scrapy项目4：爬取当当网中机器学习的数据及价格（CrawlSpider类）

时间：2018-06-03 16:22:41 阅读：224 评论：0 收藏：0 [点我收藏+]

标签：书籍 lin actor lsp 默认值 ack cat false 提取

scrapy项目3中已经对网页规律作出解析，这里用crawlspider类对其内容进行爬取；

项目结构与项目3中相同如下图，唯一不同的为book.py文件

技术分享图片

crawlspider类的爬虫文件book的生成命令为：scrapy genspider -t crawl book ‘category.dangdang.com‘

book.py代码如下：

# -*- coding: utf-8 -*-
import scrapy
# 创建用于提取响应中连接的对象
from scrapy.linkextractors import LinkExtractor
# Rule 用于发送从 LinkExtractor 中提取的连接
from scrapy.spiders import CrawlSpider, Rule
from dangdang05.items import Dangdang05Item

class BookSpider(CrawlSpider):
    name = ‘book‘
    allowed_domains = [‘category.dangdang.com‘]
    start_urls = [‘http://category.dangdang.com/cp01.54.12.00.00.00.html‘]
    # 提取连接信息，并将提取到的向提取到的url发送请求，调用回调函数处理请求
    # 注意follow表示是否继续对response中的连接进行提取，True表示提取，False表示不再提取
    # 当未指定回调函数时，follow的默认值为True,当指定回调函数时follow的默认值为False
    rules = [Rule(LinkExtractor(allow=r‘/pg\d+-cp01.54.12.00.00.00.html‘),callback=‘parse_item‘,follow=True)]

    def parse_item(self, response):
        # 实例化items中的类
        item = Dangdang05Item()
        # 网页解析第一步，返回selector对对象
        book_list = response.xpath(‘//ul[@class="bigimg"]/li‘)

        for book_info in book_list:
            # 书籍名称
            item[‘name‘] = book_info.xpath(‘./p[@class="name"]/a/@title‘).extract()[0]
            # 书籍价格
            item[‘price‘] = book_info.xpath(‘./p[@class="price"]/span[1]/text()‘).extract()[0]
            yield item

scrapy项目4：爬取当当网中机器学习的数据及价格（CrawlSpider类）

标签：书籍 lin actor lsp 默认值 ack cat false 提取

原文地址：https://www.cnblogs.com/houzichiguodong/p/9129376.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行