码迷,mamicode.com
首页 > 其他好文 > 详细

19.基于scrapy-redis两种形式的分布式爬虫

时间:2019-01-16 16:40:55      阅读:140      评论:0      收藏:0      [点我收藏+]

标签:rap   封装   pid   统一   管道   nbsp   tar   组件   使用   

redis分布式部署

  1.scrapy框架是否可以自己实现分布式?

    - 不可以。原因有二。

      其一:因为多台机器上部署的scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的url。(多台机器无法共享同一个调度器)

      其二:多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。(多台机器无法共享同一个管道)

 2.基于scrapy-redis组件的分布式爬虫

        - scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。

        - 实现方式:

            1.基于该组件的RedisSpider类

            2.基于该组件的RedisCrawlSpider类

19.基于scrapy-redis两种形式的分布式爬虫

标签:rap   封装   pid   统一   管道   nbsp   tar   组件   使用   

原文地址:https://www.cnblogs.com/mwhylj/p/10277247.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!