scrapy爬取西刺网站ip

时间：2017-07-03 13:52:56 阅读：190 评论：0 收藏：0 [点我收藏+]

标签：collect imp domain parse raw pid init import pip

# scrapy爬取西刺网站ip
# -*- coding: utf-8 -*-
import scrapy

from xici.items import XiciItem


class XicispiderSpider(scrapy.Spider):
    name = "xicispider"
    allowed_domains = ["www.xicidaili.com/nn"]
    start_urls = [‘http://www.xicidaili.com/nn/‘]

    def parse(self, response):
        item = XiciItem()
        for each in response.css(‘#ip_list tr‘):
            ip = each.css(‘td:nth-child(2)::text‘).extract_first()
            port = each.css(‘td:nth-child(3)::text‘).extract_first()
            if ip:
                ip_port = ip + ‘:‘ + port
                item[‘ip_port‘] = ip_port
                yield item

import pymongo

class XiciPipeline(object):

    collection_name = ‘scrapy_items‘

    def __init__(self, mongo_uri, mongo_db):
        self.mongo_uri = mongo_uri
        self.mongo_db = mongo_db
    #这里的from经常拼错啊
    @classmethod
    def from_crawler(cls, crawler):
        return cls(
            mongo_uri=crawler.settings.get(‘MONGO_URI‘),
            mongo_db=crawler.settings.get(‘MONGO_DB‘)
        )

    def open_spider(self, spider):
        self.client = pymongo.MongoClient(self.mongo_uri)
        self.db = self.client[self.mongo_db]

    def close_spider(self, spider):
        self.client.close()

    def process_item(self, item, spider):
        self.db[self.collection_name].insert(dict(item))
        return item

scrapy爬取西刺网站ip

标签：collect imp domain parse raw pid init import pip

原文地址：http://www.cnblogs.com/themost/p/7110378.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行