scrapy

时间：2015-01-14 09:39:24 阅读：148 评论：0 收藏：0 [点我收藏+]

标签：

# -*- coding: utf-8 -*-
import scrapy
import chardet
from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
from scrapy.utils.url import urljoin_rfc
from scrapy.http import Request

class Greasemonkey1Spider(scrapy.Spider):
    name = "greasemonkey1"
    allowed_domains = ["wiki.greasespot.net"]
    start_urls = (
        ‘http://wiki.greasespot.net/‘,
    )

    def parse(self, response):
        baseurl = response.url
        print ‘baseurl = ‘, baseurl

        hxs = response.xpath(r‘//a‘)
        for path in hxs:
            titles = path.xpath(r‘text()‘).extract()
            urls = path.xpath(r‘@href‘).extract()
            if len(titles) == 0:
                continue
            if len(urls) == 0:
                continue
            title = titles[0]
            url = urls[0]
            if title == ‘‘:
                continue
            if len(url) == 0:
                continue
            if url[0] == ‘#‘:
                continue
            print ‘2222‘, title, url
#
            url2 = urljoin_rfc(baseurl, url)
            print ‘=== ‘, url2
            yield scrapy.Request(url2, callback=self.parse)

scrapy

标签：

原文地址：http://www.cnblogs.com/zhang-pengcheng/p/4223074.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行