python实现一个简单的爬虫搜索功能

时间：2015-10-29 01:00:57 阅读：533 评论：0 收藏：0 [点我收藏+]

标签：

html.parser HTMLParser  
urllib.request urlopen  
urllib parse
LinkParser(HTMLParser):

    handle_starttag(, tag, attrs):
        tag == :
            (key, value) attrs:
                key == :

                    newUrl = parse.urljoin(.baseUrl, value)
                    .links = .links + [newUrl]

    getLinks(, url):
        .links = []
        .baseUrl = url
        response = urlopen(url)
        response.getheader()==:
            htmlBytes = response.read()
            htmlString = htmlBytes.decode()
            .feed(htmlString)
            htmlString, .links
        :
            ,[]

spider(url, word, maxPages):  
    pagesToVisit = [url]
    numberVisited = foundWord = numberVisited < maxPages pagesToVisit != [] foundWord:
        numberVisited = numberVisited +url = pagesToVisit[]
        pagesToVisit = pagesToVisit[:]
        :
            (numberVisited, , url)
            parser = LinkParser()
            data, links = parser.getLinks(url)
            pagesToVisit = pagesToVisit + links
            data.find(word)>-:
                foundWord = pagesToVisit = pagesToVisit + links
                ()
        :
            ()
    foundWord:
        (, word, , url)
    :
        ()
spider(,,)

python实现一个简单的爬虫搜索功能

标签：

原文地址：http://my.oschina.net/u/215677/blog/523343

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行