码迷,mamicode.com
首页 > 编程语言 > 详细

python网络爬虫(一):网络爬虫的定义

时间:2018-03-10 17:50:26      阅读:144      评论:0      收藏:0      [点我收藏+]

标签:开始   pid   就是   通过   蜘蛛网   一个   读取   基本   蜘蛛   

网络爬虫,即Web Spider,是一个很形象的名字。

把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。
网络蜘蛛是通过网页的链接地址来寻找网页的。

从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,

然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。

如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。

这样看来,网络爬虫就是一个爬行程序,一个抓取网页的程序。

网络爬虫的基本操作是抓取网页。

python网络爬虫(一):网络爬虫的定义

标签:开始   pid   就是   通过   蜘蛛网   一个   读取   基本   蜘蛛   

原文地址:https://www.cnblogs.com/whu-2017/p/8540732.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!