首页
Web开发
Windows程序
编程语言
数据库
移动开发
系统相关
微信
其他好文
会员
首页
>
其他好文
> 详细
爬虫的种类
时间:
2018-01-17 00:39:59
阅读:
160
评论:
0
收藏:
0
[点我收藏+]
标签:
服务
搜索排名
本地
存储
缺点
队列
工作
了解
www
通用爬虫:搜索引擎用的爬虫系统
目标:尽可能的互联网上所有的网页下载下来,放到本地形成备份,
再对这些网页进行相关处理(提取关键字,去除广告),最后提供一个
用户可用的接口。
抓取流程:
1.首先取一部分已有的URL,把这些URL放到待爬取队列。
2.从队列里取出这些URL,然后通过DNS得到主机IP,然后去这个IP服务器
里下载HTML信息,然后把这些信息放到本地服务器,之后把这个爬过的URL
放入已爬取队列中.
3.分析这些网页内容,找出网页中其它URL连接,继续执行第二步,直到没有
其它URL连接.
搜索引擎是如何获取一个新网站的URL的:
1.主动向搜索引擎提交网址
2.在其它网站设置网站的外链
3.搜索引擎会和DNS服务商进行合作,可以快速收录新的网址
通用爬虫并不是万物皆可爬的,它也需要遵守规则:
Robots协议:
https://www.taobao.com/robots.txt(可以查看协议内容
)
一般只有大型的搜索引擎才会遵守产.
通用爬虫工作流程:
抓取网页--存储数据--内容处理--提供检索--排名服务
搜索排名:
1.PageRank值:根据网站流量,网站流量越高,排名越靠前.
2.竞价排名:给钱多的排名靠前.
通用爬虫的缺点:
只能提供和文本相关的内容,不提供多媒体文件爬取.
提供的结果千篇一律(正在改进中.....)
为了解决这个问题,聚焦爬虫出现了.
爬虫的种类
标签:
服务
搜索排名
本地
存储
缺点
队列
工作
了解
www
原文地址:http://blog.51cto.com/xiaogongju/2061742
踩
(
0
)
赞
(
0
)
举报
评论
一句话评论(
0
)
登录后才能评论!
分享档案
更多>
2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)
周排行
更多
分布式事务
2021-07-29
OpenStack云平台命令行登录账户
2021-07-29
getLastRowNum()与getLastCellNum()/getPhysicalNumberOfRows()与getPhysicalNumberOfCells()
2021-07-29
【K8s概念】CSI 卷克隆
2021-07-29
vue3.0使用ant-design-vue进行按需加载原来这么简单
2021-07-29
stack栈
2021-07-29
抽奖动画 - 大转盘抽奖
2021-07-29
PPT写作技巧
2021-07-29
003-核心技术-IO模型-NIO-基于NIO群聊示例
2021-07-29
Bootstrap组件2
2021-07-29
友情链接
兰亭集智
国之画
百度统计
站长统计
阿里云
chrome插件
新版天听网
关于我们
-
联系我们
-
留言反馈
© 2014
mamicode.com
版权所有 联系我们:gaon5@hotmail.com
迷上了代码!