标签:http 数据源 不可 压缩包 代理 文本 margin 数据采集 实现
在构建本章节内容的时候,笔者也在想一个问题,究竟什么样的采集器框架,才能算得上是一个“全能”的呢?就我自己以往项目经历而言,可以归纳以下几个大的分类:
以上的分类,也有可能不够全面,不过应该可以涵盖主流数据采集的分类了。
为了方便阐述一个爬虫的工作原理,我们从上面找到一条最简单路径,来进行阐述(偷奸耍滑?非也,大道化简,万变不离其宗:)
OK,一个小目标,单机、单一数据源、定期更新、纯文本、HTTP的爬虫,来一只。
在第一境的后面各节中,我们就来逐步实现这个小目标,同时,也来探究一下其中的原理。只有掌握了这些,才能通过继续扩展,衍生出强大的爬虫:)
《C# 爬虫 破境之道》:第一境 爬虫原理 — 第一节:整体思路
标签:http 数据源 不可 压缩包 代理 文本 margin 数据采集 实现
原文地址:https://www.cnblogs.com/mikecheers/p/12090487.html