标签:tle 脚本 create 没有 clip ++ fetch tab 爬虫
PHP脚本扮演爬虫的角色,可能大家第一时间想到可能会是会正则,个人对正则的规则老是记不住,表示比较难下手,今天工作中有个需求需要爬取某个网站上的一些门店信息
无意间在网上看到一个比较好的类库叫:simple_html_dom
github下载地址:https://github.com/samacs/simple_html_dom
最重要的一步:你得先了解别人网站的结构,知道从哪个tab开始是你想要的数据
下面演示下过程吧
实现过程我分了三步
1、将门店信息的经纬度,名称等一些重要信息先插入本地表
2、跳入站点的另一个页面获取门店LOGO图片
3、更新表中对应门店的LOGO字段
OK,功能实现了,不过还没有更深入的了解这个类库的其他功能,这里也只是做个记录,方便以后需要的时候用
php利用simple_html_dom类,获取页面内容,充当爬虫角色
标签:tle 脚本 create 没有 clip ++ fetch tab 爬虫
原文地址:http://www.cnblogs.com/chenjian/p/7371327.html