码迷,mamicode.com
首页 > 其他好文 > 详细

数据提取

时间:2018-06-05 23:26:57      阅读:298      评论:0      收藏:0      [点我收藏+]

标签:idt   bottom   应用   padding   www.   anti   操作   内容   正则   

页面解析和数据提取

一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。

  • 非结构化数据:先有数据,再有结构,
  • 结构化数据:先有结构、再有数据
  • 不同类型的数据,我们需要采用不同的方式来处理。

非结构化的数据处理

文本、电话号码、邮箱地址
  • 正则表达式
HTML 文件
  • 正则表达式
  • XPath
  • CSS选择器

结构化的数据处理

JSON 文件
  • JSON Path
  • 转化成Python类型进行操作(json类)
XML 文件
  • 转化成Python类型(xmltodict)
  • XPath
  • CSS选择器
  • 正则表达式

侵权删:

  笔记来自传智播客课件, 感谢传智.

数据提取

标签:idt   bottom   应用   padding   www.   anti   操作   内容   正则   

原文地址:https://www.cnblogs.com/amou/p/9142303.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!