码迷,mamicode.com
首页 > 其他好文 > 详细

用正则获取贴吧首页贴子的相关数据

时间:2015-01-16 16:02:46      阅读:144      评论:0      收藏:0      [点我收藏+]

标签:

[root@iZ62jhlmsZ ~]$  wget http://tieba.baidu.com/f?kw=%C9%BD%CE%F7 -O - | grep -Po ‘href="(/p/[0-9]{10}).*?j_user_card.*?\>(.*?)\<.*?threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2})‘ >tb.txt

wget -- linux 下获取 http页面的工具 -O - 表示输出到管道(而不是文件)

grep --linux 正则表达式工具

-P  使用 prel语法

-o  只输出匹配到的内容(而不是一行)

(/p/[0-9]{10}) 首页贴子的链接,格式为 a href="/p/3444444444"
.*? 非贪婪匹配任意字符
j_user_card.*?\>(.*?) 查找发贴人昵称,值为(.*?)
threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2})  最后回复日期,值为([0-9]{1,2}:[0-9]{2})



用正则获取贴吧首页贴子的相关数据

标签:

原文地址:http://www.cnblogs.com/diylab/p/4228632.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!