标签:
[root@iZ62jhlmsZ ~]$ wget http://tieba.baidu.com/f?kw=%C9%BD%CE%F7 -O - | grep -Po ‘href="(/p/[0-9]{10}).*?j_user_card.*?\>(.*?)\<.*?threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2})‘ >tb.txt
wget -- linux 下获取 http页面的工具 -O - 表示输出到管道(而不是文件)
grep --linux 正则表达式工具
-P 使用 prel语法
-o 只输出匹配到的内容(而不是一行)
(/p/[0-9]{10}) 首页贴子的链接,格式为 a href="/p/3444444444"
.*? 非贪婪匹配任意字符
j_user_card.*?\>(.*?) 查找发贴人昵称,值为(.*?)
threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2}) 最后回复日期,值为([0-9]{1,2}:[0-9]{2})
标签:
原文地址:http://www.cnblogs.com/diylab/p/4228632.html