码迷,mamicode.com
首页 > Web开发 > 详细

Discuz 楼主帖子采集

时间:2015-07-16 15:55:15      阅读:116      评论:0      收藏:0      [点我收藏+]

标签:

       try
            {
                for (int i = 1; i < 130; i++)
                {
                    var html = GetHtmls("http://bbs.fobshanghai.com/viewthread.php?tid=3885995&extra=&page="+i,"","","gbk");
                    var ms = Regex.Matches(html, @"<table[\s\S]+?</table");
                    File.AppendAllText("1.html",string.Format( "<h4>第{0}页</h4><hr>",i));
                    foreach (Match m in ms)
                    {
                        var temp = m.Groups[0].Value;
                        if (!temp.Contains("鱼骨的个人空间")) continue;
                        var m1 = Regex.Match(temp, @"t_msgfont"">([\s\S]+?)</div>\s+<br");
                        var str = m1.Groups[1].Value;
                        str = Regex.Replace(str, @"\[<i>\s*本帖最后由.+?编辑\s*</i>\]", "");
                        File.AppendAllText("1.html","<p>"+str+"</p>");
                    }
                }
                MessageBox.Show("over");
            }
            catch (Exception ex)
            {
                MessageBox.Show(ex.Message);
            }

看到这帖子不错 http://bbs.fobshanghai.com/viewthread.php?tid=3885995&extra=&page=1

写了一段代码 进行采集,看着方便多了

 

Discuz 楼主帖子采集

标签:

原文地址:http://www.cnblogs.com/simadi/p/4651239.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!