码迷,mamicode.com
首页 > 编程语言 > 详细

python 抓取网上OJ试题

时间:2014-10-31 08:46:29      阅读:382      评论:0      收藏:0      [点我收藏+]

标签:http   ar   使用   文件   数据   on   问题   ef   工作   

学校工作需要,需架设一台内网OJ服务器,采用了开源的hustoj.试题下载了hustoj的freeprblem的xml文件。导入时出现很多错误,不知什么原因。另外要将历年noip复赛试题加上去,但苦于历年noip的xml文件只有3、4个。cogs上有几乎全部的历年noip于是想到了用python+pyquery抓取后转化成xml。至于不选beautifulsoup而选pyquery是感觉pq语法接近jquery,使用起来比较方便,而且速度可能更快!

ver0.9已经完成,但是由于cogs的格式没有统一,自己经验不足,发现有很多错误,有待进一步改进!

ver1.0打算主要改正这些错误,尽量使得试题抓取无误。以后可以考虑数据抓取,导入问题

python 抓取网上OJ试题

标签:http   ar   使用   文件   数据   on   问题   ef   工作   

原文地址:http://www.cnblogs.com/nbalive2001/p/4064167.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!