码迷,mamicode.com
首页 > Web开发 > 详细

去除HTML中的标签内容

时间:2017-04-28 00:18:14      阅读:161      评论:0      收藏:0      [点我收藏+]

标签:class   python   span   函数   python脚本   img   compile   htm   sdn   

采集后的数据都带有‘<>‘html标签:

<img src="http://i4.hdfimg.com/www/images/giftrans/3d/da/7b/18414.gif" border="0"/><span class=‘WmoJPQM2AzpQMA‘>科研<span class=‘WmoJPQM2AzhQMQ‘>最早和<span class=‘WmoJPQM2AzxQNw‘>一项<span class=‘WmoJPQM2AzdQOA‘>教学为一体的现代化<span class=‘WmoJPQM2AzhQOA‘>综合<span class=‘WmoJPQM2AzhQMQ‘>师从性省级医院
 
在这里只要将所有带<>去除即可:
 
dr = re.compile(r‘<[^>]+>‘,re.S)
dd = dr.sub(‘‘,Html)
 
完整的python脚本:
第一个函数:将一个字段中的刮号去除
第二个函数:将html中的所有标签去除
 

去除HTML中的标签内容

标签:class   python   span   函数   python脚本   img   compile   htm   sdn   

原文地址:http://www.cnblogs.com/iamjqy/p/6777899.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!