码迷,mamicode.com
首页 > 编程语言 > 详细

Python+ Calibre 处理 中文报纸

时间:2018-04-05 12:24:35      阅读:229      评论:0      收藏:0      [点我收藏+]

标签:统一   ali   python   中国经济   lin   集中   bre   决胜   blog   

import re
##2
line='<a href=nw.D110000renmrb_20180401_1-01.htm><script>document.write(view("领航新时代中国经济航船  "))</script></a>'
#line = line.decode("utf-8")
filtrate = re.compile(u'[^\u4E00-\u9FA5]')#非中文
filtered_str = filtrate.sub(r'', line)#replace
print (filtered_str)

##1
tempLine = '<script>document.write(view("加强党中央对经济工作的集中统一领导<br>打好决胜全面建成小康社会三大攻坚战  "))</script>'
filtrate = re.compile(u'[^\u4E00-\u9FA5]')#非中文
filtered_str = filtrate.sub(r'', tempLine)#replace
print (filtered_str)

filtrate = re.findall (r"[\u4e00-\u9fa5]+", tempLine)

print (filtrate)

python 提取 中文

Python+ Calibre 处理 中文报纸

标签:统一   ali   python   中国经济   lin   集中   bre   决胜   blog   

原文地址:https://www.cnblogs.com/xuanyuanchen/p/8721896.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!