UnicodeDammit

时间：2017-10-10 13:21:14 阅读：648 评论：0 收藏：0 [点我收藏+]

标签：默认 efault beautiful pytho odi 输入方式引号情况

UnicodeDammit 是BS内置库, 主要用来猜测文档编码.

编码自动检测功能可以在Beautiful Soup以外使用,检测某段未知编码时,可以使用这个方法:

from bs4 import UnicodeDammit
dammit = UnicodeDammit("Sacr\xc3\xa9 bleu!")
print(dammit.unicode_markup)
# Sacré bleu!
dammit.original_encoding
# ‘utf-8‘

如果Python中安装了 chardet 或 cchardet 那么编码检测功能的准确率将大大提高. 输入的字符越多,检测结果越精确,如果事先猜测到一些可能编码, 那么可以将猜测的编码作为参数,这样将优先检测这些编码:

dammit = UnicodeDammit("Sacr\xe9 bleu!", ["latin-1", "iso-8859-1"])
print(dammit.unicode_markup)
# Sacré bleu!
dammit.original_encoding
# ‘latin-1‘

智能引号

使用Unicode时,Beautiful Soup还会智能的把引号, 转换成HTML或XML中的特殊字符:

markup = b"<p>I just \x93love\x94 Microsoft Word\x92s smart quotes</p>"

UnicodeDammit(markup, ["windows-1252"], smart_quotes_to="html").unicode_markup
# u‘<p>I just &ldquo;love&rdquo; Microsoft Word&rsquo;s smart quotes</p>‘

UnicodeDammit(markup, ["windows-1252"], smart_quotes_to="xml").unicode_markup
# u‘<p>I just &#x201C;love&#x201D; Microsoft Word&#x2019;s smart quotes</p>
也可以把引号转换为ASCII码:

UnicodeDammit(markup, ["windows-1252"], smart_quotes_to="ascii").unicode_markup
# u‘<p>I just "love" Microsoft Word\‘s smart quotes</p>‘

很有用的功能,但是Beautiful Soup没有使用这种方式.默认情况下,Beautiful Soup把引号转换成Unicode:

UnicodeDammit(markup, ["windows-1252"]).unicode_markup
# u‘<p>I just \u201clove\u201d Microsoft Word\u2019s smart quotes</p>‘

UnicodeDammit

标签：默认 efault beautiful pytho odi 输入方式引号情况

原文地址：http://www.cnblogs.com/pengwang57/p/7644657.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行