有一段文本,编码未知,需要尽量解码出文本内容而不出现乱码,目前只要求中文不出现乱码即可,有什么靠谱的方法没?尝试用了ICU库(http://site.icu-project.org/),发现判断不是特别准确。
1
cute Dec 13, 2013
python下我使用的chardet.
效果还不错. |
2
scalaview Dec 13, 2013
chardet+1
>>> import urllib >>> rawdata = urllib.urlopen('http://www.google.cn/').read() >>> import chardet >>> chardet.detect(rawdata) {'confidence': 0.98999999999999999, 'encoding': 'GB2312'} |