Python文本乱码发生时的解决方案

Python文本乱码这个问题在我们使用的时候会发生在很多地方,其实我们需要不断的进行相关代码的调整,在下面的文章中你会找到相关的解决方法。希望大家详仔细的学习。

在处理utf8文本格式的时候,由于这些文本是含BOM(byte order mark)的utf8文本,编译时产生一个Error,”UnicodeEncodeError: ‘gbk’ codec can’t encode character u’\ufeff’ in position 0: illegal multibyte sequence”

原来,某些软件,如notepad,在保存一个以UTF-8编码的文件时,会在文件开始的地方插入三个不可见的字符(0xEF 0xBB 0xBF,即BOM)。 因此我们在读取时需要自己去掉这些字符,Python中的codecs module定义了这个常量:

查看源代码打印帮助

 
 
 
  1. import codecs 
  2. data = open("Test.txt").read() 
  3. if data[:3] == codecs.BOM_UTF8: 
  4. datadata = data[3:] 
  5. print data.decode("utf-8") 

以上就是对Python文本乱码发生时代码修改的详细介绍。

标题名称:Python文本乱码发生时的解决方案
文章路径:http://www.mswzjz.cn/qtweb/news12/411662.html

攀枝花网站建设、攀枝花网站运维推广公司-贝锐智能,是专注品牌与效果的网络营销公司;服务项目有等

广告

声明:本网站发布的内容(图片、视频和文字)以用户投稿、用户转载内容为主,如果涉及侵权请尽快告知,我们将会在第一时间删除。文章观点不代表本网站立场,如需处理请联系客服。电话:028-86922220;邮箱:631063699@qq.com。内容未经允许不得转载,或转载时需注明来源: 贝锐智能