最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python解決漢字編碼問題:Unicode Decode Error

 更新時(shí)間:2017年01月19日 11:26:05   作者:漁人  
最近在利用python讀取一個(gè)含有漢字的文檔時(shí)導(dǎo)致出現(xiàn)了亂碼,并報(bào)出了兩個(gè)錯(cuò)誤,無奈只能上網(wǎng)找尋答案,后通過網(wǎng)友的幫助解決了這個(gè)問題,想著總結(jié)一下,下面這篇文章就主要介紹了python如何解決漢字編碼問題,有需要的朋友們可以參考借鑒。

前言

最近由于項(xiàng)目需要,需要讀取一個(gè)含有中文的txt文檔,完了還要保存文件。文檔之前是由base64編碼,導(dǎo)致所有漢字讀取顯示亂碼。項(xiàng)目組把base64廢棄之后,先后出現(xiàn)兩個(gè)錯(cuò)誤:

ascii codec can't encode characters in position ordinal not in range 128
UnicodeDecodeError: ‘utf8' codec can't decode byte 0x。

如果對(duì)于ascii、unicode和utf-8還不了解的小伙伴,可以看之前的這篇文章關(guān)于字符串和編碼

那么必須對(duì)下面這三個(gè)概念有所了解:

  1. ascii只能表示數(shù)字、英文字母和一些特殊符號(hào),不能表示漢字
  2. unicode和utf-8都可以表示漢字,unicode是固定長度,utf-8是可變長度
  3. 內(nèi)存中存儲(chǔ)方式一般為unicode,而磁盤文件存儲(chǔ)方式一般為utf-8,因?yàn)閡tf-8可以節(jié)約存儲(chǔ)空間

那么python的默認(rèn)編碼是什么?

>>> import sys
>>> sys.getdefaultencoding()
'ascii'
>>> reload(sys)
<module 'sys' (built-in)>
>>> sys.setdefaultencoding('utf-8')
>>> sys.getdefaultencoding()
'utf-8'

python的默認(rèn)編碼是ascii,可以通過sys.setdefaultencoding('utf-8')函數(shù)設(shè)置python的默認(rèn)編碼。

python中可以通過encode和decode的方式改變數(shù)據(jù)的編碼,比如:

>>> u'漢字'
u'\u6c49\u5b57'
>>> u'漢字'.encode('utf-8')
'\xe6\xb1\x89\xe5\xad\x97'
>>> u'漢字'.encode('utf-8').decode('utf-8')
u'\u6c49\u5b57'

我們可以通過這兩個(gè)函數(shù)設(shè)置編碼。

那么,python中的str是什么類型?

>>> import binascii
>>> '漢字'
'\xba\xba\xd7\xd6'
>>> type('漢字')
<type 'str'>
>>> print binascii.b2a_hex('漢字')
babad7d6
>>> print binascii.b2a_hex(u'漢字')
Traceback (most recent call last):
 File "<stdin>", line 1, in <module>
UnicodeEncodeError: 'ascii' codec can't encode characters in
position 0-1: ordinal not in range(128)
>>> print binascii.b2a_hex(u'漢字'.encode('utf-8'))
e6b189e5ad97
>>> print binascii.b2a_hex(u'漢字'.encode('gbk'))
babad7d6

binascii是將數(shù)據(jù)的二進(jìn)制轉(zhuǎn)換成ascii,上面的解釋是:‘漢字'的類型是str,二進(jìn)制是babad7d6,u‘漢字'是無法轉(zhuǎn)換成ascii,這樣就報(bào)出了開頭的第一個(gè)錯(cuò)誤。解決辦法就是把它.encode(‘utf-8')成str類型。因?yàn)槲颐钚惺莣indows默認(rèn)的GBK編碼,所有u'漢字'.encode(‘gbk')的時(shí)候,輸出結(jié)果和‘漢字'結(jié)果一樣。

總結(jié)一下,python的str實(shí)際上是unicode的一種,python的默認(rèn)編碼是ascii,對(duì)于非ascii轉(zhuǎn)成ascii的時(shí)候都會(huì)報(bào)錯(cuò),牢記下面的規(guī)則:

  1. unicode => encode(‘合適的編碼') => str
  2. str => decode(‘合適的編碼') => unicode

還有一種簡單的方式,就是在文件頭設(shè)置編碼,可以省去很多麻煩:

import sys
reloads(sys)
sys.setdefaultencoding('utf-8')

對(duì)于第二個(gè)問題,是在文件讀取的時(shí)候出的錯(cuò)。utf-8的文件有bom和無bom兩種方式,兩者的差別好像在bom文件比無bom文件多了一個(gè)頭,導(dǎo)致以u(píng)tf-8方式讀文件時(shí)報(bào)錯(cuò),我先前曾嘗試讀文件的時(shí)候先對(duì)有無bom進(jìn)行判斷,跳過bom文件的頭,后來失敗了,真尷尬~~。

還得上google求助大神,具體的操作方法就是使用codecs庫來讀文件(我猜這個(gè)庫就是對(duì)文件的頭進(jìn)行檢測)。

import codecs
codecs.open(file_name, "r",encoding='utf-8', errors='ignore')

對(duì)于編碼問題,一定要懂得ascii、unicode和utf-8工作原理。

總結(jié)

以上就是這篇文章的全部內(nèi)容了,希望本文的內(nèi)容對(duì)大家的學(xué)習(xí)或者工作能帶來一定的幫助,如果有疑問大家可以留言交流。

相關(guān)文章

  • Tensorflow深度學(xué)習(xí)使用CNN分類英文文本

    Tensorflow深度學(xué)習(xí)使用CNN分類英文文本

    這篇文章主要為大家介紹了Tensorflow深度學(xué)習(xí)CNN實(shí)現(xiàn)英文文本分類示例解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步
    2021-11-11
  • 詳解讓Python性能起飛的15個(gè)技巧

    詳解讓Python性能起飛的15個(gè)技巧

    Python?一直以來被大家所詬病的一點(diǎn)就是執(zhí)行速度慢,但不可否認(rèn)的是?Python?依然是我們學(xué)習(xí)和工作中的一大利器。本文總結(jié)了15個(gè)tips有助于提升?Python?執(zhí)行速度、優(yōu)化性能,需要的可以參考一下
    2022-02-02
  • 基于python實(shí)現(xiàn)操作git過程代碼解析

    基于python實(shí)現(xiàn)操作git過程代碼解析

    這篇文章主要介紹了基于python實(shí)現(xiàn)操作git過程代碼解析,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-07-07
  • 在python中利用KNN實(shí)現(xiàn)對(duì)iris進(jìn)行分類的方法

    在python中利用KNN實(shí)現(xiàn)對(duì)iris進(jìn)行分類的方法

    今天小編就為大家分享一篇在python中利用KNN實(shí)現(xiàn)對(duì)iris進(jìn)行分類的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-12-12
  • Python如何查看數(shù)據(jù)的類型

    Python如何查看數(shù)據(jù)的類型

    這篇文章主要介紹了Python如何查看數(shù)據(jù)的類型方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2025-03-03
  • CentOS安裝pillow報(bào)錯(cuò)的解決方法

    CentOS安裝pillow報(bào)錯(cuò)的解決方法

    本文給大家分享的是作者在centos下為Python安裝pillow的時(shí)候報(bào)錯(cuò)的解決方法,希望對(duì)大家能夠有所幫助。
    2016-01-01
  • python基于隱馬爾可夫模型實(shí)現(xiàn)中文拼音輸入

    python基于隱馬爾可夫模型實(shí)現(xiàn)中文拼音輸入

    這篇文章主要介紹了python基于隱馬爾可夫模型實(shí)現(xiàn)中文拼音輸入的相關(guān)資料,需要的朋友可以參考下
    2016-04-04
  • Python使用Paramiko庫實(shí)現(xiàn)SSH管理詳解

    Python使用Paramiko庫實(shí)現(xiàn)SSH管理詳解

    paramiko 是一個(gè)用于在Python中實(shí)現(xiàn)SSHv2協(xié)議的庫,它支持對(duì)遠(yuǎn)程服務(wù)器進(jìn)行加密的通信,本文主要介紹了如何使用Paramiko庫實(shí)現(xiàn)SSH管理,感興趣的小伙伴可以學(xué)習(xí)一下
    2023-11-11
  • 基于Python輕松制作一個(gè)股票K線圖網(wǎng)站

    基于Python輕松制作一個(gè)股票K線圖網(wǎng)站

    在當(dāng)今這個(gè)人手一個(gè)?Web?服務(wù)的年代,GUI?程序還是沒有?Web?服務(wù)來的香啊。所以本文將用Python制作一個(gè)簡單的股票K線圖網(wǎng)站,感興趣的可以了解一下
    2022-09-09
  • 如何使用Python破解ZIP或RAR壓縮文件密碼

    如何使用Python破解ZIP或RAR壓縮文件密碼

    這篇文章主要介紹了如何使用Python破解ZIP或RAR壓縮文件密碼,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-01-01

最新評(píng)論

嫩江县| 易门县| 司法| 聂拉木县| 重庆市| 永宁县| 曲阳县| 东港市| 彰化县| 河西区| 咸丰县| 阿拉善盟| 天峻县| 保山市| 西青区| 盐亭县| 峨眉山市| 桃源县| 文安县| 锦州市| 和硕县| 肥东县| 江安县| 定西市| 辽阳县| 全州县| 延安市| 将乐县| 章丘市| 灌云县| 张掖市| 宣汉县| 西乌珠穆沁旗| 德令哈市| 许昌县| 永吉县| 依兰县| 贵德县| 永和县| 武城县| 金川县|