Python2與Python3關(guān)于字符串編碼處理的差別總結(jié)
0x00 字符的編碼
計(jì)算機(jī)畢竟是西方國(guó)家的發(fā)明,最開始并沒有想到會(huì)普及到全世界,只用一個(gè)字節(jié)中的7位(ASCII)來表示字符對(duì)于現(xiàn)在龐大的文字?jǐn)?shù)量來說顯然不夠,所以先后經(jīng)歷了好幾套編碼方案,不同國(guó)家和地區(qū)又有自己的方案,造成了現(xiàn)在諸多的歷史遺留問題。
0x01 Python中的字符串
Python有兩種不同的字符串,一種存儲(chǔ)文本,一種存儲(chǔ)字節(jié)。對(duì)于文本,Python內(nèi)部采用Unicode存儲(chǔ),而字節(jié)字符串顯示原始字節(jié)序列或者ASCII。
什么叫編碼(encode)?
按照字面意思和以往經(jīng)驗(yàn),我要把這個(gè)文本或字符串用“UTF-8”編碼,感覺上應(yīng)該是對(duì)字節(jié)數(shù)據(jù)進(jìn)行編碼然后顯示正確的文字。大多數(shù)人都是這么想的,可事實(shí)呢?
編碼的意思是將Unicode字符按照編碼規(guī)則(如UTF-8)編成字節(jié)序列:

有人此時(shí)會(huì)問,我用 print 語句打印出來怎么是亂碼或者是中文,并不是字節(jié)序列。這是因?yàn)槟阏{(diào)用 print 語句的時(shí)候,默認(rèn)進(jìn)行了隱式解碼,為的是讓人類看見友好的字符數(shù)據(jù) ,也就是默認(rèn)的進(jìn)行了str()包裝,想看見背后真正的十六進(jìn)制數(shù),你需要調(diào)用魔術(shù)方法 _repr_() 。
什么叫解碼(decode)?
對(duì)應(yīng)的,解碼就是將字節(jié)序列按照編碼規(guī)則(如UTF-8)解釋成unicode形式。

這里或許又會(huì)有疑問,編碼解碼都是十六進(jìn)制,那中文字符咋顯示的?
這又要結(jié)合你的環(huán)境了??赐晡疑厦嫱扑]的文章,你就會(huì)明白,Unicode只是一種標(biāo)準(zhǔn),而具體的編碼才是實(shí)現(xiàn)方式。有了正確的Unicode編碼,僅僅代表你有了正確的英文文獻(xiàn),想翻譯成中文,還得再轉(zhuǎn)換一次。而這一次轉(zhuǎn)換,是你的環(huán)境幫你完成。舉個(gè)例子,你打開一個(gè)文檔,發(fā)現(xiàn)是亂碼,多半是文本編輯器的解碼方式有問題,換個(gè)解碼規(guī)則就好了。
0x02 Python2 和 Python3 之間的區(qū)別
Python3 一切都很美好
在Python3當(dāng)中,文本字符串類型(使用Unicode數(shù)據(jù)存儲(chǔ))被命名為 str , 字節(jié)字符串類型被命名為 bytes 。一般情況下,實(shí)例化一個(gè)字符串會(huì)得到一個(gè) str 對(duì)象 :

所以現(xiàn)在很多人都說,Python3默認(rèn)是Unicode,也就是這個(gè)意思。
如果你想得到bytes,那就在文本之前加上前綴 b , 或者 encode 一下。

所以,很顯然,str 對(duì)象有一個(gè)encode方法,bytes 對(duì)象有一個(gè)decode方法。
Python2 相當(dāng)?shù)牟俚?,甚至?xí)`導(dǎo)你
在Python3中的 str 對(duì)象在Python2中叫做 unicode ,感覺很通俗對(duì)吧?但 bytes 對(duì)象在Python2中叫做 str ,對(duì)。。就是你平時(shí)用的 str , 默認(rèn)的那個(gè)。。。
如果你想得到一個(gè)文本字符串,你需要在字符串之前加上前綴 u 或者 decode 一下。
搞笑的還不止這么點(diǎn),Python2中的 str (字節(jié)) 對(duì)象,竟然有一個(gè) encode 方法!?。《夷銊e指望它有什么特殊用處,它就是用來報(bào)錯(cuò)的,永遠(yuǎn)都別使用它?。。?/strong>
同樣的,unicode (文本字符) 對(duì)象也有一個(gè)用來報(bào)錯(cuò)的 decode 方法。
我們嘗試一下:

不知道大家注意到錯(cuò)誤信息沒有,我們?cè)谶M(jìn)行解碼,規(guī)則是GBK,但它說 無法用 ascii 進(jìn)行編碼 ,這是為什么?
這就是Python2自作聰明為了對(duì)一個(gè)unicode對(duì)象執(zhí)行解碼而進(jìn)行的隱式編碼 ,等于以下代碼:
b.encode('ascii').decode('GBK')
這就是為什么很多人說,Python2的編碼很操蛋。
0x03 小結(jié)
如果你在用2.X,請(qǐng)養(yǎng)成在字符串加上 u 前綴的習(xí)慣,統(tǒng)一編碼UTF-8,如果windows控制臺(tái)或者Pycharm控制臺(tái)依舊出現(xiàn)亂碼,那多半是控制臺(tái)編碼不同,改過來就好。
參考書籍 《Python 高級(jí)編程》
總結(jié)
到此這篇關(guān)于Python2與Python3關(guān)于字符串編碼處理的差別總結(jié)的文章就介紹到這了,更多相關(guān)Python2與Python3字符串編碼處理差別內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
python3中利用filter函數(shù)輸出小于某個(gè)數(shù)的所有回文數(shù)實(shí)例
今天小編就為大家分享一篇 python3中利用filter函數(shù)輸出小于某個(gè)數(shù)的所有回文數(shù)實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2019-11-11
python編程學(xué)習(xí)使用管道Pipe編寫優(yōu)化代碼
大家好,今天這篇文章我將詳細(xì)講解 Pipe 如何讓你的代碼更加簡(jiǎn)潔的方法,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步2021-11-11
Python接口自動(dòng)化淺析pymysql數(shù)據(jù)庫(kù)操作流程
本文主要介紹pymysql安裝、操作流程、語法基礎(chǔ)及封裝操作數(shù)據(jù)庫(kù)類,需要的朋友可以參考下,希望能對(duì)大家有所幫助,每日提升一點(diǎn)點(diǎn),歡迎大家多多交流討論2021-08-08
python多進(jìn)程執(zhí)行方法apply_async使用說明
這篇文章主要介紹了python多進(jìn)程執(zhí)行方法apply_async使用說明,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2021-03-03
python網(wǎng)絡(luò)爬蟲精解之pyquery的使用說明
PyQuery是一個(gè)類似于jQuery的解析網(wǎng)頁工具,使用lxml操作xml和html文檔,它的語法和jQuery很像。和XPATH,Beautiful Soup比起來,PyQuery更加靈活,提供增加節(jié)點(diǎn)的class信息,移除某個(gè)節(jié)點(diǎn),提取文本信息等功能2021-09-09
Python實(shí)現(xiàn)將Excel轉(zhuǎn)換成為image的方法
今天小編就為大家分享一篇Python實(shí)現(xiàn)將Excel轉(zhuǎn)換成為image的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2018-10-10
Python requests獲取網(wǎng)頁常用方法解析
這篇文章主要介紹了Python requests獲取網(wǎng)頁常用方法解析,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-02-02
AI生成圖片Stable?Diffusion環(huán)境搭建與運(yùn)行方法
Stable?Diffusion是一種基于擴(kuò)散過程的生成模型,由Ge?et?al.在2021年提出,該模型利用了隨機(jī)變量的穩(wěn)定分布,通過遞歸地應(yīng)用擴(kuò)散過程來生成高質(zhì)量的圖像,這篇文章主要介紹了AI圖片生成Stable?Diffusion環(huán)境搭建與運(yùn)行,需要的朋友可以參考下2023-05-05

