最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python 編碼處理-str與Unicode的區(qū)別

 更新時(shí)間:2016年09月06日 16:25:34   投稿:lqh  
本文主要介紹Python 編碼處理的問題,這里整理了相關(guān)資料,并詳細(xì)說明如何處理編碼問題,有需要的小伙伴可以參考下

一篇關(guān)于STR和UNICODE的好文章

整理下python編碼相關(guān)的內(nèi)容

注意: 以下討論為Python2.x版本, Py3k的待嘗試

開始

用python處理中文時(shí),讀取文件或消息,http參數(shù)等等

一運(yùn)行,發(fā)現(xiàn)亂碼(字符串處理,讀寫文件,print)

然后,大多數(shù)人的做法是,調(diào)用encode/decode進(jìn)行調(diào)試,并沒有明確思考為何出現(xiàn)亂碼

所以調(diào)試時(shí)最常出現(xiàn)的錯(cuò)誤

錯(cuò)誤1

Traceback (most recent call last): File "<stdin>", line 1, in <module> UnicodeDecodeError: ‘a(chǎn)scii‘ codec can‘t decode byte 0xe6 in position 0: ordinal not in range(128)

錯(cuò)誤2

Traceback (most recent call last): File "<stdin>", line 1, in <module> File "/System/Library/Frameworks/Python.framework/Versions/2.7/lib/python2.7/encodings/utf_8.py", line 16, in decode     return codecs.utf_8_decode(input, errors, True) UnicodeEncodeError: ‘a(chǎn)scii‘ codec can‘t encode characters in position 0-1: ordinal not in range(128)

首先

必須有大體概念,了解下字符集,字符編碼

ASCII | Unicode | UTF-8 | 等等

字符編碼筆記:ASCII,Unicode和UTF-8

淘寶搜索技術(shù)博客-中文編碼雜談

str 和 unicode

str和unicode都是basestring的子類

所以有判斷是否是字符串的方法

def is_str(s):     return isinstance(s, basestring)

str和unicode 轉(zhuǎn)換

decode 文檔

encode 文檔

str  -> decode(‘the_coding_of_str‘) -> unicode unicode -> encode(‘the_coding_you_want‘) -> str

區(qū)別

str是字節(jié)串,由unicode經(jīng)過編碼(encode)后的字節(jié)組成的

聲明方式

s = ‘中文‘ s = u‘中文‘.encode(‘utf-8‘)  >>> type(‘中文‘) <type ‘str‘>

求長(zhǎng)度(返回字節(jié)數(shù))

>>> u‘中文‘.encode(‘utf-8‘) ‘\xe4\xb8\xad\xe6\x96\x87‘ >>> len(u‘中文‘.encode(‘utf-8‘)) 6

unicode才是真正意義上的字符串,由字符組成

聲明方式

s = u‘中文‘ s = ‘中文‘.decode(‘utf-8‘) s = unicode(‘中文‘, ‘utf-8‘)  >>> type(u‘中文‘) <type ‘unicode‘>

求長(zhǎng)度(返回字符數(shù)),在邏輯中真正想要用的

>>> u‘中文‘ u‘\u4e2d\u6587‘ >>> len(u‘中文‘) 2

結(jié)論

搞明白要處理的是str還是unicode, 使用對(duì)的處理方法(str.decode/unicode.encode)

下面是判斷是否為unicode/str的方法

>>> isinstance(u‘中文‘, unicode) True >>> isinstance(‘中文‘, unicode) False  >>> isinstance(‘中文‘, str) True >>> isinstance(u‘中文‘, str) False

簡(jiǎn)單原則:不要對(duì)str使用encode,不要對(duì)unicode使用decode (事實(shí)上可以對(duì)str進(jìn)行encode的,具體見最后,為了保證簡(jiǎn)單,不建議)

>>> ‘中文‘.encode(‘utf-8‘) Traceback (most recent call last): File "<stdin>", line 1, in <module> UnicodeDecodeError: ‘a(chǎn)scii‘ codec can‘t decode byte 0xe4 in position 0: ordinal not in range(128)  >>> u‘中文‘.decode(‘utf-8‘) Traceback (most recent call last): File "<stdin>", line 1, in <module> File "/System/Library/Frameworks/Python.framework/Versions/2.7/lib/python2.7/encodings/utf_8.py", line 16, in decode     return codecs.utf_8_decode(input, errors, True) UnicodeEncodeError: ‘a(chǎn)scii‘ codec can‘t encode characters in position 0-1: ordinal not in range(128)

不同編碼轉(zhuǎn)換,使用unicode作為中間編碼

#s是code_A的str s.decode(‘code_A‘).encode(‘code_B‘)

文件處理,IDE和控制臺(tái)

處理流程,可以這么使用,把python看做一個(gè)水池,一個(gè)入口,一個(gè)出口

入口處,全部轉(zhuǎn)成unicode, 池里全部使用unicode處理,出口處,再轉(zhuǎn)成目標(biāo)編碼(當(dāng)然,有例外,處理邏輯中要用到具體編碼的情況)

讀文件  外部輸入編碼,decode轉(zhuǎn)成unicode  處理(內(nèi)部編碼,統(tǒng)一unicode)  encode轉(zhuǎn)成需要的目標(biāo)編碼  寫到目標(biāo)輸出(文件或控制臺(tái))

IDE和控制臺(tái)報(bào)錯(cuò),原因是print時(shí),編碼和IDE自身編碼不一致導(dǎo)致

輸出時(shí)將編碼轉(zhuǎn)換成一致的就可以正常輸出

>>> print u‘中文‘.encode(‘gbk‘) ???? >>> print u‘中文‘.encode(‘utf-8‘) 中文

建議

規(guī)范編碼

統(tǒng)一編碼,防止由于某個(gè)環(huán)節(jié)產(chǎn)生的亂碼

環(huán)境編碼,IDE/文本編輯器, 文件編碼,數(shù)據(jù)庫(kù)數(shù)據(jù)表編碼

保證代碼源文件編碼

這個(gè)很重要

py文件默認(rèn)編碼是ASCII, 在源代碼文件中,如果用到非ASCII字符,需要在文件頭部進(jìn)行編碼聲明 文檔

不聲明的話,輸入非ASCII會(huì)遇到的錯(cuò)誤,必須放在文件第一行或第二行

File "XXX.py", line 3 SyntaxError: Non-ASCII character ‘\xd6‘ in file c.py on line 3, but no encoding declared; see http://www.python.org/peps/pep-0263.html for details
聲明方法

# -*- coding: utf-8 -*- 或者 #coding=utf-8

若頭部聲明coding=utf-8, a = ‘中文‘ 其編碼為utf-8

若頭部聲明coding=gb2312, a = ‘中文‘ 其編碼為gbk

so, 同一項(xiàng)目中所有源文件頭部統(tǒng)一一個(gè)編碼,并且聲明的編碼要和源文件保存的編碼一致(編輯器相關(guān))

在源代碼用作處理的硬編碼字符串,統(tǒng)一用unicode

將其類型和源文件本身的編碼隔離開, 獨(dú)立無依賴方便流程中各個(gè)位置處理

if s == u‘中文‘:  #而不是 s == ‘中文‘     pass #注意這里 s到這里時(shí),確保轉(zhuǎn)為unicode

以上幾步搞定后,你只需要關(guān)注兩個(gè) unicode和 你設(shè)定的編碼(一般使用utf-8)

處理順序

1. Decode early 2. Unicode everywhere 3. Encode later

相關(guān)模塊及一些方法

獲得和設(shè)置系統(tǒng)默認(rèn)編碼

>>> import sys >>> sys.getdefaultencoding() ‘a(chǎn)scii‘  >>> reload(sys) <module ‘sys‘ (built-in)> >>> sys.setdefaultencoding(‘utf-8‘) >>> sys.getdefaultencoding() ‘utf-8‘
str.encode(‘other_coding‘)

在python中,直接將某種編碼的str進(jìn)行encode成另一種編碼str

#str_A為utf-8 str_A.encode(‘gbk‘)  執(zhí)行的操作是 str_A.decode(‘sys_codec‘).encode(‘gbk‘) 這里sys_codec即為上一步 sys.getdefaultencoding() 的編碼

‘獲得和設(shè)置系統(tǒng)默認(rèn)編碼‘和這里的str.encode是相關(guān)的,但我一般很少這么用,主要是覺得復(fù)雜不可控,還是輸入明確decode,輸出明確encode來得簡(jiǎn)單些(個(gè)人觀點(diǎn))

chardet

文件編碼檢測(cè),下載

>>> import chardet >>> f = open(‘test.txt‘,‘r‘) >>> result = chardet.detect(f.read()) >>> result {‘confidence‘: 0.99, ‘encoding‘: ‘utf-8‘}

\u字符串轉(zhuǎn)對(duì)應(yīng)unicode字符串

>>> u‘中‘ u‘\u4e2d‘  >>> s = ‘\u4e2d‘ >>> print s.decode(‘unicode_escape‘) 中  >>> a = ‘\\u4fee\\u6539\\u8282\\u70b9\\u72b6\\u6001\\u6210\\u529f‘ >>> a.decode(‘unicode_escape‘) u‘\u4fee\u6539\u8282\u70b9\u72b6\u6001\u6210\u529f‘

 以上就是對(duì)Python 編碼處理的資料整理,后續(xù)繼續(xù)補(bǔ)充相關(guān)資料,謝謝大家對(duì)本站的支持!

相關(guān)文章

  • Python中xlsx文件轉(zhuǎn)置操作詳解(行轉(zhuǎn)列和列轉(zhuǎn)行)

    Python中xlsx文件轉(zhuǎn)置操作詳解(行轉(zhuǎn)列和列轉(zhuǎn)行)

    很多時(shí)候我們處理的Excel表格并不是我們想要的樣子,需要將表格的形式進(jìn)行相應(yīng)轉(zhuǎn)換后進(jìn)行數(shù)據(jù)分析操作,下面這篇文章主要給大家介紹了關(guān)于Python中xlsx文件轉(zhuǎn)置操作(行轉(zhuǎn)列和列轉(zhuǎn)行)的相關(guān)資料,需要的朋友可以參考下
    2022-07-07
  • Python 寫入訓(xùn)練日志文件并控制臺(tái)輸出解析

    Python 寫入訓(xùn)練日志文件并控制臺(tái)輸出解析

    這篇文章主要介紹了Python 寫入訓(xùn)練日志文件并控制臺(tái)輸出解析,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-08-08
  • 解決python 輸出到csv 出現(xiàn)多空行的情況

    解決python 輸出到csv 出現(xiàn)多空行的情況

    這篇文章主要介紹了解決python 輸出到csv 出現(xiàn)多空行的情況,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2021-03-03
  • Python各種擴(kuò)展名區(qū)別點(diǎn)整理

    Python各種擴(kuò)展名區(qū)別點(diǎn)整理

    在本篇文章里小編給大家整理的是關(guān)于Python各種擴(kuò)展名區(qū)別點(diǎn)整理,需要的朋友們可以學(xué)習(xí)下。
    2020-02-02
  • 輕量級(jí)的Web框架Flask 中模塊化應(yīng)用的實(shí)現(xiàn)

    輕量級(jí)的Web框架Flask 中模塊化應(yīng)用的實(shí)現(xiàn)

    說到flask的模塊化,大家可能第一時(shí)間想到的都是藍(lán)圖,今天我們不討論藍(lán)圖,先從0.2版本中的Module類的實(shí)現(xiàn)講起
    2017-09-09
  • keras得到每層的系數(shù)方式

    keras得到每層的系數(shù)方式

    這篇文章主要介紹了keras得到每層的系數(shù)方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2020-06-06
  • Python中__slots__屬性介紹與基本使用方法

    Python中__slots__屬性介紹與基本使用方法

    在Python中,每個(gè)類都有實(shí)例屬性。默認(rèn)情況下Python用一個(gè)字典來保存一個(gè)對(duì)象的實(shí)例屬性。這非常有用,因?yàn)樗试S我們?cè)谶\(yùn)行時(shí)去設(shè)置任意的新屬性。下面這篇文章主要給大家介紹了關(guān)于Python中__slots__屬性與基本使用方法的相關(guān)資料,需要的朋友可以參考下
    2018-09-09
  • 對(duì)python中 math模塊下 atan 和 atan2的區(qū)別詳解

    對(duì)python中 math模塊下 atan 和 atan2的區(qū)別詳解

    今天小編就為大家分享一篇對(duì)python中 math模塊下 atan 和 atan2的區(qū)別詳解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01
  • Python3.10接入ChatGPT實(shí)現(xiàn)逐句回答流式返回

    Python3.10接入ChatGPT實(shí)現(xiàn)逐句回答流式返回

    這篇文章主為大家要介紹了Python3.10接入ChatGPT實(shí)現(xiàn)逐句回答流式返回示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-03-03
  • 獨(dú)特的python循環(huán)語句

    獨(dú)特的python循環(huán)語句

    本文主要給大家介紹的是Python循環(huán)語句與其他編程語言中的循環(huán)語句不同的地方,非常的獨(dú)特,有需要的小伙伴可以參考下
    2016-11-11

最新評(píng)論

南昌市| 张家港市| 津南区| 华宁县| 和龙市| 光泽县| 衡南县| 延吉市| 沁水县| 林西县| 邯郸市| 福海县| 宜君县| 灵台县| 惠水县| 舞钢市| 高州市| 沙雅县| 龙州县| 万宁市| 黔西县| 嘉祥县| 宜兰市| 阳东县| 南岸区| 缙云县| 方正县| 文昌市| 永定县| 宜兰市| 武胜县| 徐水县| 龙州县| 台南县| 务川| 申扎县| 商水县| 宿州市| 江孜县| 郸城县| 腾冲县|