pandas如何讀取含有中文的excel
pandas讀取含有中文的excel
在讀取含有中文的 Excel 文件時,需要使用 encoding 參數(shù)設置編碼方式。
常用的編碼方式有 'gbk' 和 'utf-8'。
示例代碼:
import pandasas pd
# 讀取含有中文的 Excel 文件
df = pd.read_excel('filename.xlsx', encoding='gbk')如果讀取過程中出現(xiàn)亂碼,可以嘗試更換編碼方式。
pandas讀取excel時遇到的編碼問題 unknown_codepage_21010
最近在使用pandas讀取不規(guī)則excel表時遇到了一種編碼問題,自己找了好久資料也是終于綜合了一下解決了這種編碼異常的問題。
首先呢,報錯會提示 下面這種錯誤:
unknown encoding: unknown_codepage_21010
自己在找資料的時候看到一篇很早在git上發(fā)布的一篇文章,意思就是讓直接明確將編碼設置好,具體可以看一下git鏈接
https://github.com/okfn/messytables/issues/47
最后呢,自己改了一個源文件里的東西,其實也不知道是不是正確的,但是這個問題卻解決了,所以分享出來,也算是為自己記錄一下,以防以后再次遇到這個問題,又得找半天。
找到xlrd的__init__.py文件,在 open_workbook 模塊中將encoding_override的值明確為"cp1252",其實具體這樣做的原因就是將編碼明確,使得可以識別這種異常編碼。
def open_workbook(filename=None,
logfile=sys.stdout,
verbosity=0,
use_mmap=USE_MMAP,
file_contents=None,
encoding_override="cp1252",
formatting_info=False,
on_demand=False,
ragged_rows=False):這樣問題就成功解決了~
總結
以上為個人經(jīng)驗,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關文章
Python實戰(zhàn)快速上手BeautifulSoup庫爬取專欄標題和地址
BeautifulSoup是爬蟲必學的技能,BeautifulSoup最主要的功能是從網(wǎng)頁抓取數(shù)據(jù),Beautiful Soup自動將輸入文檔轉換為Unicode編碼,輸出文檔轉換為utf-8編碼2021-10-10

