python讀取大型csv文件的操作方法(降低內(nèi)存占用)
簡介
遇到大型的csv文件時,pandas會把該文件全部加載進(jìn)內(nèi)存,從而導(dǎo)致程序運(yùn)行速度變慢。
本文提供了批量讀取csv文件、讀取屬性列的方法,減輕內(nèi)存占用情況。
import pandas as pd input_file = 'data.csv'
讀取前多少行
加載前100000行數(shù)據(jù)
df = pd.read_csv(input_file, nrows=1e5) df
查看每個字段占用的系統(tǒng)內(nèi)存的情況
df.info(memory_usage='deep')
設(shè)置 memory_usage 的參數(shù)為 ‘deep’ 時,深度檢查對象中的內(nèi)存使用情況,包括對象中可能包含的其他對象(如列表、數(shù)組或其他數(shù)據(jù)結(jié)構(gòu))。若不設(shè)置deep參數(shù),memory_usage 只會返回一個對象的基礎(chǔ)內(nèi)存使用情況,這主要基于對象本身的內(nèi)存占用,而不考慮它可能引用的其他對象。

如上圖所示,前100000行數(shù)據(jù)共占用220.MB內(nèi)存。
查看每列屬性的內(nèi)存占用情況;
item = df.memory_usage(deep=True)

針對每個屬性列的字節(jié)數(shù)進(jìn)行求和,使用/ (1024 ** 2),實(shí)現(xiàn)1B到1MB的單位轉(zhuǎn)換。驗證了所有屬性列的內(nèi)存占用確實(shí)為 220.8MB。

內(nèi)存占用從高到低降序排列:
df.memory_usage(deep=True).sort_values(ascending=False)

讀取屬性列
可能我們只關(guān)心, 一整張表中的某幾個屬性,比如:'企業(yè)名稱', '經(jīng)營范圍'。那么便無需把整張表加載進(jìn)內(nèi)存。
df2 = pd.read_csv(input_file, nrows=1e5, usecols=['企業(yè)名稱', '經(jīng)營范圍'])
查看一下內(nèi)存占用
df2.memory_usage(deep=True).sum() / (1024 ** 2)

只讀取兩個屬性列,內(nèi)存占用只有33MB。
逐塊讀取整個文件
pd.read_csv(input_file, chunksize=1e3, nrows=1e5)
nrows=1e5: 讀取100000條數(shù)據(jù);chunksize=1e3: 每一塊是1000條數(shù)據(jù);
故1e5條數(shù)據(jù),應(yīng)該由100塊1e3的數(shù)據(jù)組成;
# 分批次讀取, 每chunksize是一個批次
chunk_dfs = pd.read_csv(input_file, chunksize=1e3, nrows=1e5)
v = 0
cnt = 0
# 每個chunk_df 都是 dataframe 類型數(shù)據(jù)
for chunk_df in chunk_dfs:
print(chunk_df.shape)
cnt += 1
v += chunk_df.shape[0]
print(v, cnt)

上圖驗證了,總共處理了1e5條數(shù)據(jù),分成了100塊進(jìn)行讀取。
總結(jié)
pd.read_csv(input_file, nrows, usecols, chunksize)
nrows: 讀取多少行數(shù)據(jù);usecols: 讀取哪些屬性列的數(shù)據(jù);chunksize:分塊讀取,每一塊的大小是多少條數(shù)據(jù);
到此這篇關(guān)于python讀取大型csv文件的操作方法(降低內(nèi)存占用)的文章就介紹到這了,更多相關(guān)python讀取大型csv文件內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
python中pandas nlargest()的詳細(xì)用法小結(jié)
df.nlargest()是一個DataFrame的方法,用于返回DataFrame中最大的n個值所在的行,通過調(diào)用nlargest()方法,我們返回了分?jǐn)?shù)最高的三個行,并按照降序排列,本文結(jié)合實(shí)例代碼給大家介紹的非常詳細(xì),需要的朋友參考下吧2023-10-10
解決pandas報錯'DataFrame' object has no
這篇文章主要介紹了解決pandas報錯'DataFrame' object has no attribute 'as_matrix'問題,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教2023-08-08
Python面向?qū)ο蟪绦蛟O(shè)計示例小結(jié)
這篇文章主要介紹了Python面向?qū)ο蟪绦蛟O(shè)計,結(jié)合實(shí)例形式總結(jié)分析了Python面向?qū)ο蟪绦蛟O(shè)計中比較常見的類定義、實(shí)例化、繼承、私有變量等相關(guān)使用技巧與操作注意事項,需要的朋友可以參考下2019-01-01
Python操作mongodb數(shù)據(jù)庫的方法詳解
這篇文章主要介紹了Python操作mongodb數(shù)據(jù)庫的方法,結(jié)合實(shí)例形式詳細(xì)分析了Python下載、安裝pymongo及操作MongoDB數(shù)據(jù)庫相關(guān)實(shí)現(xiàn)技巧,需要的朋友可以參考下2018-12-12

