pandas提升計(jì)算效率的一些方法匯總
前言
Pandas是為一次性處理整個(gè)行或列的矢量化操作而設(shè)計(jì)的,循環(huán)遍歷每個(gè)單元格、行或列并不是它的設(shè)計(jì)用途。所以,在使用Pandas時(shí),你應(yīng)該考慮高度可并行化的矩陣運(yùn)算。
一、避免使用for循環(huán)
盡量使用列號(hào)或者行號(hào)進(jìn)行矩陣檢索,避免使用for循環(huán)。
1.1使用for循環(huán)
import os
import pandas as pd
import datetime
path = r'E:\科研文件\shiyan\LZQ\LZQ_all_sampledata.csv'
def read_csv(target_csv):
target = pd.read_csv(path,header=None,sep=',')
return target
start_time = datetime.datetime.now()
a = read_csv(path)
for i in range(10000):
b = a.iloc[i]
end_time = datetime.datetime.now()
print(end_time-start_time)
耗時(shí):0:00:02.455211
1.2使用行號(hào)檢索
path = r'E:\科研文件\shiyan\LZQ\LZQ_all_sampledata.csv'
def read_csv(target_csv):
target = pd.read_csv(path,header=None,sep=',')
return target
start_time = datetime.datetime.now()
a = read_csv(path)
b = a.iloc[10000]
end_time = datetime.datetime.now()
print(end_time-start_time)
耗時(shí):0:00:00.464756
二、使用for循環(huán)的條件下提高效率
2.0 如果必須使用for循環(huán)如何提高效率
我們可以做的最簡單但非常有價(jià)值的加速是使用Pandas的內(nèi)置 .iterrows() 函數(shù)。
在上一節(jié)中編寫for循環(huán)時(shí),我們使用了 range() 函數(shù)。然而,當(dāng)我們?cè)赑ython中對(duì)大范圍的值進(jìn)行循環(huán)時(shí),生成器往往要快得多。
Pandas的 .iterrows() 函數(shù)在內(nèi)部實(shí)現(xiàn)了一個(gè)生成器函數(shù),該函數(shù)將在每次迭代中生成一行Dataframe。更準(zhǔn)確地說,.iterrows() 為DataFrame中的每一行生成(index, Series)的對(duì)(元組)。這實(shí)際上與在原始Python中使用 enumerate() 之類的東西是一樣的,但運(yùn)行速度要快得多!
生成器(Generators)
生成器函數(shù)允許你聲明一個(gè)行為類似迭代器的函數(shù),也就是說,它可以在for循環(huán)中使用。這大大簡化了代碼,并且比簡單的for循環(huán)更節(jié)省內(nèi)存。
當(dāng)你想要處理一個(gè)龐大的列表時(shí),比如10億個(gè)浮點(diǎn)數(shù),問題就出現(xiàn)了。使用for循環(huán),在內(nèi)存中創(chuàng)建了大量的內(nèi)存huge列表,并不是每個(gè)人都有無限的RAM來存儲(chǔ)這樣的東西!
生成器將創(chuàng)建元素時(shí),僅在需要時(shí)將它們存儲(chǔ)在內(nèi)存中。一次一個(gè)。這意味著,如果必須創(chuàng)建10億個(gè)浮點(diǎn)數(shù),那么只能一次將它們存儲(chǔ)在內(nèi)存中。Python中的range()函數(shù)使用生成器來構(gòu)建列表。
也就是說,如果你想多次迭代列表并且它足夠小以適應(yīng)內(nèi)存,那么使用for循環(huán)和range函數(shù)會(huì)更好。這是因?yàn)槊看卧L問list值時(shí),生成器和range都會(huì)重新生成它們,而range是一個(gè)靜態(tài)列表,并且內(nèi)存中已存在整數(shù)以便快速訪問。
2.1使用range
import os
import pandas as pd
import datetime
path = r'E:\科研文件\shiyan\LZQ\LZQ_all_sampledata.csv'
def read_csv(target_csv):
target = pd.read_csv(path,header=None,sep=',')
return target
start_time = datetime.datetime.now()
a = read_csv(path)
for data_row in range(a.shape[0]):
b = a.iloc[data_row]
end_time = datetime.datetime.now()
print(end_time-start_time)
耗時(shí):0:00:07.642816
2.2使用 .iterrows() 代替 range
import os
import pandas as pd
import datetime
path = r'E:\科研文件\shiyan\LZQ\LZQ_all_sampledata.csv'
def read_csv(target_csv):
target = pd.read_csv(path,header=None,sep=',')
return target
start_time = datetime.datetime.now()
a = read_csv(path)
for index,data_row in a.iterrows():
b = data_row
end_time = datetime.datetime.now()
print(end_time-start_time)
耗時(shí):0:00:03.513161
三、使用.apply
iterrows()函數(shù)極大地提高了速度,但我們還遠(yuǎn)遠(yuǎn)沒有完成。請(qǐng)始終記住,當(dāng)使用為向量操作設(shè)計(jì)的庫時(shí),可能有一種方法可以在完全沒有for循環(huán)的情況下最高效地完成任務(wù)。
為我們提供此功能的Pandas功能是 .apply() 函數(shù)。apply()函數(shù)接受另一個(gè)函數(shù)作為輸入,并沿著DataFrame的軸(行、列等)應(yīng)用它。在傳遞函數(shù)的這種情況下,lambda通常可以方便地將所有內(nèi)容打包在一起。
四、其他方式
總結(jié)
到此這篇關(guān)于pandas提升計(jì)算效率的文章就介紹到這了,更多相關(guān)pandas計(jì)算效率內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
python3中獲取文件當(dāng)前絕對(duì)路徑的兩種方法
下面小編就為大家分享一篇python3中獲取文件當(dāng)前絕對(duì)路徑的兩種方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2018-04-04
Python 利用pandas和mysql-connector獲取Excel數(shù)據(jù)寫入到MySQL數(shù)據(jù)庫
在實(shí)際應(yīng)用中,我們可能需要將Excel表格中的數(shù)據(jù)導(dǎo)入到MySQL數(shù)據(jù)庫中,以便于進(jìn)行進(jìn)一步的數(shù)據(jù)分析和處理,本文將介紹如何使用Python將Excel表格中的數(shù)據(jù)插入到MySQL數(shù)據(jù)庫中,需要的朋友可以參考下2023-10-10
Python使用Tesseract實(shí)現(xiàn)從圖像中讀取文本
Tesseract?是一個(gè)基于計(jì)算機(jī)的系統(tǒng),用于光學(xué)字符識(shí)別?(OCR)?和其他圖像到文本處理,本文將介紹如何使用?Python?中的?Tesseract?創(chuàng)建一個(gè)可以從圖像中讀取文本的程序,需要的可以參考下2023-11-11
使用Python腳本從文件讀取數(shù)據(jù)代碼實(shí)例
這篇文章主要介紹了使用Python腳本從文件讀取數(shù)據(jù)代碼實(shí)例,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-01-01
Python趣味實(shí)戰(zhàn)之手把手教你實(shí)現(xiàn)舉牌小人生成器
前幾天寫了一個(gè)嬰兒級(jí)別的爬蟲圖文教程,大家很喜歡.恰好周末看到有人咨詢這個(gè) “舉牌小人” 怎么做?基于此,我想借此為大家再寫一篇 “爬蟲應(yīng)用” 的文章,教你制作一個(gè)好玩兒的 “舉牌小人” ,需要的朋友可以參考下2021-06-06
解決使用pip安裝報(bào)錯(cuò):Microsoft?Visual?C++?14.0?is?required.
對(duì)于程序員來說,經(jīng)常pip安裝自己所需要的包,大部分的包基本都能安裝,但是總會(huì)遇到包安裝不了的問題,下面這篇文章主要給大家介紹了關(guān)于如何解決使用pip安裝報(bào)錯(cuò):Microsoft?Visual?C++?14.0?is?required.的相關(guān)資料,需要的朋友可以參考下2022-09-09

