最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Pandas DataFrame數(shù)據(jù)存儲格式比較分析

 更新時間:2023年09月05日 16:16:11   作者:deephub  
Pandas 支持多種存儲格式,在本文中將對不同類型存儲格式下的Pandas Dataframe的讀取速度、寫入速度和大小的進行測試對比,有需要的朋友可以借鑒參考下,希望能夠有所幫助

創(chuàng)建測試Dataframe

首先創(chuàng)建一個包含不同類型數(shù)據(jù)的測試Pandas Dataframe。

import pandas as pd
 import random
 import string
 import numpy as np
 # Config DF
 df_length= 10**6
 start_date= '2023-01-01'
 all_string= list(string.ascii_letters + string.digits)
 string_length= 10**1
 min_number= 0
 max_number= 10**3
 # Create Columns
 date_col= pd.date_range(start= start_date, periods= df_length, freq= 'H')
 str_col= [''.join(np.random.choice(all_string, string_length)) for i in range(df_length)]
 float_col= np.random.rand(df_length)
 int_col= np.random.randint(min_number,max_number, size = df_length)
 # Create DataFrame
 df= pd.DataFrame({'date_col' : date_col, 
                   'str_col' : str_col, 
                   'float_col' : float_col, 
                   'int_col' : int_col})
 df.info()
 df.head()

以不同的格式存儲

接下來創(chuàng)建測試函數(shù),以不同的格式進行讀寫。

import time 
 import os
 def check_read_write_size(df, file_name, compression= None) :
     format= file_name.split('.')[-1]
     # Write
     begin= time.time()
     if file_name.endswith('.csv') : df.to_csv(file_name, index= False, compression= compression)
     elif file_name.endswith('.parquet') : df.to_parquet(file_name, compression= compression)
     elif file_name.endswith('.pickle') : df.to_pickle(file_name, compression= compression)
     elif file_name.endswith('.orc') : df.to_orc(file_name)
     elif file_name.endswith('.feather') : df.to_feather(file_name)
     elif file_name.endswith('.h5') : df.to_hdf(file_name, key= 'df')
     write_time= time.time() - begin
     # Read
     begin= time.time()
     if file_name.endswith('.csv') : pd.read_csv(file_name, compression= compression)
     elif file_name.endswith('.parquet') : pd.read_parquet(file_name)
     elif file_name.endswith('.pickle') : pd.read_pickle(file_name, compression= compression)
     elif file_name.endswith('.orc') : pd.read_orc(file_name)
     elif file_name.endswith('.h5') : pd.read_hdf(file_name)
     read_time= time.time() - begin
     # File Size
     file_size_mb = os.path.getsize(file_name) / (1024 * 1024)
     return [format, compression, read_time, write_time, file_size_mb]

然后運行該函數(shù)并將結(jié)果存儲在另一個Pandas Dataframe中。

test_case= [
             ['df.csv','infer'],
             ['df.csv','gzip'],
             ['df.pickle','infer'],
             ['df.pickle','gzip'],
             ['df.parquet','snappy'],
             ['df.parquet','gzip'],
             ['df.orc','default'],
             ['df.feather','default'],
             ['df.h5','default'],
             ]
 
 result= []
 for i in test_case :
     result.append(check_read_write_size(df, i[0], compression= i[1]))
 
 result_df= pd.DataFrame(result, columns= ['format','compression','read_time','write_time','file_size'])
 result_df

測試結(jié)果

下面的圖表和表格是測試的結(jié)果。

分析

我們對測試的結(jié)果做一個簡單的分析

CSV

  • 未壓縮文件的大小最大
  • 壓縮后的尺寸很小,但不是最小的
  • CSV的讀取速度和寫入速度是最慢的

Pickle

  • 表現(xiàn)得很平均
  • 但壓縮寫入速度是最慢的

Feather

最快的讀寫速度,文件的大小也是中等,非常的平均

ORC

  • 所有格式中最小的
  • 讀寫速度非???,幾乎是最快的

Parquet

總的來說,快速并且非常小,但是并不是最快也不是最小的

總結(jié)

從結(jié)果來看,我們應(yīng)該使用ORC或Feather,而不再使用CSV ?是嗎?

“這取決于你的系統(tǒng)。”

如果你正在做一些單獨的項目,那么使用最快或最小的格式肯定是有意義的。

但大多數(shù)時候,我們必須與他人合作。所以,除了速度和大小,還有更多的因素。

未壓縮的CSV可能很慢,而且最大,但是當需要將數(shù)據(jù)發(fā)送到另一個系統(tǒng)時,它非常容易。

ORC作為傳統(tǒng)的大數(shù)據(jù)處理格式(來自Hive)對于速度的和大小的優(yōu)化是做的最好的,Parquet比ORC更大、更慢,但是它卻是在速度和大小中取得了最佳的平衡,并且支持他的生態(tài)也多,所以在需要處理大文件的時候可以優(yōu)先選擇Parquet。

以上就是Pandas DataFrame數(shù)據(jù)存儲格式比較分析的詳細內(nèi)容,更多關(guān)于Pandas DataFrame數(shù)據(jù)存儲格式的資料請關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • Python 處理圖片像素點的實例

    Python 處理圖片像素點的實例

    今天小編就為大家分享一篇Python 處理圖片像素點的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01
  • python統(tǒng)計函數(shù)庫scipy.stats的用法解析

    python統(tǒng)計函數(shù)庫scipy.stats的用法解析

    今天小編就為大家分享一篇python統(tǒng)計函數(shù)庫scipy.stats的用法解析,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-02-02
  • python實現(xiàn)拓撲排序的方法步驟

    python實現(xiàn)拓撲排序的方法步驟

    拓撲排序是對有向無環(huán)圖進行排序的一種算法,本文主要介紹了python實現(xiàn)拓撲排序的方法步驟,具有一定的參考價值,感興趣的可以了解一下
    2024-03-03
  • Python中else的三種使用場景

    Python中else的三種使用場景

    在Python中else最常見的用法就是用在判斷語句中,其實還可以用在循環(huán)語句和異常處理中。 下面來總結(jié)一下else的用法:
    2021-06-06
  • Python的joblib模型固化函數(shù)解析

    Python的joblib模型固化函數(shù)解析

    這篇文章主要介紹了Python的joblib模型固化函數(shù)解析,joblib提供了三個與對象序列化和模型固化相關(guān)的函數(shù)hash,dump,load,joblib.hash主要是為了提供一個numpy對象的hash方法,需要的朋友可以參考下
    2023-08-08
  • 如何使用Python在excel中創(chuàng)建柱狀圖

    如何使用Python在excel中創(chuàng)建柱狀圖

    這篇文章主要給大家介紹了關(guān)于如何使用Python在excel中創(chuàng)建柱狀圖的相關(guān)資料,包括導入模塊、新建工作簿、創(chuàng)建圖表、設(shè)置數(shù)據(jù)范圍、添加標題和數(shù)據(jù)系列、以及保存圖表和工作簿,文中通過代碼介紹的非常詳細,需要的朋友可以參考下
    2025-04-04
  • 常見Python AutoEDA工具庫及功能使用探究

    常見Python AutoEDA工具庫及功能使用探究

    AutoEDA(自動探索性數(shù)據(jù)分析)工具庫是數(shù)據(jù)科學中至關(guān)重要的一部分,它們能夠自動生成數(shù)據(jù)摘要、探查數(shù)據(jù)的基本特征、檢測異常值和提供可視化,為數(shù)據(jù)科學家和分析師們提供了解數(shù)據(jù)的便捷方式,本文為大家介紹常見的AutoEDA工具庫及其功能和示例代碼
    2024-01-01
  • Python使用matplotlib的pie函數(shù)繪制餅狀圖功能示例

    Python使用matplotlib的pie函數(shù)繪制餅狀圖功能示例

    這篇文章主要介紹了Python使用matplotlib的pie函數(shù)繪制餅狀圖功能,結(jié)合實例形式分析了Python使用matplotlib的pie函數(shù)進行餅狀圖繪制的具體操作技巧,注釋中對pie函數(shù)的用法進行了詳細的說明,便于理解,需要的朋友可以參考下
    2018-01-01
  • matplotlib圖例、標簽、坐標軸刻度的字體設(shè)置方式

    matplotlib圖例、標簽、坐標軸刻度的字體設(shè)置方式

    這篇文章主要介紹了matplotlib圖例、標簽、坐標軸刻度的字體設(shè)置方式,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2023-05-05
  • Python urlopen()函數(shù) 示例分享

    Python urlopen()函數(shù) 示例分享

    urlopen(url, data=None, proxies=None) 即創(chuàng)建一個表示遠程url的類文件對象,然后像本地文件一樣操作這個類文件對象來獲取遠程數(shù)據(jù)。參數(shù)url表示遠程數(shù)據(jù)的路徑,一般是網(wǎng)址;參數(shù)data表示以post方式提交到url的數(shù)據(jù);參數(shù)proxies用于設(shè)置代理。
    2014-06-06

最新評論

蓬安县| 巨野县| 尼勒克县| 聂荣县| 克拉玛依市| 平潭县| 绥化市| 柳河县| 广昌县| 瓦房店市| 和林格尔县| 成安县| 千阳县| 阿坝县| 栾川县| 沂南县| 晋江市| 吴堡县| 宾阳县| 鲁山县| 屏东市| 临高县| 偏关县| 枝江市| 伊川县| 且末县| 钦州市| 建湖县| 安化县| 大安市| 海阳市| 富民县| 临清市| 伊宁市| 翼城县| 古田县| 桂阳县| 安顺市| 宝鸡市| 大埔区| 松溪县|