最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

pandas與pyspark計(jì)算效率對比分析

 更新時間:2023年06月16日 09:39:08   作者:一個散步者的夢  
這篇文章主要介紹了pandas與pyspark計(jì)算效率對比,本文給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下

日常工作中,主要還是應(yīng)用HQL和SparkSQL,數(shù)據(jù)量大,分布式計(jì)算很快;

本地?cái)?shù)據(jù)處理,一般會使用python的pandas包,api豐富,寫法比較簡單,但只能利用單核性能跑數(shù),數(shù)據(jù)量大可能會比較慢;spark可以利用多核性能;

單機(jī)上,這里嘗試構(gòu)造一個大數(shù)據(jù)集分別對pandas和sparksql進(jìn)行跑批測試:

# 數(shù)據(jù)集構(gòu)造
import pandas as pd
import numpy as np 
import pyarrow
import sys
import time
from pyspark.sql import SparkSession
df = pd.DataFrame(columns=['id','sales'])
df['id']= np.random.randint(1,10,800000000)    
df['sales']= np.random.randint(30,1000,800000000)   # 生成8億數(shù)據(jù)
df = df.append(df)   # 數(shù)據(jù)量膨脹一倍
df.to_parquet('parquet_test')    # 寫入本地文件
print(sys.getsizeof(df) / 1024 / 1024 / 1024)  # 總數(shù)據(jù)占用內(nèi)存:23個g

定義pandas計(jì)算函數(shù)

pandas的read函數(shù)會將數(shù)據(jù)一次讀入內(nèi)存,本地機(jī)器資源不夠可能會有內(nèi)存溢出,這時候要考慮逐塊讀取,分別對每塊進(jìn)行聚合,再進(jìn)行累聚合;

def pandas_duration():
    start = time.time()
    # df.to_csv('data.txt',index=False,sep=',')
    df = pd.read_parquet('parquet_test')
    mid_time = time.time()
    print('pandas讀取數(shù)據(jù)用時:{:.2f}'.format(mid_time-start))
    print(df.groupby('id',as_index=False).max())   # 分組求最大值
    end = time.time()
    print(end-start)

定義pyspark讀取計(jì)算函數(shù)

# 防止driver內(nèi)存溢出,可以把資源調(diào)大點(diǎn),筆者電腦64個g就隨意填了個32g,分區(qū)數(shù)結(jié)合實(shí)際數(shù)據(jù)大小資源調(diào)整
spark = SparkSession.Builder()\
    .master("local[*]")\
    .config("spark.sql.shuffle.partitions",24)\
    .config("spark.driver.memory","32g")\
    .config("spark.driver.maxResultSize","32g")\
    .appName('pyspark')\
    .getOrCreate()
def pyspark_duration():
    start = time.time()
    # df.to_csv('data.txt',index=False,sep=',')
    spark_df = spark.read.parquet('parquet_test')
    mid_time = time.time()
    print('spark讀取數(shù)據(jù)用時:{:.2f}'.format(mid_time-start))
    spark_df.groupBy('id').agg({"sales":"max"}).show()  # 分組求最大值
    end = time.time()
    print(end-start)

查看spark計(jì)算時間:

在整個運(yùn)行過程中,電腦最大內(nèi)存使用14%;(包括其他系統(tǒng)軟件占用),數(shù)據(jù)讀取計(jì)算只花了32秒

查看pandas計(jì)算時間:

計(jì)算巔峰時刻內(nèi)存在80-90%跳動,差點(diǎn)把我機(jī)器干爆了,計(jì)算耗時105秒,遠(yuǎn)大于spark處理32秒

結(jié)論:

小數(shù)據(jù)量通常我們使用pandas處理會更快;對于大量數(shù)據(jù),即使是單機(jī),充分利用多核性能,我們使用spark讀取往往會有更好的表現(xiàn),不用定義分塊讀取聚合,計(jì)算更快,內(nèi)存使用表現(xiàn)更好;

數(shù)據(jù)處理&優(yōu)化技巧相關(guān),感興趣的同學(xué)可以點(diǎn)擊下面鏈接:

SparkSQL優(yōu)化:https://blog.csdn.net/me_to_007/article/details/130916946

hive優(yōu)化: https://blog.csdn.net/me_to_007/article/details/126921955

pandas數(shù)據(jù)處理詳解:https://blog.csdn.net/me_to_007/article/details/90141769

到此這篇關(guān)于pandas與pyspark計(jì)算效率對比的文章就介紹到這了,更多相關(guān)pandas與pyspark內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • OpenCV半小時掌握基本操作之分水嶺算法

    OpenCV半小時掌握基本操作之分水嶺算法

    這篇文章主要介紹了OpenCV基本操作之分水嶺算法,本文給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-09-09
  • Python切片列表字符串如何實(shí)現(xiàn)切換

    Python切片列表字符串如何實(shí)現(xiàn)切換

    這篇文章主要介紹了Python切片列表字符串如何實(shí)現(xiàn)切換,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2020-08-08
  • 一文帶你理解Python中面向?qū)ο缶幊蘋OP的概念

    一文帶你理解Python中面向?qū)ο缶幊蘋OP的概念

    在Python中,面向?qū)ο缶幊蹋∣OP)是一種在編程中使用對象和類的編程范式,它旨在實(shí)現(xiàn)現(xiàn)實(shí)世界的實(shí)體,下面我們就一起來看看它的相關(guān)知識吧
    2023-08-08
  • Python使用requests模塊發(fā)送http請求的方法介紹

    Python使用requests模塊發(fā)送http請求的方法介紹

    Python?Requests是一個?HTTP?庫,它允許我們向?Web?服務(wù)器發(fā)送??HTTP?請求,并獲取響應(yīng)結(jié)果,本文將會詳細(xì)介紹Python?requests模塊如何發(fā)送http請求,文中有相關(guān)的代碼示例,需要的朋友可以參考下
    2023-06-06
  • Python繪制組合圖的示例

    Python繪制組合圖的示例

    這篇文章主要介紹了Python如何繪制組合圖,幫助大家更好的利用python繪制圖像,進(jìn)行數(shù)據(jù)可視化分析,感興趣的朋友可以了解下
    2020-09-09
  • python實(shí)現(xiàn)對指定輸入的字符串逆序輸出的6種方法

    python實(shí)現(xiàn)對指定輸入的字符串逆序輸出的6種方法

    這篇文章主要介紹了python實(shí)現(xiàn)對指定輸入的字符串逆序輸出的6種方法,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2018-04-04
  • 使用Matplotlib 繪制精美的數(shù)學(xué)圖形例子

    使用Matplotlib 繪制精美的數(shù)學(xué)圖形例子

    今天小編就為大家分享一篇使用Matplotlib 繪制精美的數(shù)學(xué)圖形例子,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12
  • Python使用SpeechRecognition庫實(shí)現(xiàn)語音識別功能

    Python使用SpeechRecognition庫實(shí)現(xiàn)語音識別功能

    SpeechRecognition 是 Python 生態(tài)中最主流的語音識別第三方庫,它封裝了多個國內(nèi)外主流語音識別引擎的接口,本文將帶大家了解Python的SpeechRecognition庫的功能、使用方法,并通過具體案例掌握它在不同場景下的應(yīng)用,需要的朋友可以參考下
    2026-01-01
  • 詳解Python如何與?java高效的交互

    詳解Python如何與?java高效的交互

    這篇文章主要為大家介紹了詳解Python如何與java高效的交互的方法示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-06-06
  • Python訪問純真IP數(shù)據(jù)庫腳本分享

    Python訪問純真IP數(shù)據(jù)庫腳本分享

    這篇文章主要介紹了Python訪問純真IP數(shù)據(jù)庫腳本分享,本文直接給出實(shí)現(xiàn)代碼,需要的朋友可以參考下
    2015-06-06

最新評論

吉林市| 隆德县| 东至县| 宜章县| 嘉黎县| 秀山| 武山县| 西吉县| 龙口市| 晋中市| 高陵县| 邹城市| 崇礼县| 中山市| 行唐县| 洪江市| 湘潭市| 延庆县| 海阳市| 甘德县| 阳原县| 富川| 额济纳旗| 宜章县| 祁阳县| 建宁县| 耿马| 互助| 南乐县| 沁水县| 平山县| 柳林县| 台东县| 涪陵区| 福贡县| 鹤山市| 达拉特旗| 桦川县| 新绛县| 驻马店市| 百色市|