最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

PySpark和RDD對象最新詳解

 更新時間:2023年01月11日 15:03:03   作者:陽862  
Spark是一款分布式的計算框架,用于調(diào)度成百上千的服務器集群,計算TB、PB乃至EB級別的海量數(shù)據(jù),PySpark是由Spark官方開發(fā)的Python語言第三方庫,本文重點介紹PySpark和RDD對象,感興趣的朋友一起看看吧

一.了解Spark、PySpark

Spark是什么

定義:Apache Spark是用于大規(guī)模數(shù)據(jù)(large-scala data)處理的統(tǒng)一(unified)分析引擎。

簡單來說,Spark是一款分布式的計算框架,用于調(diào)度成百上千的服務器集群,計算TB、PB乃至EB級別的海量數(shù)據(jù)

Python on Spark

Spark作為全球頂級的分布式計算框架,支持眾多的編程語言進行開發(fā)。而Python語言,則是Spark重點支持的方向。

Pyspark

Spark對Python語言的支持,重點體現(xiàn)在,Python第三方庫: PySpark之上。
PySpark是由Spark官方開發(fā)的Python語言第三方庫。
Python開發(fā)者可以使用pip程序快速的安裝PySpark并像其它三方庫那樣直接使用。

 小結

1.什么是Spark、什么是PySpark

  • Spark是Apache基金會旗下的頂級開源項目,用于對海量數(shù)據(jù)進行大規(guī)模分布式計算。
  • PySpark是Spark的Python實現(xiàn),是Spark為Python開發(fā)者提供的編程入口,用于以Python代碼完成Spark任務的開發(fā)
  • PySpark不僅可以作為Python第三方庫使用,也可以將程序提交的Spark集群環(huán)境中,調(diào)度大規(guī)模集群進行執(zhí)行。

2.為什么要學習PySpark?
大數(shù)據(jù)開發(fā)是Python眾多就業(yè)方向中的明星賽道,薪資高崗位多,Spark ( PySpark)又是大數(shù)據(jù)開發(fā)中的核心技術

二.構建PySpark執(zhí)行環(huán)境入口對象

想要使用PySpark庫完成數(shù)據(jù)處理,首先需要構建一個執(zhí)行環(huán)境入口對象。PySpark的執(zhí)行環(huán)境入口對象是:類SparkContext的類對象

 注意:

 紅框里面的兩個都是一個意思,上面的方法叫做鏈式調(diào)用

#導包
from pyspark import SparkConf,SparkContext
#創(chuàng)建SparkConf類對象
conf=SparkConf().setMaster("local[*]").setAppName("test_spark_app")
#基于SparkConf類對象創(chuàng)建SparkContext對象
sc=SparkContext(conf=conf)
#打印Pyspark版本
print(sc.version)
#停止SparkContext對象的運行(停止PySpark程序)
sc.stop()

 注意:要想運行成功需要下載JDK并配置好環(huán)境變量

PySpark的編程模型

SparkContext類對象,是PySpark編程中一切功能的入口。PySpark的編程,主要分為如下三大步驟:

  • 通過SparkContext對象,完成數(shù)據(jù)輸入
  • 輸入數(shù)據(jù)后得到RDD對象,對RDD對象進行迭代計算
  • 最終通過RDD對象的成員方法,完成數(shù)據(jù)輸出工作

小結

1.如何安裝PySpark庫
        pip install pyspark
2.為什么要構建SparkContext對象作為執(zhí)行入口
        PySpark的功能都是從SparkContext對象作為開始
3.PySpark的編程模型是?

  • 數(shù)據(jù)輸入:通過SparkContext完成數(shù)據(jù)讀取
  • 數(shù)據(jù)計算:讀取到的數(shù)據(jù)轉(zhuǎn)換為RDD對象,調(diào)用RDD的成員方法完成計算
  • 數(shù)據(jù)輸出:調(diào)用RDD的數(shù)據(jù)輸出相關成員方法,將結果輸出到list、元組、字典、文本文件、數(shù)據(jù)庫等

三.RDD對象

如圖可見,PySpark支持多種數(shù)據(jù)的輸入,在輸入完成后,都會得到一個:RDD類的對象
RDD全稱為:彈性分布式數(shù)據(jù)集( Resilient Distributed Datasets)
PySpark針對數(shù)據(jù)的處理,都是以RDD對象作為載體,即:

  • 數(shù)據(jù)存儲在RDD內(nèi)
  • 各類數(shù)據(jù)的計算方法,也都是RDD的成員方法
  • RDD的數(shù)據(jù)計算方法,返回值依舊是RDD對象

python數(shù)據(jù)容器轉(zhuǎn)RDD對象

PySpark支持通過Sparkcontext對象的parallelize成員方法,將:

  • list
  • tuple
  • set
  • dict
  • str

轉(zhuǎn)為PySpark的RDD對象

代碼:

 注意

  • 字符串會被拆分出1個個的字符
  • 存入RDD對象字典僅有key會被存入RDD對象
  • 如果要查看RDD里面有什么內(nèi)容,需要用collect()方法

演示

#導包
from pyspark import  SparkConf,SparkContext
#創(chuàng)建SparkConf類對象
conf=SparkConf().setMaster("local[*]").setAppName("test_spark")
#基于SparkConf類對象創(chuàng)建SparkContext對象
sc=SparkContext(conf=conf)
 
#通過parallelize方法將python對象加載到Spark內(nèi),成為RDD對象
rdd1=sc.parallelize([1,2,3,4,5])
rdd2=sc.parallelize((1,2,3,4,5))
rdd3=sc.parallelize("abcdefg")
rdd4=sc.parallelize({1,2,3,4,5})
rdd5=sc.parallelize({"key1":"value1","key2":"value2"})
#如果要查看RDD里面有什么內(nèi)容,需要用collect()方法
print(rdd1.collect())
print(rdd2.collect())
print(rdd3.collect())
print(rdd4.collect())
print(rdd5.collect())
#停止SparkContext對象的運行(停止PySpark程序)
sc.stop()

結果是

 讀取文件轉(zhuǎn)RDD對象

PySpark也支持通過SparkContext入口對象,來讀取文件,來構建出RDD對象。

 演示

#導包
from pyspark import  SparkConf,SparkContext
#創(chuàng)建SparkConf類對象
conf=SparkConf().setMaster("local[*]").setAppName("test_spark")
#基于SparkConf類對象創(chuàng)建SparkContext對象
sc=SparkContext(conf=conf)
#用textFile方法,讀取文件數(shù)據(jù)加載到Spark中,成為RDD對象
rdd=sc.textFile("D:/game.txt")
print(rdd.collect())
#停止SparkContext對象的運行(停止PySpark程序)
sc.stop()

結果是

到此這篇關于PySpark和RDD對象詳解的文章就介紹到這了,更多相關PySpark和RDD對象內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • Python+PyQt手搓一個簡單的記事本

    Python+PyQt手搓一個簡單的記事本

    這篇文章主要為大家詳細介紹了Python如何結合PyQt手搓一個簡單的記事本,文中的示例代碼簡潔易懂,感興趣的小伙伴可以跟隨小編一起學習一下
    2025-02-02
  • Python程序中用csv模塊來操作csv文件的基本使用教程

    Python程序中用csv模塊來操作csv文件的基本使用教程

    這篇文章主要介紹了Python程序中用csv模塊來操作csv文件的基本使用教程,csv文件中也是格式化的數(shù)據(jù),只不過csv本身沒有XML和JSON那么流行...需要的朋友可以參考下
    2016-03-03
  • 把Anaconda中的環(huán)境導入到Pycharm里面的方法步驟

    把Anaconda中的環(huán)境導入到Pycharm里面的方法步驟

    這篇文章主要介紹了把Anaconda中的環(huán)境導入到Pycharm里面的方法步驟,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-10-10
  • PyQt5+requests實現(xiàn)車票查詢工具

    PyQt5+requests實現(xiàn)車票查詢工具

    這篇文章主要為大家詳細介紹了PyQt5+requests實現(xiàn)車票查詢工具,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2019-01-01
  • python登錄pop3郵件服務器接收郵件的方法

    python登錄pop3郵件服務器接收郵件的方法

    這篇文章主要介紹了python登錄pop3郵件服務器接收郵件的方法,涉及Python操作郵件的相關技巧,需要的朋友可以參考下
    2015-04-04
  • python裝飾器相當于函數(shù)的調(diào)用方式

    python裝飾器相當于函數(shù)的調(diào)用方式

    今天小編就為大家分享一篇python裝飾器相當于函數(shù)的調(diào)用方式,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12
  • 淺談優(yōu)化Django ORM中的性能問題

    淺談優(yōu)化Django ORM中的性能問題

    這篇文章主要介紹了淺談優(yōu)化Django ORM中的性能問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-07-07
  • python讀取npy文件數(shù)據(jù)實例

    python讀取npy文件數(shù)據(jù)實例

    npy文件用于存儲重建ndarray所需的數(shù)據(jù)、圖形、dtype?和其他信息,下面這篇文章主要給大家介紹了關于python讀取npy文件數(shù)據(jù)的相關資料,文中通過示例代碼介紹的非常詳細,需要的朋友可以參考下
    2022-04-04
  • Python全棧之學習JQuery

    Python全棧之學習JQuery

    這篇文章主要為大家介紹了Python全棧之JQuery,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2022-01-01
  • Python中輸入和輸出格式化操作詳解

    Python中輸入和輸出格式化操作詳解

    這篇文章主要介紹了Python中的輸入與輸出操作,包括使用input()函數(shù)進行輸入、數(shù)據(jù)類型轉(zhuǎn)換、異常處理,以及使用print()函數(shù)進行輸出、格式化輸出方法(如%格式化、str.format()和f-string),需要的朋友可以參考下
    2025-02-02

最新評論

天峻县| 临邑县| 博乐市| 新巴尔虎右旗| 宜阳县| 岳阳县| 凤冈县| 陇南市| 万源市| 凤城市| 堆龙德庆县| 济宁市| 东至县| 聊城市| 上杭县| 大关县| 来宾市| 淳安县| 读书| 铜川市| 塘沽区| 临猗县| 宜宾县| 南宁市| 鄂托克旗| 丽江市| 夹江县| 孟津县| 涡阳县| 万荣县| 方城县| 洛南县| 息烽县| 双柏县| 敦化市| 清河县| 新和县| 稷山县| 齐河县| 二连浩特市| 紫云|