pycharm連接spark教程
1.解壓Hadoop
解壓到任意盤,路徑不要帶中文路徑

進入保存后的bin目錄,查看,是否解壓成功

2.解壓spark
到任意位置,路徑不要帶有中文


3. 打開pycharm
把Hadoop,spark環(huán)境變量配置到pycharm中。
3.1新建項目


3.2在項目中創(chuàng)建一個python文件


3.3把Hadoop_home
python_home,pythonpath添加到Pycharm中.



- 1.HADOOP_HOME
- 2.SPARK_HOME
- 3.PYTHONPATH
注意?。。?/strong>
PYTHONPATH路徑要添加到D:\spark\spark-2.4.6-bin-hadoop2.7\python\lib\py4j-0.10.7-src.zip下



3.4 檢查是否有以下軟件包

3.4.1 如果沒有請按照以下教程下載,后期需要


3.4.2安裝py4j

3.4.3安裝pyspark推薦2.4.6版本

3.4.4安裝pip

3.5安裝findspark

4.把winutils.exe插件
放到Hadoop解壓后的/bin目錄下面

5.把以下代碼
復(fù)制到4.2步驟中,新建的python文件中
#添加此代碼
import findspark
findspark.init()
#在spark前,添加此代碼
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("WordCount").getOrCreate()
spark.sparkContext.textFile("file:///D:/Hadoop/hadoop-2.7.7/README.txt")\
.flatMap(lambda x: x.split(' '))\
.map(lambda x: (x, 1))\
.reduceByKey(lambda x, y: x + y)\
.foreach(print)
必須要有這句話在spark前面!??!

6.測試


出現(xiàn)以上內(nèi)容,表示pycharm連接spark成功。
總結(jié)
以上為個人經(jīng)驗,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關(guān)文章
Windows下實現(xiàn)將Pascal VOC轉(zhuǎn)化為TFRecords
今天小編就為大家分享一篇Windows下實現(xiàn)將Pascal VOC轉(zhuǎn)化為TFRecords,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-02-02
Python將字符串轉(zhuǎn)換為小寫字母的幾種常用方法
Python generator生成器和yield表達式詳解
python+pyqt5實現(xiàn)KFC點餐收銀系統(tǒng)

