如何使用pycharm連接Databricks的步驟詳解
在本地使用pycharm連接databricks,大致步驟如下:
首先,為了讓本地環(huán)境能夠識別遠端的databricks集群環(huán)境,需要收集databricks的基本信息和自己databricks的token,這些信息能夠讓本地環(huán)境識別databricks;接著,需要使用到工具 anaconda創(chuàng)建一個虛擬環(huán)境,連接databricks;最后,將虛擬環(huán)境導(dǎo)入pycharm。
(下面的圖渣渣,因為直接拖進來的)
第0步:檢查
檢查java版本,需要時1.8開頭的版本,如果不是,請到這里下載:https://www.oracle.com/java/technologies/javase/javase-jdk8-downloads.html

第1步:收集databricks的信息
查看python版本 (還不知道怎么看,這里cluster的python版本為3.7)
查看Runtime Version

查看cluster ulr,解析出下面信息

生成token,點擊這個小人-user setting



最后,這是我們收集到的所有信息

第2步:安裝anaconda
如果已經(jīng)安裝anaconda,請略過這一步
沒有安裝,可以看這個教程
http://www.fzitv.net/article/196286.htm
第3步:使用anaconda創(chuàng)建虛擬環(huán)境
下面的參數(shù)信息,使用第一步收集的信息
打開anaconda的命令行

創(chuàng)建一個3.7版本的虛擬隔離環(huán)境
conda create -n dbconnect python=3.7

使用環(huán)境
conda activate dbconnect

卸載pyspark,如果是新創(chuàng)建的環(huán)境,可以不用執(zhí)行這步(這是為了確保,創(chuàng)建的環(huán)境不能有pyspark的包,因為會產(chǎn)生包的問題)
pip uninstall pyspark

下面開始安裝包,但是為了讓安裝速度快一些,使用清華鏡像
conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/free/ conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/main/ conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/cloud/conda-forge/ conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/cloud/pytorch/ conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/pro/ conda config --set show_channel_urls yes

查看是否切換到鏡像
conda config --show channels
可以看到已經(jīng)切換

安裝connect包,第一步中確定的run的版本為6.4,故選擇6.4.* (用公司的網(wǎng)絡(luò),下載很慢,我用自己的熱點)
pip install -U databricks-connect==6.4.*

連接遠端databricks,并輸入第一步收集的相關(guān)信息
databricks-connect configure

測試是否已經(jīng)連接上:
databricks-connect test
已經(jīng)在啟動節(jié)點了

查看databricks,可以看到

第4步:pycharm導(dǎo)入虛擬環(huán)境
打開pycahrm,點擊setting

選擇解釋器,點擊小齒輪的add'

選擇剛才我們創(chuàng)建好的dbconnect

點擊ok,可以看到已經(jīng)選好了環(huán)境

不知道為啥連接不到遠端的包,我的項目還需要在本地安裝一些用的包
conda install scikit-learn==0.22.1 conda install pandas==0.24.2 conda install pyarrow==0.15.1

在pycharm測試運行一下:
import pandas as pd import numpy as np # Generate a pandas DataFrame pdf = pd.DataFrame(np.random.rand(100, 3)) from pyspark.sql import * spark = SparkSession.builder.getOrCreate() df = spark.createDataFrame(pdf) print(df.head(5))
去databrick的cluster log看一下,已經(jīng)啟動了節(jié)點,正在運行

到此這篇關(guān)于如何使用pycharm連接Databricks的步驟詳解的文章就介紹到這了,更多相關(guān)pycharm連接Databricks內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python?ttkbootstrap?制作賬戶注冊信息界面的案例代碼
ttkbootstrap 是一個基于 tkinter 的界面美化庫,使用這個工具可以開發(fā)出類似前端 bootstrap 風(fēng)格的 tkinter 桌面程序。本文重點給大家介紹Python?ttkbootstrap?制作賬戶注冊信息界面的案例代碼,感興趣的朋友一起看看吧2022-02-02
Python中threading庫實現(xiàn)線程鎖與釋放鎖
threading用于提供線程相關(guān)的操作,為了保證安全的訪問一個資源對象,我們需要創(chuàng)建鎖。那么Python線程鎖與釋放鎖如何實現(xiàn),感興趣的小伙伴們可以參考一下2021-05-05
使用Python和XPath解析動態(tài)JSON數(shù)據(jù)的操作指南
JSON動態(tài)數(shù)據(jù)在Python中扮演著重要的角色,為開發(fā)者提供了處理實時和靈活數(shù)據(jù)的能力,動態(tài)JSON數(shù)據(jù)的獲取可能涉及到網(wǎng)絡(luò)請求和API調(diào)用,可以使用Python和XPath來解析動態(tài)JSON數(shù)據(jù),接下來小編就給大家介紹一下操作步驟2023-09-09
python編程實現(xiàn)清理微信重復(fù)緩存文件
這篇文章主要為大家介紹了使用python編程來實現(xiàn)清理微信重復(fù)緩存文件的示例代碼過程,有需要的朋友可以借鑒參考下,希望能夠有所幫助2021-11-11

