pandas讀取數(shù)據(jù)集的實(shí)現(xiàn)示例
pandas 作為 Python 數(shù)據(jù)分析的核心庫(kù),其數(shù)據(jù)讀取功能(如 read_csv、read_excel、read_sql 等)支撐著從數(shù)據(jù)接入到價(jià)值產(chǎn)出的全流程。以下是其典型應(yīng)用場(chǎng)景及實(shí)例:
一、數(shù)據(jù)加載與初步探索
場(chǎng)景:接入各類數(shù)據(jù)源并快速預(yù)覽數(shù)據(jù)結(jié)構(gòu)
實(shí)例:
import pandas as pd
df = pd.read_csv("sales_data.csv") # 讀取CSV文件
print(df.head()) # 查看前5行數(shù)據(jù)
print(df.info()) # 獲取數(shù)據(jù)類型、缺失值等元信息
二、數(shù)據(jù)清洗與預(yù)處理
場(chǎng)景:處理缺失值、異常值、重復(fù)數(shù)據(jù)
實(shí)例:
df = pd.read_excel("user_data.xlsx")
df.drop_duplicates(inplace=True) # 刪除重復(fù)行
df.fillna({"age": df["age"].mean()}, inplace=True) # 用均值填充缺失年齡
三、結(jié)構(gòu)化數(shù)據(jù)分析
場(chǎng)景:統(tǒng)計(jì)分析、聚合計(jì)算、交叉表生成
實(shí)例:
df = pd.read_sql("SELECT * FROM orders", conn) # 從數(shù)據(jù)庫(kù)讀取訂單數(shù)據(jù)
monthly_sales = df.groupby(df["order_date"].dt.to_period("M"))["amount"].sum() # 按月匯總銷售額
四、時(shí)間序列分析
場(chǎng)景:金融數(shù)據(jù)、傳感器數(shù)據(jù)等時(shí)序數(shù)據(jù)處理
實(shí)例:
df = pd.read_csv("stock_prices.csv", parse_dates=["date"], index_col="date") # 解析日期并設(shè)為索引
df["rolling_mean"] = df["close"].rolling(window=30).mean() # 計(jì)算30天移動(dòng)平均
五、機(jī)器學(xué)習(xí)數(shù)據(jù)準(zhǔn)備
場(chǎng)景:特征工程、數(shù)據(jù)拆分、格式轉(zhuǎn)換
實(shí)例:
df = pd.read_csv("titanic.csv")
X = df[["Pclass", "Age", "Fare"]] # 提取特征
y = df["Survived"] # 提取標(biāo)簽
X = pd.get_dummies(X, columns=["Pclass"]) # 獨(dú)熱編碼分類特征
六、報(bào)表自動(dòng)化與數(shù)據(jù)導(dǎo)出
場(chǎng)景:生成動(dòng)態(tài)報(bào)告、數(shù)據(jù)格式化輸出
實(shí)例:
df = pd.read_json("api_response.json") # 讀取API返回的JSON數(shù)據(jù)
summary = df.describe().T # 生成統(tǒng)計(jì)摘要
summary.to_excel("analysis_report.xlsx") # 導(dǎo)出為Excel報(bào)表
七、多源數(shù)據(jù)集成
場(chǎng)景:合并不同格式/來(lái)源的數(shù)據(jù)集
實(shí)例:
df1 = pd.read_csv("sales_2023.csv")
df2 = pd.read_excel("sales_2024.xlsx")
combined_df = pd.concat([df1, df2], ignore_index=True) # 縱向合并兩年銷售數(shù)據(jù)
八、日志與非結(jié)構(gòu)化數(shù)據(jù)處理
場(chǎng)景:解析半結(jié)構(gòu)化日志數(shù)據(jù)
實(shí)例:
df = pd.read_csv("server_logs.csv", sep="|", header=None) # 自定義分隔符讀取日志
df.columns = ["timestamp", "level", "message"] # 手動(dòng)指定列名
九、教育與科研
場(chǎng)景:學(xué)術(shù)數(shù)據(jù)處理、論文圖表數(shù)據(jù)準(zhǔn)備
實(shí)例:
df = pd.read_csv("experimental_results.csv")
correlation = df[["temperature", "yield"]].corr() # 計(jì)算溫度與產(chǎn)量的相關(guān)性
十、商業(yè)智能(BI)支撐
場(chǎng)景:為Tableau、Power BI等工具提供預(yù)處理數(shù)據(jù)
實(shí)例:
df = pd.read_parquet("large_dataset.parquet") # 高效讀取大數(shù)據(jù)文件
df_filtered = df[df["region"] == "North"] # 按區(qū)域篩選數(shù)據(jù)
df_filtered.to_csv("north_region_data.csv") # 輸出給BI工具
核心價(jià)值
pandas的數(shù)據(jù)讀取能力不僅支持 CSV/Excel/JSON/SQL/Parquet 等20+種格式,更能無(wú)縫銜接后續(xù)的分析、建模和可視化流程,是數(shù)據(jù)工作流的“第一環(huán)”。
到此這篇關(guān)于pandas讀取數(shù)據(jù)集的實(shí)現(xiàn)示例的文章就介紹到這了,更多相關(guān)pandas讀取數(shù)據(jù)集內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python 中urls.py:URL dispatcher(路由配置文件)詳解
這篇文章主要介紹了Python 中urls.py:URL dispatcher(路由配置文件)詳解的相關(guān)資料,需要的朋友可以參考下2017-03-03
Python MySQL如何通過(guò)Binlog獲取變更記錄恢復(fù)數(shù)據(jù)
本文介紹了如何使用Python和pymysqlreplication庫(kù)通過(guò)MySQL的二進(jìn)制日志(Binlog)獲取數(shù)據(jù)庫(kù)的變更記錄,并展示了一個(gè)簡(jiǎn)單的Python腳本,該腳本讀取Binlog事件并打印出插入、更新和刪除操作的SQL語(yǔ)句,此外,還提到可以使用pandas將結(jié)果輸出到Excel表格中進(jìn)行數(shù)據(jù)分析處理2025-01-01
Python實(shí)現(xiàn)繪制3D條形圖的示例詳解
這篇文章主要為大家學(xué)習(xí)介紹了如何利用Python實(shí)現(xiàn)繪制3D條形圖,文中的示例代碼講解詳細(xì),具有一定的學(xué)習(xí)價(jià)值,感興趣的小伙伴可以了解一下2023-07-07
python 實(shí)現(xiàn)判斷ip連通性的方法總結(jié)
下面小編就為大家分享一篇python 實(shí)現(xiàn)判斷ip連通性的方法總結(jié),具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-04-04
對(duì)DataFrame數(shù)據(jù)中的重復(fù)行,利用groupby累加合并的方法詳解
今天小編就為大家分享一篇對(duì)DataFrame數(shù)據(jù)中的重復(fù)行,利用groupby累加合并的方法詳解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-01-01

