最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python?Pandas讀取Excel數(shù)據(jù)并查看數(shù)據(jù)特征的常見(jiàn)方法詳解

 更新時(shí)間:2026年04月17日 09:37:40   作者:一位代碼  
這篇文章主要為大家詳細(xì)介紹了如何使用pandas讀取Excel數(shù)據(jù)后,通過(guò)DataFrame屬性和方法查看數(shù)據(jù)基本情況的操作,文中的示例代碼講解詳細(xì),感興趣的小伙伴可以了解下

前言

pandas 讀取數(shù)據(jù)后,以 DataFrame 數(shù)據(jù)結(jié)構(gòu)存儲(chǔ)在內(nèi)存中,可以通過(guò) DdataFrame 自帶的屬性和方法對(duì)數(shù)據(jù)的大小、類型、分布、摘要等基本情況,進(jìn)行查看。

本文以讀取 Excel 文件數(shù)據(jù)為以下示例數(shù)據(jù):

import pandas as pd

df = pd.read_excel('zpxx.xlsx')

常用讀取參數(shù)

參數(shù)說(shuō)明示例
sheet_name指定工作表名稱或索引sheet_name='Sheet1' 或 sheet_name=0
header指定哪一行作為列名header=0(默認(rèn)第一行)
usecols讀取指定列usecols=['A','C'] 或 usecols='A:C'
nrows讀取前N行nrows=100
skiprows跳過(guò)前N行skiprows=2
dtype指定列的數(shù)據(jù)類型dtype={'id': str, 'amount': float}
na_values將特定值識(shí)別為NaNna_values=['-', 'N/A']

一、獲取數(shù)據(jù)形狀(行列數(shù))

df.shape:返回幾行幾列(行,列),元組格式,如:(395, 23)。

可結(jié)合 len() 函數(shù)分別獲取行數(shù)和列數(shù):

行數(shù):len(df),列數(shù):len(df.columns)

print('數(shù)據(jù)的形狀:', df.shape)
print('數(shù)據(jù)的行數(shù)', len(df))
print('數(shù)據(jù)的列數(shù):', len(df.columns))

二、獲取數(shù)據(jù)類型

pandas 數(shù)據(jù)類型指的是某一列所有數(shù)據(jù)的共性,默認(rèn)數(shù)值型數(shù)據(jù)類型為 int64 或 float64,文本類型為 object。

df.dtypes:查看所有列的數(shù)據(jù)類型

df.列名.dtype:查看指定列的數(shù)據(jù)類型

df.dtypes.value_counts():各個(gè)數(shù)據(jù)類型的列數(shù)(字段個(gè)數(shù))

python、numpy、pandas數(shù)據(jù)類型對(duì)比:

三、獲取數(shù)據(jù)摘要

df.info() 函數(shù),獲取數(shù)據(jù)集摘要,語(yǔ)法如下:

DataFrame.info(verbose=None,buf=None, max_cols=None, memory_usage=None, null_counts=None)
常用參數(shù)釋義
verbose該參數(shù)決定是否打印完整的摘要。如果為True,顯示所有列的信息;如果為False,那么會(huì)省略一部分。
null_counts該參數(shù)決定是否顯示非空計(jì)數(shù)。值為True始終顯示計(jì)數(shù),而值為False則不顯示計(jì)數(shù)。
memory_usage該參數(shù)決定是否應(yīng)顯示DataFrame元素(包括索引)的總內(nèi)存使用情況。默認(rèn)情況下為True。True始終顯示內(nèi)存使用情況,False不會(huì)顯示內(nèi)存使用情況。

示例:顯示數(shù)據(jù)的簡(jiǎn)要摘要。

print(df.info(verbose=False))  # 簡(jiǎn)要摘要

結(jié)果包括:行數(shù)(RangeIndex)、列數(shù)(Columns)、各個(gè)數(shù)據(jù)類型的列數(shù)(dtypes)等信息。

四、數(shù)據(jù)描述性統(tǒng)計(jì)

describe() 函數(shù)用于生成描述性統(tǒng)計(jì)信息,語(yǔ)法如下:

DataFrame.describe (percentiles=None, include=None,exclude=None)

描述性統(tǒng)計(jì)數(shù)據(jù):

一是:數(shù)值型數(shù)據(jù),則包括均值、標(biāo)準(zhǔn)差、最大值、最小值、四分位數(shù)等;

二是:非數(shù)值型數(shù)據(jù),則包括類別的個(gè)數(shù)、最高數(shù)量的類別及出現(xiàn)次數(shù)等。

參數(shù)釋義
percentiles該參數(shù)決定要包含在輸出中的百分位數(shù)。所有值都應(yīng)介于0和1之間。默認(rèn)值為[.25,.5,.75],它返回第25、50和75個(gè)百分位數(shù)。
include該參數(shù)決定要包含在結(jié)果中的數(shù)據(jù)類型的白名單。‘all’:所有列將包含在輸出中。dtypes的列表:將結(jié)果限制為提供的數(shù)據(jù)類型。默認(rèn)情況下, 只統(tǒng)計(jì)數(shù)值類型數(shù)據(jù)。
exclude該參數(shù)決定要從結(jié)果中忽略的數(shù)據(jù)類型的黑名單。dtypes的列表:從結(jié)果中排除提供的數(shù)據(jù)類型。默認(rèn)情況下, 結(jié)果將不排除任何內(nèi)容。

示例:不加任何參數(shù),默認(rèn)為只統(tǒng)計(jì)數(shù)值類型數(shù)據(jù),包括均值、標(biāo)準(zhǔn)差、最大值、最小值、四分位數(shù)等。

print(df.describe()) # 描述性統(tǒng)計(jì)信息,默認(rèn)只是數(shù)字列

如果需要查看所有列的數(shù)據(jù)統(tǒng)計(jì),可以加入?yún)?shù):include='all'

print(df.describe(include='all')) # 所有列

五、查看數(shù)據(jù)元素個(gè)數(shù)

df.size:數(shù)據(jù)中元素的個(gè)數(shù),指的是數(shù)據(jù)的行數(shù)(395)乘以數(shù)據(jù)的列數(shù)(25)

print('表的元素個(gè)數(shù)::', df.size)

六、查看數(shù)據(jù)的維度

df.ndim:DataFrame 是一種二維表格型數(shù)據(jù)的結(jié)構(gòu),既有行索引,也有列索引。

print('表的維度數(shù):', df.ndim)

七、數(shù)據(jù)轉(zhuǎn)置

df.T:T屬性可以實(shí)現(xiàn)DataFrame的轉(zhuǎn)置(行列轉(zhuǎn)換)

print('表轉(zhuǎn)置后形狀:', df.T.shape)

八、查看數(shù)據(jù)的基本統(tǒng)計(jì)特征

描述統(tǒng)計(jì)(數(shù)值列)

# 基礎(chǔ)描述統(tǒng)計(jì):count, mean, std, min, 25%, 50%, 75%, max
df.describe()
# 包含百分位數(shù)
df.describe(percentiles=[.1, .2, .5, .9])
# 包含所有列(包括object類型)
df.describe(include='all')
# 只包含數(shù)值列
df.describe(include=[np.number])
# 只包含對(duì)象列
df.describe(include=['object'])

單個(gè)統(tǒng)計(jì)值

# 平均值
df.mean()
# 中位數(shù)
df.median()
# 標(biāo)準(zhǔn)差
df.std()
# 最小值/最大值
df.min()
df.max()
# 求和
df.sum()
# 計(jì)數(shù)(非空)
df.count()

九、查看缺失值情況

統(tǒng)計(jì)缺失值數(shù)量

# 每列缺失值數(shù)量
df.isnull().sum()
# 每列缺失值占比
df.isnull().sum() / len(df) * 100
# 總?cè)笔е禂?shù)量
df.isnull().sum().sum()
# 缺失值占比超過(guò)30%的列
missing_ratio = df.isnull().sum() / len(df)
high_missing_cols = missing_ratio[missing_ratio > 0.3].index

可視化缺失值(需要matplotlib)

import matplotlib.pyplot as plt
# 繪制缺失值熱力圖
plt.figure(figsize=(12, 6))
plt.imshow(df.isnull(), aspect='auto', cmap='gray')
plt.colorbar(label='Missing')
plt.title('Missing Values Heatmap')
plt.show()

處理缺失值建議

方法適用場(chǎng)景
df.dropna()刪除包含缺失值的行/列
df.fillna(value)用固定值填充
df.fillna(method='ffill')用前一個(gè)值填充
df.interpolate()插值填充

到此這篇關(guān)于Python Pandas讀取Excel數(shù)據(jù)并查看數(shù)據(jù)特征的常見(jiàn)方法詳解的文章就介紹到這了,更多相關(guān)Python Pandas讀取Excel數(shù)據(jù)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python內(nèi)存管理機(jī)制原理詳解

    python內(nèi)存管理機(jī)制原理詳解

    這篇文章主要介紹了python內(nèi)存管理機(jī)制原理詳解,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-08-08
  • Python 中Pickle庫(kù)的使用詳解

    Python 中Pickle庫(kù)的使用詳解

    pickle是python語(yǔ)言的一個(gè)標(biāo)準(zhǔn)模塊,安裝python后已包含pickle庫(kù),不需要單獨(dú)再安裝。這篇文章主要介紹了Python 中Pickle庫(kù)的使用詳解,需要的朋友可以參考下
    2018-02-02
  • 淺談python數(shù)據(jù)類型及其操作

    淺談python數(shù)據(jù)類型及其操作

    今天帶大家了解python數(shù)據(jù)類型的相關(guān)知識(shí),文中介紹的非常詳細(xì),對(duì)正在學(xué)習(xí)python的小伙伴們有很好地幫助,需要的朋友可以參考下
    2021-05-05
  • Django 登陸驗(yàn)證碼和中間件的實(shí)現(xiàn)

    Django 登陸驗(yàn)證碼和中間件的實(shí)現(xiàn)

    這篇文章主要介紹了Django 登陸驗(yàn)證碼和中間件的實(shí)現(xiàn),小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2018-08-08
  • Python利用sqlacodegen自動(dòng)生成ORM實(shí)體類示例

    Python利用sqlacodegen自動(dòng)生成ORM實(shí)體類示例

    這篇文章主要介紹了Python利用sqlacodegen自動(dòng)生成ORM實(shí)體類,結(jié)合實(shí)例形式分析了Python sqlacodegen安裝技巧ORM實(shí)體類相關(guān)實(shí)現(xiàn)技巧,需要的朋友可以參考下
    2019-06-06
  • python畫(huà)圖常見(jiàn)不同圖片格式保存方式

    python畫(huà)圖常見(jiàn)不同圖片格式保存方式

    這篇文章主要介紹了python畫(huà)圖常見(jiàn)不同圖片格式保存方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2023-09-09
  • mac系統(tǒng)下Redis安裝和使用步驟詳解

    mac系統(tǒng)下Redis安裝和使用步驟詳解

    這篇文章主要介紹了mac下Redis安裝和使用步驟詳解,并將python如何操作Redis做了簡(jiǎn)單介紹,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-07-07
  • 淺談Pycharm調(diào)用同級(jí)目錄下的py腳本bug

    淺談Pycharm調(diào)用同級(jí)目錄下的py腳本bug

    今天小編就為大家分享一篇淺談Pycharm調(diào)用同級(jí)目錄下的py腳本bug,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2018-12-12
  • Python Dataframe 指定多列去重、求差集的方法

    Python Dataframe 指定多列去重、求差集的方法

    今天小編就為大家分享一篇Python Dataframe 指定多列去重、求差集的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2018-07-07
  • python中的json模塊常用方法匯總

    python中的json模塊常用方法匯總

    這篇文章主要介紹了python中的json模塊常用方法匯總,json模塊可以實(shí)現(xiàn)json數(shù)據(jù)的序列化和反序列化,更多相關(guān)資料介紹需要的小伙伴可以參考一下下面文章內(nèi)容
    2022-06-06

最新評(píng)論

石景山区| 武城县| 海安县| 广宁县| 新龙县| 拉萨市| 宁国市| 威海市| 齐河县| 阿坝县| 岳阳县| 西平县| 哈密市| 枞阳县| 琼结县| 牙克石市| 平定县| 桂阳县| 孝义市| 鹤山市| 遵化市| 大安市| 麻城市| 潞西市| 柏乡县| 翁牛特旗| 延安市| 米脂县| 赫章县| 成都市| 襄城县| 山西省| 额济纳旗| 荃湾区| 鸡东县| 永川市| 克山县| 拉萨市| 平阴县| 仲巴县| 蒙城县|