最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Pandas拼接concat使用方法

 更新時間:2023年12月04日 10:44:56   作者:金戈鐡馬  
當我們需要將兩個Pandas DataFrame對象合并為一個時,就需要使用Pandas拼接函數(shù),本文主要介紹了Pandas拼接concat使用方法,感興趣的可以了解一下

1.處理索引和軸

假設(shè)我們有2個關(guān)于考試成績的數(shù)據(jù)集。

df1 = pd.DataFrame({ 
    'name':['A','B','C','D'],
    'math':[60,89,82,70],
    'physics':[66, 95,83,66],
    'chemistry':[61,91,77,70] 
})
df2 = pd.DataFrame({ 
    'name':['E','F','G','H'],
    'math':[66,95,83,66],
    'physics':[60, 89,82,70],
    'chemistry':[90,81,78,90] 
})

最簡單的用法就是傳遞一個含有DataFrames的列表,例如[df1, df2]。默認情況下,它是沿axis=0垂直連接的,并且默認情況下會保留df1和df2原來的索引。

pd.concat([df1,df2])

圖片

如果想要合并后忽略原來的索引,可以通過設(shè)置參數(shù)ignore_index=True,這樣索引就可以從0到n-1自動排序了。

pd.concat([df1,df2],ignore_index = True)

圖片

如果想要沿水平軸連接兩個DataFrame,可以設(shè)置參數(shù)axis=1。

pd.concat([df1,df2],axis = 1)

圖片

以上是一些基本操作,我們繼續(xù)往下看。

2.避免重復(fù)索引

我們知道了concat()函數(shù)會默認保留原dataframe的索引。那有些情況,我想保留原來的索引,并且我還想驗證合并后的結(jié)果是否有重復(fù)的索引,該怎么辦呢?

可以通過設(shè)置參數(shù)verify_integrity=True,將此設(shè)置True為時,如果存在重復(fù)的索引,將會報錯。比如下面這樣。

try:
    pd.concat([df1,df2], verify_integrity=True)
except ValueError as e:
    print('ValueError', e)
ValueError: Indexes have overlapping values: Int64Index([0, 1, 2, 3], dtype='int64')

3.使用keys和names選項添加層次結(jié)構(gòu)索引

添加層次結(jié)構(gòu)索引非常的有用,可以進行更多層的數(shù)據(jù)分析。

舉個例子,某些情況下我們并不想合并兩個dataframe的索引,而是想為兩個數(shù)據(jù)集貼上標簽。比如我們分別為df1df2添加標簽Year 1Year 2。

這種情況,我們只需指定keys參數(shù)即可。

res = pd.concat([df1,df2],keys = ['Year 1','Year 2'])
res

圖片

如果我們想要獲取Year 1的數(shù)據(jù)集,可以直接使用loc像下面這樣操作:

res.loc['Year 1']

另外,參數(shù)names可用于為所得的層次索引添加名稱。例如,將名稱Class添加到剛創(chuàng)建的的標簽上。

pd.concat(
    [df1,df2],
    keys = ['Year 1','Year 2'],
    names = ['Class',None],
)

圖片

如果要重置索引并將其轉(zhuǎn)換為數(shù)據(jù)列,可以使用 reset_index(),這一步操作也是非常的實用。

pd.concat(
    [df1, df2], 
    keys=['Year 1', 'Year 2'],
    names=['Class', None],
).reset_index(level=0)   
# reset_index(level='Class')

圖片

4.列匹配和排序

concat()函數(shù)還可以將合并后的列按不同順序排序。雖然,它會自動將兩個df的列對齊合并。但默認情況下,生成的DataFrame與第一個DataFrame具有相同的列排序。例如,在以下示例中,其順序與df1相同。

圖片

如果想要按字母順序?qū)Y(jié)果DataFrame進行排序,則可以設(shè)置參數(shù)sort=True

pd.concat([df1, df2], sort=True)

圖片

或者也可以自定義排序,像下面這樣:

custom_sort = ['math', 'chemistry', 'physics', 'name']
res = pd.concat([df1, df2])
res[custom_sort]

圖片

5.連接CSV文件數(shù)據(jù)集

假設(shè)我們需要從一堆CSV文件中加載并連接數(shù)據(jù)集。常規(guī)做法,我們可能會使用for循環(huán)解決,比如下面這樣。

import pathlib2 as pl2
ps = pl2.Path('data/sp3')
res = None
for p in ps.glob('*.csv'):
    if res is None:
        res = pd.read_csv(p)
    else:
        res = pd.concat([res, pd.read_csv(p)])

但上面pd.concat()在每次for循環(huán)迭代中都會被調(diào)用一次,效率不高,推薦使用列表推導(dǎo)式的寫法。

import pathlib2 as pl2
ps = pl2.Path('data/sp3')
dfs = (
    pd.read_csv(p, encoding='utf8') for p in ps.glob('*.csv')
)
res = pd.concat(dfs)
res

這樣就可以用一行代碼讀取所有CSV文件并生成DataFrames的列表dfs。然后,我們只需要調(diào)用pd.concat(dfs)一次即可獲得相同的結(jié)果,簡潔高效。

使用%%timeit測試下上面兩種寫法的時間,第二種列表推導(dǎo)式大概省了一半時間。

# for-loop solution
298 ms ± 11.8 ms per loop (mean ± std. dev. of 7 runs, 1 loop each)
# list comprehension solution
153 ms ± 6 ms per loop (mean ± std. dev. of 7 runs, 1 loop each)

 到此這篇關(guān)于Pandas拼接concat使用方法的文章就介紹到這了,更多相關(guān)Pandas拼接concat內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • flask框架路由常用定義方式總結(jié)

    flask框架路由常用定義方式總結(jié)

    這篇文章主要介紹了flask框架路由常用定義方式,結(jié)合實例形式總結(jié)分析了flask框架路由的常見定義方式與相關(guān)操作注意事項,需要的朋友可以參考下
    2019-07-07
  • 如何使用python記錄室友的抖音在線時間

    如何使用python記錄室友的抖音在線時間

    這篇文章主要介紹了如何使用python記錄室友的抖音在線時間,本文通過實例代碼圖文相結(jié)合給大家介紹的非常詳細,對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-06-06
  • Python中使用裝飾器和元編程實現(xiàn)結(jié)構(gòu)體類實例

    Python中使用裝飾器和元編程實現(xiàn)結(jié)構(gòu)體類實例

    Python中使用裝飾器和元編程實現(xiàn)結(jié)構(gòu)體類實例,本文的方法算是一種Python的黑魔法技術(shù),并非Python的常規(guī)寫法,需要的朋友可以參考下
    2015-01-01
  • Python?Traceback(most?recent?call?last)報錯信息:示例解讀

    Python?Traceback(most?recent?call?last)報錯信息:示例解讀

    這篇文章主要介紹了Python?Traceback(most?recent?call?last)報錯信息:示例解讀,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2023-12-12
  • 淺談python之新式類

    淺談python之新式類

    這篇文章主要介紹了淺談python之新式類,詳細的介紹了如何使用新式類和經(jīng)典類的區(qū)別。小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-08-08
  • Python for循環(huán)及基礎(chǔ)用法詳解

    Python for循環(huán)及基礎(chǔ)用法詳解

    這篇文章為大家介紹python for 循環(huán),它常用于遍歷字符串、列表、元組、字典、集合等序列類型,逐個獲取序列中的各個元素
    2019-11-11
  • Python實現(xiàn)的堆排序算法示例

    Python實現(xiàn)的堆排序算法示例

    這篇文章主要介紹了Python實現(xiàn)的堆排序算法,結(jié)合實例形式分析了堆排序的原理及Python定義與使用堆排序算法的相關(guān)操作技巧,需要的朋友可以參考下
    2018-04-04
  • Keras預(yù)訓(xùn)練的ImageNet模型實現(xiàn)分類操作

    Keras預(yù)訓(xùn)練的ImageNet模型實現(xiàn)分類操作

    這篇文章主要介紹了Keras預(yù)訓(xùn)練的ImageNet模型實現(xiàn)分類操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-07-07
  • Python中Threading用法詳解

    Python中Threading用法詳解

    本篇文章給大家介紹了Python中Threading的詳細用法,需要的朋友跟著小編一起學(xué)習(xí)下吧。
    2017-12-12
  • Python中requests庫的學(xué)習(xí)方法詳解

    Python中requests庫的學(xué)習(xí)方法詳解

    這篇文章主要為大家詳細介紹了Python中requests庫的學(xué)習(xí)方法,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2022-02-02

最新評論

绵竹市| 萝北县| 盖州市| 都匀市| 上虞市| 三亚市| 玛纳斯县| 交城县| 东光县| 黑水县| 大渡口区| 铁岭县| 阜康市| 锡林郭勒盟| 宿迁市| 京山县| 和平县| 雷州市| 合肥市| 凌源市| 吴忠市| 柯坪县| 潼关县| 镇康县| 碌曲县| 思南县| 来宾市| 喀喇沁旗| 乌兰察布市| 利辛县| 交口县| 贵南县| 合山市| 桐城市| 奇台县| 襄樊市| 疏勒县| 霍林郭勒市| 金山区| 康定县| 同仁县|