pandas的drop_duplicates無法去重問題解決
之前沒研究過pandas的去重方法,今天用了一下,發(fā)現(xiàn)這個(gè)方法并不是那么好用,我的需求是去除所有列的重復(fù)值,并保留第一個(gè)重復(fù)的值,按我的想法應(yīng)該是下面這樣寫
import pandas as pd
import numpy as np
df1 = pd.DataFrame({
'a':[1,1,float('nan'),1,4,5],
'b':[3,3,4,4,5,6],
'c':[4,4,5,5,6,7],
})
df1 = df1.drop_duplicates(keep='first')
df1但是結(jié)果卻不盡如人意,
a b c
0 1.0 3 4
2 NaN 4 5
3 1.0 4 5
4 4.0 5 6
5 5.0 6 7
如圖所示,并沒有刪除重復(fù)值,所以我只能一個(gè)一個(gè)列的刪,刪完在重新拼接在一起,
import pandas as pd
import numpy as np
df1 = pd.DataFrame({
'a':[1,1,float('nan'),1,4,5],
'b':[3,3,4,4,5,6],
'c':[4,4,5,5,6,7],
})
cols = df1.columns.to_list()
series_list = []
for col in cols:
tmp_s = df1[col].drop_duplicates(keep='first')
tmp_s = tmp_s.dropna()
tmp_s = tmp_s.reset_index(drop=True)
print(tmp_s)
series_list.append(tmp_s)
new_df = pd.concat(series_list,axis=1)
new_df結(jié)果
a b c
0 1.0 3 4
1 4.0 4 5
2 5.0 5 6
3 NaN 6 7
當(dāng)然這樣數(shù)據(jù)的索引是無法跟之前的對應(yīng)起來了,所以我猜pandas是想保留之前的數(shù)據(jù)的對應(yīng)關(guān)系的,一旦有操作要破壞這種對應(yīng),它就不會執(zhí)行
drop_duplicates()官方的函數(shù)說明
解釋一下各個(gè)參數(shù):
subset:表示要去重的列名,默認(rèn)為 None。
keep:有三個(gè)可選參數(shù),分別是 first、last、False,默認(rèn)為 first,表示只保留第一次出現(xiàn)的重復(fù)項(xiàng),刪除其余重復(fù)項(xiàng),last 表示只保留最后一次出現(xiàn)的重復(fù)項(xiàng),F(xiàn)alse 則表示刪除所有重復(fù)項(xiàng)。
inplace:布爾值參數(shù),默認(rèn)為 False 表示刪除重復(fù)項(xiàng)后返回一個(gè)副本,若為 Ture 則表示直接在原數(shù)據(jù)上刪除重復(fù)項(xiàng),改變了原來的數(shù)據(jù)框。
ignore_index:布爾值參數(shù),默認(rèn)為False,表示保留原來的行索引,若為True,則表示重新設(shè)置行索引。
到此這篇關(guān)于pandas的drop_duplicates無法去重問題解決的文章就介紹到這了,更多相關(guān)pandas的drop_duplicates無法去重內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- Pandas去除重復(fù)項(xiàng)函數(shù)詳解drop_duplicates()
- Pandas之使用drop_duplicates:去除重復(fù)項(xiàng)
- Pandas 中的 drop_duplicates()詳解
- pandas重復(fù)行刪除操作df.drop_duplicates和df.duplicated的區(qū)別
- Python?Pandas中DataFrame.drop_duplicates()刪除重復(fù)值詳解
- pandas.DataFrame.drop_duplicates 用法介紹
- 詳解pandas使用drop_duplicates去除DataFrame重復(fù)項(xiàng)參數(shù)
- Pandas之drop_duplicates:去除重復(fù)項(xiàng)方法
相關(guān)文章
Django多數(shù)據(jù)庫聯(lián)用實(shí)現(xiàn)方法解析
這篇文章主要介紹了Django多數(shù)據(jù)庫聯(lián)用實(shí)現(xiàn)方法解析,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-11-11
Python Pandas分組聚合的實(shí)現(xiàn)方法
這篇文章主要介紹了Python Pandas分組聚合的實(shí)現(xiàn)方法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2019-07-07
python中playwright截屏API的實(shí)現(xiàn)
無論是屏幕錄制,還是屏幕截圖,Playwright都提供了簡潔的方法實(shí)現(xiàn),本文就來詳細(xì)的介紹一下python中playwright截屏API的實(shí)現(xiàn),具有一定的參考價(jià)值,感興趣的可以了解一下2026-01-01
python中數(shù)字列表轉(zhuǎn)化為數(shù)字字符串的實(shí)例代碼
先前學(xué)習(xí)過,數(shù)字和字符串都可以存儲到變量當(dāng)中,下面這篇文章主要給大家介紹了關(guān)于python中數(shù)字列表轉(zhuǎn)化為數(shù)字字符串的相關(guān)資料,文中通過實(shí)例代碼介紹的非常詳細(xì),需要的朋友可以參考下2023-02-02

