最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

pandas數(shù)據(jù)集的端到端處理

 更新時間:2019年02月18日 16:16:41   作者:Inside_Zhang  
今天小編就為大家分享一篇關于pandas數(shù)據(jù)集的端到端處理,小編覺得內容挺不錯的,現(xiàn)在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧

1. 數(shù)據(jù)集基本信息

df = pd.read_csv()

df.head():前五行;

df.info():

  • rangeindex:行索引;
  • data columns:列索引;
  • dtypes:各個列的類型,
  • 主體部分是各個列值的情況,比如可判斷是否存在 NaN 值;

對于非數(shù)值型的屬性列

  • df[‘some_categorical_columns'].value_counts():取值分布;

df.describe(): 各個列的基本統(tǒng)計信息

  • count
  • mean
  • std
  • min/max
  • 25%, 50%, 75%:分位數(shù)

df.hist(bins=50, figsize=(20, 15)):統(tǒng)計直方圖;

對 df 的每一列進行展示:

train_prices = pd.DataFrame({'price': train_df.SalePrice, 
    'log(price+1)': np.log1p(train_df.SalePrice)})
 # train_prices 共兩列,一列列名為 price,一列列名為 log(price+1)
train_prices.hist()

2. 數(shù)據(jù)集拆分

def split_train_test(data, test_ratio=.3):
 shuffled_indices = np.random.permutation(len(data))
 test_size = int(len(data)*test_ratio)
 test_indices = shuffled_indices[:test_size]
 train_indices = shuffled_indices[test_size:]
 return data.iloc[train_indices], data.iloc[test_indices]

3. 數(shù)據(jù)預處理

  • 一鍵把 categorical 型特征(字符串類型)轉化為數(shù)值型:
>> df['label'] = pd.Categorical(df['label']).codes
  • 一鍵把 categorical 型特征(字符串類型)轉化為 one-hot 編碼:
>> df = pd.get_dummies(df)
  • null 值統(tǒng)計與填充:
>> df.isnull().sum().sort_values(ascending=False).head()
# 填充為 mean 值
>> mean_cols = df.mean()
>> df = df.fillna(mean_cols)
>> df.isnull().sum().sum()
0

總結

以上就是這篇文章的全部內容了,希望本文的內容對大家的學習或者工作具有一定的參考學習價值,謝謝大家對腳本之家的支持。如果你想了解更多相關內容請查看下面相關鏈接

相關文章

  • Sphinx環(huán)境配置及VScode編寫Rst文檔轉html的步驟

    Sphinx環(huán)境配置及VScode編寫Rst文檔轉html的步驟

    sphinx主要用于編寫 reStructuredText 和 Markdown 格式技術文檔,編寫此類技術文檔時Sphinx工具可將其轉為html、pdf、ePub等格式,這篇文章主要介紹了Sphinx環(huán)境配置及VScode編寫Rst文檔轉html,需要的朋友可以參考下
    2023-03-03
  • 解決python ogr shp字段寫入中文亂碼的問題

    解決python ogr shp字段寫入中文亂碼的問題

    今天小編就為大家分享一篇解決python ogr shp字段寫入中文亂碼的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-12-12
  • Django自定義過濾器定義與用法示例

    Django自定義過濾器定義與用法示例

    這篇文章主要介紹了Django自定義過濾器定義與用法,結合實例形式分析了Django自定義過濾器的概念、功能、定義及使用方法,需要的朋友可以參考下
    2018-03-03
  • 淺析python打包工具distutils、setuptools

    淺析python打包工具distutils、setuptools

    python包在開發(fā)中十分常見,一般的使用套路是所有的功能做一個python模塊包,打包模塊,然后發(fā)布,安裝使用。這篇文章給大家介紹了python打包工具distutils、setuptools的相關知識,感興趣的朋友一起看看吧
    2018-04-04
  • pandas之分組groupby()的使用整理與總結

    pandas之分組groupby()的使用整理與總結

    這篇文章主要介紹了pandas之分組groupby()的使用整理與總結,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-06-06
  • python3實現(xiàn)短網(wǎng)址和數(shù)字相互轉換的方法

    python3實現(xiàn)短網(wǎng)址和數(shù)字相互轉換的方法

    這篇文章主要介紹了python3實現(xiàn)短網(wǎng)址和數(shù)字相互轉換的方法,涉及Python操作字符串的相關技巧,非常具有實用價值,需要的朋友可以參考下
    2015-04-04
  • Python中批量文件處理與自動化管理技巧分享

    Python中批量文件處理與自動化管理技巧分享

    在日常辦公或數(shù)據(jù)處理工作中,我們經(jīng)常需要處理大量的文件,本文主要介紹了如何使用Python進行文件操作,目錄管理等常見任務,希望對大家有所幫助
    2025-02-02
  • Python可視化之pyechart庫使用詳解

    Python可視化之pyechart庫使用詳解

    這篇文章主要介紹了Python可視化之pyechart庫使用詳解,Pyecharts 提供了一個簡單而直觀的 API 接口,使得使用者無需了解復雜的 JavaScript 語法,即可通過 Python 代碼實現(xiàn)高度定制化的圖表設計,需要的朋友可以參考下
    2023-12-12
  • python讀寫ini配置文件方法實例分析

    python讀寫ini配置文件方法實例分析

    這篇文章主要介紹了python讀寫ini配置文件方法,實例分析了Python針對ini配置文件的相關讀寫技巧,需要的朋友可以參考下
    2015-06-06
  • python 解決flask 圖片在線瀏覽或者直接下載的問題

    python 解決flask 圖片在線瀏覽或者直接下載的問題

    今天小編就為大家分享一篇python 解決flask 圖片在線瀏覽或者直接下載的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01

最新評論

从江县| 淳安县| 平度市| 阜康市| 阜新市| 广灵县| 山东| 静宁县| 双江| 通江县| 吉安市| 乾安县| 竹北市| 宣威市| 平湖市| 八宿县| 万州区| 蓝山县| 枣强县| 夏津县| 蕉岭县| 乌海市| 东乡县| 曲麻莱县| 吐鲁番市| 唐山市| 青冈县| 红安县| 仪陇县| 金阳县| 韶山市| 高青县| 广昌县| 瓦房店市| 含山县| 民权县| 崇明县| 桦甸市| 和政县| 安泽县| 垫江县|