基于數(shù)據(jù)歸一化以及Python實現(xiàn)方式
數(shù)據(jù)歸一化:
數(shù)據(jù)的標準化是將數(shù)據(jù)按比例縮放,使之落入一個小的特定區(qū)間,去除數(shù)據(jù)的單位限制,將其轉(zhuǎn)化為無量綱的純數(shù)值,便于不同單位或量級的指標能夠進行比較和加權(quán)。
為什么要做歸一化:
1)加快梯度下降求最優(yōu)解的速度
如果兩個特征的區(qū)間相差非常大,其所形成的等高線非常尖,很有可能走“之字型”路線(垂直等高線走),從而導致需要迭代很多次才能收斂。
2)有可能提高精度
一些分類器需要計算樣本之間的距離,如果一個特征值域范圍非常大,那么距離計算就主要取決于這個特征,從而與實際情況相悖(比如這時實際情況是值域范圍小的特征更重要)。
歸一化類型
1)線性歸一化
這種歸一化比較適用在數(shù)值比較集中的情況,缺陷就是如果max和min不穩(wěn)定,很容易使得歸一化結(jié)果不穩(wěn)定,使得后續(xù)的效果不穩(wěn)定,實際使用中可以用經(jīng)驗常量來代替max和min。
2)標準差標準化
經(jīng)過處理的數(shù)據(jù)符合標準正態(tài)分布,即均值為0,標準差為1。
3)非線性歸一化
經(jīng)常用在數(shù)據(jù)分化較大的場景,有些數(shù)值大,有些很小。通過一些數(shù)學函數(shù),將原始值進行映射。該方法包括log、指數(shù)、反正切等。需要根據(jù)數(shù)據(jù)分布的情況,決定非線性函數(shù)的曲線。
log函數(shù):x = lg(x)/lg(max)
反正切函數(shù):x = atan(x)*2/pi
Python實現(xiàn)
線性歸一化
定義數(shù)組:x = numpy.array(x)
獲取二維數(shù)組列方向的最大值:x.max(axis = 0)
獲取二維數(shù)組列方向的最小值:x.min(axis = 0)
對二維數(shù)組進行線性歸一化:
def max_min_normalization(data_value, data_col_max_values, data_col_min_values): """ Data normalization using max value and min value Args: data_value: The data to be normalized data_col_max_values: The maximum value of data's columns data_col_min_values: The minimum value of data's columns """ data_shape = data_value.shape data_rows = data_shape[0] data_cols = data_shape[1] for i in xrange(0, data_rows, 1): for j in xrange(0, data_cols, 1): data_value[i][j] = \ (data_value[i][j] - data_col_min_values[j]) / \ (data_col_max_values[j] - data_col_min_values[j])
標準差歸一化
定義數(shù)組:x = numpy.array(x)
獲取二維數(shù)組列方向的均值:x.mean(axis = 0)
獲取二維數(shù)組列方向的標準差:x.std(axis = 0)
對二維數(shù)組進行標準差歸一化:
def standard_deviation_normalization(data_value, data_col_means,
data_col_standard_deviation):
""" Data normalization using standard deviation
Args:
data_value: The data to be normalized
data_col_means: The means of data's columns
data_col_standard_deviation: The variance of data's columns
"""
data_shape = data_value.shape
data_rows = data_shape[0]
data_cols = data_shape[1]
for i in xrange(0, data_rows, 1):
for j in xrange(0, data_cols, 1):
data_value[i][j] = \
(data_value[i][j] - data_col_means[j]) / \
data_col_standard_deviation[j]
非線性歸一化(以lg為例)
定義數(shù)組:x = numpy.array(x)
獲取二維數(shù)組列方向的最大值:x.max(axis=0)
獲取二維數(shù)組每個元素的lg值:numpy.log10(x)
獲取二維數(shù)組列方向的最大值的lg值:numpy.log10(x.max(axis=0))
對二維數(shù)組使用lg進行非線性歸一化:
def nonlinearity_normalization_lg(data_value_after_lg,
data_col_max_values_after_lg):
""" Data normalization using lg
Args:
data_value_after_lg: The data to be normalized
data_col_max_values_after_lg: The maximum value of data's columns
"""
data_shape = data_value_after_lg.shape
data_rows = data_shape[0]
data_cols = data_shape[1]
for i in xrange(0, data_rows, 1):
for j in xrange(0, data_cols, 1):
data_value_after_lg[i][j] = \
data_value_after_lg[i][j] / data_col_max_values_after_lg[j]
以上這篇基于數(shù)據(jù)歸一化以及Python實現(xiàn)方式就是小編分享給大家的全部內(nèi)容了,希望能給大家一個參考,也希望大家多多支持腳本之家。
- python 機器學習的標準化、歸一化、正則化、離散化和白化
- 如何基于python實現(xiàn)歸一化處理
- python數(shù)據(jù)歸一化及三種方法詳解
- python實現(xiàn)幾種歸一化方法(Normalization Method)
- 詳解python實現(xiàn)數(shù)據(jù)歸一化處理的方式:(0,1)標準化
- python numpy 按行歸一化的實例
- Python數(shù)據(jù)預處理之數(shù)據(jù)規(guī)范化(歸一化)示例
- python 實現(xiàn)對數(shù)據(jù)集的歸一化的方法(0-1之間)
- 對python3 一組數(shù)值的歸一化處理方法詳解
- 如何用Pythony驗證萬物歸一(考拉咨猜想)
相關(guān)文章
python自定義模塊使用.pth文件實現(xiàn)重用方式
這篇文章主要介紹了python自定義模塊使用.pth文件實現(xiàn)重用方式,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教2024-02-02
Pandas Shift函數(shù)的基礎(chǔ)入門學習筆記
shift函數(shù)是對數(shù)據(jù)進行移動的操作,下面這篇文章主要給大家介紹了關(guān)于Pandas Shift函數(shù)的基礎(chǔ)入門學習筆記,文中通過示例代碼介紹的非常詳細,需要的朋友可以參考借鑒,下面隨著小編來一起學習學習吧2018-11-11
python接口自動化使用requests庫發(fā)送http請求
這篇文章主要介紹了python接口自動化使用requests庫發(fā)送http請求,HTTP協(xié)議?,一個基于TCP/IP通信協(xié)議來傳遞數(shù)據(jù),包括html文件、圖像、結(jié)果等,即是一個客戶端和服務器端請求和應答的標準2022-08-08
解決python 執(zhí)行sql語句時所傳參數(shù)含有單引號的問題
這篇文章主要介紹了解決python 執(zhí)行sql語句時所傳參數(shù)含有單引號的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-06-06
python中常見的幾種音頻數(shù)據(jù)讀取、保存方式總結(jié)
Python是一種非常適合進行音頻處理和音頻分析的語言,因為它有許多強大的庫可以使用,下面這篇文章主要給大家介紹了關(guān)于python中常見的幾種音頻數(shù)據(jù)讀取、保存方式,文中通過代碼介紹的非常詳細,需要的朋友可以參考下2024-06-06
python實現(xiàn)字符串完美拆分split()的方法
今天小編就為大家分享一篇python實現(xiàn)字符串完美拆分split()的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2019-07-07

