批標(biāo)準(zhǔn)化層 tf.keras.layers.Batchnormalization()解析
批標(biāo)準(zhǔn)化層 tf.keras.layers.Batchnormalization()
tf.keras.layers.Batchnormalization()
重要參數(shù):
training:布爾值,指示圖層應(yīng)在訓(xùn)練模式還是在推理模式下運行。training=True:該圖層將使用當(dāng)前批輸入的均值和方差對其輸入進行標(biāo)準(zhǔn)化。training=False:該層將使用在訓(xùn)練期間學(xué)習(xí)的移動統(tǒng)計數(shù)據(jù)的均值和方差來標(biāo)準(zhǔn)化其輸入。
BatchNormalization 廣泛用于 Keras 內(nèi)置的許多高級卷積神經(jīng)網(wǎng)絡(luò)架構(gòu),比如 ResNet50、Inception V3 和 Xception。
BatchNormalization 層通常在卷積層或密集連接層之后使用。
批標(biāo)準(zhǔn)化的實現(xiàn)過程
- 求每一個訓(xùn)練批次數(shù)據(jù)的均值
- 求每一個訓(xùn)練批次數(shù)據(jù)的方差
- 數(shù)據(jù)進行標(biāo)準(zhǔn)化
- 訓(xùn)練參數(shù)γ,β
- 輸出y通過γ與β的線性變換得到原來的數(shù)值
在訓(xùn)練的正向傳播中,不會改變當(dāng)前輸出,只記錄下γ與β。在反向傳播的時候,根據(jù)求得的γ與β通過鏈?zhǔn)角髮?dǎo)方式,求出學(xué)習(xí)速率以至改變權(quán)值。
對于預(yù)測階段時所使用的均值和方差,其實也是來源于訓(xùn)練集。比如我們在模型訓(xùn)練時我們就記錄下每個batch下的均值和方差,待訓(xùn)練完畢后,我們求整個訓(xùn)練樣本的均值和方差期望值,作為我們進行預(yù)測時進行BN的的均值和方差。
批標(biāo)準(zhǔn)化的使用位置
原始論文講在CNN中一般應(yīng)作用與非線性激活函數(shù)之前,但是,實際上放在激活函數(shù)之后效果可能會更好。
# 放在非線性激活函數(shù)之前
model.add(tf.keras.layers.Conv2D(64, (3, 3)))
model.add(tf.keras.layers.BatchNormalization())
model.add(tf.keras.layers.Activation('relu'))
# 放在激活函數(shù)之后
model.add(tf.keras.layers.Conv2D(64, (3, 3), activation='relu'))
model.add(tf.keras.layers.BatchNormalization())tf.keras.layers.BatchNormalization使用細(xì)節(jié)
關(guān)于keras中的BatchNormalization使用,官方文檔說的足夠詳細(xì)。本文的目的旨在說明在BatchNormalization的使用過程中容易被忽略的細(xì)節(jié)。
在BatchNormalization的Arguments參數(shù)中有trainable屬性;以及在Call arguments參數(shù)中有training。兩個都是bool類型。第一次看到有兩個參數(shù)的時候,我有點懵,為什么需要兩個?
后來在查閱資料后發(fā)現(xiàn)了兩者的不同作用。
1,trainable是Argument參數(shù),類似于c++中構(gòu)造函數(shù)的參數(shù)一樣,是構(gòu)建一個BatchNormalization層時就需要傳入的,至于它的作用在下面會講到。
2,training參數(shù)時Call argument(調(diào)用參數(shù)),是運行過程中需要傳入的,用來控制模型在那個模式(train還是interfere)下運行。關(guān)于這個參數(shù),如果使用模型調(diào)用fit()的話,是可以不給的(官方推薦是不給),因為在fit()的時候,模型會自己根據(jù)相應(yīng)的階段(是train階段還是inference階段)決定training值,這是由learning——phase機制實現(xiàn)的。
重點
關(guān)于trainable=False:如果設(shè)置trainable=False,那么這一層的BatchNormalization層就會被凍結(jié)(freeze),它的trainable weights(可訓(xùn)練參數(shù))(就是gamma和beta)就不會被更新。
注意:freeze mode和inference mode是兩個概念。
但是,在BatchNormalization層中,如果把某一層BatchNormalization層設(shè)置為trainable=False,那么這一層BatchNormalization層將一inference mode運行,也就是說(meaning that it will use the moving mean and the moving variance to normalize the current batch, rather than using the mean and variance of the current batch).
總結(jié)
以上為個人經(jīng)驗,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關(guān)文章
Python 拷貝對象(深拷貝deepcopy與淺拷貝copy)
Python中的對象之間賦值時是按引用傳遞的,如果需要拷貝對象,需要使用標(biāo)準(zhǔn)庫中的copy模塊。2008-09-09
python2和python3應(yīng)該學(xué)哪個(python3.6與python3.7的選擇)
許多剛?cè)腴T Python 的朋友都在糾結(jié)的的問題是:我應(yīng)該選擇學(xué)習(xí) python2 還是 python3,Python 3.7 已經(jīng)發(fā)布了,目前Python的用戶,主要使用的版本 應(yīng)該是 Python3.6 和 Python2.7 ,那么是不是該轉(zhuǎn)到 Python 3.7 呢2019-10-10
Pytorch如何指定device(cuda or cpu)
這篇文章主要介紹了Pytorch如何指定device(cuda or cpu)問題,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教2024-06-06

