← 返回卷宗
數據預測

殘差網絡

神經網絡

見到知乎上有一個解釋說,基礎形式實際上類似於差分放大,很有道理。

假如: F'(5)=5.1 從5到5.1的變化率是極低的,因為5的基數太大,所以可以進行拆分:

H(5)=5.1, H(5)=5+F(5), F(5)=0.1 此時由於在拆分項中0變成0.1,這個變化率就達到了10%,便放大了這種效果。 因為神經網絡不能很好辨識出這種拆分,所以需要人工設計結構進行輔助,

一般理論上認為網絡層數越多,提取細節與抽象能力越豐富,然而實際層數迭代多了,會出現梯度爆炸或梯度彌散 ,這可以通過通過正則化解決。

但即使解決了這個問題,仍然會有退化問題,即層數多了後,出現準確率反而下降的情況。

這裡有一個變化的技巧就是,在 H(x) = F(x) + x 時,當F(x)=0時, 顯然H(x) = x,如果f(x)越來越趨近於0,則h(x)越來越趨進x

所以可以構造這樣的形式:

所以,x可以直接跳兩層作為輸入,因為h(x)=x,f(x)這裡當然不會等於0,但是可以通過relu使得矩陣中儘量多的地方變成0,從而實現殘差放大。

X如何變化是不清楚的,因為它本來就是一個需要求的值,但這裡可以直接採用X的原值,因為是如果改變了X值,那麼就會破壞掉殘差對應的原來的X結構,因為這裡的殘差實際上不是差分,而只是一個通過訓練後才有可能不斷向差分靠攏的值。

 

 

 

本文由 三符道長 撰於 2017年9月15日。轉載請註明出處。