學習目標:把「深網路標準配備」拆成三件獨立的事。降取樣用指數的速度買接受域,代價是尺度小於幾個取樣點的東西一次就回不來——除非留一條 skip。殘差修的是深度方向的梯度,正規化修的是每層輸出的尺度,兩者都不能替對方做事。

一維訊號的編碼–解碼玩具:上=原訊號(低頻基底+幾個尖峰)、中=降取樣再升回來、下=加上 skip connection

可切換:(a) 接受域對深度 (b) 逐頻率的保留率 (c) 深度 × 三種接法的訓練誤差

高頻部分的重建誤差:沒有 skip = 有 skip = 低頻部分(沒有 skip) = 要到目標接受域:平的堆疊 = 每兩層降一次 = 初始化時第 32 層輸出的 RMS(無殘差/殘差/殘差+LN) =

觀察:把降取樣次數從 0 拉到 3,中間那條的尖峰一個一個消失而低頻幾乎不動——切到 (b) 就知道為什麼:降 2 次之後,週期短於 20 個取樣點的成分振幅掉到一半以下,而低頻那一段幾乎是 1.0。下面那條留了 skip 的線把尖峰帶回來了:同樣降 2 次,高頻的重建誤差從 0.0797 掉到 0.0090,差快一個數量級——那份資訊繞過了瓶頸。切到 (a):同樣要到接受域 128,平的堆疊要 32 層,每兩層降一次只要 9 層。切到 (c):深度超過 16 層之後無殘差那條就貼在「完全沒學到」的水準,只加正規化也只是把失敗往後推;殘差那條到 48 層還在 10⁻⁵。降取樣、殘差、正規化解決的是三個不同的問題。