學習目標:universal approximation 保證的是存在,不是學得到。同一個網路、同一組超參數與同樣的步數,目標從 1 個週期換到 32 個週期,訓練誤差差好幾個數量級——網路對低頻有一個很強的偏好。而它對「哪些輸入座標相鄰」一無所知,那就是後面每一個架構存在的理由。

灰虛線=目標 sin(2πkx);散點=訓練資料;實線=目前的網路(訓練中會即時更新)

縱軸 log:訓練 MSE 對步數,四條線對應 k = 1 / 4 / 16 / 32;水平線=0.5(完全沒學到的水準)

k = 1 寬度 = 32 k=1 的訓練 MSE = k=4 = k=16 = k=32 =

觀察:四條曲線同時開始,k=1 很快掉到 10⁻³ 以下,k=32 那條幾乎貼在 0.5 上不動——同一個網路、同樣的步數,差別只在目標的頻率。把寬度從 32 加到 128 會讓高頻那條掉一些,但差距不會消失:這不是容量不夠,是梯度下降在這個參數化下先學低頻。定理說得出「存在一組權重」,它沒說你找得到。