學習目標:在 m 個候選裡挑驗證分數最好的那一個,那個分數就帶著一個系統性的樂觀量。它隨 √log m 成長(所以「少試幾組」幫助有限),而且正比於驗證集本身的抖動 σ(所以「把驗證集加大」有效得多)。

一條分數軸上的 m 個候選(點);垂直線=真實品質;高亮=被挑中的那個;箭頭=樂觀量

對 m(log 橫軸):勝出者的驗證分數、勝出者的真實風險、以及理論的 σ√(2 log m)(虛線)

m = σ(驗證集的抖動) = 勝出者的驗證分數 = 勝出者的真實風險 = 樂觀量 = 理論 σ√(2 log m) =

觀察:把 m 拉大,被挑中的那個點越來越偏離真實品質線,而下圖兩條線越分越開——但那條分開得很慢,因為它是 √log m。把驗證集 n 加大四倍,樂觀量大約減半(σ ∝ 1/√n):「把驗證集加大」比「少試幾組」有效得多。打開巢狀驗證,畫面上多出來的那條估計線貼回真實風險——代價是那份資料不能再拿來選。