學習目標:在驗證集上從 m 個候選裡挑最好的那一個,那個分數就不再是無偏的——它是 m 個抽樣的極值。挑的候選越多、驗證集越小,勝出者的驗證分數就越樂觀,而它的測試分數完全不動。
三個分佈(600 次重複):勝出者的驗證分數、同一個模型的測試分數、與所有候選的平均水準;垂直線=各自的中位數
樂觀量(驗證中位數 − 測試中位數)對候選數 m,三條線對應三種驗證集大小
觀察:把 m 拉大,驗證分佈整團往右漂而測試分佈幾乎不動——多出來的那一段完全是挑選造成的。把驗證集拉大,三個分佈同時變窄、樂觀量跟著縮小:樂觀量正比於驗證集本身的抖動,而它隨 m 只以 √log m 成長,所以下圖的曲線越後面越平。