學習目標:交叉驗證的 K 買的是估計的穩定度,而且到 5–10 就幾乎買完了。真正會讓 CV 說謊的不是 K 選錯,是fold 的邊界沒有沿著資料相依的邊界畫

橫軸 K:CV 估計的標準差(實線)與偏誤(虛線);✕=單次留出的參考點

橫軸=序列的自相關 ρ:隨機切分的 CV 分數 vs 尊重時間順序的前向鏈;虛線=真實風險

真實風險 = 單次留出 std = 5-fold std = 10-fold std = LOO std =

觀察:K 從 2 走到 n,標準差掉得很快然後幾乎不再改善——5 到 10 之後你買不到什麼了。下圖是另一回事:把序列的自相關 ρ 從 0 拉到 0.95,隨機切分的 CV 分數越來越樂觀(fold 裡面有和訓練點幾乎一樣的鄰居),而尊重時間順序的前向鏈仍然貼著真實風險。