學習目標:訓練誤差和你真正想小的那個數字之間有兩段落差。第一段(訓練誤差 → 同分佈風險)來自資料有限,加資料會關掉;第二段(同分佈風險 → 上線風險)來自你只在 x ≤ 上限那一段蒐集資料,加多少同樣的資料都關不掉。
散點=訓練資料;斜線區=從來沒有蒐集過資料的範圍;灰虛線=真值;實線=擬合
三根柱子(log 縱軸):訓練誤差、同分佈風險(只在蒐集範圍內算)、上線風險(整個 [0,1])
觀察:把 n 拉大,前兩根柱子靠攏而第三根紋風不動;把 d 拉大,前兩根分家;把蒐集範圍上限拉回 1.0,第三根瞬間掉回第二根的高度。加資料能關掉第一段落差,關不掉第二段——判斷自己卡在哪一段,決定你該去蒐集更多同樣的資料,還是不一樣的資料。