學習目標:最大化對數概似最小化交叉熵最小化 KL 到真分布是同一件事——三條曲線在同一個地方取到最小值,彼此只差一個和參數無關的常數(真分布的熵)。而你手上只有其中一條:樣本上的經驗 NLL,它是母體交叉熵的一個有雜訊的估計,n 越小抖得越兇。

真分布(藍虛線)、樣本(下緣的短線)、目前 μ 的模型(紅實線)、經驗 MLE(綠虛線)

三條曲線對 μ:經驗 NLL、母體交叉熵、KL。水平線=真分布的熵 H(p)

經驗 NLL 的最小值位置 μ̂ = 母體交叉熵的最小值位置 = 最小交叉熵 H(p,q) = 真分布的熵 H(p) = 最小 KL = H(p,q) − H(p) = |μ̂ − 母體最佳| 的大小 =

觀察:中間那兩條線永遠是平行的——母體交叉熵減掉一個常數 H(p) 就是 KL,所以它們的最小值在同一個 μ。這就是「最大概似=最小 KL」的全部內容。而你手上只有第三條:經驗 NLL。把 n 從 400 拉到 5,那條線整個歪掉、最小值跑到別的地方,兩者的差距就是你的估計誤差;n 越大它越貼回去。打開「真分布是兩個峰」:模型是單峰,所以最小 KL 不是零——那個沒辦法消掉的量就是模型設定本身的誤差,再多資料也補不回來。