學習目標:「概似高」和「樣本好看」不是同一件事,而且可以差到荒謬的程度。往一個好模型裡摻 1% 的垃圾,NLL 最多只漲 log(1/0.99) ≈ 0.01 nat,但你抽出來的樣本每一百張就有一張是垃圾。反過來,一個塌到單一模式的模型樣本張張漂亮,概似卻可以是負無窮。所以評估要兩邊都量,而且要先講清楚你在意的是哪一邊。
真分布(虛線)與兩個模型:摻垃圾的(實線)與塌掉的(實線);下緣的短線=各自抽出來的樣本
橫軸 log:摻進去的比例 ε。左縱軸=NLL 比真模型多幾個 nat;右縱軸=樣本端的距離(W₂)
觀察:把 ε 拉到 0.01,上圖那條摻垃圾的密度看起來幾乎和真分布重疊,NLL 只多了 0.0066 nat(上界 log(1/(1−ε)) = 0.0101,實測略低一點,因為那個寬垃圾在真分布的高密度區也還有一點密度)。可是同一個模型的樣本端:W₂ 從 0.33 的雜訊底線跳到 1.03——每一百個樣本就有一個掉在很遠的地方。一個在概似上小到看不見的差別,在樣本上是每一百張一張垃圾。再看另一個方向:把「保留幾成的寬度」拉到 0.1,那個模型的樣本全部落在真分布的高密度區、看起來張張好看(W₂ 只有 0.81),可是它的 NLL 多出 43.9 nats——真分布尾巴上的點在它那裡機率接近 0。兩個方向都存在,所以只報一個數字的評估一定有一邊是瞎的。