學習目標:同一份資料、同一個(完美的)網路,只換 forward chain。absorbing 翻開就固定——像 ODE;uniform 每一步都能改任何字——像 SDE。但 uniform 的代價是模型分不清哪些字是噪聲。
兩排是同一條長度 16 的 0/1 序列(資料:相鄰格以機率 0.9 相同)。灰=[MASK] 橘/藍=0/1 紅框=被植入的錯誤 綠框=那個錯誤已經被改掉
按「植入錯誤」再一路按「下一步」:absorbing 那排的紅框永遠不變(已翻開的位置不再被碰);uniform 那排的紅框常常在後面幾步被改掉,變成綠框。跑 200 次,absorbing 的修正率恆為 0%。代價在「視角」那顆按鈕:打開它,你會看到 uniform 的 xt 裡噪聲字和原字長得一模一樣(模型看不到那些標記,得自己猜);absorbing 的 [MASK] 一眼可辨,所有不確定性都集中在那裡。