學習目標:取樣就是重複擲硬幣——翻開一些、留下一些。每一格被翻開的機率只跟 schedule 有關(旁邊那個數字),而翻開時填什麼是從網路給的分布抽、不是取 argmax。翻開的字之後不會再改。
上排=當前的 xt(灰=[MASK]、橘=這一步剛翻開、藍=之前翻開的) 下方曲線=loss 的時間權重(線性 schedule 下是 1/t) 點任一個還被遮的格子看網路在那裡的分布
資料是一個 toy 文法:長度 16、字典 A B ( ),規則是「A 與 B 交替、且括號要配對」。按「下一步」看每一步翻開哪些格子——機率只跟 t 有關,和內容無關。把 N 從 16 降到 1:每步同時翻開的格子越來越多,最後一步就把全部 16 格一起填完。點一個還被遮的格子看它的分布:翻開時是從那四根柱子抽的。按 BERT 對照:BERT 只在一個固定的遮罩比例上訓練、權重是常數;masked diffusion 要對所有比例都學會,而且各比例的權重不一樣。