學習目標:remasking 是取樣器上的一個旋鈕(σ),不動 forward、不用重訓。它讓早期填錯的字有機會被重填,代價是每一步都要多做一些工作——所以步數少的時候 σ 大反而更差。
橫軸=remasking 強度 σ 縱軸=Markov toy(L=16)樣本的切換率,每個點 300 條樣本 虛線=資料的真值 0.10 三條線=三種步數
σ=0 就是上週的 masked diffusion:步數越多、切換率越接近資料的 0.10。把 σ 往上推,三條線的反應不一樣。完美網路下,N=8 從 0.14–0.15 降到 0.13 左右(最佳 σ 每次跑落在 0.25~1 之間),而 N=32 與 N=128 本來就已經貼在 0.10,沒有空間可以進步。所以在這個 toy 上 remasking 補的是「一步翻開太多格」造成的誤差——步數少時那個誤差最大,補起來最有感。每個點只有 300 條樣本,數字每次跑都會動一點;要看的是三條線的高低關係,不是小數點。切到「有誤差的網路」:三條線整體往上抬,而且 σ 補不回來——那個誤差不是缺 context 造成的,重填一次用的還是同一個偏掉的網路。