學習目標:DFM 的條件路徑就是每個 token 各自跳一次:質量以 κt 的比例從起點的字流到終點的字。起點不必是 [MASK]——可以是均勻隨機字、甚至另一句話。

上方六根柱=六個 token 位置;下半=起點的字(高度 1−κt)、上半=終點的字(高度 κt) 下方=κt 與兩個條件 rate

t0.40
起點
κt
κt = forward rate κ̇/(1−κ) = 生成 rate κ̇/κ = 已跳的 token = /6

拖 t:每根柱子的質量從下半(起點)流到上半(終點),比例就是 κt——六根柱子完全同步,因為條件路徑是逐 token 各自獨立的。按「抽一條軌跡」:每個 token 抽一個跳躍時刻,於是同一個 t 之下有些已經跳了、有些還沒;每個 token 只跳一次,這就是條件路徑的全部內容。看下方兩條 rate:forward rate 在 t→1 發散、生成 rate 在 t→0 發散,所以兩端都要小心(實作上會 clamp)。換起點看看:起點是「另一句話」時,這個框架直接就是序列到序列,完全不需要 [MASK]。