學習目標:離散版的「加噪聲」就是一條我們自己寫好的 Markov chain。兩條標準選擇的差別只在終點:uniform 走向一片隨機的字,absorbing 走向整串 [MASK],而被遮的位置不會回來。
兩排是同一句話走同一個 t。橘=原字 藍=被換成隨機字 灰=[MASK] 下方長條圖=該排在被點選的位置上 q(xt|x₀) 的分布(點格子換位置)
拖 t:兩排的原字都以機率 ᾱt 存活,所以被動過的格數大致相同。差別在動過之後長什麼樣——uniform 換成一個隨機的字(也可能換回自己),absorbing 一律變 [MASK],而且往右拖不會有格子復原。看下方長條圖(滿高=機率 1):uniform 的那根柱子一路矮下去、其餘 29 根一起長高,最後攤成一片均勻;absorbing 永遠只有兩根,質量從原字整批搬到 [MASK]。