學習目標:在 transition matrix 上加一點「回到 [MASK]」的機會,兩件事會壞掉:閉式消失,而且那個量沒有單位——換步數 T 就得重新調。改用「單位時間的流量」來描述,第二個問題直接沒了。
上圖=Q̄t 的實際值(連乘出來的)與「閉式猜測」ᾱtI+(1−ᾱt)·[MASK] 的最大差距 下圖=同一個參數在三種步數 T 之下,走到終點時還剩多少原字
γ=0 時上圖是一條貼在 0 上的線——閉式完全正確。把 γ 往上推,誤差立刻長出來,Q̄t 再也不是「ᾱ 倍的 identity + 剩下的全在 [MASK]」那個形狀,每個 t 都得重新連乘一次矩陣。下圖是更麻煩的那件事:兩種模式的遮罩總量都固定(所以 γ=0 時三根柱子一樣高)。選「每步的機率 γ」——在 T=40 校準好的那個 γ 直接拿去 T=10、100、1000 用——三根柱子高度差很多;切到「單位時間的 rate σ」(也就是每步取 σ/T),三根柱子幾乎一樣高。這就是為什麼下一篇要換語言:rate 有單位,每步的機率沒有。