學習目標:離散空間沒有梯度,取代它的是鄰居之間的比值 pt(y)/pt(xt)。比值大於 1 的鄰居就是「往那邊改會更像資料」。這裡的 pt 是用前向演算法精確算的,不是網路。
上排=當前的 xt(灰=[MASK]) 下方=每個位置的鄰居比值。absorbing 下把共同因子 ᾱ/(1−ᾱ) 除掉之後就是一個機率分布(線性刻度 0–1);uniform 下畫原始比值(對數刻度,虛線=1)。空槽=那個位置沒有鄰居。點格子可手動改那一格
資料是「相鄰格以機率 0.9 相同」的鏈。absorbing 下每個 [MASK] 有兩根柱子(填 0 或填 1),而把共同因子 ᾱ/(1−ᾱ) 除掉之後,兩根的和剛好是 1(看下面那個數字)——因為 pt(y)/pt(xt) = [ᾱ/(1−ᾱ)] · p(x₀ℓ=v | xt),比值和上週那個網路只差一個已知的係數。填成和鄰居一致的字那根明顯高,填成相反的字那根幾乎是 0。沒被遮的位置畫成空槽:forward 沒有「字換成字」這條管子,反向也就沒有,那些比值根本不用學。切到 uniform:每個位置都有一根柱子,比值要學的數量整個變多,而且沒有那個乾淨的化簡。