學習目標:LLaDA 那類系統把序列切成 block,block 之間從左到右、block 之內平行翻開。這顆旋鈕直接在網路呼叫次數與因子化誤差之間換——而且完全在取樣器裡,不動訓練。
橫軸=網路呼叫次數(對數) 縱軸=樣本的切換率(虛線=資料的真值 1−相依強度) 每個點標它的 block 大小;同一條線上是同一個 block 大小、不同的每 block 步數
最右下角那個點是 B=1:一次一格、16 次呼叫,切換率打在 0.10 上——那就是 autoregressive,沒有因子化誤差。最左上角是 B=16、1 步:一次呼叫全部填完,切換率衝到 0.5 附近。中間那些點才是有意思的地方:B=4、每 block 2 步(8 次呼叫)量到 0.170——用一半的呼叫次數,走完「最差 0.49 → 最好 0.09」這段路的大約八成。這就是 block 這顆旋鈕在賣的東西:它完全在取樣器裡,不必重訓。把相依強度切到 0.7 再看一次:資料本身變亂(真值變成 0.30),整張圖的可讀範圍跟著變窄——相依越弱,平行翻開的代價越小。