三種語言:Noise、Score、Velocity
「From Noise to Data」系列的收尾。把整張地圖摺好,放進口袋。
走到這裡,你看過 particle 與向量場、probability path、去噪、score、velocity,也看過把生成寫成「沿著場一步步積分」。資訊不少。這最後一篇不加新東西,只做一件事:把它們收成一句話、一張表、和幾個可以繼續走的方向。
一句話
現代生成模型反覆在做同一件事——把 noise 變成 data;它只是用三種不同的語言,描述「此刻該往哪移動」。
同一個樣本,三個提問
面對同一個 noisy sample :
- noise 語言問:要移除哪一部分噪聲?→
- score 語言問:往哪走密度更高?→
- velocity 語言問:此刻該往哪流?→
三個問題都在描述「從簡單分布回到資料分布」的局部方向。在仿射高斯路徑 上,它們是彼此的線性換算——最乾淨的一條是
而 velocity 又能寫成 -預測 / -預測 / score 的線性組合。知道一個,就知道全部。它們不是三個模型家族,是同一個動態的三種座標。
幾個容易想歪的地方
三條可以繼續走的分支
這張地圖是入口,不是終點。想再往深處走,Diffusion & Flow Models 課程 把下面每一條都展開成完整的數學(continuity equation、conditional→marginal 的證明、probability-flow ODE、path design、rectified flow、optimal transport 都在那裡):
- diffusion / score-based modeling:SDE 框架、noise schedule(EDM)、ODE samplers、guidance。
- flow matching / rectified flow:conditional flow matching、OT-CFM、拉直與少步 / 單步生成、蒸餾。
- optimal transport / Schrödinger bridge:Wasserstein 幾何、動態 OT、把擴散與最優傳輸接起來的橋接模型。
讀這些題目時,隨時可以回到這張地圖:先問 path、訊號、sampler,再看它離 OT 最優有多遠。
你已經走完一條橋
如果你能在腦中想像一群點從圓形雲團流成月牙、能說出「向量場是給整個空間的導航規則」、能解釋為什麼用 這種粗目標卻學得到對的場——那你已經不只是「看過科普」,而是握住了讀懂這些論文所需的核心直覺與語言。剩下的,就是挑一條分支,繼續走下去。
想先驗收一下自己吸收了多少嗎?最後附上一篇全是問題的 回顧測驗,用九個跨篇的問題,把整張地圖再走一遍。
參考文獻
- Song, Y., et al. Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021.
- Lipman, Y., et al. Flow Matching for Generative Modeling. ICLR 2023.
- Albergo, M., Boffi, N., Vanden-Eijnden, E. Stochastic Interpolants: A Unifying Framework for Flows and Diffusions. 2023.