← 返回筆記

研究領域 / Flow-Based Generative Models / From Noise to Data / 2026年6月

三種語言:Noise、Score、Velocity

可閱讀 4 分鐘閱讀

「From Noise to Data」系列的收尾。把整張地圖摺好,放進口袋。

走到這裡,你看過 particle 與向量場、probability path、去噪、score、velocity,也看過把生成寫成「沿著場一步步積分」。資訊不少。這最後一篇不加新東西,只做一件事:把它們收成一句話、一張表、和幾個可以繼續走的方向。

一句話

現代生成模型反覆在做同一件事——把 noise 變成 data;它只是用三種不同的語言,描述「此刻該往哪移動」。

同一個樣本,三個提問

面對同一個 noisy sample xtx_t

  • noise 語言問:要移除哪一部分噪聲?→ ϵθ(xt,t)ϵ\epsilon_\theta(x_t, t) \approx \epsilon
  • score 語言問:往哪走密度更高?→ sθ(xt,t)xlogpt(x)s_\theta(x_t, t) \approx \nabla_x \log p_t(x)
  • velocity 語言問:此刻該往哪流?→ vθ(xt,t)vt(x)v_\theta(x_t, t) \approx v_t(x)

三個問題都在描述「從簡單分布回到資料分布」的局部方向。在仿射高斯路徑 xt=αtx0+σtϵx_t=\alpha_t x_0+\sigma_t\epsilon 上,它們是彼此的線性換算——最乾淨的一條是

xlogpt(x)=ϵ(x,t)σt,\nabla_x \log p_t(x) = -\frac{\epsilon^\star(x,t)}{\sigma_t},

而 velocity 又能寫成 ϵ\epsilon-預測 / x0x_0-預測 / score 的線性組合。知道一個,就知道全部。它們不是三個模型家族,是同一個動態的三種座標。

幾個容易想歪的地方

想一想noise、score、velocity 這三種語言,描述的是不同的東西,還是同一件事?

想一想帶著這張地圖去讀一篇新的生成模型論文,最該避免的反應是?

三條可以繼續走的分支

這張地圖是入口,不是終點。想再往深處走,Diffusion & Flow Models 課程 把下面每一條都展開成完整的數學(continuity equation、conditional→marginal 的證明、probability-flow ODE、path design、rectified flow、optimal transport 都在那裡):

  1. diffusion / score-based modeling:SDE 框架、noise schedule(EDM)、ODE samplers、guidance。
  2. flow matching / rectified flow:conditional flow matching、OT-CFM、拉直與少步 / 單步生成、蒸餾。
  3. optimal transport / Schrödinger bridge:Wasserstein 幾何、動態 OT、把擴散與最優傳輸接起來的橋接模型。

讀這些題目時,隨時可以回到這張地圖:先問 path、訊號、sampler,再看它離 OT 最優有多遠。

你已經走完一條橋

如果你能在腦中想像一群點從圓形雲團流成月牙、能說出「向量場是給整個空間的導航規則」、能解釋為什麼用 x1x0x_1-x_0 這種粗目標卻學得到對的場——那你已經不只是「看過科普」,而是握住了讀懂這些論文所需的核心直覺與語言。剩下的,就是挑一條分支,繼續走下去。

想先驗收一下自己吸收了多少嗎?最後附上一篇全是問題的 回顧測驗,用九個跨篇的問題,把整張地圖再走一遍。

參考文獻

  1. Song, Y., et al. Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021.
  2. Lipman, Y., et al. Flow Matching for Generative Modeling. ICLR 2023.
  3. Albergo, M., Boffi, N., Vanden-Eijnden, E. Stochastic Interpolants: A Unifying Framework for Flows and Diffusions. 2023.