學習目標:只換配對,兩端的分布完全不動。 每一輪用上一輪的 ODE 終點當新的配對,條件直線就越來越不交叉——運輸成本、straightness、少步數誤差三個數會一起往下走。
綠細線=這一輪的配對直線 靛/金粗線=這一輪訓出來的邊際 ODE 軌跡 藍點=起點 橘點=終點
三個指標隨輪數的變化(各自除以第 0 輪的值,所以都從 1 出發)
從第 0 輪按到第 3 輪:配對直線從交錯成一團變得幾乎互不相交,ODE 軌跡也跟著變直。第一輪就吃掉大部分的好處:straightness 從約 1.4 掉到 0.03、1 步 Euler 的誤差從約 1.4 掉到 0.1(十幾倍),運輸成本從約 4.0 掉到 0.6;第二、三輪只再擠出一點。同時終點分布與資料的距離一直在 0.01 以下(和第 0 輪的 0 相比可以忽略)——改善不是靠犧牲樣本品質換來的,這就是「保邊際」那條性質。