不靠 CFG、DMD、GAN、Drifting 和MeanFlow,如何訓(xùn)練一步生成模型?
不靠CFG、DMD、GAN、Drifting和MeanFlow,如何訓(xùn)練一步生成模型?,算法
只做一次生成器前向,就能得到一張圖,這是一步生成追求的效率。但想把采樣步數(shù)降到 1,難題其實在訓(xùn)練端:怎樣用足夠穩(wěn)定、簡單的監(jiān)督信號,讓生成分布靠近真實分布?
(資料圖片僅供參考)
現(xiàn)有路線各有結(jié)構(gòu)性取舍:
- 自回歸、擴(kuò)散和流匹配(Flow Matching)模型擴(kuò)展性強(qiáng),但前者需按順序或尺度解碼,后兩者沿噪聲 — 數(shù)據(jù)路徑反復(fù)調(diào)用網(wǎng)絡(luò),都會增加推理時間。
- 生成對抗網(wǎng)絡(luò)(GAN)天然支持單次前向推理,但學(xué)習(xí)信號來自同步訓(xùn)練的判別器,極小極大優(yōu)化較敏感。
- 一致性模型(Consistency Models)和分布匹配蒸餾(Distribution Matching Distillation,DMD)可以壓縮采樣步數(shù),但通常需要噪聲 — 時間監(jiān)督、一致性約束、教師或輔助估計器;DMD 同時依賴固定擴(kuò)散教師與在線生成分布的 score(對數(shù)密度梯度),擴(kuò)展到較大模型時還需要更多穩(wěn)定化技巧。
這些路線各有優(yōu)勢,TBSM 并不是要簡單否定它們。它把問題改寫成了一句更直接的話:能不能訓(xùn)練一個小模型,直接告訴每個生成樣本 “該往哪里走”?
- 論文標(biāo)題:THREE-BODY SCATTERING FOR GENERATIVE MODELING
- 論文鏈接:https://arxiv.org/abs/2607.18198
- 項目主頁與代碼:https://github.com/sp12138/TBSM
具體來說,TBSM 在線訓(xùn)練一個輕量級 Tracker,學(xué)習(xí)從當(dāng)前生成分布到真實分布(Fake-to-Real)的轉(zhuǎn)移場。對每個生成樣本,Tracker 都會獨立地給出一個移動方向,生成器只需回歸樣本沿該方向移動后的位置。
面對約 800M 的像素擴(kuò)散 Transformer 模型 PixelDiT-XL/16,單個 Tracker 僅有 30M 參數(shù)不到,且只在訓(xùn)練時使用。ImageNet-256 上,TBSM 的潛空間和像素空間模型在推理時前向次數(shù)(number of function evaluations,NFE)為 1 時,分別達(dá)到 Fréchet Inception Distance(FID,越低越好)1.63 和 2.23。
視頻鏈接:https://mp.weixin.qq.com/s/0MFfONowxYytCSTB7PQ9tA
TBSM 方法介紹視頻:三樣本散射事件產(chǎn)生 Fake-to-Real 局部方向,Tracker 學(xué)習(xí)這些方向的期望,引導(dǎo)生成器最終實現(xiàn) NFE=1。
TBSM 一步生成樣例
從左到右依次為 MNIST、Fashion-MNIST、CIFAR-10、像素空間 ImageNet-1K,以及 20B 文生圖模型的生成結(jié)果。
Fake-to-Real 轉(zhuǎn)移場
(即 Tracker 的學(xué)習(xí)目標(biāo))從哪里來?
算法 1:基礎(chǔ)三體散射回歸
算法 1:三樣本事件現(xiàn)場給出移動方向,即瞬時三體散射方向,生成器回歸凍結(jié)后的目標(biāo)位置。
不使用 Tracker 時,這就是瞬時散射(Instant Scattering)。嚴(yán)格來說,凍結(jié)回歸在當(dāng)前參數(shù)處的期望梯度與能量距離梯度一致,但單個即時方向只是該條件期望的一個帶噪估計。使用 Tracker 的跟蹤散射(Tracked Scattering)則把瞬時散射方向作為在線標(biāo)簽,學(xué)習(xí)更穩(wěn)定的方向場。
Tracker 如何學(xué)習(xí)穩(wěn)定的 Fake-to-Real 轉(zhuǎn)移場?
單個三樣本事件很便宜,但方差較大;換一組真實源和生成源,同一投射體可能收到不同方向。Tracker 學(xué)習(xí)的正是這些隨機(jī)觀測在給定位置和條件下的平均方向,而不是像 GAN 判別器那樣判斷真假。
算法 2:完整 TBSM 訓(xùn)練循環(huán)
兩個參數(shù)組成的方法設(shè)計圖
TBSM 的 rho-lambda 設(shè)計圖
像素空間圖像 Transformer JiT(Just image Transformers)的 B 規(guī)模配置 JiT-B 短程實驗。Drift 是 Drifting Models 的圖中簡稱;圖中 Inception Score(IS)越高越好。四個角點依次對應(yīng)類 Drift、Tracked Scattering、擴(kuò)散相關(guān)和類 GAN 的結(jié)構(gòu)聯(lián)系。擴(kuò)散式訓(xùn)練還需要配對噪聲輸入、時間條件和相應(yīng)目標(biāo)。
算法 3:一個直觀的視角去看 TBSM 能學(xué)到什么
算法 3:TBSM 的 “類 GAN” 位移類比
從算法 3 和傳統(tǒng)風(fēng)格遷移的視角看,也可以把 Fake 和 Real 理解成兩種不同的 “風(fēng)格”:Tracker 學(xué)習(xí)二者之間的轉(zhuǎn)移,再指導(dǎo)生成器產(chǎn)生新的 Fake;新的 Fake 又定義下一輪轉(zhuǎn)移場,形成迭代循環(huán)。這提供了一種直觀、與 GAN-like learned field 相近的理解視角。
從理論落到高維圖像
像素歐氏距離未必對應(yīng)圖像語義距離,因此 TBSM 將散射搬到凍結(jié)的圖像表征空間:真實圖像、生成投射體和生成源經(jīng)過凍結(jié)編碼器后計算方向與損失,梯度只沿投射體分支回到生成器,源特征保持停止梯度。多個表征空間分別形成損失后再聚合。
像素生成器的輸出可直接進(jìn)入表征網(wǎng)絡(luò);潛空間生成器則先通過凍結(jié)解碼器還原圖像。訓(xùn)練結(jié)束后,Tracker 和額外表征分支都可移除,只保留生成器及潛空間模型原有的解碼器。
單步的 ImageNet 與文生圖結(jié)果
下表中的 FID 越低越好,Inception Score(IS)越高越好。所有 ImageNet 指標(biāo)均由 50,000 張生成圖像計算,并使用訓(xùn)練集參考統(tǒng)計量;TBSM 的訓(xùn)練和推理均不使用 CFG(Classifier-Free Guidance)。擴(kuò)散 Transformer(DiT)先生成潛空間表示再解碼,PixelDiT 和 JiT 則直接輸出圖像。
將原本為多步采樣訓(xùn)練的 DiT-XL/4 直接限制為 NFE=1 時,F(xiàn)ID 為 398.20;這只反映不適配的單步運(yùn)行方式,不代表正常多步采樣的質(zhì)量。經(jīng)過 TBSM 訓(xùn)練后,同一架構(gòu)達(dá)到 1.92。
文生圖實驗從預(yù)訓(xùn)練的 20B 參數(shù) Qwen-Image 初始化,隨后只用 TBSM 更新生成器和 Tracker。
TBSM 后訓(xùn)練的20B參數(shù)文生圖模型上的一步生成樣例
討論與展望
結(jié)語
TBSM 的核心是從能量距離得到 “真實吸引 — 生成自交互” 的局部方向,再讓 Tracker 學(xué)習(xí)其條件均值。訓(xùn)練完成后,輔助網(wǎng)絡(luò)退出,生成器只需一次前向;它展示了把分布距離轉(zhuǎn)化為高維生成器可直接學(xué)習(xí)的樣本級運(yùn)動監(jiān)督的一條路徑。
項目狀態(tài):目前已開放 MNIST 最小實現(xiàn) 和 ImageNet-1K 訓(xùn)練、評測代碼;后續(xù)還計劃發(fā)布 Qwen-Image-20B 文生圖模型的權(quán)重和訓(xùn)練代碼。
作者介紹:本文第一作者是西湖大學(xué)與浙江大學(xué)聯(lián)合培養(yǎng)的三年級博士生孫鵬,研究興趣是簡單有效的生成式AI的訓(xùn)練與推理加速框架。未來希望能在世界模型和視頻生成上繼續(xù)找到合適的 合作者/Mentor 并做出更多有影響力的工作。









營業(yè)執(zhí)照公示信息