文字轉圖像 AI 模型如 Nano Banana、Stable Diffusion 和 Flux 的快速進步,已徹底改變創意設計領域,讓任何人都能從文字描述中合成出逼真、高擬真度的圖像。然而,引導這些龐大模型以滿足精確的使用者意圖、後續目標或嚴格的視覺限制,仍然是一個微妙且難以預測的平衡挑戰。
舉例來說,想像一下提示模型生成「一隻戴著太陽眼鏡的蜥蜴」,模型可能會生成一隻逼真的蜥蜴,但卻沒有戴太陽眼鏡。或者,強迫模型包含太陽眼鏡可能會扭曲蜥蜴的臉部,破壞圖像品質。
現有的圖像生成引導或微調方法非常不連貫。一方面,開發者使用推論時技術(例如,無分類器擴散引導)來調整文字提示的影響,並即時引導圖像生成過程。另一方面,他們依賴使用參數高效適配器(如 LoRA)、獎勵加權迴歸或策略梯度進行大量微調,以改變模型的行為。
由於這些工具歷來被視為獨立且不相關的修復方法,該領域一直缺乏一個統一、有原則的數學語言,來整合、分析和優化我們控制生成模型的方式。這種碎片化的方法常常迫使工程師在平衡使用者偏好與圖像品質時,只能依賴猜測。
為了解決這種平衡難題,我們提出了 Diffusion Controller 框架。它不將圖像生成視為一系列僵硬、孤立的步驟,而是將整個去噪過程重新定義為一個平滑、連續的控制問題。我們的結果顯示,Diffusion Controller 的輕量級附加網路在符合人類偏好方面,表現優於業界標準。
此外,其完全解鎖版本(即經過微調的模型,具有「白箱」或不受限制地修改內部模型權重的權限)比基準模型取得了 90% 的勝率。
Diffusion Controller 框架將圖像生成過程(AI 模型從隨機雜訊開始,逐步將其精煉成清晰圖像)視為一個平穩受控的旅程。想像一下基礎預訓練模型是一輛龐大而強大的摩托車;重建其核心引擎來改變其駕駛方式是低效且有風險的。相反地,Diffusion Controller 就像一個輕量級的轉向阻尼器,附加在摩托車上,而主模型(摩托車)則完全凍結且安全地保持不動。
Diffusion Controller 的核心機制(轉向阻尼器)不再需要猜測每一步如何引導生成,而是在圖像創建過程中動態調整生成軌跡。它平穩地重新校準模型的標準預設行為,為最大化使用者定義目標(例如實現藝術風格或上下文對齊)的方向賦予更多權重。
透過數學優化生成軌跡中帶有回饋的這些轉變,Diffusion Controller 框架達成了平衡,成功地引導模型生成過程符合新的使用者偏好,同時完全保留了基礎模型清晰的視覺圖像品質和底層穩定性。回到前面蜥蜴的例子,這意味著轉向阻尼器會引導模型確保包含太陽眼鏡,但懲罰護欄會啟動,以防止系統扭曲蜥蜴的自然鱗片和比例來實現這一點。
為了將這個理論上的控制問題轉化為實用的工具,我們將抽象且可能難以處理的方程式,橋接為兩種完全基於最終獎勵分數的高效微調方法:
方法一:策略梯度和 PPO(穩定優化器):這種方法透過計算出的增量調整,迭代地引導模型。它包含一個內建的「剪輯規則」,就像一個限速器,防止系統在模型行為中做出巨大、不穩定的改變,以確保訓練保持平穩和穩定。方法二:獎勵加權損失(捷徑):這作為一個直接的優化路徑。它會大力獎勵產生高品質結果的生成過程,提供數學保證,確保模型能夠可靠地學習生成使用者意圖的確切圖像類型。
Diffusion Controller 框架的運作方式就像一個轉向阻尼器,解決了一個巨大的現實商業問題。通常,要改變模型的行為,你需要「白箱」存取權限,才能深入其核心引擎並更改其內部設定。然而,世界上最好的圖像生成模型往往是企業機密(被稱為黑箱或灰箱)。
轉向阻尼器網路依賴於完美的圖像引導指令,這是基礎模型知識加上微小修正的組合。它在圖像清除靜態雜訊的過程中進行觀察,並注入精確、微小的轉向修正。這使得工程師即使在面對嚴格鎖定、閉源的模型時,也能完美控制和客製化,而無需觸碰底層程式碼。
我們使用 Stable Diffusion v1.4 作為骨幹模型,在三種微調機制下評估了 Diffusion Controller 框架的能力:監督式微調(SFT)、獎勵加權損失(RWL)和 PPO。效能是透過標準化的 HPS-v2 分數來衡量,以確定生成的圖像與使用者提示和美學選擇的符合程度。
我們在 Diffusion Controller 框架下實施了四種網路結構:Diffusion Controller:我們的轉向阻尼器網路,用於灰箱存取,以中間反向平均值作為輸入,並採用所提出的側邊適配器流。Diffusion Controller-Naive:轉向阻尼器網路的樸素設計,既沒有中間反向平均值,也沒有側邊適配器流。
Diffusion Controller-J:我們的白箱解決方案,透過聯合訓練轉向阻尼器網路和基礎模型。Diffusion Controller-S:另一種白箱解決方案,透過單獨訓練轉向阻尼器網路和基礎模型。
結果顯示,Diffusion Controller 在完全可存取的「白箱」環境和高度限制的「灰箱」環境中都表現出色,持續超越其對應的基準模型,並實現了更好的品質與效率權衡。
在 SFT 和 RWL 軌跡中,灰箱 Diffusion Controller 轉向阻尼器在 HPS-v2 勝率方面超越了 LoRA,這是一種最先進的參數高效白箱方法。這是一個重要的里程碑,因為 Diffusion Controller 在操作的內部模型層數遠少於 LoRA 的情況下達成了這一點。
此外,在全面的真人評估小組中,Diffusion Controller 在複雜的多屬性測試提示中,記錄了最佳的主觀品質和提示匹配結果。
該框架的一個核心特點是其運行時的靈活性。透過調整單一的推論時引導強度參數,使用者可以動態地增強或減弱控制約束的強度。這允許在不破壞基準圖像穩定性或引起舊有引導方法常見的視覺扭曲的情況下,即時進行平滑、細緻的提示對齊調整。
透過將數學控制與圖像生成模型結合,Diffusion Controller 彌合了純數學與現代創意工具之間的鴻溝。它不再依賴拼湊的猜測和快速修復來調整模型,而是提供了一個單一、數學上嚴謹的系統來引導圖像生成。最棒的是,它提供了一個實用、輕量級的「轉向阻尼器」藍圖,即使對於存取受限的閉源模型也能完美運作。
展望未來,這個統一的框架為研究開闢了令人興奮的新途徑。由於控制層與模型的核心引擎完全分離,未來的開發者可以將 Diffusion Controller 用於遠不止匹配文字提示的功能。眼前的下一步包括使用該框架來構建先進的個人化工具、開發強大的安全機制以幫助緩解有害內容的生成,以及調整轉向阻尼器網路以控制複雜的下一代影片模型。
我們要感謝來自 Google Research、Google DeepMind 和學術界的共同作者及合作者對這項工作的貢獻。



