影片擴散模型在生成高擬真影片方面取得了顯著進展,能在幾秒內渲染逼真場景。然而,儘管擴散模型能生成高擬真影片片段,但將其轉化為連貫的長篇故事引擎仍具挑戰。
大多數現有的代理管道透過鏈式模組自動化此過程,但由於獨立且手工製作的提示詞,常出現語義漂移(角色服裝或場景在不同鏡頭間的細微變化)和級聯故障(例如,上游資產瑕疵破壞下游影片合成)。由於早期錯誤會傳播並破壞長期的連貫性,此過程通常需要大量手動介入。
從結構角度來看,這反映了經典的歸因問題,因為最終故障很難追溯到特定的提示詞。此外,現有方法還存在特徵漂移(實體和環境無意中逐漸改變)或內容崩潰(敘事未能有意義地推進)的問題。
今天,我們介紹一項關於 AI 影片協同導演的研究,這是一個統一的多代理框架,明確規劃多鏡頭敘事中的視覺連續性。該框架作為 Gemini 和 Veo 之上的協調層,原生繼承了 SynthID 浮水印等安全機制。透過將長篇生成視為全球最佳化和世界狀態追蹤問題,我們開發了一套框架,Co-Director (將於 COLM 2026 發表)、CANVAS (將於 EMNLP 2026 發表)、A²RD 和 VQQA,將高層次的人類創意規格轉化為執行,自動化重複的協調任務,從多模型提示和鏡頭鏈接到閉環視覺精修。
我們設計這些框架,使其能作為反應靈敏的創意夥伴,抽象化維持視覺連續性的負擔,讓使用者能專注於故事敘述的藝術。這種架構透過將品質建模為測試時目標,將創意合成與一致性解耦。在全面的評估中,我們的框架在多鏡頭敘事一致性和角色持久性方面展現了顯著提升,成功生成了數分鐘長的影片,同時減輕了視覺漂移和管道錯誤傳播。
為了解決長篇影片的多面向問題,我們將研究分解為四個基礎支柱,每個支柱都解決了生成管道中的特定瓶頸。
為確保整個影片的語義連貫性,我們提出了 AI 影片協同導演,這是一個將影片故事敘述形式化為全球最佳化問題的分層多代理框架。我們引入了分層參數化,而非依賴僵硬的線性提示鏈:一個多臂吃角子老虎機 (MAB) 全局識別有前景的創意方向。這將創意過程形式化為在探索新穎敘事策略與利用有效創意配置之間尋求最佳平衡的搜尋。
系統會取樣抽象的創意軌跡,例如將資訊策略與小插曲敘事模式和特定美學原型結合,並將這些動態注入子代理的系統提示中。這種由上而下的引導確保了整個管道在統一的願景下運作。
由於我們的 AI 影片協同導演框架作為協調層運作,它透過將這些結構化提示直接輸入基礎的 Gemini 和 Veo 模型來實現這一願景(儘管其模型不可知架構使其能夠置於任何基礎生成模型之上)。這種架構確保所有生成的圖像、影片和音訊都固有地帶有原生安全保護,包括 SynthID 浮水印。
對於生產,可以在最終影片上應用額外的安全分類器,以防止單獨安全的片段之間產生意外的上下文互動。該管道透過兩個相互連接的循環執行全球最佳化:策略引導和多階段生產。首先,協調代理使用 MAB 演算法評估輸入,以在三個維度上選擇創意配置:(1) 創意策略(意圖)、(2) 敘事模式(故事結構)和 (3) 美學原型(視覺基調和電影攝影)。
此配置驅動生產層次結構。預生產代理將簡短的逐場故事情節和視覺資產合成為統一的分鏡腳本。然後,生產代理使用專門的子代理將此分鏡腳本轉化為具體的視聽媒體:關鍵影格代理錨定角色和場景視覺,影片代理添加動作,音訊代理疊加匹配的旁白和配樂。最後,一個多模態大型語言模型 (MLLM) 判斷器會根據三個指定維度評估編譯後的剪輯,將分解後的獎勵訊號回饋給 MAB,以在連續的生成循環中迭代精煉和最佳化選擇。
即使有統一的腳本,生成長序列鏡頭也常導致角色漂移和不穩定的環境。為解決此問題,我們引入了 CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding),這是一個明確規劃多鏡頭敘事中視覺連續性的多代理框架。CANVAS 透過在敘事演進過程中維持角色、位置和物體狀態的結構化表示來強制執行連貫性。
CANVAS 作為 Gemini 之上的協調層,依賴於持久的視覺記憶。透過從記憶中檢索視覺錨點或在需要時初始化新錨點,CANVAS 確保在相同設定內的平滑過渡。這種明確的世界狀態建模確保角色保留其身份,環境在重新訪問時保持其空間結構。為了實際展示這些功能,下圖展示了一個多鏡頭博物館搶劫序列,將 CANVAS 與代表性基準進行比較:使用底層基礎模型 (Gemini-3.1-Pro) 的直接生成和另一個多代理框架 (AutoStudio)。
圖底部的提示詞突出了必須保持相同視覺特徵的重複元素,例如,竊賊、展覽廳和寶石。請注意每種方法如何處理連續過渡(例如,角色的服裝)與非連續過渡(例如,攝影機在繞道後返回主廳)。單獨使用 Gemini-3.1-Pro 生成會出現道具不一致(文物改變)和背景漂移(房間佈局移動),顯示了無引導生成的局限性。
AutoStudio 在剪輯之間也會退化,導致角色漂移(竊賊的帽子消失)和背景不一致。相比之下,CANVAS 的持久視覺記憶確保角色、空間幾何和物體狀態在整個敘事中保持完美連貫。
為將分鏡腳本轉化為實際數分鐘長的影片,我們開發了 A²RD,這是一種代理式自迴歸影片生成架構。A²RD 具有逐段生成功能,並輔以多模態影片記憶,可追蹤片段上下文和動態。對於每個片段,它在檢索-合成-精煉-更新循環中運作。此循環的關鍵部分是代理如何自適應地確定片段生成模式。
它在外推(允許自然敘事進展)和內插(將片段錨定到現有實體和環境)之間平穩切換。這有效地平衡了故事向前推進的需求與維持場景物理現實的必要性。
為測試此系統,下方十分鐘的影片展示了長篇生成,這要求在數分鐘長的時間間隔內保持一致的敘事進展。影片強調了系統如何在兩種操作模式之間動態切換:使用外推將情節推向新的敘事節拍,以及使用內插將返回的角色和環境錨定到其原始設計。雖然標準影片生成器會出現嚴重的視覺衰退,角色變異和位置變形,A²RD 會持續查詢其多模態影片記憶,以從開場鏡頭到最終畫面維持角色身份、服裝細節和結構幾何。
最後,我們需要一種方法讓系統自主識別並修復視覺瑕疵。現有的測試時最佳化方法通常要麼計算成本高昂,要麼需要白盒存取模型內部。為解決此問題,我們開發了 VQQA (Video Quality Question Answering),這是一個統一的多代理框架,可泛化應用於多種輸入模態和影片生成任務。
VQQA 動態生成針對特定提示詞量身定制的視覺問題,並使用由此產生的視覺語言模型 (VLM) 評論作為語義梯度(提供自然語言方向性回饋以引導迭代精煉,類似於反向傳播中的數值梯度)。這取代了傳統的被動評估指標,提供了人類可解釋、可操作的回饋。
然後,系統可以透過自然語言介面執行高效的迭代回饋循環(模型生成影片,透過視覺問題評估,並根據評論精煉文字提示詞)。為防止在此精煉過程中出現語義漂移,VQQA 採用了全局選擇機制:VLM 全局評分器會評估最佳化軌跡中生成的每個影片與原始未編輯提示詞的符合度,而不是盲目採用最終迭代的輸出。然後系統選擇得分最高的候選,確保局部修正不會損害更廣泛的上下文。
實際上,VQQA 作為黑盒提示詞最佳化器運作,而非像素級編輯器。它不是直接修改像素,而是迭代精煉文字提示詞以修正高層次的構圖缺陷,例如屬性綁定錯誤或不一致的角色屬性。這個更新後的提示詞引導生成器在其潛在空間中取樣一條新路徑。在下面的範例中,VQQA 不會遮罩或繪製原始影格;相反,它透過將逼真的 Mylar 氣球紋理渲染到嚴格的長方體幾何上,解決了模型的材質綁定問題,並透過讓小提琴手和鋼琴手在不同剪輯中始終錨定到各自的樂器,修正了混亂的表演中樂器更換的問題。
為嚴格評估我們的框架,我們開發了三個專門的基準,旨在反映專業影片製作的挑戰。


