AI 自我改進的概念一直是近期研究領域的熱門話題,大量論文湧現,OpenAI 執行長 Sam Altman 等知名人物也對自我演化的智慧系統未來發表看法。現在,麻省理工學院(MIT)的一篇新論文《自我適應語言模型》(Self-Adapting Language Models)介紹了 SEAL(Self-Adapting LLMs),這是一個新穎的框架,允許大型語言模型(LLMs)更新自己的權重。
這項發展被視為實現真正自我演化 AI 的又一重要里程碑。這篇研究論文於昨日發表,已在 Hacker News 等平台引發廣泛討論。SEAL 提出一種方法,讓 LLM 能透過「自我編輯」生成自己的訓練資料,並根據新的輸入更新其權重。關鍵在於,這個自我編輯過程是透過強化學習(reinforcement learning)來學習的,其獎勵機制與更新後模型的下游任務效能掛鉤。
鑑於近期 AI 自我演化相關興趣的激增,這篇論文的發表時機顯得格外引人注目。本月初,其他幾項研究也獲得關注,包括 Sakana AI 和不列顛哥倫比亞大學的「Darwin-Gödel Machine (DGM)」、卡內基美隆大學(CMU)的「Self-Rewarding Training (SRT)」、上海交通大學用於多模態大型模型持續自我改進的「MM-UPT」框架,以及香港中文大學與 vivo 合作的「UI-Genie」自我改進框架。
此外,OpenAI 執行長 Sam Altman 最近在他的部落格文章《溫和奇點》(The Gentle Singularity)中,分享了他對未來自我改進 AI 和機器人的願景。他認為,雖然最初數百萬個人形機器人需要傳統製造,但它們隨後將能夠「營運整個供應鏈來製造更多機器人,這些機器人又可以反過來建造更多的晶片製造廠、資料中心等等。」
此言論迅速引發了 @VraserX 的推文,聲稱有 OpenAI 內部人士透露該公司內部已在運行遞歸自我改進的 AI,這一說法引發了關於其真實性的廣泛爭議。無論 OpenAI 內部發展的具體情況如何,麻省理工學院關於 SEAL 的論文為 AI 朝向自我演化進程提供了具體證據。
深入理解 SEAL:自我適應語言模型SEAL 的核心思想是讓語言模型在遇到新資料時,能透過生成自己的合成資料並透過自我編輯來優化其參數,從而改進自身。模型的訓練目標是利用模型上下文提供的資料,直接生成這些自我編輯(SEs)。這些自我編輯的生成是透過強化學習來學習的。
當生成的自我編輯被應用後,若能提高目標任務的效能,模型就會獲得獎勵。因此,SEAL 可以被視為一個具有兩個嵌套迴圈的演算法:一個外部強化學習(RL)迴圈,用於優化自我編輯的生成;一個內部更新迴圈,利用生成的自我編輯透過梯度下降(gradient descent)來更新模型。
這種方法可以被視為元學習(meta-learning)的一個實例,其重點在於如何以元學習的方式生成有效的自我編輯。一個通用框架SEAL 針對單一任務實例 (C,τ) 運作,其中 C 是與任務相關的上下文資訊,τ 則定義了用於評估模型適應能力的下游評估。
例如,在知識整合任務中,C 可能是一段要整合到模型內部知識的文本,而 τ 則是一組關於該文本的問題。給定 C,模型會生成一個自我編輯 SE,然後透過監督式微調(supervised fine-tuning)來更新其參數:θ′←SFT(θ,SE)。
強化學習用於優化這個自我編輯的生成:模型執行一個動作(生成 SE),根據 LMθ′ 在 τ 上的效能獲得獎勵 r,並更新其策略以最大化預期獎勵。研究人員發現,GRPO 和 PPO 等傳統線上策略方法會導致訓練不穩定。他們最終選擇了 ReST^EM,這是一種來自 DeepMind 論文的、更簡單、基於過濾的行為複製方法。
這種方法可以被視為一個期望最大化(EM)過程,其中 E 步驟從當前模型策略中採樣候選輸出,而 M 步驟則僅透過監督式微調來強化那些產生正向獎勵的樣本。論文還指出,雖然目前的實作使用單一模型來生成和學習自我編輯,但這些角色可以在「師生」設定中分離。
在特定領域實例化 SEAL麻省理工學院團隊在兩個特定領域實例化了 SEAL:知識整合和小樣本學習。知識整合:目標是將文章中的資訊有效整合到模型的權重中。小樣本學習:這涉及模型以極少的範例適應新任務。實驗結果小樣本學習和知識整合的實驗結果都證明了 SEAL 框架的有效性。
在小樣本學習中,使用 Llama-3.2-1B-Instruct 模型,SEAL 顯著提高了適應成功率,達到 72.5%,而使用基本自我編輯但未經 RL 訓練的模型僅為 20%,未經適應的模型則為 0%。儘管仍低於「Oracle TTT」(一個理想化的基準),這表明取得了實質性進展。
對於知識整合,使用更大的 Qwen2.5-7B 模型來整合來自 SQuAD 文章的新事實,SEAL 始終優於基準方法。使用基礎 Qwen-2.5-7B 模型合成生成資料進行訓練已顯示出顯著改進,隨後的強化學習進一步提升了效能。準確度在外部 RL 迭代中也顯示出快速提升,通常在僅兩次迭代內就超越了使用 GPT-4.1 生成資料的設定。
論文中的定性範例說明了強化學習如何導致生成更詳細的自我編輯,從而提高效能。儘管前景看好,研究人員也承認 SEAL 框架存在一些限制,包括與災難性遺忘、計算開銷和上下文相關評估等方面的問題。這些在原始論文中都有詳細討論。原始論文:https://arxiv.org/pdf/2506.10943專案網站:https://jyopari.github.io/posts/sealGitHub 儲存庫:https://github.com/Continual-Intelligence/SEAL


