現今,頂尖的 AI 實驗室都在競相開發能自我改進的模型。有人認為這是通往超級智慧最可靠的途徑,他們認為,當 AI 在一個令人驚嘆的循環中不斷自我提升時,最終將超越人類的理解(甚至可能超越人類的控制)。

這些聽起來都很棒,但我還有電子報要製作。我好奇遞迴式自我改進對我來說是否也有用。我能否利用 AI 來訓練並持續改進一個模型,以自動化電子報的一些繁瑣工作?

經過約一週的實驗,答案似乎是一個響亮且令人驚訝的「絕對可以」。更重要的是,涉足自我改進模型展現了 AI 發展的一種不同願景,一個不以少數幾家公司控制整個產業為中心的願景。

我首先嘗試了一個簡單的自我改進循環

為了牛刀小試,我嘗試從頭訓練一個小型語言模型,我的意思是,我把所有繁重的工作都丟給了 Claude。

我安裝了 AutoResearch,它能幫助現成的 AI 模型建立並改進一個較小的模型。AutoResearch 是 Andrej Karpathy 的心血結晶,他是一位明星級的 AI 研究員,曾協助創立 OpenAI、領導 Tesla 的 AI 工作,並最近加入了 Anthropic。

我啟動了 Claude,並給它推薦的指令:「嗨,看看 program.md,我們來開始一個新實驗吧!」當 Claude 處理這些困難工作時,我提供了硬體(一台 Nvidia DGX,專為 AI 實驗設計的桌上型「超級電腦」)、電力(連續幾天高溫運轉),以及一個可能不明智的意願,讓模型跳過所有常規的權限檢查來執行其任務(放手讓它做!)。

我每隔幾個小時就會查看 AutoResearch 專案的進度,並驚訝地看到 Claude 如何調整參數和訓練方案,觀察這如何改變小型模型的輸出,並進一步精煉它。

以下是當我提示它完成「In the beginning …」這句話時,那個小型語言模型的早期版本所產生的內容:「In the beginning of the beginning of the end of the end of the end end of end end end end end end end beginning end end end end…」。

這並不算出色。但後來由 Claude 自主改進的模型變得更加連貫,也較少出現瘋狂、無止盡的重複。它當然不是 GPT-5,但這展示了一條持續改進的潛力之路。

我的旅程繼續走向更複雜且更有用的方向

我已經在使用一個依賴 Claude 來幫助我尋找值得注意的研究論文的代理程式,所以我決定看看是否有可能建立一個超越此功能的系統。

我轉向了一家名為 Prime Intellect 的新創公司所提供的工具,該工具利用 AI 為特定任務訓練客製化模型。我收集了大約 100 篇以前電子報中「AI 前沿的其他資訊」欄目的內容,這些是主文章後面的研究片段。然後,我建立了一個 Prime Intellect 訓練環境,並請 Claude 幫助我建立自己的模型,Claude 將其命名為 Frontier_Paper_Curator,用於尋找和摘要有趣的研究論文。

Claude 找到了更多論文,並生成了大量合成資料來協助訓練。接著,它又利用另一個模型來評估 Frontier_Paper_Curator 的輸出,同時訓練環境也透過強化學習來改進該模型。

Prime Intellect 的執行長 Vincent Weisser 告訴我,他的公司旨在讓遞迴式自我改進普及化,而不僅限於頂尖實驗室。Prime Intellect 最近獲得了 1500 萬美元的資金。Weisser 表示,頂尖實驗室的模型可能非常出色,但普及這種 AI 訓練也能產生同樣強大的專用模型。

Weisser 說:「讓每家公司都能使用前沿的訓練基礎設施,市場的集體創造力將釋放出比任何少數實驗室所能達到的更多潛力。」「我們不想要一個中心化、近乎神一般的智慧,我們想要數十億個智慧,它們進入所有利基市場,創造出美好的事物。」

Prime Intellect 並不是唯一一家如此看待未來的公司。另一家新創公司 Adaption 提供了一款名為 AutoScientist 的工具,可自動化 AI 模型訓練。執行長 Sara Hooker 表示,Adaption 正在與幾家消耗大量 token 但缺乏內部 AI 專家的公司合作。

當 Anthropic 決定阻止對其最新模型 Fable 5 的某些請求時,這暴露了過度依賴單一前沿模型的風險。一些高階主管,例如 Palantir 的 Alex Karp,也曾警告說,使用頂尖實驗室的服務也意味著交出自己的資料和對技術的控制權。

遞迴式自我改進的最終目標是讓 AI 能將新穎的想法應用於模型,並產生自己的見解。我們這些普通人可用的工具雖然較為有限,但仍然令人印象深刻。與 Prime Intellect 合作不到一天,我就成功建立了一個出乎意料地擅長尋找和摘要研究的模型。以下是它為我創建的一個範例條目:

科大訊飛(iFLYTEK)的研究人員開發了 iFLYTEK-Embodied-Omni,這是一個統一的多模態 AI 模型,將視覺、語言和動作生成整合到單一框架中。與以往將視覺理解、未來狀態預測和動作生成分開處理的具身代理不同,他們的模型使用共享的多模態自注意力機制,實現了視覺-語言「高階大腦」與動作生成「低階小腦」之間的緊密協調,類似於大腦與小腦的協作。

這種方法減少了級聯管線中常見的錯誤累積和介面瓶頸。透過在包含人類和機器人標註的具身影片及圖像-文字資料的大型多樣化資料集上進行訓練,並採用分階段訓練策略,他們展示了一個能夠進行聯合推理、預測和控制的通用具身代理。這為更整合、多功能的機器人 AI 系統貢獻了一種新穎的架構和訓練範式。

對於第一次嘗試來說,這還不錯。新模型仍然有點過於熱情,選擇了太多我會跳過的論文,而且其摘要也有些過於籠統。但這是一個充滿希望的開始。希望有一天我能用它來把我從繁瑣工作的束縛中解放出來。

本文為 Will Knight 的 AI Lab 電子報內容。您可以在此閱讀先前的電子報。