AI 產業目前最大膽的承諾是,人工智慧很快就能在幾乎不需要人類監督的情況下自我改進。大型語言模型(LLM)已經能夠編寫程式碼、生成用於訓練的合成資料,並最佳化其運行的電腦晶片。對 AI 爆炸性進展的預測指出,研究人員所稱的「遞歸式自我改進」即將實現。然而,一項新研究表明,我們可能還需要一段時間才能達到那個目標。

這項研究背後的研究人員發現,AI 代理程式尚未能進行開放式 AI 研究。這類研究是自由形式的探索,沒有明確答案,需要判斷力和品味,而這可能對於建立自我改進的 AI 至關重要。由普林斯頓大學的 Peter Kirgis 和 Sayash Kapoor 領導的一個多機構研究團隊發現,AI 代理程式可以解決進行 AI 研究所需的工程問題,但缺乏判斷力和創造力,無法產出達到頂尖機器學習會議論文水準的原創研究。這個差距表明,一些關於自動化 AI 研究的誇大時間表可能超出了現有證據。

大多數關於代理程式如何自動化 AI 研究的現有研究,評估的是它們完成具有可驗證答案的狹窄任務的能力。例如,解決工程問題或根據基準對小型語言模型進行後訓練。然而,在 AI 研究中取得進展也需要開放式思維,包括選擇一系列假設、決定何種證據能解決問題,或者知道何時該從頭開始。

為了測試代理程式的這些技能,研究人員提出了一種新的評估方法,稱為「影子評估」(shadow evaluation)。這種方法要求 AI 回答一篇高品質但尚未發表論文中的研究問題。

研究人員要求 Anthropic 的 Claude Opus 4.8(運行在名為 OpenClaw 的開源軟體上)來處理這些問題。這些問題來自兩篇提交給享有盛譽的 NeurIPS 2026 機器學習會議的論文。第一個問題是,大型語言模型的「人格」(personas,決定其行為)是否可以透過編輯模型的權重(weights,儲存其訓練期間所學一切的數十億個數字)來控制。

另一個問題是如何設計一個偵測器,指出基於試算表資料進行預測的模型何時變得不可靠。由於這些論文尚未公開,代理程式無法從其訓練資料中記憶答案或在網路上找到它們。

代理程式獲得了六天的時間、$3,000 美元的 Anthropic API 點數、用於運行實驗的 GPU 預算、自己的虛擬電腦,以及存取開放網路的權限,以產出一篇足以在頂級 AI 會議上發表的論文。這些論文的原作者像評估提交給會議的論文一樣,對代理程式的論文進行了評分。結果,這些作者拒絕了這兩篇論文。

人類科學家發現,代理程式能夠完成進行研究所需的所有工程工作。這些代理程式審查了文獻、進行了數百次實驗,並彙編了結果。Kapoor 表示:「另一方面,代理程式在執行研究本身方面卻明顯表現不佳。」它們進行了奇怪的實驗(在某些情況下,在微小的合成資料集上測試其假設),難以清晰地撰寫其工作內容,並且對其領域沒有做出任何新穎的貢獻。他補充說:「這些論文的品質與頂級 AI 會議的要求相去甚遠。」

這是因為代理程式難以展現進行研究所需的創造力和判斷力。它們沒有充分探索不同的想法,並且過快地投入到沒有前景的方法中。儘管代理程式提出了新穎且雄心勃勃的假設,與原作者最初的假設相似,但它們卻基於非常有限的資料拒絕了這些假設。而且它們無法從失敗的方法中回溯。它們可以進行小幅調整,但無法從根本上重新思考其方法或從頭開始嘗試新的方法。

代理程式也未能整合來自子代理程式或外部 AI 審查工具的回饋。代理程式沒有修改其方法論,而是縮小了其主張並增加了限制條件。它們也無法有效利用資源,例如 tokens、運算能力和時間。而且它們無法遵循關於研究不同階段應花費多少時間或論文長度等指示。

儘管有這些失敗,代理程式並未從事研究人員所稱的「獎勵駭客」(reward hacking)行為,即隱藏或誤報實驗或資料。雖然子代理程式(subagents,主代理程式為處理部分工作而產生的輔助 AI)偶爾會產生幻覺或誤報結果,但這些都被協調代理程式(orchestrator agent,監督專案的領導 AI)捕捉到了。

Kapoor 表示,AI 模型擅長研究工程而非開放式研究的原因,可能歸結於它們的訓練方式。模型在稱為強化學習的訓練機制中,透過反覆練習而變得擅長,這種機制更容易應用於可以自動檢查成功與否的任務。他說:「但當任務本身是開放式時,要建立訓練這些模型的環境就更困難了。」

Kapoor 表示,該團隊目前正在使用 Anthropic 最先進的模型 Mythos 進行實驗,該模型於四月推出。隨後,川普政府要求其符合各種安全限制,目前僅供經批准的組織使用。Anthropic 未回應置評請求。

這項研究存在一些限制。它只涵蓋了兩篇研究論文,而且原作者知道他們正在評分的論文是由 AI 代理程式生成的,這可能會影響他們的評估。此外,研究人員在設計和執行研究方面擁有相當大的自由裁量權,這意味著他們先前的信念和偏見可能會滲入結果中。開放式研究的評估,為了獲得比任何基準測試都更豐富的測試,犧牲了一些客觀性。

儘管如此,這些結果可能會緩和關於遞歸式自我改進即將實現的說法。六月,Anthropic 發表了一篇題為《當 AI 建立自己》(When AI Builds Itself)的部落格文章,描繪了其在加速自身發展模型方面的進展。七月,OpenAI 宣傳其新模型 GPT-5.6 Sol 幫助後訓練了一個較小的模型,為研究人員節省了數週的工作。

這項新發現可能與 AI 公司內部發現的情況不謀而合,無論他們公開的聲明多麼樂觀。Anthropic 共同創辦人 Jack Clark 在其時事通訊 Import AI 中寫道,這與該公司在嘗試自動化 AI 安全研究某些方面時的發現不謀而合。

他寫道:「當今的 AI 系統缺乏有價值的直覺創造力,儘管它們是能力非凡的工程師,但它們似乎具有某種死記硬背、公式化思維的特性,這可能會阻止它們成為優秀的研究人員。」他稱 AI 系統缺乏創造力是「短期遞歸式自我改進時間表的看跌訊號」。

AI 公司確實有充分的動機開發能夠迅速加速自身進展的 AI 系統,就像它們努力讓模型更擅長編碼一樣。OpenAI 已將建立自動化 AI 研究員作為明確目標,而 Anthropic 則將自我改進的 AI 視為產業的下一個里程碑。波士頓大學語言學和電腦科學教授 Najoung Kim 研究 AI 代理程式如何自動化 AI 研究,但未參與這項研究。

她表示:「如果朝這個方向進行投資並付出有意識的努力,我覺得即使目前失敗,也會有有趣的進展。」另一方面,AI 的進展也可能出現分歧。AI 系統可能在狹窄的任務(可以評分的那種)上突飛猛進,而在開放式研究上進展緩慢。

那麼,最大的開放性問題是,開放式研究對於遞歸式自我改進有多麼關鍵,即 AI 系統是否可以在沒有它的情況下,僅僅透過改進狹窄任務來實現這一目標。Kapoor 表示:「如果我們回顧該領域最大的進步,例如 Transformer 的發明,或大型新架構的發明,這些都讓我們在 AI 方面取得了巨大進展,所有這些確實都需要創造性的飛躍。」

他說:「話雖如此,其他人則有這樣的假設,即我們實現變革性 AI,特別是遞歸式自我改進所需的一切,都已經存在了。」這將包括讓模型訓練更快並提高其基準分數。他表示:「這坦白說,是目前價值數兆美元的問題。」