歡迎來到 Import AI,一份關於 AI 研究的電子報。Import AI 的內容基於 arXiv 論文和讀者回饋。如果您想支持我們,請訂閱。

AI 系統即將開始自我建構。這意味著什麼?

我撰寫這篇文章,是因為綜合所有公開資訊後,我不得不抱持一個觀點:有很高的可能性(60% 以上),在 2028 年底前,將出現「無人參與的 AI 研發」,即一個強大到足以自主建構其繼任者的 AI 系統。

這是一件大事。

我不知道該如何理解它。

這是一個不情願的觀點,因為其影響過於巨大,讓我感到渺小,而且我不確定社會是否已準備好迎接自動化 AI 研發所帶來的各種變革。

我現在相信,我們正處於 AI 研究將實現端到端自動化的時代。如果這成真,我們將跨越盧比孔河,進入一個幾乎無法預測的未來。稍後將詳細說明。

本文旨在闡述我認為全面自動化 AI 研發即將發生的原因。我會討論其部分後果,但主要篇幅將用於探討支持此信念的證據,並將在 2026 年大部分時間裡深入探討其影響。

就時程而言,我不預期這會在 2026 年發生。但我認為我們可能在一兩年內看到「模型端到端訓練其繼任者」的範例,當然,這會是非前沿模型的概念驗證,儘管前沿模型可能更困難(它們昂貴許多,且是許多人類極度努力的成果)。

我的推論主要來自公開資訊:arXiv、bioRxiv 和 NBER 上的論文,以及觀察前沿公司在全球部署的產品。從這些數據中,我得出結論,目前所有條件都已具備,足以自動化當今 AI 系統的生產,即 AI 開發的工程組成部分。如果規模化趨勢持續,我們應準備好迎接模型變得足夠有創意,能夠取代人類研究員提出新穎研究路徑的創意想法,從而自行推動前沿發展,並完善現有知識。

事前聲明

在本文大部分內容中,我將嘗試從許多個別基準測試中發生的事情,拼湊出 AI 進展的全貌。正如所有研究基準測試的人所知,所有基準測試都有其獨特的缺陷。對我而言,重要的是透過綜合所有這些數據點所呈現的總體趨勢,您應該假設我已了解每個個別數據點的缺點。

現在,讓我們一起檢視一些證據。

程式碼奇點,能力隨時間演進:

AI 系統透過軟體實例化,而軟體則由程式碼構成。

AI 系統徹底改變了程式碼的生產方式。這歸因於兩個相關趨勢:AI 系統在撰寫複雜的真實世界程式碼方面變得更出色,以及 AI 系統在無需人類監督下,將多個線性程式碼任務(例如,撰寫程式碼,然後進行測試)串聯起來的能力大幅提升。

兩個能體現這一趨勢的例子是 SWE-Bench 和 METR 的時間範圍圖。

解決真實世界的軟體工程問題:

SWE-Bench 是一個廣泛使用的程式碼測試,用於評估 AI 系統解決真實世界 GitHub 問題的能力。SWE-Bench 於 2023 年底推出時,當時的最佳成績是 Claude 2,其整體成功率約為 2%。而 Claude Mythos Preview 達到了 93.9%,幾乎使該基準測試飽和。

(所有基準測試都帶有一定程度的固有雜訊,因此通常會有一個點,當您得分夠高時,您遇到的會是基準測試本身的限制,而非您方法的限制,例如,ImageNet 驗證集中約有 6% 的標籤是錯誤或模稜兩可的)。

SWE-Bench 是衡量程式碼能力和 AI 對軟體工程影響的可靠指標。我在前沿實驗室和矽谷遇到的大多數人,現在完全透過 AI 系統來編寫程式碼。他們也越來越多地使用 AI 系統來撰寫測試和檢查程式碼。換句話說,AI 系統已足夠成熟,能夠自動化 AI 研發的一個主要組成部分,從而加速所有參與其中的人類工作。

衡量 AI 系統完成耗時任務的能力:

METR 製作了一張圖表,顯示 AI 能完成的任務複雜度,其衡量標準是熟練人類完成這些任務所需的小時數。這裡的關鍵指標是 AI 系統在多項任務中達到 50% 可靠性的大致時間範圍。

在這方面,進展令人震驚:2022 年,GPT 3.5 能完成人類約 30 秒的任務。2023 年,GPT-4 將此時間提升至 4 分鐘。2024 年,o1 模型達到 40 分鐘。2025 年,GPT 5.2 (High) 達到約 6 小時。

2026 年,Opus 4.6 已提升至約 12 小時。METR 的資深 AI 預測員 Ajeya Cotra 認為,預期 AI 系統能在 2026 年底前完成約 100 小時的任務並非不合理。

AI 系統獨立工作時間的顯著增長,與代理式程式碼工具的爆發式成長密切相關,這代表 AI 系統的產品化,它們能代表人類工作,並長時間獨立運作。

這也回溯到 AI 研發領域,仔細觀察許多 AI 研究員的工作,其中許多任務歸結為人類可能需要數小時才能完成的事情,例如資料清理、資料讀取、啟動實驗等。所有這類工作現在都已納入現代系統的時間範圍內。

AI 系統越熟練,且越能獨立於我們工作,它們就越能幫助自動化 AI 研發的各個環節。

委派任務的關鍵要素是:a) 對被委派者技能的信心,以及 b) 對其能以符合您意圖的方式獨立工作的信心。

當我們審視 AI 在程式碼編寫方面的能力時,似乎 AI 系統正變得更加熟練,並且能夠在無需重新校準的情況下,獨立於人類工作更長的時間。

這與我們周圍所見的現象相符,工程師和研究員現在正將越來越大比例的工作委派給 AI 系統,隨著能力的提升,被委派工作的複雜性和重要性也隨之增加。

AI 在 AI 研發所需的核心科學技能方面表現出色

思考現代科學,其中很大一部分是關於指定一個方向來生成一些實證資訊,運行實驗來生成該資訊,然後對實驗結果進行合理性檢查。程式碼編寫技術的持續進步,結合大型語言模型 (LLMs) 的通用世界建模能力,已經產生了有助於加速人類科學家工作並部分自動化廣泛研發領域的工具。

在這裡,我們可以檢視 AI 在 AI 研究本身固有的幾個關鍵科學技能方面的進展速度:複製研究成果、將機器學習技術和其他方法串聯起來解決技術問題,以及優化 AI 系統本身。

實作完整的科學論文並進行實驗:

AI 研究的一個核心工作是閱讀科學論文並重現其結果。在這方面,各種基準測試都取得了顯著進展。

一個很好的例子是 CORE-Bench,即計算可重現性代理基準測試。這個基準測試挑戰 AI 系統「在給定研究論文的儲存庫情況下,重現其結果。代理必須安裝函式庫、套件和依賴項並運行程式碼。如果程式碼成功運行,代理需要搜尋所有輸出以回答任務問題。」

CORE-Bench 於 2024 年 9 月推出,當時得分最高的系統是名為 CORE-Agent 的 GPT-4o 模型,在基準測試中最困難的任務集上得分約 21.5%。

2025 年 12 月,CORE-Bench 的一位作者宣布該基準測試「已解決」,Opus 4.5 模型達到了 95.5% 的成績。

建構完整的機器學習系統以解決 Kaggle 競賽:

MLE-Bench 是 OpenAI 建立的基準測試,用於檢視 AI 系統在「75 個涵蓋自然語言處理、電腦視覺和訊號處理等多種領域的 Kaggle 競賽」中(離線)競爭的能力。該基準測試於 2024 年 10 月推出時,得分最高的系統(代理框架內的 o1 模型)獲得 16.9%。截至 2026 年 2 月,得分最高的系統(帶有搜尋功能的代理框架內的 Gemini3)獲得 64.4%。

核心設計:

核心優化是 AI 開發中較困難的任務之一,它涉及編寫和精煉將特定操作(如矩陣乘法)映射到底層硬體的程式碼。核心優化對 AI 開發至關重要,因為它決定了訓練和推論的效率,您能有效利用多少算力來開發 AI 系統,以及一旦訓練好模型,能多有效地將該算力轉化為推論。

近年來,用於核心設計的 AI 已從一個新奇事物發展成為一個競爭激烈的研究領域,並出現了多個基準測試。這些基準測試都沒有特別流行,因此我們無法輕易地模擬其隨時間的進展。另一方面,我們可以透過一些正在進行的研究來感受其進展。

部分工作類型包括:利用 DeepSeek 的模型嘗試建構更好的 GPU 核心(#400)、自動化將 PyTorch 模組轉換為 CUDA 程式碼(#401)、Meta 使用 LLMs 自動生成優化的 Triton 核心以供其基礎設施使用(#439)、使用 LLMs 協助為華為 Ascend 晶片等非標準硬體編寫核心(「AscendCraft」#444)、針對 GPU 核心設計微調開源模型(「Cuda Agent」,#448)。

這裡的一個注意事項是,核心設計確實具有一些特性,使其特別適合 AI 驅動的研發,例如具有易於驗證的獎勵。

透過 PostTrainBench 微調語言模型

這類測試的一個更困難版本是 PostTrainBench(#449),它檢視不同的前沿模型如何能夠取用較小的開源模型,並對其進行微調以提高在某些基準測試上的性能。這個基準測試的一個優點是我們有非常良好的人類基準,這些模型的現有「指令微調」版本。