如果你覺得 AI 領域的發展正在加速,那你的感覺很可能是對的。領先的美國 AI 實驗室正以史無前例的速度發布更優異的 AI 模型,儘管政府干預曾暫時阻止了兩個最強大模型 Claude Fable 和 GPT-5.6 的存取。然而,這不僅僅是發布時間的問題,證據也顯示 AI 能力的提升正在加速,儘管前沿技術仍不穩定,且 AI 在許多方面依然存在弱點。

當我們觀察 AI 執行實際工作的能力時,這一點尤其明顯。有幾項評估試圖衡量 AI 能完成多少人類工作,其中最著名的兩項來自 METR 和英國官方 AI 安全研究所,它們估計 AI 透過單一提示詞能完成多少人類程式設計師工時的工作量。GDPval 則透過專業評審比較 AI 在多個領域與人類專家的表現,這些評估都顯示 AI 能力正以超越指數級的速度增長。

另一個進行類似實驗的組織 Epoch 最近發現,Opus 4.7 經過 14 小時的自主運作,能夠建立一個需要人類工程師 2 到 17 週才能完成的軟體套件,而其在代幣上的花費僅為 251 美元。儘管 AI 系統並非能通過所有測試,運行成本也並非總是低廉,但它們的改進速度確實非常快。

在我自己的實驗中,我發現 Fable 能夠自主工作 9 小時,執行非常複雜的軟體專案,而這原本需要一個團隊花費超過一週的時間才能完成。

到目前為止,我主要關注的是那些擁有最高「智慧」的前沿模型,它們由三家美國公司開發:Anthropic、OpenAI 和 Google,儘管 Google 已有一段時間未發布新模型。然而,還存在第二類接近前沿的 AI 模型,它們通常落後前沿模型 6 到 12 個月,且全部來自中國。這些是開源權重模型,意味著任何人發布後都可以使用或修改它們,這與專有的前沿模型不同,也使得它們的營運成本相當低廉。

儘管這些模型落後於美國的閉源模型,但它們也正沿著指數級的改進曲線攀升。你可以在我針對 AA-Briefcase 測試中 AI 表現的圖表中看到這一點,該測試模擬一個複雜的、為期數週的顧問專案,其中 AI 必須進行多種分析。中國的開源權重模型(其他國家也生產開源權重模型,但沒有一個接近前沿)正處於自己的指數曲線上,僅次於美國的閉源模型。

然而,抽象的圖表只能提供有限的資訊,它們可能會掩蓋前沿技術的不穩定性,以及開源權重模型儘管令人印象深刻,但其實際表現不一定總能達到基準測試所顯示的水平。要獲得真正的洞察力,你需要嘗試將 AI 用於不同的應用場景,並嚴格評估它們在你關心的領域表現如何。

舉一個有趣的例子,我創建了一個測試,要求 AI 建立一個港口隨時間演變的互動式模擬。你可以在這裡查看所有結果。我認為這提供了一個有趣的視角,顯示模型在設計、風格方法甚至判斷力等領域的差異有多大。隨著系統執行越來越長的任務,這些難以基準化的因素變得更加重要。

隨著 AI 能夠執行越來越長的任務,人們使用 AI 的方式也正在改變。直到最近,使用 AI 的主要方式是作為一種「協作智慧」。你會要求 AI 完成某項任務,檢查結果,然後再要求它執行工作的下一步。透過仔細的提示詞和人類的關注,你可以引導 AI 完成複雜且長期的任務。

這種使用 AI 的方法仍然普遍且有用,但越來越多地,它不再是 AI 被用於有價值工作的方式。長時間運行、智慧且能自我修正的 AI 系統不需要持續的人工干預,它們需要一種不同的工作方式,這也是我即將出版的書籍《Co-Existence》的主題。

與聊天機器人不同,AI 代理人配備了額外的機制:提供 AI 存取工具和行動環境的「工具鏈」(harnesses),以及為代理人構建的應用程式,例如 Claude Code 或 OpenAI 的 Codex。因此,AI 模型本已不斷提升的能力,可以透過優良的工具鏈或應用程式進一步增強。

因此,工作越來越多地變成將任務分配給 AI 代理人,而不是與聊天機器人協同工作。OpenAI 與學術經濟學家的一項聯合研究顯示了這種轉變在其組織內部發生的速度有多快。關鍵是,不只是程式設計師在使用代理人,法律、人資和其他非技術職能部門也以幾乎相同的速度採用了代理人。OpenAI 可能預示著其他工作領域將會發生的變化。

越來越多地,OpenAI 的工作模式看起來像是管理 AI。每週有四分之一的 OpenAI 員工同時運行至少四個代理人。隨著程式編寫由 AI 在專門的工具鏈和應用程式中完成,其他職位也開始轉變為某種形式的「程式設計師」。而且他們在這方面表現出色。一項針對 Claude Code 使用者的獨立研究發現,軟體工程師在使用 Claude Code 執行編碼任務時,與其他專業人士的成功率相似。

實際上,重要的不是使用者的職業,而是他們的專業知識。一個人擁有的領域經驗越多,他們在使用 Claude Code 於該領域時就越成功。更有趣的是,他們從每個提示詞中從 Claude 獲得的輸出也越有用。

我們正從一個非專業人士使用聊天機器人來填補空白的世界,轉變為專家使用代理人來完成工作的世界。而使用代理人的最佳方式,就是將自己視為一名管理者。

處於指數級增長意味著在固定時間窗口內的每一次變化都比前一次更大。如果你的組織在 2025 年冬季之前制定了 AI 計畫,它描述的系統可能只能在錯誤率相當高的情況下完成幾個小時的工作。然而幾個月後,你可能就能透過單一提示詞獲得十六小時或更多的工作量。

這就是為什麼 AI 總讓人感覺在不斷飛躍,儘管它在圖表上是一條曲線,我們卻不斷經歷能力穩步翻倍所帶來的一系列衝擊。我們非常不擅長從內部感受指數級增長,而我們目前正處於其中。

我認為這也比通常關於炒作的說法,更能解釋 AI 周圍的動盪。AI 在突然之間成為真正的網路安全威脅之前,似乎還不具備這種能力,這導致政府最高層級突然且即興地改變政策。市場會低估 AI 是否可能威脅到商業模式,直到它突然能夠做到,從而導致股市大幅波動。

這些劇烈波動常被解讀為一個不成熟領域的跡象,最終會趨於穩定。但我認為它不會很快穩定下來。這種不穩定性正是當以人類速度(或更糟,委員會速度)運作的機構,試圖追蹤一個本質上非人類的能力曲線時所發生的情況。只要我們處於某種指數級增長中,並且只要這種增長持續,差距只會不斷擴大。