為了精確測試這些能力,研究人員開發了 CEO-Bench 基準測試。這項基準測試模擬了長期任務的真實範例:經營一家新創公司長達 500 個模擬日。

研究人員引用了一個著名案例:1997 年,Apple 距離破產僅剩 90 天。當時 Steve Jobs 畫了一個簡單的二乘二矩陣,消費者與專業、桌上型與攜帶型,並決定 Apple 只為這四個象限開發產品。隨後,iMac、iPod 和 iPhone 陸續問世。

作者們認為,這種策略引導智慧與當今 AI 代理程式的能力截然不同。雖然 AI 代理程式在單一任務上的表現迅速提升,但要引導整個組織朝長期目標邁進,卻是完全不同的問題。CEO-Bench 是首次嘗試精確衡量這種「引導智慧」。

虛構軟體公司的 AI 執行長

在 CEO-Bench 中,一個代理程式經營一家虛構的訂閱軟體公司 NovaMind。它從零客戶和一百萬美元的銀行存款開始,績效則以最終剩餘現金衡量。如果餘額曾一度降至零以下,公司即宣告破產,模擬也會隨之結束。

該代理程式透過一個包含 34 種工具的 Python API 和一個 19 個資料表的資料庫來控制公司。它不只發出單一指令,還能自行編寫程式碼、使用 SQL 查詢資料庫,並根據結果建立客製化的工作流程。研究人員表示,這讓它面臨與人類執行長相同的挑戰。

在 500 天的新創模擬中,代理程式將資料庫查詢、管理工具互動和社群媒體貼文與市場週期及結果指標(如問題解決數、訂閱者成長、取消率和手頭現金)連結起來。

有許多決策要做:定價與分級、跨管道廣告支出、產品品質與研發、基礎設施容量與客戶支援,以及與企業客戶進行多輪談判。此外,還有一個模擬的社群網路,代理程式可以在其中閱讀客戶投訴、競爭對手新聞和經濟趨勢,並自行發布貼文。

延遲回饋與隱藏變數增加測試難度

這項任務的難度在於時間和不確定性。決策會按照實際的商業時間線發展:收入只在帳單日期入帳,研發專案需要數天到數週,而錯誤往往要等到客戶流失或聲譽受損後才會顯現。成本卻是立即發生。代理程式必須花錢,而其回報可能數週後才會出現。

公司的許多狀態都保持隱藏。代理程式無法直接看到客戶滿意度、支付意願或最低品質期望。它必須從雜訊訊號中拼湊這些資訊,例如取消訂閱、支援票證或社群網路上的反應。該模擬模型包含 26 個客戶區隔和個別客戶,每個客戶都有自己的預算、價格敏感度和期望。

世界也在不斷變化。競爭對手會定期提高客戶的品質期望,偏好會隨著時間推移而轉變,模擬的商業週期也會影響需求和支付意願,因此代理程式必須不斷調整。

研究人員刻意選擇了固定且透明的規則,而非使用語言模型作為裁判。他們希望避免 Vending-Bench(一個模擬販賣機的測試)中發現的弱點:在該測試中,由 AI 模擬的供應商可能會因為代理程式不切實際的口頭承諾而給予獎勵。

大多數模型宣告破產

在十四款受測模型中,大多數都未能完成任務。幾乎所有模型都能生成有效的指令和資料庫查詢,但沒有一款能夠長期維持連貫的策略。許多模型在模擬結束前就宣告破產。

只有三款模型在最佳運行中,最終資產超過一百萬美元的起始資本:Claude Fable 5 達到 4715 萬美元,Claude Opus 4.8 達到 2780 萬美元,而 GPT-5.5 則為 2130 萬美元。其中,Claude Fable 5 是唯一在多次運行中都能超過起始資本的模型。

不過,這其中也有一些注意事項。一次 Fable 5 的運行因模型拒絕繼續而中止,而在另外兩次運行中,部分請求則回退到 Opus 4.8。GPT-5.5 在其三次運行中有兩次宣告破產。

在 500 天的模擬中,Claude 模型的手頭現金最高達到 4715 萬美元,其次是 GPT-5.5。數個代理程式在運行結束前就宣告破產。

最具說服力的比較是與一個從未呼叫語言模型的簡單規則型啟發式演算法進行對比。該演算法設定固定價格、配額和分級,將廣告和目標開發集中在一小部分客戶區隔,並根據近期使用情況調整容量。這個啟發式演算法最終達到 1576 萬美元,擊敗了除 Fable 5、Opus 4.8 和 GPT-5.5 之外的所有模型。

研究人員還粗略估計了可實現的最終現金上限約為 22 億美元。即使是表現最好的代理程式也遠遠未能達到。作者們表示,這項測試的潛力遠未被完全發揮。

探索勝於謹慎

分析決策軌跡揭示了明顯的行為差異。GPT-5.5 和 Claude Opus 4.8 會隨著條件變化不斷嘗試新策略,無論是增加客戶獲取、調整分級,還是轉移支援和研發預算。相較之下,Claude Opus 4.7 主要透過削減成本和保留現金來應對挫折。這種被動方法讓模型得以存活到最後,但卻無法獲利。

有趣的是,Opus 4.8 和 GPT-5.5 透過截然不同的路徑達到了相似的最終結果:Opus 4.8 在早期獲得更多客戶,但在模擬中期客戶數降至零,而 GPT-5.5 則始終保持其客戶群。兩者都編寫了出乎意料的複雜程式碼。Opus 4.8 建立了內部模擬,對客戶群進行建模以預測未來現金流。GPT-5.5 則深入挖掘資料庫中的談判歷史,以揭示隱藏的客戶偏好。

研究人員衡量了與成功相關的四種能力:

揭示隱藏資訊,例如哪個廣告管道最適合特定的客戶區隔,

預測未來,以四週現金預測的誤差來衡量,

快速適應變化,以模型發現競爭對手動向的速度來衡量,

以及提前規劃,部分透過代理程式筆記中「如果-那麼」情境出現的頻率來衡量。

在這四個方面,Opus 4.8 和 GPT-5.5 的得分都高於其他模型的平均水準。

工具環境也至關重要

另一個發現與代理程式用於行動的軟體環境有關。研究人員還測試了使用 Claude Code 的 Claude Opus 4.7 和使用 Codex 的 GPT-5.5,這兩者都是受歡迎的程式碼助手。在這兩種情況下,代理程式的行動頻率都顯著降低,表現也更差。研究人員懷疑,這些工具中針對軟體開發調整的系統提示詞是造成此現象的原因。

縮短時間範圍也未能解決問題。當模擬時間壓縮至 50 天時,只有 GPT-5.5 成功獲利。研究人員總結,大多數模型即使面對短期目標,在協調決策方面仍然表現薄弱。

作者們承認其設定存在局限性。產品以單一品質分數表示,因為他們找不到可靠的方法來評估定性產品變化。為了讓每次運行在經濟上可行,合規性、安全性及募資等因素都被排除在外。儘管如此,他們表示 CEO-Bench 仍揭示了當今模型在局部工具能力與將長期行動連結成連貫策略能力之間的差距。