AI 代理正變得日益複雜,從單純回答問題,進化到能自主執行多步驟的複雜任務。

然而,在這些代理能夠被信任代用戶預訂行程或進行財務分析之前,模型供應商和開發這些代理的新創公司,都希望確保它們能在各種情境下可靠地運作。

AI 實驗室常利用基準測試來展示其模型的實力,但即使是針對代理的基準測試獲得高分,也無法真正證明 AI 能正確完成各種複雜的真實世界任務。

Patronus AI 是一家由前 Meta AI 研究員 Anand Kannappan 和 Rebecca Qian 於 2023 年創立的新創公司。他們透過建立模擬數位環境來評估 AI 代理的表現,協助模型開發者和企業微調模型,以達到上述目標。

這家位於舊金山的新創公司顯然正在解決一個重要的問題。根據 Notable Capital 的執行董事 Glenn Solomon 表示,幾乎所有頂尖的 AI 實驗室和許多新興新創公司都已成為他們的客戶,對該公司模擬環境的需求幾乎是永無止境。

Patronus 在過去一年中營收成長了 15 倍,吸引了投資者的濃厚興趣。該公司週四宣布完成由 Greenfield Partners 領投的 5000 萬美元 B 輪融資,Notable Capital、Lightspeed、Datadog 和 Samsung 也參與其中。此輪融資使該公司的總募資額達到 7000 萬美元。

Patronus 運用其所謂的「數位世界模型」,建立網站和內部系統的複製品。在這些環境中,AI 代理在訓練後會透過強化學習進行壓力測試,該學習方式會反覆獎勵成功的任務完成,並懲罰錯誤。

AI 實驗室認為這些數位模擬極具價值,因為它們讓 AI 代理有機會嘗試各種不同、有時甚至是不可預測的情境。該公司將其方法比喻為 Waymo 訓練自動駕駛汽車的方式,Waymo 也是先建立合成世界來測試車輛應對惡劣天氣或兒童追球等罕見危險。

AI 代理的不同之處在於它們傾向於走捷徑,這意味著它們可能無法正確完成任務。Solomon 表示:「Patronus 非常擅長發現這些『漏洞』,並確保模型負起責任。」

根據 Kannappan 的說法,Patronus 目前為軟體工程和金融領域提供模擬數位世界,但這僅僅是個開始。

他說:「目前我們非常專注於可驗證的問題,也就是你可以立即檢查和驗證的問題,但還有大量非常難以或無法驗證的領域。」

這些過程可驗證並不代表它們簡單。Kannappan 表示:「我們希望能夠真正創建一個環境,讓 AI 代理可以在其中運行 10 小時、10 天甚至 10 週。」

至於競爭對手,Patronus 認為其主要競爭對手是 AI 實驗室內部已建立的代理行為評估團隊。儘管像 Mercor 和 Surge 這樣的人類數據公司會協助模型開發者進行強化學習,但 Patronus 的運作方式不同,它在沒有任何人類參與的情況下評估 AI 代理的行為。