對於企業而言,代理式 AI 的潛力遠不止於一個更優異的聊天機器人。它指的是能夠跨人員、業務工作流程、資料和系統,端到端執行業務任務的軟體代理。最適合運行代理的平台應具備適當的 CPU 容量、彈性的資料存取、符合政策的工具使用、可觀測性、記憶體管理,以及可預測的代理規劃與擴展能力。

為了更深入理解這些依賴關係,Intel 進行了數千次代理式 AI 工作負載實驗。我們的初步研究結果為企業領導者提供了五個實用建議:代理式 AI 是一個更廣泛的系統問題,而不僅僅是推論問題。現有的大多數代理式 AI 框架都有限制,無法衡量整體系統效能。

容量規劃應使用每個虛擬 CPU (vCPU) 的代理密度,而非代理數量。監控代理任務延遲,而不僅僅是平均 CPU 使用率。託管代理的系統應預設為橫向擴展,而垂直擴展則保留給每個代理計算負載較重或有架構限制的工作負載。

超越推論:代理作為工作流程自動化

代理式 AI 不僅僅是大型語言模型 (LLM) 的推論。其企業價值取決於完整的系統、任務編排、資料存取、工具執行、延遲管理、治理和可擴展的基礎設施。代理是一個目標導向的自動化企業工作流程:它規劃多步驟任務、呼叫工具、讀取結果,並在失敗時重試。因此,企業代理不僅是推論問題,更是一個系統問題。

定義「良好」的標準

大多數代理式 AI 指標都側重於評估所使用的 LLM。然而,平台團隊還需要了解任務所需時間、一個代理群組能支援多少代理、使用者在執行過程結束時的體驗,以及隨著更多代理同時工作,成本如何變化。一個更有用的企業視角應關注六個指標:任務成功率、每個任務的成本、每個任務的時間、任務吞吐量、代理密度(每個 vCPU 的代理數量)以及延遲。

這些指標共同回答了企業 AI 營運者關心的問題:系統是否按預期運行?系統能維持多少代理?以及應如何擴展以支援更多代理?

建立穩固的基礎

為了更深入了解代理式 AI 工作負載的效能,Intel 擴展了 Terminal-Bench,這是一個開源的基準測試框架,用於評估 AI 代理並具備分析、遙測和重播功能。這使得了解代理在 LLM 推論之外的時間花費成為可能。此基準測試擴展使用確定性的 LLM 回應記錄與重播,以將代理效能與 LLM 變異性分開。

LLM 回應被記錄一次,並在不同運行中以相同方式重播,從而減少了運行間的差異,並為比較創建了更可靠的基礎。

Terminal-Bench 使用的任務組合刻意廣泛,包括編譯、測試、資料庫操作、布林邏輯、解釋、光線追蹤、壓縮、線性代數、影片轉碼和機器學習訓練。這種多樣性使得研究結果與真實企業環境更具相關性。

代理式 AI 的三個部署維度

部署代理式 AI 應分三個階段進行:首先,以代理密度而非代理數量進行規劃。第一個規模規劃規則是根據可用計算資源來標準化代理數量。代理密度,以每個 vCPU 的代理數量衡量,是判斷飽和度的主要指標。例如,在 8 個 vCPU 系統上的 10 個代理與在 16 個 vCPU 系統上的 20 個代理,如果密度相同,則行為相似。這為架構師提供了一種可攜式方法,以比較不同實例大小和處理器世代的容量。

適當的密度也取決於業務目標。互動式協作助理和面向使用者的助手應偏好較低的密度,因為回應時間至關重要。而批次工作負載,例如 IT 工作流程,通常可以在較高的密度下運行。這為團隊提供了一種實用的方法,可以根據服務級別目標和總體擁有成本來調整代理群組。

代理式 AI 需要一種新的可觀測性形式:平均計算 (CPU) 使用率對於代理工作負載來說,是一個較弱的主要效能監控訊號。代理通常在等待模型回應和執行短暫的計算密集型工作之間交替。由於這種「突發性」模式,即使這些突發正在產生佇列並降低使用者體驗,平均使用率也可能看起來可以接受。

任務延遲 (P95) 是一個更好的領先指標。它顯示了工作流程何時開始等待,甚至在平均任務持續時間顯著下降之前。一個實用的操作模型是首先針對 P95 延遲發出警報,然後透過查看持續任務持續時間來確認問題。

預設採用橫向擴展:橫向擴展是增加更多系統以提高總代理容量,而垂直擴展則是為單一系統增加核心或記憶體,以處理計算突發較重的代理。我們的測試資料顯示,橫向擴展通常是更好的預設選項。這與代理通常是半獨立且每個代理的突發負載適中這一事實相符,它能提高整體效能、支援高可用性、通常降低成本,並在平台成長時更容易保持目標的每個 vCPU 代理比率。

當代理需要更重的平行計算、共享狀態限制了分割、記憶體局部性很重要,或存在授權限制時,才應考慮垂直擴展。

考量業務影響:代理式 AI 將首先在哪裡創造業務價值?那些獲得生產級成果的組織,正在將自動化層包裝在已經具有編碼規則和可衡量服務級別的工作流程周圍,例如程式碼創建、迴歸測試場、票證分類、市場分析和安全審查。因此,代理式 AI 的理想企業使用者並非追求新奇的實驗者,而是必須提高週期時間和生產力、保護服務品質、執行政策,並在考量成本的情況下擴大採用的負責領導者。

代理式 AI 的價值來自於幫助企業跨團隊、系統、資料和流程完成實際工作。對於企業而言,優先事項不僅是更好的模型效能,更是創建一個可靠的環境,讓 AI 代理能夠支援業務工作流程、提高生產力、在治理要求內運行,並隨著採用率的增長而擴展。實際上,代理式 AI 的成功取決於正確的基礎,以提供一致的成果、管理成本、保持控制,並自信地從試點走向生產。

此內容由 Intel 製作,並非由 MIT Technology Review 的編輯人員撰寫。