根據一項針對157家企業的調查,各組織正賦予AI代理更高的自主性,但對用於把關這些自主性的評估卻越來越不信任。半數企業曾部署通過內部評估卻在生產環境中讓客戶失望的AI代理;目前只有二十分之一的企業完全信任自動化評估;最常被提及的弱點是評估結果與實際成效不符。
然而,三分之二的企業已經允許,或正積極將AI代理的變更僅憑自動化評估就部署到生產環境,完全無需人工介入。這導致了「評估落差」,即企業賦予AI代理的自主性,與他們對旨在捕捉失敗的測試所抱持的信任程度之間的距離。
VentureBeat Pulse Research 的這波調查探討了技術主管如何衡量AI代理的效能:他們使用哪些可靠性與評估平台、如何選擇與信任這些平台、生產環境中會出現哪些問題,以及他們願意讓AI代理在無人工介入的情況下運行到什麼程度。核心發現是「評估落差」,企業賦予AI代理的自主性,與他們對旨在管理這些自主性的評估所抱持的信任程度之間的距離。
過去一年中,半數組織(50%)曾部署通過內部評估,但隨後導致客戶端失敗的AI代理或大型語言模型功能,其中四分之一的組織甚至發生過不止一次。對測試本身的信任度很低:只有5%的組織表示他們目前完全信任自動化評估,而最常被提及的限制是評估與實際成效的契合度不佳(29%)。企業發現,通過評估並不等同於AI代理能正常運作。
這個落差之所以重要,在於其發展方向。三分之二的組織(66%)已經允許對低風險AI代理進行完全自動化、無人工介入的部署(34%),或者正積極改造其部署流程,以便在十二個月內實現此目標(33%)。與此同時,本應贏得這種信任的評估技術堆疊卻是分散且不成熟的。
最常見的主要工具是模型供應商的原生評估工具,與完全沒有專用工具的比例相同(各佔17%);只有約四分之一的企業會對即時生產流量進行即時品質檢查。自主性的發展速度快於保障措施的到位速度。
研究方法
VentureBeat 進行這項調查是其 Pulse Research 系列的一部分,本次調查,「代理可靠性與評估追蹤器」,重點關注技術主管如何評估AI代理的效能與可靠性。受訪者篩選為擁有100名或以上員工的組織(n=157),數據來自2026年6月的一次單一調查;由於這是一波調查而非多個月樣本的匯總,因此報告採用橫斷面分析,不推斷月度趨勢。多選題的比例加總可能超過100%。
按職位劃分,樣本具有資深性和買家可信度:38%是AI採購的最終決策者,另有34%是推薦者或影響者。產品與專案經理(15%)、顧問與諮詢師(10%)、工程/IT總監(8%)以及CIO/CTO/CISO(8%)是主要職稱,另有大量「其他」職能(37%)。
按組織規模劃分,樣本偏向中型市場:100-499名員工(37%)和500-2,499名員工(27%)佔主導,其次是2,500-9,999名(20%)、10,000-49,999名(10%)和50,000名以上(6%)。科技/軟體業是最大的產業,佔23%,其次是零售/消費(15%)、醫療保健/生命科學(12%)和製造業(10%)。
157名受訪者的樣本量足以提供方向性參考,但應視為方向性訊號而非精確測量;它是自我選擇的樣本,並非機率樣本。樣本偏向中型市場,因此最適合解讀為正在積極建立AI代理評估實務的組織的觀點,而非最大型營運商的觀點。註:本次調查是從早期的「LLM可觀測性與評估」調查重建,用於6月這一波;由於問題和樣本不同,因此不與4月至5月的數據進行比較。
發現1:通過評估不等於AI代理能正常運作
半數企業部署了通過評估卻讓客戶失敗的AI代理。我們詢問在過去12個月內,組織是否曾部署通過內部評估但隨後導致客戶端失敗的AI代理或大型語言模型功能。在進行評估的組織中,半數發生過此情況。這是本報告的關鍵數字。
半數組織(50%)部署了通過內部評估卻在客戶面前失敗的AI功能,可能是錯誤的輸出、損壞的工作流程或品質事件,其中四分之一甚至發生過不止一次。只有36%的組織報告沒有此類失敗,其餘的要麼沒有進行部署前評估(8%),要麼沒有足夠密切地追蹤根本原因(6%)。這種失敗是明確且代價高昂的:評估說AI代理已準備就緒,但它並沒有。
接下來的一切,企業如何信任其評估、監控什麼以及賦予多少自主性,都受到這種經驗的影響。
發現2:幾乎沒有人完全信任自動化評估
最常見的抱怨:評估與實際成效不符。我們詢問了目前最影響對自動化AI代理評估信任度的限制是什麼。只有極少數企業沒有任何抱怨。
對自動化評估的信任度稀缺且具體。只有5%的組織表示他們完全信任目前的自動化評估,這意味著95%的組織指出了阻礙他們的限制。最常見的限制是評估與實際成效契合度不佳(29%),這直接解釋了發現1:通過評估的AI代理隨後卻失敗了。
偏誤或不一致(21%)和缺乏可解釋性(18%)緊隨其後,企業不總能知道評估為何得出其結論,17%的組織提到了評估過程中的資料洩漏或隱私疑慮。旨在認證AI代理的測試尚未被信任能真正認證它們,這正是發現3中自主性發展軌跡如此引人注目的原因。
發現3:自主性上限仍在提高
三分之二的企業已經允許或正在建立無人工介入部署。我們詢問組織是否會讓自主AI代理僅憑自動化評估結果,在沒有人工介入驗證的情況下,將程式碼或系統變更部署到生產環境。其發展軌跡直接穿過信任落差。
這是本報告的核心矛盾。儘管幾乎沒有人完全信任自動化評估(發現2),但三分之二的組織(66%)要麼已經允許對低風險AI代理進行無人工介入部署(34%),要麼正積極改造其部署流程,以便在一年內實現此目標(33%)。只有22%的組織在可預見的未來排除了這種可能性。
方向是明確的:企業正朝著讓評估自主把關生產環境的方向發展,移除人工審核,而他們卻同時表示這些評估無法可靠地匹配現實。自主性上限的提升速度快於其底層保障措施的到位速度,這正是發現1中那種虛假自信失敗將會擴大而非縮小的機制。
值得注意的是,自主性賭注不僅僅是小型公司的現象。按公司規模劃分樣本,大型企業在邁向零人工審核的道路上比小型公司稍遠(70%對64%),並且更有可能部署通過評估卻隨後讓客戶失敗的AI代理(54%對48%)。在本樣本中,認為大型受監管組織會最長時間保留人工介入的假設是錯誤的。
當然,這些是方向性數字,因為調查樣本量不大,來自2,500名以上員工公司的受訪者有57位,來自較小公司的有100位。
發現4:評估技術堆疊分散且由供應商主導
供應商原生評估工具領先,與沒有專用工具的比例相同。我們詢問企業目前主要使用哪種AI代理可靠性或評估平台。市場上沒有明確的領導者,而且有很大一部分企業根本沒有專用工具。
評估層級尚處早期且未整合。供應商原生工具領先,OpenAI 的原生評估與追蹤(17%)和 Anthropic 的 Claude Console 評估(13%)合計超過任何獨立平台,但令人驚訝的是,它與一個答案並列榜首:17%的企業根本沒有使用任何專用的AI代理評估工具,這對於向客戶部署AI代理的組織來說是一個顯著的落差。
專業評估供應商,DeepEval(12%)、Braintrust(8%)、LangSmith、Weave、Promptfoo、Langfuse、Arize,分佈在個位數到低兩位數的比例,11%的企業自行開發。目前沒有任何獨立平台成為類別標準,這使得大多數企業使用供應商原生工具、自行開發腳本或根本沒有工具來評估AI代理。
發現5:生產環境監控很少關注輸出品質
只有四分之一的企業對即時流量進行即時品質檢查。AI代理的生產環境監控可以關注兩種截然不同的事物。它可以監控系統是否正常運作,AI代理是否啟動並回應、每個請求是否完成、速度如何、成本多少、是否有任何錯誤。或者它可以監控AI代理的輸出是否正確,自動檢查每個答案的內容:AI代理是否給出了正確的答案、採取了正確的行動、是否符合政策。
這種區別很重要,因為一個自信卻錯誤的答案對於第一種監控是不可見的:請求完成、回應快速、沒有拋出錯誤,所有運作指標都顯示正常。我們詢問組織目前其即時生產環境監控是為哪種類型而建構的。
按實際監控的內容分組,差異顯著:51%的組織僅監控AI代理是否正常運作,而23%的組織監控其答案是否正確。如果算上臨時審查者和不確定者,大約四分之三的組織在生產環境中沒有對輸出正確性進行自動化、即時評估,他們可以看到系統是否正常運作以及成本,但他們對其答案的正確性是憑藉信念。
這個盲點是運行時對發現1中部署前落差的對應:那些將人工從部署決策中移除的組織,在生產環境中大多無法即時看到部署的AI代理何時開始出錯。
發現6:基於成本採購,基於一致性衡量
價格和整合驅動選擇;評估一致性是目標。我們詢問了什麼最影響企業選擇評估供應商,以及他們將什麼視為主要的成功衡量標準。兩個答案都很務實。
企業購買評估工具是基於經濟考量,並基於可重複性來信任它。評估成本(28%)略微領先選擇因素,緊隨其後的是易於整合(27%)和評估準確性(24%),可觀測性的廣度(13%)和供應商發展藍圖(4%)則不那麼重要。對於成功的定義,超過三分之一(36%)的企業提到了評估一致性,每次對相同行為都能得出相同的判斷,遠超過實驗速度(19%)、減少失敗(18%)、生產環境可視性(13%)和法規遵循(11%)。
對一致性的強調說明了一切:在企業信任評估結果之前,他們需要它穩定,而這種穩定性(偏誤和不一致)正是發現2中排名靠前的信任限制之一。對目前工具的滿意度僅為中等,在整體滿意度、實施難易度和性價比方面,五分制平均為3.8分。
發現7:下一筆投資將流向人工與可觀測性
投資正流向監督,而不僅僅是自動化。我們詢問了未來一年哪項可靠性與評估投資將增長最多。資金正流向更密切地監控AI代理,包括人工介入。

