針對101家企業的調查顯示,為AI代理提供業務語境的基礎設施建構速度,已超越其可被信任的程度。檢索增強生成(RAG)已成為預設的語境來源,且供應商原生檢索已悄然超越定義此類別的專用向量資料庫。然而,大多數企業已發現其AI代理產生自信卻錯誤的答案,這些錯誤可追溯至語境缺失或不一致。
受控語義層正浮現為解決方案,但多數企業仍在建構中;業界正趨向混合檢索;儘管供應商原生工具在實務上佔主導地位,但許多企業仍表示打算保留各領域最佳工具。這導致了「語境落差」,AI代理聽起來權威,但其底層基礎卻尚未完全被擁有者信任。
本期VentureBeat Pulse研究深入探討企業RAG和語境層:包括如何為AI代理提供業務語境、企業運行的檢索系統、如何採購和衡量這些系統、架構的發展方向,以及最關鍵的,語境失敗的頻率。核心發現是「語境落差」,即企業AI代理回答的自信程度與其底層語境實際可靠性之間的差距。
大多數企業(57%)表示,在過去六個月中,他們的AI代理曾產生自信卻錯誤的答案,這些錯誤可追溯至語境缺失或不一致,其中超過一半的企業表示這種情況發生不止一次。這並非邊緣化的失敗:檢索是38%企業的主要語境來源,超越其他任何方法,因此當檢索不足或不一致時,所產生的錯誤會損害AI代理的權威性。
解決此問題的基礎設施正在建構中,58%的企業已運行或正在建構受控語義層,但對大多數企業而言,尚未投入生產。底層市場正以令人驚訝的方向整合。供應商原生檢索,OpenAI的檔案搜尋(40%)和Google的Vertex AI Search(38%),已領先所有專用向量資料庫,且企業預計混合檢索將在2026年底前佔主導地位(34%)。
然而,許多企業(36%)表示他們打算保留各領域最佳的獨立工具,而非整合到單一供應商的原生語境堆疊中,且大多數企業(57%)計劃在一年內更換或增加供應商。這顯示出聲明偏好與實際使用之間存在矛盾,市場正在採購供應商原生工具,同時卻堅持其獨立性。
VentureBeat將本次調查作為其Pulse研究系列的一部分。本次調查重點關注企業RAG基礎設施和語境層,即為AI代理提供語境的檢索系統、語義層和語境來源。受訪者僅限於員工數超過100人的組織(n=101);本次調查未收到員工數100人或以下組織的回應,因此所有樣本均符合資格。
所有回應均來自2026年第二季(6月)的單一波次,因此報告為橫斷面分析,不推斷逐月趨勢。有幾個問題是多選題,因此其佔比總和可能超過100%。按組織規模劃分,樣本集中於中型市場:251-1,000名員工(31%)和101-250名員工(31%)佔主導,其次是1,001-5,000名(20%)、5,001-10,000名(12%)和10,001名以上(7%)。
按職位劃分,涵蓋經理(39%)、個人貢獻者(27%)、高階主管(16%)以及副總裁和總監(14%);在採購權限方面,具有買家可信度,其中46%為最終決策者,另有26%為推薦者或影響者。科技/軟體業是最大的產業,佔20%,其次是醫療保健/生命科學(11%),並廣泛分佈於零售、運輸、金融服務、製造和教育等領域。
本次調查有101名受訪者,樣本規模適中,應視為方向性訊號而非精確測量;它是自我選擇的,並非機率樣本。最好將其解讀為積極建立RAG和語境基礎設施的組織的觀點,而非來自最大型營運商的觀點。
我們詢問企業在過去六個月中,是否曾將AI代理自信卻錯誤的答案追溯到缺失或不一致的業務語境。大多數企業都有此經驗。這是本報告的關鍵數據。超過一半的企業(57%)已經經歷過AI代理產生自信卻錯誤的答案,這些錯誤可追溯至不良語境,例如錯誤的指標、過時的定義或缺失的文件,其中超過一半的企業表示這種情況發生不止一次。
只有28%的企業表示沒有發生此類失敗,其餘少數企業要麼不在企業數據上運行AI代理,要麼沒有足夠密切地追蹤根本原因。這種失敗模式具體且危險:模型並非明顯地產生幻覺;它只是因為所提供的語境不足或不一致而自信地給出錯誤答案。本報告中的所有其他內容,企業如何檢索、如何治理以及計劃建構什麼,都源於這個問題。
我們詢問企業的AI代理主要使用什麼來理解其數據。檢索以顯著優勢領先。檢索是企業語境的骨幹。對於38%的組織而言,透過文件或向量索引進行RAG是AI代理理解業務的主要方式,幾乎是下一個方法(受控語義層或本體論,21%)的兩倍。
混合方法(14%)、直接即時系統查詢(10%)和長語境載入(6%)佔據其餘部分,只有2%的企業讓AI代理僅依賴模型的通用知識。這種集中性在發現1的背景下至關重要:由於如此多的企業語境透過檢索流動,檢索的品質直接決定了答案的品質。當RAG成為預設來源時,不足的檢索不再是邊緣情況,它成為主要的失敗介面。
一種方法值得注意其缺席:客製化模型權重,也稱為微調。所有領先的業務語境來源都是在運行時注入的。我們最近對微調的直接測量來自4月至5月的調查波次(另一項調查,n=136),其中微調能力在模型選擇的六個因素中排名最後,僅佔5%,儘管該樣本中有26%仍將微調和客製化視為預計會增長的投資。微調已退出主要選擇的討論;語境注入才是企業讓AI代理了解其業務的方式。
我們詢問企業目前在生產環境中運行哪些檢索系統。答案偏向模型供應商和超大規模雲服務商,而非專業供應商。專用向量資料庫不再是RAG堆疊的核心。OpenAI的檔案搜尋(40%)和Google的Vertex AI Search(38%),供應商原生和超大規模雲服務商原生檢索,領先於所有專用向量資料庫。
在專業供應商中,使用最多的是企業因其他原因已在運行的工具(Elasticsearch/OpenSearch,20%)以及開放、嵌入式選項(pgvector,12%);定義此類別的純粹向量資料庫,Weaviate、Qdrant、Pinecone、Milvus,每個都只佔個位數到低雙位數。
值得注意的是,13%的企業表示他們根本沒有運行任何生產RAG。如同平行基礎設施浪潮中的平台一樣,企業正傾向於捆綁在他們已採購工具中的檢索功能。
這項發現的趨勢在第二季的兩次調查波次中保持一致。在4月至5月的調查中(n=161),供應商建構的檢索也領先使用率,而所有專用向量資料庫仍處於邊緣地位,使用最多的獨立向量資料庫最高佔該樣本的8%,且混合、多元化的未來已是共識預期(34%預計混合檢索將佔主導,另有29%預計按使用案例採用多種架構)。兩次調查波次,一致的結果:創造「向量資料庫」一詞的類別正被企業已採購的平台所整合。
我們詢問當模型供應商將檢索、記憶體和協調功能捆綁到其平台時,企業將如何回應。他們聲明的意圖與其當前使用情況背道而馳。這是堆疊核心的張力所在。儘管供應商原生檢索在實務上佔主導地位(發現3),但許多企業(36%)表示他們打算保留各領域最佳的獨立工具,而非整合到供應商的原生語境堆疊中,遠高於計劃整合的21%。
另有21%預計會採用混合模式,9%打算自行建構和擁有該層。企業實際運行情況與其聲明意圖之間的差距,是此類別的戰略問題:他們為了便利性而採用捆綁式檢索,同時卻聲稱要保持獨立性。哪種衝動會勝出,供應商捆綁的吸引力,還是對模組化控制的聲明偏好,將比任何單一工具更能塑造檢索市場。
我們詢問企業預計到2026年底,哪種檢索架構將主導其生產RAG系統。業界正趨於一致,但仍有很大一部分不確定。架構正趨於混合模式。三分之一的企業(34%)預計混合檢索,結合嵌入、重新排序和存取控制,將在2026年底前主導其生產系統,這是預計向量專用檢索將佔主導地位(11%)的三倍。
這是一個值得注意的訊號:純粹的向量搜尋方法(開創此類別)已被視為不足,取而代之的是增加了重新排序以提高準確性和存取控制以實現治理的管線,正是這些存取控制的缺失導致了發現1中的失敗。第二大的答案是不確定性:17%的企業根本不知道,另有14%預計將完全超越專用向量層,轉向工具優先或長語境檢索。共識並非單一工具,而是一個分層管線,且尚未完全成形。
我們詢問企業是否使用受控語義層或語境層,以使AI代理和商業智慧(BI)對其數據有共同的理解。大多數企業正在這條路上,但只有少數已達成目標。解決語境落差的方案正在建構中。超過一半的企業(58%)要麼已在生產環境中運行受控語義層(25%),要麼正在試點和建構中(34%),另有17%正在積極評估,這意味著四分之三的企業以某種形式參與了這個概念。
但這種平衡說明問題:正在建構的企業多於已投入使用的企業,因此對大多數企業而言,能夠防止發現1中「自信卻錯誤」失敗的共享、受控定義層仍在進行中。語義層是業界對不一致語境的回應;本次調查捕捉到它正處於建構中期,雄心遠超實際生產。
我們詢問企業在選擇檢索系統時最看重什麼,以及一旦系統運行後他們會追蹤什麼。兩者都偏向實用性。企業選擇檢索系統時,主要考量其可操作性。數據攝取便利性(36%)、延遲和效能(32%)以及操作簡便性(29%)是主要的選擇標準,這些都領先於檢索準確性和存取控制(各佔23%),而後兩者正是與發現1中失敗直接相關的因素。一旦系統運行起來,企業會更側重於監控其正確性和安全性。
