回到文章介紹語音助理的故障通常具有高度的領域專屬性。一個在航班重新預訂交易中能完美處理英數字元確認碼的系統,在處理人力資源系統中複雜政策時可能會遇到困難。不同的領域考驗著助理適應不同詞彙、工作流程複雜度及使用者期望的能力。因此,本次發布的 EVA-Bench 從一個企業領域擴展到三個:航空客戶服務管理 (CSM)、企業 IT 服務管理 (ITSM) 和醫療人資服務交付 (HRSD)。

它們共同涵蓋 121 項工具的 213 個評估情境,情境覆蓋率比原始版本增加了約四倍。每個情境都經過三個頂尖模型(OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6)的解決能力驗證,確保此評測基準既具挑戰性又公平。

所有三個資料集均為開源,可供下載:from datasets import load_dataset# 航空客戶服務管理 (CSM),50 個情境airline = load_dataset("ServiceNow-AI/eva-bench", "airline", split="test")# 企業 IT 服務管理 (ITSM),80 個情境itsm = load_dataset("ServiceNow-AI/eva-bench", "itsm", split="test")# 醫療人資服務交付 (HRSD),83 個情境hrsd = load_dataset("ServiceNow-AI/eva-bench", "medical", split="test")EVA-Bench 專為多種受眾而建構。

如果您正在評估語音助理,可以針對涵蓋 35 種以上獨特工作流程的多元真實企業情境進行測試。如果您正在建構自己的評估資料集,本文詳細描述了我們的端到端生成和驗證流程,足以作為實用參考。我們將逐步說明每個領域的設計和生成方式,並深入探討兩個新增領域。

我們還預覽了即將推出的多語言擴展,這將使評測基準的範圍超越僅限英語的企業部署。資料設計原則有五項原則指導著 EVA-Bench 資料集在所有三個領域的設計。語音優先範圍。並非每個企業工作流程都適合語音評測基準。我們首先確定每個領域中哪些任務在實踐中是透過電話處理的,然後從該子集中選擇最常見的流程。

這使得情境紮根於真實的通話模式。真實性。工具綱要模仿生產平台使用的 API 類型。情境政策則取自實際的企業限制。對於醫療人資服務交付領域,這意味著將情境建立在實際的美國醫療政策和管理系統上,包括國家提供者識別碼 (NPI) 號碼、家庭醫療休假法 (FMLA) 和保險範圍,以便評測基準能反映從業者在現實生活中遇到的領域。

多樣性。僅透過重複相同任務來擴展資料集提供的評估訊號有限。為避免此情況,我們為每個領域定義了特定的工作流程,並從三種情境類型中取樣:單一意圖通話、單次對話中包含最多四個意圖的多意圖通話,以及來電者試圖繞過故障排除步驟、錯誤分類緊急程度或存取未經授權記錄的對抗性通話。

在單一和多意圖情境中,我們也包含了使用者目標無法滿足的情況,因為真實的通話量並非都是順利路徑,而且根據我們的經驗,模型在無法滿足的目標上往往比在成功互動中表現更差。身份驗證。先前的研究(EVA-Bench 和 τ-Voice)已將身份驗證確定為語音助理最一致的失敗點之一。

EVA-Bench 中的每個領域都包含身份驗證流程,並且具體機制會根據任務進行校準。例如,基於一次性密碼 (OTP) 的權限提升會出現在生產系統實際需要它的地方,而不是統一應用於所有情境。可重現性。如果沒有可重現的情境,就很難知道分數差異是反映了真正的能力差距,還是情境執行方式的產物。

我們設計資料集,使每個情境都只有一個正確的解決路徑。使用者目標建構確保模擬器始終擁有其一致行為所需的信息和指令,並且情境生成明確檢查並消除了任何可能透過多個有效動作序列達成相同結果的情況。情境生成聯合生成。情境是使用 SyGra(一個基於圖形的合成資料生成管線)生成的,以 GPT-5.4 作為核心。

每個情境都需要三個聯合一致的組件,這些組件會同時生成,以防止組件獨立生成時出現的不一致性:使用者目標。可重現性要求使用者模擬器在每次執行情境時都表現相同。模糊的意圖陳述無法達成此目的:模擬器會在不同執行中做出不同的判斷,產生不一致的評估訊號。

為消除此情況,使用者目標被建構成一個決策樹,涵蓋模擬器可能遇到的所有情況。使用者目標精確指定了使用者應該要求哪些內容,以及一個協商序列,精確指定何時反駁、何時要求替代方案以及何時接受。常見的邊緣案例,例如是否接受候補航班或替代機場,都透過明確指示處理,而不是留給模擬器解讀。

解決條件要求完成動作的證據,例如確認號碼或案件編號,而不是口頭承諾,因此模擬器會持續通話直到動作實際確認。結果是使用者行為像一個一致、真實的來電者,而不是一個即興發揮的來電者。初始情境資料庫。助理工具在情境期間將查詢和修改的後端狀態。與使用者目標聯合生成,以確保使用者目標中引用的每個實體,例如預訂 ID、帳戶詳細資料和身份驗證憑證,都存在且在資料庫中保持一致。

預期最終資料庫狀態 (黃金標準)。我們透過在助理指令、使用者目標和初始情境資料庫上執行生成式大型語言模型 (LLM) 來推導預期結果,產生完整的動作追蹤。當 LLM 執行寫入工具呼叫時,資料庫會逐步更新,產生的最終狀態成為驗證器在評估期間檢查的黃金標準。

聯合生成至關重要,因為這三個組件深度相互依存。獨立生成會引入隱性不一致性,例如使用者目標中引用的案件編號在情境資料庫中不存在,這將完全破壞評估訊號。為強制一致性,我們在每次生成嘗試後運行多階段驗證迴圈,並將任何失敗回饋給生成步驟,該步驟會重試直到所有檢查通過。

驗證分三個步驟進行。結構檢查根據 Pydantic 綱要驗證情境資料庫,捕捉型別錯誤和遺失欄位。基於 LLM 的驗證器更全面地檢查情境的一致性:使用者介面上的細節是否與資料庫記錄匹配,交叉引用是否內部有效,以及身份驗證資料是否正確配置。基於 LLM 的追蹤驗證檢查完整的對話追蹤是否符合政策合規性、正確的動作排序、所有必要的終端動作的完成,以及沒有會引入非確定性的替代寫入路徑。

進一步驗證在 SyGra 生成之後,所有情境都經過多輪人工審查。審查人員驗證了:(1) 政策在領域內的情境中一致應用;(2) 使用者目標足夠具體,只允許一個正確的解決方案;(3) 預期最終狀態與使用者目標和初始資料庫內部一致;以及 (4) 對抗性情境正確指定,具有明確可識別的政策違規。

模糊或不一致的記錄被修正或捨棄。作為最後一輪,我們在每個情境的純文字版本上運行了三個頂尖模型:OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6,繞過音訊管線並直接提供對話轉錄。

對於任何模型在任務完成度上得分為零的情境,我們都人工調查了失敗是否反映了真正的模型錯誤或資料集問題:模糊的政策、未充分指定的使用者目標、工具執行器中的錯誤,或初始和預期資料庫狀態之間的不一致。發現有資料集問題的記錄被修正或移除。所有選定的樣本都至少被一個頂尖模型解決。

資料集深度解析我們在不同的企業領域創建了三個資料集,每個資料集都旨在針對語音助理的不同難度軸線。所有三個都要求透過語音精確轉錄結構化命名實體(例如,確認碼和員工識別碼),但在其主要挑戰和工具數量上有所不同。下面,我們將深入探討兩個新的資料集:企業 IT 服務管理 (ITSM) 和醫療人資服務交付 (HRSD)。

多語言支援僅限英語的評估對語音助理在其他語言中的實際表現提供的洞察有限。語音辨識準確度、轉錄保真度和對話流暢度都可能以特定語言的方式退化,這意味著在英語中表現出色的語音助理在部署到其他語言環境時可能會完全失敗。為了讓從業者真正了解多語言部署,我們正在增加對更多語言的支援,不僅調整對話語言,還將評估管線適應每個目標語言和文化:情境中引用的地點名稱使用者姓名和電子郵件地址本地化電話號碼English ScenarioFrench ScenarioUtterance: "Hi, I'm locked out and need help getting back into my account."Utterance "Bonjour, mon compte est bloqué et j’ai besoin d’aide pour y accéder à nouveau."Locations: [ "downtown", "engineering center" ]locations: [ "centre-ville", "centre d’ingénierie" ]Names: {"first_name": "Marcus", "last_name": "Chen"}Names: {"first_name": "Éric", "last_name": "Nicolas"}Email: "marcus.chen@example.com"Email: "eric.nicolas@example.com"Phone: +1-512-555-0148Phone: +33 6 19 41 27 70這使得使用者模擬器能夠以所選語言提供真實的體驗。

除了資料集之外,我們還在更新我們的指標和判斷器,以建立跨語言的可信賴評估。取得資料EVA-Bench 完全開源,採用 MIT 授權。資料集、評估框架和排行榜都公開可用。在 HuggingFace 資料集頁面下載資料集並探索個別記錄。使用 Hugging Face 資料集函式庫直接載入其中任何一個:from datasets import load_dataset# 航空客戶服務管理 (CSM),50 個情境airline = load_dataset("ServiceNow-AI/eva-bench", "airline", split="test")# 企業 IT 服務管理 (ITSM),80 個情境itsm = load_dataset("ServiceNow-AI/eva-bench", "itsm", split="test")# 醫療人資服務交付 (HRSD),83 個情境hrsd = load_dataset("ServiceNow-AI/eva-bench", "medical", split="test")每個記錄都包含結構化的使用者目標、初始情境資料庫和黃金標準預期最終資料庫狀態,運行完整機器人對機器人評估所需的一切。

有關設定說明、程式碼和貢獻指南,請參閱 GitHub 儲存庫。引用@misc{bogavelli2026evabenchnewendtoendframework,title={