Parloa 共同創辦人 Stefan Ostwald 在公司早期曾於一間保險客服中心待了一天,當時他的團隊正在開發早期的語音體驗。他與客服人員並肩工作,不斷聽到重複的對話:密碼重設、保單問題、例行變更。他意識到其中大部分工作都可以自動化。在那次經驗之後,總部位於柏林的 Parloa 開始建構基於規則的語音代理,以自動化處理大量客戶互動。

隨著 ChatGPT 的出現,該公司轉型開發出現在的 AI 代理管理平台(AMP),其基礎是新一代模型,包括 GPT-5.4。AMP 讓企業能夠大規模設計、部署和管理客戶服務互動。團隊不再需要規劃僵化的意圖和流程,而是透過自然語言定義行為、連接內部系統,並利用內建的模擬和評估功能快速迭代。

Parloa 端到端地執行這些互動,處理從簡單路由到複雜多步驟請求的一切事務。其重點在於實際應用中的一致性,其中效能、延遲和邊緣案例都至關重要。為此,Parloa 在部署模型之前,會持續針對真實客戶情境進行測試。

「模型只有在實際應用中有效才重要。我們與 OpenAI 密切合作,研究如何讓模型足夠快速且可靠,以應對即時對話。」,Ciaran O’Reilly Ibañez,Parloa 工程經理

為企業建構者設計 AMP

Parloa 的代理管理平台(AMP)專為業務使用者和領域專家設計,讓他們無需編寫程式碼即可建構 AI 代理。「透過 AMP,我們可以讓來自不同業務部門的領域專家實際建構代理,並以更精簡、更簡單的方式連接 API。」O’Reilly 表示。

總體而言,AMP 讓品牌能夠管理整個 AI 代理的生命週期。它透過提供非技術團隊一種更簡單的方式,來定義代理在上線前的行為方式。領域專家無需編寫程式碼或繪製僵硬的意圖樹,而是以自然語言設定代理的角色、指令、工具和邊界。這種配置成為模型如何被提示以及系統在實際應用中如何運作的基礎。

一旦定義完成,代理會在部署前進行測試。Parloa 使用 GPT-5.4 等模型模擬客戶對話,其中一個模型扮演來電者,另一個則執行已配置的代理。團隊可以直接檢查這些互動,針對真實情境測試變更,並在上線前進行迭代。然後,相同的模型會用於評估這些對話,結合確定性檢查和「LLM 作為評審」(LLM-as-a-judge)的評分方式。這顯示了代理是否遵循了指令、正確使用了工具,並按預期完成了任務。

在即時對話期間,AMP 的編排層會以代理配置和對話上下文提示 OpenAI 模型,以生成回應、透過 RAG 檢索資訊,或觸發工具與客戶後端互動。Parloa 會隨著最新一代模型在實際效能上展現明顯提升,持續更新此層。對話結束後,獨立的 OpenAI 驅動工作流程會總結互動、分類客戶意圖,並根據定義的規則評估效能。

隨著代理變得越來越複雜,維護單一、龐大的提示詞變得更加困難。微小的變更可能會引入意想不到的副作用。為了解決這個問題,Parloa 引入了模組化方法。身份驗證、預訂變更或帳戶更新等任務可以分離成獨立的子代理,從而提高指令遵循能力,並使系統更容易隨著時間演進。

同時,該平台在可靠性最重要的地方整合了確定性控制。企業可以定義結構化的 API 鏈和基於事件的邏輯,以確保關鍵步驟按正確順序發生,平衡對話的靈活性與可預測的執行。

Parloa 使用 GPT-4.1、GPT-5-mini 等模型來模擬真實的客戶互動,然後再將代理上線。接著,它結合「LLM 作為評審」和確定性規則來評估這些互動。這使得團隊能夠測試邊緣案例、快速迭代,並在客戶面臨失敗之前驗證效能。

評估優先的方法

Parloa 主要與大型企業合作,在這些企業中,一致性與能力同樣重要。「當有新模型發布時,我們會用我們的基準測試套件來對其進行測試。」資深應用科學家 Matthäus Deutsch 表示。「對我們來說,事情不僅在理論基準測試中有效,而且在實際應用案例中也能運作,這一點非常重要。」

Parloa 不依賴抽象的基準測試,而是複製真實的生產代理,並讓它們通過模擬和評估流程。這些測試衡量了指令遵循的可靠性、API 呼叫的一致性、延遲以及在實際條件下的整體效能。這些評估決定了哪些模型已準備好投入生產。只有在真實客戶情境中表現可靠的模型才會被部署。「企業客戶面臨實際的遷移成本。」Deutsch 表示。「一旦系統在生產中運作,他們會保持其穩定性,只有在效益明確時才會進行切換。」

因此,即使在大規模運作下,系統在實際應用中也能表現出可預測性。在數百萬次的客戶互動中,大多數對話都能順利解決。即使通話被轉接到人工客服,也很少是因為系統故障。在一次部署中,一家全球旅遊公司將人工客服請求減少了 80%。這種評估優先的思維已成為 Parloa 的核心差異化優勢,使其能夠在不犧牲實際應用可靠性的前提下快速發展。

為全球規模的語音應用而建

語音應用引入了與基於文字聊天不同的限制。每一次互動都透過低延遲的管道運行:語音轉文字、模型推理和文字轉語音。這個管道使得延遲變得至關重要。即使模型層的微小延遲也會累積成來電者可察覺的停頓,這影響了模型的選擇和優化方式。Parloa 與 OpenAI 密切合作,為即時應用案例優化效能,重點關注延遲、回應品質和指令遵循。

團隊在將新模型迭代推向即時客戶互動之前,會持續在類似生產的環境中進行評估和壓力測試。

Parloa 獨立評估語音堆疊的每個組件:語音轉文字系統會測試詞錯誤率,特別是針對保單號碼或帳戶識別碼等敏感輸入。文字轉語音模型透過盲聽測試進行評估,以評估語音對真實使用者來說有多自然。然後將這些結果與真實客戶互動進行比對,以確保在生產環境中效能一致。語音轉語音模型目前正在評估其生產就緒性,重點關注延遲、準確性和成本。

從一開始,這些系統就是為全球部署而建構的。基準測試涵蓋多種語言,客戶遍布全球各地。這種多語言的嚴謹性既反映了 Parloa 的歐洲根源,也符合企業客戶的期望,他們要求在所有市場中都能提供一致的效能,而不僅僅是單一語言或地區。

如今,Parloa 的代理處理著零售、旅遊和保險等行業的數百萬次對話,支援的應用案例從支援自動化到電話購物等創收流程。

科技變革下的客戶旅程

Parloa 認為客戶服務正在演變為一種完全多模態的體驗。對話可能從電話開始,在聊天中繼續,並在過程中包含連結或互動元素。AMP 的設計宗旨是將其視為單一互動來處理,而不是將每個步驟視為獨立的流程。隨著時間的推移,AI 代理可能會像網站和行動應用程式一樣,成為客戶旅程的核心。隨著企業越來越多地自動化客戶互動,Parloa 專注於讓 AI 代理足夠可靠、足夠靈活、足夠值得信賴,以便在全球規模上運作。