OpenAI 正在推出 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,這是一系列旨在即時進行推論、翻譯和轉錄的新一代語音模型。
ChatGPT 已經具備語音模式一段時間,Google 也透過 Gemini 提供類似的即時對話功能。然而,這些語音互動背後的模型,相較於純文字模型,能力明顯較弱,特別是與需要時間思考問題的文字推論模型相比。
根據 OpenAI 的說法,這已不再足夠。一個現代的語音代理(agent)需要同時理解用戶的實際意圖、追蹤上下文、應對變化、使用工具並適當回應。
該公司提出了三種新的互動模式,這些模式也可以組合使用。透過「語音轉行動」(Voice-to-Action),用戶口頭描述他們的需求,系統會對請求進行推論,呼叫正確的工具並完成任務。
透過「系統轉語音」(Systems-to-Voice),軟體將上下文轉化為語音引導。例如,一個旅遊應用程式可以告訴乘客,儘管航班延誤,他們仍然可以趕上轉機,並提供前往新登機門的最快路線,同時確認行李轉運。
透過「語音轉語音」(Voice-to-Voice),AI 幫助人們跨越語言障礙進行即時對話。德國電信(Deutsche Telekom)已經在客戶支援方面測試這種模式。
OpenAI 概述了語音 AI 的三種核心互動模式:語音轉行動(Voice-to-Action)、系統轉語音(Systems-to-Voice)和語音轉語音(Voice-to-Voice)。| 圖片:OpenAI
OpenAI 表示,這些功能也將很快應用於 ChatGPT 的語音模式。該公司認為:「語音現在真的可以成為主要介面了。」
GPT-Realtime-2 透過「拖延技巧」爭取思考時間
此次發布的核心是 GPT-Realtime-2,OpenAI 表示其推論能力與 GPT-5 不相上下。該模型專為即時語音互動而設計,需要同時進行對話、思考請求、呼叫工具並處理中斷。
在技術層面,上下文視窗從 32,000 個 token 躍升至 128,000 個 token,這應能支援更長、更複雜的對話。該模型可以並行呼叫多個工具,並透過「讓我查一下」等短語讓這些動作可聽見。簡短的開場白(稱為「前導語」),例如「請稍等」,讓用戶知道系統正在處理。當出現問題時,模型不再只是保持沉默,而是會說「我現在遇到了一些麻煩」。
OpenAI 表示,該模型在處理專業術語、專有名詞和醫學術語方面優於其前身。語氣也更具可控性,在解決問題時保持冷靜,對沮喪的用戶表現出同理心,並在成功完成操作後語氣歡快。
開發者可以將推論強度調整為五個等級:極低、低、中、高和極高。預設為「低」以降低簡單請求的延遲,而較困難的任務則可以利用更多的運算資源。
在基準測試中,GPT-Realtime-2 的表現優於其前身 GPT-Realtime-1.5。在「高」設定下,它在 Big Bench Audio 上的準確度達到 96.6%,高於 81.4%。在測試多輪對話中指令遵循能力的 Audio MultiChallenge 上,「極高」變體的平均通過率為 48.5%,而之前為 34.7%。
基準測試顯示 GPT-Realtime-2 在語音推論和多輪指令遵循方面均優於其前身。| 圖片:OpenAI
即時翻譯支援 70 多種語言,即時轉錄鎖定會議與工作流程
根據 OpenAI 的說法,GPT-Realtime-Translate 是一個獨立的即時翻譯模型,支援超過 70 種輸入語言和 13 種輸出語言。它能在保持語義的同時跟上說話者的速度,即使在處理上下文切換、地區口音和專業詞彙時也能做到。其應用場景包括客戶支援、跨境銷售、教育、活動和媒體。
第三個模型 GPT-Realtime-Whisper 是一個低延遲的串流轉錄模型。它能即時轉錄語音,目標是為會議、課堂、廣播和活動提供即時字幕。團隊可以使用它在對話進行中生成筆記和摘要,建立具有連續語音理解能力的語音代理,並為客戶支援、醫療保健、銷售和招聘等領域加速後續工作流程。
定價依據 token 和分鐘數計算
這三個模型現在都可以透過 Realtime API 取得,並可在 Playground 中進行測試。GPT-Realtime-2 的費用為每百萬音訊輸入 token 32 美元(快取輸入 token 為 0.40 美元),每百萬音訊輸出 token 64 美元。
GPT-Realtime-Translate 的費用為每分鐘 0.034 美元,而 GPT-Realtime-Whisper 則為每分鐘 0.017 美元。
Realtime API 支援歐盟應用程式的歐盟資料駐留,並受 OpenAI 的企業隱私承諾保障。



