OpenAI 在三個月前推出了 Realtime-1.5,但當時影響相對有限,因為它仍基於 GPT-4o 的智慧(在 Big Bench Audio 上僅提升 5%)。然而,今天發布的 Realtime-2(在 BBA 上提升了 15.2%)展現了十足的信心,並獲得了廣泛好評:正如部落格文章所解釋,這次發布了三款模型,可以簡化為「語音輸入、語音輸出和語音對語音」。
重點不在於「語音品質」,而在於可用性。總結來說:
開場白:開發人員可以在主要回應之前啟用簡短的語句,例如「讓我查一下」或「請稍等,我正在查詢」。
平行工具呼叫和工具透明度:模型可以同時呼叫多個工具,並透過「正在檢查您的日曆」或「正在查詢中」等語句讓這些動作可聽見,幫助代理在完成任務時保持回應。更強的恢復能力:模型可以更優雅地恢復,例如說「我現在遇到了一些問題」,而不是直接失敗或中斷。
更長的上下文:從 32K 提升至 128K。
更強的領域理解能力:模型能更好地保留專業術語、專有名詞、醫療術語和其他詞彙。
更可控的語氣和表達方式:模型能根據上下文更好地調整語氣,平靜、富有同理心或樂觀。
可調整的推理程度:開發人員現在可以選擇極低、低、中、高和極高五種推理等級,其中「低」為預設值。
演示影片展示了當主要說話者與他人交談時,語音模型如何更好地調整,從而減少打斷:
2026 年 5 月 6 日至 5 月 7 日的 AI 新聞。我們檢查了 12 個 Reddit 子版塊、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。AINews 網站允許您搜尋所有過往發布。提醒您,AINews 現已成為 Latent Space 的一個版塊。您可以選擇訂閱或取消電子郵件頻率!
頭條新聞:GPT-Realtime-2 和 OpenAI 語音 AI 評論
OpenAI 在 Realtime API 中推出了三款新的即時串流語音模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。OpenAI 將 GPT-Realtime-2 定位為其「最智慧的語音模型」,為即時語音代理帶來「GPT-5 等級的推理能力」,使其能夠聆聽、推理、處理中斷、使用工具並維持更長的對話。
輔助模型則針對即時語音翻譯和轉錄:GPT-Realtime-Translate 支援從 70 多種輸入語言即時翻譯成 13 種輸出語言,而 GPT-Realtime-Whisper 則在語音產生時提供即時串流轉錄/字幕。OpenAI 表示這些模型現已在 Realtime API 中可用,而 ChatGPT 語音功能升級仍在進行中:「敬請期待,我們正在努力。」
Sam Altman 將這次發布定位為一種行為轉變:用戶在需要「傾倒」大量上下文時,越來越多地使用語音與 AI 互動,OpenAI 也正在改進 ChatGPT 語音功能。
OpenAI 及評估者直接聲明的事實
模型家族:GPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisper 現已在 Realtime API 中可用。
GPT-Realtime-2 功能:以推理為導向的原生語音對語音模型,適用於生產級語音代理;支援工具使用/動作、中斷恢復、更長的對話,以及 OpenAI 所稱的「GPT-5 等級推理能力」。
上下文視窗:社群/OpenAI 開發者評論報告 GPT-Realtime-2 語音代理的上下文為 128K;Artificial Analysis 獨立報告上下文視窗從 32K 增加到 128K,最大輸出 token 為 32K。
翻譯:GPT-Realtime-Translate 支援從 70 多種輸入語言即時語音翻譯成 13 種輸出語言。
轉錄:GPT-Realtime-Whisper 在 Realtime API 中提供低延遲即時串流轉錄,用於字幕、筆記和連續語音理解。
提示詞/控制:OpenAI 發布了一份語音提示詞指南,涵蓋推理程度、開場白、工具行為、不清晰音訊處理、精確實體捕捉以及長會話中的狀態維護。
獨立基準測試:Scale AI 報告 GPT-Realtime-2 在其 Audio MultiChallenge S2S 排行榜上名列第一,指令保留率相較於 GPT-Realtime-1.5 從 36.7% 提升至 70.8% APR,並在語音編輯/即時修復方面表現出色。
獨立基準測試:Artificial Analysis 報告在 Big Bench Audio 語音對語音推理方面達到 96.6%,在其對話動態基準測試中達到 96.1%,在「高推理」模式下平均首音時間為 2.33 秒,在「極低推理」模式下為 1.12 秒,語音處理費用保持不變,輸入每小時 1.15 美元,輸出每小時 4.61 美元。
推理程度控制:Artificial Analysis 報告可調整的推理等級:極低、低、中、高、極高,預設為「低」。
企業/產品評估:Glean 表示,在內部評估中,GPT-Realtime-2 在即時組織語音互動方面的實用性比舊版本相對增加了 42.9%。Genspark 表示其 Call for Me 代理已升級到 GPT-Realtime-2,有效對話率提高了 26%,通話中斷次數減少。
觀點/解讀/評論
支持者將這次發布描述為語音代理的「巨大進步」、即時語音的「全面勝利」,以及第一個足以用於複雜語音代理「實際工作」的語音對語音模型。
更謹慎的觀點:Simon Willison 指出,此公告並不意味著 ChatGPT 語音模式本身已升級;ChatGPT 升級「聽起來」即將到來。
介面懷疑論:Will Depue 將語音介面比作虛擬實境,經常令人興奮,但在歷史上作為介面並不具黏性,同時認為即時工具使用、邊說邊推理和即時翻譯是可能讓語音介面最終普及的功能。
更廣泛的用戶體驗樂觀主義:一些評論者將語音視為對人類而言更自然、頻寬效率更高的介面,一條通往類似 Jarvis 隨時可用的電腦代理之路,或者最終會被更高頻寬的腦機介面 (BCIs) 取代。
競爭格局:Elon Musk 推動 Grok Voice 用於客戶支援,強調即時語音支援/客戶服務自動化現已成為各實驗室的競爭領域。
GPT-Realtime-2
原生語音對語音/即時語音模型,透過 OpenAI 的 Realtime API 發布。被定位為語音代理的「GPT-5 等級推理能力」。專為能做到以下幾點的代理設計:
在對話中進行推理、使用工具/採取行動、處理中斷、在用戶修改或修復語音時恢復、透過擴展的上下文維持更長的會話。
報告的上下文:128K token,從 32K 提升。報告的最大輸出:32K token。Artificial Analysis 報告的輸入:文字、音訊和圖像。推理程度等級:極低、低、中、高、極高;預設為「低」。首音時間:極低推理時為 1.12 秒,高推理時為 2.33 秒。
定價:語音輸入每小時 1.15 美元,語音輸出每小時 4.61 美元,根據 Artificial Analysis 的說法,與之前的模型相比保持不變。對話功能:支援主要回應前的簡短開場白,例如「讓我查一下」,以及工具呼叫期間的聲音透明度,例如「正在檢查您的日曆」。
基準測試
Scale AI Audio MultiChallenge S2S:GPT-Realtime-2 位居第一;指令保留率相較於 GPT-Realtime-1.5 從 36.7% 提升至 70.8% APR;當用戶即時修復/修改語音時,語音編輯能力強大。
Artificial Analysis Big Bench Audio:GPT-Realtime-2 高變體得分 96.6%,據報導與 Gemini 3.1 Flash Live Preview High 相當,比之前最高結果高約 13%。Justin Uberti 另外總結,在 Big Bench Audio 上,相較於 GPT-Realtime-1.5 提升了 15 個百分點,接近飽和。
對話動態/全雙工基準測試子集:GPT-Realtime-2 最小變體得分 96.1%,在暫停處理和輪流發言方面表現出色。
GPT-Realtime-Translate
即時串流語音翻譯,從 70 多種輸入語言翻譯成 13 種輸出語言。OpenAI 共同創辦人 Greg Brockman 表示,即時語音對語音翻譯自公司早期以來一直是 OpenAI 預期的應用,現在任何人都可以用它來開發。Vimeo 展示了即時配音,沒有預載字幕,顯示翻譯完全即時生成。
Junling Zhang 強調了新的即時翻譯模型,並鼓勵 API 使用。Boris Power 表示即時翻譯「實際效果非常好」,並計劃定期使用。
GPT-Realtime-Whisper
人們說話時的即時串流轉錄,用於即時字幕、筆記和語音理解。Justin Uberti 將其描述為「Whisper,但現在具備即時串流功能」,並更新了演示以使用新模型。Uberti 還建立了一個延遲選擇器,在即時打字演示中揭示延遲/準確性之間的權衡。
Glean:推出由 GPT-Realtime-2 驅動的即時語音功能,基於組織上下文;內部評估顯示,相較於舊版本,實用性相對增加了 42.9%。
Vimeo:使用 GPT-Realtime-Translate 展示了即時配音,翻譯完全即時生成,沒有預載字幕。
Genspark:將其 Call for Me 代理升級到 GPT-Realtime-2;Genspark Realtime Voice 即將推出;聲稱推理更敏銳、指令遵循更嚴格、有效對話率提高了 26%,通話中斷次數減少。
Gradient Bang / 遊戲代理演示:Kyle Windland 表示,GPT-Realtime-2 是第一個足以用於其語音代理「實際工作」的 OpenAI 語音對語音模型,他在一個具備工具呼叫和子代理的複雜代理中展示了它作為船載 AI 的應用。
語音控制的市場儀表板:Levin Stanley 演示了 GPT-Realtime-2 透過意圖控制介面,「專注於 Apple」、「它在過去 30 天表現如何?」、「返回」,他認為即時中斷和推理將使用者介面循環從導航轉變為指令。
即時演示:Justin Uberti 更新了 hello-realtime 以支援 GPT-Realtime-2,並提供了電話演示號碼;Diego Cabezas 發布了 GPT-Realtime-2 的快速演示;Ray Fernando 主持了「建立即時翻譯器」的廣播。
機器人語音介面興趣:Clement Delangue 詢問誰會將新的語音功能添加到 Reachy Mini,此前他曾詢問 Gradium、Kyutai 和 ElevenLabs 等語音 AI 實驗室誰能幫助解決機器人語音使用案例。
這次發布將語音代理從「聊天機器人的語音輸入/輸出包裝器」推向全雙工、工具使用、長上下文、推理代理。技術轉變不僅僅是更好的自動語音辨識 (ASR) 或文字轉語音 (TTS);它是低延遲輪流發言、中斷處理、更長的上下文、工具呼叫透明度以及可調整的推理程度在單一即時循環中的結合。這對於客戶支援、會議、無障礙功能、即時翻譯、機器人技術、瀏覽器/電腦控制以及文字聊天太慢或不便的免手持工作流程至關重要。
最重要的工程影響是,語音應用現在需要設計為有狀態的即時系統,而不是提示詞-回應的端點。OpenAI 的提示詞指南明確引導開發人員關注推理程度調整、開場白、工具行為、不清晰音訊恢復、實體捕捉和長會話狀態管理。這表明語音代理的品質將越來越依賴於框架設計:延遲預算、中斷語義、工具呼叫使用者體驗、對話記憶和故障恢復,而不僅僅是原始模型的選擇。
剩餘的不確定性是分發。API 模型現已可用,但 ChatGPT 語音模式尚未收到升級。



