我們正在 API 中推出三款音訊模型,為開發者開啟全新類型的語音應用程式。藉由這些模型,開發者可以打造更自然、回應更智慧、並能即時採取行動的語音體驗:GPT-Realtime-2,我們首個具備 GPT-5 等級推理能力的語音模型,能處理更複雜的請求並自然地推進對話。
GPT-Realtime-Translate,一個全新的即時翻譯模型,能將 70 多種輸入語言的語音翻譯成 13 種輸出語言,同時與說話者保持同步。GPT-Realtime-Whisper,一個全新的串流語音轉文字模型,能在說話者講話時即時轉錄語音。
試用 GPT-Realtime-2啟動會話後,即可與 GPT-Realtime-2 自然對話。我可以問什麼?啟動會話後,可以嘗試說出以下內容:我今晚要舉辦一場臨時晚餐派對。我只有 30 分鐘,有兩位素食朋友,一位不吃蘑菇的朋友,還有一個小廚房。
幫我規劃一個簡單的菜單。我正在日本歡迎現場活動的來賓。請用日語說一段熱情自然的歡迎詞,就像主持人為特別活動開場一樣。我的訂單號碼是 Orbit-742Q。請清楚地重複一遍,以便我確認是否正確。幫我練習告訴我的團隊我們達成了發布里程碑。先用沉著自信的語氣說,然後再用更興奮的語氣說。
我正在為公路旅行規劃益智問答。給我三個聽起來很簡單但具有欺騙性的問題,然後用一句話解釋每個答案。此演示有時間限制。使用即表示您同意 OpenAI 的服務條款並確認我們的隱私權政策。語音正成為人們使用軟體最自然的方式之一。它讓人們可以在開車時尋求幫助、在機場步行時更改旅行計畫、以偏好語言獲得支援,或在不停止打字的情況下完成任務。
然而,建立有用的語音產品不僅僅需要快速的輪流對話或自然的語音。語音代理需要理解用戶的意圖、追蹤上下文、在請求改變時進行恢復、在對話進行中運用工具,並以符合當下情境的方式回應。總體而言,我們推出的這些模型將即時音訊從簡單的問答模式,推向能夠實際執行工作的語音介面:在對話展開時進行聆聽、推理、翻譯、轉錄和採取行動。
語音作為人與產品之間的介面隨著語音成為使用軟體更自然的方式,我們看到開發者圍繞語音 AI 的三個新興模式進行開發:語音轉行動(Voice-to-action),人們可以描述他們的需求,系統可以透過請求進行推理、使用工具並完成任務。例如,Zillow 正在建立一個助理,可以聆聽、推理並根據請求採取行動,例如:「在我的 BuyAbility 範圍內尋找房屋,避開繁忙街道,並安排週六的參觀。」
系統轉語音(Systems-to-voice),軟體可以將上下文轉化為即時語音指導。例如,旅行應用程式可以主動告訴旅行者:「您的入境航班延誤了,但您仍然可以趕上轉機。我找到了新的登機門,規劃了穿過航廈的最快路線,您的行李預計仍會轉運。」語音轉語音(Voice-to-voice),AI 可以幫助即時對話跨語言、任務或不斷變化的上下文進行。
例如,Deutsche Telekom 正在建立語音支援體驗,客戶可以用他們最舒適的語言說話,而模型會即時翻譯對話。這些模式也可以協同工作。Priceline 正在努力實現一個未來,旅行者可以透過語音管理整個旅程:對話式地搜尋航班和飯店、處理變更(例如航班延誤後調整飯店預訂或獲取 TSA 等待時間的即時更新),以及在旅行者抵達目的地後翻譯對話。
即時語音:協助語音模型推理並採取行動GPT-Realtime-2 專為即時語音互動而設計,模型在對請求進行推理、呼叫工具、處理更正或中斷時,能保持對話流暢,並以符合當下情境的方式回應。開場白:開發者可以在主要回應之前啟用簡短的詞句,例如「讓我確認一下」或「請稍等,我正在查詢」,讓使用者知道代理正在處理請求。
平行工具呼叫與工具透明度:模型可以同時呼叫多個工具,並透過「正在檢查您的日曆」或「現在正在查詢」等詞句讓這些動作可聽見,幫助代理在完成任務時保持回應能力。更強的恢復行為:模型可以更優雅地恢復,例如說「我現在遇到了一些問題」,而不是默默失敗或中斷對話。
更長的代理工作流程上下文:我們將上下文視窗從 32K 增加到 128K,以支援更長、更連貫的會話和更複雜的任務流程。更強的領域理解:模型能更好地保留專業術語、專有名詞、醫療術語以及在生產環境中重要的其他詞彙。更可控的語氣和表達:模型可以更好地調整其語氣,在解決問題時平靜地說話,在使用者沮喪時富有同理心,或在確認成功操作時語氣輕快。
可調整的推理工作量:開發者現在可以從極簡、低、中、高和極高推理等級中選擇,預設為低,以平衡簡單互動的較低延遲與複雜請求的更深思熟慮推理。這些改進體現在與生產語音代理密切相關的音訊評估中:GPT-Realtime-2 (高) 在 Big Bench Audio 的音訊智慧方面比 GPT-Realtime-1.5 高出 15.2%。
GPT-Realtime-2 (極高) 在 Audio MultiChallenge 的指令遵循方面比 GPT-Realtime-1.5 高出 13.8%,顯示在即時對話中更強的推理、上下文管理和控制能力。Big Bench Audio 評估支援音訊輸入的語言模型中具有挑戰性的推理能力。
Audio MultiChallenge 評估口語對話系統中的多輪對話智慧,包括指令遵循、上下文整合、自我一致性以及處理自然語音更正。GPT-Realtime-2 的魔力體現在各種不同的使用案例中:載入即時範例…在早期測試中,企業使用 GPT-Realtime-2 建立語音代理,透過自然對話幫助客戶和員工完成任務:「GPT-Realtime-2 的突出之處在於它為複雜語音互動帶來的智慧和工具呼叫可靠性。
在我們最嚴苛的對抗性基準測試中,這意味著在提示詞優化後,通話成功率提高了 26 個百分點(95% 對 69%)。GPT-Realtime-2 在公平住房合規性方面也實質上更為穩健,這對我們的業務至關重要。代理能力和防護欄強度的結合使其在 Zillow 的生產語音應用中可行。」
,Josh Weisberg,Zillow 資深副總裁兼 AI 主管即時翻譯:建立即時多語言語音體驗GPT-Realtime-Translate 幫助開發者建立即時多語言語音體驗,讓每個人都可以用自己偏好的語言說話,並即時聽到對話翻譯和閱讀即時轉錄。
它支援超過 70 種輸入語言和 13 種輸出語言,使其適用於客戶支援、跨境銷售、教育、活動、媒體和服務全球受眾的創作者平台。對於開發者而言,即時翻譯需要保留語義,同時與說話者保持同步,即使人們自然說話、切換上下文或使用地區發音和特定領域語言。
例如,Deutsche Telekom 正在測試該模型用於多語言語音互動,其中較低的延遲和更強的流暢性可以使跨語言對話感覺更自然。在這段影片中,Vimeo 展示了 GPT-Realtime-Translate 如何在產品教育影片播放時即時翻譯,讓全球客戶可以用他們偏好的語言聽到更新,而無需等待單獨製作的版本。
「為印度建立語音 AI 意味著要處理多樣的地區語音。在我們對印地語、泰米爾語和泰盧固語的評估中,GPT-Realtime-Translate 的詞錯誤率比我們測試的任何其他模型低 12.5%,同時具有更低的後備率、更高的任務完成率和維持自然對話的延遲。
它為多語言語音 AI 樹立了新標準。」,Prateek Sachan,BolnaAI 共同創辦人兼技術長即時轉錄:建立低延遲轉錄體驗GPT-Realtime-Whisper 是一個新的串流轉錄模型,專為低延遲語音轉文字而設計。它在人們說話時轉錄音訊,因此即時產品可以感覺更快、反應更靈敏、更自然,從即時顯示的字幕,到跟上對話的會議記錄。
該模型使即時語音能夠在業務工作流程中即時使用。團隊可以為會議、教室、廣播和活動提供字幕;在對話進行中生成筆記和摘要;建立需要持續理解使用者的語音代理;並為客戶支援、醫療保健、銷售、招聘和其他高頻率語音互動建立更快的後續工作流程。安全性即時 API 整合了多層安全防護和緩解措施,以幫助防止濫用。
我們在即時 API 會話中採用主動分類器,這意味著如果某些對話被檢測到違反我們的有害內容準則,則可以終止。開發者還可以使用 Agents SDK 輕鬆添加自己的額外安全防護欄。我們的使用政策禁止將我們服務的輸出重新用於或分發用於垃圾郵件、欺騙或其他有害目的。
開發者還必須向終端使用者明確表示他們正在與 AI 互動,除非從上下文來看已經很明顯。定價與可用性GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper 已在即時 API 中提供。
GPT-Realtime-2 的定價為每 100 萬音訊輸入 token 32 美元(快取輸入 token 為 0.40 美元),每 100 萬音訊輸出 token 64 美元。GPT-Realtime-Translate 的定價為每分鐘 0.034 美元。
GPT-Realtime-Whisper 的定價為每分鐘 0.017 美元。開始使用要開始建構,請在 Codex 中開啟此提示詞,將 GPT-Realtime-2 添加到現有應用程式或啟動一個新應用程式。如果您還沒有 Codex,請先下載 Codex 應用程式。



