OpenAI 週四表示,其 API 將整合多項全新的語音智慧功能,旨在協助開發者打造能夠與使用者進行對話、轉錄和翻譯的應用程式。
該公司全新的 GPT-Realtime-2 是一個語音模型,旨在建立逼真的語音模擬,能與使用者進行對話。然而,與其前身 GPT-Realtime-1.5 不同的是,GPT-Realtime-2 採用了 OpenAI 所稱的 GPT-5 級推理能力,專為處理使用者更複雜的請求而設計。
該公司也推出了 GPT-Realtime-Translate,顧名思義,這項功能旨在提供即時翻譯服務,能夠在對話中「跟上」使用者的語速。此功能支援超過 70 種輸入語言(即其能理解的語言)和 13 種輸出語言(即其能轉述給說話者的語言)。
最後,該公司還推出了一項新的轉錄功能 GPT-Realtime-Whisper,它能為使用者提供即時語音轉文字的能力,在互動發生時同步捕捉語音內容。
該公司表示:「我們推出的這些模型,將即時音訊從簡單的問答模式,推向真正能執行任務的語音介面:在對話展開時,進行聆聽、推理、翻譯、轉錄並採取行動。」
這些更新對誰有益?顯而易見的目標是希望擴展客戶服務能力的公司。然而,OpenAI 也指出,其新功能將有助於廣泛的領域,包括教育、媒體、活動和創作者平台等。
儘管這些工具從企業角度來看似乎非常實用,但也可能被濫用。該公司表示,已建立防護措施,以防止其新功能被濫用於製造垃圾郵件、詐騙或其他形式的網路濫用。OpenAI 指出,系統中已嵌入特定觸發機制,以便「如果對話被偵測到違反我們的有害內容準則,即可終止」。
所有新的語音模型都已整合到 OpenAI 的 Realtime API 中。GPT-Realtime-Translate 和 GPT-Realtime-Whisper 按分鐘計費,而 GPT-Realtime-2 則按 token 消耗量計費。



