OpenAI 今日發表了全新的對話式模型,命名為 GPT-Live-1 和 GPT-Live-1 mini。該公司宣稱這些模型聽起來更自然,且能更好地處理對話輪替。它們是全雙工模型,意味著能同時說話和聆聽,讓使用者能自然地打斷對話,並實現即時翻譯等功能。
OpenAI 也將以 GPT-Live-1 mini 作為 ChatGPT 現有進階語音模式的預設替代。付費訂閱者將能使用功能更強大的 GPT-Live-1 模型。先前的模型結合了語音轉文字模型來轉錄語音、大型語言模型來生成回應,以及文字轉語音模型來傳遞最終答案。
該公司在記者會上表示,新模型解決了過去會打斷用戶說話,以及智慧程度不足以回答問題等問題。OpenAI 的新模型將在持續對話的同時,把查詢發送到最新的文字模型,例如 GPT-5.5,以進行搜尋、推理或代理功能。
OpenAI 也展示了模型可以長時間保持靜默,並吸收對話的上下文,直到被呼叫為止。此外,由於新的語音模式可存取更新的 GPT 模型,它也能以視覺格式呈現部分資訊。其他新創公司,例如從 DST 和 Lux Capital 獲得 4000 萬美元種子資金的 Monogram,也正朝向視覺回應發展,以使助理更具互動性。
該公司表示,ChatGPT 中的新語音模式旨在進行更長時間的對話。在簡報中,ChatGPT 語音產品負責人 Atty Eleti 提到,他曾在散步時與語音功能進行長達 30 到 40 分鐘的對話。
OpenAI 認為語音可能成為處理複雜工作的主要運算介面。有報導指出,該公司今年可能會推出具備 AI 功能的耳機,但 OpenAI 並未提供任何硬體產品的資訊。
Eleti 表示:「隨著時間推移,我們認為這也將解鎖將語音作為主要運算介面的能力,並管理日益複雜且長時間運作的代理工作。我們看到人們使用 Codex 和 ChatGPT 完成的那些驚人應用案例,我們認為語音可以成為未來各種工作的介面。」
過去幾年,OpenAI 一直致力於強化語音功能,讓 ChatGPT 的語音模式聽起來更自然。該公司表示,超過 1.5 億人透過語音和聽寫等功能與 ChatGPT 對話。
競爭對手也正努力讓其助理更具表現力。Apple 和 Amazon 都已更新其助理,使其更具對話性並能更好地處理上下文。由 Oculus 共同創辦人 Brendan Iribe 和 Ankit Kumar 創立的新創公司 Sesame,也推出了具備更自然對話能力的 AI 助理,同時在背景執行任務。
OpenAI 正朝著相同的方向邁進,目標是讓使用者能更長時間地免手持與其助理對話。儘管聲稱新語音模式聽起來更自然,但該公司強調其目的並非打造 AI 伴侶。它指出,新模型內建了安全防護措施,能為青少年提供符合年齡的回應,並在對話轉向自殘等話題時提供資源。
新的語音模式仍有改進空間。在展示中,當該公司展示其印地語即時翻譯功能時,助理帶有濃重的美國口音,且印地語聽起來不自然,帶有些許書面語氣。該公司表示新模式已針對「大多數常用語言」進行優化,但未具體說明是哪些語言。



