OpenAI 正式推出 GPT-Live,這是一系列新一代語音模型,旨在讓使用者與 AI 對話時,感覺更像與真人交談。GPT-Live 採用全雙工架構,意味著它能同時聽取與說話。在對話中,GPT-Live 能透過「嗯哼」或「對啊」等詞語表達專注,進行快速的來回互動,或在您需要思考時保持安靜。這帶來了令人耳目一新的語音體驗,讓對話變得異常輕鬆。
GPT-Live 也是我們迄今最智慧的語音模型。對於需要網路搜尋、深度推理或更複雜工作的問題,它會在幕後將任務委派給我們最新的前沿模型,並在準備好後將結果帶回對話中。在此過程中,GPT-Live 仍能與您持續對話,保持流暢的交流。在發布初期,GPT-Live 將在後台使用 GPT-5.5 模型。隨著我們推出新的前沿模型,GPT-Live 所使用的模型也將持續更新。
這些進展為全新的 ChatGPT 語音體驗注入了動力,使其更智慧、更自然。我們相信,隨著時間推移,這項研究也將開啟透過語音執行日益複雜、耗時更長且更具代理性質工作的能力。
我們今天開始向全球 ChatGPT 用戶推出兩個版本的 GPT-Live:GPT-Live-1 和 GPT-Live-1 mini。我們也計畫很快將其引入 API,開發者和企業可以透過此表格註冊以接收通知。
我們的願景是實現真正自然的人機互動:一個與 AI 協作時,感覺像與另一個人工作一樣流暢且反應迅速的世界,同時推理和複雜任務的執行在後台無縫進行。
舊一代的語音 AI 系統讓我們更接近這個願景,但也伴隨著重要的權衡。級聯語音系統依賴一系列模型依序處理每個回合。最初的 ChatGPT 語音將三個模型串聯起來:一個語音轉文字模型來轉錄您的語音,一個大型語言模型來生成回應,以及一個文字轉語音模型將其轉換回語音。這種方法首次讓我們能夠與前沿 AI 模型對話,但其複雜性帶來了代價:資訊可能在模型之間遺失,且回應緩慢而生硬。
級聯語音系統導致回應緩慢、生硬且停頓時間長。而像 ChatGPT 進階語音模式這類基於回合的語音模型,雖然在單一模型內處理和生成音訊,減少了延遲並使對話更流暢,但它們仍然透過離散的回合運作。模型必須等待用戶停止說話後才能回應,導致僵硬的來回對話。此外,由於回合偵測是基於靜默,即使是短暫的停頓或背景噪音也可能被誤認為回合結束,導致模型在不自然的時間點打斷對話。
基於回合的語音模型雖然回應稍快且流暢,但與模型的來回對話仍然感覺僵硬。GPT-Live 透過兩項架構變革解決了這些限制。
首先,我們利用全雙工架構為 GPT-Live 打造了連續互動能力。GPT-Live 不再處理一系列獨立訊息,而是持續處理輸入同時生成輸出。因此,模型每秒可以做出多次互動決策:是說話、繼續聆聽、暫停、打斷,還是呼叫工具。這使得模型能夠進行更自然的來回對話,更好地掌握時間感,甚至執行即時翻譯。
其次,我們將負責連續互動的 GPT-Live 與深度工作解耦。當問題需要搜尋、推理或更具代理能力的任務時,GPT-Live 可以將任務委派給另一個模型,例如 GPT-5.5。這使得它即使在後台處理多個任務時,也能保持對話的進行。
這項架構變革也讓 GPT-Live 能夠持續使用最新的模型和代理,將前沿智慧與自然互動結合。
為了更深入的工作委派,GPT-Live 提供快速、自然的反應,而 GPT-5.5 則在後台處理搜尋。我們建立了新的人工評估方法,以衡量對話的愉悅度和流暢性。在這些一對一的比較中,GPT-Live-1 和 GPT-Live-1 mini 在 5-10 分鐘的對話中,無論是整體偏好、輪流發言、打斷、對話流暢度以及互動的自然程度,都明顯優於進階語音模式。
在 GPQA 測試中,GPT-Live-1 在生物學、化學和物理學等領域的專家級科學推理方面,顯著優於進階語音模式。在 BrowseComp 測試中,GPT-Live-1 在代理式網路搜尋和尋找難以定位的資訊方面,也展現出比進階語音模式更強的優勢。
此外,在 τ³-Voice Telecom(內部變體)測試中,GPT-Live-1 在真實、多回合的電信支援任務上,表現優於進階語音模式。值得注意的是,GPT-Live-1 (instant) 和 GPT-Live-1 mini 在後台使用 GPT-5.5 Instant 模型,而 GPT-Live-1 Medium 和 GPT-Live-1 High 則使用具有中等和高度推理能力的 GPT-5.5 Thinking 模型。
每週有超過 1.5 億人使用 ChatGPT 的語音和聽寫功能進行對話。他們利用這些功能獲得免手持的日常協助、練習語言、講睡前故事,或僅僅是在通勤時聊天。
從今天起,當您點擊語音按鈕與 ChatGPT 對話時,將獲得由 GPT-Live 驅動的改進體驗,包括更自然的對話、更智慧的答案、更好的聆聽能力和視覺回應。與 ChatGPT 對話現在應該感覺更像一場真正的交談。您可以隨時打斷提問,暫停思考,或要求 ChatGPT 放慢速度。
它會自然地用「嗯哼」或「懂了」等詞語回應您所說的話,讓您知道它正在跟隨。我們也為 GPT-Live 重新製作了 ChatGPT 中九種獨特的語音。
ChatGPT 語音現在可以利用我們最新的前沿模型,在您需要時提供更智慧的答案。您還可以根據需求選擇推理等級:選擇「即時 (Instant)」以獲得快速回應,或在希望 ChatGPT 花更多時間思考時選擇「中等 (Medium)」和「高 (High)」。
如果您需要片刻思考,ChatGPT 語音現在會等待,而不是貿然打斷。如果您要求它保持安靜聆聽,它也會照做。當有背景噪音時,例如經過的車輛或附近的交談聲,ChatGPT 也能更好地專注於您的聲音,而不是分心。
有些答案以視覺呈現會更有用。在您對話時,ChatGPT 現在可以顯示豐富的視覺卡片,涵蓋天氣、股市、運動等主題。語音功能也持續支援搜尋、記憶、圖片和檔案上傳。
最終,ChatGPT 語音體驗變得更加自然、更具能力,並在日常生活中更加實用。
GPT-Live 在設計之初就以安全為預設考量。它建立在我們最新模型的安全進展基礎上,同時針對關鍵風險領域增加了專門的安全訓練,並為語音功能設計了新的防護措施。為了更好地反映人們在現實生活中使用語音的方式,我們首先擴大了安全測試範圍,納入新的音訊原生評估。
我們也創建了使用生成音訊的合成評估,以更深入地關注關鍵安全領域,借鑒了從進階語音模式中學到的經驗。這些領域包括自殘、精神病和躁狂症、對 AI 的情感依賴、暴力和性內容。內部專家也對模型進行了紅隊測試,以找出語音特有的風險。
在我們的測試中,GPT-Live 在我們評估的幾乎所有領域都表現與進階語音模式相當或更優。您可以在 GPT-Live 系統卡中閱讀更多關於我們的測試和防護措施。
由於語音對話是即時進行的,我們也建立了能在模型說話時即時啟動的防護措施。當系統偵測到潛在不安全的輸出時,它可以引導模型產生更安全的回答,顯示額外的安全訊息或資源,或在更高風險的情況下終止語音對話。對於涉及自殘的對話,我們調整了 ChatGPT 的支援流程以適用於語音,包括提供經專家審查的危機求助熱線支援。
我們設計了額外的保護措施來支援青少年用戶,並將適合年齡的行為直接訓練到模型中,以減少不當回應的風險。家長可以透過家長控制功能選擇其青少年是否可以使用 ChatGPT 語音,且在涉及潛在自殘或自殺意圖跡象的高風險情況下,相關家長可能會收到通知。
我們也正在推出長期測量和發布後監控,重點關注情感依賴,以持續增進我們的理解並完善防護措施。這將建立在我們之前關於情感使用和情感福祉的研究基礎上,幫助我們識別新興模式,並改進系統在情感敏感互動中的回應方式。
最後,GPT-Live 專為對話設計,而非語音模仿。它使用 ChatGPT 中一組預定義的語音,並設有防護措施,以防止其模仿真人的聲音。
我們致力於支持安全和福祉,並將隨著從實際使用中學習而持續加強這些保護措施。
GPT-Live 現已在全球範圍內向 iOS、Android 和 ChatGPT.com 的 ChatGPT 用戶推出。GPT-Live-1 將成為 Go、Plus 和 Pro 用戶的 ChatGPT 語音預設模型,而 GPT-Live-1 mini 將成為免費用戶的預設模型。更多可用性詳情可在我們的幫助中心找到。
我們已針對 ChatGPT 中一些最受歡迎的語言優化了 GPT-Live。對於某些語言,模型可能會有非母語口音或流暢度不足的情況。我們正積極努力改進跨語言的體驗。
在發布時,GPT-Live 暫不支援 ChatGPT 中的語音與視訊或螢幕共享功能,但我們正努力盡快推出這些功能。您仍然可以存取舊版 ChatGPT 語音,包括標準和進階語音模式,這些功能在其中可用。



