每次語音互動都有其延遲預算。當使用者聽到您的應用程式回應時,寶貴的毫秒已經花費在擷取音訊、語音轉錄、執行大型語言模型(LLM)、檢索上下文和生成回應上。文字轉語音(TTS)是最後一個步驟,也是使用者最容易察覺的環節。如果語音生成速度緩慢,整個體驗就會顯得遲鈍。

您能自行執行和調整的管線部分越多,就能取回越多的延遲預算。語音 AI 發展迅速。整合式語音模型提供簡便性,只需一個 API 呼叫,輸入音訊即可輸出音訊,但這犧牲了為特定領域微調每個組件、在模型發布時替換更好的模型、強制實施資料在地化,以及精確了解延遲來源的能力。為了獲得更多控制權,級聯式架構(專為 ASR、TTS 和 LLM 設計的組件協同運作)可讓每個層級獨立調整並部署在您擁有的基礎設施上。

NVIDIA Magpie 多語言 TTS 正是為此而生。憑藉其開放權重、生產就緒的 NVIDIA NIM,以及對 12 種語言的支援,您可以在自己的基礎設施內部部署多語言語音功能,針對您的工作負載優化延遲,並為您的領域客製化模型,在您自己的環境中實現端到端控制。

最新版本擴展了多語言覆蓋範圍,新增了現代標準阿拉伯語、韓語和巴西葡萄牙語,同時透過更新的訓練資料和模型改進,提升了許多現有語言的品質。無論您是開發客戶支援助理、醫療保健助手、企業協作工具、翻譯系統還是對話式 AI 應用程式,Magpie 都為生產級語音 AI 提供了開放的基礎。

如今的語音應用程式不再只服務單一語言。全球客戶支援、企業助理、醫療保健文件、零售自動化和翻譯工作流程,越來越需要跨多種語言進行自然對話,同時還要保持低延遲。支援更多語言只是挑戰的一部分。開發者還需要能夠:在資料所在地部署、符合企業隱私要求、客製化發音和語音、預測生產工作負載下的延遲,以及在自己的基礎設施上擴展。開放模型改變了所有這些方面的可能性。

Magpie TTS 多語言模型是一個擁有 3.64 億參數的開放權重模型,支援英語、西班牙語、法語、德語、義大利語、越南語、普通話、印地語、日語、現代標準阿拉伯語(新增)、韓語(新增)和巴西葡萄牙語(新增)。每種語言都透過共享的多語言說話者表示,包含男性和女性說話者語音。

此版本還透過 IPA 字素到音素處理和自訂發音詞典,擴展了印地語和日語的語碼轉換支援,提高了多語言靈活性,使其更容易準確發音姓名、技術術語和混合語言內容。開發者無需為不同地區維護單獨的 TTS 模型,可以在單一開放基礎上構建多語言應用程式。

在對話式 AI 中,文字轉語音是使用者聽到回應之前的最後階段。這使得「首次音訊時間」(TTFA),即語音生成開始到第一個音訊到達使用者之間的延遲,成為語音管線中最重要的延遲指標之一。由於 Magpie TTS 可以部署在您自己的環境中,您測量的延遲是您實際控制的伺服器端延遲,不包含託管服務的往返時間。

在 B200 上,Magpie 的 TTFA 僅為 32 毫秒,將剩餘的延遲預算留給 ASR 和 LLM 處理,使總端到端延遲保持在自然對話所需的 200 毫秒以內。在 NVIDIA GPU 上,Magpie 在單一串流下可在 32-79 毫秒內提供首次音訊。

在 64 個並行串流下,B200 達到 239 毫秒的 TTFA,同時提供 320 倍即時吞吐量,即使在並行負載下,生成音訊的速度也比播放速度快 300 多倍。上表顯示了 Magpie 作為 NVIDIA NIM 服務的效能,在本地測量,NIM 是運行在您自己 GPU 上的優化容器。

Hugging Face 上的開放檢查點是相同的模型,是您進行研究和微調的途徑;NIM 是經過調整的服務堆疊,可產生這些生產級延遲。兩者都運行在您控制的硬體上。

由於模型運行在您自己的基礎設施上,您可以直接基準測試效能,針對您的部署進行調整,並根據您的工作負載進行擴展。對於即時語音助理而言,這就是對話感覺反應靈敏與感覺延遲之間的區別。

低延遲並非偶然。Magpie 引入了兩項互補的架構改進,在保持語音品質的同時減少了推論時間。首先是「幀堆疊」(Frame stacking),解碼器在每個解碼步驟中預測兩個音訊幀而非一個,這將解碼器迭代次數減少一半,縮短了生成時間並提高了吞吐量。

其次是「局部變換器」(Local transformer),單獨的幀堆疊會因同時生成的碼本標記之間引入依賴關係而降低音訊品質,而局部變換器則對這些依賴關係進行建模並精煉生成的音訊,恢復了幀堆疊可能犧牲的品質。這些技術共同實現了更快的生成速度和自然的語音合成。

該架構在 ICASSP 2026 論文《Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation》中有所描述。

此版本不僅增加了語言支援,還改進了許多現有語言的合成品質。與前一版本相比,Magpie 在多種語言上顯示出更低的字元錯誤率(CER)和更高的說話者相似度(SSIM),其中法語和西班牙語的提升最為顯著。新加入的阿拉伯語(1.62% CER)、韓語(2.69%)和巴西葡萄牙語(2.91%)模型為未來的改進奠定了基準品質。

雖然客觀指標有助於衡量進度,但語音品質最終是感知上的。您可以在 NVIDIA Build 或 Hugging Face 演示中親自體驗差異。

可測量的延遲很有用,但可控制的延遲更佳。開放權重賦予開發者部署自主權。透過 Magpie,您可以:在您控制的基礎設施上部署,完全在您自己的基礎設施中運行,包括私有或氣隙環境。掌控您的延遲預算,沒有託管服務的往返時間,您可以直接針對您的硬體和工作負載進行優化。

客製化發音和語音,使用 NeMo 為您自己的品牌、領域詞彙或說話者資料進行微調。根據您的需求進行擴展,為您的基礎設施和工作負載優化服務堆疊。維持企業控制,將敏感對話和客戶資料保留在您的環境中。對於構建生產級語音 AI 的企業而言,這種對部署、效能和客製化的控制通常是最重要的。

生產環境中的語音 AI 是一個模型系統,而非單一模型。Magpie TTS 是 NVIDIA Nemotron 語音助理開發者範例的一部分,這是一個參考實作,展示了專用語音、語言和推理模型如何協同運作,形成一個協調系統,讓您能夠構建始終在線的語音助理,而不僅僅是聽起來更好的語音。

開發者可以結合:用於串流語音辨識的 Nemotron Speech、用於自然多語言語音合成的 Magpie TTS、用於推理、工具呼叫和多模態理解的 Nemotron 語言和多模態模型、用於 GPU 優化、生產就緒推論微服務的 NVIDIA NIM,以及用於客製化和微調的 NeMo。

Nemotron 語音助理開發者範例提供了一個端到端的參考實作,開發者可以在數小時內複製、客製化和部署。它包括以下生產模式:即時可打斷(barge-in)對話、具備視覺理解的多模態語音助理、多代理協調和工具呼叫、多語言語音互動,以及使用 NVIDIA NIM 實現的亞秒級端到端延遲。

開發者無需從頭組裝單個組件,可以從完整的參考架構開始,並將其應用於自己的應用程式。

開始使用。試用模型:NVIDIA Build、Hugging Face 演示。部署到生產環境:NVIDIA Magpie 多語言 TTS NIM,優化推論容器。為您的領域客製化:NVIDIA NeMo Speech,微調和訓練。構建完整的語音助理:NVIDIA voice-agent-examples。

開放權重和許可:Hugging Face 上的模型卡,在 NVIDIA 開放模型許可下提供開放權重。推薦的推論配置:cfg_scale = 2.5(無分類器引導,提高以更嚴格地遵循文本)、temperature = 0.6、top_k = 80、apply_attention_prior = True、prior_epsilon = 0.1。