開源語音合成(TTS)模型的發布速度驚人,截至 2026 年 9 月 30 日,Hugging Face Hub 上已有超過 8,000 個 TTS 模型。然而,模型評估卻未能跟上腳步,仍處於分散且缺乏標準化的狀態。

人類偏好分數(如 MOS 或 MUSHRA)是業界公認的黃金標準,為此,一些競技場式的排行榜已成為社群有用的參考點,包括 TTS Arena v2、Artificial Analysis 和 Voice Arena。這些競技場透過讓使用者比較兩個模型的 TTS 輸出並選擇其一來進行評估,收集足夠票數後,再利用 Elo 分數來對模型進行排名。

儘管人類偏好是最終的決定因素,但競技場式的評估方式難以擴展,無法跟上 TTS 模型發布的速度。這或許解釋了為何開源模型在這些排行榜上的代表性不足:截至 2026 年 9 月 30 日,Artificial Analysis 上的 92 個模型中只有 16 個是開源權重模型,Voice Arena 也存在類似的偏斜。

這可能反映了實際操作的因素:新增 API 模型只需一個 API 金鑰,而開源模型則需要由競技場營運商託管和提供服務;此外,商業供應商比開源作者更有動機尋求排名。競技場式評估的另一個限制是投票者的一致性:沒有任何競技場能確保相同的投票者以相同的「更好」標準,能夠持續地評估模型。

為此,我們建立了 Open TTS 排行榜,它利用客觀指標來評估模型在不同性能面向上的表現。

這些指標包括「語音清晰度」:使用 Qwen3 ASR(Open ASR 排行榜上排名最高的開源模型)計算提示詞與生成音訊轉錄之間的字詞錯誤率(WER)或字元錯誤率(CER)。還有「速度」:針對 H200 GPU 上的批次離線推論,計算即時因子倒數(RTFx);以及針對 H200 GPU 和 CPU 上串流批次大小為 1 的延遲,量化首音時間(TTFA)。

「說話者相似度」則是透過計算生成音訊與參考音訊片段的 WavLM 說話者嵌入之間的餘弦相似度(SIM)來衡量。藉由依賴客觀指標,模型評估時間從數週(收集投票)縮短到數小時。

重要的是,Open TTS 排行榜並非取代人類偏好排名。基於 ASR 的 WER 提供了語音清晰度的代理指標,而說話者相似度則估計了語音身份的保留程度。兩者都無法直接衡量語音的自然度、表達力或聽眾偏好。

然而,它們甚至可以為基於投票的排行榜提供資訊,指導其應納入哪些模型進行評估。我們希望這個排行榜能由社群共同塑造;我們期待聽到您的回饋,以確保評估保持相關性和洞察力。接下來的幾個部分將概述 Open TTS 排行榜的主要功能。

在排行榜的預設視圖中,模型根據 Seed TTS Eval 和 CV3 Eval(零樣本)的英文資料集上的巨集平均 WER 進行排名。hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 在這兩個英文資料集上的平均 WER 表現領先,而 Pareto 圖則視覺化了模型在 WER、批次推論(RTFx)和模型大小之間取得的平衡。

英文性能不一定能轉化為其他語言的表現。使用者可以切換多種語言,以評估模型在多語言環境下的性能。Seed TTS Eval 僅提供英文和中文音訊,因此其他語言的得分僅來自 CV3 Eval(零樣本)。請注意,中文、日文和韓文是基於字元的語言,因此報告的是字元錯誤率(CER),而跨語言的「平均 WER」是跨語言的巨集平均值。

k2-fsa/OmniVoice、fishaudio/s2-pro 和 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 是強大的多語言模型。透過切換「聲音複製」功能,可以比較支援此功能的模型(在選定的語言上)。

此外,表格中會出現一個用於說話者相似度的 SIM 欄位,以及另外兩個 Pareto 圖,用於視覺化 SIM、批次推論和模型大小之間的權衡。某些模型的平均 WER,例如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2,在提供參考音訊進行聲音複製時會有所改善。

數字僅能說明部分情況,如前所述,人類偏好才是最終的決定因素。在「聆聽」分頁中,您可以比較生成音訊的輸出,這些輸出是衡量指標背後的實際成果,讓您找出自己偏好的模型!

您可以選擇感興趣的語言/資料集,是否要比較聲音複製功能,並可選擇特定模型或聆聽隨機選取的輸出。「聆聽」分頁填補了現有 TTS 排行榜的一個重要空白:提供一個空間來探索各種模型的輸出。您甚至可以對生成的輸出提供回饋。隨著我們從社群收集到更多投票,我們可能會將這些數據納入排行榜中。所以,請踴躍投票!但請使用您的 Hugging Face 帳戶登入,以幫助我們過濾垃圾訊息和機器人。

「串流」分頁比較了模型的串流能力。模型根據 TTFA(首音時間)進行排名,該指標量化了使用者在探測模型後,需要等待多久才能獲得可播放的音訊。這對於語音助理和其他互動式應用程式非常重要。

對於串流模型(在「串流 API」下顯示 ✅),TTFA 是指第一個音訊區塊到達的時間。對於非串流模型,則是整個語句生成完成的時間,因為在此之前無法開始播放。每個模型都以批次大小為 1 的方式,在相同的硬體上,使用 CV3-Eval 中的 50 個英文提示詞,並以其預設語音運行。我們捨棄前 3 次運行作為暖機,並報告其餘運行的 TTFA 中位數。

預設視圖比較了 H200 GPU 上的性能。對於一小部分(但正在增長)的模型,也提供了 CPU 上的結果!kyutai/pocket-tts 是一個在 GPU 和 CPU 上都表現出色的串流模型!

Open TTS 排行榜的目標不僅是跟上 TTS 模型發布的驚人速度,更希望由社群共同塑造;我們期待聽到您的回饋,以確保評估保持相關性和洞察力。請告訴我們您希望看到哪些資料集、模型和指標!

目前,我們專注於開源模型,以推廣許多被競技場式評估所忽視的優秀模型;以及多語言支援,因為英文性能不足以代表其他語言。我們很快就會開源評估腳本,就像 Open ASR 排行榜儲存庫一樣,以便您可以透過 GitHub Issues 和 PRs 直接提供您的回饋和建議!讓我們一起塑造 TTS 評估的未來吧!