基準測試效能與實際部署之間的落差,一直是 ASR 開發中最令人沮喪的問題之一。在標準評估中表現良好的模型,一旦遇到真實房間聲學環境,例如迴響、背景噪音和麥克風距離等因素,其行為往往會有所不同。
這些因素之間複雜的相互作用,會以純淨語音基準測試無法捕捉的方式影響效能。FFASR 排行榜正是我們量化這個落差的嘗試。
Treble Technologies 與 Hugging Face 正在推出遠場 ASR (FFASR) 排行榜,這是首個開放且由社群驅動的基準測試,旨在評估 ASR 模型在真實遠場聲學條件下的表現。排行榜現已上線,我們邀請社群提交模型、探索結果,並協助塑造未來的發展。
語音介面已遠遠超越耳機和智慧型手機的應用範圍。AI 語音助理、會議室轉錄、車載助理、人形機器人、智慧眼鏡和免手持工具等,都正在快速普及。
它們的共同點是都在聲學複雜的環境中運作:包括迴響、背景噪音、聲音重疊,以及麥克風可能距離說話者一到數公尺遠。主流的 ASR 評估範式尚未跟上這個現實。純淨、近距離麥克風的基準測試仍然是標準,雖然它們對於衡量核心辨識品質很有用,但無法預測遠場效能。
在 LibriSpeech 或其他近場資料集上表現良好的模型,一旦真實房間聲學環境介入,效能可能會大幅下降。儘管已有數項關於遠場和嘈雜語音評估的研究,例如 CHiME、URGENT 和 NOIZEUS,但社群一直缺乏一個標準化、開放的方式,能夠以持續更新的排行榜形式,一致地衡量不同模型在這種情況下的效能下降。這正是 FFASR 建立的目的。
遠場評估的一個主要挑戰是資料的可用性。僅靠實體測量來大規模收集代表各種房間類型、麥克風距離和噪音條件的遠場錄音,成本高得令人望而卻步。模擬技術使得系統性地涵蓋這些空間成為可能,並能隨著時間推移擴大覆蓋範圍,而無需相應增加測量成本。
FFASR 的另一個目標是鼓勵開發對這些條件具有明確魯棒性的模型。排行榜歷來在引導研究方向方面非常有效。透過使遠場效能可見且可比較,我們希望提高整個領域對真實世界聲學魯棒性的重視程度。
FFASR 排行榜評估模型在九種條件下的表現。其中四種決定主要排名分數的條件(截至 2026 年 6 月 22 日)為:近場(乾燥)、遠場高 SNR(高於 14 dB)、遠場中 SNR(8 至 12 dB)、遠場低 SNR(低於 6 dB)。
為了讓大家了解這些條件實際聽起來的樣子,下面的範例讓您可以聽到相同的語音,先是乾燥無響室音訊,然後與房間脈衝響應進行卷積,最後在每個 SNR 等級添加噪音。乾燥錄音與低 SNR 遠場條件之間的差異,合理地代表了排行榜正在衡量的問題規模。
另外兩欄「實驗室測量」和「實驗室模擬」作為模擬與現實驗證的軌道。排行榜還包括目前處於測試階段的移動音源分割,用於評估模型在說話者移動而非靜止時的音訊表現。這種條件反映了人形機器人、車載語音和行動語音助理等使用案例,其中說話者和麥克風之間的聲學幾何結構會持續變化。
聲學資料是透過 Treble 的混合模擬引擎生成的,該引擎結合了低頻到中頻的波基求解器與高頻的幾何聲學建模。這種方法捕捉了更簡單的模擬方法經常遺漏的物理現象:繞射、散射、干涉和模態行為。結果是模擬資料與測量到的聲學條件高度吻合,這在「實驗室測量」和「實驗室模擬」欄位中透過對兩者執行相同評估直接證實。
基準測試中包含十四個裝潢完整的房間,範圍從 20 到 470 立方公尺,涵蓋浴室、帶走廊的客廳、辦公室、教室和餐廳空間。每個聲學場景包含一位目標說話者,在無響室中錄製以避免錄音環境的迴響殘留,以及最多三個噪音源。
每個場景都包含瞬態噪音源(如咳嗽)和連續噪音源(如空調),並設定三種 SNR 等級。這種涵蓋範圍旨在反映部署語音系統實際運作的各種空間。除了 WER,排行榜還報告了每次提交的 RTFx(每推論秒處理的音訊秒數),這些都在相同條件下的 NVIDIA L4 GPU 上進行評估。在實際部署中,準確性和延遲是同等重要的,而「分析」分頁中的 Pareto 前緣圖明確展示了這種權衡。
這個基準測試是基於 Treble Technologies 專有的模擬引擎所建立的模擬聲學空間。該引擎的輸出範例可在去年發布的 Treble10 資料集中找到,該資料集建立了模擬管線並提供了遠場 RIR 以供訓練和研究。FFASR 將此基礎擴展為一個標準化的評估框架,包含一個保留的測試集、一致的正規化和自動化評分。
隨著排行榜上線,所有提交的模型都呈現出一個一致的模式:近場與遠場效能之間的差距很大,並且隨著 SNR 降低而顯著增大。在純淨乾燥語音上的近場 WER 值,與相同模型在既有基準測試上取得的結果相當。然而,低 SNR 下的遠場 WER 卻大相徑庭,通常高出數倍。這個基準測試使得這種效能下降變得可見且可比較,這在專有評估管線之外是難以實現的。
平均 WER 對 RTFx 的 Pareto 前緣圖也很有啟發性。目前的提交模型中,代表了真正多元的方法:有些模型以犧牲部分準確性來優先考慮速度,有些模型則以犧牲吞吐量來追求準確性,還有少數模型在這兩個軸向上都取得了競爭力。相較於純淨語音準確性,將這些權衡與遠場準確性一起視覺化,會呈現出系統之間真正差異的實質不同面貌。「分析」分頁值得在主排名表之外進一步探索。
對於開發者而言,一個值得強調的觀察是:排行榜並列報告了近場(乾燥)和遠場的 WER。這種區分是刻意且有用的。這使得區分真正準確的模型與準確但對聲學條件脆弱的模型成為可能,這對於決定是否投資於遠場微調、語音增強預處理,或完全不同的架構至關重要。
開啟 FFASR 排行榜上的「提交」分頁,貼上 Hugging Face 模型 ID,評估將在伺服器端針對保留的資料集執行。該管線支援 Whisper 變體、IBM Granite Speech、Cohere Transcribe、Wav2Vec2 和 HuBERT CTC heads、SpeechBrain ASR,以及 Hub 上大多數其他 ASR 架構,無需任何自訂配置。
對於使用更複雜推論堆疊的團隊,包括將語音增強與 ASR 結合的系統,自訂評估器選項允許您定義自己的 evaluate() 函數。自訂評估器在經過審核後會在 Hub Jobs 上運行,提交備註欄位是記錄任何預處理步驟的好地方,以便其他人可以解釋結果。
保留的評估集使用了 2,000 個無響語音樣本,涵蓋 14 個房間和三個 SNR 等級,每個條件約 8 小時的音訊,並一致應用 Whisper 風格的文字正規化。音訊不向提交者公開,以避免測試集污染。
我們正在積極探索未來軌道的條件包括多說話者情境(多個說話者同時活躍)、麥克風陣列評估(涵蓋波束成形和空間濾波方法),以及迴聲消除(適用於任何在播放音訊同時也進行聆聽的設備)。
我們接下來會開發什麼,將取決於社群告訴我們哪些方面的差距最大。如果您在部署環境或使用案例中,目前的基準測試未能充分代表,我們希望聽到您的聲音。FFASR 排行榜旨在成長,其發展方向應反映實際需求。
提交您的模型,探索「分析」分頁,在 FFASR 論壇上發表您的想法和建議,並幫助我們建立一個對該領域正在解決的問題真正有用的基準測試。



