基準測試決定了產品的發展方向。在 Open ASR 排行榜上表現優異的模型會被採用並持續迭代,而排行榜未測量的能力則往往得不到改進。
排行榜近期的大部分工作都致力於提升評估指標的可靠性,包括保留的私有分割資料集、基準擬合分析(用於量化模型重現參考文本的程度),以及彌補正規化器中的不足,確保正確的預測或變體不會受到懲罰。
所有這些努力都讓單一指標(詞錯誤率 WER)更難被操縱。然而,它仍然只是一個數字。長期以來的研究表明,ASR 的錯誤率在不同使用者之間分佈不均。
自動語音辨識中的種族差異研究發現,商業系統對黑人說話者的表現大約是白人說話者的兩倍差。另一項「量化自動語音辨識中的偏見」研究則發現了性別、年齡和口音方面的進一步差異。這些資訊在排行榜上都無法顯示,並非因為排行榜刻意隱藏,而是因為其測試集只記錄了說了什麼,幾乎沒有記錄是誰說的。
為彌補這一差距,我們在 Open ASR 排行榜中引入了兩個新的評估集:Monsoon en-IN 和 Monsoon hi-IN。印地語(Hindi)擁有超過五億使用者,是目前僅涵蓋歐洲語言的多語言標籤頁中,首個被納入的印度語系語言。
每個資料集都包含一個公開分割版本(可用於自我評分)和一個私有分割版本(用於限制針對基準測試的優化)。這四個分割資料集包含 4,888 位獨立說話者,每位說話者都記錄了 12 項屬性。
測試集只能揭示其所涵蓋變數範圍內的失敗模式。大多數基準測試都是利用現有的音訊資料建立的。Monsoon 資料集則旨在涵蓋九個維度:地理、年齡、性別、詞彙、設備、聲學環境、語音類型、語速,以及同一音訊存在多個有效轉錄文本的情況。
這些維度解釋了為何總體詞錯誤率(WER)可能在平均上是正確的,但對特定人群卻是錯誤的。其資料收集方法也依循此原則:地理多樣性來自於在數百個地區招募參與者,而非在少數地點進行長時間錄音。
設備和聲學條件則來自貢獻者使用自己的手機和網路連線,在室內外進行錄音,而非在安靜房間內使用提供的硬體。詞彙、語音類型和語速則來自提示詞:日常話題促使貢獻者表達意見、異議、敘述和回憶,這些情境會出現專有名詞、數字和未經排練的措辭。
年齡和性別按說話者記錄並經過驗證。多個有效轉錄文本是參考文本的屬性而非音訊的屬性,這將在後續章節中討論。
四個分割資料集、兩種語言,透過一個管道收集。
這些資料來源於未經腳本的雙聲道自發性對話,每個片段從單一聲道中分割出來,以確保每個片段只有一位說話者。除了表格中列出的欄位外,每個片段還記錄了職業、教育背景、婚姻狀況、收入區間、手機品牌、目前居住城市以及在目前地區居住的年數。
以下是來自公開印度英語分割資料集的五個片段及其攜帶的元資料範例:29 歲女性,來自 Tripura 邦的 West Tripura 區。學生,使用三星 SM-G781B 手機。32 歲女性,來自 Madhya Pradesh 邦的 Satna 區。
失業,使用三星 SM-E146B 手機。22 歲男性,來自 Bihar 邦的 Rohtas 區。學生,使用 motorola moto g54 5G 手機。27 歲女性,來自 Telangana 邦的 Warangal 區。失業,使用 vivo V2247 手機。
57 歲男性,來自 Puducherry。從事私人工作,使用小米 M2006C3LI 手機。
英語資料集使用標準字串參考,排行榜的正規化器會將大多數拼寫變體合併。然而,印地語的變體更多,且沒有正規化器能夠解決,因為這些變體並非兩種約定之間的固定映射。
因此,印地語資料集提供了一個「格狀結構」(lattice):對於轉錄文本的每個區段,都提供一份被接受為正確的拼寫列表。
Monsoon 資料集以小時計算時數雖少,但以說話者數量計算則非常龐大。這就是其設計理念,也是其大部分價值所在。除了上述欄位外,說話者的集中度和多樣性也值得關注。
由此產生了三個特性,每個都關乎變異性而非總量。沒有單一聲音主導分數:前十大貢獻者僅佔總時長的 2.8% 到 6.8%,且超過一半的說話者只出現過一次。Monsoon 上的結果是數百種不同聲音的平均值,而非少數幾位說話者長時間錄音的結果。同等時長的測試集通常採用相反的建構方式。
沒有單一地區或手機主導:印度英語公開資料集涵蓋了 30 個邦和聯邦屬地的 428 個原生地區;印地語資料集作為印地語帶的語言,雖然集中度較高,但仍涵蓋 202 到 295 個地區。
錄音來自 315 到 582 種不同的設備型號,沒有任何單一型號在任何子集中佔比超過 2.1%。在標準化硬體上收集的語料庫容易過度擬合單一麥克風響應;而 Monsoon 則不會。
此處的印度英語並非單一口音:這是全國各地所說的英語,而非單一地區的英語。所有六個區域都有代表:在公開資料集中,35% 的片段來自南方說話者,18% 來自東方,18% 來自中部,16% 來自北方,11% 來自西方。這種分佈所帶來的口音變化記錄在元資料中,而非僅僅聲稱。
Monsoon 資料集每個片段包含 18 個欄位,其中 12 個是元資料,而大多數公開 ASR 測試集僅提供識別碼、轉錄文本和時長。人口統計欄位完整或接近完整;貢獻者已同意此類使用。
這兩種語言具有不同的地理分佈形態,這種形態提供了豐富的資訊。印地語資料集集中在印地語帶,其中北方邦約佔說話者的 40%,這符合按人口抽樣的印地語語料庫應有的樣貌。
印度英語資料集的分佈則更為扁平:沒有任何一個邦的佔比超過 13%,且三分之一的說話者來自八個最大邦之外。公開和私有資料集在這兩方面都高度匹配。
印度的邦界是沿著語言界線劃定的,因此地區和邦別確實帶有真實的口音訊號,這也是為何這些欄位被公開而非被概括的原因。針對印度 ASR 的大規模分析已報告過此類研究:地區層級的錯誤率範圍約為 4% 到 44%,其中代表性不足的地區遠落後於印地語帶和大都市,此外還有按音訊品質、語速、語句時長、性別、年齡和設備進行的細分。
這些分析是在封閉基準測試上進行的。Monsoon 則使得在公開排行榜測試集上進行同類分析成為可能。
廣泛的地理覆蓋需要從數百個地區招募參與者,而非從少數說話者那裡進行長時間錄音。這種大規模的分散式招募會引入小型資料集不會面臨的失敗模式:例如貢獻者作弊、提交預錄音訊而非即時語音,以及粗心大意的標註。每個問題都透過明確的檢查來解決。
招募與錄音:貢獻者透過 Voice Arena 社群招募,這是一個全球數位平台,其影響力延伸至語音語料庫鮮少涵蓋的農村和半城市地區。參與者成對透過點對點介面,以雙聲道方式錄製關於指定日常話題的兩人對話。
貢獻者使用自己的手機和網路連線。其中許多是低階設備,網路頻寬不穩定,這也是為何發布的音訊中保留了這種條件,而非將其濾除。潛在貢獻者在獲得錄音權限前需完成語言能力篩選,並獲得報酬,同時提供知情同意書,涵蓋資料用於訓練和分發。
每位說話者的錄音時長設有上限,根據語言的人口規模和說話者的地理分佈進行校準,以防止少數多產貢獻者主導某種語言或地區;這些資料集中超過一半的說話者只貢獻了一個片段。
引導:大規模引導自發性語音本身就存在困難,因為貢獻者在沒有結構化指導的情況下往往會產生簡短稀疏的回應。因此,每次對話都以開放式敘事提示詞開頭,並逐步揭示後續問題,涵蓋旅行、醫療保健、農業、教育和數位服務等領域。
這引導對話走向更詳細的描述,而無需腳本。候選話題由大型語言模型生成,然後由母語語言學家審查和在地化。
品質控制:每段錄音在轉錄前都經過一系列的把關檢查。使用在超過 30 種語言的人工標註資料上訓練的語言識別模型,驗證了口語與指定語言是否一致。說話者性別則使用專用分類器與自報標籤進行確認,作為自報資訊的佐證而非替代。
另一個模型則區分了真實的自發性對話與預錄或播放的音訊。訊號雜訊比估計移除了清晰度受損的錄音,同時故意保留了自然的環境背景噪音,以維持真實語音的聲學真實性。
通過這些檢查的錄音透過語音活動檢測進行分段,在兩秒的連續靜音處或在 15 秒的軟性上限(在下一個檢測到的靜音處結束)處分割。分段獨立應用於每個聲道,因此每個片段都是單一說話者和單一聲道。隨後,這些片段還通過了 DNSMOS P.808 檢查。
轉錄:參考轉錄文本是人工完成的。初稿由內部 ASR 模型生成,這些模型均未出現在任何公開排行榜上,因此任何在這些資料集上評估的系統都未曾貢獻其用於評分的參考文本。隨後的每個階段都由母語語言學家在嚴格分工的五級協議下執行,其中每個校正輪次之後都會進行獨立的審查。



