半監督式聯邦學習(SSFL)利用教師模型在客戶端的未標記資料上生成偽標籤,並結合伺服器上的少量已標記種子資料集來訓練模型。然而,自動語音辨識(ASR)在此情境下特別脆弱:偽標籤錯誤會隨著輸出序列和訓練回合累積,導致模型發散,與全監督式聯邦學習之間存在巨大差距。
本研究指出,縮小這個差距取決於兩個相互關聯的設計軸線:「教師模型」(即生成偽標籤的模型)和「錨點」(即伺服器端在已標記資料上進行的更新,用以穩定訓練)。
在教師模型軸線上,每個客戶端各自演進的「線上教師模型」本身容易發散,但一旦穩定下來,它在同領域表現上能顯著超越廣播式的「全域教師模型」(一個伺服器模型,在一個回合內固定),在領域轉移下也能與之競爭。隨著種子資料集變得更強大,線上教師模型的優勢逐漸縮小,此時採用「過渡型教師模型」(在第 r 回合從全域轉為線上)則能超越前兩者。
在錨點軸線上,伺服器必須在各回合之間持續利用已標記資料進行訓練,否則線上教師模型會產生漂移;這種交錯訓練,比種子模型本身更能主導收斂。
這兩個軸線密不可分:激進的教師模型選擇,只有在錨點穩定訓練後才能發揮作用,而錨點的穩定性高度依賴於資料增強和批次大小等設定,這些設定決定了伺服器注入多少輸入和梯度雜訊。所需的穩定化程度則取決於領域,受到種子資料的分散程度及其與客戶端資料重疊程度的影響。
這些研究結果為 ASR 訓練中的 SSFL 提供了指導原則,相較於最強的既有方法,在 11 對測試中改進了 9 對,平均在同領域內提升 20.8%,跨領域提升 10.0%,顯著縮小了與全監督式聯邦學習之間的差距。
相關閱讀與更新:
自訓練(Self-training)已被證明在解決許多領域的資料稀缺問題上有所幫助,包括電腦視覺、語音和自然語言處理。具體來說,自訓練或偽標籤(pseudo-labeling)會為無監督資料打上標籤,並將其加入訓練資料池。在這項工作中,我們研究並使用了偽標籤來處理一個最近提出的新穎設定:語音的聯合轉錄和翻譯,這項任務面臨著缺乏足夠平行資料資源的問題。本論文已被「我不敢相信它沒有更好:透過實證證偽理解深度學習」研討會接受。
連續偽標籤(PL)演算法,例如 slimIPL,最近已成為語音辨識半監督學習的強大策略。與早期在訓練模型和生成偽標籤之間交替的策略不同,這裡的偽標籤是端到端生成的。



