Meta 的 Superintelligence Labs 發表了他們首個即時語音感知模型。
它能在即時對話中轉錄語音、區分說話者,並偵測句子邊界。
Spark 系列模型將傳入的音訊分成 80 毫秒的區塊。在每個區塊之後,它會決定是繼續聆聽還是將下一個詞語輸出為文字,藉此控制在確定轉錄之前收集多少上下文資訊。
Meta 表示,等待時間越長意味著準確度越高,但延遲也越長。Muse Voice Transcribe 會根據每個詞語的難度動態調整等待時間,簡單的詞語會更快輸出,而較難的詞語則會獲得更多聆聽時間。Meta 透過強化學習訓練這種行為,同時獎勵模型實現低錯誤率和短延遲。
Meta 將其餘功能整合到同一個模型中,無需額外的獨立系統。對於說話者歸屬,模型會在運行文字中標記說話者變化,並為每個段落標記從 A 到 Z 的識別碼。對於句子邊界,它會標記每個語句的開始和結束位置。這兩項任務都與語音辨識共同訓練。
該模型可以同時區分 20 多位說話者,並處理超過一小時的錄音而無需後處理。根據 Meta 的說法,在一個有八個人在房間裡的演示中,該系統能即時將詞語分配給個別說話者。
Meta 表示,Muse Voice Transcribe 經過 70 多種語言的訓練,其中 25 種經過深入測試。該模型還能處理語碼轉換(code-switching),即說話者在句子中途切換兩種語言。關於語言、關鍵字和上下文的提示可以進一步提高準確度,特別是對於像「Meta」、「Muse」或「Menlo Park」這樣的專有名詞。
獨立評估機構 Artificial Analysis 證實了 Meta 的說法。Muse Voice Transcribe 在說話者結束說話後 0.16 秒內,英文詞錯誤率達到 3.1%。ElevenLabs Scribe v2 Realtime 的錯誤率為 3.6%,延遲 0.14 秒;AssemblyAI Universal-3.5 Pro Realtime 為 4.0%。
Cartesia Ink-2 的得分為 3.4% 或 4.0%,取決於模型是自行偵測語句結束還是依賴外部系統。競爭非常激烈。OpenAI 在五月發布了用於相同目的的 GPT-Realtime-Whisper,並在七月降低了轉錄模型的價格。
Meta 將此次發布與執行長 Mark Zuckerberg 的「個人超級智慧」(personal superintelligence)願景聯繫起來。在一次預設的演示中,Meta 員工認為可靠的語音辨識是個人 AI 代理透過 AI 眼鏡聆聽真實對話的基礎。在德國,最近曾討論禁止 Meta 的相機眼鏡,儘管德國聯邦網路局最終決定不予追究。
Muse Voice Transcribe 現已為 Meta AI 和 Muse Code 中的語音聽寫提供支援,並可透過 Meta Model API 取得。使用者可以在任何應用程式中按住「Fn」鍵來試用它。
Meta 在定價上擊敗了競爭對手。每小時 0.18 美元,或每 1,000 分鐘音訊 3 美元,它比 Cartesia Ink-2 的 4 美元以及 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux 各自的 6.50 美元都要便宜。
這延續了 Muse Spark 1.1 和 Muse Spark 1.2 的策略,Meta 選擇在價格而非頂級性能上競爭。該公司尚未披露模型的參數數量、訓練資料量或音訊資料來源,也沒有發布模型權重。
Meta 在 2025 年夏天將其 AI 部門重組到 Superintelligence Labs 旗下,招募了來自 OpenAI、Google DeepMind 和 Apple 的頂尖研究人員,薪酬方案高達四年 3 億美元。但並非所有人都留下來,有些人僅僅幾週後就回到了 OpenAI。



