Google DeepMind 今日隆重推出 Gemini 3.5 Transcribe,這是我們迄今最精準的語音轉文字模型,專為智慧語音互動而設計。與傳統語音辨識模型不同,Gemini 3.5 Transcribe 能克服背景噪音、複雜術語和語句不流暢等挑戰,直接將原始音訊轉換為精確、潤飾且格式化的文字。
目前,消費者已在 Gemini App 和 Android 等產品中體驗到這款轉錄模型帶來的全新語音功能,例如 Android 上的 Rambler 和 macOS 上的 Gemini App。現在,開發者也能透過 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,利用 Gemini 3.5 Transcribe 打造類似的功能。
我們設計 3.5 Transcribe 旨在無縫融入您的開發者工作流程,無論您是建構語音助理、即時字幕工具,還是通話後分析流程。此模型透過兩個獨立的 API 提供服務:
即時串流:透過 Live API 使用 gemini-3.5-transcribe-live,為互動式語音應用程式提供連續、雙向串流,延遲時間低於一秒。
預錄音訊處理:透過 Interactions API 使用 gemini-3.5-transcribe,轉錄錄音、會議、通話記錄等,並提供說話者歸因和字詞級時間戳記。
Gemini 3.5 Transcribe 旨在捕捉您的自然說話風格,以更好地理解您的意圖並辨識自訂詞彙,讓您能透過語音執行任務。其智慧轉錄功能可無縫處理自我修正(例如「我們週二見,不,週三」)、去除贅字(如「嗯」和「啊」),並自動格式化您的文字。
此模型還支援函式呼叫,可將複雜任務(例如圖像生成和檔案分析)委派給其他 Gemini 模型處理,目前已在 Gemini macOS App 中提供。在精準度方面,根據 Artificial Analysis 的測量,其串流使用情境的平均詞錯誤率(WER)為 4.0%,非串流使用情境為 2.6%。它在嘈雜的真實環境中表現出色,能精確捕捉郵遞區號和訂單 ID 等字母數字實體。
此外,Gemini 3.5 Transcribe 支援自訂詞彙,能辨識專業術語和特殊拼寫,並無縫調整轉錄內容以符合您提供的詞彙。它還具備全球語言支援能力,可自動偵測並轉錄超過 85 種語言,無縫處理不同地區的口音和方言。對於預錄音訊,它能精確歸因最多三位說話者的語音,並提供時間戳記(支援三位以上說話者為實驗性功能)。
Gemini 3.5 Transcribe 的效能相較於我們之前的轉錄模型 Chirp 3 有了重大進步,提供了新功能、更低的詞錯誤率和顯著改善的延遲。根據 Artificial Analysis 的測量,最終轉錄時間縮短了 70%。在 FLEURS 基準測試中,針對一系列主要語言和地區,該模型提供了精準的多語言效能,優於 Chirp 3,在串流模式下詞錯誤率為 5.50%,非串流使用情境下為 5.04%。
除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,3.5 Transcribe 更超越標準語音轉文字功能,讓您在 Google 產品中的工作體驗更加自然直覺。透過將情境感知理解直接帶入 Gboard、Antigravity、Gemini App 和 Chrome 等日常介面,它能輕鬆捕捉語氣、意圖和即時編輯。
在 Android 上的 Gboard 中,透過全新的 Rambler 功能,3.5 Transcribe 能將口述想法轉化為格式良好的文字,並過濾掉贅字。您還可以透過語音進行編輯、修正拼寫錯誤和更改寫作風格。在 Google Antigravity 中,3.5 Transcribe 經您許可後,會結合螢幕情境和聊天記錄,確保檔案名稱、助理想法和活動文件中的轉錄精準度。
在 Google AI Studio 中,您可以在 Build 模式下存取 3.5 Transcribe,透過語音即時編寫應用程式。
在 macOS 上的 Gemini App 中,3.5 Transcribe 不僅能將您的自然口語轉錄為清晰格式化的文字,還能啟用語音指令,與螢幕情境無縫搭配,以驅動複雜的工作流程。透過在後台呼叫其他 Gemini 模型來處理繁重任務,該模型讓您只需語音即可輕鬆總結本地檔案、跨應用程式重複利用文字或在游標處生成圖像。
即將在 Chrome 中推出,您將能夠在任何網頁欄位中語音輸入,讓您更自然、更輕鬆地透過語音聽寫回覆、撰寫貼文或向 Chrome 中的 Gemini 下達提示詞。
透過利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等開發者平台使開發者能夠輕鬆建構和部署高效能的語音驅動介面。這些平台在幕後管理複雜的即時媒體串流基礎設施,讓開發者能夠完全專注於打造使用者體驗。
Vivo、Intellitek Health 和 Lingopal 等公司也分享了對 3.5 Transcribe 的正面評價,強調其令人印象深刻的延遲、精準度和廣泛的語言支援。
開發者:目前已透過 Google AI Studio 和 Google Antigravity 中的 Gemini API 提供公開預覽。企業用戶:目前透過 Gemini Enterprise Agent Platform 提供公開預覽,並即將推出 Gemini Enterprise for Customer Experience。
所有使用者:已在 macOS 上的 Gemini App(英文版)和部分國家/語言的 Android 版 Rambler 中推出,並即將在 Chrome 中推出。



