Google 已更新 Gemini Audio,推出全新的轉錄功能,能自動偵測專業術語及超過 85 種語言。Gemini 3.5 Transcribe 是 Gemini 系列的新成員,繼 3.5 Live Translate 之後發表,而我們仍在等待 Google 兌現承諾,於六月推出 Gemini 3.5 Pro 模型。
Google 表示,3.5 Transcribe「代表了我們先前轉錄模型 Chirp 3 的重大進步」,尤其在多語言效能和文字錯誤率方面表現更佳。根據 Google 的說法,這個轉錄模型允許使用者「僅用聲音就能自然編輯」,並能自動格式化文字,同時移除「嗯」、「啊」等口語贅詞。
使用者可以為模型提供自訂詞彙表,讓 3.5 Transcribe 自動適應獨特的拼寫要求和專業術語。這能避免這些詞彙需要手動編輯,它還能為預錄音訊中的最多三位講者歸因語音,並提供字詞級的時間戳記。
Google 原先也提到 3.5 Live 和 3.5 Live Experimental 更新將於今日登陸 Gemini Audio,這些更新基於現有語音辨識技術,為 Gemini 的語音聊天模式提供支援。然而,在我們發布這篇報導後,Google 隨即聯繫表示這些額外模型尚未推出,也未提供新的發布日期。
根據 Google 先前提供的資訊,Gemini 3.5 Live 在處理句子中斷、語言辨識和即時視覺處理方面表現更佳。而 Gemini 3.5 Live Experimental 更進一步,能在處理複雜任務的推理過程中,即時逐步敘述其進度。
Gemini 3.5 Transcribe 將於今日起陸續推出,首先支援所有 macOS Gemini 應用程式的英文使用者。Android 上的 Rambler 聽寫功能也將在特定國家和語言提供,開發者則可透過 AI Studio 和 Antigravity 的 Gemini API 公開預覽此功能。Google 表示 Chrome 瀏覽器支援也即將推出。



