今天,我們向 Gemini 系列推出兩款全新的文字轉語音模型,將語音生成從靜態預設轉變為動態創意工作室。這些模型讓創作者、開發者和企業能夠打造更豐富、更具表現力的音訊體驗,同時也改進了 Gemini Notebook 和 Google Vids 等產品的使用者體驗。
Gemini 3.8 Flash TTS 專為深度創意指導和角色設計而打造。它能讓使用者透過自然語言提示詞從零開始創造全新的語音,將遊戲、沉浸式有聲書、Podcast 和互動媒體中的角色栩栩如生地呈現。使用者可以逐行指導每個語音表現,精確控制表演提示、語速、方言轉換和背景對話。
Gemini 3.8 Flash-Lite TTS 則專為高流量、高成本效益的規模化應用而設計。它針對大量配音、音訊內容創作和具表現力的語音助理進行了最佳化,並能精細控制語氣、語速和表達的細微差別。
這些模型補充了我們快速成長的 Gemini Audio 系列,此前已推出 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。現在,您可以創造並自訂自己的語音。
從 30 種原始語音擴展到無限的語音庫。無論您需要一個全新的角色語音,還是希望擁有一個具備一致性的品牌大使,我們的 3.8 Flash TTS 模型都能提供完整的語音工作室功能。這讓您能夠在任何時刻創造並使用富有表現力、聽起來自然的語音,同時也賦予開發者和企業輕鬆打造客製化音訊體驗的能力。
透過生成式語音設計,Gemini 3.8 Flash TTS 讓您能利用自然語言提示詞,從零開始客製化角色、口音和語音特徵,支援超過 100 種語言和方言,無論是創造一條戲劇性的噴火龍,還是塑造一位帶有獨特地方腔調的魅力旁白。
廣泛的語音庫:存取超過 2,000 種可立即用於製作的語音,涵蓋多種語言,包括墨西哥西班牙語、魁北克法語和蘇格蘭英語等地區變體。語音複製功能則能從您或您擁有使用權的語音中,僅需 30 秒的音訊樣本,即可重現一致的語音檔案,並透過內建的同意驗證、SynthID 浮水印和 C2PA 憑證來保護開發者及其語音人才。
儲存與擴展:儲存並管理您設計的客製化語音,以確保在持續專案中保持一致的表現且漂移最小。語音混音:即將推出,您可以從我們的語音庫中選擇一種語音,並微調音色、音高、語速和口音。使用提示詞來調整特定特徵(例如「加入微妙的美國南方口音」或「柔化語氣」)。
一旦您選擇了語音,這兩款 TTS 模型都能讓您精確控制每句話的呈現方式。逐行指導表演:您可以自行編寫舞台指示,或讓 Gemini 根據自然腳本提示來引導語音呈現,無論是平靜的客服人員,還是低語的懸疑場景。
長篇內容生成:在數小時的連續音訊中,仍能保持高語音品質、自然的語速和角色音色,且說話者漂移極小,非常適合 Podcast 和有聲書。原生雙人對話場景編排:從單一腳本無縫指導多輪對話,無論是用於 Podcast 或戲劇性故事講述,都能讓兩種語音清晰分離,並具有自然的對話輪替。
腳本化語音爆發與背景對話:使用非語言提示(如 <laughs>、<sigh>、<gasp>)和主動聆聽的插入語(如 |mhm| 或 |yeah|),增加真實的對話質感,以實現精確的喜劇時機和反應節奏。
實現為全球規模打造的富有表現力高品質語音生成。Gemini 3.8 Flash TTS 提供領先的語音客製化功能,在 Hume AI 的語音設計基準測試中獲得總體第一名(71.4 分),並在口音建模方面也居於領先地位(60.8 分)。Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 實現了真正富有表現力的語音,同時不犧牲可靠性,分別在 Hume AI 的整體品質指數中獲得第一和第二名。
與 Gemini 3.1 Flash TTS 相比,該模型在長篇內容和雙人劇本控制等廣泛用例中顯示出重大改進。在 Voice Arena 的盲測人類偏好評估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在主要全球語言(包括日語、巴西葡萄牙語、越南語、現代標準阿拉伯語 (MSA)、墨西哥西班牙語和印地語)中,均在競爭對手中名列前茅。
這些模型支援超過 100 種語言,賦予創作者、開發者和企業在全球範圍內打造高品質、多語言語音體驗的能力。
建立信任、同意與透明度。我們在語音創造和複製功能中建立了嚴格的保護措施,以幫助保護語音人才、尊重身份並確保內容透明度。對於語音複製,我們的系統利用同意驗證:使用者必須提供語音所有者的口頭同意錄音,且該錄音必須與參考說話者相符,才能創建語音。
更廣泛地說,我們 Gemini Audio 模型生成的每個音訊片段都帶有 SynthID 浮水印。這種不可察覺的浮水印直接嵌入到音訊輸出中,確保 AI 生成的語音仍可被檢測到,以幫助防止錯誤資訊傳播。有關我們安全和責任方法的更多詳細資訊,請查閱模型卡。
試用我們新的 Google AI Studio 音訊遊樂場。從今天開始,開發者可以在 Google AI Studio 中體驗這些新的語音生成功能。它被設計成一個語音設計工作區,您可以從零開始提示全新的語音身份,或複製自己的語音,然後將它們直接導入雙人劇本編輯器中,逐行指導語音呈現。
輕鬆部署高效能語音介面。透過使用 Gemini API,Agora、LiveKit、Pipecat、Vercel 等開發者平台使開發者能夠輕鬆建立和部署高效能的語音生成體驗。我們正在與 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,這些公司正在整合我們最新的 TTS 模型,以幫助加速全球配音、以細緻的地區口音在地化媒體,並大規模推動對話式語音助理。
開始使用我們最新的 Gemini Audio 模型:Gemini 3.8 Flash TTS 從今天開始推出:對於開發者:可在 Gemini API 和 Google AI Studio 中使用。對於企業:即將透過 Gemini Enterprise 的 API 提供。
對於所有人:可在 Gemini Notebook 中使用。Gemini 3.8 Flash-Lite TTS 從今天開始推出:對於開發者:可在 Gemini API 和 Google AI Studio 中使用。對於企業:即將透過 Gemini Enterprise 的 API 提供。對於所有人:可在 Google Vids 中使用。



