去年,Nano Banana 將 Gemini 的智慧帶入影像生成與編輯領域。從那時起,它已幫助數百萬人修復舊照片、從草圖進行設計,並以以前不可能的方式將想法視覺化。從一開始,我們就將 Gemini 設計為原生多模態模型,現在我們正邁出下一步。

我們推出 Gemini Omni,讓 Gemini 的推理能力與創作能力結合。Omni 是我們的新模型,能從任何輸入(從影片開始)創造任何內容。透過 Omni,你可以結合影像、音訊、影片和文字作為輸入,並根據 Gemini 的真實世界知識生成高品質影片。

你也可以透過對話輕鬆編輯影片。今天,我們正在 Gemini 應用程式、Google Flow 和 YouTube Shorts 上推出 Omni 系列中的第一個模型:Gemini Omni Flash。未來我們將支援影像和音訊等輸出模態。以下是 Omni 的一些特別之處:透過對話編輯影片。

Gemini Omni 讓你能以自然語言更輕鬆地編輯影片。每個指令都建立在前一個指令的基礎上。你的角色保持一致,物理效果逼真,場景也能記住之前的內容。改變你周圍的世界。修改特定事物,或改變一切。你的影片成為你從未拍攝過的事物的起點。重新構想動作。

拿起你拍攝的影片,只需請 Omni 改變正在發生的事情。編輯動作、加入新角色或物體,或將某個時刻轉化為意想不到的內容。提示詞:用泡泡製作雕塑。提示詞:當人觸摸鏡子時,讓鏡子像液體一樣美麗地波動,並且人的手臂變成反射性的鏡面材質。提示詞:調暗房間的燈光。

將一個黑白棋盤格房間放入一個玻璃球中,該玻璃球漂浮在手上方並追蹤,其中包含一個遞迴表示的同一隻手握著玻璃球,創造出無限遞迴的房間。攝影機慢慢靠近玻璃球,創造一個影片循環。提示詞:公寓的燈光開始與音樂同步亮起。透過多輪對話精修影片。改變環境、角度、風格甚至特定細節,而不會失去原始場景的連貫性。

提示詞:一位小提琴手演奏歌曲的影片。提示詞:將小提琴手傳送到影像環境中。提示詞:讓小提琴隱形。提示詞:將攝影機角度改為從小提琴手肩膀上方拍攝。根據 Gemini 的世界知識將想法付諸實現。Gemini Omni 不僅能建立看起來真實的場景,它還能推斷接下來應該發生什麼。

它將對物理的直觀理解與 Gemini 的歷史、科學和文化背景知識相結合,彌合了從寫實主義到有意義敘事的鴻溝。創造具有更精確物理效果的視覺內容。Omni 對重力、動能和流體動力學等作用力有更直觀的理解,讓你能夠創造更逼真的場景。提示詞:一顆彈珠在連鎖反應式的軌道上快速滾動,連續流暢的鏡頭。

融合知識與創造力。Omni 運用 Gemini 的知識,以超越模式匹配的方式連結語言、影像和意義。提示詞:影片展示字母表中的物品。每個字母開頭的一個不尋常物品放在桌上(例如 C 代表水豚 Capybara,D 代表迪斯可球 disco globe,L 代表熔岩燈 Lava Lamp)。

所有 26 個字母必須由 26 個物品表示,並配有顯示字母的下三分之一字幕。每次只顯示一個物品和一個下三分之一字幕。每個下三分之一字幕必須看起來像用黑色麥克筆寫在一張紙條上,位於左下角。快速剪輯,每個物品大約 9 幀,24FPS。最後一幀是一張寫有「THE END」的紙條。

整個影片伴隨著平靜流暢的音樂。將複雜概念視覺化。Omni 可以從簡短的提示詞中創建引人入勝的解釋性影片,生成視覺內容來分解更複雜的概念。提示詞:蛋白質摺疊的黏土動畫解釋影片,所有東西都由黏土製成,沒有手,停格動畫,精確。從任何輸入組合創建影片。

參考任何內容。Omni 將任何參考資料(影像、文字、影片或音訊)轉化為單一、連貫的輸出。雖然一開始只支援語音參考作為音訊輸入,但我們很快就會推出其他類型的音訊輸入。提示詞:基於 image_0.png 製作動態科幻電影風格影片。元素像 video_0.mp4 一樣亮起,與 audio_0.wav 的音樂節奏同步。

提示詞:參考 video-0 中極端的攝影機運動、視角和扭曲,創建 image-0 中角色的正面全身行走循環,在行走循環中快速切換多種視覺風格,從寫實電影風格開始。保留環境,只改變風格。硬切背景始終以天空為中心。連續行走、連續音訊,風格切換與音訊節奏完美同步。

電影感,16:9。提示詞:在我觸摸每片蕨葉時,同步添加豎琴聲音。將葉子結構全部改變為半透明的 3D 生物發光植物生命,周圍有生物發光的螢火蟲飛舞,它們會隨著我的演奏而反應,與聲音同步,微妙的散景景深動態照明,反射在房間的牆壁上,保持房間結構不變。

從你擁有的內容開始。透過輸入參考,你可以使用角色、場景或圖畫的影像,以符合你願景的方式進行創作。提示詞:想像當我行走時,世界逐漸變成復古未來風格(像 image-1 一樣顆粒感和憂鬱)。使用音訊作為復古未來背景音樂。10 秒。提示詞:將此轉化為寫實影片,僅使用繪圖作為動作指南,最終影片中不顯示繪圖。

提示詞:將輸入影片中的姿勢和動作應用到此影像提供的角色。將影像參考中的風格應用到新影片。應用風格、動作或效果。透過使用輸入參考來定義視覺語言,或者只需用自然語言描述。Omni 會融合輸入參考以創建連貫的片段。提示詞:編輯此內容,保持所有內容不變。

在滑板上添加動畫動作效果。提示詞:將所提供影片中鯨魚游泳的動作應用到所提供的流體反射材料影像。不顯示鯨魚或水;相反地,讓這種反射性移動材料形成一個類似鯨魚游泳時的形狀。將水替換為白色光滑的移動材料形狀。用你自己的數位分身創建影片。我們致力於負責任地開發 AI,並制定了明確的政策來保護使用者免受傷害,並規範我們 AI 工具的使用。

首先,你可以透過使用 Avatars 創建自己的數位版本,生成看起來和聽起來都像你的影片。除了分身功能之外,在編輯影片以改變音訊和語音方面,我們仍在努力測試並更好地理解如何負責任地將此功能帶給使用者。所有使用 Omni 創建的影片都包含我們難以察覺的 SynthID 數位浮水印。

你可以透過 Gemini 應用程式、Chrome 中的 Gemini 和 Google 搜尋輕鬆驗證影片是否由 Gemini Omni 生成。你可以在我們的部落格文章中了解更多關於我們如何擴展內容透明度和驗證工具,以幫助你了解內容是如何在網路上創建和編輯的。

立即體驗 Gemini Omni。今天,我們正在推出 Omni 系列中的第一個模型,Gemini Omni Flash。Gemini Omni Flash 今天起將透過 Gemini 應用程式和 Google Flow 向全球所有 Google AI Plus、Pro 和 Ultra 訂閱者推出。

本週起,它也將免費向 YouTube Shorts 和 YouTube Create App 的使用者推出。在未來幾週內,我們也將透過 API 將其推廣給開發者和企業客戶。