Google DeepMind 今天為其最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出「代理式影片理解」功能。這項新能力在顯著降低影片分析的代幣使用量和成本的同時,也提升了準確度。如同結合程式碼執行與 Gemini 模型原生圖像理解的代理式視覺功能,代理式影片理解利用 Gemini 的原生影片工具來提升效能,並解鎖影片處理的新功能。
這些新功能包括亞秒級時刻檢索、更精確的異常偵測、精準計數等。此功能現已透過 Google AI Studio 和 Gemini 企業代理平台中的 Gemini API,支援影片上傳和 YouTube 影片。
與目前「靜態」處理方式不同,靜態處理是指模型以固定的每秒影格數(預設為 1 FPS,可透過 API 調整)來擷取影片。代理式影片理解則將模型的核心推理能力與原生影片工具結合,動態地搜尋、掃描並檢查目標影片片段,涵蓋視覺影格、音訊和逐字稿。在標準影片分析基準測試中,搭載代理式影片理解的 Gemini 模型可將分析成本降低高達 66%,代幣消耗減少 88%,同時將準確度提升 7%。
這些效率提升在長篇影片(從 10 分鐘的操作指南到 90 分鐘的講座和數小時的錄影)上尤為顯著,因為靜態處理會迫使開發人員在高昂的代幣成本或犧牲關鍵細節的技術之間做出選擇。
儘管這些優勢適用於所有三款支援的模型,但搭載代理式理解功能的 Gemini 3.7 Flash 在整體品質方面表現最佳,並在品質與成本效益之間達到最佳平衡。這使其在影片理解的測試模型中,處於準確度與成本的帕累托前沿。
代理式影片理解的運作方式,是讓 Gemini 扮演主動、目標導向的角色,而非像靜態處理那樣以固定影格率擷取媒體串流。它能決定要觀看什麼、以什麼速度觀看,以及透過哪種模態(影格、音訊或逐字稿)觀看,只擷取所需的時刻和訊號。雖然開發人員過去可以手動完成這些操作,但透過代理式影片理解,Gemini 可以透過代理式循環來實現,呼叫內部工具載入影片檔案的相關部分,從而顯著減少開發負擔。
代理式影片理解徹底改變了開發人員處理各種高要求應用中長篇影片內容的方式。它能實現亞秒級時刻檢索,精準找出在 1 FPS 下容易錯過的瞬間狀態變化和緊密剪輯邊界,使精確的自動影片編輯成為可能。在長篇影片中進行「大海撈針」式的搜尋,無需消耗數百萬個代幣即可回答跨數小時影片的複雜查詢。
在異常偵測方面,它能以更高的 FPS 重新取樣感興趣的時間視窗,以檢查快速移動和細微的視覺偽影。此外,它還能精準計數動作與物件,隨時間準確追蹤重複的身體動作和不同的物件。
代理式影片理解功能已透過 Google AI Studio 和 Gemini 企業代理平台中的 Gemini API 提供,支援 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型。它採用標準的 Gemini API 代幣定價,不收取額外功能費用。
要啟用此功能,只需在 API 配置中將處理方式設定為「agentic」即可。請閱讀我們的開發人員指南,以獲取更多關於此功能的見解以及如何開始使用。
我們也將代理式影片理解的效率和品質提升帶給 Google 產品中的數十億用戶。此功能將很快在 Gemini 應用程式中向所有 Flash 和 Flash-Lite 模型用戶推出。在未來幾個月內,代理式影片理解也將為 YouTube 影片觀看頁面上的「詢問 YouTube」功能提供支援,利用 Gemini 提供基於視覺內容的更高品質答案。
感謝 Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 和 Agentic Vision 團隊對這項工作的貢獻。



