我們的最新 Gemini 模型提供高效能、低延遲和高可靠性,以大規模建構 AI 代理。

開發者和客戶在建構生產級 AI 代理時,需要更高的 token 效率、更低的延遲和更可靠的性能。我們的 Flash 系列模型旨在達到效率與品質的最佳平衡點,以實現代理工作流程的規模化。

在 Gemini 3.5 Flash 的基礎上,我們推出了新的 Gemini 模型:

3.6 Flash:這是我們的主力模型,在程式碼生成、知識工作和多模態性能方面表現更佳。根據 Artificial Analysis Index,它比 3.5 Flash 減少了 17% 的輸出 token 使用量,在 Datacurve 的 DeepSWE 等基準測試中,我們觀察到最高可達 65% 的提升,同時每個輸出 token 的成本也更低。

3.5 Flash-Lite:這是我們最快、最具成本效益的 3.5 級模型,根據 Artificial Analysis Index,它每秒可提供 350 個輸出 token,在代理工作流程中也顯著超越了前幾代 Flash-Lite 模型。

CodeMender 中的 3.5 Flash Cyber:成功的網路安全應用需要模型與代理基礎設施的精心協調。我們推出了一款全新、高效且專注於網路安全的模型,並將其與我們的 CodeMender 程式碼安全代理結合,在業界前沿提供了極具競爭力的性能。

除了今天的發布,Gemini 3.5 Pro 目前正在與合作夥伴進行測試,我們計劃在準備就緒後廣泛推出。同時,我們的團隊也已專注於建構下一代模型。我們已經為 Gemini 4 啟動了迄今為止最雄心勃勃的預訓練計畫,並對其進展感到興奮。

3.6 Flash:比 3.5 Flash 更高效、品質更佳

Gemini 3.6 Flash 直接根據開發者和客戶對 3.5 Flash 的回饋進行開發。3.6 Flash 不僅在程式碼生成和知識工作方面有所提升,同時也顯著提高了 token 效率。例如,在 Artificial Analysis Index 上,我們看到 3.6 Flash 比 3.5 Flash 少消耗 17% 的輸出 token。它還需要更少的推理步驟和工具呼叫來完成多步驟工作流程。

這種提升的效率還伴隨著比 3.5 Flash 更低的價格。3.6 Flash 的輸入 token 價格為每百萬 $1.50,輸出 token 價格為每百萬 $7.50,這降低了每個代理任務的總體成本,使建構和運行代理更具成本效益。

即使效率更高,3.6 Flash 在各種使用案例中仍比 3.5 Flash 實現了性能提升:

3.6 Flash 提供了更高的精確度,減少了不必要的程式碼編輯和執行迴圈,這在 DeepSWE 中可見一斑(49% 對 37%),並在機器學習研究方面顯示出顯著改進,如 MLE Bench 所示(63.9% 對 49.7%)。

它改進了電腦使用能力,如 OSWorld-Verified 所示(83.0% 對 78.4%)。現在,電腦使用功能已透過 Gemini API 和 Gemini Enterprise 成為內建的客戶端工具。

它在知識工作方面超越了 3.5 Flash,如 GDPval-AA v2 等基準測試所示(1421 對 1349)。Hebbia 和 Harvey 等客戶發現它在文件解析、圖表和數據分析以及報告起草等多模態任務中特別出色。

客戶回報 3.6 Flash 在成本和品質方面都邁進了一大步,在複雜的工作流程和知識型任務中平衡了 token 效率、準確性和速度。

內建安全防護

3.6 Flash 搭載了增強的 Frontier Safety 防護措施,涵蓋化學、生物、放射性、核能(CBRN)以及網路攻擊濫用等領域。這些防護措施使模型更能抵抗「越獄」(jailbreaks)。同時,模型也經過訓練,盡量減少對有益用途的拒絕。

欲了解更多資訊,請參閱 3.6 Flash 模型卡。

3.5 Flash-Lite:為規模化代理工作流程而生

除了 Flash 系列,我們也發布了 Gemini 3.5 Flash-Lite,專為低延遲任務以及開發者工作流程中高吞吐量至關重要的任務而設計,例如代理搜尋和文件處理。

3.5 Flash-Lite 是 3.5 系列中最快的模型。根據 Artificial Analysis 的測量,它以每秒 350 個輸出 token 的速度運行。其輸入 token 價格為每百萬 $0.3,輸出 token 價格為每百萬 $2.5,且品質顯著優於 3.1 Flash-Lite,為運行高吞吐量生產流量的開發者和客戶提供了強大的性價比。

3.5 Flash-Lite 實現了代理系統的高效擴展。在各個思考層級上,該模型顯著超越了 3.1 Flash-Lite。根據工作負載,開發者可以配置模型,以最小和低思考層級優先處理高流量任務的低延遲、低成本執行,或者啟用更高思考層級來處理多步驟子代理工作負載。

該模型現在也將電腦使用功能作為內建工具,以可靠地支援跨介面的代理任務。它在程式碼生成和代理任務方面取得了顯著進步,如 Terminal-Bench 2.1 所示(54% 對 31%),在長上下文處理方面也表現出色,如 GDM-MRCR v2 所示(72.2% 對 60.1%),並在實際任務執行方面有所提升,如 GDPval-AA v2 所示(1140 對 642)。

事實上,在許多代理和程式碼評估中,3.5 Flash-Lite 甚至超越了 3 Flash,包括 SWE-Bench Pro(54.2% 對 49.6%)和 OSWorld-Verified(74.0% 對 65.1%),使其成為 2.5 和 3 Flash 工作負載更快、更強大的選擇。

3.5 Flash-Lite 的早期客戶強調其在速度、智慧和成本效益方面的獨特結合,有助於擴展代理工作流程和數據處理任務。

欲了解更多模型資訊,請參閱 3.5 Flash-Lite 模型卡。

CodeMender 中的 3.5 Flash Cyber:高效發現並修復漏洞

AI 模型已能比現有系統更快地發現安全漏洞。應對這種日益增長的威脅,需要一種高效且強大的軟體安全方法。

Flash 模型的性能和效率使其成為大規模檢測、驗證和修補程式碼安全問題的理想基礎。Gemini 3.5 Flash Cyber 建基於 3.5 Flash,並經過微調,專門用於發現和修復網路安全漏洞,且每個 token 的價格比大型模型更低。

在 CodeMender 中,多個 3.5 Flash Cyber 代理協同工作以生成一份綜合報告,3.5 Flash Cyber 在熱門基準測試 CyberGym 上達到了業界前沿的競爭性能。

鑑於這項技術的雙重用途性質,我們對 3.5 Flash Cyber 的部署採取了審慎的態度。該模型將很快透過 CodeMender,作為有限存取試點計畫的一部分,專門提供給政府和值得信賴的合作夥伴。這將使前線防禦者能夠搶先發現並修復關鍵漏洞,防止其被利用,同時也減輕了更廣泛的濫用風險。

3.6 Flash 和 3.5 Flash-Lite:即刻開始使用

3.6 Flash 和 3.5 Flash-Lite 從今天起即可使用:

對於開發者,可透過 Google AI Studio 和 Android Studio 中的 Gemini API 存取。3.6 Flash 也可在 Google Antigravity 中使用。請參閱開發者指南開始使用。

對於企業用戶,可在 Gemini Enterprise Agent Platform 中使用。3.6 Flash 也可在 Gemini Enterprise 應用程式中使用。

對於所有使用者,可透過 Gemini 應用程式使用。3.5 Flash-Lite 也將在 Google 搜尋中推出。

當您開始使用 3.6 Flash 和 3.5 Flash-Lite 進行建構時,我們歡迎您的回饋,以改進未來的 Gemini 模型,並期待很快發布 3.5 Pro。