繼三週前推出 3.7 Flash 後,Google DeepMind 在短短六週內第三次發布 Flash 模型,今日隆重介紹 Gemini 3.8。這是我們迄今為止最出色的推理與程式碼生成模型,並維持 3.7 的速度和低成本。
Gemini 3.8 推出兩種版本:Gemini 3.8 Flash 是我們最智能的工作主力模型,在軟體工程、代理任務以及專業領域的關鍵多步驟推理方面,相較於 3.7 Flash 有顯著改進。其定價與 3.7 Flash 相同,輸入 token 每百萬美元 0.75 美元,輸出 token 每百萬美元 3.75 美元。
Gemini 3.8 Flash Cyber 則是我們最強大的網路安全模型,在漏洞偵測和自動修補方面展現了頂尖性能,將透過我們全新的 Fairwind 專案提供給值得信賴的防禦者。儘管針對不同的部署環境進行了調整,這兩個版本都由相同的基礎智能驅動,並透過設計用於遞歸評估和改進底層模型的長期代理循環進一步加速。
這些共享核心在程式碼生成和推理方面的顯著提升,得益於多項創新,包括在要求極高的網路安全領域進行嚴格訓練。Gemini 3.8 Flash 專為長期程式碼開發和自主代理而設計,其性能相較於 3.7 Flash 有大幅提升,通常能媲美成本更高的頂尖模型。
在 DeepSWE v1.1(長期軟體工程)基準測試中,3.8 Flash 在自主解決複雜端到端工程問題方面超越了大多數大型頂尖模型,而成本僅為其一小部分。此外,3.8 Flash 在專業知識領域展現了關鍵企業自主性所需的可靠性。
在需要進階分析和報告的量化和專業領域中,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基準測試中,表現優於 3.7 Flash 和其他頂尖模型。3.8 Flash 在 HLE-Verified 上也達到了 54.9% 的分數,證明其處理 STEM、人文和專業領域多步驟推理的能力。
這些性能提升源於核心設計選擇:3.8 Flash 更努力地工作。在複雜任務中,它展現出更高的勤奮度,執行額外的推理步驟,並迭代地呼叫工具。有時,模型可能會使用更多的 token 來最大化性能,尤其是在較高的努力程度下。
對於以運算效率為主要限制的應用程式,開發人員可以利用較低的努力程度來最小化 token 開銷,或者繼續依賴 Gemini 3.7 Flash,該模型仍完全支援效率優先的工作負載。
Gemini 3.8 Flash Cyber 透過 Fairwind 專案提供給值得信賴的防禦者,在當今複雜的網路安全環境中提供了決定性的優勢,並具備 Flash 的速度和成本,可實現快速迭代。在用於尋找漏洞的行業標準基準測試 CyberGym 上,Gemini 3.8 Flash Cyber 在自主漏洞偵測方面展現了頂尖性能。
它超越了 3.5 Flash Cyber 以及顯著更大的頂尖模型。為了更好地捕捉不限於 CyberGym 中 C/C++ 程式碼庫的實際防禦需求,我們還針對一個全面的內部基準測試評估了 Gemini 3.8 Flash Cyber,其中模型必須在涵蓋 20 種程式語言的複雜程式碼庫中發現各種漏洞。
在此測試中,該模型展現出超越我們之前模型的驚人飛躍,成功率超過 70%。透過 Gemini 3.8 Flash Cyber,我們特別專注於為防禦者提供專家級能力,使其在攻擊者面前佔據優勢。這就是為什麼我們從一開始就投入漏洞修復,並將其優先於利用等攻擊性能力。
由 Collinear 運行的 CWE-Bench 是一個具有挑戰性的修補能力外部基準測試。在這個基準測試中,Gemini 3.8 Flash Cyber 處於 Pareto 前沿:其 pass@1 為 47.2%,而領先的頂尖模型為 47.8%,但成本顯著降低。
我們已經在使用 Gemini 3.8 Flash Cyber 來保護 Google 的程式碼。例如,Chrome 安全團隊發現 3.8 Flash Cyber 在 Chrome 漏洞修補方面,比最佳的商業模型(規模大得多)產生了 2.6 倍的正確修補。
Wiz 發現 Gemini 3.8 Flash Cyber 在其內部滲透測試基準中,以 2.3-5.2 倍的較低成本,實現了比其他領先頂尖模型高 7.5-9.7% 的召回率。
Google 的雲端漏洞研究團隊利用 3.8 Flash Cyber 模型在不到 2 小時內發現了一個關鍵的基礎漏洞,而通常這類漏洞的研究和發現需要數月時間。3.8 Flash 根據我們的 Frontier 安全框架,內建了針對化學、生物、放射和核子 (CBRN) 以及網路攻擊領域濫用的防護措施,同時支援有益的使用案例。
3.8 Flash Cyber 則針對網路安全提供了更寬鬆的緩解措施,因此僅提供給需要更全面網路能力的值得信賴的防禦者。Gemini 3.8 模型在 Gray Swan 測量的提示詞注入韌性方面也取得了顯著飛躍,保護 Gemini 模型用戶免受提示詞注入相關的惡意攻擊。
開發人員可以透過 Google Antigravity 探索代理優先工作流程,或立即透過 Google AI Studio 和 Android Studio 中的 Gemini API 開始建構,或在 Stitch 中生成使用者介面。企業用戶可在 Gemini Enterprise 中存取 3.8 Flash。
消費者方面,Google AI Pro 和 Ultra 訂閱者可在 Gemini 應用程式、Google 搜尋中的 AI 模式以及 Google Sheets 中的 Gemini 使用 3.8 Flash。
網路安全領域,透過我們新的 Fairwind 專案,我們為值得信賴的政府機構、關鍵基礎設施營運商和軟體維護者提供 Gemini 3.8 Flash Cyber 的優先存取權限。



