Google 多年來持續投入網路安全領域,率先開發自動化漏洞發現技術,以保護全球的程式碼庫。諸如 CodeMender 這類程式碼安全代理,能自動找出並修復關鍵的軟體漏洞。然而,隨著 AI 代理在發現漏洞方面的能力日益增強,且速度超越防禦者修復的速度,應對這項全球威脅需要一種高效能、經濟實惠且可擴展的方法。

今天,我們擴展了長期以來的努力,透過推出 Gemini 3.5 Flash Cyber 來更好地協助防禦者。這是一款輕量級的網路安全模型,建構於 3.5 Flash 之上,並經過微調,能快速有效地發現、驗證和修補漏洞,使其在這些任務上的表現優於 Gemini 的主流 Flash 模型。

Flash 的性能和效率使其成為我們網路安全模型工作的理想基礎。透過建構在 Flash 之上,3.5 Flash Cyber 提供了一種成本效益高且功能強大的替代方案,相較於大型且昂貴的網路安全模型更具優勢。

考量到這項技術的雙重用途性質,我們對 3.5 Flash Cyber 的部署採取了審慎的策略。作為一項有限存取試點計畫的一部分,3.5 Flash Cyber 將很快透過 CodeMender 獨家提供給政府和信任的合作夥伴,並將隨著時間逐步擴大。這將使前線防禦者能夠搶先發現並修復關鍵漏洞,避免其被利用,同時也能降低更廣泛的濫用風險。

此外,我們也將透過 Gemini Enterprise Agent Platform,把 CodeMender 的核心功能直接帶給使用一般 Gemini 模型的客戶。

深入挖掘潛在缺陷需要探索龐大的執行搜尋空間。若僅依賴對單一、昂貴的大型語言模型進行呼叫,可能會造成瓶頸。3.5 Flash Cyber 特別適合用於尋找漏洞,尤其當代理需要掃描大型程式碼庫並分析大量程式碼路徑時。

CodeMender 會多次呼叫 3.5 Flash Cyber,讓代理能夠分析更多程式碼路徑以發現並驗證漏洞。隨後,這些子代理會產生一份單一且高品質的報告。

由於其速度快且價格實惠,3.5 Flash Cyber 可以輕鬆整合到頻繁掃描、時間敏感的發布流程或大規模的提交掃描管線中。

我們對 3.5 Flash Cyber 進行了多種基準測試。特別是,我們在 CyberGym 基準測試中評估了 3.5 Flash Cyber,該測試旨在衡量 AI 代理應對數百個真實世界軟體漏洞的能力。

透過配置 CodeMender,讓其為單一最終報告最多呼叫 3.5 Flash Cyber 五次,藉此利用 3.5 Flash Cyber 的低成本優勢,該整體代理在 CyberGym 上達到了與顯著更大的模型競爭的性能。*競爭對手的結果來自供應商自行報告的分數。

我們還在沒有安全防護措施的情況下,對模型的性能進行了 CyberGym 之外的壓力測試。Google 的 Big Sleep 團隊獨立建立了一項評估,專注於在 Chrome 和 Safari 等世界上最複雜的程式碼庫中,尋找關鍵且難以發現的漏洞。在此測試中,3.5 Flash Cyber 顯著超越了主流的 3.5 Flash 和 3.6 Flash 模型。

3.5 Flash Cyber 也針對 Google Chrome 的生產提交掃描管線進行了評估。這些漏洞並未公開披露,這確保了此基準測試對 Gemini 和競爭對手模型而言,沒有受到任何污染。

結果顯示,3.5 Flash Cyber 相較於 3.5 Flash 有顯著提升。請注意:Opus 4.6 之後的最新競爭對手模型版本,由於內建安全防護措施,拒絕執行這些任務,因此未顯示其結果。

此外,3.5 Flash Cyber 相較於主流 3.5 Flash 和 Claude Opus 4.6,持續發現了更多獨特的漏洞。在針對高度複雜的 V8 JavaScript Engine 進行固定次數的呼叫測試中,3.5 Flash Cyber 發現了 55 個獨特的已確認問題,而主流 3.5 Flash 發現了 47 個,Opus 4.6 發現了 36 個,其中包含 10 個其他兩個模型未捕捉到的問題。

基本的網路安全模型可能會陷入循環,重複發現相同的問題,卻錯過關鍵漏洞。一個強大的模型會撒下更廣泛的網,發現更多獨特的問題。

隨著我們增加呼叫次數,我們發現 3.5 Flash Cyber 持續發現新的程式碼路徑和漏洞。

基準測試只是故事的一部分。CodeMender 中的 3.5 Flash Cyber 已經在 Google 內部的程式碼庫中,包括 Chrome、Android、Cloud、Ads 和 YouTube,發現並修復了漏洞。

輕量級模型所實現的發現速度,已帶來可衡量的影響。

例如,Google 的 Cloud Vulnerability Research 團隊利用 3.5 Flash Cyber,在創紀錄的時間內主動保護了我們的系統。在短短 2 小時內,該模型揭露了公共 API 中的遠端程式碼執行漏洞,並在一個敏感的生產服務中發現了記憶體損壞漏洞。

隨後,它還生成了一個 100% 可靠的遠端程式碼執行漏洞利用程式,成功繞過了諸如位址空間配置隨機化 (ASLR) 和寫入 XOR 執行 (W^X) 等標準緩解技術。

來自 Wiz 和 Cloud CISO Security Engineering 測試人員的早期回饋證實,3.5 Flash Cyber 相較於主流 3.5 Flash 模型,在能力上有了顯著提升。

Google 在軟體安全領域的領導地位賦予我們獨特的優勢。例如,由 Google 營運的漏洞資料庫 OSV.dev 涵蓋超過 70 萬個開源漏洞,以及超過 10 年的 OSS-Fuzz 結果,這些都幫助我們識別出最高品質的漏洞。

這使我們能夠超越合成的網路安全範例,教導我們的模型如何像真正的安全專業人員一樣工作。我們的模型學習操作業界標準工具,閱讀 Chromium 等大型專案中數百萬行的程式碼,並獨立處理需要數小時持續深入分析的複雜安全任務。

透過以 3.5 Flash Cyber 驅動 CodeMender,我們正在提供一個高效能、可擴展且經濟實惠的架構,旨在幫助更多防禦者保護軟體安全。