今天,我們宣布推出全新的前沿模型 Gemini 4 Argon,目前正透過我們的 Fairwind 專案向一群值得信賴的網路防禦者推出。Argon 旨在複雜且長期性的工作流程中維持深度推理能力,正從根本上改變 Google 內部的工作和建構方式。

它在實際的軟體工程、法律和金融等企業知識工作,以及網路安全防禦等複雜工作流程中,展現出前沿的效能。安全地發布這種級別的前沿功能需要分階段進行,我們正積極參與美國政府自願性的模型預發布存取流程,同時逐步擴大存取權限。

我們將繼續收集早期測試者的回饋,並在盡快向開發者、企業和消費者提供 Argon 之前,不斷改進安全防護措施。Argon 的推出價格為每百萬輸入 token 2 美元,每百萬輸出 token 10 美元,快取輸入 token 價格可享 95% 折扣。

Gemini 4 Argon 已在 Google 內部工作流程中發揮作用,數千名 Googler 強調該模型在專業編碼任務、進行深度研究和提高寫作品質方面的優勢。它正協助團隊更快地建構,推動工程生產力的極限,並加速突破性進展。

在量子演算法優化方面,Argon 協助我們的量子計算研究人員優化瓶頸重要應用的子程式時空資源(量子位元 × 閘)。在一個案例中,它在幾分鐘內就超越了已發表的基準 40%。

在記憶體效率方面,Argon 代理團隊分析了全艦隊的分析遙測數據,自主識別並應用 Google 資料中心的記憶體優化,一旦部署,可釋放超過 300 TiB 的記憶體,預計總共可節省 500 TiB 到 1 PiB。

對於大規模程式碼庫遷移和優化,Argon 代理正在 Google 內部將 C/C++ 程式碼庫遷移到 Rust,規模從 re2、libgav1 等核心函式庫的數萬行,擴展到 Fuchsia Zircon 核心的 80 萬行以上。鑑於許多這些系統的關鍵性,如此大規模的重寫正在經歷嚴格的自動和手動審核、模擬測試和審查,然後才投入生產。

對於 Google 用於解碼影片的開源軟體 libgav1,Argon 代理採用現有的 Rust 移植版本,透過多次執行設定檔引導實驗、研究編譯器輸出,並產生安全的 Rust 程式碼,讓編譯器自動向量化,取代了 32K 行的 SIMD 程式碼。最終結果是一個記憶體安全的影片解碼器,其運行速度比 Rust 移植版本快 2.7 倍,影片輸出相同,使其更接近優化的 C++ 版本。

為了支援 Gemini 4 Argon 在更長、更複雜用例中的能力,我們將模型的輸出 token 限制顯著擴展到業界領先的 100 萬 token,遠高於之前的 64K token。當模型有足夠的空間進行深度思考並在單一軌跡中生成數十萬個 token 時,它為一次性解決棘手問題增加了新的推理深度。

Gemini 4 Argon 在編碼、推理和多模態方面的能力,以及其維持長時間、多步驟任務的能力,使其在各種企業工作流程中表現出色。Google 工程師已將 Argon 用於日常任務,從日常偵錯到大規模程式碼庫遷移和演算法設計。

它在 DeepSWE v1.1 上設定了新的最先進水準 (77.9%),該基準衡量模型在實際長期軟體工程任務中的表現。除了編碼之外,Argon 在 Vals Index 上也是領先的模型,該指數衡量金融、編碼、法律和稅務工作中的經濟影響,每個部門都按其對美國 GDP 的貢獻加權。

我們在其他特定領域評估中也看到了類似的領先表現,例如 Vals Finance Agent v2(多步驟金融研究)和 Harvey’s Legal Agent Benchmark(法律研究和起草)。在 Zapier 衡量核心業務功能端到端執行的基準 AutomationBench 上,Argon 以 51.3% 的分數排名第一。

當知識工作需要視覺理解時,Argon 也表現出獨特的強大能力。它能夠進行專業圖表分析、從長影片中識別細節,並根據一系列文件採取行動。例如,在衡量長影片理解的 LVBench 上,Argon 以 91.7% 的分數達到最先進水準。

為了更好地裝備網路防禦者應對網路攻擊的新時代,我們訓練 Gemini 4 Argon 在網路安全防禦方面具備高度能力。Argon 可以自主發現、驗證和修補關鍵軟體漏洞。對於值得信賴的防禦者和 Google 內部的團隊,我們將發布不帶網路防護措施的 Argon,以便他們可以利用其完整的前沿級網路安全防禦能力。

Wiz 已透過其 Scan for Good 倡議使用 Argon 進行網路安全防禦,這是一項致力於透過發現和修復高風險漏洞來免費保護關鍵公共基礎設施的計畫。在一次早期影響展示中,該模型發現了一個關鍵漏洞,該漏洞暴露了全球醫院使用的醫療保健軟體中的敏感個人資訊,識別出以前的前沿模型所遺漏的嚴重風險。

在評估模型修復安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分數並列第一,這是在 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表現基礎上建立的。

Gemini 4 Argon 在漏洞發現方面比 3.8 Flash Cyber 展現出令人印象深刻的飛躍。例如,在 Google 內部的綜合漏洞基準測試中,Argon 在跨越 20 種程式語言的複雜程式碼庫中發現了廣泛的漏洞。

Wiz 的內部黑箱滲透測試基準測試模型分析即時網路系統而無需原始碼的能力,Argon 在發現攻擊面、識別漏洞和產生概念驗證證據以驗證它們方面優於 3.8 Flash Cyber。

在廣泛推出 Gemini 4 Argon 之前,我們將繼續在四個主要領域加強關鍵的前沿安全防護措施。為防止惡意行為者將 Argon 用於網路或化學、生物、放射和核 (CBRN) 攻擊,該模型旨在拒絕有害請求,同時根據我們的前沿安全框架,保留合法的雙重用途科學研究。

我們正在加強本次發布的安全防護措施的穩健性,包括改進我們監控模型內部活動以發現濫用行為的技術。這些安全防護措施經過內部和外部紅隊使用手動和自動攻擊方法的組合進行了穩健性測試。Argon 也是我們迄今為止對間接提示詞注入最具彈性的模型,間接提示詞注入是指惡意指令或上下文用於劫持模型行為的攻擊。

這些是複雜的攻擊,需要持續的警惕和多層防禦。透過自動紅隊測試和對抗性訓練,Gemini 4 Argon 在 Gray Swan 的間接提示詞注入 (IPI) 基準測試中,在提示詞注入穩健性方面處於領先地位。

為了防止 Argon 超出範圍,以超出使用者意圖的方式完成任務,我們正在部署錯位緩解措施,監控 Argon 的思維鏈和行動,並在必要時停止執行。我們使用類似的系統來監控我們的訓練運行,並向專門的事件響應團隊發送警報,採取謹慎的預防措施,避免將發現結果反饋到訓練中,以免冒險塑造 Argon 的推理以規避我們的監控。

我們強烈鼓勵業界其他公司在能力增加的關鍵時刻,在應對對齊風險的同時,保持推理透明度,以便模型思維在識別和診斷錯位方面保持有用。隨著前沿模型的能力日益增強,安全地測試它們需要能夠跟上系統本身的受保護環境。根據我們的代理控制路線圖,我們正在透過在高風險訓練或評估開始之前隔離和密封沙盒環境來強化它們。

我們致力於與我們的合作夥伴分享這些代理安全最佳實踐,以改善整個生態系統的安全性。我們打造 Gemini 4 Argon 具備前沿級別的編碼、知識工作、網路安全防禦和創意寫作能力,旨在成為開發者、專業人士的合作夥伴。