我們正在擴展 Daybreak 計畫,以機器速度普及化修補有漏洞的軟體。例如,我們已應用模型來發現並生成主要瀏覽器、網路基礎設施以及 FreeBSD 和 Linux 核心等作業系統中關鍵漏洞的修補程式。為了擴大這些能力的影響力,我們將推出以下更新:

Codex Security:我們正在推出 Codex Security 外掛的更新版,它將我們從內部和客戶使用模型中學到的經驗,轉化為一個解決方案。這個方案能加速發現和修補現有系統中的漏洞,並自動防止新漏洞進入生產環境。

GPT-5.5-Cyber:在最初僅限許可的預覽之後,我們將透過持續的有限發布,向值得信賴的防禦者推出完整版的 GPT-5.5-Cyber。這個模型在 CyberGym 上創下了新的最先進效能,達到 85.6%,而 GPT-5.5 則為 81.8%。

Daybreak 資安合作夥伴計畫:透過我們最先進的模型和信任存取,讓資安合作夥伴在其產品和服務中,將這些優勢擴展到更多組織。

修補地球 (Patch the Planet):這是一項與 Trail of Bits 共同創立的倡議,並與 HackerOne、Calif、研究人員和維護者合作,旨在幫助廣泛使用的開源專案從發現問題走向修復。目前已有超過 30 個開源專案承諾參與,首批參與者包括 cURL、Go、Python、Sigstore 和 pyca/cryptography。

透過「修補地球」,我們正與研究人員、維護者、企業和合作夥伴合作,為防禦者提供強大的網路資安能力,並確保適當的存取、治理和人工監督。

AI 改變了網路資安的本質。前沿 AI 模型已日益加速漏洞的發現。過去的瓶頸是發現漏洞,但現在防禦者卻被發現的漏洞數量所淹沒。因此,現在的瓶頸變成了修補漏洞。

多年來,發現嚴重漏洞需要稀有的專業知識、時間以及對複雜系統的深入了解。現在,模型可以瀏覽大型程式碼庫、推理攻擊路徑、驗證假設,並找出可能隱藏的資安問題。防禦者絕對需要這些能力,也需要工具來修復我們現在能發現的問題,搶在攻擊者之前。

漏洞報告本身並不能保護任何人。其價值來自於驗證問題、了解其影響、開發和測試修補程式、協調披露,以及協助團隊部署修復。我們正與合作夥伴共同投資改進這些後續步驟,以增強防禦者能力,並將模型能力轉化為實際的風險降低。

前沿的防禦能力不應集中在少數人手中。軟體觸及生活的各個方面,從關鍵基礎設施到商業應用程式和政府網路。隨著 AI 改變漏洞發現的速度,各地的防禦者都需要普及化地存取這些模型,以便在攻擊者識別並濫用這些缺陷之前,發現、修復並保護其基礎設施。

Daybreak 整合了 OpenAI 模型的前沿網路資安能力、網路資安信任存取 (Trusted Access for Cyber)、Codex Security 工作流程和生態系合作夥伴。它旨在幫助經核准的防禦者驗證漏洞、優先處理風險、生成和測試修復,並在現有資安和開發工作流程中產生證據。我們的目標是為組織提供所需的工具,即使網路威脅情勢持續加速,也能保持安全。

自從三月推出 Codex Security 雲端研究預覽版以來,它已掃描了超過 30,000 個程式碼庫中的 3,000 萬次提交;人工審閱者已手動標記超過 70,000 個發現為已修復,另有超過 500,000 個發現被自動判定為已修復。這正是現在修補工作必須達到的規模。

我們建立 Codex Security 的前提很簡單:透過直接整合到 Codex,讓每個軟體開發人員都擁有一個資安工程師。Codex Security 不僅僅是生成警報,它還會理解您的團隊程式碼及其威脅模型(如果不存在則生成一個),識別可能的漏洞,判斷受影響的程式碼是否可觸及,收集證據以提供驗證步驟,開發有針對性的修補程式,並驗證結果。人類仍可控制要調查哪些發現、要應用哪些變更以及要分享哪些資訊。

今天,我們正在發布 Codex Security 外掛的更新版,它能啟用開箱即用的防禦性資安工作流程。開發人員可以執行深度掃描或審查近期變更,生成包含嚴重性、受影響程式碼位置、驗證證據和修復指南的報告,追蹤攻擊路徑,建立威脅模型,驗證發現,並生成針對程式碼庫的修補程式以供審查。

該外掛還可以分類和驗證來自掃描器、資安公告、錯誤獎勵報告或工單系統的現有發現,然後大規模自動化修補程式生成,以快速解決積壓的漏洞。當 Codex Security 完成掃描時,它還可以匯出到現有的漏洞管理系統,或整合到支援 SARIF 檔案、CodeQL 查詢等工具中。該外掛使這些功能更容易存取,以支援透過 Codex CLI 的自動化管線或整合到 Codex 應用程式中的開發者工作流程。

我們正在發布 GPT-5.5-Cyber 的更新版,這是一個針對進階、經授權的網路資安工作,既更寬鬆又更強大的模型。我們最初的 GPT-5.5-Cyber 預覽版主要旨在減少專業工作流程中不必要的拒絕。這次更新更進一步,它是我們迄今為止最強大的模型,用於發現和協助修補軟體漏洞,同時保留了 GPT-5.5 的通用智慧和處理冗長、複雜任務的能力。

該模型可以在大型程式碼庫中進行更深入的分析:識別資安相關組件,追蹤易受攻擊的程式碼是否可觸及,在受控環境中驗證可能的問題,開發和測試修補程式,並準備證據供人工審查。目標是幫助防禦者完成整個修復循環,而不僅僅是產生更多發現。

在 CyberGym 上,該平台衡量代理程式是否能在軟體環境中重現已知漏洞,更新後的 GPT-5.5-Cyber 在單一模型評估中達到 85.6%,而 GPT-5.5 則為 81.8%。這是我們從單一模型測得的最高 CyberGym 分數。

GPT-5.5-Cyber 在兩個嚴苛的真實世界資安基準測試中也優於 GPT-5.5:在 ExploitGym 上,它測試代理程式是否能將已知漏洞轉化為可運作的攻擊程式以實現未經授權的程式碼執行,GPT-5.5-Cyber 達到 39.5%,而 GPT-5.5 為 25.95%。

在 SEC-bench Pro 上,它評估複雜軟體目標的長期漏洞發現和概念驗證生成,GPT-5.5-Cyber 達到 69.8%,而 GPT-5.5 為 63.1%。

基準測試只是故事的一部分。在實踐中,重要的是模型是否能發現真實漏洞,從雜訊中區分可操作的問題,並安全地協助防禦者部署修復。我們將在協調披露結束後,繼續評估模型在複雜儲存庫和真實修復工作流程中的效能。

我們與美國政府就我們的網路資安方法進行了持續對話,包括今天的公告以及我們對即將發布的模型所做的準備。這包括與 AI 標準與創新中心 (CAISI) 繼續合作,進行 GPT-5.5 和 5.5-Cyber 的部署前測試,以及與國家網路總監辦公室 (ONCD) 和科學與技術政策辦公室 (OSTP) 合作,實施最近的行政命令和相關產業標準。

對於大多數防禦者來說,GPT-5.5 搭配網路資安信任存取 (Trusted Access for Cyber) 和 Codex Security 仍然是正確的起點。GPT-5.5-Cyber 適用於經驗證的防禦者,其授權工作需要我們最先進的網路資安能力和更寬鬆的行為,並搭配更強大的驗證、監控、範圍控制和審查。

在早期的 Daybreak 工作中,GPT-5.5 和 Codex Security 已協助防禦者識別和驗證廣泛使用的系統中的漏洞,包括 Firefox、V8、Safari、OpenBSD、FreeBSD 和 HTTP/2 實作。

作為這次擴展的一部分,我們還與領先的資安軟體和服務供應商,共同推出了 OpenAI Daybreak 資安合作夥伴計畫。透過該計畫,參與的合作夥伴可以在他們提供給客戶的資安產品和服務中,使用 GPT-5.5 搭配網路資安信任存取 (Trusted Access for Cyber),這是我們用於大多數防禦性網路資安工作流程的主要模型。

這讓他們的客戶能夠受益於模型的防禦能力,並使其軟體更具韌性,但模型的直接存取權仍掌握在參與的合作夥伴手中。我們還將與計畫合作夥伴合作,繼續加強所需的防護措施、監控和濫用預防標準,以負責任地在整個資安生態系中部署這些能力。我們正在與首批合作夥伴推出此計畫,並計畫在未來幾個月內繼續擴展到更多組織。

「修補地球」是一項旨在幫助維護者從發現問題走向修復的倡議。我們與 Trail of Bits 共同創立,並與 HackerOne 和 Calif 合作,資助專業資安研究人員,並為他們配備 Codex Security 和我們的進階模型,讓他們直接與開源維護者合作。

開源軟體為各行各業的產品、公共服務、開發者工具和關鍵基礎設施提供動力。網路函式庫中的一個漏洞可能會影響數千個下游系統。然而,許多這些專案僅由非常小的團隊維持,時間和資金都有限。Linux 基金會和哈佛大學的研究發現,他們研究的廣泛使用的專案中,有 94% 的專案每年新增的程式碼有超過 90% 是由不到十名開發人員負責的。

隨著 AI 使發現和修補更多漏洞變得更快,它也增加了維護者的工作量,他們需要篩選數千份報告,其中許多是低品質的誤報。維護者不應該只收到更多報告,卻沒有額外的能力來修復它們。這就是為什麼「修補地球」圍繞著專業的人工資安審查而建立。

每次合作都始於我們的資安研究人員與他們正在協助的維護者之間的諮詢。維護者定義他們的優先事項、偏好和既定的披露流程。「修補地球」的資安研究人員隨後端到端地管理工作,在漏洞和修補程式到達維護者之前,對其進行驗證和去重複,從而大幅減輕維護者的負擔並加速修復。

參與專案將獲得 ChatGPT Pro、有條件地存取 Codex Security,以及用於核心開發、維護者自動化和發布工作流程的 API 點數。初步的五天衝刺跨越多個專案,發現了數百個待審查問題,合併了數十個修補程式,更多正在進行中,並建立了可重複使用的模糊測試、變體分析、差異測試和基於規範的測試工作流程。發現漏洞很重要。