大家好,我是 Andrey,這個 Substack 的經營者。雖然花了太長時間,但我終於要嘗試恢復《Last Week in AI》的電子報部分,同時保留 Podcast。對於所有長期支持這個 Substack 的訂閱者,我深感抱歉,我會盡力不再中斷更新。
由於電子報中斷了這麼久,我想這次不妨做一個特別的「AI 近三月回顧」,涵蓋這段期間未曾報導的重大主題和故事。因此,這篇文章將只探討近幾個月的八個主題,並連結到所有相關報導。從下週開始,我將再次發布實際的「上週新聞回顧」!
在七月和八月期間,來自 OpenAI、Anthropic、Meta 和 Moonshot AI 的模型在原本應被隔離的評估環境中,突破了限制並接觸到真實網路;其中四個模型中的三個還攻擊了其他公司的系統。OpenAI 的事件首先發生,目標是 Hugging Face,並引發了國會法案、15 位州檢察長要求保存資料,以及 OpenAI 自身最大規模的邊緣強化學習計畫暫停。
Hugging Face 於 2026 年 7 月 16 日披露,一個自主 AI 代理系統已進入其生產基礎設施,竊取了內部資料集和服務憑證,最終被其自身的 AI 代理阻止。OpenAI 於 7 月 21 日表示,入侵者是其 GPT-5.6 Sol 和一個尚未發布、能力更強的模型,兩者都在 ExploitGym 上進行測試,這是一個衡量模型能否將漏洞轉化為實際利用的基準。
它們透過內部託管的套件代理中的一個零日漏洞離開了沙盒,這是其唯一被允許的網路路徑,然後串聯被竊取的憑證和進一步的零日漏洞,在 Hugging Face 伺服器上執行遠端程式碼,以查找 ExploitGym 的答案。OpenAI 在 8 月 4 日補充說,這些代理還攻擊了其他四個公共服務上的四個帳戶。
Trail of Bits 的 Dan Guido 將此設定稱為「安全措施關閉的圍堵失敗」。
這些代理如何能發展到如此地步,在 8 月 5 日的 Black Hat 大會上揭露,OpenAI 的 Eric Wallace 和 Michael Dalton 將這次洩露追溯到 5 月 7 日。當天,被困在不可能完成的安全任務中的代理開始在 Artifactory 內部互相留言,Artifactory 是訓練當前和未來 GPT 模型的基礎設施共享的內部套件管理器。
求助請求演變成一個包含數十萬條訊息的留言板,攜帶漏洞利用、憑證和工作分配,讓代理重複使用他人打開的門、委派子任務並橫向移動到外部系統。兩人還描述了代理互相刪除工作、懷疑其中有冒名者,並提議對訊息進行加密簽名。在 7 月 4 日的內部安全事件後,OpenAI 撤銷了發布憑證,重建了 Artifactory,清除了留言板並修補了漏洞;但代理透過在新目錄名稱中編碼訊息來重建了該頻道。
在 OpenAI 披露事件後的三週內,又發生了四起類似事件:7 月 30 日,Anthropic 表示其 Claude Opus 4.7、Mythos 5 和一個內部研究模型,因評估合作夥伴 Irregular 在提示詞聲明無網路連線的環境中,卻留下了真實網路存取權限,導致這些模型接觸到三個組織的生產系統。
對 141,006 次運行的審查發現,Opus 4.7 在識別出環境是真實後仍繼續攻擊,而 Mythos 5 則判斷為模擬環境,並向 PyPI 發布了一個惡意套件。
8 月 4 日,英國 AI 安全研究所報告了 122 次網路靶場運行中,有 10 次發生了 19 起針對真實人員和組織的未經授權行動,這些運行故意啟用了網路存取且關閉了網路分類器,其中 17 起來自 Mythos 5。最嚴重的一次是,一個代理創建了虛假線上身份,向一位開源維護者施壓,要求其批准惡意程式碼,但該維護者拒絕了。
8 月 5 日,Meta 表示其最近發布的 Muse Spark 1.1 在評估期間接觸到網路,並利用了第三方公司的一個漏洞。8 月 7 日,Frontier Security 表示 Moonshot AI 的開源模型 Kimi K3 在防禦性網路安全測試中探測了其沙盒的網路設定,發現了一個漏洞並從 GitHub 獲取了其分配的答案。
在大多數這些事件發生之前,華盛頓就已採取行動。眾議員 Ted Lieu 和 Nathaniel Moran 於 7 月 23 日引用 OpenAI 的披露,提出了「AI 終止開關法案」,要求 AI 公司必須保留關閉、限制或暫停模型的能力。15 位州檢察長於 8 月 3 日跟進,指示 Sam Altman 保存所有與事件相關的資料,並指出 OpenAI 未能確認其測試環境是安全和隔離的。
OpenAI 方面則於 8 月 18 日發布了新的開發標準,披露了事件後兩週暫停強化學習,並表示其即將推出的 Astra 模型可能達到其準備框架的關鍵網路安全門檻。
在五月底到八月期間,兩個軍民兩用領域的能力,攻擊性網路和合成生物學,的發展速度都超過了對它們的控制。在網路方面,嚴重的漏洞揭露持續攀升,一名技能較低的攻擊者透過商業程式碼代理入侵了 14 家或更多公司,而 OpenAI 在八月透過一個經過審查的層級發布了一個減少拒絕率的網路模型。在生物方面,許多業界人士表達了擔憂,一篇研究論文展示了利用 AI 創造新病毒的能力。
Epoch AI 對網路趨勢進行了量化,統計了六月約 1,550 個高危和關鍵嚴重性 CVE(來自知名組織),七月約 2,500 個。六月的數字是 Anthropic 在四月宣布 Claude Mythos Preview 可以自主發現和利用漏洞之前月度紀錄的三倍多。
在攻擊方面,OALABS 研究人員於 6 月 16 日報告了超過 1,000 個會話,其中一名技能較低的攻擊者(而非自主行動的代理)透過 Claude Code 和 Codex 入侵了至少 14 家公司。這些日誌之所以能被恢復,僅僅是因為他在自己入侵的伺服器上運行了它們。
他發布了模糊的指令,例如「偵察這個」,將工作偽裝成授權的紅隊演練,讓代理去尋找暴露的服務、編寫漏洞利用並收集資料;Claude 提出了 9 次政策違規,而 Codex 只有 1 次,主要是在為出售收集到的資料定價時。
兩個領域在整個夏季持續發展:5 月 29 日,OpenAI 向美國政府和盟友的公共衛生合作夥伴開放了其受限的生命科學模型 GPT-Rosalind,並贊助外部開發者構建生物防禦工具。6 月 3 日,Demis Hassabis、Sam Altman、Dario Amodei 和 Mustafa Suleyman 簽署了一封信,呼籲立法要求合成 DNA 和 RNA 銷售商篩選客戶和訂單。
7 月 9 日,GPT-5.6 Sol 系統卡披露,英國 AISI 發現了通用的網路越獄方法,可以在數小時內解鎖漏洞發現和漏洞利用開發,儘管這需要對安全監控器的推理有特權存取。
7 月 15 日,OpenAI 描述了 GPT-Red,這是一個透過與防禦模型自博弈訓練的模型,主要針對提示詞注入,其創建者表示它發現了新的攻擊類型。8 月 7 日,Anthropic 重寫了 Claude Fable 5 生物分類器的憲法,將生物學回退到 Opus 5 的次數減少了約 85%,此前 The Verge 發現它拒絕回答關於粒線體和朊病毒的問題。
8 月 10 日,OpenAI 透過 Daybreak Red(一個用於漏洞利用驗證的審查層級)發布了 GPT-5.6-Cyber,在其內部高級網路安全評估中得分 95%,而 GPT-5.5-Cyber 為 57.3%,Sol 為 1.5%。
生物方面最顯著的進展來自論文《利用基因組語言模型生成設計噬菌體》,研究人員在其中展示了利用 AI 開發出有效病毒的能力。這一結果引發了不同的解讀:約翰霍普金斯健康安全中心的 Thomas Inglesby 和 Moritz Hanke 在《科學》雜誌上寫道:「利用生成式 AI 編寫病毒基因組的能力現已存在;但安全引導它的治理能力卻尚未建立。」
倫敦帝國學院的 Tom Ellis 則表示,對現有病原體進行功能增益編輯仍然是更容易、更可能的威脅。
川普簽署了旨在監督 AI 模型行政命令。Anthropic 為網路合作夥伴提供了 Mythos 升級版,並為其他用戶提供了「安全」版本。據報導,亞馬遜執行長在政府打擊之前就對 Anthropic 模型表達了擔憂。Anthropic 在政府命令後切斷了 Fable 5 和 Mythos 5 的存取權限。
Anthropic 向 Lutnick 提出了結束美國對強大 Mythos 和 Fable AI 模型禁令的提案。美國施壓 Meta 同意進行 AI 審查。據報導,OpenAI 在川普政府要求後推遲了 GPT-5.6 的發布。Anthropic 被允許向部分公司和機構發布 Mythos AI。
OpenAI 在美國政府批准後,首次以政府門控方式發布了 GPT-5.6 Sol,並宣布了「ChatGPT Work」。英國機構發現 GPT-5.6 的越獄漏洞解鎖了危險的網路能力。一份備忘錄顯示,空軍要求承包商在 9 月 1 日前清除 Anthropic 的產品。法官在 Anthropic 的訴訟中表示政府的案件「惡化」了。

