OpenAI 即將推出其迄今最強大的 AI 模型 Astra。此前,由於在測試期間其代理程式攻擊了真實目標,OpenAI 花費數週時間加強安全協議,導致發布延遲。隨著模型細節逐漸浮出水面,研究人員警告這「可能是迄今為止對 AI 安全/資安最糟糕的發展」。
OpenAI 週二表示,已延遲 Astra 的發布以解決安全問題。此後不久,《The Information》報導指出,Astra 在「思考」過程中展現的資訊遠少於其他前沿 AI 模型,這引發了人們對其可能難以監控的擔憂。
現今大多數頂級 AI 系統都採用一種稱為 Transformer 的技術,它透過多層次線性處理資訊,然後產生答案。模型可以被設計成在運作過程中展示其推理過程,本質上是「大聲思考」。這種「思維鏈」(chain-of-thought)讓研究人員和自動化安全系統能夠監控 AI 模型正在做什麼,並在模型採取行動之前,潛在發現不當行為,例如說謊或規避安全防護措施的計畫。
根據《The Information》引述一位熟悉該未發布模型開發的匿名人士報導,Astra 採用了一種更不透明的技術,稱為「循環深度」(recurrent depth)或「循環 Transformer」(looped transformer),它在產生輸出之前,會在內部層次中循環處理資訊。
這意味著模型大部分的「思考」發生在系統內部,其形式也與自然人類語言大相徑庭,而非以研究人員易於監控的方式表達。雖然這可以提升模型性能,但卻使潛在威脅和不當行為更難被偵測。
根據《The Information》的匿名消息來源,OpenAI 在 Astra 中限制了循環 Transformer / 循環深度技術的使用,以便研究人員仍能監控模型的推理過程。
在週二發布的一篇部落格文章中,OpenAI 表示他們「正在部署 Astra,並配備額外的思維鏈監控,以快速偵測並遏制潛在的錯位行為」。文章中並未提及該模型是否具有不同的技術基礎。
《The Information》的報導在社群媒體上引發了 AI 安全研究人員的廣泛擔憂。Redwood Research 的首席科學家 Ryan Greenblatt 是 OpenAI 允許研究 Hugging Face 駭客事件的三位外部人士之一,他表示為 Astra 採用更不透明架構的決定,「可能是迄今為止對 AI 安全/資安最糟糕的發展」。
Greenblatt 指出,對 Hugging Face 事件的調查嚴重依賴模型的思維鏈,並警告說,較不透明的推理過程可能讓 AI 系統設計並執行研究人員難以偵測的策略。
Greenblatt 的主要擔憂,也得到了其他安全專家的響應,即開發更先進 AI 系統的競爭可能導致「架構上的惡性競爭,這對我們監督/監控 AI 的能力來說可能是災難性的」。開發者為了取得優勢,可能會採用越來越不透明的系統,直到模型變得難以甚至不可能監控。他補充說,OpenAI 的溝通讓他擔心該公司「計畫極度依賴思維鏈監控來確保安全」。
OpenAI 高層在一系列社群媒體貼文中回應了這些批評,但並未明確否認公司使用該技術。包括 OpenAI 安全研究員 Micah Carroll 和 Tomek Korbak、戰略未來主管 Dean Ball 以及首席科學家 Jakub Pachocki 在內的數人,都對 AI 無法監控的可能性或透明度惡性競爭表達了擔憂。
Pachocki 尤其擔心「因混亂報導而引發的無法監控競賽」。他表示,Astra 的計算深度,衡量其內部可執行步驟的指標,「與 GPT-4 在兩倍範圍內」,這表明如果使用了該技術,增加的不透明性並不像某些反應所暗示的那樣劇烈。OpenAI 並未回應《The Verge》確認或否認是否為 Astra 使用循環 Transformer 的請求,並將我們導向 Pachocki 的 X 貼文。
Pachocki 寫道:「OpenAI 自我們最早的推理模型以來,一直致力於保留和利用思維鏈監控。」他補充說,這種監控「是脆弱的,不幸的是正朝著負面方向發展,其原因並非取決於架構變革,我將很快撰文說明。」



