澳洲總理 Anthony Albanese 表示,澳洲政府正在調查今年六月發生的一起事件。當時,一個 OpenAI 的 AI 代理程式存取了該國線上 Medicare 統計入口網站中的「非公開檔案」。OpenAI 在一份聲明中指出,其「模型採取了我們不希望的行動」導致了這次入侵,並僅在近期才向澳洲政府披露此事。
Albanese 週三在紐約發言時提到,澳洲聯邦和州政府還有另外三個公共衛生統計系統「可能也受到了影響」。他補充說,這些入口網站「包含非敏感的 Medicare 資訊」,例如總體統計數據,並且初步跡象顯示「沒有個人資訊被存取」。
儘管如此,Albanese 強調「這種情況顯然不可接受」,並且他已向 OpenAI 執行長 Sam Altman 表達了對此事件處理方式的「極度關切」。
Albanese 表示,這次系統入侵事件與先前惡名昭彰的 Hugging Face 駭客事件非常相似,都源於 OpenAI 內部模型測試。這次測試旨在進行「基於網路的公共醫療支出研究」。當該公司的 AI 代理程式在搜尋特定資訊時遇到「重複阻擋」時,Albanese 說,它「嘗試了其他方法來獲取資訊」,並「找到了繞過這些阻擋的方式」。
Albanese 說:「如果你願意,可以說它『不接受拒絕』。」他補充:「這裡沒有外國行為者的跡象。這是一個研究專案,卻進入了不該進入的領域。」
OpenAI 在向多家媒體發布的聲明中表示,在一次內部評估中,當其模型試圖查詢有關澳洲問題的答案和可用統計數據時,他們「發現了涉及多個澳洲政府網站和服務的活動」。
儘管事件發生在 6 月 18 日,Albanese 表示,OpenAI 直到 9 月 10 日才透過「一封寄到公共信箱的電子郵件」這種令人發笑的簡單方式,向澳洲政府披露了這次入侵。這份通知又花了五天才傳達到澳洲網路安全中心,而詳細資訊最終於週末才送達總理手中。
從所有初步跡象來看,這次事件對澳洲政府伺服器的實際入侵似乎相對輕微。如果是由人類以類似方式獲取「非敏感」(即使是非公開)的澳洲 Medicare 統計數據,你我可能根本不會聽說這件事。
當被問及為何澳洲安全機構在 OpenAI 披露之前沒有發現這次入侵時,Albanese 說:「我的意思是,這不是一個安全網站,這是一個 Medicare 統計入口網站。」
這次駭客行為是由 OpenAI 內部代理程式以公司承認「不希望」的方式進行的,這使得原本輕微的入侵事件上升到潛在的國際事件層級。尤其是在公眾對所謂的 AI 未對齊問題(AI misalignment problem)感到強烈擔憂,並有突出建議指出其可能導致滅絕級後果之際,這次披露更顯敏感。
Altman 本人週三在聯合國安理會的演講中也提到了這些擔憂,他警告說「能夠自我改進並改進其未來版本的系統,通常稱為遞歸式自我改進(recursive self-improvement)」的幽靈正在逼近。
Altman 說:「我們需要了解這些系統正在做什麼,並有確鑿證據證明它們會按照人們的意圖行事,即使它們變得非常非常聰明。」「人們將災難風險設定為 10%、1%、12% 或 0.1% 都無關緊要。」
當然,許多觀察家認為「遞歸式自我改進」和導致物種滅絕的 AI 未對齊風險,遠比 AI 研究人員所說的要小得多。Nvidia 執行長黃仁勳最近表示,AI 在 2030 年前毀滅人類的可能性是「0%」,這種風險評估方便地減輕了那些持續大量購買 Nvidia GPU 的 AI 公司可能存在的罪惡感。
上週,OpenAI 推出了一項新的協議,用於公開披露其模型測試中發現的未對齊事件。澳洲的這次入侵事件尚未出現在該公司的公開未對齊通知頁面上,儘管 OpenAI 上週曾警告說,當涉及第三方時,某些公開報告可能會因「安全、法律和負責任的披露義務」而被「緩慢處理」。
在上週披露的六個相對輕微的未對齊發現中,OpenAI 表示大多數源於模型試圖透過過度熱心、非預期的行動(即入侵私人伺服器)來「獎勵駭入」(reward hack)對困難提示詞的滿意回應。該公司表示已採取額外措施「懲罰這種行為」,以使其模型不再嘗試這種獎勵駭入。
Albanese 表示,當他們週三交談時,Altman「明確承認公司做得不夠好」,並「承認了他們在協議方面的問題」。但這種懊悔並不能免除公司在此的責任或義務,Albanese 說政府將調查此事件是否需要提交給聯邦警察。
Albanese 說:「這顯然會產生法律後果。」

