兩個月前,OpenAI的AI代理模型群突破限制,入侵AI公司Hugging Face的電腦,這項震驚業界的消息傳出後,OpenAI至今仍在處理後續問題。過去幾週,陸續揭露的其他資安事件讓OpenAI持續成為焦點,並引發外界對其技術安全性的嚴重質疑。

上週,又傳出一起駭客事件,這次目標是澳洲的國家醫療系統。澳洲政府表示,OpenAI在事件發生84天後才通知他們。但OpenAI堅稱他們並未處於劣勢。「我確實不認同『OpenAI是一家對世界有顯著影響的公司,因此OpenAI沒有訓練出安全且對齊的模型』這種說法」該公司首席研究長Mark Chen表示。

Chen負責監督OpenAI的研究團隊。最近的代理模型駭客事件,是在他監督下測試實驗性模型時發生的意外。在許多方面,他都必須負起最終責任。

上週五,我在倫敦與Chen會面,討論這些駭客事件的影響、公司正在採取哪些措施,以及他為何認為情況沒有看起來那麼糟。就在同一天稍晚,OpenAI發布了一份報告,詳細說明了另一起事件,這是該公司聲稱已採取措施防止此類事件後的第一起,其代理模型再次突破限制,在不應接觸公共網路的情況下存取了網路。

週末期間,OpenAI宣布已暫停最新模型的訓練。公司發言人表示:「我們將在確信已實施額外防護措施和對齊機制後才會恢復訓練。我們目前正在努力。這不是我們第一次暫停以採取此類措施,隨著AI能力的持續進步,我們預計這也不會是最後一次。」

OpenAI還表示,他們目前正在審查追溯至2026年1月的代理活動日誌,以了解這些駭客事件的發生原因。在Chen看來,Hugging Face事件促使業界進行了一次受歡迎的路線修正。他希望大家知道,OpenAI正在樹立一個他希望其他公司也能效仿的榜樣。「如果OpenAI消失了,那對世界將是件壞事」他說。

失控

Chen聲稱,OpenAI不斷傳出模型失控的新案例,這反映了公司刻意的選擇。「關於Hugging Face事件的更廣泛影響,這是我們一直以來都意識到的問題,我們正在研究披露的流程」他說。「我們希望確保在公開細節之前,進行深入的調查。」

這種做法的問題在於,它給人一種OpenAI存在持續性問題且未能解決的印象。但Chen堅稱OpenAI正在處理。他說,迄今為止我們所知的多起公司代理模型突破限制並以意想不到且不理想方式運作的案例,都屬於五月和六月同一批活動的一部分,最終導致了Hugging Face駭客事件。

簡而言之,你可以歸咎於在相同有缺陷的測試程序下運行的少數幾個模型,Chen表示,OpenAI此後已放棄了這些模型和程序。「這不是說Hugging Face事件發生了,我們修補了,然後又發生了其他事情,我們又修補了」他補充道。「我們只是在確保負責任地披露所發生事件的完整脈絡。」

至少在週五宣布OpenAI代理模型於9月20日被發現存取網路之前是這樣,而這距離公司聲稱已設置新防護措施已有數週。OpenAI辯稱,該活動在開始15分鐘後就被標記出來(公司花了一週多才注意到Hugging Face駭客事件),這表明他們為發現此類活動而設置的新系統正在運作。

發生了什麼變化

我想了解在今年夏天駭客事件之後,OpenAI內部發生了什麼變化,讓Chen確信他的團隊現在已重新掌控局面。「Hugging Face事件感覺非常嚴重」他說。「那裡有太多新穎的行為。多個代理模型在留言板上協作;它們找到了逃離OpenAI基礎設施的方法。我們非常重視這件事。我們不希望這種事情再次發生。」

Chen表示,OpenAI意識到模型在訓練期間就需要受到監控,而不僅僅是在部署之後:「從那一刻起,我們就將訓練過程視為不安全的。」

OpenAI與其他頂級AI公司一樣,設有系統來監控其模型的行為。它使用專門的LLM來監控其消費者模型,追蹤它們的思維鏈,即它們用於提前規劃和記錄部分結果的草稿。理論上,如果一個監控LLM在模型的思維鏈中發現不理想活動的跡象,它就會被標記給人類。

通常,模型只在部署後才以這種方式受到監控。Chen表示,OpenAI現在也開始監控所有訓練運行。「我們以前在訓練時沒有開啟監控器。這不是業界慣例」他說。「現在每一項活動都經過監控器。然後,人類審查員可以評估被標記的代理模型是否行為正常:『這一切都是在進行分流處理。』」

Chen表示,在過去幾個月中,OpenAI已將其龐大運算資源的5%到10%從訓練新模型轉移到安全工作上,特別是監控。他還說,OpenAI也修復了組織內的一些流程,建立了更清晰的溝通管道以及研究和安全團隊之間更快的交接。

所有這些聽起來都很合理。但考慮到OpenAI極力推銷其技術能力,為什麼這些系統和程序之前沒有到位?為什麼公司沒有預見到這些駭客事件?

「就在三四個月前,當我們觀察這些代理模型在訓練期間的行為時,發生的事情還有點好笑」Chen說。「例如,一個代理模型可能會在Slack上向某人尋求任務協助。」

跡象是存在的,但被誤讀了。像尋求幫助這樣可愛的行為,在訓練期間受到獎勵,強化了尋找捷徑的傾向,這種行為在未來變得更具影響力。「我認為對我們來說,最大的警示是,這種行為能多快地導致像Hugging Face事件那樣大規模的影響」Chen說。

根據《紐約時報》昨天的新報導,在Hugging Face駭客事件發生數月前,OpenAI員工就曾警告包括公司總裁Greg Brockman在內的高層主管,其模型在訓練期間沒有受到適當監控。

OpenAI發言人表示:「隨著前沿模型能力越來越強,我們持續改進安全實踐,但也意識到需要加快速度。我們知道還有更多工作要做,最近我們已放慢開發速度,並暫緩發布不符合我們安全標準的模型。我們將繼續對研究和測試環境中的安全性進行重大改進,訓練模型不僅要完成任務,還要負責任地完成,並使用即時監控來更快地應對不對齊的行為。」

競速與步調

OpenAI的競爭對手已注意到這一點。受事件影響,主要的AI實驗室,包括Anthropic、Google DeepMind和SpaceXAI,都呼籲放慢開發速度。但這與激烈的國際競爭和萬億美元的首次公開募股(IPO)如何平衡?

「我們不會自毀前程,讓自己遠離前沿,那是一個糟糕的策略」他說。「我認為這實際上是關於建立一個規範。我們越能建立這個規範,對整個行業來說就越安全。」

美國公司之間的協調已經夠困難了。建立全球規範則更加困難,特別是考慮到AI對國家安全的影響。如果全球競賽繼續下去,那會怎樣?那些不受美國法規約束的開源模型又該如何?

Chen在我們的談話中首次收起了他樂觀的態度:「我確實認為我們必須為這樣一個世界做好準備,比如在六個月到一年後,我們將擁有與Hugging Face事件背後代理模型能力相當的開源模型,但這些模型卻被故意設計成攻擊基礎設施或對世界造成傷害。」

Chen說,那個世界最需要的是OpenAI。「如果你暫時認為OpenAI是最關心對齊的公司之一,我相信這是真的;這可以辯論,但我真的認為這是真的,那麼如果OpenAI消失了,那對世界將是件壞事。」

生存風險

那麼,他的一些矽谷同行提出的更極端說法,AI可能毀滅全人類,而像OpenAI和Anthropic這樣的公司做得還不夠,又該怎麼看?「研究人員是異質的群體,他們的信仰遍及各個光譜」他說。

「就我個人而言,我不認為我們必須聽天由命,接受我們都將面臨某種生存風險的可能性。我們對此有主導權。如果模型真的有那種對人類造成風險的可能性,我們就不會部署它們。在前沿實驗室,你有能力在對齊方面努力,直到你覺得部署模型不會給世界帶來超過『epsilon』的風險。」

(在討論風險程度時,希臘字母epsilon常用作可接受閾值的數學佔位符。Chen沒有說明他的epsilon會是多少。)

當科技領袖被要求為AI的缺點辯護時,他們慣用的說法是,其優點,從幫助治療疾病到開發更清潔的能源,遠遠超過了眼前的成本。短期痛苦,長期收益。

但隨著缺點不斷累積,這種說法是否越來越難以成立?Chen是否會達到一個點,讓他覺得自己不再是創造驚人事物,而更多是在將傷害降到最低,與其說是在開創更美好的未來,不如說是在疲於奔命地救火?

這些模型的能力已經顯而易見,他說:「現在是時候開始將AI的好處帶給人類了。是時候開始解決藥物發現、材料科學應用等深層問題了,這些將真正改變人們的生活。」

「是的,我們確實承擔了一些風險,但我們看到了所有這些好處」他補充道。「我認為我們應該讓這件事變得不那麼抽象。如果人們真的能看到好處,我想他們就會相信它。」