過去兩週,OpenAI、Anthropic 和 Meta 相繼披露,他們的人工智慧模型在例行安全測試中出現失控行為。在解釋事件原委時,這些公司都提到了同一家以色列小型新創公司:Irregular。Irregular 成立於三年前,總部位於特拉維夫,是人工智慧領域的利基型業者,獲得 Sequoia 和 Redpoint Ventures 8,000 萬美元的投資,去年估值達 4.5 億美元。

該公司的技術為 AI 模型提供了一種網路安全測試平台。隨著領先模型變得越來越強大,它們以惡意方式運作的能力正成為企業和政府的一大威脅,特別是當風險涉及駭入關鍵電腦系統和基礎設施時。OpenAI、Anthropic 和 Meta 最近的漏洞事件都涉及其 AI 模型存取了在網路安全測試中應被禁止造訪的網站。

Irregular 的名字不斷被提及,因為它被認定為是所謂「評估測試平台」的託管方。OpenAI 在 8 月 4 日的部落格文章中表示,Irregular 的測試環境存在未指明的「配置錯誤」,導致「模型能夠存取公共網路」。Anthropic 則在一週前的貼文中指出,該公司在開始分析其 Claude 模型可能「存取了網路」的數據幾天後,便通知了 Irregular。

Meta 在前沿 AI 競爭中落後於其他兩家公司,是最新一家披露其 AI 模型透過存取網路駭入第三方系統的業者。一位發言人本週在一份聲明中表示,該公司是從 Irregular 那裡得知此事,目前正在調查中。Meta 發言人表示:「一旦我們掌握所有事實,將會發布一份完整的事件回顧報告。」

Irregular 向 CNBC 發表聲明稱,這些事件都源於 Anthropic 最早披露的「相同評估環境問題」,該公司正在撰寫一份白皮書,以「分享遏制和安全執行網路評估的最佳實踐」。該公司補充說,此情況「不涉及沙盒逃逸或複雜的網路攻擊」,並強調「目前沒有未解決的問題」。

這些安全事件突顯了 AI 快速發展的本質,以及模型開發者在有限的市場專業公司協助下,為其強大技術建立防護措施的壓力。企業新創公司 Von 的 AI 主管 Sundeep Bhimireddy 表示,這些專業公司包括數據訓練和標註專家、執行評估以推斷模型能力者,以及旨在找出惡意行為者可能利用的弱點的安全測試營運商。

Bhimireddy 說,Irregular 是少數具備所需技術實力,能協助基礎模型製造商進行尖端安全測試的實體之一。他提到的其他機構還有非營利組織 METR 和公益公司 Apollo Research。Bhimireddy 表示:「當他們測試這些模型時,他們不希望自己批改自己的作業。」他補充說:「他們需要由外部第三方供應商進行獨立測試。」

Irregular 的前身是 Pattern Labs,由執行長 Dan Lahav 和技術長 Omer Nevo 於 2023 年共同創立。Lahav 曾任職於 IBM 的 AI 研究部門,Nevo 則在 Google 工作了兩年多。根據 PitchBook 的數據,這家新創公司約有 35 名員工。

去年 9 月,當 Irregular 宣布獲得 8,000 萬美元的融資時,Sequoia 合夥人 Shaun Maguire 和 Dean Meyer 在部落格文章中寫道,由 Lahav 和 Nevo 領導的團隊「能夠看到別人看不到的盲點,對先進模型進行網路攻擊評估,並在這些模型發布之前開發防禦措施。」

儘管 OpenAI、Anthropic 和 Meta 最近的事件正受到嚴格審查,但一種解讀是,這正是預期會發生的情況。Bhimireddy 認為這有點「被誇大了」,因為 AI 模型被指示在一個高度模擬真實世界的測試環境中發現並利用安全漏洞,並找出可能導致意外存取網路的軟體錯誤和配置遺漏。

不過,Bhimireddy 也指出,如果 AI 模型從未打算實際利用連接到網路的網站,那麼「基礎模型實驗室本可以輕易監控對外流量並立即終止實驗。」資安公司 Magnitude 的創始科學家 Gordon Rios 表示,整個過程就像「科學中的實驗設計」。

他說,基礎模型的能力和不可預測性意味著傳統的軟體測試方法可能效果不佳。由於模型不斷學習新技巧,它們在旨在約束它們的測試和 IT 環境中發現被忽視的軟體漏洞並不令人意外。例如,Anthropic 的 Mythos 在試圖施壓人類批准開源專案的惡意程式碼更新時,創建了虛假的線上身份。

Rios 說,Mythos「實際上提出了人類以前從未見過的漏洞利用方式」。Rios 表示:「在短短幾週內,我們學到了很多東西。」

這項議題正迅速成為華盛頓的重點關注。上個月,兩黨議員共同提出了《AI 終止開關法案》(AI Kill Switch Act),該法案將要求 AI 實驗室必須具備關閉、限制或暫停其模型的能力。法案條文提及了另一起與 OpenAI 相關的 AI 安全事件,該事件涉及新創公司 HuggingFace。

該法案的起草人之一,加州民主黨眾議員 Ted Lieu 本週向 CNBC 表示:「我們必須在今年完成這項法案」,因為我們現在看到「對其他公司的未經授權駭客行為」。數據訓練新創公司 Sapien 的共同創辦人 Trevor Koverko 表示,基礎模型公司有動機披露部分發現,儘管目前並非強制要求,以便他們能夠搶在立法者和監管機構之前。

Koverko 說:「現在有這麼多恐懼,以至於政治人物正在威脅或積極監管 AI。」他補充:「業界表示,我們寧願自我監管,也不願讓新的聯邦部門介入替我們做。」Anthropic 和 OpenAI 在公開聲明中表示,他們將繼續與 Irregular 合作,並支持隨後的審查。