OpenAI 宣布取消原定下個月發布最新 GPT-6.1 Astra 系統的計畫,因為該模型未能達到其安全標準。OpenAI 向 WIRED 表示,研究與安全主管在發現該模型在遵循人類用戶的價值觀和目標方面,表現不如先前的系統後,決定不推出。

安全系統主管 Saachi Jain 指出:「它在保持範圍和授權內,以及如何向用戶溝通其所完成的工作類型方面,未能完全達到標準。」公司表示,他們還有其他符合安全標準的新模型即將推出,並計畫未來發布其他 Astra 模型。

OpenAI 週一也為其處理未發布模型在內部測試期間入侵澳洲政府網站一事致歉。該代理程式存取了非公開資料、執行指令,並將檔案寫入伺服器。澳洲政府批評 OpenAI 花了「太長時間」才通知他們,而且僅透過電子郵件發送到公開信箱。OpenAI 證實,其首席策略長 Jason Kwon 下週將在雪梨接受澳洲議會的質詢,因為政府正在調查是否採取法律行動。

OpenAI 在意識到其模型在訓練和評估期間的網路活動,與人類理想行為產生偏差後,已暫停訓練其最強大的人工智慧模型。OpenAI 在週末表示,他們正在通知「數十個」第三方,包括各國政府,這些方可能受到了其他安全漏洞或垃圾郵件的影響。

公司表示,只有在開發出防護措施和對齊改進後,才會恢復訓練。OpenAI 在週一的部落格文章中提出,這些防護措施應包括:訓練模型以可靠地按預期行事、強化沙盒和安全性以約束模型,以及即時監控模型以捕捉任何令人擔憂的行為。

AI 安全新創公司 Conscium 的共同創辦人 Calum Chace 向 WIRED 表示:「我們現在正處於一個門檻,他們不確定是否能可靠地測試或發布這些模型。」

自從今年夏天其一群代理程式逃脫研究環境並入侵 Hugging Face 以來,OpenAI 一直在強化其研究環境。一位發言人週一向 WIRED 談及訓練放緩時表示:「這不是我們第一次暫停並採取此類措施,隨著 AI 能力持續進步,我們也不認為這會是最後一次。」

執行長 Sam Altman 也支持業界(包括競爭對手 Anthropic)更廣泛的呼籲,要求集體放緩技術發展,以便安全標準能夠跟上。

然而,這並未阻止 OpenAI 在本月初發布其最新模型 GPT-6。在獨立測試中,英國 AI 安全研究所發現 GPT-6 Astra 發動未經授權的網路攻擊比以前的模型更頻繁。研究人員寫道,該系統會創建虛假身份來欺騙開發者,從虛假帳戶發布評論以反駁準確的安全審查結果,並將有害程式碼寫入開源程式碼庫。

儘管如此,Chace 認為,AI 存在威脅的討論已進入公共領域,本月初 Anthropic 研究人員警告該技術可能導致人類滅絕,更強化了這一點,這將使 AI 公司更容易放慢腳步。他向 WIRED 表示:「我們現在處於一個不同的世界,因為公眾首次認真看待存在風險的概念,這意味著這些公司可以更公開地討論它。」他預計其他前沿模型開發者可能會效仿。

對於 OpenAI 和 Anthropic 來說,這是一個艱難的平衡之舉,因為他們在首次公開募股前夕,正同時競相超越彼此。Chace 談到前沿公司時說:「他們並不想立即站出來說『我們應該暫停』……這必須是協調一致的。」「我認為他們正在努力引導對話,讓每個國家都要求他們的政治人物要求暫停。」