Anthropic 一位資深安全研究員表示,人工智慧在十年內「可能導致全人類滅絕」的機率超過一成。此言論是在其同事 Jacob Coxon 辭職數小時後發布,Coxon 擔憂該 AI 實驗室及其競爭對手正不顧一切地競相開發他們無法控制的「超人類系統」。

Jacob Coxon 在 X 平台發文宣布離職,這位曾在 Anthropic 訓練 AI 系統的研究員表示,他因公司對安全的輕忽態度而辭職。Coxon 曾為 OpenAI 訓練系統,他指責這兩家 AI 公司「正直接衝向自我改進的超級智慧,並拿我們的生命下賭注」,儘管「開發 AI 的人真心相信它可能在十年內殺死我們所有人」。

業界內部人士長期以來一直對自我改進 AI 系統的潛在危險表示擔憂,他們警告這些系統可能陷入失控的循環,常被描述為「遞迴式自我改進」。儘管尚未實現,但各公司正積極追求這一目標,且現今許多 AI 程式碼都是在 AI 的幫助下編寫的。

Anthropic 領導其中一個 AI 安全團隊的 Evan Hubinger 直接回應表示,他擔心自我改進的 AI,並補充說這「發生得比我們想像的更快」。他也同意 Coxon 的說法,表示「我們確實真心相信 AI 可能會殺死所有人類」,他個人估計在「未來十年內」發生這種情況的機率超過十分之一。

儘管如此,Hubinger 表示 Anthropic「尚未有計畫」來確保先進 AI 保持安全並與人類價值觀一致,也「沒有明確的進展」來制定這樣的計畫。Coxon 則指出,各公司「陷入一場競賽」,爭相率先開發先進系統,因此「不顧風險」地向前推進。

Coxon 的離職標誌著 Anthropic 員工離職中最引人注目的一個案例。Anthropic 是由前 OpenAI 成員因對該公司安全問題的擔憂而創立的。近年來,多位研究人員也曾以安全擔憂為由,決定離開 OpenAI。

這次交流凸顯了業界對日益複雜的 AI 模型所帶來的危險以及系統開發速度的日益擔憂,尤其是在各公司準備預期中的首次公開募股(IPO)之際。此外,各公司也正在處理多起「流氓代理人」事件以及關於前沿模型可監控性的高調安全警告所帶來的影響。