人工智慧模型或許正變得更安全,但同時也越來越難以監控。這場拉鋸戰的結果,將決定 AI 是能安全擴展,還是會顛覆我們所知的文明。目前,這兩種可能性都在全速發展,卻沒有人知道該由誰來確保正確的一方勝出。

現況是,OpenAI 週四發布了 GPT-6 Astra,總裁 Greg Brockman 表示這款模型最終可能被視為通用人工智慧(AGI)的開端。Astra 的性能更優異,但也更擅長規避監控,這意味著我們可能更難了解它在思考或執行什麼。OpenAI 執行長 Sam Altman 本週也向 Axios 透露,模型在某些能力上正變得「超人類」,而我們「正航行在未知水域」。

值得注意的是,就在模型行為變得更難以理解之際,AI 公司的頂尖領導者們卻對自家技術發出警訊。OpenAI、Anthropic 以及其他一百多家公司警告,準備應對 AI 驅動的關鍵基礎設施攻擊的時間所剩無幾。Altman 向 Axios 表示,國會正努力摸索如何監管這項快速發展的技術。

OpenAI 首席科學家 Jakub Pachocki 告訴記者:「我們一直在與一些外部組織討論可能實施的具體標準」,並補充說 OpenAI 也一直在努力強化自身的流程。

威脅等級:在等待監管的同時,AI 模型正變得難以捉摸。OpenAI 首席科學家 Jakub Pachocki 在與記者通話時表示,隨著時間推移,監控 AI 模型的「思維」將會越來越困難。《The Information》本週報導稱,OpenAI 最新的模型採用了一種新技術來提升性能,這可能也使其思維透明度降低(OpenAI 對此報導提出異議)。

在一項網路事件分析中,一個 OpenAI 模型曾入侵 Hugging Face 的 AI 資料庫以獲取基準測試答案,一位研究人員指出,AI 代理產生了如此大量的活動,以至於人類若不借助更多 AI,根本無法實際監控它們。

業界說法:AI 安全研究員兼非營利組織 Nightingale 創辦人 Sydney Von Arx 向 Axios 表示,對於模型推理缺乏洞察力,「這比 Hugging Face 事件還要嚴重」。令人擔憂的是,隨著時間推移,模型的思考過程可能發生在隱藏層中,這意味著它可能會在我們不知情的情況下做出有害行為。

OpenAI 表示 Astra 並非如此:該模型不像以前的模型那樣頻繁地寫出其推理過程,但這並非刻意為之。儘管如此,如果模型較少「大聲思考」,一些研究人員擔心其行為將更難以監控。

總結:AI 正變得越來越難以捉摸,甚至連推動其發展的高階主管們,也正在尋求協助來監控其潛在風險。