本週,關於人工智慧(AI)可能有一天毀滅人類的警告,引爆了 AI 安全性辯論。然而,Anthropic 最新的威脅報告提供了一個更迫切的警示:現今的 AI 模型已經在協助美國的對手開發神風無人機、追捕異議人士,並進行危險的病毒研究。

這項發現至關重要,因為 AI 正在打破長期以來限制世界上最危險行為者的障礙。現在,少數人就能發動過去需要大量間諜、工程師或駭客才能執行的行動。

Anthropic 是以安全為導向的實驗室,也是 Claude 的開發者。他們表示,過去八個月來,他們一直在追蹤並阻止濫用其模型的行為。在他們發現的案例中,有幾個特別令人震驚。

一項與伊朗有關的行動利用 Claude 協助鎖定美國海軍部隊。Claude 協助建立了目標手冊,追蹤船隻位置、美國人員、飛機和船隻識別碼、衛星圖像以及揭露海軍動態的網站。其他與伊朗相關的行動則利用該模型進行宣傳、國內監控,並鎖定反對派人物和少數民族。

Claude 成為葉門團隊開發飛彈的工程師。葉門北部的一個武器小組依賴 Claude Code 開發火箭和飛彈的導引軟體。該團隊使用不同的 Claude 副本來編寫程式碼、進行研究並互相檢查工作。據稱,在一次導引火箭測試失敗後,他們在數小時內再次求助於 Claude,以診斷問題所在。

一項與中國有關的行動利用 Claude 追捕維吾爾族。Anthropic 表示,該行為者篩選了超過 100 個 WhatsApp 群組和數十個 Telegram 頻道,以識別敘利亞境內的維吾爾族人。這些維吾爾族人可能被施壓或收買,以報告武裝維吾爾團體的情況。

Claude 隨後協助一名不諳阿拉伯語的操作員,以敘利亞阿拉伯語進行秘密接觸,翻譯回覆並指導如何利用金錢問題、家庭分離以及仍在新疆的親屬來進行壓迫。

一名男子利用 Claude 協助為 2500 萬部手機建立監控系統。馬利的一名顧問依賴 Claude 作為全國性系統的主要工程力量。該系統能夠收集通話記錄、簡訊和語音流量,並能在不同 SIM 卡之間透過語音識別人員,標記 VPN 用戶,並在沒有搜查令的情況下,為任何電話號碼生成情報檔案。

Claude 拒絕了危險的病毒研究請求,因此該請求被轉移到另一個 AI 模型。獲得國家資助的研究人員試圖修改屈公病(一種蚊媒病毒),使其更容易傳播或逃避免疫防禦。這項工作旨在為軍事研究機構服務。Claude 阻止了最敏感的請求,因此該平台將這些請求轉發給了防護措施較弱的競爭模型,這嚴酷地提醒我們,單一實驗室的安全規則作用有限。

從字裡行間來看,頂尖 AI 實驗室正逐漸成為獨特的情報機構。賦予惡意行為者能力的相同模型,也能讓其開發者及早發現惡意活動。例如,Anthropic 發現了俄羅斯無人機被設計成無需人工批准即可選擇人類目標。這使得頂尖實驗室能夠對新興威脅有非凡的洞察力,即使 AI 讓雜牌團體、單獨操作者和其他難以追蹤的行為者發動更複雜的攻擊。

本週的事件點燃了華盛頓的關注,立法者突然將 AI 安全性視為一個緊急的政治議題。眾議院兩黨議員團體正在敦促議長 Mike Johnson 取消休會,直到國會採取行動。參議員 Bernie Sanders,可能是國會中最直言不諱的 AI 批評者,甚至希望徹底禁止超級智慧。然而,全面的聯邦 AI 安全規則仍然難以實現,特別是川普總統週五駁斥了滅絕恐懼,並將更大的危險歸咎於在 AI 競賽中輸給中國。