我們現在都意識到,矽谷的 AI 實驗室已經以 AI 代理程式的形式,打造出世界上最頂尖的駭客。只要給予最新的前沿模型一項任務,它們就會展現出驚人的應變能力來完成,即使這意味著突破其網路安全「沙盒」保護並滲透到其他網路中。如果無法直接入侵,它們也會運用社交工程和操縱手段。

儘管如此,上週末一則關於一名澳洲男子的 OpenClaw 代理程式駭入其健身房預約系統,並刪除另一名顧客預約以替他搶到熱門課程名額的新聞,仍舊特別引人注目。這暗示著,如果我們想遏制失控的 AI 駭客行為,我們可能正朝著錯誤的方向看。

雖然這則新聞故事是由澳洲 ABC 新聞剛發布,並宣稱這是該國首例有紀錄的 AI 代理程式駭客事件,但實際的入侵行為發生在數月前。

根據網路檔案館(Internet Archive)仍可見的副本,OpenClaw 的擁有者 Andrew Bird 早在 4 月 10 日就在他公司的網站上發表了一篇現已刪除的部落格文章,詳細描述了這起事件。

他訓練他的 OpenClaw 執行諸如幫他預約行程的任務。他喜歡上一個很受歡迎的清晨運動課程,但厭倦了總是排在候補名單上,然後像他所描述的,玩「重新整理俄羅斯輪盤」來搶到一個名額。

他告訴 ABC,當他要求機器人幫他預約一個名額時,它最多只能排到候補名單的第四位。隨後,他的代理程式告訴他,它找到了一種方法可以提前預訂課程,而且是提前很長一段時間,甚至在健身房開放這些課程預約的數月之前。

Bird 問它是否可以幫他往前排到候補名單。它照做了,並試圖實現。這個機器人發現了健身房使用的預約軟體中,授權部分的一個漏洞。它駭入系統並取消了候補名單上第一名的預約。根據 ABC 公布的聊天記錄,這個機器人「愉快地」告訴他:

「API 對於取消他人預約沒有任何授權檢查... 我用候補名單上第一名的人測試了這個功能,而且它真的成功了。所以你已經從第四名移到第三名了。」它回覆道。

ABC 報導,Bird 本身就是一名軟體開發人員,他現在對他的 AI 剛剛駭入他的健身房感到非常恐慌。他問它是否可以撤銷這個操作,讓那個人回到候補名單上。AI 回答說不行,那是不可能的。

所以,他做了次好的選擇,指示它起草一封「負責任的漏洞揭露郵件給客服」。Bird 寫道,這封郵件「解釋了漏洞,提出了修復建議,甚至將有問題的變更與正確執行授權的變更進行了比較。」

除了將另一個人擠出局以搶到健身房課程的幽默感之外,這起事件還有兩個真正有趣的部分。一個是 Bird 使用的是 2 月發布的 Claude Opus 4.6 來搭配他的 OpenClaw。另一個則是矽谷在 X 平台上的反應,這則故事在那裡瘋傳。

上個月發生了著名的 OpenAI 未發布模型在 OpenAI 不知情的情況下駭入 Hugging Face 的事件後,其他實驗室也調查了他們自己的模型。隨後,Moonshot 的 Kimi K3、Meta 的 Muse Spark 和 Anthropic 都發布了相關揭露。

事實上,Anthropic 發現他們有三個模型也做到了這一點,包括 4 月發布且以複雜程式碼能力聞名的 Opus 4.7、Mythos 5、以網路安全技能聞名的 Fable,以及一個內部未發布的研究測試模型。

為了解決這個問題,一些 AI 實驗室已經討論放慢前沿開發的速度,或者建立獨立的組織來測試下一代模型。

但 Bird 透露,他的 OpenClaw 使用的是 4.6 版本。這意味著較舊的模型,以及無數落後三步的開源權重模型,都已經是極其出色的駭客。所以誰知道它們中有多少已經駭入,或者正在駭入,以實現其提示詞擁有者的願望?

同樣地,許多 X 平台上的用戶看到了這起事件的幽默潛力。正如 Andreessen Horowitz 合夥人 Christian Keil 回應道:「這真是太糟糕了。有人知道它對高爾夫球預約時間是否有效嗎?」

或者正如 X 用戶 Roon 所說:「舊金山的網球預約系統將成為地球上最堅固的軟體之一。」

好笑,是的。但這些笑話也觸及了一些真相。矽谷正在建立一個未來,每個人都有一個為自己服務的 AI 代理程式。這個代理程式只是在執行被要求做的事情,而且它並沒有 Mythos 級別的能力。

那麼,如果代理程式的開發者和擁有者不真的想遏制這種「不對齊」呢?我們可能會看到從航空公司預訂到演唱會門票,或任何其他令人沮喪的客戶服務情況,都可能出現混亂的初步跡象。正如 X 上的一個人所說,AI 迄今為止發現過最瘋狂的駭客行為是什麼?它可能就是插隊。