代理式 AI 徹底改變了網路資安領域,它讓發現和修復軟體漏洞變得更快、更容易,也能更快速地開發出所謂的「攻擊利用程式」來武器化這些漏洞。然而,資深網路安全研究員 James Kettle 希望超越這種「漏洞獵捕」的現狀,探討一個更迫切的問題:隨著主要 AI 組織揭露真實世界中惡意 AI 駭客的案例,代理式 AI 是否能從概念到實際攻擊,開發出新穎、抽象的駭客方法?

Kettle 在週三於拉斯維加斯舉行的 Black Hat 資安會議上發表了他的研究結果,這些結果展示了 AI 在網路資安方面快速進步的能力,但也揭示了其局限性。目前,Kettle 問題的答案是微妙的:他總結指出,AI 在完全自主設計新攻擊路徑方面的能力或許微乎其微,且極其有限。

然而,重要的是,Kettle 發現當 AI 在關鍵時刻與人類的指導和洞察力結合時,它能成為概念化和發掘新駭客策略的極其強大夥伴。

Kettle 表示,在多年研究網路安全漏洞之後,他透過 AI 的啟發,發現了一個全新的潛在漏洞領域,並將其命名為「共享解析器混淆」(Shared-Parser Confusion)。這個漏洞源於網路伺服器使用共享程式碼來處理請求和回應的機制。

Kettle 在會議演講前告訴 WIRED:「這絕對是個大問題,因為如果你仔細想想,對網站的請求是完全不可信的,它們可以是任何東西,但回應卻是可信的。」他補充說:「因此,這是一個主要的攻擊面,並可能蔓延到許多不同類型的攻擊。」

這項發現源於 2025 年 9 月開始的數月實驗,當時 Kettle 使用了 Anthropic 和 OpenAI 最新的模型。Kettle 原本想探索 AI 進行理論安全研究的能力,但很快意識到一個障礙:這些系統試圖將現有研究冒充為原創,透過回傳關於極其深奧且難以驗證的主題的發現。

有鑑於此,他決定縮小測試範圍,讓 AI 系統在他自己的網路安全專業領域內運作。這樣他就能完全掌握資料,並確保 AI 無法欺騙他。此外,Kettle 意識到,透過綜合自己的研究方法並以此訓練模型,他可以更深入地探究這些系統獨立推斷的能力。

Kettle 表示:「我對將 AI 推向極限很感興趣,想看看它在哪裡會失敗,以及在哪裡需要人類的介入。」他指出:「目前很少有人討論 AI 的局限性,尤其是在資安領域,因為沒有誘因去談論這個角度。每個人都希望被視為『AI 原生』,而不是談論他們的系統在哪裡會徹底崩潰。」

隨著 Kettle 不斷完善他的實驗,為模型提供更多方法論資料和更精細的參數,以及隨著時間推移和更強大模型的推出,他表示這些系統的發現速度遠遠超過了他自己,形成了他所描述的「富有成效的研究回饋循環」。

Kettle 說:「這個過程真的很有趣。它可能每兩天就會有顯著的發現,甚至不需要我登入系統,這讓我感到焦慮。」他形容:「我幾乎不想知道。研究線索太多了,你會因為無法探索所有線索而產生錯失恐懼症(FOMO),所以這迫使你必須自動化更多的分析。」

除了在短短幾個月內發現比他幾年內可能發現的更多已證實的特定漏洞案例外,Kettle 也曾希望 AI 系統能找到一整類新型的這類錯誤。他表示,從某種程度上來說,AI 確實成功了,但這項發現與一種極其罕見的錯誤類型有關,並且在唯一可用的易受攻擊目標中實際上無法被利用。

然而,Kettle 強調,「共享解析器混淆」的發現之所以如此重要,即使它是人機協作的成果,是因為它闡明了 AI 系統目前如何最有力的貢獻於網路資安工作,無論是防禦性還是攻擊性駭客行為。

Kettle 說:「它無法自行證明這一點,但它分析了一些真實且已證實的發現,並提出了假設,然後我進行了評估並確認了它。」他認為:「這可能是具有最大長期影響的發現。它無法獨自完成,但我自己也絕對不可能找到它。即使你給我文件中的那一行,我也看不出來。但我們一起成功地找到了它。」