在 AI 安全的短暫歷史中,提示詞注入已迅速成為最大的威脅。大型語言模型本質上無法區分使用者提供的合法指令,以及潛藏在電子郵件、原始碼或其他模型處理的第三方內容中的惡意指令。這使得偷偷注入惡意指令變得輕而易舉,而大型語言模型會輕易地遵循這些指令。

由於無法強制執行信任與非信任來源之間的關鍵界線,AI 引擎開發者只能建立精密的防護措施,旨在減輕損害而非解決根本原因。

迄今為止,大多數提示詞注入攻擊都屬於「推播式」攻擊,即每個潛在受害者都會被單獨鎖定。例如,攻擊者將惡意指令注入單一電子郵件或行事曆邀請中。由於注入內容必須被「推播」到每個特定目標,因此攻擊規模受到限制,阻礙了針對整個網路的大規模利用。

同時,「拉取式」攻擊(即大型語言模型主動搜尋網站上植入的惡意提示詞)仍然有限。由於沒有辦法將大量大型語言模型引誘到惡意網站,這類攻擊也無法擴大規模。

現在,研究人員設計了一種「拉取式」攻擊,徹底改變了這種情況。這種被研究人員命名為 HalluSquatting 的新型攻擊,有潛力組建大規模殭屍網路、執行大規模分散式阻斷服務攻擊(DDoS),並大規模感染裝置,這是提示詞注入攻擊的首次突破。

這種攻擊對包括 Cursor、Cursor CLI、Gemini CLI、Windsurf、GitHub Copilot、Cline、OpenClaw、ZeroClaw 和 NanoClaw 在內的 AI 編碼助理和代理程式都有效。在日常活動中,這些助理和代理程式會例行性地從儲存庫和註冊表中拉取程式碼和其他資源。

HalluSquatting 是「對抗性幻覺佔用」(adversarial hallucination squatting)的縮寫,它建立在大型語言模型固有地傾向於「幻覺」儲存庫和註冊表中託管的資源識別碼的基礎上。它針對編碼代理程式和助理,這些工具通常會存取高權限的命令列來執行來自第三方資源的程式碼。

透過預測大型語言模型最有可能產生幻覺的識別碼,然後註冊這些識別碼並植入安裝反向 Shell 或其他惡意軟體的指令,這種攻擊可以不分青紅皂白地感染大量裝置,而無需針對每個裝置。