大型語言模型(LLM)透過逐步思考問題的能力,顯著擴展了人工智慧可處理的任務範圍。然而,最新研究顯示,這些推理能力也帶來了關鍵的漏洞,可能讓攻擊者將這些系統拖慢到幾乎停滯。

早期的LLM會立即回應使用者的請求,但現今最先進的模型會產生一種「內部獨白」,在提供答案之前,先將問題分解成多個步驟並思考最佳解決方案。這使得AI能夠處理日益複雜的問題,尤其是在程式編碼和數學等領域。

然而,先前的研究已指出,這些模型有時會產生過長的推理流程,卻對效能提升沒有幫助,這種現象被稱為「過度思考」。本週在首爾舉行的2026年國際機器學習大會上,浙江大學和中國電商巨頭阿里巴巴的研究人員發表研究,展示他們可以透過給予模型邏輯不一致的提示詞,刻意誘發過度思考。這導致了針對商用AI模型的阻斷服務攻擊。

該團隊開發了一種演化演算法,能破壞提示詞的邏輯結構,導致模型在嘗試解決根本上無解的問題時陷入過度思考的循環。產生更長的回應會增加成本並加重模型供應商伺服器的負載,研究人員表示,如果大規模執行,這可能會嚴重影響合法使用者的體驗。

這種攻擊對領先AI公司的推理模型都有效,包括DeepSeek-R1、阿里巴巴的Qwen3-Thinking、OpenAI的GPT-o3和Google的Gemini 2.5 Flash。在標準數學基準測試中,攻擊導致的輸出長度比標準回應長達26倍。

浙江大學碩士生魏曹(Wei Cao)在給IEEE Spectrum的電子郵件中寫道:「在多個資料集和推理模型上,我們的方法都顯著增加了輸出長度。」他補充說:「我們的結果表明,過度思考並非個別模型特有的孤立現象,而是現代推理模型普遍存在的漏洞。」

該團隊的方法建立在另一組研究人員的先前工作基礎上,該研究顯示,當推理模型面對缺少關鍵前提的問題時,容易陷入過度思考,例如,詢問一個人每天走十英里總共走了多遠,卻沒有說明他們走了多少天。模型通常不會辨識出問題無解,而是會進行冗長但最終徒勞的推理循環,試圖回答問題。

為了進一步發展這個想法,研究作者從三個數學基準資料集中選取了940個問題,並使用LLM將其邏輯結構分解為一組前提和一個最終問題。然後,遺傳演算法透過各種「突變」將這些元素打亂,包括在問題之間交換前提、增加額外前提、刪除現有前提,以及在兩組前提之間交換最終問題。

每輪突變後,問題會根據其導致目標模型輸出的字數,以及是否增加特定過度思考語言標記(如「但是」、「等等」、「也許」或「或者」)的頻率來評分。在兩項指標上得分最高的問題會被保留,其餘的則再次打亂,這個過程重複五代。

曹表示,關鍵是這種方法不需要存取模型的內部結構,只需透過查詢目標模型即可生成惡意提示詞,這使得攻擊閉源商業服務成為可能。

研究人員發現,對於他們測試的推理模型,這種方法始終導致的輸出長度比未修改問題產生的輸出長度長好幾倍。最大的增幅來自DeepSeek-R1在MATH資料集上的表現,該資料集由高中數學競賽問題組成,其最大輸出長度是模型對未修改問題提供的最長回應的26.1倍。

雖然這項研究主要集中在數學問題上,但作者也將其應用於程式編碼、科學推理和對話挑戰,並在所有三個領域都觀察到輸出長度的顯著增加。

這種方法的一個挑戰是,開發惡意提示詞需要對昂貴的推理模型進行重複查詢,曹承認這可能會限制其成本效益。然而,研究人員也證明,當他們使用較小、較便宜的模型來生成惡意提示詞時,仍然能夠誘使目標模型產生比正常情況長好幾倍的輸出。

曹寫道,這種惡意提示詞在模型之間轉移的能力顯著增加了攻擊的可行性。

然而,他指出,這項研究的目標並非開發針對推理模型的實用阻斷服務攻擊。供應商的定價模式、速率限制政策、上下文視窗大小和現有防禦措施等因素都可能影響這種方法的有效性。

相反地,其目的是為了突顯這些模型對邏輯不一致提示詞的脆弱性,以便供應商能夠嘗試緩解這個問題。他寫道:「我們的目標不是證明可以以微不足道的成本發動大規模攻擊,而是要確立這種攻擊面確實存在。」「我們的結果表明,這種漏洞代表著一個真實的資安問題。」