電腦科學家最近發現一種方法,可以提取頂尖 AI 模型在處理複雜問題時所進行的隱藏「思維」。這些發現提供了一些證據,儘管不是確鑿的證明,表明某些中國模型可能透過「蒸餾」美國模型的推理資訊進行訓練,這些資訊原本應該是隱藏的,因為它們的思維或推理模式似乎非常匹配。研究人員也證明,這種方法可用於從模型的內部推理中恢復個人資訊,例如密碼和 API 金鑰,儘管此漏洞已修復。

德國圖賓根大學的電腦科學家 Alexander Panfilov 參與了這項研究,他表示:「我們測試過的所有主要頂尖模型供應商都存在這個漏洞。」他補充說:「這可能導致個人資訊洩漏,並促成大規模的推理蒸餾攻擊。」

Panfilov 及其來自圖賓根大學、馬克斯普朗克研究所、AI 安全機構 MATS Research 和資安公司 Snyk 的同事,發現 OpenAI、Anthropic 和 Google 透過應用程式介面 (API) 存取的頂尖模型也存在同樣的問題。

在一篇闡述這項研究的論文中,研究人員指出,來自 Moonshot AI 的開源或可下載的中國模型 Kimi K3,在某些提示詞下,其輸出與 Claude Opus 4.8 和 GPT 5.6 Sol 的隱藏推理軌跡(解決問題所涉及的書面推理步驟)驚人地相似。

儘管存在這些相似之處,他們也強調這項研究「無法因果地確立蒸餾行為」。他們發現另外兩個開源模型,中國的 DeepSeek 和美國公司 Thinking Machines 的 Inkling,並未展現出與 Claude Opus 類似的推理模式。

截至發稿時,Moonshot AI 和 Z.ai 尚未回應評論請求。

蒸餾是一種行之有年且廣泛使用的技術,能有效將現有模型的能力複製到新模型上,在開發開源或完全可下載的模型時尤其常見。

然而,近期蒸餾已成為一個備受爭議的話題,因為有指控稱中國 AI 公司利用它來複製美國最優秀的模型。今年二月,OpenAI 告訴美國國會議員,DeepSeek 似乎複製了其一個模型來建立一個名為 R1 的推理模型。六月,Anthropic 則向議員表示,阿里巴巴系統性地蒸餾了其模型,以建立自己的 Qwen 模型。

目前沒有跡象表明中國 AI 公司使用了這項特定技術來蒸餾美國的 AI 模型。但 Panfilov 和其合作者表示,使用他們的方法將能夠從封閉模型中蒸餾出比以往更多的資訊。

迷你模型:先進的 AI 模型透過將複雜問題分解成組成部分,然後依序進行分析,形成一種人工推理或「思維鏈」。公司通常會將專有模型的推理過程保密,以防止他人用於訓練新模型。然而,它們通常也會將該推理的加密版本傳送給使用者的電腦,以分擔部分運算負載。

研究人員的攻擊利用了大多數 AI 公司也會提供不同尺寸相關模型的事實。大型模型能力更強,但運算成本和存取費用也更高。使用者可能會選擇較小、較弱的模型來執行某些任務以降低成本。

Panfilov 及其同事發現,將加密的推理軌跡輸入到同模型的較小版本中,可以揭示其內部隱藏的推理。這些較小的模型接受的對齊訓練較少,這意味著與大型模型不同,它們不太可能拒絕揭露其內部思維。

瑞士蘇黎世聯邦理工學院專攻電腦安全的電腦科學家 Florian Tramer 表示:「將訊息替換給具有相同解密金鑰但對齊能力較弱的較小模型變體,這個想法非常巧妙。」他補充說:「這絕對會成為一個問題。」

同樣的方法也揭示了從使用者機器捕獲的推理軌跡中嵌入的秘密資訊,包括 API 金鑰和密碼。

Panfilov 和合著者上個月已向 OpenAI、Anthropic 和 Google 示警此漏洞。各公司都已調整其 API 以緩解這個問題。Panfilov 表示,雖然現在無法再以這種方式提取私人資訊,但某些推理軌跡仍可透過相同方法被揭露。他指出,要徹底解決蒸餾問題,需要對這些公司的 API 運作方式進行根本性的改革。

Anthropic 發言人 Michael Aciman 表示:「我們重視對我們模型的獨立研究,並已開始為報告中描述的重放行為建立短期緩解措施。」他補充說,這項研究不涉及恢復加密金鑰、存取 Anthropic 的基礎設施或從其系統中恢復個人資料。

Google 和 OpenAI 均拒絕置評。

近幾個月來,隨著美中兩國公司競相開發日益強大的模型以爭奪 AI 霸權,蒸餾已成為一個地緣政治議題。中國鷹派聲稱,該國透過蒸餾美國技術來建立運作成本較低的開源模型,從而獲得戰略優勢。

然而,其他人則認為蒸餾是一種廣泛使用的方法,有助於快速提升 AI 模型在某些領域的能力。Meta 執行長 Mark Zuckerberg 本週在一篇部落格文章中表示,蒸餾「是開源生態系統運作的重要原則」,並警告限制這種做法將使美國處於劣勢。

科技政策智庫「安全與新興技術中心」的研究員 Kyle Miller 表示,目前尚不清楚蒸餾對中國的幫助有多大。這是因為它只能在有限的程度上增強現有模型的能力,而且中國公司似乎擁有從頭開始建立尖端模型所需的專業知識。「在美國,沒有人知道蒸餾對中國實驗室的益處有多大」Miller 說。「如果取消中國實驗室進行蒸餾的能力,我認為這不會顯著改變競爭格局。」

為了測試開源模型是否可能從封閉模型中進行了蒸餾,研究人員向每個模型輸入了 90 個問題。當他們向某些開源模型提供從專有模型組捕獲的推理軌跡的前幾個詞時,他們有時會看到這些開源模型產生驚人相似的答案。研究人員表示,這種情況在 Kimi K3 上尤其明顯。此前,中國社群媒體上曾有一些猜測,認為可能可以發現並利用隱藏的推理軌跡進行蒸餾。

牛津大學電腦科學家 Yarin Gal 表示,蒸餾不僅廣泛使用,也加速了 AI 的發展。他說:「如果每個人都阻止彼此進行蒸餾成為常態,那麼這也會對進步速度產生影響。」

公司和政策制定者可能會引入旨在限制蒸餾的措施,但即便如此,AI 模型仍可能以令人驚訝的方式揭露其內部思維。