我們近期發現並阻止了一場有組織的行動,該行動旨在從我們的模型中竊取受保護的推理能力,最早的活動發生在七月的第一週。這種行為符合「對抗性蒸餾」(adversarial distillation)的定義:即系統性且未經授權地使用一個模型的輸出或推理過程,來訓練、複製或改進另一個模型。受保護的推理能力是模型在處理任務時的內部記錄;竊取它可能會揭露最終答案中未包含的資訊,並幫助他人複製模型的能力。

攻擊者並未破解我們的加密系統、入侵資料庫,也未直接存取儲存的使用者對話。相反地,他們透過操縱模型互動,以有組織、大規模的方式,將受保護的推理能力以請求者可見的形式重現,這違反了我們的服務條款。這種操縱並非 OpenAI 模型獨有的漏洞,我們已透過 Frontier Model Forum 與業界夥伴分享相關資訊,以加強對抗性蒸餾的集體防禦。

在發布此消息前,我們已調查了其範圍和潛在影響,部署了自身的緩解措施,並與研究人員和業界夥伴分享資訊並聽取反饋,以確保已建立針對此類攻擊的保護措施。額外的緩解和調查工作仍在持續進行中。我們相信現在分享所學,將有助於整個生態系統加強防禦。

我們觀察到攻擊者試圖以新穎的方式竊取受保護的推理能力,包括從一個對話中複製加密的推理內容,然後要求另一個對話中的模型解密並轉錄這些隱藏的推理內容。

獨立資安研究人員也透過負責任的揭露,向我們通報了相關的跨模型和對話壓縮漏洞。我們調查了他們的發現,並確認他們識別出的攻擊路徑確實存在。他們的工作幫助我們理解了更廣泛的攻擊類別,並加速了緩解措施的實施。

該活動始於 7 月 1 日,初期流量較低,直到 7 月 24 日和 25 日我們觀察到高峰,包含來自超過 4,000 名使用者的 16,000 次使用相關竊取模式的請求。進一步調查發現,在超過 15,000 名使用者群體中存在相關的提示詞模式活動,我們已於 7 月 28 日前完全阻止了這些活動。該活動隨時間演變,這再次證明對抗性蒸餾是一個更廣泛的資安挑戰,需要多層次、適應性的防禦措施。

目前尚不清楚我們在相關期間觀察到的所有攻擊者是否都來自單一實體。然而,我們將核心活動歸因於與 Kimi 開發商 Moonshot AI 相關的個人。

對抗性蒸餾帶來安全和國家安全風險。被竊取的推理能力可能被用來訓練另一個模型,而無需保留原始模型使用者端輸出所應用的安全防護措施。大規模的蒸餾還可以在不投入相同安全成本的情況下,加速先進能力的轉移。隨著模型在軍民兩用領域獲得能力,這些擔憂會更加劇烈。

這種風險並非 OpenAI 獨有。如前所述,類似的技術可能會影響其他先進的 AI 系統,這使其成為一個需要全產業協調的共同資安挑戰。

我們透過帳戶執法、技術控制和夥伴協調等多種方式,緩解了這次的模型蒸餾攻擊。我們封鎖或限制了詐欺帳戶,加強了註冊和基礎設施控制,並擴大了對相關網路的監控。

我們也加強了對跨使用者、工作區、組織和模型家族的隱藏推理能力的保護。我們關閉了一條允許已擁有其他使用者加密推理內容的人重播並恢復其內容的路徑,並增加了檢查機制,以偵測並攔截可能暴露推理能力的串流輸出。當相關活動透過第三方服務進行時,我們與這些供應商合作,識別並阻止了涉案帳戶。

最後,我們透過 Frontier Model Forum 和適當的政府資訊共享管道分享了相關發現,以便其他前沿模型開發者和公共部門夥伴能夠尋找類似活動並加強自身的防禦。支援可攜式或可重播推理產物的系統可能面臨相關風險。

我們預計,隨著前沿模型的改進以及攻擊者尋求更便宜的方式來模仿其能力,對抗性蒸餾的嘗試將變得更加複雜。防禦此類活動需要多層次的控制和持續的適應。

這項工作尚未完成。合作夥伴託管的部署需要與第一方服務相同的保護,而工具輸出攻擊則需要檢查的不僅僅是普通的顯示文字。我們正在持續改進工具防禦、分類器覆蓋範圍、模型拒絕機制,並將相關控制措施推廣到雲端合作夥伴。

我們的應對措施將繼續專注於三個領域:更強大的技術保護以防止竊取、更完善的協調行動偵測與執法,以及深化產業與政府間的威脅資訊共享。