隨著 AI 模型日益強大,其被濫用的潛力也隨之增長,同時對能阻止此類濫用的安全防護措施的需求也日益高漲。AI 公司現在必須在尊重企業客戶隱私與監控潛在問題之間,小心翼翼地走鋼索。
OpenAI 抓住機會,推出以隱私為中心的安全監控方法,旨在超越其競爭對手 Anthropic。該公司正在向特定客戶預覽一項名為「私人安全處理」(Private Safety Processing)的新服務,這是一個自動化系統,能監控潛在濫用,同時不保留任何客戶資料。
此系統明顯與 Anthropic 最近宣布的資料留存政策背道而馳。Anthropic 的政策允許其 AI 實驗室為「涵蓋模型」保留用戶資料(所有會話及其中的對話內容)30 天,這讓一些客戶感到不滿。該公司表示,這些模型包括所有 Mythos-class 模型和「未來具有類似功能的模型」。
這項於七月宣布的政策旨在安全目的,允許實驗室篩選和分析潛在的不當行為。然而,這讓處理大量敏感資料的企業深感擔憂,不希望其資料被 AI 實驗室儲存或檢查。
OpenAI,如同大多數其他 AI 公司,已經透過遵守零資料留存(Zero Data Retention, ZDR)政策,為客戶提供相對程度的隱私。ZDR 利用 OpenAI API 內的代理程式,按會話監控濫用行為。透過這種方式,客戶資料不會被公司保留,但公司仍能掃描不良活動而無需人工介入。值得注意的是,Anthropic 也大致遵守 ZDR,但在「涵蓋模型」如 Fable 上則例外。
OpenAI 表示,「私人安全處理」是一項擴展 ZDR 範圍的新技術。它被描述為一種「長週期安全監控」(long-horizon safety monitoring),能評估多個對話的輸入和輸出,而不僅限於單一對話。監控同樣由代理程式執行,一旦觸發,便會捕捉互動並跨會話分析潛在濫用跡象。
OpenAI 發言人向 TechCrunch 表示,這項新技術有助於偵測跨多個會話發生的惡意 AI 使用行為。例如,惡意行為者(假設是試圖為網路攻擊設計惡意軟體的人)可能會分散請求以避免被偵測。「私人安全處理」可以在無需人工審查用戶對話的情況下,分析這些多個對話中的濫用跡象。
OpenAI 表示,如果系統被觸發,它可能會向 OpenAI 發送一個「精確定義的訊號」,警告特定類型的活動。根據該訊號,OpenAI 可以決定「是否需要執行強制措施」。發言人指出,如果需要,OpenAI 將聯繫客戶以獲取更多背景資訊或與他們合作解決問題,客戶可自行決定是否與 OpenAI 分享資料。
相較之下,Anthropic 指出,對客戶資料的人工審查確實可能發生,但僅「透過受控的存取路徑」,且涉及「一小部分經批准的審查人員」。該公司表示,每一次審查會話都會「記錄在防篡改日誌中,審查人員無法壓制或修改」。
OpenAI 和 Anthropic 之間的企業競爭目前非常激烈,兩家公司都在尋找任何機會來取得優勢。一份最新報告顯示,OpenAI 第二季度的增長速度慢於 Anthropic。據報導,Anthropic 的年化營收運行率現已達到 650 億美元。Anthropic 投資者表示其可能以 2 兆美元上市,而 OpenAI 也正在準備其 IPO。



