Anthropic 週五發表部落格文章,旨在回答關於其聊天機器人 Claude 如何為生成文本添加浮水印的一些基本問題。這些問題包括:浮水印實際如何運作?編輯是否能隱藏它?以及這對程式碼有何影響?

自 Anthropic 本週稍早透露將實施浮水印以來,Claude 用戶一直在討論這項舉措。此舉是為了遵守歐盟 AI 法案的透明度規範,該規範要求 AI 公司使用能識別 AI 生成內容的系統。

例如,在 Reddit 上,一位用戶將此描述為針對無辜 Claude 用戶的陰謀,而另一位則聲稱:「你唯一不想這樣做的理由就是想欺騙他人。」《商業內幕》報導,X 平台上「數十名」用戶因此聲稱取消了他們的 Claude 訂閱。

Anthropic 的新文章首先概述了浮水印的概念,解釋當 Claude 在做出「低風險選擇」時,例如在描述天氣時選擇「陰天」或「灰色」,它可以在回應中創建一種模式。這種模式「讀者無法察覺,但任何擁有解碼金鑰的人都能偵測到」。

該公司表示:「浮水印不會影響 Claude 輸出的品質。」「對讀者而言,帶有浮水印的回應與沒有浮水印的回應是無法區分的。」

更具體地說,Anthropic 表示將採用 Google DeepMind 團隊在 2024 年提出的 SynthID-Text 方法,並計劃發布一個浮水印偵測 API。它還指出,浮水印與 Pangram 等公司提供的 AI 偵測方法不同,後者是透過尋找寫作中的「特徵」(例如「這不是 [X],而是 [Y]」的結構)來揭示 AI 使用情況:「識別這些模式與檢查浮水印有本質上的區別。」

那麼,是否有人可以透過重寫文本來隱藏浮水印呢?Anthropic 表示這是有可能的,但「輕微編輯可能無法完全移除浮水印」,而「將每個字都替換的徹底重寫則可以」。

該公司表示:「在後一種情況下,當然,該文本是否還能被描述為 AI 生成的,這是值得商榷的。」

至於 Claude 僅用於校對或編輯的文本是否能偵測到浮水印,Anthropic 表示這將取決於「文本的長度以及 Claude 編輯的程度」。如果只是輕微編輯,「幾乎所有的詞語」都是由人類作者撰寫的,並且「浮水印幾乎沒有(或根本沒有)可以附著的地方」。

同時,程式碼的浮水印應該比其他文本少,因為模型需要創建可運行的程式碼,並且沒有自由選擇各種同樣有效的選項。

Anthropic 表示:「話雖如此,在程式碼中特定詞語或術語存在任意選擇的區域,例如程式碼中的註解,浮水印仍然可以使用。」「但從定義上來說,它對實際生成的程式碼影響微乎其微。」

Anthropic 還表示,Claude 不會是唯一生成帶有浮水印文本的 AI 聊天機器人,因為「其他主要的模型開發者也簽署了相同的行為準則,並將實施他們自己的浮水印」。