Anthropic 宣布,其模型處理(不只是生成!)的內容將很快加入浮水印。Anthropic 在一篇支援文章中解釋,此舉是為了符合歐盟的 AI 法案,該法案要求所有 AI 系統供應商必須為 AI 生成或修改的音訊、圖像、文字和視訊輸出加上浮水印。這項法律適用於 8 月 2 日之後發布的所有 AI 模型,並提供寬限期至 2026 年 12 月,讓供應商更新先前發布的模型。
Anthropic 證實,未來所有在全球(不限於歐盟)推出的新模型,都將「從第一天起」標記 AI 生成的內容。Anthropic 表示,文字輸出將「帶有嵌入式浮水印」,對用戶而言是不可見的,而其他「生成的檔案在支援的情況下,將包含數位簽章的來源後設資料」。
值得注意的是,Anthropic 採取了「全面標記」的做法,在支援的情況下,對所有經處理的內容都加上浮水印。儘管歐盟法規並未要求 AI 系統執行「標準編輯輔助功能」(例如語法修正)或「未實質改變」用戶文字或其意義的情況下也需標記。
模型層級的浮水印無法區分是全面生成還是僅修正一個逗號,因此 Claude 可能會標記到法律原意上不需標記的內容。究竟浮水印的標記程度有多徹底,必須等到 Anthropic 發布可供測試的偵測工具後才能得知。該公司表示,計畫最終會分享如何偵測標記的細節,以提供歐盟法律要求的技術支援。
Anthropic 也指出,這些浮水印在「某些不支援的平台或功能」上將無法運作。對於非文字內容,Anthropic 將採用 C2PA 後設資料方法來記錄來源。
歐盟描述並由 Anthropic 實施的這種方法,不幸地對惡意行為者來說,規避起來輕而易舉,同時卻可能懲罰那些信任系統能準確標記其輸出的用戶。文字浮水印的運作原理是透過在整個文件中散佈的模式來偏置模型的詞彙選擇,只有使用正確的工具才能整體偵測到。問題在於,「隱形」也可能意味著模型偶爾會為了保持訊號完整,而犧牲最佳詞彙選擇較差的詞彙。
Anthropic 指出,這些標記「在文字被複製貼上到其他地方時會隨之移動,並可能在某些編輯後仍然存在」。但是,如果帶有浮水印的文字被貼到另一個聊天機器人系統並進行編輯,浮水印可能會被破壞。對於圖像和視訊內容,截圖/錄影或使用任何好的後設資料編輯工具也足以移除這些資訊。一旦 Anthropic 公布如何識別這些浮水印,建立一個移除它們的系統將會非常簡單。
此外,誤解的可能性似乎很高;浮水印本身並非特別具資訊性。Anthropic 解釋說,「偵測到的標記提供了一個內容曾由 Claude 處理的訊號,但並非完全結論性」。Anthropic 表示,該標記唯一真正的訊息是「內容可能曾由 Claude 處理」,甚至可能出現在並非由 Claude 生成的內容上。
除此之外,一般大眾可能無法理解經處理的文字與完全由 AI 生成的文字之間的區別。如果系統僅因為人類撰寫的文字在涉及 Claude 的工作流程中被編輯過,就加上浮水印,那麼它突然就帶有與完全由 AI 生成文字相同的含義。Anthropic 表示,在這樣一個系統中,「缺乏偵測到的標記並不意味著內容未經 AI 生成或處理」。
值得肯定的是,Anthropic 承認它可能會標記一些 AI 法案並未要求標記的內容:「人們經常使用 Claude 進行校對、翻譯、摘要或檔案轉換。即使底層的想法、文字或資料源自其他來源,輸出內容仍可能帶有 Claude 的標記。」因此,儘管法律明確豁免,Claude 仍會標記對原始寫作所做的任何編輯工作。
如果浮水印成為所有 Claude 用途的「萬用標籤」,從拼寫檢查到完全重寫,Anthropic 的解決方案可能會因為過度標記內容而讓用戶感到沮喪,這可能無意中混淆了內容來源。例如,教師或教授不應將此浮水印訊號解讀為「AI 觸及過此內容」之外的任何東西,但很容易想像他們會這樣做。畢竟,一個無法區分輕微編輯和完全生成文字的浮水印有何意義?
當我們轉向歐盟 AI 法案的另一部分,即 50(4) 條,該條規定發布此類文字者必須明確標記內容時,情況變得更加模糊。根據其標記制度,完全由 AI 生成的文字在大多數情況下不需要標籤。AI 撰寫的小說?無需標籤。AI 生成的行銷文案?也不需要。
但是,如果文字旨在「向公眾告知公共利益事項」,則必須標記,除非有人類進行編輯審查(意味著編輯者是已知且負責的)。因此,我們面臨一個奇怪的局面:在模型層級是「所有東西都加浮水印」,但在公開揭露方面卻是「如果 Joe 看過這段 AI 文字,你就不需要標記它」。
Ars 已聯繫 Anthropic,詢問是否有關於偵測細節發布的時間表,或公司是否能分享任何評估假陰性或假陽性可能性的測試結果。我們也詢問 Anthropic 是否能說明其浮水印如何與標準編輯和 AI 法案的其他豁免條款產生衝突,但 Anthropic 發出的聲明並未回應 Ars 的問題。
Anthropic 表示:「我們正在為 Claude 的輸出添加標記,以符合歐盟 AI 法案,其他實驗室也正在採取類似措施。識別 AI 生成的文字很困難,而這為人們提供了更好的識別工具。來自支援的 Claude 模型(包括 Claude Code 的輸出)的文字將帶有隱形浮水印,並且不會改變 Claude 回應的意義、品質或可讀性。我們也計畫推出文字偵測 API,讓用戶可以自行進行更多識別。」
在歐盟,透明度要求旨在確保像 Claude 這樣的 AI 工具不會破壞「資訊生態系統的完整性和信任,引發大規模錯誤資訊和操縱、詐欺、冒充和消費者欺騙的新風險」。一篇歐盟支援文章預測,這些義務將是許多 AI 公司面臨的「主要合規挑戰」。
歐盟委員會的指導方針指出:「人們應該知道他們何時正在與 AI 互動或接觸到 AI 生成的內容。」「這將幫助他們做出明智的決定,校準他們對 AI 的信任和依賴,並避免錯誤資訊或欺騙。」然而,這很難與一個完全由 AI 生成的公共利益文章,如果經過編輯適當審查,會獲得浮水印卻沒有面向讀者的標籤這一事實相符。
歐盟預計,像 Anthropic 這樣的 AI 公司最適合開發浮水印解決方案,因為 AI 發展迅速,將持續「需要新的方法和技術來追溯資訊來源」。
但這在很大程度上將這些標記的社會價值交由科技公司決定,歐盟僅規定「技術和方法應在技術可行範圍內足夠可靠、可互操作、有效且穩健」。
Anthropic 在其文章中表示,計畫將繼續改進其浮水印和偵測方法,以符合歐盟的要求。如果 Claude 的標記未能達標,AI 法案對違規行為處以嚴厲罰款,包括最高 1500 萬歐元或公司全球年收入 3% 的罰款。

