一些全球領先的音樂出版商認為,Anthropic 在一項歷史性和解中支付作者 15 億美元後,承認盜版了 700 多萬本書籍來訓練 AI,但這筆和解金太輕了。

音樂出版商在週五提交的訴訟中表示:「15 億美元顯然不足以嚇阻一家透過大規模侵權行為,將公司估值推升至驚人的 2 兆美元的公司。」

控告 Anthropic 的音樂出版商包括 Sony、EMI 和 Warner Chappell。他們聲稱 Anthropic 的非法種子下載行為也包含了「數以千計」受版權保護的音樂作品。

訴狀指出,詞曲創作者正日益與 AI 生成的作品在音樂排行榜上競爭,這種盜版行為對他們造成了傷害。

據稱 Anthropic 計劃「永遠」保留用於訓練 AI 的盜版書籍,其中包括披頭四的完整作品、泰勒絲的「最佳」歌曲,以及「VH1 搖滾樂 100 首最偉大歌曲」。出版商聲稱,若無禁令終止不當的 AI 訓練,Anthropic 將繼續侵犯音樂版權,透過逐字複製歌詞並生成模仿熱門作品「核心」的「新」歌曲,不當地取代市場上的藝術家。

例如,Anthropic 可能會依賴歌本或樂譜來回應提示詞,要求 Claude 將 Eminem 的歌詞改寫成「Beyonce 風格」的歌曲。

音樂出版商聲稱:「這是一場大規模非法種子下載、抓取和下載受版權保護作品的無恥行動,目的是為了開發、營運並獲取巨額利潤。」

Sony 重新揭露 Anthropic 員工聊天紀錄。Anthropic 的「大規模非法種子下載行動」始於 2021 年 7 月,當時 Anthropic 共同創辦人 Benjamin Mann「親自使用 BitTorrent 從具爭議的盜版圖書館 Library Genesis (LibGen) 非法下載並上傳數百萬本盜版書籍」。

據稱 Anthropic 共同創辦人兼執行長 Dario Amodei 批准了這項種子下載行為,他和 Mann 兩人都在音樂出版商的訴訟中被單獨列為被告。

訴狀指出,儘管聯邦調查局在 2021 年底關閉了 LibGen,「但線上盜版者在其關閉前複製了其內容,創建了一個名為『Z-Library』的新圖書館」。訴訟稱,儘管 Z-Library 也很快被關閉,但書籍作者訴訟中揭露的內部訊息顯示,Anthropic 透過「盜版圖書館鏡像」(PiLiMi) 獲得了該副本的副本。

Mann 被指控在 PiLiMi 上線後不久,便指示員工進行種子下載,並向同事發訊息稱該鏡像「來得正是時候!」一名 Anthropic 員工回覆道:「Zlibrary 我的摯愛。」

音樂出版商指出這些評論,證明 Anthropic 讚揚盜版行為,並依賴種子下載來快速獲取新的訓練資料。他們聲稱,透過爬梳 LibGen 和 PiLiMi 的非機密目錄,發現了「書目元數據,如標題、作者和 ISBN」,這表明「Anthropic 至少種子下載了數百本包含樂譜和歌詞的音樂作品」,這些作品為控告方的出版商所有。

訴狀稱,出版商聲稱將透過證據開示揭露 Anthropic 種子下載的「全部範圍」。

出版商懷疑 Claude 曾用熱門歌曲進行訓練。出版商承認 Anthropic 否認使用從 LibGen 和 PiLiMi 種子下載的任何書籍來訓練商業版 Claude AI 模型。然而,他們聲稱 Anthropic 的說法取決於「訓練」的定義,並認為如果法院追溯 Anthropic 的步驟足夠遠,可能會揭示商業模型在某個時間點曾使用盜版作品進行訓練。

他們解釋道:「通常,AI 開發包括一個『預訓練』階段,其中一個 AI 模型可能會使用由另一個 AI 模型創建的『合成資料』進行訓練,或從另一個 AI 模型接收其他行為回饋。Anthropic 至少使用了一個由非商業 AI 模型創建的合成資料來訓練其至少一個商業發布的 Claude 模型,而該非商業 AI 模型是使用來自 LibGen 和/或 PiLiMi 的文本進行訓練的。

Anthropic 至少使用了一個由 LibGen 和/或 PiLiMi 文本訓練的非商業模型,為至少一個商業版 Claude 模型提供強化回饋。」

此外,他們的訴狀指出,最近從書籍作者案件中解封的文件「揭示了 Anthropic 利用其從 LibGen 非法種子下載的盜版書籍來建立其防護措施」。例如,在一份文件中,一名 Anthropic 證人作證稱,Anthropic 已停止使用 LibGen 訓練大型語言模型 (LLM),但仍繼續使用 LibGen 資料集來檢查輸出中長字串是否與原始文本過於匹配。

Anthropic 的發言人向 Ars 提供了一份聲明,似乎暗示音樂出版商透過翻閱書籍作者已和解的訴狀來斷章取義。Anthropic 發言人表示:「這是同一批律師提出的第三起訴訟,重複了法院已審理案件中的指控。訓練生成式 AI 模型是一種具變革性的合理使用,正如法院在 Bartz 案中裁定,我們將堅決捍衛自己。」

據稱詞曲創作者受到 AI 歌曲的傷害。Anthropic 的聲明忽略了合理使用裁決的關鍵在於書籍作者未能證明市場損害,或 AI 工具已在市場上取代了他們。訴訟稱,只有 Anthropic 確切知道用戶多久會依賴 Claude 生成音樂家歌曲的替代品。但出版商似乎認為音樂版權所有者比作者更有機會證明市場損害。

他們聲稱 Anthropic 公開追蹤其 AI 產品對歌詞創作者的威脅,並且該公司知道目前登上音樂排行榜的 AI 生成歌曲,直接與那些歌曲被用於訓練 AI 卻未獲報酬的音樂家競爭,而這些 AI 正取代他們在榜單上的位置。訴訟指出,最明顯的是,美國著作權局「觀察到『當生成式 AI 模型的輸出,即使與特定的受版權保護作品沒有實質相似之處,但在該類作品的市場中競爭時』,包括在歌詞的情況下」,這些輸出可能會稀釋版稅池。

具體而言,書籍作者案件的法官寫道:「就像任何渴望成為作家的讀者一樣,Anthropic 的 LLM 訓練作品並非為了超越並複製或取代它們,而是為了轉向並創造出不同的東西。」但目前尚不清楚法院是否會同意這對詞曲創作者或代表他們的音樂出版商也同樣適用。

音樂出版商聲稱,Claude 被刻意訓練來「反芻」歌詞,不僅依賴盜版圖書館,還依賴其他未經授權的資料集,包括未經版權所有者許可從歌詞網站抓取的盜版內容。此外,Anthropic 據稱銷毀實體書籍以獲取更多資料,非法創建了「數百本歌本和樂譜集」的數位副本,這也侵犯了版權。

根據出版商的說法,Claude 模型在收到提示詞時會抓取歌詞,卻不分享版權管理資訊,甚至在用戶未要求時也會生成歌詞。例如,訴狀稱,如果用戶向 Claude 詢問某首歌曲的和弦進行,「AI 模型通常會生成包含『受版權保護歌詞以及這些和弦』的輸出」。訴訟還指出,Claude 在創作「新」歌曲時,也經常將實際歌詞與 AI 生成的歌詞混搭,並且能夠「回應各種用戶提示詞,重現這些作品的『核心』」。

Anthropic 似乎刻意將模型設計成這種運作方式。據稱,Anthropic 員工在公司要求他們測試 AI 模型是否能根據某人喜歡的音樂推薦類似歌曲後,「多次提示 AI 模型提供音樂出版商受版權保護的歌詞,鼓勵模型生成包含這些歌詞的輸出」。

Amodei 在書籍作者訴訟期間作證稱,Anthropic 本可以合法購買受版權保護的作品,但卻選擇種子下載,因為 Anthropic 希望避免「法律/實務/商業上的繁瑣」。法院將 Anthropic 的意圖總結為下載盜版書籍「以避免支付費用」,音樂出版商則強調 Anthropic 從未像其最大的 AI 競爭對手那樣,主動與他們達成授權協議。

Anthropic 嚴密保護其訓練資料來源,但音樂出版商認為法院應要求更高的透明度。出版商要求 Anthropic 被命令「提供 Anthropic AI 模型的訓練資料、訓練方法和已知能力的說明」。這樣,所有類型的媒體藝術家都能評估 Anthropic 如何獲取他們的作品、哪些作品被納入,以及這些作品對商業模型可能產生了多大影響。

音樂出版商聲稱,如果任由 Anthropic 依賴盜版和未經授權的作品來訓練 AI,將使詞曲創作者如今更難以謀生,同時以低品質的 AI 複製知名歌曲稀釋市場。當然,訴狀也指出,盜版行為也使得出版商更難以透過授權歌曲來訓練 AI 獲取報酬。

他們的訴狀稱:「Anthropic 從未尋求或取得任何許可,以合法利用音樂出版商受版權保護的作品進行任何用途,更不用說用於 AI 訓練資料或輸出。」「Anthropic 透過無償利用音樂出版商及其詞曲創作者的勞動來致富,降低了他們投資、支持和擴展當前及未來創意工作的動力。」