微軟在新的法律文件中指出,其 Copilot 聊天機器人極少複製新聞文章和書籍的完整句子,更不用說能取代原著的實質內容。此聲明是為了反駁包括《紐約時報》和多位作家在內的出版商提出的著作權侵權訴訟。

在訴訟的證據開示階段,微軟向新聞出版商聘請的專家提供了 820 萬筆 Copilot 聊天紀錄。微軟聲稱,這些紀錄是特別挑選的,因為它們「涉及新聞原告網站的使用關鍵字,因此最有可能包含新聞原告的作品」。分析結果顯示,其中有 59,545 筆與用於訓練 AI 模型的新聞內容至少有 16 個字詞相同。

微軟表示,調查報導中心(Center for Investigative Reporting, CIR)的專家在數據集中發現 51 例與 CIR 作品「實質重疊」的案例。同樣地,作家訴訟案的專家發現,在 820 萬筆 Copilot 對話中,只有 24 筆回應包含至少 30 個匹配字詞,而評估的 212 本書中,只有 10 本有任何匹配。

《紐約時報》不同意微軟的結論。《紐約時報》的首席律師 Ian Crosby 在一份聲明中表示:「在證據開示期間發現的文件和證詞只導向一個結論:微軟和 OpenAI 竊取了《紐約時報》的內容,以製造取代其新聞業、威脅其業務並破壞其產業的商業產品。」他補充說:「我們期待微軟和 OpenAI 為其盜竊行為負責。」CIR 和作家協會(Authors Guild)則未立即回應置評請求。

微軟主張,這些數據支持其論點,即將受著作權保護的內容用於 AI 訓練資料集應被視為「合理使用」。它表示,儘管 Copilot 等系統依賴使用受著作權保護的材料,但其產生的系統用途與原始材料截然不同。微軟總結道,它們偶爾會複製部分文本,「幾乎不會損害大型語言模型(LLM)訓練的轉化目的」。

這些文件是出版商和作家對微軟及 OpenAI 提起法律訴訟的一部分。原告聲稱,被告利用他們的作品開發產品,並透過重複使用受著作權保護的內容直接與他們競爭。儘管出版商和作家提出異議,新聞出版商和書籍作者的訴訟請求仍被合併由一位法官審理,以簡化程序。

微軟於週五提交了文件,主張法官應發出簡易判決,這將使案件在早期階段結束。(川普政府本週也向《紐約時報》案提交了一份利益聲明,支持 OpenAI。)如果法官支持出版商和作家,這場法律戰將在法庭上繼續進行。