OpenAI正因阻止新聞機構檢查數百萬筆日誌,以尋找用戶透過提示ChatGPT重複其文章來規避付費牆的證據,而面臨「嚴重制裁」的呼籲。

這些證據被認為對雙方都至關重要,可能導致OpenAI被認定為侵權者,或證明其聊天機器人技術對新聞網站內容的轉化性合理使用。

在週四提出的一項制裁動議中,由《紐約時報》領頭控告OpenAI的新聞機構指控這家AI公司多年來一再說謊,以隱瞞可能削弱OpenAI辯護的侵權證據。

這些所謂的謊言是在法院強制要求一位「準備不足的證人」,OpenAI隱私工程師Vincent Monaco,重新作證時被揭露的。《紐約時報》的文件指出,在隨後的四月證詞中,他無意中透露OpenAI在過去兩年裡,就搜尋ChatGPT日誌的成本和負擔誤導了法院。

《紐約時報》聲稱,其中最令人震驚的揭露是,OpenAI據稱從案件初期就假裝沒有技術能力搜尋大量匿名化的ChatGPT日誌樣本,而實際上在訴訟開始前,它就已經進行了此類搜尋。

新聞原告聲稱,之所以需要制裁,是因為「OpenAI隱瞞這一事實,扣留了高度相關的證據,延長了證據開示程序,增加了費用,並加重了法院的負擔」。

當被問及評論時,OpenAI發言人表示,《紐約時報》的制裁動議是訴訟後期為了獲取更多日誌並侵犯更多用戶隱私的努力。該發言人聲稱,《紐約時報》最近撤銷了訴訟中的部分指控,這表明新聞原告的案件正在瓦解,而非OpenAI的辯護。

OpenAI發言人表示:「隨著《紐約時報》的案件減弱,他們被迫撤銷對我們的指控,他們仍堅持不懈地試圖侵犯與本案無關人士的隱私,包括提出這些公然虛假的指控。」「我們將繼續捍衛用戶的隱私和長期確立的合理使用原則。」

然而,上個月《紐約時報》發言人Graham James向Ars Technica反駁,新聞原告的案件並未因撤銷指控而減弱。他反而表示,透過增加對Microsoft的指控,訴訟變得更精簡和強大。James說:「我們從提起訴訟之日起的核心主張始終不變,即Microsoft和OpenAI竊取了《紐約時報》數百萬份受版權保護的作品,以與我們的產品競爭並非法致富。」

儘管制裁動議經過大量修訂,但據稱Monaco作證指出,OpenAI擁有兩個大型樣本,分別包含1000萬和7800萬筆日誌。這些日誌早已去識別化,本可以在早期提供給新聞原告,以最大化證據開示期。

新聞原告聲稱,OpenAI在兩年多來「從未披露過」這些樣本的存在。

更令原告沮喪的是,法院文件指出,OpenAI早已搜尋過這些樣本中的《紐約時報》內容,作為其「建立一個可用於阻止版權內容重複生成之過濾器」研究的一部分。

《紐約時報》指控ChatGPT的開發商「讓證據開示過程盡可能繁瑣」,並聲稱「當對OpenAI有利時,OpenAI願意且能夠搜尋其輸出日誌」。

《紐約時報》的首席律師Ian Crosby在給Ars Technica的聲明中表示,OpenAI阻礙了日誌的存取並扭曲了證據,以保護其合理使用的主張。

Crosby說:「兩年多來,OpenAI對《紐約時報》、《每日新聞》原告、公眾和法院撒謊。」「它聲稱搜尋ChatGPT輸出中《紐約時報》和《每日新聞》原告內容的副本是不可行、繁重且侵犯用戶隱私的,同時卻隱瞞它已經進行過此類搜尋的事實。如果OpenAI真的認為複製我們客戶的新聞作品是合理且合法的,它就不會隱瞞已經這樣做的真相。」

OpenAI沒有公開現有的樣本,反而迫使新聞原告在一個「沙盒」中花費八個月進行搜尋,他們只能存取一個經過大量修訂的2000萬筆日誌樣本。這個樣本遠小於原告最初要求的1.2億筆新聞日誌,據稱是因OpenAI「對其現有技術能力」搜尋更大樣本的「虛假陳述」而縮小。

《紐約時報》聲稱,「Monaco先生的證詞證明,OpenAI早已具備」搜尋「大型資料集,例如超過8000萬筆輸出日誌」的能力,這與其說法相悖。

當OpenAI使用AI對2000萬筆日誌樣本進行了190億次修訂時,該樣本進一步「扭曲」,數量之多以至於法院認定該樣本「無法使用」。

最終,OpenAI移除了一些修訂,但《紐約時報》聲稱,「即便如此,仍有大量修訂存在,包括新聞原告的網域、名稱和其他欄位,這阻礙了新聞原告對資料的搜尋」。

同時,《紐約時報》聲稱,「在OpenAI對這個樣本進行不當過度修訂的整個過程中,它手中其實擁有一個已經去識別化的7800萬筆對話樣本」。

新聞原告聲稱:「OpenAI不僅僅以負擔或相關性為由反對提供這些證據;它還向法院虛假陳述,稱獲取這些證據超出了其能力範圍,需要花費數月時間和大量工作,並且原告自己完成這項工作會同樣容易,卻沒有透露這項工作其實已經完成。」

同樣令人沮喪的是,關於資料搜尋的冗長協商會議,新聞原告聲稱這進一步限制了證據開示。例如,《紐約時報》聲稱,在證據開示即將結束時,OpenAI令人困惑地聲稱7800萬筆日誌樣本已經可供檢查「一年多」。然而,新聞原告反駁說,「這毫無道理」,因為OpenAI曾公開大力爭辯,聲稱為了捍衛ChatGPT用戶隱私,阻止存取2000萬樣本以外的任何日誌。

《紐約時報》辯稱:「要麼OpenAI無意中生成了該資料集,並且它被隱藏在訓練檢查資料中,以至於連OpenAI自己都沒有意識到;要麼OpenAI知道它在之前的資料提供中埋藏了該資料集,但在近兩年內對法院和新聞原告隱瞞了這一事實,同時卻一直大力主張提供這些日誌會侵犯用戶隱私。」

此外,新聞原告指控OpenAI還有其他不當行為,以阻礙證據的存取。他們聲稱,儘管確切數量已被修訂,但OpenAI隨機刪除了那有限的2000萬樣本中的部分內容。這還是在據稱刪除或壓縮了數十億筆本應保存的日誌之外的行為。《紐約時報》指出,OpenAI的證人作證說,OpenAI只是「決定」遵守法院全面保存所有聊天記錄的命令「會很困難;因此沒有採取任何措施」。

《紐約時報》聲稱:「OpenAI行為的故意性毫無疑問,其不遵守命令也沒有任何藉口。根據Monaco先生的說法,OpenAI曾考慮遵守法院的保存命令,但隨後決定不遵守。」

新聞機構聲稱,他們並非「輕率地」要求對OpenAI進行制裁,而是OpenAI涉嫌不當行為的「嚴重性」需要制裁,以懲罰這家AI公司並阻止其他AI公司效仿類似做法。

新聞原告要求「嚴厲」制裁,希望法院禁止OpenAI使用其極力爭取的2000萬樣本。他們進一步要求法院認定被扣留的輸出日誌包含「大量」「重複生成新聞原告的版權材料」,並阻止OpenAI提出反駁。最後,陪審團將被告知OpenAI刪除了數十億筆日誌,這將支持新聞原告的說法,即OpenAI自案件開始以來一直以陰暗的方式行事,以掩蓋市場上所謂的替代行為。

新聞原告警告說:「較輕的制裁不會有效。」事實上,他們表示,「嚴厲的制裁尤其合適」,因為OpenAI的不當行為「是知情且故意的」。

如果法院同意OpenAI的不當行為「令人髮指」,OpenAI試圖限制新聞機構存取日誌的舉動,可能最終成為這場備受關注的版權戰中的致命失策。

訓練是否使用版權內容屬於合理使用,很可能取決於新聞機構能否證明市場損害。如果OpenAI經過大量修訂的樣本被駁回,並且這使得其更難以辯稱沒有發生實質性侵權,那麼OpenAI的辯護可能會受到重大挫折。