自 2023 年初以來,攝影師 Jingna Zhang 與一小群志工不懈努力,維護著一個名為 Cara 的圖片分享社群媒體與作品集應用程式。迄今為止,它已吸引約 150 萬名藝術家。是什麼吸引他們來到這個平台?是對未經授權使用其作品來訓練 AI 模型的一致反對,以及在避免大型科技公司剝削的同時,公開展示其藝術作品的渴望。
然而,儘管 Cara 會篩選掉 AI 圖像並提供一些最低限度的保護功能,但要完全阻止爬蟲本身幾乎是不可能的。就在本月,從 8 月 13 日開始,Cara 遭受了三次大規模的爬蟲攻擊,導致其伺服器費用飆升,並讓那些從 Instagram 等平台遷移過來的創作者感到驚慌,因為在 Instagram 上,所有內容都明確可供 Meta 作為訓練資料使用。
第一起事件曝光,是因為負責人到 Reddit 的 r/DefendingAIArt 子版塊宣布,他已從 Cara 獲取了一個 12 TB 的檔案,其中包含 1200 萬件作品,這幾乎是其所有公開可用圖像的完整庫。他在已刪除的貼文中以「MandarinDawnPoppy994」的帳號寫道:「這是一個有趣的專案」,並表示整個過程花費不到 10 美元。
Zhang 告訴 WIRED:「我們實際上是透過用戶標記我們才發現的。」因為該爬蟲在 Reddit 上「沾沾自喜,並尋找其他人加入他,利用這個資料集做些什麼」,這在 AI 相關論壇中引發了關於他行為倫理的激烈辯論。她補充說:「我只是覺得這是針對性的,而且非常傷人。」
她指出「法律尚未跟上」對此類資料收集的保護,這意味著爬蟲者通常可以將其辯解為技術上合法。(Zhang 本人也參與了兩起由視覺藝術家提起的集體訴訟,一起針對 Stability AI、Midjourney 等公司,另一起則針對 Google,指控這些公司的圖像生成工具是利用他們的版權作品進行訓練的。)
然而,出人意料的是,這位從 Cara 抓取所有藝術作品的人,最終卻對自己的行為感到後悔,並同意與 Zhang 合作開發一款新的開源工具來保護藝術家。
不幸的是,在此期間,其他爬蟲者繼續利用 Cara 的漏洞和有限資源。儘管一些 AI 支持者反對針對 Cara 的行為,但顯然有少數人受到 MandarinDawnPoppy994 的鼓舞,進行了 Zhang 所稱的「模仿」攻擊。
第二位爬蟲者從 Cara 抓取了大約 850 萬個連結,以及使用者名稱、標題和標籤等中繼資料,並將這些上傳到 AI 開發者平台 Hugging Face。在 Hugging Face 收到大量下架請求後,它發表聲明回應,雖然會向用戶「CaptiveDreamer」發出通知,要求移除個人中繼資料,但無法對 URL 採取同樣措施,因為「這裡沒有託管藝術作品的副本」,且這些連結「指向藝術家在 Cara 上發布的副本」。該公司總結道:「基於相同理由的進一步版權報告不會改變這個結果。」
最後,在 8 月 22 日,第三位爬蟲者從 Cara 獲取了 123,000 張圖像,以及包含個人資訊的文字貼文和用戶簡介,並將所有這些內容分享到一個名為 Academic Torrents 的網站。Zhang 隨後發起了 GoFundMe 募款活動以支付法律費用,目標設定為 12 萬美元,解釋說這筆錢將用於探索透過網路和版權法捍衛 Cara 的所有策略。
截至週四,她已募得超過 10 萬美元,她表示 Cara 正在積極尋求任何額外的法律協助。
Zhang 不僅對爬蟲行為感到沮喪,也對她和 Cara 團隊能實際做些什麼來保護藝術家免受惡意行為者侵害感到困惑,她表示一些用戶已經刪除了他們的作品集並放棄了該網站。Zhang 談到該應用程式目前的防護措施時說:「我們在限制範圍內做了正確的事情,而沒有讓它變得難以使用。」這些措施包括一些新的臨時措施,例如登入驗證,她補充說,這並不是一個持續存在、網路範圍問題的真正解決方案。
Zhang 擔心,那些將一系列攻擊歸咎於她的人可能不明白,Cara 幾乎肯定像其他任何網站一樣,以前也曾被爬取過;它無法保證完全的安全。Zhang 談到那些離開的用戶時說:「如果刪除你的作品並離開 Cara 能讓他們感覺好一點,我支持這樣做。」「但我不想讓大家誤以為如果他們去其他地方就會更安全,因為事實並非如此。更大的平台會被爬取更多,這讓我感覺更糟。」
然而,Zhang 迅速向 WIRED 強調,她並非刻意成為科技創辦人,而是在這場戰役中找到了一位新盟友:正是本月引發爬蟲狂潮的那個人。在一位 Cara 用戶與他對質並最終說服他刪除資料集後,她與他取得了聯繫,以了解他的動機並確認刪除。Zhang 說:「他看到人們受到如此大的傷害,感到非常難過。」「所以他決定幫助我們。」
「Heft」是北美的一名學生,擁有軟體背景,對數位保存和檔案專案感興趣。(他要求我們僅以他的其中一個網路名稱稱呼他,因為他表示因 Cara 事件而收到人肉搜索和死亡威脅。)在 Discord 上的對話中,Heft 告訴 WIRED,爬取 Cara 最初只是一個技術專案,他無意公開這些資料。
Heft 說,他儘管如此還是「做了一個愚蠢的決定,試圖在 Reddit 上用這個資料集激怒大家」,並且「被評論中的嘲諷帶走了」。他知道這會激怒 Cara 上的藝術家,但沒有預料到那個社群會如此痛苦。他看到人們「分享他們因爬蟲而恐慌發作,以及他們如何從網路上刪除了整個作品集」。在與藝術家的直接對話中,他更深刻地體會到他們的作品對他們來說是多麼個人化,以及他們多麼重視其所有權。
Heft 說:「回想起來,不僅是刻意針對 Cara,而且以我在貼文中呈現的方式,都是殘酷且不經思考的。」「我錯過了這會造成超越一點點憤怒的後果。」
他指出,雖然他最初好奇這些資料是否能成功用於 AI 訓練,但他從未相信會如此,因為 1200 萬張圖像「對於訓練圖像模型來說並不多」,而且「大多數商業 AI 實驗室都是從 LAION 等開放資料組織提供的大規模網路爬取資料進行訓練」。Heft 說,隨機用戶可能會在 Hugging Face 上傾倒大量資料,但他認為「OpenAI 或 Anthropic 掃描每個新的 Hugging Face 資料集進行訓練的可能性極低」。
一旦擺脫了這種理論思維並決心彌補,Heft 便加入了 Cara 的 Discord 伺服器擔任故障排除員,並一直在找出為什麼許多提議的修復方案不太可能成功。Zhang 說:「他只是在幫助我們,你知道的,花時間解釋」那些允許爬蟲的結構性弱點。她表示,當對話中提到某個工具或設計時,Heft 會說明他如何「在幾分鐘內,真的,就能突破」。
正如 Heft 所說,因為他「相信沒有任何網站能真正做到『無法被爬取』」,所以他與 Zhang 正在合作開發一種事後能產生作用的對策。
這款名為 Lantern 的工具,允許藝術家為其圖像創建「單向指紋」,而無需將圖像儲存在平台上。Heft 表示,它「定期掃描新的公開可用 AI 圖像資料集」,如果藝術家的作品出現在其中,則「藝術家會收到通知和資料集的連結,以便他們可以要求移除或潛在提交下架通知」。
Lantern 才剛起步,它是一種在監管真空下誕生的不完美權宜之計。但 Zhang 和 Heft 的目標是讓藝術家對內容如何在網路上被大量收集有更多的控制權和意識,無論網站是否像 Cara 一樣在其服務條款中禁止這種行為。此外,由於它是開源的,任何人都可以為其程式碼貢獻。
Zhang 對於這次爬蟲狂潮的後果最大的希望是,它能引起政策制定者的關注,讓他們超越版權問題,因為版權只是這個複雜難題的一部分。
她說:「被 AI 攻擊將會變得非常、非常普遍。」而且大多數時候,攻擊者不會道歉,更不用說試圖彌補了。
更新,8 月 28 日星期五下午 2 點:此報導已更新,以澄清 Cara 領導團隊在網站被爬取後與 Husk 聯繫的過程。



