如果你真心喜愛一本古書,甚至對其脆弱泛黃的書頁中,蘊含著人類早期探索世界的方式感到驚嘆,那麼關於科技公司為訓練 AI 而銷毀書籍的報導,無疑會深深刺痛你的心靈。

想像成堆的書脊等待被送入碎木機,而撕下的書頁被裁切、掃描並丟棄,確實令人沮喪。然而,這是最便宜、最快速的掃描方式,而 AI 公司正競相透過訓練模型來提升能力,這些模型需要大量引人入勝、高品質的長篇文本,而這些文本只能在書籍中找到。因此,愛書人士擔心這種做法的規模可能比目前報導的更大,一些實體書籍將永遠消失。

然而,這種破壞之所以格外令人心痛,是因為它其實不必如此。

Google 早在 2009 年就申請了一項非破壞性書籍掃描技術的專利,AI 公司若願意放慢腳步並投入資源,便可有效利用該技術掃描書籍。然而,這項技術並不完美;研究發現,頁面彎曲可能會導致文字變形,甚至遺漏頁面。正如 Wired 報導,當工作人員操作過快時,也可能出現錯誤,例如無人身體的手遮擋頁面。

整體而言,成本與速度之間的權衡可能無法吸引那些尋求最便宜方式掃描數百萬本書籍的 AI 公司。而且,Google 的方法也未必是處理珍稀書籍的最佳方式。長期以來,協助圖書館保存老舊藏書的 Internet Archive 深知掃描古籍需要時間與細心,以減少處理過程中的損害,這也是為何它被視為一項如此需要人力的工作。

對於一心想走捷徑的 AI 公司而言,Internet Archive 的方法可能顯得格格不入。

但如果你是一位愛書人,正在為 AI 驅動的書籍銷毀傳聞尋求慰藉,Internet Archive 2021 年的一篇舊文章描述了他們如何掃描書籍,以避免損壞最珍貴的珍本。文中,自 2010 年起就在該檔案館工作的書籍掃描員 Eliza Zhang,分享了她為何如此喜歡「費力」掃描書籍的禪意時刻。

該文章指出,Internet Archive 確實嘗試過自動化路線,甚至測試過「配備真空吸力翻頁臂的商用書籍掃描器」。但 Internet Archive 表示:「事實證明,這些自動掃描器對於脆弱的書籍、珍稀卷宗以及其他特殊藏品,也就是我們的圖書館合作夥伴要求我們數位化的材料,效果不佳。」

Zhang 表示:「這份工作需要高度專注。」因為「非常古老、脆弱的書籍」的書頁「薄如紙片」。文章中,協助領導檔案館書籍掃描業務的 Andrea Mills 解釋道:「乾淨、乾燥的人手是翻頁的最佳方式。」

為了確保每本珍稀書籍只需經歷一次掃描過程,Zhang 總是從容不迫。她每次翻頁時都會用腳踏板小心地抬起掃描儀玻璃,然後調整相機並確保頁面清晰可讀。她還會留意任何摺頁,設定提醒自己回頭掃描這些插頁,以確保在記錄作品主要內容的同時,不會遺漏額外的資料。

在整個過程中,她知道如果跳過一頁或影像模糊,Internet Archive 的專有軟體會停止進程,並提示她重新掃描。然而,熟能生巧,經過十多年在工作中找到節奏後,她報告的錯誤率很低。

該文章指出,當時 Zhang 已掃描了「超過 300 萬頁、14,000 個摺頁和 18,000 件物品(主要是書籍)」,目標是確保「零錯誤」。

Ars 向 Internet Archive 徵求評論,但圖書館服務總監 Chris Freeland 表示,詳細介紹 Zhang 工作的文章「至今仍是我們掃描過程的最佳描述」。

這篇文章是在 Zhang 掃描書籍的影片在當時的 Twitter 上獲得 150 萬次觀看後發布的,影片配文引起了當今對 AI 驅動書籍銷毀感到震驚的愛書人士的共鳴。該推文寫道:「在 Internet Archive,我們是這樣將書籍數位化的。我們從不透過切割書脊來破壞書籍。相反地,我們以費力的方式,一次一頁地將其數位化。」

自從 2025 年夏天的一起訴訟揭露 Anthropic 為訓練其 AI 模型而銷毀數百萬本實體書籍以來,愛書人士便開始行動,以保護一些最珍貴的藏書,免受 AI 公司似乎無止境地將世界上所有書籍餵給其大型語言模型的追求。

對於希望在訓練過程中保存書籍的人來說,最大的恐懼是 AI 公司會無情地將那些無法替代的珍稀書籍打成紙漿。

正如《大西洋月刊》上週報導,在兩份近期報告指出 AI 已危及珍稀書籍後,社群媒體「怒火中燒」。首先,《電訊報》指責矽谷銷毀數百萬本珍稀書籍並「粉碎原件」,接著 404 Media 報導稱,一家名為 ISBNdb 的書籍資料庫公司正在宣傳它可以幫助 AI 公司批量採購書籍。

這種反彈是預料之中的,據報導 ISBNdb 曾警告其客戶,此舉觀感不佳。Anthropic 開始為其破壞性書籍掃描使用代號「Project Panama」,試圖將其隱藏於公眾視線之外。

沒有跡象表明 Anthropic 曾銷毀珍稀書籍,該公司也在聲明中否認這樣做。事實上,一些 AI 公司正在幫助保存珍稀書籍。例如,OpenAI 和 Microsoft 正與哈佛大學圖書館員合作,一項旨在利用約一百萬本可追溯至 15 世紀的公共領域書籍來訓練 AI 模型的計畫。

其他公司,包括 Elon Musk 的 xAI,也公開表示他們不會銷毀珍稀書籍來訓練 AI。Musk 在 X 上發文稱,他「已要求 SpaceXAI 團隊保存圖書館中的任何珍稀書籍,並以費力的方式掃描它們,而不是直接切掉書脊進行掃描。」

但並非所有人都相信最大的 AI 公司在保存珍稀書籍的承諾上是真誠的,即使版權法允許他們銷毀已購買的書籍副本。社群媒體和 Reddit 上的批評者指出,Musk 並沒有說 xAI 團隊不會銷毀任何書籍,而且不清楚他的公司如何定義「珍稀」書籍。

與此同時,珍稀書籍銷售商繼續標記奇怪的訂單,他們意識到大多數真誠的買家傾向於尋找單一書籍,而不是大量訂購各種不同的書籍。就在昨天,據《愛爾蘭時報》報導,一家名為 Kennys 的愛爾蘭書店標記了一筆「瘋狂」的 5,000 本冷門書籍訂單。與大學或大型圖書館的批量訂單不同,這筆訂單顯得可疑,因為買家沒有嘗試討價還價,《泰晤士報》報導稱,這已成為一個明顯的「危險信號」,表明可能涉及 AI。

儘管一些書商表示他們短期內可能從大訂單中獲益,但他們擔心向那些不加區別地銷毀其藏品的 AI 公司出售書籍,「可能是在自掘墳墓」,《泰晤士報》報導。

Kennys 書店的 Tomás Kenny 告訴《泰晤士報》,AI 正在「嚇壞我們的行業」,他計劃拒絕那些可能用於 AI 訓練的訂單,以保護作者對其作品的權利以及讀者獲取難尋書籍的機會。他說:「書商往往處於許多道德困境、政治和倫理問題的最前線。在大多數情況下,這不是我能決定的。然而,如果他們拿走一本書並掃描它,目的是為了獲取智慧財產權,那麼 Kennys 不想參與其中。」

公眾的反彈可能會迫使最大的公司採用像 Internet Archive 那樣的方法,這種方法既注重實體保存珍稀書籍,也注重數位化保存。但想像另一種情況,即珍稀書籍變得更加稀有,尤其是對於那些喜歡手捧古書感覺的人來說,這令人心碎。

Zhang 了解珍稀書籍的魅力,她偶爾會暫停工作,閱讀她掃描的書籍內容。當被問及她最喜歡這份工作的什麼時,Zhang 以許多愛書人士在 Kennys 等書店瀏覽書架時感受到的同樣熱情回答。

「一切!我發現一切都很有趣」Zhang 說。「我不覺得無聊。每個藏品對我來說都很重要。」