Hugging Face 和 EleutherAI 合作的 FineBooks 計畫,針對歷史書籍中超過 2,000 頁的內容,測試了 14 個開源 OCR 模型。結果顯示,最佳模型已能產生足夠用於 AI 訓練的文本,但尚未達到學術研究使用的標準。
使用公共領域書籍訓練開源 AI 語言模型時,必須面對品質不佳的文本。這些文本是圖書館多年前從掃描檔中透過光學字元辨識(OCR)提取的,結果往往錯誤百出。Talkie 計畫曾指出其潛在危害:一個用 OCR 文本訓練的語言模型,其學習效率只有使用相同書籍人工轉錄文本的 30%。
FineBooks 計畫由 Hugging Face 和 EleutherAI 合作發起,旨在測試目前的開源 OCR 模型是否能解決這個問題。該團隊對 2,165 頁歷史書籍運行了 14 個開源模型,並將結果以排行榜形式公布。最佳模型在每千頁不到兩美元的成本下,字元準確度超過 97%。
數百萬頁的公共領域文獻需要更好的文字辨識。去年 EleutherAI 及其合作夥伴發布了 Common Pile,這是迄今為止最大的開放授權訓練語料庫,其中包含約 30 萬本來自舊 OCR 處理的公共領域書籍。FineBooks 的作者表示,使用更好的模型重新處理這些書籍,是改善開源 AI 訓練資料集最有效的方法之一。
該計畫選擇了生物多樣性遺產圖書館(Biodiversity Heritage Library, BHL)作為首要目標,該圖書館收藏了超過 30 萬份數位化的自然歷史文獻,總計超過 6,400 萬頁。BHL 透過 AWS 提供其館藏的大量下載服務。
衡量 OCR 品質需要已知正確轉錄的頁面,團隊使用了 IMPACT 計畫和 BHL-Europe 的成果:在 2011 至 2012 年間,專家們以約每 2,000 個字元一個錯誤率,轉錄了六卷 BHL 的英文、法文、德文和拉丁文內容。這些資料以 CC-BY 授權在 GitHub 儲存庫中提供,並構成了新「黃金標準(ground-truth)」資料集的基礎。
所有 14 個模型都是免費提供,無需 API 金鑰即可在本地硬體上運行。評估指標是字元錯誤率(Character Error Rate, CER),即錯誤辨識字元的比例。排行榜將結果分為「外交(diplomatic)」版本(將古老字元如長 s (ſ) 的現代化視為錯誤)和「閱讀(reading)」版本(容忍此類變更)。
令人驚訝的是,小型模型擊敗了大型競爭對手。領先的 dots.mocr 模型僅使用 30 億個參數,而 Qwen3.5-9B 儘管規模幾乎是其三倍,得分卻較低。OvisOCR2 以僅 9 億個參數位居第二,每千頁成本僅 46 美分。對於歷史文獻而言,模型大小與 OCR 品質並無關聯。
例如,dots.mocr 模型以 97.6% 的準確度脫穎而出,每千頁成本為 1.94 美元。OvisOCR2 則以 96.9% 的準確度和更低的 0.46 美元成本緊隨其後。PaddleOCR-VL-1.6 和 olmOCR-2 也展現了不錯的性能,且成本效益極高。
這項評估僅涵蓋四種語言的 Antiqua 字體,不包括 Fraktur 字體、非拉丁文字或手寫內容,且 FineBooks 僅限於單欄書籍頁面。該團隊計畫使用其中一個頂級模型,重新處理約 20 萬份公共領域的 BHL 文獻,並將其文本作為開放資料集發布。新的模型將持續加入排行榜,且評估框架也已公開。
FineBooks 的作者根據預期用途來判斷結果。他們寫道,對於訓練語言模型而言,表現最佳的模型已足夠好用。這些模型產生的錯誤遠少於舊的處理流程,且以測量出的成本來看,重新處理 BHL 這樣規模的館藏是可行的。
團隊指出,圖書館面臨著不同的問題。他們的系統依賴於 ALTO XML,這是一種包含字詞級座標的格式。而新模型輸出的是 Markdown 或純文本,不含字詞位置,因此無法與現有的圖書館基礎設施整合。
對於學術轉錄而言,準確度仍有不足,但這並非因為模型誤讀字元。它們會默默地將古老字元現代化,例如將長 s 或連字替換為現代等效字元。團隊表示,透過有針對性的微調可以解決這個問題。



