PP-OCRv6 是 PaddleOCR 通用 OCR 模型家族的最新一代,專為真實世界中的文件、螢幕截圖、多語言圖片、數位顯示器、工業標籤和場景文字的偵測與辨識而設計。

這個模型家族的參數規模從 1.5M 到 34.5M,分為 tiny、small 和 medium 三個層級。其中 medium 和 small 層級支援 50 種語言,包括簡體中文、繁體中文、英文、日文以及 46 種拉丁語系語言。

在 PaddleOCR 官方內部多場景 OCR 基準測試中,PP-OCRv6_medium 在偵測 Hmean 達到 86.2%,辨識準確度達到 83.2%。與 PP-OCRv5_server 相比,其文字偵測能力提升了 4.6 個百分點,文字辨識能力則提升了 5.1 個百分點。

PP-OCRv6 專注於實際的 OCR 需求,旨在透過小型模型和靈活的部署選項,產生準確且結構化的文字輸出。

PP-OCRv6 在偵測與辨識的架構、訓練和資料方面都進行了改進。其主要設計目標是在保持模型規模適用於不同部署環境的同時,提升 OCR 的準確性。

PP-OCRv6 提供三個模型層級,涵蓋不同的模型大小和 OCR 準確度水準。這些層級包括 1.5M 參數的 PP-OCRv6_tiny,適用於邊緣裝置和輕量級本地 OCR;7.7M 參數的 PP-OCRv6_small,適合行動裝置和平衡的 OCR 服務;以及 34.5M 參數的 PP-OCRv6_medium,專為追求高準確度的伺服器端和工業 OCR 應用而設計。

PP-OCRv6 採用 PPLCNetV4 作為文字偵測和文字辨識的統一骨幹網路。對於開發者而言,主要優勢在於整個模型家族的一致性。tiny、small 和 medium 層級並非不相關的模型,它們屬於同一個 OCR 家族,並共享相同的架構方向。

文字偵測是 OCR 流程的第一階段。偵測品質會影響傳送給辨識器的圖片裁切,而不良的裁切通常會導致辨識效果不佳。

PP-OCRv6 透過 RepLKFPN 升級了偵測模組,這是一個輕量級的大核心特徵金字塔網路,專為多尺度文字偵測而設計,同時保持推論效率。這對於真實世界的 OCR 輸入非常重要,因為文字可能很小、密集、旋轉、低解析度或嵌入在複雜的背景中。

在文字辨識方面,PP-OCRv6 使用 EncoderWithLightSVTR。它結合了局部上下文建模和全局注意力機制,以提高對具挑戰性文字裁切的辨識品質。

這些辨識改進對於多語言文字、螢幕文字、工業字符、特殊符號、密集文字和雜訊圖像區域尤其重要。

medium 和 small 層級在單一模型家族中支援 50 種語言,涵蓋簡體中文、繁體中文、英文、日文以及 46 種拉丁語系語言。這有助於減少在常見多語言 OCR 場景中需要獨立 OCR 模型的需求。

開發者可以透過安裝 PaddleOCR 輕鬆開始使用 PP-OCRv6。預設情況下,模型使用 Paddle Inference 作為後端,並能將 OCR 結果儲存為可視化圖像和結構化的 JSON 輸出。

這些結構化輸出可供下游系統使用,例如文件解析、搜尋、資訊提取、RAG 或代理工作流程。

PP-OCRv6 可透過 PaddleOCR 與多種推論後端配合使用。PaddleOCR 3.7 提供統一的推論引擎介面,允許開發者選擇底層運行時並透過 API 傳遞相關配置。

除了預設的 Paddle Inference,Hugging Face 用戶還可以選擇使用 Transformers 後端,只需將 engine 參數設定為 "transformers" 即可。此外,對於使用 ONNX Runtime 的環境,PP-OCRv6 也提供 ONNX 變體,可透過設定 engine="onnxruntime" 來啟用。

這些後端選項確保 PP-OCRv6 可以在不同的運行時環境中無縫使用,同時保持 Hugging Face Hub 上的相同 OCR 模型家族。

PP-OCRv6 擴展了 PaddleOCR 的功能,提供了一個輕量級、多語言的 OCR 模型家族,用於真實世界的文字偵測和辨識。

此版本包含三個模型層級,參數從 1.5M 到 34.5M,支援多達 50 種語言的 OCR,並在偵測和辨識準確度上超越了 PP-OCRv5_server。模型資產在 Hugging Face Hub 上提供多種格式,包括 safetensors、Paddle 推論模型和 ONNX 模型,方便用戶評估和整合。