LFM2.5-VL-3B 是我們目前最強大的視覺語言模型,您可以在自己的硬體上運行。它能理解文件和螢幕,定位物件,並能呼叫工具。
它直接回答問題而非進行推理,因此在即時和裝置端應用程式中能保持快速回應。LFM2.5-VL-3B 透過四項主要改進,擴展了我們先前版本的視覺語言能力,包括:強大的數位螢幕理解能力、透過自然語言查詢改進物件定位和偵測、多圖輸入的推理能力提升,以及在純文字和視覺文字情境下顯著增強的函數呼叫能力。
我們如何訓練出最強大的視覺語言模型
LFM2.5-VL-3B 將 SigLIP2 400M NaFlex 視覺編碼器與我們 LFM2.5-2.6B 文字模型相同的預訓練骨幹網路配對。它在約 34 兆個 token 上進行預訓練,其中視覺資料量比以往增加了四倍,這些資料來自精選和合成的圖像-標題、OCR、定位和指令遵循資料集。
為支援非拉丁語系,我們將詞彙量翻倍至 128K,透過原地擴展分詞器而非從頭重新訓練。後訓練分兩個階段進行:首先是監督式微調(SFT),包含來自大型教師模型的知識蒸餾和 Antidoom 訓練;其次是多獎勵強化學習(RL)。
基準測試結果
我們在視覺和文字基準測試中評估了 LFM2.5-VL-3B。視覺基準測試涵蓋多語言視覺理解、指令遵循、視覺數學和科學推理、文件理解、物件偵測、多圖理解和螢幕理解。
LFM2.5-VL-3B 在真實世界圖像任務中領先同尺寸模型,同時也能很好地閱讀數位內容,從文件、圖表到螢幕上的 UI 元素。我們還在純文字基準測試中評估了 LFM2.5-VL-3B 的指令遵循和工具使用能力,結果顯示指令遵循能力全面提升,工具使用能力也大幅增強。
在工具使用方面,LFM2.5-VL-3B 與 Gemma-4-E2B 和 Qwen3.5-2B 表現相當。這些結果證明 LFM2.5-VL-3B 是一款強大且通用的視覺語言模型,它涵蓋日常任務(圖像描述、視覺問答、文件理解),尤其擅長物件定位、閱讀螢幕和文件以及呼叫工具。
CPU 和 GPU 上的推論速度
LFM2.5-VL-3B 在推論生態系統中提供首日支援,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。在裝置端推論方面,LFM2.5-VL-3B 在 M5 Max 上每秒解碼 228 個 token,在 Ryzen AI Max+ 395 上每秒解碼 116 個 token,並佔用約 3 GB 記憶體。
它甚至在 Galaxy S26 Ultra 上也能達到每秒 20 個 token,因此您可以在裝置上完全運行它。LFM2.5-VL-3B 在 GPU 推論方面保持低延遲,並且在多幀輸入上速度最快。在我們測試的所有模型中,LFM2.5-VL-3B 的輸出吞吐量也是最快的,在高併發情況下達到每秒約 11K 個 token。
這大約是較大型 4B 級模型的兩倍,甚至領先於較小的 2B 級模型,這意味著單一 H100 每天可產生近 10 億個輸出 token。
如何使用 LFM2.5-VL-3B
當您需要用於高負載工作量的裝置端智慧時,請選擇 LFM2.5-VL-3B。您可以安裝最新版本的 transformers 函式庫,然後載入並運行模型。文章中提供了詳細的程式碼範例,展示如何載入模型並使用它來描述圖像。
您可以在我們的文件中找到更多關於如何使用 LFM2.5-VL3B 進行多圖輸入、定位、OCR 和工具呼叫的實作範例。此外,也可以查看我們的發布部落格以觀看影片範例。
LFM2.5-VL-3B 示範
您可以查看這個 LFM2.5-VL-3B 驅動的視覺聊天介面瀏覽器示範。它允許您拍攝或上傳多張圖像,並讓模型與它們互動,包括定位、OCR 和工具使用。
立即開始
LFM2.5-VL-3B 即日起在 Hugging Face 上提供。透過 LFM2.5,我們正在實現 AI 隨處運行的願景。您可以下載 LFM2.5-VL-3B,在瀏覽器中試用 WebGPU 示範,無需任何設定,或透過我們的微調教學將 LFM2.5-VL-3B 適應您的任務。
引用
請引用這篇文章。



