今天,我們為視覺語言模型 (VLM) LFM2.5-VL-3B 釋出實驗性的 DSpark 草稿模型。如同我們最近釋出的 LFM2.5-DSpark 草稿模型,它增加了一個推測解碼路徑,以極小的記憶體佔用增量換取大幅度的速度提升,同時不改變輸出品質。

這項技術帶來了更快的推論速度:裝置端解碼速度最高可達 3.13 倍,H100 上最高可達 2.66 倍,端到端效能增益最高分別為 2.62 倍和 2.27 倍。草稿模型僅增加 2.8 億個參數,佔 3B 目標模型的 8.9%,記憶體成本極低。LFM 相容的 DSpark 整合方案在發布首日即支援 llama.cpp、MLX-VLM 和 SGLang。

視覺草稿模型採用與我們的文字 LFM2.5-DSpark 草稿模型相同的架構:它捕捉目標模型在固定指定層的隱藏狀態,並以此為條件生成 k 個候選詞元區塊。在這些層之前,圖像區塊和文字詞元會被投射到共享表示中,因此無論輸入模態為何,草稿模型都能在相同維度的隱藏狀態向量上運作。推論演算法因此與文字模型保持不變。

我們遵循 DSpark 訓練方法,使用視覺語言 SFT 資料混合集,並根據預期模型服務的工作負載進行加權。根據對 3、4 和 5 層的消融實驗,草稿模型是一個簡化的僅注意力草稿模型,具有 4 層和 9 的區塊大小。我們在最終混合集上訓練了 10 個週期,並在每個週期後測量接受率,結果顯示隨著額外訓練詞元的增加,接受率有所提升,直到達到報酬遞減。在推論時,我們建議根據硬體選擇 8 或 9 的區塊大小。

最終的草稿模型約有 2.8 億個參數,僅使部署模型的參數數量增加 8.9%。

| 元件 | LFM2.5-VL-3B |

|---|---|

| 解碼器堆疊 (4 層) | 1.93 億 |

| 隱藏狀態投射 | 2,100 萬 |

| 馬可夫頭 | 6,550 萬 |

| 正規化 + 信賴度頭 | 6.4 千 |

| 總計 | 2.795 億 |

LFM2.5-VL-3B 的 DSpark 草稿模型在發布首日即支援 llama.cpp、MLX-VLM 和 SGLang。我們同時測量了裝置端推論和 GPU 推論。兩種配置都使用 8 的 DSpark 區塊大小,並根據 MMSpec 基準測試,在六種不同的視覺任務上進行評估,包括通用 VQA、文字 VQA、圖像描述、圖表 VQA、複雜推理和多輪對話。

在裝置端推論方面,使用 MLX 在 M5 Max 上,解碼速度依任務不同可快 2.30 倍至 3.13 倍。端到端延遲改善了 1.56 倍至 2.62 倍。使用 llama.cpp 在 M3 Ultra 上,解碼速度改善了 1.57 倍至 2.14 倍,端到端改善了 1.30 倍至 1.77 倍。

在 GPU 推論方面,在 H100 上,相同的草稿模型提供了 2.04 倍至 2.66 倍的解碼速度提升,端到端改善了 1.64 倍至 2.27 倍。

在大型語言模型 (LLM) 中,預填充 (prefill) 主要受計算限制,其成本隨提示詞長度呈(次)二次方增長。視覺語言模型 (VLM) 則更為複雜,因為圖像首先會通過視覺編碼器,然後語言骨幹會處理數百個視覺詞元以及文字提示詞。邊緣裝置的計算能力遠低於資料中心 GPU,因此預填充在端到端延遲中佔據了更多時間,這可從 Apple 晶片和 H100 上的首詞元時間和解碼測量中看出。(M5 的每核心 GPU 神經加速器縮小了這個差距)。

推測解碼僅加速解碼階段,不加速視覺編碼或預填充。當這些階段已經佔據大部分執行時間時,即使解碼速度大幅提升,也只能帶來適度的端到端增益。這就是阿姆達爾定律 (Amdahl's law),其中整體加速受限於工作負載中未加速的部分。

使用 SGLang 執行 DSpark 草稿模型需要支援 LFM2 目標的 SGLang 版本 (PR #40651)。啟動目標模型並附加草稿模型:

```python

python -m sglang.launch_server \

--model-path LiquidAI/LFM2.5-VL-3B \

--speculative-algorithm DSPARK \

--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \

--speculative-draft-attention-backend flashinfer \

--speculative-dspark-block-size 9 \

--disable-radix-cache

```

然後查詢位於 http://localhost:30000/v1 的與 OpenAI 相容的端點。區塊大小從草稿模型的 config.json 讀取;基準線是移除三個 --speculative-* 旗標的相同指令。

使用 llama.cpp 執行它們需要相應的 llama.cpp 版本 (PR#29339)。

```bash

llama-server -m models/LFM2.5-VL-3B-F16.gguf \

--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \

-md LFM2.5-2.6B-DSpark-F16.gguf \

--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \

-fa on -ngl 99 -c 8192

```

使用 MLX-VLM 執行它們需要相應的版本 (PR#2280)。

```bash

mx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

```

區塊大小從附帶中繼資料讀取 (n-max 會被限制於此)。推測解碼是精確的:目標模型會驗證每個提議的詞元,因此貪婪輸出與單獨目標模型相同;每個回應的計時報告 draft_n / draft_n_accepted。

我們的視覺 DSpark 草稿模型已在 Hugging Face 上提供 Safetensors 和 GGUF 格式。透過 LFM2.5,我們正在實現 AI 無處不在的願景。這些模型具有以下特點:

開源權重,無限制地下載、微調和部署。

首日即快速,首日即支援 llama.cpp、MLX 和 SGLang。

完整的模型家族,從用於客製化的基礎模型到專門的音訊和視覺變體,單一架構涵蓋多種使用情境。

我們迫不及待地想看到您將創造出什麼。如需引用,請使用以下參考文獻或 BibTeX:Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026。

```bibtex

@article{liquidAI2026vldspark,

author = {Liquid AI},

title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},

journal = {Liquid AI Blog},

year = {2026},

note = {www.liquid.ai/blog/lfm2-5-vl-dspark},

}

```