Google 今年春天推出了 Gemma 4 開源模型,承諾為本地 AI 帶來全新的效能水準。隨著 Gemma 推出 Multi-Token Prediction (MTP) 預測模型,Google 在邊緣 AI 領域的表現可能已進一步加速。

Google 表示,這些實驗性模型利用一種推測性解碼(speculative decoding)形式,預先猜測未來的詞元,相較於模型單獨生成詞元的方式,能顯著加快生成速度。

最新的 Gemma 模型採用與 Google 尖端 AI 模型 Gemini 相同的底層技術,但經過微調以在本地運行。Gemini 專為 Google 的客製化 TPU 晶片優化,這些晶片在龐大的叢集中運作,擁有超高速互連和記憶體。單一高效能 AI 加速器即可全精度運行最大的 Gemma 4 模型,而量化處理則能使其在消費級 GPU 上運行。

Gemma 讓使用者可以在自己的硬體上試驗 AI,而無需將所有資料分享給 Google 或其他公司的雲端 AI 系統。Google 也將 Gemma 4 的授權改為 Apache 2.0,這比 Google 之前版本採用的客製化 Gemma 授權更為寬鬆。然而,大多數人用於運行本地 AI 模型硬體存在固有限制。這正是 MTP 發揮作用的地方。

像 Gemma(或 Gemini)這類大型語言模型 (LLM) 以自迴歸方式生成詞元,也就是說,它們根據前一個詞元一次生成一個詞元。無論該詞元是輸出中的填充詞,還是複雜邏輯問題中的關鍵資訊,每個詞元所需的計算工作量都與前一個相同。

自行運行 AI 的問題在於,您的系統記憶體相較於企業級硬體中使用的高頻寬記憶體 (HBM) 可能不夠快。因此,處理器在為每個詞元將參數從 VRAM 傳輸到計算單元時會花費大量時間,而在此過程中計算週期卻未被充分利用。

MTP 利用這段時間繞過主要模型,並使用輕量級的預測模型生成推測性詞元。儘管這些預測模型較小(Gemma 4 E2B 中僅有 7400 萬個參數),但它們也透過多種方式進行優化,以加速推測性詞元生成。例如,預測模型共享鍵值快取(本質上是 LLM 的活躍記憶體),因此無需重新計算主要模型已處理過的上下文。E2B 和 E4B 預測模型還使用稀疏解碼技術來縮小可能詞元的範圍。