生成式 AI 的蓬勃發展已將記憶體成本推向高峰,而 Google 在這股趨勢中扮演了關鍵角色。因此,Google 推出對記憶體需求較低的本地端 AI 模型也合情合理。該公司宣布發布一款新的 Gemma 4 模型,填補了今年稍早推出的產品線中的空白。這款新模型效率極高,甚至可以在一般消費級筆記型電腦上運行。
今年四月,Google 發布了 Gemma 4 系列的四款模型,同時也將其授權轉為更開放的 Apache 2.0。最初的模型包括兩款針對行動裝置優化的選項(E2B 和 E4B),以及兩款用於更嚴謹工作的模型(26B Mixture of Experts 和 31B Dense)。這在產品線中留下了一個相當大的未服務空間,而新模型正好填補了這個空缺。
Gemma 4 12B 的能力遠超行動版本,但它不需要價值兩萬美元的 AI 加速器就能在本地端運行。Google 表示,Gemma 4 12B 的獨特之處在於它可以在許多消費級筆記型電腦上運行,而無需犧牲品質。只要您的電腦配備 16GB 的系統記憶體(RAM)或顯示記憶體(VRAM),這個擁有 120 億參數的模型就能運作。
這大約是 Gemma 4 26B MoE 總記憶體佔用量的一半,Google 聲稱新模型在基準測試方面幾乎與其一樣強大。
Google 表示,新模型能夠執行複雜的多步驟推理和代理工作流程,這些功能過去需要更大的 Gemma 變體才能實現。儘管參數數量較少,Gemma 4 12B 仍搭載了新開發的多標記預測(Multi-Token Prediction, MTP)預測器,它利用未使用的處理週期來計算可能的未來標記。
這帶來了更高的速度和效率。Google 已為其他 Gemma 4 模型發布了可選的 MTP 版本,但這是第一個內建 MTP 的模型。
Gemma 4 12B 還透過新的多模態處理方法提高了效率。Gemma 4 系列本身就是多模態的,可以接受文字、音訊或圖像作為輸入。大多數生成式 AI 模型(包括其他 Gemma 4 變體)都使用專用的編碼器來處理非文字輸入,並將這些資料傳遞給大型語言模型(LLM)。這種方法雖然有效,但會增加延遲和記憶體使用量。
透過這款新的中等規模模型,Google 為視覺輸入實施了簡化的嵌入模組,其特點是採用單矩陣乘法和位置嵌入,使資料能夠以適當的空間感知傳遞給 LLM。這消除了對龐大中間編碼器的需求。對於音訊,則完全無需編碼。開發人員設計了一種方法,將原始音訊訊號投射到與文字標記相同的向量中。
如果您想試用新的 Gemma 4 模型,可以透過 LM Studio、Google AI Edge Gallery 等工具無需下載即可存取。但 Gemma 4 12B 的核心理念是讓您能夠在本地端、按照自己的方式運行它。如果您有足夠的記憶體,模型權重已可在 Kaggle 和 Hugging Face 上立即下載,檔案大小略低於 18GB。



