作者:Duc Hoang, Ajay Jaiswal, Mohammad Samragh Razlighi, Minsik Cho專家混合模型 (Mixture-of-Experts, MoE) 能夠實現稀疏專家啟用,這表示在每次推論期間,模型只會使用其參數的一個子集。

然而,要將這種稀疏性轉化為實際效能,就需要一個專家快取機制。先前的研究提出了以硬體為中心的快取策略,但這些不同的快取策略如何相互作用以及與不同硬體規格的互動方式,仍未被充分理解。為了解決這個問題,我們開發了 SpecMD,這是一個標準化的框架,用於在各種硬體配置上基準測試臨時快取策略。

透過 SpecMD,我們對多種 MoE 快取策略進行了詳盡的基準測試,在受控且具有實際限制的環境中,重現並擴展了先前的方法。我們的實驗揭示,MoE 模型的專家存取與時間局部性假設(例如 LRU、LFU)不符。基於此觀察,我們提出了一種新穎的淘汰策略:Least-Stale。

該策略利用 MoE 模型可預測的專家存取模式,將衝突遺失 (collision misses) 比 LRU 減少高達 85 倍。憑藉這些顯著的提升,我們在 OLMoE 模型上實現了超過 88% 的命中率,並將首個詞元生成時間 (Time-to-first-token, TTFT) 減少了高達 34.7%,而 VRAM 快取容量僅佔 5% 或 0.6GB。

相關閱讀與更新以高吞吐量服務 Transformer 語言模型,需要快取鍵值 (Key-Values, KVs) 以避免自迴歸生成期間的重複計算。KV 快取的記憶體佔用量相當大,嚴重影響服務成本。這項工作旨在減少這些記憶體需求。儘管最近的研究主要透過沿時間軸的壓縮和淘汰來解決 KV 快取縮減問題,但我們認為深度維度提供了…閱讀更多大型語言模型 (LLMs) 的生成品質通常可透過利用推論時序層級擴展方法(例如思維鏈 Chain-of-Thought)來改善。

我們引入了超平行擴展 (hyper-parallel scaling),這是一個互補的框架,可在詞元層級提升預測品質。超平行擴展會從模型中計算並聚合單一詞元的多個輸出提案。我們在專家混合模型 (MoE) 中實現了這個概念,該模型…閱讀更多