記憶體可說是現代 AI 大型語言模型(LLM)最嚴重的限制。根據一篇具影響力的論文指出,LLM 的 token 生成本質上是記憶體受限的任務,這意味著模型輸出文字的速度受限於從記憶體讀取資料的速度。此瓶頸的嚴重程度會隨著模型規模的擴大而增加,進而形成一道阻礙 LLM 推論效能的「記憶體牆」。

AI 硬體新創公司 Majestic Labs 正採取直接且全面的方法來解決這個問題。他們正在開發一款名為 Prometheus 的新型 AI 伺服器,其記憶體容量高達 128 TB,這比 Nvidia 尖端的 AI 處理機架 DGX B300 伺服器多出 60 倍以上。

Majestic Labs 的共同創辦人兼總裁 Sha Rabii 相信,記憶體的大幅增加將為公司帶來優勢。他承認「Nvidia 在建立可擴展系統方面做得非常出色」,但他認為隨著模型規模的增長,這種方式的經濟效益會降低,最終導致「運算資源過度配置,而記憶體資源卻嚴重不足」。

Majestic Labs 計劃透過一種與競爭對手截然不同的架構來克服「記憶體牆」。Nvidia 目前的伺服器配備快速的高頻寬記憶體(HBM),通常用於讀取 LLM 的模型權重。此外,還有一個通常更大但速度較慢的動態隨機存取記憶體(DRAM)池,用於處理 LLM 和伺服器的額外負載。

Majestic 則採用統一架構,全面投入 DRAM(特別是 LPDDR6)。Rabii 表示,大多數記憶體介面設計用於短距離物理操作,有時僅數毫米。這限制了可放置的記憶體容量。「在運算晶片上,你只能在有限的『岸線』上放置 HBM。如果你想放置更多,也辦不到。」

Rabii 解釋道。為了解決這個問題,Majestic 使用專有的記憶體介面,該介面由微型銅纜構成,有效距離可達一公尺。這與客製化的記憶體聚合晶片搭配使用,這些晶片實體上位於記憶體模組旁,並協調整個伺服器的記憶體。「它作為高速介面的終端,並分流至許多商品化的 DRAM 晶片。」

Rabii 解釋。除了處理大量記憶體池外,Majestic 表示此設計還提供高達每秒 25.6 TB 的記憶體頻寬。更多的記憶體固然好,但它需要與 AI 加速器搭配使用,類似於 Nvidia 的 GPU。Majestic 的解決方案是 Ignite,這是一種客製化的 AI 處理單元,作為伺服器的運算引擎。

Prometheus 伺服器包含 12 個 Ignite 晶片。Ignite 將資料中心級的 ARM 應用核心與 RISC-V 向量和張量核心整合在單一晶片上,所有核心共享相同的記憶體空間。ARM 核心作為晶片上的主機處理器,負責協調 AI 模型。

RISC-V 核心則執行實際的 LLM 處理。其結果是一個單一晶片即可處理 LLM 推論需求的各個層面,而無需在處理器之間進行切換。Majestic Labs 尚未公布 Prometheus 運算效能的具體指標。Rabii 承認軟體同樣重要,因為許多 AI 框架已經根深蒂固。

他表示:「我們正在努力在客戶採用的各個方面,無論是硬體還是軟體,盡可能減少摩擦。」Prometheus 將支援 PyTorch、vLLM 和 OpenAI 的 Triton 推論框架,無需修改程式碼。這意味著與這些框架相容的現有模型可以原封不動地運行。

所有這些都整合在伺服器本身,該伺服器符合 Open Compute Project 標準。每個伺服器機架最多可容納四台伺服器;每個機架的功耗預計最高可達 120 千瓦;散熱將採用冷板液冷技術管理。伺服器的記憶體設計採用模組化,這意味著購買記憶體容量低於最大值 128 TB 的伺服器,日後仍可升級。

儘管該專案範圍廣泛,Majestic 也希望 Prometheus 在價格上具有競爭力,考慮到每台伺服器可容納的記憶體量,這可能令人驚訝。Majestic 認為這之所以可行,是因為它使用 DRAM 而非 HBM。由於 Prometheus 預計於 2027 年出貨,定價尚未公布。

Rabii 聲稱:「根據工作負載的不同,我們客戶的資本支出將減少 10 到 50 倍,功耗也將減少類似的幅度。」