Nvidia 於週一宣布,其 Groq 3 LPX 機櫃已全面投產,標誌著這項技術的商業化,也是該公司有史以來最大規模收購的成果。Nvidia 資深總監 Dion Harris 向記者表示,Groq 機櫃將與 Vera 中央處理器和 Rubin 圖形處理器一同部署在雲端服務商 Nebius,並預計於今年稍晚上線。
Nvidia 加速生產 Groq 晶片並提供給客戶,凸顯了低延遲推論日益重要的地位。這對於讓人工智慧代理(AI agents)在沒有長時間延遲的情況下,為使用者提供即時回應至關重要,尤其是在程式碼生成方面。Nvidia 表示,雲端公司可以針對這類型的代幣(tokens)收取更高的費用。
Harris 說:「對於提供代幣服務的業者來說,這開啟了為那些對延遲最敏感的服務協議有需求的用戶和客戶,提供高階服務層級的能力。」Nvidia 於去年 12 月以 200 億美元收購了晶片新創公司 Groq 的資產,這是該公司最大的一筆收購案。
Groq 架構在晶片本身內建 500 MB 的高速 SRAM,以減少記憶體相關的瓶頸。Groq 晶片由 Samsung 製造,而 Nvidia 的 GPU 則由台積電(TSMC)生產。Nvidia 將 256 個獨立的 Groq 3 晶片整合到其 LPX 機櫃中。
Nvidia 引用 Artificial Analysis 的基準測試數據指出,其 Groq 3 LPX 機櫃每秒可提供 3,400 個代幣。
這是一個競爭激烈的領域。較小的 GPU 製造商 Advanced Micro Devices(AMD)今年稍早宣布,將把其機櫃級系統與最近上市的 Cerebras 晶片整合,同樣專注於低延遲推論。OpenAI 新推出的 Ultrafast 模式目前承諾每秒 750 個代幣,並由 Cerebras 提供技術支援。
低延遲晶片並不能取代作為 AI 晶片主力軍的 GPU,後者既能進行訓練也能執行推論,並且足夠靈活以適應新技術和模型。像 Groq 這樣的低延遲晶片主要專注於模型服務中的「解碼」(decode)階段。Harris 表示:「這並不是要取代 GPU,而是要為工作負載的正確部分,使用正確的價格和正確的處理器。」
Nvidia 目前正在加速出貨其 Vera Rubin 系統,該系統已於今年稍早開始生產。在三月份的 Vera Rubin 和 Groq 3 LPX 發表會上,Nvidia 執行長黃仁勳預計,從當前的 Blackwell 晶片到新的 Vera Rubin 系統,到 2027 年的累計銷售額將達到 1 兆美元。
黃仁勳當時表示,他將把用於程式碼應用程式的資料中心空間的四分之一分配給 Groq 晶片。他補充說:「我資料中心的其他部分將 100% 採用 Vera Rubin。」Nvidia 預計於週三公布財報。



