自從發表 OpenAI 首款客製化推論晶片 Jalapeño 以來,我們一直在測試這款晶片及其周邊系統。測試結果顯示其效能有顯著提升:Jalapeño 能以更低的功耗處理更多 AI 工作,同時更快地回應。Jalapeño 在單一架構下同時實現了更高的吞吐量和更低的延遲,而現有硬體系統通常需要在兩者之間取捨。
對客戶而言,這意味著更快的反應速度、更靈敏的代理程式,以及在需求增長時更可靠的存取。我們的使命是確保通用人工智慧(AGI)造福全人類。這些進步將有助於讓功能日益強大的 AI 更經濟實惠且更廣泛地普及。
OpenAI 的模型也加速了 Jalapeño 的開發。早期模型協助團隊設計並啟動晶片,而我們最新的模型則加速了晶片的最佳化和程式設計。Jalapeño 的效能涵蓋了 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 等模型,顯示其架構適用於 OpenAI 內部及外部開發的模型。
在這三款模型上,Jalapeño 在峰值吞吐量下,每瓦特能處理的 AI 工作量比對照系統高出 1.5 到 1.9 倍,端到端延遲則降低了 1.7 到 3.6 倍。對於高度互動的工作負載,其效能提升了 2.1 到 4.1 倍。
Jalapeño 也證明了 OpenAI 具備更廣泛的全端優勢。OpenAI 能夠將模型、產品、服務軟體、晶片、記憶體、網路和系統整合設計,並利用從實際工作負載中學習到的經驗來改進堆疊的每一層。Jalapeño 是我們首款自研晶片,已取得實測成果,並將成為多世代平台的開端。
在未來幾個月,我們將逐步擴大 Jalapeño 的部署,為客戶提供更快、更強大、更高效的產品。
我們評估 Jalapeño 效能的方式,是衡量每個系統在滿足客戶和互動代理程式所需延遲的同時,每單位功耗能完成多少有用的 AI 工作量,以達到匹配的使用者體驗。這對於需要依序完成多個步驟的代理程式尤其重要,因為延遲可能會在整個任務中累積。
為了了解 Jalapeño 在實際應用中的表現,我們在 InferenceX 上進行了測試。InferenceX 是 SemiAnalysis 推出的一項公開基準測試,用於衡量 AI 請求的完整服務流程。我們將 Jalapeño 與領先的商用 AI 系統在各種操作範圍內進行了比較,從高吞吐量服務到高度互動、低延遲使用。
Jalapeño 在吞吐量、功耗效率和延遲方面提供了更好的組合。儘管效能有時會以每晶片計算,但我們認為更實用的標準是每單位功耗的效能。
Jalapeño 在所有三款公開模型上,於測試的操作範圍內,提供了每瓦特效能和延遲的更佳組合,使其位於帕累托前沿(Pareto frontier)。為了保持系統比較的一致性,我們使用每個加速器公佈的晶片額定功率來標準化結果。Jalapeño 的額定功率為 700 瓦,儘管在測試的工作負載下,其測得的持續功耗保持在 550 瓦或以下。
Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上表現強勁。在我們測試的最大公開模型 Kimi 上,它提供了約 1.5 倍的峰值每瓦特效能,以及比對照系統低 3.4 倍的端到端延遲。在我們的內部測試中,Jalapeño 在前沿 OpenAI 模型上的優勢進一步擴大,這表明隨著工作負載變得更大、要求更高,該架構的價值也隨之增加。
Jalapeño 從一開始的設計理念就是:如果主要任務是服務現代和未來的語言模型,特別是互動式代理程式,我們會打造什麼樣的硬體?Jalapeño 的優勢來自於圍繞實際語言模型工作負載,共同設計晶片、記憶體、網路、軟體和機架級系統。語言模型推論會經歷幾個不同的階段,每個階段都有不同的瓶頸。
預填充(Prefill)階段,即系統處理提示詞時,是計算密集型的;而解碼(Decode)階段,即系統逐個生成回應詞元時,則受記憶體頻寬的限制更多。當資料必須在核心和晶片之間移動時,通訊也會增加延遲,導致某些處理單元在等待時閒置。一個在某個階段表現出色的系統,可能會在等待資料或在不同資源之間移動模型狀態時失去優勢。
我們設計 Jalapeño 的目的是最大限度地減少資料移動和通訊延遲。這意味著模型狀態,包括在生成回應時使用的 KV 快取,可以明確地放置並保持在本地,同時系統為每個推論階段啟動正確的計算、記憶體和網路組合。網路是該架構不可或缺的一部分。其大範圍允許整個工作負載保持在一個連接的系統內,最大限度地減少資料移動,並有助於從頭到尾保持完整請求的快速和高效。
結果是一個平衡且可互換的加速器,能夠支援不斷變化的模型架構,在預填充和解碼方面都表現出色,並能適應兩者之間的平衡變化,這是代理式工作負載的一個決定性特徵。
我們利用 AI 設計晶片,並設計晶片讓 AI 能夠對其進行程式設計。AI 在 Jalapeño 的開發中扮演了直接角色,透過探索實作方案、縮短設計、測量和驗證循環,以及持續迭代模型工作負載,使團隊在九個月內從初步設計推進到流片。AI 還協助最佳化了晶片的算術電路,讓團隊能夠按時將更多計算效能整合到晶片中。
Jalapeño 被設計成一個對人類和 AI 都清晰、可預測的程式設計目標。工程師可以透過局部張量、明確通訊和可預測的同步來描述工作。然後,AI 可以最佳化這些工作在系統中的映射、放置、排程和協調方式。這種清晰、可預測的結構為 AI 提供了一種可行的方法來解決傳統上困難的平行程式設計問題。
支援每個新的模型家族仍然需要新的核心(kernels)和模型特定的最佳化。透過將 Codex 與 GPT‑Astra 結合使用,團隊在兩個月內將三個不在 Jalapeño 原始生產計畫中的開源模型提升到高效能。這證明了該架構的靈活性以及 AI 協助我們進行程式設計的速度。
對於選定的 GPT‑OSS 注意力機制和專家混合(mixture-of-experts)區塊,AI 生成的實作比現有的人工專家編寫的實作運行速度快 1.5 到 1.8 倍。這些數字適用於選定的區塊,而非完整模型,但它們指向了一個強大的新開發循環。
高效、超快速推論的未來之路。AI 基礎設施之所以有價值,是因為它能實現有用的實際工作。透過從相同的功耗和硬體中產生更多有用的工作,Jalapeño 可以幫助我們滿足更多需求,並降低提供成功結果的成本。對於 OpenAI 而言,這可以透過讓有用的工作和收入增長速度快於服務成本來提高營運槓桿。
它還可以支持更廣泛的採用以及對更好的模型、產品和基礎設施的持續投資。更快的推論可以實現更快的迭代和新的使用案例。
Jalapeño 擴展了高效、低延遲推論的可能性:
- 以過去僅在快速模式下可實現的效率進行超快速模式推論。
- 以過去僅在批次模式下可實現的效率進行快速模式推論。
- 提高批次模式推論的效率。
我們計畫在今年底前開始在 OpenAI 的計算基礎設施中部署 Jalapeño。這是多世代發展藍圖的第一代:第二代正在深入開發中,第三代也正在成形。每一代都將建立在我們所學到的經驗之上,並進一步提升效率和速度。
滿足不斷增長的 AI 需求將需要來自所有可用來源的更多計算能力。我們將繼續廣泛部署來自 NVIDIA 和其他合作夥伴的加速器,用於訓練和推論工作負載。我們的使命是確保通用人工智慧造福全人類。
在準備部署的同時,我們正在繼續進行生產資格認證、完善軟體、準備大規模運行 Jalapeño,並驗證其在更多模型上的效能。迄今為止的結果顯示,當我們共同設計整個系統時,能夠實現什麼:為更多人提供更靈敏、更有能力、更具代理性的 AI,且效率更高。



