OpenAI 在 Hot Chips 大會上展示了其首款內部開發的推論晶片基準測試結果。據報導,這款名為「Jalapeño」的晶片在每瓦吞吐量和 token 延遲方面,都超越了 Nvidia 的 Blackwell 和 Rubin 晶片。

這款晶片僅處理推論任務,意味著它能運行 AI 模型但無法訓練模型。Jalapeño 也沒有針對 OpenAI 自己的模型進行微調,它是一款通用的 LLM 推論加速器。

OpenAI 聲稱,在所有三種測試模型中,Jalapeño 在峰值吞吐量下每瓦能提供 1.5 到 1.9 倍的 AI 工作量,並且端到端延遲比市面上最佳系統低 1.7 到 3.6 倍。針對互動式工作負載,該公司表示效能提升了 2.1 到 4.1 倍。

這些結果來自使用 SemiAnalysis 公開的 InferenceX 基準測試。OpenAI 提供了這些數據,SemiAnalysis 則在實驗室現場驗證了部分測試運行。測試模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。

在 GPT-OSS 上,Jalapeño 每個使用者每秒約可處理 1,400 個 token。在 Deepseek R1 上,單一併發請求每秒可處理超過 700 個 token。

在相同的解碼速度下,根據模型不同,Jalapeño 每千瓦的 token 吞吐量比市面上最佳加速器高出 54 到 104 倍。值得注意的是,Jalapeño 在未採用多 token 預測或推測解碼等技術的情況下達到這些數據,而一些比較系統則依賴這些優化,這表示 Jalapeño 仍有改進空間。

SemiAnalysis 寫道,在每瓦效能的比較中,「Jalapeño 擊敗了所有其他晶片」。SemiAnalysis 執行長 Dylan Patel 補充說:「通常第一代晶片不具競爭力,但 OpenAI 卻擊敗了 Nvidia Blackwell 甚至 Rubin。」

SemiAnalysis 指出,更公平的比較對象不是 Blackwell,而是 Nvidia 較新的 Vera Rubin 平台,因為兩者都使用 HBM4 記憶體。即使如此,Jalapeño 每兆瓦輸出的 token 數量仍超過 Vera Rubin,儘管 Nvidia 的加速器使用了 Jalapeño 尚未採用的多 token 預測優化。若以每個 token 的總體擁有成本來看,兩者大致持平。

不過,仍有一些注意事項。Nvidia 和 AMD 已發布了使用 Deepseek V4 Pro 和 Kimi K3 等更大模型的測試結果,這些模型尚未在 Jalapeño 上進行測試。此外,Rubin 系統已開始向客戶出貨,而 Jalapeño 據報導仍處於工程樣本階段。

OpenAI 與 Broadcom 合作開發了 Jalapeño。設計工作於 2024 年年中啟動,最終設計於 2025 年 11 月送交製造。整個週期約 16 個月,但 OpenAI 表示從首次晶片設計到最終藍圖送廠,僅花了九個月。據 OpenAI 稱,該公司在開發過程中使用了自己的 AI 模型。較舊的模型世代協助了晶片設計,而較新的模型則加速了程式設計和優化。

SemiAnalysis 認為這是一個跡象,表明 Nvidia 備受討論的「CUDA 護城河」可能不再堅不可摧。該公司寫道:「鑑於 OpenAI 能如此快速地在其晶片上啟用新模型,CUDA 護城河可能已經失效。」

OpenAI 財務長 Sarah Friar 表示,這款晶片符合更廣泛的運算策略,其中資料中心、晶片、模型、開發者平台、產品和設備都作為一個整合系統運作。她聲稱 Jalapeño 補充而非取代了 OpenAI 與 Nvidia、AMD、AWS、Cerebras、CoreWeave 等現有合作夥伴關係。

OpenAI 與其中幾家公司有著深厚的聯繫。Nvidia、AMD 和 AWS 都是投資者或運算合作夥伴,其中 Nvidia 是最大的之一。這些公司也都正在開發自己的 AI 晶片,這使得彼此關係既合作又競爭。儘管如此,所有這些公司都持續表示世界對運算的需求永不滿足,這項說法恰好支持了它們各自的商業模式。