
自從宣布推出 OpenAI 首款客製化推論晶片 Jalapeño 以來,我們一直在測試這款晶片及以晶片為核心打造的系統。結果顯示效能顯著提升:Jalapeño 每單位功耗能處理更多 AI 工作,回應速度也更快。Jalapeño 透過單一架構同時提高吞吐量並降低延遲,而現有硬體系統通常必須在兩者之間取捨。
對客戶而言,這代表回應更快、智慧體反應更靈敏,而且需求成長時仍能更穩定地使用服務。我們的使命是確保通用人工智慧造福全人類。相關進展有助於讓能力日益提升的 AI 價格更親民,也能更廣泛普及。
OpenAI 模型也加速了 Jalapeño 的開發。較早期的模型協助團隊設計晶片並完成啟動驗證,而最新模型則加快了最佳化及程式設計的流程。Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上都展現優異效能,證明這套架構能支援 OpenAI 內外部開發的模型。在這三個模型上,Jalapeño 於峰值吞吐量時,每瓦可處理的 AI 工作量是比較系統的 1.5 至 1.9 倍,端對端延遲則降低 1.7 至 3.6 倍。面對高度互動式工作負載時,效能可達比較系統的 2.1 至 4.1 倍。
Jalapeño 也體現了 OpenAI 更全面的完整技術堆疊優勢。OpenAI 能協同設計模型、產品、推論服務軟體、晶片、記憶體、網路及系統,並運用實際工作負載累積的經驗,改善技術堆疊的每一層。Jalapeño 是已投入運作並取得實測成果的自研晶片,也是多世代平台的起點。未來幾個月,我們將逐步擴大 Jalapeño 的部署規模,為客戶提供速度更快、能力更強、效率更高的產品。
我們會在相同使用者體驗下評估效能,衡量每個系統在符合客戶與互動式智慧體的延遲需求時,每單位功耗能完成多少實用的 AI 工作。這項指標對智慧體尤其重要,因為智慧體必須依序完成許多步驟,延遲會在整項任務中逐步累積。
為了解 Jalapeño 的實際表現,我們使用 SemiAnalysis 的公開基準 InferenceX 進行測試。這項基準會衡量處理 AI 請求的完整流程。我們在測試涵蓋的運作範圍內,將 Jalapeño 與市面上領先的 AI 系統比較,情境從高吞吐量服務到高度互動、低延遲的應用皆包含在內。Jalapeño 在吞吐量、能源效率與延遲之間取得更理想的平衡。效能有時會以單顆晶片為單位呈現,但我們認為每單位功耗的效能是更實用的衡量標準。
在三個公開模型上,Jalapeño 於測試涵蓋的運作範圍內,都展現更理想的每瓦效能與延遲組合,因此位於帕累托前沿。為一致比較各個系統,我們根據每款加速器公布的晶片額定功率將結果標準化。Jalapeño 的額定功率為 700 瓦,但在測試的工作負載上,實測持續功耗始終不超過 550 瓦。
Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上都表現出色。Kimi 是我們測試的最大型公開模型。在這個模型上,Jalapeño 的每瓦峰值效能約為比較系統的 1.5 倍,端對端延遲則降低約 3.4 倍。內部測試顯示,Jalapeño 在前沿 OpenAI 模型上的優勢更加明顯,表示工作負載的規模越大、要求越高,這套架構就越有價值。
Jalapeño 的設計始於一個問題:如果硬體的主要任務是為現代及未來的語言模型提供推論服務,尤其是互動式智慧體,我們會打造出什麼樣的硬體?Jalapeño 的效能優勢,來自以實際的語言模型工作負載為核心,協同設計晶片、記憶體、網路、軟體及機架級系統。語言模型推論會經過數個階段,每個階段都有不同的瓶頸。系統處理提示的預填階段需要密集運算;系統逐一產生回應 Token 的解碼階段,則更受記憶體頻寬限制。資料必須在核心與晶片之間移動時,通訊也會增加延遲,導致部分處理單元在等待期間閒置。在某個階段表現出色的系統,可能會因等待資料,或在不同資源之間移動模型狀態而失去優勢。
我們設計 Jalapeño 時,力求減少資料移動和通訊延遲。這表示模型狀態,包括產生回應時使用的 KV 快取,都能明確配置並留在本機;系統則會為每個推論階段啟用適當的運算、記憶體與網路組合。網路是這套架構不可或缺的一部分。網路涵蓋範圍廣,能讓整個工作負載留在單一互連系統內,減少資料移動,使完整請求從頭到尾都能維持快速且高效率。最終打造出兼具均衡效能與彈性調度能力的加速器,不僅能支援不斷演進的模型架構、妥善處理預填和解碼,也能因應兩者比重的變化。這正是智慧體工作負載的一項關鍵特性。
AI 直接參與 Jalapeño 的開發,協助探索實作方案、縮短設計、量測與驗證循環,並持續依據模型工作負載反覆改進,讓團隊在九個月內完成從初步設計到晶片設計定案。AI 也協助最佳化晶片的算術電路,讓團隊如期在晶片中達到更高的運算效能。
對人類和 AI 而言,Jalapeño 都是明確且可預測的程式設計對象。工程師可以透過區域張量、明確的通訊和可預測的同步機制來描述工作。AI 接著能最佳化工作在整個系統中的對應、配置、排程與協調方式。這種明確且可預測的結構,讓 AI 能以可行的方法處理一向困難的平行程式設計問題。
每支援一個新的模型系列,仍需要開發新的核心運算程式,並針對模型進行最佳化。團隊搭配使用 Codex 與 GPT‑Astra,在兩個月內讓三個原本不在 Jalapeño 生產計畫中的開放權重模型達到高效能。這不僅展現架構的彈性,也顯示 AI 能多快協助我們為 Jalapeño 編寫程式。針對特定的 GPT‑OSS 注意力及專家混合模組,AI 產生的實作速度比現有的人類專家實作快 1.5 至 1.8 倍。上述數據僅適用於指定模組,而非完整模型,但也展現一種強大的全新開發循環。
AI 基礎設施的價值,在於能協助人們完成現實世界中的實用工作。Jalapeño 能運用相同的電力與硬體完成更多實用工作,協助我們滿足更多需求,並降低產出有效成果的成本。對 OpenAI 而言,實用工作量和營收的成長速度可望超越服務成本,進而提升營運槓桿。這也有助於讓 AI 更廣泛普及,我們也得以持續投資更優良的模型、產品與基礎設施。加快推論速度還能縮短迭代週期,並開創新的使用情境。
Jalapeño 進一步拓展高效率、低延遲推論的可能性:
- 超高速模式推論可達到過去僅快速模式才有的效率
- 快速模式推論可達到過去僅批次模式才有的效率
- 批次模式推論的效率進一步提升
我們計畫在今年年底前,開始於 OpenAI 的運算基礎設施中部署 Jalapeño。Jalapeño 是多世代發展藍圖的第一代產品。目前 Gen 2 已進入深入開發階段,Gen 3 也逐漸成形。每一代都會延續我們累積的經驗,進一步提升效率與速度。
要滿足持續成長的 AI 需求,就必須充分運用各種來源,取得更多運算資源。我們將繼續廣泛部署 NVIDIA 與其他合作夥伴的加速器,用於訓練和推論工作負載。我們的使命是確保通用人工智慧造福全人類。
在準備部署的同時,我們持續進行量產資格驗證、提高軟體成熟度、準備大規模運行 Jalapeño,並在更多模型上驗證效能。目前的成果顯示,協同設計完整系統能帶來什麼可能性:以更高效率,將反應更快、能力更強的智慧體 AI 提供給更多人。
每 kW 吞吐量前沿
InferenceX · GPT‑OSS‑120B · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB200 1,200 W
峰值與速度相符時的吞吐量
InferenceX · GPT‑OSS‑120B · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB200 1,200 W
更高的混合 Token 峰值吞吐量/kW
≈1.9×
85,448 對 44,960 混合 Token/kW
端對端延遲降低
≈1.7×
1.03 秒對 1.80 秒
最低 TBT 降低
≈2.7×
0.69 對 1.87 毫秒 (1,459 對 535 Token/秒/使用者)
在先前最佳 TBT 下達到更高吞吐量
≈53.7×
22,935 對 427 混合 Token/kW (535.28 Token/秒/使用者)
每 kW 吞吐量前沿
InferenceX · DeepSeek R1 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W
峰值與速度相符時的吞吐量
InferenceX · DeepSeek R1 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W
更高的混合 Token 峰值吞吐量/kW
≈1.7×
19,641 對 11,781 混合 Token/kW
端對端延遲降低
≈3.6×
1.65 秒對 5.99 秒
最低 TBT 降低
≈4.1×
1.43 對 5.90 毫秒 (700 對 169 Token/秒/使用者)
在先前最佳 TBT 下達到更高吞吐量
≈104.3×
12,258 對 118 混合 Token/kW (169.41 Token/秒/使用者)
每 kW 吞吐量前沿
InferenceX · Kimi K2.5 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W
峰值與速度相符時的吞吐量
InferenceX · Kimi K2.5 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W
更高的混合 Token 峰值吞吐量/kW
≈1.5×
18,195 對 11,862 混合 Token/kW
端對端延遲降低
≈3.4×
1.56 秒對 5.31 秒
最低 TBT 降低
≈3.8×
1.44 對 5.48 毫秒 (694 對 182 Token/秒/使用者)
在先前最佳 TBT 下達到更高吞吐量
≈56.1×
6,744 對 120 混合 Token/kW (182.46 Token/秒/使用者)


