跳至主要內容
OpenAI

2026年8月25日

工程公司

Jalapeño 首批成果展現業界領先的 AI 推論速度與效率

載入中…
安裝在藍綠色電路板上的 Jalapeño 推論晶片特寫。

自從宣布推出 OpenAI 首款客製化推論晶片 Jalapeño 以來,我們一直在測試這款晶片及以晶片為核心打造的系統。結果顯示效能顯著提升:Jalapeño 每單位功耗能處理更多 AI 工作,回應速度也更快。Jalapeño 透過單一架構同時提高吞吐量並降低延遲,而現有硬體系統通常必須在兩者之間取捨。

對客戶而言,這代表回應更快、智慧體反應更靈敏,而且需求成長時仍能更穩定地使用服務。我們的使命是確保通用人工智慧造福全人類。相關進展有助於讓能力日益提升的 AI 價格更親民,也能更廣泛普及。

OpenAI 模型也加速了 Jalapeño 的開發。較早期的模型協助團隊設計晶片並完成啟動驗證,而最新模型則加快了最佳化及程式設計的流程。Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上都展現優異效能,證明這套架構能支援 OpenAI 內外部開發的模型。在這三個模型上,Jalapeño 於峰值吞吐量時,每瓦可處理的 AI 工作量是比較系統的 1.5 至 1.9 倍,端對端延遲則降低 1.7 至 3.6 倍。面對高度互動式工作負載時,效能可達比較系統的 2.1 至 4.1 倍。

Jalapeño 也體現了 OpenAI 更全面的完整技術堆疊優勢。OpenAI 能協同設計模型、產品、推論服務軟體、晶片、記憶體、網路及系統,並運用實際工作負載累積的經驗,改善技術堆疊的每一層。Jalapeño 是已投入運作並取得實測成果的自研晶片,也是多世代平台的起點。未來幾個月,我們將逐步擴大 Jalapeño 的部署規模,為客戶提供速度更快、能力更強、效率更高的產品。

Jalapeño 效能的衡量方式

我們會在相同使用者體驗下評估效能,衡量每個系統在符合客戶與互動式智慧體的延遲需求時,每單位功耗能完成多少實用的 AI 工作。這項指標對智慧體尤其重要,因為智慧體必須依序完成許多步驟,延遲會在整項任務中逐步累積。

為了解 Jalapeño 的實際表現,我們使用 SemiAnalysis 的公開基準 InferenceX 進行測試。這項基準會衡量處理 AI 請求的完整流程。我們在測試涵蓋的運作範圍內,將 Jalapeño 與市面上領先的 AI 系統比較,情境從高吞吐量服務到高度互動、低延遲的應用皆包含在內。Jalapeño 在吞吐量、能源效率與延遲之間取得更理想的平衡。效能有時會以單顆晶片為單位呈現,但我們認為每單位功耗的效能是更實用的衡量標準。

Jalapeño 在先前最佳 TBT 下進一步擴大領先優勢

Jalapeño 為每位使用者提供更多 Token

Jalapeño 每千瓦可提供更高吞吐量

在三個公開模型上,Jalapeño 於測試涵蓋的運作範圍內,都展現更理想的每瓦效能與延遲組合,因此位於帕累托前沿。為一致比較各個系統,我們根據每款加速器公布的晶片額定功率將結果標準化。Jalapeño 的額定功率為 700 瓦,但在測試的工作負載上,實測持續功耗始終不超過 550 瓦。

Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上都表現出色。Kimi 是我們測試的最大型公開模型。在這個模型上,Jalapeño 的每瓦峰值效能約為比較系統的 1.5 倍,端對端延遲則降低約 3.4 倍。內部測試顯示,Jalapeño 在前沿 OpenAI 模型上的優勢更加明顯,表示工作負載的規模越大、要求越高,這套架構就越有價值。

在單一晶片中兼顧速度與效率的架構設計

Jalapeño 的設計始於一個問題:如果硬體的主要任務是為現代及未來的語言模型提供推論服務,尤其是互動式智慧體,我們會打造出什麼樣的硬體?Jalapeño 的效能優勢,來自以實際的語言模型工作負載為核心,協同設計晶片、記憶體、網路、軟體及機架級系統。語言模型推論會經過數個階段,每個階段都有不同的瓶頸。系統處理提示的預填階段需要密集運算;系統逐一產生回應 Token 的解碼階段,則更受記憶體頻寬限制。資料必須在核心與晶片之間移動時,通訊也會增加延遲,導致部分處理單元在等待期間閒置。在某個階段表現出色的系統,可能會因等待資料,或在不同資源之間移動模型狀態而失去優勢。

我們設計 Jalapeño 時,力求減少資料移動和通訊延遲。這表示模型狀態,包括產生回應時使用的 KV 快取,都能明確配置並留在本機;系統則會為每個推論階段啟用適當的運算、記憶體與網路組合。網路是這套架構不可或缺的一部分。網路涵蓋範圍廣,能讓整個工作負載留在單一互連系統內,減少資料移動,使完整請求從頭到尾都能維持快速且高效率。最終打造出兼具均衡效能與彈性調度能力的加速器,不僅能支援不斷演進的模型架構、妥善處理預填和解碼,也能因應兩者比重的變化。這正是智慧體工作負載的一項關鍵特性。

我們運用 AI 設計晶片,也讓 AI 能為晶片編寫程式

AI 直接參與 Jalapeño 的開發,協助探索實作方案、縮短設計、量測與驗證循環,並持續依據模型工作負載反覆改進,讓團隊在九個月內完成從初步設計到晶片設計定案。AI 也協助最佳化晶片的算術電路,讓團隊如期在晶片中達到更高的運算效能。

對人類和 AI 而言,Jalapeño 都是明確且可預測的程式設計對象。工程師可以透過區域張量、明確的通訊和可預測的同步機制來描述工作。AI 接著能最佳化工作在整個系統中的對應、配置、排程與協調方式。這種明確且可預測的結構,讓 AI 能以可行的方法處理一向困難的平行程式設計問題。

每支援一個新的模型系列,仍需要開發新的核心運算程式,並針對模型進行最佳化。團隊搭配使用 Codex 與 GPT‑Astra,在兩個月內讓三個原本不在 Jalapeño 生產計畫中的開放權重模型達到高效能。這不僅展現架構的彈性,也顯示 AI 能多快協助我們為 Jalapeño 編寫程式。針對特定的 GPT‑OSS 注意力及專家混合模組,AI 產生的實作速度比現有的人類專家實作快 1.5 至 1.8 倍。上述數據僅適用於指定模組,而非完整模型,但也展現一種強大的全新開發循環。

高效率超高速推論的未來發展

AI 基礎設施的價值,在於能協助人們完成現實世界中的實用工作。Jalapeño 能運用相同的電力與硬體完成更多實用工作,協助我們滿足更多需求,並降低產出有效成果的成本。對 OpenAI 而言,實用工作量和營收的成長速度可望超越服務成本,進而提升營運槓桿。這也有助於讓 AI 更廣泛普及,我們也得以持續投資更優良的模型、產品與基礎設施。加快推論速度還能縮短迭代週期,並開創新的使用情境。

Jalapeño 進一步拓展高效率、低延遲推論的可能性:

  • 超高速模式推論可達到過去僅快速模式才有的效率
  • 快速模式推論可達到過去僅批次模式才有的效率
  • 批次模式推論的效率進一步提升

我們計畫在今年年底前,開始於 OpenAI 的運算基礎設施中部署 Jalapeño。Jalapeño 是多世代發展藍圖的第一代產品。目前 Gen 2 已進入深入開發階段,Gen 3 也逐漸成形。每一代都會延續我們累積的經驗,進一步提升效率與速度。

要滿足持續成長的 AI 需求,就必須充分運用各種來源,取得更多運算資源。我們將繼續廣泛部署 NVIDIA 與其他合作夥伴的加速器,用於訓練和推論工作負載。我們的使命是確保通用人工智慧造福全人類。

在準備部署的同時,我們持續進行量產資格驗證、提高軟體成熟度、準備大規模運行 Jalapeño,並在更多模型上驗證效能。目前的成果顯示,協同設計完整系統能帶來什麼可能性:以更高效率,將反應更快、能力更強的智慧體 AI 提供給更多人。

附錄

Jalapeño 在 GPT‑OSS 120B 上位於帕累托前沿

每 kW 吞吐量前沿

InferenceX · GPT‑OSS‑120B · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB200 1,200 W

Jalapeño 在 GPT‑OSS 的各個運作點均領先

峰值與速度相符時的吞吐量

InferenceX · GPT‑OSS‑120B · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB200 1,200 W

更高的混合 Token 峰值吞吐量/kW

≈1.9×

85,448 對 44,960 混合 Token/kW

端對端延遲降低

≈1.7×

1.03 秒對 1.80 秒

最低 TBT 降低

≈2.7×

0.69 對 1.87 毫秒 (1,459 對 535 Token/秒/使用者)

在先前最佳 TBT 下達到更高吞吐量

≈53.7×

22,935 對 427 混合 Token/kW (535.28 Token/秒/使用者)

Jalapeño 在 DeepSeek R1 670B 上位於帕累托前沿

每 kW 吞吐量前沿

InferenceX · DeepSeek R1 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

Jalapeño 在 DeepSeek R1 的各個運作點均領先

峰值與速度相符時的吞吐量

InferenceX · DeepSeek R1 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

更高的混合 Token 峰值吞吐量/kW

≈1.7×

19,641 對 11,781 混合 Token/kW

端對端延遲降低

≈3.6×

1.65 秒對 5.99 秒

最低 TBT 降低

≈4.1×

1.43 對 5.90 毫秒 (700 對 169 Token/秒/使用者)

在先前最佳 TBT 下達到更高吞吐量

≈104.3×

12,258 對 118 混合 Token/kW (169.41 Token/秒/使用者)

Jalapeño 在 Kimi K2.5 1T 上位於帕累托前沿

每 kW 吞吐量前沿

InferenceX · Kimi K2.5 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

Jalapeño 在 Kimi K2.5 的各個運作點均領先

峰值與速度相符時的吞吐量

InferenceX · Kimi K2.5 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

更高的混合 Token 峰值吞吐量/kW

≈1.5×

18,195 對 11,862 混合 Token/kW

端對端延遲降低

≈3.4×

1.56 秒對 5.31 秒

最低 TBT 降低

≈3.8×

1.44 對 5.48 毫秒 (694 對 182 Token/秒/使用者)

在先前最佳 TBT 下達到更高吞吐量

≈56.1×

6,744 對 120 混合 Token/kW (182.46 Token/秒/使用者)

作者

OpenAI