跳到主要內容
OpenAI

2026年8月25日

工程公司

Jalapeño 首批測試結果顯示 AI 推論速度及效率領先業界

正在載入...
安裝於藍綠色電路板上的 Jalapeño 推論晶片特寫。

自 OpenAI 公布首款自訂推論晶片 Jalapeño 以來,我們一直測試這款晶片及以它為核心建立的系統。結果顯示效能顯著提升:Jalapeño 每單位功耗可處理更多 AI 工作,亦能更快提供回應。Jalapeño 以單一架構同時實現更高吞吐量和更低延遲,而現有硬件系統往往需要在兩者之間取捨。

對客戶而言,這可帶來更快的回應、反應更靈敏的智能代理,以及在需求增長時更穩定可靠的存取體驗。我們的使命是確保通用人工智能造福全人類。這些提升將有助降低能力日益強大的 AI 的使用成本,並讓更多人可以使用。

OpenAI 模型亦加快了 Jalapeño 的開發。較早期的模型協助團隊設計晶片並完成啟動,而最新模型正加快我們最佳化晶片及為其編程的進度。Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上均展現出良好效能,顯示這套架構適用於 OpenAI 內外開發的模型。在三款模型上,Jalapeño 於峰值吞吐量下,每瓦可處理的 AI 工作量較比較系統高 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。對於高度互動的工作負載,其效能高出 2.1 至 4.1 倍。

Jalapeño 亦體現了完整技術堆疊帶來的整體優勢。OpenAI 可以協同設計模型、產品、推論服務軟件、晶片、記憶體、網絡和系統,並將實際工作負載所得的經驗用於改進技術堆疊的每一層。Jalapeño 是已投入實際運作並取得實測結果的自研晶片,也是涵蓋多個世代的平台起點。未來數月,我們將逐步擴大 Jalapeño 的部署規模,為客戶提供速度更快、能力更強、效率更高的產品。

我們如何評估 Jalapeño 的效能

我們在用戶體驗相若的條件下評估效能,衡量每個系統在達到客戶及互動式智能代理所需延遲水平的同時,每單位功耗可完成多少實際有用的 AI 工作。這對智能代理尤其重要,因為它們需要依次完成多個步驟,延遲可能在整項任務中不斷累積。

為了解 Jalapeño 的實際表現,我們使用 SemiAnalysis 的公開基準測試 InferenceX 進行測試。這項基準測試衡量處理 AI 請求的完整流程。我們在測試涵蓋的運作範圍內,將 Jalapeño 與市場上領先的商用 AI 系統比較,範圍由高吞吐量的推論服務,到高度互動的低延遲應用。Jalapeño 在吞吐量、能源效率和延遲之間取得更佳平衡。效能有時會以每枚晶片計算,但我們認為以每單位功耗計算的效能更具參考價值。

Jalapeño 在過往最佳 TBT 水平上進一步擴大領先優勢

Jalapeño 為每名用戶提供更多 Token

Jalapeño 每 kW 提供更高吞吐量

在三款公開模型上,Jalapeño 於整個測試運作範圍內,在每瓦效能和延遲之間取得更佳平衡,處於帕累托前沿。為確保各系統的比較方式一致,我們按照每款加速器已公布的晶片額定功耗將結果標準化。Jalapeño 的額定功耗為 700 瓦,但在測試工作負載下,實測持續功耗維持在 550 瓦或以下。

Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上均表現出色。在我們測試的最大型公開模型 Kimi 上,Jalapeño 的每瓦峰值效能較比較系統高約 1.5 倍,端到端延遲則低 3.4 倍。我們的內部測試顯示,Jalapeño 在 OpenAI 前沿模型上的優勢進一步擴大,反映工作負載越龐大、要求越高,這套架構的價值就越顯著。

以單一晶片架構兼顧速度與效率

Jalapeño 的設計從一開始就以一個問題為出發點:如果硬件的首要工作是為現今及未來的語言模型提供推論服務,尤其是互動式智能代理,我們會設計出怎樣的硬件?Jalapeño 的效能提升,來自我們以實際語言模型工作負載為核心,協同設計晶片、記憶體、網絡、軟件及機架級系統。語言模型推論會經歷數個階段,而各階段都有不同的瓶頸。預填充階段由系統處理提示詞,需要大量運算;解碼階段由系統逐個 Token 生成回應,則較受記憶體頻寬限制。資料需要在核心和晶片之間傳輸時,通訊亦會增加延遲,令部分處理單元在等候期間閒置。系統即使在某個階段表現出色,也可能在等候資料或於不同資源之間移動模型狀態時失去這項優勢。

我們在設計 Jalapeño 時,致力盡量減少資料移動和通訊延遲。這表示模型狀態,包括生成回應時使用的 KV 快取,可以明確配置並保留在本機;系統則會為每個推論階段啟用合適的運算、記憶體和網絡組合。網絡是這套架構不可或缺的一環。其大型網絡域讓整個工作負載可保留在同一個互連系統內,盡量減少資料移動,協助完整請求由始至終保持快速高效。由此形成一款效能均衡、可靈活調配的加速器,既可支援不斷變化的模型架構,亦能在預填充和解碼階段發揮出色表現,並隨兩者的比重轉變而調整。這是智能代理式工作負載的一項關鍵特徵。

我們以 AI 設計晶片,並讓晶片可由 AI 編程

AI 直接參與 Jalapeño 的開發,協助團隊探索不同實作方式、縮短設計、測量和驗證週期,並持續根據模型工作負載反覆改進,從初步設計到流片只用了九個月。AI 亦協助最佳化晶片的算術電路,讓團隊按計劃在晶片中實現更高運算效能。

Jalapeño 的設計讓人類和 AI 都可清晰、可預測地為其編程。工程師可透過本機張量、明確的通訊方式和可預測的同步機制來描述工作。AI 隨後可最佳化這些工作在整個系統中的映射、配置、排程和協調方式。這種清晰、可預測的結構,為 AI 提供一個可行途徑,處理傳統上難以解決的並行編程問題。

支援每個新模型系列仍需要新的運算核心及模型專用的最佳化。團隊使用 Codex 和 GPT‑Astra,在兩個月內將三款原定 Jalapeño 生產計劃以外的開放權重模型提升至高效能。這既展現架構的靈活性,也反映 AI 可多快協助我們為其編程。對於部分 GPT‑OSS 注意力及專家混合區塊,AI 生成的實作速度較現有由人類專家編寫的實作快 1.5 至 1.8 倍。這些數字僅適用於所選區塊,而非整個模型,但已展現一個極具潛力的新開發循環。

高效超高速推論的未來方向

AI 基礎設施的價值,在於它能促成實際有用的工作。Jalapeño 可利用相同電力和硬件完成更多實際有用的工作,協助我們應付更多需求,並降低交付成功成果的成本。對 OpenAI 而言,有用工作和收入的增長速度可因而超越服務成本的增長,改善營運槓桿。這亦可推動更廣泛採用,並支持我們持續投資更出色的模型、產品和基礎設施。更快的推論可加快反覆改進,並開拓新的應用場景。

Jalapeño 為高效、低延遲推論開拓更多可能:

  • 以過往只有快速模式才能達到的效率進行超高速模式推論
  • 以過往只有批次模式才能達到的效率進行快速模式推論
  • 提高批次模式推論的效率

我們計劃在今年年底前,開始於 OpenAI 的運算基礎設施部署 Jalapeño。這是涵蓋多個世代的路線圖中的第一代:Gen 2 正處於深入開發階段,Gen 3 亦逐漸成形。每一代都會建基於我們所得的經驗,進一步提升效率和速度。

為滿足日益增長的 AI 需求,我們需要善用所有可用來源,取得更多運算資源。我們將繼續廣泛部署 NVIDIA 及其他合作夥伴的加速器,處理訓練和推論工作負載。我們的使命是確保通用人工智能造福全人類。

在準備部署的同時,我們正繼續進行生產驗證、完善軟件、為大規模運作 Jalapeño 做好準備,並在更多模型上驗證效能。迄今的結果顯示,協同設計完整系統可帶來哪些成果:以更高效率,讓更多人使用反應更快、能力更強的智能代理式 AI。

附錄

Jalapeño 在 GPT‑OSS 120B 上處於帕累托前沿

每 kW 吞吐量前沿

InferenceX · GPT‑OSS‑120B · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB200 1,200 W

Jalapeño 在各個 GPT‑OSS 運作點均領先

峰值及相同速度下的吞吐量

InferenceX · GPT‑OSS‑120B · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB200 1,200 W

更高的每 kW 峰值混合 TPS

≈1.9×

85,448 對 44,960 混合吞吐量/kW

更低的端到端延遲

≈1.7×

1.03 秒對 1.80 秒

較低的最低 TBT

≈2.7×

0.69 對 1.87 毫秒 (1,459 對 535 tok/秒/用戶)

在先前的 TBT 下達到更高吞吐量

≈53.7×

22,935 對 427 混合吞吐量/kW (以 535.28 tok/s/用戶計)

Jalapeño 在 DeepSeek R1 670B 上處於帕累托前沿

每 kW 吞吐量前沿

InferenceX · DeepSeek R1 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

Jalapeño 在各個 DeepSeek R1 運作點均領先

峰值及相同速度下的吞吐量

InferenceX · DeepSeek R1 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

更高的每 kW 峰值混合 TPS

≈1.7×

19,641 對 11,781 混合吞吐量/kW

更低的端到端延遲

≈3.6×

1.65 秒對 5.99 秒

較低的最低 TBT

≈4.1×

1.43 對 5.90 毫秒 (700 對 169 tok/秒/用戶)

在先前的 TBT 下達到更高吞吐量

≈104.3×

12,258 對 118 混合吞吐量/kW (以 169.41 tok/秒/用戶計)

Jalapeño 在 Kimi K2.5 1T 上處於帕累托前沿

每 kW 吞吐量前沿

InferenceX · Kimi K2.5 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

Jalapeño 在各個 Kimi K2.5 運作點均領先

峰值及相同速度下的吞吐量

InferenceX · Kimi K2.5 MXFP4 · 標稱 8k/1k · STP · 封裝 TDP:Jalapeño 700 W;GB300 1,400 W

更高的每 kW 峰值混合 TPS

≈1.5×

18,195 對 11,862 混合吞吐量/kW

更低的端到端延遲

≈3.4×

1.56 秒對 5.31 秒

較低的最低 TBT

≈3.8×

1.44 對 5.48 毫秒 (694 對 182 tok/秒/用戶)

在先前的 TBT 下達到更高吞吐量

≈56.1×

6,744 對 120 混合吞吐量/kW (以 182.46 tok/秒/用戶計)

作者

OpenAI