
自从发布 OpenAI 首款自研推理芯片 Jalapeño 以来,我们一直在对该芯片及其配套系统进行测试。结果显示其在性能上取得了显著的性能提升:Jalapeño 能够在单位功耗下处理更多的 AI 工作,同时还能更快速地返回响应。Jalapeño 通过单一架构同时实现了更高的吞吐量和更低的延迟,而现有的硬件系统往往不得不在两者之间做出妥协。
对客户而言,这可能意味着响应更快、智能体更加敏捷,并能在需求增长时获得更可靠的访问保障。我们的使命是确保通用人工智能造福全人类。这些性能提升将有助于使能力日益强大的 AI 变得更加平价且更易普及。
OpenAI 的模型同样加速了 Jalapeño 的开发进程。早期几代模型协助团队完成芯片设计和启动调试,而我们最新的模型正在加速芯片的优化与编程。Jalapeño 的出色性能同样体现在 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上,这表明该架构不仅适用于 OpenAI 内部开发的模型,对外部模型同样有效。在这三款模型上,Jalapeño 在峰值吞吐量下每瓦完成的 AI 任务量是对比系统的 1.5 到 1.9 倍,端到端延迟比对比系统低 1.7 到 3.6 倍。对于高度交互式的工作负载,其性能达到对比系统的 2.1 至 4.1 倍。
Jalapeño 也是我们更广泛的“全栈优势 (full-stack advantage)”的有力证明。OpenAI 能够将模型、产品、推理服务软件、芯片、内存、网络和系统结合在一起进行协同设计,并利用从实际工作负载中获得的经验,去改进全栈体系的每一层。Jalapeño 是一款已经实际运行并取得实测结果的自研芯片,也是多代平台的起点。在接下来的几个月里,我们将逐步扩大 Jalapeño 的部署规模,为我们的客户提供更快、能力更强且更高效的产品。
我们在用户体验相当的条件下评估性能,测量每个系统在满足客户和交互式智能体延迟要求的同时,单位功耗能够完成多少有用的 AI 工作。这对于智能体尤其重要,因为它们需要连续完成许多步骤,延迟可能在整个任务过程中不断累积。
为评估 Jalapeño 的实际性能,我们在 InferenceX 上对其进行了测试,这是由 SemiAnalysis 发布的一个公开基准,用于衡量处理 AI 请求的全过程。我们在从高吞吐量服务到高度交互、低延迟使用的整个测试运行区间内,将 Jalapeño 与市面上领先的商用 AI 系统进行了对比。Jalapeño 在吞吐量、能效和延迟之间实现了更优平衡。尽管性能数据有时会按单颗芯片来报告,但我们认为,单位功耗性能 (performance per unit of power) 才是更具实用价值的衡量标准。
在所有三款公开模型上,Jalapeño 在整个测试运行范围内均展现了更优的每瓦性能与延迟组合,使其处于帕累托前沿。为了保持对比的一致性,我们使用了各加速器公布的芯片额定功率对结果进行了标准化处理。Jalapeño 的额定功率为 700 瓦,不过在测试的工作负载下,其测得的持续功耗均维持在 550 瓦或以下。
Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上均表现强劲。在我们测试过的公开模型中,Kimi 的规模最大;在该模型上它提供的峰值每瓦性能约为对比系统的 1.5 倍,端到端延迟比对比系统低 3.4 倍。在我们内部测试中,Jalapeño 在 OpenAI 前沿模型上的优势进一步扩大,这表明随着工作负载规模扩大、要求提高,该架构的价值也日益凸显。
Jalapeño 的设计从一开始就围绕这样一个问题展开:如果硬件的首要任务是为当代及未来的语言模型提供推理服务,特别是交互式智能体,我们应该构建怎样的硬件?Jalapeño 的优势在于,它是围绕实际的语言模型工作负载,将芯片、内存、网络、软件以及机架级系统作为一个整体来进行协同设计的。语言模型推理会经历多个瓶颈各不相同的阶段。系统处理提示词的预填充 (prefill) 阶段计算密集,而系统逐个 Token 生成响应的解码 (decode) 阶段则更多受限于内存带宽。此外,当数据必须在计算核心和芯片之间移动时,通信也会增加延迟,导致部分处理单元在等待数据时处于闲置状态。在某个阶段表现出色的系统,可能会在等待数据或在不同资源间移动模型状态时丧失这一优势。
我们在设计 Jalapeño 时,致力于将数据移动和通信延迟降至最低。这意味着模型状态(包括生成响应时使用的 KV 缓存)可以进行显式放置并保留在本地,同时系统能够针对每个推理阶段激活最合适的计算、内存和网络资源组合。网络是该架构不可或缺的一部分。它广泛的互联范围允许整个工作负载保留在一个互联系统内,从而最大限度地减少数据移动,并确保完整的请求从头至尾保持快速与高效。其结果是打造出一款均衡且可灵活调配的加速器,它不仅能支持不断演进的模型架构、在预填充和解码阶段均表现出色,还能根据预填充与解码工作负载比例的变化灵活调整 — 这正是智能体工作负载的一个显著特征。
AI 在 Jalapeño 的开发过程中发挥了直接作用,通过探索不同实现方式、缩短设计、测量和验证的迭代周期,并持续在模型工作负载上进行迭代,使团队能够在九个月内完成从初步设计到流片 (tapeout) 的全过程。AI 还帮助优化了芯片的算术电路,使团队能够按计划在芯片中融入更多的计算性能。
Jalapeño 被设计成一个对人类和 AI 而言都清晰、可预测的编程目标平台。工程师可以通过本地张量 (local tensors)、显式通信和可预测的同步来描述工作。随后,AI 可以优化这些工作在整个系统中的映射、放置、调度与协调方式。这种清晰、可预测的结构,为 AI 解决以往十分棘手的并行编程问题提供了一条可行的路径。
支持每一个新的模型系列,依然需要编写新的内核并面向特定模型进行优化。利用搭载 GPT‑Astra 的 Codex,团队在两个月内便使三款原本不在 Jalapeño 生产计划内的开放权重模型实现了高性能运行。这不仅证明了该架构的灵活性,也展现了 AI 协助我们编程的速度。针对所选的 GPT‑OSS 注意力机制 (attention) 和混合专家 (MoE) 模块,由 AI 生成的实现方案的运行速度是现有人类专家编写方案的 1.5 到 1.8 倍。这些数据虽然仅适用于所选模块而非整个模型,但展现出一种强大的全新开发循环的潜力。
AI 基础设施的价值在于让 AI 能够在现实世界中完成有用的工作。通过在相同的功耗和硬件条件下产出更多有效工作,Jalapeño 能够帮助我们满足更多需求,并降低成功完成任务的成本。对 OpenAI 而言,这能让有效工作和收入的增长快于服务成本的增长,从而提升运营杠杆。它还能支持更广泛的普及,并为更优质的模型、产品及基础设施的持续投资提供保障。更快的推理速度能够带来更快的迭代,并催生新的用例。
Jalapeño 拓展了高效、低延迟推理的能力边界:
- 以过往仅在“快速模式”下才能实现的效率,实现“超快速模式” (Ultra-fast-mode) 的推理
- 以过往仅在“批处理模式”下才能实现的效率,实现“快速模式”的推理
- 在“批处理模式”下实现更高的推理效率
我们计划于今年年底前,开始在 OpenAI 的计算基础设施内部署 Jalapeño。这是我们多代产品路线图中的第一代:第二代 (Gen 2) 正处于深度开发阶段,第三代 (Gen 3) 也已初具雏形。每一代产品都将建立在我们的经验基础之上,并进一步提升效率与速度。
满足日益增长的 AI 需求,需要我们调动所有可用资源的更多算力。我们将继续在训练和推理工作负载中广泛部署 NVIDIA 及其他合作伙伴的加速器。我们的使命是确保通用人工智能造福全人类。
在为部署做准备的同时,我们将继续进行生产验证、完善软件、为规模化运营 Jalapeño 做好准备,并在更多模型上验证其性能。目前的结果展现了对整个系统进行协同设计所能实现的效果:我们将更高效地把响应更快、能力更强、更具智能体特性的 AI 交付给更多人。
每千瓦吞吐量前沿曲线
InferenceX · GPT‑OSS‑120B · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB200 1,200 瓦
峰值吞吐量及同速吞吐量对比
InferenceX · GPT‑OSS‑120B · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB200 1,200 瓦
更高的峰值混合 TPS/千瓦
≈1.9×
85,448 vs. 44,960 混合 Token/千瓦
更低的端到端延迟
≈1.7×
1.03 秒 vs. 1.80 秒
更低的最低 TBT
≈2.7×
0.69 毫秒 vs. 1.87 毫秒 (1,459 vs. 535 Token/秒/用户)
在此前最佳 TBT 下实现更高吞吐量
≈53.7×
22,935 vs. 427 混合 Token/千瓦 (在 535.28 Token/秒/用户的速度下)
每千瓦吞吐量前沿曲线
InferenceX · DeepSeek R1 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦
峰值吞吐量及同速吞吐量对比
InferenceX · DeepSeek R1 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦
更高的峰值混合 TPS/千瓦
≈1.7×
19,641 vs. 11,781 混合 Token/千瓦
更低的端到端延迟
≈3.6×
1.65 秒 vs. 5.99 秒
更低的最低 TBT
≈4.1×
1.43 毫秒 vs. 5.90 毫秒 (700 vs. 169 Token/秒/用户)
在此前最佳 TBT 下实现更高吞吐量
≈104.3×
12,258 vs. 118 混合 Token/千瓦 (在 169.41 Token/秒/用户的速度下)
每千瓦吞吐量前沿曲线
InferenceX · Kimi K2.5 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦
峰值吞吐量及同速吞吐量对比
InferenceX · Kimi K2.5 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦
更高的峰值混合 TPS/千瓦
≈1.5×
18,195 vs. 11,862 混合 Token/千瓦
更低的端到端延迟
≈3.4×
1.56 秒 vs. 5.31 秒
更低的最低 TBT
≈3.8×
1.44 毫秒 vs. 5.48 毫秒 (694 vs. 182 Token/秒/用户)
在此前最佳 TBT 下实现更高吞吐量
≈56.1×
6,744 vs. 120 混合 Token/千瓦 (在 182.46 Token/秒/用户的速度下)


