跳至主要内容
OpenAI

2026年8月25日

工程公司

Jalapeño 的首批测试结果展现出行业领先的 AI 推理速度与效率

正在加载…
安装在蓝绿色电路板上的 Jalapeño 推理芯片特写。

自从发布 OpenAI 首款自研推理芯片 Jalapeño 以来,我们一直在对该芯片及其配套系统进行测试。结果显示其在性能上取得了显著的性能提升:Jalapeño 能够在单位功耗下处理更多的 AI 工作,同时还能更快速地返回响应。Jalapeño 通过单一架构同时实现了更高的吞吐量和更低的延迟,而现有的硬件系统往往不得不在两者之间做出妥协。

对客户而言,这可能意味着响应更快、智能体更加敏捷,并能在需求增长时获得更可靠的访问保障。我们的使命是确保通用人工智能造福全人类。这些性能提升将有助于使能力日益强大的 AI 变得更加平价且更易普及。

OpenAI 的模型同样加速了 Jalapeño 的开发进程。早期几代模型协助团队完成芯片设计和启动调试,而我们最新的模型正在加速芯片的优化与编程。Jalapeño 的出色性能同样体现在 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上,这表明该架构不仅适用于 OpenAI 内部开发的模型,对外部模型同样有效。在这三款模型上,Jalapeño 在峰值吞吐量下每瓦完成的 AI 任务量是对比系统的 1.5 到 1.9 倍,端到端延迟比对比系统低 1.7 到 3.6 倍。对于高度交互式的工作负载,其性能达到对比系统的 2.1 至 4.1 倍。

Jalapeño 也是我们更广泛的“全栈优势 (full-stack advantage)”的有力证明。OpenAI 能够将模型、产品、推理服务软件、芯片、内存、网络和系统结合在一起进行协同设计,并利用从实际工作负载中获得的经验,去改进全栈体系的每一层。Jalapeño 是一款已经实际运行并取得实测结果的自研芯片,也是多代平台的起点。在接下来的几个月里,我们将逐步扩大 Jalapeño 的部署规模,为我们的客户提供更快、能力更强且更高效的产品。

我们如何衡量 Jalapeño 的性能

我们在用户体验相当的条件下评估性能,测量每个系统在满足客户和交互式智能体延迟要求的同时,单位功耗能够完成多少有用的 AI 工作。这对于智能体尤其重要,因为它们需要连续完成许多步骤,延迟可能在整个任务过程中不断累积。

为评估 Jalapeño 的实际性能,我们在 InferenceX 上对其进行了测试,这是由 SemiAnalysis 发布的一个公开基准,用于衡量处理 AI 请求的全过程。我们在从高吞吐量服务到高度交互、低延迟使用的整个测试运行区间内,将 Jalapeño 与市面上领先的商用 AI 系统进行了对比。Jalapeño 在吞吐量、能效和延迟之间实现了更优平衡。尽管性能数据有时会按单颗芯片来报告,但我们认为,单位功耗性能 (performance per unit of power) 才是更具实用价值的衡量标准。

在此前最佳 TBT 水平下,Jalapeño 进一步扩大领先优势

Jalapeño 为每个用户提供更高的 Token 速率

Jalapeño 提供更高的每千瓦吞吐量

在所有三款公开模型上,Jalapeño 在整个测试运行范围内均展现了更优的每瓦性能与延迟组合,使其处于帕累托前沿。为了保持对比的一致性,我们使用了各加速器公布的芯片额定功率对结果进行了标准化处理。Jalapeño 的额定功率为 700 瓦,不过在测试的工作负载下,其测得的持续功耗均维持在 550 瓦或以下。

Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上均表现强劲。在我们测试过的公开模型中,Kimi 的规模最大;在该模型上它提供的峰值每瓦性能约为对比系统的 1.5 倍,端到端延迟比对比系统低 3.4 倍。在我们内部测试中,Jalapeño 在 OpenAI 前沿模型上的优势进一步扩大,这表明随着工作负载规模扩大、要求提高,该架构的价值也日益凸显。

在单颗芯片中兼顾速度与效率

Jalapeño 的设计从一开始就围绕这样一个问题展开:如果硬件的首要任务是为当代及未来的语言模型提供推理服务,特别是交互式智能体,我们应该构建怎样的硬件?Jalapeño 的优势在于,它是围绕实际的语言模型工作负载,将芯片、内存、网络、软件以及机架级系统作为一个整体来进行协同设计的。语言模型推理会经历多个瓶颈各不相同的阶段。系统处理提示词的预填充 (prefill) 阶段计算密集,而系统逐个 Token 生成响应的解码 (decode) 阶段则更多受限于内存带宽。此外,当数据必须在计算核心和芯片之间移动时,通信也会增加延迟,导致部分处理单元在等待数据时处于闲置状态。在某个阶段表现出色的系统,可能会在等待数据或在不同资源间移动模型状态时丧失这一优势。

我们在设计 Jalapeño 时,致力于将数据移动和通信延迟降至最低。这意味着模型状态(包括生成响应时使用的 KV 缓存)可以进行显式放置并保留在本地,同时系统能够针对每个推理阶段激活最合适的计算、内存和网络资源组合。网络是该架构不可或缺的一部分。它广泛的互联范围允许整个工作负载保留在一个互联系统内,从而最大限度地减少数据移动,并确保完整的请求从头至尾保持快速与高效。其结果是打造出一款均衡且可灵活调配的加速器,它不仅能支持不断演进的模型架构、在预填充和解码阶段均表现出色,还能根据预填充与解码工作负载比例的变化灵活调整 — 这正是智能体工作负载的一个显著特征。

我们使用 AI 设计芯片,也让芯片能够由 AI 编程

AI 在 Jalapeño 的开发过程中发挥了直接作用,通过探索不同实现方式、缩短设计、测量和验证的迭代周期,并持续在模型工作负载上进行迭代,使团队能够在九个月内完成从初步设计到流片 (tapeout) 的全过程。AI 还帮助优化了芯片的算术电路,使团队能够按计划在芯片中融入更多的计算性能。

Jalapeño 被设计成一个对人类和 AI 而言都清晰、可预测的编程目标平台。工程师可以通过本地张量 (local tensors)、显式通信和可预测的同步来描述工作。随后,AI 可以优化这些工作在整个系统中的映射、放置、调度与协调方式。这种清晰、可预测的结构,为 AI 解决以往十分棘手的并行编程问题提供了一条可行的路径。

支持每一个新的模型系列,依然需要编写新的内核并面向特定模型进行优化。利用搭载 GPT‑Astra 的 Codex,团队在两个月内便使三款原本不在 Jalapeño 生产计划内的开放权重模型实现了高性能运行。这不仅证明了该架构的灵活性,也展现了 AI 协助我们编程的速度。针对所选的 GPT‑OSS 注意力机制 (attention) 和混合专家 (MoE) 模块,由 AI 生成的实现方案的运行速度是现有人类专家编写方案的 1.5 到 1.8 倍。这些数据虽然仅适用于所选模块而非整个模型,但展现出一种强大的全新开发循环的潜力。

高效、超快速推理的未来之路

AI 基础设施的价值在于让 AI 能够在现实世界中完成有用的工作。通过在相同的功耗和硬件条件下产出更多有效工作,Jalapeño 能够帮助我们满足更多需求,并降低成功完成任务的成本。对 OpenAI 而言,这能让有效工作和收入的增长快于服务成本的增长,从而提升运营杠杆。它还能支持更广泛的普及,并为更优质的模型、产品及基础设施的持续投资提供保障。更快的推理速度能够带来更快的迭代,并催生新的用例。

Jalapeño 拓展了高效、低延迟推理的能力边界:

  • 以过往仅在“快速模式”下才能实现的效率,实现“超快速模式” (Ultra-fast-mode) 的推理
  • 以过往仅在“批处理模式”下才能实现的效率,实现“快速模式”的推理
  • 在“批处理模式”下实现更高的推理效率

我们计划于今年年底前,开始在 OpenAI 的计算基础设施内部署 Jalapeño。这是我们多代产品路线图中的第一代:第二代 (Gen 2) 正处于深度开发阶段,第三代 (Gen 3) 也已初具雏形。每一代产品都将建立在我们的经验基础之上,并进一步提升效率与速度。

满足日益增长的 AI 需求,需要我们调动所有可用资源的更多算力。我们将继续在训练和推理工作负载中广泛部署 NVIDIA 及其他合作伙伴的加速器。我们的使命是确保通用人工智能造福全人类。

在为部署做准备的同时,我们将继续进行生产验证、完善软件、为规模化运营 Jalapeño 做好准备,并在更多模型上验证其性能。目前的结果展现了对整个系统进行协同设计所能实现的效果:我们将更高效地把响应更快、能力更强、更具智能体特性的 AI 交付给更多人。

附录

Jalapeño 在 GPT‑OSS 120B 上处于帕累托前沿 (Pareto frontier)

每千瓦吞吐量前沿曲线

InferenceX · GPT‑OSS‑120B · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB200 1,200 瓦

Jalapeño 在 GPT‑OSS 的各工作点均保持领先

峰值吞吐量及同速吞吐量对比

InferenceX · GPT‑OSS‑120B · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB200 1,200 瓦

更高的峰值混合 TPS/千瓦

≈1.9×

85,448 vs. 44,960 混合 Token/千瓦

更低的端到端延迟

≈1.7×

1.03 秒 vs. 1.80 秒

更低的最低 TBT

≈2.7×

0.69 毫秒 vs. 1.87 毫秒 (1,459 vs. 535 Token/秒/用户)

在此前最佳 TBT 下实现更高吞吐量

≈53.7×

22,935 vs. 427 混合 Token/千瓦 (在 535.28 Token/秒/用户的速度下)

Jalapeño 在 DeepSeek R1 670B 上处于帕累托前沿

每千瓦吞吐量前沿曲线

InferenceX · DeepSeek R1 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦

Jalapeño 在 DeepSeek R1 的各工作点均保持领先

峰值吞吐量及同速吞吐量对比

InferenceX · DeepSeek R1 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦

更高的峰值混合 TPS/千瓦

≈1.7×

19,641 vs. 11,781 混合 Token/千瓦

更低的端到端延迟

≈3.6×

1.65 秒 vs. 5.99 秒

更低的最低 TBT

≈4.1×

1.43 毫秒 vs. 5.90 毫秒 (700 vs. 169 Token/秒/用户)

在此前最佳 TBT 下实现更高吞吐量

≈104.3×

12,258 vs. 118 混合 Token/千瓦 (在 169.41 Token/秒/用户的速度下)

Jalapeño 在 Kimi K2.5 1T 上处于帕累托前沿

每千瓦吞吐量前沿曲线

InferenceX · Kimi K2.5 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦

Jalapeño 在 Kimi K2.5 的各工作点均保持领先

峰值吞吐量及同速吞吐量对比

InferenceX · Kimi K2.5 MXFP4 · 标称 8k/1k · STP · 封装 TDP:Jalapeño 700 瓦;GB300 1,400 瓦

更高的峰值混合 TPS/千瓦

≈1.5×

18,195 vs. 11,862 混合 Token/千瓦

更低的端到端延迟

≈3.4×

1.56 秒 vs. 5.31 秒

更低的最低 TBT

≈3.8×

1.44 毫秒 vs. 5.48 毫秒 (694 vs. 182 Token/秒/用户)

在此前最佳 TBT 下实现更高吞吐量

≈56.1×

6,744 vs. 120 混合 Token/千瓦 (在 182.46 Token/秒/用户的速度下)

作者

OpenAI