Pasar al contenido principal
OpenAI

25 de agosto de 2026

IngenieríaEmpresa

Los primeros resultados de Jalapeño muestran velocidad y eficiencia líderes en inferencia de IA

Cargando...
Primer plano del chip de inferencia Jalapeño montado en una placa de circuito verde azulado.

Desde que anunciamos Jalapeño, el primer chip personalizado de inferencia de OpenAI, hemos estado probando el chip y el sistema construido a su alrededor. Los resultados muestran un avance significativo en rendimiento: Jalapeño puede procesar más cargas de trabajo de IA por unidad de potencia y, al mismo tiempo, devolver respuestas con mayor rapidez. Jalapeño ofrece mayor rendimiento y menor latencia con una sola arquitectura, mientras que los sistemas de hardware existentes suelen tener que sacrificar uno para mejorar el otro.

Para los clientes, eso puede significar respuestas más rápidas, agentes con mayor capacidad de respuesta y acceso más confiable a medida que aumenta la demanda. Nuestra misión es asegurar que la inteligencia artificial general beneficie a toda la humanidad. Estas mejoras ayudarán a que la IA, cada vez más capaz, sea más asequible y esté disponible de forma más amplia.

Los modelos de OpenAI también aceleraron el desarrollo de Jalapeño. Las generaciones anteriores ayudaron al equipo a diseñar y poner en funcionamiento el chip, mientras que nuestros modelos más recientes están acelerando su optimización y programación. Jalapeño ofrece un alto rendimiento en GPT‑OSS 120B, DeepSeek R1 y Kimi K2.5 1T, lo que demuestra que la arquitectura funciona con modelos desarrollados tanto dentro como fuera de OpenAI. En los tres modelos, Jalapeño completó entre 1.5 y 1.9 veces más trabajo de IA por vatio en el punto de máximo rendimiento y ofreció una latencia de extremo a extremo entre 1.7 y 3.6 veces menor que la de los sistemas comparados. En cargas de trabajo altamente interactivas, ofreció un rendimiento entre 2.1 y 4.1 veces superior.

Jalapeño también demuestra la ventaja más amplia que ofrece el stack completo. OpenAI puede diseñar modelos, productos, software de inferencia, chips, memoria, redes y sistemas de manera conjunta, usando lo que aprendemos de cargas de trabajo reales para mejorar cada capa del stack. Jalapeño es el primer chip propio de OpenAI plenamente operativo y con resultados medidos, y marca el inicio de una plataforma multigeneracional. En los próximos meses, ampliaremos el despliegue de Jalapeño para ofrecer productos más rápidos, con más capacidades y más eficientes a nuestros clientes.

Cómo medimos el rendimiento de Jalapeño

Evaluamos el rendimiento con una experiencia de usuario equivalente y medimos cuánto trabajo útil de IA puede completar cada sistema por unidad de potencia sin superar los niveles de latencia que requieren los clientes y los agentes interactivos. Esto es especialmente importante para los agentes, que deben completar muchos pasos en secuencia, ya que las demoras pueden acumularse a lo largo de una tarea.

Para comprender el rendimiento de Jalapeño en la práctica, lo probamos en InferenceX, un benchmark público de SemiAnalysis que mide de principio a fin cómo se procesa una solicitud de IA. Comparamos Jalapeño con los principales sistemas de IA disponibles comercialmente en todo el rango operativo evaluado, desde escenarios de inferencia de alto rendimiento hasta usos altamente interactivos y de baja latencia. Jalapeño ofreció una mejor combinación de rendimiento, eficiencia energética y latencia. Aunque el rendimiento a veces se expresa por chip, creemos que el criterio más útil es el rendimiento por unidad de potencia.

Jalapeño amplía la ventaja respecto al mejor TBT anterior

Jalapeño ofrece más tokens por usuario

Jalapeño ofrece más rendimiento por kilovatio

En los tres modelos públicos, Jalapeño ofreció una mejor combinación de rendimiento por vatio y latencia en todo el rango operativo evaluado, lo que lo sitúa en la frontera de Pareto. Para comparar los sistemas de manera coherente, normalizamos los resultados utilizando la potencia nominal publicada del chip de cada acelerador. Jalapeño tiene una potencia nominal de 700 vatios, aunque su potencia sostenida medida se mantuvo en 550 vatios o menos en las cargas de trabajo evaluadas.

Jalapeño ofreció un alto rendimiento con GPT‑OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. En Kimi, el modelo público más grande que probamos, alcanzó aproximadamente 1.5 veces el rendimiento máximo por vatio del sistema comparado y una latencia de extremo a extremo 3.4 veces menor. En nuestras pruebas internas, la ventaja de Jalapeño se amplió aún más con los modelos de vanguardia de OpenAI, lo que sugiere que la arquitectura adquiere más valor a medida que las cargas de trabajo crecen y se vuelven más exigentes.

Diseñar la arquitectura para lograr velocidad y eficiencia en un solo chip

Jalapeño se diseñó desde el inicio a partir de la siguiente pregunta: ¿qué hardware construiríamos si su función principal fuera ejecutar modelos de lenguaje modernos y futuros, especialmente para agentes interactivos? Las mejoras de Jalapeño provienen del diseño conjunto del chip, la memoria, la red, el software y el sistema a escala de rack en torno a cargas de trabajo reales de modelos de lenguaje. La inferencia de modelos de lenguaje pasa por varias fases distintas, cada una con diferentes cuellos de botella. El preprocesamiento, durante el cual el sistema procesa un prompt, requiere una gran capacidad de cómputo, mientras que la decodificación, durante la cual el sistema genera la respuesta token por token, está más limitada por el ancho de banda de la memoria. La comunicación también puede aumentar la latencia cuando los datos deben desplazarse entre núcleos y chips, lo que deja inactivas algunas unidades de procesamiento mientras esperan. Un sistema que sobresale en una fase puede perder esa ventaja mientras espera datos o transfiere el estado del modelo entre diferentes recursos.

Diseñamos Jalapeño para minimizar el movimiento de datos y los retrasos en la comunicación. Esto permite asignar explícitamente el estado del modelo —incluida la caché KV utilizada para generar una respuesta— y mantenerlo de forma local, mientras el sistema activa la combinación adecuada de cómputo, memoria y redes para cada fase de inferencia. La red es un componente esencial de la arquitectura. Su amplio dominio de interconexión permite mantener toda la carga de trabajo dentro de un único sistema conectado, lo que minimiza el movimiento de datos y ayuda a procesar cada solicitud con rapidez y eficiencia de principio a fin. El resultado es un acelerador equilibrado y versátil, capaz de adaptarse a la evolución de las arquitecturas de modelos, sobresalir tanto en el preprocesamiento como en la decodificación y ajustarse a los cambios en el equilibrio entre ambas fases, una característica fundamental de las cargas de trabajo agénticas.

Usamos IA para diseñar el chip y diseñamos el chip para que la IA pudiera programarlo

La IA desempeñó un papel directo en el desarrollo de Jalapeño, lo que permitió al equipo pasar del diseño inicial al tape-out en nueve meses mediante la exploración de implementaciones, la reducción de los ciclos de diseño, medición y verificación, y pruebas e iteraciones continuas con cargas de trabajo de modelos. La IA también ayudó a optimizar los circuitos aritméticos del chip, lo que permitió al equipo incorporar una mayor capacidad de cómputo dentro del plazo previsto.

Jalapeño se diseñó como una plataforma de programación clara y predecible tanto para los humanos como para la IA. Los ingenieros pueden definir las tareas mediante tensores locales, comunicación explícita y sincronización predecible. Luego, la IA puede optimizar la forma en que esas tareas se asignan, se ubican, se programan y se coordinan en todo el sistema. Esta estructura clara y predecible ofrece a la IA una forma viable de abordar el tradicionalmente complejo problema de la programación paralela.

Cada nueva familia de modelos sigue requiriendo nuevos kernels y optimizaciones específicas para cada modelo. Con Codex y GPT‑Astra, el equipo logró que tres modelos de pesos abiertos que no formaban parte del plan original de producción de Jalapeño alcanzaran un alto rendimiento en dos meses. Esto demostró tanto la flexibilidad de la arquitectura como la velocidad con la que la IA puede ayudarnos a programarla. En determinados bloques de atención y de mezcla de expertos de GPT‑OSS, las implementaciones generadas por IA fueron entre 1.5 y 1.8 veces más rápidas que las implementaciones existentes escritas por especialistas humanos. Estas cifras se aplican a los bloques seleccionados, no al modelo completo, pero apuntan a un nuevo y potente ciclo de desarrollo.

El camino hacia una inferencia eficiente y ultrarrápida

El valor de la infraestructura de IA radica en el trabajo útil que permite realizar en el mundo real. Al obtener más trabajo útil con la misma energía y el mismo hardware, Jalapeño puede ayudarnos a atender una mayor demanda y reducir el costo de lograr resultados satisfactorios. Para OpenAI, esto puede mejorar el apalancamiento operativo, ya que permite que el trabajo útil y los ingresos crezcan más rápido que el costo de prestar el servicio. También puede favorecer una adopción más amplia y una inversión continua en mejores modelos, productos e infraestructura. Una inferencia más rápida puede acelerar la iteración y habilitar nuevos casos de uso.

Jalapeño amplía las posibilidades para una inferencia eficiente y de baja latencia:

  • Inferencia en modo ultrarrápido con eficiencias antes disponibles solo en modo rápido
  • Inferencia en modo rápido con eficiencias antes disponibles solo en modo por lotes
  • Mayor eficiencia para la inferencia en modo por lotes

Planeamos comenzar a desplegar Jalapeño en la infraestructura de cómputo de OpenAI para finales de año. Es la primera generación de una hoja de ruta multigeneracional: la Gen 2 está en pleno desarrollo y la Gen 3 está tomando forma. Cada generación se basará en lo que aprendamos y seguirá mejorando tanto la eficiencia como la velocidad.

Para satisfacer la creciente demanda de IA, se requerirá más capacidad de cómputo de todas las fuentes disponibles. Seguiremos implementando a gran escala aceleradores de NVIDIA y otros socios para cargas de trabajo tanto de entrenamiento como de inferencia. Nuestra misión es asegurar que la inteligencia artificial general beneficie a toda la humanidad.

Mientras nos preparamos para el despliegue, seguimos validando Jalapeño para producción, perfeccionando el software, preparándonos para operarlo a gran escala y evaluando su rendimiento con más modelos. Los resultados hasta ahora muestran lo que es posible cuando diseñamos conjuntamente todo el sistema: una IA más ágil, capaz y agéntica, ofrecida de manera más eficiente a más personas.

Anexo

Jalapeño se encuentra en la frontera de Pareto en GPT‑OSS 120B

FRONTERA DE RENDIMIENTO POR kW

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB200 1200 W

Jalapeño lidera en todos los puntos de operación de GPT‑OSS

RENDIMIENTO MÁXIMO Y EQUIVALENTE

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB200 1200 W

Mayor rendimiento máximo de TPS mixtos por kW

≈1.9×

85 448 vs. 44 960 mixtos/kW

Menor latencia de extremo a extremo

≈1.7×

1.03 s vs. 1.80 s

Menor TBT mínimo

≈2.7×

0.69 vs. 1.87 ms (1459 vs. 535 tokens/s/usuario)

Mayor rendimiento en el TBT anterior

≈53.7×

22 935 vs. 427 mixtos/kW (a 535.28 tokens/s/usuario)

Jalapeño se encuentra en la frontera de Pareto en DeepSeek R1 670B

FRONTERA DE RENDIMIENTO POR kW

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Jalapeño lidera en todos los puntos de operación de DeepSeek R1

RENDIMIENTO MÁXIMO Y EQUIVALENTE

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Mayor rendimiento máximo de TPS mixtos por kW

≈1.7×

19 641 vs. 11 781 mixtos/kW

Menor latencia de extremo a extremo

≈3.6×

1.65 s vs. 5.99 s

Menor TBT mínimo

≈4.1×

1.43 vs. 5.90 ms (700 vs. 169 tokens/s/usuario)

Mayor rendimiento en el TBT anterior

≈104.3×

12 258 vs. 118 mixtos/kW (a 169.41 tokens/s/usuario)

Jalapeño se encuentra en la frontera de Pareto en Kimi K2.5 1T

FRONTERA DE RENDIMIENTO POR kW

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Jalapeño lidera en todos los puntos de operación de Kimi K2.5

RENDIMIENTO MÁXIMO Y EQUIVALENTE

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Mayor rendimiento máximo de TPS mixtos por kW

≈1.5×

18 195 vs. 11 862 mixtos/kW

Menor latencia de extremo a extremo

≈3.4×

1.56 s vs. 5.31 s

Menor TBT mínimo

≈3.8×

1.44 vs. 5.48 ms (694 vs. 182 tokens/s/usuario)

Mayor rendimiento en el TBT anterior

≈56.1×

6744 vs. 120 mixtos/kW (a 182.46 tokens/s/usuario)

Autor

OpenAI