Los primeros resultados de Jalapeño muestran velocidad y eficiencia líderes en inferencia de IA

Desde que anunciamos Jalapeño, el primer chip personalizado de inferencia de OpenAI, hemos estado probando el chip y el sistema construido a su alrededor. Los resultados muestran un avance significativo en rendimiento: Jalapeño puede procesar más cargas de trabajo de IA por unidad de potencia y, al mismo tiempo, devolver respuestas con mayor rapidez. Jalapeño ofrece mayor rendimiento y menor latencia con una sola arquitectura, mientras que los sistemas de hardware existentes suelen tener que sacrificar uno para mejorar el otro.
Para los clientes, eso puede significar respuestas más rápidas, agentes con mayor capacidad de respuesta y acceso más confiable a medida que aumenta la demanda. Nuestra misión es asegurar que la inteligencia artificial general beneficie a toda la humanidad. Estas mejoras ayudarán a que la IA, cada vez más capaz, sea más asequible y esté disponible de forma más amplia.
Los modelos de OpenAI también aceleraron el desarrollo de Jalapeño. Las generaciones anteriores ayudaron al equipo a diseñar y poner en funcionamiento el chip, mientras que nuestros modelos más recientes están acelerando su optimización y programación. Jalapeño ofrece un alto rendimiento en GPT‑OSS 120B, DeepSeek R1 y Kimi K2.5 1T, lo que demuestra que la arquitectura funciona con modelos desarrollados tanto dentro como fuera de OpenAI. En los tres modelos, Jalapeño completó entre 1.5 y 1.9 veces más trabajo de IA por vatio en el punto de máximo rendimiento y ofreció una latencia de extremo a extremo entre 1.7 y 3.6 veces menor que la de los sistemas comparados. En cargas de trabajo altamente interactivas, ofreció un rendimiento entre 2.1 y 4.1 veces superior.
Jalapeño también demuestra la ventaja más amplia que ofrece el stack completo. OpenAI puede diseñar modelos, productos, software de inferencia, chips, memoria, redes y sistemas de manera conjunta, usando lo que aprendemos de cargas de trabajo reales para mejorar cada capa del stack. Jalapeño es el primer chip propio de OpenAI plenamente operativo y con resultados medidos, y marca el inicio de una plataforma multigeneracional. En los próximos meses, ampliaremos el despliegue de Jalapeño para ofrecer productos más rápidos, con más capacidades y más eficientes a nuestros clientes.
Evaluamos el rendimiento con una experiencia de usuario equivalente y medimos cuánto trabajo útil de IA puede completar cada sistema por unidad de potencia sin superar los niveles de latencia que requieren los clientes y los agentes interactivos. Esto es especialmente importante para los agentes, que deben completar muchos pasos en secuencia, ya que las demoras pueden acumularse a lo largo de una tarea.
Para comprender el rendimiento de Jalapeño en la práctica, lo probamos en InferenceX, un benchmark público de SemiAnalysis que mide de principio a fin cómo se procesa una solicitud de IA. Comparamos Jalapeño con los principales sistemas de IA disponibles comercialmente en todo el rango operativo evaluado, desde escenarios de inferencia de alto rendimiento hasta usos altamente interactivos y de baja latencia. Jalapeño ofreció una mejor combinación de rendimiento, eficiencia energética y latencia. Aunque el rendimiento a veces se expresa por chip, creemos que el criterio más útil es el rendimiento por unidad de potencia.
En los tres modelos públicos, Jalapeño ofreció una mejor combinación de rendimiento por vatio y latencia en todo el rango operativo evaluado, lo que lo sitúa en la frontera de Pareto. Para comparar los sistemas de manera coherente, normalizamos los resultados utilizando la potencia nominal publicada del chip de cada acelerador. Jalapeño tiene una potencia nominal de 700 vatios, aunque su potencia sostenida medida se mantuvo en 550 vatios o menos en las cargas de trabajo evaluadas.
Jalapeño ofreció un alto rendimiento con GPT‑OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. En Kimi, el modelo público más grande que probamos, alcanzó aproximadamente 1.5 veces el rendimiento máximo por vatio del sistema comparado y una latencia de extremo a extremo 3.4 veces menor. En nuestras pruebas internas, la ventaja de Jalapeño se amplió aún más con los modelos de vanguardia de OpenAI, lo que sugiere que la arquitectura adquiere más valor a medida que las cargas de trabajo crecen y se vuelven más exigentes.
Jalapeño se diseñó desde el inicio a partir de la siguiente pregunta: ¿qué hardware construiríamos si su función principal fuera ejecutar modelos de lenguaje modernos y futuros, especialmente para agentes interactivos? Las mejoras de Jalapeño provienen del diseño conjunto del chip, la memoria, la red, el software y el sistema a escala de rack en torno a cargas de trabajo reales de modelos de lenguaje. La inferencia de modelos de lenguaje pasa por varias fases distintas, cada una con diferentes cuellos de botella. El preprocesamiento, durante el cual el sistema procesa un prompt, requiere una gran capacidad de cómputo, mientras que la decodificación, durante la cual el sistema genera la respuesta token por token, está más limitada por el ancho de banda de la memoria. La comunicación también puede aumentar la latencia cuando los datos deben desplazarse entre núcleos y chips, lo que deja inactivas algunas unidades de procesamiento mientras esperan. Un sistema que sobresale en una fase puede perder esa ventaja mientras espera datos o transfiere el estado del modelo entre diferentes recursos.
Diseñamos Jalapeño para minimizar el movimiento de datos y los retrasos en la comunicación. Esto permite asignar explícitamente el estado del modelo —incluida la caché KV utilizada para generar una respuesta— y mantenerlo de forma local, mientras el sistema activa la combinación adecuada de cómputo, memoria y redes para cada fase de inferencia. La red es un componente esencial de la arquitectura. Su amplio dominio de interconexión permite mantener toda la carga de trabajo dentro de un único sistema conectado, lo que minimiza el movimiento de datos y ayuda a procesar cada solicitud con rapidez y eficiencia de principio a fin. El resultado es un acelerador equilibrado y versátil, capaz de adaptarse a la evolución de las arquitecturas de modelos, sobresalir tanto en el preprocesamiento como en la decodificación y ajustarse a los cambios en el equilibrio entre ambas fases, una característica fundamental de las cargas de trabajo agénticas.
La IA desempeñó un papel directo en el desarrollo de Jalapeño, lo que permitió al equipo pasar del diseño inicial al tape-out en nueve meses mediante la exploración de implementaciones, la reducción de los ciclos de diseño, medición y verificación, y pruebas e iteraciones continuas con cargas de trabajo de modelos. La IA también ayudó a optimizar los circuitos aritméticos del chip, lo que permitió al equipo incorporar una mayor capacidad de cómputo dentro del plazo previsto.
Jalapeño se diseñó como una plataforma de programación clara y predecible tanto para los humanos como para la IA. Los ingenieros pueden definir las tareas mediante tensores locales, comunicación explícita y sincronización predecible. Luego, la IA puede optimizar la forma en que esas tareas se asignan, se ubican, se programan y se coordinan en todo el sistema. Esta estructura clara y predecible ofrece a la IA una forma viable de abordar el tradicionalmente complejo problema de la programación paralela.
Cada nueva familia de modelos sigue requiriendo nuevos kernels y optimizaciones específicas para cada modelo. Con Codex y GPT‑Astra, el equipo logró que tres modelos de pesos abiertos que no formaban parte del plan original de producción de Jalapeño alcanzaran un alto rendimiento en dos meses. Esto demostró tanto la flexibilidad de la arquitectura como la velocidad con la que la IA puede ayudarnos a programarla. En determinados bloques de atención y de mezcla de expertos de GPT‑OSS, las implementaciones generadas por IA fueron entre 1.5 y 1.8 veces más rápidas que las implementaciones existentes escritas por especialistas humanos. Estas cifras se aplican a los bloques seleccionados, no al modelo completo, pero apuntan a un nuevo y potente ciclo de desarrollo.
El valor de la infraestructura de IA radica en el trabajo útil que permite realizar en el mundo real. Al obtener más trabajo útil con la misma energía y el mismo hardware, Jalapeño puede ayudarnos a atender una mayor demanda y reducir el costo de lograr resultados satisfactorios. Para OpenAI, esto puede mejorar el apalancamiento operativo, ya que permite que el trabajo útil y los ingresos crezcan más rápido que el costo de prestar el servicio. También puede favorecer una adopción más amplia y una inversión continua en mejores modelos, productos e infraestructura. Una inferencia más rápida puede acelerar la iteración y habilitar nuevos casos de uso.
Jalapeño amplía las posibilidades para una inferencia eficiente y de baja latencia:
- Inferencia en modo ultrarrápido con eficiencias antes disponibles solo en modo rápido
- Inferencia en modo rápido con eficiencias antes disponibles solo en modo por lotes
- Mayor eficiencia para la inferencia en modo por lotes
Planeamos comenzar a desplegar Jalapeño en la infraestructura de cómputo de OpenAI para finales de año. Es la primera generación de una hoja de ruta multigeneracional: la Gen 2 está en pleno desarrollo y la Gen 3 está tomando forma. Cada generación se basará en lo que aprendamos y seguirá mejorando tanto la eficiencia como la velocidad.
Para satisfacer la creciente demanda de IA, se requerirá más capacidad de cómputo de todas las fuentes disponibles. Seguiremos implementando a gran escala aceleradores de NVIDIA y otros socios para cargas de trabajo tanto de entrenamiento como de inferencia. Nuestra misión es asegurar que la inteligencia artificial general beneficie a toda la humanidad.
Mientras nos preparamos para el despliegue, seguimos validando Jalapeño para producción, perfeccionando el software, preparándonos para operarlo a gran escala y evaluando su rendimiento con más modelos. Los resultados hasta ahora muestran lo que es posible cuando diseñamos conjuntamente todo el sistema: una IA más ágil, capaz y agéntica, ofrecida de manera más eficiente a más personas.
FRONTERA DE RENDIMIENTO POR kW
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB200 1200 W
RENDIMIENTO MÁXIMO Y EQUIVALENTE
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB200 1200 W
Mayor rendimiento máximo de TPS mixtos por kW
≈1.9×
85 448 vs. 44 960 mixtos/kW
Menor latencia de extremo a extremo
≈1.7×
1.03 s vs. 1.80 s
Menor TBT mínimo
≈2.7×
0.69 vs. 1.87 ms (1459 vs. 535 tokens/s/usuario)
Mayor rendimiento en el TBT anterior
≈53.7×
22 935 vs. 427 mixtos/kW (a 535.28 tokens/s/usuario)
FRONTERA DE RENDIMIENTO POR kW
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W
RENDIMIENTO MÁXIMO Y EQUIVALENTE
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W
Mayor rendimiento máximo de TPS mixtos por kW
≈1.7×
19 641 vs. 11 781 mixtos/kW
Menor latencia de extremo a extremo
≈3.6×
1.65 s vs. 5.99 s
Menor TBT mínimo
≈4.1×
1.43 vs. 5.90 ms (700 vs. 169 tokens/s/usuario)
Mayor rendimiento en el TBT anterior
≈104.3×
12 258 vs. 118 mixtos/kW (a 169.41 tokens/s/usuario)
FRONTERA DE RENDIMIENTO POR kW
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W
RENDIMIENTO MÁXIMO Y EQUIVALENTE
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W
Mayor rendimiento máximo de TPS mixtos por kW
≈1.5×
18 195 vs. 11 862 mixtos/kW
Menor latencia de extremo a extremo
≈3.4×
1.56 s vs. 5.31 s
Menor TBT mínimo
≈3.8×
1.44 vs. 5.48 ms (694 vs. 182 tokens/s/usuario)
Mayor rendimiento en el TBT anterior
≈56.1×
6744 vs. 120 mixtos/kW (a 182.46 tokens/s/usuario)


