Ir al contenido principal
OpenAI

25 de agosto de 2026

IngenieríaEmpresa

Los primeros resultados de Jalapeño muestran una velocidad y eficiencia líderes en inferencia de IA.

Cargando…
Primer plano del chip de inferencia Jalapeño montado en una placa de circuito impreso verde azulado.

Desde que anunciamos Jalapeño, el primer chip de inferencia diseñado a medida de OpenAI, hemos estado probando el chip y el sistema creado a su alrededor. Los resultados muestran una mejora significativa del rendimiento: Jalapeño puede procesar más trabajo de IA por unidad de potencia, y devuelve respuestas con mayor rapidez. Jalapeño ofrece un mayor rendimiento y una menor latencia con una sola arquitectura, mientras que los sistemas de hardware existentes a menudo tienen que hacer un compromiso entre ambos.

Para los clientes, eso puede traducirse en respuestas más rápidas, agentes con mayor capacidad de respuesta y un acceso más fiable a medida que crece la demanda. Nuestra misión es garantizar que la inteligencia artificial general beneficie a toda la humanidad. Estas mejoras ayudarán a que una IA cada vez más capaz sea más asequible y esté disponible de forma más generalizada.

Los modelos de OpenAI también aceleraron el desarrollo de Jalapeño. Las generaciones anteriores ayudaron al equipo a diseñar y poner en marcha el chip, mientras que nuestros modelos más recientes están acelerando la forma en que lo optimizamos y programamos. El rendimiento de Jalapeño se extiende a GPT‑OSS 120B, DeepSeek R1 y Kimi K2.5 1T, lo que demuestra que la arquitectura funciona en modelos desarrollados tanto dentro como fuera de OpenAI. En los tres casos, Jalapeño ofreció entre 1,5 y 1,9 veces más trabajo de IA por vatio con el máximo rendimiento y una latencia de extremo a extremo entre 1,7 y 3,6 veces menor que los sistemas de comparación. Para cargas de trabajo muy interactivas, ofreció un rendimiento entre 2,1 y 4,1 veces mayor.

Jalapeño también demuestra una ventaja más amplia de una plataforma tecnológica integral. OpenAI puede diseñar conjuntamente modelos, productos, software de implementación, chips, memoria, redes y sistemas, utilizando lo que aprendemos de cargas de trabajo reales para mejorar cada capa de la plataforma. Jalapeño es silicio propio con resultados medidos y marca el inicio de una plataforma de varias generaciones. En los próximos meses, ampliaremos el uso de Jalapeño para ofrecer a nuestros clientes productos más rápidos, capaces y eficientes.

Cómo medimos el rendimiento de Jalapeño

Evaluamos el rendimiento con una experiencia de usuario equivalente y medimos cuánto trabajo útil de IA puede realizar cada sistema por unidad de energía, sin superar la latencia que necesitan los clientes y los agentes interactivos. Esto es especialmente importante para los agentes, que necesitan completar muchos pasos en secuencia, por lo que las demoras pueden acumularse a lo largo de toda una tarea.

Para entender cómo funciona Jalapeño en la práctica, lo probamos en InferenceX, una evaluación comparativa pública de SemiAnalysis que mide el proceso completo de atender una solicitud de IA. Comparamos Jalapeño con los principales sistemas de IA disponibles comercialmente en todo el rango operativo probado, desde el servicio de alto rendimiento hasta el uso muy interactivo y de baja latencia. Jalapeño ofreció una mejor combinación de rendimiento, eficiencia energética y latencia. Aunque a veces se informa del rendimiento por chip, creemos que la métrica más útil es el rendimiento por unidad de potencia.

Jalapeño amplía la ventaja frente al mejor TBT anterior

Jalapeño ofrece más tokens por usuario

Jalapeño ofrece más rendimiento por kilovatio

En los tres modelos públicos, Jalapeño ofreció una mejor combinación de rendimiento por vatio y latencia en todo el rango de operación probado, lo que lo sitúa como una solución de vanguardia. Para comparar los sistemas de forma coherente, normalizamos los resultados utilizando la potencia nominal del chip publicada de cada acelerador. Jalapeño tiene una potencia nominal de 700 vatios, aunque su potencia sostenida medida se mantuvo en 550 vatios o menos en las cargas de trabajo evaluadas.

Jalapeño mostró un gran rendimiento con GPT‑OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. En Kimi, el modelo público más grande que probamos, ofreció aproximadamente un rendimiento máximo por vatio 1,5 veces superior y una latencia integral 3,4 veces menor que el sistema de comparación. En nuestras pruebas internas, la ventaja de Jalapeño se amplió aún más en los modelos de OpenAI de vanguardia, lo que sugiere que la arquitectura adquiere más valor a medida que las cargas de trabajo aumentan de tamaño y exigencia.

Diseñar para la velocidad y la eficiencia dentro de un único chip

Jalapeño se diseñó desde el principio partiendo de una pregunta: ¿qué hardware construiríamos si su función principal fuera dar servicio a modelos de lenguaje modernos y futuros, especialmente agentes interactivos? Las mejoras de Jalapeño son fruto de diseñar conjuntamente el chip, la memoria, la red, el software y el sistema a escala de rack en función de las cargas de trabajo reales de los modelos de lenguaje. La inferencia de modelos de lenguaje pasa por varias fases distintas con diferentes cuellos de botella. El prefill, cuando el sistema procesa un prompt, requiere mucha capacidad de cálculo, mientras que la decodificación, cuando el sistema genera la respuesta token a token, está más limitada por el ancho de banda de memoria. La comunicación también puede añadir latencia cuando los datos deben moverse entre núcleos y chips, lo que deja algunas unidades de procesamiento inactivas mientras esperan. Un sistema que destaca en una fase puede perder esa ventaja mientras espera datos o mueve el estado del modelo entre distintos recursos.

Diseñamos Jalapeño para minimizar el movimiento de datos y las demoras en la comunicación. Esto significa que el estado del modelo, incluida la caché KV utilizada al generar una respuesta, puede colocarse explícitamente y mantenerse local mientras el sistema activa la combinación adecuada de computación, memoria y redes para cada fase de inferencia. La red es parte integral de la arquitectura. Su amplio dominio permite que toda la carga de trabajo permanezca dentro de un único sistema conectado, lo que minimiza el movimiento de datos y ayuda a que la solicitud completa siga siendo rápida y eficiente de principio a fin. El resultado es un acelerador equilibrado y fungible que puede admitir arquitecturas de modelos cambiantes, ofrecer un excelente rendimiento tanto en el procesamiento inicial como en la decodificación y adaptarse a medida que cambia el equilibrio entre ambos, una característica distintiva de las cargas de trabajo de la IA con agentes.

Usamos IA para diseñar el chip, y diseñamos el chip para que la IA pudiera programarlo

La IA desempeñó un papel directo en el desarrollo de Jalapeño y permitió al equipo pasar del diseño inicial a la fabricación del primer prototipo en nueve meses al explorar distintas implementaciones, acortar los ciclos de diseño, medición y verificación, y realizar iteraciones continuas con las cargas de trabajo de los modelos. La IA también ayudó a optimizar los circuitos aritméticos del chip, lo que permitió al equipo incorporar más rendimiento de cálculo en el chip dentro del plazo previsto.

Jalapeño se diseñó como un objetivo de programación claro y predecible tanto para humanos como para IA. Los ingenieros pueden describir el trabajo mediante tensores locales, comunicación explícita y sincronización predecible. La IA puede optimizar cómo se asigna, distribuye, programa y coordina ese trabajo en todo el sistema. Esa estructura clara y predecible proporciona a la IA una forma manejable de abordar el problema tradicionalmente difícil de la programación paralela.

Admitir cada nueva familia de modelos sigue requiriendo nuevos kernels y optimizaciones específicas para cada modelo. Con Codex y GPT‑Astra, el equipo logró que tres modelos de pesos abiertos que no formaban parte del plan de producción original de Jalapeño alcanzaran un alto rendimiento en dos meses. Esto demostró tanto la flexibilidad de la arquitectura como la rapidez con la que la IA puede ayudarnos a programarla. En determinados bloques de atención y mezcla de expertos de GPT‑OSS, las implementaciones generadas por IA se ejecutaron entre 1,5 y 1,8 veces más rápido que las implementaciones existentes escritas por expertos humanos. Estas cifras se aplican a los bloques seleccionados, no al modelo completo, pero apuntan a un potente nuevo ciclo de desarrollo.

El camino hacia una inferencia eficiente y ultra-rápida

La infraestructura de IA es valiosa por el trabajo útil en el mundo real que permite realizar. Al producir más trabajo útil con la misma energía y el mismo hardware, Jalapeño puede ayudarnos a atender una mayor demanda y reducir el costo de obtener un resultado satisfactorio. Para OpenAI, esto puede mejorar el apalancamiento operativo, al permitir que el trabajo útil y los ingresos crezcan más rápido que el coste de prestar servicio. También puede favorecer una adopción más amplia y mantener la inversión en mejores modelos, productos e infraestructura. Una inferencia más rápida permite una iteración más rápida y nuevos casos de uso.

Jalapeño amplía las posibilidades de una inferencia eficiente y de baja latencia:

  • Inferencia en modo ultrarrápido con eficiencias que antes solo estaban disponibles en modo rápido
  • Inferencia en modo rápido con eficiencias antes disponibles solo en modo por lotes
  • Alta eficiencia para la inferencia en modo por lotes

Tenemos previsto empezar a implementar Jalapeño en la infraestructura de computación de OpenAI a finales de año. Es la primera generación de una hoja de ruta multigeneracional: la Gen 2 está en pleno desarrollo y la Gen 3 está tomando forma. Cada generación se basará en lo que aprendamos y seguirá mejorando tanto la eficiencia como la velocidad.

Satisfacer la creciente demanda de IA requerirá más capacidad de computación procedente de todas las fuentes disponibles. Seguiremos desplegando de forma generalizada aceleradores de NVIDIA y otros socios para cargas de trabajo tanto de entrenamiento como de inferencia. Nuestra misión es garantizar que la inteligencia artificial general beneficie a toda la humanidad.

De cara a la implementación, continuamos con la cualificación para producción, el perfeccionamiento del software, la preparación de Jalapeño para funcionar a escala y la validación de su rendimiento en más modelos. Los resultados hasta ahora muestran lo que es posible cuando diseñamos conjuntamente todo el sistema: una IA con agentes más ágil y capaz, que llega a más personas de forma más eficiente.

Anexo

Jalapeño está de vanguardia en la frontera de Pareto con GPT‑OSS 120B

RENDIMIENTO por kW DE VANGUARDIA

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB200 1200 W

Jalapeño lidera en todos los puntos operativos de GPT‑OSS

RENDIMIENTO MÁXIMO Y EQUIVALENTE

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB200 1200 W

Mayor pico de TPS combinados/kW

≈1,9×

85 448 frente a 44 960 mixto/kW

Menor latencia de extremo a extremo

≈1,7×

1,03 s frente a 1,80 s

TBT mínimo más bajo

≈2,7×

0,69 frente a 1,87 ms (1459 frente a 535 tokens/s/usuario)

Más rendimiento en el TBT anterior

≈53,7×

22 935 frente a 427 mixto/kW (a 535,28 tok/s/user)

Jalapeño es de vanguardia de DeepSeek R1 670B

RENDIMIENTO POR kW DE VANGUARDIA

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Jalapeño lidera en todos los puntos de operación de DeepSeek R1

RENDIMIENTO MÁXIMO Y EQUIVALENTE

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Mayor pico de TPS combinados/kW

≈1,7×

19 641 frente a 11 781 mixtos/kW

Menor latencia de extremo a extremo

≈3,6×

1,65 s frente a 5,99 s

TBT mínimo más bajo

≈4.1×

1,43 frente a 5,90 ms (700 frente a 169 tokens por segundo y usuario)

Más rendimiento en el TBT anterior

≈104,3×

12 258 frente a 118 mixed/kW (a 169 41 tok/s/user)

Jalapeño es de vanguardia en Kimi K2.5 1T

RENDIMIENTO POR kW DE VANGUARDIA

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1 400 W

Jalapeño lidera en todos los puntos de funcionamiento de Kimi K2.5

RENDIMIENTO MÁXIMO Y EQUIVALENTE

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquete: Jalapeño 700 W; GB300 1400 W

Mayor pico de TPS combinados/kW

≈1,5×

18 195 frente a 11 862 mixto/kW

Menor latencia de extremo a extremo

≈3,4×

1,56 s frente a 5,31 s

TBT mínimo más bajo

≈3,8×

1,44 frente a 5,48 ms (694 frente a 182 tok/s/user)

Más rendimiento en el TBT anterior

≈56,1×

6744 frente a 120 mixto/kW (a 182 46 tok/s/user)

Autor

OpenAI