Ir al contenido principal
OpenAI

29 de julio de 2026

IngenieríaEmpresa

Cómo GPT‑5.6 une inteligencia y eficiencia de vanguardia

Cargando…

Diseñamos la familia de modelos GPT‑5.6 para equilibrar la capacidad y el coste en todo el espectro de tareas para las que se utilizan nuestros modelos. Nuestro modelo insignia, GPT‑5.6 Sol, con razonamiento Max, supera a Claude Fable 5 en el Artificial Analysis Coding Agent Index por menos de la mitad del coste. Terra iguala el rendimiento de GPT‑5.5 en las pruebas de inteligencia por la mitad de precio, y Luna es nuestro modelo más rápido y asequible, con un precio un 80 % inferior al de Sol. Para lograr esta eficiencia, nuestros equipos técnicos y de investigación han realizado importantes optimizaciones en cada una de las principales capas de nuestra pila. Estas mejoras abarcan nuestros modelos, la inferencia (cómo ejecutamos los modelos para generar resultados) y nuestro arnés para agentes, que utilizan tanto Codex como ChatGPT Work.

A medida que nuestros modelos han alcanzado los 1000 millones de usuarios activos y más de 2 millones de empresas durante los últimos cuatro años, la eficiencia ha sido fundamental para extender a todos los beneficios de la inteligencia. Nuestra misión es garantizar que la inteligencia artificial general beneficie a toda la humanidad. Durante estos años, hemos trabajado para impulsar continuamente nuevas optimizaciones en toda nuestra pila y ofrecer los modelos con mejor rendimiento en cada punto de la curva de coste e inteligencia. Con GPT‑5.6 hemos logrado nuestra mayor eficiencia de inteligencia por token hasta la fecha, ya que está entrenado para realizar más trabajo por token. Durante el entrenamiento, optimizamos tanto la ejecución satisfactoria de las tareas como la eficiencia, orientando al modelo para que siga una vía más directa al realizarlas.

Este artículo va más allá de nuestros modelos y explica cómo incorporamos la eficiencia mediante avances en otras dos partes principales de la pila: 1) la inferencia, donde optimizamos procesos como el equilibrio de carga, la decodificación especulativa, el almacenamiento en caché y los kernels para obtener más resultados con el mismo hardware; y 2) nuestro arnés para agentes, con una mejor gestión del crecimiento excesivo del contexto, el uso de herramientas y el trabajo repetido. También explicaremos el papel de GPT‑5.6 Sol a la hora de conseguir de forma autónoma varias de estas mejoras. Aunque una mejora aislada pueda parecer limitada, estos avances se acumulan y nos permiten situarnos a la vanguardia tanto de la inteligencia como de la eficiencia.

Diagrama de la eficiencia de GPT-5.6 en el arnés de agentes, la orquestación de la API y la inferencia del modelo, con menos datos de red, menos trabajo de CPU y más producción de las GPU.

Acelerar la inferencia con GPT‑5.6 Sol

En un mundo con recursos de cálculo limitados, donde la demanda de modelos crece más rápido que la capacidad, la eficiencia es esencial para diseñar cualquier sistema. Esto es especialmente cierto en nuestra pila de inferencia, que ejecuta modelos entrenados para generar respuestas. Nuestro principal objetivo es servir más tokens con el mismo hardware, sin renunciar a la inteligencia, la latencia, la disponibilidad y la fiabilidad que esperan los usuarios.

Para lograrlo, es necesario optimizar todo el sistema. Un modelo puede ser muy eficiente de forma aislada y, aun así, resultar caro de servir si las solicitudes se distribuyen mal, el hardware permanece inactivo o el movimiento de datos ralentiza el cálculo. Las mejoras de cada capa se acumulan gracias a optimizaciones del enrutamiento (adónde se envían las solicitudes), la planificación (cuándo se envían), los kernels (el software que se ejecuta en las GPU), el almacenamiento en caché (trabajo guardado y reutilizado) y la implementación del modelo (el orden del código de las GPU). GPT‑5.6 Sol en Codex desempeñó un papel decisivo en todas estas optimizaciones.

El primer ejemplo importante es el equilibrio de carga. A escala mundial, enrutamos las solicitudes según factores como la ubicación geográfica, la capacidad disponible y el tipo de acelerador (la GPU o el chip especializado que ejecuta el modelo). Dentro de un clúster, distribuimos el trabajo entre las instancias del modelo en función de la carga, la longitud del contexto, la disponibilidad de caché y otras propiedades de la solicitud. Después, dentro de cada instancia, el trabajo debe dividirse de forma eficiente entre los aceleradores, las subredes del modelo y los núcleos de cálculo. GPT‑5.6 Sol en Codex nos ayuda a analizar el tráfico de producción, identificar causas de desequilibrio que antes pasaban inadvertidas, probar nuevas estrategias de enrutamiento y ajustar continuamente estas heurísticas. Estas mejoras del equilibrio de carga redujeron por sí solas y de forma drástica el coste de servir nuestros modelos.

También utilizamos GPT‑5.6 Sol para optimizar la pasada hacia delante del modelo: el cálculo que transforma las entradas en predicciones del siguiente token. Incluso cuando las operaciones individuales son rápidas, el exceso de movimientos de memoria, la sincronización y una disposición ineficiente de los datos pueden dejar las GPU inactivas. Para evitarlo, GPT‑5.6 Sol identificó trabajo que podía calcularse por adelantado, evitarse o paralelizarse. Con Codex, GPT‑5.6 Sol reescribió y optimizó de forma autónoma nuestros kernels de producción, el código central que ejecuta las operaciones matemáticas que componen el modelo. Esto funcionó en parte porque hemos entrenado GPT‑5.6 para escribir y mejorar eficazmente kernels en Triton(se abre en una ventana nueva) y Gluon(se abre en una ventana nueva), dos lenguajes de programación de GPU de código abierto mantenidos por OpenAI. Estas iniciativas, junto con otros avances en kernels logrados por GPT‑5.6 Sol, redujeron un 20 % los costes integrales de servicio. También hemos invertido mucho en herramientas de verificación, como la herramienta de código abierto FpSan(se abre en una ventana nueva) (Floating-Point Sanitizer), para ayudar a validar que los kernels escritos por GPT‑5.6 Sol sean correctos.

La decodificación especulativa es otra vía para mejorar la velocidad y la eficiencia. La técnica consiste en ejecutar un modelo preliminar más pequeño (o «especulador») junto al modelo principal para proponer varios tokens que este pueda verificar en paralelo. Cuando se aceptan esas propuestas, el sistema puede producir varios tokens de salida en una sola pasada del modelo principal, lo que reduce el costoso cálculo secuencial. GPT‑5.6 Sol mejoró su propio modelo preliminar diseñando y ejecutando cientos de experimentos sobre su arquitectura para probar cambios de tamaño, estructura y características. Además, GPT‑5.6 Sol inició y supervisó el proceso de entrenamiento del especulador e intervino de forma autónoma cuando surgieron problemas, como fallos de hardware e inestabilidad del entrenamiento. Las mejoras resultantes aumentaron en más de un 15 % la eficiencia de generación de tokens.

Al procesar tokens de entrada que no están en caché, el modelo crea la caché de claves y valores (KV) en una sola pasada de cálculo intensivo; al generar la salida, lee y amplía esa caché repetidamente. La configuración óptima de servicio —como el procesamiento por lotes, la fragmentación y la gestión de KV— depende mucho de la carga de trabajo: la longitud del prompt y la salida, el tamaño del lote, la tasa de aciertos de la caché, las características de las consultas y otros factores. Sin embargo, antes el espacio de configuraciones era demasiado amplio para ajustarlo de forma sistemática, lo que obligaba a los ingenieros a recurrir a heurísticas generales. Con GPT‑5.6 Sol en Codex, pudimos analizar las cargas de trabajo de producción, generar y evaluar configuraciones candidatas e hiperoptimizar la configuración del motor y el modelo para cada escenario. Esto permite aplicar un nuevo grado de optimización específica para cada carga de trabajo y obtener más inferencia útil con el mismo hardware.

La optimización de la inferencia es un ciclo continuo de retroalimentación. Medimos el comportamiento en producción, identificamos las principales carencias, aplicamos cambios y verificamos que mejoren todo el sistema, no solo una prueba de rendimiento aislada. GPT‑5.6 Sol y Codex aceleran cada parte de ese ciclo. Esto permite a nuestro equipo explorar más ideas, responder con mayor rapidez a los cambios en las cargas de trabajo y crear una pila de inferencia con menor latencia, más capacidad y menores costes para los usuarios.

Cómo agiliza nuestro arnés para agentes el trabajo repetitivo

ChatGPT Work y Codex completan tareas complejas mediante una serie de solicitudes al modelo y llamadas a herramientas. En un único turno —desde la solicitud del usuario hasta la respuesta final—, Codex puede inspeccionar código fuente, consultar el historial de despliegues, leer informes de incidentes, editar un archivo y ejecutar pruebas. Cada paso puede requerir una solicitud.

Preparar el contexto, transmitir datos, ejecutar la inferencia, llamar a herramientas e iniciar procesos requiere tiempo y capacidad de cálculo. Si una tarea requiere 30 solicitudes al modelo, un segundo adicional por solicitud acaba pesando. Mejorar el rendimiento general exige reducir el trabajo repetido en todo el sistema, no solo acelerar el modelo.

Una tarea del usuario llega al modelo, que puede llamar a una herramienta, recibir un resultado y tomar otra decisión repetidamente antes de completar la tarea.

Un turno del usuario puede incluir muchas iteraciones del modelo y las herramientas. Cualquier coste dentro de la región repetida puede pagarse muchas veces.

Estos efectos multiplicadores han orientado el diseño de nuestro arnés para agentes, una capa de orquestación en Rust que conecta nuestros modelos y herramientas con el entorno del usuario. A continuación, explicaremos cómo evitar que el contexto crezca en exceso, cargar herramientas y reutilizar el trabajo permite aumentar la eficiencia de cada solicitud.

Evitar que el contexto crezca en exceso

A medida que los agentes obtienen acceso a más herramientas, capacidades, complementos e historial de conversación, las ventanas de contexto pueden crecer con facilidad. Esto aumenta el coste, distrae al modelo y provoca razonamientos innecesarios. El arnés puede reducir esta sobrecarga mediante la detección diferida, que hace que las integraciones, las herramientas MCP personalizadas, las capacidades y los complementos solo aparezcan cuando se necesitan. El arnés también evita que herramientas concretas e integraciones MCP consuman de forma inesperada la ventana de contexto. La salida de las herramientas está limitada de forma predeterminada a 10 000 tokens, salvo que el modelo solicite un límite distinto.

Conservar prefijos exactos para almacenar prompts en caché

Como ya hemos indicado, un bucle de agente puede enviar varias veces a las GPU las mismas instrucciones, el historial de conversación, las definiciones de herramientas y los resultados anteriores durante un único turno. Procesar estas entradas repetidas resulta costoso, por lo que el almacenamiento de prompts en caché reutiliza el cálculo asociado a un prefijo de prompt procesado anteriormente. Para conservar ese prefijo, el arnés trata todo el historial visible para el modelo como un registro al que solo se puede añadir contenido: los mensajes nuevos, los resultados de herramientas y las actualizaciones del entorno se agregan al final, en lugar de insertarse en un contexto anterior. Las herramientas también se presentan en un orden determinista, mientras que los ajustes de ejecución, como las políticas de aprobación, se aplican durante la ejecución en vez de integrarse en las definiciones de las herramientas. Esta decisión de diseño contribuye a las elevadas tasas generales de aciertos de la caché de prompts de Codex y ChatGPT Work.

Tres solicitudes comparan los bytes enviados mediante una conexión persistente con el contexto creciente que ve el modelo y el prefijo que puede reutilizarse desde la caché.

El transporte incremental cambia lo que cruza la red; el almacenamiento en caché de prompts cambia lo que el modelo puede evitar recalcular. Los anchos son conceptuales y no se muestra la capa de compresión adicional.

Eficiencia en toda la curva de inteligencia

Las mejoras de eficiencia que hemos logrado con GPT‑5.6 son fruto de años de avances acumulativos en toda la pila, desde la investigación y la inferencia hasta nuestro arnés para agentes. El papel de GPT‑5.6 a la hora de lograr muchas de estas mejoras nos hace ser optimistas sobre la aceleración del ritmo de las optimizaciones. Seguiremos ampliando las optimizaciones en ámbitos como los kernels, además de introducir mejoras fundamentales en nuestra pila. Esperamos trasladar estas mejoras continuas entre bastidores a nuestros usuarios y clientes mediante una inteligencia más accesible y rentable.

Un agradecimiento especial a Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson y Steve Coffey, miembros del personal técnico, por sus contribuciones a este artículo.

Autor

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson y Steve Coffey