Cómo GPT‑5.6 combina inteligencia y eficiencia de vanguardia
Diseñamos la familia de modelos GPT‑5.6 para equilibrar la capacidad y el costo en todo el espectro de tareas para las que las personas usan nuestros modelos. Nuestro modelo insignia, GPT‑5.6 Sol, con razonamiento Max, supera a Claude Fable 5 en el Artificial Analysis Coding Agent Index por menos de la mitad del costo. Terra iguala el desempeño de GPT‑5.5 en evaluaciones de inteligencia a mitad de precio, y Luna es nuestro modelo más rápido y asequible, con un precio un 80 % menor que el de Sol. Para alcanzar esta eficiencia, nuestros equipos técnicos y de investigación realizaron optimizaciones importantes en cada capa principal de nuestra pila. Estas mejoras abarcan nuestros modelos, la inferencia (cómo ejecutamos los modelos para generar resultados) y nuestro arnés de ejecución para agentes, que utilizan tanto Codex como ChatGPT Work.
Durante los últimos cuatro años, a medida que ampliamos nuestros modelos para atender a 1 000 millones de usuarios activos y más de 2 millones de empresas, la eficiencia ha sido fundamental para llevar los beneficios de la inteligencia a todas las personas. Nuestra misión es garantizar que la inteligencia artificial general beneficie a toda la humanidad. A lo largo de estos años, hemos trabajado para lograr continuamente mayores optimizaciones en toda nuestra pila y ofrecer los modelos de mejor desempeño en cada punto de la curva de costo e inteligencia. Con GPT‑5.6 alcanzamos nuestra mayor eficiencia de inteligencia por token hasta la fecha; el modelo está entrenado para realizar más trabajo por token. Durante el entrenamiento, optimizamos tanto el éxito en las tareas como la eficiencia, para que el modelo siga una ruta más directa al completarlas.
Esta publicación va más allá de nuestros modelos para explicar cómo priorizamos la eficiencia mediante avances en otras dos partes principales de la pila: 1) la inferencia, donde optimizamos procesos como el balanceo de carga, la decodificación especulativa, la caché y los kernels para obtener más resultados con el mismo hardware; y 2) nuestro arnés de ejecución para agentes, con una mejor gestión de la saturación del contexto, el uso de herramientas y el trabajo repetido. También explicaremos cómo GPT‑5.6 Sol logró de forma autónoma varias de estas mejoras. Aunque cada mejora aislada pueda parecer limitada, en conjunto se acumulan y nos permiten alcanzar la vanguardia tanto de la inteligencia como de la eficiencia.
En un mundo con recursos de cómputo limitados, donde la demanda de modelos crece más rápido que la capacidad, la eficiencia es fundamental para el diseño de todos los sistemas. Esto es especialmente cierto en nuestra pila de inferencia, que ejecuta modelos entrenados para generar respuestas. Nuestro objetivo principal es procesar más tokens con el mismo hardware, sin sacrificar la inteligencia, la latencia, la disponibilidad ni la confiabilidad que esperan los usuarios.
Para lograrlo, debemos optimizar todo el sistema. Un modelo puede ser muy eficiente de forma aislada, pero aun así resultar costoso de ofrecer si las solicitudes se distribuyen mal, el hardware permanece inactivo o el movimiento de datos ralentiza el cómputo. Las mejoras de cada capa se acumulan, con beneficios derivados de optimizar el enrutamiento (adónde se envían las solicitudes), la programación (cuándo se envían), los kernels (software que se ejecuta en las GPU), la caché (trabajo guardado y reutilizado) y la implementación del modelo (el orden del código de la GPU). GPT‑5.6 Sol en Codex desempeñó un papel decisivo en todas estas optimizaciones.
El primer ejemplo importante es el balanceo de carga. A nivel global, enrutamos las solicitudes según factores como la ubicación geográfica, la capacidad disponible y el tipo de acelerador (la clase de GPU o chip especializado que ejecuta el modelo). Dentro de un clúster, distribuimos el trabajo entre instancias del modelo según la carga, la longitud del contexto, la disponibilidad de la caché y otras propiedades de la solicitud. En cada instancia, el trabajo debe dividirse eficientemente entre los aceleradores, las subredes del modelo y los núcleos de cómputo. GPT‑5.6 Sol en Codex nos ayuda a analizar el tráfico de producción, detectar fuentes de desequilibrio que antes pasaban inadvertidas, probar nuevas estrategias de enrutamiento y ajustar constantemente estas heurísticas. Estas mejoras en el balanceo de carga redujeron drásticamente, por sí solas, el costo de servir nuestros modelos.
También usamos GPT‑5.6 Sol para optimizar la pasada hacia adelante del modelo: el cómputo que transforma las entradas en predicciones del siguiente token. Incluso cuando las operaciones individuales son rápidas, el movimiento excesivo de memoria, la sincronización y las distribuciones ineficientes de datos pueden dejar inactivas las GPU. Para evitarlo, GPT‑5.6 Sol encontró trabajo que podía precalcularse, evitarse o paralelizarse. Con Codex, GPT‑5.6 Sol reescribió y optimizó de forma autónoma nuestros kernels de producción, el código central que ejecuta las operaciones matemáticas que componen el modelo. Esto funcionó en parte porque entrenamos a GPT‑5.6 para escribir y mejorar kernels eficazmente en Triton(se abre en una nueva ventana) y Gluon(se abre en una nueva ventana), dos lenguajes de programación de código abierto para GPU mantenidos por OpenAI. Estos esfuerzos, junto con avances más amplios en kernels logrados por GPT‑5.6 Sol, redujeron en un 20 % los costos integrales de servicio. También invertimos considerablemente en herramientas de verificación, como la herramienta de código abierto FpSan(se abre en una nueva ventana) (sanitizador de punto flotante), para ayudar a validar que los kernels escritos por GPT‑5.6 Sol sean correctos.
La decodificación especulativa es otro recurso para mejorar la velocidad y la eficiencia. La técnica consiste en ejecutar un modelo preliminar más pequeño (o “especulador”) junto con el modelo principal para proponer varios tokens que este último verifica en paralelo. Cuando se aceptan esas propuestas, el sistema puede generar varios tokens de salida con una sola pasada del modelo principal, lo que reduce el costoso cómputo secuencial. GPT‑5.6 Sol mejoró su propio modelo preliminar al diseñar y ejecutar cientos de experimentos sobre su arquitectura y probar cambios de tamaño, estructura y características. Además, GPT‑5.6 Sol inició y supervisó el proceso de entrenamiento del especulador e intervino de forma autónoma cuando surgieron problemas, incluidas fallas de hardware e inestabilidad del entrenamiento. Las mejoras resultantes aumentaron en más de un 15 % la eficiencia de generación de tokens.
Al procesar tokens de entrada que no están en caché, el modelo crea la caché de clave-valor (KV) en una sola pasada de cómputo intensivo; al generar la salida, lee y amplía repetidamente esa caché. La configuración óptima de servicio, como el procesamiento por lotes, la fragmentación y la administración de KV, depende en gran medida de la carga de trabajo: la longitud del prompt y la salida, el tamaño del lote, la tasa de aciertos de caché, las características de las consultas y más. Sin embargo, el espacio de configuración era demasiado amplio para ajustarlo sistemáticamente, lo que obligaba a los ingenieros a depender de heurísticas generales. Con GPT‑5.6 Sol en Codex, pudimos analizar cargas de trabajo de producción, generar y evaluar configuraciones candidatas y optimizar al máximo la configuración del motor y el modelo para cada situación. Esto vuelve viable un nuevo nivel de optimización específica para cada carga de trabajo y permite obtener más inferencia útil con el mismo hardware.
La optimización de la inferencia es un ciclo continuo de retroalimentación. Medimos el comportamiento en producción, identificamos las mayores deficiencias, implementamos cambios y verificamos que mejoren todo el sistema, no solo una prueba de rendimiento aislada. GPT‑5.6 Sol y Codex aceleran cada parte de ese ciclo. Esto permite que nuestro equipo explore más ideas, responda con mayor rapidez a los cambios en las cargas de trabajo y cree una pila de inferencia con menor latencia, más capacidad y menores costos para los usuarios.
ChatGPT Work y Codex completan tareas complejas mediante una serie de solicitudes al modelo y llamadas a herramientas. En un solo turno —desde la solicitud del usuario hasta la respuesta final—, Codex puede inspeccionar código fuente, buscar en el historial de implementaciones, leer informes de incidentes, editar un archivo y ejecutar pruebas. Cada paso puede requerir una solicitud.
Preparar el contexto, transmitir datos, ejecutar la inferencia, llamar a herramientas e iniciar procesos requieren tiempo y capacidad de cómputo. Si una tarea requiere 30 solicitudes al modelo, un segundo adicional por solicitud se acumula. Mejorar el rendimiento general implica reducir el trabajo repetido en todo el sistema, no solo acelerar el modelo.
Un turno del usuario puede incluir muchas iteraciones del modelo y las herramientas. Cualquier costo dentro de la región repetida puede pagarse muchas veces.
Estos factores multiplicadores orientaron el diseño de nuestro arnés de ejecución para agentes, una capa de orquestación en Rust que conecta nuestros modelos y herramientas con el entorno del usuario. A continuación, explicaremos cómo evitar la saturación del contexto, cargar herramientas y reutilizar trabajo vuelve más eficiente cada solicitud.
A medida que los agentes obtienen acceso a más herramientas, habilidades, complementos e historial de conversación, las ventanas de contexto pueden crecer con facilidad. Esto aumenta el costo, distrae al modelo y provoca razonamiento innecesario. El arnés de ejecución puede reducir esta sobrecarga mediante el descubrimiento diferido, que permite que las integraciones, las herramientas MCP personalizadas, las habilidades y los complementos solo aparezcan cuando se necesiten. El arnés de ejecución también evita que herramientas individuales e integraciones de MCP consuman inesperadamente la ventana de contexto. La salida de las herramientas tiene un límite predeterminado de 10 000 tokens, salvo que el modelo solicite otro límite.
Como mencionamos antes, un ciclo de agente puede enviar las mismas instrucciones, el historial de conversación, las definiciones de herramientas y los resultados anteriores a las GPU varias veces durante un solo turno. Procesar estas entradas repetidas es costoso, por lo que la caché de prompts reutiliza el cómputo asociado con el prefijo de un prompt procesado anteriormente. Para conservar ese prefijo, el arnés de ejecución trata todo el historial visible para el modelo como datos que solo admiten adiciones: los mensajes nuevos, los resultados de herramientas y las actualizaciones del entorno se agregan al final, en lugar de insertarse en el contexto anterior. Las herramientas también se presentan en un orden determinista, mientras que los ajustes del entorno de ejecución, como las políticas de aprobación, se aplican durante la ejecución en vez de integrarse en las definiciones de las herramientas. Esta decisión de diseño contribuye a las altas tasas generales de aciertos en la caché de prompts de Codex y ChatGPT Work.
El transporte incremental cambia lo que cruza la red; el almacenamiento en caché del prompt cambia lo que el modelo puede evitar recalcular. Los anchos son conceptuales y no se muestra la capa de compresión adicional.
Las mejoras de eficiencia que logramos con GPT‑5.6 son el resultado de años de avances acumulativos en toda la pila, desde la investigación y la inferencia hasta nuestro arnés de ejecución para agentes. El papel de GPT‑5.6 en muchos de estos avances nos hace ser optimistas sobre la aceleración del ritmo de las optimizaciones. Seguiremos ampliando las optimizaciones en áreas como los kernels, junto con mejoras fundamentales en nuestra pila. Esperamos trasladar estas mejoras continuas y poco visibles a nuestros usuarios y clientes mediante una inteligencia más accesible y rentable.
Agradecemos especialmente a Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson y Steve Coffey, miembros del personal técnico, por sus aportes a esta publicación.


