Guía para crear con GPT‑5.6
Lecciones técnicas de startups en producción
La familia de modelos GPT‑5.6 hace que el rendimiento de agentes de vanguardia sea mucho más asequible, a la vez que amplía los límites de lo posible.
En esta guía mostramos cómo las startups usan una selección de modelos más inteligente y nuevos controles de API que favorecen la continuidad del razonamiento, la orquestación multiagente y las llamadas programáticas a herramientas para crear agentes más rápidos y capaces por una fracción del costo.
Desde GPT‑5, cada generación de modelos ha buscado abordar tareas de mayor duración con menos tokens. GPT‑5.6 mantiene esa trayectoria: ofrece un mejor rendimiento de los agentes y menores costos, con cambios mínimos en el arnés de ejecución subyacente.
Las mejoras generales en eficiencia de costos se potencian con una mayor precisión a niveles más bajos de esfuerzo de razonamiento. Por ejemplo, en Agents’ Last Exam, GPT‑5.6 Sol con razonamiento “bajo” superó a GPT‑5.5 con razonamiento “alto” cuando se mantuvo constante el arnés de ejecución. Hemos visto resultados similares en pruebas de producción, donde las startups informan mejoras significativas de costos en diversos flujos de trabajo al reducir el esfuerzo de razonamiento respecto de los valores predeterminados anteriores.
Históricamente, pasar a un modelo insignia con el nivel de razonamiento más alto disponible ha sido la mejor opción para casos de uso de larga duración. Esto se debía en gran medida a que estos modelos eran mucho más capaces que los optimizados para costos al gestionar contextos más largos y llamadas a herramientas. Esto cambió con la familia 5.6: con más cómputo en tiempo de prueba, Luna y Terra a menudo pueden rendir de forma similar a GPT‑5.4 y 5.5, pero a un costo mucho menor.
Consideremos las tareas de BrowseComp, un benchmark basado en búsquedas que evalúa la capacidad de un modelo para encontrar datos poco conocidos. Hace tres meses, GPT‑5.5 (Muy alta) obtuvo un 84,36 % en este benchmark, con un costo total de USD 33,27. En su lanzamiento, GPT‑5.6 Luna (Muy alta) ofrece prácticamente el mismo rendimiento: obtiene un 84,04 % con un costo de USD 1,33. Desde entonces, redujimos aún más los precios. Obtén más información sobre nuestras últimas reducciones de precios.
Los modelos más pequeños de la familia 5.6 son ideales para cargas de trabajo de gran volumen, interacciones sensibles a la latencia y pasos repetitivos dentro de flujos de trabajo de agentes. Por ejemplo, si diriges una startup de tecnología jurídica que procesa notas manuscritas antes de que un agente las analice, ahora puedes usar Terra o Luna para la extracción, en lugar de emplear un modelo de vanguardia para todo el caso de uso, y así lograr ahorros considerables.
Además de mejorar el rendimiento inmediato de GPT‑5.6, incorporamos nuevos componentes básicos a la API Responses para conseguir mejoras adicionales. Entrenamos GPT‑5.6 de extremo a extremo con tres intervenciones arquitectónicas complementarias que permiten que los agentes operen con mayor eficiencia:
- Reutilizar el trabajo ya realizado: al permitir que el razonamiento se conserve(se abre en una nueva ventana) entre turnos del modelo y usar la compactación nativa(se abre en una nueva ventana) para comprimir conversaciones prolongadas, el modelo puede mantener la coherencia de su trabajo durante tareas más largas sin confundirse ni tener que reconstruir el contexto anterior.
- Descomponer en paralelo cuando corresponda: usar la orquestación multiagente nativa(se abre en una nueva ventana) permite coordinar varios agentes en líneas de trabajo paralelas para terminar tareas complejas más rápido.
- Trasladar el trabajo determinista al código: usar llamadas programáticas a herramientas(se abre en una nueva ventana) para filtrar, agregar y orquestar los resultados de las herramientas fuera de la ventana de contexto del modelo permite reservar los tokens del modelo para tareas de criterio y reducir el costo, la latencia y el deterioro del contexto.
Al usarlas en conjunto, la diferencia puede ser enorme. Por ejemplo, en ARC-AGI-3, GPT‑5.6 Sol obtuvo un 13,3 % con el arnés de ejecución estándar. Sin embargo, tras habilitar el razonamiento conservado y la compactación, la puntuación aumentó al 38,3 %, usando aproximadamente 6 veces menos tokens de salida. Sin cambios en el modelo, pero con casi el triple de rendimiento. Puedes consultar más información en nuestra investigación del arnés de ejecución de ARC-AGI-3.
Los flujos de trabajo de agentes suelen incluir dos tipos de trabajo:
- Tareas que requieren criterio
- Trabajo que consiste principalmente en trasladar, filtrar y combinar datos
Cuando un agente recupera 100 documentos regulatorios, los filtra por fecha e identifica transacciones pertinentes, el modelo no debería tener que razonar sobre cada resultado intermedio dentro de su ventana de contexto. Las llamadas programáticas a herramientas permiten que GPT‑5.6 escriba JavaScript para orquestar herramientas, ejecutar llamadas independientes en paralelo y procesar sus resultados fuera de la ventana de contexto. Así, el modelo puede concentrarse en lo que requiere inteligencia: aplicar criterio.
En tareas complejas que pueden paralelizarse, distribuir las acciones y el razonamiento entre varias líneas de trabajo de agentes permite completarlas más rápido y con mayor inteligencia. En estas configuraciones, el agente principal se encarga de orquestar a los subagentes y delegarles tareas. Los subagentes persiguen sus objetivos en paralelo y, al final, devuelven sus resultados al agente principal para que realice la síntesis final. Los equipos pueden empezar a aprovechar la funcionalidad multiagente de forma nativa al habilitar el modo multiagente(se abre en una nueva ventana) en la API Responses. Así funciona también la configuración de capacidad Ultra en ChatGPT.
“Qualia opera equipos de agentes para resolver problemas de investigación abiertos, y GPT‑5.6 Sol simplemente dio en el clavo. Mostró una mejora notable frente a GPT‑5.5, terminó más rápido que casi todos los demás modelos que probamos y enseguida se convirtió en nuestro modelo de OpenAI preferido.”
“GPT‑5.6 es el mejor orquestador que hemos visto de OpenAI. Le dimos seis especificaciones a la vez —para redactarlas, desarrollarlas y analizarlas— y pudo seguirles la pista a todas sin que la calidad se deteriorara.”
Aunque GPT‑5.6 identifica bien cuántos subagentes conviene usar y cuándo crearlos, el comportamiento multiagente es muy fácil de orientar. Indicarle al modelo cuándo debe invocar subagentes puede aumentar la probabilidad de que solo cree agentes cuando el gasto adicional de tokens produzca un mejor rendimiento.
En toda la familia de modelos, el TTL de la caché de prompts se amplió a un mínimo de 30 minutos, y ahora se pueden establecer puntos de interrupción de caché de forma determinista dentro de la ventana de contexto de un modelo. Esto permitió que las startups mejoraran considerablemente su tasa de aciertos de caché.
Además de establecer puntos de interrupción de caché, seguir usando una prompt_cache_key(se abre en una nueva ventana) adecuada aumenta la probabilidad de que las solicitudes lleguen al mismo motor de inferencia que atendió anteriormente el mismo prefijo, lo que reduce la latencia.
Lo más destacable de estos ejemplos es cuánto ha cambiado la economía de crear agentes.
Los casos de uso que antes requerían un modelo de vanguardia en cada paso ahora pueden lograr resultados comparables o mejores por una fracción del costo mediante modelos más pequeños, el ajuste del esfuerzo de razonamiento y decisiones arquitectónicas eficientes.
¡Nos entusiasma ver lo que crean!
- 2026
- Plataforma API
Acerca de los autores
Esta guía fue elaborada por Samarth Madduru(se abre en una nueva ventana), Prashant Mital(se abre en una nueva ventana), Dave Leo(se abre en una nueva ventana) y Julien Reiman(se abre en una nueva ventana), a partir de su experiencia de colaboración estrecha con startups que desarrollan con GPT‑5.6, desde las primeras pruebas hasta la producción.


