Pasar al contenido principal
OpenAI

13 de agosto de 2026

IA aplicada

Guía para crear con GPT‑5.6

Lecciones técnicas de startups en producción

Cargando...

GPT‑5.6 establece un nuevo estándar de relación precio-rendimiento

La familia de modelos GPT‑5.6 hace que el rendimiento de agentes de vanguardia sea mucho más asequible, a la vez que amplía los límites de lo posible.

En esta guía mostramos cómo las startups usan una selección de modelos más inteligente y nuevos controles de API que favorecen la continuidad del razonamiento, la orquestación multiagente y las llamadas programáticas a herramientas para crear agentes más rápidos y capaces por una fracción del costo.

Una mejor experiencia desde el primer momento

Desde GPT‑5, cada generación de modelos ha buscado abordar tareas de mayor duración con menos tokens. GPT‑5.6 mantiene esa trayectoria: ofrece un mejor rendimiento de los agentes y menores costos, con cambios mínimos en el arnés de ejecución subyacente.

Las mejoras generales en eficiencia de costos se potencian con una mayor precisión a niveles más bajos de esfuerzo de razonamiento. Por ejemplo, en Agents’ Last Exam, GPT‑5.6 Sol con razonamiento “bajo” superó a GPT‑5.5 con razonamiento “alto” cuando se mantuvo constante el arnés de ejecución. Hemos visto resultados similares en pruebas de producción, donde las startups informan mejoras significativas de costos en diversos flujos de trabajo al reducir el esfuerzo de razonamiento respecto de los valores predeterminados anteriores.

Integramos GPT‑5.6 en nuestro arnés de ejecución, y un bajo esfuerzo de razonamiento nos dio los mejores resultados. Sabía cuándo los datos simplemente no existían, no seguía pistas falsas y llegaba a la respuesta correcta con menos tokens.
— Izzy Miller, líder de investigación en IA, Hex(se abre en una nueva ventana)

Selección de modelos

Históricamente, pasar a un modelo insignia con el nivel de razonamiento más alto disponible ha sido la mejor opción para casos de uso de larga duración. Esto se debía en gran medida a que estos modelos eran mucho más capaces que los optimizados para costos al gestionar contextos más largos y llamadas a herramientas. Esto cambió con la familia 5.6: con más cómputo en tiempo de prueba, Luna y Terra a menudo pueden rendir de forma similar a GPT‑5.4 y 5.5, pero a un costo mucho menor.

1 de 3
Luna conserva el 98 % de la precisión de extracción de GPT‑5.5 por una decimoctava parte del costo. Esto ofrece a nuestros agentes una comprensión de documentos de alta calidad a un precio que permite usarla en muchos más flujos de trabajo.
— Serhii Shchoholiev, líder de ingeniería de agentes, Hypha(se abre en una nueva ventana)

Consideremos las tareas de BrowseComp, un benchmark basado en búsquedas que evalúa la capacidad de un modelo para encontrar datos poco conocidos. Hace tres meses, GPT‑5.5 (Muy alta) obtuvo un 84,36 % en este benchmark, con un costo total de USD 33,27. En su lanzamiento, GPT‑5.6 Luna (Muy alta) ofrece prácticamente el mismo rendimiento: obtiene un 84,04 % con un costo de USD 1,33. Desde entonces, redujimos aún más los precios. Obtén más información sobre nuestras últimas reducciones de precios.

Los modelos más pequeños de la familia 5.6 son ideales para cargas de trabajo de gran volumen, interacciones sensibles a la latencia y pasos repetitivos dentro de flujos de trabajo de agentes. Por ejemplo, si diriges una startup de tecnología jurídica que procesa notas manuscritas antes de que un agente las analice, ahora puedes usar Terra o Luna para la extracción, en lugar de emplear un modelo de vanguardia para todo el caso de uso, y así lograr ahorros considerables.

Evolucionar la API Responses para diseñar agentes más eficientes

Además de mejorar el rendimiento inmediato de GPT‑5.6, incorporamos nuevos componentes básicos a la API Responses para conseguir mejoras adicionales. Entrenamos GPT‑5.6 de extremo a extremo con tres intervenciones arquitectónicas complementarias que permiten que los agentes operen con mayor eficiencia:

  1. Reutilizar el trabajo ya realizado: al permitir que el razonamiento se conserve(se abre en una nueva ventana) entre turnos del modelo y usar la compactación nativa(se abre en una nueva ventana) para comprimir conversaciones prolongadas, el modelo puede mantener la coherencia de su trabajo durante tareas más largas sin confundirse ni tener que reconstruir el contexto anterior.
  2. Descomponer en paralelo cuando corresponda: usar la orquestación multiagente nativa(se abre en una nueva ventana) permite coordinar varios agentes en líneas de trabajo paralelas para terminar tareas complejas más rápido.
  3. Trasladar el trabajo determinista al código: usar llamadas programáticas a herramientas(se abre en una nueva ventana) para filtrar, agregar y orquestar los resultados de las herramientas fuera de la ventana de contexto del modelo permite reservar los tokens del modelo para tareas de criterio y reducir el costo, la latencia y el deterioro del contexto.

Al usarlas en conjunto, la diferencia puede ser enorme. Por ejemplo, en ARC-AGI-3, GPT‑5.6 Sol obtuvo un 13,3 % con el arnés de ejecución estándar. Sin embargo, tras habilitar el razonamiento conservado y la compactación, la puntuación aumentó al 38,3 %, usando aproximadamente 6 veces menos tokens de salida. Sin cambios en el modelo, pero con casi el triple de rendimiento. Puedes consultar más información en nuestra investigación del arnés de ejecución de ARC-AGI-3.

Llamadas programáticas a herramientas

Los flujos de trabajo de agentes suelen incluir dos tipos de trabajo:

  1. Tareas que requieren criterio
  2. Trabajo que consiste principalmente en trasladar, filtrar y combinar datos

Cuando un agente recupera 100 documentos regulatorios, los filtra por fecha e identifica transacciones pertinentes, el modelo no debería tener que razonar sobre cada resultado intermedio dentro de su ventana de contexto. Las llamadas programáticas a herramientas permiten que GPT‑5.6 escriba JavaScript para orquestar herramientas, ejecutar llamadas independientes en paralelo y procesar sus resultados fuera de la ventana de contexto. Así, el modelo puede concentrarse en lo que requiere inteligencia: aplicar criterio.

En la investigación financiera, lo difícil es obtener documentos regulatorios de forma confiable, coordinar herramientas y analizar las cifras. En nuestras evaluaciones, GPT‑5.6 con llamadas programáticas a herramientas igualó la calidad de nuestra rúbrica usando un 21 % menos de tokens de entrada. Esa es la diferencia entre un agente que puede hablar de investigación financiera y uno que realmente puede llevarla a cabo.
— Alex Wang, IA aplicada, Rogo(se abre en una nueva ventana)

Multiagente

En tareas complejas que pueden paralelizarse, distribuir las acciones y el razonamiento entre varias líneas de trabajo de agentes permite completarlas más rápido y con mayor inteligencia. En estas configuraciones, el agente principal se encarga de orquestar a los subagentes y delegarles tareas. Los subagentes persiguen sus objetivos en paralelo y, al final, devuelven sus resultados al agente principal para que realice la síntesis final. Los equipos pueden empezar a aprovechar la funcionalidad multiagente de forma nativa al habilitar el modo multiagente(se abre en una nueva ventana) en la API Responses. Así funciona también la configuración de capacidad Ultra en ChatGPT.

1 de 2
Qualia opera equipos de agentes para resolver problemas de investigación abiertos, y GPT‑5.6 Sol simplemente dio en el clavo. Mostró una mejora notable frente a GPT‑5.5, terminó más rápido que casi todos los demás modelos que probamos y enseguida se convirtió en nuestro modelo de OpenAI preferido.
— E Chi, fundador, Quadrillion(se abre en una nueva ventana)

Aunque GPT‑5.6 identifica bien cuántos subagentes conviene usar y cuándo crearlos, el comportamiento multiagente es muy fácil de orientar. Indicarle al modelo cuándo debe invocar subagentes puede aumentar la probabilidad de que solo cree agentes cuando el gasto adicional de tokens produzca un mejor rendimiento.

Almacenamiento en caché de prompts

En toda la familia de modelos, el TTL de la caché de prompts se amplió a un mínimo de 30 minutos, y ahora se pueden establecer puntos de interrupción de caché de forma determinista dentro de la ventana de contexto de un modelo. Esto permitió que las startups mejoraran considerablemente su tasa de aciertos de caché.

Agregamos puntos de interrupción de caché y claves específicas de cada Espacio de trabajo a un prompt compartido de 29 000 tokens, y redujimos la entrada sin caché en un 28 %. La ventana de caché de 30 minutos también marcó una gran diferencia: nuestros agentes pudieron reutilizar el mismo contexto entre ejecuciones en lugar de empezar desde cero.
— Lorenzo Gentile, ingeniero de IA, Ploy(se abre en una nueva ventana)

Además de establecer puntos de interrupción de caché, seguir usando una prompt_cache_key(se abre en una nueva ventana) adecuada aumenta la probabilidad de que las solicitudes lleguen al mismo motor de inferencia que atendió anteriormente el mismo prefijo, lo que reduce la latencia.

Conclusión

Lo más destacable de estos ejemplos es cuánto ha cambiado la economía de crear agentes.

Los casos de uso que antes requerían un modelo de vanguardia en cada paso ahora pueden lograr resultados comparables o mejores por una fracción del costo mediante modelos más pequeños, el ajuste del esfuerzo de razonamiento y decisiones arquitectónicas eficientes.

¡Nos entusiasma ver lo que crean!

  • 2026
  • Plataforma API

Acerca de los autores

Esta guía fue elaborada por Samarth Madduru(se abre en una nueva ventana), Prashant Mital(se abre en una nueva ventana), Dave Leo(se abre en una nueva ventana) y Julien Reiman(se abre en una nueva ventana), a partir de su experiencia de colaboración estrecha con startups que desarrollan con GPT‑5.6, desde las primeras pruebas hasta la producción.