Ir al contenido principal
OpenAI

13 de agosto de 2026

IA aplicada

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Cargando…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Integramos GPT‑5.6 en nuestro arnés y obtuvimos nuestros mejores resultados con un nivel de razonamiento bajo. Sabía cuándo los datos simplemente no existían, no seguía pistas falsas y llegaba a la respuesta correcta con menos tokens.
— Izzy Miller, responsable de Investigación en IA, Hex(se abre en una ventana nueva)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 de 3
Luna conserva el 98 % de la precisión de extracción de GPT‑5.5 por una decimoctava parte del coste. Así, nuestros agentes comprenden documentos con gran calidad a un precio que permite aplicar esta capacidad a muchos más flujos de trabajo.
— Serhii Shchoholiev, responsable de Ingeniería de Agentes, Hypha(se abre en una ventana nueva)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(se abre en una ventana nueva) across model turns and using native compaction(se abre en una ventana nueva) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(se abre en una ventana nueva) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(se abre en una ventana nueva) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Al combinarlas, la diferencia puede ser espectacular. Por ejemplo, en ARC-AGI-3, GPT‑5.6 Sol obtuvo un 13,3 % con el arnés estándar. Sin embargo, tras activar la conservación del razonamiento y la compactación, la puntuación subió al 38,3 %, usando aproximadamente seis veces menos tokens de salida. Sin cambios en el modelo, pero con casi el triple de rendimiento. Puedes obtener más información en nuestro estudio del arnés de ARC-AGI-3.

Llamadas programáticas a herramientas

Los flujos de trabajo con agentes suelen implicar dos tipos de trabajo:

  1. Tareas que requieren criterio
  2. Trabajo que consiste principalmente en trasladar, filtrar y combinar datos

Cuando un agente recupera 100 documentos regulatorios, los filtra por fecha e identifica transacciones relevantes, el modelo no debería tener que razonar sobre cada resultado intermedio en su ventana de contexto. Las llamadas programáticas a herramientas permiten que GPT‑5.6 escriba JavaScript para orquestar herramientas, ejecutar llamadas independientes en paralelo y procesar sus resultados fuera de la ventana de contexto. Así, el modelo puede centrarse en lo que requiere inteligencia: aplicar el criterio.

En la investigación financiera, lo difícil es obtener documentos regulatorios de forma fiable, coordinar herramientas y analizar las cifras. En nuestras evaluaciones, GPT‑5.6 con llamadas programáticas a herramientas igualó la calidad de nuestra rúbrica usando un 21 % menos de tokens de entrada. Esa es la diferencia entre un agente que puede hablar de investigación financiera y otro capaz de llevarla a cabo.
— Alex Wang, IA aplicada, Rogo(se abre en una ventana nueva)

Multiagente

En tareas complejas y paralelizables, distribuir las acciones y el razonamiento entre varios flujos de agentes permite completarlas más rápido y con mayor inteligencia. En estas configuraciones, el agente principal se encarga de orquestar los subagentes y delegarles tareas. Los subagentes persiguen sus objetivos en paralelo y, al final, devuelven sus resultados al agente principal para que realice la síntesis definitiva. Los equipos pueden empezar a aprovechar la función multiagente de forma nativa al activar el modo multiagente(se abre en una ventana nueva) en la API de Responses. Así funciona también el ajuste de capacidad Ultra de ChatGPT.

1 de 2
Qualia coordina equipos de agentes para resolver problemas de investigación abiertos, y GPT‑5.6 Sol encajó a la perfección. Mostró una clara mejora frente a GPT‑5.5, terminó antes que casi todos los demás modelos que probamos y rápidamente se convirtió en nuestro modelo de OpenAI de referencia.
— E Chi, fundador, Quadrillion(se abre en una ventana nueva)

Aunque GPT‑5.6 determina bien cuántos subagentes conviene usar y cuándo crearlos, el comportamiento multiagente se puede dirigir con gran precisión. Indicar al modelo cuándo debe recurrir a subagentes puede aumentar la probabilidad de que solo los cree cuando el gasto adicional de tokens vaya a mejorar el rendimiento.

Almacenamiento en caché de prompts

En toda la familia de modelos, el TTL de la caché de prompts se ha ampliado a un mínimo de 30 minutos y ahora es posible definir puntos de interrupción de caché de forma determinista dentro de la ventana de contexto de un modelo. Esto ha permitido a las startups mejorar notablemente su tasa de aciertos de caché.

Añadimos puntos de interrupción de caché y claves específicas del Área de trabajo a un prompt compartido de 29 000 tokens, y redujimos un 28 % la entrada no almacenada en caché. La ventana de caché de 30 minutos también supuso un gran avance: nuestros agentes podían reutilizar el mismo contexto entre ejecuciones en vez de empezar desde cero.
— Lorenzo Gentile, ingeniero de IA, Ploy(se abre en una ventana nueva)

Además de definir puntos de interrupción de caché, seguir usando una prompt_cache_key(se abre en una ventana nueva) adecuada aumenta la probabilidad de que las solicitudes lleguen al mismo motor de inferencia que atendió anteriormente el mismo prefijo, lo que reduce la latencia.

Conclusión

Lo más destacado de estos ejemplos es cuánto ha cambiado la viabilidad económica de crear agentes.

Los casos de uso que antes requerían un modelo de vanguardia en cada paso ahora pueden obtener resultados comparables o mejores por una fracción del coste usando modelos más pequeños, ajustando el nivel de razonamiento y tomando decisiones arquitectónicas eficientes.

¡Estamos deseando ver todo lo que creáis!

  • 2026
  • Plataforma API

Sobre los autores

Esta guía fue elaborada por Samarth Madduru(se abre en una ventana nueva), Prashant Mital(se abre en una ventana nueva), Dave Leo(se abre en una ventana nueva) y Julien Reiman(se abre en una ventana nueva), a partir de su experiencia colaborando estrechamente con startups que desarrollaron soluciones con GPT‑5.6 desde las primeras pruebas hasta la producción.