Salta al contingut principal
OpenAI

13 d’agost del 2026

AI aplicada

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

S'està carregant…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Vam incorporar GPT‑5.6 al nostre entorn d'execució, i el nivell de raonament baix ens va donar els millors resultats. Sabia detectar quan les dades simplement no hi eren, no seguia pistes falses i arribava a la resposta correcta amb menys segments.
— Izzy Miller, responsable de recerca en IA, Hex(s'obre en una finestra nova)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 de 3
Luna conserva el 98 % de la precisió d'extracció de GPT‑5.5 a una divuitena part del cost. Això ofereix als nostres agents una comprensió documental d'alta qualitat a un preu que en fa viable l'ús en molts més fluxos de treball.
— Serhii Shchoholiev, responsable d'enginyeria d'agents, Hypha(s'obre en una finestra nova)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(s'obre en una finestra nova) across model turns and using native compaction(s'obre en una finestra nova) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(s'obre en una finestra nova) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(s'obre en una finestra nova) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Quan es fan servir conjuntament, la diferència pot ser espectacular. Per exemple, a ARC-AGI-3, GPT‑5.6 Sol va obtenir un 13,3 % amb l'entorn d'execució estàndard. Però, després d'activar la conservació del raonament i la condensació de context, la puntuació va pujar al 38,3 %, tot utilitzant aproximadament sis vegades menys segments de sortida. Sense canviar el model, però amb gairebé el triple de rendiment. Podeu trobar més informació a la nostra investigació de l'entorn d'execució d'ARC-AGI-3.

Crides programàtiques a eines

Els fluxos de treball amb agents solen incloure dos tipus de feina:

  1. Tasques que requereixen criteri
  2. Feina que consisteix principalment a moure, filtrar i combinar dades

Quan un agent recupera 100 documents regulatoris, els filtra per data i identifica les transaccions rellevants, el model no hauria d'haver de raonar sobre cada resultat intermedi dins de la finestra de context. Les crides programàtiques a eines permeten que GPT‑5.6 escrigui JavaScript per orquestrar eines, executar crides independents en paral·lel i processar-ne els resultats fora de la finestra de context. Així, el model es pot centrar en allò que requereix intel·ligència: aplicar criteri.

En la recerca financera, la dificultat és obtenir documents regulatoris de manera fiable, coordinar eines i analitzar les xifres. En les nostres avaluacions, GPT‑5.6 amb crides programàtiques a eines va igualar la qualitat de la nostra rúbrica amb un 21 % menys de segments d'entrada. Aquesta és la diferència entre un agent que pot parlar de recerca financera i un que realment pot dur-la a terme.
— Alex Wang, IA aplicada, Rogo(s'obre en una finestra nova)

Multiagent

En tasques complexes que es poden paral·lelitzar, distribuir les accions i el raonament entre diverses línies de treball d'agents permet completar-les més ràpidament i augmentar-ne la intel·ligència. En aquestes configuracions, l'agent principal s'encarrega d'orquestrar els subagents i delegar-los les tasques. Els subagents treballen en paral·lel per assolir els seus objectius i, al final, retornen els resultats a l'agent principal perquè en faci la síntesi final. Els equips poden començar a aprofitar la funcionalitat multiagent nativa activant l'opció multiagent(s'obre en una finestra nova) a l'API Responses. Així és també com funciona el nivell de capacitat Ultra a ChatGPT.

1 de 2
Qualia gestiona equips d'agents per resoldre problemes de recerca oberts, i GPT‑5.6 Sol va encaixar perfectament. Va mostrar una millora notable respecte a GPT‑5.5, va acabar més de pressa que gairebé tots els altres models que vam provar i aviat es va convertir en el nostre model d'OpenAI de referència.
— E Chi, fundador, Quadrillion(s'obre en una finestra nova)

Tot i que GPT‑5.6 sap determinar força bé quants subagents calen i quan ha de crear-los, el comportament multiagent és molt fàcil de dirigir. Indicar al model quan ha d'invocar subagents pot fer que només els creï quan la despesa addicional de segments es tradueixi en un rendiment millor.

Emmagatzematge en memòria cau d'indicacions

En tota la família de models, el TTL de la memòria cau d'indicacions s'ha ampliat a un mínim de 30 minuts, i ara es poden establir punts d'interrupció deterministes dins de la finestra de context d'un model. Això ha permès que les empreses emergents millorin considerablement la taxa d'encerts de la memòria cau.

Vam afegir punts d'interrupció de memòria cau i claus específiques de cada espai de treball a una indicació compartida de 29.000 segments, i vam reduir un 28 % l'entrada no emmagatzemada a la memòria cau. La finestra de memòria cau de 30 minuts també va obrir moltes possibilitats: els nostres agents podien reutilitzar el mateix context entre execucions en lloc de començar de zero.
— Lorenzo Gentile, enginyer d'IA, Ploy(s'obre en una finestra nova)

A més d'establir punts d'interrupció de memòria cau, continuar utilitzant una prompt_cache_key(s'obre en una finestra nova) adequada augmenta la probabilitat que les sol·licituds arribin al mateix motor d'inferència que ja havia processat el mateix prefix, cosa que redueix la latència.

Conclusió

El que més destaca d'aquests exemples és fins a quin punt ha canviat l'economia del desenvolupament d'agents.

Els casos d'ús que abans requerien un model d'avantguarda a cada pas ara poden assolir resultats comparables o millors per una fracció del cost gràcies a models més petits, a l'ajust del nivell de raonament i a decisions arquitectòniques eficients.

Tenim moltes ganes de veure què creeu!

  • 2026
  • Plataforma d'API

Sobre els autors

Aquesta guia ha estat elaborada per Samarth Madduru(s'obre en una finestra nova), Prashant Mital(s'obre en una finestra nova), Dave Leo(s'obre en una finestra nova) i Julien Reiman(s'obre en una finestra nova), a partir de la seva experiència de col·laboració estreta amb empreses emergents que desenvolupen amb GPT‑5.6, des de les primeres proves fins a la producció.