The builder’s guide to GPT‑5.6
Technical lessons from startups in production
The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.
In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.
Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.
The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.
Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.
Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.
The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.
In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:
- Reuse work already performed: by allowing reasoning to be persisted(atveras jaunā logā) across model turns and using native compaction(atveras jaunā logā) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
- Parallel decomposition where appropriate: using native multi-agent orchestration(atveras jaunā logā) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
- Move deterministic work into code: using programmatic tool calling(atveras jaunā logā) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.
Izmantojot šīs iespējas kopā, atšķirība var būt krasa. Piemēram, ARC-AGI-3 testā GPT‑5.6 Sol ar standarta izpildes ietvaru ieguva 13,3%. Taču pēc saglabātās spriestspējas un konteksta saspiešanas iespējošanas rezultāts pieauga līdz 38,3%, izmantojot aptuveni sešreiz mazāk izvades tekstvienību. Modelis netika mainīts, taču veiktspēja pieauga gandrīz trīskārt. Plašāku informāciju skatiet mūsu ARC-AGI-3 izpildes ietvara pētījumā.
Aģentu darbplūsmās bieži ir divu veidu darbs:
- Uzdevumi, kuros jāizdara spriedumi
- Darbs, kas galvenokārt ietver datu pārvietošanu, filtrēšanu un apvienošanu
Kad aģents izgūst 100 pārskatus, filtrē tos pēc datuma un atrod attiecīgos darījumus, modelim nevajadzētu savā konteksta logā analizēt katru starprezultātu. Programmatiska rīku izsaukšana ļauj GPT‑5.6 rakstīt JavaScript kodu, lai orķestrētu rīkus, paralēli veiktu neatkarīgus izsaukumus un apstrādātu to izvadi ārpus konteksta loga. Tādējādi modelis var koncentrēties uz to, kam vajadzīgs intelekts: spriedumu izdarīšanu.
Sarežģītos, paralēli izpildāmos uzdevumos darbību un spriestspējas sadalīšana starp vairāku aģentu darba plūsmām ļauj uzdevumu pabeigt ātrāk un paaugstina domāšanas līmeni. Šādās sistēmās galvenais aģents orķestrē apakšaģentus un deleģē tiem uzdevumus. Apakšaģenti paralēli īsteno savus mērķus un beigās nodod rezultātus galvenajam aģentam galīgajai sintēzei. Komandas var sākt izmantot iebūvēto vairāku aģentu funkcionalitāti, Responses API iespējojot vairākus aģentus(atveras jaunā logā). Šādi darbojas arī ChatGPT spēju iestatījums Ultra.
“Qualia izmanto aģentu komandas atvērtiem pētniecības uzdevumiem, un GPT‑5.6 Sol vienkārši nostrādāja. Tas uzrādīja ievērojamu uzlabojumu salīdzinājumā ar GPT‑5.5, darbu pabeidza ātrāk par gandrīz visiem pārējiem mūsu pārbaudītajiem modeļiem un drīz kļuva par mūsu iecienītāko OpenAI modeli.”
“GPT‑5.6 ir labākais OpenAI orķestrators, ko esam redzējuši. Mēs tam vienlaikus uzdevām sešas specifikācijas — tās visas bija jāraksta, jāizstrādā un jāizskaidro —, un tas spēja izsekot visam, nezaudējot kvalitāti.”
Lai gan GPT‑5.6 labi nosaka piemērotu apakšaģentu skaitu un brīdi, kad tos izveidot, vairāku aģentu darbību var viegli vadīt. Norādot modelim, kad izsaukt apakšaģentus, var palielināt iespēju, ka aģenti tiks izveidoti tikai tad, kad papildu tekstvienību patēriņš nodrošinās labāku veiktspēju.
Visā modeļu saimē uzvedņu kešatmiņas glabāšanas laiks ir pagarināts vismaz līdz 30 minūtēm, un tagad modeļa konteksta logā var determinēti iestatīt kešatmiņas kontrolpunktus. Tas ir ļāvis jaunuzņēmumiem ievērojami palielināt kešatmiņas trāpījumu īpatsvaru.
Papildus kešatmiņas kontrolpunktu iestatīšanai piemērotas prompt_cache_key(atveras jaunā logā) turpmāka izmantošana palielina iespēju, ka pieprasījumi nonāks tajā pašā inferenču dzinī, kas iepriekš apstrādāja tādu pašu prefiksu, tā samazinot aizkavi.
Šie piemēri īpaši skaidri parāda, cik ļoti ir mainījusies aģentu izstrādes ekonomika.
Lietojumi, kuros agrāk katrā posmā bija vajadzīgs robežšķirtnes modelis, tagad var sasniegt līdzvērtīgus vai labākus rezultātus par daudz zemākām izmaksām, izmantojot mazākus modeļus, pielāgojot spriestspējas piepūli un izvēloties efektīvus arhitektūras risinājumus.
Ar nepacietību gaidām, ko jūs radīsiet!
- 2026
- API platforma
Par autoriem
Šo ceļvedi izstrādāja Samarth Madduru(atveras jaunā logā), Prashant Mital(atveras jaunā logā), Dave Leo(atveras jaunā logā) un Julien Reiman(atveras jaunā logā), balstoties uz pieredzi ciešā sadarbībā ar jaunuzņēmumiem, kas veido risinājumus ar GPT‑5.6 — no agrīnas testēšanas līdz produkcijas videi.


