The builder’s guide to GPT‑5.6
Technical lessons from startups in production
The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.
In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.
Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.
The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.
Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.
Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.
The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.
In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:
- Reuse work already performed: by allowing reasoning to be persisted(avaneb uues aknas) across model turns and using native compaction(avaneb uues aknas) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
- Parallel decomposition where appropriate: using native multi-agent orchestration(avaneb uues aknas) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
- Move deterministic work into code: using programmatic tool calling(avaneb uues aknas) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.
Koos kasutades võivad need anda väga suure erinevuse. Näiteks sai GPT‑5.6 Sol ARC-AGI-3 testis standardse täitmiskeskkonnaga tulemuseks 13,3%. Pärast säilitatud arutluse ja tihendamise lubamist tõusis tulemus aga 38,3%-ni, kusjuures väljundtokeneid kasutati ligikaudu kuus korda vähem. Mudel ei muutunud, kuid jõudlus peaaegu kolmekordistus. Lisateavet leiate meie ARC-AGI-3 täitmiskeskkonna analüüsist.
Agentsed töövood hõlmavad sageli kaht liiki tööd:
- Otsustusvõimet nõudvad ülesanded
- Töö, mis seisneb peamiselt andmete teisaldamises, filtreerimises ja ühendamises
Kui agent hangib 100 aruannet, filtreerib neid kuupäeva järgi ja tuvastab asjakohased tehingud, ei peaks mudel oma kontekstivaates iga vahetulemust läbi analüüsima. Programmiline tööriistakutsumine võimaldab GPT‑5.6‑l kirjutada JavaScripti, et orkestreerida tööriistu, teha sõltumatuid kutseid paralleelselt ja töödelda nende väljundeid väljaspool kontekstivaadet. Nii saab mudel keskenduda nutikust nõudvale osale: otsustamisele.
Keerukate ja paralleeltöötluseks sobivate ülesannete puhul võimaldab tegevuste ning arutluse jaotamine mitme agendi töövoogude vahel ülesandeid kiiremini ja nutikamalt lahendada. Sellistes lahendustes vastutab põhiagent alamagentide orkestreerimise ja neile ülesannete delegeerimise eest. Alamagendid täidavad oma eesmärke paralleelselt ja edastavad lõpuks väljundi põhiagendile, kes koostab lõpptulemuse. Meeskonnad saavad Responses API-s mitme agendi funktsiooni lubades(avaneb uues aknas) seda kohe kasutada. Samamoodi töötab ka ChatGPT Ultra võimekuse säte.
“Qualia rakendab avatud uurimisprobleemide lahendamisel agentide meeskondi ja GPT‑5.6 Sol lihtsalt toimis. See oli GPT‑5.5‑st märgatavalt parem, lõpetas töö kiiremini kui peaaegu kõik teised meie katsetatud mudelid ja sai kiiresti meie eelistatud OpenAI mudeliks.”
“GPT‑5.6 on parim OpenAI orkestreerija, mida oleme näinud. Andsime sellele korraga kuus spetsifikatsiooni – palusime need kõiki koostada, ellu viia ja läbi arutada – ning see suutis kõigel järge pidada, ilma et kvaliteet oleks kannatanud.”
Kuigi GPT‑5.6 oskab hästi hinnata, kui palju alamagente on vaja ja millal neid käivitada, saab mitme agendi käitumist väga täpselt suunata. Kui anda mudelile juhised, millal alamagent käivitada, suureneb tõenäosus, et agente luuakse ainult olukordades, kus täiendav tokenikulu parandab tulemust.
Kogu mudelipere viipade vahemälu minimaalne TTL on nüüd 30 minutit ning vahemälu katkestuspunkte saab mudeli kontekstivaates deterministlikult määrata. See on võimaldanud idufirmadel vahemälu tabamusmäära märkimisväärselt parandada.
Vahemälu katkestuspunktide määramise kõrval suurendab sobiva võtme prompt_cache_key(avaneb uues aknas) jätkuv kasutamine tõenäosust, et päring jõuab samasse järeldusmootorisse, mis varem sama prefiksit töötles, vähendades seeläbi viivitust.
Nende näidete juures torkab silma, kui palju on agentide loomise majanduslik tasuvus muutunud.
Kasutusjuhud, mis varem nõudsid igas etapis tipptasemel mudelit, võivad nüüd saavutada võrreldavaid või paremaid tulemusi murdosa kuludega, kui kasutada väiksemaid mudeleid, kohandada arutluspingutust ja teha tõhusaid arhitektuurivalikuid.
Ootame põnevusega, mida te kõik loote!
- 2026
- API Platform
Autoritest
Selle juhendi koostasid Samarth Madduru(avaneb uues aknas), Prashant Mital(avaneb uues aknas), Dave Leo(avaneb uues aknas) ja Julien Reiman(avaneb uues aknas), tuginedes kogemusele, mille nad said GPT‑5.6-l arendavate idufirmadega tihedalt koostööd tehes alates varastest katsetest kuni tootmiskeskkonnani.


