Pāriet uz galveno saturu
OpenAI

2026. gada 13. augusts

Lietišķais MI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Notiek ielāde…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Mēs ievietojām GPT‑5.6 savā izpildes ietvarā, un vislabākos rezultātus ieguvām ar zemu spriestspējas piepūli. Tas saprata, kad datu vienkārši nav, nesekoja aplamiem pavedieniem un atrada pareizo atbildi ar mazāk tekstvienībām.
— Izzy Miller, MI pētniecības vadītāja, Hex(atveras jaunā logā)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 no 3
Luna saglabā 98% no GPT‑5.5 datu izgūšanas precizitātes par astoņpadsmito daļu izmaksu. Tādējādi mūsu aģenti iegūst kvalitatīvu dokumentu izpratni par cenu, kas ļauj to praktiski izmantot daudz vairāk darbplūsmās.
— Serhii Shchoholiev, aģentu izstrādes vadītājs, Hypha(atveras jaunā logā)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(atveras jaunā logā) across model turns and using native compaction(atveras jaunā logā) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(atveras jaunā logā) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(atveras jaunā logā) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Izmantojot šīs iespējas kopā, atšķirība var būt krasa. Piemēram, ARC-AGI-3 testā GPT‑5.6 Sol ar standarta izpildes ietvaru ieguva 13,3%. Taču pēc saglabātās spriestspējas un konteksta saspiešanas iespējošanas rezultāts pieauga līdz 38,3%, izmantojot aptuveni sešreiz mazāk izvades tekstvienību. Modelis netika mainīts, taču veiktspēja pieauga gandrīz trīskārt. Plašāku informāciju skatiet mūsu ARC-AGI-3 izpildes ietvara pētījumā.

Programmatiska rīku izsaukšana

Aģentu darbplūsmās bieži ir divu veidu darbs:

  1. Uzdevumi, kuros jāizdara spriedumi
  2. Darbs, kas galvenokārt ietver datu pārvietošanu, filtrēšanu un apvienošanu

Kad aģents izgūst 100 pārskatus, filtrē tos pēc datuma un atrod attiecīgos darījumus, modelim nevajadzētu savā konteksta logā analizēt katru starprezultātu. Programmatiska rīku izsaukšana ļauj GPT‑5.6 rakstīt JavaScript kodu, lai orķestrētu rīkus, paralēli veiktu neatkarīgus izsaukumus un apstrādātu to izvadi ārpus konteksta loga. Tādējādi modelis var koncentrēties uz to, kam vajadzīgs intelekts: spriedumu izdarīšanu.

Finanšu izpētē grūtākais ir uzticami izgūt pārskatus, koordinēt rīkus un izanalizēt skaitļus. Mūsu novērtējumos GPT‑5.6 ar programmatisku rīku izsaukšanu sasniedza mūsu kritērijiem atbilstošu kvalitāti, izmantojot par 21% mazāk ievades tekstvienību. Tieši ar to aģents, kas spēj runāt par finanšu izpēti, atšķiras no tāda, kas to patiešām spēj veikt.
— Alex Wang, lietišķā MI speciālists, Rogo(atveras jaunā logā)

Vairāki aģenti

Sarežģītos, paralēli izpildāmos uzdevumos darbību un spriestspējas sadalīšana starp vairāku aģentu darba plūsmām ļauj uzdevumu pabeigt ātrāk un paaugstina domāšanas līmeni. Šādās sistēmās galvenais aģents orķestrē apakšaģentus un deleģē tiem uzdevumus. Apakšaģenti paralēli īsteno savus mērķus un beigās nodod rezultātus galvenajam aģentam galīgajai sintēzei. Komandas var sākt izmantot iebūvēto vairāku aģentu funkcionalitāti, Responses API iespējojot vairākus aģentus(atveras jaunā logā). Šādi darbojas arī ChatGPT spēju iestatījums Ultra.

1 no 2
Qualia izmanto aģentu komandas atvērtiem pētniecības uzdevumiem, un GPT‑5.6 Sol vienkārši nostrādāja. Tas uzrādīja ievērojamu uzlabojumu salīdzinājumā ar GPT‑5.5, darbu pabeidza ātrāk par gandrīz visiem pārējiem mūsu pārbaudītajiem modeļiem un drīz kļuva par mūsu iecienītāko OpenAI modeli.
— E Chi, dibinātājs, Quadrillion(atveras jaunā logā)

Lai gan GPT‑5.6 labi nosaka piemērotu apakšaģentu skaitu un brīdi, kad tos izveidot, vairāku aģentu darbību var viegli vadīt. Norādot modelim, kad izsaukt apakšaģentus, var palielināt iespēju, ka aģenti tiks izveidoti tikai tad, kad papildu tekstvienību patēriņš nodrošinās labāku veiktspēju.

Uzvedņu kešošana

Visā modeļu saimē uzvedņu kešatmiņas glabāšanas laiks ir pagarināts vismaz līdz 30 minūtēm, un tagad modeļa konteksta logā var determinēti iestatīt kešatmiņas kontrolpunktus. Tas ir ļāvis jaunuzņēmumiem ievērojami palielināt kešatmiņas trāpījumu īpatsvaru.

Koplietotai 29 000 tekstvienību uzvednei pievienojām kešatmiņas kontrolpunktus un darbvietai specifiskas atslēgas, tā samazinot nekešoto ievadi par 28%. Arī 30 minūšu kešatmiņas periods pavēra plašas iespējas: mūsu aģenti varēja atkārtoti izmantot vienu un to pašu kontekstu vairākās izpildēs, nevis ikreiz sākt no nulles.
— Lorenzo Gentile, MI inženieris, Ploy(atveras jaunā logā)

Papildus kešatmiņas kontrolpunktu iestatīšanai piemērotas prompt_cache_key(atveras jaunā logā) turpmāka izmantošana palielina iespēju, ka pieprasījumi nonāks tajā pašā inferenču dzinī, kas iepriekš apstrādāja tādu pašu prefiksu, tā samazinot aizkavi.

Secinājumi

Šie piemēri īpaši skaidri parāda, cik ļoti ir mainījusies aģentu izstrādes ekonomika.

Lietojumi, kuros agrāk katrā posmā bija vajadzīgs robežšķirtnes modelis, tagad var sasniegt līdzvērtīgus vai labākus rezultātus par daudz zemākām izmaksām, izmantojot mazākus modeļus, pielāgojot spriestspējas piepūli un izvēloties efektīvus arhitektūras risinājumus.

Ar nepacietību gaidām, ko jūs radīsiet!

  • 2026
  • API platforma

Par autoriem

Šo ceļvedi izstrādāja Samarth Madduru(atveras jaunā logā), Prashant Mital(atveras jaunā logā), Dave Leo(atveras jaunā logā) un Julien Reiman(atveras jaunā logā), balstoties uz pieredzi ciešā sadarbībā ar jaunuzņēmumiem, kas veido risinājumus ar GPT‑5.6 — no agrīnas testēšanas līdz produkcijas videi.