Jäta vahele ja mine põhisisu juurde
OpenAI

13. august 2026

Rakenduslik AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Laadimine…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Lisasime GPT‑5.6 oma täitmiskeskkonda ja saime parimad tulemused väikese arutluspingutusega. See sai aru, kui andmeid lihtsalt polnud, ei ajanud valesid jälgi taga ja jõudis õige vastuseni vähemate tokenitega.
– Izzy Miller, tehisintellekti uuringute juht, Hex(avaneb uues aknas)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 / 3
Luna säilitab 98% GPT‑5.5 andmete eraldamise täpsusest, makstes sellest vaid kaheksateistkümnendiku. Nii saavad meie agendid dokumentidest kvaliteetselt aru hinnaga, mis muudab selle kasutamise praktiliseks palju rohkemates töövoogudes.
– Serhii Shchoholiev, agentide arendusjuht, Hypha(avaneb uues aknas)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(avaneb uues aknas) across model turns and using native compaction(avaneb uues aknas) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(avaneb uues aknas) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(avaneb uues aknas) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Koos kasutades võivad need anda väga suure erinevuse. Näiteks sai GPT‑5.6 Sol ARC-AGI-3 testis standardse täitmiskeskkonnaga tulemuseks 13,3%. Pärast säilitatud arutluse ja tihendamise lubamist tõusis tulemus aga 38,3%-ni, kusjuures väljundtokeneid kasutati ligikaudu kuus korda vähem. Mudel ei muutunud, kuid jõudlus peaaegu kolmekordistus. Lisateavet leiate meie ARC-AGI-3 täitmiskeskkonna analüüsist.

Programmiline tööriistakutsumine

Agentsed töövood hõlmavad sageli kaht liiki tööd:

  1. Otsustusvõimet nõudvad ülesanded
  2. Töö, mis seisneb peamiselt andmete teisaldamises, filtreerimises ja ühendamises

Kui agent hangib 100 aruannet, filtreerib neid kuupäeva järgi ja tuvastab asjakohased tehingud, ei peaks mudel oma kontekstivaates iga vahetulemust läbi analüüsima. Programmiline tööriistakutsumine võimaldab GPT‑5.6‑l kirjutada JavaScripti, et orkestreerida tööriistu, teha sõltumatuid kutseid paralleelselt ja töödelda nende väljundeid väljaspool kontekstivaadet. Nii saab mudel keskenduda nutikust nõudvale osale: otsustamisele.

Finantsuuringute keerukaim osa on aruannete usaldusväärne hankimine, tööriistade koordineerimine ja arvutuste tegemine. Meie hindamistes saavutas programmilikku tööriistakutsumist kasutav GPT‑5.6 hindamiskriteeriumide järgi sama kvaliteedi, kasutades 21% vähem sisendtokeneid. See eristab agenti, kes suudab finantsuuringutest rääkida, agendist, kes suudab neid ka päriselt teha.
– Alex Wang, rakenduslik tehisintellekt, Rogo(avaneb uues aknas)

Mitu agenti

Keerukate ja paralleeltöötluseks sobivate ülesannete puhul võimaldab tegevuste ning arutluse jaotamine mitme agendi töövoogude vahel ülesandeid kiiremini ja nutikamalt lahendada. Sellistes lahendustes vastutab põhiagent alamagentide orkestreerimise ja neile ülesannete delegeerimise eest. Alamagendid täidavad oma eesmärke paralleelselt ja edastavad lõpuks väljundi põhiagendile, kes koostab lõpptulemuse. Meeskonnad saavad Responses API-s mitme agendi funktsiooni lubades(avaneb uues aknas) seda kohe kasutada. Samamoodi töötab ka ChatGPT Ultra võimekuse säte.

1 / 2
Qualia rakendab avatud uurimisprobleemide lahendamisel agentide meeskondi ja GPT‑5.6 Sol lihtsalt toimis. See oli GPT‑5.5‑st märgatavalt parem, lõpetas töö kiiremini kui peaaegu kõik teised meie katsetatud mudelid ja sai kiiresti meie eelistatud OpenAI mudeliks.
– E Chi, asutaja, Quadrillion(avaneb uues aknas)

Kuigi GPT‑5.6 oskab hästi hinnata, kui palju alamagente on vaja ja millal neid käivitada, saab mitme agendi käitumist väga täpselt suunata. Kui anda mudelile juhised, millal alamagent käivitada, suureneb tõenäosus, et agente luuakse ainult olukordades, kus täiendav tokenikulu parandab tulemust.

Viipade vahemällu salvestamine

Kogu mudelipere viipade vahemälu minimaalne TTL on nüüd 30 minutit ning vahemälu katkestuspunkte saab mudeli kontekstivaates deterministlikult määrata. See on võimaldanud idufirmadel vahemälu tabamusmäära märkimisväärselt parandada.

Lisasime ühisele 29 000 tokeniga viibale vahemälu katkestuspunktid ja tööjaamapõhised võtmed ning vähendasime vahemällu salvestamata sisendit 28%. Ka 30-minutiline vahemäluaken avas suuri võimalusi: meie agendid said käituste vahel sama konteksti uuesti kasutada, selle asemel et iga kord nullist alustada.
– Lorenzo Gentile, tehisintellekti insener, Ploy(avaneb uues aknas)

Vahemälu katkestuspunktide määramise kõrval suurendab sobiva võtme prompt_cache_key(avaneb uues aknas) jätkuv kasutamine tõenäosust, et päring jõuab samasse järeldusmootorisse, mis varem sama prefiksit töötles, vähendades seeläbi viivitust.

Kokkuvõte

Nende näidete juures torkab silma, kui palju on agentide loomise majanduslik tasuvus muutunud.

Kasutusjuhud, mis varem nõudsid igas etapis tipptasemel mudelit, võivad nüüd saavutada võrreldavaid või paremaid tulemusi murdosa kuludega, kui kasutada väiksemaid mudeleid, kohandada arutluspingutust ja teha tõhusaid arhitektuurivalikuid.

Ootame põnevusega, mida te kõik loote!

  • 2026
  • API Platform

Autoritest

Selle juhendi koostasid Samarth Madduru(avaneb uues aknas), Prashant Mital(avaneb uues aknas), Dave Leo(avaneb uues aknas) ja Julien Reiman(avaneb uues aknas), tuginedes kogemusele, mille nad said GPT‑5.6-l arendavate idufirmadega tihedalt koostööd tehes alates varastest katsetest kuni tootmiskeskkonnani.