Utviklerens guide til GPT‑5.6
Tekniske erfaringer fra oppstartsbedrifter i produksjon
GPT‑5.6‑modellfamilien gjør agenter med banebrytende ytelse dramatisk rimeligere, samtidig som den flytter grensene for hva som er mulig.
I denne guiden viser vi hvordan oppstartsbedrifter bruker smartere modellvalg og nye API-kontroller for kontinuitet i resonneringen, fleragentorkestrering og programmatisk verktøykalling til å bygge raskere og mer avanserte agenter til en brøkdel av kostnaden.
Siden GPT‑5 har hver nye modellgenerasjon forsøkt å håndtere mer langsiktige oppgaver med færre tokener. GPT‑5.6 viderefører denne utviklingen med bedre agentytelse og lavere kostnader, samtidig som rammeverket krever minimale endringer.
Den overordnede kostnadseffektiviteten styrkes ytterligere av høyere presisjon ved lavere resonneringsinnsats. På Agents’ Last Exam gjorde for eksempel GPT‑5.6 Sol med «lav» resonnering det bedre enn GPT‑5.5 med «høy» resonnering når rammeverket var det samme. Vi har sett lignende resultater i produksjonstester, der oppstartsbedrifter melder om betydelige kostnadsreduksjoner i en rekke arbeidsflyter etter å ha redusert resonneringsinnsatsen fra de tidligere standardinnstillingene.
Historisk sett har det beste alternativet for langsiktige bruksområder vært å oppgradere til en flaggskipmodell med høyest mulig resonnering. Det skyldes i stor grad at disse modellene har vært betydelig bedre enn kostnadsoptimaliserte modeller til å håndtere lengre kontekster og verktøykall. Dette har endret seg med 5.6-familien: Med mer beregning ved kjøring kan Luna og Terra ofte yte omtrent som GPT‑5.4 og 5.5, men til en betydelig lavere pris.
Se for eksempel på oppgavene i BrowseComp, en søkebasert referansetest som måler en modells evne til å finne obskure fakta. For tre måneder siden fikk GPT‑5.5 (Ekstra høy) 84,36 % på denne referansetesten, til en samlet kostnad på 33,27 dollar. Ved lansering leverer GPT‑5.6 Luna (Ekstra høy) i praksis samme ytelse, med en poengsum på 84,04 % til en kostnad på 1,33 dollar. Siden har vi redusert prisene ytterligere. Les mer om de nyeste priskuttene våre.
De mindre modellene i 5.6-familien egner seg godt til arbeidsbelastninger med høyt volum, interaksjoner som krever lav ventetid, og gjentatte trinn i agentbaserte arbeidsflyter. Driver du for eksempel en juridisk teknologibedrift som tolker håndskrevne notater før agentbasert analyse, kan du nå bruke Terra eller Luna til datauttrekk i stedet for en banebrytende modell til hele bruksområdet, og dermed oppnå betydelige kostnadsbesparelser.
I tillegg til å gi GPT‑5.6 bedre ytelse fra første stund lanserte vi nye grunnkomponenter i Responses API som gir ytterligere forbedringer. Vi trente GPT‑5.6 ende til ende med tre utfyllende arkitekturgrep som gjør at agenter kan arbeide mer effektivt:
- Gjenbruk arbeid som allerede er utført: Ved å la resonneringen bevares(åpnes i et nytt vindu) mellom modellrunder og bruke innebygd komprimering(åpnes i et nytt vindu) til å komprimere langvarige samtaler kan modellen arbeide sammenhengende over lengre oppgaveforløp uten å bli forvirret eller måtte gjenskape tidligere kontekst.
- Del opp arbeidet parallelt når det passer: Med innebygd fleragentorkestrering(åpnes i et nytt vindu) kan flere agenter koordineres på tvers av parallelle arbeidsstrømmer, slik at komplekse oppgaver fullføres raskere.
- Flytt deterministisk arbeid til kode: Bruk programmatisk verktøykalling(åpnes i et nytt vindu) til å filtrere, samle og orkestrere verktøyresultater utenfor modellens kontekstvindu. Da kan modellens tokener brukes på vurderinger, samtidig som kostnader, ventetid og kontekstforringelse reduseres.
Når de brukes sammen, kan forskjellen være dramatisk. På ARC-AGI-3 fikk for eksempel GPT‑5.6 Sol 13,3 % med standardrammeverket. Da bevart resonnering og komprimering ble aktivert, steg resultatet imidlertid til 38,3 % – samtidig som modellen brukte omtrent en sjettedel så mange utdatatokener. Ingen endringer i modellen, men nesten tredoblet ytelse. Du kan lese mer i undersøkelsen vår av ARC-AGI-3-rammeverket.
Agentbaserte arbeidsflyter omfatter ofte to typer arbeid:
- Oppgaver som krever vurderingsevne
- Arbeid som hovedsakelig består i å flytte, filtrere og kombinere data
Når en agent henter 100 selskapsdokumenter, filtrerer dem etter dato og identifiserer relevante transaksjoner, bør ikke modellen måtte resonnere over hvert mellomresultat i kontekstvinduet. Med programmatisk verktøykalling kan GPT‑5.6 skrive JavaScript for å orkestrere verktøy, kjøre uavhengige kall parallelt og behandle resultatene utenfor kontekstvinduet. Da kan modellen konsentrere seg om det som krever intelligens: å gjøre vurderinger.
I komplekse oppgaver som kan parallelliseres, kan handlinger og resonnering fordeles mellom flere agentbaserte arbeidsstrømmer. Det gir både raskere oppgaveløsning og høyere intelligens. I slike oppsett har hovedagenten ansvar for å orkestrere underagentene og delegere oppgaver til dem. Underagentene arbeider parallelt mot målene sine og sender til slutt resultatene tilbake til hovedagenten for endelig sammenstilling. Team kan ta i bruk innebygd fleragentfunksjonalitet ved å aktivere fleragent(åpnes i et nytt vindu) i Responses API. Det er også slik kapasitetsinnstillingen Ultra fungerer i ChatGPT.
“Qualia bruker team av agenter til åpne forskningsproblemer, og med GPT‑5.6 Sol falt alt på plass. Den var klart bedre enn GPT‑5.5, ble ferdig raskere enn nesten alle andre modeller vi testet, og ble raskt vår foretrukne modell fra OpenAI.”
“GPT‑5.6 er den beste orkestratoren vi har sett fra OpenAI. Vi ga den seks kravspesifikasjoner samtidig – den skulle skrive, bygge og drøfte alle sammen – og den holdt styr på alt uten at kvaliteten falt sammen.”
Selv om GPT‑5.6 har en god forståelse av hvor mange underagenter som passer, og når de bør opprettes, er fleragentatferden svært enkel å styre. Ved å instruere modellen om når den skal bruke underagenter, øker sannsynligheten for at agenter bare opprettes når den ekstra tokenbruken gir bedre ytelse.
For hele modellfamilien er TTL-en for promptcaching utvidet til minst 30 minutter, og cache-bruddpunkter kan nå plasseres deterministisk i modellens kontekstvindu. Dette har gjort det mulig for oppstartsbedrifter å øke treffraten i cachen betydelig.
I tillegg til å angi cache-bruddpunkter øker fortsatt bruk av en passende prompt_cache_key(åpnes i et nytt vindu) sannsynligheten for at forespørsler sendes til den samme inferensmotoren som tidligere behandlet det samme prefikset, noe som reduserer ventetiden.
Det som skiller seg ut i disse eksemplene, er hvor mye økonomien i agentutvikling har endret seg.
Bruksområder som tidligere krevde en banebrytende modell i hvert trinn, kan nå oppnå like gode eller bedre resultater til en brøkdel av kostnaden ved å bruke mindre modeller, justere resonneringsinnsatsen og velge effektive arkitekturløsninger.
Vi gleder oss til å se hva dere bygger!
- 2026
- API-plattform
Om forfatterne
Denne guiden ble utarbeidet av Samarth Madduru(åpnes i et nytt vindu), Prashant Mital(åpnes i et nytt vindu), Dave Leo(åpnes i et nytt vindu) og Julien Reiman(åpnes i et nytt vindu), basert på erfaringene deres fra tett samarbeid med oppstartsbedrifter som har bygget på GPT‑5.6, fra tidlig testing til produksjon.


