Udviklerens guide til GPT‑5.6
Tekniske erfaringer fra startups i produktion
GPT‑5.6‑modelfamilien gør agenters ydeevne på banebrydende niveau markant mere overkommelig og flytter samtidig grænsen for, hvad der er muligt.
I denne guide viser vi, hvordan startups bruger smartere modelvalg og nye API-styringsmuligheder til at sikre kontinuitet i ræsonneringen, orkestrere flere agenter og foretage programmatiske værktøjskald, så de kan bygge hurtigere og mere effektive agenter til en brøkdel af prisen.
Siden GPT‑5 har hver modelgeneration haft som mål at løse mere langvarige opgaver med færre tokens. GPT‑5.6 fortsætter udviklingen med bedre agentydelse og lavere omkostninger, uden at det kræver væsentlige ændringer i den underliggende harness.
Den overordnede omkostningseffektivitet forbedres yderligere af højere nøjagtighed ved lavere ræsonneringsindsats. I Agents’ Last Exam klarede GPT‑5.6 Sol med »lav« ræsonnering sig eksempelvis bedre end GPT‑5.5 med »høj« ræsonnering, når den samme harness blev brugt. Vi har set lignende resultater i produktionstest, hvor startups melder om betydelige omkostningsbesparelser i en række arbejdsgange ved at sænke ræsonneringsindsatsen fra de tidligere standardindstillinger.
Historisk set har det bedste valg til langvarige brugsscenarier været at opgradere til en flagskibsmodel med den højest tilgængelige ræsonnering. Det skyldes i høj grad, at disse modeller har været betydeligt bedre end omkostningsoptimerede modeller til at håndtere længere kontekster og værktøjskald. Det har ændret sig med 5.6-familien: Med mere beregningskraft under kørsel kan Luna og Terra ofte levere resultater på niveau med GPT‑5.4 og 5.5 til en væsentligt lavere pris.
Se eksempelvis opgaverne i BrowseComp, en søgebaseret benchmark, der tester en models evne til at finde svært tilgængelige fakta. For tre måneder siden opnåede GPT‑5.5 (Ekstra høj) 84,36 % i denne benchmark til en samlet pris på 33,27 $. Ved lanceringen leverer GPT‑5.6 Luna (Ekstra høj) stort set samme resultat med 84,04 % til en pris på 1,33 $. Siden har vi sænket priserne yderligere. Læs mere om vores seneste prisnedsættelser.
De mindre modeller i 5.6-familien er velegnede til arbejdsbelastninger med stor volumen, interaktioner med stramme krav til latenstid og gentagne trin i agentbaserede arbejdsgange. Driver du eksempelvis en legal tech-startup, der analyserer håndskrevne notater før en agentbaseret analyse, kan du nu bruge Terra eller Luna til udtræk i stedet for en banebrydende model til hele opgaven og dermed opnå betydelige besparelser.
Ud over at gøre GPT‑5.6 mere effektiv fra starten har vi også lanceret nye grundelementer i Responses API, der giver yderligere forbedringer. Vi trænede GPT‑5.6 fra ende til anden med tre supplerende arkitektoniske tiltag, der gør agenter mere effektive:
- Genbrug allerede udført arbejde: Ved at gøre det muligt at bevare ræsonnering(åbner i et nyt vindue) på tværs af modelrunder og bruge integreret komprimering(åbner i et nyt vindue) til at komprimere langvarige samtaler kan modellen bevare sammenhængen i sit arbejde over længere opgaveforløb uden at blive forvirret eller skulle genskabe tidligere kontekst.
- Parallel opdeling, hvor det er relevant: Med integreret orkestrering af flere agenter(åbner i et nyt vindue) kan flere agenter koordineres på tværs af parallelle arbejdsspor, så komplekse opgaver løses hurtigere.
- Flyt deterministisk arbejde over i kode: Brug programmatiske værktøjskald(åbner i et nyt vindue) til at filtrere, samle og orkestrere værktøjsoutput uden for modellens kontekstvindue. Dermed forbeholdes modellens tokens til vurderinger, mens omkostninger, latenstid og forringelse af konteksten reduceres.
Når de bruges sammen, kan forskellen være markant. På ARC-AGI-3 opnåede GPT‑5.6 Sol eksempelvis 13,3 % med standard-harness. Efter aktivering af bevaret ræsonnering og komprimering steg resultatet imidlertid til 38,3 % – samtidig med at der blev brugt cirka seks gange færre outputtokens. Ingen ændringer af modellen, men næsten tre gange så god ydeevne. Du kan læse mere i vores undersøgelse af ARC-AGI-3-harness her.
Agentbaserede arbejdsgange omfatter ofte to slags arbejde:
- Opgaver, der kræver vurdering
- Arbejde, der primært består i at flytte, filtrere og kombinere data
Når en agent henter 100 indberetninger, filtrerer dem efter dato og identificerer relevante transaktioner, bør modellen ikke skulle ræsonnere over hvert mellemresultat i sit kontekstvindue. Med programmatiske værktøjskald kan GPT‑5.6 skrive JavaScript for at orkestrere værktøjer, køre uafhængige kald parallelt og behandle deres output uden for kontekstvinduet. Så kan modellen fokusere på det, der kræver intelligens: at foretage vurderinger.
Ved komplekse opgaver, der kan paralleliseres, kan handlinger og ræsonnering fordeles på flere agenters arbejdsspor. Det giver både hurtigere opgaveløsning og højere intelligens. I disse opsætninger er den primære agent ansvarlig for at orkestrere underagenterne og uddelegere opgaver til dem. Underagenterne arbejder parallelt mod deres mål og sender til sidst deres output tilbage til den primære agent, som samler det endelige resultat. Teams kan komme i gang med integreret brug af flere agenter ved at aktivere flere agenter(åbner i et nyt vindue) i Responses API. Det er også sådan, kapacitetsindstillingen Ultra i ChatGPT fungerer.
“Qualia bruger teams af agenter til åbne forskningsproblemer, og med GPT‑5.6 Sol faldt det hele bare på plads. Den var markant bedre end GPT‑5.5, blev færdig hurtigere end næsten alle andre modeller, vi testede, og blev hurtigt vores foretrukne OpenAI-model.”
“GPT‑5.6 er den bedste orkestrator, vi har set fra OpenAI. Vi gav den seks specifikationer på én gang – den skulle skrive, bygge og gennemgå dem alle – og den holdt styr på det hele, uden at kvaliteten faldt fra hinanden.”
Selvom GPT‑5.6 har en god fornemmelse for det rette antal underagenter, og hvornår de skal oprettes, kan adfærden med flere agenter styres meget præcist. Ved at instruere modellen i, hvornår den skal aktivere underagenter, øges sandsynligheden for, at agenter kun oprettes i situationer, hvor det ekstra tokenforbrug giver bedre resultater.
For hele modelfamilien er prompt cachens TTL forlænget til mindst 30 minutter, og cachebrydepunkter kan nu placeres deterministisk i en models kontekstvindue. Det har gjort det muligt for startups at forbedre deres cachetræfrate betydeligt.
Ud over at angive cachebrydepunkter øger fortsat brug af en passende prompt_cache_key(åbner i et nyt vindue) sandsynligheden for, at anmodninger sendes til den samme inferensmotor, som tidligere har behandlet det samme præfiks, og reducerer dermed latenstiden.
Det mest iøjnefaldende ved disse eksempler er, hvor meget økonomien i at bygge agenter har ændret sig.
Brugsscenarier, der tidligere krævede en banebrydende model i hvert trin, kan nu opnå tilsvarende eller bedre resultater til en brøkdel af prisen ved at bruge mindre modeller, justere ræsonneringsindsatsen og træffe effektive arkitektoniske valg.
Vi glæder os til at se, hvad I bygger!
- 2026
- API-platform
Om forfatterne
Denne guide er udarbejdet af Samarth Madduru(åbner i et nyt vindue), Prashant Mital(åbner i et nyt vindue), Dave Leo(åbner i et nyt vindue) og Julien Reiman(åbner i et nyt vindue) på baggrund af deres erfaring med at arbejde tæt sammen med startups, der bygger på GPT‑5.6, fra de første test til produktion.


