Gå til hovedindhold
OpenAI

13. august 2026

Anvendt AI

Udviklerens guide til GPT‑5.6

Tekniske erfaringer fra startups i produktion

Indlæser ...

GPT‑5.6 sætter en ny standard for forholdet mellem pris og ydeevne

GPT‑5.6‑modelfamilien gør agenters ydeevne på banebrydende niveau markant mere overkommelig og flytter samtidig grænsen for, hvad der er muligt.

I denne guide viser vi, hvordan startups bruger smartere modelvalg og nye API-styringsmuligheder til at sikre kontinuitet i ræsonneringen, orkestrere flere agenter og foretage programmatiske værktøjskald, så de kan bygge hurtigere og mere effektive agenter til en brøkdel af prisen.

En bedre oplevelse fra starten

Siden GPT‑5 har hver modelgeneration haft som mål at løse mere langvarige opgaver med færre tokens. GPT‑5.6 fortsætter udviklingen med bedre agentydelse og lavere omkostninger, uden at det kræver væsentlige ændringer i den underliggende harness.

Den overordnede omkostningseffektivitet forbedres yderligere af højere nøjagtighed ved lavere ræsonneringsindsats. I Agents’ Last Exam klarede GPT‑5.6 Sol med »lav« ræsonnering sig eksempelvis bedre end GPT‑5.5 med »høj« ræsonnering, når den samme harness blev brugt. Vi har set lignende resultater i produktionstest, hvor startups melder om betydelige omkostningsbesparelser i en række arbejdsgange ved at sænke ræsonneringsindsatsen fra de tidligere standardindstillinger.

Vi satte GPT‑5.6 direkte ind i vores harness, og en lav ræsonneringsindsats gav os de bedste resultater. Den vidste, når dataene ganske enkelt ikke fandtes, fulgte ikke dårlige spor og nåede frem til det rigtige svar med færre tokens.
— Izzy Miller, forskningsleder inden for AI, Hex(åbner i et nyt vindue)

Modelvalg

Historisk set har det bedste valg til langvarige brugsscenarier været at opgradere til en flagskibsmodel med den højest tilgængelige ræsonnering. Det skyldes i høj grad, at disse modeller har været betydeligt bedre end omkostningsoptimerede modeller til at håndtere længere kontekster og værktøjskald. Det har ændret sig med 5.6-familien: Med mere beregningskraft under kørsel kan Luna og Terra ofte levere resultater på niveau med GPT‑5.4 og 5.5 til en væsentligt lavere pris.

1 af 3
Luna bevarer 98 % af GPT‑5.5's nøjagtighed ved dataudtræk til en attendedel af prisen. Det giver vores agenter dokumentforståelse af høj kvalitet til en pris, der gør den praktisk anvendelig i langt flere arbejdsgange.
— Serhii Shchoholiev, udviklingsleder for agenter, Hypha(åbner i et nyt vindue)

Se eksempelvis opgaverne i BrowseComp, en søgebaseret benchmark, der tester en models evne til at finde svært tilgængelige fakta. For tre måneder siden opnåede GPT‑5.5 (Ekstra høj) 84,36 % i denne benchmark til en samlet pris på 33,27 $. Ved lanceringen leverer GPT‑5.6 Luna (Ekstra høj) stort set samme resultat med 84,04 % til en pris på 1,33 $. Siden har vi sænket priserne yderligere. Læs mere om vores seneste prisnedsættelser.

De mindre modeller i 5.6-familien er velegnede til arbejdsbelastninger med stor volumen, interaktioner med stramme krav til latenstid og gentagne trin i agentbaserede arbejdsgange. Driver du eksempelvis en legal tech-startup, der analyserer håndskrevne notater før en agentbaseret analyse, kan du nu bruge Terra eller Luna til udtræk i stedet for en banebrydende model til hele opgaven og dermed opnå betydelige besparelser.

Responses API udvikles til at skabe mere effektive agenter

Ud over at gøre GPT‑5.6 mere effektiv fra starten har vi også lanceret nye grundelementer i Responses API, der giver yderligere forbedringer. Vi trænede GPT‑5.6 fra ende til anden med tre supplerende arkitektoniske tiltag, der gør agenter mere effektive:

  1. Genbrug allerede udført arbejde: Ved at gøre det muligt at bevare ræsonnering(åbner i et nyt vindue) på tværs af modelrunder og bruge integreret komprimering(åbner i et nyt vindue) til at komprimere langvarige samtaler kan modellen bevare sammenhængen i sit arbejde over længere opgaveforløb uden at blive forvirret eller skulle genskabe tidligere kontekst.
  2. Parallel opdeling, hvor det er relevant: Med integreret orkestrering af flere agenter(åbner i et nyt vindue) kan flere agenter koordineres på tværs af parallelle arbejdsspor, så komplekse opgaver løses hurtigere.
  3. Flyt deterministisk arbejde over i kode: Brug programmatiske værktøjskald(åbner i et nyt vindue) til at filtrere, samle og orkestrere værktøjsoutput uden for modellens kontekstvindue. Dermed forbeholdes modellens tokens til vurderinger, mens omkostninger, latenstid og forringelse af konteksten reduceres.

Når de bruges sammen, kan forskellen være markant. På ARC-AGI-3 opnåede GPT‑5.6 Sol eksempelvis 13,3 % med standard-harness. Efter aktivering af bevaret ræsonnering og komprimering steg resultatet imidlertid til 38,3 % – samtidig med at der blev brugt cirka seks gange færre outputtokens. Ingen ændringer af modellen, men næsten tre gange så god ydeevne. Du kan læse mere i vores undersøgelse af ARC-AGI-3-harness her.

Programmatiske værktøjskald

Agentbaserede arbejdsgange omfatter ofte to slags arbejde:

  1. Opgaver, der kræver vurdering
  2. Arbejde, der primært består i at flytte, filtrere og kombinere data

Når en agent henter 100 indberetninger, filtrerer dem efter dato og identificerer relevante transaktioner, bør modellen ikke skulle ræsonnere over hvert mellemresultat i sit kontekstvindue. Med programmatiske værktøjskald kan GPT‑5.6 skrive JavaScript for at orkestrere værktøjer, køre uafhængige kald parallelt og behandle deres output uden for kontekstvinduet. Så kan modellen fokusere på det, der kræver intelligens: at foretage vurderinger.

Ved finansiel research er det svære at hente indberetninger pålideligt, koordinere værktøjer og arbejde sig gennem tallene. I vores evalueringer matchede GPT‑5.6 med programmatisk værktøjskald kvaliteten i vores bedømmelseskriterier, men brugte 21 % færre inputtokens. Det er forskellen på en agent, der kan diskutere finansiel research, og en, der rent faktisk kan udføre den.
— Alex Wang, anvendt AI, Rogo(åbner i et nyt vindue)

Flere agenter

Ved komplekse opgaver, der kan paralleliseres, kan handlinger og ræsonnering fordeles på flere agenters arbejdsspor. Det giver både hurtigere opgaveløsning og højere intelligens. I disse opsætninger er den primære agent ansvarlig for at orkestrere underagenterne og uddelegere opgaver til dem. Underagenterne arbejder parallelt mod deres mål og sender til sidst deres output tilbage til den primære agent, som samler det endelige resultat. Teams kan komme i gang med integreret brug af flere agenter ved at aktivere flere agenter(åbner i et nyt vindue) i Responses API. Det er også sådan, kapacitetsindstillingen Ultra i ChatGPT fungerer.

1 af 2
Qualia bruger teams af agenter til åbne forskningsproblemer, og med GPT‑5.6 Sol faldt det hele bare på plads. Den var markant bedre end GPT‑5.5, blev færdig hurtigere end næsten alle andre modeller, vi testede, og blev hurtigt vores foretrukne OpenAI-model.
— E Chi, stifter, Quadrillion(åbner i et nyt vindue)

Selvom GPT‑5.6 har en god fornemmelse for det rette antal underagenter, og hvornår de skal oprettes, kan adfærden med flere agenter styres meget præcist. Ved at instruere modellen i, hvornår den skal aktivere underagenter, øges sandsynligheden for, at agenter kun oprettes i situationer, hvor det ekstra tokenforbrug giver bedre resultater.

Prompt caching

For hele modelfamilien er prompt cachens TTL forlænget til mindst 30 minutter, og cachebrydepunkter kan nu placeres deterministisk i en models kontekstvindue. Det har gjort det muligt for startups at forbedre deres cachetræfrate betydeligt.

Vi føjede cachebrydepunkter og arbejdsområdespecifikke nøgler til en fælles prompt på 29.000 tokens og reducerede input uden cache med 28 %. Cachevinduet på 30 minutter gjorde også en stor forskel: Vores agenter kunne genbruge den samme kontekst på tværs af kørsler i stedet for at begynde forfra.
— Lorenzo Gentile, AI-ingeniør, Ploy(åbner i et nyt vindue)

Ud over at angive cachebrydepunkter øger fortsat brug af en passende prompt_cache_key(åbner i et nyt vindue) sandsynligheden for, at anmodninger sendes til den samme inferensmotor, som tidligere har behandlet det samme præfiks, og reducerer dermed latenstiden.

Konklusion

Det mest iøjnefaldende ved disse eksempler er, hvor meget økonomien i at bygge agenter har ændret sig.

Brugsscenarier, der tidligere krævede en banebrydende model i hvert trin, kan nu opnå tilsvarende eller bedre resultater til en brøkdel af prisen ved at bruge mindre modeller, justere ræsonneringsindsatsen og træffe effektive arkitektoniske valg.

Vi glæder os til at se, hvad I bygger!

  • 2026
  • API-platform

Om forfatterne

Denne guide er udarbejdet af Samarth Madduru(åbner i et nyt vindue), Prashant Mital(åbner i et nyt vindue), Dave Leo(åbner i et nyt vindue) og Julien Reiman(åbner i et nyt vindue) på baggrund af deres erfaring med at arbejde tæt sammen med startups, der bygger på GPT‑5.6, fra de første test til produktion.