Gå direkt till huvudinnehåll
OpenAI

13 augusti 2026

Tillämpad AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Laddar …

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Vi satte in GPT‑5.6 i vår körmiljö, och låg resonemangsnivå gav oss våra bästa resultat. Den förstod när data helt enkelt saknades, följde inte felaktiga spår och kom fram till rätt svar med färre token.
— Izzy Miller, forskningschef inom AI, Hex(öppnas i ett nytt fönster)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 av 3
Luna behåller 98 % av extraktionsprecisionen hos GPT‑5.5 till en artondel av kostnaden. Det ger våra agenter dokumentförståelse av hög kvalitet till ett pris som gör den praktiskt användbar i många fler arbetsflöden.
— Serhii Shchoholiev, utvecklingschef för agenter, Hypha(öppnas i ett nytt fönster)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(öppnas i ett nytt fönster) across model turns and using native compaction(öppnas i ett nytt fönster) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(öppnas i ett nytt fönster) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(öppnas i ett nytt fönster) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

När de används tillsammans kan skillnaden bli dramatisk. I ARC-AGI-3 fick GPT‑5.6 Sol exempelvis 13,3 % med standardkörmiljön. När bevarade resonemang och komprimering aktiverades steg resultatet däremot till 38,3 % – samtidigt som ungefär sex gånger färre utdatatoken användes. Inga ändringar av modellen, men nästan tre gånger så hög prestanda. Du kan läsa mer i vår undersökning av körmiljön för ARC-AGI-3.

Programmatisk verktygsanropning

Agentbaserade arbetsflöden omfattar ofta två typer av arbete:

  1. Uppgifter som kräver omdöme
  2. Arbete som främst består i att flytta, filtrera och kombinera data

När en agent hämtar 100 rapporter, filtrerar dem efter datum och identifierar relevanta transaktioner ska modellen inte behöva resonera kring varje mellanresultat i sitt kontextfönster. Med programmatisk verktygsanropning kan GPT‑5.6 skriva JavaScript för att orkestrera verktyg, köra oberoende anrop parallellt och bearbeta deras utdata utanför kontextfönstret. Modellen kan då fokusera på det som kräver intelligens: att göra bedömningar.

Inom finansiell analys är det svåra att på ett tillförlitligt sätt hämta in rapporter, samordna verktyg och arbeta sig igenom siffrorna. I våra utvärderingar uppnådde GPT‑5.6 med programmatisk verktygsanropning samma kvalitet enligt våra bedömningskriterier, men med 21 % färre indatatoken. Det är skillnaden mellan en agent som kan diskutera finansiell analys och en som faktiskt kan utföra den.
— Alex Wang, tillämpad AI, Rogo(öppnas i ett nytt fönster)

Flera agenter

I komplexa uppgifter som kan parallelliseras går det både snabbare att slutföra uppgiften och att nå högre intelligens genom att fördela åtgärder och resonemang mellan flera agenters arbetsflöden. I sådana konfigurationer ansvarar huvudagenten för att orkestrera underagenterna och delegera uppgifter till dem. Underagenterna arbetar parallellt mot sina mål och skickar slutligen tillbaka sina resultat till huvudagenten för en slutlig sammanställning. Team kan börja använda flera agenter direkt genom att aktivera flera agenter(öppnas i ett nytt fönster) i Responses API. Det är också så kapacitetsinställningen Ultra i ChatGPT fungerar.

1 av 2
Qualia använder team av agenter för öppna forskningsproblem, och med GPT‑5.6 Sol föll allt på plats. Den var markant bättre än GPT‑5.5, blev klar snabbare än nästan alla andra modeller vi testade och blev snabbt vår förstahandsmodell från OpenAI.
— E Chi, grundare, Quadrillion(öppnas i ett nytt fönster)

Även om GPT‑5.6 har en god uppfattning om hur många underagenter som är lämpliga och när de bör startas, går beteendet med flera agenter att styra i hög grad. Genom att instruera modellen om när underagenter ska anropas ökar sannolikheten att agenter bara startas när den extra tokenförbrukningen ger bättre prestanda.

Promptcachning

För hela modellfamiljen har promptcachens TTL förlängts till minst 30 minuter, och cachebrytpunkter kan nu anges deterministiskt inom en modells kontextfönster. Det har gjort det möjligt för startupföretag att avsevärt förbättra andelen cacheträffar.

Vi lade till cachebrytpunkter och arbetsytespecifika nycklar i en gemensam prompt på 29 000 token och minskade icke-cachelagrad indata med 28 %. Cachefönstret på 30 minuter var också ett stort genombrott: våra agenter kunde återanvända samma kontext mellan körningar i stället för att börja om från början.
— Lorenzo Gentile, AI-ingenjör, Ploy(öppnas i ett nytt fönster)

Utöver att ange cachebrytpunkter ökar fortsatt användning av en lämplig prompt_cache_key(öppnas i ett nytt fönster) sannolikheten att förfrågningar hamnar på samma inferensmotor som tidigare hanterade samma prefix, vilket minskar svarstiden.

Slutsats

Det som sticker ut i dessa exempel är hur mycket ekonomin kring att bygga agenter har förändrats.

Användningsfall som tidigare krävde en banbrytande modell i varje steg kan nu uppnå jämförbara eller bättre resultat till en bråkdel av kostnaden genom mindre modeller, justerad resonemangsnivå och effektiva arkitekturval.

Vi ser fram emot att få se vad ni bygger!

  • 2026
  • API-plattform

Om författarna

Den här guiden har tagits fram av Samarth Madduru(öppnas i ett nytt fönster), Prashant Mital(öppnas i ett nytt fönster), Dave Leo(öppnas i ett nytt fönster) och Julien Reiman(öppnas i ett nytt fönster), utifrån deras erfarenheter av nära samarbete med startupföretag som byggt på GPT‑5.6, från tidiga tester till produktion.