Preskočite na glavno vsebino
OpenAI

13. avgust 2026

Uporabna AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Nalaganje …

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

GPT‑5.6 smo vključili v svoje ogrodje in najboljše rezultate dosegli z nizko ravnjo sklepanja. Prepoznal je, kdaj podatkov preprosto ni, ni sledil napačnim sledem in je do pravilnega odgovora prišel z manj žetoni.
– Izzy Miller, vodja raziskav UI, Hex(odpre se v novem oknu)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 od 3
Luna ohrani 98 % natančnosti pridobivanja podatkov modela GPT‑5.5 za osemnajstino njegove cene. Tako lahko naši agenti kakovostno razumejo dokumente po ceni, ki omogoča praktično uporabo v veliko več delovnih tokovih.
– Serhii Shchoholiev, vodja inženirstva za agente, Hypha(odpre se v novem oknu)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(odpre se v novem oknu) across model turns and using native compaction(odpre se v novem oknu) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(odpre se v novem oknu) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(odpre se v novem oknu) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Skupni učinek je lahko izjemen. Na preizkusu ARC-AGI-3 je na primer GPT‑5.6 Sol s standardnim ogrodjem dosegel 13,3 %. Ko smo omogočili ohranjeno sklepanje in kompaktiranje, pa je rezultat poskočil na 38,3 % – ob približno šestkrat manj izhodnih žetonih. Brez sprememb modela, vendar s skoraj trikrat boljšim rezultatom. Več lahko preberete v naši raziskavi ogrodja ARC-AGI-3.

Programsko klicanje orodij

Delovni tokovi agentov pogosto vključujejo dve vrsti dela:

  1. Naloge, ki zahtevajo presojo
  2. Delo, ki večinoma obsega premikanje, filtriranje in združevanje podatkov

Ko agent pridobi 100 poročil, jih filtrira po datumu in poišče ustrezne transakcije, modelu ne bi bilo treba sklepati o vsakem vmesnem rezultatu v svojem kontekstnem oknu. Programsko klicanje orodij omogoča GPT‑5.6, da napiše kodo JavaScript za orkestracijo orodij, vzporedno izvede neodvisne klice in njihove rezultate obdela zunaj kontekstnega okna. Model se tako lahko osredotoči na tisto, kar zahteva inteligenco: presojo.

Pri finančnih raziskavah je najtežje zanesljivo pridobiti poročila, usklajevati orodja in obdelati številke. V naših vrednotenjih je GPT‑5.6 s programskim klicanjem orodij dosegel kakovost po naših merilih, pri tem pa porabil 21 % manj vhodnih žetonov. To je razlika med agentom, ki zna razpravljati o finančnih raziskavah, in agentom, ki jih zna dejansko izvesti.
– Alex Wang, uporabna UI, Rogo(odpre se v novem oknu)

Več agentov

Pri zapletenih nalogah, ki jih je mogoče izvajati vzporedno, porazdelitev dejanj in sklepanja med več delovnih tokov agentov omogoča hitrejše dokončanje nalog in večjo inteligenco. V takšnih postavitvah glavni agent orkestrira podagente in jim dodeljuje naloge. Podagenti vzporedno sledijo svojim ciljem, nato pa rezultate posredujejo glavnemu agentu za končno sintezo. Ekipe lahko začnejo izvorno uporabljati več agentov tako, da v API-ju Responses omogočijo večagentno delovanje(odpre se v novem oknu). Tako deluje tudi nastavitev zmogljivosti Ultra v ChatGPT.

1 od 2
Qualia uporablja ekipe agentov za odprte raziskovalne probleme in pri GPT‑5.6 Sol se je vse preprosto poklopilo. V primerjavi z GPT‑5.5 je pokazal občutno izboljšanje, delo končal hitreje kot skoraj vsi drugi preizkušeni modeli in hitro postal naš prvi izbor med modeli OpenAI.
– E Chi, ustanovitelj, Quadrillion(odpre se v novem oknu)

Čeprav GPT‑5.6 dobro presodi primerno število podagentov in trenutek za njihovo vzpostavitev, je večagentno vedenje mogoče zelo natančno usmerjati. Z navodili modelu, kdaj naj prikliče podagente, lahko povečamo verjetnost, da bo agente vzpostavil le takrat, ko dodatna poraba žetonov prinese boljše rezultate.

Predpomnjenje pozivov

Za celotno družino modelov je najkrajši čas veljavnosti predpomnilnika pozivov podaljšan na 30 minut, prekinitvene točke predpomnilnika pa je zdaj mogoče deterministično nastaviti znotraj kontekstnega okna modela. Tako so lahko zagonska podjetja občutno izboljšala delež zadetkov v predpomnilniku.

Skupnemu pozivu z 29.000 žetoni smo dodali prekinitvene točke predpomnilnika in ključe za posamezne delovne prostore ter nepredpomnjen vhod zmanjšali za 28 %. Velik preboj je bilo tudi 30-minutno okno predpomnilnika: naši agenti so lahko isti kontekst znova uporabili v več izvajanjih, namesto da bi vsakič začeli od začetka.
– Lorenzo Gentile, inženir UI, Ploy(odpre se v novem oknu)

Poleg nastavitve prekinitvenih točk predpomnilnika nadaljnja uporaba ustreznega ključa prompt_cache_key(odpre se v novem oknu) poveča verjetnost, da bodo zahteve prispele v isti mehanizem sklepanja, ki je že obdelal isto predpono, s čimer se zmanjša zakasnitev.

Sklep

V vseh teh primerih najbolj izstopa, kako močno se je spremenila ekonomika razvoja agentov.

Primeri uporabe, ki so nekoč na vsakem koraku zahtevali prelomni model, lahko zdaj z manjšimi modeli, prilagajanjem ravni sklepanja in učinkovitimi arhitekturnimi odločitvami dosežejo primerljive ali boljše rezultate za bistveno nižjo ceno.

Komaj čakamo, da vidimo, kaj boste ustvarili!

  • 2026
  • Platforma API

O avtorjih

Ta vodnik so pripravili Samarth Madduru(odpre se v novem oknu), Prashant Mital(odpre se v novem oknu), Dave Leo(odpre se v novem oknu) in Julien Reiman(odpre se v novem oknu) na podlagi izkušenj tesnega sodelovanja z zagonskimi podjetji, ki so na GPT‑5.6 gradila vse od zgodnjega preizkušanja do produkcije.