Ugrás a fő tartalomra
OpenAI

2026. augusztus 13.

Alkalmazott AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Betöltés…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Beillesztettük a GPT‑5.6-ot a végrehajtási környezetünkbe, és alacsony érvelési ráfordítással kaptuk a legjobb eredményeket. Felismerte, ha egyszerűen nem állt rendelkezésre adat, nem indult el téves nyomokon, és kevesebb tokennel jutott el a helyes válaszhoz.
— Izzy Miller, MI-kutatási vezető, Hex(új ablakban nyílik meg)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 / 3
A Luna a költségek tizennyolcadáért megőrzi a GPT‑5.5 adatkinyerési pontosságának 98%-át. Így ügynökeink kiváló minőségű dokumentumértelmezést kapnak olyan áron, amely jóval több munkafolyamatban teszi praktikussá a használatát.
— Serhii Shchoholiev, az ügynökfejlesztés műszaki vezetője, Hypha(új ablakban nyílik meg)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(új ablakban nyílik meg) across model turns and using native compaction(új ablakban nyílik meg) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(új ablakban nyílik meg) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(új ablakban nyílik meg) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Ezeket együtt alkalmazva drámai lehet a különbség. Az ARC-AGI-3 teszten például a GPT‑5.6 Sol 13,3%-ot ért el a szabványos végrehajtási környezettel. A megőrzött érvelés és a kontextustömörítés bekapcsolása után azonban az eredmény 38,3%-ra ugrott, miközben a modell nagyjából hatszor kevesebb kimeneti tokent használt. A modell változatlan maradt, a teljesítmény mégis csaknem megháromszorozódott. Erről bővebben az ARC-AGI-3 végrehajtási környezetét vizsgáló elemzésünkben olvashat.

Programozott eszközhívás

Az ügynökalapú munkafolyamatok gyakran kétféle munkából állnak:

  1. Mérlegelést igénylő feladatok
  2. Főként adatok mozgatását, szűrését és összevonását igénylő munka

Amikor egy ügynök lekér 100 jelentést, dátum szerint szűri őket, és azonosítja a releváns tranzakciókat, a modellnek nem kellene minden köztes eredményt végigelemeznie a kontextusablakában. A programozott eszközhívással a GPT‑5.6 JavaScript-kódot írhat az eszközök összehangolására, a független hívások párhuzamos futtatására és kimenetük kontextusablakon kívüli feldolgozására. Így a modell arra összpontosíthat, ami intelligenciát igényel: a mérlegelésre.

A pénzügyi kutatás nehéz része a jelentések megbízható lekérése, az eszközök összehangolása és a számítások elvégzése. Értékeléseinkben a programozott eszközhívást használó GPT‑5.6 a szempontrendszerünk szerint azonos minőséget ért el, miközben 21%-kal kevesebb bemeneti tokent használt. Ez a különbség a pénzügyi kutatásról beszélni képes ügynök és az azt ténylegesen elvégezni képes ügynök között.
— Alex Wang, alkalmazott mesterséges intelligencia, Rogo(új ablakban nyílik meg)

Többügynökös működés

Az összetett, párhuzamosítható feladatoknál a műveletek és az érvelés több ügynöki munkafolyamat közötti elosztása gyorsabb feladatvégrehajtást és magasabb intelligenciát tesz lehetővé. Ezekben az elrendezésekben az elsődleges ügynök felel az alügynökök összehangolásáért és a feladatok kiosztásáért. Az alügynökök párhuzamosan dolgoznak céljaikon, majd eredményeiket visszaadják az elsődleges ügynöknek a végső összegzéshez. A csapatok közvetlenül kihasználhatják a többügynökös működést, ha engedélyezik azt(új ablakban nyílik meg) a Responses API-ban. A ChatGPT Ultra képességbeállítása is így működik.

1 / 2
A Qualia ügynökcsapatokat vet be nyitott végű kutatási problémák megoldására, és a GPT‑5.6 Sol egyszerűen bevált. Jelentős javulást mutatott a GPT‑5.5‑höz képest, szinte minden más tesztelt modellnél gyorsabban végzett, és hamar az első számú OpenAI-modellünkké vált.
— E Chi, alapító, Quadrillion(új ablakban nyílik meg)

Bár a GPT‑5.6 jól felméri, hány alügynökre van szükség, és mikor érdemes elindítani őket, a többügynökös viselkedés nagymértékben irányítható. Ha utasítást adunk a modellnek arra, mikor hívjon alügynököket, nagyobb eséllyel csak olyan helyzetekben indítja el őket, amikor a további tokenráfordítás jobb teljesítményt eredményez.

Prompt-gyorsítótárazás

A teljes modellcsaládnál legalább 30 percre nőtt a prompt-gyorsítótár élettartama, és a gyorsítótár töréspontjai mostantól determinisztikusan állíthatók be a modell kontextusablakán belül. Ennek köszönhetően a startupok jelentősen javíthatták a gyorsítótár-találati arányukat.

Gyorsítótár-töréspontokat és munkaterület-specifikus kulcsokat adtunk egy közös, 29 000 tokenes utasításhoz, így 28%-kal csökkentettük a gyorsítótárból ki nem szolgált bemenetet. A 30 perces gyorsítótárazási idő is nagy áttörést hozott: ügynökeink az egyes futások között újra felhasználhatták ugyanazt a kontextust, ahelyett hogy elölről kezdték volna.
— Lorenzo Gentile, MI-mérnök, Ploy(új ablakban nyílik meg)

A gyorsítótár-töréspontok beállítása mellett egy megfelelő prompt_cache_key(új ablakban nyílik meg) folyamatos használata növeli annak esélyét, hogy a kérések ugyanarra a következtetési motorra kerüljenek, amely korábban már kiszolgálta ugyanazt az előtagot, ezáltal csökkentve a késleltetést.

Összegzés

Ezekből a példákból leginkább az tűnik ki, mennyit változott az ügynökök fejlesztésének gazdaságossága.

Azok a felhasználási esetek, amelyek korábban minden lépésnél élvonalbeli modellt igényeltek, ma már kisebb modellekkel, az érvelési ráfordítás finomhangolásával és hatékony architekturális döntésekkel a költségek töredékéért érhetnek el hasonló vagy jobb eredményt.

Izgatottan várjuk, mit építenek majd!

  • 2026
  • API Platform

A szerzőkről

Az útmutatót Samarth Madduru(új ablakban nyílik meg), Prashant Mital(új ablakban nyílik meg), Dave Leo(új ablakban nyílik meg) és Julien Reiman(új ablakban nyílik meg) készítette azon tapasztalataik alapján, amelyeket a GPT‑5.6-ra építő startupokkal végzett szoros együttműködés során szereztek, a korai teszteléstől egészen az éles bevezetésig.