Přeskoč na hlavní obsah
OpenAI

13. srpna 2026

Aplikovaná AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Načítání…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Nasadili jsme GPT‑5.6 do našeho harnessu a nejlepších výsledků jsme dosáhli s nízkou mírou uvažování. Rozpoznal, když potřebná data jednoduše nebyla k dispozici, nesledoval falešné stopy a ke správné odpovědi dospěl s menším počtem tokenů.
— Izzy Miller, vedoucí výzkumu AI, Hex(otevře se v novém okně)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 z 3
Luna si zachovává 98 % přesnosti extrakce modelu GPT‑5.5 za osmnáctinu nákladů. Naši agenti tak získávají kvalitní porozumění dokumentům za cenu, která umožňuje praktické využití v mnohem více pracovních postupech.
— Serhii Shchoholiev, vedoucí vývoje agentů, Hypha(otevře se v novém okně)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(otevře se v novém okně) across model turns and using native compaction(otevře se v novém okně) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(otevře se v novém okně) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(otevře se v novém okně) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Při společném použití může být rozdíl dramatický. Například v testu ARC-AGI-3 dosáhl GPT‑5.6 Sol se standardním harnessem skóre 13,3 %. Po zapnutí uchovávání uvažování a kompakce však skóre vzrostlo na 38,3 %, přičemž model použil přibližně šestkrát méně výstupních tokenů. Model se nezměnil, ale výkon se téměř ztrojnásobil. Více se dočtete v našem zkoumání harnessu ARC-AGI-3.

Programové volání nástrojů

Pracovní postupy agentů často zahrnují dva druhy práce:

  1. Úlohy vyžadující úsudek
  2. Práce spočívající převážně v přesouvání, filtrování a kombinování dat

Když agent získá 100 regulatorních dokumentů, filtruje je podle data a vyhledává relevantní transakce, model by neměl být nucen uvažovat v kontextovém okně nad každým mezivýsledkem. Programové volání nástrojů umožňuje modelu GPT‑5.6 psát JavaScript pro orchestraci nástrojů, spouštět nezávislá volání paralelně a zpracovávat jejich výstupy mimo kontextové okno. Model se tak může soustředit na to, co vyžaduje inteligenci: uplatnění úsudku.

Ve finančním výzkumu je nejtěžší spolehlivě získávat regulatorní dokumenty, koordinovat nástroje a zpracovávat čísla. V našich hodnoceních dosáhl GPT‑5.6 s programovým voláním nástrojů stejné kvality podle našich kritérií, přitom použil o 21 % méně vstupních tokenů. Právě to odlišuje agenta, který umí o finančním výzkumu diskutovat, od agenta, který ho dokáže skutečně provést.
— Alex Wang, aplikovaná AI, Rogo(otevře se v novém okně)

Multiagentní práce

U složitých úloh, které lze zpracovávat paralelně, umožňuje rozdělení akcí a uvažování mezi několik pracovních proudů agentů rychlejší provedení i vyšší inteligenci. V takovém uspořádání hlavní agent orchestruje dílčí agenty a deleguje jim úlohy. Dílčí agenti plní své cíle paralelně a nakonec předají výstupy hlavnímu agentovi k závěrečné syntéze. Týmy mohou nativní podporu více agentů začít využívat zapnutím multiagentního režimu(otevře se v novém okně) v Responses API. Stejným způsobem funguje i nastavení schopností „Ultra“ v ChatGPT.

1 z 2
Qualia nasazuje týmy agentů na otevřené výzkumné problémy a GPT‑5.6 Sol si s nimi zkrátka poradil. Oproti GPT‑5.5 přinesl výrazné zlepšení, práci dokončil rychleji než téměř všechny ostatní testované modely a rychle se stal naším preferovaným modelem OpenAI.
— E Chi, zakladatel, Quadrillion(otevře se v novém okně)

Přestože GPT‑5.6 dobře odhaduje vhodný počet dílčích agentů i okamžik jejich spuštění, jeho chování v multiagentním režimu je velmi ovladatelné. Pokyny, kdy má model spouštět dílčí agenty, mohou zvýšit pravděpodobnost, že je vytvoří jen v situacích, kdy tato vyšší spotřeba tokenů povede k lepšímu výkonu.

Ukládání promptů do mezipaměti

U celé rodiny modelů byla minimální doba platnosti mezipaměti promptů prodloužena na 30 minut a body přerušení mezipaměti lze nyní deterministicky nastavit v kontextovém okně modelu. Startupy tak mohou výrazně zvýšit podíl požadavků obsloužených z mezipaměti.

Do sdíleného promptu o 29 000 tokenech jsme přidali body přerušení mezipaměti a klíče specifické pro pracovní prostor, čímž jsme objem vstupu mimo mezipaměť snížili o 28 %. Velký přínos mělo i 30minutové okno mezipaměti: naši agenti mohli mezi jednotlivými běhy znovu používat stejný kontext a nemuseli pokaždé začínat od nuly.
— Lorenzo Gentile, AI inženýr, Ploy(otevře se v novém okně)

Vedle nastavení bodů přerušení mezipaměti zvyšuje další používání příslušného klíče prompt_cache_key(otevře se v novém okně) pravděpodobnost, že požadavek zpracuje stejný inferenční modul, který už dříve obsloužil totožný prefix, a tím se sníží latence.

Závěr

Na těchto příkladech vyniká především to, jak výrazně se změnila ekonomika vývoje agentů.

Případy použití, které dříve v každém kroku vyžadovaly průkopnický model, mohou nyní dosahovat srovnatelných či lepších výsledků za zlomek nákladů díky menším modelům, vyladění míry uvažování a efektivním architektonickým rozhodnutím.

Těšíme se, co všechno vytvoříte!

  • 2026
  • Platforma API

O autorech

Tohoto průvodce vytvořili Samarth Madduru(otevře se v novém okně), Prashant Mital(otevře se v novém okně), Dave Leo(otevře se v novém okně) a Julien Reiman(otevře se v novém okně) na základě zkušeností z úzké spolupráce se startupy, které stavěly na GPT‑5.6 od prvních testů až po produkční nasazení.