Преминаване към основното съдържание
OpenAI

13 август 2026 г.

Приложен AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Зареждане…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Интегрирахме GPT‑5.6 в базовата ни рамка и ниското усилие за структурирано анализиране ни даде най-добрите резултати. Моделът разпознаваше кога данните просто липсват, не следваше погрешни следи и стигаше до верния отговор с по-малко токени.
– Изи Милър, ръководител на изследванията в областта на ИИ, Hex(отваря се в нов прозорец)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 от 3
Luna запазва 98% от точността на GPT‑5.5 при извличане на информация на една осемнадесета от цената. Така агентите ни разбират документите с високо качество на цена, която прави използването им практично в много повече работни процеси.
– Сергий Щоголев, ръководител на инженерния екип за агенти, Hypha(отваря се в нов прозорец)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(отваря се в нов прозорец) across model turns and using native compaction(отваря се в нов прозорец) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(отваря се в нов прозорец) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(отваря се в нов прозорец) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Използвани заедно, те могат да доведат до драстична разлика. Например в ARC-AGI-3 GPT‑5.6 Sol постигна 13,3% със стандартната базова рамка. След активирането на запазено структурирано анализиране и компресиране обаче резултатът скочи до 38,3% – при използване на приблизително 6 пъти по-малко изходни токени. Без промени в модела, но с почти три пъти по-висока производителност. Можете да научите повече от нашето проучване на базовата рамка за ARC-AGI-3.

Програмно извикване на инструменти

Агентните работни процеси често включват два вида работа:

  1. Задачи, които изискват преценка
  2. Работа, която включва основно преместване, филтриране и комбиниране на данни

Когато агент извлича 100 регулаторни документа, филтрира ги по дата и определи съответните трансакции, моделът не би трябвало да анализира всеки междинен резултат в контекстния си прозорец. Програмното извикване на инструменти позволява на GPT‑5.6 да пише JavaScript за оркестриране на инструменти, паралелно изпълнение на независими извиквания и обработване на резултатите им извън контекстния прозорец. Така моделът се съсредоточава върху онова, което изисква интелигентност: прилагането на преценка.

При финансовите проучвания трудното е надеждното извличане на регулаторни документи, координирането на инструментите и обработването на числата. В нашите оценки GPT‑5.6 с Програмното извикване на инструменти постигна качеството по нашата рубрика с 21% по-малко входни токени. Именно това е разликата между агент, който може да обсъжда финансови проучвания, и такъв, който действително може да ги извършва.
– Алекс Уанг, приложен ИИ, Rogo(отваря се в нов прозорец)

Многоагентна работа

При сложни задачи, подходящи за паралелна работа, разпределянето на действията и структурираното анализиране между няколко работни потока с агенти позволява по-бързо изпълнение и по-висока интелигентност. При такива конфигурации основният агент отговаря за оркестрирането на подагентите и делегирането на задачи към тях. Подагентите работят паралелно по целите си и накрая връщат резултатите на основния агент за окончателно обобщаване. Екипите могат да започнат да използват вградената работа с множество агенти, като активират режима за многоагентна работа(отваря се в нов прозорец) в Responses API. По същия начин работи и настройката за възможности Ultra в ChatGPT.

1 от 2
Qualia използва екипи от агенти за изследователски задачи с отворен край, а GPT‑5.6 Sol просто сработи идеално. Той показа значително подобрение спрямо GPT‑5.5, приключваше задачите по-бързо от почти всеки друг тестван модел и бързо се превърна в предпочитания ни модел на OpenAI.
– Е Чи, основател, Quadrillion(отваря се в нов прозорец)

Въпреки че GPT‑5.6 има добра преценка за подходящия брой подагенти и кога да ги стартира, поведението при многоагентна работа може лесно да се управлява. Като инструктирате модела кога да извиква подагенти, можете да увеличите вероятността той да стартира агенти само в ситуации, в които допълнителният разход на токени би довел до по-добра производителност.

Кеширане на подкани

За цялото семейство модели минималният TTL на кеша за подкани е удължен до минимум 30 минути, а точките за прекъсване на кеширането вече могат да се задават детерминистично в рамките на контекстния прозорец на модела. Това позволи на стартъпите значително да повишат процента на попадения в кеша.

Добавихме точки за прекъсване на кеширането и специфични за работното пространство ключове към споделена подкана от 29 000 токена и намалихме некеширания вход с 28%. 30-минутният прозорец за кеширане също отключи големи възможности: агентите ни можеха да използват повторно същия контекст при различни изпълнения, вместо всеки път да започват отначало.
– Лоренцо Джентиле, инженер по ИИ, Ploy(отваря се в нов прозорец)

Освен задаването на точки за прекъсване на кеширането, продължаването на използването на подходящ prompt_cache_key(отваря се в нов прозорец) увеличава вероятността заявките да попаднат на същата инференционна машина, която преди е обработила същия префикс, като по този начин се намалява латентността.

Заключение

Това, което се откроява във всички тези примери, е колко много се е променил икономическият модел при изграждането на агенти.

Приложения, които преди изискваха авангарден модел на всяка стъпка, вече могат да постигат сравними или по-добри резултати на много по-ниска цена чрез по-малки модели, настройване на усилието за структурирано анализиране и ефективни архитектурни решения.

Нямаме търпение да видим какво ще създадете!

  • 2026 г.
  • API платформа

За авторите

Това ръководство е разработено от Самарт Мадуру(отваря се в нов прозорец), Прашант Митал(отваря се в нов прозорец), Дейв Лио(отваря се в нов прозорец) и Жулиен Райман(отваря се в нов прозорец) въз основа на опита им от тясната работа със стартъпи, изграждащи решения с GPT‑5.6 – от първоначалните тестове до внедряването в реална среда.