The builder’s guide to GPT‑5.6
Technical lessons from startups in production
The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.
In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.
Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.
The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.
Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.
Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.
The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.
In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:
- Reuse work already performed: by allowing reasoning to be persisted(відкривається у новому вікні) across model turns and using native compaction(відкривається у новому вікні) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
- Parallel decomposition where appropriate: using native multi-agent orchestration(відкривається у новому вікні) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
- Move deterministic work into code: using programmatic tool calling(відкривається у новому вікні) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.
Спільне використання цих можливостей може кардинально змінити результат. Наприклад, в ARC-AGI-3 модель GPT‑5.6 Sol набрала 13,3% зі стандартною системою harness. Однак після ввімкнення збереженого міркування та ущільнення показник зріс до 38,3% — із приблизно вшестеро меншою кількістю вихідних токенів. Модель не змінилася, а результат зріс майже втричі. Докладніше читайте в нашому дослідженні системи harness для ARC-AGI-3.
Агентні робочі процеси часто охоплюють два види роботи:
- Завдання, що потребують оцінювання
- Робота, що переважно полягає в переміщенні, фільтруванні й об’єднанні даних
Коли агент отримує 100 звітних документів, фільтрує їх за датою та визначає релевантні транзакції, модель не повинна аналізувати кожен проміжний результат у межах свого ліміту контексту. Програмне викликання інструментів дає GPT‑5.6 змогу писати JavaScript для оркестрації інструментів, паралельно виконувати незалежні виклики й обробляти їхні результати поза лімітом контексту. Завдяки цьому модель зосереджується на тому, що потребує інтелектуальних можливостей: на оцінюванні.
У складних завданнях, які можна розпаралелити, розподіл дій і міркування між кількома потоками роботи агентів пришвидшує виконання та підвищує інтелектуальні можливості системи. У таких конфігураціях основний агент оркеструє субагентів і делегує їм завдання. Субагенти паралельно виконують свої завдання, а потім передають результати основному агенту для остаточного узагальнення. Команди можуть одразу скористатися вбудованою багатоагентною роботою, увімкнувши багатоагентний режим(відкривається у новому вікні) в API Responses. Саме так працює й налаштування можливостей Ultra у ChatGPT.
“Qualia залучає команди агентів до відкритих дослідницьких задач, і GPT‑5.6 Sol одразу нам підійшла. Вона помітно перевершила GPT‑5.5, виконала завдання швидше за майже всі інші протестовані нами моделі й швидко стала нашою основною моделлю OpenAI.”
“GPT‑5.6 — найкращий оркестратор, який ми бачили від OpenAI. Ми одночасно дали їй шість специфікацій — попросили написати, реалізувати й обговорити кожну — і вона нічого не втратила з поля зору та зберегла якість.”
Хоча GPT‑5.6 добре визначає доречну кількість субагентів і момент їх запуску, багатоагентною поведінкою легко керувати. Вказівки моделі щодо того, коли залучати субагентів, підвищують імовірність їх запуску лише тоді, коли додаткові витрати токенів справді покращать результат.
Для всього сімейства моделей TTL кешу промпту збільшено щонайменше до 30 хвилин, а контрольні точки кешу тепер можна детерміновано задавати в межах ліміту контексту моделі. Завдяки цьому стартапи змогли значно підвищити частку влучань у кеш.
Окрім налаштування контрольних точок кешу, подальше використання відповідного ключа prompt_cache_key(відкривається у новому вікні) підвищує ймовірність спрямування запиту до того самого рушія інференсу, який раніше обслуговував такий самий префікс, і в такий спосіб зменшує затримку.
Усі ці приклади наочно показують, наскільки змінилася економіка створення агентів.
Сценарії, у яких раніше на кожному етапі була потрібна передова модель, тепер можуть забезпечувати порівнянні або кращі результати за значно нижчою ціною завдяки меншим моделям, налаштуванню рівня міркування та ефективним архітектурним рішенням.
Нам не терпиться побачити, що ви створите!
- 2026
- Платформа API
Про авторів
Цей посібник підготували Самарт Маддуру(відкривається у новому вікні), Прашант Мітал(відкривається у новому вікні), Дейв Лео(відкривається у новому вікні) та Жульєн Райман(відкривається у новому вікні) на основі досвіду тісної співпраці зі стартапами, що створювали рішення на GPT‑5.6 — від раннього тестування до виробничого запуску.


