Перейти до основного вмісту
OpenAI

13 серпня 2026 р.

Прикладний ШІ

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Завантаження…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Ми інтегрували GPT‑5.6 у нашу систему harness, і низький рівень міркування дав нам найкращі результати. Модель розуміла, коли даних просто немає, не йшла хибним слідом і знаходила правильну відповідь із меншою кількістю токенів.
— Іззі Міллер, керівниця досліджень ШІ, Hex(відкривається у новому вікні)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 із 3
Luna зберігає 98% точності вилучення даних GPT‑5.5 за вісімнадцяту частину її вартості. Завдяки цьому наші агенти якісно розуміють документи за ціною, що робить таке рішення практичним для значно більшої кількості робочих процесів.
— Сергій Щоголєв, керівник інженерного напряму агентів, Hypha(відкривається у новому вікні)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(відкривається у новому вікні) across model turns and using native compaction(відкривається у новому вікні) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(відкривається у новому вікні) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(відкривається у новому вікні) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Спільне використання цих можливостей може кардинально змінити результат. Наприклад, в ARC-AGI-3 модель GPT‑5.6 Sol набрала 13,3% зі стандартною системою harness. Однак після ввімкнення збереженого міркування та ущільнення показник зріс до 38,3% — із приблизно вшестеро меншою кількістю вихідних токенів. Модель не змінилася, а результат зріс майже втричі. Докладніше читайте в нашому дослідженні системи harness для ARC-AGI-3.

Програмне викликання інструментів

Агентні робочі процеси часто охоплюють два види роботи:

  1. Завдання, що потребують оцінювання
  2. Робота, що переважно полягає в переміщенні, фільтруванні й об’єднанні даних

Коли агент отримує 100 звітних документів, фільтрує їх за датою та визначає релевантні транзакції, модель не повинна аналізувати кожен проміжний результат у межах свого ліміту контексту. Програмне викликання інструментів дає GPT‑5.6 змогу писати JavaScript для оркестрації інструментів, паралельно виконувати незалежні виклики й обробляти їхні результати поза лімітом контексту. Завдяки цьому модель зосереджується на тому, що потребує інтелектуальних можливостей: на оцінюванні.

Найскладніше у фінансових дослідженнях — надійно отримувати звітні документи, координувати інструменти й опрацьовувати цифри. У наших оцінюваннях GPT‑5.6 із програмним викликанням інструментів забезпечила передбачену нашою рубрикою якість, використавши на 21% менше вхідних токенів. Саме це відрізняє агента, здатного обговорювати фінансові дослідження, від агента, здатного справді їх виконувати.
— Алекс Ван, прикладний ШІ, Rogo(відкривається у новому вікні)

Багатоагентна робота

У складних завданнях, які можна розпаралелити, розподіл дій і міркування між кількома потоками роботи агентів пришвидшує виконання та підвищує інтелектуальні можливості системи. У таких конфігураціях основний агент оркеструє субагентів і делегує їм завдання. Субагенти паралельно виконують свої завдання, а потім передають результати основному агенту для остаточного узагальнення. Команди можуть одразу скористатися вбудованою багатоагентною роботою, увімкнувши багатоагентний режим(відкривається у новому вікні) в API Responses. Саме так працює й налаштування можливостей Ultra у ChatGPT.

1 із 2
Qualia залучає команди агентів до відкритих дослідницьких задач, і GPT‑5.6 Sol одразу нам підійшла. Вона помітно перевершила GPT‑5.5, виконала завдання швидше за майже всі інші протестовані нами моделі й швидко стала нашою основною моделлю OpenAI.
— Е Чі, засновник, Quadrillion(відкривається у новому вікні)

Хоча GPT‑5.6 добре визначає доречну кількість субагентів і момент їх запуску, багатоагентною поведінкою легко керувати. Вказівки моделі щодо того, коли залучати субагентів, підвищують імовірність їх запуску лише тоді, коли додаткові витрати токенів справді покращать результат.

Кешування промпту

Для всього сімейства моделей TTL кешу промпту збільшено щонайменше до 30 хвилин, а контрольні точки кешу тепер можна детерміновано задавати в межах ліміту контексту моделі. Завдяки цьому стартапи змогли значно підвищити частку влучань у кеш.

Ми додали контрольні точки кешу та ключі для окремих робочих просторів до спільного запиту на 29 000 токенів і скоротили некешовані вхідні дані на 28%. 30-хвилинне вікно кешу теж відкрило великі можливості: наші агенти могли повторно використовувати той самий контекст у різних запусках, а не починати з нуля.
— Лоренцо Джентіле, інженер ШІ, Ploy(відкривається у новому вікні)

Окрім налаштування контрольних точок кешу, подальше використання відповідного ключа prompt_cache_key(відкривається у новому вікні) підвищує ймовірність спрямування запиту до того самого рушія інференсу, який раніше обслуговував такий самий префікс, і в такий спосіб зменшує затримку.

Висновок

Усі ці приклади наочно показують, наскільки змінилася економіка створення агентів.

Сценарії, у яких раніше на кожному етапі була потрібна передова модель, тепер можуть забезпечувати порівнянні або кращі результати за значно нижчою ціною завдяки меншим моделям, налаштуванню рівня міркування та ефективним архітектурним рішенням.

Нам не терпиться побачити, що ви створите!

  • 2026
  • Платформа API

Про авторів

Цей посібник підготували Самарт Маддуру(відкривається у новому вікні), Прашант Мітал(відкривається у новому вікні), Дейв Лео(відкривається у новому вікні) та Жульєн Райман(відкривається у новому вікні) на основі досвіду тісної співпраці зі стартапами, що створювали рішення на GPT‑5.6 — від раннього тестування до виробничого запуску.