Переход к основному контенту
OpenAI

13 августа 2026 г.

Прикладной ИИ

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Загрузка…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Мы просто подключили GPT‑5.6 к нашей обвязке, и низкий уровень усилий на рассуждения дал лучшие результаты. Модель понимала, когда нужных данных просто нет, не шла по ложному следу и находила верный ответ с меньшим числом токенов.
— Иззи Миллер, руководитель исследований в области ИИ, Hex(открывается в новом окне)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 из 3
Luna сохраняет 98% точности извлечения GPT‑5.5 при стоимости в 18 раз ниже. Благодаря этому наши агенты качественно анализируют документы по цене, которая позволяет применять их в гораздо большем числе процессов.
— Сергей Щоголев, руководитель разработки агентов, Hypha(открывается в новом окне)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(открывается в новом окне) across model turns and using native compaction(открывается в новом окне) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(открывается в новом окне) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(открывается в новом окне) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

В совокупности эти возможности могут дать впечатляющий результат. Например, в ARC-AGI-3 модель GPT‑5.6 Sol набрала 13,3% со стандартной обвязкой. Однако после включения сохранения рассуждений и сжатия контекста результат вырос до 38,3%, а выходных токенов потребовалось примерно в шесть раз меньше. Модель не изменилась, а результат вырос почти втрое. Подробнее читайте в нашем исследовании обвязки ARC-AGI-3.

Программный вызов инструментов

Агентные процессы часто включают два типа работы:

  1. Задачи, требующие оценки
  2. Работа, которая в основном сводится к перемещению, фильтрации и объединению данных

Когда агент получает 100 отчетов, фильтрует их по дате и определяет релевантные транзакции, модели не нужно анализировать каждый промежуточный результат в своем контекстном окне. Программный вызов инструментов позволяет GPT‑5.6 писать код JavaScript для оркестрации инструментов, параллельно выполнять независимые вызовы и обрабатывать их результаты вне контекстного окна. Модель может сосредоточиться на том, где действительно нужен интеллект: на принятии решений.

В финансовых исследованиях самое сложное — надежно получать отчетность, координировать инструменты и анализировать цифры. В наших тестах GPT‑5.6 с программным вызовом инструментов обеспечила качество по нашей системе оценки, использовав на 21% меньше входных токенов. Именно это отличает агента, способного обсуждать финансовые исследования, от агента, который действительно может их проводить.
— Алекс Ван, прикладной ИИ, Rogo(открывается в новом окне)

Многоагентный режим

В сложных задачах, допускающих распараллеливание, распределение действий и рассуждений между несколькими потоками агентов позволяет быстрее выполнять работу и повышать качество интеллектуальной обработки. В таких конфигурациях основной агент оркестрирует субагентов и делегирует им задачи. Субагенты параллельно выполняют свои задачи, а затем передают результаты основному агенту для итогового обобщения. Команды могут начать использовать встроенный многоагентный режим, включив многоагентную работу(открывается в новом окне) в Responses API. Так же работает настройка возможностей Ultra в ChatGPT.

1 из 2
Qualia задействует команды агентов для решения исследовательских задач с открытым ответом, и GPT‑5.6 Sol сразу пришлась нам по душе. Она заметно превзошла GPT‑5.5, справилась быстрее почти всех других протестированных нами моделей и быстро стала нашей основной моделью OpenAI.
— Э. Чи, основатель, Quadrillion(открывается в новом окне)

Хотя GPT‑5.6 хорошо определяет нужное число субагентов и момент их запуска, многоагентным поведением легко управлять. Указав модели, когда следует вызывать субагентов, можно повысить вероятность того, что они будут запускаться лишь в ситуациях, где дополнительные затраты токенов действительно улучшают результат.

Кэширование промптов

Для всего семейства моделей минимальный срок жизни кэша промптов увеличен до 30 минут, а точки разрыва кэша теперь можно детерминированно задавать в контекстном окне модели. Благодаря этому стартапы смогли значительно повысить долю попаданий в кэш.

Мы добавили точки разрыва кэша и отдельные ключи для рабочих областей в общий промпт на 29 000 токенов и сократили объем некэшируемых входных данных на 28%. 30-минутное окно кэша тоже открыло большие возможности: наши агенты смогли повторно использовать один контекст в разных запусках, а не начинать с нуля.
— Лоренцо Джентиле, инженер по ИИ, Ploy(открывается в новом окне)

Помимо настройки точек разрыва кэша, дальнейшее использование подходящего ключа prompt_cache_key(открывается в новом окне) повышает вероятность того, что запрос попадет на тот же механизм инференса, который ранее обрабатывал тот же префикс, и тем самым снижает задержку.

Заключение

Эти примеры особенно наглядно показывают, насколько изменилась экономика разработки агентов.

Сценарии, где раньше на каждом этапе требовалась передовая модель, теперь могут обеспечивать сопоставимые или лучшие результаты за малую долю прежней стоимости благодаря небольшим моделям, настройке усилий на рассуждения и эффективным архитектурным решениям.

Нам не терпится увидеть, что вы создадите!

  • 2026
  • Платформа API

Об авторах

Это руководство подготовили Самарт Маддуру(открывается в новом окне), Прашант Митал(открывается в новом окне), Дэйв Лео(открывается в новом окне) и Жюльен Райман(открывается в новом окне), опираясь на опыт тесной работы со стартапами, создававшими решения на базе GPT‑5.6 с этапа раннего тестирования до запуска в продакшене.