Lumaktaw sa pangunahing content
OpenAI

Agosto 13, 2026

Inilapat na AI

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Naglo-load…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Inilagay namin ang GPT‑5.6 sa aming harness, at ang mababang pagsisikap sa pangangatwiran ang nagbigay ng pinakamahusay naming mga resulta. Alam nito kung kailan talagang wala ang data, hindi ito humabol sa mga maling lead, at nakuha nito ang tamang sagot gamit ang mas kaunting token.
— Izzy Miller, Pinuno ng AI Research, Hex(magbubukas sa bagong window)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 sa 3
Napananatili ng Luna ang 98% ng katumpakan ng GPT‑5.5 sa extraction sa halagang ikalabingwalong bahagi lamang. Dahil dito, nagkakaroon ang aming mga agent ng mataas na kalidad na pag-unawa sa dokumento sa presyong praktikal para sa mas marami pang workflow.
— Serhii Shchoholiev, Pinuno ng Engineering, Mga Agent, Hypha(magbubukas sa bagong window)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(magbubukas sa bagong window) across model turns and using native compaction(magbubukas sa bagong window) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(magbubukas sa bagong window) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(magbubukas sa bagong window) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Kapag pinagsama-sama, maaaring maging napakalaki ng epekto. Halimbawa, sa ARC-AGI-3, nakakuha ang GPT‑5.6 Sol ng 13.3% gamit ang karaniwang harness. Ngunit matapos paganahin ang retained reasoning at compaction, tumaas ang score sa 38.3%—habang gumagamit ng humigit-kumulang 6× na mas kaunting output token. Walang pagbabago sa modelo, ngunit halos tatlong beses ang performance. Makakabasa pa tungkol dito sa aming pagsisiyasat sa ARC-AGI-3 harness.

Programmatic Tool Calling

Kadalasang may dalawang uri ng gawain ang mga agentic workflow:

  1. Mga gawaing nangangailangan ng pagpapasya
  2. Gawaing pangunahing nangangailangan ng paglilipat, pag-filter, at pagsasama-sama ng data

Kapag kumuha ang isang agent ng 100 filing, nag-filter ayon sa petsa, at tumukoy ng mahahalagang transaksiyon, hindi na dapat pangatwiranan ng modelo ang bawat pansamantalang resulta sa context window nito. Sa Programmatic Tool Calling, makasusulat ang GPT‑5.6 ng JavaScript upang mag-orchestrate ng mga tool, sabay-sabay na magpatakbo ng mga hiwalay na tawag, at iproseso ang mga output ng mga ito sa labas ng context window. Sa gayon, makapagtutuon ang modelo sa nangangailangan ng talino: ang mahusay na pagpapasya.

Sa pananaliksik sa pananalapi, ang mahirap ay ang maaasahang pagkuha ng mga filing, koordinasyon ng mga tool, at pagsusuri sa mga numero. Sa aming mga pagsusuri, naabot ng GPT‑5.6 na gumagamit ng Programmatic Tool Calling ang kalidad ayon sa aming rubric habang gumagamit ng 21% mas kaunting input token. Iyan ang kaibahan ng agent na kayang talakayin ang pananaliksik sa pananalapi at ng agent na aktuwal itong naisasagawa.
— Alex Wang, Applied AI, Rogo(magbubukas sa bagong window)

Multi-agent

Sa mga komplikado at maaaring pagsabay-sabayin na gawain, ang pamamahagi ng mga aksiyon at pangangatwiran sa maraming workstream ng agent ay nagpapabilis sa pagkumpleto at nagpapataas ng intelligence. Sa ganitong setup, responsibilidad ng pangunahing agent na i-orchestrate ang mga subagent at magtalaga ng mga gawain sa kanila. Sabay-sabay na tinutupad ng mga subagent ang kani-kanilang layunin at ibinabalik ang kanilang output sa pangunahing agent para sa panghuling pagbubuo. Maaaring simulang gamitin ng mga team ang native multi-agent sa pamamagitan ng pag-enable sa multi-agent(magbubukas sa bagong window) sa Responses API. Ganito rin gumagana ang Ultra capability setting sa ChatGPT.

1 sa 2
Nagpapatakbo ang Qualia ng mga pangkat ng agent para sa mga bukas na problema sa pananaliksik, at naging swak agad ang GPT‑5.6 Sol. Kapansin-pansin ang paghusay nito kumpara sa GPT‑5.5, natapos ito nang mas mabilis kaysa sa halos lahat ng iba pang modelong sinubukan namin, at agad itong naging pangunahing OpenAI modelo namin.
— E Chi, Tagapagtatag, Quadrillion(magbubukas sa bagong window)

Bagama’t mahusay matukoy ng GPT‑5.6 ang angkop na bilang ng mga subagent at kung kailan sila bubuuin, lubos na magagabayan ang kilos nito sa multi-agent. Ang pagtuturo sa modelo kung kailan gagamit ng mga subagent ay makatutulong upang bumuo lamang ito ng mga agent kapag magdudulot ng mas mahusay na performance ang karagdagang gastos sa token.

Prompt Caching

Sa buong pamilya ng mga modelo, pinalawig sa hindi bababa sa 30 minuto ang TTL ng prompt cache, at maaari na ngayong deterministikong itakda ang mga cache breakpoint sa loob ng context window ng isang modelo. Dahil dito, lubos na napahusay ng mga startup ang kanilang cache hit rate.

Nagdagdag kami ng mga cache breakpoint at key na partikular sa workspace sa isang nakabahaging prompt na may 29,000 token, at nabawasan nang 28% ang hindi naka-cache na input. Malaking tulong din ang 30 minutong cache window: nagamit muli ng aming mga agent ang parehong konteksto sa iba’t ibang run sa halip na magsimula sa wala.
— Lorenzo Gentile, AI Engineer, Ploy(magbubukas sa bagong window)

Bukod sa pagtatakda ng mga cache breakpoint, ang patuloy na paggamit ng angkop na prompt_cache_key(magbubukas sa bagong window) ay nagpapataas sa posibilidad na mapunta ang mga request sa parehong inference engine na dati nang nagproseso sa kaparehong prefix, kaya nababawasan ang latency.

Konklusyon

Ang kapansin-pansin sa lahat ng halimbawang ito ay kung gaano kalaki ang ipinagbago ng gastos sa pagbuo ng mga agent.

Ang mga gamit na dati’y nangangailangan ng frontier na modelo sa bawat hakbang ay maaari na ngayong makamit ang kapantay o mas mahusay na resulta sa maliit na bahagi ng gastos sa pamamagitan ng mas maliliit na modelo, pagsasaayos ng pagsisikap sa pangangatwiran, at episyenteng pagpili ng arkitektura.

Sabik kaming makita ang mga bubuuin ninyo!

  • 2026
  • API Platform

Tungkol sa mga may-akda

Binuo ang gabay na ito nina Samarth Madduru(magbubukas sa bagong window), Prashant Mital(magbubukas sa bagong window), Dave Leo(magbubukas sa bagong window), at Julien Reiman(magbubukas sa bagong window), batay sa kanilang karanasan sa malapit na pakikipagtulungan sa mga startup na bumubuo gamit ang GPT‑5.6, mula sa maagang pagsubok hanggang sa production.