Kalo te përmbajtja kryesore
OpenAI

13 gusht 2026

IA e aplikuar

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Duke ngarkuar…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Ne e vendosëm GPT‑5.6 në strukturën tonë dhe përpjekja e ulët e arsyetimit na dha rezultatet më të mira. Ai e kuptonte kur të dhënat thjesht nuk ekzistonin, nuk ndiqte pista të gabuara dhe arrinte te përgjigjja e duhur me më pak tokenë.
— Izzy Miller, Drejtori Kërkimor për IA-në, Hex(hapet në një dritare të re)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 nga 3
Luna ruan 98% të saktësisë së GPT‑5.5 në nxjerrjen e të dhënave me vetëm një të tetëmbëdhjetën e kostos. Kjo u jep agjentëve tanë aftësi të larta për të kuptuar dokumentet me një çmim që i bën më praktikë në shumë më tepër rrjedha pune.
— Serhii Shchoholiev, Drejtori i Inxhinierisë për Agjentët, Hypha(hapet në një dritare të re)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(hapet në një dritare të re) across model turns and using native compaction(hapet në një dritare të re) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(hapet në një dritare të re) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(hapet në një dritare të re) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Kur përdoren së bashku, diferenca mund të jetë e jashtëzakonshme. Për shembull, në ARC-AGI-3, GPT‑5.6 Sol arriti 13,3% me strukturën standarde. Por pas aktivizimit të arsyetimit të ruajtur dhe kompaktimit, rezultati u rrit në 38,3%, duke përdorur rreth 6 herë më pak tokenë dalës. Pa ndryshime të modelit, por me thuajse trefishin e performancës. Mund të lexosh më shumë këtu për hulumtimin tonë mbi strukturën e ARC-AGI-3.

Thirrja programatike e mjeteve

Rrjedhat e punës së agjentëve shpesh përfshijnë dy lloje punësh:

  1. Detyra që kërkojnë gjykim
  2. Punë që kërkon kryesisht zhvendosjen, filtrimin dhe kombinimin e të dhënave

Kur një agjent merr 100 dosje, ai i filtron sipas datës dhe identifikon transaksionet përkatëse, modeli nuk duhet të arsyetojë mbi çdo rezultat të ndërmjetëm në dritaren e vet të kontekstit. Thirrja programatike e mjeteve lejon që GPT‑5.6 të shkruajë në JavaScript për të orkestruar mjetet, për të ekzekutuar paralelisht thirrje të pavarura dhe për të përpunuar rezultatet e tyre jashtë dritares së kontekstit. Modeli përqendrohet tek ajo që kërkon inteligjencë: zbatimi i gjykimit.

Në kërkimet financiare, pjesa e vështirë është marrja e dosjeve të besueshme, koordinimi i mjeteve dhe analizimi i shifrave. Në vlerësimet tona, GPT‑5.6 me Thirrjen programatike të mjeteve arriti cilësinë e rubrikës sonë duke përdorur 21% më pak tokenë hyrës. Kjo është diferenca mes një agjenti që mund të diskutojë për kërkimet financiare dhe një tjetri që mund ta kryejë realisht atë.
— Alex Wang, IA-ja e Aplikuar, Rogo(hapet në një dritare të re)

Me shumë agjentë

Në detyrat komplekse që mund të kryhen paralelisht, shpërndarja e veprimeve dhe arsyetimit në disa rrjedha pune agjentësh mundëson përfundim më të shpejtë të detyrave dhe inteligjencë më të lartë. Në këto konfigurime, agjenti kryesor është përgjegjës për orkestrimin e nënagjentëve dhe delegimin e detyrave tek ata. Nënagjentët ndjekin objektivat e tyre paralelisht dhe në fund ia përcjellin rezultatet agjentit kryesor për përmbledhjen përfundimtare. Ekipet mund të fillojnë ta shfrytëzojnë funksionimin e integruar me shumë agjentë duke aktivizuar shumë agjentë(hapet në një dritare të re) në Responses API. Kështu funksionon edhe cilësimi i aftësisë Ultra në ChatGPT.

1 nga 2
Qualia përdor ekipe agjentësh për të punuar për probleme kërkimore të hapura dhe GPT‑5.6 Sol thjesht ishte e duhuri për këtë. Ai tregoi përmirësim të dukshëm krahasuar me GPT‑5.5, përfundoi më shpejt se thuajse çdo model tjetër që testuam dhe u bë shpejt modeli ynë i preferuar nga OpenAI.
— E Chi, Themelues, Quadrillion(hapet në një dritare të re)

Megjithëse GPT‑5.6 e përcakton mirë numrin e duhur të nënagjentëve dhe kohën kur duhen krijuar, sjellja me shumë agjentë mund të menaxhohet me shumë lehtësi. Udhëzimi i modelit se kur t'i thërrasë nënagjentët mund të rrisë mundësinë që agjentët të krijohen vetëm kur shpenzimi shtesë i tokenëve sjell një performancë më të mirë.

Ruajtja e promptit në memorien specifike

Në të gjithë familjen e modeleve, TTL-ja e ruajtjes së promptit në memorien specifike është zgjatur në të paktën 30 minuta dhe pikat e ndërprerjes tani mund të caktohen në mënyrë përcaktuese brenda dritares së kontekstit të një modeli. Kjo ka bërë të mundur që kompanitë e reja të përmirësojnë ndjeshëm normën e gjetjeve në memorien specifike.

Një kërkese të përbashkët prej 29 000 tokenësh ne i shtuam pika ndërprerjeje të memories specifike dhe çelësa specifikë të hapësirës së punës dhe i reduktuam të dhënat hyrëse të paruajtura me 28%. Edhe intervali 30-minutësh i memories specifike solli një përfitim të madh po ashtu: agjentët tanë mund të ripërdornin të njëjtin kontekst në ekzekutime të ndryshme në vend që të nisnin nga e para.
— Lorenzo Gentile, Inxhinier i IA-së, Ploy(hapet në një dritare të re)

Përveç caktimit të pikave të ndërprerjes, përdorimi i vazhdueshëm i një prompt_cache_key(hapet në një dritare të re) të përshtatshëm rrit gjasat që kërkesat të mbërrijnë tek i njëjti motor inference që ka përpunuar më parë të njëjtën parashtesë, duke reduktuar kështu vonesën.

Përfundimi

Ajo që bie në sy në këta shembuj është se sa shumë ka ndryshuar ekonomia e krijimit të agjentëve.

Rastet e përdorimit që dikur kërkonin një model avangardë në çdo hap, tani mund të arrijnë rezultate të krahasueshme ose më të mira me një kosto shumë herë më të ulët duke përdorur modele më të vogla, duke përshtatur përpjekjen e arsyetimit dhe duke bërë zgjedhje arkitekturore efikase.

Presim me padurim të shohim se çfarë do të ndërtoni!

  • 2026
  • Platforma API

Rreth autorëve

Ky udhëzues është zhvilluar nga Samarth Madduru(hapet në një dritare të re), Prashant Mital(hapet në një dritare të re), Dave Leo(hapet në një dritare të re) dhe Julien Reiman(hapet në një dritare të re), bazuar në përvojën e tyre të bashkëpunimit të ngushtë me kompanitë e reja që kanë ndërtuar me GPT‑5.6, nga testimet e hershme deri në prodhim.