Preskočite na glavni sadržaj
OpenAI

13. kolovoza 2026.

Primijenjena AI

Vodič za razvoj uz GPT‑5.6

Tehničke pouke startupova iz produkcijskog okruženja

Učitavanje…

GPT‑5.6 postavlja novi standard omjera cijene i performansi

Obitelj modela GPT‑5.6 omogućuje performanse agenata na razini najnaprednijih modela uz znatno niže troškove, a istodobno pomiče granice mogućeg.

U ovom vodiču pokazujemo kako startupovi uz pametniji odabir modela i nove API kontrole za kontinuitet rasuđivanja, orkestraciju više agenata i programsko pozivanje alata brže izrađuju sposobnije agente uz tek djelić troška.

Bolje iskustvo odmah nakon pokretanja

Od modela GPT‑5 svaka nova generacija modela nastoji rješavati dugotrajnije zadatke uz manje tokena. GPT‑5.6 nastavlja tim smjerom: snažnije performanse agenata i niži troškovi uz minimalne promjene temeljnog testnog sklopa.

Veću ukupnu troškovnu učinkovitost dodatno prati veća točnost pri nižim razinama rasuđivanja. Primjerice, na testu Agents’ Last Exam GPT‑5.6 Sol uz „nisku” razinu rasuđivanja nadmašio je GPT‑5.5 uz „visoku” razinu rasuđivanja kada je testni sklop ostao isti. Slične uspjehe vidjeli smo i u produkcijskim testiranjima, gdje startupovi navode znatne uštede u nizu radnih procesa nakon što su smanjili razinu rasuđivanja u odnosu na prethodne zadane postavke.

Uključili smo GPT‑5.6 u svoj testni sklop, a niska razina rasuđivanja dala nam je najbolje rezultate. Prepoznao je kada podaci jednostavno nisu postojali, nije slijedio pogrešne tragove i došao je do točnog odgovora uz manje tokena.
— Izzy Miller, voditelj istraživanja umjetne inteligencije, Hex(otvara se u novom prozoru)

Odabir modela

Prelazak na vodeći model s najvišom dostupnom razinom rasuđivanja tradicionalno je bio najbolji izbor za dugotrajne slučajeve primjene. To je uglavnom bilo zato što su ti modeli znatno sposobniji od troškovno optimiziranih modela u obradi duljih konteksta i pozivanju alata. To se promijenilo s obitelji 5.6: uz više računalnih resursa tijekom zaključivanja Luna i Terra često mogu ostvariti rezultate slične onima modela GPT‑5.4 i GPT‑5.5, ali uz znatno nižu cijenu

1 od 3
Luna zadržava 98 % točnosti izdvajanja modela GPT‑5.5 uz osamnaest puta niži trošak. To našim agentima omogućuje visokokvalitetno razumijevanje dokumenata po cijeni koja ga čini praktičnim za mnogo više radnih procesa.
— Serhii Shchoholiev, voditelj inženjeringa za agente, Hypha(otvara se u novom prozoru)

Pogledajmo zadatke u testu BrowseComp, koji se temelji na pretraživanju i provjerava sposobnost modela da pronađe teško dostupne činjenice. Prije tri mjeseca GPT‑5.5 (Vrlo visoka) na tom je testu ostvario rezultat od 84,36 % uz ukupan trošak od 33,27 USD. Pri predstavljanju GPT‑5.6 Luna (Vrlo visoka) ostvaruje gotovo jednake performanse: rezultat od 84,04 % uz trošak od 1,33 USD. Otad smo dodatno snizili cijene. Saznajte više o našim najnovijim sniženjima cijena.

Manji modeli iz obitelji 5.6 izvrstan su izbor za radna opterećenja velikog obujma, interakcije osjetljive na latenciju i ponavljajuće korake u agentskim radnim procesima. Primjerice, ako vodite pravno-tehnološki startup koji obrađuje rukom pisane bilješke prije agentske analize, umjesto najnaprednijeg modela za cijeli slučaj primjene sada možete upotrijebiti Terru ili Lunu za izdvajanje podataka i ostvariti znatne uštede.

Razvoj Responses API-ja za projektiranje učinkovitijih agenata

Osim što smo poboljšali početne performanse modela GPT‑5.6, u Responses API uveli smo i nove osnovne elemente za dodatna poboljšanja. GPT‑5.6 trenirali smo od početka do kraja uz tri komplementarne arhitekturne intervencije koje agentima omogućuju učinkovitiji rad:

  1. Ponovna uporaba već obavljenog rada: omogućavanjem zadržavanja rasuđivanja(otvara se u novom prozoru) kroz poteze modela i uporabom izvornog sažimanja(otvara se u novom prozoru) za skraćivanje dugih razgovora model može zadržati dosljednost tijekom dugotrajnijih zadataka bez zabune ili potrebe za ponovnom izgradnjom prethodnog konteksta.
  2. Paralelna razrada kada je primjerena: izvorna orkestracija više agenata(otvara se u novom prozoru) omogućuje koordinaciju više agenata u paralelnim tijekovima rada kako bi se složeni zadaci brže dovršili.
  3. Premještanje determinističkog rada u kôd: programsko pozivanje alata(otvara se u novom prozoru) omogućuje filtriranje, objedinjavanje i orkestriranje izlaza alata izvan kontekstnog prozora modela, čime se tokeni modela čuvaju za prosudbu te smanjuju troškovi, latencija i degradacija konteksta.

Kada se upotrebljavaju zajedno, razlika može biti golema. Primjerice, na testu ARC-AGI-3 GPT‑5.6 Sol ostvario je 13,3 % sa standardnim testnim sklopom. Međutim, nakon uključivanja zadržanog rasuđivanja i sažimanja rezultat je skočio na 38,3 % uz približno šest puta manje izlaznih tokena. Bez promjena modela, ali uz gotovo trostruko bolje performanse. Više možete pročitati u našem istraživanju testnog sklopa ARC-AGI-3.

Programsko pozivanje alata

Agentski radni procesi često obuhvaćaju dvije vrste rada:

  1. Zadatke koji zahtijevaju prosudbu
  2. Rad koji se uglavnom sastoji od premještanja, filtriranja i spajanja podataka

Kad agent dohvati 100 regulatornih podnesaka, filtrira ih prema datumu i utvrdi relevantne transakcije, model ne bi trebao rasuđivati o svakom međurezultatu u svojem kontekstnom prozoru. Programsko pozivanje alata omogućuje modelu GPT‑5.6 pisanje JavaScripta radi orkestriranja alata, paralelnog izvođenja neovisnih poziva i obrade njihovih izlaza izvan kontekstnog prozora. Model se tako može usredotočiti na ono što zahtijeva inteligenciju: prosudbu.

U financijskim istraživanjima najteže je pouzdano dohvatiti regulatorne podneske, koordinirati alate i obraditi brojke. U našim je evaluacijama GPT‑5.6 uz programsko pozivanje alata zadovoljio naša mjerila kvalitete uz 21 % manje ulaznih tokena. Upravo je to razlika između agenta koji može raspravljati o financijskom istraživanju i onoga koji ga doista može provesti.
— Alex Wang, primijenjena umjetna inteligencija, Rogo(otvara se u novom prozoru)

Više agenata

Kod složenih zadataka koji se mogu paralelizirati raspodjela radnji i rasuđivanja na više agentskih tijekova rada omogućuje brže dovršavanje zadataka i veću inteligenciju. U takvim je postavkama glavni agent odgovoran za orkestriranje podagenata i delegiranje zadataka. Podagenti paralelno ostvaruju svoje ciljeve, a zatim svoje rezultate vraćaju glavnom agentu radi konačne sinteze. Timovi mogu izvorno početi upotrebljavati više agenata tako da u Responses API-ju omoguće rad više agenata(otvara se u novom prozoru). Na taj način radi i postavka mogućnosti Ultra u ChatGPT‑u.

1 od 2
Qualia angažira timove agenata na otvorenim istraživačkim problemima, a GPT‑5.6 Sol pokazao se kao pun pogodak. Pokazao je znatno poboljšanje u odnosu na GPT‑5.5, završio brže od gotovo svih drugih modela koje smo testirali i brzo postao naš prvi izbor među modelima OpenAI-ja.
— E Chi, osnivač, Quadrillion(otvara se u novom prozoru)

Iako GPT‑5.6 dobro procjenjuje primjeren broj podagenata i kada ih treba pokrenuti, ponašanje sustava s više agenata vrlo je prilagodljivo. Upute modelu o tome kada treba pozvati podagente mogu povećati vjerojatnost njihova pokretanja samo u situacijama u kojima dodatna potrošnja tokena donosi bolje performanse.

Predmemoriranje upita

Za cijelu obitelj modela TTL predmemorije upita produljen je na najmanje 30 minuta, a prijelomne točke predmemorije sada se mogu deterministički postaviti unutar kontekstnog prozora modela. To je startupovima omogućilo znatno povećanje stope pogodaka u predmemoriji.

Zajedničkom upitu od 29.000 tokena dodali smo prijelomne točke predmemorije i ključeve specifične za radni prostor te za 28 % smanjili količinu ulaznih podataka koji nisu bili spremljeni u predmemoriju. I razdoblje predmemoriranja od 30 minuta donijelo je velik napredak: naši su agenti mogli ponovno upotrebljavati isti kontekst u različitim izvođenjima umjesto da svaki put kreću ispočetka.
— Lorenzo Gentile, inženjer umjetne inteligencije, Ploy(otvara se u novom prozoru)

Uz postavljanje prijelomnih točaka predmemorije, nastavak uporabe odgovarajućeg ključa prompt_cache_key(otvara se u novom prozoru) povećava vjerojatnost da će zahtjevi stići na isti mehanizam za zaključivanje koji je prethodno obradio isti prefiks, čime se smanjuje latencija.

Zaključak

U svim ovim primjerima posebno se ističe koliko se promijenila ekonomika izrade agenata.

Slučajevi primjene koji su nekoć u svakom koraku zahtijevali najnapredniji model sada mogu ostvariti usporedive ili bolje rezultate uz djelić troška zahvaljujući manjim modelima, prilagodbi razine rasuđivanja i učinkovitim arhitekturnim odabirima.

Jedva čekamo vidjeti što ćete sve izraditi!

  • 2026.
  • Platforma API

O autorima

Ovaj su vodič razvili Samarth Madduru(otvara se u novom prozoru), Prashant Mital(otvara se u novom prozoru), Dave Leo(otvara se u novom prozoru) i Julien Reiman(otvara se u novom prozoru) na temelju iskustva bliske suradnje sa startupovima koji su razvijali rješenja uz GPT-5.6, od ranog testiranja do produkcije.