Preskočite na glavni sadržaj
OpenAI

13. august 2026.

Primijenjena AI

Vodič za programere kroz GPT‑5.6

Tehničke lekcije startupa iz produkcijskog okruženja

Učitavanje…

GPT‑5.6 postavlja novi standard odnosa cijene i performansi

Porodica modela GPT‑5.6 čini performanse agenata na nivou graničnih modela znatno pristupačnijim, istovremeno pomjerajući granice mogućeg.

U ovom vodiču pokazujemo kako startupi pametnijim izborom modela i novim API kontrolama za kontinuitet rezonovanja, orkestraciju više agenata i programsko pozivanje alata grade brže i sposobnije agente uz tek djelić dosadašnjih troškova.

Bolje iskustvo odmah nakon pokretanja

Od modela GPT‑5 svaka nova generacija modela nastoji rješavati dugotrajnije zadatke uz manje tokena. GPT‑5.6 nastavlja tim putem: bolje performanse agenata i niži troškovi uz minimalne izmjene osnovnog harness sistema.

Veća preciznost pri nižim nivoima rezonovanja dodatno povećava ukupnu troškovnu efikasnost. Naprimjer, na testu Agents’ Last Exam GPT‑5.6 Sol s „niskim“ nivoom rezonovanja nadmašio je GPT‑5.5 s „visokim“ nivoom rezonovanja kada je harness ostao isti. Slične uspjehe vidjeli smo i u produkcijskim testovima, u kojima startupi navode znatne uštede u različitim radnim procesima nakon smanjenja nivoa rezonovanja u odnosu na prethodne zadane postavke.

Ubacili smo GPT‑5.6 u naš harness, a nizak nivo rezonovanja dao nam je najbolje rezultate. Prepoznao je kada podaci jednostavno nisu postojali, nije slijedio pogrešne tragove i došao je do tačnog odgovora uz manje tokena.
— Izzy Miller, voditelj istraživanja umjetne inteligencije, Hex(otvara se u novom prozoru)

Izbor modela

Historijski je prelazak na glavni model s najvišim dostupnim nivoom rezonovanja bio najbolji izbor za dugotrajne slučajeve upotrebe. Razlog je uglavnom bio to što su ti modeli znatno sposobniji od troškovno optimiziranih modela u radu s dužim kontekstima i pozivanju alata. To se promijenilo s porodicom 5.6: uz više računarskih resursa tokom testiranja, Luna i Terra često pružaju rezultate slične modelima GPT‑5.4 i 5.5, ali uz znatno niže troškove.

1 od 3
Luna zadržava 98% tačnosti izdvajanja modela GPT‑5.5 uz osamnaestinu troška. Tako naši agenti mogu kvalitetno razumijevati dokumente po cijeni koja to čini praktičnim u mnogo većem broju radnih procesa.
— Serhii Shchoholiev, voditelj inženjeringa za agente, Hypha(otvara se u novom prozoru)

Razmotrite zadatke iz testa BrowseComp, mjerila zasnovanog na pretraživanju koje ispituje sposobnost modela da pronađe teško dostupne činjenice. Prije tri mjeseca GPT‑5.5 (Veoma visoka) ostvario je 84,36% na ovom testu uz ukupan trošak od 33,27 USD. Prilikom predstavljanja GPT‑5.6 Luna (Veoma visoka) pruža gotovo iste performanse, s rezultatom od 84,04% uz trošak od 1,33 USD. Od tada smo dodatno snizili cijene. Pročitajte više o našim najnovijim sniženjima cijena.

Manji modeli iz porodice 5.6 odličan su izbor za radna opterećenja velikog obima, interakcije osjetljive na kašnjenje i ponavljajuće korake u agentskim radnim procesima. Naprimjer, ako vodite pravno-tehnološki startup koji obrađuje rukom pisane bilješke prije agentske analize, sada za izdvajanje podataka možete koristiti modele Terra ili Luna umjesto graničnog modela za cijeli proces i tako ostvariti znatne uštede.

Razvoj API-ja Responses za projektovanje efikasnijih agenata

Osim što GPT‑5.6 odmah pruža bolje performanse, u API Responses uveli smo i nove osnovne funkcije koje omogućavaju dodatna poboljšanja. GPT‑5.6 obučili smo od početka do kraja uz tri komplementarne arhitektonske intervencije koje agentima omogućavaju efikasniji rad:

  1. Ponovno koristite već obavljeni rad: omogućavanjem čuvanja rezonovanja(otvara se u novom prozoru) između poteza modela i korištenjem izvorne kompakcije(otvara se u novom prozoru) za sažimanje dugih razgovora model može održati dosljednost tokom dugotrajnijih zadataka bez zabune ili potrebe da ponovo gradi prethodni kontekst.
  2. Paralelno raščlanjivanje gdje je prikladno: izvorna orkestracija više agenata(otvara se u novom prozoru) omogućava koordinaciju više agenata u paralelnim tokovima rada radi bržeg završavanja složenih zadataka.
  3. Premjestite deterministički rad u kôd: koristite programsko pozivanje alata(otvara se u novom prozoru) za filtriranje, objedinjavanje i orkestraciju izlaza alata izvan kontekstnog prozora modela, čuvajući tokene modela za prosuđivanje te smanjujući troškove, kašnjenje i degradaciju konteksta.

Kada se koriste zajedno, razlika može biti ogromna. Naprimjer, na testu ARC-AGI-3 GPT‑5.6 Sol ostvario je 13,3% sa standardnim harness sistemom. Međutim, nakon omogućavanja sačuvanog rezonovanja i kompakcije rezultat je skočio na 38,3%, uz približno šest puta manje izlaznih tokena. Bez izmjena modela, ali uz gotovo trostruko bolje performanse. Više možete pročitati u našoj analizi harness sistema za ARC-AGI-3.

Programsko pozivanje alata

Agentski radni procesi često obuhvataju dvije vrste rada:

  1. Zadatke koji zahtijevaju prosuđivanje
  2. Rad koji se uglavnom svodi na premještanje, filtriranje i objedinjavanje podataka

Kada agent preuzme 100 regulatornih izvještaja, filtrira ih prema datumu i utvrdi relevantne transakcije, model ne bi trebao rezonovati o svakom međurezultatu u svom kontekstnom prozoru. Programsko pozivanje alata omogućava modelu GPT‑5.6 da piše JavaScript radi orkestracije alata, paralelno pokreće nezavisne pozive i obrađuje njihove izlaze izvan kontekstnog prozora. Model se tako može usredotočiti na ono što zahtijeva inteligenciju: prosuđivanje.

U finansijskim istraživanjima najteže je pouzdano pribaviti regulatorne izvještaje, koordinirati alate i obraditi brojke. U našim evaluacijama GPT‑5.6 je uz programsko pozivanje alata dostigao kvalitet prema našim kriterijima, koristeći 21% manje ulaznih tokena. To je razlika između agenta koji može razgovarati o finansijskom istraživanju i onoga koji ga zaista može provesti.
— Alex Wang, primijenjena umjetna inteligencija, Rogo(otvara se u novom prozoru)

Više agenata

Kod složenih zadataka koji se mogu paralelizirati, raspodjela radnji i rezonovanja na više agentskih tokova rada omogućava brže izvršavanje zadataka i veću sposobnost. U takvim postavkama glavni agent orkestrira podagente i dodjeljuje im zadatke. Podagenti paralelno ostvaruju svoje ciljeve, a zatim rezultate vraćaju glavnom agentu radi završne sinteze. Timovi mogu početi izvorno koristiti više agenata tako što će omogućiti rad s više agenata(otvara se u novom prozoru) u API-ju Responses. Na taj način radi i postavka mogućnosti Ultra u aplikaciji ChatGPT.

1 od 2
Qualia koristi timove agenata za otvorene istraživačke probleme, a GPT‑5.6 Sol pokazao se kao pun pogodak. Pokazao je značajno poboljšanje u odnosu na GPT‑5.5, završio je brže od gotovo svih drugih modela koje smo testirali i ubrzo postao naš prvi izbor među modelima kompanije OpenAI.
— E Chi, osnivač, Quadrillion(otvara se u novom prozoru)

Iako GPT‑5.6 dobro procjenjuje odgovarajući broj podagenata i kada ih treba pokrenuti, ponašanje sistema s više agenata veoma je prilagodljivo. Upute modelu o tome kada treba pozvati podagente mogu povećati vjerovatnoću da se agenti pokreću samo kada bi dodatna potrošnja tokena donijela bolje performanse.

Keširanje promptova

U cijeloj porodici modela minimalni TTL keša promptova produžen je na 30 minuta, a kontrolne tačke keša sada se mogu deterministički postaviti unutar kontekstnog prozora modela. To je startupima omogućilo da znatno poboljšaju stopu pogodaka u kešu.

Zajedničkom upitu od 29.000 tokena dodali smo kontrolne tačke keša i ključeve specifične za radni prostor te smanjili nekeširani unos za 28%. I 30-minutni period keširanja donio je veliki pomak: naši agenti mogli su ponovo koristiti isti kontekst u više izvršavanja umjesto da svaki put počinju ispočetka.
— Lorenzo Gentile, AI inženjer, Ploy(otvara se u novom prozoru)

Uz postavljanje kontrolnih tačaka keša, daljnje korištenje odgovarajućeg ključa prompt_cache_key(otvara se u novom prozoru) povećava vjerovatnoću da zahtjevi stignu na isti mehanizam za izvođenje koji je ranije obradio isti prefiks, čime se smanjuje kašnjenje.

Zaključak

U svim ovim primjerima posebno se ističe koliko se promijenila ekonomika izrade agenata.

Slučajevi upotrebe koji su nekada zahtijevali granični model u svakom koraku sada mogu postići slične ili bolje rezultate uz djelić troškova zahvaljujući manjim modelima, prilagođavanju nivoa rezonovanja i efikasnim arhitektonskim rješenjima.

Jedva čekamo vidjeti šta ćete sve izgraditi!

  • 2026
  • API Platform

O autorima

Ovaj vodič izradili su Samarth Madduru(otvara se u novom prozoru), Prashant Mital(otvara se u novom prozoru), Dave Leo(otvara se u novom prozoru) i Julien Reiman(otvara se u novom prozoru) na osnovu iskustva bliske saradnje sa startupima koji su gradili na modelu GPT‑5.6, od ranog testiranja do produkcije.