Vodič za programere kroz GPT‑5.6
Tehničke lekcije startupa iz produkcijskog okruženja
Porodica modela GPT‑5.6 čini performanse agenata na nivou graničnih modela znatno pristupačnijim, istovremeno pomjerajući granice mogućeg.
U ovom vodiču pokazujemo kako startupi pametnijim izborom modela i novim API kontrolama za kontinuitet rezonovanja, orkestraciju više agenata i programsko pozivanje alata grade brže i sposobnije agente uz tek djelić dosadašnjih troškova.
Od modela GPT‑5 svaka nova generacija modela nastoji rješavati dugotrajnije zadatke uz manje tokena. GPT‑5.6 nastavlja tim putem: bolje performanse agenata i niži troškovi uz minimalne izmjene osnovnog harness sistema.
Veća preciznost pri nižim nivoima rezonovanja dodatno povećava ukupnu troškovnu efikasnost. Naprimjer, na testu Agents’ Last Exam GPT‑5.6 Sol s „niskim“ nivoom rezonovanja nadmašio je GPT‑5.5 s „visokim“ nivoom rezonovanja kada je harness ostao isti. Slične uspjehe vidjeli smo i u produkcijskim testovima, u kojima startupi navode znatne uštede u različitim radnim procesima nakon smanjenja nivoa rezonovanja u odnosu na prethodne zadane postavke.
Historijski je prelazak na glavni model s najvišim dostupnim nivoom rezonovanja bio najbolji izbor za dugotrajne slučajeve upotrebe. Razlog je uglavnom bio to što su ti modeli znatno sposobniji od troškovno optimiziranih modela u radu s dužim kontekstima i pozivanju alata. To se promijenilo s porodicom 5.6: uz više računarskih resursa tokom testiranja, Luna i Terra često pružaju rezultate slične modelima GPT‑5.4 i 5.5, ali uz znatno niže troškove.
Razmotrite zadatke iz testa BrowseComp, mjerila zasnovanog na pretraživanju koje ispituje sposobnost modela da pronađe teško dostupne činjenice. Prije tri mjeseca GPT‑5.5 (Veoma visoka) ostvario je 84,36% na ovom testu uz ukupan trošak od 33,27 USD. Prilikom predstavljanja GPT‑5.6 Luna (Veoma visoka) pruža gotovo iste performanse, s rezultatom od 84,04% uz trošak od 1,33 USD. Od tada smo dodatno snizili cijene. Pročitajte više o našim najnovijim sniženjima cijena.
Manji modeli iz porodice 5.6 odličan su izbor za radna opterećenja velikog obima, interakcije osjetljive na kašnjenje i ponavljajuće korake u agentskim radnim procesima. Naprimjer, ako vodite pravno-tehnološki startup koji obrađuje rukom pisane bilješke prije agentske analize, sada za izdvajanje podataka možete koristiti modele Terra ili Luna umjesto graničnog modela za cijeli proces i tako ostvariti znatne uštede.
Osim što GPT‑5.6 odmah pruža bolje performanse, u API Responses uveli smo i nove osnovne funkcije koje omogućavaju dodatna poboljšanja. GPT‑5.6 obučili smo od početka do kraja uz tri komplementarne arhitektonske intervencije koje agentima omogućavaju efikasniji rad:
- Ponovno koristite već obavljeni rad: omogućavanjem čuvanja rezonovanja(otvara se u novom prozoru) između poteza modela i korištenjem izvorne kompakcije(otvara se u novom prozoru) za sažimanje dugih razgovora model može održati dosljednost tokom dugotrajnijih zadataka bez zabune ili potrebe da ponovo gradi prethodni kontekst.
- Paralelno raščlanjivanje gdje je prikladno: izvorna orkestracija više agenata(otvara se u novom prozoru) omogućava koordinaciju više agenata u paralelnim tokovima rada radi bržeg završavanja složenih zadataka.
- Premjestite deterministički rad u kôd: koristite programsko pozivanje alata(otvara se u novom prozoru) za filtriranje, objedinjavanje i orkestraciju izlaza alata izvan kontekstnog prozora modela, čuvajući tokene modela za prosuđivanje te smanjujući troškove, kašnjenje i degradaciju konteksta.
Kada se koriste zajedno, razlika može biti ogromna. Naprimjer, na testu ARC-AGI-3 GPT‑5.6 Sol ostvario je 13,3% sa standardnim harness sistemom. Međutim, nakon omogućavanja sačuvanog rezonovanja i kompakcije rezultat je skočio na 38,3%, uz približno šest puta manje izlaznih tokena. Bez izmjena modela, ali uz gotovo trostruko bolje performanse. Više možete pročitati u našoj analizi harness sistema za ARC-AGI-3.
Agentski radni procesi često obuhvataju dvije vrste rada:
- Zadatke koji zahtijevaju prosuđivanje
- Rad koji se uglavnom svodi na premještanje, filtriranje i objedinjavanje podataka
Kada agent preuzme 100 regulatornih izvještaja, filtrira ih prema datumu i utvrdi relevantne transakcije, model ne bi trebao rezonovati o svakom međurezultatu u svom kontekstnom prozoru. Programsko pozivanje alata omogućava modelu GPT‑5.6 da piše JavaScript radi orkestracije alata, paralelno pokreće nezavisne pozive i obrađuje njihove izlaze izvan kontekstnog prozora. Model se tako može usredotočiti na ono što zahtijeva inteligenciju: prosuđivanje.
Kod složenih zadataka koji se mogu paralelizirati, raspodjela radnji i rezonovanja na više agentskih tokova rada omogućava brže izvršavanje zadataka i veću sposobnost. U takvim postavkama glavni agent orkestrira podagente i dodjeljuje im zadatke. Podagenti paralelno ostvaruju svoje ciljeve, a zatim rezultate vraćaju glavnom agentu radi završne sinteze. Timovi mogu početi izvorno koristiti više agenata tako što će omogućiti rad s više agenata(otvara se u novom prozoru) u API-ju Responses. Na taj način radi i postavka mogućnosti Ultra u aplikaciji ChatGPT.
“Qualia koristi timove agenata za otvorene istraživačke probleme, a GPT‑5.6 Sol pokazao se kao pun pogodak. Pokazao je značajno poboljšanje u odnosu na GPT‑5.5, završio je brže od gotovo svih drugih modela koje smo testirali i ubrzo postao naš prvi izbor među modelima kompanije OpenAI.”
“GPT‑5.6 je najbolji orkestrator koji smo vidjeli od kompanije OpenAI. Istovremeno smo mu zadali šest specifikacija — da ih sve napiše, izradi i objasni — a on je sve držao pod kontrolom bez pada kvaliteta.”
Iako GPT‑5.6 dobro procjenjuje odgovarajući broj podagenata i kada ih treba pokrenuti, ponašanje sistema s više agenata veoma je prilagodljivo. Upute modelu o tome kada treba pozvati podagente mogu povećati vjerovatnoću da se agenti pokreću samo kada bi dodatna potrošnja tokena donijela bolje performanse.
U cijeloj porodici modela minimalni TTL keša promptova produžen je na 30 minuta, a kontrolne tačke keša sada se mogu deterministički postaviti unutar kontekstnog prozora modela. To je startupima omogućilo da znatno poboljšaju stopu pogodaka u kešu.
Uz postavljanje kontrolnih tačaka keša, daljnje korištenje odgovarajućeg ključa prompt_cache_key(otvara se u novom prozoru) povećava vjerovatnoću da zahtjevi stignu na isti mehanizam za izvođenje koji je ranije obradio isti prefiks, čime se smanjuje kašnjenje.
U svim ovim primjerima posebno se ističe koliko se promijenila ekonomika izrade agenata.
Slučajevi upotrebe koji su nekada zahtijevali granični model u svakom koraku sada mogu postići slične ili bolje rezultate uz djelić troškova zahvaljujući manjim modelima, prilagođavanju nivoa rezonovanja i efikasnim arhitektonskim rješenjima.
Jedva čekamo vidjeti šta ćete sve izgraditi!
- 2026
- API Platform
O autorima
Ovaj vodič izradili su Samarth Madduru(otvara se u novom prozoru), Prashant Mital(otvara se u novom prozoru), Dave Leo(otvara se u novom prozoru) i Julien Reiman(otvara se u novom prozoru) na osnovu iskustva bliske saradnje sa startupima koji su gradili na modelu GPT‑5.6, od ranog testiranja do produkcije.


