Príručka pre tvorcov aplikácií s GPT‑5.6
Technické poznatky startupov z produkčného prostredia
Rodina modelov GPT‑5.6 výrazne sprístupňuje výkon agentov na úrovni prelomových technológií a zároveň posúva hranice možného.
V tejto príručke ukazujeme, ako startupy vďaka inteligentnejšiemu výberu modelov a novým ovládacím prvkom API podporujúcim kontinuitu uvažovania, orchestráciu viacerých agentov a programové volanie nástrojov vytvárajú rýchlejších a schopnejších agentov za zlomok nákladov.
Od uvedenia GPT‑5 sa každá nová generácia modelov zameriava na zvládanie dlhodobejších úloh s menším počtom tokenov. GPT‑5.6 v tomto smere pokračuje: ponúka vyšší výkon agentov a nižšie náklady, pričom vyžaduje len minimálne zmeny základného harnessu.
Vyššiu celkovú nákladovú efektívnosť navyše sprevádza väčšia presnosť pri nižšej miere uvažovania. Napríklad v teste Agents’ Last Exam prekonal GPT‑5.6 Sol pri „nízkej“ miere uvažovania model GPT‑5.5 s „vysokou“ mierou uvažovania, keď sa použil rovnaký harness. Podobné úspechy sme zaznamenali aj pri testovaní v produkcii, kde startupy uvádzajú výrazné zníženie nákladov v rôznych pracovných postupoch po znížení miery uvažovania oproti predvoleným hodnotám predchádzajúcich modelov.
V minulosti bolo pre dlhodobé prípady použitia najlepšou voľbou prejsť na vlajkový model s najvyššou dostupnou mierou uvažovania. Dôvodom bolo najmä to, že tieto modely zvládali dlhší kontext a volanie nástrojov podstatne lepšie než modely optimalizované na náklady. S rodinou 5.6 sa to zmenilo: vďaka väčšiemu výpočtovému výkonu pri testovaní dokážu Luna a Terra často dosiahnuť podobný výkon ako GPT‑5.4 a 5.5, no za výrazne nižšiu cenu.
Pozrime sa na úlohy v BrowseComp, vyhľadávacom benchmarku, ktorý testuje schopnosť modelu nájsť málo známe fakty. Pred tromi mesiacmi dosiahol GPT‑5.5 (Extra vysoká) v tomto benchmarku skóre 84,36 % pri celkových nákladoch 33,27 USD. Pri uvedení dosahuje GPT‑5.6 Luna (Extra vysoká) prakticky rovnaký výkon: skóre 84,04 % pri nákladoch 1,33 USD. Odvtedy sme ceny znížili ešte viac. Prečítajte si viac o našom najnovšom znižovaní cien.
Menšie modely rodiny 5.6 sa výborne hodia na úlohy s veľkým objemom spracovania, interakcie citlivé na latenciu a opakované kroky v pracovných postupoch agentov. Ak napríklad prevádzkujete startup v oblasti právnych technológií, ktorý pred analýzou agentom spracúva ručne písané poznámky, už nemusíte na celý proces používať prelomový model. Na extrakciu môžete použiť model Terra alebo Luna a výrazne tak ušetriť.
Okrem zlepšenia výkonu GPT‑5.6 ihneď po nasadení sme do rozhrania Responses API pridali aj nové základné funkcie, ktoré umožňujú dosiahnuť ďalšie zlepšenia. GPT‑5.6 sme kompletne vytrénovali s tromi vzájomne sa dopĺňajúcimi architektonickými zásahmi, vďaka ktorým môžu agenti pracovať efektívnejšie:
- Opätovné využitie už vykonanej práce: vďaka možnosti zachovať uvažovanie(otvorí sa v novom okne) medzi jednotlivými interakciami s modelom a použitiu natívnej kompakcie(otvorí sa v novom okne) na komprimovanie dlhých konverzácií si model dokáže udržať súvislosť práce aj pri dlhodobejších úlohách bez toho, aby sa zmiatol alebo musel rekonštruovať predchádzajúci kontext.
- Paralelné rozdelenie tam, kde je vhodné: natívna orchestrácia viacerých agentov(otvorí sa v novom okne) umožňuje koordinovať viacero agentov v paralelných pracovných prúdoch a rýchlejšie dokončovať zložité úlohy.
- Presunutie deterministickej práce do kódu: programové volanie nástrojov(otvorí sa v novom okne) umožňuje filtrovať, agregovať a koordinovať výstupy nástrojov mimo kontextového okna modelu. Tokeny modelu tak zostávajú vyhradené na posudzovanie, čím sa znižujú náklady, latencia aj degradácia kontextu.
Pri ich spoločnom použití môže byť rozdiel dramatický. Napríklad v teste ARC-AGI-3 dosiahol GPT‑5.6 Sol so štandardným harnessom skóre 13,3 %. Po zapnutí zachovaného uvažovania a kompakcie však skóre vyskočilo na 38,3 %, pričom sa použilo približne šesťkrát menej výstupných tokenov. Bez zmien modelu, no s takmer trojnásobným výkonom. Viac sa dočítate v našej analýze harnessu ARC-AGI-3.
Pracovné postupy agentov často zahŕňajú dva druhy práce:
- Úlohy vyžadujúce posúdenie
- Práca spočívajúca najmä v presúvaní, filtrovaní a spájaní údajov
Keď agent načíta 100 regulačných podaní, filtruje ich podľa dátumu a identifikuje relevantné transakcie, model by nemal vo svojom kontextovom okne uvažovať nad každým priebežným výsledkom. Programové volanie nástrojov umožňuje modelu GPT‑5.6 písať JavaScript na orchestráciu nástrojov, súbežne vykonávať nezávislé volania a spracúvať ich výstupy mimo kontextového okna. Model sa tak môže sústrediť na to, čo si vyžaduje inteligenciu: na posudzovanie.
Pri zložitých úlohách, ktoré možno vykonávať paralelne, umožňuje rozdelenie činností a uvažovania medzi viacero pracovných prúdov agentov rýchlejšie dokončenie úloh aj vyššiu inteligenciu. V takýchto konfiguráciách zodpovedá hlavný agent za orchestráciu podriadených agentov a delegovanie úloh. Podriadení agenti pracujú na svojich cieľoch paralelne a napokon odovzdajú výstupy hlavnému agentovi na záverečnú syntézu. Tímy môžu začať natívne využívať viacerých agentov zapnutím podpory viacerých agentov(otvorí sa v novom okne) v rozhraní Responses API. Takto funguje aj nastavenie schopností Ultra v ChatGPT.
“Qualia nasadzuje tímy agentov na otvorené výskumné problémy a GPT‑5.6 Sol nám jednoducho sadol. Oproti GPT‑5.5 priniesol výrazné zlepšenie, úlohy dokončil rýchlejšie než takmer každý iný testovaný model a rýchlo sa stal naším preferovaným modelom od OpenAI.”
“GPT‑5.6 je najlepší orchestrátor, akého sme od OpenAI videli. Zadali sme mu naraz šesť špecifikácií – všetky mal napísať, zostaviť a vysvetliť – a udržal si prehľad o všetkom bez poklesu kvality.”
Hoci GPT‑5.6 veľmi dobre odhaduje vhodný počet podriadených agentov aj to, kedy ich má spustiť, správanie viacerých agentov možno veľmi dobre usmerňovať. Pokyny, kedy má model zapojiť podriadených agentov, môžu zvýšiť pravdepodobnosť, že ich spustí len v situáciách, keď dodatočná spotreba tokenov prinesie lepší výkon.
V celej rodine modelov sa minimálna doba platnosti cache príkazov predĺžila na 30 minút a body prerušenia cache možno teraz deterministicky nastaviť v kontextovom okne modelu. Startupy tak mohli výrazne zvýšiť mieru úspešných zásahov do cache.
Okrem nastavenia bodov prerušenia cache zvyšuje ďalšie používanie vhodného kľúča prompt_cache_key(otvorí sa v novom okne) pravdepodobnosť, že požiadavky spracuje rovnaký inferenčný mechanizmus, ktorý už predtým obslúžil rovnaký prefix, čím sa znižuje latencia.
Na týchto príkladoch vyniká najmä to, ako výrazne sa zmenila ekonomika tvorby agentov.
Prípady použitia, ktoré kedysi vyžadovali prelomový model v každom kroku, môžu teraz dosiahnuť porovnateľné alebo lepšie výsledky za zlomok nákladov vďaka menším modelom, prispôsobeniu miery uvažovania a efektívnym architektonickým rozhodnutiam.
Tešíme sa na to, čo všetko vytvoríte!
- 2026
- Platforma API
O autoroch
Túto príručku vytvorili Samarth Madduru(otvorí sa v novom okne), Prashant Mital(otvorí sa v novom okne), Dave Leo(otvorí sa v novom okne) a Julien Reiman(otvorí sa v novom okne) na základe skúseností z úzkej spolupráce so startupmi, ktoré stavali na GPT‑5.6 od prvých testov až po produkčné nasadenie.


