Водич за развој уз GPT‑5.6
Техничке поуке стартапа из продукционог окружења
Породица модела GPT‑5.6 чини перформансе граничног нивоа за агенте знатно приступачнијим, а истовремено помера границе могућег.
У овом водичу показујемо како стартапи користе паметнији избор модела и нове API контроле за континуитет резоновања, оркестрацију више агената и програмско позивање алата како би брже правили способније агенте по знатно нижој цени.
Од модела GPT‑5, свака нова генерација модела настоји да решава дуготрајније задатке уз мање токена. GPT‑5.6 наставља тим путем: боље перформансе агената и нижи трошкови, уз минималне измене основног окружења.
Основне уштеде додатно расту захваљујући већој прецизности при нижем нивоу резоновања. На пример, на тесту Agents’ Last Exam, GPT‑5.6 Sol са „ниским“ нивоом резоновања надмашио је GPT‑5.5 са „високим“ нивоом када је окружење остало непромењено. Сличне успехе видели смо и у продукционим тестирањима, где стартапи бележе знатне уштеде у различитим токовима рада након смањења нивоа резоновања у односу на претходне подразумеване вредности.
Раније је прелазак на најпознатији модел са највишим доступним нивоом резоновања био најбољи избор за дуготрајне задатке. Главни разлог је био то што су ови модели знатно способнији од модела оптимизованих за цену у раду са дужим контекстом и позивању алата. То се променило са породицом 5.6: уз више рачунарских ресурса током извршавања, Luna и Terra често достижу перформансе сличне моделима GPT‑5.4 и 5.5, али по знатно нижој цени.
Размотримо задатке у тесту BrowseComp, заснованом на претрази, који проверава способност модела да пронађе тешко доступне чињенице. Пре три месеца, GPT‑5.5 (веома високо) остварио је резултат од 84,36% на овом тесту, уз укупан трошак од 33,27 USD. При представљању, GPT‑5.6 Luna (веома високо) пружа практично исте перформансе: резултат од 84,04% уз трошак од 1,33 USD. Од тада смо додатно снизили цене. Сазнајте више о нашим најновијим снижењима цена.
Мањи модели из породице 5.6 одлично одговарају задацима великог обима, интеракцијама осетљивим на кашњење и корацима који се понављају у токовима рада агената. На пример, ако водите стартап у области правне технологије који обрађује руком писане белешке пре анализе помоћу агената, више не морате да користите гранични модел за цео поступак: за издвајање можете користити Terra или Luna и остварити знатне уштеде.
Поред тога што GPT‑5.6 одмах пружа боље перформансе, у Responses API смо увели и нове основне механизме за додатна побољшања. GPT‑5.6 смо обучили од почетка до краја уз три комплементарне архитектонске измене које агентима омогућавају ефикаснији рад:
- Поново користите већ обављен рад: омогућавањем чувања резоновања(отвара се у новом прозору) између потеза модела и употребом уграђене компакције(отвара се у новом прозору) за сажимање дугих разговора, модел може доследно да настави рад на дуготрајнијим задацима без забуне или поновног реконструисања претходног контекста.
- Паралелно рашчланите задатак када је то прикладно: уграђена оркестрација више агената(отвара се у новом прозору) омогућава координацију више агената у паралелним токовима рада ради бржег завршавања сложених задатака.
- Преместите детерминистички рад у кôд: користите програмско позивање алата(отвара се у новом прозору) за филтрирање, обједињавање и оркестрацију излаза алата изван прозора контекста модела, остављајући токене модела за процену и смањујући трошкове, кашњење и деградацију контекста.
Када се користе заједно, разлика може бити огромна. На пример, на тесту ARC-AGI-3, GPT‑5.6 Sol је са стандардним окружењем остварио резултат од 13,3%. Међутим, након укључивања сачуваног резоновања и компакције, резултат је скочио на 38,3% — уз приближно шест пута мање излазних токена. Без измена модела, али са готово троструко бољим резултатом. Више о томе можете прочитати у нашем истраживању окружења ARC-AGI-3.
Токови рада агената често обухватају две врсте посла:
- Задатке који захтевају процену
- Посао који се углавном своди на премештање, филтрирање и комбиновање података
Када агент преузме 100 извештаја, филтрира их по датуму и утврди релевантне трансакције, модел не би требало да разматра сваки међурезултат у свом прозору контекста. Програмско позивање алата омогућава моделу GPT‑5.6 да пише JavaScript кôд за оркестрацију алата, паралелно покреће независне позиве и обрађује њихове излазе изван прозора контекста. Тако модел може да се усредсреди на оно што захтева интелигенцију: доношење процене.
Код сложених задатака који се могу паралелизовати, расподела радњи и резоновања на више токова рада агената омогућава брже завршавање задатка и већу интелигенцију. У таквим поставкама, главни агент оркестрира подагенте и делегира им задатке. Подагенти паралелно остварују своје циљеве, а затим враћају резултате главном агенту ради коначног обједињавања. Тимови могу почети да користе уграђену подршку за више агената тако што ће омогућити рад са више агената(отвара се у новом прозору) у Responses API-ју. На овај начин функционише и подешавање могућности Ultra у производу ChatGPT.
“Qualia ангажује тимове агената на истраживачким проблемима отвореног типа, а GPT‑5.6 Sol се одмах показао као право решење. Показао је приметан напредак у односу на GPT‑5.5, завршио је задатак брже од готово свих других модела које смо тестирали и брзо постао наш подразумевани OpenAI модел.”
“GPT‑5.6 је најбољи оркестратор који смо видели од компаније OpenAI. Истовремено смо му задали шест спецификација — да их све напише, изради и објасни — а он је све испратио без пада квалитета.”
Иако GPT‑5.6 добро процењује одговарајући број подагената и тренутак када треба да их покрене, понашање система са више агената може се веома прецизно усмеравати. Ако моделу дате инструкције када да позове подагенте, већа је вероватноћа да ће их покренути само када додатна потрошња токена доноси боље перформансе.
У целој породици модела, TTL кеша инструкције продужен је на најмање 30 минута, а контролне тачке кеша сада се могу детерминистички постављати унутар прозора контекста модела. То је стартапима омогућило да знатно повећају стопу погодака кеша.
Поред постављања контролних тачака кеша, доследна употреба одговарајућег кључа prompt_cache_key(отвара се у новом прозору) повећава вероватноћу да ће захтеви стићи до истог механизма за извођење који је раније обрадио исти префикс, чиме се смањује кашњење.
У свим овим примерима посебно се истиче колико се променила исплативост развоја агената.
Случајеви употребе који су некада захтевали гранични модел у сваком кораку сада могу да постигну упоредиве или боље резултате по знатно нижој цени, употребом мањих модела, подешавањем нивоа резоновања и ефикасним архитектонским изборима.
Једва чекамо да видимо шта ћете све направити!
- 2026.
- API platforma
О ауторима
Овај водич су припремили Самарт Мадуру(отвара се у новом прозору), Прашант Митал(отвара се у новом прозору), Дејв Лео(отвара се у новом прозору) и Жилијен Рајман(отвара се у новом прозору), на основу искуства блиске сарадње са стартапима који развијају решења уз GPT‑5.6, од раног тестирања до продукције.


