Пређите на главни садржај
OpenAI

13. август 2026.

Примењени AI

Водич за развој уз GPT‑5.6

Техничке поуке стартапа из продукционог окружења

Учитавање…

GPT‑5.6 поставља нови стандард односа цене и перформанси

Породица модела GPT‑5.6 чини перформансе граничног нивоа за агенте знатно приступачнијим, а истовремено помера границе могућег.

У овом водичу показујемо како стартапи користе паметнији избор модела и нове API контроле за континуитет резоновања, оркестрацију више агената и програмско позивање алата како би брже правили способније агенте по знатно нижој цени.

Боље искуство од самог почетка

Од модела GPT‑5, свака нова генерација модела настоји да решава дуготрајније задатке уз мање токена. GPT‑5.6 наставља тим путем: боље перформансе агената и нижи трошкови, уз минималне измене основног окружења.

Основне уштеде додатно расту захваљујући већој прецизности при нижем нивоу резоновања. На пример, на тесту Agents’ Last Exam, GPT‑5.6 Sol са „ниским“ нивоом резоновања надмашио је GPT‑5.5 са „високим“ нивоом када је окружење остало непромењено. Сличне успехе видели смо и у продукционим тестирањима, где стартапи бележе знатне уштеде у различитим токовима рада након смањења нивоа резоновања у односу на претходне подразумеване вредности.

Увели смо GPT‑5.6 у наше окружење, а низак ниво резоновања донео нам је најбоље резултате. Препознао је када подаци једноставно не постоје, није пратио погрешне трагове и дошао је до тачног одговора уз мање токена.
— Изи Милер, руководилац AI истраживања, Hex(отвара се у новом прозору)

Избор модела

Раније је прелазак на најпознатији модел са највишим доступним нивоом резоновања био најбољи избор за дуготрајне задатке. Главни разлог је био то што су ови модели знатно способнији од модела оптимизованих за цену у раду са дужим контекстом и позивању алата. То се променило са породицом 5.6: уз више рачунарских ресурса током извршавања, Luna и Terra често достижу перформансе сличне моделима GPT‑5.4 и 5.5, али по знатно нижој цени.

1 од 3
Luna задржава 98% тачности издвајања коју пружа GPT‑5.5, уз осамнаест пута нижи трошак. Тако наши агенти добијају висококвалитетно разумевање докумената по цени која га чини практичним за много више токова рада.
— Сергиј Шчохолијев, руководилац развоја агената, Hypha(отвара се у новом прозору)

Размотримо задатке у тесту BrowseComp, заснованом на претрази, који проверава способност модела да пронађе тешко доступне чињенице. Пре три месеца, GPT‑5.5 (веома високо) остварио је резултат од 84,36% на овом тесту, уз укупан трошак од 33,27 USD. При представљању, GPT‑5.6 Luna (веома високо) пружа практично исте перформансе: резултат од 84,04% уз трошак од 1,33 USD. Од тада смо додатно снизили цене. Сазнајте више о нашим најновијим снижењима цена.

Мањи модели из породице 5.6 одлично одговарају задацима великог обима, интеракцијама осетљивим на кашњење и корацима који се понављају у токовима рада агената. На пример, ако водите стартап у области правне технологије који обрађује руком писане белешке пре анализе помоћу агената, више не морате да користите гранични модел за цео поступак: за издвајање можете користити Terra или Luna и остварити знатне уштеде.

Развој Responses API-ја за пројектовање ефикаснијих агената

Поред тога што GPT‑5.6 одмах пружа боље перформансе, у Responses API смо увели и нове основне механизме за додатна побољшања. GPT‑5.6 смо обучили од почетка до краја уз три комплементарне архитектонске измене које агентима омогућавају ефикаснији рад:

  1. Поново користите већ обављен рад: омогућавањем чувања резоновања(отвара се у новом прозору) између потеза модела и употребом уграђене компакције(отвара се у новом прозору) за сажимање дугих разговора, модел може доследно да настави рад на дуготрајнијим задацима без забуне или поновног реконструисања претходног контекста.
  2. Паралелно рашчланите задатак када је то прикладно: уграђена оркестрација више агената(отвара се у новом прозору) омогућава координацију више агената у паралелним токовима рада ради бржег завршавања сложених задатака.
  3. Преместите детерминистички рад у кôд: користите програмско позивање алата(отвара се у новом прозору) за филтрирање, обједињавање и оркестрацију излаза алата изван прозора контекста модела, остављајући токене модела за процену и смањујући трошкове, кашњење и деградацију контекста.

Када се користе заједно, разлика може бити огромна. На пример, на тесту ARC-AGI-3, GPT‑5.6 Sol је са стандардним окружењем остварио резултат од 13,3%. Међутим, након укључивања сачуваног резоновања и компакције, резултат је скочио на 38,3% — уз приближно шест пута мање излазних токена. Без измена модела, али са готово троструко бољим резултатом. Више о томе можете прочитати у нашем истраживању окружења ARC-AGI-3.

Програмско позивање алата

Токови рада агената често обухватају две врсте посла:

  1. Задатке који захтевају процену
  2. Посао који се углавном своди на премештање, филтрирање и комбиновање података

Када агент преузме 100 извештаја, филтрира их по датуму и утврди релевантне трансакције, модел не би требало да разматра сваки међурезултат у свом прозору контекста. Програмско позивање алата омогућава моделу GPT‑5.6 да пише JavaScript кôд за оркестрацију алата, паралелно покреће независне позиве и обрађује њихове излазе изван прозора контекста. Тако модел може да се усредсреди на оно што захтева интелигенцију: доношење процене.

У финансијским истраживањима најтеже је поуздано преузети извештаје, координисати алате и обрадити бројке. У нашим евалуацијама, GPT‑5.6 је уз програмско позивање алата достигао квалитет према нашим критеријумима, уз 21% мање улазних токена. То је разлика између агента који може да разговара о финансијском истраживању и оног који заиста може да га спроведе.
— Алекс Ванг, примењена вештачка интелигенција, Rogo(отвара се у новом прозору)

Више агената

Код сложених задатака који се могу паралелизовати, расподела радњи и резоновања на више токова рада агената омогућава брже завршавање задатка и већу интелигенцију. У таквим поставкама, главни агент оркестрира подагенте и делегира им задатке. Подагенти паралелно остварују своје циљеве, а затим враћају резултате главном агенту ради коначног обједињавања. Тимови могу почети да користе уграђену подршку за више агената тако што ће омогућити рад са више агената(отвара се у новом прозору) у Responses API-ју. На овај начин функционише и подешавање могућности Ultra у производу ChatGPT.

1 од 2
Qualia ангажује тимове агената на истраживачким проблемима отвореног типа, а GPT‑5.6 Sol се одмах показао као право решење. Показао је приметан напредак у односу на GPT‑5.5, завршио је задатак брже од готово свих других модела које смо тестирали и брзо постао наш подразумевани OpenAI модел.
— Е Чи, оснивач, Quadrillion(отвара се у новом прозору)

Иако GPT‑5.6 добро процењује одговарајући број подагената и тренутак када треба да их покрене, понашање система са више агената може се веома прецизно усмеравати. Ако моделу дате инструкције када да позове подагенте, већа је вероватноћа да ће их покренути само када додатна потрошња токена доноси боље перформансе.

Кеширање инструкције

У целој породици модела, TTL кеша инструкције продужен је на најмање 30 минута, а контролне тачке кеша сада се могу детерминистички постављати унутар прозора контекста модела. То је стартапима омогућило да знатно повећају стопу погодака кеша.

У заједничку инструкцију од 29.000 токена додали смо контролне тачке кеша и кључеве специфичне за радни простор, чиме смо некеширани улаз смањили за 28%. И период кеширања од 30 минута донео је велики помак: наши агенти су могли поново да користе исти контекст у различитим покретањима уместо да сваки пут почињу од нуле.
— Лоренцо Ђентиле, AI инжењер, Ploy(отвара се у новом прозору)

Поред постављања контролних тачака кеша, доследна употреба одговарајућег кључа prompt_cache_key(отвара се у новом прозору) повећава вероватноћу да ће захтеви стићи до истог механизма за извођење који је раније обрадио исти префикс, чиме се смањује кашњење.

Закључак

У свим овим примерима посебно се истиче колико се променила исплативост развоја агената.

Случајеви употребе који су некада захтевали гранични модел у сваком кораку сада могу да постигну упоредиве или боље резултате по знатно нижој цени, употребом мањих модела, подешавањем нивоа резоновања и ефикасним архитектонским изборима.

Једва чекамо да видимо шта ћете све направити!

  • 2026.
  • API platforma

О ауторима

Овај водич су припремили Самарт Мадуру(отвара се у новом прозору), Прашант Митал(отвара се у новом прозору), Дејв Лео(отвара се у новом прозору) и Жилијен Рајман(отвара се у новом прозору), на основу искуства блиске сарадње са стартапима који развијају решења уз GPT‑5.6, од раног тестирања до продукције.