Pereiti prie pagrindinio turinio
OpenAI

2026 m. rugpjūčio 13 d.

Taikomasis AI

GPT‑5.6 kūrėjo vadovas

Techninės produkcijoje veikiančių startuolių pamokos

Įkeliama...

GPT‑5.6 nustato naują kainos ir našumo standartą

GPT‑5.6 modelių šeima priešakinio lygio agentų našumą padaro gerokai prieinamesnį ir kartu išplečia galimybių ribas.

Šiame vadove parodome, kaip startuoliai, išmaniau rinkdamiesi modelius ir naudodami naujas API valdymo priemones, padedančias išlaikyti protavimo tęstinumą, koordinuoti kelis agentus ir programiškai iškviesti įrankius, kuria greitesnius bei pajėgesnius agentus už gerokai mažesnę kainą.

Geresnė patirtis iškart pradėjus naudoti

Nuo GPT‑5 kiekviena nauja modelių karta siekė įveikti ilgesnes užduotis naudodama mažiau žetonų. GPT‑5.6 tęsia šią kryptį: agentai veikia geriau ir kainuoja mažiau, o esamos infrastruktūros beveik nereikia keisti.

Bendrą sąnaudų efektyvumo augimą dar labiau sustiprina didesnis tikslumas naudojant mažiau protavimo pastangų. Pavyzdžiui, teste „Agents’ Last Exam“, nekeičiant infrastruktūros, GPT‑5.6 Sol su „mažomis“ protavimo pastangomis pranoko GPT‑5.5 su „didelėmis“ protavimo pastangomis. Panašių sėkmės pavyzdžių matėme ir bandant produkcijoje: startuoliai praneša gerokai sumažinę įvairių darbo eigų sąnaudas, kai protavimo pastangas sumažino nuo ankstesnių numatytųjų lygių.

Įdiegėme GPT‑5.6 į savo infrastruktūrą ir geriausių rezultatų pasiekėme naudodami mažas protavimo pastangas. Jis suprato, kada duomenų tiesiog nėra, nesivaikė klaidingų užuominų ir teisingą atsakymą rado naudodamas mažiau žetonų.
— Izzy Miller, DI tyrimų vadovas, Hex(atsidaro naujame lange)

Modelio pasirinkimas

Istoriškai ilgoms užduotims geriausia būdavo pereiti prie pavyzdinio modelio ir rinktis didžiausias galimas protavimo pastangas. Taip buvo daugiausia todėl, kad šie modeliai daug geriau nei sąnaudoms optimizuoti modeliai apdorodavo ilgesnį kontekstą ir iškviesdavo įrankius. Su 5.6 šeima padėtis pasikeitė: skyrus daugiau skaičiavimo išteklių bandymo metu, Luna ir Terra dažnai prilygsta GPT‑5.4 ir 5.5, tačiau kainuoja gerokai mažiau.

1 iš 3
Luna išlaiko 98 % GPT‑5.5 duomenų išgavimo tikslumo, tačiau kainuoja aštuoniolika kartų mažiau. Todėl mūsų agentai kokybiškai supranta dokumentus už kainą, leidžiančią tai praktiškai taikyti daugelyje kitų darbo eigų.
— Serhii Shchoholiev, agentų inžinerijos vadovas, Hypha(atsidaro naujame lange)

Panagrinėkime „BrowseComp“ užduotis – tai paieška pagrįstas etaloninis testas, kuriuo tikrinama modelio geba rasti sunkiai aptinkamus faktus. Prieš tris mėnesius GPT‑5.5 (Labai aukštas) šiame teste surinko 84,36 %, o bendra kaina siekė 33,27 USD. Išleidimo metu GPT‑5.6 Luna (Labai aukštas) užtikrina iš esmės tokį patį rezultatą – 84,04 % už 1,33 USD. Nuo tada kainas dar sumažinome. Sužinokite daugiau apie naujausią mūsų kainų mažinimą.

Mažesni 5.6 šeimos modeliai puikiai tinka didelės apimties darbo krūviams, delsai jautrioms sąveikoms ir pasikartojantiems agentinių darbo eigų veiksmams. Pavyzdžiui, jei jūsų teisinių technologijų startuolis prieš agentinę analizę apdoroja ranka rašytas pažymas, nebereikia visai užduočiai naudoti priešakinio modelio: duomenims išgauti galite rinktis Terra arba Luna ir gerokai sutaupyti.

Responses API tobulinimas efektyvesniems agentams kurti

Ne tik pagerinome pradinį GPT‑5.6 našumą, bet ir į Responses API įtraukėme naujų bazinių funkcijų, leidžiančių pasiekti dar geresnių rezultatų. GPT‑5.6 nuo pradžios iki pabaigos mokėme taikydami tris viena kitą papildančias architektūrines priemones, kurios leidžia agentams veikti efektyviau:

  1. Pakartotinai naudoti jau atliktą darbą: išsaugant protavimą tarp iškvietimų(atsidaro naujame lange) ir ilgus pokalbius glaudinant savuoju tankinimu(atsidaro naujame lange), modelis gali nuosekliai dirbti su ilgesnėmis užduotimis, nesusipainioti ir nekurti ankstesnio konteksto iš naujo.
  2. Kur tinkama, skaidyti lygiagrečiai: savasis kelių agentų koordinavimas(atsidaro naujame lange) leidžia valdyti kelis agentus lygiagrečiose darbo eigose ir greičiau atlikti sudėtingas užduotis.
  3. Deterministinį darbą perkelti į kodą: programinis įrankių iškvietimas(atsidaro naujame lange) leidžia filtruoti, jungti ir koordinuoti įrankių išvestis už modelio konteksto lango ribų, modelio žetonus paliekant sprendimams ir mažinant sąnaudas, delsą bei konteksto nykimą.

Naudojant šias priemones kartu, skirtumas gali būti įspūdingas. Pavyzdžiui, ARC-AGI-3 teste GPT‑5.6 Sol su standartine infrastruktūra surinko 13,3 %. Tačiau įjungus išsaugomą protavimą ir tankinimą, rezultatas šoktelėjo iki 38,3 %, nors buvo sunaudota maždaug 6 kartus mažiau išvesties žetonų. Modelis nepakeistas, o našumas išaugo beveik tris kartus. Daugiau skaitykite mūsų ARC-AGI-3 infrastruktūros tyrime.

Programinis įrankių iškvietimas

Agentinės darbo eigos dažnai apima dviejų rūšių darbą:

  1. Užduotis, kurioms reikia priimti sprendimus
  2. Darbą, kurį daugiausia sudaro duomenų perkėlimas, filtravimas ir jungimas

Kai agentas gauna 100 ataskaitų, filtruoja jas pagal datą ir nustato susijusius sandorius, modeliui nereikėtų savo konteksto lange nagrinėti kiekvieno tarpinio rezultato. Programinis įrankių iškvietimas leidžia GPT‑5.6 rašyti JavaScript kodą, koordinuoti įrankius, lygiagrečiai vykdyti nepriklausomus iškvietimus ir apdoroti jų išvestis už konteksto lango ribų. Taip modelis gali susitelkti į tai, kam reikia intelekto – pagrįstų sprendimų priėmimą.

Atliekant finansinius tyrimus sunkiausia patikimai gauti ataskaitas, koordinuoti įrankius ir išanalizuoti skaičius. Per mūsų vertinimus GPT‑5.6 su programiniu įrankių iškvietimu pasiekė mūsų kriterijus atitinkančią kokybę, naudodamas 21 % mažiau įvesties žetonų. Būtent tuo agentas, gebantis aptarti finansinius tyrimus, skiriasi nuo agento, galinčio juos iš tikrųjų atlikti.
— Alex Wang, taikomojo DI specialistas, Rogo(atsidaro naujame lange)

Keli agentai

Atliekant sudėtingas, lygiagrečiai vykdomas užduotis, veiksmų ir protavimo paskirstymas kelioms agentų darbo eigoms leidžia užduotis atlikti greičiau ir padidina intelektą. Tokiose sistemose pagrindinis agentas koordinuoja pagalbinius agentus ir perduoda jiems užduotis. Pagalbiniai agentai lygiagrečiai siekia savo tikslų, o galiausiai grąžina išvestis pagrindiniam agentui, kad šis parengtų galutinį rezultatą. Komandos gali pradėti naudotis savuoju kelių agentų režimu Responses API įjungdamos kelių agentų funkciją(atsidaro naujame lange). Taip pat veikia ir ChatGPT Ultra pajėgumo nuostata.

1 iš 2
„Qualia“ pasitelkia agentų komandas atviroms tyrimų problemoms spręsti, o GPT‑5.6 Sol tiesiog puikiai tiko. Jis buvo akivaizdžiai geresnis už GPT‑5.5, darbą baigė greičiau nei beveik visi kiti mūsų išbandyti modeliai ir netrukus tapo mūsų pagrindiniu OpenAI modeliu.
— E Chi, Quadrillion(atsidaro naujame lange) įkūrėjas

Nors GPT‑5.6 gerai nustato tinkamą pagalbinių agentų skaičių ir kada juos paleisti, kelių agentų elgseną lengva valdyti. Nurodžius modeliui, kada pasitelkti pagalbinius agentus, padidėja tikimybė, kad jie bus paleisti tik tais atvejais, kai papildomos žetonų sąnaudos pagerins rezultatą.

Užklausų podėliavimas

Visoje modelių šeimoje užklausų podėlio galiojimo laikas pratęstas bent iki 30 minučių, o podėlio kontrolinius taškus dabar galima deterministiškai nustatyti modelio konteksto lange. Tai leido startuoliams gerokai padidinti podėlio atitikčių rodiklį.

Į bendrą 29 000 žetonų užklausą įtraukėme podėlio kontrolinius taškus ir konkrečioms darbo erdvėms skirtus raktus, todėl į podėlį nepatekusios įvesties sumažėjo 28 %. 30 minučių podėlio galiojimo laikas taip pat atvėrė daug galimybių: mūsų agentai galėjo pakartotinai naudoti tą patį kontekstą skirtinguose vykdymuose, užuot kaskart pradėję nuo nulio.
— Lorenzo Gentile, DI inžinierius, Ploy(atsidaro naujame lange)

Be podėlio kontrolinių taškų nustatymo, toliau naudojant tinkamą prompt_cache_key(atsidaro naujame lange) padidėja tikimybė, kad užklausos pateks į tą patį išvedimo modulį, kuris anksčiau apdorojo tą patį priešdėlį, todėl sumažėja delsa.

Išvada

Visi šie pavyzdžiai aiškiai rodo, kaip smarkiai pasikeitė agentų kūrimo ekonomika.

Naudojimo atvejais, kuriems anksčiau kiekviename žingsnyje reikėjo priešakinio modelio, dabar galima pasiekti panašių ar geresnių rezultatų už gerokai mažesnę kainą: pakanka naudoti mažesnius modelius, derinti protavimo pastangas ir rinktis efektyvią architektūrą.

Nekantraujame pamatyti, ką sukursite!

  • 2026 m.
  • API platforma

Apie autorius

Šį vadovą parengė Samarth Madduru(atsidaro naujame lange), Prashant Mital(atsidaro naujame lange), Dave Leo(atsidaro naujame lange) ir Julien Reiman(atsidaro naujame lange), remdamiesi patirtimi glaudžiai bendradarbiaujant su GPT‑5.6 naudojančiais startuoliais nuo ankstyvųjų bandymų iki produkcijos.