GPT‑5.6 kūrėjo vadovas
Techninės produkcijoje veikiančių startuolių pamokos
GPT‑5.6 modelių šeima priešakinio lygio agentų našumą padaro gerokai prieinamesnį ir kartu išplečia galimybių ribas.
Šiame vadove parodome, kaip startuoliai, išmaniau rinkdamiesi modelius ir naudodami naujas API valdymo priemones, padedančias išlaikyti protavimo tęstinumą, koordinuoti kelis agentus ir programiškai iškviesti įrankius, kuria greitesnius bei pajėgesnius agentus už gerokai mažesnę kainą.
Nuo GPT‑5 kiekviena nauja modelių karta siekė įveikti ilgesnes užduotis naudodama mažiau žetonų. GPT‑5.6 tęsia šią kryptį: agentai veikia geriau ir kainuoja mažiau, o esamos infrastruktūros beveik nereikia keisti.
Bendrą sąnaudų efektyvumo augimą dar labiau sustiprina didesnis tikslumas naudojant mažiau protavimo pastangų. Pavyzdžiui, teste „Agents’ Last Exam“, nekeičiant infrastruktūros, GPT‑5.6 Sol su „mažomis“ protavimo pastangomis pranoko GPT‑5.5 su „didelėmis“ protavimo pastangomis. Panašių sėkmės pavyzdžių matėme ir bandant produkcijoje: startuoliai praneša gerokai sumažinę įvairių darbo eigų sąnaudas, kai protavimo pastangas sumažino nuo ankstesnių numatytųjų lygių.
Istoriškai ilgoms užduotims geriausia būdavo pereiti prie pavyzdinio modelio ir rinktis didžiausias galimas protavimo pastangas. Taip buvo daugiausia todėl, kad šie modeliai daug geriau nei sąnaudoms optimizuoti modeliai apdorodavo ilgesnį kontekstą ir iškviesdavo įrankius. Su 5.6 šeima padėtis pasikeitė: skyrus daugiau skaičiavimo išteklių bandymo metu, Luna ir Terra dažnai prilygsta GPT‑5.4 ir 5.5, tačiau kainuoja gerokai mažiau.
Panagrinėkime „BrowseComp“ užduotis – tai paieška pagrįstas etaloninis testas, kuriuo tikrinama modelio geba rasti sunkiai aptinkamus faktus. Prieš tris mėnesius GPT‑5.5 (Labai aukštas) šiame teste surinko 84,36 %, o bendra kaina siekė 33,27 USD. Išleidimo metu GPT‑5.6 Luna (Labai aukštas) užtikrina iš esmės tokį patį rezultatą – 84,04 % už 1,33 USD. Nuo tada kainas dar sumažinome. Sužinokite daugiau apie naujausią mūsų kainų mažinimą.
Mažesni 5.6 šeimos modeliai puikiai tinka didelės apimties darbo krūviams, delsai jautrioms sąveikoms ir pasikartojantiems agentinių darbo eigų veiksmams. Pavyzdžiui, jei jūsų teisinių technologijų startuolis prieš agentinę analizę apdoroja ranka rašytas pažymas, nebereikia visai užduočiai naudoti priešakinio modelio: duomenims išgauti galite rinktis Terra arba Luna ir gerokai sutaupyti.
Ne tik pagerinome pradinį GPT‑5.6 našumą, bet ir į Responses API įtraukėme naujų bazinių funkcijų, leidžiančių pasiekti dar geresnių rezultatų. GPT‑5.6 nuo pradžios iki pabaigos mokėme taikydami tris viena kitą papildančias architektūrines priemones, kurios leidžia agentams veikti efektyviau:
- Pakartotinai naudoti jau atliktą darbą: išsaugant protavimą tarp iškvietimų(atsidaro naujame lange) ir ilgus pokalbius glaudinant savuoju tankinimu(atsidaro naujame lange), modelis gali nuosekliai dirbti su ilgesnėmis užduotimis, nesusipainioti ir nekurti ankstesnio konteksto iš naujo.
- Kur tinkama, skaidyti lygiagrečiai: savasis kelių agentų koordinavimas(atsidaro naujame lange) leidžia valdyti kelis agentus lygiagrečiose darbo eigose ir greičiau atlikti sudėtingas užduotis.
- Deterministinį darbą perkelti į kodą: programinis įrankių iškvietimas(atsidaro naujame lange) leidžia filtruoti, jungti ir koordinuoti įrankių išvestis už modelio konteksto lango ribų, modelio žetonus paliekant sprendimams ir mažinant sąnaudas, delsą bei konteksto nykimą.
Naudojant šias priemones kartu, skirtumas gali būti įspūdingas. Pavyzdžiui, ARC-AGI-3 teste GPT‑5.6 Sol su standartine infrastruktūra surinko 13,3 %. Tačiau įjungus išsaugomą protavimą ir tankinimą, rezultatas šoktelėjo iki 38,3 %, nors buvo sunaudota maždaug 6 kartus mažiau išvesties žetonų. Modelis nepakeistas, o našumas išaugo beveik tris kartus. Daugiau skaitykite mūsų ARC-AGI-3 infrastruktūros tyrime.
Agentinės darbo eigos dažnai apima dviejų rūšių darbą:
- Užduotis, kurioms reikia priimti sprendimus
- Darbą, kurį daugiausia sudaro duomenų perkėlimas, filtravimas ir jungimas
Kai agentas gauna 100 ataskaitų, filtruoja jas pagal datą ir nustato susijusius sandorius, modeliui nereikėtų savo konteksto lange nagrinėti kiekvieno tarpinio rezultato. Programinis įrankių iškvietimas leidžia GPT‑5.6 rašyti JavaScript kodą, koordinuoti įrankius, lygiagrečiai vykdyti nepriklausomus iškvietimus ir apdoroti jų išvestis už konteksto lango ribų. Taip modelis gali susitelkti į tai, kam reikia intelekto – pagrįstų sprendimų priėmimą.
Atliekant sudėtingas, lygiagrečiai vykdomas užduotis, veiksmų ir protavimo paskirstymas kelioms agentų darbo eigoms leidžia užduotis atlikti greičiau ir padidina intelektą. Tokiose sistemose pagrindinis agentas koordinuoja pagalbinius agentus ir perduoda jiems užduotis. Pagalbiniai agentai lygiagrečiai siekia savo tikslų, o galiausiai grąžina išvestis pagrindiniam agentui, kad šis parengtų galutinį rezultatą. Komandos gali pradėti naudotis savuoju kelių agentų režimu Responses API įjungdamos kelių agentų funkciją(atsidaro naujame lange). Taip pat veikia ir ChatGPT Ultra pajėgumo nuostata.
“„Qualia“ pasitelkia agentų komandas atviroms tyrimų problemoms spręsti, o GPT‑5.6 Sol tiesiog puikiai tiko. Jis buvo akivaizdžiai geresnis už GPT‑5.5, darbą baigė greičiau nei beveik visi kiti mūsų išbandyti modeliai ir netrukus tapo mūsų pagrindiniu OpenAI modeliu.”
“GPT‑5.6 yra geriausias mūsų matytas OpenAI darbo koordinatorius. Vienu metu pateikėme jam šešias specifikacijas – visas reikėjo aprašyti, įgyvendinti ir aptarti – o jis nieko nepametė ir išlaikė aukštą kokybę.”
Nors GPT‑5.6 gerai nustato tinkamą pagalbinių agentų skaičių ir kada juos paleisti, kelių agentų elgseną lengva valdyti. Nurodžius modeliui, kada pasitelkti pagalbinius agentus, padidėja tikimybė, kad jie bus paleisti tik tais atvejais, kai papildomos žetonų sąnaudos pagerins rezultatą.
Visoje modelių šeimoje užklausų podėlio galiojimo laikas pratęstas bent iki 30 minučių, o podėlio kontrolinius taškus dabar galima deterministiškai nustatyti modelio konteksto lange. Tai leido startuoliams gerokai padidinti podėlio atitikčių rodiklį.
Be podėlio kontrolinių taškų nustatymo, toliau naudojant tinkamą prompt_cache_key(atsidaro naujame lange) padidėja tikimybė, kad užklausos pateks į tą patį išvedimo modulį, kuris anksčiau apdorojo tą patį priešdėlį, todėl sumažėja delsa.
Visi šie pavyzdžiai aiškiai rodo, kaip smarkiai pasikeitė agentų kūrimo ekonomika.
Naudojimo atvejais, kuriems anksčiau kiekviename žingsnyje reikėjo priešakinio modelio, dabar galima pasiekti panašių ar geresnių rezultatų už gerokai mažesnę kainą: pakanka naudoti mažesnius modelius, derinti protavimo pastangas ir rinktis efektyvią architektūrą.
Nekantraujame pamatyti, ką sukursite!
- 2026 m.
- API platforma
Apie autorius
Šį vadovą parengė Samarth Madduru(atsidaro naujame lange), Prashant Mital(atsidaro naujame lange), Dave Leo(atsidaro naujame lange) ir Julien Reiman(atsidaro naujame lange), remdamiesi patirtimi glaudžiai bendradarbiaujant su GPT‑5.6 naudojančiais startuoliais nuo ankstyvųjų bandymų iki produkcijos.


