Preskočite na glavni sadržaj
OpenAI

29. srpnja 2026.

InženjerstvoTvrtka

Kako GPT‑5.6 spaja graničnu inteligenciju i graničnu učinkovitost

Učitavanje…

Obitelj modela GPT‑5.6 osmislili smo kako bismo uravnotežili mogućnosti i troškove u cijelom rasponu zadataka za koje ljudi upotrebljavaju naše modele. Naš vodeći model GPT‑5.6 Sol, s rasuđivanjem Max, nadmašuje Claude Fable 5 prema indeksu Artificial Analysis Coding Agent Index uz manje od polovice troška. Terra postiže jednake rezultate kao GPT‑5.5 na testovima inteligencije uz upola nižu cijenu, a Luna je naš najbrži i najpovoljniji model, s cijenom 80 % nižom od modela Sol. Kako bi ostvarili tu učinkovitost, naši istraživački i tehnički timovi proveli su znatne optimizacije na svakom važnom sloju našeg tehnološkog sustava. Ta poboljšanja obuhvaćaju naše modele, zaključivanje (način na koji pokrećemo modele radi generiranja izlaza) i naš agentski testni sklop, kojim se koriste i Codex i ChatGPT Work.

Dok smo u protekle četiri godine proširivali naše modele na milijardu aktivnih korisnika i više od dva milijuna tvrtki, učinkovitost je bila ključna za pružanje koristi inteligencije svima. Naša je misija osigurati da opća umjetna inteligencija koristi cijelom čovječanstvu. Tijekom tih godina kontinuirano smo otvarali nove mogućnosti optimizacije u cijelom tehnološkom sustavu kako bismo ponudili modele s najboljim performansama u svakoj točki krivulje troška i inteligencije. Uz GPT‑5.6 postigli smo dosad najveću učinkovitost inteligencije po tokenu, a model je obučen da obavi više posla po tokenu. Tijekom obuke optimiziramo i uspješnost zadatka i učinkovitost, usmjeravajući model da zadatak izvrši izravnijim putem.

Ova objava nadilazi naše modele i objašnjava kako smo učinkovitost ostvarili napretkom u dvama drugim važnim dijelovima tehnološkog sustava: 1) zaključivanju, optimizacijom procesa poput uravnoteženja opterećenja, spekulativnog dekodiranja, predmemoriranja i optimizacije kernela kako bismo iz istog hardvera dobili više izlaza, te 2) našem agentskom testnom sklopu, uključujući bolje upravljanje gomilanjem konteksta, uporabom alata i radom koji se ponavlja. Objasnit ćemo i ulogu modela GPT‑5.6 Sol u samostalnom ostvarivanju nekoliko tih poboljšanja. Iako se svako pojedinačno poboljšanje može činiti ograničenim, ti se uspjesi nadograđuju i omogućuju nam da dosegnemo granice inteligencije i učinkovitosti.

Dijagram prikazuje učinkovitost modela GPT-5.6 u agentskom testnom sklopu, API orkestraciji i zaključivanju modela, uz manje mrežnih podataka, manje rada CPU-a i veći izlaz GPU-a.

Ubrzavanje zaključivanja uz GPT‑5.6 Sol

U svijetu ograničenih računalnih resursa, u kojem potražnja za modelima raste brže od kapaciteta, učinkovitost je temelj dizajna svakog sustava. To osobito vrijedi za naš sustav zaključivanja, koji pokreće obučene modele radi generiranja odgovora. Naš je glavni cilj istim hardverom obraditi više tokena, a pritom očuvati inteligenciju, latenciju, dostupnost i pouzdanost koje korisnici očekuju.

Za to je potrebno optimizirati cijeli sustav. Model može biti vrlo učinkovit sam za sebe, ali njegovo posluživanje i dalje može biti skupo ako se zahtjevi loše raspoređuju, hardver miruje ili prijenos podataka usporava izračune. Poboljšanja na svim slojevima međusobno se nadograđuju, a koristi donose optimizacije usmjeravanja (kamo se zahtjevi šalju), raspoređivanja (kada se zahtjevi šalju), kernela (softvera koji se izvodi na GPU-ovima), predmemoriranja (spremanja i ponovne uporabe obavljenog rada) te implementacije modela (redoslijeda GPU koda). GPT‑5.6 Sol u Codexu imao je ključnu ulogu u svim tim optimizacijama.

Prvi je važan primjer uravnoteženje opterećenja. Na globalnoj razini zahtjeve usmjeravamo prema čimbenicima kao što su geografska lokacija, raspoloživi kapacitet i vrsta akceleratora (vrsta GPU-a ili specijaliziranog čipa koji pokreće model). Unutar klastera raspoređujemo rad među instancama modela na temelju opterećenja, duljine konteksta, dostupnosti predmemorije i drugih svojstava zahtjeva. Unutar svake instance rad se zatim mora učinkovito podijeliti među akceleratorima, podmrežama modela i računalnim jezgrama. GPT‑5.6 Sol u Codexu pomaže nam analizirati produkcijski promet, prepoznati ranije zanemarene izvore neravnoteže, testirati nove strategije usmjeravanja i stalno prilagođavati te heuristike. Samo su ta poboljšanja uravnoteženja opterećenja znatno smanjila troškove posluživanja naših modela.

GPT‑5.6 Sol upotrijebili smo i za optimizaciju prolaza modela unaprijed: izračuna koji ulazne podatke pretvara u predviđanja sljedećeg tokena. Čak i kada su pojedinačne operacije brze, suvišno premještanje memorije, sinkronizacija i neučinkoviti rasporedi podataka mogu ostaviti GPU-ove neiskorištenima. Kako bi to izbjegao, GPT‑5.6 Sol pronašao je rad koji se mogao unaprijed izračunati, izbjeći ili paralelizirati. Uz Codex, GPT‑5.6 Sol samostalno je prepisao i optimizirao naše produkcijske kernele, temeljni kod koji izvodi matematičke operacije od kojih se model sastoji. To je djelomično uspjelo zato što smo GPT‑5.6 obučili za učinkovito pisanje i poboljšavanje kernela u jezicima Triton(otvara se u novom prozoru) i Gluon(otvara se u novom prozoru), dvama programskim jezicima otvorenog koda za GPU-ove koje održava OpenAI. Ti su napori, zajedno sa širim napretkom kernela koji je ostvario GPT‑5.6 Sol, smanjili ukupne troškove posluživanja za 20 %. Mnogo smo uložili i u alate za provjeru, poput alata otvorenog koda FpSan(otvara se u novom prozoru) (sanitizator brojeva s pomičnim zarezom), koji pomažu potvrditi ispravnost kernela koje je napisao GPT‑5.6 Sol.

Spekulativno dekodiranje još je jedan način poboljšanja brzine i učinkovitosti. Ta tehnika uključuje pokretanje manjeg nacrtnog modela (ili „spekulatora”) usporedno s glavnim modelom, pri čemu nacrtni model predlaže nekoliko tokena koje glavni model istodobno provjerava. Kada se ti prijedlozi prihvate, sustav može proizvesti više izlaznih tokena jednim prolazom glavnog modela, čime se smanjuje količina skupih sekvencijalnih izračuna. GPT‑5.6 Sol poboljšao je vlastiti nacrtni model tako što je osmislio i proveo stotine eksperimenata na njegovoj arhitekturi te ispitao promjene veličine, strukture i značajki. Uz to, GPT‑5.6 Sol pokrenuo je i nadzirao postupak obuke spekulatora te samostalno intervenirao kada bi se pojavili problemi, uključujući kvarove hardvera i nestabilnost obuke. Ostvarena poboljšanja povećala su učinkovitost generiranja tokena za više od 15 %.

Pri obradi ulaznih tokena koji nisu u predmemoriji model u jednom računalno zahtjevnom prolazu izgrađuje predmemoriju ključ-vrijednost (KV); pri generiranju izlaza više je puta čita i proširuje. Optimalna konfiguracija posluživanja, primjerice grupiranje u serije, particioniranje i upravljanje KV-om, uvelike ovisi o radnom opterećenju — duljini upita i izlaza, veličini serije, stopi pogodaka u predmemoriji, svojstvima upita i drugim čimbenicima. Međutim, prostor mogućih konfiguracija prije je bio prevelik za sustavno podešavanje, pa su se inženjeri morali oslanjati na općenite heuristike. Uz GPT‑5.6 Sol u Codexu mogli smo analizirati produkcijska radna opterećenja, generirati i procijeniti moguće konfiguracije te do krajnjih granica optimizirati konfiguraciju pogona i modela za svaki scenarij. Time nova razina optimizacije prilagođene radnom opterećenju postaje praktična, pa se iz istog hardvera dobiva više korisnog zaključivanja.

Optimizacija zaključivanja kontinuirana je povratna petlja. Mjerimo ponašanje u produkciji, utvrđujemo najveće nedostatke, provodimo promjene i provjeravamo poboljšavaju li cijeli sustav, a ne samo izolirani test performansi. GPT‑5.6 Sol i Codex ubrzavaju svaki dio te petlje. To znači da naš tim može istražiti više ideja, brže odgovoriti na promjene radnih opterećenja i izgraditi sustav zaključivanja koji korisnicima donosi nižu latenciju, veći kapacitet i niže troškove.

Kako naš agentski testni sklop pojednostavnjuje rad koji se ponavlja

ChatGPT Work i Codex izvršavaju složene zadatke nizom zahtjeva modelu i poziva alata. Tijekom jednog poteza — od korisničkog zahtjeva do konačnog odgovora — Codex može pregledati izvorni kod, pretražiti povijest implementacija, pročitati izvješća o incidentima, urediti datoteku i pokrenuti testove. Svaki korak može zahtijevati zaseban zahtjev.

Priprema konteksta, prijenos podataka, izvođenje zaključivanja, pozivanje alata i pokretanje procesa zahtijevaju vrijeme i računalne resurse. Ako zadatak zahtijeva 30 zahtjeva modelu, dodatna sekunda po zahtjevu brzo se zbraja. Poboljšanje ukupnih performansi znači smanjivanje ponavljajućeg rada u cijelom sustavu, a ne samo ubrzavanje modela.

Korisnički zadatak ulazi u model, koji može pozvati alat, primiti rezultat i ponovno donijeti odluku, ponavljajući postupak do završetka zadatka.

Jedan korisnički potez može sadržavati brojne iteracije modela i alata. Svaki trošak unutar ponavljajućeg područja može nastati mnogo puta.

Ti su čimbenici utjecali na dizajn našeg agentskog testnog sklopa, orkestracijskog sloja u Rustu koji povezuje naše modele, alate i korisnikovo okruženje. U nastavku ćemo objasniti kako izbjegavanje gomilanja konteksta, učitavanje alata i ponovna uporaba obavljenog rada čine svaki zahtjev učinkovitijim.

Izbjegavajte gomilanje konteksta

Kako agenti dobivaju pristup sve većem broju alata, vještina, dodataka i povijesti razgovora, kontekstni se prozori lako mogu proširiti. To povećava troškove, ometa model i potiče nepotrebno rasuđivanje. Testni sklop može smanjiti to opterećenje odgođenim otkrivanjem, zbog kojeg integracije, prilagođeni MCP alati, vještine i dodaci postaju dostupni tek kada su potrebni. Testni sklop također sprječava da pojedinačni alati i MCP integracije neočekivano zauzmu kontekstni prozor. Izlaz alata prema zadanim je postavkama ograničen na 10.000 tokena, osim ako model ne zatraži drugo ograničenje.

Očuvajte identične prefikse za predmemoriranje upita

Kao što je već spomenuto, petlja agenta može tijekom jednog poteza više puta GPU-ovima poslati iste upute, povijest razgovora, definicije alata i ranije rezultate. Obrada tih ponovljenih ulaza skupa je, pa se predmemoriranjem upita ponovno upotrebljava izračun povezan s prethodno obrađenim prefiksom upita. Kako bi očuvao taj prefiks, agentski orkestracijski sloj svu povijest vidljivu modelu tretira kao sadržaj koji se samo nadopunjuje: nove poruke, rezultati alata i ažuriranja okruženja dodaju se na kraj umjesto da se umeću u raniji kontekst. Alati se također prikazuju determinističkim redoslijedom, dok se postavke izvođenja, poput pravila odobravanja, primjenjuju tijekom izvođenja umjesto da budu ugrađene u definicije alata. Ova projektna odluka pridonosi ukupno visokim stopama pogodaka u predmemoriji upita za Codex i ChatGPT Work.

Tri zahtjeva uspoređuju bajtove poslane trajnom vezom s rastućim kontekstom koji model vidi i prefiksom koji se može ponovno upotrijebiti iz predmemorije.

Inkrementalni prijenos mijenja ono što prolazi mrežom, a predmemoriranje upita mijenja ono što model možda neće morati ponovno izračunati. Širine su konceptualne, a dodatni sloj kompresije nije prikazan.

Učinkovitost duž krivulje inteligencije

Povećanje učinkovitosti koje smo ostvarili uz GPT‑5.6 rezultat je višegodišnjih poboljšanja koja su se nadograđivala u cijelom tehnološkom sustavu, od istraživanja i zaključivanja do našeg agentskog testnog sklopa. Uloga modela GPT‑5.6 u ostvarivanju mnogih od tih poboljšanja daje nam razloga za optimizam u pogledu ubrzavanja optimizacija. Nastavit ćemo provoditi veće optimizacije u područjima poput optimizacije kernela, uz temeljna poboljšanja našeg tehnološkog sustava. Radujemo se što ćemo ta stalna poboljšanja u pozadini prenijeti našim korisnicima i klijentima u obliku dostupnije i troškovno učinkovitije inteligencije.

Posebno zahvaljujemo Matthewu Ferrariju, Philippeu Tilletu, Ahmedu Ibrahimu, Joeu Gershensonu i Steveu Coffeyju, članovima tehničkog osoblja, na doprinosu ovoj objavi.

Autor

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson i Steve Coffey