Preskočite na glavni sadržaj
OpenAI

29. juli 2026.

InženjeringKompanija

Kako GPT‑5.6 spaja graničnu inteligenciju i graničnu efikasnost

Učitavanje…

Porodicu modela GPT‑5.6 osmislili smo kako bismo uravnotežili sposobnosti i troškove u cijelom rasponu zadataka za koje ljudi koriste naše modele. Naš glavni model GPT‑5.6 Sol, uz maksimalno rezonovanje, nadmašuje Claude Fable 5 na indeksu Artificial Analysis Coding Agent uz manje od polovine troškova. Terra postiže jednake rezultate kao GPT‑5.5 na testovima inteligencije uz upola nižu cijenu, a Luna je naš najbrži i najpovoljniji model, čija je cijena 80% niža od cijene modela Sol. Kako bi ostvarili tu efikasnost, naši istraživački i tehnički timovi proveli su značajne optimizacije na svakom važnom sloju našeg tehnološkog sistema. Ta poboljšanja obuhvataju naše modele, zaključivanje (način na koji pokrećemo modele radi generiranja izlaza) i agentski harness koji koriste i Codex i ChatGPT Work.

Dok smo u protekle četiri godine širili naše modele na milijardu aktivnih korisnika i više od dva miliona kompanija, efikasnost je bila ključna za pružanje koristi inteligencije svima. Naša misija je osigurati da opća umjetna inteligencija koristi cijelom čovječanstvu. Tokom tih godina neprestano smo radili na većim optimizacijama cijelog tehnološkog sistema kako bismo ponudili modele s najboljim performansama na svakoj tački krivulje troška i inteligencije. Uz GPT‑5.6 postigli smo dosad najveću efikasnost inteligencije po tokenu, jer je obučen da obavi više posla po tokenu. Tokom obuke optimiziramo i uspješno izvršavanje zadatka i efikasnost, usmjeravajući model da zadatak obavi izravnijim putem.

Ova objava ide dalje od naših modela i opisuje kako smo unapređenjima još dva važna dijela tehnološkog sistema povećali efikasnost: 1) zaključivanja, optimizacijom procesa poput uravnotežavanja opterećenja, spekulativnog dekodiranja, predmemoriranja i optimizacije kernela radi dobivanja više izlaza iz istog hardvera; i 2) našeg agentskog harnessa, uključujući bolje upravljanje prekomjernim rastom konteksta, upotrebom alata i ponavljanim radom. Objasnit ćemo i ulogu GPT‑5.6 Sol u samostalnom ostvarivanju nekoliko tih poboljšanja. Iako svako pojedinačno poboljšanje može djelovati ograničeno, njihovi učinci se umnožavaju i omogućavaju nam da dosegnemo granice inteligencije i efikasnosti.

Dijagram koji prikazuje efikasnost GPT-5.6 u agentskom harnessu, orkestraciji API-ja i zaključivanju modela, uz manje mrežnih podataka, manje rada CPU-a i veći izlaz GPU-a.

Ubrzavanje zaključivanja uz GPT‑5.6 Sol

U svijetu ograničenih računarskih resursa, gdje potražnja za modelima raste brže od kapaciteta, efikasnost je temelj dizajna svakog sistema. To posebno važi za naš sistem zaključivanja, koji pokreće obučene modele radi generiranja odgovora. Naš glavni cilj je obraditi više tokena istim hardverom, uz očuvanje inteligencije, odziva, dostupnosti i pouzdanosti koje korisnici očekuju.

Za to je potrebno optimizirati cijeli sistem. Model može biti vrlo efikasan sam za sebe, ali i dalje skup za posluživanje ako su zahtjevi loše raspoređeni, hardver miruje ili prijenos podataka usporava izračunavanje. Poboljšanja na svakom sloju međusobno se umnožavaju, a napredak dolazi iz optimizacije usmjeravanja (kamo se zahtjevi šalju), raspoređivanja (kada se šalju), kernela (softvera koji se izvršava na GPU-ovima), predmemoriranja (čuvanja i ponovne upotrebe rada) te implementacije modela (redoslijeda GPU koda). GPT‑5.6 Sol u Codexu imao je ključnu ulogu u svim tim optimizacijama.

Prvi važan primjer je uravnotežavanje opterećenja. Na globalnom nivou zahtjeve usmjeravamo na osnovu faktora kao što su geografska lokacija, raspoloživi kapacitet i vrsta akceleratora (vrsta GPU-a ili specijaliziranog čipa koji pokreće model). Unutar klastera raspoređujemo rad među instancama modela na osnovu opterećenja, dužine konteksta, dostupnosti predmemorije i drugih svojstava zahtjeva. Unutar svake instance rad se zatim mora efikasno podijeliti između akceleratora, podmreža modela i računarskih jezgri. GPT‑5.6 Sol u Codexu pomaže nam analizirati produkcijski saobraćaj, pronaći ranije previđene izvore neravnoteže, testirati nove strategije usmjeravanja i stalno podešavati te heuristike. Sama ova poboljšanja uravnotežavanja opterećenja znatno su smanjila troškove posluživanja naših modela.

GPT‑5.6 Sol koristili smo i za optimizaciju prolaza modela unaprijed: izračunavanja koje ulaze pretvara u predviđanja sljedećeg tokena. Čak i kada su pojedinačne operacije brze, prekomjerno premještanje memorije, sinhronizacija i neefikasan raspored podataka mogu ostaviti GPU-ove neiskorištenim. Kako bi to izbjegao, GPT‑5.6 Sol pronašao je rad koji se mogao unaprijed izračunati, izbjeći ili paralelizirati. Uz Codex, GPT‑5.6 Sol samostalno je prepisao i optimizirao naše produkcijske kernele, temeljni kôd koji izvršava matematičke operacije od kojih je model sastavljen. To je djelimično uspjelo zato što smo GPT‑5.6 obučili da efikasno piše i poboljšava kernele u jezicima Triton(otvara se u novom prozoru) i Gluon(otvara se u novom prozoru), dvama programskim jezicima otvorenog koda za GPU koje održava OpenAI. Ti napori, zajedno sa širim unapređenjima kernela koja je ostvario GPT‑5.6 Sol, smanjili su ukupne troškove posluživanja za 20%. Mnogo smo ulagali i u alate za provjeru, poput alata otvorenog koda FpSan(otvara se u novom prozoru) (sanitizator brojeva s pomičnim zarezom), kako bismo lakše potvrdili ispravnost kernela koje je napisao GPT‑5.6 Sol.

Spekulativno dekodiranje još je jedan način poboljšanja brzine i efikasnosti. Ta tehnika podrazumijeva pokretanje manjeg nacrtnog modela (ili „spekulatora”) uz glavni model, koji predlaže nekoliko tokena kako bi ih glavni model paralelno provjerio. Kada se ti prijedlozi prihvate, sistem može proizvesti više izlaznih tokena jednim prolazom glavnog modela, čime se smanjuje količina skupog sekvencijalnog izračunavanja. GPT‑5.6 Sol poboljšao je vlastiti nacrtni model tako što je osmislio i proveo stotine eksperimenata na njegovoj arhitekturi, testirajući promjene veličine, strukture i karakteristika. Osim toga, GPT‑5.6 Sol pokrenuo je i nadzirao proces obuke spekulatora te samostalno intervenirao kada su se pojavili problemi, uključujući kvarove hardvera i nestabilnost obuke. Ostvarena poboljšanja povećala su efikasnost generiranja tokena za više od 15%.

Pri obradi ulaznih tokena koji nisu u predmemoriji, model gradi predmemoriju ključ-vrijednost (KV) u jednom računarski zahtjevnom prolazu; pri generiranju izlaza više puta čita iz te predmemorije i proširuje je. Optimalna konfiguracija posluživanja, poput grupiranja, particioniranja i upravljanja KV-om, uveliko zavisi od radnog opterećenja — dužine upita i izlaza, veličine grupe, stope pogodaka u predmemoriji, karakteristika upita i drugih faktora. Međutim, prostor mogućih konfiguracija ranije je bio prevelik za sistematsko podešavanje, pa su se inženjeri morali oslanjati na opće heuristike. Uz GPT‑5.6 Sol u Codexu mogli smo analizirati produkcijska radna opterećenja, generirati i ocijeniti moguće konfiguracije te maksimalno optimizirati način konfiguriranja pogona i modela za svaki scenarij. Time novi nivo optimizacije prilagođene radnom opterećenju postaje praktičan i omogućava više korisnog zaključivanja na istom hardveru.

Optimizacija zaključivanja kontinuirana je povratna petlja. Mjerimo ponašanje u produkciji, utvrđujemo najveće nedostatke, provodimo promjene i potvrđujemo da poboljšavaju cijeli sistem, a ne samo izolirano referentno mjerenje. GPT‑5.6 Sol i Codex ubrzavaju svaki dio te petlje. To znači da naš tim može istražiti više ideja, brže odgovoriti na promjene radnih opterećenja i izgraditi sistem zaključivanja s manjim kašnjenjem, većim kapacitetom i nižim troškovima za korisnike.

Kako naš agentski harness pojednostavljuje ponavljani rad

ChatGPT Work i Codex izvršavaju složene zadatke nizom zahtjeva modelu i poziva alata. U jednom potezu — od korisničkog zahtjeva do konačnog odgovora — Codex može pregledati izvorni kôd, pretražiti historiju implementacija, pročitati izvještaje o incidentima, urediti datoteku i pokrenuti testove. Svaki korak može zahtijevati zaseban zahtjev.

Priprema konteksta, prijenos podataka, pokretanje zaključivanja, pozivanje alata i pokretanje procesa zahtijevaju vrijeme i računarske resurse. Ako zadatak zahtijeva 30 zahtjeva modelu, dodatna sekunda po zahtjevu brzo se sabira. Poboljšanje ukupnih performansi znači smanjenje ponavljanog rada u cijelom sistemu, a ne samo ubrzavanje modela.

Korisnički zadatak ulazi u model, koji može pozvati alat, primiti rezultat i više puta donijeti novu odluku prije nego što završi zadatak.

Jedan korisnički potez može sadržavati mnogo iteracija modela i alata. Svaki trošak unutar ponavljanog područja može se platiti više puta.

Ti faktori umnožavanja utjecali su na dizajn našeg agentskog harnessa, orkestracijskog sloja u Rustu koji povezuje naše modele, alate i korisničko okruženje. U nastavku ćemo objasniti kako izbjegavanje prekomjernog rasta konteksta, učitavanje alata i ponovna upotreba obavljenog rada povećavaju efikasnost svakog zahtjeva.

Izbjegavanje prekomjernog rasta konteksta

Kako agenti dobijaju pristup većem broju alata, vještina, dodataka i historiji razgovora, kontekstni prozori mogu se lako proširiti. To povećava troškove, ometa model i izaziva nepotrebno rezonovanje. Harness može smanjiti ovo opterećenje odgođenim otkrivanjem, zahvaljujući kojem integracije, prilagođeni MCP alati, vještine i dodaci postaju dostupni tek kada su potrebni. Harness također sprečava da pojedinačni alati i MCP integracije neočekivano zauzmu kontekstni prozor. Izlaz alata standardno je ograničen na 10.000 tokena, osim ako model zatraži drugo ograničenje.

Očuvanje tačnih prefiksa za predmemoriranje upita

Kao što je ranije navedeno, petlja agenta može više puta tokom jednog poteza GPU-ovima poslati iste upute, historiju razgovora, definicije alata i ranije rezultate. Obrada tih ponovljenih ulaza je skupa, pa predmemoriranje upita ponovo koristi izračunavanje povezano s prethodno obrađenim prefiksom upita. Kako bi očuvao taj prefiks, harness svu historiju vidljivu modelu tretira tako da se može samo dopunjavati: nove poruke, rezultati alata i ažuriranja okruženja dodaju se na kraj umjesto da se umeću u raniji kontekst. Alati se također predstavljaju utvrđenim redoslijedom, dok se postavke izvršavanja, poput pravila odobravanja, primjenjuju tokom izvršavanja umjesto da budu ugrađene u definicije alata. Ova projektna odluka doprinosi visokim ukupnim stopama pogodaka u predmemoriji upita za Codex i ChatGPT Work.

Tri zahtjeva porede bajtove poslane putem trajne veze s rastućim kontekstom koji model vidi i prefiksom pogodnim za ponovnu upotrebu iz predmemorije.

Inkrementalni prijenos mijenja ono što prolazi mrežom, a predmemoriranje upita mijenja šta model ne mora ponovo izračunavati. Širine su konceptualne, a dodatni sloj kompresije nije prikazan.

Efikasnost duž krivulje inteligencije

Poboljšanja efikasnosti koja smo ostvarili uz GPT‑5.6 rezultat su višegodišnjih uzastopnih unapređenja cijelog tehnološkog sistema, uključujući istraživanje, zaključivanje i naš agentski harness. Uloga GPT‑5.6 u ostvarivanju mnogih od ovih poboljšanja ulijeva nam optimizam u pogledu ubrzavanja optimizacija. Nastavit ćemo ostvarivati veće optimizacije u područjima poput optimizacije kernela, uz temeljna unapređenja našeg tehnološkog sistema. Radujemo se tome što ćemo ova stalna poboljšanja u pozadini prenijeti našim korisnicima i klijentima u obliku dostupnije i troškovno efikasnije inteligencije.

Posebno zahvaljujemo članovima tehničkog osoblja Matthewu Ferrariju, Philippeu Tilletu, Ahmedu Ibrahimu, Joeu Gershensonu i Steveu Coffeyju na doprinosu ovoj objavi.

Autor

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson i Steve Coffey