Pāriet uz galveno saturu
OpenAI

2026. gada 29. jūlijs

InženierijaUzņēmums

Kā GPT‑5.6 apvieno robežšķirtnes intelektu un efektivitāti

Notiek ielāde…

GPT‑5.6 modeļu saimi izstrādājām tā, lai līdzsvarotu spējas un izmaksas visā to uzdevumu klāstā, kuriem cilvēki izmanto mūsu modeļus. Mūsu pamatmodelis GPT‑5.6 Sol ar Max spriestspēju pārspēj Claude Fable 5 etalontestā Artificial Analysis Coding Agent Index, maksājot mazāk nekā uz pusi tik daudz. Terra intelekta etalontestos darbojas tikpat labi kā GPT‑5.5, bet maksā uz pusi mazāk, savukārt Luna ir mūsu ātrākais un pieejamākais modelis, kura cena ir par 80% zemāka nekā Sol. Lai sasniegtu šādu efektivitāti, mūsu pētniecības un tehniskās komandas ir būtiski optimizējušas katru galveno tehnoloģiju kopuma slāni. Šie uzlabojumi aptver mūsu modeļus, izsecināšanu (modeļu darbināšanu izvades ģenerēšanai) un aģentisko izpildes ietvaru, ko izmanto gan Codex, gan ChatGPT Work.

Pēdējo četru gadu laikā izvēršot mūsu modeļus līdz 1 miljardam aktīvo lietotāju un vairāk nekā 2 miljoniem uzņēmumu, efektivitātei ir bijusi izšķiroša nozīme, lai intelekta sniegtie ieguvumi būtu pieejami ikvienam. Mūsu misija ir panākt, lai mākslīgais vispārējais intelekts sniegtu labumu visai cilvēcei. Šajos gados esam pastāvīgi meklējuši arvien plašākas optimizācijas iespējas visā mūsu tehnoloģiju kopumā, lai katrā izmaksu un intelekta līknes punktā piedāvātu modeļus ar vislabāko veiktspēju. Ar GPT‑5.6 esam sasnieguši līdz šim augstāko intelekta efektivitāti uz vienu tekstvienību; tas ir apmācīts paveikt vairāk darba ar katru tekstvienību. Apmācībā optimizējam gan uzdevuma sekmīgu izpildi, gan efektivitāti, veidojot modeli tā, lai tas uzdevumu izpildītu tiešāk.

Šajā rakstā aplūkojam ne tikai modeļus, bet arī to, kā efektivitāti panācām ar uzlabojumiem divās citās būtiskās tehnoloģiju kopuma daļās: 1) izsecināšanā — optimizējot tādus procesus kā slodzes līdzsvarošana, spekulatīvā dekodēšana, kešošana un kodolu optimizācija, lai no tās pašas aparatūras iegūtu vairāk izvades; 2) mūsu aģentiskajā izpildes ietvarā — labāk pārvaldot konteksta uzblīšanu, rīku izmantošanu un atkārtotu darbu. Pastāstīsim arī par GPT‑5.6 Sol lomu vairāku šo ieguvumu autonomā sasniegšanā. Lai gan katrs atsevišķs uzlabojums var šķist neliels, kopā tie ļauj mums sasniegt robežšķirtni gan intelekta, gan efektivitātes jomā.

Diagramma, kurā parādīta GPT-5.6 efektivitāte aģenta izpildes ietvarā, API orķestrācijā un modeļa izsecināšanā, samazinot tīkla datu apjomu un CPU darbu un palielinot GPU izvadi.

Izsecināšanas paātrināšana ar GPT‑5.6 Sol

Pasaulē, kur skaitļošanas resursi ir ierobežoti un pieprasījums pēc modeļiem aug straujāk nekā jauda, efektivitāte ir ikvienas sistēmas uzbūves pamatā. Tas jo īpaši attiecas uz mūsu izsecināšanas tehnoloģiju kopumu, kurā apmācīti modeļi ģenerē atbildes. Mūsu galvenais mērķis ir ar to pašu aparatūru apstrādāt vairāk tekstvienību, vienlaikus saglabājot lietotāju gaidīto intelektu, latentumu, pieejamību un uzticamību.

Lai to panāktu, jāoptimizē visa sistēma. Atsevišķi modelis var būt ļoti efektīvs, tomēr tā apkalpošana var būt dārga, ja pieprasījumi tiek slikti sadalīti, aparatūra netiek izmantota vai datu pārvietošana palēnina aprēķinus. Uzlabojumi katrā slānī summējas. Ieguvumus nodrošina maršrutēšanas (kur tiek nosūtīti pieprasījumi), plānošanas (kad tie tiek nosūtīti), kodolu (GPU darbinātās programmatūras), kešošanas (saglabāta un atkārtoti izmantota darba) un modeļa ieviešanas (GPU koda izpildes secības) optimizācija. GPT‑5.6 Sol platformā Codex bija būtiska loma visās šajās optimizācijās.

Pirmais nozīmīgais piemērs ir slodzes līdzsvarošana. Globālā mērogā mēs maršrutējam pieprasījumus, ņemot vērā tādus faktorus kā ģeogrāfiskā atrašanās vieta, pieejamā jauda un paātrinātāja veids (GPU vai specializētās mikroshēmas veids, kurā darbojas modelis). Klasterī darbu starp modeļa instancēm sadalām pēc slodzes, konteksta garuma, kešatmiņas pieejamības un citām pieprasījuma īpašībām. Katrā instancē darbs pēc tam efektīvi jāsadala starp paātrinātājiem, modeļa apakštīkliem un skaitļošanas kodoliem. GPT‑5.6 Sol platformā Codex palīdz analizēt ražošanas datplūsmu, atklāt iepriekš nepamanītus nelīdzsvarotības avotus, pārbaudīt jaunas maršrutēšanas stratēģijas un pastāvīgi pielāgot šīs heiristikas. Šie slodzes līdzsvarošanas uzlabojumi vien būtiski samazināja mūsu modeļu apkalpošanas izmaksas.

GPT‑5.6 Sol izmantojām arī modeļa tiešās caurlaides optimizēšanai — tas ir aprēķins, kas ievaddatus pārvērš nākamās tekstvienības prognozēs. Pat ja atsevišķas darbības ir ātras, pārmērīga datu pārvietošana, sinhronizācija un neefektīvs datu izkārtojums var atstāt GPU dīkstāvē. Lai no tā izvairītos, GPT‑5.6 Sol atrada darbu, ko varēja iepriekš aprēķināt, izlaist vai paralelizēt. Izmantojot Codex, GPT‑5.6 Sol autonomi pārrakstīja un optimizēja mūsu ražošanas kodolus — pamata kodu, kas izpilda modeli veidojošās matemātiskās darbības. Tas daļēji izdevās tāpēc, ka esam apmācījuši GPT‑5.6 efektīvi rakstīt un uzlabot kodolus valodās Triton(atveras jaunā logā) un Gluon(atveras jaunā logā) — divās OpenAI uzturētās atvērtā pirmkoda GPU programmēšanas valodās. Šie centieni kopā ar plašākiem GPT‑5.6 Sol kodolu uzlabojumiem samazināja pilna apkalpošanas cikla izmaksas par 20%. Esam arī daudz ieguldījuši verifikācijas rīkos, piemēram, atvērtā pirmkoda rīkā FpSan(atveras jaunā logā) (peldošā komata sanitizētājā), lai palīdzētu pārbaudīt GPT‑5.6 Sol rakstīto kodolu pareizību.

Spekulatīvā dekodēšana ir vēl viens veids, kā uzlabot ātrumu un efektivitāti. Šajā metodē līdztekus galvenajam modelim darbojas mazāks melnraksta jeb „spekulatora” modelis, kas piedāvā vairākas tekstvienības, kuras galvenais modelis pārbauda paralēli. Kad šie priekšlikumi tiek pieņemti, sistēma vienā galvenā modeļa caurlaidē var izveidot vairākas izvades tekstvienības, tā samazinot dārgo secīgo aprēķinu apjomu. GPT‑5.6 Sol uzlaboja savu melnraksta modeli, izstrādājot un veicot simtiem eksperimentu ar tā arhitektūru un pārbaudot izmēra, struktūras un funkciju izmaiņas. Turklāt GPT‑5.6 Sol sāka un uzraudzīja spekulatora apmācību, autonomi iejaucoties, kad radās problēmas, tostarp aparatūras kļūmes un apmācības nestabilitāte. Šie uzlabojumi palielināja tekstvienību ģenerēšanas efektivitāti par vairāk nekā 15%.

Apstrādājot nekešotas ievades tekstvienības, modelis vienā skaitļošanas ziņā intensīvā caurlaidē izveido atslēgu un vērtību (KV) kešatmiņu; ģenerējot izvadi, tas šo kešatmiņu atkārtoti nolasa un papildina. Optimālā apkalpošanas konfigurācija, piemēram, grupēšana paketēs, dalīšana segmentos un KV pārvaldība, ir ļoti atkarīga no darba slodzes — uzvednes un izvades garuma, paketes lieluma, kešatmiņas trāpījumu īpatsvara, vaicājumu īpašībām un citiem faktoriem. Tomēr iepriekš konfigurāciju telpa bija pārāk plaša sistemātiskai pielāgošanai, tāpēc inženieriem nācās paļauties uz vispārīgām heiristikām. Izmantojot GPT‑5.6 Sol platformā Codex, varējām analizēt ražošanas darba slodzes, ģenerēt un izvērtēt konfigurāciju variantus un maksimāli optimizēt dziņa un modeļa konfigurāciju katram scenārijam. Tādējādi kļūst praktiski iespējams jauns konkrētai darba slodzei pielāgotas optimizācijas līmenis, iegūstot vairāk noderīgu izsecinājumu ar to pašu aparatūru.

Izsecināšanas optimizācija ir nepārtraukts atgriezeniskās saites cikls. Mēs novērtējam sistēmas darbību ražošanā, atrodam lielākos trūkumus, ieviešam izmaiņas un pārbaudām, vai tās uzlabo visu sistēmu, nevis tikai atsevišķu etalontestu. GPT‑5.6 Sol un Codex paātrina ikvienu šī cikla daļu. Tādējādi mūsu komanda var izpētīt vairāk ideju, ātrāk reaģēt uz mainīgām darba slodzēm un izveidot izsecināšanas tehnoloģiju kopumu, kas lietotājiem nodrošina mazāku latentumu, lielāku jaudu un zemākas izmaksas.

Kā mūsu aģentiskais izpildes ietvars racionalizē atkārtotu darbu

ChatGPT Work un Codex izpilda sarežģītus uzdevumus, izmantojot virkni modeļa pieprasījumu un rīku izsaukumu. Viena pieprasījuma laikā — no lietotāja pieprasījuma līdz gala atbildei — Codex var pārbaudīt pirmkodu, meklēt izvietošanas vēsturē, lasīt incidentu pārskatus, rediģēt failu un palaist testus. Katrai darbībai var būt vajadzīgs atsevišķs pieprasījums.

Konteksta sagatavošana, datu pārsūtīšana, izsecināšana, rīku izsaukšana un procesu palaišana prasa laiku un skaitļošanas resursus. Ja uzdevumam vajadzīgi 30 modeļa pieprasījumi, katra pieprasījuma papildu sekunde summējas. Lai uzlabotu kopējo veiktspēju, jāmazina atkārtots darbs visā sistēmā, nevis tikai jāpaātrina modelis.

Lietotāja uzdevums nonāk modelī, kas var izsaukt rīku, saņemt rezultātu un atkārtoti pieņemt nākamo lēmumu, līdz uzdevums ir pabeigts.

Viens lietotāja pieprasījums var ietvert daudzas modeļa un rīku darbību iterācijas. Atkārtotajā daļā jebkuras izmaksas var rasties daudzkārt.

Šie daudzkāršojošie faktori ir noteikuši mūsu aģentiskā izpildes ietvara uzbūvi. Tas ir Rust valodā veidots orķestrācijas slānis, kas savieno mūsu modeļus, rīkus un lietotāja vidi. Tālāk aplūkosim, kā izvairīšanās no konteksta uzblīšanas, rīku ielāde un darba atkārtota izmantošana padara katru pieprasījumu efektīvāku.

Novērsiet konteksta uzblīšanu

Piešķirot aģentiem piekļuvi arvien vairāk rīkiem, prasmēm, spraudņiem un sarunu vēsturei, konteksta logi var viegli paplašināties. Tas palielina izmaksas, novērš modeļa uzmanību un rosina nevajadzīgu spriestspējas izmantošanu. Izpildes ietvars var mazināt šo slodzi ar atlikto atklāšanu, kas integrācijas, pielāgotus MCP rīkus, prasmes un spraudņus padara pieejamus tikai tad, kad tie ir vajadzīgi. Izpildes ietvars arī neļauj atsevišķiem rīkiem un MCP integrācijām negaidīti aizpildīt konteksta logu. Pēc noklusējuma rīka izvade ir ierobežota līdz 10 000 tekstvienībām, ja vien modelis nepieprasa citu ierobežojumu.

Saglabājiet precīzus prefiksus uzvedņu kešatmiņai

Kā minēts iepriekš, aģenta cikls viena pieprasījuma laikā var vairākkārt nosūtīt GPU vienus un tos pašus norādījumus, sarunas vēsturi, rīku definīcijas un iepriekšējos rezultātus. Šo atkārtoto ievaddatu apstrāde ir dārga, tāpēc uzvedņu kešatmiņa atkārtoti izmanto aprēķinus, kas saistīti ar iepriekš apstrādātas uzvednes prefiksu. Lai šo prefiksu saglabātu, izpildes ietvars visu modelim redzamo vēsturi apstrādā kā tikai papildināmu: jauni ziņojumi, rīku rezultāti un vides atjauninājumi tiek pievienoti beigās, nevis ievietoti agrākā kontekstā. Arī rīki tiek parādīti determinētā secībā, savukārt izpildlaika iestatījumi, piemēram, apstiprināšanas politikas, tiek lietoti izpildes laikā, nevis iekļauti rīku definīcijās. Šis risinājums palīdz Codex un ChatGPT Work sasniegt augstu kopējo uzvedņu kešatmiņas trāpījumu īpatsvaru.

Trīs pieprasījumos salīdzināts pa pastāvīgu savienojumu nosūtīto baitu apjoms, modeļa redzamā konteksta pieaugums un kešatmiņā atkārtoti izmantojamais prefikss.

Inkrementāla pārsūtīšana maina tīklā pārraidīto informāciju, savukārt uzvedņu kešatmiņa maina to, kādus aprēķinus modelim var nebūt jāatkārto. Platumi ir konceptuāli, un papildu saspiešanas slānis nav attēlots.

Efektivitāte visā intelekta līknes diapazonā

Ar GPT‑5.6 panāktais efektivitātes pieaugums ir rezultāts gadiem ilgiem, savstarpēji papildinošiem uzlabojumiem visā tehnoloģiju kopumā — pētniecībā, izsecināšanā un mūsu aģentiskajā izpildes ietvarā. GPT‑5.6 loma daudzu šo uzlabojumu īstenošanā ļauj mums optimistiski raudzīties uz optimizācijas tempa paātrināšanos. Līdztekus fundamentāliem mūsu tehnoloģiju kopuma uzlabojumiem turpināsim veikt vēl plašāku optimizāciju, piemēram, kodolu optimizāciju. Ceram šos pastāvīgos, lietotājiem neredzamos uzlabojumus nodot mūsu lietotājiem un klientiem plašāk pieejama un izmaksu ziņā efektīvāka intelekta veidā.

Īpašs paldies tehniskajiem darbiniekiem Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson un Steve Coffey par ieguldījumu šī raksta tapšanā.

Autors

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson un Steve Coffey