Preskočiť na hlavný obsah
OpenAI

29. júla 2026

TechnikaSpoločnosť

Ako GPT‑5.6 spája prelomovú inteligenciu s prelomovou efektivitou

Načítava sa…

Rodinu modelov GPT‑5.6 sme navrhli tak, aby vyvažovala schopnosti a náklady v celom spektre úloh, na ktoré ľudia používajú naše modely. Náš vlajkový model GPT‑5.6 Sol s maximálnym uvažovaním prekonáva Claude Fable 5 v indexe Artificial Analysis Coding Agent Index za menej než polovičné náklady. Terra dosahuje v testoch inteligencie rovnaké výsledky ako GPT‑5.5 za polovičnú cenu a Luna je náš najrýchlejší a cenovo najdostupnejší model, ktorého cena je o 80 % nižšia než cena modelu Sol. Aby sme dosiahli túto efektivitu, naše výskumné a technické tímy výrazne optimalizovali každú hlavnú vrstvu nášho technologického systému. Tieto zlepšenia zahŕňajú naše modely, inferenciu (spôsob, akým modely spúšťame na generovanie výstupu) aj agentický harness, ktorý využívajú Codex aj ChatGPT Work.

Keďže sme za posledné štyri roky rozšírili naše modely na 1 miliardu aktívnych používateľov a viac než 2 milióny firiem, efektivita bola kľúčom k sprístupneniu prínosov inteligencie všetkým. Naším poslaním je zabezpečiť, aby všeobecná umelá inteligencia prinášala úžitok celému ľudstvu. Počas týchto rokov sme neustále hľadali ďalšie možnosti optimalizácie celého technologického systému, aby sme v každom bode krivky nákladov a inteligencie ponúkali modely s najvyšším výkonom. S modelom GPT‑5.6, ktorý je trénovaný tak, aby vykonal viac práce na jeden token, sme dosiahli doteraz najvyššiu efektivitu inteligencie na token. Pri trénovaní optimalizujeme úspešnosť úloh aj efektivitu a model vedieme k tomu, aby úlohou prechádzal priamejšie.

Tento článok sa pozerá aj za hranice našich modelov a ukazuje, ako sme zvýšili efektivitu pokrokom v dvoch ďalších hlavných častiach technologického systému: 1) v inferencii sme optimalizovali procesy, ako sú vyvažovanie záťaže, špekulatívne dekódovanie, ukladanie do vyrovnávacej pamäte a optimalizácia jadier, aby sme z rovnakého hardvéru získali viac výstupu; 2) v našom agentickom harnesse sme zlepšili správu nadmerného rastu kontextu, používania nástrojov a opakovanej práce. Priblížime aj úlohu GPT‑5.6 Sol pri autonómnom zavedení niekoľkých z týchto zlepšení. Hoci sa jednotlivé zlepšenia môžu zdať malé, ich účinky sa znásobujú a umožňujú nám dosahovať prelomovú úroveň inteligencie aj efektivity.

Diagram znázorňujúci efektivitu GPT-5.6 v harnesse agenta, orchestrácii API a inferencii modelu, čo vedie k menšiemu objemu sieťových údajov, menšej záťaži CPU a vyššiemu výstupu GPU.

Zrýchlenie inferencie pomocou GPT‑5.6 Sol

Vo svete s obmedzeným výpočtovým výkonom, kde dopyt po modeloch rastie rýchlejšie než kapacita, je efektivita základom návrhu každého systému. Platí to najmä pre náš inferenčný systém, ktorý spúšťa natrénované modely a generuje odpovede. Naším hlavným cieľom je spracovať na rovnakom hardvéri viac tokenov a zároveň zachovať inteligenciu, latenciu, dostupnosť a spoľahlivosť, ktoré používatelia očakávajú.

Dosiahnutie tohto cieľa si vyžaduje optimalizáciu celého systému. Model môže byť sám osebe veľmi efektívny, no jeho prevádzka môže byť aj tak nákladná, ak sa požiadavky rozdeľujú nevhodne, hardvér zostáva nečinný alebo presun údajov spomaľuje výpočty. Zlepšenia na každej vrstve sa znásobujú. Prínosy pochádzajú z optimalizácie smerovania (kam sa požiadavky odosielajú), plánovania (kedy sa odosielajú), jadier (softvéru bežiaceho na GPU), ukladania do vyrovnávacej pamäte (uloženej a opätovne využitej práce) a implementácie modelu (poradia kódu GPU). GPT‑5.6 Sol v prostredí Codex zohral pri všetkých týchto optimalizáciách kľúčovú úlohu.

Prvým dôležitým príkladom je vyvažovanie záťaže. V globálnom meradle smerujeme požiadavky podľa faktorov, ako sú geografická poloha, dostupná kapacita a typ akcelerátora (typ GPU alebo špecializovaného čipu, na ktorom model beží). V rámci klastra rozdeľujeme prácu medzi inštancie modelu podľa záťaže, dĺžky kontextu, dostupnosti vyrovnávacej pamäte a ďalších vlastností požiadavky. V každej inštancii sa potom musí práca efektívne rozdeliť medzi akcelerátory, podsiete modelu a výpočtové jadrá. GPT‑5.6 Sol v prostredí Codex nám pomáha analyzovať produkčnú prevádzku, odhaľovať predtým prehliadané zdroje nerovnováhy, testovať nové stratégie smerovania a neustále dolaďovať tieto heuristiky. Už samotné zlepšenia vyvažovania záťaže výrazne znížili náklady na prevádzku našich modelov.

GPT‑5.6 Sol sme použili aj na optimalizáciu dopredného priechodu modelu: výpočtu, ktorý premieňa vstupy na predikcie nasledujúceho tokenu. Aj keď sú jednotlivé operácie rýchle, nadmerné presuny v pamäti, synchronizácia a neefektívne rozloženie údajov môžu ponechať GPU nečinné. GPT‑5.6 Sol tomu zabránil tým, že našiel prácu, ktorú bolo možné vopred vypočítať, vynechať alebo paralelizovať. Pomocou Codex model GPT‑5.6 Sol autonómne prepísal a optimalizoval naše produkčné jadrá – kľúčový kód vykonávajúci matematické operácie, z ktorých sa model skladá. Fungovalo to aj preto, že sme GPT‑5.6 natrénovali na efektívne písanie a zlepšovanie jadier v jazykoch Triton(otvorí sa v novom okne) a Gluon(otvorí sa v novom okne), dvoch open-source programovacích jazykoch pre GPU, ktoré spravuje OpenAI. Tieto snahy spolu so širšími pokrokmi v oblasti jadier, ktoré priniesol GPT‑5.6 Sol, znížili celkové náklady na prevádzku o 20 %. Výrazne sme investovali aj do nástrojov na overovanie, napríklad do open-source nástroja FpSan(otvorí sa v novom okne) (sanitizér operácií s pohyblivou rádovou čiarkou), ktorý pomáha overovať správnosť jadier napísaných modelom GPT‑5.6 Sol.

Ďalším spôsobom zvýšenia rýchlosti a efektivity je špekulatívne dekódovanie. Táto technika spočíva v spustení menšieho návrhového modelu (čiže „špekulátora“) spolu s primárnym modelom. Navrhne niekoľko tokenov, ktoré primárny model paralelne overí. Keď systém tieto návrhy prijme, môže z jediného priechodu primárnym modelom vytvoriť viacero výstupných tokenov, čím sa zníži objem nákladných sekvenčných výpočtov. GPT‑5.6 Sol zlepšil vlastný návrhový model tak, že navrhol a vykonal stovky experimentov s jeho architektúrou a testoval zmeny veľkosti, štruktúry a funkcií. GPT‑5.6 Sol navyše spustil a monitoroval trénovanie špekulátora a autonómne zasiahol pri problémoch vrátane zlyhaní hardvéru a nestability trénovania. Výsledné zlepšenia zvýšili efektivitu generovania tokenov o viac než 15 %.

Pri spracovaní vstupných tokenov, ktoré nie sú vo vyrovnávacej pamäti, model vytvorí vyrovnávaciu pamäť kľúčov a hodnôt (KV) počas jedného výpočtovo náročného priechodu. Pri generovaní výstupu z nej opakovane číta a rozširuje ju. Optimálna konfigurácia prevádzky, napríklad dávkové spracovanie, delenie a správa KV, výrazne závisí od pracovnej záťaže – dĺžky príkazu a výstupu, veľkosti dávky, miery zásahov do vyrovnávacej pamäte, vlastností dopytov a ďalších faktorov. Priestor možných konfigurácií bol však predtým príliš rozsiahly na systematické ladenie, takže sa technici museli spoliehať na všeobecné heuristiky. Vďaka GPT‑5.6 Sol v prostredí Codex sme mohli analyzovať produkčné záťaže, generovať a vyhodnocovať kandidátne konfigurácie a mimoriadne presne optimalizovať konfiguráciu enginu a modelu pre každý scenár. Tým sa stáva praktickou nová úroveň optimalizácie podľa konkrétnej záťaže, ktorá z rovnakého hardvéru získava viac užitočnej inferencie.

Optimalizácia inferencie je nepretržitý cyklus spätnej väzby. Meriame správanie v produkcii, identifikujeme najväčšie nedostatky, zavádzame zmeny a overujeme, že zlepšujú celý systém, nielen izolovaný porovnávací test. GPT‑5.6 Sol a Codex zrýchľujú každú časť tohto cyklu. Náš tím tak môže skúmať viac nápadov, rýchlejšie reagovať na meniacu sa záťaž a vytvárať inferenčný systém s nižšou latenciou, vyššou kapacitou a nižšími nákladmi pre používateľov.

Ako náš agentický harness zefektívňuje opakovanú prácu

ChatGPT Work a Codex dokončujú zložité úlohy prostredníctvom série požiadaviek na model a volaní nástrojov. Počas jediného cyklu – od požiadavky používateľa po konečnú odpoveď – môže Codex preskúmať zdrojový kód, prehľadať históriu nasadení, prečítať hlásenia o incidentoch, upraviť súbor a spustiť testy. Každý krok si môže vyžadovať samostatnú požiadavku.

Príprava kontextu, prenos údajov, spustenie inferencie, volanie nástrojov aj spúšťanie procesov si vyžadujú čas a výpočtový výkon. Ak si úloha vyžaduje 30 požiadaviek na model, každá sekunda navyše pri jednej požiadavke sa násobí. Zlepšenie celkového výkonu znamená obmedziť opakovanú prácu v celom systéme, nielen zrýchliť model.

Úloha používateľa vstupuje do modelu, ktorý môže opakovane volať nástroj, prijať výsledok a urobiť ďalšie rozhodnutie, až kým úlohu nedokončí.

Jedna akcia používateľa môže zahŕňať mnoho iterácií modelu a nástrojov. Každý náklad v opakovanej časti môže vzniknúť mnohokrát.

Tieto násobiace účinky ovplyvnili návrh nášho agentického harnessu – orchestračnej vrstvy v jazyku Rust, ktorá prepája naše modely, nástroje a prostredie používateľa. Ďalej vysvetlíme, ako predchádzanie nadmernému rastu kontextu, načítavanie nástrojov a opätovné využívanie práce zefektívňujú každú požiadavku.

Predchádzanie nadmernému rastu kontextu

Keď agenti získavajú prístup k ďalším nástrojom, schopnostiam, doplnkom a histórii konverzácie, kontextové okná sa môžu ľahko zväčšovať. To zvyšuje náklady, rozptyľuje model a vyvoláva zbytočné uvažovanie. Harness môže túto réžiu znížiť odloženým vyhľadávaním, vďaka ktorému sa integrácie, vlastné nástroje MCP, schopnosti a doplnky sprístupnia až vtedy, keď sú potrebné. Harness zároveň bráni tomu, aby jednotlivé nástroje a integrácie MCP nečakane zapĺňali kontextové okno. Výstup nástroja je predvolene obmedzený na 10 000 tokenov, pokiaľ model nepožiada o iný limit.

Zachovanie presných prefixov na ukladanie príkazov do vyrovnávacej pamäte

Ako sme už spomenuli, slučka agenta môže počas jedinej akcie viackrát odoslať do GPU rovnaké pokyny, históriu konverzácie, definície nástrojov a predchádzajúce výsledky. Spracovanie týchto opakovaných vstupov je nákladné, preto sa pri ukladaní príkazov do vyrovnávacej pamäte opätovne využíva výpočet spojený s už spracovaným prefixom príkazu. Na zachovanie tohto prefixu považuje harness celú históriu viditeľnú pre model za nemennú a iba ju dopĺňa: nové správy, výsledky nástrojov a aktualizácie prostredia pridáva na koniec, namiesto toho, aby ich vkladal do skoršieho kontextu. Nástroje sa tiež zobrazujú v deterministickom poradí, zatiaľ čo nastavenia behu, napríklad pravidlá schvaľovania, sa uplatňujú počas vykonávania a nevkladajú sa do definícií nástrojov. Toto konštrukčné rozhodnutie prispieva k celkovo vysokej miere zásahov do vyrovnávacej pamäte príkazov v produktoch Codex a ChatGPT Work.

Tri požiadavky porovnávajú bajty odoslané cez trvalé pripojenie s rastúcim kontextom, ktorý vidí model, a prefixom vhodným na opätovné použitie z vyrovnávacej pamäte.

Inkrementálny prenos mení to, čo prechádza sieťou; ukladanie príkazov do vyrovnávacej pamäte mení to, čo model nemusí prepočítavať. Šírky sú len ilustračné a ďalšia vrstva kompresie nie je znázornená.

Efektivita v celom spektre inteligencie

Vyššia efektivita, ktorú prináša GPT‑5.6, je výsledkom rokov postupných zlepšení naprieč celým stackom – od výskumu a inferencie až po náš agentický harness. Úloha GPT‑5.6 pri zavádzaní mnohých z týchto zlepšení nám dáva dôvod veriť, že tempo optimalizácií sa bude zrýchľovať. Popri zásadných zlepšeniach nášho technologického systému budeme pokračovať v rozsiahlejších optimalizáciách oblastí, ako sú jadrá. Tešíme sa, že tieto priebežné zlepšenia na pozadí prenesieme späť k používateľom a zákazníkom v podobe dostupnejšej a nákladovo efektívnejšej inteligencie.

Osobitne ďakujeme členom technického tímu Matthewovi Ferrarimu, Philippovi Tilletovi, Ahmedovi Ibrahimovi, Joeovi Gershensonovi a Stevovi Coffeymu za ich príspevky k tomuto článku.

Autor

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson a Steve Coffey