Sari la conținutul principal
OpenAI

29 iulie 2026

InginerieCompanie

Cum îmbină GPT‑5.6 inteligența și eficiența de vârf

Se încarcă…

Am proiectat familia de modele GPT‑5.6 pentru a echilibra capabilitățile și costurile în întregul spectru de sarcini pentru care oamenii folosesc modelele noastre. Modelul nostru de vârf, GPT‑5.6 Sol, cu raţionament maxim, depășește Claude Fable 5 în Artificial Analysis Coding Agent Index la mai puțin de jumătate din cost. Terra egalează performanța GPT‑5.5 în testele de inteligență la jumătate de preț, iar Luna este modelul nostru cel mai rapid și mai accesibil, cu un preț cu 80% mai mic decât Sol. Pentru a obține această eficiență, echipele noastre de cercetare și tehnice au realizat optimizări semnificative la fiecare nivel important al infrastructurii. Aceste îmbunătățiri vizează modelele noastre, inferența (modul în care rulăm modelele pentru a genera rezultate) și cadrul nostru de testare agentiv, folosit atât de Codex, cât și de ChatGPT Work.

Pe măsură ce ne-am extins modelele la 1 miliard de utilizatori activi și peste 2 milioane de companii în ultimii patru ani, eficiența a fost esențială pentru a oferi tuturor beneficiile inteligenței. Misiunea noastră este să ne asigurăm că inteligența generală artificială aduce beneficii întregii omeniri. În acești ani, am căutat constant noi optimizări în întreaga infrastructură, pentru a oferi modelele cu cele mai bune performanțe la fiecare nivel al raportului dintre cost și inteligență. Cu GPT‑5.6 am obținut cea mai bună eficiență de până acum în materie de inteligență per token, modelul fiind antrenat să realizeze mai mult cu fiecare token. În timpul antrenării, optimizăm atât reușita sarcinii, cât și eficiența, astfel încât modelul să urmeze o cale mai directă spre finalizarea acesteia.

Această postare privește dincolo de modelele noastre și prezintă modul în care am urmărit eficiența prin progrese în alte două componente majore ale infrastructurii: 1) inferența, prin optimizarea unor procese precum echilibrarea încărcării, decodarea speculativă, memorarea în cache și optimizarea nucleelor software, pentru a obține mai multe rezultate cu același hardware; și 2) cadrul nostru de testare agentiv, inclusiv prin gestionarea mai bună a supraîncărcării contextului, utilizării instrumentelor și activităților repetitive. Vom prezenta și rolul GPT‑5.6 Sol în obținerea autonomă a mai multor astfel de câștiguri. Deși fiecare îmbunătățire izolată poate părea limitată, aceste reușite se cumulează și ne permit să atingem performanțe de vârf atât în inteligență, cât și în eficiență.

Diagramă care arată eficiența GPT-5.6 la nivelul cadrului de testare pentru agenți, orchestrării API și inferenței modelului, rezultând mai puține date în rețea, mai puține operații CPU și un randament GPU mai mare.

Accelerarea inferenței cu GPT‑5.6 Sol

Într-o lume cu resurse de calcul limitate, în care cererea pentru modele crește mai repede decât capacitatea, eficiența este esențială în proiectarea fiecărui sistem. Acest lucru este valabil mai ales pentru infrastructura noastră de inferență, care rulează modele antrenate pentru a genera răspunsuri. Obiectivul nostru principal este să procesăm mai multe tokenuri cu același hardware, păstrând inteligența, latența, disponibilitatea și fiabilitatea la care se așteaptă utilizatorii.

Pentru aceasta, trebuie optimizat întregul sistem. Un model poate fi foarte eficient în mod izolat, dar costisitor de operat dacă solicitările sunt distribuite necorespunzător, hardware-ul rămâne inactiv sau transferul datelor încetinește calculele. Îmbunătățirile de la fiecare nivel se cumulează, prin optimizarea rutării (unde sunt trimise solicitările), planificării (când sunt trimise), nucleelor software (programele rulate pe GPU-uri), memorării în cache (rezultate salvate și reutilizate) și implementării modelului (ordinea codului executat pe GPU). GPT‑5.6 Sol din Codex a avut un rol esențial în toate aceste optimizări.

Primul exemplu important este echilibrarea încărcării. La nivel global, rutăm solicitările pe baza unor factori precum regiunea geografică, capacitatea disponibilă și tipul acceleratorului (tipul de GPU sau cip specializat care rulează modelul). Într-un cluster, distribuim activitatea între instanțele modelului în funcție de încărcare, lungimea contextului, disponibilitatea cache-ului și alte caracteristici ale solicitării. În fiecare instanță, activitatea trebuie apoi împărțită eficient între acceleratoare, subrețelele modelului și nucleele de calcul. GPT‑5.6 Sol din Codex ne ajută să analizăm traficul de producție, să identificăm surse de dezechilibru omise anterior, să testăm strategii noi de rutare și să ajustăm continuu aceste euristici. Doar aceste îmbunătățiri ale echilibrării încărcării au redus considerabil costurile de operare a modelelor noastre.

De asemenea, am folosit GPT‑5.6 Sol pentru a optimiza trecerea înainte a modelului, adică procesul de calcul care transformă datele de intrare în predicții pentru următorul token. Chiar și atunci când operațiile individuale sunt rapide, transferurile excesive de date în memorie, sincronizarea și organizarea ineficientă a datelor pot lăsa GPU-urile inactive. Pentru a evita acest lucru, GPT‑5.6 Sol a identificat operații care puteau fi precalculate, eliminate sau executate în paralel. Folosind Codex, GPT‑5.6 Sol a rescris și optimizat în mod autonom kernelurile noastre utilizate în producție, adică secvențele de cod de bază care execută operațiile matematice din care este alcătuit modelul. Acest lucru a fost posibil, în parte, deoarece am antrenat GPT‑5.6 să scrie și să îmbunătățească eficient kerneluri în Triton(se deschide într-o fereastră nouă) și Gluon(se deschide într-o fereastră nouă), două limbaje open-source de programare pentru GPU-uri, întreținute de OpenAI. Aceste eforturi, împreună cu progresele mai ample realizate de GPT‑5.6 Sol în domeniul kernelurilor, au redus cu 20% costurile totale de servire. De asemenea, am investit masiv în instrumente de verificare, precum instrumentul open-source FpSan(se deschide într-o fereastră nouă) (Floating-Point Sanitizer), pentru a contribui la validarea corectitudinii kernelurilor scrise de GPT‑5.6 Sol.

Decodarea speculativă este o altă modalitate de a îmbunătăți viteza și eficiența. Tehnica presupune rularea unui model preliminar mai mic (sau „speculator”) în paralel cu modelul principal, pentru a propune mai multe tokenuri pe care modelul principal să le verifice simultan. Când propunerile sunt acceptate, sistemul poate produce mai multe tokenuri de ieșire într-o singură trecere a modelului principal, reducând volumul calculelor secvențiale costisitoare. GPT‑5.6 Sol și-a îmbunătățit propriul model preliminar prin proiectarea și derularea a sute de experimente asupra arhitecturii sale, testând modificări de dimensiune, structură și funcționalități. În plus, GPT‑5.6 Sol a lansat și monitorizat procesul de antrenare a speculatorului, intervenind autonom când au apărut probleme, inclusiv defecțiuni hardware și instabilitate în timpul antrenării. Îmbunătățirile rezultate au crescut cu peste 15% eficiența generării de tokenuri.

La procesarea tokenurilor de intrare care nu se află în memoria cache, modelul construiește memoria cache cheie-valoare (KV) într-o singură trecere, care necesită un volum mare de calcule; la generarea rezultatului, acesta citește în mod repetat din memoria cache și o extinde. Configurația optimă pentru servire, inclusiv gruparea în loturi, partiționarea și gestionarea memoriei cache KV, depinde în mare măsură de volumul de lucru: lungimea promptului și a rezultatului, dimensiunea lotului, rata de accesare cu succes a memoriei cache, caracteristicile interogărilor și alți factori. Totuși, anterior, spațiul de configurare era prea vast pentru a putea fi optimizat sistematic, ceea ce îi obliga pe ingineri să se bazeze pe euristici generale. Cu GPT‑5.6 Sol în Codex, am putut analiza volumele de lucru din producție, genera și evalua configurații candidate și optimiza în profunzime modul în care motorul și modelul sunt configurate pentru fiecare scenariu. Astfel, devine posibil un nou nivel de optimizare adaptată fiecărui tip de volum de lucru, obținându-se mai multe inferențe utile cu același hardware.

Optimizarea inferenței este o buclă continuă de feedback. Măsurăm comportamentul în producție, identificăm cele mai mari lacune, implementăm modificări și verificăm dacă acestea îmbunătățesc întregul sistem, nu doar un test de performanță izolat. GPT‑5.6 Sol și Codex accelerează fiecare etapă a acestei bucle. Astfel, echipa noastră poate explora mai multe idei, poate răspunde mai rapid la volume de lucru în schimbare și poate crea o infrastructură de inferență cu latență mai mică, capacitate mai mare și costuri mai reduse pentru utilizatori.

Cum eficientizează cadrul nostru de testare agentiv activitățile repetitive

ChatGPT Work și Codex finalizează sarcini complexe printr-o serie de solicitări adresate modelului și apeluri de instrumente. Într-o singură interacțiune, de la solicitarea utilizatorului până la răspunsul final, Codex poate inspecta codul sursă, căuta în istoricul implementărilor, citi rapoarte de incidente, edita un fișier și rula teste. Fiecare pas poate necesita o solicitare.

Pregătirea contextului, transmiterea datelor, rularea inferenței, apelarea instrumentelor și pornirea proceselor necesită timp și resurse de calcul. Dacă o sarcină necesită 30 de solicitări adresate modelului, fiecare secundă suplimentară per solicitare se acumulează. Îmbunătățirea performanței generale presupune reducerea activităților repetitive în întregul sistem, nu doar accelerarea modelului.

O sarcină a utilizatorului ajunge la model, care poate apela un instrument, primi un rezultat și lua în mod repetat o nouă decizie înainte de a finaliza sarcina.

O singură interacțiune a utilizatorului poate include numeroase iterații ale modelului și instrumentelor. Orice cost din regiunea repetată poate fi suportat de multe ori.

Acești factori de multiplicare au influențat proiectarea cadrului nostru de testare agentiv, un strat de orchestrare scris în Rust care conectează modelele și instrumentele noastre cu mediul utilizatorului. În continuare, vom explica modul în care evitarea supraîncărcării contextului, încărcarea instrumentelor și reutilizarea rezultatelor sporesc eficiența fiecărei solicitări.

Evitarea supraîncărcării contextului

Pe măsură ce agenții primesc acces la mai multe instrumente, abilități, pluginuri și la istoricul conversației, ferestrele contextuale se pot extinde ușor. Aceasta crește costurile, distrage modelul și generează raţionament inutil. Cadrul de testare poate reduce acest consum suplimentar prin descoperirea amânată, astfel încât integrările, instrumentele MCP personalizate, abilitățile și pluginurile să devină disponibile numai când sunt necesare. Cadrul de testare împiedică și instrumentele individuale sau integrările MCP să consume în mod neașteptat fereastra contextuală. În mod implicit, rezultatul unui instrument este limitat la 10.000 de tokenuri, exceptând cazul în care modelul solicită o altă limită.

Păstrarea exactă a prefixelor pentru memorarea în cache a solicitărilor

După cum am menționat, o buclă de agent poate trimite către GPU-uri aceleași instrucțiuni, același istoric al conversației, aceleași definiții ale instrumentelor și rezultate anterioare de mai multe ori într-o singură interacțiune. Procesarea repetată a acestor date de intrare este costisitoare, așa că memorarea în cache a solicitărilor reutilizează calculele asociate unui prefix procesat anterior. Pentru a păstra acel prefix, cadrul de testare tratează întregul istoric vizibil modelului ca fiind doar pentru adăugare: mesajele noi, rezultatele instrumentelor și actualizările mediului sunt adăugate la final, nu inserate în contextul anterior. Instrumentele sunt prezentate și într-o ordine deterministă, iar setările de execuție, precum politicile de aprobare, sunt aplicate în timpul rulării, nu încorporate în definițiile instrumentelor. Această alegere de proiectare contribuie la ratele generale ridicate de accesare a cache-ului solicitărilor în Codex și ChatGPT Work.

Trei solicitări compară volumul de date trimis printr-o conexiune persistentă cu contextul tot mai amplu văzut de model și cu prefixul care poate fi reutilizat din cache.

Transferul incremental schimbă datele care traversează rețeaua; memorarea în cache a solicitărilor schimbă calculele pe care modelul le poate evita. Lățimile sunt conceptuale, iar stratul suplimentar de compresie nu este afișat.

Eficiență pe întreaga curbă a inteligenței

Câștigurile de eficiență obținute cu GPT‑5.6 sunt rezultatul multor ani de îmbunătățiri cumulative în întreaga infrastructură, de la cercetare și inferență până la cadrul nostru de testare agentiv. Rolul GPT‑5.6 în realizarea multora dintre aceste îmbunătățiri ne face optimiști în privința accelerării ritmului optimizărilor. Vom continua optimizările substanțiale în domenii precum nucleele software, alături de îmbunătățiri fundamentale ale infrastructurii noastre. Dorim să le oferim utilizatorilor și clienților aceste îmbunătățiri continue, realizate în culise, sub forma unei inteligențe mai accesibile și mai eficiente din punct de vedere al costurilor.

Mulțumiri speciale membrilor echipei tehnice Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson și Steve Coffey pentru contribuțiile lor la această postare.

Autor

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey