Com GPT‑5.6 combina intel·ligència i eficiència d'avantguarda
Vam dissenyar la família de models GPT‑5.6 per equilibrar capacitat i cost en tot l'espectre de tasques per a les quals s'utilitzen els nostres models. El nostre model insígnia, GPT‑5.6 Sol, amb raonament Max, supera Claude Fable 5 a l'Artificial Analysis Coding Agent Index per menys de la meitat del cost. Terra iguala GPT‑5.5 en les proves de referència d'intel·ligència per la meitat de preu, i Luna és el nostre model més ràpid i assequible, amb un preu un 80 % inferior al de Sol. Per aconseguir aquesta eficiència, els nostres equips tècnics i de recerca han fet optimitzacions importants en totes les capes principals de la nostra pila. Aquestes millores abasten els nostres models, la inferència (com executem els models per generar resultats) i el nostre entorn d'execució agentiu, que utilitzen tant Codex com ChatGPT Work.
Durant els últims quatre anys, a mesura que hem ampliat els nostres models fins a arribar a 1.000 milions d'usuaris actius i més de 2 milions d'empreses, l'eficiència ha estat clau per fer arribar a tothom els beneficis de la intel·ligència. La nostra missió és garantir que la intel·ligència artificial general beneficiï tota la humanitat. Durant aquests anys, hem treballat per aconseguir contínuament més optimitzacions en tota la nostra pila i oferir els models de millor rendiment en cada punt de la corba entre cost i intel·ligència. Amb GPT‑5.6 hem assolit la nostra millor eficiència d'intel·ligència per segment textual, gràcies a un entrenament orientat a fer més feina per segment textual. Durant l'entrenament, optimitzem tant l'èxit de les tasques com l'eficiència i orientem el model perquè segueixi un camí més directe per completar-les.
Aquesta publicació va més enllà dels nostres models per explicar com hem incorporat l'eficiència mitjançant avenços en dues altres parts principals de la pila: 1) la inferència, amb l'optimització de processos com l'equilibri de càrrega, la descodificació especulativa, la memòria cau i els nuclis per obtenir més resultats amb el mateix maquinari; i 2) el nostre entorn d'execució agentiu, amb una millor gestió de l'excés de context, l'ús d'eines i el treball repetit. També explicarem el paper de GPT‑5.6 Sol a l'hora d'aconseguir autònomament diversos d'aquests guanys. Tot i que una millora aïllada pot semblar limitada, aquests guanys s'acumulen i ens permeten oferir intel·ligència i eficiència d'avantguarda.
En un món amb recursos de càlcul limitats, on la demanda de models creix més de pressa que la capacitat, l'eficiència és essencial en el disseny de tots els sistemes. Això és especialment cert en la nostra pila d'inferència, que executa models entrenats per generar respostes. El nostre objectiu principal és processar més segments textuals amb el mateix maquinari, tot mantenint la intel·ligència, la latència, la disponibilitat i la fiabilitat que esperen els usuaris.
Per aconseguir-ho, cal optimitzar tot el sistema. Un model pot ser molt eficient de manera aïllada, però continuar sent costós d'oferir si les sol·licituds es distribueixen malament, el maquinari queda inactiu o el moviment de dades alenteix el càlcul. Les millores de cada capa s'acumulen, amb guanys procedents de l'optimització de l'encaminament (on s'envien les sol·licituds), la planificació (quan s'envien), els nuclis (el programari que s'executa a les GPU), la memòria cau (el treball desat i reutilitzat) i la implementació del model (l'ordre del codi de la GPU). GPT‑5.6 Sol a Codex va tenir un paper fonamental en totes aquestes optimitzacions.
El primer exemple important és l'equilibri de càrrega. A escala global, encaminem les sol·licituds segons factors com la ubicació geogràfica, la capacitat disponible i el tipus d'accelerador (la mena de GPU o xip especialitzat que executa el model). Dins d'un clúster, distribuïm el treball entre les instàncies del model segons la càrrega, la longitud del context, la disponibilitat de la memòria cau i altres propietats de la sol·licitud. Dins de cada instància, el treball s'ha de repartir eficientment entre els acceleradors, les subxarxes del model i els nuclis de càlcul. GPT‑5.6 Sol a Codex ens ajuda a analitzar el trànsit de producció, identificar fonts de desequilibri que abans havien passat desapercebudes, provar noves estratègies d'encaminament i ajustar constantment aquestes heurístiques. Només aquestes millores en l'equilibri de càrrega ja van reduir dràsticament el cost d'oferir els nostres models.
També vam utilitzar GPT‑5.6 Sol per optimitzar la passada cap endavant del model: el càlcul que transforma les entrades en prediccions del segment textual següent. Encara que les operacions individuals siguin ràpides, un moviment de memòria excessiu, la sincronització i una disposició ineficient de les dades poden deixar les GPU inactives. Per evitar-ho, GPT‑5.6 Sol va trobar treball que es podia precalcular, evitar o paral·lelitzar. Amb Codex, GPT‑5.6 Sol va reescriure i optimitzar autònomament els nostres nuclis de producció, el codi essencial que executa les operacions matemàtiques que formen el model. Això va funcionar en part perquè hem entrenat GPT‑5.6 perquè sigui eficaç escrivint i millorant nuclis en Triton(s'obre en una finestra nova) i Gluon(s'obre en una finestra nova), dos llenguatges de programació de GPU de codi obert mantinguts per OpenAI. Aquests esforços, juntament amb altres avenços de GPT‑5.6 Sol en els nuclis, van reduir un 20 % els costos totals de servei. També hem invertit molt en eines de verificació, com l'eina de codi obert FpSan(s'obre en una finestra nova) (Floating-Point Sanitizer), per ajudar a validar la correcció dels nuclis escrits per GPT‑5.6 Sol.
La descodificació especulativa és una altra via per millorar la velocitat i l'eficiència. La tècnica consisteix a executar un model d'esborrany més petit (o "especulador") al costat del model principal perquè proposi diversos segments textuals que el model principal verifica en paral·lel. Quan s'accepten aquestes propostes, el sistema pot produir diversos segments textuals de sortida amb una sola passada del model principal, cosa que redueix el costós càlcul seqüencial. GPT‑5.6 Sol va millorar el seu propi model d'esborrany dissenyant i executant centenars d'experiments sobre la seva arquitectura i provant canvis de mida, estructura i característiques. A més, GPT‑5.6 Sol va iniciar i supervisar el procés d'entrenament de l'especulador, i va intervenir autònomament quan van sorgir problemes, com ara errors de maquinari i inestabilitat de l'entrenament. Les millores resultants van augmentar més d'un 15 % l'eficiència de generació de segments textuals.
En processar segments textuals d'entrada no emmagatzemats a la memòria cau, el model crea la memòria cau de clau-valor (KV) en una sola passada de càlcul intensiu; en generar la sortida, llegeix repetidament aquesta memòria cau i l'amplia. La configuració òptima de servei, com ara l'agrupació per lots, la fragmentació i la gestió de KV, depèn molt de la càrrega de treball: la longitud de la indicació i la sortida, la mida del lot, la taxa d'encerts de la memòria cau, les característiques de les consultes i altres factors. Tanmateix, l'espai de configuració era massa ampli per ajustar-lo sistemàticament, fet que obligava els enginyers a confiar en heurístiques generals. Amb GPT‑5.6 Sol a Codex, vam poder analitzar càrregues de treball de producció, generar i avaluar configuracions candidates i hiperoptimitzar la configuració del motor i el model per a cada situació. Això fa viable un nou nivell d'optimització específica per a cada càrrega de treball i permet obtenir més inferència útil amb el mateix maquinari.
L'optimització de la inferència és un bucle de retroalimentació continu. Mesurem el comportament en producció, identifiquem les mancances més importants, implementem canvis i verifiquem que millorin tot el sistema, no només una prova de rendiment aïllada. GPT‑5.6 Sol i Codex acceleren totes les parts d'aquest bucle. Això permet al nostre equip explorar més idees, respondre més de pressa als canvis en les càrregues de treball i crear una pila d'inferència amb menys latència, més capacitat i costos més baixos per als usuaris.
ChatGPT Work i Codex completen tasques complexes mitjançant una sèrie de sol·licituds al model i crides a eines. En un sol torn —des de la sol·licitud de l'usuari fins a la resposta final—, Codex pot inspeccionar el codi font, cercar l'historial de desplegaments, llegir informes d'incidències, editar un fitxer i executar proves. Cada pas pot requerir una sol·licitud.
Preparar el context, transmetre dades, executar la inferència, cridar eines i iniciar processos requereix temps i capacitat de càlcul. Si una tasca requereix 30 sol·licituds al model, cada segon addicional per sol·licitud es va acumulant. Millorar el rendiment global exigeix reduir el treball repetit en tot el sistema, no només accelerar el model.
Un sol torn de l'usuari pot incloure moltes iteracions del model i les eines. Qualsevol cost dins la regió repetida es pot pagar moltes vegades.
Aquests factors multiplicadors han orientat el disseny del nostre entorn d'execució agentiu, una capa d'orquestració en Rust que connecta els nostres models i eines amb l'entorn de l'usuari. A continuació, explicarem com evitar l'excés de context, carregar eines i reutilitzar el treball fa que cada sol·licitud sigui més eficient.
A mesura que els agents obtenen accés a més eines, habilitats, connectors i historial de converses, les finestres de context poden créixer fàcilment. Això augmenta el cost, distreu el model i provoca raonaments innecessaris. L'entorn d'execució pot reduir aquesta sobrecàrrega mitjançant la descoberta diferida, que fa que les integracions, les eines MCP personalitzades, les habilitats i els connectors només es mostrin quan cal. L'entorn d'execució també impedeix que eines concretes i integracions MCP consumeixin inesperadament la finestra de context. La sortida de les eines es limita per defecte a 10.000 segments textuals, tret que el model sol·liciti un límit diferent.
Com ja hem esmentat, un bucle d'agent pot enviar diverses vegades a les GPU les mateixes instruccions, l'historial de la conversa, les definicions d'eines i els resultats anteriors durant un sol torn. Processar aquestes entrades repetides és costós, per això la memòria cau d'indicacions reutilitza el càlcul associat al prefix d'una indicació processada anteriorment. Per conservar aquest prefix, l'entorn d'execució tracta tot l'historial visible per al model com un registre en què només es poden afegir dades: els missatges nous, els resultats de les eines i les actualitzacions de l'entorn s'afegeixen al final en lloc d'inserir-se en un context anterior. Les eines també es presenten en un ordre determinista, mentre que la configuració del temps d'execució, com ara les polítiques d'aprovació, s'aplica durant l'execució en lloc d'incrustar-se en les definicions de les eines. Aquesta decisió de disseny contribueix a les elevades taxes globals d'encerts de la memòria cau d'indicacions de Codex i ChatGPT Work.
El transport incremental canvia què travessa la xarxa; la memòria cau d'indicacions canvia què pot evitar recalcular el model. Les amplades són conceptuals i no s'hi mostra la capa de compressió addicional.
Els guanys d'eficiència que hem aconseguit amb GPT‑5.6 són el resultat d'anys de millores acumulatives en tota la pila, des de la recerca i la inferència fins al nostre entorn d'execució agentiu. El paper de GPT‑5.6 a l'hora d'aconseguir moltes d'aquestes millores ens fa ser optimistes sobre l'acceleració del ritme de les optimitzacions. Continuarem fent optimitzacions més importants en àrees com els nuclis de programari, juntament amb millores fonamentals de la nostra pila. Esperem poder traslladar aquestes millores internes i contínues als usuaris i clients en forma d'una intel·ligència més accessible i rendible.
Un agraïment especial a Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson i Steve Coffey, membres del personal tècnic, per les seves contribucions a aquesta publicació.


