Lumaktaw sa pangunahing content
OpenAI

Hulyo 29, 2026

EngineeringKumpanya

Paano pinagsasanib ng GPT‑5.6 ang frontier na katalinuhan at kahusayan

Naglo-load…

Dinisenyo namin ang pamilya ng modelo ng GPT‑5.6 upang balansehin ang kakayahan at gastos sa buong saklaw ng mga gawaing ginagamitan ng mga tao ng aming mga modelo. Ang aming pangunahing modelo na GPT‑5.6 Sol, gamit ang max na pangangatwiran, ay nahihigitan ang Claude Fable 5 sa Artificial Analysis Coding Agent Index sa mas mababa sa kalahati ng gastos. Kasinghusay ng GPT‑5.5 ang Terra sa mga benchmark ng katalinuhan sa kalahati ng presyo, habang ang Luna ang pinakamabilis at pinakamatipid naming modelo, na 80% mas mura kaysa sa Sol. Upang maihatid ang mga kahusayang ito, nagsagawa ang aming mga research at technical team ng mahahalagang optimization sa bawat pangunahing layer ng aming stack. Saklaw ng mga pagpapahusay na ito ang aming mga modelo, inference (kung paano namin pinapatakbo ang mga modelo upang bumuo ng output), at agentic harness na ginagamit ng Codex at ChatGPT Work.

Habang pinalawak namin ang aming mga modelo upang magamit ng 1 bilyong aktibong user at mahigit 2 milyong negosyo sa nakalipas na apat na taon, naging sentro ang kahusayan sa pagpapalaganap ng mga pakinabang ng katalinuhan sa lahat. Misyon naming tiyaking mapakikinabangan ng buong sangkatauhan ang artificial general intelligence. Sa mga taong ito, patuloy kaming nagsikap na makamit ang mas malalaking optimization sa buong stack upang maialok ang mga modelong may pinakamahusay na performance sa bawat bahagi ng ugnayan ng gastos at katalinuhan. Nakamit namin sa GPT‑5.6 ang aming pinakamahusay na kahusayan sa katalinuhan kada token; sinanay ito upang makagawa nang higit pa sa bawat token. Sa training, ino-optimize namin ang tagumpay at kahusayan sa gawain upang mahubog ang modelo na tahakin ang mas direktang landas sa pagtapos nito.

Higit pa sa aming mga modelo, ibinabahagi sa post na ito kung paano kami nagdisenyo para sa kahusayan sa pamamagitan ng mga pagsulong sa dalawa pang pangunahing bahagi ng stack: 1) inference, sa pag-optimize ng mga prosesong gaya ng load balancing, speculative decoding, caching, at kernel optimization upang makakuha ng mas maraming output mula sa parehong hardware; at 2) ang aming agentic harness, kabilang ang mas mahusay na pamamahala sa paglobo ng context, paggamit ng tool, at paulit-ulit na gawain. Ibabahagi rin namin ang papel ng GPT‑5.6 Sol sa awtonomong pagkamit ng ilan sa mga pagpapahusay na ito. Bagama't maaaring limitado ang bawat hiwalay na pagpapahusay, naiipon ang mga tagumpay na ito upang makapaghatid kami sa frontier ng katalinuhan at kahusayan.

Diagram ng kahusayan ng GPT-5.6 sa agent harness, API orchestration, at model inference, na nagreresulta sa mas kaunting network data, mas kaunting CPU work, at mas maraming GPU output.

Pagpapabilis ng inference gamit ang GPT‑5.6 Sol

Sa mundong limitado ang compute at mas mabilis lumalaki ang demand sa mga modelo kaysa sa kapasidad, sentro ang kahusayan sa disenyo ng bawat system. Lalo itong totoo sa aming inference stack, na nagpapatakbo ng mga sinanay na modelo upang bumuo ng mga tugon. Pangunahing layunin naming makapaghatid ng mas maraming token gamit ang parehong hardware habang pinananatili ang katalinuhan, latency, availability, at reliability na inaasahan ng mga user.

Kailangan dito ang pag-optimize sa buong system. Maaaring napakahusay ng isang modelo nang mag-isa ngunit mahal pa ring ihatid kung hindi maayos ang pamamahagi ng mga request, walang ginagawa ang hardware, o pinabagal ng paglipat ng data ang computation. Naiipon ang mga pagpapahusay sa bawat layer, mula sa mga optimization sa routing (kung saan ipinapadala ang mga request), scheduling (kailan ipinapadala ang mga request), kernel (software na tumatakbo sa mga GPU), caching (gawaing sine-save at muling ginagamit), at implementasyon ng modelo (pagkakasunod-sunod ng GPU code). Mahalaga ang naging papel ng GPT‑5.6 Sol sa Codex sa lahat ng optimization na ito.

Ang unang mahalagang halimbawa ay load balancing. Sa buong mundo, niru-route namin ang mga request batay sa mga salik gaya ng heograpiya, available na kapasidad, at uri ng accelerator (ang uri ng GPU o espesyal na chip na nagpapatakbo sa modelo). Sa loob ng isang cluster, ipinapamahagi namin ang gawain sa mga instance ng modelo batay sa load, haba ng context, availability ng cache, at iba pang katangian ng request. Sa loob ng bawat instance, kailangan namang mahusay na hatiin ang gawain sa mga accelerator, sub-network ng modelo, at computing core. Tinutulungan kami ng GPT‑5.6 Sol sa Codex na suriin ang production traffic, tukuyin ang mga dati nang hindi napansing sanhi ng imbalance, subukan ang mga bagong diskarte sa routing, at patuloy na ayusin ang mga heuristic na ito. Malaki ang ibinaba ng gastos sa paghahatid ng aming mga modelo dahil lamang sa mga pagpapahusay na ito sa load balancing.

Ginamit din namin ang GPT‑5.6 Sol upang i-optimize ang forward pass ng modelo: ang computation na ginagawang mga prediksyon sa susunod na token ang mga input. Kahit mabilis ang bawat operasyon, maaaring matengga ang mga GPU dahil sa labis na paglipat ng memory, synchronization, at hindi mahusay na layout ng data. Upang maiwasan ito, tinukoy ng GPT‑5.6 Sol ang mga gawaing maaaring paunang kalkulahin, iwasan, o iproseso nang parallel. Gamit ang Codex, awtonomong muling isinulat at in-optimize ng GPT‑5.6 Sol ang aming mga production kernel—ang pangunahing code na nagsasagawa ng mga matematikal na operasyong bumubuo sa modelo. Naging posible ito partly dahil sinanay namin ang GPT‑5.6 na mahusay na magsulat at magpahusay ng mga kernel sa Triton(magbubukas sa bagong window) at Gluon(magbubukas sa bagong window), dalawang open-source na GPU programming language na pinapanatili ng OpenAI. Kasama ng mas malawak na pagsulong sa mga kernel mula sa GPT‑5.6 Sol, pinababa ng mga pagsisikap na ito nang 20% ang kabuuang gastos sa paghahatid. Malaki rin ang ipinuhunan namin sa mga tool sa verification, gaya ng open-source na FpSan(magbubukas sa bagong window) (Floating-Point Sanitizer), upang makatulong na patunayang tama ang mga kernel na isinulat ng GPT‑5.6 Sol.

Isa pang paraan ang speculative decoding upang mapahusay ang bilis at kahusayan. Sa paraang ito, nagpapatakbo ng mas maliit na draft model (o “speculator”) kasabay ng pangunahing modelo upang magmungkahi ng ilang token na sabay-sabay na susuriin ng pangunahing modelo. Kapag tinanggap ang mga mungkahing iyon, makagagawa ang system ng maraming output token mula sa iisang pass ng pangunahing modelo, kaya nababawasan ang magastos na sunod-sunod na computation. Pinahusay ng GPT‑5.6 Sol ang sarili nitong draft model sa pamamagitan ng pagdisenyo at pagpapatakbo ng daan-daang eksperimento sa architecture nito, kasama ang pagsubok sa mga pagbabago sa laki, structure, at feature. Bukod dito, inilunsad at minonitor ng GPT‑5.6 Sol ang proseso ng pagsasanay sa speculator at awtonomong namagitan kapag nagkaroon ng mga problema, kabilang ang pagkasira ng hardware at kawalang-katatagan ng training. Pinataas ng mga nagresultang pagpapahusay nang mahigit 15% ang kahusayan sa pagbuo ng token.

Kapag nagpoproseso ng mga input token na wala sa cache, binubuo ng modelo ang key-value (KV) cache sa isang compute-intensive na pass; sa pagbuo naman ng output, paulit-ulit itong nagbabasa mula sa cache at nagdaragdag dito. Ang pinakamainam na configuration sa paghahatid—gaya ng batching, sharding, at pamamahala ng KV—ay nakadepende nang malaki sa workload: haba ng prompt at output, laki ng batch, cache hit rate, mga katangian ng query, at iba pa. Gayunman, dati ay napakalawak ng mga posibleng configuration para sistematikong i-tune, kaya napipilitang umasa ang mga engineer sa malalawak na heuristic. Sa GPT‑5.6 Sol sa Codex, nasuri namin ang mga production workload, nakabuo at nakapagsuri ng mga posibleng configuration, at lubos na na-optimize ang configuration ng engine at modelo para sa bawat sitwasyon. Dahil dito, nagiging praktikal ang bagong antas ng optimization na partikular sa workload at nakakakuha ng mas kapaki-pakinabang na inference mula sa parehong hardware.

Ang inference optimization ay isang tuloy-tuloy na feedback loop. Sinusukat namin ang kilos sa production, tinutukoy ang pinakamalalaking puwang, nagpapatupad ng mga pagbabago, at tinitiyak na pinahuhusay ng mga ito ang buong system sa halip na isang hiwalay na benchmark lamang. Pinabibilis ng GPT‑5.6 Sol at Codex ang bawat bahagi ng loop na iyon. Dahil dito, mas maraming ideya ang masusuri ng aming team, mas mabilis kaming makatutugon sa nagbabagong workload, at makagagawa kami ng inference stack na may mas mababang latency, mas malaking kapasidad, at mas mababang gastos para sa mga user.

Paano pinapahusay ng aming agentic harness ang paulit-ulit na gawain

Tinatapos ng ChatGPT Work at Codex ang mga kumplikadong gawain sa pamamagitan ng serye ng mga request sa modelo at mga tool call. Sa iisang turno—mula sa request ng user hanggang sa huling tugon—maaaring siyasatin ng Codex ang source code, hanapin ang history ng deployment, basahin ang mga incident report, mag-edit ng file, at magpatakbo ng mga test. Maaaring mangailangan ng request ang bawat hakbang.

Lahat ay nangangailangan ng oras at compute: paghahanda ng context, pagpapadala ng data, pagpapatakbo ng inference, pagtawag sa mga tool, at pagsisimula ng mga proseso. Kung kailangan ng isang gawain ang 30 request sa modelo, naiipon ang dagdag na isang segundo sa bawat request. Para mapahusay ang kabuuang performance, kailangang bawasan ang paulit-ulit na gawain sa buong system, hindi lang pabilisin ang modelo.

Pumapasok sa modelo ang gawain ng user; maaari itong tumawag ng tool, tumanggap ng resulta, at paulit-ulit na gumawa ng panibagong desisyon bago tapusin ang gawain.

Maaaring magkaroon ng maraming pag-ulit ng modelo at tool sa isang turno ng user. Maaaring maulit nang maraming beses ang anumang gastos sa bahaging inuulit.

Naging batayan ang mga multiplier na ito sa pagdisenyo ng aming agentic harness, isang orchestration layer sa Rust na nag-uugnay sa aming mga modelo, tool, at environment ng user. Susunod, tatalakayin namin kung paano pinahuhusay ng pag-iwas sa paglobo ng context, pag-load ng mga tool, at muling paggamit ng nagawang trabaho ang bawat request.

Iwasan ang paglobo ng context

Habang nabibigyan ang mga agent ng access sa mas maraming tool, skill, plugin, at history ng usapan, madaling lumaki ang mga context window. Pinatataas nito ang gastos, ginagambala ang modelo, at nag-uudyok ng hindi kailangang pangangatwiran. Mababawasan ng harness ang overhead na ito sa pamamagitan ng deferred discovery, na lumilitaw lamang kapag kailangan ang mga integration, custom na MCP tool, skill, at plugin. Pinipigilan din ng harness ang mga indibidwal na tool at MCP integration na biglang umubos sa context window. Bilang default, nililimitahan sa 10,000 token ang output ng tool maliban kung humiling ang modelo ng ibang limitasyon.

Panatilihin ang mga eksaktong prefix para sa prompt caching

Gaya ng nabanggit, maaaring ipadala ng isang agent loop sa mga GPU nang maraming beses sa iisang turno ang parehong mga tagubilin, history ng usapan, mga depinisyon ng tool, at mga naunang resulta. Magastos ang pagproseso sa mga paulit-ulit na input na ito, kaya muling ginagamit ng prompt caching ang computation na nauugnay sa isang dati nang naprosesong prompt prefix. Upang mapanatili ang prefix na iyon, itinuturing ng harness na append-only ang lahat ng history na nakikita ng modelo: idinaragdag sa dulo ang mga bagong mensahe, resulta ng tool, at update sa environment sa halip na isingit sa naunang context. Inilalahad din ang mga tool sa isang tiyak at pare-parehong pagkakasunod-sunod, habang inilalapat sa oras ng execution ang mga runtime setting, gaya ng mga patakaran sa pag-apruba, sa halip na i-embed sa mga depinisyon ng tool. Nakatutulong ang disenyong ito sa mataas na kabuuang prompt-cache hit rate ng Codex at ChatGPT Work.

Inihahambing ng tatlong request ang bytes na ipinadala sa isang persistent na koneksyon, ang lumalaking context na nakikita ng modelo, at ang prefix na maaaring muling gamitin mula sa cache.

Binabago ng incremental transport ang dumaraan sa network; binabago naman ng prompt caching ang maaaring hindi na muling kalkulahin ng modelo. Konseptuwal ang mga lapad, at hindi ipinapakita ang karagdagang compression layer.

Husay sa buong saklaw ng katalinuhan

Ang mga paghusay na naihatid namin sa GPT‑5.6 ay bunga ng maraming taon ng naiipong pagpapahusay sa buong stack—mula sa pananaliksik at inference hanggang sa aming agentic harness. Dahil mahalaga ang papel ng GPT‑5.6 sa paghahatid ng marami sa mga pagpapahusay na ito, positibo kami na lalo pang bibilis ang mga optimization. Patuloy kaming gagawa ng mas malalaking optimization sa mga larangang gaya ng kernel optimization, kasabay ng mga pundamental na pagpapahusay sa aming stack. Inaasahan naming maihatid sa aming mga user at customer ang mga patuloy na pagpapahusay na ito sa likod ng system sa anyo ng mas malawak na makukuha at mas matipid na katalinuhan.

Espesyal na pasasalamat kina Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson, at Steve Coffey, mga Miyembro ng Technical Staff, para sa kanilang mga kontribusyon sa post na ito.

May-akda

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey