Aqbeż għall-kontenut prinċipali
OpenAI

29 ta’ Lulju 2026

InġinerijaKumpanija

Kif GPT‑5.6 jgħaqqad intelliġenza u effiċjenza tal-ogħla livell

Qed jillowdja…

Iddisinjajna l-familja ta’ mudelli GPT‑5.6 biex tibbilanċja l-kapaċità u l-ispiża fil-firxa kollha ta’ kompiti li għalihom in-nies jużaw il-mudelli tagħna. Il-mudell flagship tagħna, GPT‑5.6 Sol, b’raġunament massimu, jaqbeż lil Claude Fable 5 fl-Artificial Analysis Coding Agent Index bi spiża ta’ inqas min-nofs. Terra jġib prestazzjoni tajba daqs GPT‑5.5 fil-parametri referenzjarji tal-intelliġenza b’nofs il-prezz, filwaqt li Luna huwa l-aktar mudell veloċi u affordabbli tagħna, bi prezz 80% orħos minn Sol. Biex niksbu din l-effiċjenza, it-timijiet tar-riċerka u dawk tekniċi tagħna wettqu ottimizzazzjonijiet sinifikanti f’kull saff ewlieni tal-arkitettura teknoloġika tagħna. Dan it-titjib ikopri l-mudelli tagħna, l-inferenza (kif inħaddmu l-mudelli biex jiġġeneraw l-output) u l-harness aġentiku tagħna, li jintuża kemm minn Codex kif ukoll minn ChatGPT Work.

Tul dawn l-aħħar erba’ snin, hekk kif espandejna l-mudelli tagħna biex jilħqu biljun utent attiv u aktar minn żewġ miljun negozju, l-effiċjenza kienet essenzjali biex il-benefiċċji tal-intelliġenza jaslu għand kulħadd. Il-missjoni tagħna hi li niżguraw li l-intelliġenza artifiċjali ġenerali tkun ta’ benefiċċju għall-umanità kollha. Tul dawn is-snin, ħdimna biex kontinwament niksbu aktar ottimizzazzjonijiet fl-arkitettura teknoloġika tagħna, ħalli noffru l-mudelli bl-aqwa prestazzjoni f’kull punt tal-kurva bejn l-ispiża u l-intelliġenza. Permezz ta’ GPT‑5.6 ksibna l-ogħla effiċjenza tagħna s’issa fl-intelliġenza għal kull token. Il-mudell huwa mħarreġ biex iwettaq aktar xogħol għal kull token. Waqt it-taħriġ, nottimizzaw kemm għas-suċċess fil-kompitu kif ukoll għall-effiċjenza, u nħarrġu l-mudell biex isegwi rotta aktar diretta fit-twettiq tal-kompitu.

Dan l-artiklu jħares lil hinn mill-mudelli tagħna u jispjega kif ippjanajna għall-effiċjenza permezz ta’ avvanzi f’żewġ partijiet ewlenin oħra tal-arkitettura teknoloġika: 1) l-inferenza, billi ottimizzajna proċessi bħall-ibbilanċjar tat-tagħbija, id-dekodifikazzjoni spekulattiva, il-caching u l-ottimizzazzjoni tal-kernel biex niksbu aktar riżultati bl-istess ħardwer; u 2) il-harness aġentiku tagħna, inkluż permezz ta’ ġestjoni aħjar tat-tkabbir żejjed tal-kuntest, l-użu tal-għodod u x-xogħol ripetut. Se nispjegaw ukoll ir-rwol ta’ GPT‑5.6 Sol fil-kisba awtonoma ta’ bosta minn dawn ir-riżultati. Għalkemm kull titjib meqjus waħdu jista’ jidher limitat, flimkien dawn il-kisbiet jakkumulaw u jippermettulna nwasslu intelliġenza u effiċjenza tal-ogħla livell.

Dijagramma li turi l-effiċjenza ta’ GPT-5.6 madwar il-harness tal-aġent, l-orkestrazzjoni tal-API, u l-inferenza tal-mudell, li tipproduċi inqas data tan-netwerk, inqas xogħol tas-CPU, u aktar output tal-GPU.

Naċċelleraw l-inferenza b’GPT‑5.6 Sol

F’dinja b’riżorsi tal-komputazzjoni limitati, fejn id-domanda għall-mudelli qed tikber aktar malajr mill-kapaċità, l-effiċjenza hija fil-qalba ta’ kull disinn ta’ sistema. Dan jgħodd b’mod speċjali fl-istack tal-inferenza tagħna, li jħaddem mudelli mħarrġa biex jiġġenera tweġibiet. L-għan primarju tagħna huwa li nservu aktar tokens bl-istess ħardwer, filwaqt li nżommu l-intelliġenza, il-latenza, id-disponibbiltà u l-affidabbiltà li l-utenti jistennew.

Biex jinkiseb dan, jeħtieġ li s-sistema kollha tiġi ottimizzata. Mudell jista’ jkun effiċjenti ħafna waħdu, iżda xorta jkun għali biex jiġi servut jekk it-talbiet jitqassmu ħażin, il-ħardwer jibqa’ inattiv, jew il-moviment tad-data jnaqqas il-veloċità tal-komputazzjoni. It-titjib f’kull saff jakkumula, b’żidiet fil-prestazzjoni li jiġu minn ottimizzazzjonijiet fir-rotta (fejn jintbagħtu t-talbiet), fl-iskedar (meta jintbagħtu t-talbiet), fil-kernels (softwer li jitħaddem fuq GPUs), fil-cache (xogħol salvjat u użat mill-ġdid), u fl-implimentazzjoni tal-mudell (l-ordni tal-kodiċi tal-GPU). GPT‑5.6 Sol fi Codex kellu rwol strumentali f’dawn l-ottimizzazzjonijiet kollha.

L-ewwel eżempju importanti huwa l-ibbilanċjar tat-tagħbija. Fuq livell globali, nidderieġu t-talbiet abbażi ta’ fatturi bħall-ġeografija, il-kapaċità disponibbli, u t-tip ta’ aċċeleratur (it-tip ta’ GPU jew ċippa speċjalizzata li tħaddem il-mudell). Fi ħdan il-cluster, inqassmu x-xogħol bejn l-istanzi tal-mudell abbażi tat-tagħbija, it-tul tal-kuntest, id-disponibbiltà tal-cache, u proprjetajiet oħra tat-talba. Fi ħdan kull istanza, ix-xogħol għandu mbagħad jinqasam b’mod effiċjenti bejn l-aċċeleraturi, is-sott-netwerks tal-mudell, u n-nuklei tal-komputazzjoni. GPT‑5.6 Sol f’Codex jgħinna nanalizzaw it-traffiku tal-produzzjoni, nidentifikaw sorsi ta’ żbilanċ li qabel ma kinux ġew innutati, nittestjaw strateġiji ġodda ta’ rotta, u nirfinaw kontinwament dawn l-ewristiċi. It-titjib fil-bilanċjar tat-tagħbija waħdu naqqas b’mod drastiku l-ispiża tas-servizz tal-mudelli tagħna.

Użajna wkoll GPT‑5.6 Sol biex jottimizza l-pass 'forward' tal-mudell: il-komputazzjoni li tittrasforma l-inputs fit-tbassir tat-token li jmiss. Anke meta l-operazzjonijiet individwali jkunu veloċi, ċaqliq eċċessiv tal-memorja, sinkronizzazzjoni, u tqassimiet ineffiċjenti tad-dejta jistgħu jħallu l-GPUs inattivi. Biex nevitaw dan, GPT‑5.6 Sol sab xogħol li seta’ jiġi kkalkulat minn qabel, evitat, jew parallelizzat. Permezz ta’ Codex, GPT‑5.6 Sol b’mod awtonomu kiteb mill-ġdid u ottimizza l-kernels tal-produzzjoni tagħna, il-kodiċi ewlieni li jeżegwixxi l-operazzjonijiet matematiċi li jiffurmaw il-mudell. Dan ħadem parzjalment għaliex ħarriġna lil GPT‑5.6 biex ikun effettiv fil-kitba u fit-titjib tal-kernels fi Triton(jinfetaħ f’tieqa ġdida) u Gluon(jinfetaħ f’tieqa ġdida), żewġ lingwi ta’ programmazzjoni tal-GPU b’sors miftuħ miżmuma minn OpenAI. Dawn l-isforzi, flimkien ma’ avvanzi usa’ fil-kernel minn GPT‑5.6 Sol, naqqsu l-ispejjeż tas-servizz minn tarf sa tarf b’20%. Investejna ħafna wkoll f’għodod ta’ verifika, bħall-għodda b’sors miftuħ FpSan(jinfetaħ f’tieqa ġdida) (Floating-Point Sanitizer), biex ngħinu nivvalidaw il-korrettezza tal-kernels miktuba minn GPT‑5.6 Sol.

Id-dekodifikazzjoni spekulattiva hija għodda oħra biex jitjiebu l-veloċità u l-effiċjenza. It-teknika tinvolvi t-tħaddim ta’ mudell ta’ abbozz iżgħar (jew “spekulatur”) flimkien mal-mudell primarju, fejn il-mudell iżgħar jipproponi diversi tokens biex il-mudell primarju jivverifikahom, b’mod parallel. Meta dawk il-proposti jiġu aċċettati, is-sistema tista’ tipproduċi diversi tokens tal-output minn passaġġ wieħed tal-mudell primarju, u b’hekk tnaqqas l-ammont ta’ komputazzjoni sekwenzjali għolja. GPT‑5.6 Sol tejjeb il-mudell abbozz tiegħu stess billi fassal u wettaq mijiet ta’ esperimenti fuq l-arkitettura tiegħu, u ttestja bidliet fid-daqs, fl-istruttura u fil-karatteristiċi. Barra minn hekk, GPT‑5.6 Sol nieda u mmonitorja l-proċess ta’ taħriġ tas-speculator, u intervjena b’mod awtonomu meta qamu problemi, inklużi ħsarat fil-hardware u instabbiltà fit-taħriġ. It-titjib li rriżulta żied l-effiċjenza tal-ġenerazzjoni tat-tokens b’aktar minn 15 %.

Meta jipproċessa tokens mhux fil-cache, il-mudell jibni l-cache key-value (KV) f’pass wieħed intensiv fil-komputazzjoni; meta jiġġenera l-output, jaqra u jestendi dak il-cache ripetutament. Il-konfigurazzjoni ottimizzata għat-tħaddim, bħal batching, sharding u ġestjoni tal-KV, tiddependi ħafna fuq il-workload — it-tul tal-prompt u tal-output, id-daqs tal-batch, ir-rata ta’ hit fil-cache, il-karatteristiċi tal-query, u aktar. Madankollu, l-ispazju tal-konfigurazzjoni qabel kien kbir wisq biex jiġi rfinat b’mod sistematiku, u dan ġiegħel lill-inġiniera jiddependu fuq ewristiċi ġenerali. Bil-GPT‑5.6 Sol f’Codex, stajna nanalizzaw tagħbijiet ta’ xogħol tal-produzzjoni, niġġeneraw u nivvalutaw konfigurazzjonijiet kandidati, u nottimizzaw b’mod estrem kif il-magna u l-mudell jiġu kkonfigurati għal kull xenarju. Dan jagħmel prattikabbli livell ġdid ta’ ottimizzazzjoni speċifika għat-tagħbijiet tax-xogħol, billi jipproduċi inferenza aktar utli mill-istess ħardwer.

L-ottimizzazzjoni tal-inferenza hija ċiklu kontinwu ta’ feedback. Aħna nkejlu l-imġiba fil-produzzjoni, nidentifikaw l-akbar lakuni, nimplimentaw bidliet, u nivverifikaw li dawn itejbu s-sistema kollha minflok benchmark iżolat. GPT‑5.6 Sol u Codex iħaffu kull parti minn dak iċ-ċiklu. Dan ifisser li t-tim tagħna jista’ jesplora aktar ideat, jirrispondi aktar malajr għal tagħbijiet tax-xogħol li jinbidlu, u joħloq stack tal-inferenza b’latenza aktar baxxa, kapaċità akbar, u spejjeż aktar baxxi għall-utenti.

Kif il-harness aġentiku tagħna jissimplifika x-xogħol ripetut

ChatGPT Work u Codex iwettqu kompiti kumplessi permezz ta’ sensiela ta’ talbiet lill-mudell u sejħiet tal-għodod. F’interazzjoni waħda—mit-talba tal-utent sat-tweġiba finali—Codex jista’ jispezzjona l-kodiċi tas-sors, ifittex fl-istorja tad-deployment, jaqra rapporti dwar inċidenti, jeditja fajl, u jmexxi testijiet. Kull pass jista’ jirrikjedi talba.

It-tħejjija tal-kuntest, it-trażmissjoni tad-dejta, it-tħaddim tal-inferenza, is-sejħa ta’ għodod, u l-bidu ta’ proċessi kollha jieħdu ħin u riżorsi ta’ komputazzjoni. Jekk kompitu jeħtieġ 30 talba lill-mudell, sekonda żejda għal kull talba tgħaddi. It-titjib tal-prestazzjoni ġenerali jfisser li jitnaqqas ix-xogħol ripetut fis-sistema kollha, mhux sempliċement li l-mudell isir aktar mgħaġġel.

Kompitu ta’ utent jidħol fil-mudell, li jista’ jsejjaħ għodda, jirċievi riżultat, u jieħu deċiżjoni oħra tal-mudell ripetutament qabel ma jlesti l-kompitu.

Dawra waħda tal-utent tista’ tinkludi ħafna iterazzjonijiet tal-mudell u tal-għodod. Kwalunkwe spiża fi ħdan ir-reġjun ripetut tista’ titħallas ħafna drabi.

Dawn il-multiplikaturi ggwidaw il-mod kif iddisinjajna l-harness aġentiku tagħna, li huwa saff ta’ orkestrazzjoni f’Rust li jgħaqqad il-mudelli tagħna, l-għodod tagħna u l-ambjent tal-utent. Sussegwentement, se niddiskutu kif l-evitar tat-tkabbir żejjed tal-kuntest, it-tagħbija tal-għodod, u l-użu mill-ġdid tax-xogħol jagħmlu kull talba aktar effiċjenti.

Evita l-kuntest żejjed

Hekk kif l-aġenti jingħataw aċċess għal aktar għodod, ħiliet, plugins, u l-istorja tal-konversazzjoni, it-twieqi tal-kuntest jistgħu jikbru faċilment. Dan iżid l-ispiża, jiddisturba lill-mudell, u jwassal għal raġunament mhux meħtieġ. Il-harness jista’ jnaqqas dan il-piż żejjed permezz ta’ skoperta differita, li tagħmel l-integrazzjonijiet, l-għodod MCP personalizzati, il-ħiliet, u l-plugins jidhru biss meta jkun hemm bżonn. Il-harness jipprevjeni wkoll lil għodod individwali u integrazzjonijiet MCP milli jikkunsmaw b’mod mhux mistenni t-tieqa tal-kuntest. L-output tal-għodda huwa limitat għal 10000 tokens b’mod awtomatiku sakemm il-mudell ma jitlobx limitu differenti.

Żomm il-prefissi eżatti għall-ħażna tal-prompt

Kif issemma qabel, ċiklu ta’ aġent jista’ jibgħat l-istess istruzzjonijiet, l-istorja tal-konverżazzjoni, id-definizzjonijiet tal-għodod, u r-riżultati preċedenti lill-GPUs diversi drabi matul dawra waħda. L-ipproċessar ta’ dawn l-inputs ripetuti jirrikjedi ħafna riżorsi, għalhekk il-ħażna fil-cache tal-prompt terġa’ tuża l-komputazzjoni marbuta ma’ prefiss tal-prompt li ġie pproċessat qabel. Biex jippreserva dak il-prefiss, il-harness jittratta l-istorja kollha viżibbli għall-mudell bħala append-only: messaġġi ġodda, riżultati tal-għodod, u aġġornamenti tal-ambjent jiżdiedu fl-aħħar minflok ma jiddaħħlu f’kuntest preċedenti. L-għodod jiġu ppreżentati wkoll f’ordni deterministiku, filwaqt li s-settings tar-runtime, bħal politiki ta’ approvazzjoni, jiġu applikati waqt l-eżekuzzjoni minflok ma jkunu inkorporati fid-definizzjonijiet tal-għodod. Din l-għażla tad-disinn tikkontribwixxi għar-rati ġenerali għoljin ta’ hits fil-cache tal-prompt ta’ Codex, u ta’ ChatGPT Work.

Tliet talbiet iqabblu l-bytes mibgħuta fuq konnessjoni persistenti mal-kuntest li qed jikber u li jarah il-mudell, u mal-prefiss eliġibbli għall-użu mill-ġdid tal-cache.

It-trasport inkrementali jibdel dak li jgħaddi min-netwerk; caching prompt jibdel dak li l-mudell jista’ jevita li jerġa’ jikkalkula. Il-wisgħat huma kunċettwali, u s-saff addizzjonali ta’ kompressjoni mhuwiex muri.

Effiċjenza tul il-kurva tal-intelliġenza

Il-kisbiet fl-effiċjenza li ksibna b’GPT‑5.6 huma r-riżultat ta’ snin ta’ titjib akkumulattiv fl-istack kollu, li jinkludi r-riċerka, l-inferenza, u l-harness aġentiku tagħna. Ir-rwol ta’ GPT‑5.6 fit-twassil ta’ ħafna minn dawn it-titjib jagħmilna ottimisti dwar kif ir-ritmu tal-ottimizzazzjonijiet se jitħaffef. Se nkomplu nagħmlu ottimizzazzjonijiet akbar f’oqsma bħall-ottimizzazzjoni tal-kernel, flimkien ma’ titjib fundamentali fl-istack tagħna. Nistennew bil-ħerqa li nwasslu dan it-titjib kontinwu u sottostanti lura lill-utenti u lill-klijenti tagħna fil-forma ta’ intelliġenza aktar disponibbli b’mod wiesa’ u effiċjenti fl-ispejjeż.

Ringrazzjamenti speċjali lil Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson, u Steve Coffey, Membri tal-Persunal Tekniku, għall-kontributi tagħhom għal din il-pubblikazzjoni.

Awtur

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, u Steve Coffey