Kalo te përmbajtja kryesore
OpenAI

29 korrik 2026

InxhinieriaKompania

Si bashkon GPT‑5.6 inteligjencën me efikasitetin avangardë

Duke ngarkuar…

E projektuam familjen e modeleve GPT‑5.6 për të ekuilibruar aftësinë dhe koston në të gjithë spektrin e detyrave për të cilat njerëzit përdorin modelet tona. Modeli ynë kryesor, GPT‑5.6 Sol, me arsyetim Max, tejkalon Claude Fable 5 në Artificial Analysis Coding Agent Index me më pak se gjysmën e kostos. Terra performon po aq mirë sa GPT‑5.5 në testet e inteligjencës me gjysmën e çmimit, ndërsa Luna është modeli ynë më i shpejtë dhe më ekonomik, me çmim 80% më të ulët se kostoja e Sol. Për të arritur këtë efikasitet, ekipet tona kërkimore dhe teknike kanë bërë optimizime të konsiderueshme në çdo shtresë kryesore të grupit tonë teknologjik. Këto përmirësime përfshijnë modelet tona, inferencën (mënyrën si i ekzekutojmë modelet për të gjeneruar rezultate) dhe strukturën tonë agjentike, që përdoret si nga Codex, ashtu edhe nga ChatGPT Punë.

Teksa i kemi zgjeruar modelet tona për 1 miliard përdorues aktivë dhe më shumë se 2 milionë biznese gjatë katër viteve të fundit, efikasiteti ka qenë thelbësor për t’ua shpërndarë të gjithëve përfitimet e inteligjencës. Misioni ynë është të sigurojmë që inteligjenca e përgjithshme artificiale t’i sjellë përfitime gjithë njerëzimit. Gjatë këtyre viteve, kemi punuar për të mundësuar vazhdimisht optimizime më të mëdha në të gjithë grupin tonë teknologjik, në mënyrë që të ofrojmë modelet me performancën më të lartë në çdo pikë të kurbës kosto-inteligjencë. Me GPT‑5.6 arritëm efikasitetin tonë më të lartë deri më sot për inteligjencën për token; ai është trajnuar që të kryejë më shumë punë për token. Gjatë trajnimit, optimizojmë si suksesin e detyrës, ashtu edhe efikasitetin, duke e mësuar modelin të ndjekë një rrugë më të drejtpërdrejtë për realizimin e saj.

Ky artikull shkon përtej modeleve tona për të treguar se si e integruam efikasitetin përmes përparimeve në dy pjesë të tjera kryesore të grupit teknologjik: 1) inferenca, duke optimizuar procese si balancimi i ngarkesës, dekodimi spekulativ, memoria specifike dhe optimizimi i kernelëve, për të marrë më shumë rezultate nga i njëjti harduer; dhe 2) struktura jonë agjentike, përfshirë menaxhimin më të mirë të fryrjes së kontekstit, përdorimit të mjeteve dhe punës së përsëritur. Do të tregojmë gjithashtu rolin e GPT‑5.6 Sol në realizimin autonom të disa prej këtyre përfitimeve. Edhe pse çdo përmirësim i veçuar mund të duket i kufizuar, këto arritje akumulohen dhe na mundësojnë të jemi në avangardë si të inteligjencës, ashtu edhe të efikasitetit.

Diagram që tregon efikasitetin e GPT-5.6 në strukturën e agjentit, orkestrimin e API-së dhe inferencën e modelit, duke prodhuar më pak të dhëna rrjeti, më pak punë për CPU-në dhe më shumë rezultate nga GPU-ja.

Përshpejtimi i inferencës me GPT‑5.6 Sol

Në një botë me burime të kufizuara përllogaritëse, ku kërkesa për modele rritet më shpejt se kapaciteti, efikasiteti është thelbësor në projektimin e çdo sistemi. Kjo vlen veçanërisht për grupin tonë teknologjik të inferencës, i cili ekzekuton modelet e trajnuara për të gjeneruar përgjigje. Objektivi ynë kryesor është të shërbejmë më shumë tokenë me të njëjtin harduer, duke ruajtur inteligjencën, vonesën, disponueshmërinë dhe besueshmërinë që presin përdoruesit.

Për ta arritur këtë, duhet optimizuar i gjithë sistemi. Një model mund të jetë shumë efikas më vete, por gjithsesi të kushtojë shumë për t’u ofruar nëse kërkesat shpërndahen keq, hardueri mbetet pa punë ose lëvizja e të dhënave ngadalëson përllogaritjen. Përmirësimet në çdo shtresë akumulohen, me përfitime nga optimizimi i rutimit (ku dërgohen kërkesat), planifikimit (kur dërgohen kërkesat), kernelëve (softueri që ekzekutohet në GPU), memories specifike (puna e ruajtur dhe e ripërdorur) dhe implementimit të modelit (renditja e kodit të GPU-së). GPT‑5.6 Sol në Codex luajti një rol vendimtar në të gjitha këto optimizime.

Shembulli i parë i rëndësishëm është balancimi i ngarkesës. Në nivel global, i rutinojmë kërkesat sipas faktorëve si vendndodhja gjeografike, kapaciteti i disponueshëm dhe lloji i përshpejtuesit (lloji i GPU-së ose i çipit të specializuar që ekzekuton modelin). Brenda një grupi serverësh, e shpërndajmë punën mes instancave të modelit sipas ngarkesës, gjatësisë së kontekstit, disponueshmërisë së memories specifike dhe veçorive të tjera të kërkesës. Brenda çdo instance, puna duhet të ndahet më pas me efikasitet mes përshpejtuesve, nënrrjeteve të modelit dhe bërthamave përllogaritëse. GPT‑5.6 Sol në Codex na ndihmon të analizojmë trafikun e prodhimit, të identifikojmë burime çekuilibri të anashkaluara më parë, të testojmë strategji të reja rutimi dhe t’i përshtatim vazhdimisht këto heuristika. Vetëm këto përmirësime në balancimin e ngarkesës ulën ndjeshëm koston e ofrimit të modeleve tona.

Përdorëm gjithashtu GPT‑5.6 Sol për të optimizuar kalimin përpara të modelit: përllogaritjen që i shndërron hyrjet në parashikime të tokenit të ardhshëm. Edhe kur veprimet individuale janë të shpejta, lëvizja e tepërt e memories, sinkronizimi dhe organizimi joefikas i të dhënave mund t’i lënë GPU-të pa punë. Për ta shmangur këtë, GPT‑5.6 Sol gjeti punë që mund të përllogaritej paraprakisht, të shmangej ose të kryhej paralelisht. Me Codex, GPT‑5.6 Sol rishkroi dhe optimizoi në mënyrë autonome kernelët tanë të prodhimit, kodin bazë që ekzekuton veprimet matematikore nga të cilat përbëhet modeli. Kjo funksionoi pjesërisht sepse e kemi trajnuar GPT‑5.6 të shkruajë dhe të përmirësojë me efikasitet kernelë në Triton(hapet në një dritare të re) dhe Gluon(hapet në një dritare të re), dy gjuhë programimi me burim të hapur për GPU, të mirëmbajtura nga OpenAI. Këto përpjekje, së bashku me përparimet më të gjera të kernelëve nga GPT‑5.6 Sol, ulën me 20% kostot e ofrimit nga fillimi në fund. Kemi investuar shumë edhe në mjete verifikimi, si mjeti me burim të hapur FpSan(hapet në një dritare të re) (Pastruesi i presjes së lëvizshme), për të ndihmuar në vërtetimin e saktësisë së kernelëve të shkruar nga GPT‑5.6 Sol.

Dekodimi spekulativ është një tjetër mënyrë për të përmirësuar shpejtësinë dhe efikasitetin. Teknika përfshin ekzekutimin e një modeli më të vogël paraprak (ose «spekulatori») përkrah modelit kryesor, duke propozuar disa tokenë që modeli kryesor t’i verifikojë paralelisht. Kur këto propozime pranohen, sistemi mund të prodhojë disa tokenë dalës nga një kalim i vetëm i modelit kryesor, duke zvogëluar përllogaritjen e kushtueshme vijuese. GPT‑5.6 Sol përmirësoi modelin e vet paraprak duke projektuar dhe zhvilluar qindra eksperimente mbi arkitekturën e tij, ku testoi ndryshime në madhësi, strukturë dhe veçori. Për më tepër, GPT‑5.6 Sol nisi dhe mbikëqyri procesin e trajnimit të spekulatorit, duke ndërhyrë në mënyrë autonome kur shfaqeshin probleme, përfshirë defektet e harduerit dhe paqëndrueshmërinë e trajnimit. Përmirësimet që rezultuan rritën me më shumë se 15% efikasitetin e gjenerimit të tokenëve.

Kur përpunon tokenë hyrës që nuk gjenden në memorien specifike, modeli ndërton memorien specifike çelës-vlerë (KV) në një kalim me përllogaritje intensive; kur gjeneron dalje, ai lexon vazhdimisht prej saj dhe e zgjeron. Konfigurimi optimal i ofrimit, si grupimi, ndarja në segmente dhe menaxhimi i KV-së, varet shumë nga ngarkesa e punës—gjatësia e kërkesës dhe daljes, madhësia e grupit, norma e goditjeve në memorien specifike, karakteristikat e pyetjeve e të tjera. Megjithatë, hapësira e konfigurimeve ishte më parë tepër e madhe për t’u përshtatur sistematikisht, ndaj inxhinierëve u duhej të mbështeteshin në heuristika të përgjithshme. Me GPT‑5.6 Sol në Codex, mundëm të analizonim ngarkesat e prodhimit, të gjeneronim e vlerësonim konfigurime kandidate dhe të hiperoptimizonim konfigurimin e motorit dhe modelit për çdo skenar. Kjo e bën praktik një nivel të ri optimizimi sipas ngarkesës së punës, duke nxjerrë më shumë inferencë të dobishme nga i njëjti harduer.

Optimizimi i inferencës është një cikël i vazhdueshëm reagimi. Matim sjelljen në prodhim, identifikojmë mangësitë më të mëdha, zbatojmë ndryshime dhe verifikojmë që ato përmirësojnë të gjithë sistemin, jo vetëm një test të izoluar performance. GPT‑5.6 Sol dhe Codex përshpejtojnë çdo pjesë të këtij cikli. Kjo do të thotë se ekipi ynë mund të shqyrtojë më shumë ide, t’u përgjigjet më shpejt ndryshimeve të ngarkesave dhe të krijojë një grup teknologjik inferencash me më pak vonesë, më shumë kapacitet dhe kosto më të ulëta për përdoruesit.

Si e thjeshton struktura jonë agjentike punën e përsëritur

ChatGPT Punë dhe Codex përfundojnë detyra komplekse përmes një serie kërkesash ndaj modelit dhe thirrjesh të mjeteve. Brenda një ndërveprimi të vetëm—nga kërkesa e përdoruesit deri te përgjigjja përfundimtare—Codex mund të inspektojë kodin burimor, të kërkojë në historikun e vendosjeve, të lexojë raporte incidentesh, të redaktojë një skedar dhe të ekzekutojë teste. Çdo hap mund të kërkojë një kërkesë të veçantë.

Përgatitja e kontekstit, transmetimi i të dhënave, kryerja e inferencës, thirrja e mjeteve dhe nisja e proceseve kërkojnë kohë dhe fuqi përllogaritëse. Nëse një detyrë kërkon 30 kërkesa ndaj modelit, një sekondë shtesë për çdo kërkesë bëhet e ndjeshme. Përmirësimi i performancës së përgjithshme do të thotë të pakësohet puna e përsëritur në të gjithë sistemin, jo thjesht të bëhet modeli më i shpejtë.

Një detyrë e përdoruesit hyn në model, i cili mund të thërrasë një mjet, të marrë një rezultat dhe të marrë sërish një vendim, në mënyrë të përsëritur, para se ta përfundojë detyrën.

Një ndërveprim i vetëm i përdoruesit mund të përmbajë shumë përsëritje të modelit dhe mjeteve. Çdo kosto brenda pjesës së përsëritur mund të paguhet shumë herë.

Këta shumëzues kanë ndikuar në projektimin e strukturës sonë agjentike, një shtresë orkestrimi në Rust që lidh modelet, mjetet dhe mjedisin e përdoruesit. Më tej do të shohim se si shmangia e fryrjes së kontekstit, ngarkimi i mjeteve dhe ripërdorimi i punës e bëjnë çdo kërkesë më efikase.

Shmang fryrjen e kontekstit

Ndërsa agjentëve u jepet qasje në më shumë mjete, aftësi, shtojca dhe historik bisede, dritaret e kontekstit mund të zgjerohen lehtësisht. Kjo rrit koston, shpërqendron modelin dhe nxit arsyetim të panevojshëm. Struktura mund ta ulë këtë barrë përmes zbulimit të shtyrë, falë të cilit integrimet, mjetet e personalizuara MCP, aftësitë dhe shtojcat shfaqen vetëm kur nevojiten. Struktura gjithashtu parandalon që mjete të veçanta dhe integrime MCP ta zënë papritur dritaren e kontekstit. Si parazgjedhje, rezultati i mjeteve kufizohet në 10 000 tokenë, përveçse kur modeli kërkon një kufi tjetër.

Ruaj prefikset e sakta për memorien specifike të kërkesave

Siç u përmend më herët, një cikël agjenti mund t’ua dërgojë GPU-ve disa herë brenda një ndërveprimi të vetëm të njëjtat udhëzime, historikun e bisedës, përkufizimet e mjeteve dhe rezultatet e mëparshme. Përpunimi i këtyre hyrjeve të përsëritura kushton, ndaj memoria specifike e kërkesave ripërdor përllogaritjen që lidhet me prefiksin e një kërkese të përpunuar më parë. Për ta ruajtur këtë prefiks, struktura e trajton të gjithë historikun e dukshëm për modelin si vetëm të shtueshëm: mesazhet e reja, rezultatet e mjeteve dhe përditësimet e mjedisit shtohen në fund, në vend që të futen në kontekstin e mëparshëm. Edhe mjetet paraqiten në një rend të përcaktuar, ndërsa cilësimet e ekzekutimit, si politikat e miratimit, zbatohen gjatë ekzekutimit në vend që të përfshihen në përkufizimet e mjeteve. Kjo zgjedhje projektimi ndihmon që Codex dhe ChatGPT Punë të arrijnë norma të larta të përgjithshme goditjesh në memorien specifike të kërkesave.

Tri kërkesa krahasojnë bajtet e dërguara përmes një lidhjeje të vazhdueshme me kontekstin në rritje që sheh modeli dhe prefiksin që mund të ripërdoret nga memoria specifike.

Transporti inkremental ndryshon çfarë kalon nëpër rrjet; ruajtja e kërkesave në memorien specifike ndryshon çfarë mund të shmangë së rillogarituri modeli. Gjerësitë janë konceptuale dhe shtresa shtesë e kompresimit nuk paraqitet.

Efikasitet në të gjithë kurbën e inteligjencës

Përfitimet në efikasitet që sollëm me GPT‑5.6 janë rezultat i përmirësimeve të akumuluara gjatë viteve në të gjithë grupin tonë teknologjik, nga kërkimi dhe inferenca deri te struktura jonë agjentike. Roli i GPT‑5.6 në realizimin e shumë prej këtyre përmirësimeve na bën optimistë se ritmi i optimizimeve do të përshpejtohet. Do të vazhdojmë të bëjmë optimizime më të mëdha në fusha si optimizimi i kernelëve, krahas përmirësimeve themelore të grupit tonë teknologjik. Mezi presim t’ua përcjellim përdoruesve dhe klientëve tanë këto përmirësime të vazhdueshme në prapaskenë, në formën e një inteligjence më gjerësisht të disponueshme dhe me kosto më efikase.

Falënderime të veçanta për Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson dhe Steve Coffey, anëtarë të stafit teknik, për kontributin e tyre në këtë artikull.

Autor

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson dhe Steve Coffey