Carane GPT‑5.6 nyawijèkaké kecerdasan tercanggih karo efisiensi tercanggih
Kita ngrancang kulawarga model GPT‑5.6 kanggo ngimbangi kapabilitas lan biaya ing saindhenging spektrum tugas sing ditindakake wong nganggo model kita. Model unggulan kita, GPT‑5.6 Sol, kanthi nalar maksimal ngluwihi Claude Fable 5 ing Artificial Analysis Coding Agent Index kanthi biaya kurang saka separoné. Terra nduweni kinerja padha apike karo GPT‑5.5 ing benchmark kecerdasan kanthi rega separo, dene Luna minangka model kita sing paling cepet lan paling murah, kanthi rega 80% luwih murah tinimbang Sol. Kanggo ngasilake efisiensi kasebut, tim riset lan teknis kita wis nindakake optimisasi gedhe ing saben lapisan utama stack kita. Perbaikan iki nyakup model, inferensi (carane kita nglakokake model kanggo ngasilake output), lan harness agen sing digunakake Codex lan ChatGPT Work.
Sajrone patang taun kepungkur, nalika model kita tambah gedhe nganti nglayani 1 milyar panganggo aktif lan luwih saka 2 yuta bisnis, efisiensi dadi kunci kanggo mbagekake paédah kecerdasan marang kabèh wong. Misi kita yaiku mesthekake yen kecerdhasan umum tiruan migunani tumrap sakabehing manungsa. Sajrone taun-taun kasebut, kita terus ngupaya ngasilake optimisasi luwih gedhe ing kabeh stack supaya bisa nawakake model kanthi kinerja paling apik ing saben titik kurva biaya-kecerdasan. Liwat GPT‑5.6, kita nggayuh efisiensi kecerdasan saben token paling dhuwur nganti saiki, amarga model iki dilatih kanggo ngrampungake luwih akeh gaweyan saben token. Sajrone pelatihan, kita ngoptimalake kasil tugas lan efisiensi, saéngga model bisa njupuk dalan sing luwih langsung kanggo ngrampungake tugas.
Tulisan iki ora mung mbahas model kita, nanging uga nerangake carane efisiensi dirancang liwat kemajuan ing rong bagean utama stack liyane, yaiku 1) inferensi, kanthi ngoptimalake proses kayata load balancing, decoding spekulatif, caching, lan optimisasi kernel supaya hardware sing padha ngasilake output luwih akeh, lan 2) harness agen, kalebu pengelolaan konteks sing gedhe banget, panggunaan alat, lan gaweyan sing dibaleni kanthi luwih apik. Kita uga bakal nerangake peran GPT‑5.6 Sol kanggo ngasilake sawetara peningkatan kasebut kanthi mandhiri. Sanajan saben perbaikan sing kapisah katon winates, gabungan asil kasebut ndadekake kita bisa menehi kecerdasan lan efisiensi sing padha-padha tercanggih.
Ing donya sing kapasitas komputasiné winates lan panjaluk model tuwuh luwih cepet tinimbang kapasitas, efisiensi dadi inti saben rancangan sistem. Iki mligi bener kanggo stack inferensi kita, sing nglakokake model sing wis dilatih kanggo ngasilake tanggapan. Tujuan utama kita yaiku nglayani luwih akeh token nganggo hardware sing padha, tanpa ngurangi kecerdasan, latensi, kasedhiyan, lan linuwih sing dikarepake panganggo.
Kanggo nggayuh iki, kabeh sistem kudu dioptimalake. Model bisa efisien banget nalika diukur dhewe, nanging tetep larang dilayani yen panjaluk disebar kanthi ala, hardware nganggur, utawa perpindahan data ngalonake komputasi. Perbaikan ing saben lapisan saya nguwatake siji lan sijiné, saka optimisasi routing (menyang endi panjaluk dikirim), scheduling (kapan panjaluk dikirim), kernel (piranti lunak sing mlaku ing GPU), caching (gaweyan sing disimpen lan digunakake maneh), lan implementasi model (urutan kode GPU). GPT‑5.6 Sol ing Codex nduweni peran wigati ing kabeh optimisasi kasebut.
Conto wigati sing kapisan yaiku load balancing. Ing skala global, kita ngarahake panjaluk adhedhasar faktor kayata geografi, kapasitas sing kasedhiya, lan jinis akselerator (jinis GPU utawa chip khusus sing nglakokake model). Ing sajroning kluster, kita nyebar gaweyan menyang instans model adhedhasar beban, dawa konteks, kasedhiyan cache, lan sipat panjaluk liyane. Ing saben instans, gaweyan banjur kudu dipérang kanthi efisien ing antarane akselerator, subjaringan model, lan inti komputasi. GPT‑5.6 Sol ing Codex mbantu kita nganalisis lalu lintas produksi, ngenali sumber ketimpangan sing sadurunge ora kawigatèn, nguji strategi routing anyar, lan terus nyetel heuristik kasebut. Perbaikan load balancing iki wae wis nyuda biaya layanan model kanthi drastis.
Kita uga nggunakake GPT‑5.6 Sol kanggo ngoptimalake forward pass model: komputasi sing ngowahi input dadi predhiksi token sabanjure. Sanajan saben operasi lumaku cepet, perpindahan memori lan sinkronisasi sing kakehan, uga tata letak data sing ora efisien, bisa ndadekake GPU nganggur. Kanggo nyegah iki, GPT‑5.6 Sol nemokake gaweyan sing bisa dikomputasi luwih dhisik, disingkiri, utawa diparalelake. Kanthi Codex, GPT‑5.6 Sol nulis ulang lan ngoptimalake kernel produksi kita kanthi mandhiri, yaiku kode inti sing nglakokake operasi matematika panyusun model. Iki bisa kasil antara liya amarga kita wis nglatih GPT‑5.6 supaya trampil nulis lan ningkatake kernel ing Triton(mbukak ing jendhela anyar) lan Gluon(mbukak ing jendhela anyar), rong basa pamrograman GPU sumber terbuka sing dikelola OpenAI. Upaya iki, bebarengan karo kemajuan kernel sing luwih amba saka GPT‑5.6 Sol, nyuda biaya layanan saka wiwitan nganti pungkasan nganti 20%. Kita uga nandur modal gedhe ing piranti verifikasi, kayata piranti sumber terbuka FpSan(mbukak ing jendhela anyar) (Sanitizer Floating-Point), kanggo mbantu mriksa kabeneran kernel sing ditulis GPT‑5.6 Sol.
Decoding spekulatif minangka cara liya kanggo ningkatake kacepetan lan efisiensi. Teknik iki nglakokake model draf sing luwih cilik (utawa “spekulator”) bebarengan karo model utama, banjur ngusulake sawetara token supaya diverifikasi model utama kanthi paralel. Nalika usulan kasebut ditampa, sistem bisa ngasilake sawetara token output saka siji pass model utama, saéngga nyuda komputasi sekuensial sing larang. GPT‑5.6 Sol ningkatake model drafé dhewe kanthi ngrancang lan nglakokake atusan eksperimen tumrap arsitekturé, kalebu nguji owah-owahan ukuran, struktur, lan fitur. Kajaba iku, GPT‑5.6 Sol miwiti lan ngawasi proses pelatihan spekulator, sarta melu kanthi mandhiri nalika ana masalah, kalebu kegagalan hardware lan pelatihan sing ora stabil. Perbaikan sing diasilake ningkatake efisiensi pangasilan token luwih saka 15%.
Nalika ngolah token input sing durung dicache, model mbangun cache key-value (KV) sajrone siji pass sing mbutuhake komputasi gedhe; nalika ngasilake output, model bola-bali maca lan nambah cache kasebut. Konfigurasi layanan sing optimal, kayata batching, sharding, lan pengelolaan KV, gumantung banget marang beban kerja—dawa prompt lan output, ukuran batch, tingkat hit cache, sipat kueri, lan liya-liyane. Nanging, sadurunge ruang konfigurasi kegedhèn kanggo disetel kanthi sistematis, mula insinyur kudu ngandelake heuristik umum. Kanthi GPT‑5.6 Sol ing Codex, kita bisa nganalisis beban kerja produksi, ngasilake lan ngevaluasi calon konfigurasi, sarta ngoptimalake kanthi banget carane mesin lan model dikonfigurasi kanggo saben skenario. Iki ndadekake optimisasi anyar sing khusus kanggo saben beban kerja bisa ditrapake, saéngga entuk inferensi sing luwih migunani saka hardware sing padha.
Optimisasi inferensi minangka loop umpan balik sing terus lumaku. Kita ngukur tumindak sistem produksi, ngenali kekurangan paling gedhe, ngetrapake owah-owahan, lan mesthekake yen owah-owahan kasebut ningkatake kabeh sistem, ora mung benchmark kapisah. GPT‑5.6 Sol lan Codex nyepetake saben bagean saka loop kasebut. Tegese, tim kita bisa njajaki luwih akeh gagasan, luwih cepet nanggapi owah-owahan beban kerja, lan nggawe stack inferensi kanthi latensi luwih cendhek, kapasitas luwih gedhe, lan biaya luwih murah kanggo panganggo.
ChatGPT Work lan Codex ngrampungake tugas rumit liwat rerangken panjaluk model lan panggilan alat. Sajrone siji giliran—wiwit panjaluk panganggo nganti tanggapan pungkasan—Codex bisa mriksa kode sumber, nggoleki riwayat deployment, maca laporan insiden, nyunting berkas, lan nglakokake tes. Saben langkah bisa mbutuhake panjaluk.
Nyiyapake konteks, ngirim data, nglakokake inferensi, nelpon alat, lan miwiti proses kabèh mbutuhake wektu lan komputasi. Yen tugas mbutuhake 30 panjaluk model, tambahan sedetik saben panjaluk bakal numpuk. Ningkatake kinerja sakabèhé ateges nyuda gaweyan sing dibaleni ing saindhenging sistem, ora mung nyepetake model.
Siji giliran panganggo bisa ngemot akeh iterasi model lan alat. Saben biaya ing bagean sing dibaleni bisa dibayar bola-bali.
Faktor pengali iki dadi dhasar rancangan harness agen kita, yaiku lapisan orkestrasi Rust sing nyambungake model, alat, lan lingkungan panganggo. Sabanjure, kita bakal mbahas carane nyegah konteks dadi gedhe banget, ngemot alat, lan nggunakake maneh gaweyan bisa ndadekake saben panjaluk luwih efisien.
Nalika agen diwenehi akses menyang luwih akeh alat, katrampilan, plugin, lan riwayat pacelathon, jendhela konteks bisa gampang nggedhe. Iki nambah biaya, ngganggu model, lan njalari nalar sing ora perlu. Harness bisa nyuda overhead iki liwat panemuan sing ditundha, saéngga integrasi, alat MCP kustom, katrampilan, lan plugin mung bisa ditampilake nalika dibutuhake. Harness uga nyegah alat lan integrasi MCP tartamtu ngentekake jendhela konteks kanthi ora dinyana. Kanthi gawan, output alat diwatesi nganti 10.000 token, kajaba model njaluk wates liyane.
Kaya sing wis disebutake, loop agen bisa ngirim pandhuan, riwayat pacelathon, definisi alat, lan asil sadurunge sing padha menyang GPU kaping pirang-pirang sajrone siji giliran. Ngolah input sing dibaleni iki larang, mula caching prompt nggunakake maneh komputasi sing ana gandhengane karo prefiks prompt sing wis diolah sadurunge. Kanggo njaga prefiks kasebut, harness nganggep kabeh riwayat sing katon dening model mung bisa ditambahi: pesen anyar, asil alat, lan pembaruan lingkungan ditambahake ing pungkasan, dudu disisipake menyang konteks sadurunge. Alat uga disajekake kanthi urutan deterministik, dene setelan runtime, kayata kabijakan persetujuan, ditrapake nalika eksekusi tinimbang dilebokake ing definisi alat. Pilihan desain iki nyumbang marang tingkat hit cache prompt sakabèhé sing dhuwur ing Codex lan ChatGPT Work.
Transportasi inkremental ngowahi apa sing ngliwati jaringan; caching prompt ngowahi komputasi apa sing bisa ora dibaleni model. Jembaré mung konseptual, lan lapisan komprèsi tambahan ora ditampilake.
Peningkatan efisiensi sing diwenehake liwat GPT‑5.6 minangka asil saka perbaikan sing saya ngrembaka sajrone pirang-pirang taun ing kabeh stack, kalebu riset, inferensi, lan harness agen kita. Peran GPT‑5.6 kanggo ngasilake akeh perbaikan iki ndadekake kita optimistis yen laju optimisasi bakal saya cepet. Kita bakal terus nindakake optimisasi luwih gedhe ing bidang kayata optimisasi kernel, bebarengan karo perbaikan dhasar ing stack kita. Kita ngarep-arep bisa nerusake perbaikan internal sing terus lumaku iki marang panganggo lan pelanggan kanthi wujud kecerdasan sing luwih gampang diakses lan luwih irit biaya.
Matur nuwun khusus kanggo Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson, lan Steve Coffey, para Anggota Staf Teknis, amarga wis nyumbang kanggo tulisan iki.


