Pandhuan pangembang kanggo GPT‑5.6
Piwulang teknis saka perusahaan rintisan ing tahap produksi
Kulawarga model GPT‑5.6 ndadekake kinerja agen kelas tercanggih luwih terjangkau, uga ngluwihi wates kemampuan sing bisa digayuh.
Ing pandhuan iki, kita nuduhake carane perusahaan rintisan nggunakake pilihan model sing luwih pinter lan kontrol API anyar kanggo njaga kesinambungan nalar, ngorkestrasi multi-agen, lan nindakake panggilan alat kanthi program, supaya bisa nggawe agen sing luwih cepet lan luwih mumpuni kanthi biaya sing luwih murah.
Wiwit GPT‑5, saben generasi model dirancang kanggo ngrampungake tugas jangka luwih dawa kanthi token luwih sithik. GPT‑5.6 nerusake kemajuan kasebut: kinerja agen luwih kuwat, biaya luwih murah, lan mung mbutuhake sethithik owah-owahan ing harness dhasare.
Peningkatan efisiensi biaya sakabèhé saya gedhe amarga akurasi uga mundhak sanajan upaya nalare luwih sithik. Contone, ing Agents’ Last Exam, GPT‑5.6 Sol kanthi nalar “endhek” ngluwihi GPT‑5.5 kanthi nalar “dhuwur” nalika harness tetep padha. Kita uga ndeleng asil sing padha ing uji produksi. Perusahaan rintisan nglaporake pengiritan biaya gedhe ing maneka alur kerja kanthi nyuda upaya nalar saka setelan gawan sadurunge.
Sadurunge, nganyarke menyang model unggulan kanthi tingkat nalar paling dhuwur sing kasedhiya dadi pilihan paling apik kanggo kasus panggunaan jangka dawa. Iki utamane amarga model-model kasebut luwih mumpuni tinimbang model sing dioptimalake kanggo biaya nalika nangani konteks dawa lan panggilan alat. Kahanan iki owah ing kulawarga 5.6: kanthi komputasi wektu-uji luwih akeh, Luna lan Terra kerep bisa nindakake tugas kaya GPT‑5.4 lan 5.5, nanging kanthi biaya luwih murah.
Coba tugas ing BrowseComp, yaiku tolok ukur adhedhasar panelusuran sing nguji kemampuan model kanggo nggoleki fakta sing angel ditemokake. Telung sasi kepungkur, GPT‑5.5 (Dipikir Nemen Banget) entuk skor 84,36% ing tolok ukur iki kanthi biaya total $33,27. Nalika diluncurake, GPT‑5.6 Luna (Dipikir Nemen Banget) menehi kinerja sing meh padha, kanthi skor 84,04% lan biaya $1,33. Wiwit kuwi, regane wis kita murahake maneh. Waca luwih lengkap babagan pangurangan rega paling anyar.
Model kulawarga 5.6 sing luwih cilik cocog banget kanggo beban kerja volume gedhe, interaksi sing sensitif marang latensi, lan langkah-langkah bola-bali ing alur kerja agen. Contone, yen sampeyan ngelola perusahaan rintisan teknologi hukum sing ngolah memo tulisan tangan sadurunge dianalisis agen, sampeyan saiki bisa nggunakake Terra utawa Luna kanggo ekstraksi, ora perlu nggunakake model tercanggih kanggo kabeh proses, lan bisa ngirit biaya kanthi gedhe.
Saliyane ningkatake kinerja gawan GPT‑5.6, kita uga ngluncurake komponen dhasar anyar ing Responses API kanggo ngasilake peningkatan luwih lanjut. Kita nglatih GPT‑5.6 saka wiwitan nganti pungkasan kanthi telung intervensi arsitektur sing saling nglengkapi supaya agen bisa makarya luwih efisien:
- Gunakake maneh karya sing wis rampung: kanthi njaga nalar supaya tetep kasimpen(mbukak ing jendhela anyar) ing saben giliran model lan nggunakake pemadatan native(mbukak ing jendhela anyar) kanggo mampetake pacelathon dawa, model bisa njaga koherensi karya ing tugas jangka luwih dawa tanpa bingung utawa kudu mbangun maneh konteks sadurunge.
- Pecah tugas kanthi paralel yen cocog: nggunakake orkestrasi multi-agen native(mbukak ing jendhela anyar) bisa ngoordinasi pirang-pirang agen ing alur kerja paralel supaya tugas rumit rampung luwih cepet.
- Pindhah karya deterministik menyang kode: gunakake panggilan alat kanthi program(mbukak ing jendhela anyar) kanggo nyaring, nggabungake, lan ngorkestrasi output alat ing njaba jendhela konteks model. Kanthi mangkono, token model bisa diwenehake kanggo nggawe pertimbangan, nalika biaya, latensi, lan kemerosotan konteks dikurangi.
Yen digunakake bebarengan, bedane bisa gedhe banget. Contone, ing ARC-AGI-3, GPT‑5.6 Sol entuk skor 13,3% nganggo harness standar. Nanging, sawise nalar sing disimpen lan pemadatan diaktifake, skore mundhak dadi 38,3%—kanthi nggunakake token output udakara 6× luwih sithik. Tanpa ngowahi model, nanging kinerjane meh tikel telu. Sampeyan bisa maca luwih lengkap ing panliten harness ARC-AGI-3 kita ing kene.
Alur kerja agen kerep ngemot rong jinis karya:
- Tugas sing mbutuhake pertimbangan
- Karya sing utamane mung mindhah, nyaring, lan nggabungake data
Nalika agen njupuk 100 dokumen wajib, nyaring miturut tanggal, lan ngenali transaksi sing cocog, model ora perlu nalar saben asil antara ing jendhela kontekse. Panggilan Alat kanthi Program ngidini GPT‑5.6 nulis JavaScript kanggo ngorkestrasi alat, nglakokake panggilan mandiri kanthi paralel, lan ngolah output ing njaba jendhela konteks. Model banjur bisa fokus marang sing mbutuhake kapinteran: nggawe pertimbangan.
Kanggo tugas rumit sing bisa diparalelake, mbagekake tumindak lan nalar menyang pirang-pirang alur kerja agen bisa nyepetake rampunge tugas sekaligus ningkatake kapinteran. Ing konfigurasi kasebut, agen utama tanggung jawab ngorkestrasi subagen lan maringake tugas marang dheweke. Subagen ngupayakake tujuane kanthi paralel, banjur ngirim asile bali menyang agen utama kanggo disintesis ing tahap pungkasan. Tim bisa langsung nggunakake multi-agen kanthi ngaktifake multi-agen(mbukak ing jendhela anyar) ing Responses API. Iki uga cara kerja setelan kemampuan Dipikir Pol-Polan ing ChatGPT.
“Qualia nglakokake tim-tim agen kanggo ngrampungake masalah riset mbukak, lan GPT‑5.6 Sol langsung cocog. Model iki nuduhake peningkatan gedhe tinimbang GPT‑5.5, rampung luwih cepet tinimbang meh kabeh model liyane sing diuji, lan enggal dadi model OpenAI andh劸运 kita.”
“GPT‑5.6 minangka orkestrator paling apik saka OpenAI sing tau kita deleng. Kita menehi enem spesifikasi sekaligus—kabeh ditulis, dibangun, lan dirembug—lan model iki bisa nglacak kabeh tanpa nyuda kualitase.”
Sanajan GPT‑5.6 bisa nemtokake jumlah subagen sing cocog lan kapan kudu nggawe subagen, prilaku multi-agen gampang banget diarahake. Menehi instruksi marang model babagan kapan kudu ngaktifake subagen bisa ningkatake kemungkinan agen mung digawe nalika token tambahan kasebut bakal ningkatake kinerja.
Ing kabeh kulawarga model, TTL panyimpenan pituduh wis ditambah dadi paling ora 30 menit, lan titik pemutus cache saiki bisa disetel kanthi deterministik ing jendhela konteks model. Iki ndadekake perusahaan rintisan bisa ningkatake tingkat cache hit kanthi nyata.
Saliyane nyetel titik pemutus cache, terus nggunakake prompt_cache_key(mbukak ing jendhela anyar) sing cocog bakal ningkatake kemungkinan panjaluk mlebu menyang mesin inferensi sing padha karo mesin sing sadurunge nglayani prefiks kasebut, saengga latensi suda.
Sing paling narik kawigaten saka kabeh conto iki yaiku owah-owahan gedhe ing aspek ekonomi nalika mbangun agen.
Kasus panggunaan sing biyen mbutuhake model tercanggih ing saben langkah saiki bisa ngasilake asil sing padha utawa luwih apik kanthi biaya adoh luwih murah, yaiku kanthi nggunakake model sing luwih cilik, nyetel upaya nalar, lan milih arsitektur sing efisien.
Kita ora sabar ndeleng apa sing bakal sampeyan bangun!
- 2026
- Platform API
Babagan para panulis
Pandhuan iki disusun dening Samarth Madduru(mbukak ing jendhela anyar), Prashant Mital(mbukak ing jendhela anyar), Dave Leo(mbukak ing jendhela anyar), lan Julien Reiman(mbukak ing jendhela anyar), adhedhasar pengalamane makarya raket karo perusahaan rintisan sing mbangun nganggo GPT‑5.6, wiwit uji awal nganti produksi.


