Cara GPT‑5.6 menyatukan kecerdasan dengan kecekapan perbatasan
Kami mereka bentuk keluarga model GPT‑5.6 untuk mengimbangi keupayaan dan kos merentas pelbagai tugas yang dilaksanakan orang ramai menggunakan model kami. Model terunggul kami, GPT‑5.6 Sol, dengan penaakulan max mengatasi Claude Fable 5 dalam Artificial Analysis Coding Agent Index pada kos kurang daripada separuh. Terra menyamai prestasi GPT‑5.5 dalam penanda aras kecerdasan pada separuh harga, manakala Luna ialah model kami yang terpantas dan paling mampu milik, dengan harga 80% lebih rendah daripada kos Sol. Untuk mencapai kecekapan ini, pasukan penyelidikan dan teknikal kami telah melaksanakan pengoptimuman besar pada setiap lapisan utama tindanan kami. Penambahbaikan ini merangkumi model kami, inferens (cara kami menjalankan model untuk menjana output) dan harnes agentic kami, yang digunakan oleh Codex dan ChatGPT Kerja.
Sepanjang empat tahun lalu, apabila kami mengembangkan model kami kepada 1 bilion pengguna aktif dan lebih daripada 2 juta perniagaan, kecekapan menjadi teras usaha menyebarkan manfaat kecerdasan kepada semua orang. Misi kami adalah untuk memastikan kecerdasan am buatan memberi manfaat kepada seluruh umat manusia. Sepanjang tempoh ini, kami terus berusaha mencapai pengoptimuman yang lebih besar di seluruh tindanan agar dapat menawarkan model berprestasi terbaik pada setiap titik keluk kos-kecerdasan. Melalui GPT‑5.6, kami mencapai kecekapan kecerdasan bagi setiap token yang terbaik setakat ini; model ini dilatih untuk menyelesaikan lebih banyak kerja bagi setiap token. Semasa latihan, kami mengoptimumkan kejayaan tugas dan kecekapan, membentuk model agar mengambil laluan yang lebih langsung untuk menyelesaikan tugas.
Siaran ini melihat melangkaui model kami untuk menerangkan cara kami merancang demi kecekapan melalui kemajuan dalam dua bahagian utama tindanan yang lain, iaitu 1) inferens, dengan mengoptimumkan proses seperti pengimbangan beban, penyahkodan spekulatif, cache dan pengoptimuman kernel untuk memperoleh lebih banyak output daripada perkakasan yang sama; dan 2) harnes agentic kami, termasuk pengurusan pengembangan konteks, penggunaan alat dan kerja berulang yang lebih baik. Kami juga akan berkongsi peranan GPT‑5.6 Sol dalam mencapai beberapa peningkatan ini secara autonomi. Walaupun setiap penambahbaikan secara berasingan mungkin kelihatan terhad, manfaat ini terkumpul dan membolehkan kami mencapai perbatasan kecerdasan dan kecekapan.
Dalam dunia yang terbatas sumber pengiraan dan permintaan terhadap model yang berkembang lebih pantas daripada kapasiti, kecekapan menjadi teras setiap reka bentuk sistem. Hal ini khususnya benar bagi tindanan inferens kami, yang menjalankan model terlatih untuk menjana respons. Matlamat utama kami adalah untuk menyediakan lebih banyak token menggunakan perkakasan yang sama sambil mengekalkan kecerdasan, kependaman, ketersediaan dan kebolehpercayaan yang diharapkan oleh pengguna.
Pencapaian matlamat ini memerlukan pengoptimuman seluruh sistem. Sesuatu model boleh sangat cekap secara berasingan, namun masih mahal untuk disediakan jika permintaan diagihkan dengan lemah, perkakasan terbiar atau pergerakan data memperlahankan pengiraan. Penambahbaikan pada setiap lapisan terkumpul, dengan manfaat daripada pengoptimuman penghalaan (tempat permintaan dihantar), penjadualan (masa permintaan dihantar), kernel (perisian yang berjalan pada GPU), cache (kerja yang disimpan dan digunakan semula) dan pelaksanaan model (susunan kod GPU). GPT‑5.6 Sol dalam Codex memainkan peranan penting dalam semua pengoptimuman ini.
Contoh penting yang pertama ialah pengimbangan beban. Di peringkat global, kami menghalakan permintaan berdasarkan faktor seperti lokasi geografi, kapasiti yang tersedia dan jenis pemecut (jenis GPU atau cip khusus yang menjalankan model). Dalam sesebuah kelompok, kami mengagihkan kerja merentas tika model berdasarkan beban, panjang konteks, ketersediaan cache dan sifat permintaan yang lain. Dalam setiap tika, kerja kemudiannya perlu dibahagikan dengan cekap merentas pemecut, subrangkaian model dan teras pengkomputeran. GPT‑5.6 Sol dalam Codex membantu kami menganalisis trafik pengeluaran, mengenal pasti punca ketidakseimbangan yang terlepas pandang sebelum ini, menguji strategi penghalaan baharu dan menala heuristik ini secara berterusan. Penambahbaikan pengimbangan beban ini sahaja telah mengurangkan kos penyediaan model kami dengan ketara.
Kami juga menggunakan GPT‑5.6 Sol untuk mengoptimumkan laluan ke hadapan model: pengiraan yang mengubah input menjadi ramalan token seterusnya. Walaupun setiap operasi pantas, pergerakan memori dan penyegerakan yang berlebihan serta susun atur data yang tidak cekap boleh menyebabkan GPU terbiar. Untuk mengelakkan perkara ini, GPT‑5.6 Sol menemukan kerja yang boleh diprakira, dielakkan atau dilaksanakan secara selari. Dengan Codex, GPT‑5.6 Sol menulis semula dan mengoptimumkan kernel pengeluaran kami secara autonomi, iaitu kod teras yang melaksanakan operasi matematik yang membentuk model. Ini berjaya sebahagiannya kerana kami telah melatih GPT‑5.6 agar berkesan dalam menulis dan menambah baik kernel menggunakan Triton(dibuka dalam tetingkap baru) dan Gluon(dibuka dalam tetingkap baru), dua bahasa pengaturcaraan GPU sumber terbuka yang diselenggarakan oleh OpenAI. Usaha ini, bersama kemajuan kernel yang lebih luas daripada GPT‑5.6 Sol, mengurangkan kos penyediaan hujung ke hujung sebanyak 20%. Kami juga telah melabur besar dalam alat pengesahan, seperti alat sumber terbuka FpSan(dibuka dalam tetingkap baru) (Penyahjangkit Titik Apung), untuk membantu mengesahkan ketepatan kernel yang ditulis oleh GPT‑5.6 Sol.
Penyahkodan spekulatif ialah satu lagi kaedah untuk meningkatkan kelajuan dan kecekapan. Teknik ini menjalankan model draf yang lebih kecil (atau “penspekulasi”) bersama model utama untuk mencadangkan beberapa token yang boleh disahkan secara selari oleh model utama. Apabila cadangan tersebut diterima, sistem boleh menghasilkan berbilang token output daripada satu laluan model utama, sekali gus mengurangkan jumlah pengiraan berjujukan yang mahal. GPT‑5.6 Sol menambah baik model drafnya sendiri dengan mereka bentuk dan menjalankan ratusan eksperimen terhadap seni binanya serta menguji perubahan pada saiz, struktur dan ciri. Selain itu, GPT‑5.6 Sol melancarkan dan memantau proses latihan penspekulasi, lalu campur tangan secara autonomi apabila masalah timbul, termasuk kegagalan perkakasan dan ketidakstabilan latihan. Penambahbaikan yang terhasil meningkatkan kecekapan penjanaan token lebih daripada 15%.
Semasa memproses token input yang tidak dicache, model membina cache nilai kunci (KV) dalam satu laluan pengiraan intensif; semasa menjana output, model membaca daripada dan mengembangkan cache itu berulang kali. Konfigurasi penyediaan yang optimum, seperti pengelompokan, pembahagian dan pengurusan KV, amat bergantung pada beban kerja—panjang prom dan output, saiz kelompok, kadar cache berjaya, ciri pertanyaan dan banyak lagi. Namun, ruang konfigurasi sebelum ini terlalu besar untuk ditala secara sistematik, sehingga jurutera terpaksa bergantung pada heuristik umum. Dengan GPT‑5.6 Sol dalam Codex, kami dapat menganalisis beban kerja pengeluaran, menjana dan menilai konfigurasi calon serta mengoptimumkan secara terperinci konfigurasi enjin dan model bagi setiap senario. Ini menjadikan tahap baharu pengoptimuman khusus beban kerja praktikal, sekali gus memperoleh lebih banyak inferens berguna daripada perkakasan yang sama.
Pengoptimuman inferens ialah gelung maklum balas yang berterusan. Kami mengukur tingkah laku pengeluaran, mengenal pasti jurang terbesar, melaksanakan perubahan dan mengesahkan bahawa perubahan itu menambah baik seluruh sistem, bukannya sekadar penanda aras berasingan. GPT‑5.6 Sol dan Codex mempercepat setiap bahagian gelung itu. Ini bermakna pasukan kami dapat meneroka lebih banyak idea, bertindak balas dengan lebih pantas terhadap perubahan beban kerja dan membina tindanan inferens dengan kependaman lebih rendah, kapasiti lebih tinggi serta kos lebih rendah untuk pengguna.
ChatGPT Kerja dan Codex menyelesaikan tugasan rumit melalui beberapa siri permintaan model dan panggilan alat. Dalam satu giliran—daripada permintaan pengguna hingga respons akhir—Codex mungkin memeriksa kod sumber, mencari sejarah penggunaan, membaca laporan insiden, mengedit fail dan menjalankan ujian. Setiap langkah mungkin memerlukan satu permintaan.
Penyediaan konteks, penghantaran data, pelaksanaan inferens, panggilan alat dan permulaan proses semuanya memerlukan masa dan pengiraan. Jika sesuatu tugas memerlukan 30 permintaan model, satu saat tambahan bagi setiap permintaan akan terkumpul. Meningkatkan prestasi keseluruhan bermakna mengurangkan kerja berulang di seluruh sistem, bukan sekadar menjadikan model lebih pantas.
Satu giliran pengguna boleh merangkumi banyak lelaran model dan alat. Sebarang kos dalam rantau yang berulang boleh dibayar berkali-kali.
Kesan pengganda ini membentuk reka bentuk harnes agentic kami, iaitu lapisan pengorkestraan Rust yang menghubungkan model, alat dan persekitaran pengguna. Seterusnya, kami akan menerangkan cara mengelakkan pengembangan konteks, memuatkan alat dan menggunakan semula kerja dapat menjadikan setiap permintaan lebih cekap.
Apabila ejen diberi akses kepada lebih banyak alat, kemahiran, pemalam dan sejarah perbualan, tetingkap konteks boleh berkembang dengan mudah. Ini meningkatkan kos, mengganggu tumpuan model dan mencetuskan penaakulan yang tidak perlu. Harnes boleh mengurangkan overhed ini melalui penemuan tertunda, yang hanya menampilkan penyepaduan, alat MCP tersuai, kemahiran dan pemalam apabila diperlukan. Harnes juga menghalang alat dan penyepaduan MCP daripada menggunakan tetingkap konteks secara tidak dijangka. Output alat dihadkan kepada 10,000 token secara lalai melainkan model meminta had yang berbeza.
Seperti yang dinyatakan sebelum ini, gelung ejen boleh menghantar arahan, sejarah perbualan, definisi alat dan hasil terdahulu yang sama kepada GPU berkali-kali dalam satu giliran. Pemprosesan input berulang ini mahal, jadi cache prom menggunakan semula pengiraan yang dikaitkan dengan awalan prom yang telah diproses sebelum ini. Untuk mengekalkan awalan itu, harnes menganggap semua sejarah yang dapat dilihat oleh model sebagai tambah sahaja: mesej baharu, hasil alat dan kemas kini persekitaran ditambahkan pada penghujung, bukannya disisipkan ke dalam konteks terdahulu. Alat juga dipaparkan dalam susunan yang tetap, manakala tetapan masa jalan, seperti dasar kelulusan, digunakan semasa pelaksanaan dan bukannya dibenamkan dalam definisi alat. Pilihan reka bentuk ini menyumbang kepada kadar kejayaan keseluruhan cache prom yang tinggi bagi Codex dan ChatGPT Kerja.
Pengangkutan tambahan mengubah perkara yang merentasi rangkaian; cache prom mengubah perkara yang tidak perlu dikira semula oleh model. Lebar adalah dan lapisan pemampatan tambahan tidak dipaparkan.
Peningkatan kecekapan yang kami capai dengan GPT‑5.6 ialah hasil penambahbaikan terkumpul selama bertahun-tahun di seluruh tindanan, merangkumi penyelidikan, inferens dan harnes agentic kami. Peranan GPT‑5.6 dalam menghasilkan banyak penambahbaikan ini membuatkan kami optimis bahawa kadar pengoptimuman akan semakin pantas. Kami akan terus melaksanakan pengoptimuman yang lebih besar dalam bidang seperti pengoptimuman kernel, di samping penambahbaikan asas pada tindanan kami. Kami berharap dapat menyalurkan penambahbaikan dalaman yang berterusan ini kepada pengguna dan pelanggan kami dalam bentuk kecerdasan berkesan kos yang tersedia dengan lebih meluas.
Terima kasih khas kepada Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson dan Steve Coffey, Anggota Kakitangan Teknikal, atas sumbangan mereka kepada siaran ini.


