Panduan pembangun untuk GPT‑5.6
Pengajaran teknikal daripada syarikat pemula dalam pengeluaran
Keluarga model GPT‑5.6 menjadikan prestasi ejen bertaraf perbatasan jauh lebih mampu milik, di samping memperluas batas perkara yang boleh dicapai.
Dalam panduan ini, kami menunjukkan cara syarikat pemula menggunakan pemilihan model yang lebih pintar dan kawalan API baharu untuk mengekalkan kesinambungan penaakulan, mengatur berbilang ejen dan membuat panggilan alat berprogram demi membina ejen yang lebih pantas dan berkeupayaan tinggi pada kos yang jauh lebih rendah.
Sejak GPT‑5, setiap generasi model berusaha menangani tugas berjangka lebih panjang dengan token yang lebih sedikit. GPT‑5.6 meneruskan kemajuan itu dengan prestasi ejen yang lebih kukuh dan kos yang lebih rendah, tanpa banyak perubahan pada harnes asas.
Peningkatan kecekapan kos keseluruhan diperkukuh lagi oleh ketepatan yang lebih tinggi pada tahap usaha penaakulan yang lebih rendah. Contohnya, dalam Agents’ Last Exam, GPT‑5.6 Sol dengan penaakulan “rendah” mengatasi GPT‑5.5 dengan penaakulan “tinggi” apabila harnes dikekalkan sama. Kami melihat kejayaan serupa dalam ujian pengeluaran, apabila syarikat pemula melaporkan penjimatan kos yang besar merentas pelbagai aliran kerja selepas mengurangkan usaha penaakulan daripada tetapan lalai sebelumnya.
Sebelum ini, menaik taraf kepada model terunggul dengan tahap penaakulan tertinggi merupakan pilihan terbaik bagi kes penggunaan berjangka panjang. Hal ini sebahagian besarnya kerana model tersebut jauh lebih berkeupayaan daripada model yang dioptimumkan untuk kos dalam mengendalikan konteks panjang dan panggilan alat. Keadaan ini berubah dengan keluarga 5.6: dengan lebih banyak pengiraan semasa ujian, Luna dan Terra sering dapat menyamai prestasi GPT‑5.4 dan 5.5 pada kos yang jauh lebih rendah.
Pertimbangkan tugas dalam BrowseComp, penanda aras berasaskan carian yang menguji keupayaan model mencari fakta yang sukar ditemui. Tiga bulan lalu, GPT‑5.5 (Sangat Tinggi) mencatat skor 84.36% dalam penanda aras ini dengan jumlah kos $33.27. Ketika dilancarkan, GPT‑5.6 Luna (Sangat Tinggi) memberikan prestasi yang hampir sama, dengan skor 84.04% pada kos $1.33. Sejak itu, kami telah menurunkan harga lagi. Ketahui lebih lanjut tentang penurunan harga terkini kami.
Model keluarga 5.6 yang lebih kecil amat sesuai untuk beban kerja bervolum tinggi, interaksi yang sensitif terhadap kependaman dan langkah berulang dalam aliran kerja berejen. Contohnya, jika anda mengendalikan syarikat pemula teknologi perundangan yang menghuraikan memo tulisan tangan sebelum analisis berejen, anda kini boleh menggunakan Terra atau Luna untuk pengekstrakan dan meraih penjimatan kos yang besar, dan bukannya menggunakan model perbatasan untuk keseluruhan kes penggunaan.
Selain meningkatkan prestasi sedia guna GPT‑5.6, kami turut memperkenalkan komponen asas baharu dalam Responses API untuk mencapai peningkatan selanjutnya. Kami melatih GPT‑5.6 secara menyeluruh dengan tiga penambahbaikan seni bina yang saling melengkapi agar ejen dapat beroperasi dengan lebih cekap:
- Gunakan semula kerja yang telah dilakukan: dengan membolehkan penaakulan dikekalkan(dibuka dalam tetingkap baru) antara giliran model dan menggunakan pemadatan natif(dibuka dalam tetingkap baru) untuk memampatkan perbualan yang panjang, model dapat mengekalkan kesinambungan kerjanya sepanjang tugas berjangka lebih panjang tanpa keliru atau perlu membina semula konteks terdahulu.
- Pecahkan kerja secara selari apabila sesuai: penggunaan pengaturan berbilang ejen secara natif(dibuka dalam tetingkap baru) membolehkan beberapa ejen diselaraskan merentas aliran kerja selari untuk menyiapkan tugas kompleks dengan lebih pantas.
- Pindahkan kerja deterministik ke dalam kod: gunakan panggilan alat berprogram(dibuka dalam tetingkap baru) untuk menapis, mengagregat dan mengatur output alat di luar tetingkap konteks model. Dengan itu, token model dikhususkan untuk pertimbangan, sambil mengurangkan kos, kependaman dan kemerosotan konteks.
Apabila digunakan bersama, perbezaannya boleh menjadi sangat ketara. Contohnya, dalam ARC-AGI-3, GPT‑5.6 Sol mencatat skor 13.3% dengan harnes standard. Namun, selepas penaakulan tersimpan dan pemadatan didayakan, skornya melonjak kepada 38.3% dengan penggunaan token output kira-kira 6× lebih sedikit. Model tidak berubah, tetapi prestasinya meningkat hampir tiga kali ganda. Anda boleh mengetahui lebih lanjut dalam penyelidikan harnes ARC-AGI-3 kami di sini.
Aliran kerja berejen lazimnya melibatkan dua jenis kerja:
- Tugas yang memerlukan pertimbangan
- Kerja yang sebahagian besarnya melibatkan pemindahan, penapisan dan penggabungan data
Apabila ejen mendapatkan 100 pemfailan, menapisnya mengikut tarikh dan mengenal pasti transaksi yang berkaitan, model tidak sepatutnya perlu menaakul setiap hasil perantaraan dalam tetingkap konteksnya. Panggilan Alat Berprogram membolehkan GPT‑5.6 menulis JavaScript untuk mengatur alat, menjalankan panggilan bebas secara selari dan memproses outputnya di luar tetingkap konteks. Dengan itu, model boleh menumpukan pada perkara yang memerlukan kecerdasan, iaitu membuat pertimbangan.
Bagi tugas kompleks yang boleh dilaksanakan secara selari, pengagihan tindakan dan penaakulan merentas beberapa aliran kerja ejen membolehkan tugas disiapkan dengan lebih pantas dan lebih bijak. Dalam persediaan ini, ejen utama bertanggungjawab mengatur subejen dan mengagihkan tugas kepada mereka. Subejen mencapai matlamat masing-masing secara selari, kemudian menyerahkan output kepada ejen utama untuk sintesis akhir. Pasukan boleh mula menggunakan keupayaan berbilang ejen secara natif dengan mendayakan berbilang ejen(dibuka dalam tetingkap baru) dalam Responses API. Beginilah juga tetapan keupayaan Ultra dalam ChatGPT berfungsi.
“Qualia mengendalikan pasukan ejen untuk menangani masalah penyelidikan terbuka, dan GPT‑5.6 Sol benar-benar serasi dengan keperluan kami. Prestasinya jauh lebih baik daripada GPT‑5.5, menyiapkan tugas lebih pantas daripada hampir semua model lain yang kami uji, dan segera menjadi model OpenAI pilihan kami.”
“GPT‑5.6 ialah pengatur terbaik daripada OpenAI yang pernah kami lihat. Kami memberikannya enam spesifikasi serentak—untuk ditulis, dibina dan dibincangkan—dan ia dapat menjejaki semuanya tanpa menjejaskan kualiti.”
Walaupun GPT‑5.6 dapat menentukan bilangan subejen yang sesuai dan masa untuk menciptanya dengan baik, tingkah laku berbilang ejen sangat mudah diarahkan. Arahan tentang masa model perlu memanggil subejen dapat meningkatkan kemungkinan ejen hanya dicipta apabila perbelanjaan token tambahan mampu menghasilkan prestasi yang lebih baik.
Bagi seluruh keluarga model, TTL cache prom telah dilanjutkan kepada sekurang-kurangnya 30 minit dan titik henti cache kini boleh ditetapkan secara deterministik dalam tetingkap konteks model. Ini membolehkan syarikat pemula meningkatkan kadar padanan cache dengan ketara.
Selain menetapkan titik henti cache, penggunaan berterusan prompt_cache_key(dibuka dalam tetingkap baru) yang sesuai meningkatkan kemungkinan permintaan dikendalikan oleh enjin inferens yang sebelum ini memproses awalan yang sama, sekali gus mengurangkan kependaman.
Perkara yang paling menyerlah dalam semua contoh ini ialah betapa banyaknya ekonomi pembangunan ejen telah berubah.
Kes penggunaan yang dahulunya memerlukan model perbatasan pada setiap langkah kini boleh mencapai hasil yang setanding atau lebih baik pada kos yang jauh lebih rendah dengan menggunakan model lebih kecil, melaraskan usaha penaakulan dan membuat pilihan seni bina yang cekap.
Kami tidak sabar untuk melihat hasil binaan anda semua!
- 2026
- Platform API
Perihal penulis
Panduan ini dibangunkan oleh Samarth Madduru(dibuka dalam tetingkap baru), Prashant Mital(dibuka dalam tetingkap baru), Dave Leo(dibuka dalam tetingkap baru) dan Julien Reiman(dibuka dalam tetingkap baru), berdasarkan pengalaman mereka bekerjasama rapat dengan syarikat pemula yang membangun menggunakan GPT‑5.6, daripada ujian awal hingga pengeluaran.


