OpenAI

9 Julai 2026

ProdukSiaran

GPT‑5.6: Kecerdasan termaju yang berskala mengikut cita-cita anda

Lebih banyak kecerdasan daripada setiap token, prestasi yang lebih kukuh bagi setiap dolar dan lebih banyak keupayaan mengikut permintaan untuk kerja anda yang paling mencabar.

Memuat…

Kemas kini pada 30 Julai 2026: OpenAI telah mengurangkan harga GPT‑5.6 Luna sebanyak 80% dan GPT‑5.6 Terra sebanyak 20%. Ketahui lebih lanjut di sini.


Kami melancarkan keluarga model GPT‑5.6 untuk ketersediaan umum selepas pratonton terhad kami: model utama baharu kami, Sol, bersama-sama Terra, model yang seimbang untuk kerja harian dan Luna, model kami yang paling menjimatkan kos.

GPT‑5.6 Sol menetapkan standard baharu dalam kedua-dua kecerdasan dan kecekapan, mencapai hasil tercanggih merentas pengekodan, kerja pengetahuan, keselamatan siber dan sains sambil mengatasi model perbatasan terdahulu dan pesaing dengan token yang lebih sedikit serta pada anggaran kos yang lebih rendah. Hasilnya ialah prestasi yang lebih kukuh bagi setiap dolar: lebih banyak kerja yang berjaya dengan perbelanjaan yang sama atau hasil yang setanding pada jumlah kos yang lebih rendah. Kami juga memperkenalkan cara baharu untuk mempercepat kerja yang paling mencabar: ultra ialah tetapan berkeupayaan tertinggi kami, menyelaraskan berbilang ejen merentas aliran kerja selari untuk menyelesaikan tugasan kompleks dengan lebih pantas. Penggunaan komputer dan pertimbangan reka bentuk yang lebih kukuh menjadikan GPT‑5.6 Sol ialah kolaborator kami yang paling diperhalusi setakat ini, membantu memeriksa, memperhalusi dan menyampaikan hasil yang sedia digunakan.

Kami melatih GPT‑5.6 untuk mendapatkan lebih banyak kerja yang berguna daripada setiap token. Dalam Peperiksaan Terakhir Ejen(dibuka dalam tetingkap baru), iaitu penilaian aliran kerja profesional yang berjalan lama merentasi 55 bidang, GPT‑5.6 Sol mencatat paras tertinggi baharu 53.6, mengatasi Claude Fable 5 (penaakulan adaptif) sebanyak 13.1 mata. Walaupun pada tahap penaakulan sederhana, ia mengatasi Fable 5 sebanyak 11.4 mata pada kira-kira satu perempat daripada kos yang dianggarkan. Kecekapan itu turut merangkumi model yang lebih kecil, yang penting untuk menjadikan kecerdasan lebih meluas tersedia dan mampu milik: GPT‑5.6 Terra dan GPT‑5.6 Luna mengatasi Fable 5 pada kos sekitar satu per enam belas. Pada Indeks Kecerdasan Artificial Analysis(dibuka dalam tetingkap baru), ukuran kecerdasan yang luas merangkumi kerja agentik, pengekodan, penaakulan saintifik dan keupayaan umum, GPT‑5.6 Sol dengan penaakulan maksimum berada dalam jarak satu mata daripada Fable 5 sambil menyelesaikan tugasan dalam masa 61% lebih singkat pada kira-kira separuh daripada anggaran kos.

Peperiksaan Terakhir Ejen(dibuka dalam tetingkap baru): Aliran kerja agentik jangka panjang merentas domain profesional.

GPT‑5.6 dilancarkan dengan langkah perlindungan kami yang paling kukuh setakat ini, direka bentuk untuk berdaya tahan terhadap penyalahgunaan yang bertekad dan boleh suai tanpa mengehadkan kerja yang sah secara meluas. Sebelum ketersediaan umum, kami menjalankan tempoh penilaian paling menyeluruh setakat ini terhadap model-model dan langkah perlindungan, dengan menggabungkan proses penyerang manusia bersama ujian automatik berskala besar. Semasa pratonton, kami bekerjasama rapat dengan organisasi pakar serta rakan kongsi yang dipercayai untuk menguji ketahanan pertahanan dan memperkukuh langkah perlindungan sebelum pelancaran yang lebih meluas. Sistem yang terhasil melapiskan perlindungan yang dilatih ke dalam model dengan semakan masa nyata, pemantauan dan akses yang ditentukur mengikut tahap kepercayaan dan risiko.

Cekap secara lalai, prestasi maksimum apabila diperlukan

GPT‑5.6 Sol ialah model pengekodan terbaik kami setakat ini. Pada Indeks Ejen Pengekodan Analisis Buatan, GPT‑5.6 Sol dengan penaakulan maksimum menetapkan tahap tercanggih baharu pada 80, 2.8 mata lebih tinggi daripada Fable 5, sambil menggunakan kurang daripada separuh token output, mengambil kurang daripada separuh masa dan menelan kos kira-kira satu pertiga lebih rendah. Kelebihan itu meluas merentasi seluruh keluarga: Terra mengatasi sedikit Fable 5, manakala Luna mengatasi Opus 4.8; setiap satu melakukannya dalam kira-kira satu pertiga masa, dengan kira-kira separuh bilangan token output, dan pada sekitar satu perempat kos yang dianggarkan. Ia juga mencatat keputusan tercanggih baharu pada Terminal‑Bench 2.1 dan DeepSWE yang menguji aliran kerja baris perintah yang kompleks serta kejuruteraan jangka panjang dalam pangkalan kod sebenar.

Indeks Ejen Pengekodan Analysis Buatan: indeks bebas bagi prestasi ejen pengekodan merentas pelaksanaan, penggunaan terminal dan pangkalan kod sebenar.

GPT‑5.6 boleh menulis dan menjalankan program ringan yang menyelaraskan alat, memproses hasil perantaraan, memantau kemajuan dan memilih tindakan seterusnya semasa kerja berlangsung. Ini membolehkan tugas yang banyak menggunakan alat diteruskan dengan lebih sedikit token, lebih sedikit pusingan ulang-alik model dan kurang panduan. Daripada memerlukan pembangun menulis skrip untuk setiap langkah atau menghantar setiap respons alat kembali melalui model, Programmatic Tool Calling(dibuka dalam tetingkap baru) dalam Responses API boleh menapis sejumlah besar data perantaraan, mengekalkan hanya perkara yang penting dan menyesuaikan aliran kerjanya sepanjang proses.

Untuk masalah yang memberikan ganjaran kepada pelaburan masa dan kuasa pengkomputeran yang lebih besar, GPT‑5.6 boleh melangkaui tetapan lalai yang cekap ini. max memberikan GPT‑5.6 lebih banyak masa berbanding xhigh untuk menaakul dan meneroka alternatif, menjalankan semakan, serta menyemak semula pendekatannya. ultra melangkah lebih jauh dengan menyelaraskan empat ejen secara selari secara lalai, mengimbangi penggunaan token yang lebih tinggi dengan hasil yang lebih kukuh dan masa untuk mendapatkan hasil yang lebih pantas bagi tugasan yang mencabar. Carta di bawah membandingkan persediaan lalai empat ejen Ultra dengan garis dasar 1 ejen merentas BrowseComp, SEC-Bench Pro dan Terminal-Bench 2.1; BrowseComp dan SEC-Bench Pro juga menunjukkan konfigurasi 16 ejen. Merentas ketiga-tiga penilaian, penambahan ejen selari mengalihkan perbatasan skor-kependaman ke atas dan ke kiri, mencapai hasil yang lebih kukuh dalam masa yang lebih singkat. Dalam API, pembangun boleh membina pengalaman seperti ultra menggunakan beta berbilang ejen(dibuka dalam tetingkap baru) dalam Responses API. 4, 5, 6

1 daripada 11
GPT‑5.6 ialah salah satu model paling kukuh yang telah kami uji pada CursorBench, memberikan keputusan yang mantap dalam penilaian awal. Ini merupakan langkah maju yang mengujakan untuk pembangun dari segi ketahanan, kecerdasan dan kecekapan keseluruhan. Kami tidak sabar untuk membawakan model ini kepada pengguna Cursor kami.
—Oskar Schulz, Presiden di Cursor

Lonjakan ke hadapan dalam reka bentuk

GPT‑5.6 memberikan perubahan besar dalam penilaian reka bentuk. Dengan hanya arahan tahap tinggi, GPT‑5.6 menghasilkan antara muka yang bercita rasa tinggi, ergonomik dan berfungsi. Keupayaannya menggunakan komputer yang lebih mantap membolehkannya meneliti dan memperhalus hasil yang dirender—bukan sekadar menjana kod atau kandungan yang mendasarinya—supaya ia dapat mengesan isu visual dan fungsi serta menerapkan sentuhan akhir sebelum menyerahkan semula kerja tersebut.

Prom: Bolehkah anda melaksanakan permainan pelayaran 3D untuk saya? Untuk apa sahaja yang memerlukan bitmap/tekstur/sprite (atau jika rujukan mockup membantu untuk mana-mana model 3D yang anda bina), anda bebas menggunakan imagegen.

Keupayaan antara muka hadapan GPT‑5.6 juga mengubah permintaan dalam bahasa semula jadi kepada penerangan dan visualisasi yang kemas serta interaktif dalam ChatGPT Kerja.

prom: Cipta spirograf interaktif untuk menerangkan cara ia berfungsi.

Kerja berasaskan pengetahuan hujung ke hujung

GPT‑5.6 memberikan hasil yang lebih baik untuk tugasan profesional. GPT‑5.6 mengambil konteks yang tidak tersusun daripada dokumen dan aliran kerja harian anda seperti Slack, Notion, Microsoft 365 dan Google Drive, lalu menukar semuanya menjadi artifak bertaraf pakar yang boleh dikongsi.

Kekuatan GPT‑5.6 dalam kerja berasaskan pengetahuan terserlah dalam penilaian yang merangkumi analisis profesional jangka panjang, penyemakan imbas, penggunaan alat dan penggunaan komputer. GPT‑5.6 Sol mencatat keputusan tercanggih baharu pada BrowseComp dengan 92.2% dan OSWorld 2.0 dengan 62.6%; pada OSWorld, GPT‑5.6 Sol mengatasi Opus 4.8, menggunakan 85% kurang token output. Di sini, peningkatan prestasi bagi setiap dolar meliputi seluruh keluarga GPT‑5.6. Luna hampir menyamai prestasi puncak GPT‑5.5 dengan kurang daripada separuh kos yang dianggarkan, manakala Terra mengatasi prestasi itu dengan kos yang lebih rendah.

BrowseComp: GPT‑5.6 Sol mencapai tahap tercanggih baharu pada BrowseComp, yang terdiri daripada tugasan penyemakan imbas agentik.

GPT‑5.6 Sol meningkatkan kualiti dalam pembentangan, dokumen dan hamparan, menghasilkan output yang lebih kemas dan tepat. GPT‑5.6 Sol mampu membuat pembentangan yang boleh diedit sepenuhnya dari awal, menukar prom dan bahan sumber menjadi naratif visual yang koheren dengan reka letak, hierarki dan reka bentuk yang mantap.

Peningkatan ini amat ketara apabila mengikut templat dan dek rujukan. GPT‑5.6 boleh menyimpulkan sistem reka bentuk dek pembentangan—reka letak, tipografi, jarak, warna dan pola kandungan berulang, termasuk peraturan yang dibenamkan dalam Induk Slaid—serta menerapkan konvensyen tersebut secara konsisten pada bahan baharu. Dalam contoh ini, apabila diminta untuk mengemas kini nombor berdasarkan fail rujukan, output GPT‑5.5 tertinggal komponen penting daripada slaid induk, manakala GPT‑5.6 mengikuti struktur rujukan dengan lebih tepat.

Fail rujukan
Slaid input untuk pemadanan gaya GPT-5.6
Output GPT‑5.5
Slaid output GPT-5.5 untuk pemadanan gaya

GPT‑5.5 tiada komponen utama pada slaid induk

Output GPT‑5.6
Slaid output GPT-5.6 untuk pemadanan gaya

GPT‑5.6 juga menghasilkan dokumen dan hamparan yang lebih kemas dari segi visual. Ia mematuhi format rujukan yang kompleks dengan lebih tepat, yang penting untuk aktiviti kerja berasaskan pengetahuan yang boleh diulang. Ia mengendalikan persamaan dan model kewangan dengan ketepatan yang lebih tinggi, serta menggunakan tipografi, jarak, hierarki, dan reka letak halaman atau lembaran kerja dengan lebih baik.

Pelanggan awal yang menguji GPT‑5.6 melihat peningkatan dalam output kerja berpengetahuan merentas domain.

1 daripada 9
GPT‑5.6 amat cekap dalam mengendalikan aliran kerja yang panjang dan kompleks yang mendasari pembangunan aplikasi bertaraf produksi. Sebagai salah satu model yang kini digunakan oleh Lovable, model ini memberikan hasil kepada pengguna dengan kira-kira 25% lebih sedikit langkah dan 35–48% lebih sedikit panggilan alat berbanding model sebelumnya, sambil meningkatkan kejayaan projek dan mengurangkan larian tersekat sebanyak 15%. Itu satu perbezaan yang bermakna bagi sesiapa sahaja yang cuba beralih dari idea kepada aplikasi yang berfungsi.
—Fabian Hedin, Pengasas Bersama di Lovable

Meneroka perbatasan baharu dalam siber dan sains

GPT‑5.6 ialah model keselamatan siber kami yang paling kuat setakat ini, mencapai prestasi perbatasan dengan token yang jauh lebih sedikit. Pada ExploitBench2, yang mengukur kemajuan daripada mencapai kod rentan hingga pelaksanaan kod arbitrari, ia mencatat skor 73.5% berbanding skor GPT‑5.5 47.9% pada peruntukan token output yang setanding. Pada ExploitGym3, yang meminta ejen menukar kerentanan dunia sebenar menjadi eksploit yang berfungsi, ia hampir menggandakan pencapaian GPT‑5.5 kadar kelulusan puncak, daripada 15.1% kepada 24.9% di bawah had maksimum dua jam; dengan enam jam, ia mencapai 33.7%. Pada SEC-Bench Pro, yang menguji penjanaan bukti konsep pada perisian kompleks, ia mencatat skor 71.2% berbanding GPT‑5.5 45.8% pada latensi yang lebih baik. 1

GPT‑5.6 menyokong tugas pertahanan penting seperti semakan keselamatan kod, penampalan, pemodelan ancaman dan pertahanan biru. Individu dan organisasi yang layak dalam program OpenAI Daybreak’s Trusted Access for Cyber boleh mengakses lebih banyak keupayaan pertahanannya melalui perlindungan yang lebih tepat untuk kerja yang disahkan dalam persekitaran yang dibenarkan, termasuk penapisan dan pengesahan kerentanan, analisis perisian hasad, kejuruteraan pengesanan dan pengesahan tampalan.

Individu boleh mengesahkan identiti mereka dan memohon akses yang dipercayai(dibuka dalam tetingkap baru) dan organisasi boleh memohon untuk pasukan mereka. Ahli individu perlu mengaktifkan Keselamatan Akaun Lanjutan(dibuka dalam tetingkap baru) dengan kunci laluan yang disokong perkakasan menjelang 1 September untuk mengekalkan akses kepada model perbatasan kami yang paling berkemampuan siber; mereka yang tidak berbuat demikian akan kembali kepada akses lalai. Pengguna yang belum mempunyai kunci laluan yang disokong perkakasan boleh menerima harga istimewa(dibuka dalam tetingkap baru) daripada rakan kongsi kami, Yubico. Kami juga mengambil langkah-langkah tambahan untuk mengehadkan akses kepada entiti berisiko tinggi dan di bidang kuasa berisiko tinggi.

ExploitBench: Membina eksploit V8 yang semakin berkeupayaan; GPT‑5.6 menunjukkan peningkatan besar berbanding GPT‑5.5. Carta kependaman tidak ditunjukkan kerana anggaran kependaman tidak boleh dipercayai untuk penanda aras ini.

GPT‑5.6 Sol juga menunjukkan peningkatan yang meluas dalam penyelidikan saintifik. Dalam penilaian sains hayat, GPT‑5.6 menunjukkan peningkatan Pareto berbanding GPT‑5.5 dalam biologi dunia sebenar, aliran kerja penyelidikan sains hayat dan kimia.

GeneBench Pro: Analisis genomik jangka panjang dan biologi kuantitatif; GPT‑5.6 mencapai hasil yang lebih mantap dengan penggunaan token yang kurang dan masa yang lebih singkat. Claude Fable 5 tidak disertakan kerana tidak menjawab(dibuka dalam tetingkap baru) soalan biologi lanjutan dan menolak majoriti soalan dalam penilaian ini.

GPT‑5.6 mempercepatkan OpenAI

GPT‑5.6 ialah model paling berkeupayaan kami setakat ini untuk mempercepat penyelidikan AI. Di OpenAI, para penyelidik menggunakannya merentasi kitaran pembangunan: mendiagnosis kegagalan, mengoptimumkan sistem latihan, menjalankan eksperimen dan mentafsir hasil. Kami sudah melihat pecutan dan penerimagunaan yang lebih kukuh semasa tempoh ujian dalaman GPT‑5.6, memandangkan purata token output harian bagi setiap penyelidik aktif adalah lebih daripada dua kali ganda tahap tertinggi yang diperhatikan untuk GPT‑5.5.

Cara kerja sebegini semakin cepat menjadi amalan standard. Sepanjang enam bulan yang lalu, bahagian komputasi penyelidikan yang diperuntukkan kepada inferens pengekodan dalaman meningkat 100 kali ganda, manakala penggunaan token agentik dalaman meningkat kira-kira 22 kali ganda. Metrik penggunaan ini tidak dengan sendirinya mengukur kemajuan penyelidikan, tetapi metrik ini menunjukkan betapa pantasnya bantuan AI semakin meningkat untuk penyelidikan dan merentasi pasukan lain seperti jualan, pemasaran, operasi pengguna, kewangan dan banyak lagi.

Untuk mengukur keupayaan ini secara langsung, kami membangunkan set penilaian dalaman berdasarkan tugasan penyelidikan AI sebenar, termasuk menyahpepijat sistem penyelidikan, mengoptimumkan kernel dan resipi latihan, menjalankan eksperimen pembelajaran mesin, serta menambah baik model lain.

Keupayaan RSI agregat: Dalam satu kumpulan penilaian yang mengukur kemajuan ke arah penambahbaikan kendiri rekursif, kami mendapati GPT‑5.6 Sol menunjukkan peningkatan sebanyak 16.2 mata berbanding GPT‑5.5, mempercepat penyelidikan dalaman secara menyeluruh.

Meningkatkan keselamatan dan sekuriti seiring dengan keupayaan 

Seiring dengan peningkatan keupayaan model, kami memperkukuh tindanan keselamatan kami supaya kecerdasan lanjutan dapat terus berguna secara meluas sambil mengenakan penelitian yang lebih ketat terhadap penggunaan yang berisiko paling tinggi. Untuk GPT‑5.6, kami membina sistem keselamatan kami yang paling teguh setakat ini, ditentukur mengikut keupayaan setiap model dan dikuasakan oleh lebih banyak kuasa pengkomputeran berbanding sebelum ini.

Model GPT‑5.6 lebih berkeupayaan berbanding model terdahulu kami dalam kedua-dua bidang biologi dan keselamatan siber, tetapi tidak melepasi ambang kritikal dalam mana-mana kategori tersebut. Dalam keselamatan siber, ujian kami menunjukkan GPT‑5.6 lebih baik dalam mencari dan membaiki kerentanan berbanding melaksanakan serangan autonomi hujung-ke-hujung dengan boleh dipercayai terhadap sasaran yang telah diperkukuh—memberikan peluang kepada pihak pertahanan untuk mengukuhkan sistem sebelum kelemahan dieksploitasi. Dalam bidang biologi, ujian kami menunjukkan GPT‑5.6 boleh menyokong penyelidikan yang sah tetapi tidak menyediakan keupayaan menyeluruh dari awal hingga akhir yang diperlukan untuk mencipta, mereka bentuk atau mensintesis ancaman baharu yang amat berbahaya.

Kedua-dua domain tersebut secara semula jadi bersifat dwiguna. Dalam keselamatan siber, keupayaan yang sama yang boleh membantu penyerang mengeksploitasi kelemahan juga boleh membantu pihak bertahan mencarinya, menghasilkan semula kelemahan itu dan membina pembaikan yang boleh dipercayai. Oleh itu, penyekatan berlebihan menimbulkan risiko keselamatan tersendiri. Perkara ini boleh menghalang pihak pertahanan daripada menguji sistem dan melaksanakan tampalan, sementara pelaku berniat jahat terus menggunakan model lain, termasuk model sumber terbuka yang semakin berkeupayaan tinggi, serta alat yang sudah mantap. Langkah perlindungan yang berkesan mengambil kira konteks dan kemungkinan akibat sesuatu permintaan, sambil mengekalkan kerja pertahanan yang sah dan pada masa yang sama mengenakan kawalan yang lebih ketat apabila bukti menunjukkan risiko kemudaratan yang serius.

Perlindungan keselamatan GPT‑5.6 adalah berlapis untuk ketepatan dan kelewahan yang lebih tinggi, serta direka bentuk untuk menyesuaikan diri dengan cepat apabila serangan baharu muncul. Perlindungan yang dilatih ke dalam model berfungsi seiring dengan semakan masa nyata, pemantauan berterusan dan penguatkuasaan peringkat akaun, untuk membantu sistem kekal selamat walaupun apabila lapisan tertentu tidak berfungsi seperti yang dimaksudkan. Dalam banyak sistem, tanda pengelas sahaja menentukan perkara yang perlu disekat, dengan bergantung pada model berkecerdasan lebih rendah yang lebih sukar diubah bagi mencegah kemudaratan. Pendekatan kami menambahkan pemantau penaakulan yang menyemak perbualan untuk menentukan sama ada terdapat potensi kemudaratan. Reka bentuk ini bertujuan untuk membolehkan kerja defensif sambil menyekat penyalahgunaan serius, dengan keupayaan yang paling sensitif dikhaskan untuk pengguna yang disahkan melalui Trusted Access. Oleh sebab sesetengah perlindungan menggunakan penaakulan masa ujian, kami boleh mengemas kini dengan pantas untuk menutup jurang tanpa melatih semula pengelas dari awal.

Kami mengambil pendekatan yang lebih berhati-hati sambil kami terus memperkukuh sistem terhadap serangan adaptif. Berbanding dengan model sebelumnya, GPT‑5.6 Perlindungan siber Sol kami menyekat kira-kira sepuluh kali lebih banyak aktiviti yang berpotensi membahayakan. Oleh sebab langkah-langkah ini boleh menimbulkan geseran bagi penggunaan yang tidak berbahaya, kami menyediakan pilihan dalam ChatGPT dan Codex untuk mencuba semula prom dengan mudah pada model berkeupayaan lebih rendah dan kami akan terus mengurangkan kesan perlindungan kami terhadap penggunaan yang tidak berbahaya sambil mengekalkan standard keteguhan yang tinggi. Ini mencerminkan pendekatan pelaksanaan secara berulang kami: bermula secara berhati-hati dan menambah baik berdasarkan apa yang kami pelajari daripada penggunaan dunia sebenar.

Sebelum ketersediaan umum, kami menjalankan penilaian keselamatan paling intensif kami setakat ini, termasuk proses penyerang yang meluas, ujian keupayaan dan perlindungan yang mantap bersama pakar luar, serta kira-kira 700,000 jam setara GPU NVIDIA A100 Tensor Core bagi proses penyerang automatik kotak hitam. Ini membolehkan kami menguji titik lemah yang berkemungkinan secara sistematik, mendedahkan jailbreak dan membantu kami memperkukuh sistem sebelum pelancaran.

Keselamatan yang sempurna itu tidak wujud dan usaha kami untuk memastikan keselamatan model yang semakin berkeupayaan akan diteruskan. Kelemahan baharu akan ditemui, begitu juga jailbreak baharu yang memintas langkah perlindungan sedia ada. Setiap generasi baharu model juga akan membuka ruang baharu bagi serangan dan penyalahgunaan. Kami membina bagi menghadapi realiti tersebut melalui perlindungan berlapis, pemantauan berterusan, pemulihan pantas dan kerjasama merentas komuniti pertahanan. Untuk GPT‑5.6, kami telah menggabungkan program ganjaran pepijat keselamatan kami yang sedia ada(dibuka dalam tetingkap baru) dan program ganjaran pepijat biologi dengan proses pemulihan pantas yang baharu serta usaha pemantauan kami yang paling kukuh setakat ini. Dapatan daripada penyelidik, pemantauan dan penyalahgunaan dalam dunia sebenar akan digunakan untuk memaklumkan penilaian baharu dan langkah perlindungan yang lebih kukuh secara berterusan.

Baca lebih lanjut tentang langkah perlindungan kami dalam kad sistem GPT‑5.6 yang dikemas kini(dibuka dalam tetingkap baru).

Ketersediaan dan harga

GPT‑5.6 merangkumi tiga peringkat model: Sol, model unggulan kami; Terra, model dengan kos lebih rendah yang mempunyai prestasi kompetitif dengan GPT‑5.5; dan Luna, model terpantas dan paling mampu milik kami. Nombor tersebut mengenal pasti generasi, manakala Sol, Terra dan Luna ialah peringkat keupayaan yang berkekalan yang boleh berkembang mengikut kadar masing-masing.

GPT‑5.6 tersedia mulai hari ini di seluruh ChatGPT, Codex dan OpenAI API. Pelancaran sedang bermula secara global sekarang dan akan diteruskan secara beransur-ansur ke arah ketersediaan penuh dalam tempoh 24 jam akan datang.

  • Sembang: Pengguna Plus, Pro, Business dan Enterprise mendapat akses kepada GPT‑5.6 Sol melalui tetapan usaha sederhana dan lebih tinggi. Pengguna Pro dan Enterprise juga boleh memilih GPT‑5.6 Sol Pro untuk mendapatkan hasil berkualiti tertinggi bagi tugasan yang kompleks.
  • ChatGPT Kerja dan Codex: Pengguna Free dan Go mendapat akses kepada GPT‑5.6 Terra. Pengguna ChatGPT Plus, ChatGPT Pro, Business dan Enterprise boleh memilih antara GPT‑5.6 Sol, Terra dan Luna dan tetapkan tahap usaha untuk setiap satu. max tersedia untuk semua pengguna yang mempunyai akses kepada GPT‑5.6 dalam ChatGPT Kerja dan Codex dan boleh didayakan dalam tetapan. Dalam ChatGPT Kerja, ultra tersedia kepada pengguna Pro dan Enterprise. Dalam Codex, ia tersedia untuk pelan Plus dan yang lebih tinggi.
  • API: Pembangun boleh mengakses Sol, Terra dan Luna melalui OpenAI API. Dalam Responses API, pemanggilan alat secara programatik membolehkan GPT‑5.6 menulis dan menjalankan program dalam memori yang menyelaraskan alat serta memproses hasil perantaraan, menjadikannya serasi dengan Pengekalan Data Sifar (ZDR). Multi-ejen, yang pada mulanya tersedia dalam versi beta, membolehkan GPT‑5.6 menjalankan subejen serentak dan mensintesiskan hasil kerja mereka dalam satu permintaan.

GPT‑5.6 ditetapkan harga bagi setiap 1 juta token merentas tiga saiz model: Sol ialah $5 input / $30 output; Terra ialah $2.50 input / $15 output; dan Luna ialah $1 input / $6 output. GPT‑5.6 turut memperkenalkan caching gesaan yang lebih boleh diramal, termasuk sokongan untuk titik henti cache eksplisit(dibuka dalam tetingkap baru) dan hayat cache minimum 30 minit. Untuk GPT‑5.6 dan model yang lebih baharu, penulisan cache dicaj pada 1.25x kadar input tanpa cache bagi model tersebut, manakala bacaan cache terus menerima diskaun 90% untuk input cache.

7, 8

Profesional

EvalGPT‑5.6 SolGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash
Peperiksaan akhir ejen52.7%50.4%50.3%46.9%40.5%45.2%32.1%
GDPval-AA v21,747.8 Elo1,593 Elo1,591.8 Elo1,493.7 Elo1,759.6 Elo1,600.1 Elo962.3 Elo1,348.8 Elo
Tugas Perundingan Pengurusan (Dalaman)43.2%37.2%35.4%31.3%35.5%31.6%13.2%
Penanda Aras Kewangan Besar53%51%36%49%44%
Indeks Kecerdasan Artificial Analysis v4.158.9 Skor indeks 55 skor indeks 51.2 Skor indeks 54.8 Skor indeks 59.9 Skor indeks 55.7 Skor indeks 46.5 Skor indeks 50.2 Skor indeks

Pengekodan

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
Artificial Analysis Coding Agent Index v1.180 Skor indeks77.4 Skor indeks74.6 Skor indeks76.4 Skor indeks77.2 Skor indeks72.5 Skor indeks42.7 Skor indeks
SWE-Bench Pro64.6%63.4%62.7%59.4%80.3%77.8%80%69.2%54.2%
DeepSWE v1.172.7%69.6%67.2%67%69.7%59%11.8%
Terminal-Bench 2.188.8%91.9%87.4%84.7%85.6%88%83.1%78.9%70.7%

Keselamatan

PenilaianGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5GPT‑5.4Claude Opus 4.8Claude Mythos 5Pratonton Claude Mythos
Healthbench Professional60.5%57.7%55.7%51.8%48.1%52.6%66%64.7%

Penggunaan komputer

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8Gemini 3.1 Pro Preview
OSWorld 2.062.6%50.2%45.6%47.5%54.8%
BrowseComp90.4%92.2%87.5%83.3%84.4%88%87.9%84.3%85.9%
BenchCAD70.6%62.3%63.1%44.4%38.4%35.5%27.3%
BenchCAD (alat Python)83.4%78.2%73.9%55.8%65%61%51.8%

Keselamatan siber

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PratontonClaude Opus 4.8
Cabaran Tangkap Bendera96.7%91.8%85.2%88.1%
SEC-Bench Pro71.2%74.3%57.7%48.9%45.8%
ExploitBench73.5%52.9%33.2%47.9%78%74.2%40%
ExploitGym33.7%23.2%12.4%15.1%

Penambahbaikan kendiri

Eval GPT‑5.6 sol GPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5
Penilaian Penyahpepijatan Penyelidikan Dalaman68.3%67.8%50.8%50%
KernelGen 1P61.1%49.2%22.4%29.3%
NanoGPT9.69%14.5%1.66%2.65%
PostTrainBench Lite50.3%51.5%29.6%38.8%
Indeks RSI57.9%56.3%41.9%41.7%

Multimodal

Eval GPT‑5.6 sol GPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
MMMU Pro (tiada alat)83%80.7%78.4%81.2%80.5%
MMMU Pro (dengan alat)84.6%82%79.5%83.2%
gdp.pdf30.7%24.7%22.7%26%29.8%22.5%16.7%

Akademik

EvalGPT‑5.6 SolGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
GPQA Diamond94.6%92.9%92.3%93.6%94.1%94.6%92.6%92%94.3%
FrontierMath Peringkat 1-3 (v2)89%84.9%78.6%85.3%87%80%59.6%
FrontierMath Peringkat 4 (v2)83%68.3%58.5%72.5%87.8%56.1%

Penggunaan alat

Eval GPT‑5.6 sol GPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash
AutomationBench18.1%15.2%14.9%12.9%17.4%15.5%14.5%
Toolathlon58%53.1%53.4%55.6%61.7%61.1%61.7%59.9%48.8%

Konteks panjang

EvalGPT‑5.6 SolGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8
OpenAI MRCR v2 8-jarum 256K–512K91.5%89.6%41.3%81.5%
OpenAI MRCR v2 8 jarum 512K–1M73.8%72.5%41.3%74%
GraphWalks BFS 256K f190.7%76.9%81.3%73.7%91.1%85.7%85.9%
GraphWalks BFS 1 juta f177.1%71.2%51.2%45.4%79.4%74.3%68.1%

Penaakulan abstrak

EvalGPT‑5.6 SolGPT‑5.6 Terra GPT‑5.6 LunaGPT‑5.5Claude Opus 4.8Gemini 3.1 Pro Preview
ARC-AGI-3⁷7.78%0.8%0.18%0.43%1.5%0.42%

Penulis

OpenAI

Nota kaki

  1. 1

    Keupayaan siber dinilai dengan langkah perlindungan yang dikurangkan. Pengguna boleh menyertai Program Trusted Access for Cyber OpenAI Daybreak untuk mendapatkan akses yang lebih luas kepada keupayaan siber pertahanan.

  2. 2

    Semua model dinilai menggunakan harnes API ExploitBench dengan 5 seed dan kesinambungan penaakulan.

  3. 3

    Kami menjalankan ExploitGym pada API alfa kami, yang menghasilkan respons lebih pantas daripada API awam kami, kemudian menskalakan semula untuk dipadankan dengan API awam kami. Apabila menskalakan semula kependaman kepada kelajuan yang dijangkakan untuk API awam kami, ini menyebabkan sesetengah anggaran kependaman melebihi had masa dua jam dan enam jam, walaupun had tersebut dipatuhi dengan betul dalam larian penilaian. Untuk mendapatkan kelajuan yang lebih pantas bagi kerja yang sensitif masa, kami menawarkan pemprosesan keutamaan dalam API dan mod pantas dalam Codex.

  4. 4

    Kami menganggarkan kependaman dan kos API dengan melihat tingkah laku pengeluaran model kami dan melakukan simulasi secara luar talian. Anggaran ini mengambil kira butiran panggilan alat, token yang disampel dan token input. Keputusan dunia sebenar mungkin berbeza dengan ketara dan bergantung pada banyak faktor yang tidak ditangkap dalam simulasi kami. Kami mensimulasikan latensi pada kelajuan API yang pantas dan kos pada harga API biasa.

  5. 5

    Model tanpa token output, kependaman atau kos yang dilaporkan dipaparkan sebagai garisan bertitik mendatar.

  6. 6

    Untuk berbilang ejen, latensi diperoleh daripada ejen akar, manakala jumlah token output dan kos API merangkumi semua token. Ultra dijalankan dengan 4 ejen.

  7. 7

    Kami mengira skor menggunakan pendekatan pemarkahan rasmi yang diterangkan dalam kertas kerja HealthBench Professional, yang tidak boleh dibandingkan dengan keputusan yang dilaporkan dalam kad sistem Anthropic.

  8. 8

    ARC-AGI-3 untuk Opus 4.8 dijalankan pada usaha penaakulan tinggi dan bukan maksimum, kerana ini ialah satu-satunya keputusan ARC-AGI-3 yang diterbitkan.