Langkau ke kandungan utama
OpenAI

26 Jun 2026

ProdukSiaran

Pratonton GPT‑5.6 Sol: model generasi seterusnya

Memuat…

Kami memulakan pratonton terhad siri GPT‑5.6: Sol, model utama kami; Terra, model seimbang untuk kerja harian; dan Luna, model yang pantas dan mampu milik. Terra mempunyai prestasi yang berdaya saing dengan GPT‑5.5 sambil 2x lebih murah, manakala Luna membawa keupayaan kukuh pada kos terendah kami.

GPT‑5.6 Sol dilancarkan dengan tindanan keselamatan kami yang paling kukuh setakat ini. Kami mengukuhkan perlindungan untuk aktiviti berisiko lebih tinggi, permintaan siber sensitif dan penyalahgunaan berulang, serta menghabiskan beberapa minggu mencari kelemahan, menguji tekanan sistem kami dan memperkukuhnya terhadap serangan dunia sebenar.

Kami percaya pada akses yang luas, dan kami merancang untuk menjadikan GPT‑5.6 Sol, Terra dan Luna tersedia secara umum dalam minggu-minggu akan datang. Sebagai sebahagian daripada penglibatan berterusan kami dengan kerajaan A.S., kami telah mempratonton rancangan kami dan keupayaan model sebelum pelancaran hari ini. Atas permintaan mereka, kami bermula dengan pratonton terhad untuk sekumpulan kecil rakan kongsi dipercayai yang penyertaannya telah dikongsi dengan kerajaan, sebelum dilancarkan dengan lebih meluas. Sepanjang pratonton ini, kami akan terus menguji dan berkoordinasi rapat dengan rakan kongsi sambil kami berusaha ke arah ketersediaan yang lebih luas. Kami tidak percaya proses akses kerajaan seperti ini patut menjadi kelaziman jangka panjang. Ia menghalang pengguna, pembangun, perusahaan, pembela siber dan rakan kongsi global yang memerlukannya daripada menggunakan alat terbaik. Kami mengambil langkah jangka pendek ini kerana kami percaya ia merupakan laluan paling kukuh kepada ketersediaan yang lebih luas dalam minggu-minggu akan datang, sambil kami bekerjasama dengan Pentadbiran untuk membangunkan rangka kerja Perintah Eksekutif siber dan proses yang boleh diulang bagi keluaran model masa hadapan.

Keupayaan

GPT‑5.6 Sol ialah model terkuat kami setakat ini. Untuk memberikan pratonton prestasi model, kami berkongsi satu set penilaian yang menonjolkan keupayaan agentic yang bertambah baik dalam pengekodan, biologi dan keselamatan siber, dengan penilaian keselamatan dan kesediaan tambahan tersedia dalam kad sistem(dibuka dalam tetingkap baru) kami. Kami akan berkongsi suite hasil penilaian yang diperluas apabila kami menjadikan model ini tersedia secara meluas.

Dengan GPT‑5.6, kami memperkenalkan usaha penaakulan `maks` baharu untuk memberi Sol masa paling banyak untuk menaakul secara mendalam. Selain itu, kami memperkenalkan mod `ultra` baharu yang melangkaui keupayaan satu ejen dengan memanfaatkan subejen untuk mempercepat kerja yang kompleks.

Untuk aliran kerja pengekodan, GPT‑5.6 Sol menetapkan tahap kecanggihan baharu pada Terminal‑Bench 2.1, yang menguji aliran kerja baris perintah yang memerlukan perancangan, lelaran dan koordinasi alat.

GPT‑5.6 Sol juga menunjukkan peningkatan meluas dalam aliran kerja biologi. Pada GeneBench v1, yang menilai analisis genomik horizon memanjang dan biologi kuantitatif, model ini mencapai hasil yang lebih kukuh daripada GPT‑5.5 sambil menggunakan lebih sedikit token.

GPT‑5.6 Sol ialah model kami yang paling berkeupayaan setakat ini untuk keselamatan siber. Ia mengalihkan perbatasan prestasi-kecekapan untuk tugasan keselamatan jangka panjang termasuk penyelidikan kerentanan dan eksploitasi. Pada ExploitBench², GPT‑5.6 Sol berdaya saing dengan Mythos Preview sambil menggunakan hanya ~1/3 daripada token output. Pada ExploitGym(dibuka dalam tetingkap baru)3, penanda aras yang dicipta oleh penyelidik UC Berkeley dengan kerjasama OpenAI dan makmal frontier lain, model GPT‑5.6 Sol, Terra dan Luna semuanya menunjukkan peningkatan kukuh dalam keupayaan siber apabila kami meningkatkan penaakulan.

Keupayaan siber yang lebih kukuh dengan perlindungan yang lebih kukuh

Kami membangunkan GPT‑5.6 Sol, Terra dan Luna dengan perlindungan kami yang paling kukuh setakat ini, dengan konfigurasi yang dipadankan dengan keupayaan setiap model. Apabila model menjadi lebih berkeupayaan, kami mereka bentuk perlindungan agar semakin mampu bertahan terhadap tekanan lawan dunia sebenar sambil mengekalkan akses kepada kerja yang sah seperti semakan kod, penyelidikan kerentanan, pembangunan tampalan, penyahpepijatan, pendidikan keselamatan dan ujian defensif. Matlamat kami adalah menjadikan aktiviti serangan yang dilarang lebih sukar, tidak pasti dan dapat dikesan tanpa mengehadkan penggunaan bermanfaat tersebut secara tidak perlu. Berdasarkan penilaian kami terhadap model dan perlindungan, kami menjangka manfaat besar untuk kerja defensif yang sah, sambil mengehadkan penggunaan serangan terlarang secara bermakna.

GPT‑5.6 Sol lebih baik dalam membantu orang mencari dan membaiki kerentanan berbanding melaksanakan serangan hujung ke hujung dengan boleh dipercayai. Apabila keupayaan ini terus maju, keutamaan kami adalah memastikan ia sampai kepada dan memanfaatkan para pembela, yang boleh menggunakan alat ini untuk mencari kelemahan, membangunkan tampalan dan mengukuhkan sistem dengan lebih meluas.

GPT‑5.6 Sol tidak melepasi ambang Cyber Critical di bawah Rangka Kerja Kesediaan kami. Dalam penilaian yang melibatkan Chromium dan Firefox, ia mengenal pasti pepijat dan primitif eksploitasi—blok binaan sesuatu eksploitasi—tetapi tidak menghasilkan eksploitasi rantaian penuh yang berfungsi secara autonomi di bawah keadaan yang diuji. Namun begitu, ambang penanda aras tidak dapat menangkap setiap cara model mungkin digunakan atau digabungkan dengan alat lain. Ketidakpastian itu, bersama perubahan langkah yang lebih luas dalam keupayaan model, menjadi sebab kami menggandingkan keupayaan model yang meningkat dengan perlindungan lebih kukuh dan pelancaran berfasa. Kami berkongsi butiran lanjut tentang perlindungan kami dalam kad sistem Pratonton GPT‑5.6(dibuka dalam tetingkap baru).

Tindanan perlindungan berlapis

Tiada satu pun perlindungan yang mencukupi terhadap penyalahgunaan yang tekad atau adaptif. Sepanjang pratonton GPT‑5.6, kami menggunakan perlindungan berlapis, dengan konfigurasi tepat yang berbeza-beza merentas model dan menguji tekanannya terhadap serangan dunia sebenar. Ini termasuk perlindungan yang dilatih ke dalam model, semakan masa nyata semasa penjanaan, isyarat peringkat akaun, akses dibezakan, pemantauan, penguatkuasaan dan ujian berterusan.

GPT‑5.6 dilatih untuk menolak bantuan siber terlarang, termasuk apabila pengguna cuba menyamarkan niat mereka atau melakukan jailbreak terhadap model. Perlindungan peringkat model ini mewujudkan sempadan pertama tentang perkara yang patut dan tidak patut dibantu oleh model.

Pengelas penyalahgunaan siber dan biologi masa nyata menyediakan lapisan lain dengan menilai output ketika ia dijana. Untuk kes berisiko lebih tinggi, jika pengelas mengesan kemungkinan pelanggaran, penjanaan mungkin dijeda sementara model penaakulan yang lebih besar menyemak perbualan dan konteksnya. Jika output dinilai sebagai tidak dibenarkan, ia ditahan sebelum sampai kepada pengguna.

Aktiviti yang ditandakan juga boleh mencetuskan semakan peringkat akaun merentas perbualan dan isyarat risiko yang berkaitan, selaras dengan terma dan dasar kami berkenaan pengekalan dan semakan kandungan. Melihat melangkaui satu perbualan membantu sistem kami membezakan tingkah laku berniat jahat yang berterusan daripada kerja keselamatan dwiguna yang sah, apabila konsep teknikal yang serupa mungkin muncul dalam konteks yang sangat berbeza.

Secara bersama, lapisan ini menjadikan pendekatan keseluruhan lebih kukuh daripada mana-mana satu perlindungan sahaja. Kelakuan model mengurangkan kemungkinan respons berbahaya, sistem masa nyata boleh campur tangan semasa penjanaan, semakan peringkat akaun boleh mengenal pasti corak yang lebih luas, dan akses dibezakan mengekalkan kerja defensif yang penting tanpa menjadikan keupayaan paling sensitif tersedia secara meluas secara lalai.

Terutamanya semasa pratonton, pengguna mungkin menemui perlindungan yang menyekat atau menolak sesetengah permintaan. Permintaan lain mungkin mengambil masa lebih lama kerana penjanaan dijeda untuk semakan tambahan. Perlindungan kadangkala mungkin campur tangan terhadap kerja yang sah, khususnya dalam bidang dwiguna apabila aktiviti defensif dan serangan pada mulanya boleh kelihatan serupa.

Itulah sebahagian daripada perkara yang direka untuk diuji oleh pratonton ini. Kami mahu memahami bukan sahaja sama ada perlindungan mengehadkan penyalahgunaan, tetapi juga sama ada pengguna yang sah masih boleh menyelesaikan kerja biasa dengan andal dan cekap. Maklum balas semasa pratonton akan membantu kami mengurangkan sekatan dan kelewatan yang tidak perlu, menambah baik cara perlindungan mentafsir konteks dan mewujudkan pengalaman yang lebih lancar sebelum pelancaran lebih luas.

Kami juga bekerjasama dengan pelanggan perusahaan tentang pendekatan jangka panjang—termasuk pengesanan yang memelihara privasi, kawalan keselamatan yang dikendalikan pelanggan, dan akses yang ditentukur mengikut risiko pelanggan, pengguna atau beban kerja—untuk memajukan keselamatan sambil menyokong keperluan privasi perusahaan.

Meningkatkan kekukuhan dengan proses penyerang automatik

Perlindungan juga perlu kekal berkesan apabila penyerang menyesuaikan taktik mereka. Perlindungan yang hanya berfungsi pada set serangan dikenali yang tetap tidak cukup kukuh untuk model perbatasan.

Itulah sebabnya kami menggunakan lebih banyak kecerdasan dan pengkomputeran berbanding sebelum ini untuk keselamatan, dengan menggunakan model kami sendiri bagi mencari kelemahan dan memperbaik perlindungan dengan lebih pantas. Kami memperuntukkan lebih 700,000 jam GPU setara A100 untuk proses penyerang automatik yang bertujuan mencari jailbreak universal: serangan yang boleh berfungsi merentas banyak promp atau konteks, bukan hanya satu tetapan yang sempit. Dengan menumpukan pada serangan yang lebih sukar dan lebih umum ini, kami dapat menguji perlindungan melangkaui set kegagalan dikenali yang tetap. Ia juga membolehkan kami meneroka jauh lebih banyak corak serangan daripada yang mampu diliputi oleh ujian manusia sahaja, mengenal pasti corak kegagalan lebih awal dan memendekkan laluan daripada menemukan kelemahan kepada menanganinya.

Selain proses penyerang automatik, kami bekerjasama dengan penguji pihak ketiga untuk menjalankan proses penyerang pakar manusia secara meluas, yang akan diteruskan sepanjang tempoh pratonton. Proses penyerang manusia melengkapi kerja automatik dengan menguji perlindungan terhadap pakar kreatif yang cuba menyalahgunakan model dengan cara yang mungkin tidak dijangka oleh sistem kami.

Tiada penilaian yang dapat mewakili setiap konfigurasi produk, serangan berbilang langkah atau aliran kerja dunia sebenar. Oleh itu, kami mengekalkan proses tindak balas pantas untuk menghasilkan semula, menilai, mengutamakan dan membaiki jailbreak yang baru ditemui, kemudian menambahkannya kepada penilaian berterusan kami supaya kami boleh menguji terhadap kegagalan serupa pada masa hadapan.

Ketersediaan dan harga

Semasa pratonton, model GPT‑5.6 pada mulanya akan tersedia melalui API dan Codex kepada kumpulan terpilih rakan kongsi dan organisasi yang dipercayai. Kami merancang untuk menyediakannya dengan lebih meluas tidak lama lagi kepada pengguna ChatGPT, Codex dan API.

Dalam sistem penamaan baharu yang diperkenalkan bersama GPT‑5.6 ini, nombor mengenal pasti generasi model, manakala Sol, Terra dan Luna mengenal pasti tahap keupayaan tahan lama yang boleh berkembang mengikut rentak masing-masing. Secara bersama, keluarga ini memberi pengguna dan pembangun pilihan yang lebih jelas merentas kecerdasan, kelajuan dan kos.

GPT‑5.6 berharga bagi setiap 1 juta token merentas tiga saiz model: Sol ialah input $5 / output $30; Terra ialah input $2.50 / output $15; dan Luna ialah input $1 / output $6. GPT‑5.6 juga memperkenalkan cache promp yang lebih boleh dijangka, termasuk sokongan untuk titik putus cache eksplisit dan hayat cache minimum 30 minit. Untuk GPT‑5.6 dan model kemudian, penulisan cache dibilkan pada 1.25x kadar input tanpa cache model, manakala bacaan cache terus menerima diskaun input cache 90%.

Kami juga melancarkan GPT‑5.6 Sol di Cerebras pada kelajuan sehingga 750 token sesaat pada bulan Julai, membawa kecerdasan perbatasan kepada pelanggan pada kelajuan yang belum pernah dicapai. Akses pada mulanya akan dihadkan kepada pelanggan terpilih sementara kami mengembangkan kapasiti.

Kami teruja untuk terus belajar daripada tempoh pratonton ini, dan membawa GPT‑5.6 Sol, Terra dan Luna kepada lebih ramai orang tidak lama lagi.


1. Kami menganggarkan kependaman dan kos API dengan melihat kelakuan produksi model kami, lalu mensimulasikannya secara luar talian. Anggaran ini mengambil kira butiran panggilan alat, token yang disampel dan token input. Keputusan dunia sebenar mungkin berbeza dengan ketara dan bergantung pada banyak faktor yang tidak ditangkap dalam simulasi kami. Kami mensimulasikan kependaman pada kelajuan API pantas dan kos pada harga API biasa.

2. Semua model dinilai menggunakan harnes API ExploitBench dengan 5 seed dan kesinambungan penaakulan.

3. Kami menjalankan ExploitGym pada API alfa kami, yang mengeluarkan respons lebih pantas daripada API awam kami, kemudian menskala semula untuk memadankan API awam kami. Apabila menskala semula kependaman kepada kelajuan yang dijangka untuk API awam kami, ini menyebabkan beberapa anggaran kependaman melebihi had masa 2 jam dan 6 jam, walaupun had tersebut dipatuhi dengan betul dalam larian penilaian. Untuk mendapatkan kelajuan lebih pantas bagi kerja yang sensitif masa, kami menawarkan pemprosesan keutamaan⁠ dalam API dan mod pantas⁠ dalam Codex.

4. Model tanpa token output, kependaman atau kos yang dilaporkan diplotkan sebagai garis bertitik mendatar.

Penulis

OpenAI