Liwati menyang isi utama
OpenAI

26 Juni 2026

ProdukRilis

Pratinjau GPT‑5.6 Sol: model generasi sabanjure

Lagi dimuat…

Kita miwiti pratinjau winates kanggo seri GPT‑5.6: Sol, model unggulan kita; Terra, model seimbang kanggo pakaryan saben dina; lan Luna, model sing cepet lan terjangkau. Terra nduweni kinerja sing kompetitif karo GPT‑5.5 nanging 2x luwih murah, lan Luna nggawa kemampuan kuwat ing biaya paling murah saka kita.

GPT‑5.6 Sol diluncurake kanthi stack safety paling tangguh saka kita nganti saiki. Kita nguwatake perlindhungan kanggo aktivitas risiko luwih dhuwur, panjaluk siber sensitif, lan penyalahgunaan bola-bali, sarta ngentekake pirang-pirang minggu kanggo nemokake kelemahan, nguji tekanan sistem, lan nguatake supaya tahan marang serangan donya nyata.

Kita percaya marang akses sing jembar, lan ngrancang supaya GPT‑5.6 Sol, Terra, lan Luna kasedhiya umum ing minggu-minggu sing bakal teka. Minangka bagean saka keterlibatan terus-terusan karo pamaréntah AS, kita menehi pratinjau rencana lan kemampuan model sadurunge peluncuran dina iki. Miturut panjaluke, kita miwiti kanthi pratinjau winates kanggo klompok cilik mitra dipercaya sing partisipasine wis dituduhake marang pamaréntah, sadurunge dirilis luwih jembar. Sajrone pratinjau iki, kita bakal terus nguji lan koordinasi rapet karo para mitra nalika ngupaya kasedhiyan sing luwih jembar. Kita ora percaya yen proses akses pamaréntah kaya iki kudu dadi standar jangka panjang. Iki ngalangi pangguna, pangembang, perusahaan, pembela siber, lan mitra global sing mbutuhake supaya ora entuk alat paling apik. Kita njupuk langkah jangka pendek iki amarga percaya iki dalan paling kuat menyang kasedhiyan luwih jembar ing minggu-minggu ngarep, nalika kita kerja bareng Administrasi kanggo ngembangake kerangka Executive Order siber lan proses sing bisa diulang kanggo rilis model mbesuk.

Kemampuan

GPT‑5.6 Sol minangka model paling kuat saka kita nganti saiki. Kanggo menehi pratinjau kinerja model, kita nuduhake sawetara evaluasi sing nyorot peningkatan kemampuan agentic ing pemrograman, biologi, lan keamanan siber, kanthi evaluasi safety lan kesiapan tambahan kasedhiya ing kertu sistem(mbukak ing jendhela anyar) kita. Kita bakal nuduhake rangkaian asil evaluasi sing luwih jembar nalika model iki kasedhiya luwih umum.

Kanthi GPT‑5.6, kita ngenalake upaya nalar `max` anyar supaya Sol entuk wektu paling akeh kanggo nalar kanthi jero. Kajaba iku, kita ngenalake mode `ultra` anyar sing ngluwihi kemampuan siji agen kanthi nggunakake subagen kanggo nyepetake pakaryan kompleks.

Kanggo alur kerja pemrograman, GPT‑5.6 Sol netepake standar paling anyar ing Terminal‑Bench 2.1, sing nguji alur kerja baris perintah sing mbutuhake perencanaan, iterasi, lan koordinasi alat.

GPT‑5.6 Sol uga nuduhake peningkatan jembar ing alur kerja biologi. Ing GeneBench v1, sing ngevaluasi analisis genomik jangka panjang lan biologi kuantitatif, asilé luwih kuat tinimbang GPT‑5.5 kanthi nggunakake token luwih sithik.

GPT‑5.6 Sol minangka model paling mumpuni saka kita nganti saiki kanggo keamanan siber. Model iki mindhah wates kinerja-efisiensi tercanggih kanggo tugas keamanan jangka panjang kalebu riset kerentanan lan eksploitasi. Ing ExploitBench², GPT‑5.6 Sol kompetitif karo Mythos Preview kanthi mung nggunakake ~1/3 token output. Ing ExploitGym(mbukak ing jendhela anyar)3, benchmark sing digawe peneliti UC Berkeley kanthi kolaborasi karo OpenAI lan lab tercanggih liyane, model GPT‑5.6 Sol, Terra, lan Luna kabeh nuduhake peningkatan kuat ing kemampuan siber nalika nalar kita tambahake.

Kemampuan siber luwih kuwat kanthi pengaman luwih kuwat

Kita ngembangake GPT‑5.6 Sol, Terra, lan Luna kanthi pengaman paling tangguh saka kita nganti saiki, kanthi konfigurasi sing dicocogake karo kemampuan saben model. Nalika model dadi luwih mumpuni, kita ngrancang pengaman supaya saya tahan marang tekanan adversarial donya nyata, nanging tetep njaga akses kanggo pakaryan sah kayata review kode, riset kerentanan, pangembangan patch, debugging, edukasi keamanan, lan uji pertahanan. Tujuan kita yaiku nggawe aktivitas ofensif sing dilarang dadi luwih angel, ora mesthi, lan bisa dideteksi tanpa mbatesi panggunaan migunani kasebut kanthi ora perlu. Adhedhasar penilaian kita marang model lan pengaman, kita ngarepake manfaat gedhe kanggo pakaryan pertahanan sah, nalika kanthi nyata mbatesi panggunaan ofensif sing dilarang.

GPT‑5.6 Sol luwih apik kanggo mbantu wong nemokake lan ndandani kerentanan tinimbang nindakake serangan end-to-end kanthi andal. Nalika kemampuan iki terus maju, prioritas kita yaiku mesthekake supaya tekan lan migunani kanggo para pembela, sing bisa nggunakake alat iki kanggo nemokake kelemahan, ngembangake patch, lan nguatake sistem kanthi luwih jembar.

GPT‑5.6 Sol ora ngliwati ambang Cyber Critical miturut Preparedness Framework kita. Ing evaluasi sing nyakup Chromium lan Firefox, model iki ngenali bug lan primitif eksploitasi—blok pambangun exploit—nanging ora ngasilake exploit full-chain fungsional kanthi otonom ing kahanan sing diuji. Nanging, ambang benchmark ora bisa nangkep saben cara model bisa digunakake utawa digabungake karo alat liyane. Ketidakpastian iki, bebarengan karo lompatan kemampuan model sing luwih jembar, dadi sebab kita masangake peningkatan kemampuan model karo pengaman luwih kuwat lan rilis bertahap. Kita nuduhake rincian liyane babagan pengaman kita ing kertu sistem Pratinjau GPT‑5.6(mbukak ing jendhela anyar).

Stack pengaman berlapis

Ora ana siji pengaman wae sing cukup kanggo ngadhepi penyalahgunaan sing tekun utawa adaptif. Ing sakabehing pratinjau GPT‑5.6, kita nggunakake pengaman berlapis, kanthi konfigurasi pas sing beda-beda antarane model, lan nguji tekanan marang serangan donya nyata. Iki kalebu perlindhungan sing dilatih ing model, pemeriksaan wektu nyata sajrone generasi, sinyal tingkat akun, akses sing dibedakake, pemantauan, penegakan, lan pengujian terus-terusan.

GPT‑5.6 dilatih kanggo nolak pitulungan siber sing dilarang, kalebu nalika pangguna nyoba nyamarake niate utawa njailbreak model. Pengaman tingkat model iki netepake wates pisanan babagan apa sing kudu lan ora kudu dibantu dening model.

Klasifier penyalahgunaan siber lan biologi wektu nyata nyedhiyakake lapisan liyane kanthi ngevaluasi output nalika lagi digawé. Kanggo kasus risiko luwih dhuwur, yen ndeteksi kemungkinan pelanggaran, generasi bisa dijeda nalika model nalar sing luwih gedhe mriksa obrolan lan konteksé. Yen output dinilai ora diidini, output kasebut ditahan sadurunge tekan pangguna.

Aktivitas sing ditandhani uga bisa memicu review tingkat akun ing obrolan lan sinyal risiko sing relevan, selaras karo syarat lan kabijakan kita babagan retensi lan review konten. Ndeleng ngluwihi siji obrolan mbantu sistem kita mbedakake perilaku jahat sing terus-terusan saka pakaryan keamanan dual-use sing sah, nalika konsep teknis sing padha bisa muncul ing konteks sing beda banget.

Bebarengan, lapisan-lapisan iki nggawe pendekatan sakabèhé luwih tangguh tinimbang siji pengaman apa wae yen dhewekan. Perilaku model nyuda kemungkinan respons mbebayani, sistem wektu nyata bisa campur tangan sajrone generasi, review tingkat akun bisa ngenali pola sing luwih jembar, lan akses sing dibedakake njaga pakaryan pertahanan penting tanpa nggawe kemampuan paling sensitif kasedhiya jembar kanthi standar.

Utamane sajrone pratinjau, pangguna bisa nemoni pengaman sing mblokir utawa nolak sawetara panjaluk. Panjaluk liyane bisa mbutuhake wektu luwih suwe amarga generasi dijeda kanggo review tambahan. Pengaman kadhangkala bisa campur tangan ing pakaryan sah, utamane ing wilayah dual-use nalika aktivitas pertahanan lan ofensif wiwitane bisa katon padha.

Iki minangka bagean saka tujuan pratinjau iki kanggo diuji. Kita pengin ngerti ora mung apa pengaman bisa mbatesi penyalahgunaan, nanging uga apa pangguna sah isih bisa ngrampungake pakaryan normal kanthi andal lan efisien. Umpan balik sajrone pratinjau bakal mbantu kita nyuda blokir lan keterlambatan sing ora perlu, ngapikake cara pengaman nerjemahake konteks, lan nggawe pengalaman luwih lancar sadurunge rilis luwih jembar.

Kita uga kerja bareng pelanggan perusahaan babagan pendekatan jangka luwih panjang—kalebu deteksi sing njaga privasi, kontrol safety sing dioperasikake pelanggan, lan akses sing dikalibrasi miturut risiko pelanggan, pangguna, utawa beban kerja—kanggo majokake safety nalika ndhukung syarat privasi perusahaan.

Ngapikake ketangguhan nganggo red teaming otomatis

Pengaman uga kudu tetep efektif nalika panyerang ngganti taktiké. Perlindhungan sing mung bisa kanggo sakumpulan serangan sing wis dingerteni durung cukup tangguh kanggo model tercanggih.

Mula, saiki kita ngetrapake kecerdasan lan komputasi luwih gedhe tinimbang sadurunge kanggo safety, nggunakake model kita dhewe kanggo nemokake kelemahan lan luwih cepet ngapikake pengaman. Kita nyawisake luwih saka 700.000 jam GPU setara A100 kanggo red teaming otomatis sing ditujokake nemokake jailbreak universal: serangan sing bisa lumaku ing pirang-pirang prompt utawa konteks, dudu mung ing siji setelan sempit. Kanthi fokus marang serangan sing luwih angel lan luwih umum iki, kita bisa nguji pengaman ngluwihi daftar kegagalan sing wis dingerteni. Iki uga ngidini kita njelajah pola serangan luwih akeh tinimbang sing bisa dicakup uji coba manungsa wae, ngenali pola kegagalan luwih awal, lan nyepetake dalan saka nemokake kelemahan nganti ngatasi.

Saliyane red teaming otomatis, kita makarya karo penguji pihak katelu kanggo nindakake red teaming pakar manungsa kanthi jembar, sing bakal terus ditindakake sajrone periode pratinjau. Red teaming manungsa nglengkapi pakaryan otomatis kanthi nguji pengaman ngadhepi para pakar kreatif sing nyoba nyalahgunakake model kanthi cara sing bisa uga ora diantisipasi sistem kita.

Ora ana evaluasi sing bisa makili saben konfigurasi produk, serangan multi-langkah, utawa alur kerja donya nyata. Mula, kita njaga proses tanggap cepet kanggo ngasilake maneh, mbiji, nggawe prioritas, lan ndandani jailbreak anyar sing ditemokake, banjur nambahake menyang evaluasi terus-terusan supaya mbesuk bisa nguji kegagalan sing padha.

Kasedhiyan lan rega

Sajrone pratinjau, model GPT‑5.6 wiwitane bakal kasedhiya liwat API lan Codex kanggo klompok mitra lan organisasi dipercaya sing kapilih. Kita ngrancang supaya model iki enggal kasedhiya luwih jembar kanggo wong sing nggunakake ChatGPT, Codex, lan API.

Ing sistem panamaan anyar sing dikenalake karo GPT‑5.6 iki, angka nuduhake generasi model, dene Sol, Terra, lan Luna nuduhake tingkat kemampuan awet sing bisa maju miturut irama dhewe. Bebarengan, kulawarga iki menehi pilihan sing luwih cetha kanggo wong lan pangembang babagan kecerdasan, kacepetan, lan biaya.

GPT‑5.6 diregani saben 1M token ing telung ukuran model: Sol $5 input / $30 output; Terra $2,50 input / $15 output; lan Luna $1 input / $6 output. GPT‑5.6 uga ngenalake caching prompt sing luwih bisa diprakirakake, kalebu dhukungan kanggo breakpoint cache eksplisit lan umur cache minimal 30 menit. Kanggo GPT‑5.6 lan model sabanjure, penulisan cache ditagih 1,25x tarif input tanpa cache saka model kasebut, dene maca cache tetep nampa diskon input cache 90%.

Kita uga ngluncurake GPT‑5.6 Sol ing Cerebras nganti 750 token per detik ing Juli, nggawa kecerdasan tercanggih marang pelanggan kanthi kacepetan sing durung ana sadurunge. Akses wiwitane bakal diwatesi kanggo pelanggan kapilih nalika kita nggedhekake kapasitas.

Kita bungah bisa terus sinau saka periode pratinjau iki, lan enggal nggawa GPT‑5.6 Sol, Terra, lan Luna marang luwih akeh wong.


1. Kita ngira latensi lan biaya API kanthi ndeleng perilaku produksi model kita, banjur nyimulasi kanthi offline. Perkiraan iki nyakup rincian panggilan alat, token sing disampel, lan token input. Asil donya nyata bisa beda banget, gumantung marang akeh faktor sing ora kacathet ing simulasi kita. Kita nyimulasi latensi ing kacepetan API cepet, lan biaya ing rega API reguler.

2. Kabeh model dievaluasi nganggo harness API ExploitBench kanthi 5 seed lan kesinambungan nalar.

3. Kita mbukak ExploitGym ing API alfa kita, sing ngasilake respons luwih cepet tinimbang API publik, banjur diskalakake maneh supaya cocog karo API publik. Nalika latensi diskalakake maneh menyang kacepetan sing dikarepake kanggo API publik, sawetara perkiraan latensi dadi ngluwihi wates wektu 2 jam lan 6 jam, sanajan ing run evaluasi sejatine wis manut kanthi bener. Kanggo entuk kacepetan luwih cepet kanggo pakaryan sing peka wektu, kita nyedhiyakake pangolahan prioritas⁠ ing API lan mode cepet⁠ ing Codex.

4. Model tanpa token output, latensi, utawa biaya sing dilaporake digambarake minangka garis titik-titik horizontal.

Pangarang

OpenAI