Lagi dimuat…
Dina iki, kita ngrilis GPT‑6 Astra, model paling mumpuni sing tau kita sebarake kanthi amba. Astra minangka model kapisan kita sing nggayuh tingkat kemampuan keamanan siber Kritis miturut Kerangka Kesiapan.
Bab-bab paling penting sing perlu dimangerteni ngenani keamanan peluncuran iki yaiku:
- Kemampuan siber GPT‑6 Astra mundhak kanthi signifikan lan wis nyukupi ambang Kritis kita. Iki ateges, kanthi piranti lan akses sing pas, GPT‑6 Astra bisa nemokake cacat keamanan sing sadurunge durung dimangerteni lan ngembangake cara anyar kanggo ngeksploitasi cacat kasebut ing akeh sistem sing direksa kanthi apik tanpa perlu dituntun wong ing saben langkah. Mula, kita nguwatake kanthi signifikan pangreksan supaya model ora nindakake tumindak siber sing mbebayani, apa amarga disalahgunakake utawa ora selaras. Kita uga njupuk langkah kanggo ngamanake pangembangan lan panyebaran internal Astra lan model sing padha, kalebu isolasi sing luwih ketat, enkripsi checkpoint, pemantauan universal tumrap kabeh lintasan kalebu alur pamikiran (CoT), lan proses evaluasi penyelarasan sing bisa ngalangi panggunaan sadurunge model digunakake sacara internal.
- GPT‑6 Astra luwih tangguh kanthi signifikan tinimbang model sadurunge. Kanthi nggunakake teknik latihan keamanan anyar kanggo ningkatake ketangguhan, GPT‑6 Astra luwih tangguh kanthi signifikan ngadhepi jailbreak tinimbang GPT‑5.6 Sol, kalebu sajrone lintasan sing luwih dawa. Kita mangerteni iki saka tes offline lan program pengujian jailbreak internal lan eksternal sarta remediasi sing ketat. Kanggo pangguna sing ditandhani duwe potensi risiko dhuwur, kita uga wis nglatih kemampuan kanggo nyetel wates penolakan model supaya luwih ngati-ati lan nyakup risiko guna ganda sing luwih amba. Kita nggunakake tes regresi kanggo mesthekake Astra tangguh ngadhepi jailbreak sing ditemokake ing periode pengujian sadurunge, lan nindakake babak anyar red teaming otomatis nganggo penyerang red teaming internal paling anyar kanggo ngesahake asil paningkatan kita.
- GPT‑6 Astra luwih selaras tinimbang GPT‑5.6 Sol. Astra minangka kemajuan gedhe tumrap penyelarasan model, kanthi paningkatan wiwit saka komposisi data latihan awalan nganti cara kita menehi biji sajrone sinau penguatan. Kita nglaporake rangkaian evaluasi penyelarasan anyar(mbukak ing jendhela anyar), lan nemokake manawa GPT‑6 Astra luwih bisa ngajeni wates keamanan lan tetep tumindak sajrone cakupan wewenange. Ing simulasi sing nggunakake luwih saka 54.000 tugas Codex internal(mbukak ing jendhela anyar), Astra uga mung nampa kira-kira separo saka jumlah tandha sing ditampa Sol kanggo tumindak ora selaras kanthi tingkat keruwetan luwih dhuwur.
- Kita ngetrapake pemantauan ketidakselarasan kanthi amba. Kita nganggep penyelarasan model minangka sarana utama kanggo nyegah potensi tumindak ora selaras saka model kita. Nanging, pemantauan menehi wawasan amba ngenani tumindake model tercanggih, lan nuduhake kesempatan kanggo luwih ningkatake penyelarasan lan keamanan. Kajaba iku, pemantauan dadi lapisan pangreksan tambahan tumrap tumindak ora selaras sing kasil dideteksi. Amarga alasan kasebut, kita uga nambahake pemantauan ketidakselarasan ing kabeh inferensi sing nggunakake piranti sajrone panyebaran eksternal Astra, sanadyan mbutuhake biaya komputasi sing gedhe. Sistem iki padha karo konfigurasi internal kita.
- Kemampuan GPT‑6 Astra kanggo dipantau mudhun yen dibandhingake karo GPT‑5.6 Sol. Kita wis nindakake panaliten jero babagan kemampuan kanggo dipantau(mbukak ing jendhela anyar) lan kemampuan kanggo dikendhaleni(mbukak ing jendhela anyar) saka GPT‑6 Astra. Kita nemokake manawa GPT‑6 Astra luwih bisa ngendhaleni CoT-e dhewe tinimbang GPT‑5.6 Sol, lan luwih arang nyakup informasi sing bisa mbuktekake kaluputan ing CoT-e. Ing kahanan adversarial (nalika kita meksa model nyingkiri pemantau), kita nemokake manawa model bisa tetep ora kadeteksi nalika sengaja nyuda kinerja kanthi strategis sajrone evaluasi (sandbagging), lan kadhang bisa nyingkiri pemantau internal nalika dijaluk nindakake tugas sabotase tartamtu(mbukak ing jendhela anyar). Kita durung nemokake bukti nalar CoT steganografis (umpamane, ndhelikake nalar rahasia ing teks lumrah sing katon ora ana gandhengane), sing nuduhake manawa risiko ngindhari pemantauan bisa uga umume winates ing tugas kanthi kabutuhan nalar luwih cendhek.
- Temuan iki nuduhake manawa model kelas Astra bisa nyingkiri pemantau CoT kita ing kahanan adversarial. Saiki, temuan iki umume adhedhasar evaluasi adversarial (yaiku nalika model kita prentah supaya nyingkiri pemantauan), lan sakabèhé evaluasi penyelarasan nuduhake manawa Astra luwih arang nglanggar watesan keamanan tinimbang GPT‑5.6 Sol.
- Nanging, kita nganggep tren iki kanthi serius lan terus nliti temuan kasebut sarta implikasine tumrap kemampuan kanggo dipantau nalika model kita saya mumpuni. OpenAI wis ngupaya njaga lan nggunakake pemantauan alur pamikiran, lan njaga kemampuan CoT kanggo dipantau dadi tujuan utama program riset iki. Nanging, asil kasebut uga negesake pentinge ngembangake teknik audit penyelarasan sing ora mung mriksa alur pamikiran model.
- GPT‑6 Astra tumindak luwih tanggung jawab nalika njelajah web lan ing lingkungan kerja: GPT‑6 Astra luwih tangguh kanthi signifikan ngadhepi injeksi prompt tinimbang GPT‑5.6 Sol. Kita uga wis nguji tumindake model ing lingkungan penjelajahan web lan komputer profesional sing nyata, lan nemokake manawa model iki luwih arang nindakake tumindak ora selaras sing bisa ngrusak (kayata transaksi tanpa wewenang, ilange data, akses sing kelewihan, utawa ngliwati kontrol) tinimbang GPT‑5.6 Sol. Model iki uga tumindak luwih aman nalika nangani panjaluk mbebayani ing kahanan agentik, kayata panjaluk kanggo mbantu ngrancang serangan kasar utawa nindakake penipuan.
- GPT‑6 Astra luwih aman kanthi signifikan ing skenario kanthi risiko luwih dhuwur. GPT‑6 Astra nanggapi kanthi luwih aman tinimbang GPT‑5.6 Sol tumrap panjaluk angel saka produksi lan red teaming adversarial sing ditindakake manungsa. Astra nggayuh paningkatan Pareto kanggo ngrampungake panjaluk ora aman kanthi luwih aman lan ngindhari penolakan sing ora perlu tumrap panjaluk sing ora mbebayani. Paningkatan iki uga nyakup skenario kanthi tingkat keruwetan dhuwur, nalika risiko bebaya muncul saka konteks sing luwih amba lan dudu saka panjaluk sing eksplisit. Astra uga ngetrapake wates keamanan sing cocog karo umur kanthi luwih konsisten kanggo pangguna ing sangisore 18 taun.
Kanggo informasi luwih lengkap, delengen kertu sistem lengkap(mbukak ing jendhela anyar).
Pangarang
OpenAI


