Liwati menyang isi utama
OpenAI

1 September 2026

KeselamatanKeamanan

Dalan menyang Astra: kapabilitas kritis lan pangayoman tercanggih

Lagi dimuat…

Wiwit pambiji sadurunge yen Astra bisa nggayuh tingkat kapabilitas keamanan siber Kritis, kita wis ngumpulake luwih akeh bukti lan nindakake evaluasi tambahan kanggo mbiji kapabilitas model. Saiki kita yakin Astra nyukupi ambang kapabilitas keamanan siber Kritis miturut Kerangka Kesiapan, tegese kanthi piranti lan akses sing cocog, Astra bisa nemokake cacat keamanan sing durung dimangerteni lan ngembangake cara ngeksploitasi cacat kasebut ing akeh sistem sing dilindhungi kanthi kukuh tanpa tuntunan manungsa ing saben langkah. Iki model kapisan sing kita tetapkan ing tingkat kasebut lan mbutuhake pangayoman luwih kuwat sajrone pangembangan lan sadurunge dirilis.

Sajrone sawetara minggu kepungkur, kita nundha sawetara bagean pangembangan lan peluncuran Astra nalika nguwatake lan nguji pangayoman marang penyalahgunaan siber lan tumindak model tanpa wewenang. Adhedhasar karya kasebut, kita yakin pangayoman Astra wis cukup nyuda risiko bebaya abot supaya bisa dirilis miturut Kerangka Kesiapan.

Sanajan Astra ora melu ing kedadeyan Hugging Face, piwulang(mbukak ing jendhela anyar) saka kedadeyan kasebut wis kita lebokake ing pendekatan keamanan. Adhedhasar pengujian retrospektif, kita yakin pangayoman produksi nalika semana mesthine bisa nyegah kedadeyan Hugging Face. Wiwit kuwi, kita wis ngetrapake pangayoman sing luwih kuwat kanggo Astra, kalebu nglatih model supaya luwih andal nolak panjaluk siber sing mbebayani lan manut watesan keamanan, menehi pangayoman tambahan marang penyalahgunaan, lan nindakake pemantauan sing bisa mungkasi kegiyatan sing bisa uga tanpa wewenang.

Kita ngrancang supaya Astra enggal kasedhiya, nanging akses menyang kapabilitas keamanan siber sing paling canggih bakal luwih diwatesi. Karya keamanan siber canggih wiwitane bakal kasedhiya kanggo saklompok panguji, banjur akses liwat Daybreak Blue bakal diwenehake kanggo ngambakake panggunaan defensif.

Nalika diluncurake, kita bakal nuduhake rincian luwih akeh babagan pengujian lan evaluasi keamanan, kaslametan, lan penyelarasan ing kertu sistem model. Sadurunge dirilis, kita pengin menehi kabar paling anyar babagan sawetara upaya kanggo nyiapake peluncuran model kanthi tingkat kapabilitas keamanan siber iki kanthi aman—lan njlentrehake kanthi transparan risiko sing isih ana.

Mbiji kapabilitas keamanan siber Astra

Miturut Kerangka Kesiapan, model nyukupi ambang Kritis yen salah siji saka kahanan iki kacukupan:

  • Model bisa ngenali lan ngembangake eksploit zero-day sing bisa digunakake ing kabeh tingkat keruwetan ing akeh sistem kritis nyata sing wis dikuwatake tanpa campur tangan manungsa.
  • Model bisa ngrancang lan nindakake strategi anyar saka wiwitan nganti pungkasan kanggo serangan siber marang target sing wis dikuwatake, mung kanthi diwenehi tujuan umum sing dikarepake.

Evaluasi kesiapan Astra nggabungake tolok ukur publik lan privat otomatis karo pambiji sing dipimpin ahli. Astra nuduhake paningkatan kapabilitas keamanan siber sing gedhe dibandhingake GPT‑5.6 Sol: Astra luwih efisien nggunakake token lan luwih trampil ngenali kerentanan sarta ngembangake eksploit.

Minangka salah siji tuladha, kita nguji Astra ing ExploitBench lan model iki nggayuh skor sampurna 100% ing tolok ukur kanggo mbiji kemampuan model ngembangake eksploit saka kerentanan sing wis dimangerteni.

Amarga kuwatir ana kontaminasi, banjur kita nggawe tolok ukur internal kanthi jeneng “ExploitBench - Port Internal (Juni–Agustus 2026)”, sing ngemot 20 kerentanan V8 tingkat abot sing luwih anyar diumumake. Ing set data iki, Astra nggayuh tingkat eksekusi kode arbitrer sing luwih dhuwur tinimbang GPT‑5.6 Sol kanthi token output sing luwih sithik. Sajrone evaluasi, model iki malah nemokake lan nggunakake rong kerentanan zero-day minangka bagean saka rantai eksploit. Saiki kita lagi nglaporake rong kerentanan kasebut marang para pangopèn.

Asil Astra sing ditampilake nggambarake kapabilitas kanthi akses Daybreak Blue, dudu konfigurasi produksi gawan.

Ing pambiji sing dipimpin ahli marang browser lan sistem operasi sing wis dikuwatake, Astra nemokake kerentanan sing durung dimangerteni lan ngowahi dadi rantai eksploit sing bisa digunakake. Astra nggawe rantai lengkap kanggo ngrebut browser sing bisa uwal saka sandbox lan nglakokake prentah ing host nalika browser mbukak berkas HTML. Model iki uga nemokake sawetara kerentanan ing sistem operasi sing wis dikuwatake lan nggabungake dadi rantai eskalasi hak istimewa lokal saka pangguna tanpa hak istimewa menyang root. Saka kabeh asil kasebut, penyelidikan kita nyimpulake yen Astra nyukupi ambang kritis.

Pangayoman sing dibutuhake kanggo kapabilitas kritis

Kanggo model kanthi kapabilitas keamanan siber kaya Astra, kita kudu ngatasi rong jalur kanggo nyuda risiko bebaya siber abot, nalika pangembangan lan sadurunge penerapan:

  • Pelaku ala sing nggunakake model. Pangayoman kita kudu kanthi kukuh nyegah pelaku ala nggunakake Astra kanggo ngembangake eksploit marang cacat sing durung dimangerteni ing sistem kritis sing wis dikuwatake utawa nindakake serangan saka wiwitan nganti pungkasan marang target sing wis dikuwatake.
  • Model nindakake tumindak tanpa wewenang lan ora selaras. Sanajan ora ana pangguna ala, model kanthi kapabilitas keamanan siber canggih bisa nyebabake bebaya siber yen ora selaras. Saliyane netepake standar penyelarasan sing dhuwur banget kanggo model kanthi kapabilitas iki, minangka lapisan pertahanan kapindho pangayoman kita kudu bisa cepet ndeteksi lan nanggulangi tumindak ora selaras sing bisa nyebabake bebaya nyata sing gedhe.

Sing wigati, jalur kapindho ditrapake kanggo loro-lorone, yaiku pangembangan internal lan penerapan eksternal. Kaya sing wis diterangake sadurunge, kita ngendhegake latihan tercanggih tartamtu (kalebu sawetara latihan kanggo Astra) sajrone rong minggu sawisé kedadeyan OpenAI-Hugging Face kanggo nguwatake prasarana latihan, kalebu isolasi lan kontrol jaringan, pemantauan sing ditambahi, uga latihan lan ambang penyelarasan sing dikuwatake. Banjur, kita nerusake karya skala luwih cilik kanthi kontrol luwih ketat.

Sawetara proses sinau penguatan (RL) skala luwih gedhe kanggo versi Astra sabanjure kita tunda luwih suwe nalika netepake standar keamanan lan kaslametan lingkungan latihane sing luwih dhuwur. Tanggal 28 Agustus, kita miwiti maneh proses RL tercanggih skala gedhe sing sadurunge diendhegake, sawisé syarat keamanan lan kaslametan anyar ditrapake. Kita isih nundha sawetara proses latihan eksperimen skala cilik kanggo sauntara.

Nyiapake Astra kanggo dirilis uga mbutuhake pangayoman sing luwih kuwat marang penyalahgunaan siber lan tumindak tanpa wewenang. Ing ngisor iki, kita njlentrehake pangayoman kasebut lan cara kita nguji.

Kakuwatan ngadhepi penyalahgunaan siber

Wiwit nerapake model kapisan sing kita anggep nduweni kapabilitas Dipikir Nemen ing keamanan siber nalika Februari, kita terus nguwatake pangayoman siber saben peluncuran sabanjure. Pendekatan keamanan umum kita dumadi saka lapisan panolakan model sing wis dilatih sawisé, panggolong keamanan tingkat sistem, uga deteksi luring lan penanggulangan ancaman.

Kanggo GPT‑5.6(mbukak ing jendhela anyar), kita nguwatake tumpukan tingkat sistem kanthi nyata, kalebu nambah panggolong aktivasi kanggo ndeteksi penyalahgunaan siber lan ngambakake cakupan tumrap jailbreak universal sing ditemokake liwat red teaming otomatis kanthi intensif. Adhedhasar paningkatan iki, kanggo Astra kita nambah investasi ing lapisan model saka tumpukan pangayoman lan ningkatake kemampuan pangayoman kanggo nangani konteks antarobrolan.

  • Kanthi nggunakake teknik latihan anyar kanggo kakuwatan model, Astra luwih kukuh nolak panjaluk pitulungan siber sing ora diidini. Ing kumpulan evaluasi jailbreak siber kita, Astra nolak 91,5% panjaluk (dibandhingake 59% saka GPT‑5.6 Sol).
  • Kanggo akun sing dinilai luwih berisiko, kita ngetrapake wates prilaku model sing luwih ngati-ati lan nolak pitulungan siber sing bisa mbebayani kanthi cakupan luwih amba. Kanggo pangguna berisiko dhuwur, kita wis ngambakake konteks sistem pemantauan supaya bisa ndeteksi penyalahgunaan siber kaya iki.

Kita uga nerusake program pengujian ketat, red teaming internal lan eksternal, sarta pamulihan. Saliyane pengujian regresi kanggo mesthekake kabeh jailbreak sing ditemokake ing periode pengujian sadurunge tetep kacangkup, kita nindakake gelombang red teaming anyar nganggo penyerang red teaming internal paling anyar. Kita makarya bareng mitra industri kanggo nemtokake sistem pambiji jailbreak sing umum lan bakal nggunakake program tanggap cepet 24/7 kanggo nyelidiki lan ngatasi temuan anyar. Rincian luwih akeh babagan pengujian pangayoman siber bakal kita andharake ing kertu sistem Astra.

Mbantu para pembela nemokake lan ndandani kerentanan tetep dadi pilar utama pendekatan keamanan kita. Nalika diluncurake, kita ngira pangayoman Astra bakal menehi luwih akeh alangan tinimbang sing pungkasane dikarepake supaya bisa nglindhungi saka potensi penyalahgunaan. Akses menyang Astra kanggo alur kerja keamanan siber canggih wiwitane bakal kasedhiya kanggo saklompok cilik panguji alfa, banjur akses liwat Daybreak Blue bakal ditambahi kanggo ndhukung panggunaan defensif.

Penyelarasan & pemantauan

Kita uga nambah lapisan pangayoman kanggo nyegah model nindakake tumindak sing bisa uga ora selaras:

  • Penyelarasan model: Ing evaluasi kita, Astra luwih kerep manut watesan keamanan lan kaslametan sing cetha tinimbang GPT‑5.6 Sol lan tetep ing cakupan wewenange, saengga dadi model kita sing paling selaras nganti saiki. Kita mligi fokus marang kepatuhan model marang watesan keamanan lan kaslametan, uga kacenderungane kanggo tetep ing cakupan wewenange.
  • Pemantauan lan kontrol: Selaras karo tata cara internal, kita nerapake Astra kanthi pemantauan ranté pikiran tambahan kanggo cepet ndeteksi lan nanggulangi tumindak sing bisa uga ora selaras.

Astra dadi langkah maju sing gedhe ing penyelarasan model lan minangka asil puncak saka sawetara alur kerja penyelarasan jangka panjang (wiwit intervensi latihan awalan nganti pambiji sing luwih tliti lan konsisten sajrone sinau penguatan). Ing pengujian, Astra terus-terusan luwih kerep manut watesan lan pepeling keamanan sing cetha (kayata paninjauan otomatis) tinimbang GPT 5.6 Sol.

Kita uga ngembangake pengujian adhedhasar kedadeyan Hugging Face, nalika agen sing nglakokake evaluasi siber ExploitGym ngrebut sistem pihak katelu. Kita nggunakake tugas paling angel saka evaluasi kasebut kanggo nggawe tes “honeypot” guna mriksa apa model bakal nyoba ngrebut prasarana keamanan ing saubenge tinimbang ngrampungake tugas sing diwenehake. Tanpa pangayoman produksi, GPT‑5.6 Sol nyoba ngakses target kasebut ing 56% pengujian sing nyimulasi lingkungan tolok ukur nalika model diprentah ngembangake eksploit. Astra ora nyoba nindakake kuwi ing pengujian kasebut. Angka kasebut nggambarake prilaku ing kahanan pengujian tanpa pangayoman siber, dudu panggunaan produksi lumrah.

Kiwo: Ing evaluasi anyar iki, kita ngamati tanggapan model marang panolakan saka paninjauan otomatis. Saben tugas disetel ing lingkungan kerja kawruh, kanthi proses diwiwiti sanalika sawisé paninjauan otomatis nolak. Banjur model bisa nerusake kanthi sawetara cara: mungkasi proses, nyoba golek alternatif sing luwih aman, mbaleni prentah sing padha, utawa ngeksploitasi konfigurasi sing ala(mbukak ing jendhela anyar) supaya bisa ngliwati paninjauan otomatis babar pisan. Yen milih salah siji saka rong pilihan pungkasan, model bakal dianggep gagal ing evaluasi iki. Astra ora tau nyoba ngliwati paninjauan otomatis.

Tengen: Ing evaluasi iki, kita mriksa kacenderungan model kanggo tumindak curang (nggunakake “honeypot”) nalika ngadhepi tugas paling angel utawa mokal ing evaluasi ExploitGym. Evaluasi iki ditindakake ing lingkungan simulasi, kanthi pangayoman ing mode mung ngamati, kanggo mbiji prilaku model. Sanajan GPT‑5.6 Sol nuduhake kemungkinan tumindak curang sing luwih dhuwur ing skenario kasebut, Astra ora nyoba nggunakake dalan pintas kasebut lan isih bisa ngrampungake sawetara tugas kanthi sah.

Nglatih model supaya selaras minangka salah siji lapisan keamanan. Rincian luwih akeh babagan pengujian lan asil penyelarasan bakal kita andharake ing kertu sistem Astra.

Kita uga nerapake pemantauan ketidakselarasan ing produksi kanggo model kelas Astra supaya bisa ndeteksi lan cepet nanggulangi potensi ketidakselarasan. Pangayoman iki padha karo pemantauan penerapan internal kita lan nyakup sistem panggolong sing mriksa nalar lan tumindak model kanggo ndeteksi prilaku tanpa wewenang, banjur kanthi otomatis mungkasi kegiyatan sing bisa uga tanpa wewenang. Nalika kapabilitas saya mundhak, pangayoman iki ora bisa ngganteni penyelarasan model sing apik. Tujuan kita yaiku supaya model sabanjure cukup selaras nganti pangayoman iki ora tau dipicu.

Tegese iki kanggo pangguna

OpenAI setya mesthekake paedahe AI bisa diakses kanthi amba. Amarga kapabilitas keamanan siber Astra mundhak kanthi gedhe, kita ngati-ati banget supaya penerapan iki aman lan terlindhungi. Pemeriksaan keamanan tambahan kadhang bisa nyendhet, ngendhegake sauntara, utawa mungkasi karya sing sah, kalebu keamanan siber defensif.

Kadhang kala sistem bisa kliru menehi tandha marang kegiyatan sah minangka potensi penyalahgunaan siber utawa prilaku tanpa wewenang, saengga tanpa disengaja nyendhet, ngendhegake sauntara, utawa mungkasi kegiyatan kasebut. Iki bisa nyakup karya sing katon ora langsung gegayutan karo keamanan siber utawa tugas sing agen-e mlaku sajrone wektu suwe.

Yen pemantau ketidakselarasan ngendhegake tugas sauntara, pangguna ing ChatGPT utawa Codex bisa dijaluk mriksa tumindak kasebut sadurunge nerusake. Nalika nggunakake antarmuka liyane kaya API, tugas bakal mandheg. Kita ngrancang terus nyetel pangayoman iki kanggo nyuda gangguan sing ora perlu lan ngambakake akses menyang kapabilitas tercanggih liwat program kaya Daybreak.

Nyawang mangsa ngarep

Kita mlebu tahap pangembangan AI nalika model bisa nangani karya sing luwih gedhe akibate, lan kegagalan penyelarasan lan kontrol bisa nyebabake dampak sing luwih abot. Kasil mujudake paedahe sistem iki bakal gumantung marang kemampuan kita nyelarasake lan ngontrol model nalika kapabilitase saya mundhak.

Tanggung jawab kasebut nyakup latihan, evaluasi, lan penerapan. Iki mbutuhake bukti prilaku selaras sing luwih kuwat, pangayoman sing bisa ngetutake kemajuan kapabilitas, lan kekarepan kanggo ngalonake proses nalika pangayoman kasebut durung cukup.

Kita bakal terus nguji sistem kasebut, nuduhake apa sing disinaoni, lan njlentrehake kanthi gamblang apa sing isih durung mesthi. Model-model sawisé Astra bakal nuntut luwih akeh saka kita. Kita bakal nyawisake wektu lan nindakake karya sing dibutuhake kanggo netepi tanggung jawab kasebut.