Liwati menyang isi utama
OpenAI

18 Agustus 2026

PerusahaanPublikasi

Laju pangembangan model ing jaman kapabilitas siber kritis

Lagi dimuat…

Sajrone pirang-pirang minggu kepungkur, rong perkembangan negesake saya gedhene risiko sing ana gandheng cenenge karo sistem AI sing saya mumpuni: insiden OpenAI-Hugging Face lan, kanthi kapisah, bukti awal yen salah siji model kita sing bakal teka, Astra, bisa uga nggayuh ambang kapabilitas keamanan siber Kritis miturut Kerangka Kesiapan kita. Kanthi bebarengan, perkembangan iki lan majune riset internal kita kanthi rikat wis ndadekake pakaryan kanggo nguwatake pangawasan, keselarasan, lan pangreksan ing kabeh tahap proses pelatihan dadi saya wigati lan kudu enggal ditindakake.

Nalika model saya mumpuni, risiko nalika ngembangake lan nguji model kasebut sacara internal uga saya gedhe. Standar pangawasan, keselarasan, lan keamanan kita kudu tansah luwih maju tinimbang risiko kasebut. Kita perlu nyawisake wektu sing dibutuhake kanggo nyukupi standar kasebut, mula kita sauntara ngalonake laju paningkatan skala. Iki kalebu ngendhegake pelatihan sinau penguatan (RL) sajrone rong minggu tumrap model paling anyar sing arep diluncurake, nalika kita luwih nguwatake lan nindakake pengujian red-team ing lingkungan riset, sarta ngambakake cakupan sistem pangawasan. Pelatihan RL tercanggih paling gedhe sing direncanakake isih diendhegake, nalika kita nindakake pelatihan lan evaluasi kanthi skala luwih cilik kanggo mbiji tumindake model, ngesahake pangreksan, lan nglumpukake bukti keselarasan sing luwih akeh sadurunge diterusake.

Keselarasan—yaiku upaya supaya sistem AI tumindak kaya sing dikarepake lan nanggapi pangawasan manungsa—wis suwe dadi inti program riset kita. Saiki kita mbutuhake bukti luwih kuwat ngenani tumindak sing selaras ing kabeh proses pelatihan, adhedhasar riset lan evaluasi sing wis ditindakake. Njaga supaya sistem sing saya mumpuni tetep selaras minangka tantangan sing kudu ditangani kabeh pihak ing bidhang iki. Tandha-tandha saka kemajuan model sing bakal teka nuduhake kanthi cetha yen kita mbutuhake pendekatan luwih jembar—sing adhedhasar lan ngluwihi Kerangka Kesiapan saiki.

Kita nganggep penting kanggo blaka babagan owah-owahan pendekatan kita. Ing ngisor iki, kita njlentrehake owah-owahan sing wis ditindakake tumrap proses lan prasarana riset, uga pakaryan sing isih lumaku.

Nguwatake pangreksan kanggo model sing luwih mumpuni

Pendekatan kita kanggo ngembangake model sing luwih mumpuni adhedhasar telung pangreksan sing padha nguwatake:

  1. Pangawasan, kanggo ndeteksi tumindak sing mrihatinake lan ndadekake kita bisa nanggapi.
  2. Keselarasan, kanggo nyuda kemungkinan tumindak sing mbebayani utawa tanpa idin.
  3. Langkah keamanan, kanggo matesi apa sing bisa diakses utawa diprabawai sistem AI.

Kita ngarepake model bakal enggal nindakake mayoritas pakaryan keamanan, kalebu ngreksa saka model liyane. Kanthi mangkono, telung pangreksan kasebut bisa mundhak skalane manut kapabilitas model, lan iki kita anggep wigati banget.

Kita ngetrapake pangreksan iki ing riset lan peluncuran, kanthi nyelarasake marang kapabilitas, lingkungan operasi, lan tingkat risiko saben model.

Ngamanake lingkungan riset kita

Nalika kapabilitas keamanan siber model tercanggih saya kuwat, kita ngunggahake standar keamanan kanggo lingkungan panggonan model kasebut dilatih lan dievaluasi. Kanggo nyukupi standar kasebut, dibutuhake rekayasa gedhe-gedhean sing nyebabake biaya gedhe lan tundhane riset tercanggih. Sanalika sawise insiden OpenAI-Hugging Face*, kita ngendhegake inferensi model tercanggih ing kluster riset kanggo proses sing bisa nglakokake kode utawa nggunakake piranti sing bisa ngakses internet. Kita cukup cepet mulihake jalur sing luwih winates lan aman kanggo nglakokake kode, banjur mriksa saben beban kerja siji-siji kanggo nemtokake apa bisa diterusake kanthi aman. Sawetara beban kerja riset diterusake kanthi kontrol anyar iki, dene liyane mbutuhake owah-owahan tambahan.

Sajrone minggu-minggu sabanjure, kita wis nemtokake lan wiwit ngetrapake syarat keamanan sing luwih kuwat kanggo beban kerja riset tercanggih. Tuladhane:

  • Isolasi beban kerja: Saiki kita mbutuhake isolasi sing luwih kuwat (“sandbox”) kanggo beban kerja sing nglakokake kode gaweyane model utawa kode liyane sing ora bisa dipercaya. Iki uga ditrapake tumrap piranti alus sing bisa dibobol nalika ngolah asil model.
  • Isolasi jaringan: Kita wis ngetrapake kontrol luwih akeh kanggo misahake beban kerja kanthi risiko luwih dhuwur lan sing ora bisa dipercaya saka internet. Kontrol iki dirancang supaya yen siji beban kerja utawa layanan panyengkuyung kabobolan, kedadeyan kasebut dhewe ora bisa menehi akses tanpa idin menyang internet utawa jaringan internal liyane.
  • Pengujian keamanan terus-terusan: Kita wis ngatur maneh lingkungan kanggo mbusak layanan bareng sing bisa rawan, nyuda hak akses permanen, lan ningkatake wates keamanan lan kapercayan. Kita uga ningkatake kemampuan kanggo nglumpukake lan ngawasi log keamanan. Pungkasan, kita nandur modal ing otomatisasi sing nggunakake model kita kanggo terus-terusan nguji wates kasebut kanthi simulasi serangan.

Kanthi bebarengan, kontrol kasebut nyedhiyakake pertahanan berlapis lan mbantu ngreksa lingkungan riset kita saka serangan. Saiki, kita mbutuhake pangreksan keamanan kanthi tingkat paling ketat kanggo beban kerja sing nglibatake Astra utawa model siber, amarga kita wis nemtokake yen model Astra bisa uga nduweni kapabilitas siber tingkat kritis. Pangreksan iki uga ditrapake kanggo kabeh beban kerja liyane sing gegayutan karo siber.

Sanajan sawetara pelatihan lan evaluasi Astra wis nyukupi syarat kasebut, akeh beban kerja isih diendhegake nganti kabeh dipindhah lan ditingkatake supaya nyukupi standar keamanan anyar. Kita ngutamakake pamindhahan beban kerja keamanan lan keselarasan menyang lingkungan anyar iki luwih dhisik.

Ngambakake pangawasan ranté pikiran

Pangawasan wis suwe dadi bagean penting saka proses pangembangan model kita, kalebu pangawasan agen pangodean internal lan sesi sing lumaku suwe. Upaya pangawasan kita mligi tumuju marang peluncuran internal model tercanggih lan proses pelatihan RL tercanggih, sing kita anggep minangka beban kerja kanthi risiko paling dhuwur amarga bisa nggabungake kapabilitas model canggih karo akses menyang piranti, sistem sensitif, lan jaringan internal utawa eksternal. Pangawasan kasebut durung ditrapake marang kabeh proses inferensi lan pelatihan sing nggunakake piranti. Kita wis mbenerake lan ngambakake pendekatan nganggo tata pangawasan anyar.

Tata pangawasan anyar iki dumadi saka pirang-pirang tahap, diwiwiti saka panggolong aktivasi (detektor sing mriksa kagiyatan internal model) sing mlaku ing saben token sampel, banjur nambahake prakara sing bisa dadi masalah menyang panyelidik otomatis sing saya canggih lan mbutuhake komputasi gedhe. Sistem kasebut mriksa tumindak piranti, nalar sing kasedhiya, lan sakabehe urutan kagiyatan kanggo nemokake akses tanpa idin, nyolong data, tumindak ngrusak, lan upaya ngalahake pangreksan. Kita ngupaya nerbitake tandha sajrone 30 menit sawise kagiyatan sing mrihatinake kadeteksi dening sistem pangawasan. Yen sistem pangawasan nemokake kemungkinan pelanggaran wates keamanan kritis, sistem bakal ngasilake tandha kanthi prioritas paling dhuwur. Ing penerapan saiki, tim keslametan, keamanan, lan riset bakal dikirimi pawarta darurat. Yen sajrone 30 menit tim kasebut ora bisa mesthekake yen tandha iku positif palsu, tim kudu ngendhegake kagiyatan kasebut.

Pangawasan iki diwajibake kanggo kabeh pelatihan lan evaluasi RL sing nglibatake piranti tumrap model kanthi kapabilitas Sol utawa luwih dhuwur. Sawise kita nemtokake ing 7 Agustus yen Astra bisa uga nduweni kapabilitas siber kritis, kita nambahake syarat pangawasan kanggo kabeh inferensi Astra sing nggunakake piranti (ora mung pelatihan lan evaluasi RL).

Pangreksan iki mbutuhake komputasi sing cukup gedhe. Miturut prakiraan saiki, beban tambahan pangawasan watara 20% saka komputasi inferensi sing diawasi, sanajan biayane beda banget ing antarane beban kerja pelatihan lan evaluasi. Kita bakal nuduhake katrangan luwih akeh babagan sistem iki ing tulisan blog sabanjure.

Majokake riset keselarasan

Riset keselarasan dadi inti misi kita. Misi kita yaiku mesthekake yen kecerdhasan umum tiruan migunani kanggo kabeh manungsa. Nalika model nduweni kapabilitas canggih, kayata kemampuan kanggo nindakake serangan siber, lan makarya ing lingkungan sing luwih rumit, tumindak sing ora selaras—kayata ngapusi ganjaran (nggoleki cara supaya oleh ganjaran dhuwur nalika pelatihan tanpa tenan nggayuh asil sing dikarepake), cidra, utawa akses tanpa idin—bakal nuwuhake risiko sing saya serius.

Kanggo proses RL ing model paling mumpuni, saiki kita ngetrapake teknik keselarasan inti ing luwih akeh tahap proses pelatihan. Iki kalebu ningkatake model ganjaran supaya luwih apik anggone ndeteksi lan nyegah tumindak sing ora aman ing maneka tugas lan lingkungan; nglatih model supaya luwih jujur babagan tumindak, kapabilitas, lan watesane; sarta nyuda tumindak sing manfaatake kekurangan ing ganjaran, pambiji, piranti, utawa pangawasan. Kita uga ngambakake cakupan pelatihan tumrap tumindak sing bisa nyebabake bebaya nalika model sesambungan karo sistem utawa sumber daya eksternal.

Kita terus nandur modal kanthi gedhe ing riset keselarasan, ngambakake cakupan evaluasi, lan nggunakake asil sinaune kanggo nuntun pelatihan lan pangreksan. Ing wektu cedhak, kita arep nuduhake luwih akeh babagan riset keselarasan, kalebu apa sing kita sinaoni ngenani tumindake model lan tantangan anyar sing ditemokake.

Langkah sabanjure

Kita bakal ngembangake Kerangka Kesiapan kanggo nggabungake pangreksan iki ing kabeh pelatihan lan peluncuran, sarta supaya luwih nggambarake kapabilitas model ing mangsa ngarep lan lingkungan panggonan model kasebut makarya. Ngembangake cara sing bisa mundhak skalane manut kapabilitas kasebut bakal mbutuhake investasi terus-terusan ing keamanan kanthi pitulungan model, pangawasan sing luwih efektif, lan kemajuan riset keselarasan sing terus lumaku. Kita arep nglibatake organisasi eksternal lan nuduhake luwih akeh asil sinaune nalika pendekatan iki saya berkembang.

Kapabilitas model tercanggih saya maju kanthi rikat. Kemampuan kita kanggo mangerteni, nyelarasake, lan ngamanake model kasebut kudu tansah luwih maju.


*Kita bakal nerbitake laporan teknis ngenani asil sinaune sajrone sawetara minggu sabanjure.

Pangarang

OpenAI