Liwati menyang isi utama
OpenAI

30 September 2026

Keamanan

Nggagalake kampanye distilasi model sing dikoordinasi

Lagi dimuat…

Bubar iki kita nemokake lan nggagalake kampanye sing dikoordinasi kanggo ngekstrak nalar sing dilindhungi saka model kita. Aktivitas paling awal sing kita temokake dumadi ing minggu kapisan sasi Juli. Aktivitas iki nuduhake ciri distilasi adversarial: nggunakake output utawa nalar saka sawijining model kanthi sistematis lan tanpa idin kanggo mbantu nglatih, niru, utawa ningkatake model liyane. Nalar sing dilindhungi yaiku cathetan internal model nalika ngrampungake tugas. Ekstraksi nalar iki bisa mbukak informasi sing ora dilebokake ing wangsulan pungkasan lan mbantu pihak liya niru kabisane model.

Para pelaku ora bisa mbobol enkripsi kita, nyusupi basis data, utawa entuk akses langsung menyang pacelathon pangguna sing disimpen. Nanging, dheweke ngapusi interaksi karo model supaya nalar sing dilindhungi bisa diasilake maneh ing wujud sing katon dening pihak sing njaluk. Tumindak iki ditindakake kanthi dikoordinasi lan ing skala gedhe, saengga nglanggar syarat layanan kita. Manipulasi iki dudu kerentanan sing mung ana ing model OpenAI. Kita wis nuduhake informasi babagan iki marang mitra industri liwat Frontier Model Forum kanggo nguwatake pertahanan bebarengan nglawan distilasi adversarial.

Sadurunge nerbitake informasi iki, kita nliti cakupan lan dampak sing bisa kedadeyan, ngetrapake langkah mitigasi dhewe, sarta nuduhake informasi lan nampa pamrayoga saka peneliti lan mitra industri kanggo mesthekake yen pangayoman nglawan serangan jinis iki wis ditrapake. Upaya mitigasi lan investigasi tambahan isih diterusake. Kita yakin yen nuduhake apa sing wis kita sinaoni saiki bakal mbantu ekosistem sing luwih amba nguwatake pertahanane.

Apa sing kita temokake

Kita weruh para pelaku nyoba ngekstrak nalar sing dilindhungi nganggo cara anyar, kalebu nyalin nalar sing dienkripsi saka sawijining pacelathon, banjur njaluk model ing pacelathon liyane kanggo ndekripsi lan nyathet isine nalar sing didhelikake iku.

Peneliti keamanan independen⁠(mbukak ing jendhela anyar) uga nglaporake kerentanan sing gegandhengan ing antarane model lan ing proses pemadatan pacelathon marang kita liwat prosedur pambocoran sing tanggung jawab. Kita nliti temuan kasebut lan mesthekake yen jalur serangan sing ditemokake pancen nyata. Pakaryane mbantu kita mangerteni kategori serangan sing luwih amba lan nyepetake mitigasi.

Aktivitas kasebut diwiwiti tanggal 1 Juli, wiwitane kanthi volume sithik. Banjur kita weruh lonjakan gedhe tanggal 24 lan 25 Juli, yaiku 16.000 panjaluk1 saka luwih saka 4.000 pangguna sing nggunakake pola ekstraksi sing gegandhengan. Investigasi sabanjure nemokake aktivitas kanthi pola prompt sing gegandhengan ing sawijining klompok sing cacahe luwih saka 15.000 pangguna. Kabeh aktivitas iki wis kasil kita mandhegake ing tanggal 28 Juli.

Aktivitas iki owah saka wektu menyang wektu, negesake yen distilasi adversarial minangka tantangan keamanan sing luwih amba lan mbutuhake pertahanan sing dilapisi lan bisa adaptasi.

Pambiji kita babagan pihak sing tanggung jawab

Durung cetha apa kabeh pelaku sing kita amati sajrone wektu kasebut asale saka siji pihak. Nanging, kita mbiji yen klompok inti aktivitas kasebut ditindakake dening wong-wong sing ana gandheng cenenge karo Moonshot AI, pangembang Kimi.

Ngapa iki penting

Distilasi adversarial nuwuhake risiko tumrap kaslametan lan keamanan nasional. Nalar sing diekstrak bisa digunakake kanggo nglatih model liyane tanpa njaga pangayoman sing ditrapake ing output model asli sing dituduhake marang pangguna. Ing skala gedhe, distilasi uga bisa nyepetake pamindhahan kabisan canggih tanpa mbutuhake investasi sing padha kanggo kaslametan. Bab-bab iki saya gawe kuwatir nalika model saya duwe kabisan ing bidang sing bisa digunakake kanggo tujuan sipil utawa militer.

Risiko iki ora mung diadhepi OpenAI. Kaya sing kasebut ing ndhuwur, teknik sing padha bisa mengaruhi sistem AI canggih liyane. Mula, iki dadi tantangan keamanan bebarengan sing mbutuhake koordinasi ing saindenging industri.

Langkah sing kita tindakake

Kita nanggulangi kampanye distilasi sing lagi wae kedadeyan iki kanthi gabungan tumindak marang akun sing nglanggar, kontrol teknis, lan koordinasi karo mitra. Kita mblokir utawa matesi akun palsu, nguwatake kontrol ing proses pendaftaran lan infrastruktur, sarta nggedhekake cakupan pamantauan jaringan sing gegandhengan.

Kita uga nguwatake pangayoman kanggo nalar sing didhelikake ing antarane pangguna, ruang kerja, organisasi, lan kulawarga model. Kita nutup jalur sing sadurunge ngidini wong sing wis duwe nalar pangguna liya sing dienkripsi kanggo ngirim maneh nalar kasebut lan mbukak isine. Kita uga nambah pamriksan kanggo ndeteksi lan nahan output sing dikirim kanthi streaming sing bisa mbukak nalar. Nalika aktivitas sing gegandhengan pindhah menyang layanan pihak katelu, kita kerja bareng karo panyedhiya layanan kasebut kanggo ngenali lan mandhegake akun sing melu.

Pungkasan, kita nuduhake temuan sing relevan liwat Frontier Model Forum lan saluran ijol-ijolan informasi pamarentah sing cocog, supaya pangembang model tercanggih liyane lan mitra sektor publik bisa nggoleki aktivitas sing padha lan nguwatake pertahanane dhewe. Sistem sing ndhukung artefak nalar sing bisa dipindhah utawa dikirim maneh bisa ngadhepi risiko sing gegandhengan.

Langkah sabanjure

Kita ngira upaya distilasi adversarial bakal saya canggih nalika model tercanggih saya apik lan para pelaku golek cara sing luwih murah kanggo niru kabisane. Kanggo nglawan aktivitas iki, dibutuhake kontrol sing dilapisi lan adaptasi terus-terusan.

Pakaryan iki durung rampung. Sistem sing dioperasikake ing infrastruktur mitra mbutuhake pangayoman sing padha karo layanan sing kita kelola dhewe. Serangan liwat output piranti uga mbutuhake pangayoman sing ora mung mriksa teks lumrah sing katon. Kita terus ningkatake pertahanan piranti, cakupan sistem klasifikasi, lan kemampuan model kanggo nolak panjaluk, sarta ngetrapake kontrol sing relevan ing kabeh mitra komputasi awan.

Tanggapan kita bakal terus fokus ing telung bidang: pangayoman teknis sing luwih kuwat kanggo nyegah ekstraksi, deteksi lan penindakan sing luwih apik marang kampanye sing dikoordinasi, sarta ijol-ijolan informasi ancaman sing luwih jero ing antarane industri lan pamarentah.

Penulis

OpenAI

Cathetan sikil

  1. 1

    Angka-angka iki nuduhake upaya ekstraksi, sing durung mesthi kasil.