Penilaian siber pihak ketiga melibatkan model OpenAI
Ujian bebas memainkan peranan penting untuk membantu kami mengesahkan dan memahami risiko dengan lebih mendalam sebelum penggunaan. Sesetengah penilaian siber sengaja menggunakan konfigurasi tersuai, termasuk langkah perlindungan yang dikurangkan, untuk mengukur keupayaan asas—bukan cara model lazimnya berkelakuan apabila digunakan dalam perkhidmatan awam.
Semasa penilaian baru-baru ini, dua rakan ujian luar mengenal pasti insiden apabila gabungan konfigurasi dan kawalan ujian dengan peningkatan keupayaan model terkini membolehkan aktiviti model melangkaui sempadan ujian yang ditetapkan. Insiden ini menekankan pentingnya kerjasama seluruh industri dan dengan penilai pihak ketiga untuk memperbaharui piawaian persekitaran serta amalan ujian sejajar dengan peningkatan keupayaan model. Nota Editor: Insiden ini berasingan daripada insiden keselamatan Hugging Face, dan kami akan terus berkongsi perkembangan tentang insiden Hugging Face di sini.
Insiden baharu ini melibatkan model OpenAI yang mengakses internet awam semasa penilaian siber pihak ketiga dalam keadaan tertentu dan dengan konfigurasi perlindungan yang dikurangkan, yang tidak mencerminkan penggunaan biasa. Insiden tersebut termasuk:
- UK AISI, Institut Keselamatan AI kerajaan UK, menjalankan penilaian medan siber dengan akses internet sengaja didayakan supaya ejen dapat mencari alat sendiri dan beroperasi dalam keadaan yang lebih menyerupai penyerang sebenar, manakala pengelas siber dilumpuhkan untuk mengukur keupayaan asas. Anda boleh membaca blog mereka di sini.(dibuka dalam tetingkap baru)
- Irregular, salah satu rakan ujian keselamatan siber luar kami, menjalankan penilaian gaya Capture-the-Flag yang sepatutnya diasingkan daripada internet, tetapi kesilapan konfigurasi persekitaran ujian membolehkan model mengakses internet awam.
Di bawah, kami merumuskan perkara yang berlaku, keadaan ujian yang membolehkan aktiviti tersebut, langkah pembendungan yang diambil dan usaha kami untuk memastikan makmal bebas dapat terus menilai model yang semakin berkeupayaan secara teliti dan selamat.
Insiden ini menunjukkan cabaran lebih luas yang sama seperti yang kami huraikan dalam siaran baru-baru ini tentang insiden Hugging Face: apabila keupayaan model meningkat, sistem keselamatan dan perlindungan di sekeliling model juga perlu dipertingkatkan. Ini merangkumi persekitaran yang digunakan untuk membangunkan model serta persekitaran yang digunakan oleh makmal dan rakan bebas untuk menilainya.
Dalam minggu-minggu akan datang, kami akan menyemak pendekatan sendiri terhadap ujian pihak ketiga, termasuk cara kami mengenal pasti penilaian berisiko lebih tinggi, menyepakati skop, menilai permintaan untuk mendayakan akses internet atau mengurangkan langkah perlindungan, menetapkan jangkaan bagi pengasingan, pengendalian bukti kelayakan, pemantauan dan syarat penghentian, serta mewujudkan proses pemberitahuan dan peningkatan insiden yang lebih jelas.
Kami komited untuk bekerjasama dengan seluruh industri bagi memperkukuh amalan bersama untuk menjalankan penilaian berisiko tinggi secara selamat, termasuk menghimpunkan pihak berkepentingan seperti institut AI kebangsaan, penilai bebas, makmal AI lain dan kumpulan lain dalam minggu-minggu akan datang. Matlamat kami adalah untuk mengekalkan nilai penilaian bebas yang teliti sambil memastikan amalan ujian seiring dengan peningkatan keupayaan model.
Pada 3 Ogos, UK AISI memaklumkan kami bahawa semasa penilaian siber rutin yang bermula pada 25 Julai, model daripada OpenAI dan sebuah makmal lain telah melangkaui skop ujian dalam beberapa keadaan. Penilaian itu berlangsung dalam medan siber terkawal yang direka untuk meniru rangkaian dunia sebenar. Daripada 19 kejadian yang dikenal pasti, dua melibatkan model OpenAI, GPT‑5.6 Sol. Kejadian lain melibatkan model daripada makmal lain.
Untuk penilaian ini, ejen diarahkan bertindak sebagai pakar keselamatan siber dalam latihan capture-the-flag: menembusi tiga persekitaran simulasi yang saling bersambung dan mendapatkan bendera terakhir. Gesaan tugasan mengenal pasti rangkaian medan ujian yang berada dalam skop dan menyatakan beberapa sistem sebagai di luar skop. UK AISI turut mendayakan akses internet langsung supaya ejen dapat memuat turun alat dan beroperasi dalam keadaan yang lebih menyerupai penyerang manusia—serta melumpuhkan pengelas siber model untuk mengukur keupayaan asas.
Sempadan kebenaran yang ditetapkan oleh UK AISI ialah medan siber simulasi: ejen dibenarkan menyerang rangkaian simulasi yang ditentukan dan mendapatkan bendera, tetapi tidak dibenarkan berinteraksi dengan sistem di luar sempadan rangkaian medan tersebut. Namun, ejen tidak diberitahu secara jelas tentang cara akses internet terbuka boleh atau tidak boleh digunakan, yang dikenal pasti oleh UK AISI sebagai kemungkinan faktor penyumbang kepada insiden tersebut.
Dalam semua pelaksanaan ini, UK AISI mendapati bahawa GPT‑5.6 Sol melakukan dua tindakan tanpa kebenaran ketika cuba mencari laluan masuk ke medan simulasi dan mendapatkan bendera:
- GPT‑5.6 Sol menggunakan semula token GitHub yang dibiarkan boleh diakses secara terbuka oleh ejen makmal lain untuk memeriksa sama ada sistem dalam medan ujian sedang membuat tinjauan berkala terhadap GitHub atau perkhidmatan kemas kini lain, mencuba pemulihan akaun dan kaedah mengatasi had permintaan, serta mendaftarkan akaun dengan penyedia DNS luaran dan perkhidmatan penerowongan.
- GPT‑5.6 Sol menggunakan perkhidmatan penerowongan awam untuk membolehkan pelayan DNS yang berjalan secara setempat dalam persekitaran penilaiannya dicapai melalui internet awam. Pelayan itu mengandungi muatan yang bertujuan mengeksploitasi kerentanan yang diketahui dalam perisian yang berjalan di medan ujian. Konfigurasi itu tidak berfungsi, tiada bukti bahawa mana-mana penyelesai sebenar telah membuat pertanyaan kepadanya, dan infrastruktur tersebut dialih keluar apabila penilaian berakhir.
Walaupun model itu cuba menyelesaikan tugasan di medan siber, UK AISI menganggap tindakan ini tidak dibenarkan kerana melibatkan akaun dan perkhidmatan luaran sebenar di luar sempadan medan ujian serta tidak diperlukan untuk menyelesaikan tugasan. Pelayan DNS itu turut mengehoskan muatan eksploit di internet awam, walaupun konfigurasi tersebut tidak berfungsi dan tiada bukti bahawa mana-mana resolver sebenar telah membuat pertanyaan kepadanya.
UK AISI mengenal pasti aktiviti itu pada 28 Julai selepas pemantauan keselamatan mengesan pemindahan data yang luar biasa. UK AISI menghentikan penilaian berkaitan, mengasingkan mesin yang terlibat dan membendung aktiviti itu dalam tempoh kira-kira sejam selepas dikesan.
Kami menghargai kerjasama UK AISI sepanjang proses ini, termasuk usahanya mengenal pasti, menyiasat dan berkongsi butiran tentang aktiviti tersebut. Kami berharap dapat meneruskan kerjasama ini.
Pada 29 Julai, Irregular, salah satu rakan penilaian pihak ketiga kami, memaklumkan kepada kami tentang insiden yang melibatkan model OpenAI semasa penilaian keselamatan siber gaya Capture-the-Flag (CTF). Model tersebut diarahkan mencari maklumat tersembunyi dengan mengeksploitasi kelemahan dalam persekitaran simulasi dan diberitahu bahawa model itu tidak mempunyai akses internet. Namun, kesilapan konfigurasi dalam persekitaran ujian membolehkan model tersebut mengakses internet awam.
Dalam satu ujian, nama sasaran rekaan bagi cabaran CTF secara tidak sengaja bertepatan dengan domain sebenar. Oleh sebab persekitaran ujian tersambung ke internet secara tidak sengaja, model itu mengeksploitasi laman web sebenar kerana menyangkanya sebahagian daripada persekitaran simulasi. Ini tidak melibatkan pelepasan daripada kotak pasir yang canggih atau kerentanan sifar hari: akses internet itu berpunca daripada kesilapan konfigurasi dan model tersebut kelihatan mengeksploitasi kerentanan keselamatan asas.
Berdasarkan siasatan Irregular, model itu turut menemui dan menggunakan bukti kelayakan untuk mengendalikan laman yang sama. Irregular tidak mengenal pasti sebarang kesan selain terhadap data milik laman yang terjejas, dan auditnya masih diteruskan. Irregular telah menghentikan sementara penilaian tersebut dan memulakan pemulihan, manakala pihak ketiga yang terjejas telah dimaklumkan. Irregular telah memaklumkan kepada kami bahawa semua isu yang dikenal pasti berkaitan insiden itu tidak lagi aktif dan langkah perlindungan yang berkaitan telah ditambahkan pada persekitaran ujian. Irregular juga telah memaklumkan tentang insiden berkaitan yang melibatkan makmal lain dalam persekitaran ujian yang sama.
Kami menghargai kerjasama Irregular dan akan terus bekerjasama rapat dengannya bagi menyokong semakan yang dijalankan. Irregular juga sedang menyediakan kertas putih untuk berkongsi amalan terbaik bagi pembendungan dan pelaksanaan penilaian siber secara selamat. Kami berharap dapat menyumbang kepada kertas putih itu untuk menyediakan penemuan tersebut kepada komuniti dan meneruskan kerjasama ini. Kami menganggap kerjasama seperti ini penting bagi memastikan model semasa dan akan datang dinilai secara selamat dan menyeluruh.


