Third-party cyber evaluation sa mga modelo ng OpenAI
Mahalaga ang independiyenteng pagsusuri sa pagtulong sa aming beripikahin at higit na maunawaan ang mga panganib bago ang deployment. Sadyang gumagamit ang ilang cyber evaluation ng mga custom na configuration, kabilang ang mas maluluwag na safeguard, upang sukatin ang likas na kakayahan—hindi ang karaniwang asal ng mga modelo sa mga deployment na available sa publiko.
Sa mga kamakailang pagsusuri, natukoy ng dalawang external testing partner ang mga insidente kung saan ang pinagsamang testing configuration, mga kontrol, at lumalawak na kakayahan ng mga bagong modelo ay nagbigay-daan sa aktibidad ng modelo na lumampas sa nakalaang hangganan ng pagsusuri. Binibigyang-diin ng mga insidente ang kahalagahan ng pagtutulungan sa buong industriya at sa mga third-party evaluator upang patuloy na mapahusay ang mga pamantayan para sa mga testing environment at kasanayan habang lalo pang humuhusay ang mga modelo. Tala ng Editor: Hiwalay ang mga ito sa insidente sa seguridad ng Hugging Face, at patuloy kaming magbabahagi ng mga update tungkol sa insidente sa Hugging Face dito.
Kinasangkutan ng mga bagong insidente ang mga modelo ng OpenAI na nag-access sa pampublikong internet sa mga third-party cyber evaluation, sa ilalim ng mga partikular na kondisyon at configuration na may mas maluluwag na safeguard at hindi kumakatawan sa karaniwang deployment. Kabilang sa mga insidente ang sumusunod:
- Nagsasagawa ang UK AISI, ang AI Security Institute ng pamahalaan ng UK, ng mga pagsusuri sa cyber range na sadyang may internet access upang makahanap ang mga agent ng sarili nilang tool at kumilos sa mga kondisyong mas katulad ng kinakaharap ng isang tunay na attacker. Naka-disable din ang mga cyber classifier upang masukat ang likas na kakayahan. Mababasa ang kanilang blog dito.(magbubukas sa bagong window)
- Nagsasagawa ang Irregular, isa sa aming mga external cybersecurity testing partner, ng mga pagsusuring tulad ng Capture-the-Flag na dapat ay nakahiwalay sa internet, ngunit dahil sa maling configuration ng testing environment, nakapag-access ang mga modelo sa pampublikong internet.
Sa ibaba, ibinubuod namin ang nangyari, ang mga kondisyon sa pagsusuri na nagbigay-daan sa aktibidad, ang mga hakbang upang makontrol ito, at ang ginagawa namin upang patuloy na makapagsagawa ang mga independiyenteng lab ng masusi at ligtas na pagsusuri sa mga modelong patuloy na humuhusay.
Itinuturo ng mga insidenteng ito ang parehong mas malawak na hamong inilarawan namin sa aming kamakailang post tungkol sa insidente sa Hugging Face: habang lumalawak ang kakayahan ng mga modelo, kailangan ding humusay ang mga sistema ng seguridad at kaligtasan sa paligid ng mga ito. Kabilang dito ang mga environment na ginagamit sa pagbuo ng mga modelo, pati na ang mga environment na ginagamit ng mga lab at independiyenteng partner upang suriin ang mga ito.
Sa mga susunod na linggo, rerepasuhin namin ang sarili naming paraan ng third-party testing, kabilang ang pagtukoy sa mga pagsusuring mas mataas ang panganib, pagkakasundo sa saklaw, pagtatasa sa mga kahilingang payagan ang internet access o luwagan ang mga safeguard, pagtatakda ng mga inaasahan sa isolation, pangangasiwa ng credential, monitoring, at mga kondisyon sa paghinto, at pagbuo ng mas malinaw na proseso para sa pag-uulat at pag-escalate ng insidente.
Nakatuon kaming makipagtulungan sa buong industriya upang patibayin ang mga magkakatulad na kasanayan sa ligtas na pagsasagawa ng mga high-risk na pagsusuri, kabilang ang pagtitipon sa mga stakeholder gaya ng mga pambansang AI institute, independiyenteng evaluator, iba pang AI lab, at iba pang grupo sa mga susunod na linggo. Layunin naming mapanatili ang halaga ng masusing independiyenteng pagsusuri habang tinitiyak na nakasasabay ang mga kasanayan sa pagsubok sa patuloy na paghusay ng mga modelo.
Noong Agosto 3, ipinaalam sa amin ng UK AISI na sa ilang pagkakataon ay lumampas sa saklaw ng pagsubok ang mga modelo mula sa OpenAI at isa pang lab sa isang regular na cyber evaluation na nagsimula noong Hulyo 25. Isinagawa ang pagsusuri sa mga kontroladong cyber range na idinisenyong gayahin ang mga tunay na network. Sa 19 na natukoy na pangyayari, dalawa ang kinasangkutan ng modelo ng OpenAI na GPT‑5.6 Sol. Ang iba pang pagkakataon ay kinasangkutan ng mga modelo mula sa ibang lab.
Para sa pagsusuring ito, inatasan ang mga agent na kumilos bilang mga eksperto sa cybersecurity sa isang capture-the-flag exercise: pasukin ang tatlong magkakaugnay na simulated environment at kunin ang panghuling flag. Tinukoy ng prompt ng gawain ang mga range network na saklaw ng pagsusuri at pinangalanan ang ilang system na wala sa saklaw. Pinagana rin ng UK AISI ang live internet access upang makapag-download ng mga tool ang mga agent at kumilos sa mga kondisyong mas katulad ng kinakaharap ng isang taong attacker—at hindi nito pinagana ang mga cyber classifier ng modelo upang masukat ang likas na kakayahan.
Ang nakalaang hangganan ng awtorisasyon ng UK AISI ay ang simulated cyber range: pinahintulutan ang mga agent na atakihin ang mga tinukoy na simulated network at kunin ang isang flag, ngunit hindi makipag-ugnayan sa mga system sa labas ng network boundary ng range. Gayunman, hindi tahasang sinabi sa mga agent kung paano nila maaari at hindi maaaring gamitin ang open internet access, na tinukoy ng UK AISI bilang isang posibleng sanhi ng insidente.
Sa mga run na ito, natuklasan ng UK AISI na nagsagawa ang GPT‑5.6 Sol ng dalawang pagkilos na walang pahintulot habang naghahanap ng paraan upang makapasok sa simulated range at makuha ang flag:
- Muling ginamit ng GPT‑5.6 Sol ang isang GitHub token na iniwang pampublikong naa-access ng agent ng ibang lab upang alamin kung sinusuri ng isang system sa loob ng cyber range ang GitHub o ibang serbisyo sa pag-update. Sinubukan din nitong lampasan ang mga limitasyon sa pagbawi ng account at mga request, at nagrehistro ng mga account sa mga external DNS at tunneling provider.
- Gumamit ang GPT‑5.6 Sol ng pampublikong tunneling service upang ma-access mula sa pampublikong internet ang isang DNS server na lokal na tumatakbo sa evaluation environment nito. Naglalaman ang server ng mga payload na nakalaan para sa isang kilalang kahinaan sa software na tumatakbo sa test range. Hindi gumana ang setup, walang ebidensiyang nag-query rito ang anumang tunay na resolver, at inalis ang imprastraktura nang matapos ang pagsusuri.
Bagama't sinusubukan ng modelo na kumpletuhin ang cyber range, itinuring ng UK AISI na walang pahintulot ang mga pagkilos na ito dahil gumamit ang mga ito ng mga tunay na external account at serbisyong nasa labas ng hangganan ng range, at hindi kailangan ang mga ito upang makumpleto ang gawain. Nag-host din ang DNS server ng mga exploit payload sa pampublikong internet, bagama't hindi gumana ang setup at walang ebidensiyang nag-query rito ang anumang tunay na resolver.
Natukoy ng UK AISI ang aktibidad noong Hulyo 28 matapos makakita ang security monitoring ng mga di-pangkaraniwang paglilipat ng data. Itinigil nito ang mga kaugnay na pagsusuri, ibinukod ang mga apektadong machine, at nakontrol ang aktibidad sa loob ng humigit-kumulang isang oras mula nang matukoy ito.
Pinahahalagahan namin ang pakikipagtulungan ng UK AISI sa buong prosesong ito, kabilang ang pagtukoy, pagsisiyasat, at pagbabahagi nito ng mga detalye tungkol sa aktibidad. Inaasahan naming maipagpapatuloy ang aming pagtutulungan.
Noong Hulyo 29, ipinaalam sa amin ng Irregular, isa sa aming mga third-party partner sa pagsusuri, ang isang insidenteng kinasasangkutan ng mga modelo ng OpenAI sa mga pagsusuring cybersecurity na tulad ng Capture-the-Flag (CTF). Inatasan ang mga modelo na humanap ng nakatagong impormasyon sa pamamagitan ng pagsasamantala sa mga kahinaan sa loob ng isang simulated environment, at sinabihang wala silang access sa internet. Gayunman, dahil sa maling configuration ng testing environment, nakapag-access ang mga modelo sa pampublikong internet.
Sa isang pagsubok, hindi sinasadyang tumugma sa isang tunay na domain ang pangalan ng kathang-isip na target para sa CTF challenge. Dahil nagkamaling maikonekta sa internet ang testing environment, pinagsamantalahan ng modelo ang isang tunay na website sa pag-aakalang bahagi ito ng simulated environment. Hindi ito kinasangkutan ng isang sopistikadong pagtakas sa sandbox o zero-day: nagkaroon ng internet access dahil sa maling configuration, at lumilitaw na pinagsamantalahan ng modelo ang isang simpleng kahinaan sa seguridad.
Batay sa pagsisiyasat ng Irregular, nakahanap at gumamit din ang modelo ng mga credential upang patakbuhin ang site na iyon. Walang natukoy ang Irregular na epekto bukod sa sariling data ng apektadong site, at nagpapatuloy ang audit nito. Pansamantala nitong itinigil ang mga pagsusuri, sinimulan ang remediation, at inabisuhan ang mga apektadong third party. Ipinaalam sa amin ng Irregular na hindi na aktibo ang lahat ng natukoy na isyung nauugnay sa insidente at nagdagdag na ng mga naaangkop na safeguard sa testing environment. Nagbahagi rin ang Irregular ng impormasyon tungkol sa mga kaugnay na insidenteng kinasasangkutan ng ibang mga lab mula sa parehong testing environment.
Pinahahalagahan namin ang pakikipagtulungan ng Irregular at patuloy kaming makikipagtulungan nang malapitan upang suportahan ang pagsusuri nito. Gumagawa rin ang Irregular ng white paper upang ibahagi ang pinakamahuhusay na kasanayan sa pagkontrol at ligtas na pagsasagawa ng mga cyber evaluation. Inaasahan naming makalahok sa white paper upang maibahagi sa komunidad ang mga natuklasan at maipagpatuloy ang aming pagtutulungan. Itinuturing naming mahalaga ang ganitong pagtutulungan upang matiyak ang ligtas at masusing pagsusuri sa mga kasalukuyan at susunod na modelo.


