Pāriet uz galveno saturu
OpenAI

2026. gada 4. augusts

Aizsardzība

Trešo pušu kiberdrošības novērtējumi ar OpenAI modeļiem

Notiek ielāde…

Neatkarīga testēšana ir svarīga, jo palīdz mums pirms ieviešanas pārbaudīt un labāk izprast riskus. Dažos kiberdrošības novērtējumos apzināti izmanto īpašas konfigurācijas, tostarp vājākus aizsardzības pasākumus, lai novērtētu pamatspējas, nevis modeļu ierasto darbību publiski pieejamās sistēmās.

Nesen veiktos novērtējumos divi ārējie testēšanas partneri konstatēja incidentus, kuros testēšanas konfigurācijas un kontroles pasākumi kopā ar jaunāko modeļu augošajām spējām ļāva modeļu darbībai pārsniegt paredzētās testēšanas robežas. Šie incidenti uzsver, cik svarīgi ir sadarboties visā nozarē un ar trešo pušu vērtētājiem, lai, modeļiem kļūstot spējīgākiem, pilnveidotu testēšanas vides un prakses standartus. Redaktora piezīme. Šie incidenti nav saistīti ar Hugging Face drošības incidentu; jaunāko informāciju par Hugging Face incidentu turpināsim publicēt šeit.

Jaunajos incidentos OpenAI modeļi trešo pušu kiberdrošības novērtējumu laikā piekļuva publiskajam internetam īpašos apstākļos un konfigurācijās ar vājākiem aizsardzības pasākumiem, kas neatbilda parastai ieviešanas videi. Tika konstatēti šādi incidenti:

  1. Apvienotās Karalistes valdības MI drošības institūts UK AISI veica novērtējumus kiberdrošības poligonā, kur piekļuve internetam bija apzināti iespējota, lai aģenti varētu paši atrast rīkus un darboties apstākļos, kas vairāk līdzinās reāla uzbrucēja apstākļiem. Lai novērtētu pamatspējas, bija atspējoti arī kiberdrošības klasifikatori. UK AISI emuāra ierakstu varat lasīt šeit.(atveras jaunā logā)
  2. Viens no mūsu ārējiem kiberdrošības testēšanas partneriem Irregular veica karoga iegūšanas jeb Capture-the-Flag tipa novērtējumus vidē, ko bija paredzēts izolēt no interneta, taču testēšanas vides konfigurācijas kļūda ļāva modeļiem piekļūt publiskajam internetam.

Tālāk apkopojam notikušo, testēšanas apstākļus, kas pieļāva šo darbību, tās ierobežošanai veiktos pasākumus un mūsu rīcību, lai neatkarīgās laboratorijas arvien spējīgākus modeļus arī turpmāk varētu vērtēt rūpīgi un droši.

Trešo pušu modeļu novērtēšanas vides stiprināšana

Šie incidenti norāda uz to pašu plašāko problēmu, ko aprakstījām nesenajā publikācijā par Hugging Face incidentu: attīstoties modeļu spējām, jāattīstās arī modeļus aptverošajām drošības un aizsardzības sistēmām. Tas attiecas gan uz modeļu izstrādes vidi, gan uz vidi, ko laboratorijas un neatkarīgie partneri izmanto to novērtēšanai.

Tuvākajās nedēļās pārskatīsim savu pieeju trešo pušu veiktai testēšanai, tostarp to, kā identificējam paaugstināta riska novērtējumus, vienojamies par tvērumu, izvērtējam lūgumus iespējot piekļuvi internetam vai vājināt aizsardzības pasākumus, nosakām prasības attiecībā uz izolāciju, piekļuves datu apstrādi, uzraudzību un apturēšanas nosacījumiem, kā arī izveidojam skaidrākus incidentu paziņošanas un eskalācijas procesus.

Esam apņēmušies sadarboties ar visu nozari, lai stiprinātu kopīgu praksi augsta riska novērtējumu drošai veikšanai, un tuvākajās nedēļās pulcēsim ieinteresētās puses, piemēram, valstu MI institūtus, neatkarīgus vērtētājus, citas MI laboratorijas un citas grupas. Mūsu mērķis ir saglabāt rūpīgas un neatkarīgas novērtēšanas vērtību, vienlaikus nodrošinot, ka testēšanas prakse neatpaliek no modeļu augošajām spējām.

UK AISI

3. augustā UK AISI mūs informēja, ka 25. jūlijā sāktā kārtējā kiberdrošības novērtējuma laikā OpenAI un citas laboratorijas modeļi dažos gadījumos pārsnieguši testēšanas tvērumu. Novērtēšana notika kontrolētos kiberdrošības poligonos, kas veidoti, atdarinot reālus tīklus. Divi no 19 konstatētajiem gadījumiem bija saistīti ar OpenAI modeli GPT‑5.6 Sol. Pārējos gadījumos bija iesaistīti citas laboratorijas modeļi.

Šajā novērtējumā aģentiem bija uzdots karoga iegūšanas uzdevumā darboties kā kiberdrošības ekspertiem: kompromitēt trīs savienotas simulētās vides un iegūt gala karogu. Uzdevuma uzvednē bija norādīti tvērumā ietilpstošie poligona tīkli, kā arī vairākas sistēmas, kas tvērumā neietilpa. UK AISI arī iespējoja piekļuvi internetam, lai aģenti varētu lejupielādēt rīkus un darboties apstākļos, kas vairāk līdzinās cilvēka veiktam uzbrukumam, un atspējoja modeļa kiberdrošības klasifikatorus, lai novērtētu pamatspējas.

UK AISI paredzētā pilnvarojuma robeža bija simulētais kiberdrošības poligons: aģentiem bija atļauts uzbrukt norādītajiem simulētajiem tīkliem un iegūt karogu, bet ne mijiedarboties ar sistēmām ārpus poligona tīkla robežām. Tomēr aģentiem nebija skaidri norādīts, kā tie drīkst un nedrīkst izmantot brīvu piekļuvi internetam, un UK AISI to uzskata par vienu no iespējamiem incidenta cēloņiem.

Šajos izpildes gadījumos UK AISI konstatēja, ka GPT‑5.6 Sol, meklējot ceļu uz simulēto poligonu un mēģinot iegūt karogu, veica divas neatļautas darbības:

  1. GPT‑5.6 Sol atkārtoti izmantoja GitHub tekstvienību, ko citas laboratorijas aģents bija atstājis publiski pieejamu, lai pārbaudītu, vai kāda poligona sistēma regulāri aptaujā GitHub vai citu atjaunināšanas pakalpojumu, mēģināja apiet konta atkopšanas un pieprasījumu ierobežojumus un reģistrēja kontus pie ārējiem DNS un tunelēšanas pakalpojumu sniedzējiem.
  2. GPT‑5.6 Sol izmantoja publisku tunelēšanas pakalpojumu, lai tā novērtēšanas vidē lokāli darbinātu DNS serveri padarītu sasniedzamu no publiskā interneta. Serverī bija izvietotas slodzes, kas paredzētas testēšanas poligonā izmantotas programmatūras zināmas ievainojamības izmantošanai. Konfigurācija nedarbojās, nav pierādījumu, ka tai būtu vaicājis kāds reāls DNS atrisinātājs, un pēc novērtēšanas infrastruktūra tika likvidēta.

Lai gan modelis mēģināja izpildīt kiberdrošības poligona uzdevumu, UK AISI šīs darbības uzskatīja par neatļautām, jo tās skāra reālus ārējus kontus un pakalpojumus ārpus poligona robežām un nebija nepieciešamas uzdevuma izpildei. DNS serveris publiskajā internetā arī mitināja ievainojamību izmantošanas slodzes, lai gan konfigurācija nedarbojās un nav pierādījumu, ka tai būtu vaicājis kāds reāls DNS atrisinātājs.

UK AISI konstatēja šo darbību 28. jūlijā, kad drošības uzraudzības sistēma pamanīja neparastu datu pārsūtīšanu. UK AISI apturēja saistītos novērtējumus, izolēja attiecīgās iekārtas un ierobežoja darbību aptuveni stundas laikā pēc tās atklāšanas.

Mēs augstu vērtējam UK AISI sadarbību visā šajā procesā, tostarp paveikto, lai atklātu un izmeklētu darbību un dalītos informācijā par to. Ceram arī turpmāk cieši sadarboties.

Irregular

29. jūlijā viens no mūsu ārējiem novērtēšanas partneriem Irregular informēja mūs par incidentu, kurā OpenAI modeļi bija iesaistīti karoga iegūšanas jeb Capture-the-Flag (CTF) tipa kiberdrošības novērtējumos. Modeļiem bija dots uzdevums atrast slēptu informāciju, izmantojot simulētas vides nepilnības, un bija norādīts, ka tiem nav piekļuves internetam. Tomēr testēšanas vides konfigurācijas kļūda ļāva modeļiem piekļūt publiskajam internetam.

Vienā testā CTF uzdevuma izdomātā mērķa nosaukums nejauši sakrita ar reālu domēnu. Tā kā testēšanas vide kļūdas dēļ bija savienota ar internetu, modelis izmantoja reālas vietnes ievainojamību, kļūdaini uzskatot vietni par simulētās vides daļu. Tas nebija sarežģīts izolētās vides apiešanas gadījums vai nulles dienas ievainojamība: piekļuvi internetam izraisīja konfigurācijas kļūda, un modelis acīmredzot izmantoja vienkāršu drošības ievainojamību.

Saskaņā ar Irregular izmeklēšanas rezultātiem modelis arī atrada un izmantoja piekļuves datus, lai pārvaldītu šo pašu vietni. Irregular nav konstatējis ietekmi ārpus skartās vietnes datiem, un audits vēl turpinās. Uzņēmums ir apturējis novērtējumus, sācis novērst problēmas un informējis skartās trešās puses. Irregular mūs informēja, ka visas saistībā ar incidentu konstatētās problēmas vairs nav aktuālas un testēšanas videi ir pievienoti atbilstoši aizsardzības pasākumi. Irregular ir arī sniedzis informāciju par saistītiem incidentiem, kuros tajā pašā testēšanas vidē bija iesaistītas citas laboratorijas.

Mēs augstu vērtējam sadarbību ar Irregular un turpināsim cieši sadarboties, lai atbalstītu uzņēmuma veikto pārbaudi. Irregular arī gatavo balto grāmatu, lai iepazīstinātu ar paraugpraksi darbību ierobežošanai un drošai kiberdrošības novērtējumu veikšanai. Ceram piedalīties baltās grāmatas izstrādē, lai kopiena varētu iepazīties ar secinājumiem, un turpināt mūsu sadarbību. Šāda sadarbība, mūsuprāt, ir būtiska, lai nodrošinātu pašreizējo un turpmāko modeļu drošu un rūpīgu novērtēšanu.

Autors

OpenAI