Ugrás a fő tartalomra
OpenAI

2026. augusztus 4.

Kiberbiztonság

OpenAI-modelleket érintő külső kiberbiztonsági értékelések

Betöltés…

A független tesztelés fontos szerepet játszik abban, hogy az üzembe helyezés előtt ellenőrizhessük és jobban megérthessük a kockázatokat. Egyes kiberbiztonsági értékelések szándékosan egyedi beállításokat, köztük csökkentett védelmet alkalmaznak a modellek tényleges képességeinek mérésére – nem pedig annak vizsgálatára, hogyan viselkednek általában a nyilvánosan elérhető rendszerekben.

A közelmúltbeli értékelések során két külső tesztpartnerünk olyan incidenseket azonosított, amelyekben a tesztelési beállítások és ellenőrzések, valamint az újabb modellek fejlődő képességei együttesen lehetővé tették, hogy a modellek tevékenysége túllépje a tesztelés tervezett határait. Az incidensek rávilágítanak arra, hogy a modellek képességeinek fejlődésével párhuzamosan az egész ágazatnak és a külső értékelőknek együtt kell fejleszteniük a tesztkörnyezetekre és tesztelési gyakorlatokra vonatkozó szabványokat. Szerkesztői megjegyzés: Ezek az esetek nem kapcsolódnak a Hugging Face biztonsági incidenséhez. A Hugging Face incidensével kapcsolatos frissítéseket továbbra is itt tesszük közzé.

Az új incidensek során OpenAI-modellek fértek hozzá a nyilvános internethez külső felek kiberbiztonsági értékelései közben, olyan meghatározott körülmények és csökkentett védelmi beállítások mellett, amelyek nem tükrözték a szokásos üzemeltetést. Az incidensek a következők voltak:

  1. A UK AISI, az Egyesült Királyság kormányának AI-biztonsági intézete olyan kiberbiztonsági tesztkörnyezetekben végzett értékeléseket, ahol szándékosan engedélyezték az internet-hozzáférést, hogy az ügynökök maguk találhassák meg eszközeiket, és a valódi támadókéhoz közelebb álló körülmények között működhessenek. A tényleges képességek méréséhez a kiberbiztonsági osztályozókat is kikapcsolták. A UK AISI blogbejegyzése itt olvasható.(új ablakban nyílik meg)
  2. Az Irregular, egyik külső kiberbiztonsági tesztpartnerünk, az internettől elvileg elszigetelt, zászlófoglalásos értékeléseket végzett, de a tesztkörnyezet hibás beállítása lehetővé tette, hogy a modellek hozzáférjenek a nyilvános internethez.

Az alábbiakban összefoglaljuk a történteket, a tevékenységet lehetővé tevő tesztelési körülményeket, a megfékezés érdekében tett lépéseket, valamint azt, hogyan biztosítjuk, hogy a független laborok továbbra is alaposan és biztonságosan értékelhessék az egyre fejlettebb modelleket.

A külső felek modellértékelési környezeteinek megerősítése

Ezek az incidensek ugyanarra az általánosabb kihívásra világítanak rá, amelyet a Hugging Face incidenséről szóló közelmúltbeli bejegyzésünkben ismertettünk: ahogy fejlődnek a modellek képességei, úgy kell fejlődniük a modelleket körülvevő biztonsági és védelmi rendszereknek is. Ez egyaránt vonatkozik a modellek fejlesztésére használt környezetekre, valamint azokra, amelyekben a laborok és a független partnerek értékelik őket.

A következő hetekben felülvizsgáljuk a külső felek által végzett tesztelésre vonatkozó saját megközelítésünket. Ennek keretében áttekintjük, hogyan azonosítjuk a nagyobb kockázatú értékeléseket, hogyan állapodunk meg azok hatóköréről, hogyan bíráljuk el az internet-hozzáférés vagy a csökkentett védelem engedélyezésére irányuló kérelmeket, milyen elvárásokat támasztunk az elszigetelés, a hitelesítő adatok kezelése, a megfigyelés és a leállítási feltételek terén, valamint hogyan alakíthatunk ki egyértelműbb incidensbejelentési és eszkalációs folyamatokat.

Elkötelezettek vagyunk az ágazati együttműködés mellett, hogy megerősítsük a nagy kockázatú értékelések biztonságos végrehajtására vonatkozó közös gyakorlatokat. Ennek részeként a következő hetekben olyan érintetteket hívunk össze, mint a nemzeti AI-intézetek, a független értékelők, más AI-laborok és egyéb szervezetek. Célunk, hogy megőrizzük az alapos, független értékelés értékét, miközben biztosítjuk, hogy a tesztelési gyakorlatok lépést tartsanak az egyre fejlettebb modellekkel.

UK AISI

Augusztus 3-án a UK AISI arról tájékoztatott bennünket, hogy az OpenAI és egy másik labor modelljei néhány esetben túllépték a tesztelés hatókörét egy július 25-én megkezdett rutin kiberbiztonsági értékelés során. Az értékelés valós hálózatokat utánzó, ellenőrzött kiberbiztonsági tesztkörnyezetekben zajlott. A 19 azonosított esetből kettőben egy OpenAI-modell, a GPT‑5.6 Sol vett részt. A többi eset egy másik labor modelljeit érintette.

Ebben az értékelésben az ügynökök azt az utasítást kapták, hogy kiberbiztonsági szakértőként járjanak el egy zászlófoglalásos gyakorlatban: törjenek fel három összekapcsolt szimulált környezetet, és szerezzék meg a végső zászlót. A feladathoz adott utasítás meghatározta a hatókörbe tartozó teszthálózatokat, és több rendszert is kifejezetten kizárt a hatókörből. A UK AISI élő internet-hozzáférést is engedélyezett, hogy az ügynökök eszközöket tölthessenek le, és az emberi támadókéhoz közelebb álló körülmények között működhessenek. Emellett kikapcsolta a modell kiberbiztonsági osztályozóit a tényleges képességek méréséhez.

A UK AISI szándéka szerint az engedélyezett tevékenység határa a szimulált kiberbiztonsági tesztkörnyezet volt: az ügynökök engedélyt kaptak a meghatározott szimulált hálózatok megtámadására és a zászló megszerzésére, de a tesztkörnyezet hálózati határán kívüli rendszerekkel való interakcióra nem. Az ügynökök azonban nem kaptak egyértelmű utasítást arra vonatkozóan, hogy mire használhatják és mire nem a nyílt internet-hozzáférést. A UK AISI ezt az incidens egyik lehetséges kiváltó okaként azonosította.

E futtatások során a UK AISI megállapította, hogy a GPT‑5.6 Sol két nem engedélyezett műveletet hajtott végre, miközben megpróbált bejutni a szimulált tesztkörnyezetbe és megszerezni a zászlót:

  1. A GPT‑5.6 Sol újra felhasznált egy GitHub-tokent, amelyet egy másik labor ügynöke nyilvánosan hozzáférhetően hagyott, hogy ellenőrizze, a tesztkörnyezet valamelyik rendszere lekérdezi-e a GitHubot vagy más frissítési szolgáltatást. Emellett fiók-helyreállítási és kéréskorlát-megkerülési módszerekkel próbálkozott, valamint fiókokat regisztrált külső DNS- és alagútszolgáltatóknál.
  2. A GPT‑5.6 Sol egy nyilvános alagútszolgáltatással tette a nyilvános internetről elérhetővé az értékelési környezetében helyileg futó DNS-kiszolgálót. A kiszolgáló olyan támadókódokat tartalmazott, amelyeket a tesztkörnyezetben futó egyik szoftver ismert sérülékenységének kihasználására szántak. A megoldás nem működött, nincs bizonyíték arra, hogy bármely valódi DNS-feloldó lekérdezte volna, az infrastruktúrát pedig az értékelés befejeztével eltávolították.

Bár a modell a kiberbiztonsági feladatot próbálta teljesíteni, a UK AISI nem engedélyezettnek minősítette ezeket a műveleteket, mivel a tesztkörnyezet határán kívüli, valódi külső fiókokat és szolgáltatásokat érintettek, és nem voltak szükségesek a feladat teljesítéséhez. A DNS-kiszolgáló támadókódokat is elérhetővé tett a nyilvános interneten, de a megoldás nem működött, és nincs bizonyíték arra, hogy bármely valódi DNS-feloldó lekérdezte volna.

A UK AISI július 28-án azonosította a tevékenységet, miután a biztonsági megfigyelőrendszer szokatlan adatátvitelt észlelt. Leállította a kapcsolódó értékeléseket, elkülönítette az érintett gépeket, és az észleléstől számított nagyjából egy órán belül megfékezte a tevékenységet.

Nagyra értékeljük a UK AISI együttműködését a folyamat során, beleértve a tevékenység azonosítására és kivizsgálására, valamint a részletek megosztására irányuló munkáját. Várjuk együttműködésünk folytatását.

Irregular

Július 29-én egyik külső értékelőpartnerünk, az Irregular értesített bennünket egy incidensről, amely OpenAI-modelleket érintett zászlófoglalásos (Capture the Flag, CTF) kiberbiztonsági értékelések során. A modellek azt az utasítást kapták, hogy egy szimulált környezet gyengeségeit kihasználva találjanak meg rejtett információkat, és úgy tájékoztatták őket, hogy nincs internet-hozzáférésük. A tesztkörnyezet hibás beállítása azonban lehetővé tette, hogy a modellek hozzáférjenek a nyilvános internethez.

Az egyik tesztben a CTF-feladat fiktív célpontjának neve véletlenül megegyezett egy valódi domainnel. Mivel a tesztkörnyezet tévedésből csatlakozott az internethez, a modell feltört egy valódi webhelyet, mert azt a szimulált környezet részének vélte. Nem egy kifinomult tesztkörnyezetből való kitörésről vagy nulladik napi sérülékenységről volt szó: az internet-hozzáférést hibás beállítás tette lehetővé, a modell pedig vélhetően egy egyszerű biztonsági rést használt ki.

Az Irregular vizsgálata szerint a modell hitelesítő adatokat is talált, és ezekkel működtette ugyanazt a webhelyet. Az Irregular az érintett webhely saját adatain túl nem azonosított más hatást, ellenőrzése pedig még folyamatban van. A cég szünetelteti az értékeléseket, megkezdte a helyreállítást, az érintett külső feleket pedig értesítették. Az Irregular arról tájékoztatott bennünket, hogy az incidenssel kapcsolatban azonosított problémák már nem állnak fenn, és a tesztkörnyezetet megfelelő védelmi intézkedésekkel egészítették ki. Az Irregular az ugyanebben a tesztkörnyezetben más laborokat érintő kapcsolódó incidensekről is tájékoztatást adott.

Nagyra értékeljük az Irregular együttműködését, és továbbra is szorosan együtt dolgozunk vele a vizsgálat támogatásán. Az Irregular szakmai tanulmányt is készít, amelyben megosztja a kiberbiztonsági értékelések megfékezésére és biztonságos végrehajtására vonatkozó bevált gyakorlatokat. Örömmel veszünk részt a tanulmány elkészítésében, hogy az eredményeket a szakmai közösség számára is hozzáférhetővé tegyük, és várjuk együttműködésünk folytatását. Az ilyen együttműködést elengedhetetlennek tartjuk a jelenlegi és jövőbeli modellek biztonságos és alapos értékeléséhez.

Szerző

OpenAI