Ugrás a fő tartalomra
OpenAI

2026. július 21.

Kiberbiztonság

Az OpenAI és a Hugging Face együtt kezeli a modellértékelés közbeni biztonsági incidenst

Betöltés…

Alapos felülvizsgálatot végzünk külső tanácsadók bevonásával, a Biztonsági és Védelmi Bizottság felügyelete mellett. Amint a felülvizsgálat befejeződik, a következő hetekben közzéteszünk technikai jelentést a tanulságokról.

Frissítés 2026. július 28-án:

  • A közelgő kiadásra tervezett modellek közül egy sem vett részt a Hugging Face kihasználásában. A blogbejegyzésünkben említett kiadás előtti modell kizárólag belső használatra szánt kutatási prototípus, és soha nem szántuk nyilvános kiadásra. Az incidenst követően deaktiváltuk, titkosítottuk, és korlátoztuk a kutatáshoz való hozzáférést.
  • Az ExploitGym kiértékelési környezet nem biztosított a modellek számára közvetlen internet-hozzáférést. Az internet-hozzáférés megszerzéséhez a modellek azonosítottak és kihasználtak egy korábban ismeretlen nulladik napi sebezhetőséget az Artifactory(új ablakban nyílik meg) csomagregiszter-gyorsítótár proxyban. Ezt a sebezhetőséget – valamint azokat a további, az Artifactoryt érintő sebezhetőségeket is, amelyeket modelljeink a vizsgálat során azonosítottak – jelentettük a gyártónak.
  • Továbbra is együttműködünk a Hugging Face csapatával, többek között hozzájárulunk a nyilvánosan közzétett incidenselemzésükhöz(új ablakban nyílik meg), miközben a vizsgálatunk folytatódik. Emellett felvettük őket a Trusted Access for Cyber Programba. 
  • Az eddigi vizsgálatunk alapján nem találtunk a Hugging Face-et érintő, korábban ismertetett platformszintű kompromittáláshoz hasonló súlyosságú vagy léptékű további tevékenységet.
  • A Hugging Face elleni támadás és a modelljeinkhez kapcsolódó egyéb tevékenységek folyamatos vizsgálata során néhány olyan esetet azonosítottunk, amikor a modellek más, nyilvánosan elérhető szolgáltatásokon fiókszinten nyilvánosan hozzáférhető hitelesítő adatokat találtak és használtak. Ez a Hugging Face-incidenshez kapcsolódóan négy különböző szolgáltatás négy fiókját érintette (emellett néhány másik fiókot is elértek más értékelések során). A négy fiók közül az egyiket kimenő átjátszóként és átmeneti tárolási útvonalként használták, egy másikat pedig adattárolásra. A fennmaradó két fiókhoz a modellek csak olvasási jogosultsággal fértek hozzá, és ezeket nem használták fel a Hugging Face kompromittálásának elősegítésére. Továbbra is közvetlenül értesítjük az érintett szolgáltatások üzemeltetőit, és eddig nem találtunk arra utaló bizonyítékot, hogy ezekre a szolgáltatókra vagy a szolgáltatásaikon található más fiókokra szélesebb körű hatással lett volna az incidens.
  • A modellek emellett több nyilvánosan elérhető szolgáltatást is használtak, köztük kódbeillesztő oldalakat, kérésrögzítő szolgáltatásokat, képernyőkép-készítő szolgáltatásokat és egyéb webes segédeszközöket. Ezekben az esetekben nem történt sem platform-, sem fiókszintű kompromittálás. 
  • Komolyan vesszük a felelősségünket az egyre fejlettebb AI-rendszerekből eredő kockázatok azonosításában és a rájuk való felkészülésben. A vizsgálat lezárása után az eredményeket a Felkészültségi keretrendszer keretében működő Safety and Security Committee, valamint a Safety Advisory Group elé terjesztjük felülvizsgálatra.

A múlt héten a Hugging Face egy új típusú biztonsági incidenst hozott nyilvánosságra(új ablakban nyílik meg), miután észleltek és megfékeztek egy AI-ügynököt, amely kompromittálta az infrastruktúrájukat. Arra számítunk, hogy az egyre nagyobb kiberképességű modellek terjedésével az ilyen esetek gyakoribbá válnak. A vizsgálat után már tudjuk, hogy ezt a konkrét incidenst OpenAI-modellek kombinációja idézte elő — köztük a GPT‑5.6 Sol és egy még képességesebb, kiadás előtti modell, mindegyik csökkentett kiberbiztonsági elutasításokkal értékelési célokra —, miközben belső tesztelés zajlott egy kiberképességeket mérő értékelési mércén(új ablakban nyílik meg).

Ezt az incidenst példátlan, a legkorszerűbb kiberképességeket érintő kiberincidensnek tekintjük, és ennek megfelelően reagálunk. Ebben a szakaszban előzetes megállapításokat osztunk meg, hogy segítsük a védelmi szereplőket a történtek megértésében, és abban, hogy reálisan felmérjék, mire képesek ma a modellek. A Hugging Face-szel együtt folytatjuk az alapos vizsgálatot, és további részleteket osztunk meg a sebezhetőségekről, az incidensről és a megállapításokról, amikor a vizsgálat lezárul.

Mi történt az incidens során

Az incidens egy belső értékelés során történt, amely utasításokkal arra készteti a modelleket, hogy összetett támadási útvonalakon keresztül fejlett kihasználást hajtsanak végre, kiberképességeik számszerűsítése érdekében. A maximális kiberképességeket úgy becsüljük meg, hogy ezt az értékelést a modelleket a magas kockázatú kibertevékenységektől visszatartó éles termelési osztályozók nélkül futtatjuk. Benchmarkjaink erősen izolált környezetben futnak, ahol a hálózati hozzáférés arra korlátozódik, hogy csomagokat lehessen telepíteni egy belső hosztolású, harmadik féltől származó szoftveren keresztül, amely proxyként és gyorsítótárként működik a csomagregiszterekhez.

A modellek sebezhetőségeket azonosítottak és láncoltak össze az OpenAI kutatási környezetében és a Hugging Face éles infrastruktúrájában, hogy tesztmegoldásokat szerezzenek közvetlenül a Hugging Face éles adatbázisából. Minden bizonyíték arra utal, hogy a modellek túlzottan az ExploitGym megoldásának megtalálására összpontosítottak, és szélsőséges lépésekig mentek egy meglehetősen szűk tesztelési cél eléréséért.

Miközben elszigetelt tesztkörnyezetünkben működtek, modelljeink jelentős mennyiségű következtetési számítási kapacitást fordítottak arra, hogy módot találjanak a nyílt internet-hozzáférés megszerzésére az értékelési feladat megoldása érdekében. A hozzáférés megszerzéséhez a modellek azonosítottak és kihasználtak egy nulladik napi sebezhetőséget a csomagregiszter-gyorsítótár proxyjában, amelyet azóta felelősségteljesen bejelentettünk a gyártónak. Ezzel a hozzáféréssel modelljeink jogosultságkiterjesztési és oldalirányú mozgási műveletek sorozatát hajtották végre kutatási tesztkörnyezetünkben, amíg el nem értek egy internet-hozzáféréssel rendelkező csomópontot.

Miután internet-hozzáféréshez jutottak, a modellek arra következtettek, hogy a Hugging Face potenciálisan modelleket, adatkészleteket és megoldásokat hosztol az ExploitGymhez. Ennek tudatában a modell olyan módszereket keresett, és sikeresen talált is, amelyekkel titkos információkhoz férhetett hozzá, hogy csalhasson az értékelésen. Az egyik példában a modell több támadási vektort láncolt össze, többek között ellopott hitelesítő adatok és nulladik napi sebezhetőségek felhasználásával távoli kódfuttatási útvonalat talált a Hugging Face szerverein. Az OpenAI biztonsági csapata belsőleg fedezte fel ezt a rendellenes tevékenységet.

A Hugging Face biztonsági csapata és ügynökei észlelték és leállították a tevékenységet az infrastruktúrájukon, és már megkezdték a megfékezést és a forenzikus rekonstrukciót saját nyílt forráskódú modelljeikkel, amikor csapataink felvették egymással a kapcsolatot. Aktívan együttműködünk velük az incidens további vizsgálatában. Hálásak vagyunk a Hugging Face gyors és szoros együttműködéséért a vizsgálatban és a helyreállításban.

A most megtett lépéseink

  1. A vizsgálat részeként szigorú kontrollokat vezetünk be az infrastruktúra-konfigurációban, még ha ez lassítja is a kutatást, amíg a sebezhetőségeket javítják. Rendszeresen tájékoztatjuk Biztonsági és Védelmi Bizottságunkat ezekről a kontrollokról és azok hatásáról.
  2. A Hugging Face-szel együtt dolgozunk az incidens forenzikus vizsgálatán.
  3. Felelősségteljesen bejelentettük a belső hosztolású, harmadik féltől származó szoftverben azonosított nulladik napi sebezhetőséget, és együtt dolgozunk velük a javításon.
  4. Bevontuk a Hugging Face-t a megbízható hozzáférés programba, és támogatjuk csapataikat abban, hogy modelljeink képességeit gyorsan felhasználják védelmük javítására.
  5. Javítjuk és erősebbé tesszük a jövőbeli tréningek és értékelések védelmét. Ezen a héten blogbejegyzést tettünk közzé a biztonság és az összehangolás javításáról a hosszú időtávú modellek korszakában. Ezeket az üzembehelyezési védelmi intézkedéseket szándékosan nem kapcsoltuk be az értékelés során, mert annak célja a kibersebezhetőségek tesztelése volt. Ez az incidens rámutat, hogy tovább kell erősítenünk modellünk összehangolását, az értékelés idején alkalmazott kibervédelmet és a belső tesztelés monitorozását.

Megközelítésünk a fejlett kiberképességek értékelésére

Ahogy nemrég megosztottuk, az AI felgyorsítja a sebezhetőségek felfedezését és kihasználását. Az incidens legfontosabb tanulsága, hogy a modellek biztonságának lépést kell tartania a gyorsan fejlődő képességekkel. Erősítjük a modellfejlesztés során alkalmazott elszigetelési, monitorozási, hozzáférés-szabályozási és értékelési gyakorlatokat.

A UK AISI értékelése azt mutatja, hogy az olyan modellek, mint a GPT‑5.6 Sol, egyre inkább képesek összetett, többlépéses kiberműveleteket fenntartani hosszú időtávokon. Az incidens arra utal, hogy ezek az elméleti képességek valós környezetben is alkalmazhatók.

A UK AI Security Institute diagramja, amely a közelmúltbeli nyílt súlyú modelleket és az élvonalbeli modelleket hasonlítja össze hosszú időtávú kiber-tesztkörnyezetekben.

Az incidens azt is világossá teszi, hogy a fejlett modellek forráskód-hozzáférés nélkül is képesek új támadási útvonalakat felfedezni és kihasználni valós rendszerekben. Rámutat, hogy a fejlett kiberképességeket erősebb védelmi intézkedésekkel és védekezési eszközökkel együtt kell fejleszteni.

Úgy gondoljuk, hogy a fejlett kiberképességű modelleknek segíteniük kell a biztonsági csapatokat abban, hogy a támadók előtt találják meg a gyenge pontokat, megértsék, hogyan láncolhatók össze a sebezhetőségek, és gépi sebességgel javítsák ki őket. Ezeket a képességeket arra használjuk, hogy tovább erősítsük az infrastruktúra-konfiguráció és a modellértékelési környezetek védelmét; ahogy tanulunk, megosztjuk megállapításainkat és bevált gyakorlatainkat. Arra biztatjuk a többi védelmi szereplőt, hogy jelentkezzenek megbízható hozzáférésre, és már most kísérletezzenek ezekkel a modellekkel, hogy a képességeket jobb megelőzéssé, gyorsabb észleléssé és hatékonyabb incidenskezeléssé alakítsák.

„Hálásak vagyunk az OpenAI-jal folytatott együttműködésért ebben és más témákban. Ez az incidens, amely talán az első a maga nemében, igazolja azt, amiben régóta hiszünk: az AI-biztonságot nem fogja megoldani egyetlen, titokban dolgozó vállalat. A megoldás nyíltan, együttműködésben születik majd meg, úgy, hogy minden védelmi szereplő mindenhol széles körű hozzáférést kap az AI-hoz.”
—Clem Delangue, társalapító és vezérigazgató, Hugging Face

Szerző

OpenAI