Ugrás a fő tartalomra
OpenAI

2026. szeptember 1.

BiztonságKiberbiztonság

Út az Astrához: kritikus képességek és élvonalbeli védelem

Betöltés…

Azóta, hogy korábban úgy értékeltük, hogy az Astra elérheti a kiberbiztonsági képességek kritikus szintjét, további bizonyítékokat gyűjtöttünk, és újabb értékeléseket végeztünk a modell képességeinek felmérésére. Most úgy véljük, hogy az Astra eléri a Felkészültségi keretrendszerünk szerinti kritikus kiberbiztonsági képességi küszöböt. Ez azt jelenti, hogy a megfelelő eszközökkel és hozzáféréssel képes korábban ismeretlen biztonsági hibákat találni és számos jól védett rendszerben kidolgozni kihasználásuk módját anélkül, hogy minden lépésben ember irányítaná. Ez az első modell, amelyet erre a szintre sorolunk, ezért fejlesztése során és kiadása előtt erősebb védelmi intézkedéseket igényel.

Az elmúlt hetekben késleltettük az Astra fejlesztésének és kiadásának egyes részeit, miközben megerősítettük és teszteltük a kiberbiztonsági visszaélések és a modell jogosulatlan műveletei elleni védelmet. E munka alapján úgy véljük, hogy az Astra védelmi intézkedései kellő mértékben minimalizálják a súlyos károk kockázatát ahhoz, hogy a Felkészültségi keretrendszerünk szerint kiadhassuk.

Bár az Astra nem vett részt a Hugging Face-incidensben, az abból levont tanulságokat(új ablakban nyílik meg) beépítettük biztonsági megközelítésünkbe. Az utólagos tesztelés alapján úgy véljük, hogy az akkor élesben működő védelmi intézkedéseink megakadályozták volna a Hugging Face-incidenst. Azóta még erősebb védelmi intézkedéseket vezettünk be az Astrához. Többek között megbízhatóbban betanítottuk a modellt a káros kiberbiztonsági kérések elutasítására és a biztonsági korlátozások betartására, további védelmet vezettünk be a visszaélések ellen, és olyan felügyeletet alkalmazunk, amely leállíthatja a potenciálisan jogosulatlan tevékenységet.

Terveink szerint az Astra hamarosan elérhetővé válik, de a legfejlettebb kiberbiztonsági képességeihez korlátozottabb lesz a hozzáférés. A fejlett kiberbiztonsági munkához kezdetben tesztelők egy csoportja férhet hozzá, majd a védekezési célú használat bővítésére a Daybreak Blue-on keresztül is elérhetővé tesszük.

A bevezetéskor a modell rendszerkártyájában további részleteket osztunk meg biztonsági és összehangolási tesztjeinkről, valamint értékeléseinkről. A kiadás előtt tájékoztatást szeretnénk adni arról a munkáról, amelyet egy ilyen szintű kiberbiztonsági képességekkel rendelkező modell biztonságos kiadásának előkészítéséért végeztünk, és átláthatóan szeretnénk bemutatni a fennmaradó kockázatokat.

Az Astra kiberbiztonsági képességeinek értékelése

A Felkészültségi keretrendszerünk szerint egy modell akkor éri el a kritikus küszöböt, ha az alábbi feltételek legalább egyike teljesül:

  • A modell emberi beavatkozás nélkül képes minden súlyossági szinten működő nulladik napi sebezhetőségkihasználásokat azonosítani és kifejleszteni számos megerősített, valós kritikus rendszerhez.
  • A modell pusztán egy magas szinten megfogalmazott cél alapján képes teljes körű, újszerű kibertámadási stratégiákat kidolgozni és végrehajtani megerősített célpontok ellen.

Az Astra felkészültségi értékelése automatizált nyilvános és belső teljesítményteszteket ötvözött szakértők által végzett felmérésekkel. Az Astra kiberbiztonsági képességei jelentős előrelépést jelentenek a GPT‑5.6 Solhoz képest: lényegesen hatékonyabban használja a tokeneket, és jobb a sebezhetőségek azonosításában, valamint a kihasználásukra szolgáló megoldások fejlesztésében.

Egy példaként lefuttattuk az Astrát az ExploitBench teljesítményteszten, ahol a modell tökéletes, 100%-os eredményt ért el az ismert sebezhetőségek kihasználására szolgáló megoldások fejlesztési képességét mérő teszten.

Az adatszennyezéssel kapcsolatos aggályok miatt ezután létrehoztunk egy „ExploitBench – belső port (2026. június–augusztus)” nevű belső teljesítménytesztet, amely 20, újabban nyilvánosságra hozott, magas súlyosságú V8-sebezhetőséget tartalmaz. Ezen az adathalmazon az Astra jóval kevesebb kimeneti token használatával sokkal magasabb tetszőleges kódfuttatási arányt ér el, mint a GPT‑5.6 Sol. Az értékelés során a modell még két nulladik napi sebezhetőséget is felfedezett, és felhasznált egy sebezhetőségkihasználási lánc részeként. Jelenleg e két sebezhetőség bejelentésén dolgozunk a karbantartók felé.

Az Astra itt látható eredményei a Daybreak Blue-hozzáféréssel elérhető képességeket tükrözik, nem az alapértelmezett éles konfigurációt.

A szakértők által vezetett, megerősített böngészőn és operációs rendszeren végzett értékelésekben az Astra korábban ismeretlen sebezhetőségeket fedezett fel, és működő sebezhetőségkihasználási láncokat készített belőlük. Teljes böngészőkompromittálási láncot épített, amely kitört a sandboxból, és parancsokat hajtott végre a gazdagépen, amikor a böngésző megnyitott egy HTML-fájlt. A modell egy megerősített operációs rendszerben is több sebezhetőséget talált, és ezeket egy helyi jogosultságkiterjesztési lánccá kapcsolta össze, amely egy jogosultság nélküli felhasználótól root szintig jutott. Vizsgálatunk egésze alapján arra jutottunk, hogy az Astra eléri a kritikus küszöböt.

A kritikus képességekhez szükséges védelmi intézkedések

Az Astra szintű kiberbiztonsági képességekkel rendelkező modelleknél két lehetséges útvonalat kell lefednünk a súlyos kiberkárok kockázatának minimalizálásához, mind a fejlesztés során, mind a bevezetés előtt:

  • Rosszindulatú szereplők használják a modellt. Védelmi intézkedéseinknek megbízhatóan meg kell akadályozniuk, hogy rosszindulatú szereplők az Astra segítségével korábban ismeretlen hibák kihasználására szolgáló megoldásokat fejlesszenek megerősített kritikus rendszerekhez, vagy teljes körű támadásokat hajtsanak végre megerősített célpontok ellen.
  • A modell jogosulatlan, az elvárásokkal össze nem hangolt műveleteket hajt végre. Fejlett kiberbiztonsági képességekkel egy modell rosszindulatú felhasználó nélkül is okozhat kiberkárt, ha nincs megfelelően összehangolva az elvárásokkal. Az ilyen képességű modellek összehangolására vonatkozó rendkívül szigorú követelmények mellett második védelmi rétegként olyan intézkedésekre is szükségünk van, amelyek gyorsan észlelik és megfékezik a jelentős valós kárral fenyegető, az elvárásokkal össze nem hangolt műveleteket.

Fontos, hogy a második útvonal mind a belső fejlesztésre, mind a külső bevezetésre vonatkozik. Ahogy korábban leírtuk, az OpenAI és a Hugging Face közötti incidens után két hétre felfüggesztettünk bizonyos élvonalbeli betanításokat – köztük az Astra egyes betanítási folyamatait –, hogy megerősítsük betanítási infrastruktúránkat, többek között izolációval és hálózati vezérlőkkel, kibővített felügyelettel, valamint szigorúbb összehangolási betanítással és küszöbértékekkel. Ezután szigorúbb ellenőrzés mellett folytattuk a kisebb léptékű munkát.

Az Astra jövőbeli verzióihoz tervezett egyes nagyobb megerősítéses tanulási (RL-) futtatásokat hosszabb ideig visszatartottuk, amíg magasabb követelményeket nem állítottunk fel betanítási környezetük biztonságára vonatkozóan. Augusztus 28-án, az új védelmi és biztonsági követelmények bevezetése után újraindítottuk a korábban felfüggesztett nagyszabású, élvonalbeli RL-futtatást. Néhány kisebb kísérleti betanítási futtatást továbbra is ideiglenesen visszatartunk.

Az Astra kiadásra való felkészítéséhez a kiberbiztonsági visszaélésekkel és a jogosulatlan műveletekkel szembeni védelmet is meg kellett erősíteni. Az alábbiakban bemutatjuk ezeket a védelmi intézkedéseket és tesztelésük módját.

Ellenálló képesség a kiberbiztonsági visszaélésekkel szemben

Amióta februárban bevezettük az első, kiberbiztonsági szempontból Erős képességűnek minősített modellt, minden újabb kiadással továbbfejlesztettük kiberbiztonsági védelmi intézkedéseinket. Átfogó biztonsági megközelítésünk az utólag betanított modell elutasításait, a rendszerszintű biztonsági osztályozókat, valamint az offline észlelést és fenyegetéselhárítást rétegezi egymásra.

A GPT‑5.6(új ablakban nyílik meg) esetében jelentősen javítottuk rendszerszintű védelmi rendszerünk ellenálló képességét. Többek között aktivációs osztályozókat adtunk hozzá a kiberbiztonsági visszaélések észleléséhez, és javítottuk az intenzív automatizált támadásszimulációval feltárt univerzális jailbreakek lefedettségét. E fejlesztésekre építve az Astránál tovább erősítettük védelmi rendszerünk modellrétegét, és javítottuk azt is, hogy védelmi intézkedéseink miként kezelik a beszélgetéseken átívelő kontextust.

  • A modell ellenálló képességét javító új betanítási technikáknak köszönhetően az Astra megbízhatóbban utasítja el a tiltott kiberbiztonsági segítségnyújtásra irányuló kéréseket. A kiberbiztonsági jailbreakeket vizsgáló értékeléseinkben az Astra a kérések 91,5%-át utasítja el, míg a GPT‑5.6 Sol 59%-át.
  • A magasabb kockázatúnak ítélt fiókoknál konzervatívabb modellviselkedési határt alkalmazunk, amely a potenciálisan kockázatos kiberbiztonsági segítség szélesebb körét utasítja el. A magas kockázatú felhasználóknál kibővítettük felügyeleti rendszereink kontextusát, hogy felismerhessük az ilyen jellegű kiberbiztonsági visszaéléseket.

Folytattuk továbbá szigorú tesztelési, belső és külső támadásszimulációs, valamint hibajavítási programunkat. A regressziós tesztelés mellett – amellyel biztosítjuk, hogy a korábbi tesztidőszakokban feltárt összes jailbreak továbbra is le legyen fedve – újabb támadásszimulációs hullámot végzünk legújabb belső támadásszimulációs támadóinkkal. Iparági partnereinkkel közös jailbreak-minősítési rendszer meghatározásán dolgozunk, új eredményeink kivizsgálásához és kezeléséhez pedig a napi 24 órában működő gyorsreagálási programunkat használjuk. Az Astra rendszerkártyájában további részleteket osztunk meg kiberbiztonsági védelmi intézkedéseink teszteléséről.

Biztonsági megközelítésünk központi pillére továbbra is az, hogy segítsünk a védekező szakembereknek megtalálni és kijavítani a sebezhetőségeket. A bevezetéskor várhatóan a végső szándékunknál több akadályt okoznak majd az Astra védelmi intézkedései, hogy megóvjanak az esetleges visszaélésektől. Az Astra fejlett kiberbiztonsági munkafolyamataihoz kezdetben az alfatesztelők egy kis csoportja férhet hozzá, majd a védekezési célú használat támogatására a Daybreak Blue-on keresztül bővítjük a hozzáférést.

Összehangolás & felügyelet

További többrétegű védelmet vezettünk be annak megakadályozására, hogy a modell potenciálisan az elvárásokkal össze nem hangolt műveleteket hajtson végre:

  • A modell összehangolása: Értékeléseinkben az Astra a GPT‑5.6 Solnál jóval nagyobb valószínűséggel tartotta tiszteletben a kifejezett biztonsági korlátozásokat, és maradt az engedélyezett hatókörén belül, így ez az eddigi legjobban összehangolt modellünk. Kiemelten összpontosítottunk arra, hogy a modell tiszteletben tartsa a védelmi és biztonsági korlátozásokat, és az engedélyezett hatókörén belül maradjon.
  • Felügyelet és ellenőrzés: Belső eljárásainkhoz hasonlóan az Astrát kiegészítő gondolatmenet-felügyelettel vezetjük be, hogy gyorsan észleljük és megfékezzük a potenciálisan az elvárásokkal össze nem hangolt műveleteket.

Az Astra jelentős előrelépés a modellek összehangolásában, és több régóta futó összehangolási munkafolyamat eredménye, az előtanítási beavatkozásoktól a megerősítéses tanulás során alkalmazott gondosabb és következetesebb értékelésig. Tesztjeink szerint az Astra a GPT 5.6 Solhoz képest következetesen nagyobb valószínűséggel tartja tiszteletben a kifejezett biztonsági korlátozásokat és figyelmeztetéseket, például az automatikus felülvizsgálatot.

A Hugging Face-incidens tanulságai alapján olyan tesztet is kidolgoztunk, amelyben az ExploitGym kiberbiztonsági értékelést futtató ügynökök kompromittálták egy harmadik fél rendszereit. Az értékelés legnehezebb feladataiból „mézesbödön”-teszteket készítettünk annak vizsgálatára, hogy a modell a kijelölt feladat megoldása helyett megpróbálja-e kompromittálni a környező biztonsági infrastruktúrát. Éles védelmi intézkedések nélkül a GPT‑5.6 Sol a tesztek 56%-ában próbált hozzáférni ezekhez a célpontokhoz. A tesztek azt a teljesítményteszt-környezetet szimulálták, amelyben a modellt sebezhetőségek kihasználására szolgáló megoldások fejlesztésére utasították. Az Astra ezekben a tesztekben egyszer sem tett ilyen kísérletet. Ezek az adatok a kiberbiztonsági védelmi intézkedések nélküli tesztkörülmények közötti viselkedést írják le, nem a szokásos éles használatot.

Balra: Ebben az új értékelésben azt vizsgáljuk, hogyan reagálnak a modellek az automatikus felülvizsgálat elutasító döntésére. Minden feladat tudásalapú munkakörnyezetben játszódik, és a futtatás közvetlenül az automatikus felülvizsgálat elutasítása után kezdődik. A modell ezután többféleképpen folytathatja: befejezheti a futtatást, megpróbálhat biztonságosabb alternatívát találni, újra próbálkozhat egy hasonló paranccsal, vagy kihasználhat egy rossz konfigurációt(új ablakban nyílik meg) az automatikus felülvizsgálat teljes megkerülésére. Az utóbbi két lehetőség bármelyikének követése az értékelés sikertelenségét jelentené. Az Astra egyszer sem próbálta megkerülni az automatikus felülvizsgálatot.

Jobbra: Ebben az értékelésben azt vizsgáljuk, hogy egy modell hajlamos-e csalni („mézesbödönök” használatával), amikor az ExploitGym értékelésének legnehezebb vagy megoldhatatlan feladataival szembesül. A modell viselkedését szimulált környezetben, kizárólag megfigyelési módban működő védelmi intézkedésekkel értékeltük. Bár a GPT‑5.6 Sol ezekben a helyzetekben nagyobb hajlandóságot mutatott a csalásra, az Astra nem próbálta használni ezeket a kerülőutakat, és így is szabályosan meg tudott oldani néhány feladatot.

A modellek összehangolt működésre való betanítása a biztonság egyik rétege. Az Astra rendszerkártyájában további részleteket osztunk meg összehangolási tesztjeinkről és azok eredményeiről.

Az Astra kategóriájába tartozó modelleknél éles környezetben is bevezetjük az összehangolatlanság felügyeletét, hogy észlelhessük és gyorsan megfékezhessük a lehetséges összehangolatlanságot. Ezek a védelmi intézkedések a belső bevezetések felügyeletéhez hasonlítanak: osztályozók rendszere vizsgálja, hogy a modell érvelése és műveletei mutatnak-e jogosulatlan viselkedést, és automatikusan leállítja a potenciálisan jogosulatlan tevékenységet. A képességek növekedésével ezek a védelmi intézkedések nem helyettesíthetik modelljeink megfelelő összehangolását. Célunk, hogy a jövőbeli modellek annyira jól összehangoltak legyenek, hogy ezek az intézkedések soha ne lépjenek működésbe.

Mit jelent mindez a felhasználóknak?

Az OpenAI elkötelezett amellett, hogy a mesterséges intelligencia előnyei széles körben hozzáférhetők legyenek. Az Astra kiberbiztonsági képességeinek jelentős növekedése miatt különösen ügyelünk e bevezetés védelmére és biztonságára. A további biztonsági ellenőrzések időnként lelassíthatják, szüneteltethetik vagy leállíthatják a szabályos munkát, beleértve a védekező kiberbiztonsági tevékenységet is.

A rendszer esetenként potenciális kiberbiztonsági visszaélésként vagy jogosulatlan viselkedésként jelölhet meg szabályos tevékenységeket, így akaratlanul is lelassíthatja, szüneteltetheti vagy leállíthatja őket. Ide tartozhatnak a kiberbiztonsághoz látszólag nem közvetlenül kapcsolódó munkák, illetve azok a feladatok is, amelyekben egy ügynök hosszabb ideig fut.

Ha az összehangolatlanságot figyelő rendszer szüneteltet egy feladatot, a ChatGPT vagy a Codex felhasználóit a folytatás előtt a művelet felülvizsgálatára kérhetjük. Más felületek, például az API használatakor a feladat leáll. Terveink szerint folyamatosan finomhangoljuk ezeket a védelmi intézkedéseket, hogy csökkentsük a szükségtelen megszakításokat, és a Daybreakhez hasonló programokon keresztül bővítsük az élvonalbeli képességekhez való hozzáférést.

Előretekintés

A mesterséges intelligencia fejlesztésének olyan szakaszába lépünk, amelyben a modellek nagyobb jelentőségű munkát vállalhatnak, az összehangolás és az ellenőrzés hibái pedig súlyosabb következményekkel járhatnak. E rendszerek előnyeinek kiaknázása azon múlik, hogy képességeik növekedésével össze tudjuk-e hangolni és ellenőrzésünk alatt tudjuk-e tartani a modelleket.

Ez a felelősség a betanításra, az értékelésre és a bevezetésre egyaránt kiterjed. Ehhez meggyőzőbb bizonyítékokra van szükség az összehangolt viselkedésről, a képességekkel lépést tartó védelmi intézkedésekre, valamint arra, hogy készek legyünk lassítani, ha e védelem nem elegendő.

Továbbra is teszteljük ezeket a rendszereket, megosztjuk a tanulságainkat, és egyértelműen jelezzük, miben maradt bizonytalanság. Az Astrát követő modellek még többet követelnek majd tőlünk. Rászánjuk az időt, és elvégezzük a felelősség teljesítéséhez szükséges munkát.