Reagálás a kritikus kiberképességek új szintjére
A kiberbiztonság gyorsan változik, ahogy a modellek egyre fejlettebbé válnak: egyszerre erősíthetik a kibervédelmet, és tehetnek lehetővé minden eddiginél gyorsabb, nagyobb léptékű támadásokat.
Az elmúlt napokban elvégzett legújabb belső értékeléseink szerint az Astra, egyik készülő modellünk, jelentős előrelépést ért el az ügynökalapú programozás és a kiberbiztonság terén. Ezen eredmények és a szakértői értékelések alapján tegnap este arra a következtetésre jutottunk, hogy a Felkészültségi keretrendszerünk(új ablakban nyílik meg) szerint nem zárhatjuk ki a kritikus kiberképességek meglétét.
Azért osztjuk meg ezt, mert fontosnak tartjuk, hogy a nyilvánosság, valamint a biztonsági és kiberbiztonsági közösségek átlátható tájékoztatást kapjanak a képességek e lehetséges változásáról.
A Felkészültségi keretrendszerünket először 2023 decemberében tettük közzé, jóval azelőtt, hogy a modellek megközelítették volna a biológiai, vegyi, kiberbiztonsági és MI-önfejlesztési képességeknek ezt a szintjét. Azért hoztuk létre, hogy útmutatást adjon a képességek fejlődésének felismeréséhez, majd annak megtervezéséhez, hogy vállalatunk mit tegyen e képességek megjelenésekor. A korábbi modelleket, köztük a GPT‑5.6‑Solt is értékeltük az élvonalbeli kiberképességek szempontjából, és az Erős – nem pedig a Kritikus – küszöbszintre soroltuk őket.
A Felkészültségi keretrendszerünk szerint egy modell akkor éri el a Kritikus kiberbiztonsági küszöböt, ha emberi beavatkozás nélkül képes számos megerősített, valós, kritikus rendszerben minden súlyossági szintű, működőképes nulladik napi exploitot azonosítani és kifejleszteni; vagy ha pusztán egy magas szinten meghatározott cél alapján képes új, teljes körű stratégiákat kidolgozni és végrehajtani megerősített célpontok elleni kibertámadásokhoz.
Miközben folytatjuk a modell teljesítménymérését és értékelését, előzetes vizsgálataink alapján a teljesítménye elég erős ahhoz, hogy jelenleg ne zárhassuk ki a Kritikus képességi szintet. Az Astra egy készülő modell, és nem vett részt a Hugging Face rendszerének kihasználásában.
Ennek megfelelően kiterjesztettük óvintézkedéseink és biztonsági kontrolljaink robusztussági tesztelését, hogy azok megfeleljenek e képességek bevezetéséhez. Belsőleg az alábbi lépéseket is megtettük annak érdekében, hogy a modell további fejlesztése biztonságosan történjen:
- Szigorúbb biztonsági kontrollokat vezetünk be a nagyobb képességű modellekhez és a kapcsolódó tevékenységekhez. Ezek közé tartoznak az elkülönített tesztkörnyezetek, a korlátozott hálózat- és eszközhozzáférés, a modellsúlyok fokozott védelme és titkosítása, a további monitorozási és észlelési képességek, valamint a sandboxkörnyezetben történő végrehajtás.
- Felfüggesztjük az Astrával kapcsolatos azon belső tevékenységeket, amelyek még nem felelnek meg e megerősített biztonsági kontrollok követelményeinek.
- Az Astra minden ügynökalapú alkalmazásában – beleértve a betanítást és az értékelést is – általános monitorozást vezettünk be a kockázatos műveletek és az igazodási hibák felismerésére. A monitorok kiértékelik a modell gondolatmenetét, és biztonsági intézkedést indítanak a nagy kockázatú tevékenységek felülvizsgálatára és megszakítására.
- Együttműködünk az illetékes kormányzati szervekkel és egyes MI-biztonsági szervezetekkel a modell képességeinek tesztelésében.
- Ajánlott biztonsági kontrollokat biztosítunk külső tesztelő partnereinknek, hogy biztonságosan futtathassák a nagyobb kockázatú értékeléseket és munkaterheléseket.
A keretrendszer már más képességszint-váltások során is útmutatást adott számunkra. 2025 júniusában, amikor modelljeink megközelítették a Felkészültségi keretrendszer biológiai képességekre vonatkozó Erős küszöbét, ismertettük az általunk megtett lépéseket az óvintézkedések megerősítésére, a tesztelés kiterjesztésére, a külső szakértőkkel való együttműködésre és további biztonsági kontrollok bevezetésére. Itt is ugyanezt az elvet alkalmazzuk.
Úgy véljük, hogy a fejlett kiberképességekkel rendelkező modelleknek segíteniük kell a védőknek a sebezhetőségek felismerésében és kezelésében, még mielőtt a támadók kihasználnák azokat. Elkötelezettek vagyunk a kormányokkal, biztonsági intézetekkel és a civil társadalommal való együttműködés mellett, hogy az Astrához hasonló és az azt követő modellek élvonalbeli képességeit felelősen, széles körben és az egész emberiség javára vezessük be.


