Reaģējot uz nākamo kritisko kiberspēju robežšķirtni
Kiberdrošība strauji mainās, modeļiem kļūstot arvien spējīgākiem gan stiprināt kiberaizsardzību, gan īstenot uzbrukumus vēl nepieredzētā ātrumā un mērogā.
Mūsu jaunākie iekšējie novērtējumi, kas pēdējās dienās veikti vienam no mūsu gaidāmajiem modeļiem Astra, liecina par būtisku progresu autonomajā programmēšanā un kiberdrošībā. Šie rezultāti kopā ar ekspertu vērtējumiem vakar vakarā lika mums secināt, ka saskaņā ar mūsu Sagatavotības satvaru(atveras jaunā logā) nevaram izslēgt kritiska līmeņa kiberspējas.
Mēs ar šo informāciju dalāmies, jo uzskatām, ka sabiedrībai, kā arī drošuma un drošības kopienām ir svarīgi pārredzami skaidrot šīs iespējamās spēju pārmaiņas.
Savu Sagatavotības satvaru pirmoreiz publicējām 2023. gada decembrī — ilgi pirms modeļi bioloģijas, ķīmijas, kiberdrošības un MI pašpilnveides jomā pietuvojās šāda līmeņa spējām. Mēs to izveidojām kā vadlīnijas spēju progresa apzināšanai un uzņēmuma rīcības plānošanai, šīm spējām parādoties. Iepriekšējie modeļi, tostarp GPT‑5.6‑Sol, ir vērtēti attiecībā uz robežšķirtnes kiberspējām, un tiem noteikts Augsts, nevis Kritisks slieksnis.
Saskaņā ar mūsu Sagatavotības satvaru modelis sasniedz Kritisko kiberdrošības slieksni, ja tas bez cilvēka iejaukšanās daudzās īpaši aizsargātās, reālās kritiskajās sistēmās spēj identificēt un izstrādāt funkcionējošus jebkuras bīstamības pakāpes nulles dienas mūķus vai, saņemot tikai vispārīgi formulētu vēlamo mērķi, spēj izstrādāt un pilnībā īstenot jaunas kiberuzbrukumu stratēģijas pret īpaši aizsargātiem mērķiem.
Turpinām šā modeļa etalonpārbaudes un vērtēšanu, taču sākotnējie novērtējumi liecina par pietiekami augstu veiktspēju, lai pašlaik nevarētu izslēgt Kritisko spēju līmeni. Astra ir gaidāms modelis, un tas nebija iesaistīts Hugging Face uzlaušanā.
Tāpēc esam paplašinājuši aizsargpasākumu un drošības kontroles mehānismu noturības pārbaudes, lai tie būtu piemēroti šādu spēju ieviešanai. Lai turpmākā šā modeļa izstrāde notiktu droši, uzņēmumā esam veikuši arī šādus pasākumus:
- Modeļiem ar lielākām spējām un saistītajām darbībām ieviešam stingrākus drošības kontroles mehānismus, tostarp izolētas testēšanas vides, ierobežotu piekļuvi tīkliem un rīkiem, pastiprinātu modeļa svaru aizsardzību un šifrēšanu, papildu uzraudzības un noteikšanas iespējas, kā arī izpildi smilškastes vidē.
- Mēs apturam tās iekšējās darbības ar Astra, kuras vēl neatbilst šīm pastiprinātajām drošības kontroles prasībām.
- Visos aģentiskajos Astra lietojumos, tostarp apmācībā un vērtēšanā, esam ieviesuši visaptverošu riskantu darbību un neatbilstīgas rīcības uzraudzību. Uzraudzības sistēmas vērtē modeļa domu ķēdi un aktivizē drošības reakciju, lai pārbaudītu un pārtrauktu augsta riska darbības.
- Sadarbosimies ar attiecīgajām valsts iestādēm un atsevišķām MI drošuma organizācijām, lai pārbaudītu šā modeļa spējas.
- Trešo pušu testēšanas partneriem sniegsim ieteikumus par drošības kontroles mehānismiem, lai paaugstināta riska novērtējumus un darba slodzes varētu izpildīt droši.
Šis satvars mums jau ir palīdzējis pārvaldīt citas spēju pārmaiņas. Kad 2025. gada jūnijā mūsu modeļi saskaņā ar Sagatavotības satvaru tuvojās Augstam spēju slieksnim bioloģijas jomā, mēs izklāstījām veicamos pasākumus, lai stiprinātu aizsargpasākumus, paplašinātu testēšanu, sadarbotos ar ārējiem ekspertiem un ieviestu papildu drošības kontroles mehānismus. Arī šeit mēs piemērojam to pašu principu.
Mēs uzskatām, ka progresīviem modeļiem ar kiberspējām jāpalīdz aizstāvjiem identificēt un novērst ievainojamības, pirms tās izmanto uzbrucēji. Esam apņēmušies sadarboties ar valdībām, drošuma institūtiem un pilsonisko sabiedrību, lai nodrošinātu, ka tādu modeļu kā Astra un to pēcteču robežšķirtnes spējas tiek ieviestas atbildīgi, plaši un visas cilvēces labā.


