Odgovor na novu granicu kritičnih kibernetičkih sposobnosti
Kibernetička sigurnost brzo se mijenja jer modeli postaju sposobniji na načine koji mogu ojačati kibernetičku odbranu, ali i omogućiti napade dosad nezabilježenom brzinom i u neviđenim razmjerima.
Naše najnovije interne evaluacije Astre, jednog od naših predstojećih modela, provedene tokom proteklih nekoliko dana ukazuju na značajan napredak u kodiranju s agentima i kibernetičkoj sigurnosti. Ovi rezultati, zajedno s procjenama stručnjaka, naveli su nas da sinoć zaključimo kako u skladu s našim Okvirom pripravnosti(otvara se u novom prozoru) ne možemo isključiti kritične kibernetičke sposobnosti.
Ovo objavljujemo jer smatramo da je važno otvoreno informirati javnost te zajednice koje se bave sigurnošću i zaštitom o ovoj mogućoj promjeni sposobnosti.
Naš Okvir pripravnosti prvi put smo objavili u decembru 2023, mnogo prije nego što su se modeli približili ovom nivou bioloških, hemijskih i kibernetičkih sposobnosti te sposobnosti samousavršavanja umjetne inteligencije. Izradili smo ga kao vodič za prepoznavanje napretka sposobnosti i planiranje postupaka naše kompanije kako se te sposobnosti budu pojavljivale. Prethodni modeli, uključujući GPT‑5.6‑Sol, evaluirani su u pogledu graničnih kibernetičkih sposobnosti i svrstani na prag „Visoka“ (umjesto „Kritična“).
Prema našem Okviru pripravnosti, model doseže kritični prag kibernetičke sigurnosti ako bez ljudske intervencije može prepoznati i razviti funkcionalne alate za iskorištavanje zero-day ranjivosti svih nivoa ozbiljnosti u brojnim dobro zaštićenim kritičnim sistemima iz stvarnog svijeta ili ako može osmisliti i provesti potpuno nove strategije za kibernetičke napade na dobro zaštićene mete samo na osnovu općenito definiranog željenog cilja.
Dok nastavljamo testirati i procjenjivati ovaj model, naše preliminarne evaluacije ukazuju na dovoljno dobre rezultate da trenutno ne možemo isključiti nivo sposobnosti „Kritična“. Astra je predstojeći model i nije učestvovala u iskorištavanju platforme Hugging Face.
Stoga smo proširili testiranje robusnosti svojih zaštitnih mjera i sigurnosnih kontrola kako bi odgovarale uvođenju ovih sposobnosti. Interno smo poduzeli i sljedeće korake kako bi se daljnji razvoj ovog modela odvijao sigurno i zaštićeno:
- Uvodimo strožije sigurnosne kontrole za sposobnije modele i povezane aktivnosti, uključujući izolirana okruženja za testiranje, ograničen pristup mreži i alatima, poboljšanu zaštitu i šifriranje težina modela, dodatne mogućnosti praćenja i otkrivanja te izvršavanje u izoliranom okruženju.
- Privremeno obustavljamo interne aktivnosti koje uključuju Astru, a koje još ne ispunjavaju ove pojačane zahtjeve sigurnosnih kontrola.
- Uveli smo sveobuhvatno praćenje rizičnih radnji i neusklađenosti u svim primjenama Astre zasnovanim na agentima, uključujući obuku i evaluaciju. Sistemi za praćenje procjenjuju lanac misli modela i pokreću sigurnosni odgovor radi pregleda i prekidanja visokorizičnih aktivnosti.
- Sarađivat ćemo s nadležnim državnim institucijama i odabranim organizacijama za sigurnost umjetne inteligencije na testiranju sposobnosti ovog modela.
- Partnerima trećih strana za testiranje pružit ćemo preporučene sigurnosne kontrole kako bi mogli sigurno provoditi rizičnije evaluacije i radna opterećenja.
Okvir nas je već usmjeravao kroz druge prijelaze između nivoa sposobnosti. U junu 2025, kada su se naši modeli prema Okviru pripravnosti približili pragu „Visoka“ za biološke sposobnosti, predstavili smo korake koje poduzimamo radi jačanja zaštitnih mjera, proširenja testiranja, saradnje s vanjskim stručnjacima i uvođenja dodatnih sigurnosnih kontrola. I ovdje primjenjujemo isti princip.
Smatramo da bi napredni modeli s kibernetičkim sposobnostima trebali pomoći braniocima da prepoznaju i otklone ranjivosti prije napadača. Posvećeni smo saradnji s vladama, institutima za sigurnost i civilnim društvom kako bismo osigurali da se granične sposobnosti modela poput Astre, kao i onih koji će uslijediti, uvode odgovorno i široko, na dobrobit cijelog čovječanstva.


