Odgovor na sljedeću razinu kritičnih kibernetičkih sposobnosti
Kibernetička sigurnost brzo se mijenja jer modeli postaju sve sposobniji, što može ojačati kibernetičku obranu, ali i omogućiti napade dosad nezabilježenom brzinom i u dosad nezabilježenim razmjerima.
Naše najnovije interne evaluacije Astre, jednog od naših nadolazećih modela, provedene tijekom posljednjih nekoliko dana upućuju na znatan napredak u kodiranju uz pomoć AI agenta i kibernetičkoj sigurnosti. Ti su nas rezultati, uz stručne procjene, sinoć naveli na zaključak da prema našem Okviru pripravnosti(otvara se u novom prozoru) ne možemo isključiti postojanje kritičnih kibernetičkih sposobnosti.
Ovo objavljujemo jer smatramo da je važno transparentno informirati javnost te zajednice koje se bave sigurnošću i zaštitom o toj mogućoj promjeni sposobnosti.
Okvir pripravnosti prvi smo put objavili u prosincu 2023., znatno prije nego što su se modeli približili ovoj razini bioloških, kemijskih i kibernetičkih sposobnosti te sposobnosti samousavršavanja umjetne inteligencije. Osmislili smo ga kao smjernicu za prepoznavanje napretka u sposobnostima i planiranje postupanja naše tvrtke kako se te sposobnosti budu pojavljivale. Prethodni modeli, uključujući GPT‑5.6‑Sol, evaluirani su u pogledu naprednih kibernetičkih sposobnosti i procijenjeno je da dosežu visoku, a ne kritičnu razinu.
Prema našem Okviru pripravnosti, model doseže prag „Kritična” za kibernetičku sigurnost ako bez ljudske intervencije može pronaći i razviti funkcionalne načine iskorištavanja ranjivosti nultog dana svih stupnjeva ozbiljnosti u brojnim dobro zaštićenim kritičnim sustavima u stvarnom svijetu ili ako, polazeći samo od općenito zadanog cilja, može osmisliti i provesti potpuno nove strategije kibernetičkih napada na dobro zaštićene mete.
Dok nastavljamo usporedno testirati i procjenjivati ovaj model, naše preliminarne evaluacije pokazuju dovoljno dobre rezultate da trenutačno ne možemo isključiti kritičnu razinu sposobnosti. Astra je nadolazeći model i nije sudjelovala u iskorištavanju ranjivosti platforme Hugging Face.
Stoga smo proširili testiranje otpornosti svojih zaštitnih mjera i sigurnosnih kontrola kako bi odgovarale primjeni ovih sposobnosti. Interno smo poduzeli i sljedeće korake kako bi se daljnji razvoj ovog modela odvijao sigurno i uz odgovarajuću zaštitu:
- Uvodimo strože sigurnosne kontrole za sposobnije modele i povezane aktivnosti, uključujući izolirana okruženja za testiranje, ograničen pristup mreži i alatima, poboljšanu zaštitu i šifriranje težina modela, dodatne mogućnosti nadzora i otkrivanja te izvršavanje u zaštićenom okruženju.
- Privremeno obustavljamo interne aktivnosti koje uključuju Astru, a još ne ispunjavaju ove pooštrene zahtjeve sigurnosnih kontrola.
- Uveli smo sveobuhvatan nadzor rizičnih radnji i neusklađenosti u svim agentskim primjenama Astre, uključujući obuku i evaluaciju. Sustavi nadzora procjenjuju lanac misli modela i pokreću sigurnosnu reakciju radi pregleda i prekidanja visokorizičnih aktivnosti.
- Surađivat ćemo s nadležnim državnim tijelima i odabranim organizacijama za sigurnost umjetne inteligencije na testiranju sposobnosti ovog modela.
- Partnerima koji provode testiranja pružit ćemo preporučene sigurnosne kontrole kako bi mogli sigurno provoditi evaluacije i radna opterećenja većeg rizika.
Okvir nas je već usmjeravao tijekom drugih prijelaza na nove razine sposobnosti. U lipnju 2025., kada su se naši modeli prema Okviru pripravnosti približili pragu „Visoka” za biološke sposobnosti, opisali smo korake koje poduzimamo radi jačanja zaštitnih mjera, proširenja testiranja, suradnje s vanjskim stručnjacima i uvođenja dodatnih sigurnosnih kontrola. I ovdje primjenjujemo isto načelo.
Vjerujemo da bi napredni modeli s kibernetičkim sposobnostima trebali pomoći stručnjacima za kibernetičku obranu a pronađu i uklone ranjivosti prije napadača. Predani smo suradnji s vladama, institutima za sigurnost i civilnim društvom kako bi se napredne sposobnosti modela poput Astre, kao i onih koji slijede, primjenjivale odgovorno i široko, na dobrobit cijelog čovječanstva.


