Odziv na novo raven kritičnih kibernetskih zmogljivosti
Kibernetska varnost se hitro spreminja, saj postajajo modeli zmogljivejši na načine, ki lahko okrepijo kibernetsko obrambo, obenem pa omogočijo napade z doslej neprimerljivo hitrostjo in v neprimerljivem obsegu.
Naše najnovejše interne ocene Astre, enega od naših prihajajočih modelov, opravljene v zadnjih nekaj dneh, kažejo velik napredek pri agentskem kodiranju in kibernetski varnosti. Na podlagi teh rezultatov in strokovnih ocen smo sinoči sklenili, da po merilih našega Okvira pripravljenosti(odpre se v novem oknu) ne moremo izključiti kritičnih kibernetskih zmogljivosti.
To objavljamo, ker menimo, da je pomembno javnost ter skupnosti za varnost in zaščito pregledno obvestiti o tem morebitnem premiku v zmogljivostih.
Okvir pripravljenosti smo prvič objavili decembra 2023, veliko preden so se modeli približali tej ravni zmogljivosti na področjih biologije, kemije, kibernetske varnosti in samoizboljševanja umetne inteligence. Zasnovali smo ga kot vodilo za prepoznavanje napredka v zmogljivostih in načrtovanje ukrepov našega podjetja ob pojavu teh zmogljivosti. Prejšnji modeli, vključno z GPT‑5.6‑Sol, so bili ocenjeni glede prelomnih kibernetskih zmogljivosti in uvrščeni na prag Visoko, ne Kritično.
Po našem Okviru pripravljenosti model doseže prag Kritično na področju kibernetske varnosti, če lahko brez človekovega posredovanja v številnih utrjenih kritičnih sistemih iz resničnega sveta odkrije ranljivosti ničelnega dne vseh stopenj resnosti in zanje razvije delujoče načine izrabe ali pa ob zgolj splošno opredeljenem želenem cilju zasnuje in od začetka do konca izvede nove strategije kibernetskih napadov na utrjene tarče.
Medtem ko nadaljujemo primerjalno preskušanje in ocenjevanje tega modela, naši predhodni rezultati kažejo dovolj visoko zmogljivost, da ravni Kritično trenutno ne moremo izključiti. Astra je prihajajoči model in ni sodelovala pri izkoriščanju ranljivosti platforme Hugging Face.
Zato smo razširili preskušanje odpornosti svojih zaščitnih in varnostnih mehanizmov, da bodo ustrezali uvedbi teh zmogljivosti. Za varen in zanesljiv nadaljnji razvoj tega modela smo interno sprejeli tudi naslednje ukrepe:
- Za zmogljivejše modele in z njimi povezane dejavnosti uvajamo strožje varnostne mehanizme, med drugim izolirana preskusna okolja, omejen dostop do omrežij in orodij, okrepljeno zaščito in šifriranje uteži modelov, dodatne zmogljivosti spremljanja in zaznavanja ter izvajanje v peskovniku.
- Začasno ustavljamo interne dejavnosti, povezane z Astro, ki še ne izpolnjujejo teh strožjih zahtev glede varnostnih mehanizmov.
- V vseh agentskih uporabah Astre, vključno z učenjem in ocenjevanjem, smo uvedli celovito spremljanje tveganih dejanj in neusklajenosti. Nadzorni sistemi ocenjujejo verigo razmišljanja modela in sprožijo varnostni odziv za pregled in prekinitev zelo tveganih dejavnosti.
- Pri preskušanju zmogljivosti tega modela bomo sodelovali s pristojnimi državnimi organi in izbranimi organizacijami za varnost umetne inteligence.
- Neodvisnim partnerjem za preskušanje bomo posredovali priporočene varnostne mehanizme za varno izvajanje bolj tveganih ocen in delovnih obremenitev.
Okvir nas je že vodil skozi druge prehode med ravnmi zmogljivosti. Junija 2025, ko so se naši modeli po Okviru pripravljenosti približali pragu zmogljivosti Visoko na področju biologije, smo predstavili ukrepe, ki smo jih izvajali za okrepitev zaščitnih mehanizmov, razširitev preskušanja, sodelovanje z zunanjimi strokovnjaki in uvedbo dodatnih varnostnih mehanizmov. Tudi tukaj uporabljamo isto načelo.
Menimo, da bi morali modeli z naprednimi kibernetskimi zmogljivostmi pomagati braniteljem odkriti in odpraviti ranljivosti, preden jih izkoristijo napadalci. Zavezani smo sodelovanju z vladami, varnostnimi inštituti in civilno družbo, da bi zagotovili odgovorno in široko uporabo prelomnih zmogljivosti modelov, kot je Astra, ter njihovih naslednikov v korist vsega človeštva.


