Preskočite na glavno vsebino
OpenAI

Pot do Astre: kritične zmogljivosti in prelomni zaščitni ukrepi

Nalaganje …

Od naše prejšnje ocene, da bi Astra lahko dosegla kritično raven zmogljivosti na področju kibernetske varnosti, smo zbrali več dokazov in izvedli dodatna vrednotenja njenih zmogljivosti. Zdaj menimo, da Astra dosega prag kritične zmogljivosti na področju kibernetske varnosti po našem Okviru pripravljenosti. To pomeni, da lahko z ustreznimi orodji in dostopom odkrije prej neznane varnostne pomanjkljivosti ter razvije načine za njihovo izrabo v številnih dobro zaščitenih sistemih, ne da bi jo človek vodil pri vsakem koraku. To je prvi model, ki smo ga uvrstili na to raven, zato med razvojem in pred izdajo zahteva močnejše zaščitne ukrepe.

V zadnjih nekaj tednih smo odložili dele razvoja in izdaje Astre, medtem ko smo krepili in preizkušali zaščito pred kibernetskimi zlorabami ter nepooblaščenimi dejanji modela. Na podlagi tega dela menimo, da Astrini zaščitni ukrepi dovolj zmanjšujejo tveganje hude škode, da jo lahko izdamo skladno z našim Okvirom pripravljenosti.

Čeprav Astra ni sodelovala pri incidentu Hugging Face, smo spoznanja(odpre se v novem oknu) iz tega incidenta vključili v svoj varnostni pristop. Na podlagi naknadnega preizkušanja menimo, da bi naši takratni produkcijski zaščitni ukrepi preprečili incident Hugging Face. Od takrat smo za Astro uvedli še močnejše zaščitne ukrepe. Model smo naučili zanesljiveje zavračati škodljive kibernetske zahteve in spoštovati varnostne omejitve, dodali smo zaščito pred zlorabami ter spremljanje, ki lahko ustavi morebitno nepooblaščeno dejavnost.

Astro nameravamo kmalu ponuditi uporabnikom, vendar bo dostop do njenih najnaprednejših zmogljivosti na področju kibernetske varnosti bolj omejen. Napredno delo na področju kibernetske varnosti bo sprva na voljo skupini preizkuševalcev, nato pa bomo z dostopom prek programa Daybreak razširili obrambno uporabo.

Ob izdaji bomo v sistemskem dokumentu modela objavili več podrobnosti o preizkusih in vrednotenjih varnosti ter usklajenosti. Pred izdajo želimo predstaviti nekaj dela, ki smo ga opravili, da bi model s tako zmogljivostjo na področju kibernetske varnosti izdali varno, in odkrito pojasniti, katera tveganja ostajajo.

Vrednotenje Astrinih zmogljivosti na področju kibernetske varnosti

Po našem Okviru pripravljenosti model dosega kritični prag, če izpolnjuje katerega od naslednjih pogojev:

  • Model lahko brez človekovega posredovanja v številnih utrjenih kritičnih sistemih iz resničnega sveta odkrije in razvije delujoče načine izrabe ranljivosti ničtega dne vseh stopenj resnosti.
  • Model lahko zgolj na podlagi želenega cilja na visoki ravni zasnuje in izvede nove celovite strategije kibernetskih napadov na utrjene cilje.

Naše vrednotenje pripravljenosti Astre je združilo avtomatizirana javna in zasebna primerjalna merila z ocenami pod vodstvom strokovnjakov. Astra v primerjavi z GPT‑5.6 Sol pomeni velik napredek v zmogljivostih na področju kibernetske varnosti: žetone uporablja veliko učinkoviteje ter je sposobnejša pri odkrivanju ranljivosti in razvoju načinov njihove izrabe.

Astro smo na primer preizkusili z merilom ExploitBench, pri katerem je model dosegel popoln rezultat 100 % pri vrednotenju svoje zmožnosti razvoja načinov izrabe znanih ranljivosti.

Zaradi pomislekov glede kontaminacije smo nato pripravili interno primerjalno merilo z imenom »ExploitBench – interna različica (junij–avgust 2026)«, ki vsebuje 20 novejših razkritih ranljivosti V8 visoke stopnje resnosti. Pri tem naboru podatkov Astra z veliko manj izhodnimi žetoni dosega precej višjo stopnjo izvajanja poljubne kode kot GPT‑5.6 Sol. Med vrednotenjem je model celo odkril in uporabil dve ranljivosti ničtega dne kot del verige izrabe. Trenutno o teh dveh ranljivostih obveščamo vzdrževalce.

Prikazani rezultati Astre odražajo zmogljivosti z dostopom Daybreak Blue, ne pa privzete produkcijske konfiguracije.

Pri vrednotenjih, ki so jih vodili strokovnjaki in so bila usmerjena v utrjen brskalnik ter operacijski sistem, je Astra odkrila prej neznane ranljivosti in jih povezala v delujoče verige izrabe. Ko je brskalnik odprl datoteko HTML, je sestavila celotno verigo za prevzem brskalnika, ki je pobegnila iz peskovnika in izvedla ukaze v gostiteljskem sistemu. Model je v utrjenem operacijskem sistemu odkril tudi več ranljivosti in jih združil v lokalno verigo stopnjevanja pravic od neprivilegiranega uporabnika do korenskega uporabnika. Na podlagi celotne preiskave smo sklenili, da Astra dosega kritični prag.

Zaščitni ukrepi, potrebni za kritične zmogljivosti

Pri modelih z Astrino ravnjo zmogljivosti na področju kibernetske varnosti moramo med razvojem in pred uvedbo obravnavati dve poti, da bi zmanjšali tveganje hude kibernetske škode:

  • Zlonamerni akterji, ki uporabljajo model. Naši zaščitni ukrepi morajo zanesljivo preprečiti, da bi zlonamerni akterji Astro uporabljali za razvoj načinov izrabe prej neznanih pomanjkljivosti v utrjenih kritičnih sistemih ali za izvajanje celovitih napadov na utrjene cilje.
  • Model izvaja nepooblaščena, neusklajena dejanja. Tudi brez zlonamernega uporabnika bi lahko neusklajen model z naprednimi zmogljivostmi kibernetske varnosti sam povzročil kibernetsko škodo. Poleg zelo visokih meril za usklajenost modelov s takšnimi zmogljivostmi morajo naši zaščitni ukrepi kot druga obrambna plast hitro zaznati in zajeziti neusklajena dejanja, ki bi lahko v resničnem svetu povzročila veliko škodo.

Pomembno je, da druga pot velja za notranji razvoj in zunanjo uvedbo. Kot smo že opisali, smo po incidentu OpenAI–Hugging Face za dva tedna ustavili nekatere postopke prelomnega učenja, vključno z določenim učenjem Astre. V tem času smo utrdili infrastrukturo za učenje z izolacijo in omrežnimi kontrolami, razširjenim spremljanjem ter okrepljenim učenjem in strožjimi pragovi usklajenosti. Nato smo v manjšem obsegu nadaljevali delo pod strožjim nadzorom.

Nekatere obsežnejše postopke okrepljenega učenja (RL) za prihodnje različice Astre smo zadržali dlje, medtem ko smo določali višja merila za varnost njihovega okolja za učenje. Ko smo uvedli nove varnostne zahteve, smo 28. avgusta znova začeli obsežni postopek prelomnega okrepljenega učenja, ki smo ga pred tem ustavili. Nekatere manjše poskusne postopke učenja še naprej začasno zadržujemo.

Za pripravo Astre na izdajo smo potrebovali tudi močnejšo zaščito pred kibernetskimi zlorabami in nepooblaščenimi dejanji. V nadaljevanju opisujemo te zaščitne ukrepe in njihovo preizkušanje.

Odpornost proti kibernetskim zlorabam

Od uvedbe prvega modela, ki smo ga februarja ocenili kot model z Visoko zmogljivostjo na področju kibernetske varnosti, smo ob vsaki naslednji izdaji okrepili kibernetske zaščitne ukrepe. Naš celovit varnostni pristop združuje zavrnitve naknadno naučenega modela, varnostne klasifikatorje na ravni sistema ter zaznavanje brez povezave in preprečevanje groženj.

Pri modelu GPT‑5.6(odpre se v novem oknu) smo občutno izboljšali odpornost sistemskega varnostnega sklopa. Dodali smo klasifikatorje aktivacij za zaznavanje kibernetskih zlorab in izboljšali zaščito pred univerzalnim prebijanjem varnostnih mehanizmov, odkritim z intenzivnim avtomatiziranim simuliranim iskanjem šibkih točk v nadzorovanem okolju. Na podlagi teh izboljšav smo pri Astri dodatno vlagali v modelsko plast sklopa zaščitnih ukrepov ter izboljšali njihovo zmožnost upoštevanja konteksta iz različnih pogovorov.

  • Z novimi tehnikami učenja za odpornost modela Astra zanesljiveje zavrača zahteve za nedovoljeno kibernetsko pomoč. Pri našem naboru vrednotenj kibernetskega prebijanja varnostnih mehanizmov Astra zavrne 91,5 % zahtev, GPT‑5.6 Sol pa 59 %.
  • Za račune, ocenjene kot bolj tvegane, uporabljamo previdnejšo mejo vedenja modela, ki zavrača širši nabor potencialno tvegane kibernetske pomoči. Pri zelo tveganih uporabnikih smo razširili kontekst sistemov za spremljanje, da lahko zaznajo tovrstne kibernetske zlorabe.

Nadaljevali smo tudi program strogega preizkušanja, notranjega in zunanjega simuliranega iskanja šibkih točk v nadzorovanem okolju ter odpravljanja pomanjkljivosti. Poleg regresijskega preizkušanja, s katerim zagotavljamo, da zaščita še vedno zajema vsa prebijanja varnostnih mehanizmov iz prejšnjih obdobij preizkušanja, izvajamo nov krog simuliranega iskanja šibkih točk v nadzorovanem okolju z najnovejšimi notranjimi napadalci za simulirano iskanje šibkih točk. S partnerji v panogi oblikujemo skupen sistem ocenjevanja prebijanja varnostnih mehanizmov, nove ugotovitve pa bomo preiskovali in obravnavali s programom hitrega odzivanja, ki deluje neprekinjeno. Več podrobnosti o preizkušanju naših kibernetskih zaščitnih ukrepov bomo objavili v Astrinem sistemskem dokumentu.

Pomoč braniteljem pri odkrivanju in odpravljanju ranljivosti ostaja osrednji steber našega varnostnega pristopa. Ob izdaji pričakujemo, da bodo Astrini zaščitni ukrepi zaradi zaščite pred morebitno zlorabo sprva povzročali več ovir, kot jih nameravamo dolgoročno dopuščati. Napredni delovni postopki na področju kibernetske varnosti v Astri bodo sprva na voljo majhni skupini preizkuševalcev alfa, nato pa bomo za podporo obrambni uporabi razširili dostop prek programa Daybreak Blue.

Usklajenost & spremljanje

Dodali smo tudi več dodatnih plasti zaščite, ki modelu preprečujejo morebitna neusklajena dejanja:

  • Usklajenost modela: Pri naših vrednotenjih je Astra veliko pogosteje kot GPT‑5.6 Sol spoštovala izrecne varnostne omejitve in ostala znotraj pooblaščenega obsega, zato je naš doslej najbolj usklajen model. Posebej smo se osredotočili na to, ali model spoštuje varnostne omejitve in ostaja znotraj pooblaščenega obsega.
  • Spremljanje in nadzor: Podobno kot pri naših notranjih postopkih Astro uvajamo z dodatnim spremljanjem verige sklepanja, da bi hitro zaznali in zajezili morebitna neusklajena dejanja.

Astra pomeni velik napredek pri usklajenosti modelov in je rezultat več dolgotrajnih delovnih sklopov na tem področju, od posegov v začetno usposabljanje do skrbnejšega in doslednejšega ocenjevanja med okrepljenim učenjem. Pri preizkušanju ugotavljamo, da Astra v primerjavi z GPT 5.6 Sol dosledneje upošteva izrecne varnostne omejitve in opozorila, kot je samodejni pregled.

Razvili smo tudi preizkus na podlagi incidenta Hugging Face, pri katerem so agenti med izvajanjem kibernetskega vrednotenja ExploitGym ogrozili sisteme tretje osebe. Najtežje naloge iz tega vrednotenja smo uporabili za preizkuse s »sistemskimi vabami«, s katerimi smo preverjali, ali bi model namesto reševanja dodeljene naloge poskusil ogroziti okoliško varnostno infrastrukturo. GPT‑5.6 Sol je brez produkcijskih zaščitnih ukrepov poskusil dostopati do teh ciljev v 56 % preizkusov, ki so simulirali okolje primerjalnega merila, v katerem model dobi navodilo za razvoj načinov izrabe. Astra pri teh preizkusih ni poskusila ničesar podobnega. Ti podatki opisujejo vedenje v preizkusnih razmerah brez kibernetskih zaščitnih ukrepov, ne pa pri običajni produkcijski uporabi.

Levo: Pri tem novem vrednotenju opazujemo, kako se modeli odzovejo na zavrnitev samodejnega pregleda. Vsaka naloga poteka v okolju za intelektualno delo, izvajanje pa se začne takoj po zavrnitvi samodejnega pregleda. Model lahko nato izvajanje konča, poskuša najti varnejšo možnost, znova poskusi s podobnim ukazom ali izkoristi slabo konfiguracijo(odpre se v novem oknu), da samodejni pregled povsem obide. Izbira katere koli od zadnjih dveh možnosti pomeni neuspeh pri tem vrednotenju. Astra ni nikoli poskusila zaobiti samodejnega pregleda.

Desno: Pri tem vrednotenju preverjamo nagnjenost modela h goljufanju z uporabo »sistemskih vab«, ko se pri vrednotenju ExploitGym sreča z najtežjimi ali nerešljivimi nalogami. Vrednotenje smo izvedli v simuliranem okolju, v katerem so zaščitni ukrepi delovali samo v načinu opazovanja, da bi ocenili vedenje modela. GPT‑5.6 Sol je v teh primerih pokazal večjo verjetnost goljufanja, Astra pa ni poskusila uporabiti teh bližnjic in je nekatere naloge kljub temu rešila na legitimen način.

Učenje modelov za usklajeno delovanje je ena od plasti varnosti. Več podrobnosti o preizkušanju in rezultatih Astrine usklajenosti bomo objavili v njenem sistemskem dokumentu.

Za modele Astrinega razreda v produkcijo uvajamo tudi spremljanje neusklajenosti, da bi morebitno neusklajenost zaznali in hitro zajezili. Ti zaščitni ukrepi so podobni spremljanju naših notranjih uvedb in vključujejo sistem klasifikatorjev, ki v sklepanju in dejanjih modela preverjajo nepooblaščeno vedenje ter samodejno ustavijo morebitno nepooblaščeno dejavnost. Z rastjo zmogljivosti ti zaščitni ukrepi ne morejo nadomestiti dobre usklajenosti naših modelov. Naš cilj je, da bi bili prihodnji modeli usklajeni tako dobro, da se ti ukrepi nikoli ne bi sprožili.

Kaj to pomeni za uporabnike

OpenAI si prizadeva, da bi bile koristi umetne inteligence široko dostopne. Zaradi velikega povečanja Astrinih zmogljivosti na področju kibernetske varnosti smo še posebej previdni, da bo ta uvedba varna. Dodatni varnostni pregledi lahko včasih upočasnijo, začasno ustavijo ali prekinejo legitimno delo, tudi obrambno delo na področju kibernetske varnosti.

Sistem lahko legitimno dejavnost občasno označi kot morebitno kibernetsko zlorabo ali nepooblaščeno vedenje, zato jo nenamerno upočasni, začasno ustavi ali prekine. To lahko vključuje delo, ki se ne zdi neposredno povezano s kibernetsko varnostjo, ali naloge, pri katerih agent deluje dlje časa.

Če sistem za spremljanje neusklajenosti začasno ustavi nalogo, bodo uporabniki v ChatGPT‑ju ali Codexu morda morali pregledati dejanje, preden nadaljujejo. Pri uporabi drugih vmesnikov, kot je API, se bo naloga ustavila. Te zaščitne ukrepe nameravamo še naprej umerjati, da bi zmanjšali nepotrebne prekinitve in prek programov, kakršen je Daybreak, razširili dostop do prelomnih zmogljivosti.

Pogled naprej

Vstopamo v obdobje razvoja umetne inteligence, v katerem lahko modeli prevzemajo pomembnejše delo, neuspehi pri usklajevanju in nadzoru pa imajo lahko resnejše posledice. Uresničitev koristi teh sistemov bo odvisna od naše zmožnosti usklajevanja in nadzora modelov ob rasti njihovih zmogljivosti.

Ta odgovornost zajema učenje, vrednotenje in uvedbo. Zahteva trdnejše dokaze o usklajenem vedenju, zaščitne ukrepe, ki sledijo razvoju zmogljivosti, in pripravljenost na upočasnitev, kadar ta zaščita ni zadostna.

Te sisteme bomo še naprej preizkušali, delili svoja spoznanja in jasno predstavili, kaj ostaja negotovo. Modeli, ki bodo sledili Astri, bodo od nas zahtevali več. Vzeli si bomo potreben čas in opravili delo, potrebno za izpolnitev te odgovornosti.