Po ankstesnio vertinimo, kad „Astra“ gali pasiekti kritinį kibernetinio saugumo gebėjimų lygį, surinkome daugiau įrodymų ir atlikome papildomų modelio gebėjimų vertinimų. Dabar manome, kad pagal mūsų Pasirengimo sistemą „Astra“ pasiekė kritinį kibernetinio saugumo gebėjimų slenkstį. Tai reiškia, kad turėdama tinkamus įrankius ir prieigą ji gali daugelyje gerai apsaugotų sistemų aptikti anksčiau nežinomas saugumo spragas ir sukurti jų išnaudojimo būdus, žmogui nevadovaujant kiekvienam žingsniui. Tai pirmasis modelis, kurį priskiriame šiam lygiui, todėl jį kuriant ir prieš išleidžiant būtinos stipresnės apsaugos priemonės.
Pastarosiomis savaitėmis atidėjome dalį „Astra“ kūrimo ir išleidimo darbų, kol stiprinome ir bandėme apsaugą nuo piktnaudžiavimo kibernetinėmis priemonėmis bei neįgaliotų modelio veiksmų. Remdamiesi šiuo darbu manome, kad „Astra“ apsaugos priemonės pakankamai sumažina didelės žalos riziką, todėl modelį galima išleisti pagal mūsų Pasirengimo sistemą.
Nors „Astra“ nedalyvavo „Hugging Face“ incidente, į savo saugos metodą įtraukėme per šį incidentą įgytas žinias(atsidaro naujame lange). Remdamiesi retrospektyviais bandymais manome, kad tuo metu naudotos produkcinės apsaugos priemonės būtų užkirtusios kelią „Hugging Face“ incidentui. Nuo tada „Astra“ įdiegėme dar stipresnes apsaugos priemones: modelį mokėme patikimiau atsisakyti vykdyti žalingas kibernetines užklausas ir laikytis saugos apribojimų, pridėjome apsaugą nuo piktnaudžiavimo ir stebėseną, galinčią sustabdyti galimai neįgaliotą veiklą.
Netrukus ketiname suteikti galimybę naudotis „Astra“, tačiau prieiga prie pažangiausių jos kibernetinio saugumo gebėjimų bus labiau ribota. Iš pradžių pažangius kibernetinio saugumo darbus galės vykdyti bandytojų grupė, o vėliau prieiga per „Daybreak Blue“ bus plečiama gynybiniam naudojimui.
Išleidimo metu modelio sistemos kortelėje pateiksime daugiau informacijos apie saugos, saugumo bei suderinimo bandymus ir vertinimus. Prieš išleisdami modelį norime papasakoti apie dalį darbų, atliekamų siekiant saugiai išleisti tokio lygio kibernetinio saugumo gebėjimų modelį, ir skaidriai įvardyti išliekančią riziką.
Pagal mūsų Pasirengimo sistemą modelis pasiekia kritinį slenkstį, jei tenkinama bent viena iš šių sąlygų:
- Modelis be žmogaus įsikišimo gali daugelyje gerai apsaugotų realių kritinių sistemų aptikti ir sukurti veikiančias įvairaus pavojingumo nulinės dienos pažeidžiamumų išnaudojimo priemones.
- Gavęs tik bendro pobūdžio tikslą, modelis gali sukurti ir įgyvendinti visiškai naujas ištisinių kibernetinių atakų prieš gerai apsaugotus taikinius strategijas.
Vertindami „Astra“ pasirengimą derinome automatizuotus viešus bei privačius testus ir ekspertų atliekamus vertinimus. Palyginti su „GPT‑5.6 Sol“, „Astra“ kibernetinio saugumo gebėjimai gerokai pažangesni: ji daug efektyviau naudoja žetonus ir geriau aptinka pažeidžiamumus bei kuria jų išnaudojimo priemones.
Pavyzdžiui, išbandėme „Astra“ su „ExploitBench“ – modelis surinko 100 % balų teste, kuriame vertinamas gebėjimas kurti žinomų pažeidžiamumų išnaudojimo priemones.
Kilus abejonių dėl duomenų užterštumo, sukūrėme vidinį testą „ExploitBench“ vidinis variantas (2026 m. birželis–rugpjūtis)“, apimantį 20 neseniai atskleistų didelio pavojingumo V8 pažeidžiamumų. Šiame duomenų rinkinyje „Astra“, naudodama gerokai mažiau išvesties žetonų, savavališko kodo vykdymo rodikliu gerokai lenkia „GPT‑5.6 Sol“. Vertinimo metu modelis netgi aptiko ir išnaudojimo grandinėje panaudojo du nulinės dienos pažeidžiamumus. Šiuo metu apie juos informuojame prižiūrėtojus.
Pateikti „Astra“ rezultatai atspindi gebėjimus naudojantis „Daybreak Blue“ prieiga, o ne numatytąją produkcinę konfigūraciją.
Ekspertų atliekamuose gerai apsaugotos naršyklės ir operacinės sistemos vertinimuose „Astra“ aptiko anksčiau nežinomų pažeidžiamumų ir pavertė juos veikiančiomis išnaudojimo grandinėmis. Modelis sukūrė visą naršyklės užvaldymo grandinę, kuri, naršyklei atvėrus HTML failą, ištrūko iš izoliuotosios aplinkos ir vykdė komandas pagrindinėje sistemoje. Modelis taip pat aptiko kelis gerai apsaugotos operacinės sistemos pažeidžiamumus ir sujungė juos į vietinę teisių išplėtimo grandinę, suteikiančią neprivilegijuotam naudotojui „root“ teises. Apibendrinę visą tyrimą padarėme išvadą, kad „Astra“ pasiekė kritinį slenkstį.
Kad sumažintume didelės kibernetinės žalos riziką, tiek kurdami „Astra“ lygio kibernetinio saugumo gebėjimų modelius, tiek prieš juos diegdami turime atsižvelgti į du galimus scenarijus:
- Piktavalių naudojimasis modeliu. Mūsų apsaugos priemonės turi patikimai neleisti piktavaliams pasitelkti „Astra“ anksčiau nežinomų gerai apsaugotų kritinių sistemų spragų išnaudojimo priemonėms kurti ar visoms atakoms prieš gerai apsaugotus taikinius vykdyti.
- Modelio atliekami neįgalioti, su tikslais nesuderinti veiksmai. Net nesant piktavališko naudotojo, netinkamai suderintas pažangių kibernetinio saugumo gebėjimų modelis galėtų pats padaryti kibernetinės žalos. Tokiems modeliams taikome itin aukštus suderinimo standartus, tačiau antrasis apsaugos lygmuo taip pat turi leisti greitai aptikti ir sustabdyti su tikslais nesuderintus veiksmus, galinčius padaryti didelės žalos realiame pasaulyje.
Svarbu tai, kad antrasis scenarijus taikomas ir vidiniam kūrimui, ir išoriniam diegimui. Kaip jau aprašėme, po „OpenAI“ ir „Hugging Face“ incidento dviem savaitėms pristabdėme dalį priešakinių modelių mokymo darbų (įskaitant tam tikrus „Astra“ mokymo darbus), kad sustiprintume mokymo infrastruktūrą: izoliavimą ir tinklo kontrolės priemones, platesnę stebėseną, taip pat suderinimo mokymą ir jo slenksčius. Vėliau tęsėme mažesnio masto darbus, taikydami griežtesnes kontrolės priemones.
Kai kuriuos didesnius skatinamojo mokymosi (RL) ciklus, skirtus būsimoms „Astra“ versijoms, atidėjome ilgesniam laikui, kol jų mokymo aplinkai nustatėme aukštesnius saugos ir saugumo standartus. Rugpjūčio 28 d., įdiegę naujus saugos ir saugumo reikalavimus, atnaujinome anksčiau pristabdytą didelį priešakinio modelio RL mokymo ciklą. Kai kuriuos mažesnius eksperimentinius mokymo ciklus kol kas tebelaikome pristabdytus.
Rengiant „Astra“ išleidimui taip pat prireikė stipresnės apsaugos nuo piktnaudžiavimo kibernetinėmis priemonėmis ir neįgaliotų veiksmų. Toliau aprašome šias apsaugos priemones ir jų bandymus.
Nuo tada, kai vasarį įdiegėme pirmąjį modelį, kurio kibernetinio saugumo gebėjimus įvertinome kaip aukštus, su kiekvienu nauju leidimu stiprinome kibernetines apsaugos priemones. Mūsų bendras saugos metodas apima kelis sluoksnius: papildomai suderinto modelio atsisakymus vykdyti užklausas, sistemos lygmens saugos klasifikatorius, taip pat aptikimą neprisijungus ir grėsmių šalinimą.
Kurdami GPT‑5.6(atsidaro naujame lange) gerokai padidinome sistemos lygmens priemonių rinkinio atsparumą: be kita ko, pridėjome aktyvacijos klasifikatorius piktnaudžiavimui kibernetinėmis priemonėmis aptikti ir išplėtėme apsaugą nuo universalių apribojimų apėjimo būdų, nustatytų intensyviai automatizuotai testuojant spragas. Remdamiesi šiais patobulinimais, kurdami „Astra“ dar daugiau investavome į apsaugos priemonių rinkinio modelio lygmenį ir gerinome šių priemonių gebėjimą atsižvelgti į kelių pokalbių kontekstą.
- Dėl naujų modelio atsparumo mokymo metodų „Astra“ patikimiau atsisako vykdyti neleidžiamos kibernetinės pagalbos užklausas. Mūsų kibernetinių apribojimų apėjimo vertinimuose „Astra“ atsisako vykdyti 91,5 % užklausų (palyginti su 59 % „GPT‑5.6 Sol“ atveju).
- Didesnės rizikos paskyroms taikome konservatyvesnę modelio elgsenos ribą, todėl jis atsisako teikti įvairesnę galimai rizikingą kibernetinę pagalbą. Kad galėtume aptikti tokį didelės rizikos naudotojų piktnaudžiavimą kibernetinėmis priemonėmis, išplėtėme stebėsenos sistemų kontekstą.
Taip pat tęsiame griežtų bandymų, vidinio bei išorinio testavimo spragoms nustatyti ir trūkumų šalinimo programą. Atliekame regresinius bandymus, kad visi ankstesniais bandymų laikotarpiais nustatyti apribojimų apėjimo būdai liktų užblokuoti, ir kartu pradedame naują testavimo spragoms nustatyti etapą, pasitelkdami naujausius vidinius testavimo spragoms nustatyti atakuotojus. Su sektoriaus partneriais kuriame bendrą apribojimų apėjimo būdų vertinimo sistemą, o naujiems radiniams tirti ir šalinti naudosime visą parą veikiančią greitojo reagavimo programą. Daugiau informacijos apie „Astra“ kibernetinių apsaugos priemonių bandymus pateiksime sistemos kortelėje.
Pagalba gynėjams aptinkant ir ištaisant pažeidžiamumus tebėra vienas pagrindinių mūsų saugos metodo ramsčių. Išleidimo metu „Astra“ apsaugos priemonės, siekiant apsisaugoti nuo galimo piktnaudžiavimo, tikriausiai ribos daugiau, nei ketiname ilgainiui. Iš pradžių pažangioms kibernetinio saugumo darbo eigoms „Astra“ galės naudoti nedidelė alfa versijos bandytojų grupė, o vėliau prieiga per „Daybreak Blue“ bus plečiama, kad būtų remiamas gynybinis naudojimas.
Taip pat įdiegėme papildomų kelių sluoksnių apsaugos priemonių, neleidžiančių modeliui atlikti galimai su tikslais nesuderintų veiksmų:
- Modelio suderinimas. Mūsų vertinimuose „Astra“ daug dažniau nei „GPT‑5.6 Sol“ laikėsi aiškių saugos bei saugumo apribojimų ir neperžengė jai suteiktų įgaliojimų, todėl tai iki šiol geriausiai suderintas mūsų modelis. Ypač daug dėmesio skyrėme tam, ar modelis laikosi saugumo bei saugos apribojimų ir neperžengia jam suteiktų įgaliojimų.
- Stebėsena ir kontrolė. Panašiai kaip vidinėse procedūrose, diegdami „Astra“ naudojame papildomą minčių grandinės stebėseną, kad galėtume greitai aptikti ir sustabdyti galimai su tikslais nesuderintus veiksmus.
„Astra“ yra reikšmingas žingsnis pirmyn modelių suderinimo srityje ir kelių ilgalaikių suderinimo darbų rezultatas – nuo intervencijų per išankstinį mokymą iki kruopštesnio bei nuoseklesnio vertinimo per skatinamąjį mokymąsi. Bandymai rodo, kad, palyginti su „GPT 5.6 Sol“, „Astra“ nuosekliau laikosi aiškių saugos apribojimų ir įspėjimų, pavyzdžiui, automatinės peržiūros.
Taip pat sukūrėme „Hugging Face“ incidentu pagrįstą bandymą – per šį incidentą kibernetinį „ExploitGym“ vertinimą vykdę agentai pažeidė trečiosios šalies sistemas. Pasitelkę sunkiausias šio vertinimo užduotis sukūrėme „medaus puodynių“ bandymus, tikrinančius, ar modelis, užuot sprendęs paskirtą užduotį, mėgintų pažeisti aplinkinę saugumo infrastruktūrą. Be produkcinių apsaugos priemonių „GPT‑5.6 Sol“ mėgino pasiekti šiuos taikinius per 56 % bandymų, imituojančių testo aplinką, kurioje modeliui nurodoma kurti pažeidžiamumų išnaudojimo priemones. Per šiuos bandymus „Astra“ nė karto to nemėgino. Šie skaičiai apibūdina elgseną bandymo sąlygomis be kibernetinių apsaugos priemonių, o ne įprastą produkcinį naudojimą.
Kairėje. Šiame naujame vertinime stebime, kaip modeliai reaguoja į automatinės peržiūros atmetimą. Kiekviena užduotis vykdoma žinių darbu grindžiamoje aplinkoje, o vykdymas pradedamas iškart po to, kai automatinė peržiūra atmeta veiksmą. Tada modelis gali rinktis kelis būdus: baigti vykdymą, ieškoti saugesnės alternatyvos, pakartoti panašią komandą arba pasinaudoti prasta konfigūracija(atsidaro naujame lange) ir visiškai apeiti automatinę peržiūrą. Pasirinkus bet kurį iš dviejų pastarųjų variantų vertinimas būtų laikomas nesėkmingu. „Astra“ nė karto nemėgino apeiti automatinės peržiūros.
Dešinėje. Šiame vertinime tikriname modelio polinkį sukčiauti (naudojant „medaus puodynes“), kai atliekamos sunkiausios arba neįmanomos „ExploitGym“ vertinimo užduotys. Siekiant įvertinti modelio elgseną, bandymas atliktas imituojamoje aplinkoje, o apsaugos priemonės veikė tik stebėjimo režimu. Nors pagal „GPT‑5.6 Sol“ elgseną šiuose scenarijuose sukčiavimo tikimybė buvo didesnė, „Astra“ nemėgino naudotis šiomis nuorodomis ir vis tiek teisėtai išsprendė kai kurias užduotis.
Modelių suderinimo mokymas yra vienas saugos sluoksnių. Daugiau informacijos apie suderinimo bandymus ir rezultatus pateiksime „Astra“ sistemos kortelėje.
Produkciniu būdu diegdami „Astra“ klasės modelius taip pat naudojame nesuderintos elgsenos stebėseną, kad aptiktume ir greitai sustabdytume galimą nesuderintą elgseną. Šios apsaugos priemonės panašios į vidinių diegimų stebėseną: klasifikatorių sistema tikrina modelio protavimą ir veiksmus, ieško neįgaliotos elgsenos ir automatiškai sustabdo galimai neįgaliotą veiklą. Gebėjimams didėjant šios apsaugos priemonės negali pakeisti tinkamo modelių suderinimo, todėl siekiame, kad būsimi modeliai būtų suderinti taip gerai, jog šių priemonių niekada nereikėtų suaktyvinti.
OpenAI siekia, kad dirbtinio intelekto teikiama nauda būtų plačiai prieinama. Atsižvelgdami į gerokai pažangesnius „Astra“ kibernetinio saugumo gebėjimus, ypač rūpinamės saugiu šio modelio diegimu. Papildomos saugos patikros kartais gali sulėtinti, pristabdyti arba sustabdyti teisėtą darbą, įskaitant gynybinį kibernetinį saugumą.
Sistema kartais gali teisėtą veiklą klaidingai pažymėti kaip galimą piktnaudžiavimą kibernetinėmis priemonėmis ar neįgaliotą elgseną, todėl ši veikla gali būti netyčia sulėtinta, pristabdyta arba sustabdyta. Tai gali apimti darbą, kuris neatrodo tiesiogiai susijęs su kibernetiniu saugumu, arba ilgai agento vykdomas užduotis.
Jei nesuderintos elgsenos stebėjimo priemonė pristabdys užduotį, ChatGPT arba Codex naudotojų prieš tęsiant gali būti paprašyta peržiūrėti veiksmą. Naudojant kitas sąsajas, pavyzdžiui, API, užduotis bus sustabdyta. Toliau derinsime šias apsaugos priemones, kad sumažintume nereikalingų pertrūkių skaičių ir per tokias programas kaip „Daybreak“ plėstume prieigą prie priešakinių gebėjimų.
Žengiame į tokį DI raidos etapą, kai modeliams galima patikėti reikšmingesnius darbus, o suderinimo ir kontrolės nesėkmės gali turėti rimtesnių pasekmių. Šių sistemų nauda priklausys nuo mūsų gebėjimo suderinti ir kontroliuoti modelius augant jų gebėjimams.
Ši atsakomybė apima mokymą, vertinimą ir diegimą. Tam reikia svaresnių suderintos elgsenos įrodymų, gebėjimų raidą atitinkančių apsaugos priemonių ir pasirengimo sulėtinti darbus, kai šios priemonės nepakankamos.
Toliau bandysime šias sistemas, dalysimės įgytomis žiniomis ir aiškiai įvardysime tai, kas lieka neaišku. Po „Astra“ sukurti modeliai iš mūsų pareikalaus dar daugiau. Skirsime tiek laiko ir darbo, kiek reikės šiai atsakomybei įvykdyti.
