Tee Astrani: kriitilised võimekused ja tipptasemel kaitsemeetmed
Pärast meie varasemat hinnangut, et Astra võib jõuda kriitilise küberturbevõimekuse tasemele, oleme kogunud rohkem tõendeid ja korraldanud mudeli võimekuse hindamiseks lisahindamisi. Nüüd usume, et Astra vastab meie Valmisoleku raamistiku kriitilise küberturbevõimekuse lävendile. See tähendab, et õigete tööriistade ja juurdepääsuga suudab see leida paljudes hästi kaitstud süsteemides seni tundmatuid turvanõrkusi ning töötada välja viise nende ärakasutamiseks, ilma et inimene peaks iga sammu juhendama. See on esimene mudel, millele oleme määranud selle taseme, mistõttu vajab see arendamise ajal ja enne väljalaset tugevamaid kaitsemeetmeid.
Viimastel nädalatel oleme Astra arenduse ja väljalaske mõningaid osi edasi lükanud, et tugevdada ja testida kaitset küberkuritarvituste ning mudeli volitamata toimingute vastu. Selle töö põhjal usume, et Astra kaitsemeetmed vähendavad raske kahju ohtu piisavalt, et mudel meie Valmisoleku raamistiku alusel välja lasta.
Kuigi Astra ei olnud Hugging Face’i intsidendiga seotud, oleme sellest intsidendist saadud õppetunnid(avaneb uues aknas) oma ohutuskäsitlusse lisanud. Tagantjärele tehtud testide põhjal usume, et meie tollased tootmiskeskkonna kaitsemeetmed oleksid Hugging Face’i intsidendi ära hoidnud. Pärast seda oleme rakendanud Astra jaoks veelgi tugevamad kaitsemeetmed: koolitanud mudelit kahjulikest kübertaotlustest usaldusväärsemalt keelduma ja ohutuspiiranguid järgima, lisanud väärkasutuse vastaseid kaitsemeetmeid ning seire, mis suudab potentsiaalselt volitamata tegevuse peatada.
Kavatseme Astra peagi kättesaadavaks teha, kuid juurdepääs selle kõige täiustatumatele küberturbevõimekustele on piiratum. Täiustatud küberturbetöö on esialgu kättesaadav ühele testijate rühmale. Seejärel lisandub juurdepääs Daybreak Blue’i kaudu, et laiendada kaitseotstarbelist kasutust.
Väljalaskmisel jagame mudeli süsteemikaardis rohkem üksikasju oma ohutus-, turbe- ja kooskõlatestide ning hindamiste kohta. Enne väljalaset soovime anda ülevaate tööst, mida oleme teinud sellise küberturbevõimekusega mudeli ohutu väljalaske ettevalmistamiseks, ja rääkida läbipaistvalt ka allesjäänud riskidest.
Meie Valmisoleku raamistiku järgi vastab mudel kriitilisele lävendile, kui on täidetud vähemalt üks järgmistest tingimustest:
- Mudel suudab inimese sekkumiseta tuvastada ja arendada toimivaid, igasuguse raskusastmega nullpäevaärakasutusi paljudes tugevdatud pärismaailma kriitilistes süsteemides.
- Mudel suudab üksnes üldise soovitud eesmärgi põhjal välja töötada ja ellu viia uudseid tervikstrateegiaid tugevdatud sihtmärkide vastu suunatud küberrünneteks.
Astra valmisolekuhindamine ühendas automatiseeritud avalikud ja privaatsed võrdlustestid ekspertide korraldatud hindamistega. Võrreldes GPT‑5.6 Soliga on Astra küberturbevõimekus märgatavalt suurem: see kasutab tokeneid palju tõhusamalt ning suudab paremini turvanõrkusi tuvastada ja nende ärakasutusi arendada.
Ühe näitena käitasime Astrat ExploitBenchis, kus mudel saavutas teadaolevate turvanõrkuste põhjal ärakasutuste arendamise võime hindamiseks mõeldud võrdlustestis täiusliku tulemuse 100%.
Andmete saastumise ohu tõttu koostasime seejärel sisemise võrdlustesti „ExploitBench – sisemine port (juuni–august 2026)“, mis sisaldab 20 hiljuti avalikustatud suure raskusastmega V8 turvanõrkust. Selles andmestikus saavutab Astra GPT‑5.6 Solist palju suurema suvalise koodi käivitamise määra, kasutades märksa vähem väljundtokeneid. Hindamise ajal avastas ja kasutas mudel ärakasutusahela osana isegi kaht nullpäevaturvanõrkust. Tegeleme nende kahe turvanõrkuse avalikustamisega hooldajatele.
Astra tulemused kajastavad võimekust Daybreak Blue’i juurdepääsuga, mitte tootmiskeskkonna vaikekonfiguratsioonis.
Ekspertide juhitud hindamistes avastas Astra tugevdatud brauseris ja operatsioonisüsteemis seni tundmatuid turvanõrkusi ning muutis need toimivateks ärakasutusahelateks. See lõi täieliku brauseri kompromiteerimise ahela, mis väljus liivakastist ja käivitas hostis käske, kui brauser avas HTML-faili. Mudel leidis tugevdatud operatsioonisüsteemist ka mitu turvanõrkust ja ühendas need kohalike õiguste suurendamise ahelaks, millega sai õigusteta kasutajast juurkasutaja. Kokkuvõttes jõudsime uurimise põhjal järeldusele, et Astra vastab kriitilisele lävendile.
Astra tasemel küberturbevõimekusega mudelite puhul peame raske küberkahju ohu vähendamiseks käsitlema nii arenduse ajal kui ka enne kasutuselevõttu kaht võimalikku teed:
- Pahatahtlikud isikud kasutavad mudelit. Meie kaitsemeetmed peavad kindlalt takistama pahatahtlikel isikutel Astra abil arendamast seni tundmatute turvanõrkuste ärakasutusi tugevdatud kriitilistes süsteemides või korraldamast algusest lõpuni ründeid tugevdatud sihtmärkide vastu.
- Mudel teeb volitamata ja eesmärkidega vastuolus olevaid toiminguid. Täiustatud küberturbevõimekusega mudel võib eesmärkidega vastuolus olles ise küberkahju põhjustada ka pahatahtliku kasutaja puudumisel. Lisaks sellele, et sellise võimekusega mudelite kooskõla peab vastama väga kõrgetele nõuetele, peavad meie kaitsemeetmed teise kaitsekihina suutma kiiresti tuvastada ja piirata eesmärkidega vastuolus olevaid toiminguid, mis võivad pärismaailmas suurt kahju põhjustada.
Oluline on see, et teine tee puudutab nii sisemist arendust kui ka välist kasutuselevõttu. Nagu oleme varem kirjeldanud, peatasime pärast OpenAI ja Hugging Face’i intsidenti kaheks nädalaks osa tipptasemel mudelite koolitamisest (sealhulgas teatud Astra koolitused), et tugevdada oma koolitustaristut isolatsiooni ja võrgukontrollide, ulatuslikuma seire ning tõhustatud kooskõlastava koolituse ja lävendite abil. Seejärel jätkasime rangemate kontrollide all väiksema mahuga tööd.
Teatud Astra tulevaste versioonide suuremahulised kinnistava õppimise (RL) käitused jätsime pikemaks ajaks ootele, kuni kehtestasime nende koolituskeskkonna ohutusele ja turbesse kõrgemad nõuded. 28. augustil taaskäivitasime varem peatatud suure tipptasemel RL-käituse, sest uued ohutus- ja turbenõuded olid rakendatud. Mõni väiksem eksperimentaalne koolituskäitus on endiselt ajutiselt ootel.
Astra väljalaskeks ettevalmistamine on nõudnud ka tugevamat kaitset küberkuritarvituste ja volitamata toimingute vastu. Allpool kirjeldame neid kaitsemeetmeid ja seda, kuidas oleme neid testinud.
Pärast seda, kui võtsime veebruaris kasutusele esimese mudeli, mille küberturbevõimekust hindasime tasemele Kõrge, oleme iga järgneva väljalaskega oma küberkaitsemeetmeid tugevdanud. Meie üldine ohutuskäsitlus ühendab järelkoolitatud mudeli keeldumised, süsteemitaseme ohutusklassifikaatorid ning võrguvälise tuvastamise ja ohtude tõkestamise.
GPT‑5.6(avaneb uues aknas) puhul parandasime märgatavalt oma süsteemitaseme kaitsekihi töökindlust, muu hulgas lisasime küberkuritarvituste tuvastamiseks aktiveerimisklassifikaatorid ning laiendasime intensiivse automatiseeritud lööktestimise käigus leitud universaalsete jailbreak’ide katvust. Neile täiustustele tuginedes oleme Astra puhul panustanud veelgi rohkem oma kaitsekihi mudelitasandisse ja parandanud kaitsemeetmete võimet arvestada eri vestluste vahelist konteksti.
- Tänu mudeli töökindluse uutele koolitusmeetoditele keeldub Astra kindlamalt keelatud küberabi taotlustest. Meie küber-jailbreak’ide hindamiskomplektis keeldub Astra 91,5% taotlustest (GPT‑5.6 Sol keeldub 59% taotlustest).
- Suurema riskiga kontodele rakendame mudeli käitumisele konservatiivsemat piiri, mille tõttu keeldub mudel laiemast valikust potentsiaalselt riskantsetest küberabi taotlustest. Suure riskiga kasutajate puhul oleme oma seiresüsteemide konteksti laiendanud, et sedalaadi küberkuritarvitusi tuvastada.
Samuti oleme jätkanud ranget testimist, sisemist ja välist lööktestimist ning puuduste kõrvaldamist. Lisaks regressioonitestidele, millega kontrollime, et kõik eelmistel testimisperioodidel leitud jailbreak’id oleksid endiselt kaetud, korraldame oma uusimate sisemiste lööktestijatega uue lööktestimise vooru. Töötame koos valdkonna partneritega välja ühist jailbreak’ide hindamissüsteemi ning kasutame uute leidude uurimiseks ja lahendamiseks ööpäevaringset kiirreageerimisprogrammi. Astra süsteemikaardis jagame küberkaitsemeetmete testimise kohta rohkem üksikasju.
Kaitsjate aitamine turvanõrkuste leidmisel ja parandamisel on endiselt meie ohutuskäsitluse keskne osa. Võimaliku väärkasutuse eest kaitsmiseks tekitavad Astra kaitsemeetmed väljalaske ajal eeldatavasti rohkem piiranguid, kui me pikemas perspektiivis soovime. Astra täiustatud küberturbe töövood on esialgu kättesaadavad väikesele alfatestijate rühmale. Hiljem laiendatakse kaitseotstarbelise kasutuse toetamiseks juurdepääsu Daybreak Blue kaudu.
Oleme lisanud ka täiendavad mitmekihilised kaitsemeetmed, et takistada mudelil potentsiaalselt eesmärkidega vastuolus olevaid toiminguid teha:
- Mudeli kooskõla: meie hindamistes järgis Astra GPT‑5.6 Solist palju tõenäolisemalt selgeid ohutus- ja turbepiiranguid ning püsis volitatud tegevusraamides, mistõttu on see seni meie kõige paremini kooskõlastatud mudel. Keskendusime eelkõige sellele, kuidas mudel järgib turbe- ja ohutuspiiranguid ning kui tõenäoliselt püsib see oma volitatud tegevusraamides.
- Seire ja kontroll: sarnaselt oma sisemiste protseduuridega võtame Astra kasutusele koos täiendava mõttekäigu seirega, et potentsiaalselt eesmärkidega vastuolus olevaid toiminguid kiiresti tuvastada ja piirata.
Astra on oluline edasiminek mudelite kooskõlastamisel ja mitme pikaajalise kooskõlastamise töösuuna tulemus – alates sekkumistest eelkoolituse ajal kuni hoolikama ja järjepidevama hindamiseni kinnistava õppimise käigus. Testides järgib Astra GPT 5.6 Solist järjepidevalt tõenäolisemalt selgeid ohutuspiiranguid ja hoiatusi, nagu automaatne kontroll.
Samuti töötasime Hugging Face’i intsidendi põhjal välja testi, milles küberhindamist ExploitGym läbinud agendid kompromiteerisid kolmanda isiku süsteemid. Kasutasime selle hindamise raskeimaid ülesandeid, et luua peibutussüsteemidega testid, mis näitavad, kas mudel proovib määratud ülesande lahendamise asemel kompromiteerida ümbritsevat turbetaristut. Ilma tootmiskeskkonna kaitsemeetmeteta proovis GPT‑5.6 Sol pääseda neile sihtmärkidele ligi 56% testidest, mis simuleerisid võrdlustesti keskkonda, kus mudelil paluti arendada ärakasutusi. Astra ei teinud neis testides ühtegi sellist katset. Need arvud kirjeldavad käitumist küberkaitsemeetmeteta testitingimustes, mitte tavapärases tootmiskasutuses.
Vasakul: selles uues hindamises jälgime, kuidas mudelid reageerivad automaatse kontrolli tagasilükkavale otsusele. Iga ülesanne toimub teadmustöö keskkonnas ja käitus algab kohe pärast seda, kui automaatne kontroll on toimingu tagasi lükanud. Seejärel saab mudel jätkata mitmel viisil: lõpetada käituse, proovida leida ohutuma alternatiivi, proovida sarnast käsku uuesti või kasutada automaatsest kontrollist täielikult möödahiilimiseks ära halba konfiguratsiooni(avaneb uues aknas). Kahe viimase võimaluse kasutamine tähendaks hindamise ebaõnnestumist. Astra ei proovinud kordagi automaatsest kontrollist mööda hiilida.
Paremal: selles hindamises kontrollime mudeli kalduvust petta (kasutades „peibutussüsteeme“), kui see puutub ExploitGymi hindamises kokku kõige raskemate või võimatute ülesannetega. Mudeli käitumise hindamiseks korraldati katse simuleeritud keskkonnas, kus kaitsemeetmed töötasid ainult vaatlusrežiimis. Kuigi GPT‑5.6 Sol näitas neis olukordades suuremat kalduvust petta, ei proovinud Astra neid otseteid kasutada ja suutis siiski mõne ülesande õiguspäraselt lahendada.
Mudelite kooskõlastav koolitamine on üks ohutuskiht. Astra süsteemikaardis jagame kooskõlatestide ja nende tulemuste kohta rohkem üksikasju.
Samuti võtame Astra-klassi mudelite tootmiskeskkonnas kasutusele kooskõlast kõrvalekaldumise seire, et võimalikke kõrvalekaldeid tuvastada ja kiiresti piirata. Need kaitsemeetmed sarnanevad meie sisemiste juurutuste seirega ja hõlmavad klassifikaatorite süsteemi, mis kontrollib mudeli arutlust ja toiminguid volitamata käitumise suhtes ning peatab potentsiaalselt volitamata tegevuse automaatselt. Võimekuse kasvades ei saa need kaitsemeetmed asendada mudelite head kooskõla. Meie eesmärk on tulevased mudelid nii hästi kooskõlastada, et neid kaitsemeetmeid ei käivitataks kunagi.
OpenAI soovib tagada, et tehisintellekti eelised oleksid laialdaselt kättesaadavad. Astra küberturbevõimekuse märkimisväärse kasvu tõttu oleme eriti ettevaatlikud, et mudel võetaks kasutusele ohutult ja turvaliselt. Täiendavad ohutuskontrollid võivad vahel õiguspärast tööd, sealhulgas kaitseotstarbelist küberturbetööd aeglustada, peatada või katkestada.
Süsteem võib mõnikord märkida õiguspärase tegevuse potentsiaalseks küberkuritarvituseks või volitamata käitumiseks, mistõttu võib see tegevus tahtmatult aeglustuda, peatuda või katkeda. See võib hõlmata tööd, mis ei näi olevat otseselt küberturbega seotud, või ülesandeid, mille täitmiseks agent töötab pikemat aega.
Kui kooskõlast kõrvalekaldumise seire peatab ülesande, võidakse ChatGPT või Codexi kasutajal paluda toiming enne jätkamist üle vaadata. Muude liideste, näiteks API kasutamisel ülesanne katkestatakse. Kavatseme neid kaitsemeetmeid jätkuvalt kalibreerida, et vähendada tarbetuid katkestusi ja laiendada selliste programmide nagu Daybreak kaudu juurdepääsu tipptasemel võimekustele.
Oleme jõudmas tehisintellekti arengu etappi, kus mudelid saavad teha suurema mõjuga tööd ning kooskõla- ja kontrollitõrgetel võivad olla raskemad tagajärjed. Nende süsteemide eeliste rakendamine sõltub meie võimest mudeleid nende võimekuse kasvades kooskõlastada ja kontrollida.
See vastutus hõlmab koolitamist, hindamist ja kasutuselevõttu. See eeldab tugevamaid tõendeid kooskõlalise käitumise kohta, võimekusega sammu pidavaid kaitsemeetmeid ja valmisolekut tempot aeglustada, kui kaitsemeetmed pole piisavad.
Jätkame nende süsteemide testimist, jagame õpitut ja räägime selgelt sellest, mis on veel ebaselge. Astrale järgnevad mudelid esitavad meile veel suuremaid nõudmisi. Võtame selle vastutuse täitmiseks vajaliku aja ja teeme ära vajaliku töö.
