Pāriet uz galveno saturu
OpenAI

2026. gada 1. septembris

DrošībaAizsardzība

Ceļš uz Astra: kritiskās spējas un robežšķirtnes aizsardzība

Notiek ielāde…

Kopš mūsu iepriekšējā novērtējuma, ka Astra varētu sasniegt kritisku kiberdrošības spēju līmeni, esam ieguvuši vairāk pierādījumu un veikuši papildu novērtējumus, lai izvērtētu modeļa spējas. Tagad uzskatām, ka Astra atbilst mūsu Sagatavotības satvarā noteiktajam kritisko kiberdrošības spēju slieksnim. Tas nozīmē, ka ar atbilstošiem rīkiem un piekļuvi modelis daudzās labi aizsargātās sistēmās var atrast iepriekš nezināmus drošības trūkumus un izstrādāt to izmantošanas paņēmienus, cilvēkam nevadot katru darbību. Tas ir pirmais modelis, kam piešķiram šādu līmeni, tādēļ izstrādes laikā un pirms izlaišanas tam nepieciešami stingrāki aizsardzības pasākumi.

Pēdējās nedēļās esam aizkavējuši daļu Astra izstrādes un izlaišanas darbu, kamēr stiprinājām un pārbaudījām aizsardzību pret ļaunprātīgu izmantošanu kibertelpā un neatļautām modeļa darbībām. Pamatojoties uz šo darbu, uzskatām, ka Astra aizsardzības pasākumi pietiekami mazina smaga kaitējuma risku, lai modeli varētu izlaist atbilstoši mūsu Sagatavotības satvaram.

Lai gan Astra nebija iesaistīta Hugging Face incidentā, savā drošuma pieejā esam iekļāvuši šajā incidentā gūtās atziņas(atveras jaunā logā). Pamatojoties uz retrospektīvām pārbaudēm, uzskatām, ka tolaik izmantotie ražošanas vides aizsardzības pasākumi būtu novērsuši Hugging Face incidentu. Kopš tā laika esam ieviesuši vēl stingrākus Astra aizsardzības pasākumus: apmācījuši modeli uzticamāk atteikt kaitīgus kiberdrošības pieprasījumus un ievērot drošuma ierobežojumus, ieviesuši papildu aizsardzību pret ļaunprātīgu izmantošanu un uzraudzību, kas var apturēt potenciāli neatļautas darbības.

Plānojam drīzumā padarīt Astra pieejamu, taču piekļuve tā progresīvākajām kiberdrošības spējām būs ierobežotāka. Progresīvi kiberdrošības darbi sākotnēji būs pieejami testētāju grupai; pēc tam piekļuve ar Daybreak Blue paplašinās izmantošanu aizsardzībai.

Izlaišanas brīdī modeļa sistēmas kartē sniegsim plašāku informāciju par drošuma, drošības un saskaņotības pārbaudēm un novērtējumiem. Pirms izlaišanas vēlamies informēt par daļu darba, ko veicam, lai droši izlaistu modeli ar šāda līmeņa kiberdrošības spējām, un atklāti norādīt atlikušos riskus.

Astra kiberdrošības spēju novērtēšana

Saskaņā ar mūsu Sagatavotības satvaru modelis sasniedz kritisko slieksni, ja ir izpildīts kāds no šiem nosacījumiem:

  • Modelis bez cilvēka iesaistes spēj daudzās pastiprināti aizsargātās reālās kritiskās sistēmās identificēt un izstrādāt funkcionālus visu smaguma līmeņu nulles dienas ievainojamību izmantošanas paņēmienus.
  • Saņemot tikai vispārīgu vēlamo mērķi, modelis spēj izstrādāt un pilnībā īstenot jaunas kiberuzbrukumu stratēģijas pret pastiprināti aizsargātiem mērķiem.

Mūsu Astra sagatavotības novērtējumā tika apvienoti automatizēti publiskie un privātie etalontesti un ekspertu vadīti novērtējumi. Salīdzinājumā ar GPT‑5.6 Sol Astra kiberdrošības spējas ir būtiski pieaugušas: tas daudz efektīvāk izmanto tekstvienības un labāk identificē ievainojamības un izstrādā to izmantošanas paņēmienus.

Piemēram, pārbaudījām Astra ar ExploitBench, kur modelis etalontestā sasniedza nevainojamu 100% rezultātu, novērtējot tā spēju izstrādāt zināmu ievainojamību izmantošanas paņēmienus.

Bažās par datu piesārņojumu pēc tam izveidojām iekšēju etalontestu „ExploitBench — iekšējā versija (2026. gada jūnijs–augusts)”, kurā iekļautas 20 nesenāk atklātas augstas bīstamības V8 ievainojamības. Šajā datu kopā Astra ar daudz mazāku izvades tekstvienību skaitu sasniedz ievērojami augstāku patvaļīga koda izpildes īpatsvaru nekā GPT‑5.6 Sol. Novērtējuma laikā modelis ievainojamību izmantošanas ķēdē pat atklāja un izmantoja divas nulles dienas ievainojamības. Pašlaik informējam uzturētājus par šīm abām ievainojamībām.

Parādītie Astra rezultāti atspoguļo spējas ar Daybreak Blue piekļuvi, nevis ražošanas vides noklusējuma konfigurāciju.

Ekspertu vadītos novērtējumos ar pastiprināti aizsargātu pārlūku un operētājsistēmu Astra atklāja iepriekš nezināmas ievainojamības un pārvērta tās funkcionālās ievainojamību izmantošanas ķēdēs. Tas izveidoja pilnu pārlūka pārņemšanas ķēdi, kas pēc HTML faila atvēršanas pārlūkā izkļuva no smilškastes un izpildīja komandas resursdatorā. Modelis arī atrada vairākas ievainojamības pastiprināti aizsargātā operētājsistēmā un apvienoja tās lokālā privilēģiju paaugstināšanas ķēdē no lietotāja bez privilēģijām līdz root piekļuvei. Kopumā izmeklēšanā secinājām, ka Astra sasniedz kritisko slieksni.

Kritiskām spējām nepieciešamie aizsardzības pasākumi

Lai mazinātu smaga kiberkaitējuma risku modeļiem ar Astra līmeņa kiberdrošības spējām, gan izstrādes laikā, gan pirms ieviešanas mums jāaptver divi iespējamie riska ceļi:

  • Ļaunprātīgas personas izmanto modeli. Mūsu aizsardzības pasākumiem ir droši jānovērš iespēja ļaunprātīgām personām izmantot Astra, lai izstrādātu ievainojamību izmantošanas paņēmienus iepriekš nezināmiem trūkumiem pastiprināti aizsargātās kritiskās sistēmās vai pilnībā īstenotu uzbrukumus pastiprināti aizsargātiem mērķiem.
  • Modelis veic neatļautas, neatbilstīgas darbības. Pat bez ļaunprātīga lietotāja modelis ar progresīvām kiberdrošības spējām neatbilstības gadījumā pats varētu radīt kiberkaitējumu. Papildus ļoti augstām prasībām attiecībā uz šādu modeļu saskaņotību mūsu aizsardzības pasākumiem kā otram aizsardzības slānim jāspēj ātri konstatēt un ierobežot neatbilstīgas darbības, kas varētu radīt būtisku kaitējumu reālajā pasaulē.

Jāuzsver, ka otrais riska ceļš attiecas gan uz iekšējo izstrādi, gan ārējo ieviešanu. Kā jau iepriekš aprakstījām, pēc OpenAI un Hugging Face incidenta mēs uz divām nedēļām apturējām noteiktu robežšķirtnes modeļu apmācību (tostarp daļu Astra apmācības), lai nostiprinātu apmācības infrastruktūru. Tas ietvēra izolāciju un tīkla kontroles pasākumus, plašāku uzraudzību, kā arī stingrāku saskaņotības apmācību un sliekšņus. Pēc tam atsākām mazāka mēroga darbus ar stingrākiem kontroles pasākumiem.

Atsevišķus apjomīgākus stimulētās mācīšanās (RL) ciklus turpmākām Astra versijām aizturējām ilgāk, kamēr noteicām augstākas prasības to apmācības vides drošumam un drošībai. 28. augustā pēc jauno drošuma un drošības prasību ieviešanas atsākām iepriekš apturēto apjomīgo robežšķirtnes RL ciklu. Dažus mazākus eksperimentālās apmācības ciklus joprojām uz laiku atliekam.

Lai sagatavotu Astra izlaišanai, bija jāievieš arī stingrāka aizsardzība pret ļaunprātīgu izmantošanu kibertelpā un neatļautām darbībām. Tālāk aprakstām šos aizsardzības pasākumus un to pārbaudes.

Noturība pret ļaunprātīgu izmantošanu kibertelpā

Kopš februārī ieviesām pirmo modeli, kura kiberdrošības spējas novērtējām kā Augstas, ar katru nākamo laidienu esam stiprinājuši kiberdrošības aizsardzības pasākumus. Mūsu vispārējā drošuma pieeja apvieno pēcapmācības modeļa atteikumus, sistēmas līmeņa drošuma klasifikatorus, kā arī bezsaistes noteikšanu un apdraudējumu novēršanu.

Modelim GPT‑5.6(atveras jaunā logā) mēs būtiski uzlabojām sistēmas līmeņa risinājumu kopuma noturību, tostarp pievienojot aktivizācijas klasifikatorus ļaunprātīgas izmantošanas kibertelpā noteikšanai un uzlabojot aizsardzību pret universāliem ierobežojumu apiešanas paņēmieniem, kas atklāti intensīvos automatizētos imitētos uzbrukumos. Turpinot šos uzlabojumus, Astra vajadzībām esam vēl vairāk ieguldījuši aizsardzības risinājumu kopuma modeļa slānī un uzlabojuši aizsardzības pasākumu spēju ņemt vērā vairāku sarunu kontekstu.

  • Pateicoties jaunām modeļa noturības apmācības metodēm, Astra drošāk atsaka neatļautas kiberdrošības palīdzības pieprasījumus. Mūsu kiberdrošības ierobežojumu apiešanas novērtējumu kopā Astra atsaka 91,5% pieprasījumu (GPT‑5.6 Sol — 59%).
  • Kontiem, kas novērtēti kā riskantāki, piemērojam konservatīvāku modeļa uzvedības robežu, lai atteiktu plašāku potenciāli riskantas kiberdrošības palīdzības pieprasījumu klāstu. Augsta riska lietotājiem esam paplašinājuši kontekstu, ko aptver mūsu uzraudzības sistēmas, lai tās spētu atklāt šādu ļaunprātīgu izmantošanu kibertelpā.

Esam turpinājuši arī stingru pārbaužu, iekšējo un ārējo imitēto uzbrukumu un trūkumu novēršanas programmu. Papildus regresijas pārbaudēm, ar kurām pārliecināmies, ka aizsardzība joprojām aptver visus iepriekšējās pārbaudēs atklātos ierobežojumu apiešanas paņēmienus, veicam jaunu imitētu uzbrukumu kārtu ar jaunākajiem iekšējiem imitēto uzbrukumu veicējiem. Sadarbojamies ar nozares partneriem, lai definētu vienotu ierobežojumu apiešanas vērtēšanas sistēmu, un izmantosim diennakts ātrās reaģēšanas programmu, lai izmeklētu un novērstu jaunus atklājumus. Plašāku informāciju par Astra kiberdrošības aizsardzības pasākumu pārbaudēm sniegsim sistēmas kartē.

Palīdzība aizstāvjiem atrast un novērst ievainojamības joprojām ir mūsu drošuma pieejas pamatelements. Lai aizsargātu pret iespējamu ļaunprātīgu izmantošanu, paredzam, ka izlaišanas brīdī Astra aizsardzības pasākumi radīs vairāk šķēršļu, nekā iecerēts ilgtermiņā. Sākotnēji piekļuve Astra progresīvām kiberdrošības darbplūsmām būs pieejama nelielai alfa testētāju grupai; vēlāk piekļuve ar Daybreak Blue tiks paplašināta, lai atbalstītu izmantošanu aizsardzībai.

Saskaņotība un uzraudzība

Esam pievienojuši arī papildu daudzslāņu aizsardzību, lai neļautu modelim veikt potenciāli neatbilstīgas darbības:

  • Modeļa saskaņotība: mūsu novērtējumos Astra daudz biežāk nekā GPT‑5.6 Sol ievēroja skaidri noteiktos drošuma un drošības ierobežojumus un nepārsniedza atļautās darbības robežas, tādēļ tas ir mūsu līdz šim vislabāk saskaņotais modelis. Īpašu uzmanību pievērsām tam, vai modelis ievēro drošības un drošuma ierobežojumus un nepārsniedz atļautās darbības robežas.
  • Uzraudzība un kontrole: līdzīgi mūsu iekšējām procedūrām Astra ieviešam ar papildu domu ķēdes uzraudzību, lai ātri konstatētu un ierobežotu potenciāli neatbilstīgas darbības.

Astra ir būtisks sasniegums modeļu saskaņotībā un vairāku ilgstošu saskaņotības darba virzienu kulminācija — no iejaukšanās pirmsapmācībā līdz rūpīgākai un konsekventākai vērtēšanai stimulētās mācīšanās laikā. Pārbaudēs konstatējām, ka Astra salīdzinājumā ar GPT 5.6 Sol konsekventāk ievēro skaidri noteiktus drošuma ierobežojumus un brīdinājumus, piemēram, automātisko pārbaudi.

Izstrādājām arī Hugging Face incidentā gūtajās atziņās balstītu pārbaudi, kurā aģenti, kas veica kiberdrošības novērtējumu ExploitGym, pārņēma trešās personas sistēmas. Izmantojām šā novērtējuma grūtākos uzdevumus, lai ar „māņmērķiem” pārbaudītu, vai modelis mēģinās pārņemt apkārtējo drošības infrastruktūru, nevis risināt tam uzticēto uzdevumu. Bez ražošanas vides aizsardzības pasākumiem GPT‑5.6 Sol mēģināja piekļūt šiem mērķiem 56% pārbaužu, kas simulēja etalontesta vidi, kurā modelim bija uzdots izstrādāt ievainojamību izmantošanas paņēmienus. Astra šajās pārbaudēs neveica nevienu šādu mēģinājumu. Šie rādītāji raksturo uzvedību pārbaudes apstākļos bez kiberdrošības aizsardzības pasākumiem, nevis parasto lietojumu ražošanas vidē.

Pa kreisi: šajā jaunajā novērtējumā vērojam, kā modeļi reaģē uz automātiskās pārbaudes noraidījumu. Katrs uzdevums notiek intelektuālā darba vidē, un izpilde sākas uzreiz pēc automātiskās pārbaudes atteikuma. Pēc tam modelis var rīkoties vairākos veidos: beigt izpildi, mēģināt atrast drošāku alternatīvu, atkārtot līdzīgu komandu vai izmantot nepilnīgu konfigurāciju(atveras jaunā logā), lai pilnībā apietu automātisko pārbaudi. Jebkurš mēģinājums izmantot pēdējās divas iespējas šajā novērtējumā būtu uzskatāms par neveiksmi. Astra nekad nemēģināja apiet automātisko pārbaudi.

Pa labi: šajā novērtējumā pārbaudām modeļa tieksmi krāpties (izmantojot „māņmērķus”), kad tas saskaras ar visgrūtākajiem vai neizpildāmiem ExploitGym novērtējuma uzdevumiem. Novērtējums notika simulētā vidē, aizsardzības pasākumiem darbojoties tikai novērošanas režīmā, lai izvērtētu modeļa uzvedību. GPT‑5.6 Sol šajos scenārijos uzrādīja lielāku krāpšanās iespējamību, savukārt Astra nemēģināja izmantot šos īsceļus un tomēr spēja leģitīmi atrisināt dažus uzdevumus.

Modeļu saskaņotības apmācība ir viens drošuma slānis. Plašāku informāciju par saskaņotības pārbaudēm un rezultātiem sniegsim Astra sistēmas kartē.

Astra klases modeļiem ražošanas vidē ieviešam arī neatbilstības uzraudzību, lai konstatētu un ātri ierobežotu potenciālu neatbilstību. Šie aizsardzības pasākumi līdzinās mūsu iekšējās ieviešanas uzraudzībai un ietver klasifikatoru sistēmu, kas pārbauda modeļa spriestspēju un darbības, lai konstatētu neatļautu rīcību un automātiski apturētu potenciāli neatļautas darbības. Spējām pieaugot, šie aizsardzības pasākumi nevar aizstāt labu modeļu saskaņotību. Mūsu mērķis ir panākt, lai turpmākie modeļi būtu tik labi saskaņoti, ka šie pasākumi nekad netiktu aktivizēti.

Ko tas nozīmēs lietotājiem

OpenAI ir apņēmies nodrošināt, lai mākslīgā intelekta sniegtās priekšrocības būtu plaši pieejamas. Ņemot vērā Astra kiberdrošības spēju būtisko pieaugumu, īpaši rūpējamies, lai šī ieviešana būtu droša. Papildu drošuma pārbaudes reizēm var palēnināt, pauzēt vai apturēt leģitīmu darbu, tostarp kiberdrošības aizsardzības pasākumus.

Sistēma reizēm var kļūdaini atzīmēt leģitīmu darbību kā iespējamu ļaunprātīgu izmantošanu kibertelpā vai neatļautu rīcību, tādēļ tā var netīši tikt palēnināta, pauzēta vai apturēta. Tas var skart arī darbu, kas šķietami nav tieši saistīts ar kiberdrošību, vai uzdevumus, kuros aģents darbojas ilgstoši.

Ja neatbilstības uzraudzības sistēma pauzē uzdevumu, ChatGPT vai Codex lietotājiem pirms turpināšanas var tikt lūgts pārskatīt darbību. Izmantojot citas saskarnes, piemēram, API, uzdevums tiks apturēts. Plānojam turpināt šo aizsardzības pasākumu pielāgošanu, lai mazinātu nevajadzīgus pārtraukumus un ar tādām programmām kā Daybreak paplašinātu piekļuvi robežšķirtnes spējām.

Raugoties nākotnē

Mēs ieejam mākslīgā intelekta attīstības posmā, kurā modeļi var uzņemties arvien nozīmīgāku darbu, bet saskaņotības un kontroles kļūmēm var būt nopietnākas sekas. Šo sistēmu priekšrocību īstenošana būs atkarīga no mūsu spējas saskaņot un kontrolēt modeļus, pieaugot to spējām.

Šī atbildība aptver apmācību, novērtēšanu un ieviešanu. Tam nepieciešami pārliecinošāki pierādījumi par saskaņotu uzvedību, spējām atbilstoši aizsardzības pasākumi un gatavība palēnināt darbu, ja aizsardzība nav pietiekama.

Turpināsim pārbaudīt šīs sistēmas, dalīties gūtajās atziņās un skaidri norādīt, par ko joprojām nav pārliecības. Modeļi, kas sekos Astra, no mums prasīs vairāk. Mēs veltīsim nepieciešamo laiku un darbu, lai šo atbildību uzņemtos.