Preskočite na glavno vsebino
OpenAI

3. september 2026

Varnost

Pregled varnosti: GPT‑6 Astra

Nalaganje …

Danes izdajamo GPT‑6 Astra, najzmogljivejši model, kar smo jih doslej uvedli za široko uporabo. Astra je naš prvi model, ki je po Okviru pripravljenosti dosegel kritično raven zmogljivosti na področju kibernetske varnosti.

Najpomembnejše informacije o varnosti te izdaje so:

  1. GPT‑6 Astra predstavlja velik napredek na področju kibernetskih zmogljivosti in dosega naš kritični prag. To pomeni, da lahko GPT‑6 Astra z ustreznimi orodji in dostopom odkrije doslej neznane varnostne pomanjkljivosti ter razvije nove načine njihovega izkoriščanja v številnih dobro zaščitenih sistemih, ne da bi človek usmerjal vsak korak. Zato smo znatno okrepili zaščito pred škodljivimi kibernetskimi dejanji modela, ne glede na to, ali bi bila posledica zlorabe ali neusklajenosti. Sprejeli smo tudi ukrepe za varno interno razvijanje in uvajanje Astre ter podobnih modelov, med drugim strožjo izolacijo, šifriranje kontrolnih točk, splošno spremljanje celotnih potekov, vključno z verigami sklepanja (CoT), ter postopek ocenjevanja usklajenosti, ki lahko pred interno uporabo prepreči dostop.
  2. GPT‑6 Astra je bistveno odpornejši od svojih predhodnikov. Z novimi tehnikami varnostnega usposabljanja za večjo odpornost je GPT‑6 Astra bistveno odpornejši proti prebijanju varnostnih mehanizmov kot GPT‑5.6 Sol, tudi pri daljših potekih. To vemo na podlagi preizkusov brez povezave ter programa strogega notranjega in zunanjega preizkušanja prebijanja varnostnih mehanizmov in odpravljanja odkritih pomanjkljivosti. Za uporabnike, označene kot potencialno zelo tvegane, smo model dodatno usposobili, da lahko svojo mejo zavračanja prilagodi bolj konservativno in zajame širši nabor tveganj dvojne rabe. Z regresijskim preizkušanjem zagotavljamo, da je Astra odporna proti prebijanju varnostnih mehanizmov, odkritemu v prejšnjih obdobjih preizkušanja. Izvedli smo tudi nove kroge avtomatiziranega simuliranega iskanja šibkih točk v nadzorovanem okolju z najnovejšimi internimi napadalnimi sistemi, da bi potrdili izboljšave.
  3. Model GPT‑6 Astra je bolje usklajen kot GPT‑5.6 Sol. Astra pomeni velik napredek pri usklajenosti modelov in vključuje izboljšave – vse od sestave podatkov za začetno usposabljanje do ocenjevanja med okrepljenim učenjem. Predstavljamo nov sklop ocenjevanj usklajenosti(odpre se v novem oknu), ki kaže, da GPT‑6 Astra bolje spoštuje varnostne meje in ostaja znotraj pooblaščenega področja delovanja. V simulaciji z več kot 54.000 internimi nalogami v Codexu(odpre se v novem oknu) je Astra prejela tudi približno polovico manj opozoril zaradi hujšega neusklajenega vedenja kot Sol.
  4. Spremljanje neusklajenosti uvajamo v širokem obsegu. Usklajenost modelov obravnavamo kot glavni vzvod za preprečevanje morebitnega neusklajenega vedenja naših modelov. Spremljanje pa omogoča širok vpogled v vedenje prelomnih modelov ter razkriva priložnosti za nadaljnje izboljšanje usklajenosti in varnosti. Poleg tega je spremljanje dodatna raven zaščite pred zaznanim neusklajenim vedenjem. Zato smo kljub precejšnjim računskim stroškom spremljanje neusklajenosti dodali tudi vsem postopkom sklepanja z uporabo orodij, ki so del zunanje uvedbe Astre. Ta sistem deluje vzporedno z našo interno ureditvijo.
  5. Možnost spremljanja GPT‑6 Astra se je v primerjavi z GPT‑5.6 Sol zmanjšala. Temeljito smo raziskali možnost spremljanja(odpre se v novem oknu) in obvladljivost(odpre se v novem oknu) modela GPT‑6 Astra. Ugotovili smo, da lahko model GPT‑6 Astra bolje nadzoruje lastno verigo sklepanja kot GPT‑5.6 Sol in je manj verjetno, da bo vanjo vključil obremenilne informacije. V kontradiktornih razmerah, ko model spodbujamo k izogibanju našim nadzornim sistemom, lahko ta ostane neodkrit, kadar pri ocenjevanjih namerno prikriva sposobnosti, včasih pa se lahko izogne našim internim nadzornim sistemom tudi, ko mu naročimo izvedbo določenih sabotažnih nalog(odpre se v novem oknu). Nismo odkrili dokazov o steganografskem sklepanju v verigi sklepanja, na primer skrivanju sklepanja v običajnem in navidez nepovezanem besedilu, kar kaže, da je tveganje izogibanja morda večinoma omejeno na manj zahtevne naloge sklepanja.
    • Te ugotovitve kažejo, da bi se lahko modeli razreda Astra v kontradiktornih razmerah izognili našim sistemom za spremljanje verige sklepanja. Za zdaj te ugotovitve večinoma temeljijo na kontradiktornih ocenjevanjih, pri katerih modelu naročimo, naj se izogne spremljanju. Naša ocenjevanja usklajenosti pa na splošno kažejo, da Astra redkeje krši varnostne in zaščitne omejitve kot GPT‑5.6 Sol.
    • Kljub temu ta trend jemljemo resno in še naprej raziskujemo ugotovitve ter njihove posledice za možnost spremljanja, saj naši modeli postajajo zmogljivejši. OpenAI si prizadeva ohranjati in uporabljati spremljanje verige sklepanja, ohranitev možnosti spremljanja verige sklepanja pa je eden glavnih ciljev raziskovalnega programa. Ti rezultati obenem poudarjajo pomen razvoja tehnik za preverjanje usklajenosti, ki presegajo pregledovanje verige sklepanja modela.
  6. GPT‑6 Astra odgovorneje deluje pri brskanju in v delovnih okoljih: GPT‑6 Astra je bistveno odpornejši proti vbrizgavanju pozivov kot GPT‑5.6 Sol. Vedenje modela smo dodatno preizkusili v realističnih okoljih za brskanje in delo z računalnikom. Ugotovili smo, da je v primerjavi z GPT‑5.6 Sol bistveno manj verjetno, da bo izvedel neusklajena in potencialno uničujoča dejanja, kot so nepooblaščene transakcije, izguba podatkov, čezmeren dostop ali zaobidenje nadzornih mehanizmov. Varneje ravna tudi pri škodljivih zahtevah v agentskih okoljih, na primer pri prošnjah za pomoč pri načrtovanju nasilnega napada ali izvedbi goljufije.
  7. GPT‑6 Astra je bistveno varnejši v bolj tveganih okoliščinah. GPT‑6 Astra se na kompleksne zahteve iz produkcijskih okolij in kontradiktornega človeškega simuliranega iskanja šibkih točk v nadzorovanem okolju odziva varneje kot GPT‑5.6 Sol. Astra dosega Paretovo izboljšanje pri varnem odzivanju na nevarne zahteve in preprečevanju nepotrebnega zavračanja neškodljivih zahtev. Te izboljšave veljajo tudi za zelo resne okoliščine, v katerih nevarnost škode izhaja iz širšega konteksta in ne iz izrecne zahteve. Astra tudi dosledneje uporablja starosti primerne varnostne meje za uporabnike, mlajše od 18 let.