Pregled sigurnosti: GPT‑6 Astra
Učitavanje…
Danas objavljujemo GPT‑6 Astra, najsposobniji model koji smo dosad uveli u široku primjenu. Astra je naš prvi model koji je prema našem Okviru pripravnosti dosegnuo kritičnu razinu kibernetičkih sposobnosti.
Najvažnije informacije o sigurnosti ovog izdanja jesu:
- GPT‑6 Astra donosi znatan napredak u kibernetičkim sposobnostima i doseže naš kritični prag. To znači da GPT‑6 Astra, uz odgovarajuće alate i pristup, može pronaći dosad nepoznate sigurnosne propuste i osmisliti nove načine njihova iskorištavanja u brojnim dobro zaštićenim sustavima bez ljudskog usmjeravanja svakog koraka. Stoga smo znatno ojačali zaštitu od štetnih kibernetičkih radnji modela, bez obzira na to proizlaze li iz zloupotrebe ili neusklađenosti. Poduzeli smo i mjere za zaštitu internog razvoja i uvođenja Astre i sličnih modela, uključujući strožu izolaciju, šifriranje kontrolnih točaka, sveobuhvatno praćenje cijelih putanja, uključujući lance misli (CoT), te postupak evaluacije usklađenosti koji može blokirati internu upotrebu.
- GPT‑6 Astra znatno je robusnija od svojih prethodnika. Zahvaljujući novim tehnikama sigurnosnog treniranja za veću robusnost, GPT‑6 Astra znatno je otpornija na napade tipa jailbreak od modela GPT‑5.6 Sol, uključujući i duže putanje. To znamo na temelju izvanmrežnih testova te našeg programa strogog internog i vanjskog testiranja jailbreak napada i uklanjanja otkrivenih nedostataka. Za korisnike označene kao potencijalno visokorizične dodatno smo istrenirali mogućnost konzervativnijeg prilagođavanja granice odbijanja modela kako bi obuhvatila širi raspon rizika dvojne namjene. Regresijskim testiranjem provjeravamo otpornost Astre na jailbreak napade otkrivene u prethodnim razdobljima testiranja, a proveli smo i nove krugove automatiziranog red-team testiranja s najnovijim internim napadačkim modelima kako bismo potvrdili poboljšanja.
- GPT‑6 Astra bolje je usklađena od modela GPT‑5.6 Sol. Astra donosi znatan napredak u usklađenosti modela, s poboljšanjima koja obuhvaćaju sve od sastava podataka za predtreniranje do ocjenjivanja tijekom učenja s potkrepljivanjem. Predstavljamo novi skup evaluacija usklađenosti(otvara se u novom prozoru) i utvrđujemo da GPT‑6 Astra bolje poštuje sigurnosne granice te ostaje unutar svojeg ovlaštenog opsega. U simulaciji s više od 54.000 internih zadataka za Codex(otvara se u novom prozoru) Astra je dobila i približno upola manje upozorenja na ozbiljnije oblike neusklađenog ponašanja nego Sol.
- Široko uvodimo praćenje neusklađenosti. Usklađenost modela smatramo glavnim sredstvom za sprječavanje mogućeg neusklađenog ponašanja naših modela. Međutim, praćenje pruža širok uvid u ponašanje graničnih modela i otkriva mogućnosti za daljnje poboljšanje usklađenosti i sigurnosti. Osim toga, praćenje služi kao dodatni sloj zaštite od otkrivenog neusklađenog ponašanja. Zbog toga smo, uz znatan računalni trošak, praćenje neusklađenosti dodali svim postupcima izvođenja koji koriste alate u sklopu vanjskog uvođenja Astre. Taj je sustav sličan našem internom sustavu.
- Mogućnost praćenja modela GPT‑6 Astra smanjila se u odnosu na GPT‑5.6 Sol. Proveli smo opsežna istraživanja mogućnosti praćenja(otvara se u novom prozoru) i mogućnosti kontrole(otvara se u novom prozoru) modela GPT‑6 Astra. Utvrdili smo da GPT‑6 Astra može bolje kontrolirati vlastiti CoT od modela GPT‑5.6 Sol te da je manje vjerojatno da će u CoT-u navesti kompromitirajuće informacije. U suparničkim uvjetima, kada potičemo model da izbjegne naše sustave praćenja, utvrdili smo da može ostati neotkriven namjernim podbacivanjem na evaluacijama (strateško podbacivanje) te da ponekad može izbjeći naše interne sustave praćenja kada se od njega zatraži izvršavanje određenih zadataka sabotaže(otvara se u novom prozoru). Nismo pronašli dokaze steganografskog rasuđivanja u CoT-u, primjerice skrivanja rasuđivanja unutar običnog i naizgled nepovezanog teksta, što upućuje na to da bi rizik izbjegavanja mogao biti uglavnom ograničen na zadatke koji zahtijevaju manje rasuđivanja.
- Ti nalazi pokazuju da bi modeli iz klase Astra u suparničkim uvjetima mogli izbjeći naše sustave za praćenje CoT-a. Ti se nalazi zasad uglavnom temelje na suparničkim evaluacijama, odnosno situacijama u kojima modelu nalažemo da izbjegne praćenje, dok naše ukupne evaluacije usklađenosti pokazuju da je manja vjerojatnost da će Astra prekršiti sigurnosna ograničenja nego GPT‑5.6 Sol.
- Ipak, taj trend shvaćamo ozbiljno te nastavljamo istraživati ove nalaze i njihove posljedice za mogućnost praćenja kako naši modeli postaju sposobniji. OpenAI radi na očuvanju i primjeni praćenja lanca misli, a očuvanje mogućnosti praćenja CoT-a jedan je od glavnih ciljeva istraživačkog programa. Međutim, ti rezultati također naglašavaju važnost razvoja tehnika provjere usklađenosti koje nadilaze ispitivanje lanca misli modela.
- GPT‑6 Astra odgovornije se ponaša pri pregledavanju interneta i u poslovnim okruženjima: GPT‑6 Astra znatno je otpornija na injekcije upita od modela GPT‑5.6 Sol. Dodatno smo testirali ponašanje modela u realističnim okruženjima za pregledavanje interneta i profesionalni rad na računalu te utvrdili da je znatno manja vjerojatnost da će poduzeti neusklađene i potencijalno destruktivne radnje, kao što su neovlaštene transakcije, gubitak podataka, prekomjeran pristup ili zaobilaženje kontrola, nego GPT‑5.6 Sol. Sigurnije postupa i sa štetnim zahtjevima u agentskim okruženjima, primjerice zahtjevima za pomoć u planiranju nasilnog napada ili počinjenju prijevare.
- GPT‑6 Astra znatno je sigurnija u visokorizičnim scenarijima. GPT‑6 Astra sigurnije od modela GPT‑5.6 Sol odgovara na zahtjevne upite iz stvarne upotrebe i suparničkog ljudskog red-team testiranja. Astra ostvaruje Paretovo poboljšanje: sigurnije odgovara na nesigurne zahtjeve i izbjegava nepotrebno odbijanje bezopasnih zahtjeva. Ta poboljšanja obuhvaćaju i vrlo ozbiljne scenarije u kojima rizik od štete proizlazi iz šireg konteksta, a ne iz izričitog zahtjeva. Astra također dosljednije primjenjuje sigurnosne granice primjerene dobi za korisnike mlađe od 18 godina.
Više informacija potražite u cjelovitom dokumentu o sustavu(otvara se u novom prozoru).
Autor
OpenAI


