Įkeliama...
Šiandien pristatome GPT‑6 Astra – pajėgiausią mūsų iki šiol plačiai diegiamą modelį. Astra yra pirmasis mūsų modelis, pagal Pasirengimo sistemą pasiekęs kritinį kibernetinio saugumo pajėgumų lygį.
Svarbiausi dalykai, kuriuos reikia žinoti apie šio leidimo saugą:
- GPT‑6 Astra kibernetiniai pajėgumai gerokai išaugo ir pasiekė mūsų nustatytą kritinę ribą. Tai reiškia, kad turėdamas tinkamus įrankius ir prieigą GPT‑6 Astra gali aptikti anksčiau nežinomų saugumo spragų ir sukurti naujų būdų joms išnaudoti daugelyje gerai apsaugotų sistemų, žmogui nevadovaujant kiekvienam žingsniui. Todėl gerokai sustiprinome apsaugą nuo žalingų modelio veiksmų kibernetinėje erdvėje, nesvarbu, ar juos lemtų piktnaudžiavimas, ar nesuderinamumas. Taip pat ėmėmės priemonių, kad apsaugotume vidinį Astra ir panašių modelių kūrimą bei diegimą: taikome griežtesnį izoliavimą, kontrolinių taškų šifravimą, visuotinę visų veiksmų sekų, įskaitant minčių grandines (CoT), stebėseną ir prieš vidinį naudojimą atliekamą privalomą suderinimo vertinimą.
- GPT‑6 Astra yra gerokai atsparesnis už savo pirmtakus. Pritaikius naujus atsparumą didinančius saugos mokymo metodus, GPT‑6 Astra yra gerokai atsparesnis apribojimų apėjimui nei GPT‑5.6 Sol, taip pat ir ilgesnėse veiksmų sekose. Tai žinome iš neprisijungus atliekamų bandymų ir mūsų griežtos vidinės bei išorinės apribojimų apėjimo bandymų ir trūkumų šalinimo programos. Galimai didelės rizikos naudotojams modelį papildomai išmokėme konservatyviau nustatyti atsisakymo ribą ir apimti daugiau dvejopo naudojimo rizikų. Regresiniais bandymais tikriname, ar Astra yra atsparus ankstesniais bandymų etapais aptiktiems apribojimų apėjimo būdams, o patobulinimams patvirtinti surengėme naujus automatizuoto testavimo spragoms nustatyti etapus, pasitelkdami naujausius savo vidinius atakų modelius.
- GPT‑6 Astra yra geriau suderintas nei GPT‑5.6 Sol. Astra – reikšmingas žingsnis pirmyn modelių suderinimo srityje. Patobulinimai apima viską nuo mūsų išankstinio mokymo duomenų sudėties iki vertinimo per skatinamąjį mokymąsi. Pristatome naują suderinimo vertinimų rinkinį(atsidaro naujame lange). Jis rodo, kad GPT‑6 Astra geriau laikosi saugos ir saugumo ribų bei neperžengia suteiktų įgaliojimų. Modeliuojant daugiau kaip 54 000 vidinių Codex užduočių(atsidaro naujame lange), Astra taip pat gavo maždaug perpus mažiau žymų dėl sunkesnio nesuderinto elgesio nei Sol.
- Plačiai diegiame nesuderinamumo stebėseną. Modelių suderinimą laikome pagrindine priemone, padedančia užkirsti kelią galimam nesuderintam mūsų modelių elgesiui. Tačiau stebėsena suteikia išsamų vaizdą, kaip elgiasi priešakiniai modeliai, ir padeda nustatyti, kur dar galima gerinti suderinimą bei saugą. Be to, stebėsena yra papildomas apsaugos nuo aptikto nesuderinto elgesio sluoksnis. Dėl šių priežasčių nesuderinamumo stebėseną papildomai įdiegėme visiems išorėje diegiamo Astra išvadų generavimo procesams, kuriuose naudojami įrankiai, nors tai reikalauja daug skaičiavimo išteklių. Ši sistema atitinka mūsų vidinę sąranką.
- GPT‑6 Astra stebimumas, palyginti su GPT‑5.6 Sol, sumažėjo. Nuodugniai tyrėme GPT‑6 Astra stebimumą(atsidaro naujame lange) ir valdomumą(atsidaro naujame lange). Nustatėme, kad GPT‑6 Astra geriau nei GPT‑5.6 Sol geba valdyti savo minčių grandinę ir rečiau joje pateikia jį kompromituojančios informacijos. Priešiškomis sąlygomis, kai skatiname modelį išvengti mūsų stebėsenos sistemų, jis gali likti neaptiktas vertinimuose sąmoningai slėpdamas gebėjimus, o paprašytas atlikti tam tikras sabotažo užduotis(atsidaro naujame lange) kartais gali išvengti mūsų vidinių stebėsenos sistemų. Neradome steganografinio protavimo minčių grandinėje įrodymų, pavyzdžiui, kai paslėptas protavimas užmaskuojamas įprastu ir iš pažiūros nesusijusiu tekstu. Tai rodo, kad stebėsenos išvengimo rizika daugiausia gali apsiriboti paprastesnėmis protavimo užduotimis.
- Šios išvados rodo, kad priešiškomis sąlygomis Astra klasės modeliai galėtų išvengti mūsų minčių grandinės stebėsenos sistemų. Kol kas šios išvados daugiausia pagrįstos priešiškais vertinimais, kai nurodome modeliui išvengti stebėsenos. Vis dėlto bendri suderinimo vertinimai rodo, kad Astra rečiau nei GPT‑5.6 Sol pažeidžia saugumo ir saugos apribojimus.
- Tačiau šią tendenciją vertiname rimtai ir toliau tiriame šias išvadas bei jų reikšmę stebimumui, mūsų modeliams tampant vis pajėgesniems. OpenAI siekia išsaugoti ir naudoti minčių grandinės stebėseną, o CoT stebimumo išsaugojimas yra vienas pagrindinių šios tyrimų programos tikslų. Tačiau šie rezultatai taip pat pabrėžia, kaip svarbu kurti suderinimo audito metodus, neapsiribojančius modelio minčių grandinės nagrinėjimu.
- GPT‑6 Astra atsakingiau veikia naršymo ir darbo aplinkose. GPT‑6 Astra yra gerokai atsparesnis užklausų įterpimo atakoms nei GPT‑5.6 Sol. Taip pat išbandėme modelio elgesį tikroviškose naršymo ir profesinėse kompiuterinėse aplinkose. Nustatėme, kad, palyginti su GPT‑5.6 Sol, modelis gerokai rečiau atlieka nesuderintus ir potencialiai žalingus veiksmus, pavyzdžiui, neleistinas operacijas, lemiančias duomenų praradimą ar perteklinę prieigą, arba apeina kontrolės priemones. Jis taip pat saugiau tvarko žalingus prašymus agentinėse aplinkose, pavyzdžiui, prašymus padėti planuoti smurtinį išpuolį ar sukčiauti.
- Didesnės rizikos scenarijuose GPT‑6 Astra yra gerokai saugesnis. GPT‑6 Astra saugiau nei GPT‑5.6 Sol reaguoja į sudėtingus prašymus, surinktus realioje aplinkoje ir žmonėms atliekant priešišką testavimą spragoms nustatyti. Astra pasiekia Pareto pagerėjimą: saugiai įvykdo nesaugius prašymus ir be reikalo neatsisako vykdyti nepavojingų prašymų. Šie patobulinimai apima ir itin pavojingus scenarijus, kai žalos riziką lemia platesnis kontekstas, o ne aiškiai išreikštas prašymas. Astra taip pat nuosekliau taiko pagal amžių tinkamas saugos ribas jaunesniems nei 18 metų naudotojams.
Daugiau informacijos rasite išsamioje sistemos kortelėje(atsidaro naujame lange).
Autorius
OpenAI


