Notiek ielāde…
Šodien mēs izlaižam GPT‑6 Astra — līdz šim jaudīgāko modeli, ko esam plaši ieviesuši. Astra ir mūsu pirmais modelis, kas saskaņā ar Sagatavotības satvaru sasniedzis kritisko kiberdrošības spēju līmeni.
Svarīgākais, kas jāzina par šīs versijas drošību:
- GPT‑6 Astra ir būtisks kiberspēju lēciens un sasniedz mūsu noteikto kritisko slieksni. Tas nozīmē, ka ar atbilstošiem rīkiem un piekļuvi GPT‑6 Astra var atrast iepriekš nezināmas drošības nepilnības un izstrādāt jaunus veidus, kā tās izmantot daudzās labi aizsargātās sistēmās, cilvēkam nevadot katru darbību. Tāpēc mēs ievērojami pastiprinājām aizsardzību pret modeļa veiktām kaitīgām kiberdarbībām neatkarīgi no tā, vai tās izraisa ļaunprātīga izmantošana vai nesaskaņotība. Veicām arī pasākumus, lai aizsargātu Astra un līdzīgu modeļu iekšējo izstrādi un ieviešanu, tostarp ieviesām stingrāku izolāciju, kontrolpunktu šifrēšanu, visu darbību secību visaptverošu pārraudzību, ietverot domu gaitu (CoT), kā arī prasību pirms iekšējas lietošanas izturēt saskaņotības novērtējumu.
- GPT‑6 Astra ir ievērojami noturīgāks par saviem priekštečiem. Izmantojot jaunus drošības apmācības paņēmienus noturības uzlabošanai, GPT‑6 Astra ir ievērojami noturīgāks pret ierobežojumu apiešanu nekā GPT‑5.6 Sol, arī garākās darbību secībās. To apliecina bezsaistes testi un mūsu stingrā iekšējā un ārējā ierobežojumu apiešanas testēšanas un novēršanas programma. Lietotājiem, kuri atzīmēti kā potenciāli augsta riska lietotāji, esam papildus apmācījuši modeli konservatīvāk pielāgot atteikuma robežu, aptverot plašāku divējāda lietojuma risku loku. Ar regresijas testiem pārbaudām Astra noturību pret iepriekšējos testēšanas posmos atklātajiem ierobežojumu apiešanas paņēmieniem, kā arī veicām jaunus automatizētu imitētu uzbrukumu posmus ar mūsu jaunākajiem iekšējiem uzbrukumu veicējiem, lai apstiprinātu uzlabojumus.
- GPT‑6 Astra ir labāk saskaņots nekā GPT‑5.6 Sol. Astra ir būtisks solis uz priekšu modeļu saskaņošanā, un tā uzlabojumi aptver visu procesu — no pirmsapmācības datu sastāva līdz vērtēšanai stimulētās mācīšanās laikā. Mēs publicējam jaunu saskaņotības novērtējumu kopumu(atveras jaunā logā) un secinām, ka GPT‑6 Astra labāk ievēro drošuma un drošības robežas un darbojas tam atļautajā tvērumā. Simulācijā, kurā izmantoti vairāk nekā 54 000 iekšēju Codex uzdevumu(atveras jaunā logā), Astra saņēma arī aptuveni uz pusi mazāk atzīmju par smagākām nesaskaņotas rīcības izpausmēm nekā Sol.
- Mēs plaši ieviešam nesaskaņotības pārraudzību. Modeļu saskaņošanu uzskatām par galveno līdzekli, ar ko novērst mūsu modeļu iespējamu nesaskaņotu rīcību. Tomēr pārraudzība sniedz plašu ieskatu robežšķirtnes modeļu darbībā un palīdz atklāt iespējas vēl vairāk uzlabot saskaņotību un drošību. Turklāt pārraudzība ir papildu aizsardzības līmenis pret konstatētu nesaskaņotu rīcību. Tāpēc esam ieviesuši nesaskaņotības pārraudzību arī visos Astra ārējās ieviešanas izsecināšanas procesos, kuros tiek izmantoti rīki, lai gan tas prasa ievērojamus skaitļošanas resursus. Šī sistēma līdzinās mūsu iekšējai sistēmai.
- GPT‑6 Astra pārraugāmība ir pasliktinājusies salīdzinājumā ar GPT‑5.6 Sol. Esam rūpīgi pētījuši GPT‑6 Astra pārraugāmību(atveras jaunā logā) un vadāmību(atveras jaunā logā). Konstatējām, ka GPT‑6 Astra spēj labāk kontrolēt savu domu gaitu nekā GPT‑5.6 Sol un retāk tajā iekļauj sevi atmaskojošu informāciju. Pretinieciskos apstākļos, kad mudinām modeli izvairīties no mūsu pārraudzības sistēmām, modelis spēj palikt nepamanīts, novērtējumos apzināti slēpjot savas spējas, un dažkārt var izvairīties no mūsu iekšējām pārraudzības sistēmām, ja tam lūdz veikt noteiktus sabotāžas uzdevumus(atveras jaunā logā). Neesam novērojuši steganogrāfisku spriestspēju domu gaitā, piemēram, slēptas spriešanas maskēšanu parastā un šķietami nesaistītā tekstā. Tas liecina, ka izvairīšanās risks lielākoties varētu aprobežoties ar uzdevumiem, kam vajadzīga mazāka spriestspēja.
- Šie konstatējumi liecina, ka Astra klases modeļi pretinieciskos apstākļos varētu izvairīties no mūsu domu gaitas pārraudzības sistēmām. Pašlaik šie konstatējumi galvenokārt balstās uz pretinieciskiem novērtējumiem, proti, gadījumiem, kad uzdodam modelim izvairīties no pārraudzības. Kopumā mūsu saskaņotības novērtējumi liecina, ka Astra retāk nekā GPT‑5.6 Sol pārkāpj drošuma un drošības ierobežojumus.
- Tomēr mēs šo tendenci uztveram nopietni un, mūsu modeļiem kļūstot jaudīgākiem, turpinām pētīt šos konstatējumus un to ietekmi uz pārraugāmību. OpenAI ir strādājis, lai saglabātu un izmantotu domu gaitas pārraudzību, un CoT pārraugāmības saglabāšana ir viens no pētniecības programmas pamatmērķiem. Tomēr šie rezultāti uzsver arī to, cik svarīgi ir izstrādāt saskaņotības auditēšanas paņēmienus, kas neaprobežojas ar modeļa domu gaitas pārbaudi.
- GPT‑6 Astra atbildīgāk darbojas tīmekļa pārlūkošanas un darba vidē: GPT‑6 Astra ir ievērojami noturīgāks pret uzvedņu injekcijām nekā GPT‑5.6 Sol. Esam papildus pārbaudījuši modeļa rīcību reālistiskās tīmekļa pārlūkošanas un profesionālās datorvidēs un konstatējuši, ka salīdzinājumā ar GPT‑5.6 Sol modelis ievērojami retāk veic nesaskaņotas un potenciāli postošas darbības, piemēram, neatļautus darījumus, datu dzēšanu, pārmērīgu piekļuvi vai kontroles mehānismu apiešanu. Tas arī rīkojas drošāk, apstrādājot kaitīgus pieprasījumus aģentiskā vidē, piemēram, lūgumus palīdzēt plānot vardarbīgu uzbrukumu vai veikt krāpšanu.
- GPT‑6 Astra ir ievērojami drošāks augstāka riska situācijās. GPT‑6 Astra uz sarežģītiem pieprasījumiem no reālās ekspluatācijas un cilvēku veiktiem pretinieciskiem imitētiem uzbrukumiem reaģē drošāk nekā GPT‑5.6 Sol. Astra panāk Pareto uzlabojumu, droši izpildot nedrošus pieprasījumus un izvairoties no nevajadzīgiem atteikumiem izpildīt nekaitīgus pieprasījumus. Šie uzlabojumi attiecas arī uz īpaši nopietnām situācijām, kurās kaitējuma risks izriet no plašāka konteksta, nevis no nepārprotama pieprasījuma. Astra arī konsekventāk piemēro vecumam atbilstošas drošības robežas lietotājiem, kas jaunāki par 18 gadiem.
Plašāku informāciju skatiet pilnajā sistēmas kartē(atveras jaunā logā).
Autors
OpenAI


