Pāriet uz galveno saturu
OpenAI

2026. gada 28. septembris

Drošība

Ceļā uz drošības pamatojumiem robežšķirtnes MI apmācībā

Notiek ielāde…

Uzskatām, ka sākas jauns laikmets, kurā pirms jebkura robežšķirtnes stimulētās mācīšanās apmācības cikla turpināšanas būtu jāpieprasa strukturēta drošības dokumentācija. Ideālā gadījumā šādai dokumentācijai būtu jāsasniedz „drošības pamatojumu” līmenis — tie ir visaptveroši, strukturēti, pierādījumos balstīti argumenti par risku, kurus izmanto citās nozarēs, kur drošībai ir izšķiroša nozīme. Drošības pamatojumus uzskatām par ilgtermiņa mērķi, uz kuru tiecamies. Vienlaikus atzīstam, ka tos MI modeļiem izstrādāt tikpat stingri kā aviācijā vai kodolenerģētikā ir sarežģīti, jo katrā jaunā MI spēju līmenī rodas jauna sarežģītība. Mēs strādājam pie ietvara, kas sistematizētu šo praksi.

Tālāk sniegtas sākotnējās vadlīnijas, kurām, mūsuprāt, būtu jābūt daļai no šādiem drošības pamatojumiem robežšķirtnes MI apmācībā. Šī paraugprakse atspoguļo mūsu līdzšinējās atziņas, un paredzam, ka tā attīstīsies, mums turpinot pilnveidot iekšējos procesus pārdomātai izstrādei. Publicējam to jau tagad, lai atklāti parādītu savu pašreizējo pieeju un aicinātu kopienu sniegt atsauksmes. Ņemiet vērā, ka šis dokuments ir veltīts robežšķirtnes stimulētās mācīšanās apmācībai; ieviešanai iekšējā un ārējā lietošanā ir jāizvērtē daudz plašāks saskaņotības īpašību kopums.

1. Tehniskie aizsardzības pasākumi

Drošības pamatojumiem būtu jāaptver trīs tehnoloģiskās sistēmas aspekti: apmācība saskaņotības nodrošināšanai, izolēšana un uzraudzība. Šie aizsardzības pasākumi palīdz nodrošināt, ka modelis nemēģina rīkoties nesaskaņoti un ka pat šāda mēģinājuma gadījumā tam būtu grūti izkļūt no izolētās vides, bet uzraudzība to atklātu, pirms rastos kaitējums.

  • Modeļa saskaņotība: pirmajam aizsardzības pasākumam būtu jābūt modeļu apmācībai, kas nodrošina saskaņotību, proti, uzticamu rīcību atbilstoši mūsu nodomiem. Tā varētu ietvert šādus pasākumus:

    • Apmācības vides un vērtēšana: mazināt risku, ka modeļiem veidojas nesaskaņota uzvedība, apmācības laikā nepieļaujot pozitīvu pastiprinājumu par atalgojuma mehānisma apiešanu. Tas varētu ietvert šādus pasākumus:

      • Automatizētas datu kopu pārbaudes: izmantot aģentus, lai atrastu un labotu kļūdas stimulētās mācīšanās (RL) vidēs, kas varētu ļaut nesaskaņotām darbību secībām saņemt augstu atalgojumu par ievainojamību izmantošanu, nevis paredzēto uzvedību. Tas mazinātu iespējas apmācības laikā pastiprināt nesaskaņotu uzvedību.

      • Manuālas datu kopu pārbaudes: papildināt automatizētus imitētus uzbrukumus ar manuālu datu kopu pārskatīšanu un kvalitātes pārbaudēm, lai noteiktu kļūdainus uzdevumus, kas varētu netīši pastiprināt nesaskaņotu uzvedību.

      • Vērtētāju pielāgošana: pielāgot vērtētājus, lai tie samazinātu modeļa vērtējumu par mēģinājumiem apmācības laikā izmantot RL vides ievainojamības vai uzlauzt šīs vides.

      • Iepriekšējo ciklu analīze: ar klasifikatoriem analizēt iepriekšējo eksperimentu izpildes ierakstus, lai pārliecinātos, ka vērtētāji darbojas, kā paredzēts.

    • Saskaņotības mērīšana: veikt izvērtējumus, kas seko modeļa tieksmei uz nesaskaņotu uzvedību, lai izmērītu saskaņotības apmācības efektivitāti. Tas varētu ietvert šādus pasākumus:

      • Saskaņotības izvērtējumi ārpus tiešsaistes režīma: robežšķirtnes modeļu apmācības ciklos veikt saskaņotības izvērtējumus, lai pārbaudītu, vai apmācība darbojas, kā paredzēts, un izmeklēt jebkādu būtisku pasliktināšanos.

      • Retrospektīva pārbaude: pārbaudīt saskaņotības izvērtējumus ar iepriekšējo incidentu datiem, lai pārliecinātos, ka tie atklāj iepriekš nesaskaņotus modeļus un nav pārmērīgi pielāgoti konkrētiem incidentiem.

      • Izvērtējumu apiešanas uzraudzība: uzraudzīt izvērtēšanas apzināšanos vai stratēģisku pielāgošanos pārbaudes situācijai (modelim atpazīstot, ka tas tiek pārbaudīts), kas varētu izraisīt uzvedības maiņu. Piemēram, saskaņotības izvērtējumos iespējot šādas apzināšanās un pielāgošanās uzraudzību, nosakot konkrētus bloķēšanas sliekšņus.

      • Sliktākā scenārija stresa testi: izraisīt sliktākajam scenārijam atbilstošu nevēlamu uzvedību un pārbaudīt, vai vismaz viens izvērtējums to atklātu.

    • Nepieļaut apmācību pēc domu ķēdes: stimulētās mācīšanās laikā neļaut automatizētajiem vērtētājiem redzēt domu ķēdi, lai modeļi neiemācītos apiet domu ķēdes uzraudzības mehānismus.

  • Izolēšana: nodrošināt pietiekami stingru izolāciju smilškastē un drošības pasākumus, lai nepieļautu kaitīgas darbības, ja modelis kļūst nesaskaņots. Tas varētu ietvert šādus pasākumus:

    • Vairāki infrastruktūras drošības slāņi: ieguldīt ievērojamus resursus gan modeļa darbības smilškastes, gan to uzturošās pētniecības infrastruktūras drošības stiprināšanā, lai izkļūšanas gadījumā būtu pieejams papildu aizsardzības slānis.

    • Imitēti uzbrukumi izolācijas pārbaudei: uzlabot smilškastes, pētniecības infrastruktūras un perimetra drošību, atkārtoti veicot imitētus uzbrukumus šīm sistēmām ar robežšķirtnes apmācības ciklu kontrolpunktos saglabātajām modeļu versijām. Pirms tam jāveic drošības analīze; mērķis ir atrast un novērst nepilnības. Veikt arī imitētus uzbrukumus visiem pakalpojumiem, kuriem modelis varētu piekļūt apmācības laikā (piemēram, interneta kešatmiņai).

    • Saziņa starp paraugiem: atļaut saziņu ar lielu joslas platumu starp paraugiem tikai pa apstiprinātiem kanāliem, piemēram, ar vairāku aģentu rīkiem, un slēgt infrastruktūras blakuskanālus, kuriem ir liels joslas platums un kurus aģentiem ir viegli atklāt.

    • Nemaināmi sarunu pieraksti: visā RL apmācībā, izvērtēšanā un iekšējā lietošanā saprātīgu laiku glabāt aģentu sarunu pierakstus nemaināmā formā (piemēram, vienreiz ierakstāmās krātuves kontos), lai nodrošinātu uzticamu incidentu izmeklēšanu un nepieļautu nejaušus labojumus.

  • Uzraudzība: nodrošināt reāllaika uzraudzības sistēmu, kas atklāj iespējamo nesaskaņotību, ja modeļi sāk rīkoties nesaskaņoti, un ļauj ātri novērst prioritārās problēmas, pirms noticis nopietns incidents. Tas varētu ietvert šādus pasākumus:

    • Uzraugāmības nodrošināšana: nodrošināt, ka modeļi joprojām ir uzraugāmi, to pārbaudot ar uzraugāmības un izvairīšanās no uzraudzības izvērtējumiem ar skaidriem sliekšņiem, lai laikus atklātu satraucošu uzvedību.

    • Augsts zināmo problēmu atklāšanas īpatsvars: nodrošināt, ka uzraudzības sistēma atklāj lielu daļu iepriekšējo incidentu izvērtējumā ar atsevišķi atliktiem datiem.

    • Aktuāli uzraudzības izvērtējumi: veidot izvērtējuma datu punktus, kas atspoguļo pilnīgi jaunus riskus jaunajos apmācības ciklos, lai uzraudzības atklāšanas pilnīguma un precizitātes mērījumi nenovecotu.

    • Ātra reaģēšana: ieviest prioritārus brīdinājumus, uz kuriem reaģē SLA noteiktajā termiņā, vai nu steidzami paziņojot dežurējošajam speciālistam, vai automātiski apturot skarto apmācības ciklu, pirms modelis rada kaitējumu. Piemēram, dienā par incidentiem ziņot dežurējošajam drošības speciālistam un cikla atbildīgajam, bet naktī automātiski apturēt ciklus, ja brīdinājuma saņemšana nav apstiprināta.

2. Darbības vadlīnijas

Līdztekus ieteikumiem par tehniskajiem aizsardzības pasākumiem esam izstrādājuši arī darbības paraugpraksi robežšķirtnes MI apmācības ciklu drošības pamatojumiem. Tā varētu ietvert šādus pasākumus:

  • Iebildumi (iespējamo neveiksmju iepriekšēja analīze): pēc drošības pamatojuma sagatavošanas citas komandas pārstāvim būtu jāsagatavo iebildumi, norādot uz iespējamām nepilnībām un sniedzot samērīgu riska vērtējumu. Apmācības komandai šie iebildumi būtu jāizvērtē un jānovērš konstatētās nepilnības, tā stiprinot drošības pamatojumu.

  • Apstiprinājumi: drošības pamatojums būtu jāizskata augstākās vadības pārstāvjiem, katram ar tiesībām aizliegt apmācības ciklu, lai tam nodrošinātu vairākas iekšējās pārbaudes (piemēram, pētniecības struktūrvienības vadītājam vai viceprezidentam, drošības vadītājam un galvenajam zinātniekam).

  • Atbildība: augstākās vadības pārstāvim, kura pārziņā ir apmācības cikls (piemēram, pētniecības struktūrvienības vadītājam vai pētniecības viceprezidentam), būtu jāatbild par drošības pamatojumu un reaģēšanu uz incidentiem. Tas būtu jāņem vērā arī darba snieguma novērtējumos, lai apmācības komandām būtu stimuls rūpēties par drošību un saskaņotību.

  • Apturēšana: ja tiek atklātas problēmas, kuru dēļ drošības pamatojums vairs nav derīgs (piemēram, jauna drošības problēma), jābūt pieejamām rīcības instrukcijām, tehniskiem kontroles mehānismiem un pakalpojumu līmeņa vienošanām (SLA), lai apturētu visus ciklus, uz kuriem pamatojums attiecas.

  • Iekšējā pārredzamība: drošības pamatojumiem būtu jābūt pieejamiem iekšējās uzraudzības grupām (piemēram, Drošības un aizsardzības komitejai).

  • Auditi: auditoriem būtu jānodrošina pietiekama piekļuve, lai pārbaudītu drošības pamatojumā ietverto apgalvojumu derīgumu un pamatotību un ziņotu par atklātajām nepilnībām.

  • Eskalācija: būtu jāizveido skaidra kārtība ziņojumu par nesaskaņotību nodošanai augstākā līmenī, tostarp tabula ar definētiem nesaskaņotības smaguma līmeņiem. Būtu arī jānorīko dežurējošais speciālists nesaskaņotības jautājumos, kurš var steidzami sazināties ar vadību (piemēram, izpilddirektoru), kad apmācības ciklā tiek sasniegts noteikts smaguma līmenis.

  • Tehniskie kontroles mehānismi: gan cilvēkiem, gan aģentiem būtu jāapgrūtina prasībām neatbilstošu apmācības ciklu sākšana. Drošības funkciju, piemēram, uzraudzības un automātiskās apturēšanas, atteices gadījumā darbība būtu jābloķē (piemēram, nedrīkstētu būt iespējams sākt ciklu bez ieslēgtas atbilstošas uzraudzības vai atspējot uzraudzību no stimulētās mācīšanās apmācības, izvērtēšanas vai iekšējās lietošanas vides).

  • Iespēja atsaukt izmaiņas: būtu jābūt viegli nosakāmiem visiem nesaskaņota modeļa turpmākajiem izmantošanas veidiem apmācības procesā (piemēram, datu ģenerēšanai vai vērtēšanai), lai vajadzības gadījumā varētu novērst nesaskaņoto izvadu ietekmi.

  • Atlikušo risku pilnīgs uzskaitījums: drošības pamatojumos būtu pēc iespējas pilnīgi jāuzskaita atlikušie riski, kurus nesedz pašlaik ieviestie riska mazināšanas pasākumi, lai varētu pieņemt informētus lēmumus par riska pieņemšanu.

Šie ir mūsu pašreizējie ieteikumi, un OpenAI tos patlaban ievieš. Paredzam, ka tuvākajās nedēļās mūsu prakse turpinās pilnveidoties.

3. Nesaskaņotības incidentu izmeklēšana

Esam arī izstrādājuši paraugpraksi nopietnu MI nesaskaņotības incidentu izmeklēšanai. Laboratorijām būtu jācenšas no katra incidenta mācīties pēc iespējas vairāk (līdzīgi kā to paredz izmeklēšanas prakse⁠(atveras jaunā logā) citās augsta riska nozarēs), lai turpmāk šādus gadījumus novērstu. Iespējamie pasākumi ir šādi:

  • Iekšējā pārredzamība: tā kā izmeklēšana var prasīt daudz laika, organizācijā būtu regulāri jāsniedz jaunākā informācija par incidentu izmeklēšanas gaitu (piemēram, katru dienu, kamēr izmeklēšana turpinās). Darbiniekiem būtu jābūt noteiktai kārtībai, kā iegūt plašāku piekļuvi, tostarp neapstrādātiem sarunu pierakstiem un izvadu paraugu iegūšanai no nesaskaņotiem modeļiem, ja tas ir droši un nepieciešams viņu darbam.

  • Nesaskaņotības pamatcēlonis: pētniekiem būtu jānoskaidro ar apmācības dinamiku saistītie pamatcēloņi (piemēram, mērķtiecīgi izslēdzot atsevišķus komponentus vai veicot atkārtotas paraugu iegūšanas eksperimentus), lai saprastu, kā radusies nesaskaņota uzvedība. Tas padziļinātu zinātnisko izpratni par nesaskaņotību un palīdzētu to labāk novērst nākotnē.

  • Pēcincidenta analīze: būtu jāanalizē darbības procesi un organizācijas kultūra, lai izprastu visus incidentu veicinošos cēloņus, piemēram, kāpēc problēmas radās un līdz incidentam netika atklātas vai nodotas izskatīšanai augstākā līmenī.

  • Atklāšana: mums būtu jāizstrādā saskaņotības pārbaudes metodes, kas spēj atklāt tieksmi izraisīt šādu incidentu, tās tieši neoptimizējot pēc incidentā iegūtās informācijas (piemēram, sarunu pierakstiem vai incidenta kopsavilkumiem). No incidentiem atvasināti izvērtējumi būtu jāveido kā „regresijas testi”, lai nodrošinātu, ka nākamie modeļi ļoti līdzīgos incidentos neizrāda tieksmi uz nesaskaņotu uzvedību.

  • Informācijas publiskošana: pēc izmeklēšanas noslēguma tās rezultāti, pēcincidenta analīze un izmaiņas darbībā būtu jādara zināmi sabiedrībai. Skartās trešās puses būtu jāinformē pēc iespējas ātrāk.

Autors

OpenAI