Pereiti prie pagrindinio turinio
OpenAI

2026 m. rugsėjo 22 d.

Sauga

Veiksmingų trečiųjų šalių vertinimų prioritetai ir principai

Įkeliama...

Priešakinio DI laboratorijoms tenka didžiulė atsakomybė saugiai mokyti, vertinti ir diegti modelius. Trečiųjų šalių vertinimai yra itin svarbūs siekiant tinkamai vykdyti šią atsakomybę, sudaryti daugiau galimybių prisidėti prie DI saugos, informuoti visuomenę ir užtikrinti laboratorijų atskaitomybę pagal aiškius, nepriklausomai pagrįstus saugos teiginius.

Siekdama neatsilikti nuo priešakinės raidos, OpenAI yra įsipareigojusi remti nepriklausomus vertinimus ir suteikti išsamią prieigą visais mokymo, vertinimo bei diegimo etapais. Ši prieiga turėtų suteikti vertintojams galimybę kvestionuoti mūsų prielaidas, nustatyti galbūt nepastebėtas rizikas ir savarankiškai įvertinti mūsų apsaugos priemonių veiksmingumą.

Jau seniai bendradarbiaujame su trečiųjų šalių vertintojais įvairiais modelių kūrimo ir diegimo proceso etapais. Trečiųjų šalių vertinimus taip pat įtraukėme į savo Pasirengimo sistemos praktiką ir rėmėme organizacijas bei teisės aktus, kuriais siekiama griežtesnio ir atskaitingesnio proceso. Per šį bendradarbiavimą suteikėme išsamią prieigą, įskaitant informaciją apie mūsų technines apsaugos priemones, prieigą prie matomos minčių grandinės ir precedento neturinčią prieigą prie konfidencialių duomenų bei vidinių diegimų, kad būtų galima reaguoti į incidentus ir atlikti stebėsenos sistemų testavimą spragoms nustatyti. Čia pateikiami prioritetai ir principai skirti mūsų bendradarbiavimui su privačiojo bei ne pelno sektorių nepriklausomo vertinimo organizacijomis atliekant techninės saugos vertinimus. Jie papildo mūsų bendradarbiavimą su vyriausybėmis testavimo ir vertinimo srityse, kur dėl skirtingų vaidmenų ir atsakomybės gali reikėti kitokių metodų.

Kad šie vertinimai būtų veiksmingi, būtini tvirti nepriklausomumo mechanizmai, mokslinis kruopštumas, patikima saugumo praktika ir aiški atsakomybė. Laboratorijos privalo sudaryti sąlygas prasmingai priežiūrai ir kartu apsaugoti jautrią informaciją. Už tinkamą šio darbo atlikimą bendrai atsako laboratorijos ir nepriklausomi vertintojai, todėl jie turėtų vadovautis bendrais tarptautiniais saugos ir saugumo praktikos standartais. Toliau siūlome keturias prioritetines išsamesnio vertinimo sritis ir išdėstome kruopštaus, saugaus bei nepriklausomo darbo principus.

Prioritetinės vertinimo sritys

Trečiųjų šalių vertinimai naudingiausi tada, kai juose nagrinėjami konkretūs ir reikšmingi klausimai: ar įrodymai patvirtina laboratorijos saugos pagrindimą ir saugos teiginius? Ar vertinimais tinkamai tikrinamos rizikos, kurias jie skirti įvertinti? Ar apsaugos priemonės veikia realiomis sąlygomis?

Čia aprašyti vertinimai turėtų būti skirtingų formų, atsižvelgiant į nagrinėjamus saugos klausimus. Tikimės vienu metu ir skirtingais laikotarpiais remti kelis vertinimus: vieni truks kelias savaites, kiti – kelis mėnesius. Nors trečiųjų šalių vertinimai taip pat gali būti atliekami prieš diegimą ir padėti priimti sprendimus dėl jo, čia aprašomas darbas paprastai yra ilgalaikis ir nesusietas su produkto pristatymu – juo siekiama nuodugniai ir ilgainiui išnagrinėti konkrečius saugos teiginius.

Aprašydami prioritetines sritis ir principus vartojame sąvokas „saugos teiginiai“ ir „saugos pagrindimai“. Šias sąvokas suprantame taip:

Saugos teiginys: konkretus teiginys apie modelio ar sistemos gebėjimus, elgseną arba apsaugos priemones, svarbus jos saugai ir galimas įvertinti remiantis įrodymais. Teiginyje turėtų būti įvardytos rizikos ir sąlygos, kurioms jis taikomas, taip pat susijusios prielaidos ir apribojimai.

Saugos pagrindimas: įrodymais paremtas struktūruotas argumentas, paaiškinantis, kodėl modelio ar sistemos rizikos yra tinkamai valdomos vykdant konkrečią veiklą, pavyzdžiui, mokymą, vertinimą ar diegimą. Saugos pagrindimas susieja atskirus saugos teiginius su juos patvirtinančiais įrodymais ir aiškiai nurodo prielaidas, neapibrėžtumus bei likusias rizikas, galinčias paveikti jo išvadas.

Siūlome keturias prioritetines išsamesnio vertinimo sritis ir išdėstome kruopštaus, saugaus bei nepriklausomo darbo principus.

  1. Nepriklausomas saugos pagrindimų vertinimas, apimantis mokymą, vertinimą, vidinį ir išorinį diegimą.

    Saugos pagrindimams vertinti reikia kompetencijos suderinimo, kontrolės metodų, tokių kaip stebėsena, kibernetinio saugumo, biologinio bei cheminio piktnaudžiavimo ir testavimo spragoms nustatyti srityse. Saugos pagrindimus sudaro teiginiai, apimantys mokymą, gebėjimų vertinimus ir apsaugos priemones; juos galima vertinti kartu arba dalimis (žr. toliau pateiktus 2 ir 3 prioritetus). Tikėtina, kad skirtingas pagrindimų dalis turės nagrinėti keli vertintojai, pasitelkdami savo atitinkamų sričių kompetenciją. Kartu jų vertinimai turėtų atsakyti į tokius klausimus:

    1. Ar mokymo, vertinimo ir diegimo saugos pagrindimai patvirtinti įrodymais? Ar mokant, vertinant ir diegiant buvo laikomasi saugos pagrindime nustatytų sąlygų?

    2. Ar mūsų saugos pagrindimai apima per vertinimą nustatytas neatidėliotinas rizikas? Ar saugos teiginiai patvirtina bendrą saugos pagrindimą? Ar yra spragų arba tobulintinų sričių?

    3. Ar taikomi veiksmingi metodai mokymo paskatoms, galinčioms skatinti apgaulę, atlygio išnaudojimą, destruktyvius veiksmus ar apribojimų apėjimą, nustatyti ir sumažinti?

  2. Itin svarbių apsaugos priemonių vertinimas vidinio ir išorinio diegimo metu

    Mūsų apsaugos priemonių visuma nuolat tobulinama atsižvelgiant į kintančius gebėjimus ir aplinkybes. Mūsų apsaugos priemonės apima mokymą, vidinį diegimą ir išorinį diegimą. Šiuo metu jos apima modelio lygmens, taisyklių vykdymo užtikrinimo ir saugumo priemones, taip pat nesuderinamumo stebėsenos sistemas, skirtas įvairioms rizikoms, pavyzdžiui, kontrolės praradimui ir kibernetiniam, biologiniam bei cheminiam piktnaudžiavimui. Techninės partnerystės gali jau dabar padėti nustatyti apsaugos priemonių trūkumus, tobulinti vertinimo metodus ir spartinti standartų kūrimą, taip sukuriant tvirtesnį techninį pagrindą būsimai viešajai politikai, skirtai neatsilikti nuo priešakinės raidos. Tai ypač svarbu vidiniam diegimui, kurio saugos ir saugumo standartai dar tik kuriami.

    Nepriklausomuose vertinimuose turėtų būti nagrinėjama, kaip gerai veikia šios apsaugos priemonės ir kur jos gali būti nepakankamos, pavyzdžiui:

    1. Ar suteikus „pilkosios dėžės“ prieigą apsaugos priemonės yra atsparios priešiškam testavimui (apribojimų apėjimui) ir pakankamai apsaugo nuo gebėjimų padidėjimo didelės rizikos srityse, pavyzdžiui, kibernetikos ar biologijos? Ar mūsų priešiškas testavimas ir testavimas spragoms nustatyti apima svarbiausias rizikas?

    2. Kaip per autorizuotą testavimą realiomis veikimo sąlygomis agentai sąveikauja su kibernetinės gynybos priemonėmis, tokiomis kaip prieigos kontrolė, izoliuotos aplinkos ir aptikimo bei reagavimo sistemos? Kurios gynybos priemonės užkerta kelią žalingiems veiksmams, juos aptinka ar sustabdo ir kada jos nesuveikia?

    3. Ar mūsų nesuderinamumo stebėsenos sistemose yra kritinių spragų, kurios vidinio ar išorinio diegimo metu galėtų lemti kontrolės praradimą arba didelį nesuderinamumą? Modelių gebėjimams didėjant, kiek patikima yra minčių grandinės stebėsena kaip saugos ar suderinimo įrodymų šaltinis?

    4. Ar visuose susijusiuose mokymo, vertinimo ir diegimo procesuose įdiegta tinkama stebėsena, kurios nebūtų galima lengvai išjungti?

    5. Ar apsaugos priemonės įdiegtos proporcingai gebėjimams?

  3. Gebėjimų vertinimų, apimančių Pasirengimo sistemos rizikos kategorijas (cheminę ir biologinę riziką, kibernetinį saugumą bei DI gebėjimą tobulinti save), ir suderinimo vertinimų, skirtų nesuderinamumo rizikai, įvertinimas

    Pagal mūsų Pasirengimo sistemą vertinimais privaloma įvertinti pagrindines ribinės rizikos sritis. Peržengiant ribines vertes ir vertinimams pasiekiant savo galimybių ribas, svarbu juos nuolat atnaujinti ir užtikrinti vertinimų, kuriais tikrinami gebėjimai Pasirengimo sistemos rizikos srityse, bei suderinimo vertinimų, skirtų didelio nesuderinamumo rizikai įvertinti, aprėptį ir kokybę.

    Aktualūs klausimai:

    1. Ar Pasirengimo sistemos rizikos vertinimai tinkamai aprėpia jos rizikos ribinės vertės apibrėžtį? Ar šių vertinimų ribinės vertės nustatytos tinkamai?

    2. Ar vertinimai atnaujinami, kai modeliai nuolat pasiekia aukščiausius rezultatus, ir ar naujais testais prasmingai matuojami pažangesni gebėjimai?

    3. Ar mūsų suderinimo vertinimai tinkamai aprėpia didelio nesuderinamumo rizikas ir kokių svarbių elgsenos modelių ar sąlygų jie gali neapimti?

  4. Nepriklausomas kritinių nesuderinamumo incidentų tyrimas

    Nepriklausomi tyrimai gali būti naudingi nagrinėjant įvairius kritinius DI saugos incidentus. Čia daugiausia dėmesio skiriame modelių nesuderinamumui, įskaitant modelių veikimą be leidimo ar priežiūros vengimą, nes tokie atvejai gali atskleisti suderinimo metodų ir apsaugos priemonių trūkumus net ir nesant tyčinio piktnaudžiavimo.

    Tam tikromis aplinkybėmis, kaip OpenAI ir „Hugging Face“ incidento atveju, gali būti naudinga pasitelkti nepriklausomą trečiąją šalį atlikti nepriklausomus nesuderinamumo incidentų tyrimus. Labai svarbu, kad incidentus tiriančios trečiosios šalys turėtų reikiamą tyrimų kompetenciją, įskaitant, kai taikoma, kibernetinės ekspertizės ir suderinimo žinias, gebėjimą analizuoti didelio masto minčių grandines, taip pat pakankamai darbuotojų bei išteklių tyrimui laiku atlikti. Reaguojant į incidentą gali reikėti prieigos prie jautrių vidinių ir trečiųjų šalių duomenų, todėl kai kurios detalės gali būti pernelyg jautrios, kad jas būtų galima skelbti ar suteikti prieigą prie jų. Nepriklausomų tyrimų išvados taip pat gali padėti pagrįsti modelio saugą, nes suteikia įrodymų teiginiams apie jo suderinimą ir priemonių, kurių imtasi anksčiau nustatytam nesuderinamumui pašalinti, veiksmingumą įvertinti.

    Nesuderinamumo incidentų atveju pirmenybę teikiame nepriklausomiems šių klausimų vertinimams:

    1. Kokia modelio elgsena ar nesuderinamumo problemos pasireiškė per incidentą ir kokie buvo pagrindiniai jas lėmę veiksniai?

    2. Ar apsaugos ir trūkumų šalinimo priemonės veiksmingai sumažintų panašių incidentų riziką ateityje?

Veiksmingų vertinimų principai

  • Aiški vertinimo apimtis ir abipusiu sutarimu nustatyti teiginiai: vertinimai turėtų prasidėti nuo abipusiu sutarimu nustatytos apimties, o tada turėtų būti aiškiai apibrėžti ir prieš pradedant vertinimo veiklą iš anksto užregistruoti saugos teiginiai. Trečiosios šalys ir laboratorijos turėtų išsiaiškinti, ar tai yra vertinamos įmonės vertinimui teikiami teiginiai, ar teiginiai, kuriuos trečiosios šalies vertintojas siekia įvertinti nepriklausomai, o laboratorija sutinka būti pagal juos vertinama. Kai kurie teiginiai gali nepatekti į vertinimo apimtį dėl daugelio priežasčių, įskaitant tai, kad trečiosioms šalims neįmanoma gauti prieigos prie duomenų, vertintojui trūksta kompetencijos arba skubiam vertinimui taikomi pagrįsti laiko apribojimai. Laboratorijos ir vertintojai turėtų nustatyti procesą, pagal kurį būtų nagrinėjamos už pradinės apimties ribų nustatytos reikšmingos rizikos, taip pat sprendžiama, ar būtinas tolesnis tyrimas. Išvadose turėtų būti aiškiai nurodyta, kas pagal abipusiu sutarimu nustatytą apimtį buvo įvertinta, o kas ne.

  • Proporcinga prieiga: kai tai įmanoma nepažeidžiant teisinių, saugumo ir intelektinės nuosavybės apribojimų, vertintojams turėtų būti suteikta proporcinga prieiga, reikalinga sutartiems teiginiams įvertinti. Kai tiesioginė prieiga nepraktiška arba neįmanoma, vertintojai gali dirbti su paskirtu įmonės atstovu arba ieškoti netiesioginės ar privatumą išsaugančios prieigos būdų, kad apsaugotų pirminę informaciją.

  • Skaidri metodika ir standartai: vertintojai turėtų paaiškinti savo metodus, vertinimo kriterijus ir neapibrėžtumus, o kai įmanoma – remtis pripažintais standartais. Jei standartų dar nėra, vertintojai turėtų aiškiai pagrįsti taikomus kriterijus. Ataskaitose tiesioginės išvados turėtų būti atskirtos nuo interpretacijų, paaiškintas neapibrėžtumas ir aiškiai nurodyta, kurias išvadas patvirtina įrodymai.

  • Kompetencija ir nepriklausomumas: vertintojai turėtų įrodyti turintys reikiamą techninę kompetenciją, nustatyti ir atskleisti organizacinius bei asmeninius interesų konfliktus ir juos spręsti, įskaitant finansines paskatas, ryšius su kūrėjais ir ankstesnį dalyvavimą vertinamame darbe. Apsaugos priemonės turėtų užtikrinti, kad komercinis spaudimas ir atlygio susitarimai nedarytų įtakos išvadoms; jos gali apimti nusišalinimą arba tinkamus nedalyvavimo laikotarpius.

  • Saugumas ir konfidencialumas: vertintojai turėtų įrodyti, kad taiko informacijos saugumo praktiką ir savo darbuotojams privalomas konfidencialumo apsaugos priemones, proporcingas sistemų ir informacijos, prie kurių suteikiama prieiga, jautrumui. Šios priemonės turėtų apimti intelektinę nuosavybę, neskelbtiną informaciją ir vertinimo dokumentus. Kai vertintojai savo aplinkoje negali įvykdyti saugumo reikalavimų arba duomenys, prie kurių suteikiama prieiga, yra ypač jautrūs, gali būti tikslinga leisti prieigą įmonės valdomuose įrenginiuose ar patalpose.

  • Praktiškai pritaikomos išvados ir laikas trūkumams pašalinti: vertinimuose turėtų būti nurodytos konkrečios spragos ir pateikta pakankamai informacijos, kad laboratorijos galėtų jas pašalinti. Kai tinkama, prieš paskelbiant rezultatus laboratorijoms turėtų būti suteiktas pagrįstas laikotarpis problemoms pašalinti. Kai aktualu, ataskaitose taip pat turėtų būti paaiškintos agentų kūrėjams, diegėjams ir gynėjams svarbios pamokos bei pateiktos praktinės įgyvendinimo rekomendacijos.

  • Atsakingo skelbimo praktika: vertinimo ataskaitos turėtų būti grindžiamos įrodymais ir platinamos kuo atviriau, kartu apsaugant jautrią ir konfidencialią informaciją. Kai visko atskleisti viešai neįmanoma, atskaitomybę gali sustiprinti konfidencialios ataskaitos, teikiamos atitinkamoms priežiūros institucijoms, pavyzdžiui, valdymo organams ar įmonių valdyboms. Siekiant išlaikyti nepriklausomumo ir konfidencialumo pusiausvyrą, turėtų būti nustatytos principingos informacijos pašalinimo apsaugos priemonės bei taisyklės ir aiškūs lūkesčiai dėl grįžtamojo ryšio bei netikslumų taisymo. Vertintojai turėtų išsaugoti redakcinį nepriklausomumą ir kartu užtikrinti konfidencialumo bei intelektinės nuosavybės apsaugą. Vertintojai turėtų nustatyti aiškias informacijos pašalinimo taisykles, pagal kurias laboratorijos galėtų prašyti pašalinti jautrią informaciją, o vertintojai galėtų nurodyti, kur atlikti esminiai pašalinimai ir kokią įtaką jie turėjo vertinimo ataskaitai.

Tolesnis kelias

Esame įsipareigoję remti nepriklausomus vertintojus ir nustatyti aiškesnius bendrus tarptautinius veiksmingų trečiųjų šalių vertinimų standartus – tiek būsimais teisės aktais, tiek per privačias valdymo institucijas. Nors nepriklausomo vertinimo ekosistema dar tik auga, padėsime jai plėstis remdami įvairialypę nepriklausomų vertintojų bendruomenę, turinčią išsamių žinių įvairiais priešakinio DI saugos klausimais, ir su ja bendradarbiaudami. Nė viena trečioji šalis negali ir neturėtų visapusiškai aprėpti neatidėliotinų priešakinio DI saugos klausimų. Veiksime apgalvotai ir kryptingai, kad stiprintume savo pajėgumus ir padėtume augančiai trečiųjų šalių ekosistemai susitarti dėl geriausios praktikos ir principų. Su keliomis trečiosiomis šalimis aptariame pasiūlymus, atitinkančius pirmiau nurodytas prioritetines sritis.