Kalo te përmbajtja kryesore
OpenAI

22 shtator 2026

Siguria

Përparësi dhe parime për vlerësime efektive nga palë të treta

Duke ngarkuar…

Laboratorët e AI-së avangardë mbajnë përgjegjësi të jashtëzakonshme për trajnimin, vlerësimin dhe vënien e sigurt në përdorim të modeleve. Vlerësimet nga palët e treta janë thelbësore për të baraspeshuar këtë përgjegjësi, për të zgjeruar mundësitë e kontributit mbi sigurinë e AI-së, për ta mbajtur botën të informuar dhe laboratorët përgjegjës ndaj pretendimeve të qarta e të mbështetura në mënyrë të pavarur për sigurinë.

Si pjesë e përpjekjeve tona për të ecur në hap me avangardën, OpenAI është e përkushtuar të mbështesë vlerësime të pavarura me qasje të thellë në trajnim, vlerësim dhe vënie në përdorim. Kjo qasje duhet t’u mundësojë vlerësuesve të vënë në pikëpyetje supozimet tona, të identifikojnë rreziqe që mund të na kenë shpëtuar dhe të arrijnë në përfundimet e tyre për efektivitetin e masave tona mbrojtëse.

Prej kohësh bashkëpunojmë me vlerësues nga palë të treta në faza të ndryshme të zhvillimit dhe vënies në përdorim të modeleve. Gjithashtu, i kemi përfshirë vlerësimet nga palët e treta në praktikat e Preparedness Framework dhe kemi mbështetur organizata dhe legjislacion që nxisin një proces më rigoroz dhe më të përgjegjshëm. Gjatë këtyre angazhimeve kemi ofruar forma të thelluara qasjeje, përfshirë informacion për masat tona teknike mbrojtëse, qasje në zinxhirin e dukshëm të mendimit, si dhe nivele të paprecedenta qasjeje në të dhëna konfidenciale dhe në vënien e brendshme në përdorim për reagimin ndaj incidenteve dhe simulimin e sulmeve ndaj monitorëve. Përparësitë dhe parimet e paraqitura këtu përqendrohen te bashkëpunimi ynë me organizata të pavarura vlerësimi në sektorin privat dhe jofitimprurës për vlerësimet teknike të sigurisë. Ato plotësojnë punën tonë me qeveritë për testimin dhe vlerësimin, ku rolet dhe përgjegjësitë e veçanta mund të kërkojnë qasje të ndryshme.

Efektiviteti i këtyre vlerësimeve kërkon mekanizma të fortë pavarësie, rigorozitet shkencor, praktika të qëndrueshme sigurie dhe përgjegjësi të qarta. Laboratorët kanë përgjegjësinë të mundësojnë shqyrtim domethënës, duke mbrojtur njëkohësisht informacionin e ndjeshëm. Laboratorët dhe vlerësuesit e pavarur ndajnë përgjegjësinë për ta bërë këtë siç duhet dhe duhet të veprojnë sipas standardeve të përbashkëta ndërkombëtare për praktikat e sigurisë dhe mbrojtjes. Më poshtë propozojmë katër fusha prioritare për vlerësim më të thellë, së bashku me parimet për punë rigoroze, të sigurt dhe të pavarur.

Fushat prioritare për vlerësim

Vlerësimet nga palët e treta janë më të dobishme kur trajtojnë pyetje konkrete dhe me pasoja: A e mbështesin provat argumentin dhe pretendimet e sigurisë të një laboratori? A i testojnë vlerësimet në mënyrë të përshtatshme rreziqet që synojnë të matin? A funksionojnë masat mbrojtëse në kushte reale?

Vlerësimet e përshkruara këtu synohet të marrin forma të ndryshme, në varësi të çështjeve të sigurisë që shqyrtohen. Presim të mbështesim disa vlerësime paralelisht dhe gjatë periudhave të ndryshme, ku disa zgjasin disa javë dhe të tjera disa muaj. Edhe pse vlerësimet nga palët e treta mund të jenë pjesë e punës para vënies në përdorim dhe të ndikojnë në vendimet për të, puna e përshkruar këtu është përgjithësisht afatgjatë dhe e pavarur nga lançimi, duke u përqendruar në shqyrtimin e thellë e në vazhdimësi të pretendimeve të caktuara të sigurisë.

Në të gjitha fushat dhe parimet tona prioritare, u referohemi pretendimeve dhe argumenteve të sigurisë. Me këto terma nënkuptojmë sa vijon:

Pretendim sigurie: Një pohim specifik për aftësitë, sjelljen ose masat mbrojtëse të një modeli apo sistemi, që lidhet me sigurinë e tij dhe mund të vlerësohet kundrejt provave. Pretendimi duhet të përcaktojë rreziqet dhe kushtet që trajton, si edhe supozimet dhe kufizimet përkatëse.

Argument sigurie: Një argument i strukturuar dhe i mbështetur në prova, që shpjegon pse rreziqet e një modeli ose sistemi menaxhohen siç duhet për një veprimtari të caktuar, si trajnimi, vlerësimi ose vënia në përdorim. Një argument sigurie lidh pretendimet individuale të sigurisë me provat që i mbështesin dhe paraqet qartë supozimet, pasiguritë dhe rreziqet e mbetura që mund të ndikojnë në përfundimet e tij.

Propozojmë katër fusha prioritare për vlerësim më të thellë, së bashku me parimet për punë rigoroze, të sigurt dhe të pavarur.

  1. Vlerësim i pavarur i argumenteve të sigurisë, që përfshin trajnimin, vlerësimin dhe vënien në përdorim brenda e jashtë organizatës.

    Vlerësimi i argumenteve të sigurisë kërkon ekspertizë në përafrim, metoda kontrolli si monitorimi, siguri kibernetike, keqpërdorim biologjik e kimik dhe simulim sulmesh. Argumentet e sigurisë përbëhen nga pretendime që përfshijnë trajnimin, vlerësimet e aftësive dhe masat mbrojtëse, të cilat mund të shqyrtohen në tërësi ose pjesërisht (shih përparësitë 2 dhe 3 më poshtë). Ka të ngjarë që disa vlerësues të duhet të shqyrtojnë pjesë të ndryshme të argumenteve, duke u mbështetur në ekspertizën e tyre përkatëse. Së bashku, vlerësimet e tyre duhet t’u përgjigjen pyetjeve të tilla si:

    1. A janë të mbështetura me prova argumentet e sigurisë për trajnimin, vlerësimin dhe vënien në përdorim? A u respektuan kushtet e argumentit të sigurisë gjatë trajnimit, vlerësimit dhe vënies në përdorim?

    2. A i mbulojnë argumentet tona të sigurisë rreziqet më urgjente të identifikuara gjatë një vlerësimi? A e mbështesin pretendimet e sigurisë argumentin e përgjithshëm të sigurisë? A ka mangësi ose fusha që duhen përmirësuar?

    3. A përdoren metoda efektive për të identifikuar dhe zvogëluar stimujt në trajnim që mund të shpërblejnë mashtrimin, manipulimin e sistemit të shpërblimit, veprimet shkatërruese ose anashkalimin e kufizimeve?

  2. Vlerësimi i masave kritike mbrojtëse në vëniet në përdorim brenda dhe jashtë organizatës

    Sistemi ynë i masave mbrojtëse zhvillohet vazhdimisht për t’iu përshtatur aftësive dhe mjedisit në ndryshim. Masat tona mbrojtëse përfshijnë trajnimin dhe vënien në përdorim brenda e jashtë organizatës. Aktualisht ato përfshijnë masa mbrojtëse në nivel modeli, masa për zbatimin e rregullave dhe masa sigurie, si edhe monitorë të mospërafrimit, duke mbuluar një larmi të gjerë rreziqesh, si humbja e kontrollit dhe keqpërdorimi që sjell rreziqe kibernetike, biologjike e kimike. Partneritetet teknike mund të identifikojnë dobësitë e tanishme të masave mbrojtëse, ndërkohë që përmirësojnë metodat e vlerësimit dhe përshpejtojnë zhvillimin e standardeve, duke krijuar një bazë teknike më të fortë për politikat e ardhshme publike që të ecin në hap me avangardën, veçanërisht për vënien e brendshme në përdorim, ku standardet e sigurisë dhe mbrojtjes janë ende në fillesat e tyre.

    Vlerësimet e pavarura duhet të shqyrtojnë sa mirë funksionojnë këto masa mbrojtëse dhe ku mund të kenë mangësi, për shembull:

    1. Duke përdorur qasje «kuti gri», a u rezistojnë masat mbrojtëse testimeve kundërshtuese (heqjeve të kufizimeve mbrojtëse) dhe a mbrojnë mjaftueshëm nga rritja e aftësive në fusha me rrezik të lartë (p.sh., kibernetike dhe biologjike)? A i mbulojnë testimet tona kundërshtuese dhe simulimi i sulmeve rreziqet më të rëndësishme?

    2. Gjatë testimeve të autorizuara në kushte reale pune, si ndërveprojnë agjentët me mbrojtjen kibernetike, si kontrollet e qasjes, izolimi në mjedise të sigurta dhe sistemet e zbulimit e reagimit? Cilat masa mbrojtëse i parandalojnë, zbulojnë ose kufizojnë veprimet e dëmshme dhe ku dështojnë ato?

    3. A kanë monitorët tanë të mospërafrimit mangësi kritike që mund të shkaktojnë humbje kontrolli ose mospërafrim të rëndë, si në vënien në përdorim brenda, ashtu edhe jashtë organizatës? Sa i besueshëm është monitorimi i zinxhirit të mendimit si burim provash për sigurinë ose përafrimin, teksa përmirësohen aftësitë e modelit?

    4. A zbatohet monitorim i përshtatshëm në të gjitha trajnimet, vlerësimet dhe vëniet përkatëse në përdorim, në një mënyrë që nuk mund të çaktivizohet lehtë?

    5. A zbatohen masa mbrojtëse në përpjesëtim me aftësitë?

  3. Vlerësimi i aftësive që mbulon kategoritë e rrezikut të Preparedness Framework (rreziqet kimike dhe biologjike, siguria kibernetike, vetëpërmirësimi i AI-së), si edhe vlerësimet e përafrimit për rreziqet e mospërafrimit

    Preparedness Framework kërkon vlerësime të fushave kryesore të rrezikut të AI-së avangardë. Ndërsa pragjet kapërcehen dhe vlerësimet arrijnë kufijtë e tyre, është e rëndësishme të përditësohen vazhdimisht dhe të sigurohen mbulimi e cilësia e vlerësimeve të aftësive në fushat e rrezikut të Preparedness Framework, si edhe e vlerësimeve të përafrimit që synojnë rreziqet e mospërafrimit të rëndë.

    Pyetjet përkatëse përfshijnë:

    1. A e mbulojnë siç duhet përkufizimin e pragut të rrezikut të Preparedness Framework vlerësimet që shqyrtojnë këto rreziqe? A janë vendosur saktë pragjet për këto vlerësime?

    2. A përditësohen vlerësimet kur modelet arrijnë vazhdimisht rezultatet më të larta dhe a matin testet e reja në mënyrë domethënëse aftësi më të përparuara?

    3. A i mbulojnë siç duhet vlerësimet tona të përafrimit rreziqet e mospërafrimit të rëndë dhe cilat sjellje ose kushte të rëndësishme mund të mos kapin?

  4. Hetim i pavarur i incidenteve kritike të mospërafrimit

    Hetimi i pavarur mund të jetë i vlefshëm për një gamë të gjerë incidentesh kritike të sigurisë së AI-së. Këtu përqendrohemi te mospërafrimi i modelit, përfshirë rastet kur modelet veprojnë pa autorizim ose shmangin mbikëqyrjen, të cilat mund të zbulojnë dobësi në metodat e përafrimit dhe masat mbrojtëse edhe pa keqpërdorim të qëllimshëm.

    Në rrethana të caktuara, si në incidentin OpenAI Hugging Face, mund të jetë e dobishme përfshirja e një pale të tretë të pavarur për hetimin e pavarur të incidenteve të mospërafrimit. Është thelbësore që palët e treta të përfshira në hetimin e incidenteve të kenë ekspertizën e nevojshme, përfshirë sipas rastit ekspertizë në kriminalistikën kibernetike, përafrim, analizë në shkallë të gjerë të zinxhirit të mendimit, si edhe personelin dhe burimet për ta kryer hetimin në kohë. Reagimi ndaj incidenteve mund të përfshijë qasje në të dhëna të ndjeshme të brendshme dhe të palëve të treta; për rrjedhojë, disa hollësi mund të jenë tepër të ndjeshme për t’u publikuar ose për t’u vënë në dispozicion. Gjetjet e hetimeve të pavarura mund të ndihmojnë edhe argumentin e sigurisë të një modeli, duke ofruar prova për të vlerësuar pretendimet rreth përafrimit të tij dhe efektivitetit të masave të marra për të korrigjuar mospërafrimin e vërejtur më parë.

    Në kontekstin e incidenteve të mospërafrimit, u japim përparësi vlerësimeve të pavarura për:

    1. Çfarë sjelljeje të modelit ose problemesh mospërafrimi ndodhën gjatë incidentit dhe cilët janë faktorët kryesorë që kontribuuan?

    2. A do t’i zbusnin në mënyrë efektive masat mbrojtëse dhe korrigjuese incidente të ngjashme në të ardhmen?

Parimet për vlerësime efektive

  • Pretendime për vlerësim me fushëveprim të qartë dhe të miratuara bashkërisht: Vlerësimet duhet të nisin me një fushëveprim të miratuar bashkërisht, të pasuar nga pretendime sigurie të përcaktuara qartë dhe të regjistruara paraprakisht, para fillimit të veprimtarive të vlerësimit. Palët e treta dhe laboratorët duhet të sqarojnë nëse bëhet fjalë për pretendime që kompania e vlerësuar dëshiron t’i paraqesë për vlerësim apo për pretendime që vlerësuesi i palës së tretë synon t’i shqyrtojë në mënyrë të pavarur dhe kundrejt të cilave laboratori pranon të vlerësohet. Ka shumë arsye pse disa pretendime mund të jenë jashtë fushëveprimit, përfshirë pamundësinë që palët e treta të kenë qasje në të dhëna, mungesën e ekspertizës së mjaftueshme të vlerësuesit ose kufizime të arsyeshme kohore kur vlerësimi është urgjent. Laboratorët dhe vlerësuesit duhet të krijojnë një proces për shqyrtimin e rreziqeve të konsiderueshme të identifikuara jashtë fushëveprimit fillestar, përfshirë nëse nevojitet hetim i mëtejshëm. Përfundimet duhet të bëjnë të qartë se çfarë u vlerësua dhe çfarë nuk u vlerësua në raport me fushëveprimin e miratuar bashkërisht.

  • Qasje proporcionale: Kur është e mundur dhe brenda kufizimeve ligjore, të sigurisë dhe të pronësisë intelektuale, vlerësuesit duhet të kenë qasje proporcionale për të shqyrtuar pretendimet e miratuara. Kur qasja e drejtpërdrejtë është jopraktike ose e pamundur, vlerësuesit mund të punojnë me një përfaqësues të caktuar të kompanisë ose të shqyrtojnë mekanizma qasjeje të tërthortë apo që ruajnë privatësinë, për të mbrojtur informacionin bazë.

  • Metodologji dhe standarde transparente: Vlerësuesit duhet të shpjegojnë metodat, kriteret e vlerësimit dhe pasiguritë e tyre, duke u mbështetur në standarde të njohura kur ka të tilla. Kur standardet ende nuk ekzistojnë, ata duhet t’i arsyetojnë qartë kriteret që përdorin. Raportet duhet t’i dallojnë gjetjet e drejtpërdrejta nga interpretimi, të shpjegojnë pasigurinë dhe të sqarojnë se cilat përfundime mbështeten nga provat.

  • Ekspertizë dhe pavarësi: Vlerësuesit duhet të dëshmojnë ekspertizën teknike përkatëse dhe të identifikojnë, deklarojnë e trajtojnë konfliktet organizative dhe individuale të interesit, përfshirë stimujt financiarë, marrëdhëniet me zhvilluesit dhe përfshirjen e mëparshme në punën që po vlerësohet. Masat mbrojtëse duhet të hartohen për të siguruar që trysnia tregtare dhe marrëveshjet e kompensimit të mos ndikojnë në gjetje dhe mund të përfshijnë tërheqjen nga procesi ose periudha të përshtatshme përjashtimi.

  • Siguria dhe konfidencialiteti: Vlerësuesit duhet të dëshmojnë praktika të sigurisë së informacionit dhe mbrojtje të zbatueshme të konfidencialitetit për personelin e tyre, në përpjesëtim me ndjeshmërinë e sistemeve dhe informacionit ku kanë qasje. Këto masa duhet të mbulojnë pronësinë intelektuale, informacionin e ndjeshëm dhe dokumentacionin e vlerësimit. Kur vlerësuesit nuk mund t’i përmbushin kërkesat e sigurisë në mjediset e tyre ose kur të dhënat ku hyhet janë veçanërisht të ndjeshme, mund të jetë e përshtatshme qasja përmes pajisjeve ose ambienteve të administruara nga kompania.

  • Gjetje të zbatueshme dhe kohë për korrigjim: Vlerësimet duhet të identifikojnë mangësi konkrete dhe të japin hollësi të mjaftueshme që laboratorët t’i trajtojnë ato. Kur është e përshtatshme, laboratorëve duhet t’u jepet një afat i arsyeshëm për t’i korrigjuar problemet para publikimit. Kur është me rëndësi, raportet duhet të shpjegojnë edhe mësimet për zhvilluesit, vënësit në përdorim dhe mbrojtësit e agjentëve, me rekomandime praktike për zbatim.

  • Praktika të përgjegjshme publikimi: Raportet e vlerësimit duhet të mbështeten në prova dhe të ndahen sa më hapur të jetë e mundur, duke mbrojtur njëkohësisht informacionin e ndjeshëm dhe konfidencial. Kur publikimi i plotë nuk është i mundur, raportimi konfidencial te organet përkatëse mbikëqyrëse, si organet drejtuese ose bordet e kompanive, mund të mbështetë llogaridhënien. Duhet të zbatohen masa dhe politika parimore për redaktimin e informacionit, si edhe pritshmëri të qarta për komentet dhe korrigjimin e pasaktësive, që të ruhet ekuilibri mes pavarësisë dhe konfidencialitetit. Vlerësuesit duhet të ruajnë pavarësinë redaksionale, duke siguruar njëkohësisht mbrojtjen e konfidencialitetit dhe pronësisë intelektuale. Vlerësuesit duhet të miratojnë politika të qarta redaktimi që u lejojnë laboratorëve të kërkojnë fshehjen e informacionit të ndjeshëm, ndërsa vlerësuesit mund të shënojnë se ku janë bërë redaktime thelbësore dhe si ndikojnë ato në raportin e vlerësimit.

Rruga përpara

Jemi të përkushtuar të mbështesim vlerësuesit e pavarur dhe të krijojmë standarde ndërkombëtare më të qarta e të përbashkëta, si përmes ligjeve të ardhshme, ashtu edhe institucioneve private të qeverisjes, për vlerësime efektive nga palë të treta. Ndërsa ekosistemi i vlerësimit të pavarur vazhdon të zhvillohet, ne do ta ndihmojmë duke mbështetur dhe bashkëpunuar me një komunitet të larmishëm vlerësuesish të pavarur, me ekspertizë të thellë në çështjet e sigurisë së AI-së avangardë. Asnjë palë e tretë e vetme nuk mund dhe as nuk duhet t’i mbulojë në mënyrë gjithëpërfshirëse çështjet urgjente të sigurisë së AI-së avangardë. Do të veprojmë me kujdes dhe qëllim për të rritur kapacitetin tonë dhe për t’i mundësuar ekosistemit në zhvillim të palëve të treta të bashkërendohet rreth praktikave dhe parimeve më të mira. Po diskutojmë me disa palë të treta rreth propozimeve që përputhen me fushat prioritare të mësipërme.