Пређите на главни садржај
OpenAI

22. септембар 2026.

Безбедност

Приоритети и начела делотворних процена трећих страна

Учитавање…

Лабораторије за граничну вештачку интелигенцију имају огромну одговорност да безбедно обучавају и оцењују моделе и пуштају их у употребу. Процене трећих страна кључне су за уравнотежено испуњавање те одговорности: пружају више могућности за допринос безбедности вештачке интелигенције, обавештавају јавност и обезбеђују одговорност лабораторија према јасним и независно поткрепљеним тврдњама о безбедности.

У оквиру настојања да развој граничне вештачке интелигенције прати одговарајућа заштита, OpenAI је посвећен подршци независним проценама кроз темељан приступ процесима обуке, евалуације и примене. Тај приступ треба да омогући процењивачима да преиспитају наше претпоставке, утврде ризике које смо можда превидели и самостално закључе колико су наше заштитне мере делотворне.

Већ дуго сарађујемо са процењивачима трећих страна у различитим фазама развоја и примене модела. Процене трећих страна уврстили смо и у праксе у оквиру нашег Оквира спремности, а подржали смо организације и законодавство који се залажу за строжи и одговорнији поступак. Током ових ангажмана пружали смо темељан приступ, укључујући информације о нашим техничким заштитним мерама, увид у начин резоновања и досад незабележен ниво приступа поверљивим подацима и интерним применама ради реаговања на инциденте и надзорног тестирања црвене команде. Овде представљени приоритети и начела усредсређени су на нашу сарадњу са независним организацијама из приватног и непрофитног сектора које спроводе техничке процене безбедности. Они допуњују наш рад са владама на тестирању и евалуацији, где различите улоге и одговорности могу захтевати другачије приступе.

За делотворност ових процена неопходни су снажни механизми независности, научна строгост, робусне безбедносне праксе и јасне одговорности. Лабораторије су дужне да омогуће сврсисходно преиспитивање, уз заштиту осетљивих информација. Лабораторије и независни процењивачи деле одговорност да овај поступак буде исправно спроведен и треба да раде у складу са заједничким међународним стандардима безбедносних и заштитних пракси. У наставку предлажемо четири приоритетне области за темељнију процену, уз начела строгог, безбедног и независног рада.

Приоритетне области за процену

Процене трећих страна најкорисније су када се баве конкретним и значајним питањима: да ли докази поткрепљују образложење безбедности и тврдње о безбедности лабораторије? Да ли се евалуацијама адекватно испитују ризици које треба да мере? Да ли заштитне мере функционишу у реалним условима?

Овде описане процене треба да имају различите облике, зависно од питања безбедности која се испитују. Очекујемо да истовремено подржавамо више процена различитог трајања — неке ће трајати недељама, а друге по неколико месеци. Иако процене трећих страна могу бити део рада пре примене и утицати на одлуке о њој, овде описани рад је углавном дугорочнији и независан од конкретног лансирања — усредсређен је на темељно испитивање одређених тврдњи о безбедности током времена.

У свим приоритетним областима и начелима помињемо тврдње о безбедности и образложења безбедности. Под тим појмовима подразумевамо следеће:

Тврдња о безбедности: Конкретна тврдња о способностима, понашању или заштитним мерама модела или система која је значајна за његову безбедност и може се оценити на основу доказа. Тврдња треба да наведе ризике и услове на које се односи, као и релевантне претпоставке и ограничења.

Образложење безбедности: Структурисан аргумент поткрепљен доказима који објашњава зашто се ризицима модела или система адекватно управља у оквиру одређене активности, као што су обука, евалуација или примена. Образложење безбедности повезује појединачне тврдње о безбедности са доказима који их поткрепљују и јасно наводи претпоставке, неизвесности и преостале ризике који би могли да утичу на закључке.

Предлажемо четири приоритетне области за темељнију процену, уз начела строгог, безбедног и независног рада.

  1. Независна процена образложења безбедности која обухвата обуку, евалуацију, интерну и спољну примену.

    За процену образложења безбедности потребна је стручност у областима усклађивања, метода контроле попут надзора, сајбер-безбедности, биолошке и хемијске злоупотребе и тестирања црвене команде. Образложења безбедности састоје се од тврдњи које обухватају обуку, евалуације способности и заштитне мере, а могу се оцењивати у целини или по деловима (видети приоритете 2 и 3 у наставку). Вероватно ће бити потребно да више процењивача испита различите делове образложења, ослањајући се на своје области стручности. Њихове процене заједно треба да одговоре на питања као што су:

    1. Да ли су поткрепљени докази за образложења безбедности обуке, евалуације и примене? Да ли су током обуке, евалуације и примене поштовани услови из образложења безбедности?

    2. Да ли наша образложења безбедности обухватају најхитније ризике утврђене током процене? Да ли тврдње о безбедности поткрепљују целокупно образложење безбедности? Постоје ли недостаци или области које треба побољшати?

    3. Да ли се користе делотворне методе за препознавање и смањење подстицаја у обуци који би могли да награде обману, манипулисање награђивањем, деструктивне радње или заобилажење ограничења?

  2. Процена кључних заштитних мера у интерној и спољној примени

    Наш скуп заштитних мера непрестано се развија како би пратио промене способности и окружења. Наше заштитне мере обухватају обуку, интерну и спољну примену. Тренутно обухватају заштитне мере на нивоу модела, мере за спровођење правила и безбедносне мере, као и надзор неусклађености — чиме покривају разноврсне ризике, попут губитка контроле и злоупотребе у сајбер, биолошком и хемијском домену. Техничка партнерства већ сада могу да утврде слабости заштитних мера, унапреде методе процене и убрзају развој стандарда, чиме се ствара снажнија техничка основа за будуће јавне политике које прате развој граничне вештачке интелигенције — нарочито у интерној примени, где су стандарди безбедности и заштите још у зачетку.

    Независне процене треба да испитају колико добро ове заштитне мере функционишу и где могу бити недовољне, на пример:

    1. Када се користи приступ „сиве кутије“, да ли су заштитне мере отпорне на супарничко тестирање (заобилажење безбедносних мера) и да ли довољно спречавају повећање способности у високоризичним доменима (нпр. сајбер и биолошком)? Да ли наше супарничко тестирање и тестирање црвене команде обухватају најважније ризике?

    2. Како агенти, током овлашћеног тестирања у реалним радним условима, ступају у интеракцију са сајбер-одбранама као што су контроле приступа, изолована окружења и системи за откривање претњи и реаговање? Које одбране спречавају, откривају или ограничавају штетне радње и где не успевају?

    3. Да ли наши системи за надзор неусклађености имају критичне недостатке који би могли довести до губитка контроле или тешке неусклађености, како у интерној тако и у спољној примени? Колико је надзор начина резоновања поуздан као извор доказа о безбедности или усклађености док способности модела напредују?

    4. Да ли је у свим релевантним обукама, евалуацијама и применама успостављен одговарајући надзор који се не може лако онемогућити?

    5. Да ли су примењене заштитне мере сразмерне способностима?

  3. Процена евалуација способности које обухватају категорије ризика из Оквира спремности (хемијске и биолошке ризике, сајбер-безбедност и самопобољшавање вештачке интелигенције), као и евалуација усклађености за ризике неусклађености

    Наш Оквир спремности захтева евалуације кључних области граничног ризика. Како се прагови премашују, а евалуације достижу границе корисности, важно је редовно освежавати евалуације способности у областима ризика из Оквира спремности и обезбеђивати њихов обухват и квалитет, као и евалуације усклађености којима се процењују ризици тешке неусклађености.

    Релевантна питања обухватају:

    1. Да ли евалуације ризика из Оквира спремности адекватно обухватају дефиницију прага ризика из тог оквира? Да ли су прагови за ове евалуације правилно постављени?

    2. Да ли се евалуације ажурирају када модели доследно постижу највише резултате и да ли нови тестови заиста мере напредније способности?

    3. Да ли наше евалуације усклађености адекватно обухватају ризике тешке неусклађености и која би важна понашања или услове могле да превиде?

  4. Независна истрага критичних инцидената неусклађености

    Независна истрага може бити корисна код различитих критичних инцидената у области безбедности вештачке интелигенције. Овде се усредсређујемо на неусклађеност модела, укључујући неовлашћено деловање модела или избегавање надзора, што може открити слабости метода усклађивања и заштитних мера чак и када нема намерне злоупотребе.

    У одређеним околностима, као код инцидента OpenAI Hugging Face, може бити корисно ангажовати независну трећу страну ради независне истраге инцидента неусклађености. Од пресудног је значаја да треће стране које учествују у истрази инцидента имају потребну стручност, укључујући, где је применљиво, стручност у сајбер-форензици и усклађивању, анализи начина резоновања великих размера, као и особље и ресурсе за благовремено спровођење истраге. Реаговање на инцидент може подразумевати приступ осетљивим интерним подацима и подацима трећих страна, па неки детаљи могу бити сувише осетљиви за објављивање или приступ. Налази независних истрага могу допринети и образложењу безбедности модела тако што пружају доказе за оцену тврдњи о његовој усклађености и делотворности мера предузетих ради отклањања раније уочене неусклађености.

    У контексту инцидената неусклађености, приоритет дајемо независним проценама следећег:

    1. До каквог је понашања модела или проблема са неусклађеношћу дошло током инцидента и који су главни фактори томе допринели?

    2. Да ли би заштитне и корективне мере делотворно ублажиле сличне инциденте у будућности?

Начела делотворних процена

  • Јасно утврђен обухват и усаглашене тврдње за процену: Процене треба да почну заједничким договором о обухвату, након чега следи јасно дефинисање тврдњи о безбедности које се региструју пре почетка процене. Треће стране и лабораторије треба да разјасне да ли је реч о тврдњама које компанија обухваћена проценом жели да поднесе на оцену или о тврдњама које независно оцењује процењивач треће стране, а лабораторија пристаје да буде оцењена према њима. Неке тврдње могу бити изван обухвата из више разлога, укључујући немогућност трећих страна да приступе подацима, недовољну стручност процењивача или оправдана временска ограничења када је процена хитна. Лабораторије и процењивачи треба да успоставе поступак за разматрање значајних ризика утврђених изван првобитног обухвата, укључујући одлуку о томе да ли је потребна даља истрага. У закључцима треба јасно навести шта јесте, а шта није оцењено у оквиру заједнички договореног обухвата.

  • Сразмеран приступ: Процењивачи треба, где год је могуће, да имају приступ сразмеран потребама процене договорених тврдњи, у границама правних, безбедносних и ограничења интелектуалне својине. Када непосредан приступ није практичан или могућ, процењивачи могу да сарађују са овлашћеним представником компаније или да размотре посредне механизме приступа, односно механизме који чувају приватност, како би заштитили основне информације.

  • Транспарентна методологија и стандарди: Процењивачи треба да објасне своје методе, критеријуме процене и неизвесности, ослањајући се на установљене стандарде тамо где постоје. Тамо где стандарди још не постоје, треба јасно образложити коришћене критеријуме. Извештаји треба да раздвоје непосредне налазе од тумачења, објасне неизвесност и јасно наведу које закључке докази поткрепљују.

  • Стручност и независност: Процењивачи треба да покажу одговарајућу техничку стручност и да утврде, обелодане и реше организационе и личне сукобе интереса, укључујући финансијске подстицаје, односе са програмерима и претходно учешће у раду који се оцењује. Заштитне мере треба осмислити тако да комерцијални притисци и начини накнаде не утичу на налазе, а могу обухватити изузеће из поступка или одговарајуће периоде забране учешћа.

  • Безбедност и поверљивост: Процењивачи треба да покажу да примењују праксе информационе безбедности и правно спроводиве мере заштите поверљивости које обухватају њихово особље и сразмерне су осетљивости система и информација којима приступају. Ове мере треба да обухвате интелектуалну својину, осетљиве информације и евиденцију о процени. Када процењивачи не могу да испуне безбедносне захтеве у сопственим окружењима или су подаци којима приступају нарочито осетљиви, може бити примерен приступ преко уређаја или у просторијама којима управља компанија.

  • Примењиви налази и рок за отклањање недостатака: Процене треба да утврде конкретне недостатке и пруже довољно појединости да би лабораторије могле да их отклоне. Када је то примерено, лабораторије треба да добију разуман рок за отклањање проблема пре објављивања. Када је релевантно, извештаји треба да објасне и поуке за програмере, оператере и заштитнике агената, уз практичне препоруке за примену.

  • Одговорна пракса објављивања: Извештаји о процени треба да буду засновани на доказима и што отвореније доступни, уз заштиту осетљивих и поверљивих информација. Када потпуно јавно обелодањивање није могуће, поверљиво извештавање одговарајућих надзорних тела, као што су управљачка тела или управни одбори компанија, може да допринесе одговорности. Треба успоставити начелне мере и правила за редакцију осетљивих података, као и јасна очекивања у погледу повратних информација и исправљања нетачности, како би се очувала равнотежа између независности и поверљивости. Процењивачи треба да очувају уређивачку независност, истовремено обезбеђујући поверљивост и заштиту интелектуалне својине. Процењивачи треба да усвоје јасна правила редакције која лабораторијама омогућавају да затраже изостављање осетљивих информација, док процењивачи могу да наведу где су извршена значајна изостављања и како она утичу на извештај о процени.

Даљи пут

Посвећени смо подршци независним процењивачима и успостављању јаснијих, заједничких међународних стандарда за делотворне процене трећих страна — како кроз будуће законе, тако и кроз приватне управљачке институције. Иако се екосистем независних евалуација још развија, помагаћемо његов развој подршком разноврсној заједници независних процењивача са дубоком стручношћу у питањима безбедности граничне вештачке интелигенције и сарадњом с њима. Ниједна трећа страна не може нити треба сама да свеобухватно обради хитна питања безбедности граничне вештачке интелигенције. Поступаћемо промишљено и сврсисходно како бисмо развили сопствене капацитете и омогућили растућем екосистему трећих страна да се усагласи о најбољим праксама и начелима. Са више трећих страна разговарамо о предлозима који су усклађени са наведеним приоритетним областима.