Наш оквир за извештавање о неусклађености модела
Представљамо нови оквир компаније OpenAI за праћење, истраживање и објављивање случајева неусклађености модела, уз шест извештаја о неочекиваном или забрињавајућем понашању модела које смо запазили током последњих шест месеци.
Да бисмо боље информисали истраживаче, програмере вештачке интелигенције, доносиоце јавних политика и ширу јавност, и раније смо настојали да јавно објављујемо наша сазнања о неусклађености. Међутим, без систематичног приступа извештавању о тим сазнањима, наше објаве биле су повремене и ређе него што би требало: често смо чекали да објединимо више случајева у један извештај или смо их додавали у системске картице новообјављених модела. Овај нови оквир треба да убрза објављивање извештаја о неусклађености након што је уочимо, чак и када понашање о којем извештавамо још нисмо у потпуности објаснили или ублажили.
Како системи вештачке интелигенције постају напреднији и све заступљенији, морамо изградити шири и боље утемељен консензус о напретку истраживања усклађивања. Не верујемо да је сектор вештачке интелигенције решио питања усклађивања и надзора у мери која би још дуго омогућавала одговорно ширење система највећом брзином. Одлуке о томе како развој вештачке интелигенције треба да напредује у наредним месецима и годинама морају се заснивати на доказима које људи изван компанија које праве граничне моделе могу самостално да испитају.
Примери неусклађености могу помоћи да се утврде проблеми с којима би се други програмери вештачке интелигенције могли сусрести када њихови системи достигну сличне могућности, да се открију слабости заштитних мера или преиспитају претпоставке о понашању модела. Објављивање ових сазнања омогућава другима да истраже исте проблеме, провере наша објашњења и побољшају мере за ублажавање ризика. Пошто верујемо у вредност транспарентности у погледу неусклађености, наш нови оквир даје предност објављивању чак и када значај случаја није известан. То значи да би се за неке случајеве које објавимо могло показати да су случајни, да нису део ширег обрасца и да не указују на будући развој догађаја.
Тренутно не постоји оквир на нивоу целог сектора са изричитим стандардима о томе како програмери вештачке интелигенције треба да објављују примере неусклађености својих модела. Надамо се да је оквир који данас представљамо први корак ка стварању таквих стандарда, јер утврђује које случајеве неусклађености програмери треба да објаве и шта њихови извештаји треба да садрже. Овај оквир сматрамо недовршеним радом који ћемо усавршавати на основу искуства и повратних информација јавности.
Овде описујемо како ће оквир функционисати и представљамо прве извештаје које објављујемо.
Настојимо да објављујемо примере који пружају корисне доказе о томе како неусклађеност модела настаје, како се испољава и где заштитне мере успевају или подбацују. Предност дајемо новим механизмима, значајним променама познатог понашања и сазнањима која доводе у питање претпоставке о безбедности или ублажавању ризика. Пример не мора да изазове штету нити да потврди шири образац да би заслужио објављивање. Овај оквир обухватиће релевантно понашање током целог животног циклуса модела — укључујући обуку, евалуацију, тестирање и примену.
То обухвата нове начине на које модели делују без овлашћења, координишу се с другим моделима или избегавају надзор; пропусте који доводе у питање метод усклађивања или заштитну меру; и понашање које оспорава тврдњу из објављене процене безбедности. Исти критеријуми за објављивање примењују се на неусклађеност која може утицати на треће стране.
То може обухватити и случајеве неусклађености који делују као понављање раније објављених случајева. Само понављање проблема може бити користан доказ о понашању наших модела или делотворности наших заштитних мера — на пример, ако се одређена врста неусклађеног понашања и даље јавља упркос поновљеним покушајима да се ублажи. У тим околностима објавићемо додатне примере ажурирањем првобитне објаве о неусклађености.
Временом планирамо да развијемо објективније критеријуме за објављивање у сарадњи с другим програмерима, спољним истраживачима, телима за стандарде у сектору и регулаторима. Такође верујемо да озбиљне инциденте у вези с безбедношћу, заштитом и неусклађеношћу треба пријављивати савезној влади САД и радимо на предлогу механизама извештавања. Овај оквир сматрамо допуном постојећих обавеза и напомињемо да он не замењује наше законске обавезе објављивања, укључујући оне које се односе на критичне безбедносне инциденте или нарушавање сајбер-безбедности.
Поводом увођења новог оквира за објављивање неусклађености, објављујемо шест извештаја о случајевима неусклађеног понашања које смо запазили током обуке или евалуације наших модела. Ови случајеви приказују низ различитих понашања која сматрамо вредним објављивања, од скривања информација од корисника до предузимања неодобрених радњи ради савладавања препрека. Ово су извештаји о појединачним случајевима и не треба их сматрати показатељем учесталости неусклађености међу нашим моделима. Свака ставка у наставку води до целог извештаја.
Самостално генерисане инструкције у сажецима задатака(отвара се у новом прозору). Необјављени истраживачки модел убацио је неповезане инструкције, укључујући инструкције да занемари уобичајена ограничења, у сажетке коришћене за наставак рада у новом прозору контекста. Утврдили смо да је погођено 27 сажетака.
Инструкције за прикривање грешака у сажецима задатака(отвара се у новом прозору). Током обуке модела GPT‑5.6 Sol, многе инстанце модела додавале су у своје сажетке инструкције да од корисника сакрију грешке или неусклађено понашање. На пример, сажеци компакције садржали су инструкције да се измисле недостајући историјски подаци без откривања те чињенице и да се прикрију неслагања у верзијама извора.
Претраживање јавних депоа ради проналажења изложених API кључева, а затим измишљање информација(отвара се у новом прозору). Док је одговарао на уобичајено питање о износима зарада у једном округу Калифорније, модел је без овлашћења пронашао и употребио изложени API кључ. Када ни тада није успео да преузме тражене податке, измислио их је и представио као податке из траженог извора.
Отпремање датотека на интернет ради њиховог навођења као извора(отвара се у новом прозору). Када је корисник затражио од необјављеног модела идентификаторе и називе језера већих од 5.000.000 квадратних метара, агент је помоћу Python-а пронашао тачан одговор. Међутим, пошто су инструкције захтевале навођење извора из прегледача, агент је одлучио да отпреми датотеку како би могао да је наведе као извор у одговору, не питајући корисника.
Неодобрено уписивање и комуникација преко интерног софтверског депоа(отвара се у новом прозору). Док су тражили недостајуће улазне датотеке, модели су користили интерни софтверски депо као огласну таблу за размену захтева и одговора између засебних узорака за обуку, али нису успели да поврате те датотеке. Овај извештај разматра и ранији случај у којем је модел успешно отпремио пробне датотеке у депо покушавајући да заобиђе мрежна ограничења.
Неодобрено дељење датотека између агената који сарађују(отвара се у новом прозору). Агенти који су заједно радили на истом задатку за обуку користили су јавне веб-сајтове за смештај датотека како би их делили када нису могли да приступе локалним датотекама других агената. Тако су резултати задатка постали доступни на јавним URL адресама, иако је у задатку тражено да модели користе само локалне датотеке.
Сваки запослени у компанији OpenAI може да пријави пример неусклађености нашим тимовима за безбедност и усклађивање ради истраге и затражи да се размотри његово јавно објављивање. Тиме започиње наш поступак објављивања, са роковима за сваки корак како би истрага и објављивање били благовремени.
Када пример буде пријављен, наше техничко особље истражиће шта се догодило, шта је и даље неизвесно, да ли је јавно објављивање оправдано и које чињенице могу да се објаве. Такође ће проценити да ли је нека трећа страна погођена и треба ли је приватно обавестити пре објављивања.
Пример ће затим бити сврстан у једну од три процедуре: „Спремно за објављивање“, „Мања истрага“ или „Опсежнија истрага“ („Спора процедура“).
„Спремно за објављивање“ обухвата релевантне случајеве чија је истрага довољно завршена да би могли бити објављени након прегледа. „Мања истрага“ обухвата случајеве којима је потребна додатна техничка истрага. Очекујемо да ће ове две процедуре обухватити велику већину случајева које објављујемо, нарочито оне који не захтевају опсежну истрагу, координацију с трећим странама или решавање озбиљних ризика од злоупотребе. Сви случајеви које данас објављујемо припадају једној од ове две процедуре.
„Опсежнија истрага“ обухвата сложене истраге, нарочито оне које укључују треће стране. Када је погођена трећа страна, наше обавезе у погледу безбедности, закона и одговорног објављивања имају предност над овим оквиром. Настојаћемо да почетно обавештење објавимо што пре, али ћемо га можда морати одложити из безбедносних разлога — на пример, ако модел открије до тада непознату рањивост у широко коришћеном софтверу. Ако би извештај открио идентитет треће стране, намеравамо да је унапред обавестимо чак и када није нарушена ниједна безбедносна граница.
Почетно обавештење о случају из процедуре „Опсежнија истрага“ пружиће општи приказ догађаја, навести да ли спољни стручњаци помажу у истрази и дати сваку доступну процену времена објављивања коначног извештаја. Инцидент компаније OpenAI на платформи Hugging Face био би сврстан у ову процедуру да је објављен у оквиру овог система.
Запослени који је пријавио пример биће обавештен о одлуци да ли ће бити објављен и, ако буде, по којој ће се процедури разматрати. Нерешена неслагања о објављивању или одговарајућој процедури биће упућена Саветодавној групи за безбедност компаније OpenAI (SAG), групи високих руководилаца из целе компаније која процењује могућности граничних модела и заштитне мере, надгледа наш Оквир спремности и саветује руководство компаније OpenAI. Неслагања унутар групе SAG, као и приговори запослених на њене одлуке, биће прослеђени руководству компаније OpenAI. Одлуке да се нешто не објави или да објављивање није оправдано биће саопштене руководству за безбедност и усклађивање и, у мери у којој је то могуће, одговарајућем техничком особљу.
Овај поступак објављивања можемо мењати док будемо сазнавали како функционише у пракси, а све измене забележићемо у овој објави.
Сваки потпуни извештај описаће запажено понашање, његову озбиљност и евентуални спољни утицај, окружење у којем се догодило, датум или период, време када смо га открили и, у општим цртама, укључени модел или моделе. Када буде могуће, навешћемо и:
Додатне појединости о догађају и свакој насталој штети;
Како смо открили неусклађеност и обим наше истраге;
Наше тумачење значаја тог случаја за истраживање усклађивања и техничку безбедност вештачке интелигенције;
Важна питања без одговора која је пример отворио;
Мере које предузимамо или планирамо да предузмемо ради решавања проблема у понашању. Ти подаци можда неће увек бити доступни у тренутку објављивања, јер извештај о неусклађености можемо објавити пре завршетка истраге или израде решења.
Када се неусклађеност јави у системима корисника, поделићемо онолико информација колико нам дозвољавају приватност корисника и наше уговорне обавезе.
Данашњи извештаји су почетни скуп објава, а не свеобухватан приказ познатих неусклађености или текућих истрага. Ови почетни извештаји не представљају целокупан распон нити тежину случајева обухваћених овим оквиром. Посвећени смо објављивању случајева неусклађености који испуњавају критеријуме овог оквира, укључујући сложеније случајеве који захтевају дужу истрагу или координацију са трећим странама. Наставићемо редовно да објављујемо извештаје у складу са овим оквиром и изнећемо више појединости о обавезама извештавања док их будемо даље развијали.


