Ка образложењима безбедности обуке граничних модела ВИ
Верујемо да улазимо у ново доба у ком би структурисана безбедносна документација требало да буде обавезна пре наставка било ког циклуса обуке граничних модела подстицајним учењем. У идеалном случају, таква документација достигла би ниво „образложења безбедности“ — свеобухватних, структурисаних аргумената о ризику заснованих на доказима, какви се користе у другим секторима у којима је безбедност од пресудног значаја. Образложења безбедности видимо као циљ којем тежимо и који усмерава наш рад. Истовремено, увиђамо колико је тешко учинити их подједнако ригорозним за моделе ВИ као за ваздухопловство или нуклеарну енергетику, због нове сложености која се јавља на сваком следећем нивоу способности ВИ. Радимо на оквиру којим ћемо формализовати ове праксе.
У наставку су почетне смернице које би, по нашем мишљењу, требало да буду део таквих образложења безбедности за обуку граничних модела ВИ. Ове најбоље праксе одражавају наша тренутна сазнања и очекујемо да ће се развијати док настављамо да унапређујемо интерне процесе за пажљив развој. Објављујемо их сада како бисмо отворено представили своја тренутна размишљања и позвали заједницу да нам упути повратне информације. Напомињемо да је овај документ усмерен на обуку граничних модела подстицајним учењем; интерна и екстерна примена захтевају разматрање много ширег скупа својстава усклађености.
Образложења безбедности треба да обухвате три аспекта техничког система: обуку за усклађеност, изолацију и надзор. Ове мере заштите помажу да модел не покуша да предузме неусклађене радње, а чак и ако то покуша, да тешко може да пробије изолацију и да надзор то открије пре него што настане штета.
Усклађеност модела: Прва линија одбране треба да буде обука модела за усклађеност, односно да поуздано поступају онако како намеравамо. То би могло да обухвати следеће:
Окружења за обуку и оцењивање: Смањити ризик да модели развију неусклађено понашање тако што ће се током обуке спречити позитивно поткрепљивање злоупотреба система награђивања. То би могло да обухвати следеће:
Аутоматизоване провере скупова података: Користити агенте за проналажење и исправљање неисправних окружења за подстицајно учење у којима би неусклађени низови радњи могли да добију високу награду искоришћавањем пропуста, уместо предвиђеним понашањем. Тиме се смањују могућности да се неусклађеност поткрепљује током обуке.
Ручне провере скупова података: Допунити аутоматизоване провере црвене команде ручним прегледом и контролом квалитета скупова података, како би се открили неисправни задаци који би могли ненамерно да поткрепе неусклађено понашање.
Подешавање оцењивача: Подесити оцењиваче тако да кажњавају покушаје модела да током обуке искористе пропусте или хакују окружења за подстицајно учење.
Анализа претходних циклуса: Применити класификаторе на записе из претходних експеримената како би се проверило да ли оцењивачи раде како је предвиђено.
Мерење усклађености: Спроводити процене које прате склоност модела ка неусклађености, како би се измерила делотворност обуке за усклађеност. То би могло да обухвати следеће:
Засебне процене усклађености: Током циклуса обуке граничних модела спроводити процене усклађености како би се утврдило да ли обука даје предвиђене резултате и истражити сва значајна погоршања.
Ретроспективно тестирање: Тестирати процене усклађености на претходним инцидентима да би се потврдило да откривају раније неусклађене моделе и да нису претерано прилагођене појединачним инцидентима.
Праћење манипулисања проценама: Пратити свест о процени или метаигру (када модели препознају да се тестирају) која би могла да изазове промену понашања, уз конкретне прагове за блокирање. На пример, током процена усклађености укључити надзор свести о процени и метаигре.
Стрес-тестови најгорих сценарија: Изазвати најгоре облике непожељног понашања и проверити да ли би бар једна процена открила такво понашање.
Спречавање обуке на основу начина резоновања: Не дозволити аутоматизованим оцењивачима да виде начин резоновања током подстицајног учења, како модели не би развили способност избегавања система за надзор начина резоновања.
Изолација: Обезбедити довољно снажну изолацију окружења и безбедносну заштиту да спрече штетне радње у случају да модел постане неусклађен. То би могло да обухвати следеће:
Више слојева инфраструктурне безбедности: Значајно улагати у јачање заштите и изолованог окружења у ком модел ради и истраживачке инфраструктуре на којој је то окружење смештено. Тиме се обезбеђује додатни слој заштите у случају пробоја из изолованог окружења.
Провере изолације помоћу црвене команде: Унапређивати безбедност изолованог окружења, истраживачке инфраструктуре и спољних граница система кроз поновљене провере црвене команде. Уз претходну анализу безбедности, користити сачувана међустања модела из циклуса обуке граничних модела како би се пронашли и отклонили сви пропусти. Проверама црвене команде обухватити и све услуге којима би модел могао да приступи током обуке (нпр. интернет кеш).
Комуникација између узорака: Комуникацију великог протока између узорака ограничити на одобрене канале, као што су алати за више агената, и затворити споредне инфраструктурне канале који имају велики проток и које агенти лако могу да открију.
Непроменљиви транскрипти: Транскрипте агената из свих процеса подстицајног учења, процене и интерне примене чувати у непроменљивом облику током разумног периода (на пример, на налозима за складиштење који дозвољавају само једнократни упис). Тиме се омогућава поуздано истраживање инцидената и спречавају ненамерне измене.
Надзор: Обезбедити систем надзора у реалном времену који ће, ако модели почну да предузимају неусклађене радње, открити сваку потенцијалну неусклађеност и омогућити брзо решавање приоритетних проблема пре него што дође до озбиљног инцидента. То би могло да обухвати следеће:
Обезбеђивање могућности надзора: Осигурати да модели и даље могу да се надзиру, што се мери проценама могућности надзора и његовог избегавања, уз јасне прагове, како би се забрињавајуће понашање рано открило.
Висока стопа откривања познатих проблема: Осигурати да систем надзора открива висок удео ранијих инцидената у процени на издвојеним подацима.
Ажурност процена система надзора: Креирати примере за процену који представљају потпуно нове ризике у новим циклусима, како мере стопе откривања и прецизности надзора не би застареле.
Брзо реаговање: Увести приоритетна упозорења која покрећу реакцију у року утврђеном споразумом о нивоу услуге, било хитним обавештавањем дежурне особе или аутоматским паузирањем погођеног циклуса, пре него што модел проузрокује штету. На пример, током дана о инцидентима хитно обавештавати дежурну особу за безбедност и особу одговорну за циклус, а ноћу аутоматски паузирати циклусе ако нико не потврди пријем упозорења.
Поред препорука о техничким мерама заштите, радимо и на најбољим оперативним праксама за образложења безбедности циклуса обуке граничних модела ВИ. Оне би могле да обухвате следеће:
Издвојена мишљења (анализе могућих неуспеха): Након израде нацрта образложења безбедности, члан другог тима треба да напише издвојено мишљење како би указао на могуће пропусте и изнео одмерену процену ризика. Тим за обуку затим треба да одговори на те примедбе како би се образложење безбедности ојачало.
Одобрења: Образложење безбедности треба да прегледају чланови вишег руководства, од којих свако треба да има право да стави вето на циклус обуке. Тиме се обезбеђује више интерних провера циклуса (нпр. провера руководиоца истраживачке организације или потпредседника за истраживање, руководиоца за безбедност и главног научника).
Одговорност: Виши руководилац задужен за циклус обуке (нпр. руководилац истраживачке организације или потпредседник за истраживање) треба да сноси одговорност за образложење безбедности и реаговање на сваки инцидент, укључујући и кроз оцену радног учинка. Тако се и тимови за обуку подстичу да се залажу за безбедност и усклађеност.
Паузирање: Ако се открију проблеми који би поништили ваљаност образложења безбедности (нпр. нови безбедносни проблем), треба обезбедити оперативна упутства, техничке контроле и споразуме о нивоу услуге за паузирање свих обухваћених циклуса.
Интерна транспарентност: Образложења безбедности треба да буду доступна интерним надзорним телима (нпр. Одбору за безбедност и сигурност).
Ревизије: Ревизорима треба омогућити довољан приступ да провере ваљаност и утемељеност тврдњи из образложења безбедности и пријаве евентуалне пропусте.
Ескалације: Треба да постоји јасан поступак за прослеђивање проблема неусклађености вишим нивоима одговорности, са табелом дефинисаних нивоа озбиљности и дежурном особом за неусклађеност која може да хитно обавести руководиоце (нпр. генералног директора) када циклус достигне одређени ниво озбиљности.
Техничке контроле: Људима и агентима треба отежати покретање циклуса који нису у складу са захтевима. Безбедносне функције, попут надзора и аутоматског паузирања, у случају отказа треба да блокирају рад (нпр. не сме бити могуће покренути циклус без укљученог одговарајућег надзора, нити искључити надзор из самог процеса подстицајног учења, процене или интерне примене).
Могућност враћања на претходно стање: Треба да буде лако утврдити све накнадне употребе неусклађеног модела у процесу обуке (на пример, за генерисање података или оцењивање), како би се по потреби поништили ефекти неусклађених излаза.
Потпуност пописа преосталих ризика: Образложења безбедности треба да садрже што потпунији списак преосталих ризика који нису обухваћени тренутно примењеним мерама ублажавања, како би се омогућило информисано одлучивање о прихватању ризика.
Ово су наше тренутне препоруке, чије је увођење у OpenAI у току. Очекујемо да ће се наше праксе даље развијати током наредних недеља.
Развијамо и најбоље праксе за истраживање озбиљних инцидената неусклађености ВИ. Лабораторије треба да настоје да што више науче из појединачних инцидената (по узору на истражне праксе(отвара се у новом прозору) у другим секторима у којима су последице грешака озбиљне), како би спречиле њихово понављање. Такве мере би могле да обухвате:
Интерна транспарентност: Пошто истрага може дуго да траје, о њеном току треба периодично извештавати унутар организације (нпр. свакодневно за истраге које су у току). Запослени треба да имају јасно дефинисане начине да добију шири приступ, укључујући необрађене транскрипте и узорковање излаза неусклађених модела, ако је то безбедно и релевантно за њихов рад.
Основни узрок неусклађености: Истраживачи треба да утврде основне узроке у динамици обуке (нпр. циљаним искључивањем компоненти или експериментима са поновним узорковањем), како би разумели како су настала неусклађена понашања. То би допринело бољем научном разумевању неусклађености и њеном успешнијем спречавању у будућности.
Анализа након инцидента: Треба спровести анализу оперативних поступака и организационе културе како би се разумели сви узроци који су допринели инциденту, укључујући то зашто су проблеми настали и зашто пре инцидента нису откривени или прослеђени вишим нивоима одговорности.
Откривање: Треба да развијамо методе тестирања усклађености које могу да открију склоност ка изазивању инцидента, а да се притом не оптимизују директно на основу информација из тог инцидента (нпр. транскрипата или сажетака инцидента). Процене изведене из инцидената треба креирати као „регресионе тестове“, како би се осигурало да будући модели не показују склоност ка неусклађености у веома сличним инцидентима.
Јавно објављивање: Резултате истраге, анализе након инцидента и оперативне промене треба поделити са јавношћу по завршетку истраге. Погођене треће стране треба обавестити што пре.


