Кон аргументации за безбедноста при обука на гранична ВИ
Веруваме дека влегуваме во нова ера во која треба да се бара структурирана безбедносна документација пред да продолжи кој било циклус на обука на гранични модели со зајакнување на учењето. Во идеален случај, таквата документација би го достигнала нивото на „аргументации за безбедноста“ — сеопфатни, структурирани аргументи за ризикот засновани на докази, какви што се користат во други индустрии каде што безбедноста е од пресудно значење. Аргументациите за безбедноста ги сметаме за долгорочна цел кон која се стремиме. Притоа ги препознаваме тешкотиите да се постигне истата строгост за моделите на ВИ како во воздухопловството или нуклеарната енергетика, поради новата сложеност што се јавува на секое следно ниво на способностите на ВИ. Работиме на рамка што ќе ги формализира овие практики.
Подолу се дадени почетни насоки кои, според нас, треба да бидат дел од ваквите аргументации за безбедноста при обуката на гранична ВИ. Овие најдобри практики ги одразуваат нашите досегашни сознанија и очекуваме да се развиваат додека продолжуваме да ги усовршуваме внатрешните процеси за внимателен развој. Ги споделуваме сега за транспарентно да ги претставиме нашите тековни размислувања и да ја поканиме заедницата да даде повратни информации. Имајте предвид дека овој документ е насочен кон обуката на гранични модели со зајакнување на учењето; внатрешната и надворешната примена бараат разгледување многу поширок опсег на својства на усогласеноста.
Аргументациите за безбедноста треба да опфатат три аспекти на техничкиот систем: обука за усогласеност, изолирање и следење. Овие заштитни мерки помагаат да се осигуриме дека моделот нема да се обиде да преземе неусогласени дејства, а дури и да се обиде, дека тешко ќе ја пробие изолацијата и дека следењето ќе го открие тоа пред да настане штета.
Усогласеност на моделот: Првата линија на одбрана треба да биде обука на моделите за усогласеност, односно за доследно постапување според нашите намери. Ова би можело да опфати:
Средини за обука и оценување: Намалете го ризикот моделите да развијат неусогласено однесување така што ќе спречите позитивно поткрепување на злоупотребите на системот за наградување при обуката. Ова би можело да опфати:
Автоматизирани проверки на податочните збирки: Користете агенти за да откриваат и поправаат неисправни RL-средини во кои неусогласени траектории би можеле да добијат висока награда со искористување пропусти наместо со предвиденото однесување. Така се намалуваат можностите за поткрепување на неусогласеноста при обуката.
Рачни проверки на податочните збирки: Дополнете го автоматизираното тестирање на отпорноста со рачен преглед и проверки на квалитетот на податочните збирки, за да откриете задачи со пропусти што би можеле ненамерно да поткрепуваат неусогласено однесување.
Приспособување на оценувачите: Приспособете ги оценувачите да ги казнуваат обидите на моделот да искористува пропусти или да ги хакира RL-средините при обуката.
Анализа на претходни циклуси на обука: Применете класификатори врз записите од претходни експерименти за да се уверите дека оценувачите работат според предвиденото.
Мерење на усогласеноста: Спроведувајте проценки што ги следат склоностите на моделот кон неусогласеност за да ја измерите ефикасноста на обуката за усогласеност. Ова би можело да опфати:
Офлајн проценки на усогласеноста: Спроведувајте проценки на усогласеноста за време на циклусите на обука на гранични модели за да проверите дали обуката функционира според предвиденото и истражете ги сите значајни влошувања.
Ретроспективно тестирање: Тестирајте ги проценките на усогласеноста врз претходни инциденти за да потврдите дека ги откриваат претходно неусогласените модели и дека не се претерано приспособени на одделни инциденти.
Следење на манипулирањето со проценките: Следете ја свесноста за проценка или метаиграњето (кога моделите препознаваат дека се тестираат) што би можеле да предизвикаат промена во однесувањето. На пример, вклучете следење на свесноста за проценка и метаиграњето при проценките на усогласеноста, со конкретни прагови за блокирање.
Тестови на издржливост во најлош случај: Предизвикајте го најлошото можно недозволено однесување и проверете дали барем една проценка би го открила.
Спречување обука врз синџирот на размислување: Не дозволувајте автоматизираните оценувачи да го гледаат синџирот на размислување при зајакнување на учењето, за моделите да не развијат способност да ги заобиколуваат системите за следење на синџирот на размислување.
Изолирање: Обезбедете доволно силна изолација и безбедност на извршната средина за да спречите штетни дејства доколку моделот стане неусогласен. Ова би можело да опфати:
Повеќеслојна безбедност на инфраструктурата: Вложувајте значителни средства во зацврстување и на изолираната средина во која работи моделот и на истражувачката инфраструктура што ја хостира, за да има дополнителен слој на заштита при пробив од изолираната средина.
Тестирање на отпорноста на изолацијата: Подобрувајте ја безбедноста на изолираната средина, истражувачката инфраструктура и периметарот преку повторено тестирање на отпорноста на овие системи со зачувани верзии од циклуси на обука на гранични модели. Тестирањето треба да подлежи на безбедносна анализа и да служи за откривање и отстранување пропусти. Тестирајте ја и отпорноста на сите услуги со кои моделот би можел да дојде во допир при обуката (на пр., интернет-кешот).
Комуникација меѓу примероците: Ограничете ја комуникацијата со голема пропусност меѓу примероците на одобрени патишта, како алатки за повеќе агенти. Затворете ги споредните канали во инфраструктурата што имаат голема пропусност и кои агентите лесно можат да ги откријат.
Непроменливи транскрипти: Чувајте ги транскриптите на агентите во непроменлива форма во разумен временски период (на пример, во сметки за складирање со еднократно запишување), за секоја RL-обука, проценка и внатрешна примена. Така ќе овозможите сигурно истражување на инцидентите и ќе спречите ненамерни измени.
Следење: Обезбедете систем за следење во реално време што ќе ја открие секоја можна неусогласеност ако моделите почнат да преземаат неусогласени дејства и ќе овозможи брзо решавање на приоритетните проблеми пред да настане сериозен инцидент. Ова би можело да опфати:
Задолжителна можност за следење: Осигурете се дека моделите и понатаму можат да се следат, мерено преку проценки на можноста за следење и на неговото заобиколување, со јасни прагови, за рано да се открие загрижувачко однесување.
Висока стапка на откривање познати проблеми: Осигурете се дека системот за следење открива висок процент од минатите инциденти во проценка со податоци издвоени од обуката.
Ажурни проценки на системите за следење: Создавајте примери за проценка што ги претставуваат сосема новите ризици во новите циклуси на обука, за мерките за стапката на откривање и прецизноста на следењето да не застарат.
Брза реакција: Воведете приоритетни предупредувања што водат до дејство во рок утврден со SLA, преку алармирање дежурно лице или автоматско паузирање на засегнатиот циклус на обука, пред моделот да предизвика штета (на пр., преку ден алармирајте ги дежурното лице за безбедност и одговорното лице за циклусот при инциденти, а ноќе автоматски паузирајте ги циклусите ако приемот на предупредувањата не е потврден).
Покрај препораките за технички заштитни мерки, развиваме и најдобри оперативни практики за аргументации за безбедноста на циклусите на обука на гранична ВИ. Тие би можеле да опфатат:
Издвоени мислења (предвремена анализа на можни неуспеси): Откако ќе се состави аргументацијата за безбедноста, член на друг тим треба да напише издвоено мислење за да открие можни пропусти и да даде одмерена проценка на ризикот. Тимот за обука потоа треба да одговори на забелешките за да се зајакне аргументацијата.
Одобрувања: Аргументацијата за безбедноста треба да ја разгледаат членови на високото раководство, секој со право на вето врз циклусот на обука, за да се обезбедат повеќе внатрешни проверки (на пр., раководителот на истражувачката организација / потпретседателот, раководителот за безбедност и главниот научник).
Одговорност: Високиот раководител одговорен за циклусот на обука (на пр., раководителот на истражувачката организација / потпретседателот за истражување) треба да одговара за аргументацијата за безбедноста и за реакцијата при инциденти, вклучително и при оценувањето на неговата работа. Така и тимовите за обука ќе бидат поттикнати да се залагаат за безбедност и усогласеност.
Паузирање: Ако се откријат проблеми што би ја поништиле аргументацијата за безбедноста (на пр., нов безбедносен проблем), треба да постојат оперативни упатства, технички контроли и договори за ниво на услуга (SLA) за паузирање на сите опфатени циклуси на обука.
Внатрешна транспарентност: Аргументациите за безбедноста треба да им бидат достапни на внатрешните надзорни тела (на пр., Одборот за безбедност и сигурност).
Ревизии: На ревизорите треба да им се обезбеди доволен пристап за да проверат дали тврдењата во аргументацијата за безбедноста се валидни и издржани и да пријават пропусти ако ги откријат.
Ескалации: Треба да постои јасен процес за ескалирање случаи на неусогласеност, со табела на дефинирани нивоа на сериозност и дежурно лице за неусогласеност кое може да ги алармира раководителите (на пр., главниот извршен директор) кога циклусот на обука ќе достигне одредено ниво на сериозност.
Технички контроли: И на луѓето и на агентите треба да им биде тешко да започнат циклуси на обука што не ги исполнуваат барањата. Безбедносните функции, како следењето и автоматското паузирање, треба да ја блокираат работата при дефект (на пр., да не може да се започне циклус на обука без вклучено соодветно следење или да се исклучи системот за следење од самата RL-обука, проценка или внатрешна примена).
Можност за поништување на ефектите: Треба лесно да се утврдат сите последователни употреби на неусогласен модел во процесот на обука (на пример, генерирање податоци или оценување), за по потреба да може да се поништи влијанието на неусогласените излези.
Целосен преглед на преостанатите ризици: Аргументациите за безбедноста треба да содржат што е можно поцелосен список на преостанатите ризици што не се опфатени со тековните мерки за ублажување, за да се овозможат информирани одлуки за прифаќање ризик.
Ова се нашите тековни препораки, кои се во процес на спроведување во OpenAI. Очекуваме нашите практики да продолжат да се развиваат во наредните недели.
Развиваме и најдобри практики за истражување сериозни инциденти со неусогласеност на ВИ. Лабораториите треба да настојуваат да научат што е можно повеќе од секој инцидент (слично на истражните практики(се отвора во нов прозорец) во други индустрии со високи ризици), за да спречат такви случаи во иднина. Примери за вакви мерки се:
Внатрешна транспарентност: Бидејќи истрагата може да трае подолго, за нејзиниот тек треба редовно да се известува внатрешно (на пр., со дневни извештаи за тековните истраги). Вработените треба да имаат утврдени постапки за добивање поширок пристап, вклучително и до необработени транскрипти и генерирање примероци од неусогласени модели, доколку тоа е безбедно и релевантно за нивната работа.
Основна причина за неусогласеноста: Истражувачите треба да ги утврдат основните причини во динамиката на обуката (на пр., преку насочени аблации или експерименти со повторно земање примероци). Така ќе разберат како настанало неусогласеното однесување, ќе го продлабочат научното разбирање на неусогласеноста и поуспешно ќе ја спречуваат во иднина.
Анализа по инцидентот: Треба да се спроведе анализа на оперативните постапки и организациската култура за да се разберат сите причини што придонеле за инцидентот, како на пример зошто проблемите настанале и останале неоткриени или не биле ескалирани пред инцидентот.
Откривање: Треба да развиеме методи за тестирање на усогласеноста што можат да ја откријат склоноста да се предизвика инцидентот, без директно итеративно оптимизирање според информации од него (на пр., транскрипти или резимеа на инцидентот). Проценките засновани на инциденти треба да се создаваат како „регресиски тестови“, за да се осигуриме дека идните модели нема да покажуваат склоност кон неусогласеност во многу слични инциденти.
Јавно објавување: Резултатите од истрагата, анализите по инцидентот и оперативните промени треба да се споделат со јавноста по завршувањето на истрагата. Засегнатите трети страни треба да бидат известени што е можно поскоро.


