Во изминатите неколку недели, два настана ги нагласија растечките ризици поврзани со сè поспособните системи за ВИ: инцидентот меѓу OpenAI и Hugging Face и, одделно, првичните докази дека еден од нашите претстојни модели, Astra, може да го достигне прагот за критична способност за сајбер-безбедност според нашата Рамка за подготвеност. Овие настани, заедно со брзиот напредок на нашите интерни истражувања, ја зголемија итноста на нашата работа за зајакнување на заштитните мерки за следење, усогласување и ограничување во сите фази од процесот на обучување.
Како што моделите стануваат поспособни, растат и ризиците поврзани со нивниот интерен развој и тестирање. Нашите стандарди за следење, усогласување и безбедност мора да останат чекор пред тие ризици. Сакавме да одвоиме доволно време за да ги исполниме тие стандарди, па привремено го забавивме зголемувањето на обемот. Ова вклучуваше двонеделна пауза во обучувањето со зајакнување на учењето (RL) на нашите најнови модели наменети за примена, додека дополнително ги зајакнувавме и подложувавме на симулирани напади нашите истражувачки средини и го проширувавме опфатот на системите за следење. Нашето најголемо планирано гранично RL-обучување останува на пауза додека спроведуваме обуки и процени од помал обем за да го оцениме однесувањето на моделот, да ги потврдиме заштитните мерки и да обезбедиме повеќе докази за усогласеност пред да продолжиме.
Усогласувањето — работата со која се постигнува системите за ВИ да се однесуваат како што е предвидено и да одговараат на човечки надзор — одамна е во сржта на нашата истражувачка програма. Сега бараме посилни докази за усогласено однесување во текот на целото обучување, надградувајќи ги истражувањата и процените што веќе се спроведуваат. Одржувањето на усогласеноста на сè поспособните системи е предизвик со кој ќе треба да се справи целата област. Сигналите што ги гледаме од напредокот на претстојните модели јасно покажуваат дека ни треба поширок пристап — таков што ја надградува и ја надминува сегашната Рамка за подготвеност.
Сметаме дека е важно транспарентно да објасниме како се менува нашиот пристап. Подолу ги опишуваме промените што веќе ги направивме во нашите истражувачки процеси и инфраструктура, како и работата што сè уште трае.
Нашиот пристап кон развојот на поспособни модели се потпира на три заштитни мерки што заемно се зајакнуваат:
- Следење, со кое се открива загрижувачко однесување и ни се овозможува да реагираме.
- Усогласување, со кое се намалува веројатноста за штетни или неовластени дејства.
- Безбедносни мерки, со кои се ограничува до што можат да пристапат или врз што можат да влијаат системите за ВИ.
Очекуваме моделите наскоро да извршуваат најголем дел од безбедносните задачи, вклучително и одбраната од други модели. Ова ќе овозможи сите три заштитни мерки да се зголемуваат со способностите на моделот, што го сметаме за клучно.
Овие заштитни мерки ги применуваме во истражувањето и примената, приспособувајќи ги на способностите, работната средина и нивото на ризик на секој модел.
Како што граничните модели стекнуваат посилни способности за сајбер-безбедност, ги заоструваме безбедносните стандарди за средините во кои ги обучуваме и проценуваме. Исполнувањето на овие стандарди бараше значителна инженерска работа и предизвика големи трошоци и доцнења во граничните истражувања. Веднаш по инцидентот меѓу OpenAI и Hugging Face*, го паузиравме изведувањето заклучоци со гранични модели во истражувачките кластери за процеси што можеа да извршуваат код или да користат алатки со пристап до интернет. Релативно брзо воспоставивме поограничен и побезбеден начин за извршување код, а потоа поединечно го разгледавме секое работно оптоварување за да утврдиме дали може безбедно да продолжи. Некои истражувачки оптоварувања продолжија под овие нови контроли, додека за други беа потребни дополнителни промени.
Во следните недели дефиниравме и почнавме да спроведуваме построги безбедносни барања за работните оптоварувања во граничните истражувања. На пример:
- Изолација на работните оптоварувања: Сега бараме посилна изолација („песочни кутии“) за оптоварувањата што извршуваат код создаден од модел или друг код на кој не може да му се верува. Ова важи и за софтвер што би можел да биде компромитиран при обработката на резултатите од моделот.
- Мрежна изолација: Воведовме повеќе контроли за да ги изолираме од интернет оптоварувањата со повисок ризик и оние на кои не може да им се верува. Овие контроли ги осмисливме така што едно компромитирање на работно оптоварување или придружна услуга само по себе да не овозможи неовластен пристап до интернет или до други внатрешни мрежи.
- Континуирано безбедносно тестирање: Ја преконфигуриравме средината за да ги отстраниме потенцијално ранливите споделени услуги, да ги намалиме трајните привилегии и да ги подобриме границите на безбедност и доверба. Ја подобруваме и нашата способност за собирање и следење на безбедносните дневници. Конечно, вложуваме во автоматизација што ги користи нашите модели за континуирано тестирање на овие граници со симулирани напади.
Заедно, овие контроли обезбедуваат повеќеслојна одбрана и помагаат да ја заштитиме нашата истражувачка средина од напади. Денес бараме најстрого ниво на безбедносни заштитни мерки за работните оптоварувања што вклучуваат Astra или сајбер-модели, бидејќи утврдивме дека моделите Astra може да имаат критично ниво на сајбер-способности. Овие заштитни мерки важат и за сите други работни оптоварувања поврзани со сајбер-безбедноста.
Иако дел од обучувањето и процените на Astra ги исполнуваат тие барања, значителен број работни оптоварувања остануваат паузирани сè додека целосно не се префрлат и подобрат за да го исполнат новиот безбедносен стандард. Предност при префрлањето во овие нови средини им даваме на оптоварувањата поврзани со безбедноста и усогласувањето.
Следењето одамна е важен дел од нашиот процес за развој на модели, вклучително и следењето на интерните агенти за кодирање и долготрајните сесии. Нашите напори за следење беа особено насочени кон интерната примена на гранични модели и граничните RL-обучувања, кои ги сметавме за оптоварувања со највисок ризик бидејќи можат да ги спојат напредните способности на моделот со пристап до алатки, чувствителни системи и внатрешни или надворешни мрежи. Тие не се применуваа на сите процеси на изведување заклучоци и обучување што користат алатки. Со новиот систем за следење го преработивме и проширивме нашиот пристап.
Новиот систем за следење има повеќе фази. Започнува со класификатори на активации — детектори што ја проверуваат внатрешната активност на моделот — кои работат на секој земен примерок од токен и ги проследуваат потенцијалните проблеми до сè пософистицирани автоматизирани истражувачи што користат многу пресметковни ресурси. Тие системи ги испитуваат дејствата со алатки, достапното расудување и целосниот тек на активностите за да откријат неовластен пристап, кражба на податоци, деструктивно однесување и обиди за заобиколување на заштитните мерки. Целта ни е да издадеме предупредување во рок од 30 минути откако нашиот систем за следење ќе открие загрижувачка активност. Ако системот за следење утврди веројатно прекршување на критична безбедносна граница, создава предупредување со највисок приоритет. Во сегашната имплементација веднаш се известуваат тимовите за сигурност, безбедност и истражување. Ако во рок од 30 минути не можат со сигурност да утврдат дека означувањето е лажно позитивно, од тие тимови се очекува да ја паузираат активноста.
Ова следење е задолжително за сите RL-обучувања и процени што вклучуваат алатки за модели со способност на ниво Sol или повисоко. Откако на 7 август утврдивме дека Astra може да има критични сајбер-способности, додадовме уште едно барање за следење на секое изведување заклучоци со Astra што користи алатки, а не само на RL-обучувањата и процените.
Овие заштитни мерки бараат значителни пресметковни ресурси. Според нашите сегашни процени, дополнителниот пресметковен товар од следењето изнесува приближно 20% од следените пресметки за изведување заклучоци, иако трошокот значително се разликува меѓу оптоварувањата за обучување и процена. Повеќе детали за овој систем ќе споделиме во претстојна објава на блогот.
Истражувањето за усогласување е во средиштето на нашата мисија. Нашата мисија е да обезбедиме општата вештачка интелигенција да му користи на целото човештво. Како што моделите стекнуваат напредни способности, како што е способноста за сајбер-напади, и работат во посложени средини, неусогласените однесувања како хакирање на наградата (наоѓање начини за добивање високи награди при обучувањето без навистина да се постигне предвидениот резултат), измама или неовластен пристап ќе создаваат сè посериозен ризик.
Кај RL-обучувањата на најспособните модели, сега ги применуваме нашите основни техники за усогласување во повеќе фази од процесот на обучување. Ова вклучува подобрување на моделите за наградување за подобро откривање и обесхрабрување небезбедно однесување во различни задачи и средини; обучување на моделите да бидат поискрени за своите дејства, способности и ограничувања; и намалување на однесувањата што ги искористуваат слабостите во наградите, оценувачите, алатките или надзорот. Го прошируваме и опфатот на обучувањето за однесувања што би можеле да предизвикаат штета кога моделите комуницираат со надворешни системи или ресурси.
Продолжуваме интензивно да вложуваме во истражувањето за усогласување, да го прошируваме опфатот на процените и да ги користиме сознанијата за подобрување на обучувањето и заштитните мерки. Планираме наскоро да споделиме многу повеќе за нашето истражување за усогласување, вклучително и што учиме за однесувањето на моделите и сите нови предизвици што ќе ги откриеме.
Ќе ја развиваме нашата Рамка за подготвеност за да ги обедини овие заштитни мерки во обучувањето и примената и подобро да ги одразува способностите на идните модели и средините во кои тие работат. Развојот на методи што можат да се зголемуваат со тие способности ќе бара постојани вложувања во безбедност потпомогната од модели, поефикасно следење и континуиран напредок во истражувањето за усогласување. Имаме намера да вклучиме надворешни организации и да споделуваме повеќе од она што го учиме додека се развива нашиот пристап.
Способностите на граничните модели брзо напредуваат. Нашата способност да ги разбереме, усогласиме и обезбедиме мора да остане чекор напред.
*Во наредните недели ќе објавиме технички извештај за нашите сознанија.

