Преминаване към основното съдържание
OpenAI

18 август 2026 г.

КомпанияПубликация

Разработване на моделите с подходящо темпо в ерата на критичните киберспособности

Зареждане…

През последните няколко седмици две събития подчертаха нарастващите рискове, свързани с все по-способните системи с ИИ: инцидентът с OpenAI и Hugging Face и, отделно от него, предварителните данни, че един от предстоящите ни модели, Astra, може да достига прага за критични киберспособности съгласно нашата Рамка за готовност. В съчетание с бързия напредък във вътрешните ни изследвания тези събития придадоха още по-голяма неотложност на работата ни за укрепване на защитните механизми за наблюдение, съгласуване и ограничаване на всеки етап от процеса на обучение.

С нарастването на способностите на моделите се увеличават и рисковете от вътрешното им разработване и тестване. Стандартите ни за наблюдение, съгласуване и сигурност трябва да изпреварват тези рискове. Искахме да отделим необходимото време, за да отговорим на тези стандарти, затова временно забавихме темпото на мащабиране. Това включваше двуседмично прекъсване на обучението с утвърждение (RL) на най-новите ни модели, предназначени за внедряване, докато допълнително укрепвахме и подлагахме на стрес тестове с „червени екипи“ изследователските си среди и разширявахме обхвата на системите си за наблюдение. Най-мащабното ни планирано авангардно RL обучение все още е спряно, докато провеждаме по-малки обучения и оценки, за да анализираме поведението на моделите, да потвърдим надеждността на защитните си механизми и да съберем повече доказателства за съгласуваност, преди да продължим.

Съгласуването – работата по това да гарантираме, че системите с ИИ се държат според намеренията ни и реагират на човешкия надзор – отдавна е в основата на изследователската ни програма. Вече изискваме по-убедителни доказателства за съгласувано поведение през целия процес на обучение, като надграждаме текущите изследвания и оценки. Поддържането на все по-способните системи в съответствие с човешките намерения е предизвикателство, с което ще трябва да се справи целият сектор. Сигналите, които наблюдаваме в развитието на предстоящите модели, ясно показват, че се нуждаем от по-широк подход, който надгражда и надхвърля настоящата Рамка за готовност.

Смятаме, че е важно да бъдем прозрачни за начина, по който променяме подхода си. По-долу описваме вече направените промени в изследователските ни процеси и инфраструктура, както и работата, която все още продължава.

Укрепване на защитните механизми за по-способни модели

Подходът ни към разработването на по-способни модели се основава на три взаимно допълващи се защитни механизма:

  1. Наблюдение, което открива обезпокоително поведение и ни позволява да реагираме на него.
  2. Съгласуване, което намалява вероятността от вредни или неразрешени действия.
  3. Мерки за сигурност, които ограничават до какво имат достъп и върху какво могат да въздействат системите с ИИ.

Очакваме скоро моделите да изпълняват по-голямата част от работата по сигурността, включително защитата срещу други модели. Смятаме, че това е от решаващо значение за мащабирането и на трите мерки спрямо способностите на моделите.

Прилагаме тези защитни механизми както в изследователската дейност, така и при внедряването, като ги адаптираме към способностите на всеки модел, средата, в която работи, и нивото на риск.

Защита на изследователските ни среди

С нарастването на киберспособностите на авангардните модели повишаваме и стандартите за сигурност на средите, в които ги обучаваме и оценяваме. Спазването на тези стандарти изисква значителна инженерна работа и води до големи разходи и забавяния в авангардните изследвания. Непосредствено след инцидента с OpenAI и Hugging Face* спряхме извеждането на авангардни модели в изследователските клъстери за изпълнения, които могат да изпълняват код или да използват инструменти с достъп до интернет. Впоследствие сравнително бързо възстановихме по-ограничен и сигурен път за изпълнение на код, след което разгледахме поотделно всяко работно натоварване, за да определим дали може безопасно да бъде възобновено. Някои изследователски работни натоварвания бяха възобновени с тези нови мерки за контрол, докато други изискваха допълнителни промени.

През следващите седмици определихме и започнахме да прилагаме по-строги изисквания за сигурност към натоварванията в изследванията на авангардни модели. Например:

  • Изолиране на работните натоварвания: Вече изискваме по-строго изолиране („пясъчни среди“) за натоварванията, които изпълняват генериран от модели или друг ненадежден код. Това се отнася и за софтуер, който може да бъде компрометиран при обработването на изходни данни от модели.
  • Изолиране на мрежата: Въведохме повече мерки за изолиране на работни натоварвания с по-висок риск и на ненадеждни работни натоварвания от интернет. Проектирахме тези мерки така, че компрометирането на едно работно натоварване или поддържаща услуга само по себе си да не позволява неразрешен достъп до интернет или други вътрешни мрежи.
  • Непрекъснато тестване на сигурността: Преконфигурирахме средата си, за да премахнем потенциално уязвими споделени услуги, да ограничим постоянните привилегии и да подобрим границите за сигурност и доверие. Подобряваме и способността си да събираме и наблюдаваме регистрационни файлове за сигурността. И накрая, инвестираме в автоматизация, при която моделите ни непрекъснато проверяват тези граници чрез симулирани атаки.

Заедно тези мерки осигуряват многостепенна защита и помагат за предпазването на изследователската ни среда от атаки. Понастоящем изискваме най-строгото ниво на защитни механизми за натоварванията, включващи Astra или кибермодели, тъй като установихме, че моделите Astra може да имат критично ниво на киберспособности. Тези защитни механизми се прилагат и към всички останали натоварвания, свързани с киберсигурността.

Макар че някои обучения и оценки на Astra отговарят на тези изисквания, значителен брой натоварвания остават спрени, докато не бъдат изцяло мигрирани и подобрени, за да отговорят на новия стандарт за сигурност. Даваме приоритет на мигрирането на работните натоварвания, свързани с безопасността и съгласуването, към тези нови среди.

Разширяване на наблюдението на логическото мислене

Наблюдението отдавна е важна част от процеса ни за разработване на модели, включително наблюдението на вътрешни агенти за програмиране и продължителни сесии. Усилията ни за наблюдение бяха насочени най-вече към вътрешното внедряване на авангардни модели и RL цикли на обучение на авангардни модели, които смятахме за най-рисковите натоварвания, защото могат да съчетават усъвършенствани способности на моделите с достъп до инструменти, чувствителни системи и вътрешни или външни мрежи. Те не се прилагаха към всички изпълнения на модели и обучения, използващи инструменти. Преработихме и разширихме подхода си с новата система за наблюдение.

Новата система за наблюдение е многоетапна. Тя започва с класификатори за активиране (детектори, които проверяват вътрешната активност на модела), които се изпълняват при всеки извадков токен и ескалират потенциални проблеми към все по-усъвършенствани автоматизирани анализатори с големи изчислителни ресурси. Тези системи проверяват действията с инструменти, наличното структурирано анализиране и пълната последователност от действия за неразрешен достъп, кражба на данни, разрушително поведение и опити за заобикаляне на защитните механизми. Стремим се да изпращаме предупреждение до 30 минути след откриването на обезпокоителна активност от системата ни за наблюдение. Ако системата за наблюдение установи вероятно нарушение на критична граница за сигурност, тя генерира предупреждение с най-висок приоритет. В настоящата ни реализация екипите по безопасност, сигурност и изследвания получават спешно предупреждение. Ако до 30 минути не могат категорично да установят, че сигналът е фалшиво положителен, от тези екипи се очаква да спрат дейността.

Това наблюдение е задължително за всички RL обучения и оценки, при които се използват инструменти, за модели със способности на ниво Sol или по-високо. След като на 7 август установихме, че Astra може да има критични киберспособности, добавихме допълнително изискване за наблюдение на всички изпълнения на Astra с инструменти, а не само на RL обученията и оценките.

Тези защитни механизми изискват значителни изчислителни ресурси. Според текущите ни оценки допълнителното натоварване за наблюдението е около 20% от изчислителните ресурси за наблюдаваното изпълнение на модела, въпреки че разходите варират значително в зависимост от работните натоварвания за обучение и оценяване. Ще споделим повече подробности за тази система в предстояща публикация в блога.

Усъвършенстване на изследванията в областта на съгласуването

Изследванията в областта на съгласуването са в основата на нашата мисия. Мисията ни е да гарантираме, че изкуственият общ интелект е от полза за цялото човечество. С придобиването на усъвършенствани способности от моделите, като например способност за извършване на кибератаки, и с функционирането им във все по-сложни среди, несъгласуваното поведение – например хакване на системата за възнаграждение (намиране на начини за получаване на високи награди по време на обучението, без действително да се постига желаният резултат), измама или неразрешен достъп – ще създава все по-сериозен риск.

При RL циклите на обучение на най-способните модели вече прилагаме основните си техники за съгласуване на повече етапи от процеса на обучение. Това включва подобряване на моделите за възнаграждение, за да откриват и възпират по-ефективно опасното поведение при различни задачи и среди; обучение на моделите да бъдат по-честни относно своите действия, способности и ограничения; и ограничаване на поведението, което използва слабости във възнагражденията, оценяващите системи, инструментите или надзора. Разширяваме и обхвата на обучението за поведения, които биха могли да причинят вреда при взаимодействие на моделите с външни системи или ресурси.

Продължаваме да инвестираме активно в изследвания на съгласуването, да разширяваме обхвата на оценяването и да използваме наученото, за да усъвършенстваме обучението и защитните механизми. Планираме в близко бъдеще да споделим значително повече информация за изследванията си на съгласуването, включително какво научаваме за поведението на моделите и за всички нови предизвикателства, които установим.

Какво предстои

Ще развием нашата Рамка за готовност, за да обединим тези защитни механизми при обучението и внедряването и да отразим по-добре способностите на бъдещите модели и средите, в които работят. Разработването на методи, които могат да се мащабират заедно с тези способности, ще изисква устойчиви инвестиции в подпомагана от модели сигурност, по-ефективно наблюдение и непрекъснат напредък в изследванията на съгласуването. Възнамеряваме да привлечем външни организации и да споделяме повече от наученото, докато развиваме подхода ни.

Способностите на авангардните модели се развиват с все по-бързи темпове. Способността ни да ги разбираме, съгласуваме и защитаваме трябва да изпреварва това развитие.


*През следващите седмици ще публикуваме технически доклад, в който ще споделим основните си изводи.