Перейти до основного вмісту
OpenAI

18 серпня 2026 р.

КомпаніяПублікація

Темп розробки моделей в епоху критичних кіберможливостей

Завантаження…

Протягом останніх кількох тижнів дві події підкреслили зростання ризиків, пов’язаних із дедалі потужнішими системами ШІ: інцидент OpenAI-Hugging Face та, окремо, попередні свідчення того, що одна з наших майбутніх моделей, Astra, може досягти критичного порогу спроможностей у сфері кібербезпеки згідно з нашою рамковою системою готовності. У сукупності ці події та стрімкий поступ наших внутрішніх досліджень надали ще більшої нагальності роботі з посилення захисних механізмів моніторингу, узгодження та ізоляції на всіх етапах навчання.

Що потужнішими стають моделі, то більшими є ризики, пов’язані з їх внутрішньою розробкою та тестуванням. Наші стандарти моніторингу, узгодження та безпеки мають випереджати ці ризики. Ми хотіли виділити достатньо часу, щоб відповідати цим стандартам, тому тимчасово сповільнили масштабування. Зокрема, ми на два тижні призупинили навчання з підкріпленням (RL) наших найновіших моделей, призначених для розгортання, а тим часом додатково зміцнили та протестували дослідницькі середовища методом червоної команди й розширили охоплення систем моніторингу. Наймасштабніший із запланованих запусків навчання з підкріпленням передової моделі досі призупинено. Поки що ми проводимо навчання та оцінювання в меншому масштабі, щоб дослідити поведінку моделі, перевірити захисні механізми й отримати більше доказів узгодженості, перш ніж рухатися далі.

Узгодження — робота, спрямована на те, щоб системи ШІ поводилися належним чином і реагували на людський нагляд, — уже давно лежить в основі нашої дослідницької програми. Спираючись на вже розпочаті дослідження та оцінювання, тепер ми вимагаємо вагоміших доказів узгодженої поведінки на всіх етапах навчання. Підтримання узгодженості дедалі потужніших систем — виклик, який доведеться розв’язувати всій галузі. Ознаки, які ми спостерігаємо в розвитку майбутніх моделей, чітко свідчать, що нам потрібен ширший підхід — такий, що спирається на чинну рамкову систему готовності й виходить за її межі.

Ми вважаємо важливим прозоро розповідати про зміни в нашому підході. Нижче ми описуємо вже внесені зміни до наших дослідницьких процесів та інфраструктури, а також роботу, яка ще триває.

Посилення захисних механізмів для потужніших моделей

Наш підхід до розробки потужніших моделей ґрунтується на трьох взаємодоповнювальних захисних механізмах:

  1. Моніторинг, який виявляє небезпечну поведінку й дає нам змогу реагувати на неї.
  2. Узгодження, яке знижує ймовірність шкідливих або несанкціонованих дій.
  3. Заходи безпеки, які обмежують доступ систем ШІ та їхній вплив.

Ми очікуємо, що невдовзі моделі виконуватимуть більшість завдань із безпеки, зокрема захищатимуть від інших моделей. Завдяки цьому всі три захисні механізми можна буде масштабувати відповідно до спроможностей моделей, що ми вважаємо вкрай важливим.

Ми застосовуємо ці захисні механізми в дослідженнях і розгортанні, адаптуючи їх до спроможностей кожної моделі, її робочого середовища та рівня ризику.

Захист наших дослідницьких середовищ

Оскільки передові моделі набувають потужніших спроможностей у сфері кібербезпеки, ми підвищуємо стандарти захисту середовищ, у яких навчаємо й оцінюємо їх. Відповідність цим стандартам потребувала значної інженерної роботи, великих витрат і призвела до затримок у дослідженні передових моделей. Одразу після інциденту OpenAI-Hugging Face* ми призупинили інференс передових моделей у дослідницьких кластерах для запусків, здатних виконувати код або використовувати інструменти з доступом до інтернету. Досить швидко ми відновили більш обмежений і захищений спосіб виконання коду, а потім окремо перевірили кожне робоче навантаження, щоб визначити, чи можна безпечно його поновити. Деякі дослідницькі навантаження відновили за нових заходів контролю, тоді як інші потребували додаткових змін.

Протягом наступних тижнів ми визначили й почали впроваджувати суворіші вимоги безпеки для дослідницьких навантажень, пов’язаних із передовими моделями. Наприклад:

  • Ізоляція робочих навантажень: тепер ми вимагаємо надійнішої ізоляції («пісочниць») для навантажень, які виконують згенерований моделлю або інший ненадійний код. Це також стосується програмного забезпечення, яке може бути скомпрометоване під час обробки результатів моделі.
  • Ізоляція мережі: ми впровадили додаткові засоби контролю, щоб ізолювати від інтернету ненадійні робочі навантаження й ті, що мають підвищений ризик. Ми розробили ці засоби контролю так, щоб компрометація одного робочого навантаження або допоміжного сервісу сама по собі не давала несанкціонованого доступу до інтернету чи інших внутрішніх мереж.
  • Безперервне тестування безпеки: ми переналаштували середовище, щоб усунути потенційно вразливі спільні сервіси, скоротити постійні привілеї та зміцнити межі безпеки й довіри. Ми також удосконалюємо засоби збирання та моніторингу журналів безпеки. Нарешті, ми інвестуємо в автоматизацію, використовуючи наші моделі для безперервного тестування цих меж за допомогою імітованих атак.

Разом ці засоби контролю забезпечують багаторівневий захист і допомагають убезпечити наше дослідницьке середовище від атак. Наразі ми вимагаємо найсуворіших захисних заходів для робочих навантажень, пов’язаних з Astra або кібермоделями, оскільки визначили, що моделі Astra можуть мати критичний рівень кіберспроможностей. Ці захисні механізми також застосовуються до всіх інших робочих навантажень, пов’язаних із кібербезпекою.

Хоча частина навчання та оцінювань Astra відповідає цим вимогам, значну кількість робочих навантажень призупинено, доки їх повністю не перенесуть і не вдосконалять відповідно до нового стандарту безпеки. Під час перенесення до нових середовищ ми насамперед зосереджуємося на навантаженнях, пов’язаних із безпекою та узгодженням.

Розширення моніторингу ланцюжка міркувань

Моніторинг уже давно є важливою частиною процесу розробки наших моделей, зокрема моніторинг внутрішніх агентів із розробки коду та тривалих сеансів. Наш моніторинг був особливо зосереджений на внутрішніх розгортаннях передових моделей і запусках їх навчання з підкріпленням. Ми вважали ці навантаження найризикованішими, адже вони можуть поєднувати розширені спроможності моделей із доступом до інструментів, чутливих систем, а також внутрішніх чи зовнішніх мереж. Такий моніторинг застосовувався не до всіх запусків інференсу й навчання з використанням інструментів. Завдяки новій системі моніторингу ми переглянули й розширили свій підхід.

Нова система моніторингу є багатоетапною. Спочатку класифікатори активацій — детектори, які перевіряють внутрішню активність моделі, — аналізують кожен відібраний токен, а потенційні проблеми передають дедалі складнішим автоматизованим засобам розслідування з високими обчислювальними потребами. Ці системи перевіряють дії інструментів, доступні міркування та всю послідовність активності на ознаки несанкціонованого доступу, крадіжки даних, руйнівної поведінки й спроб обійти захисні механізми. Ми прагнемо надсилати сповіщення протягом 30 хвилин після виявлення системою моніторингу небезпечної активності. Якщо система моніторингу виявляє ймовірне порушення критичної межі безпеки, вона створює сповіщення з найвищим пріоритетом. У поточній реалізації система терміново сповіщає команди з питань надійності, безпеки та досліджень. Якщо протягом 30 хвилин вони не можуть остаточно встановити, що спрацювання було хибним, ці команди мають призупинити активність.

Такий моніторинг обов’язковий для всіх запусків навчання з підкріпленням та оцінювань із використанням інструментів для моделей рівня Sol або вище. Після того як 7 серпня ми визначили, що Astra може мати критичні кіберспроможності, ми запровадили додаткову вимогу щодо моніторингу всіх випадків інференсу Astra з інструментами, а не лише навчання з підкріпленням та оцінювань.

Ці захисні механізми потребують значних обчислювальних ресурсів. За нашими поточними оцінками, витрати на моніторинг становлять близько 20% обчислювальних ресурсів контрольованого інференсу, хоча вартість суттєво різниться залежно від навчального чи оцінювального навантаження. Докладніше про цю систему ми розповімо в одній із наступних публікацій у блозі.

Розвиток досліджень узгодження

Дослідження узгодження є основою нашої місії. Наша місія — забезпечити, щоб штучний загальний інтелект приносив користь усьому людству. У міру того як моделі набувають розширених спроможностей, як-от здатність здійснювати кібератаки, і працюють у складніших середовищах, неузгоджена поведінка — зокрема маніпуляція системою винагород (пошук способів отримувати високі винагороди під час навчання без фактичного досягнення бажаного результату), обман або несанкціонований доступ — створюватиме дедалі серйозніші ризики.

Під час запусків навчання з підкріпленням найпотужніших моделей ми тепер застосовуємо основні методи узгодження на більшій кількості етапів навчання. Зокрема, ми вдосконалюємо моделі винагород, щоб краще виявляти й стримувати небезпечну поведінку в різних завданнях і середовищах; навчаємо моделі чесніше повідомляти про свої дії, спроможності та обмеження; а також зменшуємо прояви поведінки, що використовує слабкі місця винагород, засобів оцінювання, інструментів або нагляду. Ми також розширюємо охоплення навчання для типів поведінки, які можуть завдати шкоди під час взаємодії моделей із зовнішніми системами чи ресурсами.

Ми й надалі активно інвестуємо в дослідження узгодження, розширюємо охоплення оцінювання та використовуємо здобуті знання для вдосконалення навчання й захисних механізмів. Найближчим часом ми плануємо значно докладніше розповісти про дослідження узгодження, зокрема про те, що дізнаємося щодо поведінки моделей і які нові виклики виявляємо.

Подальші кроки

Ми розвиватимемо рамкову систему готовності, щоб об’єднати ці захисні механізми на всіх етапах навчання та розгортання й краще врахувати спроможності майбутніх моделей і середовища, у яких вони працюватимуть. Розробка методів, здатних масштабуватися разом із цими спроможностями, потребуватиме сталих інвестицій у безпеку за допомогою моделей, ефективніший моніторинг і подальший розвиток досліджень узгодження. Ми плануємо залучати сторонні організації та ділитися більшою частиною здобутих знань у міру розвитку нашого підходу.

Спроможності передових моделей стрімко зростають. Наша здатність розуміти, узгоджувати й захищати їх має розвиватися ще швидше.


*Найближчими тижнями ми опублікуємо технічний звіт про здобуті знання.