На шляху до обґрунтувань безпеки навчання передового ШІ
Ми вважаємо, що вступаємо в нову еру, у якій структурована документація з безпеки має бути обов’язковою умовою продовження будь-якого циклу навчання передового ШІ з підкріпленням. В ідеалі така документація має відповідати рівню «обґрунтувань безпеки» — вичерпних, структурованих і доказових аргументів щодо ризику, які використовують в інших галузях із критичними вимогами до безпеки. Ми розглядаємо обґрунтування безпеки як орієнтир, до якого прагнемо. Водночас визнаємо: зробити їх такими ж строгими для моделей ШІ, як для авіації чи ядерної енергетики, складно через нові рівні складності, що виникають із кожним розширенням можливостей ШІ. Ми працюємо над системою, яка формалізує ці практики.
Нижче наведено початкові настанови, які, на нашу думку, мають входити до таких обґрунтувань безпеки навчання передового ШІ. Ці найкращі практики відображають наші нинішні знання. Ми очікуємо, що вони розвиватимуться в міру вдосконалення внутрішніх процесів обачної розробки. Ми ділимося ними вже зараз, щоб прозоро представити наші поточні погляди, і запрошуємо спільноту до обговорення. Зверніть увагу: цей документ присвячено навчанню передового ШІ з підкріпленням; внутрішнє й зовнішнє розгортання потребують розгляду значно ширшого набору характеристик узгодженості.
Обґрунтування безпеки мають охоплювати три складові технічного стеку: навчання для узгодженості, ізоляцію та моніторинг. Ці засоби захисту допомагають забезпечити, щоб модель не намагалася діяти неузгоджено, а навіть якби спробувала — їй було б складно вийти за межі ізольованого середовища й моніторинг виявив би це до завдання шкоди.
Узгодженість моделі: Першою лінією захисту має бути навчання моделей узгодженої поведінки, тобто здатності надійно діяти відповідно до наших намірів. Це може охоплювати:
Навчальні середовища й оцінювання: Знижувати ризик розвитку неузгодженої поведінки моделей, не допускаючи позитивного підкріплення маніпуляцій із винагородою під час навчання. Це може охоплювати:
Автоматизована перевірка наборів даних: Використовувати агентів для пошуку й виправлення недоліків у середовищах навчання з підкріпленням, через які неузгоджені траєкторії дій можуть отримувати високу винагороду завдяки використанню вразливостей, а не очікуваній поведінці. Це зменшить можливості для підкріплення неузгодженості під час навчання.
Ручна перевірка наборів даних: Доповнювати автоматизовану перевірку на вразливості та ризики ручним переглядом і контролем якості наборів даних, щоб виявляти недосконалі завдання, які можуть ненавмисно підкріплювати неузгоджену поведінку.
Налаштування оцінювачів: Налаштовувати оцінювачі так, щоб вони штрафували модель за спроби використати вразливості чи зламати середовище навчання з підкріпленням під час навчання.
Аналіз попередніх циклів навчання: Застосовувати класифікатори до журналів попередніх експериментів, щоб переконатися, що оцінювачі працюють належним чином.
Вимірювання узгодженості: Проводити оцінювання, що відстежують схильність моделі до неузгодженої поведінки, щоб вимірювати ефективність навчання для узгодженості. Це може охоплювати:
Офлайн-оцінювання узгодженості: Проводити оцінювання узгодженості під час циклів навчання передових моделей, щоб перевіряти, чи дає навчання очікувані результати, і досліджувати всі суттєві погіршення.
Ретроспективна перевірка: Перевіряти оцінювання узгодженості на попередніх інцидентах, щоб підтвердити, що вони виявляють раніше неузгоджені моделі й не є надмірно підлаштованими під окремі інциденти.
Відстеження маніпуляцій з оцінюванням: Відстежувати обізнаність про оцінювання або метагеймінг (коли моделі розпізнають, що їх тестують), які можуть змінити поведінку, і встановлювати конкретні пороги блокування. Наприклад, увімкнути моніторинг обізнаності про оцінювання та метагеймінгу під час оцінювань узгодженості.
Стрес-тести за найгіршими сценаріями: Провокувати найгірші прояви неналежної поведінки й перевіряти, чи виявить їх хоча б одне оцінювання.
Запобігання навчанню на ланцюжку міркувань: Не надавати автоматизованим оцінювачам доступу до ланцюжка міркувань під час навчання з підкріпленням, щоб моделі не навчилися обходити моніторинг ланцюжка міркувань.
Ізоляція: Забезпечити достатньо надійну ізоляцію в пісочниці та захист, щоб запобігти шкідливим діям, якщо модель стане неузгодженою. Це може охоплювати:
Багаторівневий захист інфраструктури: Вкладати значні ресурси в посилення захисту як пісочниці, у якій працює модель, так і дослідницької інфраструктури, де розміщено пісочницю. Це забезпечить додатковий рівень захисту на випадок виходу моделі за межі пісочниці.
Перевірка ізоляції на вразливості та ризики: Посилювати захист пісочниці, дослідницької інфраструктури й периметра, ітеративно перевіряючи ці системи на вразливості та ризики за допомогою контрольних версій передових моделей у процесі навчання. Такі перевірки мають проходити аналіз безпеки й допомагати знаходити та усувати прогалини. Також перевіряти на вразливості та ризики всі сервіси, з якими модель може взаємодіяти під час навчання (наприклад, кеш інтернет-ресурсів).
Обмін даними між вибірками: Дозволяти обмін даними між вибірками з високою пропускною здатністю лише схваленими каналами, як-от через інструменти для кількох агентів, і закривати побічні канали інфраструктури, що мають високу пропускну здатність і які агентам легко виявити.
Незмінні записи взаємодій: Зберігати записи взаємодій агентів у незмінному вигляді протягом достатнього часу (наприклад, в облікових записах сховища з одноразовим записом) для всього навчання з підкріпленням, оцінювання та внутрішнього розгортання. Це забезпечить надійне розслідування інцидентів і запобігатиме випадковим змінам.
Моніторинг: На випадок, якщо моделі почнуть діяти неузгоджено, мати систему моніторингу в реальному часі, яка виявлятиме потенційну неузгодженість і допомагатиме швидко розв’язувати пріоритетні проблеми, перш ніж станеться серйозний інцидент. Це може охоплювати:
Забезпечення можливості моніторингу: Забезпечувати, щоб моделі залишалися придатними для моніторингу, перевіряючи це оцінюваннями можливості моніторингу та його обходу з чіткими порогами. Це допоможе завчасно виявляти тривожну поведінку.
Висока повнота виявлення відомих проблем: Забезпечувати високу повноту виявлення минулих інцидентів системою моніторингу під час оцінювання на відкладеній вибірці.
Актуальність оцінювань моніторингу: Створювати приклади для оцінювання, що відображають цілком нові ризики в нових циклах навчання, щоб вимірювання повноти й точності моніторингу не втрачали актуальності.
Швидке реагування: Запровадити пріоритетні сповіщення, що забезпечують реагування в межах визначеної SLA — через терміновий виклик чергового фахівця або автоматичне призупинення відповідного циклу навчання — до того, як модель завдасть шкоди. Наприклад, удень сповіщати про інциденти чергового фахівця з безпеки та відповідального за цикл навчання, а вночі автоматично призупиняти цикли, якщо отримання сповіщень не підтверджено.
Поряд із рекомендаціями щодо технічних засобів захисту ми розробляємо найкращі операційні практики для обґрунтування безпеки циклів навчання передового ШІ. Вони можуть охоплювати:
Критичні відгуки (попередній аналіз можливих збоїв): Після підготовки проєкту обґрунтування безпеки представник іншої команди має написати критичний відгук, щоб виявити можливі прогалини й надати зважену оцінку ризику. Команда навчання має опрацювати ці зауваження, щоб посилити обґрунтування.
Затвердження: Обґрунтування безпеки мають розглянути представники вищого керівництва, кожен із яких повинен мати право заборонити цикл навчання. Це забезпечить кілька незалежних внутрішніх перевірок (наприклад, з боку керівника дослідницького підрозділу або віцепрезидента з досліджень, керівника з безпеки та головного науковця).
Підзвітність: Представник вищого керівництва, відповідальний за цикл навчання (наприклад, керівник дослідницького підрозділу або віцепрезидент із досліджень), має відповідати за обґрунтування безпеки та реагування на інциденти, зокрема під час оцінювання його роботи. Це також мотивуватиме команди навчання дбати про безпеку й узгодженість моделей.
Призупинення: На випадок виявлення проблем, що спростовують обґрунтування безпеки (наприклад, нової вразливості), слід передбачити інструкції, технічні засоби контролю та угоди про рівень обслуговування (SLA) для призупинення всіх циклів навчання, на які воно поширюється.
Внутрішня прозорість: Обґрунтування безпеки мають бути доступні внутрішнім наглядовим групам (наприклад, Комітету із захисту та безпеки).
Аудити: Аудиторам слід надати достатній доступ, щоб перевірити достовірність і обґрунтованість тверджень в обґрунтуванні безпеки та повідомити про виявлені прогалини.
Ескалація: Потрібен чіткий процес передавання проблем неузгодженості на вищий рівень, таблиця визначених рівнів їхньої серйозності та черговий фахівець із неузгодженості, який може терміново сповістити керівництво (наприклад, генерального директора), коли проблема в циклі навчання досягне певного рівня серйозності.
Технічні засоби контролю: Людям і агентам має бути складно запускати цикли навчання, що не відповідають вимогам. У разі збою захисних функцій, як-от моніторингу й автоматичного призупинення, робота має блокуватися. Наприклад, має бути неможливо запустити цикл навчання без належного моніторингу або вимкнути моніторинг із середовища навчання з підкріпленням, оцінювання чи внутрішнього розгортання.
Можливість відкату: Має бути легко виявити всі подальші використання неузгодженої моделі в процесі навчання (наприклад, для генерування даних чи виставлення оцінок), щоб за потреби усунути вплив її неузгоджених результатів.
Повнота переліку залишкових ризиків: Обґрунтування безпеки мають містити якомога повніший перелік залишкових ризиків, не охоплених наявними заходами захисту, щоб рішення про прийняття ризику були поінформованими.
Це наші поточні рекомендації, які зараз упроваджуються в OpenAI. Ми очікуємо, що найближчими тижнями наші практики й далі розвиватимуться.
Ми також розробляємо найкращі практики розслідування серйозних інцидентів неузгодженості ШІ. Лабораторії мають прагнути отримати якомога більше знань з окремих інцидентів (за аналогією з практиками розслідування(відкривається у новому вікні) в інших галузях, де ціна помилки висока), щоб запобігати таким випадкам у майбутньому. Ось кілька прикладів можливих заходів:
Внутрішня прозорість: Оскільки розслідування може тривати довго, слід регулярно повідомляти всередині організації про його перебіг (наприклад, щодня для поточних розслідувань). Співробітники мають мати визначені способи отримання ширшого доступу, зокрема до необроблених записів взаємодій і генерування вибірок із неузгоджених моделей, якщо це безпечно й потрібно для їхньої роботи.
Першопричина неузгодженості: Дослідники мають виявляти першопричини в динаміці навчання (наприклад, за допомогою цільових абляційних досліджень або експериментів із повторним формуванням вибірок), щоб з’ясувати, як виникла неузгоджена поведінка, поглибити наукове розуміння неузгодженості та ефективніше запобігати їй у майбутньому.
Післяінцидентний аналіз: Слід проаналізувати операційні процеси й організаційну культуру, щоб зрозуміти всі причини, які сприяли інциденту, зокрема чому проблеми виникли та чому до інциденту їх не виявили або не передали на вищий рівень.
Виявлення: Ми маємо розробляти методи перевірки узгодженості, здатні виявляти схильність до поведінки, що спричинила інцидент, без прямого ітеративного підлаштування під дані про нього (наприклад, записи взаємодій або зведення про інцидент). Оцінювання на основі інцидентів слід створювати як «регресійні тести», щоб майбутні моделі не виявляли схильності до неузгодженої поведінки в дуже схожих ситуаціях.
Публічне розкриття інформації: Після завершення розслідування його результати, післяінцидентний аналіз і зміни в операційних процесах слід оприлюднити. Постраждалі треті сторони слід повідомити якнайшвидше.


