Припинення скоординованої кампанії з дистиляції моделей
Нещодавно ми виявили й припинили скоординовану кампанію з вилучення захищених міркувань наших моделей. Перші ознаки цієї активності ми зафіксували в перший тиждень липня. Ця активність має ознаки зловмисної дистиляції — систематичного несанкціонованого використання результатів роботи або міркувань однієї моделі для навчання, відтворення чи вдосконалення іншої. Захищені міркування — це внутрішній запис процесу виконання завдання моделлю. Їх вилучення може розкрити інформацію, яку не включено до остаточної відповіді, і допомогти іншим відтворити можливості моделі.
Виконавці кампанії не зламали наше шифрування, не скомпрометували базу даних і не отримали прямого доступу до збережених розмов користувачів. Натомість вони маніпулювали взаємодіями з моделями, щоб відтворювати захищені міркування у вигляді, доступному автору запиту. Вони робили це скоординовано й у великих масштабах, порушуючи наші умови надання послуг. Вразливість до таких маніпуляцій властива не лише моделям OpenAI. Ми поділилися інформацією про неї з галузевими партнерами через Frontier Model Forum, щоб посилити спільний захист від зловмисної дистиляції.
Перед публікацією ми дослідили масштаби й потенційні наслідки цієї активності, впровадили власні заходи протидії, а також обмінялися інформацією з дослідниками й галузевими партнерами та врахували їхні відгуки, щоб забезпечити захист від атак такого типу. Розслідування та робота над додатковими заходами протидії тривають. Ми вважаємо, що оприлюднення отриманих відомостей зараз допоможе всій екосистемі посилити захист.
Ми спостерігали спроби вилучення захищених міркувань новими способами. Зокрема, виконавці копіювали зашифровані міркування з однієї розмови й просили модель в іншій розмові розшифрувати та викласти текстом їхній прихований вміст.
Незалежні дослідники безпеки(відкривається у новому вікні) також повідомили нам у межах відповідального розкриття інформації про пов’язані вразливості, що стосуються взаємодії між моделями та ущільнення розмов. Ми дослідили їхні висновки й підтвердили, що виявлені ними шляхи атаки справді працюють. Їхня робота допомогла нам краще зрозуміти ширший клас таких атак і прискорити впровадження заходів протидії.
Активність почалася 1 липня й спершу була незначною. Однак 24 та 25 липня ми зафіксували різкі сплески: 16 000 запитів1 від понад 4 000 користувачів із характерною для такого вилучення структурою. Подальше розслідування виявило пов’язану активність зі схожою структурою запитів у групі з понад 15 000 користувачів. До 28 липня ми повністю припинили цю активність.
З часом ця активність змінювалася, що підтверджує: зловмисна дистиляція — це ширша проблема безпеки, яка потребує багаторівневого адаптивного захисту.
Невідомо, чи всі виконавці, яких ми спостерігали у відповідний період, діяли від імені однієї сторони. Однак основну групу цієї активності ми пов’язуємо з особами, що мають стосунок до Moonshot AI — розробника Kimi.
Зловмисна дистиляція створює ризики для безпеки, зокрема національної. Вилучені міркування можна використати для навчання іншої моделі без збереження запобіжників, які застосовуються до відповідей вихідної моделі, призначених для користувачів. У великих масштабах дистиляція також може прискорити перенесення передових можливостей без потреби в таких самих інвестиціях у безпеку. Ці ризики зростають у міру того, як моделі набувають можливостей у сферах подвійного призначення.
Цей ризик стосується не лише OpenAI. Як зазначено вище, подібні методи можуть впливати й на інші передові системи ШІ. Тож це спільна проблема безпеки, яка потребує координації зусиль усієї галузі.
Ми протидіяли цій нещодавній кампанії з дистиляції, поєднавши заходи щодо облікових записів, технічні засоби захисту та координацію з партнерами. Ми заблокували шахрайські облікові записи або обмежили їхні можливості, посилили контроль під час реєстрації та на рівні інфраструктури, а також розширили моніторинг пов’язаних мереж.
Ми також посилили захист прихованих міркувань на рівні користувачів, робочих просторів, організацій і сімейств моделей. Ми закрили шлях, який давав змогу тому, хто вже мав зашифровані міркування іншого користувача, повторно подати їх моделі й відновити вміст. Також ми додали перевірки для виявлення та затримання потокових відповідей, які можуть розкрити міркування. Коли пов’язана активність переходила до сторонніх сервісів, ми співпрацювали з їхніми постачальниками, щоб виявляти й блокувати залучені облікові записи.
Нарешті, ми поділилися відповідними висновками через Frontier Model Forum та належні державні канали обміну інформацією, щоб інші розробники передових моделей і партнери з державного сектору могли шукати подібну активність та посилювати власний захист. Системи, які підтримують перенесення або повторне подання артефактів міркувань, можуть стикатися з подібними ризиками.
Ми очікуємо, що спроби зловмисної дистиляції ставатимуть дедалі витонченішими в міру вдосконалення передових моделей і пошуку зловмисниками дешевших способів відтворити їхні можливості. Захист від такої активності потребує багаторівневих засобів контролю та постійної адаптації.
Цю роботу ще не завершено. Розгортання на інфраструктурі партнерів потребують такого самого захисту, як і наші власні сервіси. А для протидії атакам через результати роботи інструментів потрібні засоби захисту, які аналізують не лише звичайний видимий текст. Ми продовжуємо вдосконалювати захист інструментів, розширювати охоплення класифікаторів, поліпшувати механізми відмов моделей і впроваджувати відповідні засоби контролю в усіх хмарних партнерів.
Надалі наша протидія зосереджуватиметься на трьох напрямах: посиленні технічного захисту від вилучення, кращому виявленні скоординованих кампаній і вжитті заходів проти них, а також поглибленні обміну інформацією про загрози між галуззю та державними органами.

