Пресичане на координирана кампания за дистилация на модели
Наскоро установихме и пресякохме координирана кампания за извличане на защитени записи от структурираното анализиране на нашите модели. Първите наблюдавани действия датират от първата седмица на юли. Тази дейност съответства на злонамерена дистилация: систематичното и неразрешено използване на изходните данни или структурираното анализиране на един модел за подпомагане на обучението, възпроизвеждането или подобряването на друг модел. Защитеното структурирано анализиране представлява вътрешния запис на модела за работата му по дадена задача. Извличането му може да разкрие информация, която не е включена в крайния отговор, и да помогне на други да възпроизведат възможностите на модела.
Извършителите не са разбили нашето криптиране, не са компрометирали база данни и не са получили пряк достъп до съхранени потребителски разговори. Вместо това те са манипулирали взаимодействията с моделите, така че защитеното структурирано анализиране да бъде възпроизведено във вид, достъпен за подателя на заявката. Това е ставало координирано и в голям мащаб, в нарушение на нашите условия за ползване. Тази манипулация не се основава на уязвимост, присъща само на моделите на OpenAI. Споделихме информация за нея с партньори от сектора чрез Frontier Model Forum, за да засилим колективната защита срещу злонамерена дистилация.
Преди публикуването проучихме обхвата и потенциалното въздействие, въведохме собствени мерки за ограничаване на риска и споделихме информация с изследователи и партньори от сектора, като взехме предвид обратната им връзка, за да осигурим защита срещу този вид атаки. Продължаваме разследването и работата по допълнителни мерки за ограничаване на риска. Смятаме, че споделянето на наученото още сега ще помогне на по-широката екосистема да укрепи защитата си.
Наблюдавахме опити за извличане на защитено структурирано анализиране по нови начини. Сред тях беше копирането на криптирани записи от структурирано анализиране от един разговор и подаването на заявка към модел в друг разговор да декриптира и изпише скритото съдържание.
Независими изследователи по сигурността(отваря се в нов прозорец) също ни уведомиха по реда за отговорно разкриване за свързани уязвимости при взаимодействието между модели и при сбиване на разговори. Проучихме констатациите им и потвърдихме, че установените от тях начини за атака действително са възможни. Работата им ни помогна да разберем по-широкия клас атаки и да ускорим въвеждането на мерки за защита.
Дейността започна на 1 юли, първоначално в малък обем. На 24 и 25 юли наблюдавахме резки пикове с общо 16 000 заявки1 от над 4000 потребители, използващи съответния шаблон за извличане. По-нататъшното разследване установи свързана дейност със сходни шаблони на подкани в група от над 15 000 потребители. До 28 юли я пресякохме напълно.
Дейността се променяше с времето, което потвърждава, че злонамерената дистилация е по-широко предизвикателство за сигурността, изискващо многослойна, адаптивна защита.
Не е ясно дали всички извършители, които наблюдавахме през съответния период, са действали от името на една и съща страна. Въпреки това свързваме основна група от наблюдаваните действия с лица, свързани с Moonshot AI — разработчика на Kimi.
Злонамерената дистилация създава рискове за безопасността и националната сигурност. Извлечените записи от структурирано анализиране биха могли да се използват за обучение на друг модел, без да се запазят защитните механизми, прилагани към отговорите на първоначалния модел, които потребителите виждат. В голям мащаб дистилацията може също да ускори прехвърлянето на усъвършенствани възможности, без да изисква същите инвестиции в безопасност. Тези опасения нарастват с придобиването от моделите на възможности в области с двойна употреба.
Този риск не засяга само OpenAI. Както беше посочено по-горе, подобни техники могат да засегнат и други усъвършенствани системи с ИИ. Това превръща проблема в общо предизвикателство за сигурността, което изисква координация в целия сектор.
Ограничихме тази скорошна кампания за дистилация чрез съчетание от санкции спрямо акаунти, технически мерки за контрол и координация с партньори. Блокирахме или ограничихме акаунти, използвани за измами, засилихме контрола при регистрация и върху инфраструктурата и разширихме наблюдението за свързани мрежи.
Засилихме и защитата на скритото структурирано анализиране между различни потребители, работни пространства, организации и семейства модели. Затворихме възможността някой, който вече разполага с криптирани записи от структурираното анализиране на друг потребител, да ги подаде повторно и да възстанови съдържанието им. Добавихме и проверки за откриване и задържане на поточно предавани изходни данни, които биха могли да разкрият структурирано анализиране. Когато свързаната дейност премина през услуги на трети страни, работихме с доставчиците им, за да установим използваните акаунти и да прекратим дейността им.
Накрая споделихме съответните констатации чрез Frontier Model Forum и подходящите държавни канали за обмен на информация, за да могат други разработчици на авангардни модели и партньори от публичния сектор да проверят за подобна дейност и да укрепят собствената си защита. Системите, които поддържат артефакти от структурирано анализиране, допускащи пренасяне или повторно подаване, може да са изложени на сходни рискове.
Очакваме опитите за злонамерена дистилация да стават все по-сложни, докато авангардните модели се усъвършенстват, а извършителите търсят по-евтини начини да имитират възможностите им. Защитата срещу тази дейност изисква многослойни мерки за контрол и непрекъснато адаптиране.
Тази работа не е приключила. Внедрените при партньори системи се нуждаят от същата защита като услугите, които предоставяме пряко. Атаките чрез изходни данни от инструменти изискват защитни механизми, които проверяват не само обичайния видим текст. Продължаваме да подобряваме защитата на инструментите, обхвата на класификаторите и отказите на моделите, както и да разширяваме прилагането на съответните мерки за контрол сред облачните ни партньори.
Действията ни ще продължат да се съсредоточават в три области: по-силна техническа защита срещу извличане, по-добро откриване и противодействие на координирани кампании и по-задълбочен обмен на информация за заплахи между сектора и държавните институции.

