Прескокни до главната содржина
OpenAI

30 септември 2026 г.

Сигурност

Спречување координирана кампања за дестилација на модели

Се вчитува...

Неодамна откривме и спречивме координирана кампања за извлекување на заштитеното расудување од нашите модели. Најраната забележана активност беше во првата недела од јули. Оваа активност одговара на злонамерна дестилација: систематско и неовластено користење на излезните податоци или расудувањето на еден модел за обука, репродукција или подобрување на друг модел. Заштитеното расудување е внатрешниот запис на моделот за процесот на решавање задача. Неговото извлекување може да открие информации што се изоставени од конечниот одговор и да им помогне на други да ги репродуцираат способностите на моделот.

Извршителите не ја пробија нашата енкрипција, не компромитираа база на податоци и не добија директен пристап до зачуваните кориснички разговори. Наместо тоа, ги манипулираа интеракциите со моделите за да го репродуцираат заштитеното расудување во облици видливи за подносителот на барањето. Тоа го правеа координирано и во голем обем, со што ги прекршија нашите услови за користење. Ранливоста што ја користи оваа манипулација не е својствена само за моделите на OpenAI. Споделивме информации за неа со партнери од индустријата преку Форумот за гранични модели за да ја зајакнеме заедничката одбрана од злонамерна дестилација.

Пред објавувањето, ги истраживме обемот и потенцијалното влијание, спроведовме сопствени мерки за ублажување на ризикот и споделивме информации со истражувачи и партнери од индустријата. Ги зедовме предвид и нивните повратни информации за да се осигураме дека е воспоставена заштита од овој вид напад. Продолжуваме со истрагата и со дополнителни мерки за ублажување на ризикот. Веруваме дека споделувањето на досегашните сознанија ќе му помогне на поширокиот екосистем да ја зајакне својата одбрана.

Што забележавме

Забележавме обиди на извршителите да го извлечат заштитеното расудување на нови начини, меѓу кои и копирање шифрирано расудување од еден разговор и барање до модел во друг разговор да ја дешифрира и препише скриената содржина на расудувањето.

Независни истражувачи за безбедност⁠(се отвора во нов прозорец), преку одговорно пријавување, ни укажаа и на сродни ранливости што вклучуваат различни модели и компакција на разговори. Ги истраживме нивните наоди и потврдивме дека начините на напад што ги идентификуваа навистина се изводливи. Нивната работа ни помогна да ја разбереме пошироката категорија напади и побрзо да спроведеме мерки за ублажување на ризикот.

Активноста започна на 1 јули, првично во мал обем. На 24 и 25 јули забележавме нагли скокови: 16.000 барања1 од над 4.000 корисници, со соодветна шема за извлекување. Со понатамошната истрага откривме поврзана активност со слични шеми на промптови во група од над 15.000 корисници, која целосно ја прекинавме до 28 јули.

Активноста се менуваше со текот на времето, што дополнително потврдува дека злонамерната дестилација е поширок безбедносен предизвик кој бара повеќеслојна, приспособлива одбрана.

Нашата проценка за тоа кој стои зад активноста

Не е јасно дали сите извршители што ги забележавме во релевантниот период дејствувале во име на еден ист субјект. Сепак, клучна група од овие активности им припишуваме на поединци поврзани со Moonshot AI, компанијата што го развива Kimi.

Зошто е ова важно

Злонамерната дестилација носи ризици за безбедноста, вклучително и за националната безбедност. Извлеченото расудување би можело да се користи за обука на друг модел, без да се задржат заштитните мерки што се применуваат врз излезните податоци на оригиналниот модел наменети за корисниците. Кога се спроведува во голем обем, дестилацијата може и да го забрза преносот на напредни способности без да бара исто ниво на вложување во безбедноста. Оваа загриженост се зголемува како што моделите стекнуваат способности во области со двојна намена.

Овој ризик не се однесува само на OpenAI. Како што е наведено погоре, слични техники може да влијаат и врз други напредни системи со вештачка интелигенција. Затоа ова е заеднички безбедносен предизвик што бара координација низ целата индустрија.

Како реагиравме

Ја сузбивме оваа неодамнешна кампања за дестилација со комбинација од мерки против кориснички сметки, технички контроли и координација со партнерите. Ги забранивме или ограничивме сметките што се користеа за измама, ги зајакнавме контролите при регистрација и во инфраструктурата и го проширивме следењето на поврзаните мрежи.

Ја зајакнавме и заштитата на скриеното расудување меѓу корисници, работни простори, организации и семејства модели. Затворивме патека што му овозможуваше на некој што веќе поседува шифрирано расудување на друг корисник повторно да го поднесе и да ја добие неговата содржина. Додадовме и проверки за откривање и задржување на излезните податоци што се испорачуваат во тек, а кои би можеле да го откријат расудувањето. Кога поврзаната активност се префрли на услуги од трети страни, соработувавме со тие даватели за да ги идентификуваме засегнатите сметки и да ја прекинеме нивната активност.

На крај, споделивме релевантни наоди преку Форумот за гранични модели и соодветни владини канали за размена на информации. Така, другите развивачи на гранични модели и партнерите од јавниот сектор можат да проверат дали има слична активност и да ја зајакнат сопствената одбрана. Системите што поддржуваат артефакти на расудување што може да се пренесуваат или повторно да се поднесуваат може да се соочат со сродни ризици.

Што следува

Очекуваме обидите за злонамерна дестилација да станат пософистицирани како што се подобруваат граничните модели и како што извршителите бараат поевтини начини да ги имитираат нивните способности. Одбраната од оваа активност бара повеќеслојни контроли и постојано приспособување.

Оваа работа сѐ уште не е завршена. На системите што ги хостираат партнерите им е потребна истата заштита како и на услугите што ги обезбедуваме директно. Нападите преку излезните податоци од алатките бараат заштитни мерки што проверуваат повеќе од обичниот видлив текст. Продолжуваме да ја подобруваме заштитата на алатките, опфатот на класификаторите и одбивањето несоодветни барања од страна на моделите, како и да ги воведуваме релевантните контроли кај партнерите за облачни услуги.

Нашиот одговор и понатаму ќе се фокусира на три области: посилна техничка заштита од извлекување, подобро откривање на координирани кампањи и преземање мерки против нив, како и потемелна размена на информации за закани меѓу индустријата и владините институции.

Автор

OpenAI

Фусноти

  1. 1

    Овие бројки се однесуваат на обиди за извлекување, а не нужно на успешно извлекување.