Пређите на главни садржај
OpenAI

30. септембар 2026.

Безбедност

Сузбијање координисане кампање дестилације модела

Учитавање…

Недавно смо открили и сузбили координисану кампању усмерену на извлачење заштићеног резоновања из наших модела. Прве активности забележене су у првој недељи јула. Ова активност одговара злонамерној дестилацији: систематском и неовлашћеном коришћењу излазних података или резоновања једног модела ради обуке, репродуковања или унапређења другог модела. Заштићено резоновање је интерни запис модела о процесу решавања задатка. Његовим извлачењем могу се открити информације изостављене из коначног одговора и помоћи другима да репродукују способности модела.

Извршиоци нису пробили нашу енкрипцију, компромитовали базу података нити стекли директан приступ сачуваним разговорима корисника. Уместо тога, манипулисали су интеракцијама са моделима како би се заштићено резоновање репродуковало у облицима видљивим подносиоцу захтева. То су радили координисано и у великом обиму, кршећи наше услове коришћења. Ова манипулација не представља рањивост својствену само моделима компаније OpenAI. Информације о њој поделили смо са партнерима у сектору преко организације Frontier Model Forum, како бисмо ојачали заједничку одбрану од злонамерне дестилације.

Пре објављивања истражили смо обим и потенцијални утицај, применили сопствене мере ублажавања ризика и поделили сазнања са истраживачима и партнерима у сектору. Узели смо у обзир и њихове повратне информације како бисмо осигурали да заштита од ове врсте напада буде успостављена. Настављамо истрагу и рад на додатним мерама ублажавања ризика. Верујемо да ће дељење досадашњих сазнања помоћи ширем екосистему да ојача своју одбрану.

Шта смо уочили

Уочили смо да извршиоци покушавају да извуку заштићено резоновање на нове начине. Између осталог, копирали су шифровано резоновање из једног разговора и тражили од модела у другом разговору да дешифрује и препише скривени садржај резоновања.

Независни истраживачи безбедности⁠(отвара се у новом прозору) такође су нам, кроз одговорно пријављивање, указали на сродне рањивости које се јављају при коришћењу различитих модела и при компакцији разговора. Испитали смо њихове налазе и потврдили да су начини напада које су идентификовали заиста изводљиви. Њихов рад нам је помогао да разумемо ширу класу напада и убрзамо примену мера за ублажавање ризика.

Активност је почела 1. јула, у почетку у малом обиму. Затим смо 24. и 25. јула забележили нагле скокове: више од 4.000 корисника упутило је 16.000 захтева1 користећи релевантан образац извлачења. Даљом истрагом открили смо сродне активности са сличним обрасцима инструкција у групи од више од 15.000 корисника, које смо до 28. јула у потпуности сузбили.

Активност се временом мењала, што додатно потврђује да је злонамерна дестилација шири безбедносни изазов који захтева вишеслојну, прилагодљиву одбрану.

Наша процена о томе ко стоји иза активности

Није јасно да ли су сви извршиоци које смо уочили у посматраном периоду деловали у оквиру истог актера. Међутим, главну групу активности приписујемо појединцима повезаним са компанијом Moonshot AI, која развија Kimi.

Зашто је ово важно

Злонамерна дестилација носи ризике по безбедност, укључујући националну безбедност. Извучено резоновање могло би да се користи за обуку другог модела без очувања заштитних мера које се примењују на одговоре изворног модела приказане корисницима. Када се спроводи у великом обиму, дестилација може и да убрза пренос напредних способности без потребе за истим улагањима у безбедност. Ове забринутости постају још веће како модели стичу способности у областима двоструке намене.

Овај ризик није својствен само компанији OpenAI. Као што је већ наведено, сличне технике могу да угрозе и друге напредне системе вештачке интелигенције, па је ово заједнички безбедносни изазов који захтева координацију у целом сектору.

Како смо реаговали

Ову недавну кампању дестилације сузбили смо комбинацијом мера против налога који крше правила, техничких контрола и координације са партнерима. Забранили смо или ограничили налоге коришћене за превару, појачали контроле при регистрацији и на нивоу инфраструктуре и проширили надзор над повезаним мрежама.

Такође смо појачали заштиту скривеног резоновања на нивоу корисника, радних простора, организација и породица модела. Онемогућили смо поступак којим је неко ко већ поседује шифровано резоновање другог корисника могао поново да га проследи и открије његов садржај. Додали смо и провере које откривају и задржавају излазне податке током њиховог постепеног слања ако би могли да открију резоновање. Када су се повезане активности одвијале преко услуга трећих страна, сарађивали смо са тим пружаоцима услуга како бисмо идентификовали укључене налоге и зауставили њихово деловање.

На крају, поделили смо релевантне налазе преко организације Frontier Model Forum и одговарајућих државних канала за размену информација. Тиме смо омогућили другим организацијама које развијају граничне моделе и партнерима из јавног сектора да потраже сличне активности и ојачају сопствену одбрану. Системи који подржавају преносиве записе резоновања или записе који се могу поново проследити могу се суочити са сродним ризицима.

Шта следи

Очекујемо да ће покушаји злонамерне дестилације постајати све софистициранији како гранични модели буду напредовали, а актери тражили јефтиније начине да опонашају њихове способности. Одбрана од ових активности захтева вишеслојне контроле и стално прилагођавање.

Овај посао још није завршен. Системима који раде на инфраструктури партнера потребна је иста заштита као и услугама које пружамо директно, а напади преко излазних података алата захтевају заштиту која испитује више од обичног видљивог текста. Настављамо да унапређујемо заштиту алата, обухват класификатора и одбијање недозвољених захтева од стране модела, као и да ширимо примену релевантних контрола код партнера који пружају услуге у облаку.

Наш одговор ће и даље бити усмерен на три области: јачу техничку заштиту од извлачења, боље откривање координисаних кампања и спровођење мера против њих, као и интензивнију размену информација о претњама унутар сектора и са државним органима.

Аутор

OpenAI

Фусноте

  1. 1

    Ови подаци односе се на покушаје извлачења, који нису нужно били успешни.