Frenem una campanya coordinada de destil·lació de models
Recentment hem identificat i desarticulat una campanya coordinada per extreure raonament protegit dels nostres models. Les primeres activitats observades es remunten a la primera setmana de juliol. Aquesta activitat encaixa amb la destil·lació adversària: l'ús sistemàtic i no autoritzat de les respostes o del raonament d'un model per ajudar a entrenar, reproduir o millorar un altre model. El raonament protegit és el registre intern que genera el model mentre resol una tasca; extreure'l pot revelar informació omesa de la resposta final i ajudar altres persones a reproduir les capacitats del model.
Els responsables no van trencar el nostre xifratge, ni van comprometre cap base de dades, ni van accedir directament a les converses emmagatzemades dels usuaris. En lloc d'això, van manipular les interaccions amb els models perquè el raonament protegit es pogués reproduir en formats visibles per al sol·licitant, de manera coordinada i a gran escala, infringint les nostres condicions del servei. Aquesta manipulació no és una vulnerabilitat exclusiva dels models d'OpenAI, i n'hem compartit informació amb socis del sector a través del Frontier Model Forum per reforçar les defenses col·lectives contra la destil·lació adversària.
Abans de publicar aquesta informació, vam investigar l'abast i el possible impacte de l'activitat, vam aplicar mesures de mitigació pròpies i vam compartir informació amb investigadors i socis del sector i recollir-ne les aportacions per assegurar-nos que hi hagués proteccions contra aquest tipus d'atac. La tasca de mitigació i investigació continua. Creiem que compartir ara el que hem après ajudarà tot l'ecosistema a reforçar les seves defenses.
Vam observar intents d'extreure raonament protegit amb mètodes nous, com ara copiar raonament xifrat d'una conversa i demanar a un model, en una altra conversa, que desxifrés i transcrivís el contingut ocult d'aquest raonament.
Investigadors de seguretat independents(s'obre en una finestra nova) també ens van alertar, mitjançant un procés de divulgació responsable, de vulnerabilitats relacionades que afectaven les interaccions entre models i la condensació de context de converses. Vam investigar les seves troballes i vam confirmar que les vies d'atac que havien identificat eren reals. La seva feina ens va ajudar a entendre millor aquesta categoria d'atacs en conjunt i a accelerar les mesures de mitigació.
L'activitat va començar l'1 de juliol, inicialment amb un volum baix, fins que vam observar pics els dies 24 i 25 de juliol: 16.000 sol·licituds1 de més de 4.000 usuaris que feien servir un patró d'extracció vinculat a aquesta activitat. La investigació posterior va identificar activitat amb patrons d'indicacions relacionats en un grup de més de 15.000 usuaris. El 28 de juliol ja havíem aturat completament aquesta activitat.
L'activitat va anar evolucionant, cosa que confirma que la destil·lació adversària és un repte de seguretat més ampli que requereix defenses adaptatives en diverses capes.
No és clar si totes les persones que vam observar duent a terme aquesta activitat durant el període en qüestió actuaven per compte d'un únic actor. Tanmateix, atribuïm un nucli central de l'activitat a persones vinculades a Moonshot AI, l'empresa desenvolupadora de Kimi.
La destil·lació adversària comporta riscos tant per a la seguretat dels sistemes d'IA com per a la seguretat nacional. El raonament extret es podria utilitzar per entrenar un altre model sense mantenir les salvaguardes aplicades a les respostes del model original que reben els usuaris. A gran escala, la destil·lació també pot accelerar la transferència de capacitats avançades sense exigir la mateixa inversió en seguretat. Aquests riscos s'accentuen a mesura que els models adquireixen capacitats en àmbits de doble ús.
Aquest risc no és exclusiu d'OpenAI. Com hem esmentat, tècniques similars poden afectar altres sistemes avançats d'IA. Per tant, es tracta d'un repte de seguretat compartit que requereix coordinació entre tots els agents del sector.
Vam mitigar aquesta campanya recent de destil·lació combinant mesures contra els comptes implicats, controls tècnics i coordinació amb els nostres socis. Vam bloquejar o restringir comptes fraudulents, reforçar els controls de registre i d'infraestructura i ampliar la supervisió de les xarxes relacionades.
També vam reforçar les proteccions del raonament ocult entre usuaris, espais de treball, organitzacions i famílies de models. Vam tancar una via que permetia a algú que ja disposés del raonament xifrat d'un altre usuari tornar-lo a enviar i recuperar-ne el contingut. També vam afegir comprovacions per detectar i retenir les respostes transmeses en continu que poguessin exposar raonament. Quan es va traslladar activitat relacionada a serveis de tercers, vam col·laborar amb aquests proveïdors per identificar els comptes implicats i aturar-ne l'activitat.
Finalment, vam compartir les troballes rellevants a través del Frontier Model Forum i dels canals governamentals d'intercanvi d'informació pertinents perquè altres desenvolupadors de models d'avantguarda i socis del sector públic poguessin buscar activitats similars i reforçar les seves defenses. Els sistemes que admeten artefactes de raonament portables o que es poden tornar a enviar poden estar exposats a riscos similars.
Preveiem que els intents de destil·lació adversària es tornaran més sofisticats a mesura que millorin els models d'avantguarda i que els actors busquin maneres més econòmiques d'imitar-ne les capacitats. Defensar-se d'aquesta activitat requereix controls en diverses capes i una adaptació contínua.
Aquesta tasca encara no s'ha acabat. Els desplegaments allotjats pels nostres socis necessiten les mateixes proteccions que els serveis propis, i els atacs a través de les sortides de les eines requereixen proteccions que analitzin més enllà del text visible habitual. Continuem millorant les defenses de les eines, la cobertura dels classificadors i la capacitat dels models de rebutjar sol·licituds, i estenem els controls pertinents als nostres socis de serveis al núvol.
La nostra resposta continuarà centrant-se en tres àmbits: proteccions tècniques més sòlides contra l'extracció, millors mecanismes de detecció i d'actuació contra les campanyes coordinades, i un intercanvi més ampli d'informació sobre amenaces entre el sector i les administracions públiques.

