Fermata una campagna coordinata di distillazione di modelli
Abbiamo recentemente individuato e interrotto una campagna coordinata volta a estrarre il ragionamento protetto dai nostri modelli. Le prime attività osservate risalgono alla prima settimana di luglio. Questa attività è riconducibile alla distillazione avversaria: l'uso sistematico e non autorizzato degli output o del ragionamento di un modello per contribuire ad addestrare, riprodurre o migliorare un altro modello. Il ragionamento protetto è la traccia interna dei passaggi con cui il modello affronta un compito; estrarlo può rivelare informazioni escluse dalla risposta finale e aiutare altri a riprodurre le capacità del modello.
Gli autori non hanno violato la nostra crittografia, compromesso un database né ottenuto accesso diretto alle conversazioni archiviate degli utenti. Hanno invece manipolato le interazioni con i modelli per riprodurre il ragionamento protetto in forme visibili a chi inviava le richieste, agendo in modo coordinato e su larga scala, in violazione dei nostri termini di servizio. Questa manipolazione non sfrutta una vulnerabilità esclusiva dei modelli di OpenAI. Abbiamo condiviso informazioni al riguardo con i partner del settore attraverso il Frontier Model Forum per rafforzare le difese collettive contro la distillazione avversaria.
Prima della pubblicazione, abbiamo indagato sulla portata e sul potenziale impatto dell'attività, adottato misure di mitigazione e condiviso le informazioni con ricercatori e partner del settore, raccogliendone i riscontri per assicurarci che fossero attive protezioni contro questo tipo di attacco. Proseguono le ulteriori attività di mitigazione e indagine. Riteniamo che condividere ora ciò che abbiamo appreso aiuterà l'intero ecosistema a rafforzare le proprie difese.
Abbiamo osservato tentativi di estrarre il ragionamento protetto con metodi inediti, tra cui copiare il ragionamento crittografato da una conversazione e chiedere a un modello, in un'altra conversazione, di decifrare e trascrivere il contenuto del ragionamento nascosto.
Anche alcuni ricercatori di sicurezza indipendenti(si apre in una nuova finestra) ci hanno segnalato, tramite divulgazione responsabile, vulnerabilità correlate che coinvolgono più modelli e il compattamento delle conversazioni. Abbiamo esaminato i loro risultati e confermato che i percorsi di attacco individuati erano effettivamente sfruttabili. Il loro lavoro ci ha aiutato a comprendere la categoria più ampia di attacchi a cui appartengono questi casi e ad accelerare le misure di mitigazione.
L'attività è iniziata il 1° luglio, con volumi inizialmente contenuti. Il 24 e il 25 luglio abbiamo poi osservato picchi per un totale di 16.000 richieste1 da oltre 4.000 utenti, basate su uno schema di estrazione riconducibile alla campagna. Ulteriori indagini hanno individuato attività con schemi di prompt correlati in un gruppo di oltre 15.000 utenti. Entro il 28 luglio le avevamo interrotte del tutto.
L'attività si è evoluta nel tempo, confermando che la distillazione avversaria è una sfida di sicurezza più ampia, che richiede difese su più livelli e capaci di adattarsi.
Non è chiaro se tutti gli autori delle attività osservate nel periodo in esame facessero capo a un unico soggetto. Attribuiamo tuttavia un nucleo centrale di queste attività a persone associate a Moonshot AI, l'azienda che sviluppa Kimi.
La distillazione avversaria comporta rischi per la sicurezza, anche a livello nazionale. Il ragionamento estratto potrebbe essere usato per addestrare un altro modello senza preservare le misure di salvaguardia applicate agli output del modello originale destinati agli utenti. Su larga scala, la distillazione può anche accelerare il trasferimento di capacità avanzate senza richiedere lo stesso investimento nella sicurezza. Queste preoccupazioni aumentano man mano che i modelli acquisiscono capacità in ambiti a duplice uso.
Questo rischio non riguarda solo OpenAI. Come indicato sopra, tecniche simili possono colpire altri sistemi di IA avanzati: si tratta quindi di una sfida di sicurezza condivisa, che richiede coordinamento in tutto il settore.
Abbiamo contrastato questa recente campagna di distillazione combinando provvedimenti sugli account, controlli tecnici e coordinamento con i partner. Abbiamo bloccato gli account fraudolenti o ne abbiamo limitato l'uso, rafforzato i controlli sulle registrazioni e sull'infrastruttura ed esteso il monitoraggio delle reti correlate.
Abbiamo inoltre rafforzato le protezioni del ragionamento nascosto tra utenti, spazi di lavoro, organizzazioni e famiglie di modelli. Abbiamo chiuso un canale che permetteva a chi già possedeva il ragionamento crittografato di un altro utente di reinviarlo e recuperarne il contenuto, e aggiunto controlli per rilevare e trattenere gli output in streaming che potrebbero esporre il ragionamento. Quando le attività correlate si sono spostate su servizi di terze parti, abbiamo collaborato con i rispettivi fornitori per individuare e bloccare gli account coinvolti.
Infine, abbiamo condiviso i risultati pertinenti attraverso il Frontier Model Forum e gli appositi canali governativi di scambio di informazioni, affinché altri sviluppatori di modelli di frontiera e partner del settore pubblico potessero cercare attività simili e rafforzare le proprie difese. I sistemi che supportano artefatti di ragionamento trasferibili o riutilizzabili in altre interazioni possono essere esposti a rischi analoghi.
Ci aspettiamo che i tentativi di distillazione avversaria diventino più sofisticati man mano che i modelli di frontiera migliorano e che gli autori degli attacchi cercano modi più economici per imitarne le capacità. Difendersi da queste attività richiede controlli su più livelli e un adattamento continuo.
Questo lavoro non è concluso. Le implementazioni ospitate dai partner richiedono le stesse protezioni dei servizi gestiti direttamente, e gli attacchi tramite gli output degli strumenti richiedono protezioni che non si limitino a esaminare il normale testo visibile. Continuiamo a migliorare le difese degli strumenti, la copertura dei classificatori e i meccanismi di rifiuto dei modelli, e a estendere i controlli pertinenti ai partner cloud.
La nostra risposta continuerà a concentrarsi su tre aree: protezioni tecniche più solide contro l'estrazione, maggiore capacità di rilevare e contrastare le campagne coordinate e una più ampia condivisione delle informazioni sulle minacce tra il settore e le istituzioni governative.

