Verso i dossier di sicurezza per l’addestramento dell’IA di frontiera
Crediamo di essere all’inizio di una nuova era in cui dovrebbe essere richiesta una documentazione strutturata sulla sicurezza prima di proseguire qualsiasi ciclo di addestramento dei modelli di frontiera mediante apprendimento per rinforzo. Idealmente, questa documentazione dovrebbe soddisfare gli standard dei “dossier di sicurezza”: argomentazioni sul rischio complete, strutturate e basate su evidenze, già utilizzate in altri settori in cui la sicurezza è fondamentale. Consideriamo i dossier di sicurezza un obiettivo ambizioso che orienta il nostro lavoro, pur riconoscendo quanto sia difficile renderli rigorosi per i modelli di IA quanto lo sono per l’aviazione o l’energia nucleare, data la complessità che emerge a ogni nuovo livello di capacità dell’IA. Stiamo lavorando a un quadro di riferimento per codificare queste pratiche.
Di seguito presentiamo alcune prime linee guida che, a nostro avviso, dovrebbero far parte dei dossier di sicurezza per l’addestramento dell’IA di frontiera. Queste buone pratiche riflettono quanto abbiamo appreso finora e prevediamo che evolveranno man mano che perfezioneremo i processi interni per uno sviluppo prudente. Le condividiamo ora per rendere trasparente il nostro orientamento attuale e invitare la comunità a inviarci osservazioni. Questo documento si concentra sull’addestramento dei modelli di frontiera mediante apprendimento per rinforzo; l’utilizzo interno ed esterno richiede di considerare un insieme molto più ampio di proprietà di allineamento.
I dossier di sicurezza dovrebbero coprire tre aspetti dell’architettura tecnica: addestramento all’allineamento, contenimento e monitoraggio. Queste misure aiutano a garantire che il modello non tenti azioni disallineate e che, anche se lo facesse, avrebbe difficoltà a eludere il contenimento e verrebbe rilevato dal monitoraggio prima di poter causare danni.
Allineamento dei modelli: la prima linea di difesa dovrebbe essere addestrare i modelli a essere allineati, cioè ad agire in modo affidabile secondo le nostre intenzioni. Ciò potrebbe includere:
Ambienti di addestramento e assegnazione dei punteggi: ridurre il rischio che i modelli sviluppino comportamenti disallineati, impedendo il rinforzo positivo dei tentativi di aggirare il sistema di ricompensa durante l’addestramento. Ciò potrebbe includere:
Revisioni automatizzate dei dataset: usare agenti per individuare e correggere ambienti RL difettosi che potrebbero consentire a sequenze di azioni disallineate di ottenere ricompense elevate sfruttando vulnerabilità anziché adottando il comportamento previsto, riducendo così le occasioni di rinforzare il disallineamento durante l’addestramento.
Revisioni manuali dei dataset: integrare il red teaming automatizzato con revisioni manuali e controlli di qualità sui dataset per individuare compiti difettosi che potrebbero involontariamente rinforzare comportamenti disallineati.
Calibrazione dei valutatori: calibrare i valutatori affinché penalizzino i tentativi del modello di sfruttare vulnerabilità o manipolare gli ambienti RL durante l’addestramento.
Analisi dei cicli precedenti: applicare classificatori alle tracce degli esperimenti precedenti per verificare che i valutatori funzionino come previsto.
Misurazione dell’allineamento: eseguire valutazioni che monitorino la propensione del modello al disallineamento per misurare l’efficacia dell’addestramento all’allineamento. Ciò potrebbe includere:
Valutazioni offline dell’allineamento: eseguire valutazioni dell’allineamento durante i cicli di addestramento dei modelli di frontiera per verificare che l’addestramento funzioni come previsto e indagare su eventuali regressioni significative.
Verifiche retrospettive: verificare le valutazioni dell’allineamento su incidenti passati per confermare che rilevino i modelli risultati disallineati in precedenza e non siano eccessivamente adattate a incidenti specifici.
Monitoraggio dei tentativi di aggirare le valutazioni: monitorare la consapevolezza della valutazione o il metagaming (quando i modelli riconoscono di essere sottoposti a un test), che potrebbero indurre un cambiamento di comportamento, prevedendo soglie specifiche di blocco (ad esempio, attivando sistemi di monitoraggio della consapevolezza della valutazione e del metagaming nelle valutazioni dell’allineamento).
Stress test degli scenari peggiori: provocare i peggiori comportamenti scorretti possibili e verificare che almeno una valutazione sia in grado di rilevarli.
Impedire l’addestramento sulla chain of thought: non consentire ai valutatori automatizzati di vedere la chain of thought durante l’apprendimento per rinforzo, per evitare che i modelli evolvano fino a eludere i sistemi che la monitorano.
Contenimento: qualora un modello diventi disallineato, garantire che l’isolamento nella sandbox e le misure di sicurezza siano abbastanza solidi da impedire azioni dannose. Ciò potrebbe includere:
Sicurezza dell’infrastruttura su più livelli: investire in modo significativo nel rafforzamento sia della sandbox in cui viene eseguito il modello sia dell’infrastruttura di ricerca che la ospita, per garantire un ulteriore livello di protezione in caso di evasione dalla sandbox.
Red teaming del contenimento: migliorare la sicurezza della sandbox, dell’infrastruttura di ricerca e del perimetro, sottoponendo questi sistemi a cicli ripetuti di red teaming con checkpoint dei cicli di addestramento dei modelli di frontiera, previa analisi di sicurezza, per individuare e colmare eventuali lacune. Sottoporre inoltre a red teaming tutti i servizi con cui il modello potrebbe interagire durante l’addestramento (ad esempio, la cache Internet).
Comunicazione tra campioni: limitare la comunicazione ad alta larghezza di banda tra campioni ai canali approvati, come gli strumenti multiagente, e chiudere i canali laterali dell’infrastruttura che offrono un’elevata larghezza di banda e sono facilmente individuabili dagli agenti.
Trascrizioni immutabili: conservare in forma immutabile le trascrizioni degli agenti per un periodo ragionevole (ad esempio, in account di archiviazione a scrittura unica), per tutte le attività di addestramento RL, valutazione e utilizzo interno, così da consentire indagini affidabili sugli incidenti ed evitare modifiche involontarie.
Monitoraggio: qualora i modelli inizino a compiere azioni disallineate, disporre di un sistema di monitoraggio in tempo reale per rilevare ogni potenziale disallineamento e affrontare rapidamente i problemi prioritari prima che si verifichi un incidente grave. Ciò potrebbe includere:
Garantire la monitorabilità: assicurarsi che i modelli restino monitorabili, misurandone la monitorabilità e la capacità di eludere il monitoraggio tramite valutazioni con soglie chiare, per rilevare tempestivamente comportamenti preoccupanti.
Elevata sensibilità ai problemi noti: assicurarsi che il sistema di monitoraggio rilevi un’alta percentuale degli incidenti passati in una valutazione su dati tenuti separati dall’addestramento.
Aggiornamento delle valutazioni dei sistemi di monitoraggio: creare esempi di valutazione rappresentativi dei rischi del tutto nuovi per i nuovi cicli di addestramento, affinché le misure di sensibilità e precisione del monitoraggio non diventino obsolete.
Risposta rapida: implementare avvisi prioritari che portino a un intervento entro i tempi stabiliti da uno SLA, allertando una persona reperibile o sospendendo automaticamente il ciclo interessato prima che il modello causi danni (ad esempio, di giorno allertare il personale di sicurezza reperibile e il responsabile del ciclo in caso di incidente e, di notte, sospendere automaticamente i cicli se gli avvisi non vengono presi in carico).
Oltre alle raccomandazioni sulle misure tecniche di sicurezza, stiamo elaborando buone pratiche operative per i dossier di sicurezza dei cicli di addestramento dell’IA di frontiera. Queste potrebbero includere:
Pareri contrari (analisi pre-mortem): dopo la stesura di un dossier di sicurezza, un membro di un altro team dovrebbe redigere un parere contrario per individuare eventuali lacune e fornire una valutazione ponderata del rischio. Il team di addestramento dovrebbe poi rispondere alle osservazioni, contribuendo così a rendere più solidi i dossier di sicurezza.
Approvazioni: il dossier di sicurezza dovrebbe essere esaminato da membri dell’alta dirigenza, ciascuno con il potere di porre il veto al ciclo di addestramento, così da garantire più livelli di controllo interno (ad esempio, responsabile o vicepresidente della ricerca, responsabile della sicurezza e direttore scientifico).
Responsabilità: il dirigente responsabile di un ciclo di addestramento (ad esempio, responsabile o vicepresidente della ricerca) dovrebbe rispondere del dossier di sicurezza e della gestione di eventuali incidenti, anche nelle valutazioni delle prestazioni, in modo che i team di addestramento siano incentivati a promuovere sicurezza e allineamento.
Sospensione: qualora emergano problemi che invaliderebbero un dossier di sicurezza (ad esempio, un nuovo problema di sicurezza), occorre garantire la disponibilità di procedure operative, controlli tecnici e accordi sui livelli di servizio (SLA) per sospendere tutti i cicli di addestramento coperti dal dossier.
Trasparenza interna: i dossier di sicurezza dovrebbero essere messi a disposizione degli organi di vigilanza interni (ad esempio, il Comitato per la sicurezza e la protezione).
Audit: chi conduce gli audit dovrebbe disporre di un accesso sufficiente a verificare la validità e la solidità delle affermazioni contenute nel dossier di sicurezza e a segnalare eventuali lacune.
Segnalazioni ai livelli superiori: dovrebbe esistere una procedura chiara per segnalare ai livelli superiori i problemi di disallineamento, con una tabella che ne definisca i livelli di gravità e una persona reperibile incaricata di allertare i dirigenti (ad esempio, l’amministratore delegato) quando un ciclo di addestramento raggiunge un determinato livello di gravità.
Controlli tecnici: dovrebbe essere difficile, sia per le persone sia per gli agenti, avviare cicli di addestramento non conformi. Le funzioni di sicurezza, come il monitoraggio e la sospensione automatica, dovrebbero bloccare l’attività in caso di guasto (ad esempio, non dovrebbe essere possibile avviare cicli di addestramento senza un adeguato monitoraggio attivo, né disattivare il sistema di monitoraggio dall’interno dell’ambiente di addestramento RL, di valutazione o di utilizzo interno).
Possibilità di ripristino: dovrebbe essere facile individuare tutti gli utilizzi a valle di un modello disallineato nel processo di addestramento (ad esempio, generazione di dati o valutazione), così da poter annullare, se necessario, gli effetti degli output disallineati.
Completezza dei rischi residui: i dossier di sicurezza dovrebbero elencare, nel modo più esaustivo possibile, i rischi residui non coperti dalle misure di mitigazione già implementate, per consentire decisioni informate sull’accettazione del rischio.
Queste sono le nostre raccomandazioni attuali e sono in corso di attuazione presso OpenAI. Prevediamo che le nostre pratiche continueranno a evolversi nelle prossime settimane.
Stiamo inoltre elaborando alcune buone pratiche per indagare sugli incidenti gravi di disallineamento dell’IA. I laboratori dovrebbero cercare di imparare il più possibile dai singoli incidenti, analogamente alle pratiche di indagine(si apre in una nuova finestra) adottate in altri settori ad alto rischio, per prevenire il ripetersi di questi eventi. Alcuni esempi di azioni possibili:
Trasparenza interna: poiché un’indagine può richiedere molto tempo, dovrebbero essere forniti aggiornamenti interni periodici sul suo andamento (ad esempio, aggiornamenti giornalieri per le indagini in corso). I dipendenti dovrebbero disporre di procedure definite per ottenere un accesso più ampio, anche alle trascrizioni integrali e al campionamento degli output dei modelli disallineati, laddove sia sicuro e pertinente al loro lavoro.
Cause profonde del disallineamento: i ricercatori dovrebbero individuare le dinamiche di addestramento all’origine del problema (ad esempio, tramite ablazioni mirate o esperimenti di ricampionamento) per capire come siano stati introdotti i comportamenti disallineati, comprendere meglio il fenomeno sul piano scientifico e prevenirlo con maggiore efficacia in futuro.
Analisi post-mortem: si dovrebbe condurre un’analisi post-mortem degli aspetti operativi e della cultura organizzativa per comprendere tutte le cause che hanno contribuito all’incidente, ad esempio perché i problemi siano stati introdotti e non siano stati rilevati o segnalati ai livelli superiori prima dell’incidente.
Rilevamento: dovremmo sviluppare metodi di verifica dell’allineamento capaci di individuare la propensione a causare l’incidente, senza ottimizzarli direttamente in base alle informazioni ricavate dall’incidente stesso (ad esempio, trascrizioni o riepiloghi). Le valutazioni ricavate dagli incidenti dovrebbero essere create come “test di regressione”, per garantire che i modelli futuri non mostrino una propensione al disallineamento in incidenti molto simili.
Comunicazioni pubbliche: i risultati delle indagini, le analisi post-mortem e le modifiche operative dovrebbero essere resi pubblici al termine dell’indagine. Le terze parti coinvolte dovrebbero essere informate il prima possibile.


