Priorità e principi per valutazioni efficaci di terze parti
I laboratori di IA di frontiera hanno un’enorme responsabilità nell’addestrare, valutare e distribuire i modelli in sicurezza. Le valutazioni di terze parti sono essenziali per bilanciare tale responsabilità, ampliare le opportunità di contribuire alla sicurezza dell’IA, tenere informata la società e fare in modo che i laboratori rispondano di affermazioni di sicurezza chiare e corroborate in modo indipendente.
Nell’ambito del nostro impegno per tenere il passo con la frontiera, OpenAI si impegna a sostenere valutazioni indipendenti offrendo ampi livelli di accesso nelle fasi di addestramento, valutazione e distribuzione. Tale accesso deve consentire ai valutatori di mettere in discussione le nostre ipotesi, individuare rischi che potrebbero esserci sfuggiti e giungere a conclusioni autonome sull’efficacia delle nostre misure di protezione.
Da tempo collaboriamo con valutatori terzi nelle diverse fasi del processo di sviluppo e distribuzione dei modelli. Abbiamo inoltre integrato le valutazioni di terze parti nelle nostre pratiche relative al Preparedness Framework e sostenuto organizzazioni e provvedimenti legislativi che promuovono un processo più rigoroso e responsabile. Nel corso di queste collaborazioni abbiamo fornito forme di accesso approfondite, tra cui informazioni sulle nostre misure tecniche di protezione, accesso al chain of thought visibile e livelli senza precedenti di accesso riservato ai dati e alle distribuzioni interne per la risposta agli incidenti e il red teaming dei sistemi di monitoraggio. Le priorità e i principi qui illustrati riguardano la nostra collaborazione con organizzazioni di valutazione indipendenti dei settori privato e non profit nell’ambito delle valutazioni tecniche di sicurezza. Integrano il nostro lavoro con i governi in materia di test e valutazioni, per i quali ruoli e responsabilità distinti possono richiedere approcci diversi.
Per rendere efficaci queste valutazioni servono solidi meccanismi di indipendenza, rigore scientifico, pratiche di sicurezza robuste e responsabilità chiare. I laboratori hanno la responsabilità di consentire un esame approfondito, proteggendo al contempo le informazioni sensibili. I laboratori e i valutatori indipendenti condividono la responsabilità di svolgere correttamente questo lavoro e devono operare secondo standard internazionali condivisi per le pratiche di sicurezza e protezione. Di seguito proponiamo quattro aree prioritarie per valutazioni più approfondite, insieme a principi per un lavoro rigoroso, sicuro e indipendente.
Le valutazioni di terze parti sono più utili quando affrontano domande specifiche e rilevanti: le evidenze corroborano l’argomentazione e le affermazioni di sicurezza di un laboratorio? Le valutazioni verificano adeguatamente i rischi che intendono misurare? Le misure di protezione funzionano in condizioni realistiche?
Le valutazioni qui descritte possono assumere forme diverse a seconda delle questioni di sicurezza esaminate. Prevediamo di sostenere più valutazioni in parallelo e su periodi diversi: alcune dureranno settimane, altre diversi mesi. Sebbene le valutazioni di terze parti possano rientrare anche nelle attività precedenti alla distribuzione e orientare le relative decisioni, il lavoro qui descritto ha generalmente un orizzonte più lungo ed è indipendente dai lanci, poiché mira a esaminare nel tempo e in profondità specifiche affermazioni di sicurezza.
Nelle nostre aree prioritarie e nei nostri principi facciamo riferimento ad affermazioni e argomentazioni di sicurezza. Con questi termini intendiamo quanto segue:
Affermazione di sicurezza: un’affermazione specifica sulle capacità, sul comportamento o sulle misure di protezione di un modello o sistema, rilevante per la sua sicurezza e verificabile sulla base di evidenze. Un’affermazione deve indicare i rischi e le condizioni a cui si riferisce, insieme alle ipotesi e ai limiti pertinenti.
Argomentazione di sicurezza: un’argomentazione strutturata e corroborata da evidenze che spiega perché i rischi di un modello o sistema siano gestiti adeguatamente per una determinata attività, come l’addestramento, la valutazione o la distribuzione. Un’argomentazione di sicurezza collega le singole affermazioni di sicurezza alle evidenze che le corroborano ed esplicita le ipotesi, le incertezze e i rischi residui che potrebbero influire sulle conclusioni.
Proponiamo quattro aree prioritarie per valutazioni più approfondite, insieme a principi per un lavoro rigoroso, sicuro e indipendente.
Valutazione indipendente delle argomentazioni di sicurezza nelle fasi di addestramento, valutazione, distribuzione interna e distribuzione esterna.
La valutazione delle argomentazioni di sicurezza richiede competenze in materia di allineamento, metodi di controllo come il monitoraggio, cybersicurezza, uso improprio in ambito biologico e chimico e red teaming. Le argomentazioni di sicurezza comprendono affermazioni relative all’addestramento, alle valutazioni delle capacità e alle misure di protezione, che possono essere esaminate nel loro insieme o separatamente (si vedano le priorità 2 e 3 di seguito). È probabile che più valutatori debbano esaminare parti diverse delle argomentazioni, mettendo a frutto le rispettive competenze. Nel complesso, le loro valutazioni devono rispondere a domande quali:
Le evidenze a sostegno delle argomentazioni di sicurezza per l’addestramento, la valutazione e la distribuzione sono fondate? Durante l’addestramento, la valutazione e la distribuzione sono state rispettate le condizioni previste dall’argomentazione di sicurezza?
Le nostre argomentazioni di sicurezza contemplano i rischi più urgenti individuati nel corso di una valutazione? Le affermazioni di sicurezza corroborano l’argomentazione di sicurezza complessiva? Esistono lacune o margini di miglioramento?
Vengono adottati metodi efficaci per individuare e ridurre gli incentivi introdotti nell’addestramento che potrebbero premiare l’inganno, il reward hacking, le azioni distruttive o l’elusione delle restrizioni?
Valutazione delle misure di protezione critiche nelle distribuzioni interne ed esterne
Il nostro insieme di misure di protezione evolve costantemente per adattarsi al mutare delle capacità e del contesto. Le nostre misure di protezione riguardano l’addestramento e le distribuzioni interne ed esterne. Attualmente comprendono misure di protezione a livello di modello, misure di applicazione delle regole e misure di sicurezza, oltre a sistemi di monitoraggio del disallineamento, e coprono un’ampia gamma di rischi, come la perdita di controllo e l’uso improprio nei settori informatico, biologico e chimico. Le collaborazioni tecniche possono individuare fin da ora i punti deboli delle misure di protezione, migliorando nel contempo i metodi di valutazione e accelerando lo sviluppo di standard. Ciò offre una base tecnica più solida per le future politiche pubbliche volte a tenere il passo con la frontiera, in particolare per le distribuzioni interne, dove gli standard di sicurezza e protezione sono ancora agli inizi.
Le valutazioni indipendenti devono esaminare l’efficacia di queste misure di protezione e individuarne le eventuali carenze, ponendo domande quali:
Con un accesso “grey box”, le misure di protezione resistono ai test avversari (jailbreak) e tutelano adeguatamente dall’aumento delle capacità in ambiti ad alto rischio, come quello informatico e biologico? I nostri test avversari e le attività di red teaming coprono i rischi più importanti?
Nell’ambito di test autorizzati condotti in condizioni operative realistiche, come interagiscono gli agenti con le difese informatiche, quali controlli degli accessi, sandboxing e sistemi di rilevamento e risposta? Quali difese prevengono, rilevano o contengono le azioni dannose e dove risultano inefficaci?
I nostri sistemi di monitoraggio del disallineamento presentano lacune critiche che potrebbero causare una perdita di controllo o un grave disallineamento nelle distribuzioni interne o esterne? Quanto è affidabile il monitoraggio del chain of thought come fonte di evidenze sulla sicurezza o sull’allineamento, man mano che migliorano le capacità dei modelli?
È stato implementato un monitoraggio adeguato e non facilmente disattivabile per tutte le attività pertinenti di addestramento, valutazione e distribuzione?
Le misure di protezione implementate sono commisurate alle capacità?
Valutazione delle capacità nelle categorie di rischio del Preparedness Framework (rischi chimici e biologici, cybersicurezza, automiglioramento dell’IA) e valutazioni dell’allineamento rispetto ai rischi di disallineamento
Il nostro Preparedness Framework richiede valutazioni delle principali aree di rischio di frontiera. Quando le soglie vengono superate e le valutazioni raggiungono la saturazione, è importante aggiornarle costantemente e garantire la copertura e la qualità sia delle valutazioni delle capacità nelle aree di rischio del Preparedness Framework, sia di quelle dell’allineamento volte a esaminare i rischi di grave disallineamento.
Tra le domande pertinenti figurano:
Le valutazioni dei rischi del Preparedness Framework coprono adeguatamente la definizione delle relative soglie di rischio? Le soglie di queste valutazioni sono impostate correttamente?
Le valutazioni vengono aggiornate quando i modelli ottengono sistematicamente i punteggi più alti? E i nuovi test misurano in modo significativo capacità più avanzate?
Le nostre valutazioni dell’allineamento coprono adeguatamente i rischi di grave disallineamento? Quali comportamenti o condizioni importanti potrebbero non rilevare?
Indagine indipendente sugli incidenti critici di disallineamento
Le indagini indipendenti possono essere preziose per un’ampia gamma di incidenti critici riguardanti la sicurezza dell’IA. Qui ci concentriamo sul disallineamento dei modelli, compresi i casi in cui agiscono senza autorizzazione o eludono la supervisione, comportamenti che possono rivelare debolezze nei metodi di allineamento e nelle misure di protezione anche in assenza di un uso improprio intenzionale.
In determinate circostanze, come nel caso dell’incidente OpenAI Hugging Face, può essere utile coinvolgere una terza parte indipendente per condurre indagini indipendenti sugli incidenti di disallineamento. È essenziale che le terze parti coinvolte nelle indagini sugli incidenti dispongano delle competenze necessarie, tra cui, ove applicabile, competenze di informatica forense e allineamento, capacità di analizzare su larga scala il chain of thought, nonché personale e risorse sufficienti per svolgere tempestivamente le indagini. La risposta agli incidenti può comportare l’accesso a dati interni sensibili e a dati di terze parti; di conseguenza, alcuni dettagli potrebbero essere troppo sensibili per essere pubblicati o resi accessibili. I risultati delle indagini indipendenti possono inoltre contribuire all’argomentazione di sicurezza di un modello, fornendo evidenze per valutare le affermazioni sul suo allineamento e sull’efficacia delle misure adottate per correggere casi di disallineamento osservati in precedenza.
Nel contesto degli incidenti di disallineamento, diamo priorità alle valutazioni indipendenti riguardanti:
Quali comportamenti del modello o problemi di disallineamento si sono verificati durante l’incidente e quali sono stati i principali fattori determinanti?
Le misure di protezione e gli interventi correttivi attenuerebbero efficacemente incidenti analoghi in futuro?
Affermazioni da valutare con un ambito chiaro e concordato: le valutazioni devono iniziare definendo un ambito concordato da entrambe le parti, seguito da affermazioni di sicurezza ben definite e preregistrate prima dell’inizio delle attività di valutazione. Le terze parti e i laboratori devono chiarire se si tratti di affermazioni che l’azienda valutata intende sottoporre a verifica oppure di affermazioni che il valutatore terzo vuole esaminare in modo indipendente e rispetto alle quali il laboratorio accetta di essere valutato. Alcune affermazioni possono non rientrare nell’ambito per molte ragioni, tra cui l’impossibilità per le terze parti di accedere ai dati, la mancanza di competenze sufficienti da parte del valutatore o ragionevoli vincoli di tempo quando la valutazione è urgente. I laboratori e i valutatori devono definire un processo per esaminare i rischi significativi individuati al di fuori dell’ambito originario e stabilire se siano necessarie ulteriori indagini. Le conclusioni devono indicare chiaramente che cosa sia stato valutato e che cosa no rispetto all’ambito concordato.
Accesso proporzionato: ove possibile, i valutatori devono disporre di un accesso proporzionato per esaminare le affermazioni concordate, nel rispetto dei vincoli legali, di sicurezza e di proprietà intellettuale. Quando l’accesso diretto non è praticabile o possibile, i valutatori possono collaborare con un rappresentante designato dell’azienda oppure valutare meccanismi di accesso indiretto o rispettosi della privacy per proteggere le informazioni sottostanti.
Metodologia e standard trasparenti: i valutatori devono illustrare metodi, criteri di valutazione e incertezze, facendo riferimento agli standard consolidati, ove disponibili. Laddove non esistano ancora standard, devono giustificare chiaramente i criteri adottati. I rapporti devono distinguere i risultati diretti dalle interpretazioni, spiegare le incertezze e indicare chiaramente quali conclusioni siano corroborate dalle evidenze.
Competenza e indipendenza: i valutatori devono dimostrare di possedere competenze tecniche pertinenti e individuare, dichiarare e gestire i conflitti di interesse organizzativi e individuali, inclusi incentivi finanziari, rapporti con gli sviluppatori e precedenti coinvolgimenti nel lavoro oggetto di valutazione. Le misure di protezione devono impedire che pressioni commerciali e accordi retributivi influenzino i risultati e possono includere l’astensione o adeguati periodi di esclusione.
Sicurezza e riservatezza: i valutatori devono dimostrare di adottare pratiche di sicurezza delle informazioni e tutele vincolanti della riservatezza per il proprio personale, proporzionate alla sensibilità dei sistemi e delle informazioni a cui accedono. Queste tutele devono riguardare la proprietà intellettuale, le informazioni sensibili e la documentazione delle valutazioni. Se i valutatori non possono soddisfare i requisiti di sicurezza nei propri ambienti o se i dati consultati sono particolarmente sensibili, può essere opportuno consentire l’accesso tramite dispositivi o locali gestiti dall’azienda.
Risultati utilizzabili e tempi per gli interventi correttivi: le valutazioni devono individuare lacune specifiche e fornire ai laboratori dettagli sufficienti per porvi rimedio. Ove opportuno, i laboratori devono disporre di un periodo ragionevole per correggere i problemi prima della pubblicazione. Ove pertinente, i rapporti devono inoltre illustrare gli insegnamenti per gli sviluppatori di agenti, i responsabili della distribuzione e gli addetti alla difesa, con raccomandazioni pratiche per l’implementazione.
Pratiche di pubblicazione responsabili: i rapporti di valutazione devono basarsi su evidenze ed essere condivisi nel modo più aperto possibile, tutelando al contempo le informazioni sensibili e riservate. Quando non è possibile una divulgazione pubblica completa, l’invio di rapporti riservati agli organi di supervisione competenti, come gli organi di governance o i consigli di amministrazione, può favorire la responsabilizzazione. Devono essere predisposte tutele e politiche di oscuramento fondate su principi, oltre ad aspettative chiare riguardo ai riscontri e alla correzione delle inesattezze, per preservare l’equilibrio tra indipendenza e riservatezza. I valutatori devono mantenere l’indipendenza editoriale, garantendo al contempo la tutela della riservatezza e della proprietà intellettuale. I valutatori devono adottare politiche di oscuramento chiare, che consentano ai laboratori di richiedere l’oscuramento di informazioni sensibili e ai valutatori di segnalare gli oscuramenti sostanziali effettuati e il loro impatto sul rapporto di valutazione.
Ci impegniamo a sostenere i valutatori indipendenti e a definire standard internazionali condivisi e più chiari, sia attraverso leggi future sia tramite istituzioni private di governance, per rendere efficaci le valutazioni di terze parti. Sebbene l’ecosistema delle valutazioni indipendenti sia ancora in crescita, contribuiremo al suo sviluppo sostenendo e coinvolgendo una comunità eterogenea di valutatori indipendenti con solide competenze nelle questioni di sicurezza di frontiera. Nessuna singola terza parte può o dovrebbe affrontare in modo esaustivo le questioni urgenti di sicurezza di frontiera. Procederemo in modo ponderato e consapevole per accrescere le nostre capacità e consentire all’ecosistema emergente di terze parti di convergere sulle migliori pratiche e sui principi fondamentali. Stiamo discutendo con diverse terze parti proposte in linea con le aree prioritarie sopra indicate.


