Cap a argumentacions de seguretat per a l'entrenament d'IA d'avantguarda
Creiem que estem entrant en una nova era en què caldria exigir documentació de seguretat estructurada abans de continuar qualsevol execució d'entrenament per reforç de models d'avantguarda. Idealment, aquesta documentació hauria d'assolir el nivell de les "argumentacions de seguretat": argumentacions exhaustives, estructurades i basades en proves sobre el risc, que ja s'utilitzen en altres sectors on la seguretat és crítica. Considerem les argumentacions de seguretat un objectiu ambiciós que orienta la nostra feina, tot reconeixent les dificultats per fer-les tan rigoroses per als models d'IA com ho són en l'aviació o l'energia nuclear, atesa la complexitat que emergeix amb cada nou nivell de capacitat de la IA. Estem treballant en un marc per sistematitzar aquestes pràctiques.
A continuació presentem unes primeres directrius que creiem que haurien de formar part d'aquestes argumentacions de seguretat per a l'entrenament d'IA d'avantguarda. Aquestes bones pràctiques reflecteixen el que hem après fins ara, i preveiem que evolucionin a mesura que continuem refinant els processos interns per a un desenvolupament prudent. Les compartim ara per donar a conèixer amb transparència el nostre plantejament actual i convidar la comunitat a fer-hi aportacions. Cal tenir present que aquest document se centra en l'entrenament per reforç de models d'avantguarda; el desplegament intern i extern requereix considerar un conjunt molt més ampli de propietats d'alineament.
Les argumentacions de seguretat haurien de cobrir tres aspectes de l'arquitectura tècnica: l'entrenament per a l'alineament, la contenció i la supervisió. Aquestes salvaguardes ajuden a garantir que el model no intenti dur a terme accions desalineades i que, fins i tot si ho intentés, li fos difícil superar les barreres de contenció i la supervisió ho detectés abans que es produís cap dany.
Alineament dels models: La primera línia de defensa hauria de ser entrenar els models perquè estiguin alineats; és a dir, perquè actuïn de manera fiable tal com volem. Això podria incloure:
Entorns d'entrenament i puntuació: Reduir el risc que els models desenvolupin comportaments desalineats, evitant que durant l'entrenament es reforci positivament la manipulació del sistema de recompenses. Això podria incloure:
Revisions automatitzades dels conjunts de dades: Fer servir agents per detectar i corregir entorns d'aprenentatge per reforç defectuosos que podrien permetre que trajectòries desalineades rebessin recompenses elevades aprofitant vulnerabilitats, en lloc de seguir el comportament previst, i reduir així les oportunitats de reforçar el desalineament durant l'entrenament.
Revisions manuals dels conjunts de dades: Complementar les proves automatitzades d'equip vermell amb revisions manuals i controls de qualitat dels conjunts de dades per identificar tasques defectuoses que podrien reforçar involuntàriament comportaments desalineats.
Ajust dels sistemes de puntuació: Ajustar els sistemes de puntuació perquè penalitzin els intents del model d'explotar vulnerabilitats o manipular els entorns d'aprenentatge per reforç durant l'entrenament.
Anàlisi d'execucions anteriors: Aplicar classificadors als registres d'execució d'experiments anteriors per assegurar que els sistemes de puntuació funcionen com s'espera.
Mesura de l'alineament: Executar avaluacions que facin un seguiment de les propensions del model al desalineament per mesurar l'eficàcia de l'entrenament per a l'alineament. Això podria incloure:
Avaluacions d'alineament fora de línia: Executar avaluacions d'alineament durant les execucions d'entrenament de models d'avantguarda per valorar si l'entrenament funciona com s'espera, i investigar qualsevol regressió significativa.
Validació retrospectiva: Validar retrospectivament les avaluacions d'alineament amb incidents anteriors per confirmar que detecten models que ja havien mostrat desalineament i que no s'estan sobreajustant a incidents concrets.
Seguiment de la manipulació de les avaluacions: Fer un seguiment de la consciència de l'avaluació o del metajoc (quan els models reconeixen que se'ls està posant a prova) que puguin induir un canvi de comportament, amb llindars de bloqueig específics (p. ex., activant sistemes de supervisió de la consciència de l'avaluació i del metajoc en les avaluacions d'alineament).
Proves d'estrès en el pitjor dels casos: Induir els pitjors comportaments indeguts possibles i comprovar que almenys una avaluació els detectaria.
Evitar l'entrenament basat en la cadena de pensament: No permetre que els sistemes de puntuació automatitzats vegin la cadena de pensament durant l'aprenentatge per reforç, per evitar que els models evolucionin per eludir els sistemes de supervisió de la cadena de pensament.
Contenció: Si un model es desalinea, cal que l'aïllament i la seguretat siguin prou sòlids per impedir que es duguin a terme accions perjudicials. Això podria incloure:
Múltiples capes de seguretat de la infraestructura: Invertir decididament a reforçar tant l'entorn aïllat on s'executa el model com la infraestructura de recerca que l'allotja, per garantir una capa de protecció addicional en cas que el model escapi de l'entorn aïllat.
Proves d'equip vermell de la contenció: Millorar la seguretat de l'entorn aïllat, de la infraestructura de recerca i del perímetre sotmetent aquests sistemes a proves iteratives d'equip vermell amb punts de control d'execucions d'entrenament de models d'avantguarda, subjectes a una anàlisi de seguretat, per detectar i corregir qualsevol mancança. Sotmetre també a proves d'equip vermell tots els serveis amb què el model pugui interactuar durant l'entrenament (p. ex., la memòria cau d'internet).
Comunicació entre mostres: Limitar la comunicació d'alta amplada de banda entre mostres a les vies aprovades, com ara les eines multiagent, i tancar els canals laterals de la infraestructura que tinguin una amplada de banda elevada i siguin fàcils de descobrir pels agents.
Transcripcions immutables: Desar les transcripcions dels agents de manera immutable durant un període de temps raonable (per exemple, en comptes d'emmagatzematge d'escriptura única) en tots els entrenaments per reforç, avaluacions i desplegaments interns, per permetre investigar els incidents de manera fiable i evitar modificacions involuntàries.
Supervisió: Disposar d'un sistema de supervisió en temps real per detectar qualsevol possible desalineament si els models comencen a dur a terme accions desalineades, i abordar ràpidament els problemes prioritaris abans que es produeixi un incident greu. Això podria incloure:
Garantir la capacitat de supervisió: Assegurar que els models continuïn sent supervisables, mesurant-ho amb avaluacions de la capacitat de supervisió i de l'evasió dels sistemes de supervisió amb llindars clars, per detectar aviat els comportaments preocupants.
Alta sensibilitat als problemes coneguts: Assegurar que el sistema de supervisió tingui una alta sensibilitat als incidents passats en una avaluació amb dades reservades.
Actualització de les avaluacions dels sistemes de supervisió: Crear casos d'avaluació representatius de riscos inèdits per a les noves execucions, de manera que les mesures de sensibilitat i precisió dels sistemes de supervisió no quedin obsoletes.
Resposta ràpida: Implementar alertes prioritàries que es tradueixin en una actuació dins d'un termini definit en un acord de nivell de servei, ja sigui avisant una persona de guàrdia o posant automàticament en pausa l'execució afectada, abans que el model causi danys (p. ex., avisar el personal de seguretat de guàrdia i el responsable de l'execució dels incidents durant el dia, i posar les execucions en pausa automàticament si no es confirma la recepció de les alertes durant la nit).
A més de les recomanacions sobre salvaguardes tècniques, hem estat treballant en bones pràctiques operatives per a les argumentacions de seguretat de les execucions d'entrenament d'IA d'avantguarda. Aquestes pràctiques podrien incloure:
Informes discrepants (anàlisis preventives): Un cop redactada l'argumentació de seguretat, un membre d'un altre equip hauria d'elaborar un informe discrepant per detectar-hi possibles mancances i aportar una valoració ponderada del risc. L'equip d'entrenament hauria de donar-hi resposta per reforçar l'argumentació de seguretat.
Aprovacions: L'argumentació de seguretat hauria de ser revisada per membres de l'alta direcció, cadascun dels quals hauria de poder vetar l'execució per garantir que passi per diversos controls interns (p. ex., el responsable o vicepresident de recerca, el cap de seguretat i el director científic).
Rendició de comptes: L'alt càrrec responsable d'una execució d'entrenament (p. ex., el responsable o vicepresident de recerca) hauria de retre comptes de l'argumentació de seguretat i de la resposta a qualsevol incident, també en les avaluacions del seu rendiment, de manera que els equips d'entrenament tinguin incentius per impulsar la seguretat i l'alineament.
Pausa de les execucions: Si es detecten problemes que invalidarien una argumentació de seguretat (p. ex., un nou problema de seguretat), cal garantir que hi hagi manuals de procediments, controls tècnics i acords de nivell de servei per posar en pausa totes les execucions cobertes.
Transparència interna: Les argumentacions de seguretat haurien d'estar a disposició dels òrgans de supervisió interna (p. ex., el Comitè de Protecció i Seguretat).
Auditories: Els auditors haurien de disposar de prou accés per verificar que les afirmacions de l'argumentació de seguretat són vàlides i sòlides, i per assenyalar les mancances que hi detectin.
Comunicació a instàncies superiors: Hauria d'existir un procés clar per comunicar problemes de desalineament a instàncies superiors, amb una taula de nivells de gravetat definits i un responsable de guàrdia en matèria de desalineament que pugui alertar els directius (p. ex., el director general) quan una execució arribi a un determinat nivell de gravetat.
Controls tècnics: Hauria de ser difícil, tant per a les persones com per als agents, iniciar execucions que incompleixin els requisits. Les funcions de seguretat, com ara la supervisió i la pausa automàtica, haurien de bloquejar l'execució en cas de fallada (p. ex., no hauria de ser possible iniciar execucions sense la supervisió adequada activada, ni desactivar el sistema de supervisió des de dins de l'entrenament per reforç, l'avaluació o un desplegament intern).
Capacitat de reversió: Hauria de ser fàcil identificar tots els usos posteriors d'un model desalineat dins del procés d'entrenament (per exemple, la generació de dades o la puntuació) per poder desfer, si cal, els efectes de les sortides desalineades.
Exhaustivitat dels riscos residuals: Les argumentacions de seguretat haurien d'enumerar, de la manera més exhaustiva possible, els riscos residuals que no cobreixen les mesures de mitigació ja implementades, per permetre prendre decisions informades sobre l'acceptació del risc.
Aquestes són les nostres recomanacions actuals i les estem implementant a OpenAI. Preveiem que les nostres pràctiques continuïn evolucionant durant les pròximes setmanes.
També hem estat desenvolupant bones pràctiques per investigar incidents greus de desalineament de la IA. Els laboratoris haurien d'intentar aprendre tant com sigui possible de cada incident (de manera similar a les pràctiques d'investigació(s'obre en una finestra nova) d'altres sectors d'alt risc) per evitar que es repeteixin en el futur. Alguns exemples d'aquestes mesures podrien ser:
Transparència interna: Com que una investigació pot trigar força temps a completar-se, caldria informar periòdicament, a escala interna, de l'estat de les investigacions d'incidents (p. ex., amb actualitzacions diàries de les investigacions en curs). Els empleats haurien de disposar de vies definides per obtenir més accés, incloent-hi les transcripcions sense processar i la possibilitat d'obtenir mostres de models desalineats, sempre que sigui segur i pertinent per a la seva feina.
Causa arrel del desalineament: Els investigadors haurien d'identificar les causes arrel en la dinàmica d'entrenament (p. ex., mitjançant experiments d'ablació selectiva o de remostreig) per entendre com s'han introduït els comportaments desalineats, aprofundir en el coneixement científic del desalineament i prevenir-lo millor en el futur.
Anàlisi posterior a l'incident: Caldria fer una anàlisi operativa i de cultura organitzativa per entendre totes les causes que han contribuït a l'incident, com ara per què s'han introduït problemes i per què no s'han detectat o comunicat a instàncies superiors abans de l'incident.
Detecció: Hauríem de desenvolupar mètodes de prova de l'alineament capaços de descobrir la propensió a causar l'incident, sense optimitzar-los iterativament i de manera directa a partir d'informació derivada de l'incident (p. ex., transcripcions o resums de l'incident). Caldria crear avaluacions derivades dels incidents com a "proves de regressió", per garantir que els models futurs no mostrin propensió al desalineament en incidents molt similars.
Divulgació pública: Els resultats de la investigació, les anàlisis posteriors a l'incident i els canvis operatius s'haurien de fer públics un cop conclosa la investigació. Caldria notificar-ho a les terceres parts afectades tan aviat com fos possible.


