Prioritats i principis per a avaluacions externes eficaces
Els laboratoris d'IA d'avantguarda tenen una responsabilitat immensa a l'hora d'entrenar, avaluar i desplegar models de manera segura. Les avaluacions externes són essencials per equilibrar aquesta responsabilitat, ampliar les oportunitats de contribuir a la seguretat de la IA, mantenir el món informat i fer que els laboratoris responguin d'afirmacions de seguretat clares i sustentades de manera independent.
Com a part dels nostres esforços per marcar el ritme de l'avantguarda, OpenAI es compromet a donar suport a avaluacions independents amb un accés ampli durant l'entrenament, l'avaluació i el desplegament. Aquest accés ha de permetre als avaluadors qüestionar els nostres supòsits, identificar riscos que potser no hem detectat i arribar a conclusions pròpies sobre l'eficàcia de les nostres salvaguardes.
Fa temps que col·laborem amb avaluadors externs en diverses etapes del procés de desenvolupament i desplegament dels models. També hem incorporat avaluacions externes a les nostres pràctiques de l'Entorn de treball de preparació i hem donat suport a organitzacions i lleis que promouen un procés més rigorós i responsable. En aquestes col·laboracions, hem proporcionat formes d'accés ampli, com ara informació sobre les nostres salvaguardes tècniques, accés visible a la cadena de pensament i nivells sense precedents d'accés a dades confidencials i al desplegament intern per respondre a incidents i supervisar l'equip vermell. Les prioritats i els principis que presentem se centren en la nostra col·laboració amb organitzacions independents dels sectors privat i no lucratiu per fer avaluacions tècniques de seguretat. Complementen la nostra feina amb els governs en matèria de proves i avaluacions, en què unes funcions i responsabilitats diferents poden requerir plantejaments diferents.
Perquè aquestes avaluacions siguin eficaces, calen mecanismes d'independència sòlids, rigor científic, pràctiques de seguretat robustes i responsabilitats clares. Els laboratoris tenen la responsabilitat de facilitar un escrutini significatiu i, alhora, protegir la informació sensible. Els laboratoris i els avaluadors independents comparteixen la responsabilitat de fer-ho bé i han de treballar amb estàndards internacionals compartits per a les pràctiques de seguretat. A continuació, proposem quatre àmbits prioritaris per aprofundir en l'avaluació, juntament amb principis per treballar de manera rigorosa, segura i independent.
Les avaluacions externes són més útils quan aborden qüestions específiques i rellevants: les proves sustenten l'argument i les afirmacions de seguretat d'un laboratori? Les avaluacions posen a prova adequadament els riscos que pretenen mesurar? Les salvaguardes funcionen en condicions realistes?
Les avaluacions descrites aquí poden adoptar formes diferents segons les qüestions de seguretat que s'analitzin. Preveiem donar suport a diverses avaluacions en paral·lel i durant períodes diferents: algunes duraran setmanes i d'altres, diversos mesos. Tot i que les avaluacions externes també poden formar part de la feina prèvia al desplegament i orientar-ne les decisions, la feina que descrivim aquí sol ser a més llarg termini i independent dels llançaments: se centra a examinar a fons determinades afirmacions de seguretat al llarg del temps.
En els nostres àmbits prioritaris i principis, fem referència a afirmacions i arguments de seguretat. Amb aquests termes ens referim al següent:
Afirmació de seguretat: afirmació específica sobre les capacitats, el comportament o les salvaguardes d'un model o sistema que afecta la seva seguretat i es pot contrastar amb proves. Una afirmació ha d'identificar els riscos i les condicions que aborda, així com els supòsits i les limitacions pertinents.
Argument de seguretat: argument estructurat i fonamentat en proves que explica per què els riscos d'un model o sistema es gestionen adequadament per a una activitat concreta, com ara l'entrenament, l'avaluació o el desplegament. Un argument de seguretat vincula les diferents afirmacions de seguretat amb les proves que les sustenten i explicita els supòsits, les incerteses i els riscos restants que podrien afectar-ne les conclusions.
Proposem quatre àmbits prioritaris per aprofundir en l'avaluació, juntament amb principis per treballar de manera rigorosa, segura i independent.
Avaluació independent dels arguments de seguretat durant l'entrenament, l'avaluació i els desplegaments intern i extern.
Avaluar els arguments de seguretat requereix expertesa en alineament, mètodes de control com la supervisió, ciberseguretat, ús indegut en els àmbits biològic i químic i equip vermell. Els arguments de seguretat consten d'afirmacions sobre l'entrenament, les avaluacions de capacitats i les salvaguardes, que es poden avaluar conjuntament o per parts (vegeu les prioritats 2 i 3 més avall). Probablement, caldrà que diversos avaluadors examinin diferents parts dels arguments, aportant-hi l'expertesa corresponent. En conjunt, les seves avaluacions han de respondre preguntes com ara:
Estan fonamentades les proves dels arguments de seguretat per a l'entrenament, l'avaluació i els desplegaments? Es van complir les condicions de l'argument de seguretat durant l'entrenament, l'avaluació i el desplegament?
Els nostres arguments de seguretat cobreixen els riscos més urgents detectats durant una avaluació? Les afirmacions de seguretat sustenten l'argument de seguretat general? Hi ha mancances o aspectes que es puguin millorar?
S'utilitzen mètodes eficaços per identificar i reduir els incentius de l'entrenament que podrien recompensar l'engany, l'explotació de la recompensa, les accions destructives o l'elusió de restriccions?
Avaluació de salvaguardes essencials en els desplegaments intern i extern
El nostre conjunt de salvaguardes evoluciona constantment per adaptar-se als canvis en les capacitats i el context. Les nostres salvaguardes abasten l'entrenament i els desplegaments intern i extern. Actualment inclouen salvaguardes en el model, d'aplicació i de seguretat, així com monitors de desalineament, i cobreixen una gran varietat de riscos, com ara la pèrdua de control i l'ús indegut en els àmbits cibernètic, biològic i químic. Les col·laboracions tècniques poden detectar ara les debilitats de les salvaguardes i, alhora, millorar els mètodes d'avaluació i accelerar el desenvolupament d'estàndards. Això proporciona una base tècnica més sòlida per a futures polítiques públiques que marquin el ritme de l'avantguarda, sobretot en els desplegaments interns, on els estàndards de seguretat encara són incipients.
Les avaluacions independents han d'examinar fins a quin punt funcionen aquestes salvaguardes i on poden ser insuficients, per exemple:
Amb accés de "caixa grisa", les salvaguardes resisteixen les proves adversàries (evasions de proteccions de seguretat) i protegeixen prou contra l'augment de capacitats en àmbits d'alt risc, com el cibernètic o el biològic? Les nostres proves adversàries i el nostre equip vermell cobreixen els riscos més importants?
En proves autoritzades i sota condicions operatives realistes, com interactuen els agents amb defenses cibernètiques com els controls d'accés, els entorns aïllats i els sistemes de detecció i resposta? Quines defenses eviten, detecten o contenen les accions perjudicials, i on fallen?
Els nostres monitors de desalineament tenen mancances crítiques que puguin provocar una pèrdua de control o un desalineament greu en els desplegaments tant interns com externs? Fins a quin punt és fiable la supervisió de la cadena de pensament com a font de proves sobre seguretat o alineament a mesura que milloren les capacitats dels models?
S'ha implementat una supervisió adequada en tots els entrenaments, avaluacions i desplegaments pertinents, de manera que no es pugui desactivar fàcilment?
Les salvaguardes implementades són proporcionals a les capacitats?
Avaluació de les capacitats que cobreixi les categories de risc de preparació (riscos químics i biològics, ciberseguretat i automillora de la IA) i avaluacions de l'alineament per als riscos de desalineament
El nostre Entorn de treball de preparació exigeix avaluacions dels principals àmbits de risc fronterer. A mesura que se superen els llindars i les avaluacions se saturen, és important actualitzar constantment i garantir la cobertura i la qualitat tant de les avaluacions de capacitats en àmbits de risc de preparació com de les avaluacions de l'alineament que intenten mesurar els riscos de desalineament greu.
Entre les preguntes pertinents hi ha les següents:
Les avaluacions dels riscos de preparació cobreixen adequadament la definició dels llindars de risc de preparació? Els llindars d'aquestes avaluacions s'han establert correctament?
Les avaluacions s'actualitzen quan els models obtenen sistemàticament les puntuacions més altes, i les proves noves mesuren de manera significativa capacitats més avançades?
Les nostres avaluacions de l'alineament cobreixen adequadament els riscos de desalineament greu, i quins comportaments o condicions importants podrien passar per alt?
Investigació independent d'incidents crítics de desalineament
La investigació independent pot ser valuosa en diversos incidents crítics de seguretat de la IA. Aquí ens centrem en el desalineament dels models, inclosos els models que actuen sense autorització o eludeixen la supervisió, fet que pot revelar debilitats en els mètodes d'alineament i les salvaguardes fins i tot sense un ús indegut intencionat.
En determinades circumstàncies, com en l'incident d'OpenAI a Hugging Face, pot ser útil recórrer a un tercer independent per dur a terme investigacions independents d'incidents de desalineament. És essencial que els tercers implicats en la investigació d'incidents tinguin l'expertesa necessària, inclosos, quan correspongui, coneixements de ciberinvestigació forense i alineament, capacitat per analitzar cadenes de pensament a gran escala, i el personal i els recursos necessaris per investigar amb diligència. La resposta a incidents pot implicar l'accés a dades internes sensibles i a dades de tercers; per tant, alguns detalls poden ser massa sensibles per publicar-los o permetre-hi l'accés. Les conclusions d'investigacions independents també poden contribuir a l'argument de seguretat d'un model aportant proves per avaluar les afirmacions sobre el seu alineament i l'eficàcia de les mesures adoptades per corregir desalineaments observats anteriorment.
En el context dels incidents de desalineament, prioritzem les avaluacions independents sobre:
Quins comportaments del model o problemes de desalineament es van produir durant l'incident, i quins en van ser els principals factors causals?
Les salvaguardes i les mesures correctores mitigarien eficaçment incidents semblants en el futur?
Afirmacions per a l'avaluació amb un abast clar i acordades mútuament: les avaluacions han de començar amb un abast acordat per totes les parts, seguit d'afirmacions de seguretat ben definides i registrades abans que comencin les activitats d'avaluació. Els tercers i els laboratoris han d'aclarir si es tracta d'afirmacions que l'empresa avaluada vol sotmetre a avaluació o bé d'afirmacions que l'avaluador extern pretén analitzar de manera independent i respecte de les quals el laboratori accepta ser avaluat. Hi ha molts motius pels quals algunes afirmacions poden quedar fora de l'abast, com ara la impossibilitat que tercers accedeixin a les dades, la manca de coneixements suficients de l'avaluador o unes restriccions de temps raonables quan l'avaluació és urgent. Els laboratoris i els avaluadors han d'establir un procés per considerar els riscos significatius detectats fora de l'abast original, inclosa la conveniència d'investigar-los més a fons. Les conclusions han d'indicar clarament què s'ha avaluat i què no en relació amb l'abast acordat mútuament.
Accés proporcional: sempre que sigui possible dins dels límits legals, de seguretat i de propietat intel·lectual, els avaluadors han de disposar d'un accés proporcional per avaluar les afirmacions acordades. Quan l'accés directe no sigui viable o possible, els avaluadors poden treballar amb un representant designat de l'empresa o explorar mecanismes d'accés indirecte o que preservin la privadesa per protegir la informació subjacent.
Metodologia i estàndards transparents: els avaluadors han d'explicar els seus mètodes, criteris d'avaluació i incerteses, basant-se en estàndards establerts quan n'hi hagi. Quan encara no hi hagi estàndards, han de justificar clarament els criteris que utilitzen. Els informes han de distingir les troballes directes de les interpretacions, explicar la incertesa i deixar clar quines conclusions sustenten les proves.
Expertesa i independència: els avaluadors han d'acreditar l'expertesa tècnica pertinent i identificar, declarar i abordar els conflictes d'interessos organitzatius i individuals, inclosos els incentius econòmics, les relacions amb els desenvolupadors i la participació prèvia en el treball avaluat. Les salvaguardes s'han de dissenyar per garantir que les pressions comercials i els acords de remuneració no influeixin en les conclusions, i poden incloure l'abstenció o períodes d'exclusió adequats.
Seguretat i confidencialitat: els avaluadors han d'acreditar pràctiques de seguretat de la informació i proteccions de confidencialitat exigibles aplicables al seu personal, proporcionals a la sensibilitat dels sistemes i de la informació als quals accedeixen. Aquestes proteccions han d'abastar la propietat intel·lectual, la informació sensible i els registres de l'avaluació. Quan els avaluadors no puguin complir els requisits de seguretat en els seus entorns, o quan les dades consultades siguin especialment sensibles, pot ser adient accedir-hi des de dispositius o instal·lacions gestionats per l'empresa.
Troballes aplicables i temps per corregir deficiències: les avaluacions han d'identificar mancances concretes i proporcionar prou detalls perquè els laboratoris les puguin resoldre. Quan sigui pertinent, els laboratoris han de disposar d'un termini raonable per corregir els problemes abans de la publicació. Quan sigui pertinent, els informes també han d'explicar les lliçons per als desenvolupadors, responsables del desplegament i defensors d'agents, amb recomanacions pràctiques per aplicar-les.
Pràctiques de publicació responsables: els informes d'avaluació s'han de basar en proves i compartir-se tan obertament com sigui possible, tot protegint la informació sensible i confidencial. Quan no sigui possible divulgar públicament tota la informació, la comunicació confidencial als òrgans de supervisió adients, com ara òrgans de govern o consells d'administració, pot afavorir la rendició de comptes. Cal establir proteccions i polítiques de supressió basades en principis, així com expectatives clares sobre els comentaris i la correcció d'inexactituds, per preservar l'equilibri entre independència i confidencialitat. Els avaluadors han de mantenir la independència editorial i, alhora, garantir les proteccions de confidencialitat i propietat intel·lectual. Els avaluadors han d'adoptar polítiques de supressió clares que permetin als laboratoris sol·licitar la supressió d'informació sensible; alhora, els avaluadors poden indicar on s'han fet supressions substancials i com afecten l'informe d'avaluació.
Ens comprometem a donar suport als avaluadors independents i a establir estàndards internacionals compartits més clars —tant mitjançant lleis futures com mitjançant institucions privades de governança— per aconseguir avaluacions externes eficaces. Tot i que l'ecosistema d'avaluació independent encara està creixent, contribuirem al seu desenvolupament donant suport i treballant amb una comunitat diversa d'avaluadors independents amb una gran expertesa en qüestions de seguretat d'avantguarda. Cap tercer pot ni ha d'abastar exhaustivament totes les qüestions urgents de seguretat d'avantguarda. Avançarem de manera deliberada i intencionada per ampliar la nostra capacitat i permetre que el creixent ecosistema de tercers s'alineï amb les millors pràctiques i principis. Estem conversant amb diversos tercers sobre propostes que s'ajusten als àmbits prioritaris anteriors.


