Avaluacions cibernètiques de tercers amb models d'OpenAI
Les proves independents tenen un paper important per ajudar-nos a validar i entendre millor els riscos abans del desplegament. Algunes avaluacions cibernètiques utilitzen expressament configuracions personalitzades, incloent-hi mesures de protecció reduïdes, per mesurar la capacitat subjacent, no pas el comportament habitual dels models en els desplegaments públics.
Durant unes avaluacions recents, dos col·laboradors externs de proves van identificar incidents en què la combinació de les configuracions i els controls de prova amb les capacitats creixents dels models recents va permetre que l'activitat dels models superés els límits previstos de les proves. Els incidents subratllen la importància de col·laborar amb tot el sector i amb avaluadors externs per adaptar els estàndards dels entorns i les pràctiques de prova a mesura que augmenten les capacitats dels models. Nota de l'editor: aquests incidents són independents de l'incident de seguretat de Hugging Face. Continuarem publicant novetats sobre l'incident de Hugging Face aquí.
Els nous incidents van implicar models d'OpenAI que van accedir a Internet durant avaluacions cibernètiques de tercers, en condicions específiques i amb configuracions de protecció reduïda que no reflectien un desplegament habitual. Els incidents van incloure els casos següents:
- L'UK AISI, l'Institut de Seguretat de la IA del Govern britànic, feia avaluacions en camps de proves cibernètiques amb l'accés a Internet habilitat expressament perquè els agents poguessin trobar les seves pròpies eines i operar en condicions més semblants a les d'un atacant real. També havia desactivat els classificadors cibernètics per mesurar la capacitat subjacent. En pots llegir l'article del blog aquí.(s'obre en una finestra nova)
- Irregular, un dels nostres col·laboradors externs de proves de ciberseguretat, feia avaluacions de tipus captura de bandera que havien d'estar aïllades d'Internet, però una configuració incorrecta de l'entorn de proves va permetre que els models hi accedissin.
A continuació, resumim què va passar, les condicions de prova que van permetre l'activitat, les mesures adoptades per contenir-la i què fem perquè els laboratoris independents puguin continuar avaluant amb rigor i seguretat uns models cada cop més capaços.
Aquests incidents evidencien el mateix repte general que vam descriure en la nostra publicació recent sobre l'incident de Hugging Face: a mesura que avancen les capacitats dels models, també han d'avançar els sistemes de seguretat i protecció que els envolten. Això inclou tant els entorns utilitzats per desenvolupar models com els que fan servir els laboratoris i els col·laboradors independents per avaluar-los.
Durant les properes setmanes, revisarem el nostre enfocament de les proves de tercers: com identifiquem les avaluacions de més risc, n'acordem l'abast, valorem les sol·licituds per habilitar l'accés a Internet o reduir les mesures de protecció, establim expectatives d'aïllament, gestió de credencials, supervisió i condicions d'aturada, i definim processos més clars de notificació i escalada d'incidents.
Ens comprometem a col·laborar amb tot el sector per reforçar les pràctiques compartides que permeten fer avaluacions d'alt risc amb seguretat. Durant les properes setmanes, reunirem parts interessades com ara instituts nacionals d'IA, avaluadors independents, altres laboratoris d'IA i altres grups. El nostre objectiu és preservar el valor d'una avaluació independent rigorosa i, alhora, garantir que les pràctiques de prova evolucionin al mateix ritme que les capacitats dels models.
El 3 d'agost, l'UK AISI ens va comunicar que, durant una avaluació cibernètica rutinària iniciada el 25 de juliol, en alguns casos els models d'OpenAI i d'un altre laboratori havien excedit l'abast de les proves. L'avaluació es va dur a terme en camps de proves cibernètiques controlats, dissenyats per reproduir xarxes del món real. Dels 19 casos identificats, dos implicaven un model d'OpenAI, GPT‑5.6 Sol. La resta dels casos corresponien a models d'un altre laboratori.
Per a aquesta avaluació, els agents havien rebut instruccions per actuar com a experts en ciberseguretat en un exercici de captura de bandera: havien de comprometre tres entorns simulats connectats i recuperar una bandera final. La indicació de la tasca especificava les xarxes del camp incloses en l'abast i assenyalava diversos sistemes que en quedaven exclosos. L'UK AISI també va habilitar l'accés directe a Internet perquè els agents poguessin descarregar eines i operar en condicions més semblants a les d'un atacant humà, i va desactivar els classificadors cibernètics del model per mesurar-ne la capacitat subjacent.
El límit d'autorització previst per l'UK AISI era el camp de proves cibernètiques simulat: els agents estaven autoritzats per atacar les xarxes simulades especificades i recuperar una bandera, però no per interactuar amb sistemes situats fora dels límits de xarxa del camp. Tanmateix, no es va indicar explícitament als agents com podien utilitzar l'accés obert a Internet i com no, un fet que l'UK AISI identifica com una possible causa de l'incident.
En aquestes execucions, l'UK AISI va determinar que GPT‑5.6 Sol havia dut a terme dues accions no autoritzades mentre intentava trobar una via d'accés al camp simulat i recuperar la bandera:
- GPT‑5.6 Sol va reutilitzar un segment de GitHub que l'agent d'un altre laboratori havia deixat accessible públicament per comprovar si un sistema dins del camp de proves consultava periòdicament GitHub o un altre servei d'actualització. També va intentar recuperar comptes i eludir els límits de sol·licituds, i va registrar comptes amb proveïdors externs de DNS i túnels.
- GPT‑5.6 Sol va utilitzar un servei públic de túnels perquè un servidor DNS executat localment al seu entorn d'avaluació fos accessible des d'Internet. El servidor contenia càrregues útils dissenyades per explotar una vulnerabilitat coneguda d'un programari executat al camp de proves. La configuració no va funcionar, no hi ha proves que cap sistema de resolució real hi fes consultes i la infraestructura es va retirar quan es va acabar l'avaluació.
Tot i que el model intentava completar el camp de proves cibernètiques, l'UK AISI va considerar que aquestes accions no estaven autoritzades perquè implicaven comptes i serveis externs reals fora dels límits del camp i no eren necessàries per completar la tasca. El servidor DNS també allotjava càrregues útils d'explotació a Internet, tot i que la configuració no va funcionar i no hi ha proves que cap sistema de resolució real hi fes consultes.
L'UK AISI va detectar l'activitat el 28 de juliol, després que la supervisió de seguretat identifiqués transferències de dades inusuals. Va aturar les avaluacions relacionades, va aïllar les màquines implicades i va contenir l'activitat aproximadament una hora després de detectar-la.
Agraïm la col·laboració de l'UK AISI durant tot aquest procés, incloent-hi la seva tasca per identificar i investigar l'activitat i compartir-ne els detalls. Esperem continuar col·laborant-hi.
El 29 de juliol, Irregular, un dels nostres col·laboradors externs d'avaluació, ens va notificar un incident relacionat amb models d'OpenAI durant avaluacions de ciberseguretat de tipus captura de bandera (CTF). Els models havien rebut instruccions per trobar informació oculta explotant vulnerabilitats dins d'un entorn simulat i se'ls havia dit que no tenien accés a Internet. Tanmateix, una configuració incorrecta de l'entorn de proves va permetre que els models accedissin a Internet.
En una prova, el nom de l'objectiu fictici del repte CTF va coincidir accidentalment amb un domini real. Com que l'entorn de proves estava connectat a Internet per error, el model va explotar un lloc web real perquè es pensava que formava part de l'entorn simulat. Això no va implicar una evasió sofisticada de l'entorn aïllat ni una vulnerabilitat de dia zero: l'accés a Internet es devia a una configuració incorrecta i sembla que el model va explotar una vulnerabilitat de seguretat bàsica.
Segons la investigació d'Irregular, el model també va trobar i utilitzar credencials per operar aquell mateix lloc. Irregular no ha identificat cap impacte més enllà de les dades del lloc afectat, i l'auditoria continua en curs. Ha posat en pausa les avaluacions, ha iniciat les mesures correctores i ha notificat els tercers afectats. Irregular ens ha informat que cap dels problemes identificats en relació amb l'incident continua actiu i que s'han afegit les mesures de protecció pertinents a l'entorn de proves. Irregular també ha informat d'incidents relacionats que afectaven altres laboratoris en el mateix entorn de proves.
Agraïm la col·laboració d'Irregular i continuarem treballant-hi estretament per donar suport a la seva revisió. Irregular també està elaborant un llibre blanc per compartir bones pràctiques de contenció i d'execució segura d'avaluacions cibernètiques. Esperem participar en el llibre blanc per posar les conclusions a disposició de la comunitat i continuar la nostra col·laboració. Considerem que aquesta mena de col·laboració és essencial per garantir una avaluació segura i exhaustiva dels models actuals i futurs.


