Resposta a la nova frontera de capacitats cibernètiques crítiques
La ciberseguretat canvia ràpidament a mesura que els models adquireixen capacitats que poden reforçar les defenses cibernètiques, però també permetre atacs a una velocitat i una escala sense precedents.
Les avaluacions internes que hem fet els darrers dies d'Astra, un dels nostres pròxims models, indiquen avenços importants en programació agentiva i ciberseguretat. Aquests resultats, juntament amb les valoracions d'experts, ens van portar ahir a la nit a concloure que no podem descartar capacitats cibernètiques crítiques segons el nostre Entorn de treball de preparació(s'obre en una finestra nova).
Ho compartim perquè creiem que és important ser transparents amb el públic i amb les comunitats de protecció i seguretat sobre aquest possible canvi de capacitats.
Vam publicar per primera vegada l'Entorn de treball de preparació el desembre de 2023, molt abans que els models s'apropessin a aquest nivell de capacitats biològiques, químiques, de ciberseguretat i d'automillora de la IA. El vam crear com a guia per detectar els avenços en les capacitats i planificar què faria la nostra empresa a mesura que sorgissin. S'han avaluat models anteriors, com ara GPT‑5.6‑Sol, per determinar-ne les capacitats cibernètiques d'avantguarda, i s'han classificat en el llindar Alta, no pas en el Crític.
Segons el nostre Entorn de treball de preparació, un model arriba al llindar Crític de ciberseguretat si pot identificar i desenvolupar exploits funcionals de dia zero de tots els nivells de gravetat en molts sistemes crítics reals amb proteccions reforçades, sense intervenció humana, o bé concebre i executar de cap a cap estratègies noves de ciberatac contra objectius amb proteccions reforçades a partir només d'un objectiu general.
Tot i que continuem sotmetent aquest model a proves comparatives i avaluacions, els resultats preliminars són prou sòlids perquè ara com ara no puguem descartar un nivell de capacitat Crític. Astra és un model de pròxima aparició i no va participar en l'explotació de Hugging Face.
Per tant, hem ampliat les proves de robustesa de les nostres salvaguardes i controls de seguretat perquè siguin adequats per desplegar aquestes capacitats. Internament, també hem adoptat les mesures següents perquè el desenvolupament posterior d'aquest model es faci de manera segura:
- Estem implantant controls de seguretat més estrictes per als models amb més capacitats i les activitats associades, com ara entorns de prova aïllats, accés restringit a la xarxa i a les eines, més protecció i xifratge dels pesos dels models, capacitats addicionals de supervisió i detecció, i execució en entorns aïllats.
- Estem aturant les activitats internes relacionades amb Astra que encara no compleixen aquests requisits de control de seguretat reforçats.
- Hem implantat una supervisió universal de les accions arriscades i dels desajustos en totes les aplicacions agentives d'Astra, inclosos l'entrenament i l'avaluació. Els sistemes de supervisió avaluen la cadena de pensament del model i activen una resposta de seguretat per revisar i interrompre les activitats d'alt risc.
- Col·laborarem amb els organismes governamentals pertinents i amb organitzacions seleccionades de seguretat de la IA per provar les capacitats d'aquest model.
- Proporcionarem controls de seguretat recomanats als col·laboradors externs que facin proves perquè puguin executar de manera segura avaluacions i càrregues de treball de més risc.
L'entorn de treball ja ens ha orientat en altres transicions de capacitats. El juny de 2025, quan els nostres models s'apropaven al llindar de capacitat Alta en biologia segons l'Entorn de treball de preparació, vam descriure les mesures que adoptàvem per reforçar les salvaguardes, ampliar les proves, col·laborar amb experts externs i desplegar controls de seguretat addicionals. Aquí apliquem el mateix principi.
Creiem que els models amb capacitats cibernètiques avançades haurien d'ajudar els defensors a identificar i corregir les vulnerabilitats abans que ho facin els atacants. Ens comprometem a col·laborar amb governs, instituts de seguretat i la societat civil perquè les capacitats d'avantguarda de models com Astra, i dels que vindran després, es despleguin de manera responsable i generalitzada en benefici de tota la humanitat.


