Salta al contingut principal
OpenAI

18 d’agost del 2026

EmpresaPublicació

Regular el ritme de desenvolupament dels models en una era de capacitats cibernètiques crítiques

S'està carregant…

Durant les darreres setmanes, dos fets han posat de manifest els riscos creixents associats a sistemes d'IA cada cop més capaços: l'incident entre OpenAI i Hugging Face i, d'altra banda, els indicis preliminars que un dels nostres pròxims models, Astra, podria assolir el llindar de capacitat crítica de ciberseguretat establert al nostre Entorn de treball de preparació. Aquests fets, juntament amb el ràpid progrés de la nostra recerca interna, han fet més urgent la tasca de reforçar les salvaguardes de supervisió, alineament i contenció en totes les etapes del procés d'entrenament.

A mesura que els models guanyen capacitats, també augmenten els riscos associats a desenvolupar-los i provar-los internament. Els nostres estàndards de supervisió, alineament i seguretat s'han de mantenir per davant d'aquests riscos. Volíem dedicar el temps necessari a complir aquests estàndards, per això vam alentir temporalment el ritme d'escalat. Això va incloure una pausa de dues setmanes en l'entrenament amb aprenentatge per reforç (RL) dels nostres models més recents destinats al desplegament, mentre reforçàvem i sotmetíem a proves d'equip vermell els entorns de recerca i ampliàvem la cobertura dels sistemes de supervisió. La nostra execució prevista més gran d'RL d'avantguarda continua en pausa mentre fem entrenaments i avaluacions a menor escala per analitzar el comportament dels models, validar les salvaguardes i obtenir més indicis d'alineament abans de continuar.

L'alineament —la tasca de fer que els sistemes d'IA es comportin com es pretén i responguin a la supervisió humana— és des de fa temps un element central del nostre programa de recerca. Ara exigim proves més sòlides d'un comportament alineat durant tot l'entrenament, a partir de la recerca i les avaluacions que ja estan en curs. Mantenir alineats uns sistemes cada cop més capaços és un repte que haurà d'abordar tot el sector. Els senyals que observem en el progrés dels pròxims models deixen clar que necessitem un enfocament més ampli, que parteixi de l'Entorn de treball de preparació actual i vagi més enllà.

Creiem que és important explicar amb transparència com està canviant el nostre enfocament. A continuació, descrivim els canvis que ja hem aplicat als processos i la infraestructura de recerca, així com la feina que encara està en curs.

Reforç de les salvaguardes per als models més capaços

El nostre enfocament per desenvolupar models més capaços es basa en tres salvaguardes que es reforcen mútuament:

  1. La supervisió, que detecta comportaments preocupants i ens permet respondre-hi.
  2. L'alineament, que redueix la probabilitat d'accions perjudicials o no autoritzades.
  3. Les mesures de seguretat, que limiten allò a què els sistemes d'IA poden accedir o afectar.

Preveiem que aviat els models assumiran la major part de la tasca de seguretat, inclosa la defensa contra altres models. Això permetrà que les tres salvaguardes s'adaptin a les capacitats dels models, cosa que considerem essencial.

Apliquem aquestes salvaguardes tant en la recerca com en el desplegament i les adaptem a les capacitats, l'entorn operatiu i el nivell de risc de cada model.

Protecció dels nostres entorns de recerca

A mesura que els models d'avantguarda adquireixen més capacitats de ciberseguretat, elevem els estàndards de seguretat dels entorns on els entrenem i avaluem. Complir aquests estàndards ha requerit una feina d'enginyeria considerable i ha comportat grans costos i retards en la recerca d'avantguarda. Immediatament després de l'incident entre OpenAI i Hugging Face*, vam aturar la inferència de models d'avantguarda als clústers de recerca per a les execucions que podien executar codi o utilitzar eines amb accés a Internet. Vam restablir amb força rapidesa una via més limitada i segura per executar codi i, després, vam revisar individualment cada càrrega de treball per determinar si es podia reprendre amb seguretat. Algunes càrregues de treball de recerca es van reprendre amb aquests nous controls, mentre que d'altres van requerir canvis addicionals.

Durant les setmanes següents, hem definit i començat a aplicar requisits de seguretat més estrictes per a les càrregues de treball de recerca d'avantguarda. Per exemple:

  • Aïllament de les càrregues de treball: ara exigim un aïllament més estricte ("entorns aïllats") per a les càrregues que executen codi generat per models o qualsevol altre codi no fiable. Això també s'aplica al programari que es podria veure compromès en processar els resultats dels models.
  • Aïllament de xarxa: hem implementat més controls per aïllar d'Internet les càrregues de treball de més risc i les que no són fiables. Hem dissenyat aquests controls perquè el compromís d'una sola càrrega de treball o servei de suport no permeti, per si sol, accedir sense autorització a Internet ni a altres xarxes internes.
  • Proves de seguretat contínues: hem reconfigurat l'entorn per eliminar serveis compartits potencialment vulnerables, reduir els privilegis permanents i millorar els límits de seguretat i confiança. També estem millorant la capacitat de recopilar i supervisar els registres de seguretat. Finalment, invertim en automatització i fem servir els nostres models per provar contínuament aquests límits davant d'atacs simulats.

En conjunt, aquests controls ofereixen una defensa en profunditat i ajuden a protegir el nostre entorn de recerca contra els atacs. Actualment, exigim el nivell més estricte de salvaguardes de seguretat per a les càrregues de treball relacionades amb Astra o amb models cibernètics, ja que hem determinat que els models Astra podrien tenir un nivell crític de capacitat cibernètica. Aquestes salvaguardes també s'apliquen a totes les altres càrregues de treball relacionades amb l'àmbit cibernètic.

Tot i que alguns entrenaments i avaluacions d'Astra compleixen aquests requisits, un nombre considerable de càrregues de treball continuen en pausa fins que s'hagin migrat completament i reforçat per complir el nou estàndard de seguretat. Prioritzem la migració de les càrregues de treball de seguretat i alineament a aquests nous entorns.

Ampliació de la supervisió de la cadena de pensament

La supervisió és des de fa temps una part important del nostre procés de desenvolupament de models, inclosa la supervisió d'agents interns de programació i de les sessions de llarga durada. Els nostres esforços de supervisió se centraven especialment en els desplegaments interns de models d'avantguarda i en les execucions d'entrenament d'RL d'avantguarda, que consideràvem les càrregues de més risc perquè poden combinar capacitats avançades dels models amb accés a eines, sistemes sensibles i xarxes internes o externes. No s'aplicaven a totes les execucions d'inferència i entrenament que utilitzaven eines. Hem revisat i ampliat el nostre enfocament amb el nou sistema de supervisió.

Aquest nou sistema de supervisió consta de diverses etapes. Comença amb classificadors d'activació —detectors que examinen l'activitat interna d'un model— que s'executen en cada segment mostrejat i remeten els possibles problemes a investigadors automatitzats cada cop més sofisticats i amb més capacitat de còmput. Aquests sistemes examinen les accions de les eines, el raonament disponible i tota la seqüència d'activitat per detectar accessos no autoritzats, robatoris de dades, comportaments destructius i intents d'eludir les salvaguardes. El nostre objectiu és emetre una alerta en un termini de 30 minuts des que el sistema de supervisió detecta una activitat preocupant. Si el sistema de supervisió identifica una probable vulneració d'un límit de seguretat crític, genera una alerta de màxima prioritat. En la implementació actual, s'avisa els equips de seguretat operacional, protecció i recerca. Si en un termini de 30 minuts no poden determinar de manera concloent que l'avís és un fals positiu, aquests equips han d'aturar l'activitat.

Aquesta supervisió és obligatòria per a tots els entrenaments i avaluacions d'RL amb eines de models amb capacitats de Sol o superiors. Quan el 7 d'agost vam determinar que Astra podria tenir capacitats cibernètiques crítiques, vam afegir un requisit de supervisió addicional per a totes les inferències d'Astra amb eines, no només per als entrenaments i les avaluacions d'RL.

Aquestes salvaguardes requereixen una capacitat de còmput considerable. Segons les nostres estimacions actuals, la sobrecàrrega de supervisió equival aproximadament al 20% del còmput d'inferència supervisat, tot i que el cost varia substancialment entre les càrregues de treball d'entrenament i avaluació. Compartirem més detalls sobre aquest sistema en una pròxima entrada del blog.

Impuls de la recerca sobre alineament

La recerca sobre alineament és fonamental per a la nostra missió. La nostra missió és garantir que la intel·ligència artificial general beneficiï tota la humanitat. A mesura que els models adquireixin capacitats avançades, com ara la de dur a terme ciberatacs, i operin en entorns més complexos, els comportaments no alineats —com l'explotació de la recompensa (trobar maneres d'obtenir recompenses elevades durant l'entrenament sense assolir realment el resultat previst), l'engany o l'accés no autoritzat— generaran riscos cada cop més greus.

En les execucions d'RL dels models més capaços, ara apliquem les nostres tècniques principals d'alineament en més etapes del procés d'entrenament. Això inclou millorar els models de recompensa perquè detectin i desincentivin millor els comportaments insegurs en diverses tasques i entorns; entrenar els models perquè siguin més sincers sobre les seves accions, capacitats i limitacions, i reduir els comportaments que exploten febleses en les recompenses, els avaluadors, les eines o la supervisió. També ampliem la cobertura de l'entrenament per als comportaments que podrien causar danys quan els models interactuen amb sistemes o recursos externs.

Continuem invertint decididament en la recerca sobre alineament, ampliant la cobertura de les avaluacions i aplicant allò que aprenem a l'entrenament i les salvaguardes. Tenim previst compartir ben aviat molta més informació sobre la nostra recerca en alineament, inclòs el que estem aprenent sobre el comportament dels models i qualsevol repte nou que descobrim.

Pròxims passos

Farem evolucionar el nostre Entorn de treball de preparació per integrar aquestes salvaguardes en l'entrenament i el desplegament, i perquè reflecteixi millor les capacitats dels models futurs i els entorns on operen. Desenvolupar mètodes que puguin adaptar-se a aquestes capacitats requerirà una inversió sostinguda en seguretat assistida per models, una supervisió més eficaç i avenços continus en la recerca sobre alineament. Tenim la intenció d'implicar-hi organitzacions externes i compartir més coneixements a mesura que evolucioni el nostre enfocament.

Les capacitats dels models d'avantguarda avancen ràpidament. La nostra capacitat per entendre'ls, alinear-los i protegir-los s'ha de mantenir per davant.


*Durant les pròximes setmanes publicarem un informe tècnic sobre allò que hem après.

Autor

OpenAI