Resum de seguretat: GPT‑6 Astra
S'està carregant…
Avui llancem GPT‑6 Astra, el model més capaç que hem desplegat mai de manera generalitzada. Astra és el nostre primer model que assoleix el nivell crític de capacitat de ciberseguretat segons l'Entorn de treball de preparació.
Els aspectes més importants sobre la seguretat d'aquest llançament són els següents:
- GPT‑6 Astra representa un avenç important en capacitats de ciberseguretat i assoleix el nostre llindar crític. Això vol dir que, amb les eines i l'accés adequats, GPT‑6 Astra pot trobar vulnerabilitats de seguretat desconegudes fins ara i desenvolupar noves maneres d'explotar-les en molts sistemes ben protegits, sense que una persona n'hagi de guiar cada pas. Per això, hem reforçat considerablement les proteccions contra accions cibernètiques perjudicials del model, tant si es deuen a un ús indegut com a una desalineació. També hem adoptat mesures per protegir el desenvolupament i el desplegament interns d'Astra i de models similars, com ara un aïllament més estricte, el xifratge dels punts de control, la supervisió universal de trajectòries completes —incloent-hi les cadenes de pensament (CoT)— i un procés d'avaluació d'alineació amb bloqueig abans de l'ús intern.
- GPT‑6 Astra és considerablement més robust que els seus predecessors. Gràcies a noves tècniques d'entrenament de seguretat orientades a la robustesa, GPT‑6 Astra és molt més resistent a les evasions de proteccions de seguretat que GPT‑5.6 Sol, fins i tot en trajectòries més llargues. Ho sabem gràcies a proves fora de línia i al nostre programa rigorós de proves internes i externes d'evasió de proteccions de seguretat i de correcció de vulnerabilitats. Per als usuaris identificats com a potencialment d'alt risc, també hem entrenat el model perquè pugui ajustar el llindar de rebuig de manera més conservadora i cobreixi un ventall més ampli de riscos de doble ús. Fem proves de regressió per garantir que Astra resisteixi les evasions de proteccions de seguretat detectades en períodes de proves anteriors, i hem dut a terme noves rondes automatitzades d'equip vermell amb els nostres atacants interns més recents per validar les millores.
- GPT‑6 Astra està més ben alineat que GPT‑5.6 Sol. Astra representa un avenç important en l'alineació dels models i incorpora millores que comprenen des de la composició de les dades de preentrenament fins a l'avaluació durant l'aprenentatge per reforç. Presentem un nou conjunt d'avaluacions d'alineació(s'obre en una finestra nova) i constatem que GPT‑6 Astra respecta millor els límits de seguretat i es manté dins del seu àmbit autoritzat. En una simulació amb més de 54.000 tasques internes de Codex(s'obre en una finestra nova), Astra també va rebre aproximadament la meitat d'alertes per comportaments desalineats de gravetat elevada que Sol.
- Estem desplegant àmpliament la supervisió de la desalineació. Considerem que l'alineació dels models és el principal mecanisme per evitar possibles comportaments desalineats dels nostres models. Tanmateix, la supervisió ofereix una visibilitat àmplia del comportament dels models d'avantguarda i permet detectar oportunitats per continuar millorant-ne l'alineació i la seguretat. A més, la supervisió proporciona una capa addicional de protecció contra els comportaments desalineats que es detecten. Per aquests motius, també hem incorporat la supervisió de la desalineació a totes les inferències que utilitzen eines en el desplegament extern d'Astra, amb un cost computacional considerable. Aquest sistema és anàleg a la nostra configuració interna.
- La supervisabilitat de GPT‑6 Astra ha disminuït respecte de GPT‑5.6 Sol. Hem investigat a fons la supervisabilitat(s'obre en una finestra nova) i la controlabilitat(s'obre en una finestra nova) de GPT‑6 Astra. Hem constatat que GPT‑6 Astra és més capaç de controlar la seva pròpia CoT que GPT‑5.6 Sol i menys propens a incloure-hi informació incriminatòria. En situacions adversàries, en què intentem que el model eludeixi els nostres sistemes de supervisió, observem que pot passar desapercebut quan redueix estratègicament el seu rendiment en les avaluacions (infrarepresentació estratègica de capacitats) i que, de vegades, pot eludir els nostres sistemes interns quan se li demana que executi determinades tasques de sabotatge(s'obre en una finestra nova). No hem observat indicis de raonament CoT esteganogràfic —per exemple, raonament ocult dins de text corrent i aparentment irrellevant—, cosa que indica que el risc d'evasió podria limitar-se principalment a tasques de raonament més senzilles.
- Aquestes conclusions indiquen que els models de la classe Astra podrien eludir els nostres sistemes de supervisió de la CoT en condicions d'adversari. Ara mateix, aquestes conclusions es basen sobretot en avaluacions d'adversari —és a dir, quan indiquem al model que eludeixi la supervisió— i, en conjunt, les nostres avaluacions d'alineació mostren que Astra és menys propens que GPT‑5.6 Sol a infringir les restriccions de seguretat.
- Tanmateix, ens prenem seriosament aquesta tendència i continuem investigant aquestes conclusions i les seves implicacions per a la supervisabilitat a mesura que augmenten les capacitats dels nostres models. OpenAI ha treballat per preservar i aprofitar la supervisió de la cadena de pensament, i mantenir la supervisabilitat de la CoT és un objectiu central del programa de recerca. Tanmateix, aquests resultats també subratllen la importància de desenvolupar tècniques d'auditoria de l'alineació que vagin més enllà d'examinar la cadena de pensament del model.
- GPT‑6 Astra actua de manera més responsable en navegar i en entorns laborals: GPT‑6 Astra és considerablement més resistent a les injeccions d'indicacions que GPT‑5.6 Sol. També hem provat el comportament del model en entorns realistes de navegació i d'ús professional d'ordinadors, i hem constatat que és molt menys probable que dugui a terme accions desalineades i potencialment destructives —com ara transaccions no autoritzades, pèrdua de dades, accés excessiu o elusió de controls— que GPT‑5.6 Sol. També actua amb més seguretat quan gestiona sol·licituds perjudicials en entorns amb agents, com ara peticions d'ajuda per planificar un atac violent o cometre frau.
- GPT‑6 Astra és considerablement més segur en situacions de risc elevat. GPT‑6 Astra respon amb més seguretat que GPT‑5.6 Sol a sol·licituds difícils procedents de producció i de proves d'adversari amb equip vermell humà. Astra aconsegueix una millora de Pareto tant en atendre amb seguretat sol·licituds insegures com en evitar rebutjos innecessaris de sol·licituds innòcues. Aquestes millores també s'estenen a situacions de gravetat elevada en què el risc de dany prové del context general i no pas d'una petició explícita. Astra també aplica de manera més coherent límits de seguretat adequats a l'edat per als usuaris menors de 18 anys.
Per obtenir-ne més informació, consulta la fitxa completa del model(s'obre en una finestra nova).
Autor
OpenAI


