Passer au contenu principal
OpenAI

3 septembre 2026

Sécurité

Aperçu de la sécurité : GPT‑6 Astra

Chargement…

Aujourd’hui, nous lançons GPT‑6 Astra, le modèle le plus performant que nous ayons jamais déployé à grande échelle. Astra est notre premier modèle à atteindre le niveau critique de capacités en cybersécurité selon notre cadre de préparation.

Voici les principaux éléments à connaître sur la sécurité de ce lancement :

  1. GPT‑6 Astra représente une avancée majeure en matière de capacités cybernétiques et atteint notre seuil critique. Cela signifie qu’avec les bons outils et accès, GPT‑6 Astra peut découvrir des failles de sécurité jusque-là inconnues et concevoir de nouvelles façons de les exploiter dans de nombreux systèmes bien protégés, sans qu’une personne guide chaque étape. Nous avons donc considérablement renforcé nos protections contre les cyberactions nuisibles du modèle, qu’elles découlent d’une utilisation abusive ou d’un désalignement. Nous avons également pris des mesures pour sécuriser le développement et le déploiement internes d’Astra et de modèles similaires, notamment une isolation plus stricte, le chiffrement des points de contrôle, la surveillance universelle des trajectoires complètes, y compris les chaînes de pensée (CoT), ainsi qu’un processus d’évaluation bloquante de l’alignement avant toute utilisation interne.
  2. GPT‑6 Astra est nettement plus robuste que ses prédécesseurs. Grâce à de nouvelles techniques d’entraînement à la sécurité axées sur la robustesse, GPT‑6 Astra résiste nettement mieux aux jailbreaks que GPT‑5.6 Sol, y compris sur de plus longues trajectoires. Nous le savons grâce à des tests hors ligne et à notre programme rigoureux de détection et de correction des jailbreaks, mené à l’interne et à l’externe. Pour les utilisateurs signalés comme potentiellement à risque élevé, nous avons aussi entraîné le modèle à ajuster sa limite de refus de façon plus prudente afin de couvrir un éventail plus large de risques à double usage. Nous effectuons des tests de régression pour vérifier qu’Astra résiste aux jailbreaks découverts lors de périodes de test antérieures, et avons mené de nouvelles séries d’exercices automatisés d’équipe rouge avec nos plus récents attaquants internes afin de valider nos améliorations.
  3. GPT‑6 Astra est mieux aligné que GPT‑5.6 Sol. Astra représente une avancée majeure en matière d’alignement des modèles et intègre des améliorations qui vont de la composition de nos données de pré-entraînement à notre notation durant l’apprentissage par renforcement. Nous présentons une nouvelle série d’évaluations de l’alignement(s'ouvre dans une nouvelle fenêtre) et constatons que GPT‑6 Astra respecte mieux les limites de sûreté et de sécurité et demeure dans le cadre de ses autorisations. Dans une simulation portant sur plus de 54 000 tâches Codex internes(s'ouvre dans une nouvelle fenêtre), Astra a aussi reçu environ deux fois moins de signalements que Sol pour des comportements désalignés plus graves.
  4. Nous déployons largement la surveillance du désalignement. Nous considérons l’alignement des modèles comme le principal levier pour prévenir tout comportement potentiellement désaligné de nos modèles. Toutefois, la surveillance offre une vaste visibilité sur le comportement des modèles de pointe et fait ressortir des possibilités d’améliorer encore l’alignement et la sécurité. De plus, la surveillance constitue une couche de protection supplémentaire contre les comportements désalignés détectés. Pour ces raisons, nous avons aussi ajouté la surveillance du désalignement à toutes les inférences utilisant des outils dans le cadre du déploiement externe d’Astra, malgré un coût de calcul important. Ce système reproduit notre configuration interne.
  5. La surveillabilité de GPT‑6 Astra a diminué par rapport à GPT‑5.6 Sol. Nous avons mené des recherches approfondies sur la surveillabilité(s'ouvre dans une nouvelle fenêtre) et la contrôlabilité(s'ouvre dans une nouvelle fenêtre) de GPT‑6 Astra. Nous avons constaté que GPT‑6 Astra peut mieux contrôler sa propre CoT que GPT‑5.6 Sol et qu’il est moins susceptible d’y inclure des renseignements compromettants. Dans des contextes contradictoires, où nous poussons le modèle à échapper à nos systèmes de surveillance, nous constatons qu’il peut passer inaperçu lorsqu’il réduit stratégiquement ses performances pendant les évaluations (sandbagging) et qu’il peut parfois contourner nos systèmes de surveillance internes lorsqu’on lui demande d’effectuer certaines tâches de sabotage(s'ouvre dans une nouvelle fenêtre). Nous n’avons relevé aucun signe de raisonnement CoT stéganographique, par exemple la dissimulation d’un raisonnement caché dans un texte ordinaire et apparemment sans rapport, ce qui indique que le risque de contournement pourrait être largement limité aux tâches exigeant moins de raisonnement.
    • Ces résultats indiquent que les modèles de la classe Astra pourraient échapper à nos systèmes de surveillance de la CoT dans des conditions contradictoires. Pour l’instant, ces résultats reposent surtout sur des évaluations contradictoires, c’est-à-dire lorsque nous demandons au modèle d’échapper à la surveillance, et nos évaluations globales de l’alignement montrent qu’Astra est moins susceptible que GPT‑5.6 Sol d’enfreindre les restrictions de sûreté et de sécurité.
    • Nous prenons toutefois cette tendance au sérieux et continuons d’étudier ces résultats ainsi que leurs conséquences sur la surveillabilité à mesure que nos modèles gagnent en capacités. OpenAI s’est efforcée de préserver et d’utiliser la surveillance de la chaîne de pensée, et le maintien de la surveillabilité de la CoT est un objectif central du programme de recherche. Toutefois, ces résultats soulignent également l’importance de concevoir des techniques d’audit de l’alignement qui ne se limitent pas à l’examen de la chaîne de pensée du modèle.
  6. GPT‑6 Astra navigue de façon plus responsable sur le Web et dans les milieux de travail : GPT‑6 Astra résiste nettement mieux aux injections d’invites que GPT‑5.6 Sol. Nous avons aussi testé le comportement du modèle dans des environnements réalistes de navigation et d’informatique professionnelle, et constaté qu’il est nettement moins susceptible que GPT‑5.6 Sol d’effectuer des actions désalignées et potentiellement destructrices, comme des transactions non autorisées, des pertes de données, des accès excessifs ou le contournement de contrôles. Il agit aussi de façon plus sûre lorsqu’il traite des demandes nuisibles dans des contextes agentiques, comme des demandes d’aide à la planification d’une attaque violente ou à la commission d’une fraude.
  7. GPT‑6 Astra est nettement plus sûr dans les scénarios à risque élevé. GPT‑6 Astra répond de façon plus sûre que GPT‑5.6 Sol aux demandes difficiles provenant de la production et d’exercices contradictoires d’équipe rouge menés par des humains. Astra réalise une amélioration de Pareto en répondant de façon sûre aux demandes dangereuses tout en évitant les refus inutiles de demandes inoffensives. Ces améliorations s’étendent aux scénarios très graves où le risque de préjudice découle du contexte général plutôt que d’une demande explicite. Astra applique aussi plus systématiquement des limites de sécurité adaptées à l’âge pour les utilisateurs de moins de 18 ans.