Aperçu de la sécurité : GPT‑6 Astra
Chargement...
Aujourd’hui, nous lançons GPT‑6 Astra, le modèle le plus performant que nous ayons jamais déployé à grande échelle. Astra est notre premier modèle à atteindre le niveau Critique de capacités en cybersécurité selon notre cadre de préparation.
Voici les principaux points à retenir concernant la sécurité de ce lancement :
- GPT‑6 Astra franchit un cap important en matière de capacités cyber et atteint notre seuil Critique. Cela signifie qu’avec les outils et les accès appropriés, GPT‑6 Astra peut découvrir des failles de sécurité jusque-là inconnues et concevoir de nouvelles façons de les exploiter dans de nombreux systèmes bien protégés, sans qu’une personne guide chaque étape. Nous avons donc considérablement renforcé nos protections contre l’exécution d’actions cyber malveillantes par le modèle, qu’elles résultent d’un usage abusif ou d’un défaut d’alignement. Nous avons également pris des mesures pour sécuriser le développement et le déploiement internes d’Astra et de modèles similaires, notamment par une isolation plus stricte, le chiffrement des points de contrôle, la surveillance systématique des trajectoires complètes, y compris les chaînes de pensée (CoT), et un processus d’évaluation bloquant de l’alignement avant tout usage interne.
- GPT‑6 Astra est nettement plus robuste que ses prédécesseurs. Grâce à de nouvelles techniques d’entraînement à la sécurité axées sur la robustesse, GPT‑6 Astra résiste nettement mieux aux jailbreaks que GPT‑5.6 Sol, y compris sur des trajectoires plus longues. Nous le savons grâce à des tests hors ligne ainsi qu’à notre programme rigoureux de tests internes et externes de jailbreaks et de correction des failles identifiées. Pour les utilisateurs signalés comme potentiellement à haut risque, nous avons également entraîné le modèle à ajuster son seuil de refus de façon plus prudente afin de couvrir un éventail plus large de risques liés au double usage. Nous effectuons des tests de régression pour vérifier qu’Astra résiste aux jailbreaks découverts lors des précédentes phases de test. Nous avons aussi mené de nouvelles séries de red teaming automatisé avec nos plus récents attaquants internes afin de valider nos améliorations.
- GPT‑6 Astra est mieux aligné que GPT‑5.6 Sol. Astra marque une avancée importante dans l’alignement des modèles, avec des améliorations allant de la composition de nos données de pré-entraînement à notre notation lors de l’apprentissage par renforcement. Nous présentons une nouvelle série d’évaluations de l’alignement(ouverture dans une nouvelle fenêtre) et constatons que GPT‑6 Astra respecte mieux les limites de sûreté et de sécurité et reste davantage dans le périmètre qui lui est autorisé. Dans une simulation utilisant plus de 54 000 tâches internes Codex(ouverture dans une nouvelle fenêtre), Astra a également reçu environ deux fois moins de signalements que Sol pour des comportements désalignés de gravité élevée.
- Nous déployons à grande échelle la surveillance du désalignement. Nous considérons l’alignement des modèles comme le principal levier permettant d’empêcher d’éventuels comportements désalignés de nos modèles. Cependant, la surveillance offre une large visibilité sur le comportement des modèles de pointe et met en lumière des possibilités d’améliorer encore l’alignement et la sécurité. En outre, la surveillance constitue une couche de protection supplémentaire contre les comportements désalignés détectés. Pour ces raisons, nous avons également ajouté une surveillance du désalignement à toutes les inférences utilisant des outils dans le cadre du déploiement externe d’Astra, au prix d’un coût de calcul important. Ce système reproduit notre configuration interne.
- La surveillabilité de GPT‑6 Astra a diminué par rapport à GPT‑5.6 Sol. Nous avons mené des recherches approfondies sur la surveillabilité(ouverture dans une nouvelle fenêtre) et la contrôlabilité(ouverture dans une nouvelle fenêtre) de GPT‑6 Astra. Nous avons constaté que GPT‑6 Astra est plus apte que GPT‑5.6 Sol à contrôler sa propre CoT et moins susceptible d’y inclure des informations compromettantes. Dans des conditions antagonistes, où nous poussons le modèle à échapper à nos systèmes de surveillance, nous constatons qu’il peut ne pas être détecté lorsqu’il sous-performe délibérément lors des évaluations (sandbagging) et qu’il peut parfois échapper à nos systèmes de surveillance internes lorsqu’on lui demande d’effectuer certaines tâches de sabotage(ouverture dans une nouvelle fenêtre). Nous n’avons observé aucun signe de raisonnement CoT stéganographique, par exemple la dissimulation d’un raisonnement caché dans un texte ordinaire et apparemment sans rapport. Cela indique que le risque de contournement pourrait être largement limité aux tâches exigeant peu de raisonnement.
- Ces résultats indiquent que les modèles de la classe Astra pourraient échapper à nos systèmes de surveillance de la CoT dans des conditions antagonistes. À ce stade, ces résultats reposent principalement sur des évaluations antagonistes, c’est-à-dire lorsque nous demandons au modèle d’échapper à la surveillance. Globalement, nos évaluations de l’alignement montrent toutefois qu’Astra est moins susceptible que GPT‑5.6 Sol d’enfreindre les restrictions de sûreté et de sécurité.
- Nous prenons néanmoins cette tendance au sérieux et continuons d’étudier ces résultats ainsi que leurs implications pour la surveillabilité à mesure que nos modèles gagnent en capacités. OpenAI s’est efforcée de préserver et d’exploiter la surveillance de la chaîne de pensée, et le maintien de la surveillabilité de la CoT constitue un objectif central du programme de recherche. Cependant, ces résultats soulignent également l’importance de développer des techniques d’audit de l’alignement qui ne se limitent pas à l’examen de la chaîne de pensée du modèle.
- GPT‑6 Astra gère de façon plus responsable la navigation et les environnements professionnels : GPT‑6 Astra résiste nettement mieux aux injections de prompts que GPT‑5.6 Sol. Nous avons également testé le comportement du modèle dans des environnements réalistes de navigation et d’informatique professionnelle. Nous constatons qu’il est nettement moins susceptible que GPT‑5.6 Sol d’effectuer des actions désalignées et potentiellement destructrices, telles que des transactions non autorisées, des pertes de données, des accès excessifs ou le contournement de contrôles. Il agit également de manière plus sûre lorsqu’il traite des demandes préjudiciables dans des contextes agentiques, par exemple des demandes d’aide à la planification d’une attaque violente ou à la commission d’une fraude.
- GPT‑6 Astra est nettement plus sûr dans les scénarios à risque élevé. GPT‑6 Astra répond de manière plus sûre que GPT‑5.6 Sol aux demandes difficiles issues de la production et du red teaming humain antagoniste. Astra réalise une amélioration de Pareto dans le traitement sûr des demandes dangereuses et évite davantage les refus inutiles de demandes inoffensives. Ces améliorations s’étendent aux scénarios de gravité élevée dans lesquels le risque de préjudice découle du contexte général plutôt que d’une demande explicite. Astra applique également de façon plus cohérente des limites de sécurité adaptées à l’âge pour les utilisateurs de moins de 18 ans.
Pour en savoir plus, consultez la fiche système complète(ouverture dans une nouvelle fenêtre).
Auteur
OpenAI


