Répondre à la prochaine frontière des cybercapacités critiques
La cybersécurité évolue rapidement à mesure que les modèles gagnent en capacités, ce qui peut à la fois renforcer les cyberdéfenses et permettre des attaques à une vitesse et à une échelle sans précédent.
Nos dernières évaluations internes d’Astra, l’un de nos prochains modèles, réalisées ces derniers jours, indiquent des progrès considérables en programmation agentique et en cybersécurité. Ces résultats, ainsi que les évaluations d’experts, nous ont amenés à conclure hier soir que nous ne pouvions pas exclure des cybercapacités critiques au regard de notre cadre de préparation(ouverture dans une nouvelle fenêtre).
Nous communiquons ces informations, car nous estimons important de faire preuve de transparence auprès du public et des communautés spécialisées dans la sûreté et la sécurité concernant cette évolution potentielle des capacités.
Nous avons publié notre cadre de préparation pour la première fois en décembre 2023, bien avant que les modèles ne se rapprochent de ce niveau de capacités biologiques, chimiques, de cybersécurité et d’auto-amélioration de l’IA. Nous l’avons créé pour disposer d’un guide permettant de repérer les progrès en matière de capacités, puis de planifier les mesures que notre entreprise prendrait à mesure que ces capacités émergeraient. Les modèles précédents, dont GPT‑5.6‑Sol, ont été évalués au regard des cybercapacités de pointe et classés au seuil Élevé, plutôt que Critique.
Selon notre cadre de préparation, un modèle atteint le seuil Critique en cybersécurité s’il peut, sans intervention humaine, identifier et développer des exploits zero-day fonctionnels, quel que soit leur niveau de gravité, dans de nombreux systèmes critiques réels et renforcés, ou s’il peut concevoir et exécuter de bout en bout des stratégies inédites de cyberattaque contre des cibles renforcées en ne disposant que d’un objectif général.
Alors que nous poursuivons l’analyse comparative et l’évaluation de ce modèle, nos évaluations préliminaires indiquent des performances suffisamment élevées pour que nous ne puissions pas exclure, à ce stade, un niveau de capacité Critique. Astra est un modèle à venir et n’a pas été impliqué dans la compromission de l’infrastructure de Hugging Face.
En conséquence, nous avons renforcé les tests de robustesse de nos mesures de protection et contrôles de sécurité afin qu’ils soient adaptés au déploiement de ces capacités. En interne, nous avons également pris les mesures suivantes afin que la poursuite du développement de ce modèle se déroule dans des conditions garantissant sa sûreté et sa sécurité :
- Nous mettons en œuvre des contrôles de sécurité plus stricts pour les modèles aux capacités supérieures et les activités associées, notamment des environnements de test isolés, un accès restreint au réseau et aux outils, une protection et un chiffrement renforcés des poids du modèle, des dispositifs supplémentaires de surveillance et de détection, ainsi qu’une exécution en environnement isolé.
- Nous suspendons les activités internes impliquant Astra qui ne satisfont pas encore à ces exigences renforcées en matière de contrôles de sécurité.
- Nous avons mis en place une surveillance systématique des actions risquées et des défauts d’alignement dans toutes les applications agentiques d’Astra, y compris lors de l’entraînement et de l’évaluation. Les systèmes de surveillance évaluent la chaîne de pensée du modèle et déclenchent une réponse de sécurité afin d’examiner et d’interrompre les activités à haut risque.
- Nous collaborerons avec les organismes publics concernés et certaines organisations spécialisées dans la sûreté de l’IA afin de tester les capacités de ce modèle.
- Nous fournirons aux partenaires de test tiers des recommandations relatives aux contrôles de sécurité afin qu’ils puissent mener en toute sécurité des évaluations et des charges de travail présentant des risques plus élevés.
Le cadre nous a déjà guidés lors d’autres transitions de capacités. En juin 2025, alors que nos modèles se rapprochaient du seuil de capacités élevées en biologie défini par le cadre de préparation, nous avons présenté les mesures que nous prenions pour renforcer les dispositifs de protection, étendre les tests, collaborer avec des experts externes et déployer des contrôles de sécurité supplémentaires. Nous appliquons ici le même principe.
Nous pensons que les modèles dotés de cybercapacités avancées doivent aider les défenseurs à repérer et à corriger les vulnérabilités avant les attaquants. Nous nous engageons à collaborer avec les gouvernements, les instituts pour la sécurité de l’IA et la société civile afin de veiller à ce que les capacités de pointe de modèles comme Astra, et de ceux qui suivront, soient déployées largement et de manière responsable, au bénéfice de toute l’humanité.


