Découvrez GPT-Red, le système automatisé de red teaming d’OpenAI qui utilise le self-play pour améliorer la sécurité, l’alignement et la robustesse face aux injections de prompt.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Une nouvelle analyse d’OpenAI révèle des problèmes dans SWE-Bench Pro, benchmark de code populaire, et soulève des inquiétudes sur l’évaluation des modèles d’IA.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
Présentation de GeneBench-Pro, un nouveau benchmark évaluant l’IA en génomique, biologie et recherche scientifique sur des données réelles complexes.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch – our most robust yet – are built to deliver these models safely and at scale, around the world.
OpenAI et Molecule.one montrent comment un chimiste IA quasi autonome utilisant GPT-5.4 a amélioré une réaction clé de fabrication de médicaments, faisant avancer la recherche en chimie médicinale.
Découvrez LifeSciBench, benchmark rédigé et évalué par des experts pour mesurer comment les systèmes AI gèrent les tâches et décisions réelles en sciences de la vie.