Ontdek GPT-Red, OpenAI's geautomatiseerde red-teaming-systeem dat self-play gebruikt om AI-veiligheid, alignment en robuustheid tegen prompt-injecties te verbeteren.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Een nieuwe OpenAI-analyse onthult problemen met SWE-Bench Pro, een populaire programmeerbenchmark, en roept twijfels op over de betrouwbare evaluatie van AI-modellen.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
Dit is GeneBench-Pro: een nieuwe benchmark die AI-prestaties in de genomica, biologie en wetenschap test met complexe, realistische datasets.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch – our most robust yet – are built to deliver these models safely and at scale, around the world.
OpenAI en Molecule.one laten zien hoe een bijna autonome AI-chemicus met GPT-5.4 verbeterde een belangrijke reactie voor de geneesmiddelensynthese en bracht zo het onderzoek in de medicinale chemie vooruit.
Introductie van LifeSciBench, een door experts geschreven en beoordeelde benchmark voor AI bij echte onderzoekstaken en -beslissingen in de levenswetenschappen.