Lerne GPT-Red kennen, OpenAIs automatisiertes Red-Teaming-System, das mit Self-Play KI-Sicherheit, Alignment und Robustheit gegen Prompt Injection verbessert.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Eine neue OpenAI-Analyse zeigt Probleme in SWE-Bench Pro, einem gängigen Coding-Benchmark, und damit Zweifel an der Zuverlässigkeit und Genauigkeit der KI-Modell-Bewertung.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
GeneBench-Pro ist ein neuer Benchmark, der KI-Leistung in Genomik, Biologie und Forschung anhand komplexer, realitätsnaher Datensätze testet.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch – our most robust yet – are built to deliver these models safely and at scale, around the world.
OpenAI und Molecule.one zeigen, wie ein nahezu autonomer KI-Chemiker unter Verwendung von GPT-5.4 eine wichtige Reaktion bei der Arzneimittelherstellung optimiert und damit die Forschung im Bereich der medizinischen Chemie vorangebracht hat.
LifeSciBench: ein von Fachleuten erstellter und geprüfter Benchmark, der bewertet, wie KI-Systeme reale Forschungsaufgaben und Entscheidungen in den Biowissenschaften bewältigen.