Descubre GPT-Red, el sistema automatizado de red teaming de OpenAI que usa autojuego para mejorar la seguridad, el alineamiento y la solidez de la IA ante inyecciones de prompts.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Un nuevo análisis de OpenAI revela problemas en SWE-Bench Pro, un popular benchmark de programación, y plantea dudas sobre la fiabilidad y precisión al evaluar modelos de IA.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
Presentamos GeneBench-Pro, la prueba de referencia que evalúa el rendimiento de la IA en genómica, biología e investigación científica con conjuntos de datos complejos y reales.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch – our most robust yet – are built to deliver these models safely and at scale, around the world.
OpenAI y Molecule.one muestran cómo un químico de IA casi autónomo que usa GPT-5.4 mejoró una reacción clave para fabricar fármacos, impulsando la investigación en química medicinal.
Presentamos LifeSciBench, un benchmark creado y revisado por expertos para evaluar cómo la IA aborda tareas y decisiones reales de investigación en ciencias de la vida.