Scopri GPT-Red, il sistema di red teaming automatizzato di OpenAI che usa il self-play per migliorare sicurezza, allineamento e robustezza alle iniezioni di prompt.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Una nuova analisi di OpenAI rileva problemi in SWE-Bench Pro, un noto benchmark di coding, sollevando dubbi sull'affidabilità delle valutazioni dei modelli IA.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
Ti presentiamo GeneBench-Pro, un nuovo benchmark che valuta le prestazioni dell’IA nella genomica, nella biologia e nella ricerca scientifica usando set di dati complessi e reali.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch – our most robust yet – are built to deliver these models safely and at scale, around the world.
OpenAI e Molecule.one mostrano come un sistema di chimica IA quasi autonomo basato su GPT-5.4 ha migliorato una reazione chiave per la sintesi di farmaci, facendo progredire la ricerca in chimica farmaceutica.
Presentazione di LifeSciBench, benchmark scritto e rivisto da esperti per valutare come i sistemi di AI gestiscono compiti e decisioni reali nelle scienze della vita.