Una nuova generazione di intelligenza
Aggiornamento del 22/09/2026: Stiamo ampliando la famiglia GPT‑6 con GPT‑6 Sol e GPT‑6 Luna. Scopri di più.
Ti presentiamo GPT‑6 Astra, il modello più intelligente e allineato al mondo.
GPT‑6 Astra riunisce anni di ricerca e investimenti ambiziosi nel pre-addestramento, nell’apprendimento per rinforzo e nell’allineamento. Astra è all’avanguardia nell’uso del computer, nella navigazione web, nell’ingegneria del software, nella cybersicurezza, nella scienza e nelle attività professionali. Astra raggiunge un punteggio del 98% su FrontierMath Tier 4, dopo aver già contribuito a risolvere problemi aperti da tempo in matematica. Astra raggiunge inoltre la saturazione su ARC-AGI-3 con un punteggio del 99,9% e su ExploitBench con un punteggio del 100%. Raggiunge inoltre un nuovo traguardo nell’uso del computer e del browser, gestendo le attività professionali più impegnative con velocità, precisione e capacità di giudizio senza pari.
GPT‑6 Astra viene reso disponibile da oggi a un numero limitato di organizzazioni e nei prossimi giorni sarà accessibile a tutti gli utenti di ChatGPT Plus, Pro, Business ed Enterprise, nonché tramite l’API OpenAI, Microsoft Azure e AWS Bedrock.
Astra è il nostro modello più allineato e offre miglioramenti sostanziali nella comprensione dell’intento dell’utente e nel comportamento del modello: puoi quindi delegare attività affidandoti maggiormente al suo giudizio. Per verificare questo aspetto, abbiamo sviluppato una nuova valutazione ispirata all’incidente di Hugging Face, che stabilisce se un modello alle prese con un’attività difficile o impossibile oltrepassa l’ambito previsto. Senza le misure di protezione previste per la produzione, GPT‑5.6 Sol ha oltrepassato l’obiettivo autorizzato nel 48% dei casi, mentre GPT‑6 Astra non lo ha fatto in nessun caso.
Il miglior modello al mondo per l’uso del computer
GPT‑6 Astra raggiunge un nuovo traguardo in termini di velocità, precisione e sicurezza nell’uso del computer. Può occuparsi di attività ripetitive come compilare moduli online, aggiornare le schede dei clienti in un CRM e organizzare il tuo calendario. Può svolgere ricerche online e redigere riepiloghi nella tua email o nel tuo editor di documenti. Può analizzare dati scientifici, generare grafici, creare un sito web ed eseguire controlli di QA sul frontend per verificare che tutte le funzionalità del sito funzionino. Può aiutarti a installare e testare software in autonomia e a risolvere i problemi visualizzati sullo schermo. Questi miglioramenti si riflettono anche nei risultati all’avanguardia ottenuti nelle nostre valutazioni.
Questi miglioramenti producono inoltre notevoli incrementi di efficienza nelle attività reali di lavoro intellettuale. Nelle simulazioni di latenza su OSWorld 2.0, Astra ottiene prestazioni superiori nell’uso del computer impiegando circa il 47% di tempo in meno per attività rispetto a GPT‑5.6 Sol, con un punteggio del 72,6% in circa 40 minuti per attività, rispetto al 65,7% ottenuto in circa 75 minuti.3
Le capacità di utilizzo del computer di GPT‑6 Astra sono evidenti nei risultati ottenuti in vari ambiti, tra cui lo sviluppo di videogiochi, l’ingegneria elettrica e le attività professionali quotidiane:
Insieme ad Astra, stiamo aggiornando anche l’infrastruttura di Codex per aumentare notevolmente la velocità di utilizzo del computer. Grazie anche all’efficienza di Astra, sul benchmark Mind2Web le attività vengono completate 1,9 volte più velocemente rispetto all’esperienza attuale con GPT‑5.6 Sol. Grazie alla maggiore velocità, il modello può occuparsi per te di molte attività quotidiane che richiedono tempo, completandole più rapidamente di quanto potresti fare tu.4
Un salto di qualità nel lavoro professionale
GPT‑6 Astra unisce i progressi nell’uso del computer con un addestramento mirato agli ambienti professionali per contribuire ad affrontare attività lavorative complesse. Combina l’intelligenza necessaria per risolvere problemi complessi con la capacità di eseguire flussi di lavoro in più passaggi e produrre documenti, fogli di calcolo e presentazioni curati.
GPT‑6 Astra è il nostro modello migliore per seguire modelli esistenti e produrre presentazioni ben impaginate, capaci di comunicare in modo conciso i punti chiave attraverso una narrazione strutturata. Crea documenti, presentazioni, fogli di calcolo e analisi chiari e ben strutturati, seguendo i tuoi modelli e rispecchiando il tuo stile visivo e di scrittura. Astra è inoltre addestrato a individuare solo il contesto pertinente e a includerlo nei risultati, senza ripetere informazioni superflue per l’attività in corso. Può quindi produrre contenuti immediatamente utilizzabili e in linea con il contesto e gli standard della tua azienda.
GPT‑6 Astra offre anche una maggiore capacità di giudizio visivo nei siti web, nei giochi, nelle applicazioni e nei rendering che realizza. Con Sites(si apre in una nuova finestra) su ChatGPT, Astra può creare, ospitare e condividere siti web, app web e giochi direttamente da un prompt.
Quando le istruzioni lasciano spazio all’interpretazione, GPT‑6 Astra prende decisioni corrette più spesso rispetto ai modelli precedenti. Usa il contesto per colmare le lacune ordinarie e pone domande mirate quando la risposta potrebbe modificare l’esito. In Codex, può porre domande in modo asincrono mentre prosegue con le attività che non dipendono dalla tua risposta. Se non rispondi, procede formulando ipotesi ragionevoli quando opportuno, ma attende il tuo contributo per le decisioni più importanti.
Gli esempi seguenti mostrano come Astra collabora nelle attività quotidiane in cui la mancanza di informazioni può modificare sostanzialmente la risposta.
Astra riesce inoltre a mantenere meglio il filo del lavoro mentre un’attività evolve. I modelli precedenti a volte interpretavano i messaggi di indirizzamento come un nuovo obiettivo, perdendo di vista la richiesta originale o i vincoli precedenti. Astra integra i nuovi requisiti, cambia direzione quando richiesto e risponde alle domande collaterali senza perdere di vista l’attività complessiva.
Programmazione
GPT‑6 Astra è il miglior modello per l’ingegneria del software finora.
“GPT‑6 Astra offre prestazioni all’avanguardia nei nostri benchmark interni di programmazione e mostra un netto passo avanti rispetto a GPT‑5.6 Sol nelle valutazioni dell’intuizione di trading. Quando viene usato per la programmazione agentica, GPT‑6 Astra comunica in modo più facile da seguire per chi sviluppa e produce codice che richiede meno iterazioni per raggiungere la qualità necessaria per la produzione.”
“Abbiamo testato Astra con livelli di impegno basso, medio e alto su una delle nostre valutazioni di prima generazione e ha ottenuto risultati nettamente superiori a GPT‑5.6 Sol. Un livello di impegno più alto consente di eseguire più iterazioni su una nuova build, effettuare più verifiche tramite test nel browser e privilegiare l’esecuzione del codice rispetto ad apply-patch. Comprendere come un modello distribuisce il proprio impegno ci permette di offrire a milioni di sviluppatori un percorso più rapido e affidabile dall’idea a un’app funzionante.”
Con Astra, introduciamo un nuovo modo in cui Codex può conservare e recuperare il contesto quando la finestra di contesto si riempie. Storicamente, durante le sessioni lunghe, ad esempio per eseguire il debug di problemi complessi o affrontare refactoring di ampia portata, i modelli hanno utilizzato il compattamento per riepilogare il lavoro svolto. Ogni compattamento può tralasciare dettagli sul motivo per cui una correzione non ha funzionato o sul comportamento di un componente. Su Codex, Astra può conservare note tra diverse finestre di contesto, mantenendo i dettagli accumulati senza comprimerli ripetutamente in un unico riepilogo. Le finestre di contesto precedenti restano consultabili, quindi Astra può trovare requisiti o risultati dei test nei messaggi e negli output degli strumenti precedenti, anche se queste informazioni non sono state incluse nelle note. Puoi abilitare questa funzionalità sperimentale nel tuo config.toml di Codex,(si apre in una nuova finestra) che diventerà l’impostazione predefinita per Astra nelle prossime settimane.
Promuovere la scoperta scientifica
Astra può contribuire alle attività pratiche alla base delle scoperte scientifiche. Combinando il ragionamento scientifico con l’uso del computer, può operare direttamente in software specialistici per esaminare i dati ed esplorare i risultati, aiutando i ricercatori a valutare le prove e a decidere che cosa approfondire.
Cybersicurezza
Come abbiamo spiegato nel nostro aggiornamento sulla sicurezza, Astra rappresenta un notevole salto di qualità nelle capacità di cybersicurezza e raggiunge la soglia critica prevista dal nostro Preparedness Framework. La sua capacità di individuare e sviluppare exploit zero-day può aiutare chi si occupa di difesa a rilevare e correggere le vulnerabilità, ma rende necessarie anche misure di protezione più solide. Per comprendere la portata di queste capacità, abbiamo sottoposto Astra a valutazioni condotte da esperti interni e di terze parti.
Abbiamo innanzitutto testato il modello senza le misure di protezione previste per la produzione su ExploitBench ed ExploitGym, che valutano se i modelli riescano a trasformare vulnerabilità software note in exploit funzionanti. Su ExploitBench, Astra ha ottenuto un punteggio perfetto del 100%, rispetto al 78,5% di GPT‑5.6 Sol, il nostro precedente modello avanzato con capacità informatiche. Su ExploitGym, Astra ha raggiunto un tasso di successo del 42,4%, rispetto al 30,3% di GPT‑5.6 Sol, usando al contempo molti meno token di output.13
Considerato il timore che l’esposizione a vulnerabilità software storiche possa aver influenzato i risultati dei benchmark, abbiamo valutato Astra anche su due nuovi benchmark. Per il primo, abbiamo creato una valutazione interna, “ExploitBench (giugno–agosto 2026)”, per testare lo sviluppo di exploit basati su vulnerabilità emerse nei tre mesi precedenti.14 Astra ha raggiunto tassi di esecuzione di codice arbitrario sostanzialmente più elevati rispetto a GPT‑5.6 Sol su questo set di dati, usando molti meno token di output. Durante la valutazione, Astra ha persino scoperto e sfruttato due vulnerabilità zero-day fino ad allora sconosciute. Stiamo segnalando entrambe le vulnerabilità ai rispettivi responsabili della manutenzione.
Abbiamo testato Astra anche su SRE-Bench15, un benchmark che misura se i modelli riescono a eseguire il reverse engineering di binari software per comprenderne la logica fondamentale senza accedere al codice sorgente. Astra ha risolto l’88,0% delle attività al primo tentativo e il 99,2% entro quattro tentativi, rispetto rispettivamente al 55,9% e al 68,7% di GPT‑5.6 Sol.
Oltre ai benchmark, valutazioni condotte da esperti hanno rilevato che Astra, quando viene eseguito senza le misure di protezione previste per la produzione, può sfruttare vulnerabilità sconosciute per eseguire codice arbitrario in browser con protezioni avanzate e creare exploit di escalation dei privilegi per sistemi operativi irrobustiti.
Come abbiamo spiegato in La finestra del difensore, le capacità informatiche avanzate possono aiutare chi si occupa di difesa a individuare più rapidamente le vulnerabilità, ma possono anche renderle più facili da sfruttare, aumentando l’urgenza di adeguare le misure difensive. Con la versione di Astra disponibile da oggi, chi si occupa di difesa può svolgere attività come la revisione sicura del codice e l’applicazione di patch.
Astra rifiuterà tuttavia di svolgere attività di cybersicurezza più avanzate, come la creazione di exploit proof of concept per le vulnerabilità. Tramite OpenAI Daybreak, prevediamo di ampliare l’accesso e rendere disponibili misure di protezione meno restrittive nelle prossime settimane. Ciò consentirà ulteriori flussi di lavoro difensivi, tra cui la convalida di vulnerabilità e proof of concept, l’analisi del malware e l’ingegneria del rilevamento.
Abbiamo inoltre rafforzato le protezioni contro potenziali usi impropri in ambito informatico, ampliando il sistema di misure di sicurezza adottato per GPT‑5.6 Sol. Queste misure includono una maggiore robustezza del modello per resistere meglio a potenziali jailbreak e un contesto più ampio per i nostri sistemi di monitoraggio. Abbiamo continuato a condurre rigorosi test interni ed esterni, comprese valutazioni automatizzate con i nostri attaccanti interni per il red teaming. Ulteriori dettagli sulle nostre misure di sicurezza informatica e sui relativi test sono disponibili nella panoramica sulla sicurezza di Astra e nella scheda di sistema(si apre in una nuova finestra).
Allineamento e distribuzione responsabili di GPT‑6 Astra
Astra è il nostro modello più allineato. Astra eccelle nell’agire con cautela, nel rispettare i limiti delle attività e nel comunicare con trasparenza. Questo lavoro è il risultato più recente del nostro programma di ricerca di lunga durata, dedicato all’addestramento di modelli che rimangano allineati all’intento umano dall’inizio alla fine.
Negli ambienti sensibili, Astra procede con un livello di cautela commisurato al rischio. In una valutazione di attività di utilizzo del computer selezionate con criteri avversariali per indurre comportamenti scorretti, Astra ha evitato le conseguenze indesiderate con maggiore successo. L’esecuzione con le misure di sicurezza aggiuntive attive per impostazione predefinita ha prodotto risultati ancora migliori.
Astra produce meno esiti disallineati rispetto a qualsiasi altro modello di frontiera testato. Per un confronto equo, abbiamo usato un’infrastruttura generica per agenti che utilizzano il computer, basata sugli strumenti nativi disponibili sia nell' OpenAI Responses API(si apre in una nuova finestra) sia nell' Anthropic Messages API(si apre in una nuova finestra), senza le protezioni aggiuntive normalmente applicate agli utenti di Codex e ChatGPT Work, come la revisione automatica e i criteri di conferma.
Astra ha inoltre maggiori probabilità di operare entro i limiti stabiliti dall’utente e quelli impliciti nel suo ambiente. In una valutazione interna, Astra non ha mai tentato di aggirare un rifiuto di Codex Auto-Review. Il risultato è rimasto invariato anche quando Auto-Review era stato deliberatamente configurato in modo da poter essere aggirato e l’attività era altrimenti impossibile da completare. Il rispetto delle limitazioni dell’ambiente è coerente con i risultati della valutazione sulle attività di cybersicurezza impossibili presentata nell’introduzione di questo articolo e con gli altri risultati documentati nella nostra scheda di sistema(si apre in una nuova finestra).
Astra stabilisce inoltre nuovi record nella comunicazione trasparente con gli utenti. In una valutazione, Astra ha una probabilità tre volte inferiore rispetto a GPT‑5.6 Sol di fornire descrizioni inesatte delle proprie capacità e possibilità d’azione.
Nella nostra valutazione delle allucinazioni relative alle capacità, Astra mostra un miglioramento significativo rispetto a GPT‑5.6 Sol e formula meno affermazioni fuorvianti sulle proprie capacità.
Le nostre valutazioni hanno rilevato che il ragionamento scritto di Astra è più difficile da monitorare rispetto a quello di GPT‑5.6 Sol, sulla base di test in cui veniva esplicitamente richiesto al modello di eludere il monitoraggio. Attribuiamo questo risultato al maggiore controllo di Astra sul ragionamento scritto nelle attività più semplici e alla sua capacità di risolvere i problemi con meno passaggi scritti. Astra sembra comunque avere difficoltà a nascondere il ragionamento necessario per le attività complesse, ma prendiamo sul serio questo calo. Migliorare la possibilità di monitoraggio resta una priorità di ricerca e la scheda di sistema(si apre in una nuova finestra) associata descrive in dettaglio i nostri risultati e il lavoro in corso.
L’addestramento per l’allineamento è fondamentale per il nostro approccio alla distribuzione. Come ulteriore livello di difesa, sviluppiamo misure di protezione a livello di sistema, come Codex Auto-review(si apre in una nuova finestra) e il monitoraggio del ragionamento e delle azioni degli agenti, per contribuire a rilevare e contenere comportamenti non sicuri. Come descritto nel nostro aggiornamento sulla sicurezza, stiamo introducendo in produzione il monitoraggio del disallineamento per i modelli della classe Astra, in modo da rilevarlo e contribuire a contenerne i casi più gravi. Queste misure di protezione sono simili a quelle usate per monitorare le distribuzioni interne e prevedono un sistema di classificatori che verifica il ragionamento e le azioni del modello alla ricerca di comportamenti non autorizzati e interrompe automaticamente le attività potenzialmente non autorizzate.
Considerato il notevole aumento delle capacità di cybersicurezza di Astra, prestiamo particolare attenzione affinché questa distribuzione avvenga in modo sicuro. I controlli di sicurezza aggiuntivi possono talvolta rallentare, sospendere o interrompere attività legittime, comprese quelle di cybersicurezza difensiva. Se un’attività viene messa in pausa su ChatGPT o Codex, potrebbe esserti chiesto di verificare l’azione prima di continuare. Nell'API, l'attività verrà interrotta. A volte questi controlli possono interrompere attività legittime. Continuiamo a perfezionare il sistema per ridurre le interruzioni non necessarie. Il monitoraggio del disallineamento non può sostituire l’allineamento: il nostro obiettivo è sviluppare modelli che rimangano in modo affidabile entro l’ambito autorizzato, affinché queste protezioni non debbano intervenire.
Disponibilità
GPT‑6 Astra viene reso disponibile da oggi a un numero limitato di organizzazioni e nei prossimi giorni sarà accessibile a tutti gli utenti di ChatGPT Plus, Pro, Business ed Enterprise, nonché tramite l’API OpenAI, Microsoft Azure e AWS Bedrock. L’utilizzo di Astra è incluso nelle quote degli abbonamenti esistenti; utenti e aziende potranno inoltre acquistare crediti per un utilizzo aggiuntivo. Gli utenti dei piani Pro, Business ed Enterprise avranno accesso anche a GPT‑6 Astra Pro. Gli amministratori Enterprise possono abilitare Astra per la propria area di lavoro; al momento del lancio, l’accesso è disattivato per impostazione predefinita.
Astra supporta Zero Data Retention per i clienti API idonei e, come abbiamo comunicato il mese scorso, stiamo testando Private Safety Processing per rafforzare il monitoraggio della sicurezza tutelando al contempo la privacy dei clienti.
Per gli sviluppatori, GPT‑6 Astra sarà disponibile nell’API OpenAI con il nome gpt-6-astra e tramite Microsoft Azure e Amazon Bedrock.
La tariffazione Standard dell’API OpenAI è di 10 USD per milione di token di input e 50 USD per milione di token di output. Per le letture e le scritture della cache si applicano tariffe separate. La modalità rapida è disponibile per GPT‑6 Astra nell’API e offre fino al doppio della velocità dell’elaborazione Standard al doppio del prezzo Standard.
Professionale
Professionale | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Attività interne di progettazione | 50,0% | 47,4% | - | 35,8% | - | - |
Attività interne di data science | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programmazione
| Programmazione | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended (punteggio) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (punteggio) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Attività interne di migrazione di database | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Accademico
Accademico | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (con strumenti) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Allineamento
Allineamento | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Benchmark interno sulla sicurezza nell’uso del computer (più basso è meglio) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Benchmark interno sulla sicurezza nell’uso del computer, con AutoReview (più basso è meglio) | 1,8% | 4,3% | - | - | - | - |
Benchmark interno sull’aggiramento delle restrizioni (più basso è meglio) | 0,00% | 0,29% | - | - | - | - |
Honeypot di ExploitGym (valori più bassi sono migliori) | 0,0% | 48,2% | - | - | - | - |
ExploitGym impossibile | 100,0% | - | - | - | - | - |
Benchmark interno sulle allucinazioni (più basso è meglio) | 4,2% | 12,2% | - | - | - | - |
Contesto lungo
Contesto esteso | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Ragionamento astratto
| Ragionamento astratto | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
I punteggi riportati sono i valori massimi ottenuti a qualsiasi livello di impegno. Le valutazioni GPT sono state eseguite nel nostro ambiente di ricerca o tramite la nostra API e potrebbero produrre risultati leggermente diversi da quelli di ChatGPT in produzione, a causa delle differenze nei prompt di sistema, negli strumenti disponibili e in altri elementi.
NOTE A PIÈ DI PAGINA
- 1
Su ARC-AGI-3, GPT-6 Astra è stato eseguito con la nostra infrastruttura dell’API Responses, che modifica due impostazioni per riflettere meglio le prestazioni in contesti reali. Le modifiche non riguardano specificamente ARC-AGI-3.
- 2
GPT-5.6 Sol indica la versione disponibile nella nostra API, in ChatGPT Codex e in ChatGPT Work. La versione disponibile in ChatGPT Chat è leggermente diversa.
- 3
OSWorld V2-Offline è un sottoinsieme dell’OSWorld V2 originale che funziona senza accesso a Internet. Le prestazioni del modello Claude su OSWorld-V2 Offline sono state riprodotte dagli autori nella classifica ufficiale(si apre in una nuova finestra). Su OSWorld 2.0, i punteggi di Claude usano le impostazioni ufficiali, non le attività e i criteri di valutazione modificati della scheda di sistema di Fable 5.1.
- 4
- 5
Su BenchCAD, i punteggi di Claude riflettono tre modifiche alla valutazione, descritte in dettaglio nella scheda di sistema di Fable 5.1(si apre in una nuova finestra).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon e Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(si apre in una nuova finestra).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower e Peter Jonas. “The OpenScore String Quartet Corpus(si apre in una nuova finestra).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
Su FrontierCode, GPT-6 Astra è stato eseguito con un messaggio dello sviluppatore simile a una sezione del suo messaggio dello sviluppatore in Codex(si apre in una nuova finestra): "Evita di creare troppi file di test. Crea un nuovo file di test solo quando richiesto dalle convenzioni del repository o quando nessun file esistente è adatto. Evita operazioni di pulizia non pertinenti e complessità superflue. Riutilizza le utilità esistenti appropriate. Leggi le istruzioni pertinenti del repository ed esamina il codice, i test, la documentazione e la CI nelle parti correlate. Segui le convenzioni consolidate. L’obiettivo è ottenere codice pulito e pronto per essere integrato.” Il prompt non è stato ottimizzato per la valutazione.
- 9
Il primo riguarda quanto possano essere vicini tra loro i numeri primi, indipendentemente da quanto si proceda lungo la retta numerica. Per oltre un decennio, il miglior risultato noto ha dimostrato l’esistenza di infinite coppie di numeri primi distanti al massimo 246. Julia Stadlmann(si apre in una nuova finestra) ha recentemente migliorato quel limite, portandolo a 240. Astra ha contribuito a stabilire un limite più stretto di 186, dimostrando che esistono infinite coppie comprese entro questa distanza minore. Intervalli brevi tra numeri primi: dimostrazione(si apre in una nuova finestra) e ricerca di supporto(si apre in una nuova finestra).
- 10
Il secondo riguarda intervalli insolitamente grandi tra numeri primi. Astra ha migliorato un termine di un limite relativo a questi intervalli che era rimasto invariato per oltre 80 anni. Condividiamo le dimostrazioni, la catena di pensiero abbreviata e i materiali di verifica relativi a entrambi i risultati. Intervalli ampi tra numeri primi: Dimostrazione(si apre in una nuova finestra) e ricerca di supporto(si apre in una nuova finestra).
- 11
Abbiamo valutato in modo indipendente tutti i modelli Claude seguendo la procedura prevista da HealthBench Professional e usando GPT-5.4 per la valutazione, con punteggi normalizzati per la lunghezza e non troncati. Per Fable 5.1, abbiamo usato Opus 5 come soluzione di riserva in caso di rifiuto da parte del provider.
- 12
- 13
- 14
ExploitBench (giugno–agosto 2026) contiene 20 vulnerabilità V8 ad alta gravità distribuite su 13 versioni stabili di Chrome. Il benchmark verifica se gli agenti riescono a eseguire codice arbitrario in V8 e nelle versioni ufficiali di Chrome per Linux sfruttando ciascuna vulnerabilità specificata. Alcune vulnerabilità incluse potrebbero non consentire l’esecuzione di codice arbitrario entro i vincoli della valutazione, pertanto potrebbe non essere possibile raggiungere un tasso di successo del 100%. Nota: il punteggio del 5,5% di GPT-5.6 Sol è dovuto al limite di 300 turni del benchmark, un limite a cui i clienti reali che usano Max non sarebbero soggetti. Con impostazioni simili, il modello ha ottenuto un punteggio dell’11,5% quando ha raggiunto meno limiti.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(si apre in una nuova finestra).” arXiv:2608.11469v1, 2026.
- 16
Quando eseguiamo test su modelli di terze parti, usiamo una configurazione di ricerca più semplice. Codex dispone di una configurazione di produzione più complessa, che può determinare tassi di errore diversi per il modello di base. Le misure di protezione lato provider e le implementazioni degli strumenti per l’uso del computer continuano inoltre a variare. Gli utenti non incontrano in Codex lo scenario senza conferma, poiché si tratta di una configurazione interna usata per la ricerca.
- 17
