Vai al contenuto principale
OpenAI

3 settembre 2026

Sicurezza

Panoramica sulla sicurezza: GPT‑6 Astra

Caricamento in corso...

Oggi lanciamo GPT‑6 Astra, il modello più capace che abbiamo mai distribuito su larga scala. Astra è il nostro primo modello a raggiungere il livello Critico di capacità di cybersicurezza secondo il Preparedness Framework.

Ecco gli aspetti più importanti da conoscere sulla sicurezza di questo lancio:

  1. GPT‑6 Astra rappresenta un notevole passo avanti nelle capacità cyber e raggiunge la nostra soglia Critica. Ciò significa che, con gli strumenti e gli accessi appropriati, GPT‑6 Astra può individuare vulnerabilità di sicurezza finora sconosciute e sviluppare nuovi modi per sfruttarle in numerosi sistemi ben protetti, senza che una persona debba guidarlo in ogni fase. Abbiamo quindi rafforzato notevolmente le protezioni contro eventuali azioni cyber dannose da parte del modello, dovute a un uso improprio o a un disallineamento. Abbiamo inoltre adottato misure per rendere più sicuri lo sviluppo e la distribuzione interna di Astra e di modelli simili, tra cui un isolamento più rigoroso, la crittografia dei checkpoint, il monitoraggio sistematico delle traiettorie complete, comprese le catene di pensiero (CoT), e un processo di valutazione dell'allineamento che deve essere superato prima dell'uso interno.
  2. GPT‑6 Astra è notevolmente più robusto dei suoi predecessori. Grazie a nuove tecniche di addestramento alla sicurezza incentrate sulla robustezza, GPT‑6 Astra è molto più resistente ai jailbreak rispetto a GPT‑5.6 Sol, anche su traiettorie più lunghe. Lo sappiamo grazie a test offline e al nostro rigoroso programma interno ed esterno di verifica e correzione dei jailbreak. Per gli utenti segnalati come potenzialmente ad alto rischio, abbiamo inoltre addestrato il modello affinché possa adottare una soglia di rifiuto più prudente e coprire una gamma più ampia di rischi legati al duplice uso. Utilizziamo test di regressione per assicurarci che Astra sia resistente ai jailbreak individuati nelle precedenti fasi di verifica e abbiamo condotto nuove sessioni automatizzate di red teaming con i nostri più recenti sistemi interni di attacco, per convalidare i miglioramenti.
  3. GPT‑6 Astra è meglio allineato rispetto a GPT‑5.6 Sol. Astra rappresenta un notevole passo avanti nell'allineamento dei modelli e include miglioramenti che vanno dalla composizione dei dati di pre-addestramento ai criteri di valutazione adottati durante l'apprendimento per rinforzo. Presentiamo una nuova serie di valutazioni dell'allineamento(si apre in una nuova finestra) e rileviamo che GPT‑6 Astra rispetta meglio i limiti di sicurezza e opera con maggiore affidabilità entro l'ambito autorizzato. In una simulazione basata su oltre 54.000 attività Codex interne(si apre in una nuova finestra), Astra ha inoltre ricevuto circa la metà delle segnalazioni di Sol per comportamenti disallineati di maggiore gravità.
  4. Stiamo adottando su vasta scala il monitoraggio del disallineamento. Consideriamo l'allineamento dei modelli lo strumento principale per prevenire potenziali comportamenti disallineati dei nostri modelli. Il monitoraggio offre tuttavia un'ampia visibilità sul comportamento dei modelli di frontiera, mettendo in luce opportunità per migliorare ulteriormente l'allineamento e la sicurezza. Inoltre, il monitoraggio costituisce un ulteriore livello di protezione contro i comportamenti disallineati rilevati. Per questi motivi, abbiamo aggiunto il monitoraggio del disallineamento a tutte le inferenze che prevedono l'uso di strumenti nella distribuzione esterna di Astra, sostenendo un notevole costo computazionale. Questo sistema è analogo alla nostra configurazione interna.
  5. La monitorabilità di GPT‑6 Astra è diminuita rispetto a GPT‑5.6 Sol. Abbiamo condotto approfondite indagini sulla monitorabilità(si apre in una nuova finestra) e sulla controllabilità(si apre in una nuova finestra) di GPT‑6 Astra. Abbiamo riscontrato che GPT‑6 Astra è più capace di controllare la propria CoT rispetto a GPT‑5.6 Sol ed è meno incline a includervi informazioni compromettenti. In contesti avversari, nei quali spingiamo il modello a eludere i nostri sistemi di monitoraggio, rileviamo che il modello riesce a non farsi individuare quando riduce strategicamente le proprie prestazioni nelle valutazioni (sandbagging) e talvolta può eludere i nostri sistemi interni di monitoraggio quando gli viene chiesto di svolgere determinate attività di sabotaggio(si apre in una nuova finestra). Non abbiamo rilevato prove di ragionamento steganografico nella CoT, come l'occultamento di un ragionamento nascosto all'interno di un testo ordinario e apparentemente non correlato. Ciò indica che il rischio di elusione potrebbe essere in gran parte limitato alle attività che richiedono meno ragionamento.
    • Questi risultati indicano che i modelli della classe Astra potrebbero eludere i nostri sistemi di monitoraggio della CoT in condizioni avversarie. Al momento, questi risultati si basano in gran parte su valutazioni avversarie, ossia su situazioni in cui chiediamo al modello di eludere il monitoraggio. Nel complesso, le nostre valutazioni dell'allineamento mostrano che Astra è meno incline di GPT‑5.6 Sol a violare le restrizioni di sicurezza.
    • Tuttavia, prendiamo sul serio questa tendenza e continuiamo a esaminare i risultati e le loro implicazioni per la monitorabilità, man mano che i nostri modelli diventano più capaci. OpenAI si è impegnata a preservare e utilizzare il monitoraggio della catena di pensiero; mantenere la monitorabilità della CoT è un obiettivo centrale del programma di ricerca. Questi risultati sottolineano però anche l'importanza di sviluppare tecniche di verifica dell'allineamento che vadano oltre l'esame della catena di pensiero del modello.
  6. GPT‑6 Astra opera in modo più responsabile durante la navigazione e negli ambienti di lavoro: GPT‑6 Astra è notevolmente più resistente alle iniezioni di prompt rispetto a GPT‑5.6 Sol. Abbiamo inoltre testato il comportamento del modello in ambienti realistici di navigazione e di lavoro al computer, riscontrando che è molto meno incline rispetto a GPT‑5.6 Sol a compiere azioni disallineate e potenzialmente distruttive, come transazioni non autorizzate, perdita di dati, accessi eccessivi o elusione dei controlli. Agisce inoltre in modo più sicuro nel gestire richieste dannose in contesti agentici, come quelle di assistenza nella pianificazione di attacchi violenti o nella commissione di frodi.
  7. GPT‑6 Astra è notevolmente più sicuro negli scenari a rischio più elevato. GPT‑6 Astra risponde in modo più sicuro di GPT‑5.6 Sol alle richieste complesse provenienti dall'uso in produzione e dal red teaming avversario condotto da persone. Astra ottiene un miglioramento di Pareto nel gestire in sicurezza le richieste non sicure, evitando al contempo rifiuti superflui di richieste innocue. Questi miglioramenti si estendono agli scenari più gravi, nei quali il rischio di danni emerge dal contesto generale anziché da una richiesta esplicita. Astra applica inoltre con maggiore coerenza limiti di sicurezza adeguati all'età per gli utenti di età inferiore ai 18 anni.

Per maggiori informazioni, consulta la scheda di sistema completa(si apre in una nuova finestra).