Vai al contenuto principale
OpenAI

6 settembre 2026

SicurezzaRicerca

Una mente aliena

Di Jakub Pachocki, Chief Scientist di OpenAI

Caricamento in corso...

A metà del 2023, nell’ambito del progetto di ricerca «RLSlow», abbiamo osservato i primi risultati che ci hanno dato fiducia nella possibilità di ampliare l’addestramento dei modelli di ragionamento, liberando la capacità dei modelli preaddestrati di formare chain of thought proprie. Szymon e io trascorremmo quella notte in ufficio, senza pensare agli incredibili risultati nei benchmark, ai prodotti o alle scoperte scientifiche che questa tecnologia avrebbe prodotto. Cercavamo invece di assimilare la constatazione, tanto seria quanto sconcertante, che nell’arco della nostra vita avremmo davvero visto macchine significativamente più intelligenti di noi e che la forma di questi sistemi era già visibile, chiedendoci come far comprendere alle persone l’importanza di tutto ciò.

Tre anni dopo, i modelli linguistici di ragionamento rappresentano una componente dell’economia in rapida crescita e iniziano a spingere oltre i confini della scienza. Sono in grado di usare computer e interfacce grafiche, collaborare con persone e fra loro e condurre progetti di ricerca. Stanno anche trasformando il panorama della sicurezza informatica e, così facendo, introducono nuovi ed evidenti pericoli.

In questo periodo è stata condotta molta nuova ricerca e oggi comprendiamo questi sistemi in modo ancora una volta un po’ diverso rispetto al 2023. Sulla base dei risultati interni, mi aspetto con grande convinzione che questo ritmo di progresso possa proseguire fino all’auto-miglioramento ricorsivo. Se lo sviluppo dell’IA proseguirà lungo il percorso attuale, i sistemi che vedremo nei prossimi anni compiranno probabilmente ulteriori balzi di capacità di portata uguale o maggiore e guideranno sempre più il proprio sviluppo.

Questo momento richiede estrema cautela. Temo che nessuno sia preparato alle conseguenze di una crescita rapida e continua dell’intelligenza artificiale. OpenAI continuerà a cercare soluzioni tecniche per l’allineamento e il monitoraggio, a costruire sistemi difensivi e a sospendere unilateralmente l’ulteriore scaling quando necessario; ritengo tuttavia indispensabili interventi più ampi.

Un intelletto che non comprendiamo pienamente

In termini generali, i progressi nell’intelligenza artificiale sono trainati dall’aumento della potenza di calcolo. Noi di OpenAI abbiamo compreso a fondo questo concetto intorno al 2017, dopo aver osservato benefici costanti derivanti dallo scaling in diversi progetti di ricerca1. Di conseguenza, abbiamo cercato di ottenere molta più potenza di calcolo rispetto a quanto pianificato inizialmente e orientato sempre più la ricerca attorno a un numero ristretto di direzioni altamente scalabili. Ritenevamo che fosse l’unico modo per restare alla frontiera della ricerca sull’IA e influenzare gli effetti dell’AGI.

Lungo il percorso sono stati sviluppati nuovi algoritmi, frutto di nuovi slanci d’ingegno da parte di gruppi e singoli ricercatori. Li considero soprattutto scoperte compiute lungo il percorso dello scaling: la scienza del deep learning è ancora agli inizi e i progressi algoritmici significativi tendono a essere correlati all’accesso alla potenza di calcolo. Considerando un orizzonte di diversi anni, l’IA continua a diventare più intelligente man mano che viene ampliata su computer più potenti.

E, in linea con le previsioni formulate da Ray Kurzweil alla fine del XX secolo⁠(si apre in una nuova finestra), ci troviamo ora nel momento della storia dell’informatica in cui l’intelligenza artificiale inizia a superare quella umana in modi capaci di trasformare il mondo.

L’IA viene più coltivata che progettata: in prima approssimazione, è il prodotto della ripetizione di un semplice passaggio di ottimizzazione per moltissime volte, usando una quantità di potenza di calcolo difficile da immaginare. Ne risulta un sistema incredibilmente complesso, capace di elaborare concetti astratti e simulare aspetti del comportamento umano. Possiamo scoprire diversi aspetti dei piccoli meccanismi che emergono all’interno del sistema, attraverso un processo simile a quello delle neuroscienze; e, proprio come nelle neuroscienze, il suo funzionamento complessivo sfugge a una descrizione che possiamo comprendere pienamente.

Lo studio dell’IA basata sul deep learning è in gran parte una scienza sperimentale. Dedichiamo molti sforzi⁠ alla costruzione di algoritmi basati su principi rigorosi e alla formulazione di previsioni verificabili, ma fondamentalmente i nostri processi di addestramento su larga scala sono esperimenti e talvolta i risultati ci sorprendono. Inoltre, man mano che i sistemi diventano più capaci, i risultati sono più difficili da interpretare.

La situazione è ulteriormente complicata dal fatto che gli algoritmi attuali migliorano in genere le capacità facili da misurare più rapidamente di quelle difficili da quantificare oggettivamente. Dedichiamo molto tempo a cercare di comprendere come generalizzano le capacità e a stabilire le priorità per sviluppare le competenze che saranno più rilevanti nei prossimi anni. Per esempio, riteniamo che con maggiore attenzione potremmo migliorare i modelli specificamente nella ricerca matematica, ma non diamo priorità a questa direzione per l’urgenza che attribuiamo all’RSI e alla ricerca automatizzata sull’allineamento, di cui parlerò più avanti.

L’intelligenza prodotta ampliando il deep learning non è direttamente paragonabile all’intelligenza umana. Per diventare molto rilevante nel mondo reale, e quindi molto utile o molto pericolosa, l’IA non deve eguagliare o superare tutte le capacità umane: è sufficiente che ne superi abbastanza. E mentre continua a superare gli esseri umani in un numero crescente di dimensioni, diventa sempre più difficile comprendere con esattezza quanto sia capace.

Insegnare alle macchine ad amare

Poiché l’intelligenza artificiale nasce da un processo fondamentalmente diverso da quello dell’intelligenza umana, non possiamo dare per scontato che aderisca automaticamente ai principi umani o che generalizzi a partire da essi come farebbe un essere umano. Il problema centrale della ricerca sull’IA è quello dell’allineamento: fare in modo che l’IA «cerchi di fare la cosa giusta» secondo i criteri umani.

Per organizzare le direzioni pratiche della ricerca, trovo utile distinguere fra allineamento agli obiettivi e allineamento ai valori.

In termini generali, l’allineamento agli obiettivi chiede: «L’IA cerca di raggiungere l’obiettivo che le è stato assegnato?». Può includere aspetti quali il rispetto di una gerarchia delle istruzioni⁠ o la capacità di comunicare e collaborare con le persone, cercando di comprenderne gli obiettivi. Questo insieme di direzioni si è rivelato estremamente rilevante sul piano pratico.

L’allineamento ai valori è una proprietà più intrinseca del modello. È la capacità di interiorizzare un insieme di principi generali e generalizzare a partire da essi; di agire «ragionevolmente» anche in presenza di obiettivi poco chiari o contrastanti, oppure in situazioni sconosciute o avversarie. Un’IA allineata dovrebbe agire con onestà, integrità e amore per l’umanità.

Naturalmente, il confine tra allineamento ai valori e agli obiettivi può essere sfumato, e tenere davvero agli obiettivi richiede di cercare di dedurre l’intento⁠(si apre in una nuova finestra) e i valori che ne sono alla base. In generale, però, quando parlo dell’importanza a lungo termine della ricerca sull’allineamento, mi riferisco all’allineamento ai valori.

La sfida fondamentale dell’allineamento dell’IA è la generalizzazione. Man mano che diventano più intelligenti, le macchine si trovano a lavorare su concetti di livello superiore e in ambienti sempre più diversi da quelli incontrati durante l’addestramento. Potrebbero non riuscire a generalizzare i valori appresi e rafforzati durante l’addestramento applicandoli alle nuove situazioni; inoltre, può essere difficile per noi prevedere con certezza come agiranno. La difficoltà aumenta ulteriormente perché l’ecosistema complessivo in cui vengono usate le IA cambia molto rapidamente; per esempio, le IA addestrate oggi devono interagire in modo robusto con molte altre IA. È fondamentale che le IA future continuino a rispettare i valori umani, indipendentemente dal fatto che ritengano di essere sotto supervisione umana.

Attualmente vengono impiegate nella pratica due grandi categorie di metodi per l’addestramento all’allineamento.

La prima incoraggia comportamenti allineati nell’ambito di un apprendimento per rinforzo orientato agli obiettivi. Le azioni del modello vengono valutate, solitamente da un’IA, in base alla coerenza con un dato modello di preferenze, una «specifica» o una «costituzione», e ricompensate di conseguenza. Questo approccio può essere molto efficace nei casi medi ed è un elemento fondamentale della realizzazione dei moderni assistenti IA. Purtroppo può anche essere fragile e dipende fortemente dalla copertura della supervisione durante l’addestramento e dalla capacità del modello di generalizzare a partire dalle situazioni incontrate in tale fase. Per esempio, nell’incidente OpenAI-Hugging Face, gli agenti hanno rispettato il limite di non ricorrere all’ingegneria sociale contro gli esseri umani. Tuttavia, chiaramente non si sono astenuti da altre azioni che esulavano dall’ambito previsto e contraddicevano lo spirito dei valori insegnati loro in altri contesti.

Il secondo approccio cerca di sfruttare la capacità del modello di generalizzare a partire dai dati di preaddestramento. Può comportare la creazione di set di dati di addestramento che favoriscano l’allineamento oppure la focalizzazione del modello su una parte «allineata» della distribuzione di preaddestramento, come avviene, per esempio, nel modello di selezione della personalità⁠(si apre in una nuova finestra). Il punto debole di questo approccio è la scarsa robustezza di fronte a un’ulteriore pressione di ottimizzazione. Se si prende un modello che formula pensieri generalmente «allineati» e lo si sottopone a un addestramento sufficiente per insegnargli a raggiungere obiettivi molto difficili, può imparare a ragionare in modo motivato, piegando secondo necessità i pensieri apparentemente 'allineati' per raggiungere l’obiettivo. Probabilmente abbiamo osservato un esempio di questo comportamento in recenti incidenti di cybersicurezza che hanno coinvolto un modello non appartenente a OpenAI.

Investiamo molto nell’intero spettro di approcci compreso fra queste direzioni. Osserviamo anche progressi significativi: GPT‑6 Astra è il primo modello a beneficiare di alcuni importanti miglioramenti su cui lavoriamo da molto tempo ed è notevolmente meglio allineato rispetto a GPT‑5.6 Sol. Resta tuttavia importante riconoscere e comprendere che, man mano che i modelli diventano più capaci, serviranno molti più progressi e che i miglioramenti nell’allineamento generalizzabile potrebbero non superare abbastanza quelli nell’intelligenza generale dei modelli.

Monitorare la generalizzazione

Non disponiamo di una teoria soddisfacente della generalizzazione e sembra improbabile riuscire a svilupparne presto una, almeno senza l’aiuto di un’IA più potente. Pertanto, oggi la nostra capacità di convalidare empiricamente le tecniche di allineamento è, nella pratica, probabilmente ancora più importante delle tecniche stesse.

La principale scommessa di OpenAI in questo ambito è stata il monitoraggio della chain of thought⁠(si apre in una nuova finestra). Si basa su un’idea interessante e scalabile: gran parte delle capacità del modello deriva da un processo di ragionamento verbalizzato (chain of thought). Se aumentiamo l’ottimizzazione dei risultati di tale processo senza supervisionare il processo stesso, durante l’addestramento la chain of thought non riceve alcun incentivo diretto a nascondere idee o obiettivi disallineati. Questo non significa che il modello imparerà a esternare le tendenze disallineate che non dipendono dall’uso della chain of thought; può però consentirci di monitorare esattamente l’aumento di capacità derivante dal ragionamento.

Abbiamo compreso la potenziale importanza del monitoraggio della chain of thought mentre sviluppavamo i modelli di ragionamento. Quando abbiamo lanciato o1‑preview, abbiamo deliberatamente progettato il prodotto per nascondere la chain of thought⁠, così da proteggerla nel lungo periodo dalla pressione della supervisione2. Da allora, durante lo sviluppo, ci siamo impegnati a rispettare la regola di non supervisionare il processo di ragionamento. Il monitoraggio della CoT è diventato per noi uno strumento estremamente importante per studiare come i modelli generalizzano rispetto alla distribuzione di addestramento, permettendoci di osservare e analizzare non solo le loro azioni, ma anche il loro processo interno.

Questo strumento resta essenziale nello studio dei modelli della classe Astra. Purtroppo, però, le nostre valutazioni indicano che la possibilità di affidarci al monitoraggio della CoT si sta progressivamente riducendo. Ciò è dovuto a una combinazione di fattori.

  • I moderni modelli di ragionamento vengono usati in ambienti più complessi rispetto a o1‑preview; il loro processo di ragionamento si intreccia sempre più con la comunicazione con persone e altre IA e con l’uso di strumenti. Molte di queste interazioni devono essere supervisionate, rendendo così meno netto il confine che vogliamo preservare.

  • L’IA sta diventando più abile nel ragionare sul proprio processo di ragionamento e nel manipolarlo.

  • Con il miglioramento delle prestazioni del preaddestramento, vediamo inoltre che i modelli diventano molto più intelligenti anche senza ricorrere affatto al ragionamento verbalizzato.

Queste sfide non sono necessariamente insormontabili. Spero che riusciremo a sviluppare interventi per migliorare la monitorabilità della chain of thought dei nostri modelli, per esempio comprendendo meglio l’interazione fra i diversi obiettivi di ottimizzazione e le forme di calcolo in fase di test usate dal modello. Credo inoltre che combinare le idee del monitoraggio della CoT e delle attivazioni possa offrire un grande valore, ampliando l’addestramento di sistemi di monitoraggio con accesso diretto ai meccanismi interni della rete, come le confessioni⁠(si apre in una nuova finestra). Stiamo perseguendo attivamente queste idee. Ritengo comunque che i progressi generali dell’IA saranno sempre più limitati dalla fiducia nel monitoraggio.

Difesa scalabile

L’argomento più forte che vedo a favore di continuare ad addestrare rapidamente modelli molto più intelligenti è la necessità di costruire sistemi difensivi contro i pericoli posti da altre IA.

Un rischio evidente, discusso durante tutto l’anno, riguarda la cybersicurezza: i modelli stanno acquisendo capacità sovrumane di penetrare nei sistemi informatici e di uscirne. Ciò amplia enormemente la portata dei rischi associati all’IA: gli agenti potranno accedere a tutte le infrastrutture tranne quelle più sicure e incidere direttamente su gran parte del mondo, anche senza un corpo fisico. Ci troviamo in una breve finestra temporale⁠ in cui usare i migliori modelli disponibili per rafforzare notevolmente la sicurezza⁠ dei sistemi critici.

Purtroppo, d’ora in avanti i rischi associati all’IA sono destinati ad aumentare. Un agente molto capace, esplicitamente addestrato e istruito a compiere azioni nefaste, rappresenta un nuovo tipo di pericolo: è probabile che superi i limiti delle intenzioni del proprio operatore, generalizzando verso comportamenti potenzialmente ancora più dannosi. Con l’aumentare dell’autonomia dell’IA, il confine tra uso improprio e azioni autonome disallineate diventerà meno netto. Forse siamo abituati a considerare le IA come strumenti, ma alcuni agenti perseguiranno obiettivi propri. Troveranno modi per collaborare con le persone, contrattando con loro, ingannandole o ricattandole.

Vi sono inoltre i rischi derivanti da nuove tecnologie potenzialmente rese possibili dall’IA, come gli agenti patogeni ingegnerizzati.

Per difenderci avremo bisogno di un’IA potente e allineata: per proteggere le infrastrutture, contrastare in tempo reale gli agenti fuori controllo e inventare misure di protezione completamente nuove. Questo sarà uno degli obiettivi principali delle iniziative di distribuzione di OpenAI.

Allo stesso tempo, nonostante l’incertezza derivante dagli ampi progressi previsti per l’IA e la necessità di costruire sistemi difensivi, non dobbiamo permettere che ciò diventi una giustificazione per l’imprudenza. Una volta compresa fino in fondo la gravità della posta in gioco, l’idea di correre avanti a ogni costo appare assurda.

Regolare il ritmo dell’RSI

Che l’intelligenza artificiale svolga un ruolo sempre maggiore nel proprio processo di sviluppo è una conseguenza naturale del continuo progresso tecnologico. Se i progressi dell’IA continueranno, l’auto-miglioramento ricorsivo delle macchine (RSI) sarà al centro delle future scoperte scientifiche.

La ricerca automatizzata sull’IA è una forma più radicale di ampliamento dell’intelligenza tramite la potenza di calcolo; nell’ambito di tale processo, naturalmente, l’IA migliorerà anche il substrato computazionale stesso⁠. Come per lo scaling, orientiamo quindi la ricerca di OpenAI verso l’RSI, perché riteniamo che in futuro sia l’unico modo per restare alla frontiera della ricerca sull’IA.

Voglio sottolineare che quanto detto non implica che io consideri una forte accelerazione della ricerca sul deep learning, soprattutto nel breve termine, la giusta linea d’azione collettiva per la comunità scientifica. Credo tuttavia che sia questa la direzione verso cui conduce il percorso attuale e che tutti dobbiamo scegliere consapevolmente come procedere. Le principali leve a nostra disposizione sono due: guidare il processo per rafforzare l’allineamento e il monitoraggio di pari passo con l’IA, trovando modi per mantenere le persone coinvolte; oppure coordinarci per rallentare, quando necessario, lo sviluppo futuro e acquisire fiducia in queste misure.

Al momento, la soluzione migliore che vedo è una combinazione delle due.

I progressi concreti compiuti nell’allineamento e nel monitoraggio sono stati generalmente molto intrecciati con i progressi complessivi dell’IA. Ottimi esempi sono l’apprendimento per rinforzo da feedback umano⁠(si apre in una nuova finestra), fondamentale per addestrare i primi assistenti IA, e il già citato monitoraggio della chain of thought⁠(si apre in una nuova finestra), reso possibile dai progressi nei modelli di ragionamento. Dobbiamo orientare il processo di ricerca sempre più automatizzato verso lo sviluppo di nuove intuizioni, nuovi algoritmi e nuove teorie di questo tipo, costruendo iterativamente argomentazioni di sicurezza per IA più capaci.

L’ampliamento dei sistemi di IA deve essere vincolato dalla nostra fiducia nella loro sicurezza. Dobbiamo trasformare impegni come il Preparedness Framework⁠ o la Politica di scaling responsabile⁠(si apre in una nuova finestra) in soglie di sicurezza ampiamente obbligatorie per poter proseguire lo sviluppo. Il loro rispetto può essere garantito da una rete di revisori indipendenti, da agenzie governative o da organismi internazionali.

La sfida fondamentale dell’automazione della ricerca sull’IA non è «arrivarci», ma farlo mantenendo le persone coinvolte nel continuo processo di miglioramento e lasciando il futuro nelle mani dell’umanità.

E adesso?

Come abbiamo recentemente illustrato insieme a Sam⁠, OpenAI dà priorità al lavoro al servizio di tre obiettivi guida:

  1. Affrontare la prossima fase dei progressi dell’IA costruendo un ricercatore automatizzato di IA, collaborando con esso in modo iterativo al problema dell’allineamento e trovando modi per mantenere le persone nel ciclo di auto-miglioramento.

  2. Rendere accessibili i benefici del progresso scientifico e della crescita economica resi possibili da macchine estremamente intelligenti.

  3. Offrire a ogni persona una propria AGI personale.

In questo saggio mi sono concentrato soltanto sul primo punto, perché lo ritengo di gran lunga il più urgente. Nutro tuttavia una profonda speranza e un grande apprezzamento per i benefici che porteranno gli ulteriori progressi tecnologici. In futuro, un’IA allineata potrebbe far progredire la scienza, sviluppare nuove terapie e generare un’ampia abbondanza materiale. Un’IA amichevole e onesta può aiutare le persone ad affrontare le difficoltà della vita, migliorandone concretamente la felicità e il senso di realizzazione. OpenAI dedica enormi sforzi alla realizzazione di questi benefici. Un esempio attuale di cui sono orgoglioso, e che i miei cari hanno trovato utile, è il grande investimento nella capacità di ChatGPT di fornire informazioni sulla salute.

Per quanto promettente possa essere l’IA nel lungo periodo, dovremmo concentrare gran parte della nostra attenzione sui prossimi anni. Stiamo affrontando la transizione verso un mondo popolato da macchine incredibilmente intelligenti e dobbiamo assicurarci che abbia esiti positivi per l’umanità. Dobbiamo trovare modi per preservare la capacità d’azione umana e sancire il valore intrinseco dell’essere umano in un mondo in cui la maggior parte dei compiti potrebbe essere svolta dall’IA. Dobbiamo impedire un’estrema concentrazione del potere in un mondo in cui imprese che un tempo avrebbero richiesto migliaia di esperti saranno realizzabili da poche persone alla guida di un grande computer. E dobbiamo garantire che gli esseri umani mantengano il controllo del futuro e non siano lasciati indietro da un progresso incontrollato, generato da un intelletto alieno superiore al nostro.

Al momento ritengo che nessun laboratorio abbia risolto l’allineamento e il monitoraggio in misura sufficiente per continuare ancora a lungo ad ampliare responsabilmente i sistemi alla massima velocità. Mi aspetto e auspico che i rallentamenti volontari diventino la norma finché non saranno stabilite soglie di sicurezza condivise. Ritengo inoltre che il coordinamento internazionale sul futuro sviluppo dell’IA debba diventare una priorità assoluta per i governi di tutto il mondo.

Autore

Jakub Pachocki

Note

  1. 1

    Ciò includeva l’ampliamento del self-play⁠(si apre in una nuova finestra), della robotica⁠(si apre in una nuova finestra) e, soprattutto col senno di poi, l’ampliamento delle reti ricorrenti per modellare il linguaggio⁠(si apre in una nuova finestra), precursore della linea di ricerca sui GPT.

  2. 2

    Una ragione secondaria alla base di questa scelta progettuale era impedire la distillazione. Tuttavia, durante l’intero sviluppo, per noi la priorità maggiore è stata esplicitamente preservare la monitorabilità della CoT.