OpenAI

8 luglio 2026

ProdottoVersione

Presentiamo GPT‑Live

Una nuova generazione di modelli vocali per un’interazione uomo-IA naturale, ora alla base di ChatGPT Voce.

Caricamento in corso...

Aggiornamento del 31/07/2026: i file audio supportati generati con GPT‑Live tramite la modalità Voce di ChatGPT e l’API OpenAI includono ora il watermark SynthID. Il nostro strumento pubblico di verifica ora rileva i segnali di provenienza di OpenAI nei file audio supportati. Abbiamo inoltre introdotto l’accesso alla verifica tramite API, consentendo a sviluppatori e organizzazioni di integrare i controlli sulla provenienza nei propri flussi di lavoro. Queste novità ampliano le misure di sicurezza descritte di seguito e il nostro impegno generale per rendere più facilmente identificabili i contenuti generati da OpenAI.

Stiamo lanciando GPT‑Live, una nuova generazione di modelli vocali che rende parlare con l’IA molto più simile a una vera conversazione.

GPT‑Live si basa su un’architettura full-duplex, il che significa che può ascoltare e parlare nello stesso momento. Durante le conversazioni, GPT‑Live può mostrare che sta prestando attenzione con espressioni come "mhmm" o "sì", partecipare a scambi rapidi oppure restare in silenzio quando hai bisogno di un momento per pensare. Il risultato è un’esperienza vocale con cui è sorprendentemente facile dialogare.

GPT‑Live è anche il nostro modello vocale ad oggi più intelligente. Per le domande che richiedono ricerca sul web, ragionamento più approfondito o attività più complesse, delega dietro le quinte al nostro più recente modello di frontiera e riporta il risultato nella conversazione quando è pronto. Mentre lavora, GPT‑Live può continuare a parlare con te e mantenere il flusso della conversazione. Al lancio, GPT‑Live userà GPT‑5.5 in background. Man mano che rilasceremo nuovi modelli di frontiera, aggiorneremo continuamente il modello usato da GPT‑Live.

Questi progressi rendono possibile una nuova esperienza ChatGPT Voce, più intelligente e naturale da usare. Nel tempo, crediamo che questa ricerca aprirà anche la possibilità di usare la voce per attività sempre più complesse, di più lunga durata e con maggiori capacità agentiche.

Da oggi iniziamo a distribuire a livello globale agli utenti di ChatGPT due versioni di GPT‑Live: GPT‑Live‑1 e GPT‑Live‑1 mini. Prevediamo anche di portarle presto nell’API; sviluppatori e aziende possono registrarsi per ricevere aggiornamenti usando questo modulo.

Verso una nuova era dell’interazione tra esseri umani e IA

La nostra visione è rendere possibile un’interazione davvero naturale tra esseri umani e IA: un mondo in cui collaborare con l’IA sia fluido e reattivo come lavorare con un’altra persona, mentre il ragionamento e l’esecuzione di compiti complessi avvengono senza interruzioni in background.

Approcci precedenti

Le generazioni precedenti di sistemi di IA vocale ci hanno avvicinato a quella visione, ma con compromessi importanti.

Sistemi vocali a cascata

I sistemi vocali a cascata si basano su una serie di modelli che agiscono uno dopo l’altro per elaborare ogni turno. ChatGPT Voce originale concatenava tre modelli: un modello speech-to-text per trascrivere la voce, un modello linguistico di grandi dimensioni per produrre una risposta e un modello text-to-speech per riconvertirla in voce. Questo approccio ci ha permesso per la prima volta di parlare con modelli di IA di frontiera, ma la complessità aveva un costo: le informazioni potevano andare perse tra i modelli e le risposte erano lente e impacciate.

Sistema vocale a cascata

Risposte lente e poco naturali, lunghe pause

Trascrizione
Conversazione di esempio con la modalità vocale standard, utilizzando GPT-5.5 Instant

Modelli vocali a turni

I modelli vocali a turni, come la modalità vocale avanzata di ChatGPT, elaboravano e generavano audio all’interno di un unico modello, riducendo la latenza e rendendo le conversazioni più fluide, ma funzionavano comunque per turni distinti. Il modello doveva aspettare che l’utente smettesse di parlare prima di rispondere, creando uno scambio rigido. Inoltre, poiché il rilevamento del turno si basa sul silenzio, anche una breve pausa o un rumore di fondo potevano essere scambiati per la fine del turno, portando il modello a interrompere in momenti innaturali.

Modello vocale a turni

Risposte leggermente più rapide e fluide, ma lo scambio con il modello risulta ancora rigido

Trascrizione
Conversazione di esempio con la modalità vocale avanzata di ChatGPT

Il nostro nuovo approccio

GPT‑Live supera questi limiti attraverso due cambiamenti architetturali.

Interazione continua

Per prima cosa, abbiamo progettato GPT‑Live per l’interazione continua usando un’architettura full-duplex. Invece di elaborare una sequenza di messaggi separati, GPT‑Live elabora continuamente l’input mentre genera l’output. Il modello può quindi prendere decisioni sull’interazione molte volte al secondo: se parlare, continuare ad ascoltare, fare una pausa, interrompere o invocare uno strumento.

Questo consente al modello di partecipare a scambi più naturali, mantenere una migliore percezione del tempo e persino tradurre in tempo reale.

Interazione continua

Risposte rapide, naturali ed espressive e un ascolto più attivo

Trascrizione
Conversazione di esempio con GPT-Live-1, usando GPT-5.5 Instant

Delega per attività più approfondite

In secondo luogo, abbiamo separato GPT‑Live, che gestisce l’interazione continua, dal lavoro più approfondito. Quando una domanda richiede ricerca, ragionamento o capacità più agentiche, GPT‑Live può delegare il compito a un altro modello, come GPT‑5.5. Questo gli consente di portare avanti la conversazione anche mentre gestisce più attività in background.

Questo cambiamento architetturale permette inoltre a GPT‑Live di usare continuamente i modelli e gli agenti più recenti, combinando intelligenza di frontiera e interazione naturale.

Delega per lavori più approfonditi

GPT-Live offre risposte rapide e naturali, mentre GPT-5.5 gestisce la ricerca in background

Trascrizione
Conversazione di esempio con GPT-Live-1, usando GPT-5.5 Instant

Valutazioni

Abbiamo creato nuove valutazioni umane per misurare la piacevolezza e il flusso della conversazione. In questi confronti diretti, GPT‑Live‑1 e GPT‑Live‑1 mini sono nettamente preferiti alla modalità vocale avanzata in conversazioni comparabili di 5-10 minuti che misurano preferenza complessiva, alternanza dei turni, interruzioni, flusso conversazionale e naturalezza percepita di ogni interazione.

  • GPQA: GPT‑Live‑1 supera nettamente la modalità vocale avanzata su GPQA, che valuta il ragionamento scientifico a livello esperto in biologia, chimica e fisica.
  • BrowseComp: GPT‑Live‑1 mostra forti miglioramenti rispetto alla modalità vocale avanzata su BrowseComp, che valuta la ricerca web agentica e la capacità di trovare informazioni difficili da reperire.
  • τ³-Voice Telecom (variante interna)**: GPT‑Live‑1 supera la modalità vocale avanzata su τ³-Voice Telecom, che mette alla prova gli agenti vocali in attività realistiche di assistenza nel settore delle telecomunicazioni articolate su più turni.

* GPT‑Live‑1 (Immediato) e GPT‑Live‑1 mini usano il modello GPT‑5.5 Instant in background, mentre GPT‑Live‑1 Medio e GPT‑Live‑1 Alto usano il modello GPT‑5.5 Thinking con uno sforzo di ragionamento medio e alto.

** Per questa valutazione abbiamo usato un modello utente personalizzato, basato sui nostri più recenti modelli di ragionamento.

Una nuova esperienza ChatGPT Voce

Ogni settimana, oltre 150 milioni di persone parlano con ChatGPT usando funzionalità come Voce e Dettatura. Lo usano per ricevere aiuto quotidiano senza usare le mani, esercitarsi con le lingue, farsi raccontare storie della buonanotte o semplicemente chiacchierare durante gli spostamenti.

Da oggi, quando tocchi il pulsante Voce per parlare con ChatGPT, avrai un’esperienza migliorata basata su GPT‑Live: conversazioni più naturali, risposte più intelligenti, un ascolto migliore e risposte visive.

Conversazioni più naturali

Parlare con ChatGPT dovrebbe ora sembrare molto più simile a una vera conversazione. Puoi interromperlo con una domanda, fare una pausa per raccogliere le idee o chiedere a ChatGPT di rallentare. Risponde in modo naturale a ciò che dici con espressioni come "mh-mh" o "capito", così sai che ti sta seguendo. Abbiamo anche rimasterizzato le nove voci distinte di ChatGPT per GPT‑Live.

Risposte più intelligenti

ChatGPT Voce può ora attingere ai nostri più recenti modelli di frontiera, offrendoti risposte più intelligenti quando ne hai bisogno. Puoi anche scegliere il livello di ragionamento più adatto alle tue esigenze: Immediato per risposte rapide, oppure Medio e Alto quando vuoi che ChatGPT dedichi più tempo a pensare.

Ascolto migliore

Se ti prendi un momento per pensare, ChatGPT Voce ora aspetta invece di intervenire e interromperti. Se gli chiedi di restare in silenzio e ascoltare, lo farà. E quando c’è rumore di fondo, come traffico di passaggio o conversazioni nelle vicinanze, ChatGPT riesce meglio a concentrarsi sulla tua voce senza distrarsi.

Risposte visive a colpo d’occhio

Alcune risposte sono più utili quando puoi vederle. Mentre parli, ChatGPT può ora mostrare schede visive ricche per argomenti come meteo, azioni, sport e altro ancora. Voce continua inoltre a supportare ricerca, memoria, immagini e caricamenti di file.

Il risultato è un’esperienza ChatGPT Voce più naturale, più capace e più utile nella vita di tutti i giorni.

Sicurezza progettata per la voce

GPT‑Live è stato progettato per essere sicuro per impostazione predefinita. Si basa sui progressi in materia di sicurezza dei nostri modelli più recenti e aggiunge un addestramento dedicato alla sicurezza nelle principali aree di rischio, oltre a nuove protezioni pensate specificamente per la voce.

Test di sicurezza ampliati

Per rispecchiare meglio il modo in cui le persone usano la voce in contesti reali, abbiamo iniziato ampliando i nostri test di sicurezza per includere nuove valutazioni audio native. Abbiamo anche creato valutazioni sintetiche che usano audio generato per concentrarsi in modo più intensivo sulle principali aree di sicurezza, facendo tesoro di quanto appreso dalla modalità vocale avanzata. Queste aree includono autolesionismo, psicosi e mania, dipendenza emotiva dall’IA, violenza e contenuti sessuali. Anche esperti interni hanno sottoposto il modello a red teaming per rischi specifici delle interazioni vocali.

Nei nostri test, GPT‑Live ha ottenuto risultati comparabili o superiori alla modalità vocale avanzata in quasi tutte le aree valutate. Puoi leggere di più sui nostri test e sulle protezioni nella scheda di sistema(si apre in una nuova finestra) di GPT‑Live.

Protezioni integrate

Poiché le conversazioni vocali si svolgono in tempo reale, abbiamo integrato anche protezioni che possono intervenire mentre il modello sta parlando. Quando il sistema rileva un output potenzialmente non sicuro, può orientare il modello verso una risposta più sicura, mostrare ulteriori messaggi o risorse di sicurezza oppure terminare la conversazione vocale nei casi a rischio più elevato. Per le conversazioni che riguardano l’autolesionismo, abbiamo adattato alla voce i flussi di supporto di ChatGPT, inclusa l’offerta di assistenza tramite linee di crisi verificate da esperti.

Abbiamo progettato protezioni aggiuntive per supportare gli utenti adolescenti e addestrato direttamente nel modello comportamenti adeguati all’età, per ridurre il rischio di risposte inappropriate. I genitori possono scegliere, tramite il controllo parentale, se i propri figli adolescenti possono usare ChatGPT Voce; i genitori collegati possono ricevere una notifica nelle situazioni a rischio più elevato che coinvolgono segnali di possibile autolesionismo o intento suicidario.

Imparare dall’uso in contesti reali

Stiamo inoltre introducendo misurazioni di lungo periodo e monitoraggio post-lancio incentrati sulla dipendenza emotiva, per continuare a migliorare la nostra comprensione e perfezionare le protezioni. Basandoci sulle nostre ricerche precedenti su uso affettivo e benessere emotivo, questo ci aiuterà a individuare schemi emergenti e a migliorare il modo in cui il sistema risponde nelle interazioni emotivamente sensibili.

Infine, GPT‑Live è progettato per la conversazione, non per l’impersonificazione vocale. Usa un insieme di voci predefinite in ChatGPT, con protezioni per impedirgli di imitare la voce di una persona reale.

Ci impegniamo a sostenere sicurezza e benessere e continueremo a rafforzare queste protezioni man mano che impariamo dall’uso in contesti reali.

Disponibilità e limitazioni

GPT‑Live è ora in distribuzione per gli utenti ChatGPT di tutto il mondo su iOS, Android e ChatGPT.com(si apre in una nuova finestra). GPT‑Live‑1 diventerà il modello predefinito alla base di ChatGPT Voce per gli utenti Go, Plus e Pro, mentre GPT‑Live‑1 mini diventerà quello predefinito per gli utenti Free. Maggiori dettagli sulla disponibilità sono disponibili nel nostro Centro assistenza(si apre in una nuova finestra).

Abbiamo ottimizzato GPT‑Live per alcune delle lingue più diffuse in ChatGPT. Per alcune lingue, il modello potrebbe avere un accento non madrelingua o lacune nella fluidità. Stiamo lavorando attivamente per migliorare l’esperienza in tutte le lingue.

Al lancio, GPT‑Live non supporterà la voce con video o condivisione dello schermo in ChatGPT, ma stiamo lavorando per introdurre presto queste funzionalità. Puoi comunque accedere alle versioni legacy di ChatGPT Voce, incluse Standard e modalità vocale avanzata, dove queste funzionalità sono disponibili.

Autore

OpenAI