Rendiamo disponibile GPT‑Live‑1 nell’API, offrendo agli sviluppatori un modello vocale potente e naturale per creare app con funzionalità vocali e flussi di lavoro aziendali. Presentato per la prima volta su ChatGPT, GPT‑Live‑1 è in grado di ascoltare e parlare contemporaneamente e, come dimostrato con Codex e ChatGPT Work(si apre in una nuova finestra), può delegare ragionamenti più approfonditi e azioni ai modelli e agli strumenti a cui è abbinato.
Per rendere GPT‑Live‑1 disponibile nell’API, ci siamo concentrati su nuove funzionalità che consentono agli sviluppatori di orientare e personalizzare le esperienze vocali in base a utenti, flussi di lavoro e obiettivi. Uno dei principali punti di forza di GPT‑Live‑1, la gestione fluida delle interruzioni, sta già producendo risultati concreti per le aziende: nelle prime valutazioni, Speak ha rilevato che GPT‑Live‑1 concedeva agli studenti più tempo per riflettere prima della risposta del tutor linguistico, riducendo di quasi l’80% le interruzioni rispetto ai precedenti sistemi basati sui turni.
Punti di forza principali di GPT‑Live‑1 nell’API:
Gestione delle interruzioni: migliora la gestione delle interruzioni con un unico modello che elabora congiuntamente l’audio in ingresso e in uscita, evitando la latenza e i passaggi poco affidabili delle architetture concatenate STT–LLM–TTS.
Delega del ragionamento e delle chiamate agli strumenti: GPT‑Live‑1 può delegare il ragionamento e le chiamate agli strumenti a un modello di testo back-end come GPT‑6 Astra o a un modello di terze parti.
Tono, ritmo e stile: consente agli sviluppatori di definire il tono, il ritmo e lo stile conversazionale di un agente tramite il prompt di sistema.
Gestione silenziosa del contesto e rumore di fondo: gestisce meglio il rumore di fondo e i silenzi senza interrompere la conversazione né descrivere ad alta voce ogni passaggio.
Affidabilità nelle sessioni prolungate: migliora la conservazione del contesto e la qualità della conversazione nelle interazioni di lunga durata.
Supporto per la telefonia: consente di implementare agenti vocali full duplex per le chiamate, dalle prenotazioni al ristorante all'assistenza clienti.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Questa demo è a tempo limitato. Utilizzandola, accetti le Condizioni d'uso di OpenAI e riconosci la nostra Informativa sulla privacy.
Gli agenti vocali tradizionali uniscono sistemi di riconoscimento vocale, un modello di ragionamento e sistemi di sintesi vocale. Ogni passaggio di consegne aumenta la latenza e le possibilità di perdere la tempistica, il contesto o il ritmo naturale della conversazione. Spesso spetta agli sviluppatori coordinare queste fasi, compresa la gestione di interruzioni, pause o cambi di direzione.
GPT‑Live‑1 gestisce ascolto e parlato in un unico modello, semplificando il livello vocale. Può rispondere a interruzioni e segnali di assenso man mano che si verificano, delegando al back-end i ragionamenti più approfonditi. In questo modo la conversazione può proseguire mentre le attività vengono svolte in background.
Gli sviluppatori scelgono i modelli, gli strumenti e l'infrastruttura dell'agente alla base della conversazione. Per esempio, possono abbinare GPT‑Live‑1 a un modello come Luna per attività ad alto volume, come la pianificazione o gli aggiornamenti sugli ordini, e usare un modello come Astra per problemi complessi dei clienti che richiedono ragionamento. Questa flessibilità consente agli sviluppatori di adattare a ogni attività la profondità del ragionamento, la velocità e il costo.
GPT‑Live‑1 fornisce nativamente trascrizioni ASR e testo delle risposte. Offre inoltre un’ottima comprensione dei contenuti alfanumerici e supporta l’assegnazione di priorità alle parole chiave. Sebbene GPT‑Live‑1 non sia un modello basato sui turni, supporta nativamente il rilevamento dei turni, consentendo agli sviluppatori di continuare a progettare esperienze con confini espliciti tra un turno e l’altro.
Nelle nostre valutazioni, GPT‑Live‑1 migliora le prestazioni di Full Duplex Bench di 30 punti percentuali rispetto a GPT‑Realtime‑2.1, con notevoli miglioramenti nella latenza dei turni di parola e nel comportamento interattivo. Abbinato a GPT‑6 Astra con un livello di ragionamento medio, si classifica anche al primo posto su Tau3, che misura l’intelligenza degli agenti vocali di frontiera nelle attività end-to-end.
Valuta attività vocali di assistenza clienti nei settori del trasporto aereo, della vendita al dettaglio e delle telecomunicazioni. Pass@1 misura il successo delle attività; il risultato principale attribuisce lo stesso peso a ciascun settore.
* Backend di GPT Live: Astra (medio).
Valuta l’assistenza bancaria vocale con recupero delle conoscenze e strumenti per gli account. Pass@1 è la frazione di 97 attività banking_knowledge completate con successo.
* Backend di GPT Live: Astra (medio).
Valuta la gestione delle pause, l’alternanza dei turni conversazionali, le interruzioni e i segnali di ascolto.
Verifica le reazioni al parlato in sottofondo, al parlato rivolto a un’altra persona, ai segnali di ascolto dell’interlocutore e alle interruzioni.
Misura la rapidità con cui l’agente inizia a rispondere dopo che l’utente ha concluso un turno.
Verifica l’uso degli strumenti a partire da richieste vocali contenenti pause naturali, esitazioni e autocorrezioni. Pass@1 valuta la sequenza delle chiamate agli strumenti.
* Backend di GPT Live: Terra (basso).
Valuta la risposta vocale a richieste che utilizzano strumenti e contengono pause, esitazioni e autocorrezioni. Misura quanto la risposta corrisponda all’intento di riferimento.
* Backend di GPT Live: Terra (basso).
Gli sviluppatori hanno bisogno di voci adatte ai loro prodotti e naturali per chi li utilizza. Con GPT‑Live‑1, passiamo da una selezione limitata di voci in tempo reale a una scelta più ampia di accenti, dialetti e lingue, offrendo agli sviluppatori maggiore libertà nel definire la voce dei propri assistenti.
Nei prossimi mesi continueremo ad ampliare le opzioni vocali e la disponibilità delle lingue.
GPT‑Live‑1 è ora disponibile nell'API(si apre in una nuova finestra) al prezzo di 0,05 $ al minuto per il livello vocale front-end. Abbinalo al modello back-end e all’infrastruttura dell’agente più adatti al tuo prodotto, quindi crea un’esperienza vocale in grado di adattarsi al lavoro richiesto.
Per accedere alle voci personalizzate, contatta il team vendite e scopri di più sull’idoneità e sulla procedura di richiesta.
Un altro modo per creare flussi di lavoro vocali basati su GPT‑Live‑1 è usare OpenAI Presence, che utilizza il modello per gestire interazioni vocali in tempo reale. Presence aiuta le aziende a implementare agenti IA affidabili in grado di rispondere alle domande, risolvere problemi, usare i sistemi aziendali, eseguire azioni approvate e coinvolgere una persona quando necessario. Contatta il responsabile del tuo account OpenAI per saperne di più.

