Vai al contenuto principale
OpenAI

10 settembre 2026

ProdottoVersione

Crea esperienze vocali più naturali con GPT‑Live‑1 nell’API

GPT‑Live‑1 porta nell’API le conversazioni naturali e full-duplex di ChatGPT, con maggiore controllo su come gli agenti vocali parlano e agiscono.

Caricamento in corso...

Rendiamo disponibile GPT‑Live‑1 nell’API, offrendo agli sviluppatori un modello vocale potente e naturale per creare app con funzionalità vocali e flussi di lavoro aziendali. Presentato per la prima volta su ChatGPT, GPT‑Live‑1 è in grado di ascoltare e parlare contemporaneamente e, come dimostrato con Codex e ChatGPT Work⁠(si apre in una nuova finestra), può delegare ragionamenti più approfonditi e azioni ai modelli e agli strumenti a cui è abbinato.

Per rendere GPT‑Live‑1 disponibile nell’API, ci siamo concentrati su nuove funzionalità che consentono agli sviluppatori di orientare e personalizzare le esperienze vocali in base a utenti, flussi di lavoro e obiettivi. Uno dei principali punti di forza di GPT‑Live‑1, la gestione fluida delle interruzioni, sta già producendo risultati concreti per le aziende: nelle prime valutazioni, Speak ha rilevato che GPT‑Live‑1 concedeva agli studenti più tempo per riflettere prima della risposta del tutor linguistico, riducendo di quasi l’80% le interruzioni rispetto ai precedenti sistemi basati sui turni.

Punti di forza principali di GPT‑Live‑1 nell’API:

  • Gestione delle interruzioni: migliora la gestione delle interruzioni con un unico modello che elabora congiuntamente l’audio in ingresso e in uscita, evitando la latenza e i passaggi poco affidabili delle architetture concatenate STT–LLM–TTS.

  • Delega del ragionamento e delle chiamate agli strumenti: GPT‑Live‑1 può delegare il ragionamento e le chiamate agli strumenti a un modello di testo back-end come GPT‑6 Astra o a un modello di terze parti.

  • Tono, ritmo e stile: consente agli sviluppatori di definire il tono, il ritmo e lo stile conversazionale di un agente tramite il prompt di sistema.

  • Gestione silenziosa del contesto e rumore di fondo: gestisce meglio il rumore di fondo e i silenzi senza interrompere la conversazione né descrivere ad alta voce ogni passaggio.

  • Affidabilità nelle sessioni prolungate: migliora la conservazione del contesto e la qualità della conversazione nelle interazioni di lunga durata.

  • Supporto per la telefonia: consente di implementare agenti vocali full duplex per le chiamate, dalle prenotazioni al ristorante all'assistenza clienti.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Questa demo è a tempo limitato. Utilizzandola, accetti le Condizioni d'uso di OpenAI e riconosci la nostra Informativa sulla privacy.

Semplifica l’architettura del tuo agente vocale e riduci la latenza vocale

Gli agenti vocali tradizionali uniscono sistemi di riconoscimento vocale, un modello di ragionamento e sistemi di sintesi vocale. Ogni passaggio di consegne aumenta la latenza e le possibilità di perdere la tempistica, il contesto o il ritmo naturale della conversazione. Spesso spetta agli sviluppatori coordinare queste fasi, compresa la gestione di interruzioni, pause o cambi di direzione.

GPT‑Live‑1 gestisce ascolto e parlato in un unico modello, semplificando il livello vocale. Può rispondere a interruzioni e segnali di assenso man mano che si verificano, delegando al back-end i ragionamenti più approfonditi. In questo modo la conversazione può proseguire mentre le attività vengono svolte in background.

“Rispetto alla nostra soluzione a cascata, GPT‑Live‑1 ha semplificato dell'80% la base di codice ed eliminato 23.000 righe di codice. Questo ha reso possibili conversazioni naturali e in tempo reale con i pazienti e ha permesso al nostro team di migliorare l'esperienza, dalla prenotazione di un appuntamento all'orientamento nel percorso di cura.”
—Tony Stoyanov, cofondatore e direttore tecnologico (CTO)

Gli sviluppatori scelgono i modelli, gli strumenti e l'infrastruttura dell'agente alla base della conversazione. Per esempio, possono abbinare GPT‑Live‑1 a un modello come Luna per attività ad alto volume, come la pianificazione o gli aggiornamenti sugli ordini, e usare un modello come Astra per problemi complessi dei clienti che richiedono ragionamento. Questa flessibilità consente agli sviluppatori di adattare a ogni attività la profondità del ragionamento, la velocità e il costo.

GPT‑Live‑1 fornisce nativamente trascrizioni ASR e testo delle risposte. Offre inoltre un’ottima comprensione dei contenuti alfanumerici e supporta l’assegnazione di priorità alle parole chiave. Sebbene GPT‑Live‑1 non sia un modello basato sui turni, supporta nativamente il rilevamento dei turni, consentendo agli sviluppatori di continuare a progettare esperienze con confini espliciti tra un turno e l’altro.

Misurare i vantaggi del full duplex

Nelle nostre valutazioni, GPT‑Live‑1 migliora le prestazioni di Full Duplex Bench di 30 punti percentuali rispetto a GPT‑Realtime‑2.1, con notevoli miglioramenti nella latenza dei turni di parola e nel comportamento interattivo. Abbinato a GPT‑6 Astra con un livello di ragionamento medio, si classifica anche al primo posto su Tau3, che misura l’intelligenza degli agenti vocali di frontiera nelle attività end-to-end.

Valuta attività vocali di assistenza clienti nei settori del trasporto aereo, della vendita al dettaglio e delle telecomunicazioni. Pass@1 misura il successo delle attività; il risultato principale attribuisce lo stesso peso a ciascun settore.


* Backend di GPT Live: Astra (medio).

Valuta l’assistenza bancaria vocale con recupero delle conoscenze e strumenti per gli account. Pass@1 è la frazione di 97 attività banking_knowledge completate con successo.


* Backend di GPT Live: Astra (medio).

Valuta la gestione delle pause, l’alternanza dei turni conversazionali, le interruzioni e i segnali di ascolto.

Verifica le reazioni al parlato in sottofondo, al parlato rivolto a un’altra persona, ai segnali di ascolto dell’interlocutore e alle interruzioni.

Misura la rapidità con cui l’agente inizia a rispondere dopo che l’utente ha concluso un turno.

Verifica l’uso degli strumenti a partire da richieste vocali contenenti pause naturali, esitazioni e autocorrezioni. Pass@1 valuta la sequenza delle chiamate agli strumenti.


* Backend di GPT Live: Terra (basso).

Valuta la risposta vocale a richieste che utilizzano strumenti e contengono pause, esitazioni e autocorrezioni. Misura quanto la risposta corrisponda all’intento di riferimento.


* Backend di GPT Live: Terra (basso).

Cosa dicono i clienti

1 di 4
“L’integrazione di GPT‑Live‑1 in Yelp Host e Hatch ha migliorato la gestione dei turni di parola e la precisione rispetto alla nostra architettura vocale tradizionale. Quando Yelp Host usa GPT‑Live‑1 per rispondere alle chiamate, ad esempio per prenotazioni e ordini di cibo, osserviamo miglioramenti significativi nei tassi di gestione. Inoltre, chi chiama usa frasi più complete e naturali: un segnale che l’esperienza all’altro capo del telefono è davvero diversa.”
—Alex Levy, direttore tecnologico (CTO)

Nuove opzioni vocali

Gli sviluppatori hanno bisogno di voci adatte ai loro prodotti e naturali per chi li utilizza. Con GPT‑Live‑1, passiamo da una selezione limitata di voci in tempo reale a una scelta più ampia di accenti, dialetti e lingue, offrendo agli sviluppatori maggiore libertà nel definire la voce dei propri assistenti.

Ascolta le nuove voci

Nei prossimi mesi continueremo ad ampliare le opzioni vocali e la disponibilità delle lingue.

Prezzi e disponibilità

GPT‑Live‑1 è ora disponibile nell'API⁠(si apre in una nuova finestra) al prezzo di 0,05 $ al minuto per il livello vocale front-end. Abbinalo al modello back-end e all’infrastruttura dell’agente più adatti al tuo prodotto, quindi crea un’esperienza vocale in grado di adattarsi al lavoro richiesto.

Collegare GPT-Live-1 a Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Collegamento di GPT-Live-1 a Codex. Questo estratto mostra come un’applicazione trasmette il contesto della conversazione a Codex e restituisce la relativa risposta a GPT-Live-1. La configurazione della connessione e la gestione della delega sono omesse.

Per accedere alle voci personalizzate, contatta il team vendite e scopri di più sull’idoneità e sulla procedura di richiesta.

Un altro modo per creare flussi di lavoro vocali basati su GPT‑Live‑1 è usare OpenAI Presence, che utilizza il modello per gestire interazioni vocali in tempo reale. Presence aiuta le aziende a implementare agenti IA affidabili in grado di rispondere alle domande, risolvere problemi, usare i sistemi aziendali, eseguire azioni approvate e coinvolgere una persona quando necessario. Contatta il responsabile del tuo account OpenAI per saperne di più.