Salta al contingut principal
OpenAI

10 de setembre del 2026

ProducteLlançament

Crea experiències de veu més naturals amb GPT‑Live‑1 a l'API

GPT‑Live‑1 porta a l'API les converses naturals i dúplex del ChatGPT, amb més control sobre com parlen i actuen els agents de veu.

S'està carregant…

Llancem GPT‑Live‑1 a l'API i oferim als desenvolupadors un model de veu potent i natural per crear aplicacions amb veu i fluxos de treball empresarials. Presentat inicialment al ChatGPT, GPT‑Live‑1 pot escoltar i parlar alhora i, com s'ha vist amb el Codex i ChatGPT Work⁠(s'obre en una finestra nova), pot delegar raonaments i accions més profunds als models i les eines amb què es combina.

Per al llançament de GPT‑Live‑1 a l'API, ens hem centrat en noves capacitats que permeten als desenvolupadors dirigir i personalitzar les experiències de veu en funció dels usuaris, els fluxos de treball i els objectius. Un dels punts forts principals de GPT‑Live‑1, la gestió fluida de les interrupcions, ja està tenint impacte empresarial: en les primeres avaluacions, Speak va observar que GPT‑Live‑1 donava als estudiants més temps per pensar abans no respongués el tutor de llengües, i reduïa gairebé un 80 % les interrupcions respecte dels sistemes anteriors basats en torns.

Punts forts de GPT‑Live‑1 a l'API:

  • Gestió de les interrupcions: millora la gestió de les interrupcions mitjançant un únic model que raona conjuntament sobre l'àudio d'entrada i de sortida, cosa que evita la latència i les transferències fràgils de les arquitectures STT–LLM–TTS encadenades.

  • Delegació de raonament i de crides a eines: GPT‑Live‑1 pot delegar el raonament i les crides a eines a un model de text del fons com GPT‑6 Astra o un model de tercers.

  • To, ritme i estil: permet als desenvolupadors definir el to, el ritme i l'estil conversacional d'un agent mitjançant la indicació del sistema.

  • Gestió silenciosa del context i soroll de fons: Gestiona millor el soroll de fons i els silencis sense interrompre la conversa ni narrar cada pas en veu alta.

  • Fiabilitat en sessions llargues: Millora la retenció del context i la qualitat de la conversa en interaccions prolongades.

  • Compatibilitat amb telefonia: Permet desplegar agents de veu full-duplex per a trucades telefòniques, des de reserves de restaurant fins a l'atenció al client.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Aquesta demostració té un límit de temps. En fer-ne ús, acceptes les condicions d'OpenAI i reconeixes la nostra política de privacitat.

Simplifica l'arquitectura dels teus agents de veu i redueix la latència de veu

Els agents de veu tradicionals encadenen la conversió de veu a text, un model de raonament i la conversió de text a veu. Cada transferència afegeix latència i crea més ocasions de perdre la sincronització, el context o el ritme natural de la conversa. Sovint, els desenvolupadors han de coordinar aquestes etapes, inclòs què passa quan algú interromp, fa una pausa o canvia de rumb.

GPT‑Live‑1 gestiona l'escolta i la parla en un únic model, cosa que simplifica la capa de veu. Pot respondre a les interrupcions i als senyals de confirmació de manera immediata, mentre delega el raonament més profund al fons. Això permet que la conversa continuï mentre la feina es fa en segon pla.

“En comparació amb la nostra implementació en cascada, GPT‑Live‑1 va simplificar la base de codi un 80% i va eliminar 23.000 línies de codi. Això va permetre converses naturals amb els pacients en temps real i va alliberar el nostre equip perquè millorés l'experiència, des de reservar una cita fins a orientar-se pel sistema assistencial.”
Tony Stoyanov, cofundador i director de Tecnologia

Els desenvolupadors trien els models, les eines i l'entorn d'execució de l'agent que hi ha darrere de la conversa. Per exemple, poden combinar GPT‑Live‑1 amb un model com Luna per a tasques de gran volum, com la planificació o l'actualització de comandes, i fer servir un model com Astra per a problemes complexos dels clients que requereixin raonament. Aquesta flexibilitat permet als desenvolupadors ajustar la profunditat del raonament, la velocitat i el cost a cada tasca.

GPT‑Live‑1 proporciona de manera nativa transcripcions ASR i text de resposta. També ofereix una gran comprensió alfanumèrica i admet la priorització de paraules clau. Tot i que GPT‑Live‑1 no és un model basat en torns, admet de manera nativa la detecció de torns, de manera que els desenvolupadors poden continuar desenvolupant-se al voltant de límits de torn explícits.

Mesura de l'avantatge del full-duplex

En les nostres avaluacions, GPT‑Live‑1 millora el rendiment a Full Duplex Bench en 30 punts percentuals respecte de GPT‑Realtime‑2.1, amb grans millores en la latència de l'alternança dels torns de conversa i el comportament interactiu. Combinat amb GPT‑6 Astra amb un esforç de raonament mitjà, també ocupa el primer lloc a Tau3, que mesura la intel·ligència d'avantguarda dels agents de veu en tasques d'extrem a extrem.

Avalua tasques orals d'atenció al client en els àmbits de les aerolínies, el comerç minorista i les telecomunicacions. Pass@1 mesura l'èxit de les tasques; el titular dona el mateix pes a cada àmbit.


* Fons de GPT Live: Astra (mitjà).

Avalua l'assistència bancària per veu amb recuperació de coneixement i eines de compte. Pass@1 és la fracció de 97 tasques banking_knowledge completades correctament.


* Fons de GPT Live: Astra (mitjà).

Avalua la gestió de les pauses, els torns de paraula conversacionals, les interrupcions i els senyals d'escolta activa.

Prova les reaccions a la parla de fons, a la parla dirigida a una altra persona, als senyals d'escolta de l'oient i a les interrupcions.

Mesura amb quina rapidesa l'agent inicia la resposta després que l'usuari acabi un torn.

Avalua l'ús d’eines a partir de sol·licituds orals que contenen pauses naturals, vacil·lacions i autocorreccions. Pass@1 puntua la seqüència de crides a eines.


* Fons de GPT Live: Terra (baix).

Avalua la resposta parlada a sol·licituds que utilitzen eines i que contenen pauses, vacil·lacions i autocorreccions. Puntua fins a quin punt la resposta coincideix amb la intenció de referència.


* Fons de GPT Live: Terra (baix).

Què diuen els clients

1 de 4
“La incorporació de GPT‑Live‑1 a Yelp Host i Hatch va millorar la gestió dels torns de paraula i la precisió respecte de la nostra arquitectura de veu tradicional. Quan Yelp Host utilitza GPT‑Live‑1 per atendre trucades, com ara reserves i comandes de menjar, observem millores significatives en els índexs de gestió de trucades. Les persones que truquen també s'expressen amb frases més completes i naturals, cosa que ens indica que l'experiència a l'altra banda del telèfon és realment diferent.”
Alex Levy, director de Tecnologia

Noves opcions de veu

Els desenvolupadors necessiten veus que encaixin amb el seu producte i sonin naturals per a qui l'utilitza. Amb GPT‑Live‑1, passem d'un petit conjunt de veus en temps real a una selecció més àmplia d'accents, dialectes i llengües, perquè els desenvolupadors puguin triar millor com sonen els seus assistents.

Escolta les veus noves

Durant els pròxims mesos, continuarem ampliant les opcions de veu i la disponibilitat de llengües.

Preus i disponibilitat

GPT‑Live‑1 ja està disponible a l'API avui⁠(s'obre en una finestra nova) a 0,05 $ per minut per a la capa de veu del front. Combina'l amb el model de fons i l'entorn d'execució de l'agent que s'adaptin al teu producte i crea una experiència de veu que pugui créixer d'acord amb la feina que hagi de fer.

Connexió de GPT-Live-1 al Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Connexió de GPT-Live-1 al Codex. Aquest fragment mostra com una aplicació passa el context de la conversa al Codex i en retorna la resposta a GPT-Live-1. S'ometen la configuració de la connexió i la gestió de la delegació.

Per accedir a veus personalitzades, contacta amb vendes per obtenir més informació sobre els requisits i el procés de sol·licitud.

Una altra manera de crear fluxos de treball de veu basats en GPT‑Live‑1 és amb OpenAI Presence, que utilitza el model per impulsar interaccions de veu en temps real. Presence ajuda les empreses a desplegar agents d'IA de confiança que poden respondre a preguntes, resoldre incidències, utilitzar sistemes de l'empresa, dur a terme accions aprovades i derivar a persones quan calgui. Posa't en contacte amb el teu director de compte d'OpenAI per obtenir-ne més informació.