Presentem GPT‑Live‑1 a l'API
GPT‑Live‑1 porta a l'API les converses naturals i full-duplex de ChatGPT, ara amb millor seguiment i delegació d'instruccions, personalitat ajustable, telefonia, fiabilitat en sessions llargues i gestió silenciosa del context.
[MARCADOR DE POSICIÓ: Data de publicació pendent de confirmació.]
[MARCADOR DE POSICIÓ: Vídeo testimonial de Yelp; el vídeo final, la miniatura, els subtítols i la transcripció estan pendents.]
Avui incorporem GPT‑Live‑1 a l'API, perquè els desenvolupadors puguin combinar un potent model de veu amb intel·ligència d'avantguarda a les seves aplicacions. Presentat inicialment a ChatGPT, GPT‑Live‑1 pot escoltar i parlar alhora i, com s'ha vist amb Codex i ChatGPT Work(s'obre en una finestra nova), pot delegar raonaments i accions més profunds als models i les eines amb què es combina.
Per al llançament de GPT‑Live a l'API, ens hem centrat en noves capacitats que permeten als desenvolupadors adaptar les experiències de veu als usuaris, els fluxos de treball i els objectius. Per exemple, en les primeres avaluacions, l'aplicació d'aprenentatge d'idiomes Speak va observar que GPT‑Live‑1 reduïa gairebé un 80% les interrupcions durant les pauses de reflexió dels estudiants respecte dels sistemes anteriors basats en torns, i així els donava més temps per trobar les paraules abans que intervingués el tutor.
El llançament a l'API incorpora:
Gestió de les interrupcions: Un únic model raona conjuntament sobre l'àudio d'entrada i de sortida, cosa que evita la latència i les transferències fràgils de les arquitectures STT–LLM–TTS encadenades.
Orquestració d'agents: Segueix amb més fiabilitat instruccions de diversos passos, executa crides a eines personalitzades i delega raonaments o accions més profunds al model de backend o a l'entorn d'execució de l'agent que triï el desenvolupador.
Veus personalitzades: Incorpora [XX—xifra pendent] veus personalitzades noves en [YY—llengües pendents] llengües, perquè les marques puguin crear experiències de veu naturals i distintives en diferents llengües i dialectes.
Personalitat ajustable: Permet als desenvolupadors definir el to, el ritme i l'estil conversacional d'un agent mitjançant la indicació del sistema.
Gestió silenciosa del context i soroll de fons: Gestiona millor el soroll de fons i els silencis sense interrompre la conversa ni narrar cada pas en veu alta.
Intel·ligència flexible: Permet als desenvolupadors triar qualsevol model de backend o entorn d'execució de l'agent que s'adapti al seu flux de treball.
Fiabilitat en sessions llargues: Millora la retenció del context i la qualitat de la conversa en interaccions prolongades.
Compatibilitat amb telefonia: Permet desplegar agents de veu full-duplex per a trucades telefòniques, des de reserves de restaurant fins a l'atenció al client.

[MARCADOR DE POSICIÓ: Demostració de veu interactiva; es mostra la maqueta d'origen i l'experiència final de GPT‑Live‑1 està pendent.]
Els agents de veu tradicionals encadenen la conversió de veu a text, un model de raonament i la conversió de text a veu. Cada transferència afegeix latència i crea més ocasions de perdre la sincronització, el context o el ritme natural de la conversa. Sovint, els desenvolupadors han de coordinar aquestes etapes, inclòs què passa quan algú interromp, fa una pausa o canvia de rumb.
GPT‑Live‑1 gestiona l'escolta i la parla en un únic model, cosa que simplifica la capa de veu en directe. Pot respondre a les interrupcions i als senyals de confirmació al moment, mentre delega el raonament més profund al backend. Això permet que la conversa continuï mentre la feina es fa en segon pla.
Els desenvolupadors trien els models, les eines i l'entorn d'execució de l'agent que hi ha darrere de la conversa. Per exemple, poden combinar GPT‑Live‑1 amb un model com Luna per a tasques de gran volum, com la planificació o l'actualització de comandes, i fer servir un model com Astra per a problemes complexos dels clients que requereixin raonament. Aquesta flexibilitat permet als desenvolupadors ajustar la profunditat del raonament, la velocitat i el cost a cada tasca.
GPT‑Llive‑1 proporciona de manera nativa transcripcions ASR i el text de les respostes. També ofereix una gran comprensió alfanumèrica i admet la priorització de paraules clau. Tot i que GPT‑live no és un model basat en torns, admet de manera nativa la detecció de torns, de manera que els desenvolupadors poden continuar creant experiències amb límits de torn explícits.
[MARCADOR DE POSICIÓ: Comparació d'àudio en paral·lel entre GPT‑Live‑1 i un sistema de veu en cascada; els fitxers d'àudio i les transcripcions estan pendents.]
En les nostres avaluacions, GPT‑Live‑1 combinat amb GPT‑6 Astra amb un esforç de raonament mitjà ocupa el primer lloc a Tau3, que mesura la intel·ligència d'avantguarda dels agents de veu en tasques d'extrem a extrem, i també el primer lloc a Full Duplex Bench, que avalua la interactivitat, la latència dels torns de paraula, les crides a eines i la qualitat de les respostes.

Els desenvolupadors necessiten veus que encaixin amb el seu producte i sonin naturals per a qui l'utilitza. Amb GPT‑Live‑1, passem d'un petit conjunt de veus en temps real a una selecció més àmplia d'accents, dialectes i llengües, perquè els desenvolupadors puguin triar millor com sonen els seus assistents.
Quartz—anglès australià, femenina, generada
Ripple—anglès australià, masculina, natural
Vesper—anglès britànic, masculina, natural
Willow—anglès irlandès, femenina, natural
Stone—anglès irlandès, masculina, natural
Gleam—anglès nord-americà, femenina, natural
Meridian—anglès nord-americà, masculina, natural
Bossa—portuguès brasiler, femenina, natural
Tempo—portuguès brasiler, masculina, natural
Aster—anglès de l'Índia, femenina, generada
Beacon—anglès de les Filipines, masculina, generada
Delta—anglès del sud dels EUA, femenina, generada
Cinder—anglès del sud dels EUA, masculina, generada
[MARCADOR DE POSICIÓ: Selector de veu amb entre 3 i 5 frases de mostra en bucle per veu; les mostres d'àudio i l'experiència interactiva estan pendents.]
Durant els pròxims mesos, continuarem ampliant les opcions de veu i la disponibilitat de llengües.
GPT‑Live‑1 ja està disponible a l'API per 0,05 $ per minut per a la capa de veu del front-end. Combineu-lo amb el model de backend i l'entorn d'execució de l'agent que s'adaptin al producte i creeu una experiència de veu que pugui créixer d'acord amb la feina que hagi de fer.
Per accedir a veus personalitzades, contacteu amb l'equip comercial per obtenir més informació sobre els requisits i el procés de sol·licitud.
Podeu començar més de pressa amb GPT‑Live‑1 mitjançant Presence, que admet experiències de veu i xat en temps real, com ara l'atenció al client, les vendes sortints i els fluxos de treball interns d'alt risc. Contacteu amb el vostre director de compte d'OpenAI per obtenir-ne més informació.


