Presentem GPT‑Live
Una nova generació de models de veu per a una interacció natural entre humans i IA, ara al darrere de ChatGPT Veu.
Actualització del 31 de juliol de 2026: L'àudio compatible generat amb GPT‑Live mitjançant ChatGPT Voice i l'API d'OpenAI ara inclou marques d'aigua de SynthID. La nostra eina pública de verificació ara pot detectar senyals de procedència d'OpenAI en fitxers d'àudio compatibles, i hem introduït l'accés a l'API per a la verificació perquè els desenvolupadors i les organitzacions puguin incorporar comprovacions de procedència als seus propis fluxos de treball. Aquestes actualitzacions es basen en l'enfocament de seguretat descrit a continuació i en la nostra tasca més àmplia per fer que el contingut generat per OpenAI sigui més fàcil d'identificar.
Llancem GPT‑Live, una nova generació de models de veu que fan que parlar amb la IA s’assembli molt més a mantenir una conversa real.
GPT‑Live es basa en una arquitectura full-duplex, és a dir, pot escoltar i parlar alhora. Durant les converses, GPT‑Live pot mostrar que està parant atenció amb expressions com «mm-hm» o «sí», participar en intercanvis ràpids o simplement quedar-se en silenci quan necessites un moment per pensar. El resultat és una experiència de veu amb què resulta sorprenentment fàcil conversar.
GPT‑Live és també el nostre model de veu més intel·ligent fins ara. Per a preguntes que requereixen cerca web, raonament més profund o tasques més complexes, delega en segon pla al nostre model d’avantguarda més recent i retorna el resultat a la conversa quan està a punt. Mentre treballa, GPT‑Live pot continuar parlant amb tu i mantenir el fil de la conversa. En el llançament, GPT‑Live utilitzarà GPT‑5.5 en segon pla. A mesura que publiquem nous models d’avantguarda, actualitzarem contínuament el model que fa servir GPT‑Live.
Aquests avenços impulsen una nova experiència de veu de ChatGPT, més intel·ligent i natural d’utilitzar. Amb el temps, creiem que aquesta recerca també permetrà utilitzar la veu per a tasques cada vegada més complexes, més llargues i amb més capacitat d’acció autònoma.
Avui comencem a desplegar dues versions de GPT‑Live —GPT‑Live‑1 i GPT‑Live‑1 mini— per als usuaris de ChatGPT d’arreu del món. També tenim previst portar-les aviat a l’API, i els desenvolupadors i les empreses es poden inscriure per rebre’n notificacions mitjançant aquest formulari.
Entrem en una nova era de la interacció entre humans i IA
La nostra visió és fer possible una interacció realment natural entre humans i IA: un món en què col·laborar amb la IA sigui tan fluid i receptiu com treballar amb una altra persona, mentre el raonament i l’execució de tasques complexes tenen lloc de manera imperceptible en segon pla.
Enfocaments anteriors
Les generacions anteriors de sistemes d’IA de veu ens van acostar a aquesta visió, però amb concessions importants.
Sistemes de veu en cascada
Els sistemes de veu en cascada es basen en una sèrie de models que actuen l’un darrere l’altre per processar cada torn. La veu original de ChatGPT encadenava tres models: un model de veu a text per transcriure la parla, un model de llenguatge gran per produir una resposta i un model de text a veu per tornar-la a convertir en parla. Aquest enfocament ens va permetre parlar per primera vegada amb models d’IA d’avantguarda, però la complexitat tenia un cost: es podia perdre informació entre models, i les respostes eren lentes i encarcarades.
Sistema de veu en cascada
Respostes lentes i poc naturals, pauses llargues
Models de veu per torns
Els models de veu per torns, com el mode de veu avançat de ChatGPT, processaven i generaven àudio dins d’un únic model, cosa que reduïa la latència i feia les converses més fluides, però encara funcionaven mitjançant torns separats. El model havia d’esperar que l’usuari deixés de parlar abans de respondre, cosa que donava lloc a intercanvis rígids. A més, com que la detecció de torns es basa en el silenci, fins i tot una pausa breu o soroll de fons es podia confondre amb el final del torn, fent que el model interrompés en moments poc naturals.
Model de veu per torns
Respostes una mica més ràpides i fluides, però l’intercanvi amb el model encara es percep rígid
El nostre nou enfocament
GPT‑Live resol aquestes limitacions mitjançant dos canvis d’arquitectura.
Interacció contínua
En primer lloc, hem creat GPT‑Live per a la interacció contínua amb una arquitectura full-duplex. En lloc de processar una seqüència de missatges separats, GPT‑Live processa contínuament l’entrada mentre genera la sortida. Així, el model pot prendre decisions d’interacció moltes vegades per segon: si ha de parlar, continuar escoltant, fer una pausa, interrompre o invocar una eina.
Això permet al model participar en intercanvis més naturals, mantenir una millor percepció del temps i fins i tot fer traducció en directe.
Interacció contínua
Respostes ràpides, naturals i expressives, i una escolta més activa
Delegació per a tasques més profundes
En segon lloc, hem separat GPT‑Live —que gestiona la interacció contínua— de les tasques més profundes. Quan una pregunta requereix cerca, raonament o capacitats més pròpies d’un agent, GPT‑Live pot delegar la tasca a un altre model, com ara GPT‑5.5. Això li permet mantenir la conversa, fins i tot mentre gestiona diverses tasques en segon pla.
Aquest canvi d’arquitectura també permet a GPT‑Live utilitzar contínuament els models i agents més recents, combinant la intel·ligència d’avantguarda amb una interacció natural.
Delegació per a feina més profunda
GPT-Live ofereix respostes ràpides i naturals, mentre que GPT-5.5 s’encarrega de la cerca en segon pla
Avaluacions
Hem creat noves avaluacions humanes per mesurar l’agradabilitat i la fluïdesa de la conversa. En aquestes comparacions cara a cara, GPT‑Live‑1 i GPT‑Live‑1 mini són clarament preferits al mode de veu avançat en converses equivalents de 5 a 10 minuts que mesuren la preferència general, la gestió dels torns, les interrupcions, la fluïdesa conversacional i fins a quin punt cada interacció se sentia natural.
- GPQA: GPT‑Live‑1 supera àmpliament el mode de veu avançat a GPQA, que avalua el raonament científic de nivell expert en biologia, química i física.
- BrowseComp: GPT‑Live‑1 mostra millores importants respecte del mode de veu avançat a BrowseComp, que avalua la cerca web amb capacitats d’agent i la capacitat de trobar informació difícil de localitzar.
- τ³-Voice Telecom (variant interna)**: GPT‑Live‑1 supera el mode de veu avançat a τ³-Voice Telecom, que avalua agents de veu en tasques realistes de suport de telecomunicacions amb múltiples torns.
* GPT‑Live‑1 (instantània) i GPT‑Live‑1 mini utilitzen el model GPT‑5.5 Instantània en segon pla, mentre que GPT‑Live‑1 Mitjana i GPT‑Live‑1 Alta utilitzen el model GPT‑5.5 Thinking amb un esforç de raonament mitjà i alt.
** Per a aquesta avaluació vam fer servir un model d'usuari personalitzat, impulsat pels nostres models de raonament més recents.
Una nova experiència de ChatGPT Veu
Cada setmana, més de 150 milions de persones parlen amb ChatGPT fent servir funcions com Veu i Dictat. L’utilitzen per rebre ajuda quotidiana sense mans, practicar idiomes, explicar contes abans d’anar a dormir o simplement xerrar durant el trajecte.
A partir d’avui, quan toquis el botó de veu per parlar amb ChatGPT, tindràs una experiència millorada impulsada per GPT‑Live: converses més naturals, respostes més intel·ligents, millor escolta i respostes visuals.
Converses més naturals
Parlar amb ChatGPT ara s’hauria de semblar molt més a una conversa real. Pots interrompre amb una pregunta, fer una pausa per ordenar les idees o demanar a ChatGPT que vagi més a poc a poc. Reconeix de manera natural el que dius amb expressions com "mhm" o "entesos", perquè sàpigues que et segueix. També hem remasteritzat les nou veus diferenciades de ChatGPT per a GPT‑Live.
Respostes més intel·ligents
ChatGPT Veu ara pot recórrer als nostres últims models d’avantguarda per donar-te respostes més intel·ligents quan les necessitis. També pots triar el nivell de raonament que s’adapti a les teves necessitats: Instant per a respostes ràpides, o Medium i High quan vulguis que ChatGPT dediqui més temps a pensar.
Millor escolta
Si necessites un moment per pensar, ChatGPT Veu ara espera en lloc d’entrar i interrompre’t. Si li demanes que calli i escolti, ho farà. I quan hi ha soroll de fons, com trànsit que passa o converses a prop, ChatGPT se centra millor en la teva veu i no es distreu tant.
Respostes visuals d’un cop d’ull
Algunes respostes són més útils quan les pots veure. Mentre parles, ChatGPT ara pot mostrar targetes visuals enriquides sobre temes com el temps, les accions, els esports i més. Veu també continua admetent la cerca, la memòria, les imatges i les pujades de fitxers.



El resultat és una experiència de ChatGPT Veu més natural, més capaç i més útil en el dia a dia.
Seguretat dissenyada per a la veu
GPT‑Live s’ha dissenyat perquè sigui segur per defecte. Es basa en els avenços de seguretat dels nostres últims models i hi afegeix formació de seguretat específica en àrees de risc clau i noves proteccions dissenyades especialment per a la veu.
Proves de seguretat ampliades
Per reflectir millor com la gent fa servir la veu en situacions reals, vam començar ampliant les proves de seguretat per incloure noves avaluacions natives d’àudio. També vam crear avaluacions sintètiques que utilitzen àudio generat per centrar-se amb més intensitat en àrees de seguretat clau, a partir del que vam aprendre del mode de veu avançat. Aquestes àrees inclouen l’autolesió, la psicosi i la mania, la dependència emocional de la IA, la violència i el contingut sexual. Experts interns també van sotmetre el model a proves de resistència (red teaming) per detectar riscos propis de la veu.
En les nostres proves, GPT‑Live va tenir un rendiment comparable o superior al del mode de veu avançat en gairebé totes les àrees que vam avaluar. Pots llegir més informació sobre les nostres proves i proteccions a la fitxa del model(s'obre en una finestra nova) de GPT‑Live.
Proteccions integrades
Com que les converses de veu es desenvolupen en temps real, també hem creat proteccions que poden actuar mentre el model parla. Quan el sistema detecta una sortida potencialment insegura, pot orientar el model cap a una resposta més segura, mostrar missatges o recursos de seguretat addicionals, o posar fi a la conversa de veu en casos de més risc. Per a converses relacionades amb l’autolesió, hem adaptat els fluxos de suport de ChatGPT a la veu, incloent-hi l’opció d’oferir assistència de línies d’ajuda en crisi revisades per experts.
Hem dissenyat proteccions addicionals per donar suport als usuaris adolescents i hem entrenat directament el model perquè tingui un comportament adequat a l’edat, a fi de reduir el risc de respostes inadequades. Els pares poden triar si el seu fill adolescent pot utilitzar ChatGPT Veu mitjançant el Control parental, i els pares vinculats poden rebre avisos en situacions de més risc que impliquin indicis de possible autolesió o intenció suïcida.
Aprendre de l’ús en el món real
També estem desplegant mesuraments a més llarg termini i supervisió posterior al llançament centrats en la dependència emocional, per continuar millorant-ne la comprensió i perfeccionant les proteccions. A partir de la nostra recerca anterior sobre l’ús afectiu i el benestar emocional, això ens ajudarà a identificar patrons emergents i a millorar com respon el sistema en interaccions emocionalment sensibles.
Finalment, GPT‑Live està dissenyat per conversar, no per suplantar veus. Fa servir un conjunt de veus predefinides a ChatGPT, amb proteccions per impedir que imiti la veu d’una persona real.
Tenim el compromís de donar suport a la seguretat i el benestar, i continuarem reforçant aquestes proteccions a mesura que aprenguem de l’ús en el món real.
Disponibilitat i limitacions
GPT‑Live s’està desplegant ara per als usuaris de ChatGPT d’arreu del món a iOS, Android i ChatGPT.com(s'obre en una finestra nova). GPT‑Live‑1 passarà a ser el model predeterminat que impulsa ChatGPT Veu per als usuaris de Go, Plus i Pro, i GPT‑Live‑1 mini serà el predeterminat per als usuaris del pla Gratis. Trobaràs més detalls sobre la disponibilitat al nostre Centre d'ajuda(s'obre en una finestra nova).
Hem optimitzat GPT‑Live per a alguns dels idiomes més populars a ChatGPT. En determinats idiomes, el model pot tenir un accent no nadiu o mancances de fluïdesa. Treballem activament per millorar l’experiència en tots els idiomes.
En el llançament, GPT‑Live no admetrà veu amb vídeo ni compartir pantalla a ChatGPT, però estem treballant per introduir aquestes capacitats aviat. Encara pots accedir a versions heretades de ChatGPT Veu, incloses Standard i el mode de veu avançat, quan aquestes funcions estiguin disponibles.


