Nous lançons GPT‑Live, une nouvelle génération de modèles vocaux qui rendent les échanges avec l’IA beaucoup plus proches d’une vraie conversation.
GPT‑Live repose sur une architecture full-duplex, ce qui signifie qu’il peut écouter et parler en même temps. Pendant les conversations, GPT‑Live peut montrer qu’il est attentif avec des expressions comme « mmh » ou « oui », participer à des échanges rapides, ou simplement rester silencieux quand vous avez besoin d’un moment pour réfléchir. Le résultat est une expérience vocale avec laquelle il est étonnamment facile de converser.
GPT‑Live est aussi notre modèle vocal le plus intelligent à ce jour. Pour les questions qui nécessitent une recherche sur le Web, un raisonnement plus approfondi ou un travail plus complexe, il délègue en arrière-plan à notre dernier modèle de pointe et réintègre le résultat dans la conversation lorsqu’il est prêt. Pendant ce traitement, GPT‑Live peut continuer à échanger avec vous et préserver le fil de la conversation. Au lancement, GPT‑Live utilisera GPT‑5.5 en arrière-plan. À mesure que nous publierons de nouveaux modèles de pointe, nous mettrons continuellement à jour le modèle utilisé par GPT‑Live.
Ces avancées alimentent une nouvelle expérience ChatGPT Voix, plus intelligente et plus naturelle à utiliser. Avec le temps, nous pensons que ces recherches permettront aussi d’utiliser la voix pour des tâches de plus en plus complexes, plus longues et plus agentiques.
Nous commençons aujourd’hui à déployer deux versions de GPT‑Live — GPT‑Live‑1 et GPT‑Live‑1 mini — auprès des utilisateurs de ChatGPT dans le monde entier. Nous prévoyons aussi de les proposer bientôt dans l’API ; les développeurs et les entreprises peuvent s’inscrire pour être informés au moyen de ce formulaire.
Entrer dans une nouvelle ère de l’interaction humain-IA
Notre vision est de permettre une interaction humain-IA vraiment naturelle : un monde où collaborer avec l’IA est aussi fluide et réactif que travailler avec une autre personne, tandis que le raisonnement et l’exécution de tâches complexes se déroulent sans accroc en arrière-plan.
Approches précédentes
Les anciennes générations de systèmes d’IA vocale nous ont rapprochés de cette vision, mais avec d’importants compromis.
Systèmes vocaux en cascade
Les systèmes vocaux en cascade s’appuient sur une série de modèles qui interviennent les uns après les autres pour traiter chaque tour de parole. Le ChatGPT Voix d’origine enchaînait trois modèles : un modèle de reconnaissance vocale pour transcrire votre parole, un grand modèle de langage pour produire une réponse, et un modèle de synthèse vocale pour la reconvertir en parole. Cette approche nous a permis de parler pour la première fois à des modèles d’IA de pointe, mais cette complexité avait un coût : des informations pouvaient se perdre d’un modèle à l’autre, et les réponses étaient lentes et saccadées.
Système vocal en cascade
Réponses lentes et saccadées, longues pauses
Modèles vocaux au tour par tour
Les modèles vocaux au tour par tour, comme le mode vocal avancé de ChatGPT, traitaient et généraient l’audio au sein d’un seul modèle, réduisant la latence et rendant les conversations plus fluides — mais ils fonctionnaient encore par tours distincts. Le modèle devait attendre que l’utilisateur cesse de parler avant de répondre, ce qui rendait les échanges rigides. De plus, comme la détection de tour repose sur le silence, même une brève pause ou un bruit de fond pouvait être pris pour la fin d’un tour, amenant le modèle à interrompre à des moments peu naturels.
Modèle vocal au tour par tour
Réponses un peu plus rapides et fluides, mais les échanges avec le modèle restent rigides
Notre nouvelle approche
GPT‑Live répond à ces limites grâce à deux changements d’architecture.
Interaction continue
D’abord, nous avons conçu GPT‑Live pour l’interaction continue au moyen d’une architecture full-duplex. Au lieu de traiter une suite de messages séparés, GPT‑Live traite l’entrée en continu tout en générant la sortie. Le modèle peut donc prendre des décisions d’interaction de nombreuses fois par seconde : parler, continuer à écouter, faire une pause, interrompre ou invoquer un outil.
Cela permet au modèle d’avoir des échanges plus naturels, de mieux tenir compte du temps qui passe et même d’effectuer de la traduction en direct.
Interaction continue
Réponses rapides, naturelles et expressives, avec une écoute plus active
Délégation pour les tâches plus approfondies
Ensuite, nous avons découplé GPT‑Live — qui gère l’interaction continue — du travail plus approfondi. Lorsqu’une question nécessite une recherche, du raisonnement ou des capacités plus agentiques, GPT‑Live peut déléguer la tâche à un autre modèle, comme GPT‑5.5. Cela lui permet de poursuivre la conversation, même lorsqu’il traite plusieurs tâches en arrière-plan.
Ce changement d’architecture permet également à GPT‑Live d’utiliser en continu les modèles et agents les plus récents, en combinant intelligence de pointe et interaction naturelle.
Délégation pour les tâches plus approfondies
GPT-Live fournit des réponses rapides et naturelles, tandis que GPT-5.5 gère la recherche en arrière-plan
Évaluations
Nous avons conçu de nouvelles évaluations humaines pour mesurer l’agrément et la fluidité de la conversation. Dans ces comparaisons directes, GPT‑Live‑1 et GPT‑Live‑1 mini sont nettement préférés au mode vocal avancé lors de conversations comparables de 5 à 10 minutes, qui mesurent la préférence globale, l’alternance des prises de parole, les interruptions, la fluidité de la conversation et le caractère naturel de chaque interaction.
- GPQA : GPT‑Live‑1 surpasse nettement le mode vocal avancé sur GPQA, qui teste le raisonnement scientifique de niveau expert en biologie, chimie et physique.
- BrowseComp : GPT‑Live‑1 enregistre de fortes améliorations par rapport au mode vocal avancé sur BrowseComp, qui teste la recherche Web agentique et la capacité à trouver des informations difficiles à localiser.
- τ³-Voice Telecom (variante interne)** : GPT‑Live‑1 surpasse le mode vocal avancé sur τ³-Voice Telecom, qui teste des agents vocaux sur des tâches réalistes et multitours de support télécom.
* GPT‑Live‑1 (Instant) et GPT‑Live‑1 mini utilisent en arrière-plan le modèle GPT‑5.5 Instant, tandis que GPT‑Live‑1 Médium et GPT‑Live‑1 Élevé utilisent le modèle GPT‑5.5 Thinking avec un effort de raisonnement moyen ou élevé.
** Pour cette évaluation, nous avons utilisé un modèle utilisateur personnalisé, alimenté par nos derniers modèles de raisonnement.
Une nouvelle expérience ChatGPT Voix
Chaque semaine, plus de 150 millions de personnes parlent à ChatGPT grâce à des fonctionnalités comme Voix et Dictée. Elles l’utilisent pour obtenir de l’aide au quotidien sans les mains, pratiquer des langues, raconter des histoires du soir ou simplement discuter pendant leurs trajets.
À partir d’aujourd’hui, lorsque vous appuyez sur le bouton Voix pour parler avec ChatGPT, vous bénéficiez d’une expérience améliorée, alimentée par GPT‑Live : des conversations plus naturelles, des réponses plus intelligentes, une meilleure écoute et des réponses visuelles.
Des conversations plus naturelles
Parler avec ChatGPT devrait désormais ressembler beaucoup plus à une vraie conversation. Vous pouvez l’interrompre avec une question, faire une pause pour rassembler vos idées ou demander à ChatGPT de ralentir. Il signale naturellement qu’il vous écoute avec des expressions comme « mhmm » ou « compris », pour que vous sachiez qu’il suit. Nous avons également remasterisé les neuf voix distinctes de ChatGPT pour GPT‑Live.
Des réponses plus intelligentes
ChatGPT Voix peut désormais s’appuyer sur nos derniers modèles de pointe pour vous fournir des réponses plus intelligentes lorsque vous en avez besoin. Vous pouvez aussi choisir le niveau de raisonnement adapté à vos besoins : Instant pour des réponses rapides, ou Medium et High lorsque vous voulez que ChatGPT prenne plus de temps pour réfléchir.
Une meilleure écoute
Si vous prenez un moment pour réfléchir, ChatGPT Voix attend désormais au lieu d’intervenir et de vous interrompre. Si vous lui demandez de rester silencieux et d’écouter, il le fera. Et lorsqu’il y a du bruit de fond, comme la circulation ou des conversations à proximité, ChatGPT parvient mieux à se concentrer sur votre voix sans se laisser distraire.
Des réponses visuelles en un coup d’œil
Certaines réponses sont plus utiles lorsqu’on peut les voir. Pendant que vous parlez, ChatGPT peut désormais afficher des cartes visuelles riches sur des sujets comme la météo, les actions, le sport et bien plus encore. Voix continue également de prendre en charge la recherche, la mémoire, les images et les téléversements de fichiers.



Le résultat est une expérience ChatGPT Voix plus naturelle, plus performante et plus utile au quotidien.
Une sécurité conçue pour la voix
GPT‑Live a été conçu pour être sûr par défaut. Il s’appuie sur les avancées en matière de sécurité de nos derniers modèles, tout en ajoutant un entraînement dédié à la sécurité dans les principaux domaines de risque et de nouvelles protections conçues spécifiquement pour la voix.
Des tests de sécurité élargis
Pour mieux refléter la façon dont les personnes utilisent la voix dans des contextes réels, nous avons commencé par élargir nos tests de sécurité afin d’inclure de nouvelles évaluations natives audio. Nous avons aussi créé des évaluations synthétiques qui utilisent de l’audio généré afin de nous concentrer plus intensément sur les principaux domaines de sécurité, en nous appuyant sur ce que nous avons appris du mode vocal avancé. Ces domaines comprennent l’automutilation, la psychose et la manie, la dépendance émotionnelle à l’IA, la violence et le contenu sexuel. Des experts internes ont également soumis le modèle à des exercices de red team pour les risques propres à la voix.
Lors de nos tests, GPT‑Live a obtenu des résultats comparables ou supérieurs au mode vocal avancé dans presque tous les domaines évalués. Vous pouvez en savoir plus sur nos tests et nos protections dans la fiche système(ouverture dans une nouvelle fenêtre) de GPT‑Live.
Protections intégrées
Comme les conversations vocales se déroulent en temps réel, nous avons également intégré des protections capables d’agir pendant que le modèle parle. Lorsque le système détecte une sortie potentiellement dangereuse, il peut orienter le modèle vers une réponse plus sûre, afficher des messages ou des ressources de sécurité supplémentaires, ou mettre fin à la conversation vocale dans les cas à risque élevé. Pour les conversations portant sur l’automutilation, nous avons adapté à la voix les parcours d’assistance de ChatGPT, notamment en proposant l’aide de lignes d’écoute de crise validées par des experts.
Nous avons conçu des protections supplémentaires pour accompagner les adolescents, et entraîné le modèle à adopter directement des comportements adaptés à leur âge afin de réduire le risque de réponses inappropriées. Les parents peuvent choisir si leur adolescent peut utiliser ChatGPT Voix via le contrôle parental, et les parents associés peuvent être informés dans les situations à risque élevé impliquant des signes d’automutilation potentielle ou d’intention suicidaire.
Apprendre des usages réels
Nous déployons également des mesures à plus long terme et un suivi post-lancement axés sur la dépendance émotionnelle, afin de continuer à améliorer notre compréhension et à affiner les protections. Dans le prolongement de nos recherches précédentes sur l’usage affectif et le bien-être émotionnel, cela nous aidera à repérer les tendances émergentes et à améliorer la manière dont le système répond lors d’interactions émotionnellement sensibles.
Enfin, GPT‑Live est conçu pour la conversation, pas pour l’imitation vocale. Il utilise un ensemble de voix prédéfinies dans ChatGPT, avec des protections destinées à l’empêcher d’imiter la voix d’une personne réelle.
Nous nous engageons à soutenir la sécurité et le bien-être, et nous continuerons à renforcer ces protections à mesure que nous apprendrons des usages réels.
Disponibilité et limites
GPT‑Live est en cours de déploiement auprès des utilisateurs de ChatGPT dans le monde entier sur iOS, Android et ChatGPT.com(ouverture dans une nouvelle fenêtre). GPT‑Live‑1 deviendra le modèle par défaut qui alimente ChatGPT Voix pour les utilisateurs Go, Plus et Pro, tandis que GPT‑Live‑1 mini deviendra le modèle par défaut pour les utilisateurs Free. Vous trouverez plus de détails sur la disponibilité dans notre centre d’aide(ouverture dans une nouvelle fenêtre).
Nous avons optimisé GPT‑Live pour certaines des langues les plus utilisées dans ChatGPT. Pour certaines langues, le modèle peut avoir un accent non natif ou des lacunes de fluidité. Nous travaillons activement à améliorer l’expérience dans toutes les langues.
Au lancement, GPT‑Live ne prendra pas en charge la voix avec la vidéo ou le partage d’écran dans ChatGPT, mais nous travaillons à introduire bientôt ces fonctionnalités. Vous pouvez toujours accéder aux versions héritées de ChatGPT Voix, notamment Standard et le mode vocal avancé, là où ces fonctionnalités sont disponibles.


