Nous lançons GPT‑Live‑1 dans l’API, offrant aux développeurs un modèle vocal puissant et naturel pour créer des applications vocales et des workflows métier. Présent pour la première fois dans ChatGPT, GPT‑Live‑1 peut écouter et parler simultanément et, comme nous l’avons vu avec Codex et ChatGPT Work(ouverture dans une nouvelle fenêtre), déléguer le raisonnement approfondi et les actions aux modèles et outils auxquels il est associé.
Pour le lancement de GPT‑Live‑1 dans l’API, nous nous sommes concentrés sur de nouvelles fonctionnalités permettant aux développeurs d’orienter et de personnaliser les expériences vocales en fonction de leurs utilisateurs, de leurs workflows et de leurs objectifs. L’une des principales forces de GPT‑Live‑1, sa gestion fluide des interruptions, a déjà un impact sur les entreprises : lors des premières évaluations, Speak a constaté que GPT‑Live‑1 donnait aux apprenants davantage de temps pour réfléchir avant que le professeur de langue ne réponde, réduisant les interruptions de près de 80 % par rapport aux précédents systèmes à tours de parole.
Principaux atouts de GPT‑Live‑1 dans l’API :
Gestion des interruptions : améliore la gestion des interruptions grâce à un seul modèle qui raisonne conjointement sur les flux audio entrants et sortants, évitant la latence et les transitions fragiles des architectures STT–LLM–TTS en chaîne.
Délégation du raisonnement et des appels d’outils : GPT‑Live‑1 peut déléguer le raisonnement et les appels d’outils à un modèle de texte back-end tel que GPT‑6 Astra ou à un modèle tiers.
Ton, rythme et style : permet aux développeurs de définir le ton, le rythme et le style conversationnel d’un agent à l’aide du prompt système.
Gestion silencieuse du contexte et bruit de fond : gère mieux le bruit de fond et les silences sans interrompre la conversation ni décrire chaque étape à voix haute.
Fiabilité des longues sessions : améliore la conservation du contexte et la qualité des conversations lors d’interactions prolongées.
Prise en charge de la téléphonie : permet de déployer des agents vocaux full-duplex pour les appels téléphoniques, des réservations de restaurant au service client.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Cette démo est limitée dans le temps. En l’utilisant, vous acceptez les Conditions d’utilisation d’OpenAI et reconnaissez avoir pris connaissance de notre Politique de confidentialité.
Les agents vocaux traditionnels enchaînent la reconnaissance vocale, un modèle de raisonnement et la synthèse vocale. Chaque transition augmente la latence et multiplie les risques de perdre le bon timing, le contexte ou le rythme naturel d’une conversation. Il revient souvent aux développeurs de coordonner ces étapes, notamment lorsqu’une personne interrompt la conversation, marque une pause ou change de direction.
GPT‑Live‑1 gère l’écoute et la parole dans un seul modèle, simplifiant ainsi la couche vocale. Il peut réagir aux interruptions et aux signes d’écoute à mesure qu’ils surviennent, tout en déléguant le raisonnement approfondi au back-end. La conversation peut ainsi se poursuivre pendant que le travail s’effectue en arrière-plan.
Les développeurs choisissent les modèles, les outils et le harnais d’agent qui sous-tendent la conversation. Par exemple, ils peuvent associer GPT‑Live‑1 à un modèle comme Luna pour des tâches à fort volume telles que la planification ou les mises à jour de commandes, et utiliser un modèle comme Astra pour les problèmes clients complexes exigeant du raisonnement. Cette flexibilité permet aux développeurs d’adapter la profondeur du raisonnement, la vitesse et le coût à chaque tâche.
GPT‑Live‑1 fournit nativement des transcriptions ASR et le texte des réponses. Il offre également une excellente compréhension des caractères alphanumériques et prend en charge la pondération des mots-clés. Bien que GPT‑Live‑1 ne soit pas un modèle à tours de parole, il prend nativement en charge la détection des tours, afin que les développeurs puissent continuer à s’appuyer sur des limites explicites entre les tours de parole.
Dans l’ensemble de nos évaluations, GPT‑Live‑1 améliore de 30 points de pourcentage les performances au test Full Duplex Bench par rapport à GPT‑Realtime‑2.1, avec des gains importants en matière de latence lors de l’alternance des tours et de comportement interactif. Associé à GPT‑6 Astra avec un effort de raisonnement moyen, il se classe également n° 1 sur Tau3, qui mesure les capacités des agents vocaux de pointe à effectuer des tâches de bout en bout.
Évalue les tâches de service client à l’oral dans les secteurs du transport aérien, du commerce de détail et des télécommunications. Pass@1 mesure la réussite des tâches ; le score principal accorde le même poids à chaque domaine.
* Backend GPT Live : Astra (moyen).
Évalue l’assistance bancaire vocale avec la récupération de connaissances et des outils liés aux comptes. Pass@1 est la proportion des 97 tâches banking_knowledge menées à bien avec succès.
* Backend GPT Live : Astra (moyen).
Évalue la gestion des pauses, l’alternance des tours de parole, les interruptions et les signaux d’écoute.
Teste les réactions lorsque quelqu’un parle en arrière-plan, s’adresse à une autre personne ou intervient par des signaux d’écoute, ainsi qu’aux interruptions.
Mesure la rapidité avec laquelle l’agent commence à répondre après que l’utilisateur a fini de parler.
Teste l’utilisation d’outils à partir de requêtes orales comportant des pauses naturelles, des hésitations et des autocorrections. Le score pass@1 évalue la séquence d’appels d’outils.
* Backend GPT Live : Terra (faible).
Évalue la réponse orale aux requêtes impliquant l’utilisation d’outils et comportant des pauses, des hésitations et des autocorrections. Évalue la conformité de la réponse à l’intention de référence.
* Backend GPT Live : Terra (faible).
Les développeurs ont besoin de voix adaptées à leur produit et naturelles pour ses utilisateurs. Avec GPT‑Live‑1, nous passons d’un petit ensemble de voix en temps réel à un choix plus vaste d’accents, de dialectes et de langues, afin que les développeurs puissent mieux choisir la voix de leurs assistants.
Nous continuerons d’élargir les options vocales et la disponibilité des langues au cours des prochains mois.
GPT‑Live‑1 est disponible dès aujourd’hui dans l’API(ouverture dans une nouvelle fenêtre) au tarif de 0,05 $ par minute pour la couche vocale front-end. Associez-le au modèle back-end et au harnais d’agent adaptés à votre produit, puis créez une expérience vocale qui s’adapte au travail à effectuer.
Pour accéder aux voix personnalisées, contactez l’équipe commerciale afin d’en savoir plus sur les critères d’éligibilité et la procédure de demande.
Une autre façon de créer des workflows vocaux avec GPT‑Live‑1 consiste à utiliser OpenAI Presence, qui utilise le modèle pour alimenter les interactions vocales en temps réel. Presence aide les entreprises à déployer des agents IA de confiance capables de répondre aux questions, résoudre les problèmes, utiliser les systèmes de l’entreprise, effectuer des actions approuvées et passer le relais à des personnes si nécessaire. Adressez-vous à votre responsable de compte OpenAI pour en savoir plus.

