Nous lançons GPT‑Live‑1 dans l’API afin d’offrir aux développeurs un modèle vocal puissant et naturel pour créer des applications vocales et des flux de travail d’entreprise. D’abord présenté dans ChatGPT, GPT‑Live‑1 peut écouter et parler simultanément et, comme nous l’avons vu avec Codex et ChatGPT Work(s'ouvre dans une nouvelle fenêtre), déléguer le raisonnement approfondi et les actions aux modèles et outils auxquels il est associé.
Pour le lancement de GPT‑Live‑1 dans l’API, nous avons privilégié de nouvelles fonctionnalités permettant aux développeurs d’orienter et de personnaliser les expériences vocales selon leurs utilisateurs, leurs flux de travail et leurs objectifs. L’une des principales forces de GPT‑Live‑1, sa gestion fluide des interruptions, a déjà des retombées concrètes : lors des premières évaluations, Speak a constaté que GPT‑Live‑1 donnait aux apprenants davantage de temps pour réfléchir avant que le tuteur de langue ne réponde, réduisant les interruptions de près de 80 % par rapport aux anciens systèmes à tours de parole.
Principaux atouts de GPT‑Live‑1 dans l’API :
Gestion des interruptions : améliore la gestion des interruptions grâce à un seul modèle qui raisonne conjointement sur les flux audio entrants et sortants, évitant la latence et les transitions fragiles des architectures STT–LLM–TTS en chaîne.
Délégation du raisonnement et des appels d’outils : GPT‑Live‑1 peut déléguer le raisonnement et les appels d’outils à un modèle de texte back-end, comme GPT‑6 Astra ou un modèle tiers.
Ton, rythme et style : permet aux développeurs de définir le ton, le rythme et le style conversationnel d’un agent à l’aide de l’invite système.
Gestion silencieuse du contexte et bruit de fond : Gère mieux le bruit de fond et les silences sans interrompre la conversation ni raconter chaque étape à voix haute.
Fiabilité des longues sessions : Améliore la conservation du contexte et la qualité des conversations lors d’interactions prolongées.
Prise en charge de la téléphonie : Permet de déployer des agents vocaux en duplex intégral pour les appels téléphoniques, des réservations au restaurant au soutien à la clientèle.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Cette démonstration est limitée dans le temps. En l’utilisant, vous acceptez les conditions d’utilisation d’OpenAI et reconnaissez notre politique de confidentialité.
Les agents vocaux traditionnels assemblent la reconnaissance vocale, un modèle de raisonnement et la synthèse vocale. Chaque transition ajoute de la latence et multiplie les risques de perdre la synchronisation, le contexte ou le rythme naturel d’une conversation. Il revient souvent aux développeurs de coordonner ces étapes, notamment lorsqu’une personne interrompt, fait une pause ou change de direction.
GPT‑Live‑1 gère l’écoute et la parole dans un seul modèle, ce qui simplifie la couche vocale. Il peut réagir aux interruptions et aux signes d’écoute au moment où ils surviennent, tout en déléguant le raisonnement approfondi au back-end. La conversation peut ainsi se poursuivre pendant que le travail s’effectue en arrière-plan.
Les développeurs choisissent les modèles, les outils et le harnais d’agent qui soutiennent la conversation. Par exemple, ils peuvent associer GPT‑Live‑1 à un modèle comme Luna pour les tâches à volume élevé, telles que la planification ou les mises à jour de commandes, et utiliser un modèle comme Astra pour les problèmes complexes de clients qui exigent du raisonnement. Cette souplesse permet aux développeurs d’adapter la profondeur du raisonnement, la vitesse et le coût à chaque tâche.
GPT‑Live‑1 fournit nativement des transcriptions de reconnaissance automatique de la parole et le texte des réponses. Il offre également une excellente compréhension des caractères alphanumériques et prend en charge la pondération des mots-clés. Bien que GPT‑Live‑1 ne soit pas un modèle à tours de parole, il prend nativement en charge la détection des tours, afin que les développeurs puissent continuer à s’appuyer sur des limites explicites entre les tours de parole.
Dans l’ensemble de nos évaluations, GPT‑Live‑1 améliore de 30 points de pourcentage les performances au test Full Duplex Bench par rapport à GPT‑Realtime‑2.1, avec des gains importants en matière de latence lors de l’alternance des tours et de comportement interactif. Associé à GPT‑6 Astra avec un effort de raisonnement moyen, il se classe également au premier rang sur Tau3, qui mesure les capacités des agents vocaux de pointe à effectuer des tâches de bout en bout.
Évalue les tâches de service à la clientèle effectuées oralement dans les secteurs du transport aérien, du commerce de détail et des télécommunications. Pass@1 mesure la réussite des tâches; le score principal accorde le même poids à chaque secteur.
* Backend GPT Live : Astra (moyen).
Évalue l’assistance bancaire vocale avec la recherche de connaissances et des outils liés aux comptes. Pass@1 correspond à la proportion des 97 tâches banking_knowledge réalisées avec succès.
* Backend GPT Live : Astra (moyen).
Évalue la gestion des pauses, l’alternance des tours de parole, les interruptions et les signaux d’écoute.
Teste les réactions à la parole en arrière-plan, à la parole destinée à une autre personne, aux signaux d’écoute de l’auditeur et aux interruptions.
Mesure la rapidité avec laquelle l’agent commence à répondre après que l’utilisateur a fini de parler.
Teste l’utilisation d’outils à partir de requêtes orales comportant des pauses naturelles, des hésitations et des autocorrections. Pass@1 évalue la séquence d’appels d’outils.
* Modèle backend de GPT Live : Terra (faible).
Évalue la réponse orale à des demandes nécessitant l’utilisation d’outils, qui comportent des pauses, des hésitations et des autocorrections. Évalue dans quelle mesure la réponse correspond à l’intention de référence.
* Modèle backend de GPT Live : Terra (faible).
Les développeurs ont besoin de voix adaptées à leur produit et naturelles pour les personnes qui l’utilisent. Avec GPT‑Live‑1, nous passons d’un petit ensemble de voix en temps réel à un vaste choix d’accents, de dialectes et de langues, pour offrir aux développeurs plus de possibilités quant à la sonorité de leurs assistants.
Nous continuerons d’élargir les options vocales et la disponibilité des langues au cours des prochains mois.
GPT‑Live‑1 est disponible dès aujourd’hui dans l’API (s'ouvre dans une nouvelle fenêtre) au tarif de 0,05 $ par minute pour la couche vocale front-end. Associez-le au modèle back-end et au harnais d’agent adaptés à votre produit, puis créez une expérience vocale qui s’adapte au travail à effectuer.
Pour accéder aux voix personnalisées, contactez l’équipe des ventes afin d’en savoir plus sur les critères d’admissibilité et le processus de demande.
Une autre façon de créer des flux de travail vocaux avec GPT‑Live‑1 consiste à utiliser OpenAI Presence, qui s’appuie sur le modèle pour alimenter les interactions vocales en temps réel. Presence aide les entreprises à déployer des agents IA fiables capables de répondre aux questions, de résoudre des problèmes, d’utiliser les systèmes de l’entreprise, d’effectuer des actions approuvées et de transférer le dossier à une personne au besoin. Communiquez avec votre responsable de compte OpenAI pour en savoir plus.

