Passer au contenu principal
OpenAI

10 septembre 2026

ProduitLancement

Créez des expériences vocales fluides avec GPT‑Live‑1 dans l’API

GPT‑Live‑1 apporte à l’API les conversations naturelles et en duplex intégral de ChatGPT, avec davantage de contrôle sur la façon dont les agents vocaux parlent et agissent.

Chargement…

Nous lançons GPT‑Live‑1 dans l’API afin d’offrir aux développeurs un modèle vocal puissant et naturel pour créer des applications vocales et des flux de travail d’entreprise. D’abord présenté dans ChatGPT, GPT‑Live‑1 peut écouter et parler simultanément et, comme nous l’avons vu avec Codex et ChatGPT Work⁠(s'ouvre dans une nouvelle fenêtre), déléguer le raisonnement approfondi et les actions aux modèles et outils auxquels il est associé.

Pour le lancement de GPT‑Live‑1 dans l’API, nous avons privilégié de nouvelles fonctionnalités permettant aux développeurs d’orienter et de personnaliser les expériences vocales selon leurs utilisateurs, leurs flux de travail et leurs objectifs. L’une des principales forces de GPT‑Live‑1, sa gestion fluide des interruptions, a déjà des retombées concrètes : lors des premières évaluations, Speak a constaté que GPT‑Live‑1 donnait aux apprenants davantage de temps pour réfléchir avant que le tuteur de langue ne réponde, réduisant les interruptions de près de 80 % par rapport aux anciens systèmes à tours de parole.

Principaux atouts de GPT‑Live‑1 dans l’API :

  • Gestion des interruptions : améliore la gestion des interruptions grâce à un seul modèle qui raisonne conjointement sur les flux audio entrants et sortants, évitant la latence et les transitions fragiles des architectures STT–LLM–TTS en chaîne.

  • Délégation du raisonnement et des appels d’outils : GPT‑Live‑1 peut déléguer le raisonnement et les appels d’outils à un modèle de texte back-end, comme GPT‑6 Astra ou un modèle tiers.

  • Ton, rythme et style : permet aux développeurs de définir le ton, le rythme et le style conversationnel d’un agent à l’aide de l’invite système.

  • Gestion silencieuse du contexte et bruit de fond : Gère mieux le bruit de fond et les silences sans interrompre la conversation ni raconter chaque étape à voix haute.

  • Fiabilité des longues sessions : Améliore la conservation du contexte et la qualité des conversations lors d’interactions prolongées.

  • Prise en charge de la téléphonie : Permet de déployer des agents vocaux en duplex intégral pour les appels téléphoniques, des réservations au restaurant au soutien à la clientèle.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Cette démonstration est limitée dans le temps. En l’utilisant, vous acceptez les conditions d’utilisation d’OpenAI et reconnaissez notre politique de confidentialité.

Simplifiez l’architecture de vos agents vocaux et réduisez la latence vocale

Les agents vocaux traditionnels assemblent la reconnaissance vocale, un modèle de raisonnement et la synthèse vocale. Chaque transition ajoute de la latence et multiplie les risques de perdre la synchronisation, le contexte ou le rythme naturel d’une conversation. Il revient souvent aux développeurs de coordonner ces étapes, notamment lorsqu’une personne interrompt, fait une pause ou change de direction.

GPT‑Live‑1 gère l’écoute et la parole dans un seul modèle, ce qui simplifie la couche vocale. Il peut réagir aux interruptions et aux signes d’écoute au moment où ils surviennent, tout en déléguant le raisonnement approfondi au back-end. La conversation peut ainsi se poursuivre pendant que le travail s’effectue en arrière-plan.

“Par rapport à notre architecture en cascade, GPT‑Live‑1 a simplifié notre base de code de 80 % et éliminé 23 000 lignes de code. Cela a permis des conversations naturelles et en temps réel avec les patients, tout en libérant notre équipe afin qu’elle améliore l’expérience, de la prise de rendez-vous à l’orientation dans les soins.”
— Tony Stoyanov, cofondateur et directeur technique

Les développeurs choisissent les modèles, les outils et le harnais d’agent qui soutiennent la conversation. Par exemple, ils peuvent associer GPT‑Live‑1 à un modèle comme Luna pour les tâches à volume élevé, telles que la planification ou les mises à jour de commandes, et utiliser un modèle comme Astra pour les problèmes complexes de clients qui exigent du raisonnement. Cette souplesse permet aux développeurs d’adapter la profondeur du raisonnement, la vitesse et le coût à chaque tâche.

GPT‑Live‑1 fournit nativement des transcriptions de reconnaissance automatique de la parole et le texte des réponses. Il offre également une excellente compréhension des caractères alphanumériques et prend en charge la pondération des mots-clés. Bien que GPT‑Live‑1 ne soit pas un modèle à tours de parole, il prend nativement en charge la détection des tours, afin que les développeurs puissent continuer à s’appuyer sur des limites explicites entre les tours de parole.

Mesurer l’avantage du duplex intégral

Dans l’ensemble de nos évaluations, GPT‑Live‑1 améliore de 30 points de pourcentage les performances au test Full Duplex Bench par rapport à GPT‑Realtime‑2.1, avec des gains importants en matière de latence lors de l’alternance des tours et de comportement interactif. Associé à GPT‑6 Astra avec un effort de raisonnement moyen, il se classe également au premier rang sur Tau3, qui mesure les capacités des agents vocaux de pointe à effectuer des tâches de bout en bout.

Évalue les tâches de service à la clientèle effectuées oralement dans les secteurs du transport aérien, du commerce de détail et des télécommunications. Pass@1 mesure la réussite des tâches; le score principal accorde le même poids à chaque secteur.


* Backend GPT Live : Astra (moyen).

Évalue l’assistance bancaire vocale avec la recherche de connaissances et des outils liés aux comptes. Pass@1 correspond à la proportion des 97 tâches banking_knowledge réalisées avec succès.


* Backend GPT Live : Astra (moyen).

Évalue la gestion des pauses, l’alternance des tours de parole, les interruptions et les signaux d’écoute.

Teste les réactions à la parole en arrière-plan, à la parole destinée à une autre personne, aux signaux d’écoute de l’auditeur et aux interruptions.

Mesure la rapidité avec laquelle l’agent commence à répondre après que l’utilisateur a fini de parler.

Teste l’utilisation d’outils à partir de requêtes orales comportant des pauses naturelles, des hésitations et des autocorrections. Pass@1 évalue la séquence d’appels d’outils.


* Modèle backend de GPT Live : Terra (faible).

Évalue la réponse orale à des demandes nécessitant l’utilisation d’outils, qui comportent des pauses, des hésitations et des autocorrections. Évalue dans quelle mesure la réponse correspond à l’intention de référence.


* Modèle backend de GPT Live : Terra (faible).

Ce qu’en disent les clients

1 sur 4
“L’intégration de GPT‑Live‑1 à Yelp Host et Hatch a amélioré la gestion des tours de parole et la précision par rapport à notre architecture vocale traditionnelle. Lorsque Yelp Host utilise GPT‑Live‑1 pour répondre aux appels, notamment pour les réservations et les commandes de repas, nous constatons une nette amélioration des taux de traitement des appels. Les appelants formulent également des phrases plus complètes et naturelles, ce qui montre que l’expérience à l’autre bout du fil est véritablement différente.”
—Alex Levy, directeur de la technologie

Nouvelles options vocales

Les développeurs ont besoin de voix adaptées à leur produit et naturelles pour les personnes qui l’utilisent. Avec GPT‑Live‑1, nous passons d’un petit ensemble de voix en temps réel à un vaste choix d’accents, de dialectes et de langues, pour offrir aux développeurs plus de possibilités quant à la sonorité de leurs assistants.

Écoutez les nouvelles voix

Nous continuerons d’élargir les options vocales et la disponibilité des langues au cours des prochains mois.

Tarification et disponibilité

GPT‑Live‑1 est disponible dès aujourd’hui dans l’API ⁠(s'ouvre dans une nouvelle fenêtre) au tarif de 0,05 $ par minute pour la couche vocale front-end. Associez-le au modèle back-end et au harnais d’agent adaptés à votre produit, puis créez une expérience vocale qui s’adapte au travail à effectuer.

Connecter GPT-Live-1 à Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Connexion de GPT-Live-1 à Codex. Cet extrait montre comment une application transmet le contexte de la conversation à Codex et renvoie sa réponse à GPT-Live-1. La configuration de la connexion et la gestion de la délégation sont omises.

Pour accéder aux voix personnalisées, contactez l’équipe des ventes afin d’en savoir plus sur les critères d’admissibilité et le processus de demande.

Une autre façon de créer des flux de travail vocaux avec GPT‑Live‑1 consiste à utiliser OpenAI Presence, qui s’appuie sur le modèle pour alimenter les interactions vocales en temps réel. Presence aide les entreprises à déployer des agents IA fiables capables de répondre aux questions, de résoudre des problèmes, d’utiliser les systèmes de l’entreprise, d’effectuer des actions approuvées et de transférer le dossier à une personne au besoin. Communiquez avec votre responsable de compte OpenAI pour en savoir plus.

Auteur

OpenAI