Passer au contenu principal
OpenAI

10 septembre 2026

ProduitLancement

Créez des expériences vocales fluides avec GPT‑Live‑1 via l’API

GPT‑Live‑1 apporte à l’API les conversations naturelles et full-duplex de ChatGPT, avec davantage de contrôle sur la manière dont les agents vocaux parlent et agissent.

Chargement...

Nous lançons GPT‑Live‑1 dans l’API, offrant aux développeurs un modèle vocal puissant et naturel pour créer des applications vocales et des workflows métier. Présent pour la première fois dans ChatGPT, GPT‑Live‑1 peut écouter et parler simultanément et, comme nous l’avons vu avec Codex et ChatGPT Work⁠(ouverture dans une nouvelle fenêtre), déléguer le raisonnement approfondi et les actions aux modèles et outils auxquels il est associé.

Pour le lancement de GPT‑Live‑1 dans l’API, nous nous sommes concentrés sur de nouvelles fonctionnalités permettant aux développeurs d’orienter et de personnaliser les expériences vocales en fonction de leurs utilisateurs, de leurs workflows et de leurs objectifs. L’une des principales forces de GPT‑Live‑1, sa gestion fluide des interruptions, a déjà un impact sur les entreprises : lors des premières évaluations, Speak a constaté que GPT‑Live‑1 donnait aux apprenants davantage de temps pour réfléchir avant que le professeur de langue ne réponde, réduisant les interruptions de près de 80 % par rapport aux précédents systèmes à tours de parole.

Principaux atouts de GPT‑Live‑1 dans l’API :

  • Gestion des interruptions : améliore la gestion des interruptions grâce à un seul modèle qui raisonne conjointement sur les flux audio entrants et sortants, évitant la latence et les transitions fragiles des architectures STT–LLM–TTS en chaîne.

  • Délégation du raisonnement et des appels d’outils : GPT‑Live‑1 peut déléguer le raisonnement et les appels d’outils à un modèle de texte back-end tel que GPT‑6 Astra ou à un modèle tiers.

  • Ton, rythme et style : permet aux développeurs de définir le ton, le rythme et le style conversationnel d’un agent à l’aide du prompt système.

  • Gestion silencieuse du contexte et bruit de fond : gère mieux le bruit de fond et les silences sans interrompre la conversation ni décrire chaque étape à voix haute.

  • Fiabilité des longues sessions : améliore la conservation du contexte et la qualité des conversations lors d’interactions prolongées.

  • Prise en charge de la téléphonie : permet de déployer des agents vocaux full-duplex pour les appels téléphoniques, des réservations de restaurant au service client.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Cette démo est limitée dans le temps. En l’utilisant, vous acceptez les Conditions d’utilisation d’OpenAI et reconnaissez avoir pris connaissance de notre Politique de confidentialité.

Simplifiez l’architecture de vos agents vocaux et réduisez la latence vocale

Les agents vocaux traditionnels enchaînent la reconnaissance vocale, un modèle de raisonnement et la synthèse vocale. Chaque transition augmente la latence et multiplie les risques de perdre le bon timing, le contexte ou le rythme naturel d’une conversation. Il revient souvent aux développeurs de coordonner ces étapes, notamment lorsqu’une personne interrompt la conversation, marque une pause ou change de direction.

GPT‑Live‑1 gère l’écoute et la parole dans un seul modèle, simplifiant ainsi la couche vocale. Il peut réagir aux interruptions et aux signes d’écoute à mesure qu’ils surviennent, tout en déléguant le raisonnement approfondi au back-end. La conversation peut ainsi se poursuivre pendant que le travail s’effectue en arrière-plan.

“Par rapport à notre architecture en cascade, GPT‑Live‑1 a simplifié notre base de code de 80 % et supprimé 23 000 lignes de code. Cela a permis des conversations naturelles avec les patients en temps réel et libéré notre équipe pour améliorer l’expérience, de la prise de rendez-vous à l’orientation dans le parcours de soins.”
— Tony Stoyanov, cofondateur et directeur de la technologie

Les développeurs choisissent les modèles, les outils et le harnais d’agent qui sous-tendent la conversation. Par exemple, ils peuvent associer GPT‑Live‑1 à un modèle comme Luna pour des tâches à fort volume telles que la planification ou les mises à jour de commandes, et utiliser un modèle comme Astra pour les problèmes clients complexes exigeant du raisonnement. Cette flexibilité permet aux développeurs d’adapter la profondeur du raisonnement, la vitesse et le coût à chaque tâche.

GPT‑Live‑1 fournit nativement des transcriptions ASR et le texte des réponses. Il offre également une excellente compréhension des caractères alphanumériques et prend en charge la pondération des mots-clés. Bien que GPT‑Live‑1 ne soit pas un modèle à tours de parole, il prend nativement en charge la détection des tours, afin que les développeurs puissent continuer à s’appuyer sur des limites explicites entre les tours de parole.

Mesurer l’avantage du full-duplex

Dans l’ensemble de nos évaluations, GPT‑Live‑1 améliore de 30 points de pourcentage les performances au test Full Duplex Bench par rapport à GPT‑Realtime‑2.1, avec des gains importants en matière de latence lors de l’alternance des tours et de comportement interactif. Associé à GPT‑6 Astra avec un effort de raisonnement moyen, il se classe également n° 1 sur Tau3, qui mesure les capacités des agents vocaux de pointe à effectuer des tâches de bout en bout.

Évalue les tâches de service client à l’oral dans les secteurs du transport aérien, du commerce de détail et des télécommunications. Pass@1 mesure la réussite des tâches ; le score principal accorde le même poids à chaque domaine.


* Backend GPT Live : Astra (moyen).

Évalue l’assistance bancaire vocale avec la récupération de connaissances et des outils liés aux comptes. Pass@1 est la proportion des 97 tâches banking_knowledge menées à bien avec succès.


* Backend GPT Live : Astra (moyen).

Évalue la gestion des pauses, l’alternance des tours de parole, les interruptions et les signaux d’écoute.

Teste les réactions lorsque quelqu’un parle en arrière-plan, s’adresse à une autre personne ou intervient par des signaux d’écoute, ainsi qu’aux interruptions.

Mesure la rapidité avec laquelle l’agent commence à répondre après que l’utilisateur a fini de parler.

Teste l’utilisation d’outils à partir de requêtes orales comportant des pauses naturelles, des hésitations et des autocorrections. Le score pass@1 évalue la séquence d’appels d’outils.


* Backend GPT Live  : Terra (faible).

Évalue la réponse orale aux requêtes impliquant l’utilisation d’outils et comportant des pauses, des hésitations et des autocorrections. Évalue la conformité de la réponse à l’intention de référence.


* Backend GPT Live  : Terra (faible).

Ce qu’en disent nos clients

1 sur 4
“L’intégration de GPT‑Live‑1 à Yelp Host et Hatch a amélioré la gestion des tours de parole et la précision par rapport à notre architecture vocale traditionnelle. Lorsque Yelp Host utilise GPT‑Live‑1 pour répondre aux appels, notamment pour les réservations et les commandes de repas, nous constatons une nette amélioration des taux de traitement des appels. Les appelants formulent également des phrases plus complètes et naturelles, ce qui montre que l’expérience à l’autre bout du fil est véritablement différente.”
—Alex Levy, directeur de la technologie

Nouvelles options vocales

Les développeurs ont besoin de voix adaptées à leur produit et naturelles pour ses utilisateurs. Avec GPT‑Live‑1, nous passons d’un petit ensemble de voix en temps réel à un choix plus vaste d’accents, de dialectes et de langues, afin que les développeurs puissent mieux choisir la voix de leurs assistants.

Écoutez les nouvelles voix

Nous continuerons d’élargir les options vocales et la disponibilité des langues au cours des prochains mois.

Tarifs et disponibilité

GPT‑Live‑1 est disponible dès aujourd’hui dans l’API⁠(ouverture dans une nouvelle fenêtre) au tarif de 0,05 $ par minute pour la couche vocale front-end. Associez-le au modèle back-end et au harnais d’agent adaptés à votre produit, puis créez une expérience vocale qui s’adapte au travail à effectuer.

Connexion de GPT-Live-1 à Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Connexion de GPT-Live-1 à Codex. Cet extrait montre comment une application transmet le contexte de la conversation à Codex et renvoie sa réponse à GPT-Live-1. La configuration de la connexion et la gestion de la délégation sont omises.

Pour accéder aux voix personnalisées, contactez l’équipe commerciale afin d’en savoir plus sur les critères d’éligibilité et la procédure de demande.

Une autre façon de créer des workflows vocaux avec GPT‑Live‑1 consiste à utiliser OpenAI Presence, qui utilise le modèle pour alimenter les interactions vocales en temps réel. Presence aide les entreprises à déployer des agents IA de confiance capables de répondre aux questions, résoudre les problèmes, utiliser les systèmes de l’entreprise, effectuer des actions approuvées et passer le relais à des personnes si nécessaire. Adressez-vous à votre responsable de compte OpenAI pour en savoir plus.

Auteur

OpenAI