Overslaan naar hoofdinhoud
OpenAI

10 september 2026

ProductRelease

Bouw natuurlijkere spraakervaringen met GPT‑Live‑1 in de API

GPT‑Live‑1 brengt de natuurlijke full-duplexgesprekken van ChatGPT naar de API, met meer controle over hoe spraakagenten spreken en handelen.

Bezig met laden...

We lanceren GPT‑Live‑1 in de API en bieden ontwikkelaars daarmee een krachtig, natuurlijk spraakmodel om spraakgestuurde apps en bedrijfsworkflows te bouwen. GPT‑Live‑1 werd voor het eerst geïntroduceerd in ChatGPT, kan tegelijkertijd luisteren en spreken en kan, zoals te zien is bij Codex en ChatGPT Work,⁠(opent in een nieuw venster) diepere redeneringen en acties delegeren aan de modellen en tools waarmee het wordt gecombineerd.

Voor de API-release van GPT‑Live‑1 hebben we ons gericht op nieuwe mogelijkheden waarmee ontwikkelaars spraakervaringen kunnen sturen en aanpassen aan hun gebruikers, workflows en doelen. Een belangrijke kracht van GPT‑Live‑1, het soepel omgaan met onderbrekingen, zorgt al voor zakelijke impact: in vroege evaluaties stelde Speak vast dat GPT‑Live‑1 cursisten meer tijd gaf om na te denken voordat de taaldocent reageerde, waardoor het aantal onderbrekingen met bijna 80% afnam ten opzichte van eerdere systemen met beurtwisseling.

Belangrijkste sterke punten van GPT‑Live‑1 in de API:

  • Afhandeling van onderbrekingen: Verbetert de afhandeling van onderbrekingen via één model dat gezamenlijk redeneert over inkomende en uitgaande audio, zonder de vertraging en kwetsbare overdrachten van gekoppelde STT–LLM–TTS-architecturen.

  • Delegatie van redenering & toolaanroepen: GPT‑Live‑1 kan redenering en toolaanroepen delegeren aan een backendtekstmodel zoals GPT‑6 Astra of een model van een derde partij.

  • Toon, tempo en stijl: ontwikkelaars kunnen via de systeemprompt de toon, het tempo en de gespreksstijl van een agent vormgeven.

  • Stil contextbeheer & achtergrondgeluid: Gaat beter om met achtergrondgeluid en stiltes zonder het gesprek te onderbreken of elke stap hardop te beschrijven.

  • Betrouwbaarheid bij lange sessies: Verbetert het behoud van context en de gesprekskwaliteit tijdens langdurige interacties.

  • Telefonieondersteuning: Maakt de implementatie mogelijk van full-duplex spraakagenten voor telefoongesprekken, van restaurantreserveringen tot klantenservice.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Deze demo heeft een tijdslimiet. Door deze te gebruiken, ga je akkoord met de Voorwaarden van OpenAI en bevestig je dat je ons Privacybeleid hebt gelezen.

Vereenvoudig je spraakagentarchitectuur en verlaag de spraaklatentie

Traditionele spraakagenten koppelen spraak-naar-tekst, een redenerend model en tekst-naar-spraak aan elkaar. Elke overdracht zorgt voor vertraging en vergroot de kans dat timing, context of het natuurlijke ritme van een gesprek verloren gaat. Ontwikkelaars moeten die fasen vaak zelf coördineren, ook wanneer iemand onderbreekt, pauzeert of een andere richting inslaat.

GPT‑Live‑1 verwerkt luisteren en spreken in één model, waardoor de spraaklaag eenvoudiger wordt. Het kan direct reageren op onderbrekingen en bevestigingen, terwijl de diepere redenering aan de backend wordt gedelegeerd. Zo kan het gesprek doorgaan terwijl op de achtergrond werk wordt verricht.

“Vergeleken met onze cascadeoplossing vereenvoudigde GPT‑Live‑1 onze codebase met 80% en konden we 23.000 regels code verwijderen. Dit maakte natuurlijke realtime gesprekken met patiënten mogelijk & gaf ons team de ruimte om de hele ervaring te verbeteren, van het maken van een afspraak tot het vinden van de juiste zorg.”
Tony Stoyanov, medeoprichter en CTO

Ontwikkelaars kiezen zelf de modellen, tools en agentharness achter het gesprek. Ze kunnen GPT‑Live‑1 bijvoorbeeld combineren met een model als Luna voor grootschalige taken zoals planning of bestelupdates, en een model als Astra gebruiken voor complexe klantvragen waarvoor redenering nodig is. Dankzij die flexibiliteit kunnen ontwikkelaars de diepgang van de redenering, snelheid en kosten op elke taak afstemmen.

GPT‑Live‑1 biedt standaard ASR-transcripten en antwoordtekst. Het model begrijpt alfanumerieke informatie goed en ondersteunt ook het prioriteren van trefwoorden. Hoewel GPT‑Live‑1 geen beurtgebaseerd model is, ondersteunt het standaard beurtendetectie. Ontwikkelaars kunnen dus expliciete beurtgrenzen blijven gebruiken.

Het full-duplexvoordeel meten

In onze evaluaties verbetert GPT‑Live‑1 de prestaties op Full Duplex Bench met 30 procentpunten ten opzichte van GPT‑Realtime‑2.1, met grote verbeteringen in de latentie bij beurtwisseling en interactief gedrag. In combinatie met GPT‑6 Astra bij een gemiddelde redeneringsinspanning staat het model ook op nummer 1 in Tau3, dat de geavanceerde intelligentie van spraakagenten bij end-to-endtaken meet.

Evalueert gesproken klantenservicetaken in de domeinen luchtvaart, detailhandel en telecom. Pass@1 meet het succes van taken; in het totaalcijfer weegt elk domein even zwaar.


* GPT Live-backend: Astra (gemiddeld).

Evalueert gesproken ondersteuning voor bankzaken waarbij kennis en accounttools worden gebruikt. Pass@1 is het aandeel van de 97 banking_knowledge-taken dat met succes is voltooid.


* GPT Live-backend: Astra (gemiddeld).

Evalueert de afhandeling van pauzes, beurtwisseling in gesprekken, onderbrekingen en luistersignalen.

Test reacties op achtergrondspraak, spraak die tot iemand anders is gericht, luistersignalen en onderbrekingen.

Meet hoe snel de agent met een antwoord begint nadat de gebruiker een beurt heeft afgerond.

Test het gebruik van tools op basis van gesproken verzoeken met natuurlijke pauzes, aarzelingen en zelfcorrecties. Pass@1 is de score voor de reeks toolaanroepen.


* GPT Live-backend: Terra (laag).

Evalueert het gesproken antwoord op verzoeken waarbij tools worden gebruikt en die pauzes, aarzelingen en zelfcorrecties bevatten. Beoordeelt hoe goed het antwoord overeenkomt met de intentie in de referentie.


* GPT Live-backend: Terra (laag).

Wat klanten zeggen

1 van 4
“De toevoeging van GPT‑Live‑1 aan Yelp Host en Hatch heeft de beurtwisseling en nauwkeurigheid verbeterd ten opzichte van onze traditionele spraakarchitectuur. Wanneer Yelp Host GPT‑Live‑1 gebruikt om telefoontjes over bijvoorbeeld reserveringen en bestellingen te beantwoorden, zien we duidelijke verbeteringen in het percentage succesvol afgehandelde gesprekken. Bellers spreken bovendien in volledigere, natuurlijkere zinnen. Dat laat zien dat de ervaring aan de andere kant van de lijn echt anders aanvoelt.”
—Alex Levy, Chief Technology Officer

Nieuwe stemopties

Ontwikkelaars hebben stemmen nodig die bij hun product passen en natuurlijk klinken voor de gebruikers ervan. Met GPT‑Live‑1 breiden we ons kleine aanbod van realtime stemmen uit met meer accenten, dialecten en talen, zodat ontwikkelaars meer keuze hebben in hoe hun assistenten klinken.

Luister naar de nieuwe stemmen

De komende maanden blijven we het aanbod van stemmen en talen uitbreiden.

Prijzen & beschikbaarheid

GPT‑Live‑1 is vanaf vandaag beschikbaar in de API⁠(opent in een nieuw venster) voor $0,05 per minuut voor de front-end-spraaklaag. Combineer het met het backendmodel en de agentharness die bij je product passen en bouw vervolgens een spraakervaring die kan meegroeien met het werk dat moet worden verricht.

GPT-Live-1 koppelen aan Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

GPT-Live-1 verbinden met Codex. Dit fragment laat zien hoe een applicatie gesprekscontext doorgeeft aan Codex en het antwoord terugstuurt naar GPT-Live-1. Het opzetten van de verbinding en de afhandeling van delegatie zijn weggelaten.

Voor toegang tot aangepaste stemmen kun je contact opnemen met sales voor meer informatie over de voorwaarden en de aanvraagprocedure.

Een andere manier om spraakworkflows te bouwen met GPT‑Live‑1 is met OpenAI Presence, dat het model gebruikt voor realtime spraakinteracties. Presence helpt ondernemingen betrouwbare AI-agents te implementeren die vragen kunnen beantwoorden, problemen kunnen oplossen, bedrijfssystemen kunnen gebruiken, goedgekeurde acties kunnen uitvoeren en taken zo nodig aan mensen kunnen doorgeven. Neem voor meer informatie contact op met je accountdirecteur bij OpenAI.

Auteurs

OpenAI