We lanceren GPT‑Live‑1 in de API en bieden ontwikkelaars daarmee een krachtig, natuurlijk spraakmodel om spraakgestuurde apps en bedrijfsworkflows te bouwen. GPT‑Live‑1 werd voor het eerst geïntroduceerd in ChatGPT, kan tegelijkertijd luisteren en spreken en kan, zoals te zien is bij Codex en ChatGPT Work,(opent in een nieuw venster) diepere redeneringen en acties delegeren aan de modellen en tools waarmee het wordt gecombineerd.
Voor de API-release van GPT‑Live‑1 hebben we ons gericht op nieuwe mogelijkheden waarmee ontwikkelaars spraakervaringen kunnen sturen en aanpassen aan hun gebruikers, workflows en doelen. Een belangrijke kracht van GPT‑Live‑1, het soepel omgaan met onderbrekingen, zorgt al voor zakelijke impact: in vroege evaluaties stelde Speak vast dat GPT‑Live‑1 cursisten meer tijd gaf om na te denken voordat de taaldocent reageerde, waardoor het aantal onderbrekingen met bijna 80% afnam ten opzichte van eerdere systemen met beurtwisseling.
Belangrijkste sterke punten van GPT‑Live‑1 in de API:
Afhandeling van onderbrekingen: Verbetert de afhandeling van onderbrekingen via één model dat gezamenlijk redeneert over inkomende en uitgaande audio, zonder de vertraging en kwetsbare overdrachten van gekoppelde STT–LLM–TTS-architecturen.
Delegatie van redenering & toolaanroepen: GPT‑Live‑1 kan redenering en toolaanroepen delegeren aan een backendtekstmodel zoals GPT‑6 Astra of een model van een derde partij.
Toon, tempo en stijl: ontwikkelaars kunnen via de systeemprompt de toon, het tempo en de gespreksstijl van een agent vormgeven.
Stil contextbeheer & achtergrondgeluid: Gaat beter om met achtergrondgeluid en stiltes zonder het gesprek te onderbreken of elke stap hardop te beschrijven.
Betrouwbaarheid bij lange sessies: Verbetert het behoud van context en de gesprekskwaliteit tijdens langdurige interacties.
Telefonieondersteuning: Maakt de implementatie mogelijk van full-duplex spraakagenten voor telefoongesprekken, van restaurantreserveringen tot klantenservice.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Deze demo heeft een tijdslimiet. Door deze te gebruiken, ga je akkoord met de Voorwaarden van OpenAI en bevestig je dat je ons Privacybeleid hebt gelezen.
Traditionele spraakagenten koppelen spraak-naar-tekst, een redenerend model en tekst-naar-spraak aan elkaar. Elke overdracht zorgt voor vertraging en vergroot de kans dat timing, context of het natuurlijke ritme van een gesprek verloren gaat. Ontwikkelaars moeten die fasen vaak zelf coördineren, ook wanneer iemand onderbreekt, pauzeert of een andere richting inslaat.
GPT‑Live‑1 verwerkt luisteren en spreken in één model, waardoor de spraaklaag eenvoudiger wordt. Het kan direct reageren op onderbrekingen en bevestigingen, terwijl de diepere redenering aan de backend wordt gedelegeerd. Zo kan het gesprek doorgaan terwijl op de achtergrond werk wordt verricht.
Ontwikkelaars kiezen zelf de modellen, tools en agentharness achter het gesprek. Ze kunnen GPT‑Live‑1 bijvoorbeeld combineren met een model als Luna voor grootschalige taken zoals planning of bestelupdates, en een model als Astra gebruiken voor complexe klantvragen waarvoor redenering nodig is. Dankzij die flexibiliteit kunnen ontwikkelaars de diepgang van de redenering, snelheid en kosten op elke taak afstemmen.
GPT‑Live‑1 biedt standaard ASR-transcripten en antwoordtekst. Het model begrijpt alfanumerieke informatie goed en ondersteunt ook het prioriteren van trefwoorden. Hoewel GPT‑Live‑1 geen beurtgebaseerd model is, ondersteunt het standaard beurtendetectie. Ontwikkelaars kunnen dus expliciete beurtgrenzen blijven gebruiken.
In onze evaluaties verbetert GPT‑Live‑1 de prestaties op Full Duplex Bench met 30 procentpunten ten opzichte van GPT‑Realtime‑2.1, met grote verbeteringen in de latentie bij beurtwisseling en interactief gedrag. In combinatie met GPT‑6 Astra bij een gemiddelde redeneringsinspanning staat het model ook op nummer 1 in Tau3, dat de geavanceerde intelligentie van spraakagenten bij end-to-endtaken meet.
Evalueert gesproken klantenservicetaken in de domeinen luchtvaart, detailhandel en telecom. Pass@1 meet het succes van taken; in het totaalcijfer weegt elk domein even zwaar.
* GPT Live-backend: Astra (gemiddeld).
Evalueert gesproken ondersteuning voor bankzaken waarbij kennis en accounttools worden gebruikt. Pass@1 is het aandeel van de 97 banking_knowledge-taken dat met succes is voltooid.
* GPT Live-backend: Astra (gemiddeld).
Evalueert de afhandeling van pauzes, beurtwisseling in gesprekken, onderbrekingen en luistersignalen.
Test reacties op achtergrondspraak, spraak die tot iemand anders is gericht, luistersignalen en onderbrekingen.
Meet hoe snel de agent met een antwoord begint nadat de gebruiker een beurt heeft afgerond.
Test het gebruik van tools op basis van gesproken verzoeken met natuurlijke pauzes, aarzelingen en zelfcorrecties. Pass@1 is de score voor de reeks toolaanroepen.
* GPT Live-backend: Terra (laag).
Evalueert het gesproken antwoord op verzoeken waarbij tools worden gebruikt en die pauzes, aarzelingen en zelfcorrecties bevatten. Beoordeelt hoe goed het antwoord overeenkomt met de intentie in de referentie.
* GPT Live-backend: Terra (laag).
Ontwikkelaars hebben stemmen nodig die bij hun product passen en natuurlijk klinken voor de gebruikers ervan. Met GPT‑Live‑1 breiden we ons kleine aanbod van realtime stemmen uit met meer accenten, dialecten en talen, zodat ontwikkelaars meer keuze hebben in hoe hun assistenten klinken.
De komende maanden blijven we het aanbod van stemmen en talen uitbreiden.
GPT‑Live‑1 is vanaf vandaag beschikbaar in de API(opent in een nieuw venster) voor $0,05 per minuut voor de front-end-spraaklaag. Combineer het met het backendmodel en de agentharness die bij je product passen en bouw vervolgens een spraakervaring die kan meegroeien met het werk dat moet worden verricht.
Voor toegang tot aangepaste stemmen kun je contact opnemen met sales voor meer informatie over de voorwaarden en de aanvraagprocedure.
Een andere manier om spraakworkflows te bouwen met GPT‑Live‑1 is met OpenAI Presence, dat het model gebruikt voor realtime spraakinteracties. Presence helpt ondernemingen betrouwbare AI-agents te implementeren die vragen kunnen beantwoorden, problemen kunnen oplossen, bedrijfssystemen kunnen gebruiken, goedgekeurde acties kunnen uitvoeren en taken zo nodig aan mensen kunnen doorgeven. Neem voor meer informatie contact op met je accountdirecteur bij OpenAI.

