Hopp til hovedinnhold
OpenAI

10. september 2026

ProduktLansering

Skap mer naturlige stemmeopplevelser med GPT‑Live‑1 i API-et

GPT‑Live‑1 bringer ChatGPTs naturlige full-duplex-samtaler til API-et, med mer kontroll over hvordan taleagenter snakker og handler.

Laster inn …

Vi lanserer GPT‑Live‑1 i API-et og gir utviklere en kraftig, naturlig talemodell for å bygge taleaktiverte apper og arbeidsflyter for virksomheter. GPT‑Live‑1, som først ble introdusert i ChatGPT, kan lytte og snakke samtidig og, som vi har sett med Codex og ChatGPT Work⁠(åpnes i et nytt vindu), delegere dypere resonnering og handlinger til modellene og verktøyene den er koblet sammen med.

I API-lanseringen av GPT‑Live‑1 har vi lagt vekt på nye funksjoner som lar utviklere styre og tilpasse stemmeopplevelser etter brukerne, arbeidsflytene og målene deres. En sentral styrke ved GPT‑Live‑1, sømløs håndtering av avbrytelser, har allerede forretningsmessig betydning: I tidlige evalueringer fant Speak ut at GPT‑Live‑1 ga elevene mer tid til å tenke før språklæreren svarte, og reduserte avbrytelser med nesten 80 % sammenlignet med tidligere turbaserte systemer.

Viktige styrker ved GPT‑Live‑1 i API-et:

  • Håndtering av avbrytelser: Forbedrer håndteringen av avbrytelser gjennom én modell som resonnerer over innkommende og utgående lyd samlet, og unngår dermed ventetiden og sårbare overganger i kjedede STT–LLM–TTS-arkitekturer.

  • Delegering av resonnering og verktøykall: GPT‑Live‑1 kan delegere resonnering og verktøykall til en backend-tekstmodell som GPT‑6 Astra eller en tredjepartsmodell.

  • Tone, tempo og stil: Utviklere kan forme agentens tone, tempo og samtalestil gjennom system-prompten.

  • Stille konteksthåndtering og bakgrunnsstøy: Håndterer bakgrunnsstøy og stillhet bedre uten å avbryte samtalen eller lese opp hvert trinn.

  • Pålitelighet i lange økter: Gir bedre bevaring av kontekst og samtalekvalitet gjennom lengre interaksjoner.

  • Telefonistøtte: Muliggjør bruk av full-duplex-taleagenter for telefonsamtaler, alt fra restaurantreservasjoner til kundestøtte.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Denne demoen er tidsbegrenset. Ved å bruke dette godtar du OpenAIs vilkår og bekrefter at du er kjent med vår personvernerklæring.

Forenkle tale-agent-arkitekturen din og reduser taleforsinkelsen

Tradisjonelle taleagenter kobler sammen tale-til-tekst, en resonneringsmodell og tekst-til-tale. Hver overgang øker forsinkelsen og gir flere muligheter til å miste timing, kontekst eller den naturlige rytmen i en samtale. Det er ofte utviklerne som må koordinere disse trinnene, blant annet hva som skjer når noen avbryter, tar en pause eller skifter retning.

OpenAI GPT‑Live‑1 håndterer både lytting og tale i én og samme modell, noe som forenkler talelaget. Den kan reagere på avbrytelser og bekreftelser idet de skjer, samtidig som den overlater mer omfattende resonnement til backend-systemet. Dermed kan samtalen fortsette mens arbeidet pågår i bakgrunnen.

“Sammenlignet med den kaskadekoblede løsningen vår forenklet OpenAI GPT‑Live‑1 kodebasen med 80 % og fjernet 23 000 kodelinjer. Dette muliggjorde naturlige pasientsamtaler i sanntid og frigjorde tid for teamet vårt til å forbedre opplevelsen fra timebestilling til navigering i behandlingstilbudet.”
– Tony Stoyanov, medgründer og CTO

Utviklerne velger modellene, verktøyene og agentrammeverket bak samtalen. De kan for eksempel kombinere OpenAI GPT‑Live‑1 med en modell som Luna for oppgaver med høyt volum, som planlegging eller ordreoppdateringer, og bruke en modell som Astra til komplekse kundeproblemer som krever resonnering. Med denne fleksibiliteten kan utviklerne tilpasse dybden på resonneringen, hastigheten og kostnaden til hver oppgave.

GPT‑Live‑1 har ASR-transkripsjoner og svartekst innebygd. Den har også god forståelse av alfanumerisk innhold og støtter vekting av nøkkelord. Selv om GPT‑Live‑1 ikke er en turbasert modell, har den innebygd støtte for å registrere turskifter, slik at utviklere fortsatt kan bygge rundt eksplisitte turgrenser.

Måling av fordelene ved full-duplex

I evalueringene våre forbedrer GPT‑Live‑1 ytelsen på Full Duplex Bench med 30 prosentpoeng sammenlignet med GPT‑Realtime‑2.1, med store forbedringer i forsinkelse ved turtaking og interaktiv atferd. Kombinert med GPT‑6 Astra med middels resonneringsinnsats rangeres den også som nummer én på Tau3, som måler Intelligens til banebrytende taleagenter i ende-til-ende-oppgaver.

Evaluerer muntlige kundeserviceoppgaver innen domenene flyselskap, detaljhandel og telekom. Pass@1 måler oppgavesuksess; overskriften gir hvert domene lik vekt.


* GPT Live-backend: Astra (middels).

Evaluerer talebasert bankstøtte med kunnskapsinnhenting og kontoverktøy. Pass@1 er andelen av 97 banking_knowledge-oppgaver som ble fullført på en vellykket måte.


* GPT Live-backend: Astra (middels).

Evaluerer håndtering av pauser, turtaking i samtaler, avbrytelser og tilbakemeldingssignaler.

Tester reaksjoner på bakgrunnstale, tale til en annen person, lyttertilbakemeldinger og avbrytelser.

Måler hvor raskt agenten begynner å svare etter at brukeren er ferdig med sin tur.

Tester verktøybruk fra muntlige forespørsler som inneholder naturlige pauser, nøling og selvkorrigeringer. Pass@1 vurderer verktøykallsekvensen.


* GPT Live-backend: Terra (lav).

Evaluerer det talte svaret på forespørsler som bruker verktøy og inneholder pauser, nølinger og selvkorrigeringer. Vurderer hvor godt svaret samsvarer med referanseintensjonen.


* GPT Live-backend: Terra (lav).

Dette sier kundene

1 av 4
“Innføringen av GPT‑Live‑1 i Yelp Host og Hatch har ført til bedre turtaking og høyere nøyaktighet sammenlignet med vår tradisjonelle stemmearkitektur. Når Yelp Host bruker GPT‑Live‑1 til å besvare samtaler, om blant annet reservasjoner og matbestillinger, ser vi betydelige forbedringer i andelen samtaler som håndteres. De som ringer, bruker også mer fullstendige og naturlige setninger, noe som tyder på at opplevelsen i den andre enden av telefonen føles genuint annerledes.”
– Alex Levy, Chief Technology Officer

Nye stemmealternativer

Utviklere trenger stemmer som passer produktet deres og høres naturlige ut for brukerne. Med OpenAI GPT‑Live‑1 utvider vi fra et lite utvalg sanntidsstemmer til et bredere utvalg aksenter, dialekter og språk, slik at utviklere får større valgfrihet i hvordan assistentene deres høres ut.

Lytt til de nye stemmene

Vi fortsetter å utvide stemmealternativene og språktilbudet i månedene som kommer.

Pris og tilgjengelighet

OpenAI GPT‑Live‑1 er tilgjengelig i API-et⁠(åpnes i et nytt vindu) i dag til 0,05 dollar per minutt for stemmelaget i front-end. Kombiner den med backend-modellen og agentrammeverket som passer produktet ditt, og bygg deretter en taleopplevelse som kan skaleres i takt med arbeidet den utfører.

Koble GPT-Live-1 til Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Kobler GPT-Live-1 til Codex. Dette utdraget viser hvordan en applikasjon sender samtalekontekst til Codex og returnerer svaret til GPT-Live-1. Oppsett av tilkobling og håndtering av delegering er utelatt.

For å få tilgang til tilpassede stemmer kan du kontakte salgsavdelingen for å finne ut mer om kvalifikasjonskravene og søknadsprosessen.

En annen måte å bygge talebaserte arbeidsflyter på med GPT‑Live‑1 er med OpenAI Presence, som bruker modellen til å muliggjøre taleinteraksjoner i sanntid. Presence hjelper virksomheter med å ta i bruk pålitelige AI-agenter som kan svare på spørsmål, løse problemer, bruke bedriftens systemer, utføre godkjente handlinger og eskalere til mennesker ved behov. Ta kontakt med OpenAI-kundekontakten din for å finne ut mer.

Forfatter

OpenAI