Vi lancerer GPT‑Live‑1 i API'et, hvilket giver udviklere en kraftfuld og naturlig stemmemodel til udvikling af stemmeaktiverede apps og forretningsarbejdsgange. GPT‑Live‑1 blev først introduceret i ChatGPT og kan lytte og tale samtidig. Som det ses med Codex og ChatGPT Work(åbner i et nyt vindue), kan den delegere dybere ræsonnering og handlinger til de modeller og værktøjer, den er koblet sammen med.
I forbindelse med API-udgivelsen af GPT‑Live‑1 har vi fokuseret på nye funktioner, der giver udviklere mulighed for at tilpasse og skræddersy stemmeoplevelserne til deres brugere, arbejdsgange og mål. En af GPT‑Live‑1’s største styrker – smidig håndtering af afbrydelser – har allerede haft en positiv indvirkning på forretningen: I de indledende evalueringer konstaterede Speak, at GPT‑Live‑1 gav de studerende mere tid til at tænke, inden sproglæreren svarede, hvilket reducerede antallet af afbrydelser med næsten 80 % sammenlignet med tidligere turbaserede systemer.
Vigtigste styrker ved GPT‑Live‑1 i API'et:
Håndtering af afbrydelser: Forbedrer håndteringen af afbrydelser via én model, der samlet ræsonnerer over indgående og udgående lyd og undgår dermed forsinkelserne og de ustabile overdragelser, der kendetegner sammenkædede STT‑LLM‑TTS-arkitekturer.
Delegering af ræsonnering og værktøjskald: GPT‑Live‑1 kan delegere ræsonnering og værktøjskald til en backend-tekstmodel som GPT‑6 Astra eller en tredjepartsmodel.
Tone, tempo og stil: Giver udviklere mulighed for at forme en agents tone, tempo og samtalestil via systemprompten.
Lydløs kontekststyring og baggrundsstøj: Håndterer baggrundsstøj og stilhed bedre uden at afbryde samtalen eller beskrive hvert trin højt.
Pålidelighed under lange sessioner: Forbedrer fastholdelsen af kontekst og samtalekvaliteten gennem længere interaktioner.
Understøttelse af telefoni: Muliggør implementering af stemmeagenter med fuld duplex til telefonopkald – fra restaurantreservationer til kundesupport.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Denne demo er tidsbegrænset. Ved at bruge det accepterer du OpenAIs vilkår og bekræfter vores privatlivspolitik.
Traditionelle stemmeagenter sammenkæder tale-til-tekst, en ræsonneringsmodel og tekst-til-tale. Hver overdragelse skaber forsinkelse og øger risikoen for at miste timing, kontekst eller samtalens naturlige rytme. Det er ofte udviklerne, der skal koordinere disse faser, herunder hvad der sker, når nogen afbryder, holder pause eller skifter retning.
GPT‑Live‑1 håndterer lytning og tale i én model og forenkler dermed stemmelaget. Den kan reagere på afbrydelser og tilkendegivelser, mens de sker, og samtidig uddelegere dybere ræsonnering til backenden. Det gør det muligt at fortsætte samtalen, mens arbejdet foregår i baggrunden.
Udviklerne vælger modellerne, værktøjerne og den agent-harness, der ligger bag samtalen. De kan f.eks. kombinere GPT‑Live‑1 med en model som Luna til opgaver med stor volumen, såsom planlægning eller ordreopdateringer, og bruge en model som Astra til komplekse kundeproblemer, der kræver ræsonnering. Denne fleksibilitet giver udviklere mulighed for at tilpasse ræsonneringsdybde, hastighed og omkostninger til hver opgave.
GPT‑Live‑1 leverer indbyggede ASR-transskriptioner og svartekst. Den har også en stærk alfanumerisk forståelse og understøtter nøgleordsprioritering. Selvom GPT‑Live‑1 ikke er en turbaseret model, understøtter den indbygget registrering af turskift, så udviklere fortsat kan bygge løsninger omkring eksplicitte turgrænser.
I vores evalueringer forbedrer GPT‑Live‑1 ydeevnen på Full Duplex Bench med 30 procentpoint sammenlignet med GPT‑Realtime‑2.1, med markante forbedringer i latenstiden ved turtagning og interaktiv adfærd. Sammen med GPT‑6 Astra ved ræsonneringsindsatsen Mellem ligger den også nr. 1 på Tau3, som måler banebrydende intelligens for stemmeagenter på opgaver fra start til slut.
Evaluerer talte kundeserviceopgaver inden for flyselskaber, detailhandel og telekommunikation. Pass@1 måler opgavesucces; overskriften vægter hvert domæne lige højt.
* GPT Live-backend: Astra (Mellem).
Evaluerer talebaseret banksupport med videnssøgning og kontoværktøjer. Pass@1 er andelen af 97 banking_knowledge-opgaver, der er fuldført med succes.
* GPT Live-backend: Astra (Mellem).
Evaluerer håndtering af pauser, turtagning i samtaler, afbrydelser og tilbagemeldinger.
Tester reaktioner på baggrundstale, tale til en anden person, lytterens korte responslyde og afbrydelser.
Måler, hvor hurtigt agenten begynder sit svar, efter at brugeren er færdig med at tale.
Tester brug af værktøjer ud fra talte anmodninger, der indeholder naturlige pauser, tøven og selvkorrektioner. Pass@1 vurderer sekvensen af værktøjskald.
* GPT Live-backend: Terra (lav).
Evaluerer det talte svar på anmodninger, der bruger værktøjer, og som indeholder pauser, tøven og selvkorrektioner. Vurderer, hvor godt svaret matcher referenceintentionen.
* GPT Live-backend: Terra (lav).
Udviklere har brug for stemmer, der passer til deres produkt og lyder naturlige for brugerne. Med GPT‑Live‑1 udvider vi fra et lille udvalg af realtidsstemmer til et bredere udvalg af accenter, dialekter og sprog, så udviklere får større frihed til at vælge, hvordan deres assistenter skal lyde.
Vi fortsætter med at udvide udvalget af stemmer og sprog i de kommende måneder.
GPT‑Live‑1 er tilgængelig i API'et i dag(åbner i et nyt vindue) til 0,05 USD pr. minut for stemmelaget i frontenden. Kombiner den med den backendmodel og den agent-harness, der passer til dit produkt, og byg derefter en stemmeoplevelse, der kan skaleres i takt med opgaverne.
Hvis du ønsker adgang til tilpassede stemmer, kan du kontakt salgsteamet for at få mere at vide om adgangskravene og ansøgningsprocessen.
En anden måde at bygge stemme-workflows oven på GPT‑Live‑1 på er med OpenAI Presence, som bruger modellen til at muliggøre stemmeinteraktioner i realtid. Presence hjælper virksomheder med at udrulle betroede AI-agenter, som kan besvare spørgsmål, løse problemer, bruge virksomhedens systemer, udføre godkendte handlinger og eskalere til mennesker, når det er nødvendigt. Kontakt din kundeansvarlige hos OpenAI for at få mere at vide.

