Gå direkt till huvudinnehåll
OpenAI

10 september 2026

ProduktLansering

Skapa mer naturliga röstupplevelser med GPT‑Live‑1 i API:et

GPT‑Live‑1 ger API:et ChatGPTs naturliga samtal med full duplex med mer kontroll över hur röstbaserade agenter talar och agerar.

Laddar …

Vi lanserar GPT‑Live‑1 i API:et och ger utvecklare en kraftfull, naturlig röstmodell för att bygga röstaktiverade appar och arbetsflöden för företag. Först introducerad i ChatGPT kan GPT‑Live‑1 lyssna och tala samtidigt och kan, som visats med Codex och ChatGPT Work⁠(öppnas i ett nytt fönster), delegera djupare resonemang och åtgärder till de modeller och verktyg som den kombineras med.

Inför API-lanseringen av GPT‑Live‑1 har vi fokuserat på nya funktioner som låter utvecklare styra och anpassa röstupplevelser utifrån sina användare, arbetsflöden och mål. En central styrka hos GPT‑Live‑1 – den smidiga hanteringen av avbrott – ger redan affärsnytta: I tidiga utvärderingar konstaterade Speak att GPT‑Live‑1 gav eleverna mer tid att tänka innan språkläraren svarade, vilket minskade avbrotten med nästan 80 % jämfört med tidigare turbaserade system.

Viktiga styrkor hos GPT‑Live‑1 i API:t:

  • Avbrottshantering: Förbättrar hanteringen av avbrott med hjälp av en enda modell som resonerar kring inkommande och utgående ljud samtidigt och undviker därmed fördröjning och sköra överlämningar i kedjade STT–LLM–TTS-arkitekturer.

  • Delegering av resonemang och verktygsanrop: GPT‑Live‑1 kan delegera resonemang och verktygsanrop till en textmodell på serversidan, som GPT‑6 Astra eller en tredjepartsmodell.

  • Ton, tempo och stil: Låter utvecklare forma en agents ton, tempo och samtalsstil genom systemprompten.

  • Tyst kontexthantering och bakgrundsljud: Hanterar bakgrundsljud och tystnad bättre utan att avbryta samtalet eller återge varje steg högt.

  • Tillförlitlighet under långa sessioner: Förbättrar bibehållen kontext och samtalskvalitet under längre interaktioner.

  • Telefonistöd: Gör det möjligt att driftsätta röstbaserade full duplex-agenter för telefonsamtal, från restaurangbokningar till kundsupport.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Den här demon är tidsbegränsad. Genom att använda den godkänner du OpenAI:s Villkor och bekräftar att du har tagit del av vår Integritetspolicy.

Förenkla din röstagentarkitektur och minska röstlatensen

Traditionella röstbaserade agenter kopplar samman tal till text, en resonemangsmodell och text till tal. Varje överlämning ökar fördröjningen och risken för att tajming, kontext eller samtalets naturliga rytm går förlorad. Det är ofta utvecklarna som måste samordna dessa steg, inklusive vad som händer när någon avbryter, pausar eller byter riktning.

GPT‑Live‑1 hanterar lyssnande och tal i en enda modell, vilket förenklar röstlagret. Den kan reagera på avbrott och bekräftelser när de sker och samtidigt delegera djupare resonemang till backend-systemet. På så sätt kan samtalet fortsätta medan arbetet sker i bakgrunden.

“Jämfört med vår kaskadkopplade lösning förenklade GPT‑Live‑1 vår kodbas med 80 % och eliminerade 23 000 rader kod. Det möjliggjorde naturliga patientsamtal i realtid & frigjorde tid för vårt team att förbättra hela upplevelsen, från tidsbokning till att hitta rätt i vården.”
– Tony Stoyanov, medgrundare och CTO

Utvecklarna väljer vilka modeller, verktyg och körmiljöer för agenter som ska driva samtalet. De kan exempelvis kombinera GPT‑Live‑1 med en modell som Luna för stora volymer av uppgifter som schemaläggning eller orderuppdateringar och använda en modell som Astra för komplexa kundärenden som kräver resonemang. Den flexibiliteten låter utvecklare anpassa resonemangsdjup, hastighet och kostnad efter varje uppgift.

GPT‑Live‑1 tillhandahåller ASR-transkriptioner och svarstext inbyggt. Den har även god förståelse för alfanumeriska tecken och stöder nyckelordsprioritering. Även om GPT‑Live‑1 inte är en turbaserad modell har den inbyggt stöd för turdetektering, så att utvecklare kan fortsätta bygga kring tydliga turgränser.

Mätning av fördelarna med full duplex

I våra utvärderingar förbättrar GPT‑Live‑1 prestandan i Full Duplex Bench med 30 procentenheter jämfört med GPT‑Realtime‑2.1, med stora förbättringar av fördröjning vid turtagning och interaktivt beteende. I kombination med GPT‑6 Astra vid balanserad resonemangsnivå hamnar det också på första plats i Tau3, som mäter intelligensen hos banbrytande röstbaserade agenter i heltäckande uppgifter.

Utvärderar talade kundserviceuppgifter inom flygbolag, detaljhandel och telekom. Pass@1 mäter om uppgiften lyckas; rubriken ger varje domän lika stor vikt.


* GPT Live backend: Astra (balanserad).

Utvärderar talat bankstöd med kunskapsinhämtning och kontoverktyg. Pass@1 är andelen av 97 banking_knowledge-uppgifter som har slutförts framgångsrikt.


* GPT Live backend: Astra (balanserad).

Utvärderar hantering av pauser, turtagning i samtal, avbrott och återkopplingssignaler.

Testar reaktioner på bakgrundstal, tal riktat till en annan person, lyssnarens återkopplingssignaler och avbrott.

Mäter hur snabbt agenten börjar svara efter att användaren har avslutat en tur.

Testar verktygsanvändning från talade förfrågningar som innehåller naturliga pauser, tvekan och självrättelser. Pass@1 bedömer sekvensen av verktygsanrop.


* GPT Live-backend: Terra (låg).

Utvärderar det talade svaret på begäranden där verktyg används och som innehåller pauser, tvekan och självrättelser. Betygsätter hur väl svaret överensstämmer med referensens avsikt.


* GPT Live-backend: Terra (låg).

Vad kunderna säger

1 av 4
“När vi lade till GPT‑Live‑1 i Yelp Host och Hatch förbättrades turtagningen och precisionen jämfört med vår traditionella röstarkitektur. När Yelp Host använder GPT‑Live‑1 för att besvara samtal om exempelvis bokningar och matbeställningar ser vi tydliga förbättringar i andelen samtal som hanteras. De som ringer talar dessutom i mer fullständiga och naturliga meningar, vilket visar att upplevelsen i andra änden av telefonen verkligen känns annorlunda.”
– Alex Levy, teknikchef

Nya röstalternativ

Utvecklare behöver röster som passar deras produkt och låter naturliga för användarna. Med GPT‑Live‑1 går vi från ett litet utbud av realtidsröster till ett bredare urval av accenter, dialekter och språk, så att utvecklare får större valfrihet i hur deras assistenter låter.

Lyssna på de nya rösterna

Under de kommande månaderna fortsätter vi att utöka antalet röstalternativ och tillgängliga språk.

Pris och tillgänglighet

GPT‑Live‑1 finns nu i API:et⁠(öppnas i ett nytt fönster) för 0,05 $ per minut för det användarnära röstlagret. Kombinera det med den backend-modell och körmiljö för agenter som passar din produkt och skapa sedan en röstupplevelse som kan skalas efter arbetsuppgifterna.

Ansluta GPT-Live-1 till Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Ansluta GPT-Live-1 till Codex. Det här utdraget visar hur en applikation skickar samtalskontext till Codex och returnerar dess svar till GPT-Live-1. Anslutningskonfiguration och hantering av delegering utelämnas.

Om du vill få tillgång till anpassade röster kan du kontakta säljavdelningen för att få veta mer om behörighetskraven och ansökningsprocessen.

Ett annat sätt att skapa röstarbetsflöden med GPT‑Live‑1 är att använda OpenAI Presence, som använder modellen för röstinteraktioner i realtid. Presence hjälper företag att driftsätta betrodda AI-agenter som kan svara på frågor, lösa problem, använda företagets system, utföra godkända åtgärder och eskalera till människor vid behov. Kontakta din Account Director på OpenAI för mer information.

Författare

OpenAI