Gå direkt till huvudinnehåll
OpenAI

10 september 2026

ProduktLansering

Vi presenterar GPT‑Live‑1 i API:et

GPT‑Live‑1 ger API:et ChatGPTs naturliga full duplex-samtal – nu med bättre instruktionsföljsamhet och delegering, styrbar personlighet, telefonistöd, tillförlitliga långsessioner och tyst kontexthantering.

Laddar …

[PLATSHÅLLARE: Publiceringsdatum ska bekräftas.]

[PLATSHÅLLARE: Kundreferensvideo från Yelp – slutlig video, miniatyrbild, undertexter och transkription återstår.]

I dag lanserar vi GPT‑Live‑1 i API:et och ger utvecklare en kraftfull röstmodell som kan kombineras med banbrytande intelligens i deras egna applikationer. GPT‑Live‑1 introducerades först i ChatGPT och kan lyssna och tala samtidigt. Som vi har sett med Codex och ChatGPT Work(öppnas i ett nytt fönster) kan modellen även delegera djupare resonemang och åtgärder till de modeller och verktyg som den kombineras med.

Inför API-lanseringen av GPT‑Live har vi fokuserat på nya funktioner som låter utvecklare utforma röstupplevelser efter sina användare, arbetsflöden och mål. I tidiga utvärderingar upptäckte exempelvis språkinlärningsappen Speak att GPT‑Live‑1 minskade antalet avbrott under elevernas tankepauser med nästan 80 % jämfört med tidigare turbaserade system. Det ger eleverna mer tid att hitta orden innan läraren ingriper.

API-lanseringen tillför följande:

  • Avbrottshantering: En enda modell bearbetar inkommande och utgående ljud tillsammans och undviker därmed fördröjningarna och de känsliga överlämningarna i kedjade STT–LLM–TTS-arkitekturer.

  • Agentorkestrering: Följer flerstegsinstruktioner mer tillförlitligt, utför anpassade verktygsanrop och delegerar djupare resonemang eller åtgärder till den backend-modell eller körmiljö för agenter som utvecklaren väljer.

  • Anpassade röster: Tillför [XX – antal fastställs senare] nya anpassade röster på [YY – språk fastställs senare] språk och hjälper varumärken att skapa naturliga, särpräglade röstupplevelser på olika språk och dialekter.

  • Styrbar personlighet: Låter utvecklare forma en agents ton, tempo och samtalsstil genom systemprompten.

  • Tyst kontexthantering och bakgrundsljud: Hanterar bakgrundsljud och tystnad bättre utan att avbryta samtalet eller återge varje steg högt.

  • Flexibel intelligens: Låter utvecklare välja den backend-modell eller körmiljö för agenter som passar deras arbetsflöde.

  • Tillförlitlighet under långa sessioner: Förbättrar bibehållen kontext och samtalskvalitet under längre interaktioner.

  • Telefonistöd: Gör det möjligt att driftsätta röstbaserade full duplex-agenter för telefonsamtal, från restaurangbokningar till kundsupport.

Tillfällig skiss av en röstdemo med en vågform och en sessionstimer. I originalgrafiken står det fortfarande GPT-Realtime-2.

[PLATSHÅLLARE: Interaktiv röstdemo – källskissen visas; den slutliga GPT‑Live‑1‑upplevelsen återstår.]

Bortom kedjade röstsystem: samtal som inte behöver vänta på sin tur

Traditionella röstbaserade agenter kopplar samman tal till text, en resonemangsmodell och text till tal. Varje överlämning ökar fördröjningen och risken för att tajming, kontext eller samtalets naturliga rytm går förlorad. Det är ofta utvecklarna som måste samordna dessa steg, inklusive vad som händer när någon avbryter, pausar eller byter riktning.

GPT‑Live‑1 hanterar lyssnande och tal i en enda modell, vilket förenklar realtidsröstlagret. Den kan reagera på avbrott och bekräftelser när de sker och samtidigt delegera djupare resonemang till backend-systemet. På så sätt kan samtalet fortsätta medan arbetet sker i bakgrunden.

Jämfört med vår kaskadkopplade lösning förenklade GPT‑Live‑1 vår kodbas med 80 % och eliminerade 23 000 rader kod. Det möjliggjorde naturliga patientsamtal i realtid & frigjorde tid för vårt team att förbättra hela upplevelsen, från tidsbokning till att hitta rätt i vården.
– Tony Stoyanov, medgrundare och teknisk chef, EliseAI

Utvecklarna väljer vilka modeller, verktyg och körmiljöer för agenter som ska driva samtalet. De kan exempelvis kombinera GPT‑Live‑1 med en modell som Luna för stora volymer av uppgifter som schemaläggning eller orderuppdateringar och använda en modell som Astra för komplexa kundärenden som kräver resonemang. Den flexibiliteten låter utvecklare anpassa resonemangsdjup, hastighet och kostnad efter varje uppgift.

GPT‑Llive‑1 tillhandahåller ASR-transkriptioner och svarstext direkt. Den har även god förståelse för alfanumeriska tecken och stöder nyckelordsprioritering. Även om GPT‑live inte är en turbaserad modell har den inbyggd stöd för turdetektering, så att utvecklare kan fortsätta bygga kring tydliga turgränser.

[PLATSHÅLLARE: Ljudjämförelse sida vid sida mellan GPT‑Live‑1 och ett kaskadkopplat röstsystem – ljudfiler och transkriptioner återstår.]

Mätning av fördelarna med full duplex

I våra utvärderingar hamnar GPT‑Live‑1 kombinerat med GPT‑6 Astra och balanserad resonemangsnivå på första plats i Tau3, som mäter intelligensen hos banbrytande röstbaserade agenter i heltäckande uppgifter, och på första plats i Full Duplex Bench, som utvärderar interaktivitet, fördröjning vid turtagning, verktygsanrop och svarskvalitet.

Källdiagram med prestandamätningar som jämför GPT-Live-1 med GPT-Realtime-modeller avseende intelligens i Tau3, interaktivitet, fördröjning vid turtagning, verktygsanrop och svarskvalitet.

Vad kunderna säger

1 av 4
När vi lade till GPT‑Live‑1 i Yelp Host och Hatch förbättrades turtagningen och precisionen jämfört med vår traditionella röstarkitektur. När Yelp Host använder GPT‑Live för att besvara samtal om exempelvis bokningar och matbeställningar ser vi tydliga förbättringar i andelen samtal som hanteras. De som ringer talar dessutom i mer fullständiga och naturliga meningar, vilket visar att upplevelsen i andra änden av telefonen verkligen känns annorlunda.
– Alex Levy, teknisk chef, Yelp

Nya röstalternativ

Utvecklare behöver röster som passar deras produkt och låter naturliga för användarna. Med GPT‑Live‑1 går vi från ett litet utbud av realtidsröster till ett bredare urval av accenter, dialekter och språk, så att utvecklare får större valfrihet i hur deras assistenter låter.

  • Quartz – australisk engelska, feminin, genererad

  • Ripple – australisk engelska, maskulin, naturlig

  • Vesper – brittisk engelska, maskulin, naturlig

  • Willow – irländsk engelska, feminin, naturlig

  • Stone – irländsk engelska, maskulin, naturlig

  • Gleam – nordamerikansk engelska, feminin, naturlig

  • Meridian – nordamerikansk engelska, maskulin, naturlig

  • Bossa – brasiliansk portugisiska, feminin, naturlig

  • Tempo – brasiliansk portugisiska, maskulin, naturlig

  • Aster – indisk engelska, feminin, genererad

  • Beacon – filippinsk engelska, maskulin, genererad

  • Delta – sydstatsengelska från USA, feminin, genererad

  • Cinder – sydstatsengelska från USA, maskulin, genererad

[PLATSHÅLLARE: Röstväljare med 3–5 återkommande exempelmeningar per röst – ljudexempel och interaktiv upplevelse återstår.]

Under de kommande månaderna fortsätter vi att utöka antalet röstalternativ och tillgängliga språk.

Pris och tillgänglighet

GPT‑Live‑1 finns nu i API:et för 0,05 USD per minut för det användarnära röstlagret. Kombinera det med den backend-modell och körmiljö för agenter som passar din produkt och skapa sedan en röstupplevelse som kan skalas efter arbetsuppgifterna.

Om du vill få tillgång till anpassade röster kan du kontakta säljavdelningen för att få veta mer om behörighetskraven och ansökningsprocessen.

Du kan komma igång snabbare med GPT‑Live‑1 genom Presence, som stöder realtidsupplevelser med både röst och chatt, exempelvis kundsupport, utgående försäljning och interna arbetsflöden med hög risk. Kontakta din kundansvariga på OpenAI för mer information.

Författare

OpenAI