[PLATSHÅLLARE: Publiceringsdatum ska bekräftas.]
[PLATSHÅLLARE: Kundreferensvideo från Yelp – slutlig video, miniatyrbild, undertexter och transkription återstår.]
I dag lanserar vi GPT‑Live‑1 i API:et och ger utvecklare en kraftfull röstmodell som kan kombineras med banbrytande intelligens i deras egna applikationer. GPT‑Live‑1 introducerades först i ChatGPT och kan lyssna och tala samtidigt. Som vi har sett med Codex och ChatGPT Work(öppnas i ett nytt fönster) kan modellen även delegera djupare resonemang och åtgärder till de modeller och verktyg som den kombineras med.
Inför API-lanseringen av GPT‑Live har vi fokuserat på nya funktioner som låter utvecklare utforma röstupplevelser efter sina användare, arbetsflöden och mål. I tidiga utvärderingar upptäckte exempelvis språkinlärningsappen Speak att GPT‑Live‑1 minskade antalet avbrott under elevernas tankepauser med nästan 80 % jämfört med tidigare turbaserade system. Det ger eleverna mer tid att hitta orden innan läraren ingriper.
API-lanseringen tillför följande:
Avbrottshantering: En enda modell bearbetar inkommande och utgående ljud tillsammans och undviker därmed fördröjningarna och de känsliga överlämningarna i kedjade STT–LLM–TTS-arkitekturer.
Agentorkestrering: Följer flerstegsinstruktioner mer tillförlitligt, utför anpassade verktygsanrop och delegerar djupare resonemang eller åtgärder till den backend-modell eller körmiljö för agenter som utvecklaren väljer.
Anpassade röster: Tillför [XX – antal fastställs senare] nya anpassade röster på [YY – språk fastställs senare] språk och hjälper varumärken att skapa naturliga, särpräglade röstupplevelser på olika språk och dialekter.
Styrbar personlighet: Låter utvecklare forma en agents ton, tempo och samtalsstil genom systemprompten.
Tyst kontexthantering och bakgrundsljud: Hanterar bakgrundsljud och tystnad bättre utan att avbryta samtalet eller återge varje steg högt.
Flexibel intelligens: Låter utvecklare välja den backend-modell eller körmiljö för agenter som passar deras arbetsflöde.
Tillförlitlighet under långa sessioner: Förbättrar bibehållen kontext och samtalskvalitet under längre interaktioner.
Telefonistöd: Gör det möjligt att driftsätta röstbaserade full duplex-agenter för telefonsamtal, från restaurangbokningar till kundsupport.

[PLATSHÅLLARE: Interaktiv röstdemo – källskissen visas; den slutliga GPT‑Live‑1‑upplevelsen återstår.]
Traditionella röstbaserade agenter kopplar samman tal till text, en resonemangsmodell och text till tal. Varje överlämning ökar fördröjningen och risken för att tajming, kontext eller samtalets naturliga rytm går förlorad. Det är ofta utvecklarna som måste samordna dessa steg, inklusive vad som händer när någon avbryter, pausar eller byter riktning.
GPT‑Live‑1 hanterar lyssnande och tal i en enda modell, vilket förenklar realtidsröstlagret. Den kan reagera på avbrott och bekräftelser när de sker och samtidigt delegera djupare resonemang till backend-systemet. På så sätt kan samtalet fortsätta medan arbetet sker i bakgrunden.
Utvecklarna väljer vilka modeller, verktyg och körmiljöer för agenter som ska driva samtalet. De kan exempelvis kombinera GPT‑Live‑1 med en modell som Luna för stora volymer av uppgifter som schemaläggning eller orderuppdateringar och använda en modell som Astra för komplexa kundärenden som kräver resonemang. Den flexibiliteten låter utvecklare anpassa resonemangsdjup, hastighet och kostnad efter varje uppgift.
GPT‑Llive‑1 tillhandahåller ASR-transkriptioner och svarstext direkt. Den har även god förståelse för alfanumeriska tecken och stöder nyckelordsprioritering. Även om GPT‑live inte är en turbaserad modell har den inbyggd stöd för turdetektering, så att utvecklare kan fortsätta bygga kring tydliga turgränser.
[PLATSHÅLLARE: Ljudjämförelse sida vid sida mellan GPT‑Live‑1 och ett kaskadkopplat röstsystem – ljudfiler och transkriptioner återstår.]
I våra utvärderingar hamnar GPT‑Live‑1 kombinerat med GPT‑6 Astra och balanserad resonemangsnivå på första plats i Tau3, som mäter intelligensen hos banbrytande röstbaserade agenter i heltäckande uppgifter, och på första plats i Full Duplex Bench, som utvärderar interaktivitet, fördröjning vid turtagning, verktygsanrop och svarskvalitet.

Utvecklare behöver röster som passar deras produkt och låter naturliga för användarna. Med GPT‑Live‑1 går vi från ett litet utbud av realtidsröster till ett bredare urval av accenter, dialekter och språk, så att utvecklare får större valfrihet i hur deras assistenter låter.
Quartz – australisk engelska, feminin, genererad
Ripple – australisk engelska, maskulin, naturlig
Vesper – brittisk engelska, maskulin, naturlig
Willow – irländsk engelska, feminin, naturlig
Stone – irländsk engelska, maskulin, naturlig
Gleam – nordamerikansk engelska, feminin, naturlig
Meridian – nordamerikansk engelska, maskulin, naturlig
Bossa – brasiliansk portugisiska, feminin, naturlig
Tempo – brasiliansk portugisiska, maskulin, naturlig
Aster – indisk engelska, feminin, genererad
Beacon – filippinsk engelska, maskulin, genererad
Delta – sydstatsengelska från USA, feminin, genererad
Cinder – sydstatsengelska från USA, maskulin, genererad
[PLATSHÅLLARE: Röstväljare med 3–5 återkommande exempelmeningar per röst – ljudexempel och interaktiv upplevelse återstår.]
Under de kommande månaderna fortsätter vi att utöka antalet röstalternativ och tillgängliga språk.
GPT‑Live‑1 finns nu i API:et för 0,05 USD per minut för det användarnära röstlagret. Kombinera det med den backend-modell och körmiljö för agenter som passar din produkt och skapa sedan en röstupplevelse som kan skalas efter arbetsuppgifterna.
Om du vill få tillgång till anpassade röster kan du kontakta säljavdelningen för att få veta mer om behörighetskraven och ansökningsprocessen.
Du kan komma igång snabbare med GPT‑Live‑1 genom Presence, som stöder realtidsupplevelser med både röst och chatt, exempelvis kundsupport, utgående försäljning och interna arbetsflöden med hög risk. Kontakta din kundansvariga på OpenAI för mer information.


