Vi lanserar GPT‑Live, en ny generation röstmodeller som gör att det känns mycket mer som ett riktigt samtal att prata med AI.
GPT‑Live bygger på en full-duplexarkitektur, vilket innebär att den kan lyssna och tala samtidigt. Under samtal kan GPT‑Live visa att den lyssnar med uttryck som ”mm-hm” eller ”ja”, delta i snabba repliker fram och tillbaka eller bara vara tyst när du behöver en stund att tänka. Resultatet är en röstupplevelse som känns oväntat enkel att prata med.
GPT‑Live är också vår smartaste röstmodell hittills. För frågor som kräver webbsökning, djupare resonemang eller mer komplext arbete delegerar den till vår senaste banbrytande modell bakom kulisserna och tar tillbaka resultatet in i samtalet när det är klart. Medan den arbetar kan GPT‑Live fortsätta prata med dig och hålla samtalet igång. Vid lanseringen kommer GPT‑Live att använda GPT‑5.5 i bakgrunden. När vi lanserar nya banbrytande modeller kommer vi löpande att uppdatera modellen som används av GPT‑Live.
De här framstegen möjliggör en ny ChatGPT Voice-upplevelse som är mer intelligent och naturlig att använda. Med tiden tror vi att den här forskningen också kommer att göra det möjligt att använda röst för allt mer komplext, långvarigt och agentiskt arbete.
Vi börjar i dag lansera två versioner av GPT‑Live – GPT‑Live‑1 och GPT‑Live‑1 mini – för ChatGPT‑användare globalt. Vi planerar också att snart ta dem till API:et, och utvecklare och företag kan anmäla sig för att få en avisering via det här formuläret.
In i en ny era för interaktion mellan människor och AI
Vår vision är att möjliggöra verkligt naturlig interaktion mellan människor och AI: en värld där samarbete med AI känns lika smidigt och responsivt som att arbeta med en annan person, samtidigt som resonemang och komplex uppgiftsutförande sker sömlöst i bakgrunden.
Tidigare metoder
Äldre generationer av röstbaserade AI-system förde oss närmare den visionen, men med viktiga kompromisser.
Kaskadkopplade röstsystem
Kaskadkopplade röstsystem bygger på en serie modeller som agerar en efter en för att bearbeta varje tur. Ursprungliga ChatGPT Voice kedjade ihop tre modeller: en tal-till-text-modell som transkriberade ditt tal, en stor språkmodell som tog fram ett svar och en text-till-tal-modell som omvandlade det tillbaka till tal. Den här metoden gjorde det möjligt för oss att prata med banbrytande AI-modeller för första gången, men komplexiteten hade ett pris: information kunde gå förlorad mellan modellerna, och svaren var långsamma och stela.
Kaskadkopplat röstsystem
Långsamma och stela svar, långa pauser
Turtagande röstmodeller
Turtagande röstmodeller som ChatGPT Avancerat röstläge bearbetade och genererade ljud inom en enda modell, vilket minskade latensen och gjorde samtalen smidigare – men de fungerade fortfarande genom separata turer. Modellen behövde vänta tills användaren hade slutat prata innan den svarade, vilket ledde till ett stelt utbyte fram och tillbaka. Eftersom turdetektering dessutom bygger på tystnad kunde även en kort paus eller bakgrundsljud misstas för slutet på en tur – vilket fick modellen att avbryta vid onaturliga tillfällen.
Turtagande röstmodell
Något snabbare och smidigare svar, men utbytet med modellen känns fortfarande stelt
Vår nya metod
GPT‑Live hanterar dessa begränsningar genom två arkitektoniska förändringar.
Kontinuerlig interaktion
För det första byggde vi GPT‑Live för kontinuerlig interaktion med en full-duplexarkitektur. I stället för att bearbeta en sekvens av separata meddelanden bearbetar GPT‑Live kontinuerligt indata samtidigt som den genererar utdata. Modellen kan därför fatta interaktionsbeslut många gånger per sekund: om den ska tala, fortsätta lyssna, pausa, avbryta eller anropa ett verktyg.
Det gör att modellen kan delta i ett mer naturligt utbyte fram och tillbaka, hålla bättre koll på tiden och till och med utföra livetolkning.
Kontinuerlig interaktion
Snabba, naturliga och uttrycksfulla svar samt mer aktivt lyssnande
Delegering för djupare arbete
För det andra frikopplade vi GPT‑Live – som hanterar kontinuerlig interaktion – från djupare arbete. När en fråga kräver sökning, resonemang eller mer agentiska förmågor kan GPT‑Live delegera uppgiften till en annan modell, till exempel GPT‑5.5. Det gör att den kan hålla samtalet igång även när den hanterar flera uppgifter i bakgrunden.
Den här arkitektoniska förändringen gör också att GPT‑Live kontinuerligt kan använda de senaste modellerna och agenterna, och kombinera banbrytande intelligens med naturlig interaktion.
Delegering för djupare arbete
GPT-Live ger snabba, naturliga svar, medan GPT-5.5 hanterar sökning i bakgrunden
Utvärderingar
Vi tog fram nya mänskliga utvärderingar för att mäta hur behagliga samtalen är och hur väl de flyter. I dessa parvisa jämförelser föredras GPT‑Live‑1 och GPT‑Live‑1 mini klart framför Avancerat röstläge i matchade samtal på 5–10 minuter som mäter övergripande preferens, turtagning, avbrott, samtalsflöde och hur naturlig varje interaktion kändes.
- GPQA: GPT‑Live‑1 presterar avsevärt bättre än Avancerat röstläge på GPQA, som testar vetenskapligt resonemang på expertnivå inom biologi, kemi och fysik.
- BrowseComp: GPT‑Live‑1 visar stora förbättringar jämfört med Avancerat röstläge på BrowseComp, som testar agentisk webbsökning och förmågan att hitta information som är svår att lokalisera.
- τ³-Voice Telecom (intern variant)**: GPT‑Live‑1 presterar bättre än Avancerat röstläge på τ³-Voice Telecom, som testar röstagenter i realistiska telekomsupportuppgifter med flera turer.
* GPT‑Live‑1 (Snabb) och GPT‑Live‑1 mini använder GPT‑5.5 Snabb-modellen i bakgrunden, medan GPT‑Live‑1 Balanserad och GPT‑Live‑1 Hög använder GPT‑5.5 Thinking-modellen med balanserad respektive hög resonemangsnivå.
** Vi använde en anpassad användarmodell, driven av våra senaste resonemangsmodeller, för den här utvärderingen.
En ny ChatGPT Voice-upplevelse
Varje vecka pratar fler än 150 miljoner människor med ChatGPT med funktioner som Röst och Diktering. De använder det för att få vardagshjälp utan att använda händerna, öva språk, berätta godnattsagor eller bara småprata på väg till jobbet.
Från och med i dag får du en förbättrad upplevelse, driven av GPT‑Live, när du trycker på röstknappen för att prata med ChatGPT – med naturligare samtal, smartare svar, bättre lyssnande och visuella svar.
Naturligare samtal
Att prata med ChatGPT ska nu kännas mycket mer som ett riktigt samtal. Du kan avbryta med en fråga, pausa för att samla tankarna eller be ChatGPT att prata långsammare. Den bekräftar naturligt det du säger med fraser som ”mm” eller ”jag förstår”, så att du vet att den hänger med. Vi har också mastrat om de nio distinkta rösterna i ChatGPT för GPT‑Live.
Smartare svar
ChatGPT Voice kan nu använda våra senaste banbrytande modeller, så att du får smartare svar när du behöver dem. Du kan också välja den resonemangsnivå som passar dina behov: Instant för snabba svar, eller Medium och High när du vill att ChatGPT ska lägga mer tid på att tänka.
Bättre lyssnande
Om du behöver en stund för att tänka väntar ChatGPT Voice nu i stället för att hoppa in och avbryta. Om du ber den vara tyst och lyssna gör den det. Och när det finns bakgrundsljud, som förbipasserande trafik eller samtal i närheten, är ChatGPT bättre på att fokusera på din röst i stället för att bli distraherad.
Visuella svar med en snabb överblick
Vissa svar blir mer användbara när du kan se dem. Medan du pratar kan ChatGPT nu visa innehållsrika visuella kort om ämnen som väder, aktier, sport och annat. Voice fortsätter också att ha stöd för sökning, minne, bilder och filuppladdningar.



Resultatet är en ChatGPT Voice-upplevelse som känns naturligare, mer kapabel och mer användbar i vardagen.
Säkerhet utformad för röst
GPT‑Live har utformats för att vara säkert som standard. Det bygger vidare på säkerhetsframstegen i våra senaste modeller och lägger till särskild säkerhetsträning inom viktiga riskområden samt nya skydd som utformats specifikt för röst.
Utökad säkerhetstestning
För att bättre spegla hur människor använder röst i verkliga miljöer började vi med att utöka vår säkerhetstestning med nya ljudinbyggda utvärderingar. Vi skapade också syntetiska utvärderingar som använder genererat ljud för att fokusera mer intensivt på centrala säkerhetsområden, baserat på det vi lärde oss från Avancerat röstläge. Dessa områden omfattar självskada, psykos och mani, emotionellt beroende av AI, våld och sexuellt innehåll. Interna experter red-teamade också modellen för risker som är unika för röst.
I våra tester presterade GPT‑Live jämförbart med eller bättre än Avancerat röstläge inom nästan alla områden vi utvärderade. Du kan läsa mer om våra tester och skyddsåtgärder i GPT‑Lives systemkort(öppnas i ett nytt fönster).
Inbyggda skyddsåtgärder
Eftersom röstsamtal sker i realtid har vi också byggt skyddsåtgärder som kan agera medan modellen talar. När systemet upptäcker potentiellt osäkra utdata kan det styra modellen mot ett säkrare svar, visa ytterligare säkerhetsmeddelanden eller resurser, eller avsluta röstsamtalet i fall med högre risk. För samtal som rör självskada har vi anpassat ChatGPT:s stödflöden för röst, bland annat genom att erbjuda krislinjestöd som granskats av experter.
Vi utformade ytterligare skydd för att stödja tonårsanvändare och tränade in åldersanpassat beteende direkt i modellen för att minska risken för olämpliga svar. Föräldrar kan välja om deras tonåring får använda ChatGPT Voice via Föräldrainställningar, och länkade föräldrar kan meddelas i situationer med högre risk som involverar tecken på möjlig självskada eller självmordsavsikt.
Lärdomar från användning i verkligheten
Vi inför också mer långsiktig mätning och övervakning efter lansering med fokus på emotionellt beroende, för att fortsätta förbättra vår förståelse och förfina skyddsåtgärderna. Med utgångspunkt i vår tidigare forskning om affektiv användning och emotionellt välbefinnande hjälper detta oss att identifiera nya mönster och förbättra hur systemet svarar i känslomässigt känsliga interaktioner.
Slutligen är GPT‑Live utformat för samtal, inte röstimitation. Det använder en uppsättning fördefinierade röster i ChatGPT, med skyddsåtgärder som hindrar det från att imitera en verklig persons röst.
Vi är fast beslutna att stödja säkerhet och välbefinnande och kommer att fortsätta stärka dessa skydd i takt med att vi lär oss av användning i verkligheten.
Tillgänglighet & begränsningar
GPT‑Live rullas nu ut till ChatGPT‑användare globalt på iOS, Android och ChatGPT.com(öppnas i ett nytt fönster). GPT‑Live‑1 blir standardmodellen som driver ChatGPT Voice för Go-, Plus- och Pro-användare, och GPT‑Live‑1 mini blir standard för Free-användare. Mer information om tillgänglighet finns i vårt Hjälpcenter(öppnas i ett nytt fönster).
Vi har optimerat GPT‑Live för några av de mest populära språken i ChatGPT. För vissa språk kan modellen ha en icke-infödd accent eller brister i flytet. Vi arbetar aktivt för att förbättra upplevelsen på flera språk.
Vid lanseringen har GPT‑Live inte stöd för röst med video eller skärmdelning i ChatGPT, men vi arbetar på att införa dessa funktioner snart. Du kan fortfarande komma åt äldre versioner av ChatGPT Voice, inklusive Standard och Avancerat röstläge, där dessa funktioner är tillgängliga.


