We’re launching GPT‑Live, a new generation of voice models that make talking with AI feel much more like having a real conversation.
GPT‑Live is built on a full-duplex architecture, meaning it can listen and speak at the same time. During conversations, GPT‑Live can show it’s paying attention with phrases like “mhmm” or “yeah”, engage in quick back-and-forth, or just stay quiet when you need a moment to think. The result is a voice experience that is refreshingly easy to talk to.
GPT‑Live is also our smartest voice model yet. For questions that require web search, deeper reasoning, or more complex work, it delegates to our latest frontier model behind the scenes and brings the result back into the conversation when it’s ready. While it works, GPT‑Live can keep talking with you and maintain the flow of conversation. At launch, GPT‑Live will use GPT‑5.5 in the background. As we release new frontier models, we’ll continuously update the model used by GPT‑Live.
These advances power a new ChatGPT Voice experience that is more intelligent and natural to use. Over time, we believe this research will also unlock the ability to use voice for increasingly complex, longer-running, and more agentic work.
We’re beginning to roll out two versions of GPT‑Live – GPT‑Live‑1 and GPT‑Live‑1 mini – to ChatGPT users globally today. We also plan to bring them to the API soon, and developers and enterprises can sign up to be notified using this form.
Entering a new era of human-AI interaction
Our vision is to enable truly natural human–AI interaction: a world where collaborating with AI feels as fluid and responsive as working with another person, while reasoning and complex task execution happen seamlessly in the background.
Previous approaches
Older generations of voice AI systems brought us closer to that vision, but with important tradeoffs.
Cascaded voice systems
Cascaded voice systems rely on a series of models acting one after another to process each turn. The original ChatGPT Voice chained three models together: a speech-to-text model to transcribe your speech, a large language model to produce a response, and a text-to-speech model to convert it back into speech. This approach enabled us to talk to frontier AI models for the first time, but the complexity came at a cost: information could be lost across models, and responses were slow and stilted.
Kaskadebaseret stemmesystem
Langsomme og opstyltede svar, lange pauser
Turn-based voice models
Turn-based voice models like ChatGPT Advanced Voice Mode processed and generated audio within a single model, reducing latency and making conversations smoother — but they still operated through discrete turns. The model had to wait for the user to stop speaking before responding, resulting in rigid back-and-forth. In addition, because turn detection is based on silence, even a brief pause or background noise could be mistaken for the end of turn — causing the model to interrupt at unnatural times.
Tur-baseret stemmemodel
Lidt hurtigere og mere flydende svar, men interaktionen med modellen føles stadig lidt stiv
Our new approach
GPT‑Live addresses these limitations through two architectural changes.
Continuous interaction
First, we built GPT‑Live for continuous interaction using a full-duplex architecture. Instead of processing a sequence of separate messages, GPT‑Live continuously processes input while generating output. The model can therefore make interaction decisions many times per second: whether to speak, continue listening, pause, interrupt, or invoke a tool.
This allows the model to engage in more natural back-and-forth, maintain a better sense of time, and even perform live translation.
Kontinuerlig interaktion
Hurtige, naturlige og udtryksfulde svar samt mere aktiv lytning
Delegation for deeper work
Second, we decoupled GPT‑Live — which handles continuous interaction — from deeper work. When a question requires search, reasoning, or more agentic capabilities, GPT‑Live can delegate the task to another model like GPT‑5.5. This allows it to keep the conversation going, even as it handles multiple tasks in the background.
This architectural change also allows GPT‑Live to continuously use the latest models and agents, combining frontier intelligence with natural interaction.
Delegering til dybere arbejde
GPT-Live leverer hurtige, naturlige svar, mens GPT-5.5 håndterer søgning i baggrunden
Evaluations
We built new human evaluations to measure pleasantness and the flow of conversation. In these head-to-head comparisons, GPT‑Live‑1 and GPT‑Live‑1 mini are strongly preferred over Advanced Voice Mode in matched 5–10 minute conversations that measure overall preference, turn-taking, interruptions, conversational flow, and how natural each interaction felt.
- GPQA: GPT‑Live‑1 substantially outperforms Advanced Voice Mode on GPQA, which tests expert-level scientific reasoning across biology, chemistry, and physics.
- BrowseComp: GPT‑Live‑1 shows strong gains over Advanced Voice Mode on BrowseComp, which tests agentic web search and the ability to find difficult-to-locate information.
- τ³-Voice Telecom (internal variant)**: GPT‑Live‑1 outperforms Advanced Voice Mode on τ³-Voice Telecom, which tests voice agents on realistic, multi-turn telecom support tasks.
* GPT‑Live‑1 (instant) and GPT‑Live‑1 mini use the GPT‑5.5 Instant model in the background, while GPT‑Live‑1 Medium and GPT‑Live‑1 High use the GPT‑5.5 Thinking model with medium and high reasoning effort.
** We used a customized user model, powered by our latest reasoning models, for this eval.
En ny ChatGPT stemme-oplevelse
Hver uge taler mere end 150 millioner mennesker med ChatGPT ved hjælp af funktioner som Stemme og Diktering. De bruger det til at få håndfri hjælp i hverdagen, øve sprog, fortælle godnathistorier eller bare chatte på vej til og fra arbejde.
Fra i dag får du en forbedret oplevelse drevet af GPT‑Live, når du trykker på Stemme-knappen for at tale med ChatGPT – med mere naturlige samtaler, smartere svar, bedre lytning og visuelle svar.
Mere naturlige samtaler
At tale med ChatGPT bør nu føles meget mere som en rigtig samtale. Du kan afbryde med et spørgsmål, holde pause for at samle tankerne eller bede ChatGPT om at tale langsommere. Den viser naturligt, at den følger med, med vendinger som “mm-hmm” eller “forstået”, så du ved, at den lytter. Vi har også genbearbejdet de ni forskellige stemmer i ChatGPT til GPT‑Live.
Smartere svar
ChatGPT stemme kan nu trække på vores nyeste banebrydende modeller, så du får smartere svar, når du har brug for dem. Du kan også vælge det niveau af ræsonnering, der passer til dine behov: Instant til hurtige svar eller Mellem og Høj, når du vil have ChatGPT til at bruge mere tid på at tænke.
Bedre lytteoplevelse
Hvis du bruger et øjeblik på at tænke, venter ChatGPT stemme nu i stedet for at springe ind og afbryde. Hvis du beder den om at være stille og lytte, gør den det. Og når der er baggrundsstøj, som forbipasserende trafik eller samtaler i nærheden, er ChatGPT bedre til at fokusere på din stemme i stedet for at blive distraheret.
Visuelle svar ved første blik
Nogle svar er mere nyttige, når du kan se dem. Mens du taler, kan ChatGPT nu vise detaljerede visuelle kort om emner som vejr, aktier, sport og mere. Stemme understøtter fortsat søgning, hukommelse, billeder og filuploads.



Resultatet er en ChatGPT stemme-oplevelse, der føles mere naturlig, mere kompetent og mere nyttig i hverdagen.
Sikkerhed designet til stemme
GPT‑Live er designet til at være sikker som standard. Den bygger videre på sikkerhedsfremskridtene fra vores nyeste modeller og tilføjer målrettet sikkerhedstræning på tværs af vigtige risikoområder samt nye beskyttelsesforanstaltninger, der er designet specifikt til stemme.
Udvidet sikkerhedstest
For bedre at afspejle, hvordan folk bruger stemme i virkelige situationer, begyndte vi med at udvide vores sikkerhedstest til at omfatte nye lydspecifikke evalueringer. Vi oprettede også syntetiske evalueringer, der bruger genereret lyd til at fokusere mere intensivt på vigtige sikkerhedsområder med afsæt i det, vi lærte fra avanceret stemmetilstand. Disse områder omfatter selvskade, psykose og mani, følelsesmæssig afhængighed af AI, vold og seksuelt indhold. Interne eksperter red-teamede også modellen for risici, der er særlige for stemme.
I vores test klarede GPT‑Live sig på niveau med eller bedre end avanceret stemmetilstand på næsten alle de områder, vi evaluerede. Du kan læse mere om vores test og beskyttelsesforanstaltninger i GPT‑Lives systemkort(åbner i et nyt vindue).
Indbyggede beskyttelsesforanstaltninger
Fordi stemmesamtaler foregår i realtid, har vi også indbygget beskyttelsesforanstaltninger, der kan reagere, mens modellen taler. Når systemet registrerer potentielt usikkert output, kan det lede modellen mod et mere sikkert svar, vise yderligere sikkerhedsbeskeder eller ressourcer eller afslutte stemmesamtalen i situationer med højere risiko. Til samtaler, der involverer selvskade, har vi tilpasset ChatGPTs supportforløb til stemme, herunder tilbud om ekspertgodkendt støtte fra krisehotlines.
Vi har designet yderligere beskyttelser til at støtte teenagebrugere og trænet alderssvarende adfærd direkte ind i modellen for at reducere risikoen for upassende svar. Forældre kan via forældrekontrol vælge, om deres teenager må bruge ChatGPT stemme, og tilknyttede forældre kan blive underrettet i situationer med højere risiko, hvor der er tegn på mulig selvskade eller selvmordshensigt.
Læring fra brug i den virkelige verden
Vi udruller også længerevarende målinger og overvågning efter lancering med fokus på følelsesmæssig afhængighed for fortsat at forbedre vores forståelse og finjustere beskyttelsesforanstaltningerne. Med afsæt i vores tidligere forskning i affektiv brug og følelsesmæssigt velbefindende vil dette hjælpe os med at identificere nye mønstre og forbedre, hvordan systemet reagerer i følelsesmæssigt følsomme interaktioner.
Endelig er GPT‑Live designet til samtale, ikke stemmeefterligning. Den bruger et sæt foruddefinerede stemmer i ChatGPT med beskyttelsesforanstaltninger, der forhindrer den i at efterligne en virkelig persons stemme.
Vi er engagerede i at understøtte sikkerhed og trivsel og vil fortsætte med at styrke disse beskyttelser, efterhånden som vi lærer af brug i den virkelige verden.
Tilgængelighed & begrænsninger
GPT‑Live udrulles nu til ChatGPT‑brugere globalt på iOS, Android og ChatGPT.com(åbner i et nyt vindue). GPT‑Live‑1 bliver standardmodellen, der driver ChatGPT stemme for Go-, Plus- og Pro-brugere, og GPT‑Live‑1 mini bliver standard for Free-brugere. Flere oplysninger om tilgængelighed findes i vores Hjælp(åbner i et nyt vindue).
Vi har optimeret GPT‑Live til nogle af de mest populære sprog i ChatGPT. På visse sprog kan modellen have en ikke-indfødt accent eller mangler i flydende sprogbrug. Vi arbejder aktivt på at forbedre oplevelsen på tværs af sprog.
Ved lanceringen understøtter GPT‑Live ikke stemme med video eller skærmdeling i ChatGPT, men vi arbejder på snart at introducere disse funktioner. Du kan stadig få adgang til ældre versioner af ChatGPT stemme, herunder Standard og Avanceret stemmetilstand, hvor disse funktioner er tilgængelige.


