Opdatering 31. juli 2026: Understøttet lyd, der er genereret med GPT‑Live via ChatGPT‑stemme og OpenAI-API'et, omfatter nu SynthID-vandmærkning. Vores offentlige verificeringsværktøj kan nu registrere OpenAI-provenienssignaler i understøttede lydfiler, og vi har introduceret API-adgang til verifikation, så udviklere og organisationer kan indarbejde provenienskontroller i deres egne arbejdsgange. Disse opdateringer bygger videre på den sikkerhedstilgang, der er beskrevet nedenfor, og vores bredere arbejde med at gøre OpenAI-genereret indhold nemmere at identificere.
Vi lancerer GPT‑Live, en ny generation af stemmemodeller, der får det at tale med AI til at føles meget mere som en rigtig samtale.
GPT‑Live er bygget på en full-duplex-arkitektur, hvilket betyder, at den kan lytte og tale på samme tid. Under samtaler kan GPT‑Live vise, at den følger med, med udtryk som "mhmm" eller "ja", indgå i hurtig dialog frem og tilbage eller bare være stille, når du har brug for et øjeblik til at tænke. Resultatet er en stemmeoplevelse, der er forfriskende nem at tale med.
GPT‑Live er også vores hidtil smarteste stemmemodel. Ved spørgsmål, der kræver websøgning, dybere ræsonnering eller mere komplekst arbejde, delegerer den til vores nyeste banebrydende model bag kulisserne og bringer resultatet tilbage i samtalen, når det er klar. Mens den arbejder, kan GPT‑Live fortsætte med at tale med dig og bevare samtalens flow. Ved lanceringen bruger GPT‑Live GPT‑5.5 i baggrunden. Efterhånden som vi udgiver nye banebrydende modeller, opdaterer vi løbende den model, som GPT‑Live bruger.
Disse fremskridt driver en ny ChatGPT stemme-oplevelse, der er mere intelligent og naturlig at bruge. Over tid mener vi, at denne forskning også vil åbne mulighed for at bruge stemme til stadig mere komplekst, længerevarende og mere agentbaseret arbejde.
Vi begynder i dag at udrulle to versioner af GPT‑Live – GPT‑Live‑1 og GPT‑Live‑1 mini – til ChatGPT‑brugere globalt. Vi planlægger også snart at bringe dem til API'en, og udviklere og virksomheder kan tilmelde sig for at få besked via denne formular.
På vej ind i en ny æra for interaktion mellem mennesker og AI
Vores vision er at muliggøre virkelig naturlig interaktion mellem mennesker og AI: en verden, hvor samarbejde med AI føles lige så flydende og responsivt som at arbejde med et andet menneske, mens ræsonnering og kompleks opgaveudførelse sker gnidningsfrit i baggrunden.
Tidligere tilgange
Ældre generationer af AI-stemmesystemer bragte os tættere på den vision, men med vigtige kompromiser.
Kaskadebaserede stemmesystemer
Kaskadebaserede stemmesystemer bygger på en række modeller, der handler én efter én for at behandle hver forespørgselsrunde. Den oprindelige ChatGPT stemme kædede tre modeller sammen: en tale-til-tekst-model til at transskribere din tale, en stor sprogmodel til at producere et svar og en tekst-til-tale-model til at konvertere det tilbage til tale. Denne tilgang gjorde det muligt for os for første gang at tale med banebrydende AI-modeller, men kompleksiteten havde en pris: information kunne gå tabt på tværs af modeller, og svarene var langsomme og stive.
Kaskadebaseret stemmesystem
Langsomme og opstyltede svar, lange pauser
Stemmemodeller baseret på pr. forespørgselsrunde
Stemmemodeller baseret på pr. forespørgselsrunde som ChatGPT avanceret stemmetilstand behandlede og genererede lyd i en enkelt model, hvilket reducerede latenstiden og gjorde samtaler mere flydende – men de fungerede stadig gennem adskilte forespørgselsrunder. Modellen skulle vente på, at brugeren holdt op med at tale, før den svarede, hvilket gav en stiv dialog frem og tilbage. Derudover kunne selv en kort pause eller baggrundsstøj blive forvekslet med afslutningen på en forespørgselsrunde, fordi registrering af en forespørgsel er baseret på stilhed – og får modellen til at afbryde på unaturlige tidspunkter.
Tur-baseret stemmemodel
Lidt hurtigere og mere flydende svar, men interaktionen med modellen føles stadig lidt stiv
Vores nye tilgang
GPT‑Live håndterer disse begrænsninger gennem to arkitekturændringer.
Kontinuerlig interaktion
For det første byggede vi GPT‑Live til kontinuerlig interaktion med en full-duplex-arkitektur. I stedet for at behandle en række adskilte beskeder behandler GPT‑Live løbende input, mens den genererer output. Modellen kan derfor træffe interaktionsbeslutninger mange gange i sekundet: om den skal tale, fortsætte med at lytte, holde pause, afbryde eller kalde et værktøj.
Det gør det muligt for modellen at indgå i en mere naturlig dialog frem og tilbage, bevare en bedre tidsfornemmelse og endda udføre liveoversættelse.
Kontinuerlig interaktion
Hurtige, naturlige og udtryksfulde svar samt mere aktiv lytning
Delegering til dybere arbejde
For det andet adskilte vi GPT‑Live – som håndterer kontinuerlig interaktion – fra dybere arbejde. Når et spørgsmål kræver søgning, ræsonnering eller mere agentbaserede kapaciteter, kan GPT‑Live delegere opgaven til en anden model som GPT‑5.5. Det gør den i stand til at holde samtalen i gang, selv mens den håndterer flere opgaver i baggrunden.
Denne arkitekturændring gør det også muligt for GPT‑Live løbende at bruge de nyeste modeller og agenter og kombinere banebrydende intelligens med naturlig interaktion.
Delegering til dybere arbejde
GPT-Live leverer hurtige, naturlige svar, mens GPT-5.5 håndterer søgning i baggrunden
Evalueringer
Vi udviklede nye menneskelige evalueringer til at måle behagelighed og samtalens flow. I disse direkte sammenligninger foretrækkes GPT‑Live‑1 og GPT‑Live‑1 mini klart frem for avanceret stemmetilstand i matchede samtaler på 5-10 minutter, der måler samlet præference, forespørgselshandling, afbrydelser, samtaleflow og hvor naturlig hver interaktion føltes.
- GPQA: GPT‑Live‑1 klarer sig markant bedre end avanceret stemmetilstand på GPQA, som tester videnskabelig ræsonnering på ekspertniveau inden for biologi, kemi og fysik.
- BrowseComp: GPT‑Live‑1 viser store forbedringer i forhold til avanceret stemmetilstand på BrowseComp, som tester agentbaseret websøgning og evnen til at finde oplysninger, der er svære at lokalisere.
- τ³-Voice Telecom (intern variant)**: GPT‑Live‑1 overgår Avanceret stemmetilstand på τ³-Voice Telecom, som tester stemmeagenter i realistiske, fler-samtale telekomsupportopgaver.
* GPT‑Live‑1 (instant) og GPT‑Live‑1 mini bruger GPT‑5.5 Instant-modellen i baggrunden, mens GPT‑Live‑1 Mellem og GPT‑Live‑1 Høj bruger GPT‑5.5 Thinking-modellen med mellem og høj ræsonneringsindsats.
**Vi brugte en tilpasset brugermodel, drevet af vores nyeste ræsonneringsmodeller, til denne evaluering.
En ny ChatGPT stemme-oplevelse
Hver uge taler mere end 150 millioner mennesker med ChatGPT ved hjælp af funktioner som Stemme og Diktering. De bruger det til at få håndfri hjælp i hverdagen, øve sprog, fortælle godnathistorier eller bare chatte på vej til og fra arbejde.
Fra i dag får du en forbedret oplevelse drevet af GPT‑Live, når du trykker på Stemme-knappen for at tale med ChatGPT – med mere naturlige samtaler, smartere svar, bedre lytning og visuelle svar.
Mere naturlige samtaler
At tale med ChatGPT bør nu føles meget mere som en rigtig samtale. Du kan afbryde med et spørgsmål, holde pause for at samle tankerne eller bede ChatGPT om at tale langsommere. Den viser naturligt, at den følger med, med vendinger som “mm-hmm” eller “forstået”, så du ved, at den lytter. Vi har også genbearbejdet de ni forskellige stemmer i ChatGPT til GPT‑Live.
Smartere svar
ChatGPT stemme kan nu trække på vores nyeste banebrydende modeller, så du får smartere svar, når du har brug for dem. Du kan også vælge det niveau af ræsonnering, der passer til dine behov: Instant til hurtige svar eller Mellem og Høj, når du vil have ChatGPT til at bruge mere tid på at tænke.
Bedre lytteoplevelse
Hvis du bruger et øjeblik på at tænke, venter ChatGPT stemme nu i stedet for at springe ind og afbryde. Hvis du beder den om at være stille og lytte, gør den det. Og når der er baggrundsstøj, som forbipasserende trafik eller samtaler i nærheden, er ChatGPT bedre til at fokusere på din stemme i stedet for at blive distraheret.
Visuelle svar ved første blik
Nogle svar er mere nyttige, når du kan se dem. Mens du taler, kan ChatGPT nu vise detaljerede visuelle kort om emner som vejr, aktier, sport og mere. Stemme understøtter fortsat søgning, hukommelse, billeder og filuploads.



Resultatet er en ChatGPT stemme-oplevelse, der føles mere naturlig, mere kompetent og mere nyttig i hverdagen.
Sikkerhed designet til stemme
GPT‑Live er designet til at være sikker som standard. Den bygger videre på sikkerhedsfremskridtene fra vores nyeste modeller og tilføjer målrettet sikkerhedstræning på tværs af vigtige risikoområder samt nye beskyttelsesforanstaltninger, der er designet specifikt til stemme.
Udvidet sikkerhedstest
For bedre at afspejle, hvordan folk bruger stemme i virkelige situationer, begyndte vi med at udvide vores sikkerhedstest til at omfatte nye lydspecifikke evalueringer. Vi oprettede også syntetiske evalueringer, der bruger genereret lyd til at fokusere mere intensivt på vigtige sikkerhedsområder med afsæt i det, vi lærte fra avanceret stemmetilstand. Disse områder omfatter selvskade, psykose og mani, følelsesmæssig afhængighed af AI, vold og seksuelt indhold. Interne eksperter red-teamede også modellen for risici, der er særlige for stemme.
I vores test klarede GPT‑Live sig på niveau med eller bedre end avanceret stemmetilstand på næsten alle de områder, vi evaluerede. Du kan læse mere om vores test og beskyttelsesforanstaltninger i GPT‑Lives systemkort(åbner i et nyt vindue).
Indbyggede beskyttelsesforanstaltninger
Fordi stemmesamtaler foregår i realtid, har vi også indbygget beskyttelsesforanstaltninger, der kan reagere, mens modellen taler. Når systemet registrerer potentielt usikkert output, kan det lede modellen mod et mere sikkert svar, vise yderligere sikkerhedsbeskeder eller ressourcer eller afslutte stemmesamtalen i situationer med højere risiko. Til samtaler, der involverer selvskade, har vi tilpasset ChatGPTs supportforløb til stemme, herunder tilbud om ekspertgodkendt støtte fra krisehotlines.
Vi har designet yderligere beskyttelser til at støtte teenagebrugere og trænet alderssvarende adfærd direkte ind i modellen for at reducere risikoen for upassende svar. Forældre kan via forældrekontrol vælge, om deres teenager må bruge ChatGPT stemme, og tilknyttede forældre kan blive underrettet i situationer med højere risiko, hvor der er tegn på mulig selvskade eller selvmordshensigt.
Læring fra brug i den virkelige verden
Vi udruller også længerevarende målinger og overvågning efter lancering med fokus på følelsesmæssig afhængighed for fortsat at forbedre vores forståelse og finjustere beskyttelsesforanstaltningerne. Med afsæt i vores tidligere forskning i affektiv brug og følelsesmæssigt velbefindende vil dette hjælpe os med at identificere nye mønstre og forbedre, hvordan systemet reagerer i følelsesmæssigt følsomme interaktioner.
Endelig er GPT‑Live designet til samtale, ikke stemmeefterligning. Den bruger et sæt foruddefinerede stemmer i ChatGPT med beskyttelsesforanstaltninger, der forhindrer den i at efterligne en virkelig persons stemme.
Vi er engagerede i at understøtte sikkerhed og trivsel og vil fortsætte med at styrke disse beskyttelser, efterhånden som vi lærer af brug i den virkelige verden.
Tilgængelighed & begrænsninger
GPT‑Live udrulles nu til ChatGPT‑brugere globalt på iOS, Android og ChatGPT.com(åbner i et nyt vindue). GPT‑Live‑1 bliver standardmodellen, der driver ChatGPT stemme for Go-, Plus- og Pro-brugere, og GPT‑Live‑1 mini bliver standard for Free-brugere. Flere oplysninger om tilgængelighed findes i vores Hjælp(åbner i et nyt vindue).
Vi har optimeret GPT‑Live til nogle af de mest populære sprog i ChatGPT. På visse sprog kan modellen have en ikke-indfødt accent eller mangler i flydende sprogbrug. Vi arbejder aktivt på at forbedre oplevelsen på tværs af sprog.
Ved lanceringen understøtter GPT‑Live ikke stemme med video eller skærmdeling i ChatGPT, men vi arbejder på snart at introducere disse funktioner. Du kan stadig få adgang til ældre versioner af ChatGPT stemme, herunder Standard og Avanceret stemmetilstand, hvor disse funktioner er tilgængelige.


