OpenAI

8. juli 2026

ProduktUtgivelse

Vi introduserer GPT‑Live

En ny generasjon talemodeller for naturlig samhandling mellom mennesker og KI, som nå driver ChatGPT Voice.

Laster inn …

Oppdatering 31. juli 2026: Støttede lydfiler som er generert med GPT‑Live via ChatGPT Voice og OpenAI-API-et, inkluderer nå SynthID-vannmerking. Det offentlige verifiseringsverktøyet vårt kan nå oppdage OpenAI-opprinnelsestegn i støttede lydfiler, og vi har introdusert API-tilgang for verifisering, slik at utviklere og organisasjoner kan integrere opprinnelseskontroller i sine egne arbeidsflyter. Disse oppdateringene bygger på sikkerhetstilnærmingen som beskrives nedenfor, og det bredere arbeidet vårt med å gjøre OpenAI-generert innhold enklere å identifisere.

Vi lanserer GPT‑Live, en ny generasjon talemodeller som gjør det å snakke med KI mye mer som en ekte samtale.

GPT‑Live er bygget på en full-duplex-arkitektur, som betyr at den kan lytte og snakke samtidig. Under samtaler kan GPT‑Live vise at den følger med ved å bruke uttrykk som «mm» eller «ja», delta i rask replikkveksling eller bare være stille når du trenger et øyeblikk til å tenke. Resultatet er en taleopplevelse det er forfriskende lett å ha en samtale med.

GPT‑Live er også vår smarteste talemodell hittil. For spørsmål som krever nettsøk, dypere resonnering eller mer komplekst arbeid, delegerer den til vår nyeste banebrytende modell i bakgrunnen og henter resultatet tilbake inn i samtalen når det er klart. Mens den jobber, kan GPT‑Live fortsette å snakke med deg og holde samtalen flytende. Ved lansering bruker GPT‑Live GPT‑5.5 i bakgrunnen. Etter hvert som vi lanserer nye banebrytende modeller, oppdaterer vi fortløpende modellen GPT‑Live bruker.

Disse fremskrittene driver en ny ChatGPT Voice-opplevelse som er mer intelligent og naturlig å bruke. Over tid tror vi at denne forskningen også vil åpne for å bruke tale til arbeid som blir stadig mer komplekst, varer lenger og er mer agentbasert.

Vi begynner i dag utrullingen av to versjoner av GPT‑Live – GPT‑Live‑1 og GPT‑Live‑1 mini – til ChatGPT‑brukere over hele verden. Vi planlegger også å gjøre dem tilgjengelige i API-et snart, og utviklere og bedrifter kan registrere seg for varsling ved å bruke dette skjemaet.

Inn i en ny æra for samhandling mellom mennesker og KI

Vår visjon er å muliggjøre virkelig naturlig samhandling mellom mennesker og KI: en verden der samarbeid med KI føles like flytende og responsivt som å jobbe med et annet menneske, samtidig som resonnering og utføring av komplekse oppgaver skjer sømløst i bakgrunnen.

Tidligere tilnærminger

Eldre generasjoner av tale-KI-systemer brakte oss nærmere den visjonen, men med viktige kompromisser.

Kaskaderte talesystemer

Kaskaderte talesystemer er avhengige av en serie modeller som arbeider etter hverandre for å behandle hver samtaletur. Den opprinnelige ChatGPT Voice koblet tre modeller sammen: en tale-til-tekst-modell for å transkribere talen din, en stor språkmodell for å lage et svar og en tekst-til-tale-modell for å gjøre det om til tale igjen. Denne tilnærmingen gjorde at vi for første gang kunne snakke med banebrytende KI-modeller, men kompleksiteten hadde en kostnad: Informasjon kunne gå tapt mellom modeller, og svarene var trege og stive.

Kaskadesystem for tale

Treg og stiv respons, lange pauser

Transkripsjon
Eksempel på en samtale i standard talemodus, med OpenAI GPT-5.5 Instant

Turbaserte talemodeller

Turbaserte talemodeller som ChatGPT avansert talemodus behandlet og genererte lyd i én og samme modell, noe som reduserte forsinkelsen og gjorde samtalene smidigere – men de fungerte fortsatt gjennom adskilte turer. Modellen måtte vente til brukeren sluttet å snakke før den svarte, noe som ga en stiv frem-og-tilbake-flyt. I tillegg kunne registrering av samtaletur basert på stillhet føre til at selv en kort pause eller bakgrunnsstøy ble tolket som slutten på turen – slik at modellen avbrøt på unaturlige tidspunkter.

Turbasert talemodell

Litt raskere og smidigere respons, men dialogen med modellen føles fortsatt stiv

Transkripsjon
Eksempel på en samtale med ChatGPT i avansert talemodus

Vår nye tilnærming

GPT‑Live løser disse begrensningene gjennom to arkitekturendringer.

Kontinuerlig samhandling

For det første bygget vi GPT‑Live for kontinuerlig samhandling med en full-duplex-arkitektur. I stedet for å behandle en sekvens av separate meldinger behandler GPT‑Live inndata kontinuerlig mens den genererer utdata. Modellen kan derfor ta beslutninger om samhandlingen mange ganger i sekundet: om den skal snakke, fortsette å lytte, ta en pause, avbryte eller kalle et verktøy.

Dette gjør at modellen kan delta i mer naturlig replikkveksling, ha en bedre tidsfølelse og til og med utføre sanntidsoversettelse.

Kontinuerlig samhandling

Raske, naturlige og uttrykksfulle reaksjoner, samt mer aktiv lytting

Transkripsjon
Eksempel på en samtale med GPT-Live-1, med OpenAI GPT-5.5 Instant

Delegering for dypere arbeid

For det andre skilte vi GPT‑Live – som håndterer kontinuerlig samhandling – fra dypere arbeid. Når et spørsmål krever søk, resonnering eller mer agentbaserte evner, kan GPT‑Live delegere oppgaven til en annen modell, for eksempel GPT‑5.5. Dette gjør at den kan holde samtalen i gang, selv mens den håndterer flere oppgaver i bakgrunnen.

Denne arkitekturendringen gjør også at GPT‑Live fortløpende kan bruke de nyeste modellene og agentene, og kombinere banebrytende intelligens med naturlig samhandling.

Delegering for dypere arbeid

GPT-Live gir raske og naturlige svar, mens OpenAI GPT-5.5 håndterer søk i bakgrunnen

Transkripsjon
Eksempel på en samtale med GPT-Live-1, med OpenAI GPT-5.5 Instant

Evalueringer

Vi bygget nye evalueringer med mennesker for å måle hvor behagelig samtalene oppleves, og hvordan de flyter. I disse direkte sammenligningene foretrekkes GPT‑Live‑1 og GPT‑Live‑1 mini klart fremfor avansert talemodus i matchede samtaler på 5–10 minutter som måler samlet preferanse, turtaking, avbrudd, samtaleflyt og hvor naturlig hver interaksjon føltes.

  • GPQA: GPT‑Live‑1 gjør det betydelig bedre enn avansert talemodus på GPQA, som tester vitenskapelig resonnering på ekspertnivå innen biologi, kjemi og fysikk.
  • BrowseComp: GPT‑Live‑1 viser store forbedringer sammenlignet med avansert talemodus på BrowseComp, som tester agentbasert nettsøk og evnen til å finne informasjon som er vanskelig å lokalisere.
  • τ³-Voice Telecom (intern variant)**: GPT‑Live‑1 presterer bedre enn avansert talemodus på τ³-Voice Telecom, som tester taleagenter i realistiske, flertrinns telekomstøtteoppgaver.

* GPT‑Live‑1 (rask) og GPT‑Live‑1 mini bruker GPT‑5.5 Rask-modellen i bakgrunnen, mens GPT‑Live‑1 Middels og GPT‑Live‑1 Høy bruker GPT‑5.5 Thinking-modellen med middels og høy resonneringsinnsats.

** I denne evalueringen brukte vi en tilpasset brukermodell basert på våre nyeste resonnementmodeller.

En ny ChatGPT Voice-opplevelse

Hver uke snakker mer enn 150 millioner mennesker med ChatGPT ved hjelp av funksjoner som Voice og Diktering. De bruker det til å få hverdagslig hjelp uten å bruke hendene, øve på språk, fortelle godnatthistorier eller bare prate på vei til jobb.

Fra og med i dag får du en forbedret opplevelse drevet av GPT‑Live når du trykker på Voice-knappen for å snakke med ChatGPT – med mer naturlige samtaler, smartere svar, bedre lytting og visuelle svar.

Mer naturlige samtaler

Å snakke med ChatGPT skal nå føles mye mer som en ekte samtale. Du kan avbryte med et spørsmål, ta en pause for å samle tankene eller be ChatGPT om å snakke saktere. Den bekrefter naturlig det du sier med uttrykk som «mhmm» eller «skjønner», slik at du vet at den følger med. Vi har også remastret de ni ulike stemmene i ChatGPT for GPT‑Live.

Smartere svar

ChatGPT Voice kan nå bruke de nyeste banebrytende modellene våre, slik at du får smartere svar når du trenger dem. Du kan også velge nivået av resonnering som passer behovene dine: Instant for raske svar, eller Medium og High når du vil at ChatGPT skal bruke mer tid på å tenke.

Bedre lytting

Hvis du trenger et øyeblikk til å tenke, venter ChatGPT Voice nå i stedet for å hoppe inn og avbryte. Hvis du ber den være stille og lytte, gjør den det. Og når det er bakgrunnsstøy, som forbipasserende trafikk eller samtaler i nærheten, er ChatGPT blitt bedre til å fokusere på stemmen din i stedet for å bli distrahert.

Visuelle svar med et blikk

Noen svar er mer nyttige når du kan se dem. Mens du snakker, kan ChatGPT nå vise rike visuelle kort for emner som vær, aksjer, sport og mer. Voice fortsetter også å støtte søk, minne, bilder og filopplastinger.

Resultatet er en ChatGPT Voice-opplevelse som føles mer naturlig, mer kapabel og mer nyttig i hverdagen.

Sikkerhet utviklet for tale

GPT‑Live er laget for å være trygg som standard. Den bygger på sikkerhetsfremskrittene fra de nyeste modellene våre, samtidig som den legger til dedikert sikkerhetstrening på viktige risikoområder og nye sikkerhetstiltak utviklet spesielt for tale.

Utvidet sikkerhetstesting

For bedre å gjenspeile hvordan folk bruker tale i virkelige situasjoner, startet vi med å utvide sikkerhetstestingen vår til å omfatte nye lydspesifikke evalueringer. Vi laget også syntetiske evalueringer som bruker generert lyd til å fokusere mer intensivt på viktige sikkerhetsområder, basert på det vi lærte fra avansert talemodus. Disse områdene omfatter selvskading, psykose og mani, emosjonell avhengighet av KI, vold og seksuelt innhold. Interne eksperter red-teamet også modellen for risikoer som er unike for tale.

I testingen vår presterte GPT‑Live på nivå med eller bedre enn avansert talemodus på nesten alle områdene vi evaluerte. Du kan lese mer om testingen og sikkerhetstiltakene våre i GPT‑Live sitt systemkort(åpnes i et nytt vindu).

Innebygde sikkerhetstiltak

Fordi talesamtaler skjer i sanntid, har vi også bygget inn sikkerhetstiltak som kan handle mens modellen snakker. Når systemet oppdager potensielt utrygge svar, kan det styre modellen mot et tryggere svar, vise ekstra sikkerhetsmeldinger eller ressurser, eller avslutte talesamtalen i tilfeller med høyere risiko. For samtaler som involverer selvskading, tilpasset vi ChatGPTs støtteflyter for tale, blant annet ved å tilby krisehjelp godkjent av eksperter.

Vi utformet ekstra beskyttelser for å støtte tenåringsbrukere, og trente aldersriktig atferd direkte inn i modellen for å redusere risikoen for upassende svar. Foreldre kan velge om tenåringen deres kan bruke ChatGPT Voice gjennom foreldrekontroll, og tilknyttede foreldre kan bli varslet i situasjoner med høyere risiko som involverer tegn på mulig selvskading eller selvmordstanker.

Læring fra bruk i den virkelige verden

Vi ruller også ut mer langsiktig måling og overvåking etter lansering med fokus på emosjonell avhengighet, slik at vi kan fortsette å forbedre forståelsen vår og finjustere sikkerhetstiltakene. Ved å bygge videre på vår tidligere forskning på affektiv bruk og emosjonelt velvære vil dette hjelpe oss med å identifisere nye mønstre og forbedre hvordan systemet svarer i emosjonelt sensitive samhandlinger.

Til slutt er GPT‑Live laget for samtale, ikke stemmeimitasjon. Den bruker et sett forhåndsdefinerte stemmer i ChatGPT, med sikkerhetstiltak som hindrer den i å imitere stemmen til en ekte person.

Vi er opptatt av å støtte sikkerhet og velvære, og vil fortsette å styrke disse beskyttelsene etter hvert som vi lærer av bruk i den virkelige verden.

Tilgjengelighet og begrensninger

GPT‑Live rulles nå ut til ChatGPT‑brukere globalt på iOS, Android og ChatGPT.com(åpnes i et nytt vindu). GPT‑Live‑1 blir standardmodellen som driver ChatGPT Voice for Go-, Plus- og Pro-brukere, og GPT‑Live‑1 mini blir standard for Free-brukere. Du finner mer informasjon om tilgjengelighet i hjelpesenteret(åpnes i et nytt vindu) vårt.

Vi har optimalisert GPT‑Live for noen av de mest populære språkene i ChatGPT. For enkelte språk kan modellen ha en ikke-morsmålsaksent eller mangler i flyten. Vi jobber aktivt med å forbedre opplevelsen på tvers av språk.

Ved lansering støtter ikke GPT‑Live tale med video eller skjermdeling i ChatGPT, men vi jobber med å innføre disse funksjonene snart. Du kan fortsatt bruke eldre versjoner av ChatGPT Voice, inkludert Standard og avansert talemodus, der disse funksjonene er tilgjengelige.

Forfatter

OpenAI