OpenAI

8. heinäkuuta 2026

TuoteTiedote

Esittelyssä GPT‑Live

Uuden sukupolven äänimallit luonnolliseen ihmisen ja tekoälyn vuorovaikutukseen, nyt ChatGPT Voicen taustalla.

Ladataan...

Päivitys 31.7.2026: GPT‑Livellä ChatGPT Voicen ja OpenAI API:n kautta luotu tuettu audio sisältää nyt SynthID-vesileimauksen. Julkinen todennustyökalumme voi nyt havaita OpenAI:n alkuperäsignaaleja tuetuissa audiotiedostoissa, ja olemme ottaneet käyttöön API-pääsyn todentamista varten, jotta kehittäjät ja organisaatiot voivat sisällyttää alkuperätarkistukset omiin työnkulkuihinsa. Nämä päivitykset perustuvat alla kuvattuun turvallisuuslähestymistapaan ja laajempaan työhömme, jonka tavoitteena on tehdä OpenAI:n luomasta sisällöstä helpommin tunnistettavaa.

Julkaisemme GPT‑Liven, uuden sukupolven äänimallit, joiden ansiosta tekoälyn kanssa puhuminen tuntuu paljon enemmän oikealta keskustelulta.

GPT‑Live perustuu full-duplex-arkkitehtuuriin, eli se voi kuunnella ja puhua samanaikaisesti. Keskustelujen aikana GPT‑Live voi osoittaa kuuntelevansa esimerkiksi ilmauksilla ”mm-hmm” tai ”joo”, osallistua nopeaan vuorotteluun tai vain pysyä hiljaa, kun tarvitset hetken ajatteluun. Tuloksena on äänikokemus, jonka kanssa keskusteleminen on virkistävän vaivatonta.

GPT‑Live on myös tähän mennessä älykkäin äänimallimme. Kun kysymys vaatii verkkohakua, syvempää päättelyä tai monimutkaisempaa työtä, se delegoi tehtävän taustalla uusimmalle edistyneelle mallillemme ja tuo tuloksen takaisin keskusteluun, kun se on valmis. Työskentelyn aikana GPT‑Live voi jatkaa keskustelua kanssasi ja pitää keskustelun sujuvana. Julkaisuhetkellä GPT‑Live käyttää taustalla GPT‑5.5:tä. Kun julkaisemme uusia edistyneitä malleja, päivitämme jatkuvasti GPT‑Liven käyttämää mallia.

Nämä edistysaskeleet mahdollistavat uuden ChatGPT Voice -kokemuksen, joka on älykkäämpi ja tuntuu luonnollisemmalta käyttää. Uskomme, että ajan myötä tämä tutkimus avaa myös mahdollisuuden käyttää ääntä yhä monimutkaisempaan, pitkäkestoisempaan ja agenttimaisempaan työhön.

Aloitamme tänään kahden GPT‑Live‑version – GPT‑Live‑1 ja GPT‑Live‑1 mini – käyttöönoton ChatGPT‑käyttäjille maailmanlaajuisesti. Aiomme tuoda ne pian myös APIin, ja kehittäjät ja yritykset voivat tilata ilmoituksen tällä lomakkeella.

Siirtyminen uuteen ihmisen ja tekoälyn vuorovaikutuksen aikakauteen

Tavoitteemme on mahdollistaa aidosti luonnollinen ihmisen ja tekoälyn vuorovaikutus: maailma, jossa yhteistyö tekoälyn kanssa tuntuu yhtä sujuvalta ja reagoivalta kuin työskentely toisen ihmisen kanssa, samalla kun päättely ja monimutkaisten tehtävien suorittaminen tapahtuvat saumattomasti taustalla.

Aiemmat lähestymistavat

Vanhemmat puhetekoälyjärjestelmien sukupolvet veivät meitä lähemmäs tätä visiota, mutta niihin liittyi merkittäviä kompromisseja.

Ketjutetut äänijärjestelmät

Ketjutetut äänijärjestelmät käsittelevät jokaisen vuoron peräkkäin toimivien mallien sarjan avulla. Alkuperäinen ChatGPT Voice ketjutti yhteen kolme mallia: puheesta tekstiksi -mallin, joka litteroi puheesi, suuren kielimallin, joka tuotti vastauksen, ja tekstistä puheeksi -mallin, joka muutti sen takaisin puheeksi. Tämä lähestymistapa mahdollisti ensimmäistä kertaa keskustelun edistyneiden tekoälymallien kanssa, mutta monimutkaisuudella oli hintansa: tietoa saattoi kadota mallien välillä, ja vastaukset olivat hitaita ja kankeita.

Ketjutettu äänijärjestelmä

Hitaat ja tönköt vastaukset, pitkät tauot

Transkriptio
Esimerkkikeskustelu vakioäänitilassa käyttäen mallia GPT-5.5 Nopea

Vuoropohjaiset äänimallit

Vuoropohjaiset äänimallit, kuten ChatGPT:n edistynyt äänitila, käsittelivät ja tuottivat ääntä yhdessä mallissa, mikä vähensi viivettä ja teki keskusteluista sujuvampia — mutta ne toimivat silti erillisten vuorojen varassa. Mallin oli odotettava, että käyttäjä lopettaa puhumisen, ennen kuin se pystyi vastaamaan, mikä johti jäykkään vuorotteluun. Lisäksi koska vuoron tunnistus perustuu hiljaisuuteen, jopa lyhyt tauko tai taustamelu saatettiin tulkita vuoron päättymiseksi — jolloin malli keskeytti epäluontevilla hetkillä.

Vuoropohjainen äänimalli

Vastaukset ovat hieman nopeampia ja sujuvampia, mutta vuorovaikutus mallin kanssa tuntuu edelleen jäykältä

Transkriptio
Esimerkkikeskustelu ChatGPT:n edistyneen äänitilan kanssa

Uusi lähestymistapamme

GPT‑Live ratkaisee nämä rajoitukset kahdella arkkitehtuurimuutoksella.

Jatkuva vuorovaikutus

Ensinnäkin rakensimme GPT‑Liven jatkuvaa vuorovaikutusta varten full-duplex-arkkitehtuurilla. Erillisten viestien sarjan käsittelyn sijaan GPT‑Live käsittelee syötettä jatkuvasti samalla kun se tuottaa ulostuloa. Siksi malli voi tehdä vuorovaikutuspäätöksiä monta kertaa sekunnissa: puhuako, jatkaako kuuntelemista, pitääkö tauko, keskeyttääkö vai kutsuako työkalua.

Tämän ansiosta malli voi käydä luonnollisempaa vuoropuhelua, säilyttää paremman ajantajun ja jopa tehdä reaaliaikaista tulkkausta.

Jatkuva vuorovaikutus

Nopeat, luonnolliset, ilmaisuvoimaiset vastaukset ja aktiivisempi kuuntelu

Transkriptio
Esimerkkikeskustelu GPT-Live-1:n kanssa käyttäen mallia GPT-5.5 Nopea

Delegointi syvempää työtä varten

Toiseksi erotimme jatkuvaa vuorovaikutusta hoitavan GPT‑Liven syvemmästä työstä. Kun kysymys vaatii hakua, päättelyä tai agenttimaisempia valmiuksia, GPT‑Live voi delegoida tehtävän toiselle mallille, kuten GPT‑5.5:lle. Näin se voi pitää keskustelun käynnissä, vaikka se hoitaisi useita tehtäviä taustalla.

Tämä arkkitehtuurimuutos mahdollistaa myös sen, että GPT‑Live voi jatkuvasti käyttää uusimpia malleja ja agentteja ja yhdistää edistyneen älykkyyden luonnolliseen vuorovaikutukseen.

Delegointi syvempää työtä varten

GPT-Live tarjoaa nopeita ja luonnollisia vastauksia, kun taas GPT-5.5 hoitaa haun taustalla

Transkriptio
Esimerkkikeskustelu GPT-Live-1:n kanssa käyttäen mallia GPT-5.5 Nopea

Arvioinnit

Rakensimme uusia ihmisarviointeja mittaamaan miellyttävyyttä ja keskustelun sujuvuutta. Näissä vastakkainvertailuissa GPT‑Live‑1:tä ja GPT‑Live‑1 miniä suositaan selvästi edistyneeseen äänitilaan verrattuna vastaavissa 5–10 minuutin keskusteluissa, joissa mitataan kokonaismieltymystä, vuorottelua, keskeytyksiä, keskustelun sujuvuutta ja sitä, kuinka luonnolliselta kukin vuorovaikutus tuntui.

  • GPQA: GPT‑Live‑1 päihittää edistyneen äänitilan selvästi GPQA:ssa, joka testaa asiantuntijatason tieteellistä päättelyä biologian, kemian ja fysiikan aloilla.
  • BrowseComp: GPT‑Live‑1 parantaa tuloksia selvästi edistyneeseen äänitilaan verrattuna BrowseCompissa, joka testaa agenttimaista verkkohakua ja kykyä löytää vaikeasti paikannettavaa tietoa.
  • τ³-Voice Telecom (sisäinen versio)**: GPT‑Live‑1 suoriutuu τ³-Voice Telecomissa paremmin kuin edistynyt äänitila, joka testaa ääniagentteja realistisissa, monivuoroisissa telealan tukitehtävissä.

* GPT‑Live‑1 (nopea) ja GPT‑Live‑1 mini käyttävät taustalla GPT‑5.5 Instant -mallia, kun taas GPT‑Live‑1 Medium ja GPT‑Live‑1 High käyttävät GPT‑5.5 Thinking -mallia keskitason ja korkean päättelypanostuksen kanssa.

** Tässä arvioinnissa käytimme mukautettua käyttäjämallia, jonka perustana olivat uusimmat päättelymallimme.

Uusi ChatGPT Voice -kokemus

Yli 150 miljoonaa ihmistä puhuu ChatGPT:lle joka viikko esimerkiksi Voice- ja Dictation-ominaisuuksilla. He käyttävät sitä arjen apuna ilman käsiä, kielten harjoitteluun, iltasatujen kertomiseen tai vain jutteluun työmatkalla.

Tästä päivästä alkaen saat paremman GPT‑Liven tarjoaman kokemuksen, kun napautat Voice-painiketta puhuaksesi ChatGPT:n kanssa: luonnollisempia keskusteluja, älykkäämpiä vastauksia, parempaa kuuntelua ja visuaalisia vastauksia.

Luonnollisemmat keskustelut

ChatGPT:n kanssa puhumisen pitäisi nyt tuntua paljon enemmän oikealta keskustelulta. Voit keskeyttää kysymyksellä, pysähtyä kokoamaan ajatuksiasi tai pyytää ChatGPT:tä hidastamaan tahtia. Se kuittaa sanomasi luontevasti ilmauksilla kuten ”mhmm” tai ”selvä”, jotta tiedät sen seuraavan mukana. Olemme myös masteroineet ChatGPT:n yhdeksän erilaista ääntä uudelleen GPT‑Liveä varten.

Älykkäämmät vastaukset

ChatGPT Voice voi nyt hyödyntää uusimpia edistyneitä mallejamme ja antaa älykkäämpiä vastauksia silloin, kun tarvitset niitä. Voit myös valita tarpeisiisi sopivan päättelyn tason: Nopea nopeisiin vastauksiin tai Keskitaso ja Korkea, kun haluat ChatGPT:n käyttävän enemmän aikaa ajatteluun.

Parempi kuuntelu

Jos pysähdyt hetkeksi miettimään, ChatGPT Voice odottaa eikä kiirehdi väliin keskeyttämään. Jos pyydät sitä olemaan hiljaa ja kuuntelemaan, se tekee niin. Ja kun taustalla on melua, kuten ohiajavaa liikennettä tai lähistöllä käytäviä keskusteluja, ChatGPT osaa keskittyä paremmin sinun ääneesi häiriintymättä.

Visuaaliset vastaukset yhdellä silmäyksellä

Jotkin vastaukset ovat hyödyllisempiä, kun ne näkee. Keskustelun aikana ChatGPT voi nyt näyttää monipuolisia visuaalisia kortteja aiheista kuten säästä, osakkeista, urheilusta ja muusta. Voice tukee edelleen myös hakua, muistia, kuvia ja tiedostojen lataamista.

Tuloksena on ChatGPT Voice -kokemus, joka tuntuu luonnollisemmalta, kykenevämmältä ja hyödyllisemmältä arjessa.

Äänelle suunniteltu turvallisuus

GPT‑Live suunniteltiin oletusarvoisesti turvalliseksi. Se perustuu uusimpien malliemme turvallisuuskehitykseen ja lisää siihen erillistä turvallisuuskoulutusta keskeisillä riskialueilla sekä uusia erityisesti ääntä varten suunniteltuja suojatoimia.

Laajennettu turvallisuustestaus

Jotta testaus vastaisi paremmin sitä, miten ihmiset käyttävät ääntä todellisissa tilanteissa, laajensimme turvallisuustestaustamme uusilla natiivisti ääneen perustuvilla arvioinneilla. Loimme myös synteettisiä arviointeja, joissa tuotetun äänen avulla keskitytään intensiivisemmin keskeisiin turvallisuusalueisiin hyödyntäen Edistyneestä äänitilasta opittua. Näihin alueisiin kuuluvat itsensä vahingoittaminen, psykoosi ja mania, emotionaalinen tukeutuminen tekoälyyn, väkivalta ja seksuaalinen sisältö. Sisäiset asiantuntijat myös red team -testasivat mallia äänelle ominaisia riskejä varten.

Testeissämme GPT‑Live suoriutui lähes kaikilla arvioimillamme alueilla yhtä hyvin kuin Edistynyt äänitila tai sitä paremmin. Voit lukea lisää testauksestamme ja suojatoimistamme GPT‑Liven järjestelmäkortista(avautuu uudessa ikkunassa).

Integroidut suojatoimet

Koska äänikeskustelut tapahtuvat reaaliajassa, rakensimme myös suojatoimia, jotka voivat toimia mallin puhuessa. Kun järjestelmä havaitsee mahdollisesti turvattoman tuotoksen, se voi ohjata mallia turvallisempaan vastaukseen, näyttää lisää turvallisuusviestejä tai resursseja tai suuremman riskin tapauksissa päättää äänikeskustelun. Itsensä vahingoittamista käsitteleviä keskusteluja varten sovitimme ChatGPT:n tukipolut ääneen, mukaan lukien asiantuntijoiden arvioiman kriisipuhelintuen tarjoamisen.

Suunnittelimme lisäsuojauksia teini-ikäisten käyttäjien tueksi ja koulutimme ikätasolle sopivaa käyttäytymistä suoraan malliin, jotta sopimattomien vastausten riski pienenisi. Vanhemmat voivat käytönvalvonnan kautta valita, voiko heidän teini-ikäisensä käyttää ChatGPT Voicea, ja linkitetyt vanhemmat voivat saada ilmoituksen suuremman riskin tilanteissa, joissa näkyy merkkejä mahdollisesta itsensä vahingoittamisesta tai itsetuhoisista aikeista.

Oppiminen todellisesta käytöstä

Otamme myös käyttöön pidemmän aikavälin mittausta ja julkaisun jälkeistä seurantaa, jotka keskittyvät emotionaaliseen tukeutumiseen, jotta voimme edelleen parantaa ymmärrystämme ja hienosäätää suojatoimia. Aiempi affektiivista käyttöä ja emotionaalista hyvinvointia koskeva tutkimuksemme auttaa meitä tunnistamaan nousevia malleja ja parantamaan sitä, miten järjestelmä reagoi tunnetasolla herkissä vuorovaikutuksissa.

Lopuksi GPT‑Live on suunniteltu keskusteluun, ei äänen imitointiin. Se käyttää ChatGPT:ssä ennalta määritettyjä ääniä, ja suojatoimet estävät sitä jäljittelemästä todellisen henkilön ääntä.

Olemme sitoutuneet tukemaan turvallisuutta ja hyvinvointia ja vahvistamme näitä suojauksia edelleen, kun opimme todellisesta käytöstä.

Saatavuus ja rajoitukset

GPT‑Liveä julkaistaan nyt ChatGPT‑käyttäjille maailmanlaajuisesti iOS:ssä, Androidissa ja ChatGPT.comissa(avautuu uudessa ikkunassa). GPT‑Live‑1:stä tulee oletusmalli, joka pyörittää ChatGPT Voicea Go-, Plus- ja Pro-käyttäjillä, ja GPT‑Live‑1 ministä tulee oletus Free-käyttäjille. Lisätietoja saatavuudesta on ohjekeskuksessamme(avautuu uudessa ikkunassa).

Olemme optimoineet GPT‑Liven joillekin ChatGPT:n suosituimmista kielistä. Joissakin kielissä mallilla voi olla ei-natiivin puhujan aksentti tai puutteita sujuvuudessa. Työskentelemme aktiivisesti käyttökokemuksen parantamiseksi eri kielillä.

Julkaisun yhteydessä GPT‑Live ei tue ääntä videon tai näytön jakamisen kanssa ChatGPT:ssä, mutta pyrimme tuomaan nämä ominaisuudet käyttöön pian. Voit edelleen käyttää ChatGPT Voicen vanhoja versioita, kuten Standard-tilaa ja Edistynyttä äänitilaa, silloin kun nämä ominaisuudet ovat saatavilla.

Tekijä

OpenAI