OpenAI

8. juuli 2026

ToodeVäljalase

Tutvustame GPT‑Live’i

Uue põlvkonna häälmudelid loomulikuks inimese ja tehisintellekti suhtluseks, mis käitavad nüüd ChatGPT Voice’i.

Laadimine…

Toome turule GPT‑Live’i, uue põlvkonna häälmudelid, mis muudavad tehisintellektiga rääkimise palju rohkem päris vestluse sarnaseks.

GPT‑Live põhineb täisdupleksarhitektuuril, mis tähendab, et see saab kuulata ja rääkida samal ajal. Vestluse ajal saab GPT‑Live näidata tähelepanu selliste fraasidega nagu „mhm“ või „jah“, osaleda kiires edasi-tagasi suhtluses või lihtsalt vaikida, kui vajad mõtlemiseks hetke. Tulemuseks on häälkogemus, millega on üllatavalt lihtne rääkida.

GPT‑Live on ka meie seni nutikaim häälmudel. Küsimuste puhul, mis nõuavad veebiotsingut, sügavamat arutlust või keerukamat tööd, delegeerib see ülesande taustal meie uusimale tipptasemel mudelile ja toob tulemuse vestlusesse tagasi, kui see on valmis. Töötamise ajal saab GPT‑Live sinuga edasi rääkida ja vestluse kulgu hoida. Turuletoomisel kasutab GPT‑Live taustal GPT‑5.5 mudelit. Kui avaldame uusi tipptasemel mudeleid, uuendame pidevalt mudelit, mida GPT‑Live kasutab.

Need edusammud loovad uue ChatGPT Voice’i kogemuse, mida on nutikam ja loomulikum kasutada. Usume, et aja jooksul avab see uurimistöö ka võimaluse kasutada häält üha keerukamate, pikema kestusega ja agentlikumate töövoogude jaoks.

Alustame täna kahe GPT‑Live’i versiooni – GPT‑Live‑1 ja GPT‑Live‑1 mini – ülemaailmset kasutuselevõttu ChatGPT kasutajate jaoks. Plaanime need peagi tuua ka API-sse ning arendajad ja ettevõtted saavad teavituste saamiseks registreeruda selle vormi kaudu.

Inimese ja tehisintellekti suhtluse uus ajastu

Meie visioon on teha võimalikuks tõeliselt loomulik inimese ja tehisintellekti suhtlus: maailm, kus koostöö tehisintellektiga tundub sama sujuv ja reageeriv kui töötamine teise inimesega, samal ajal kui arutlus ja keerukate ülesannete täitmine toimuvad taustal märkamatult.

Varasemad lähenemisviisid

Hääl-AI süsteemide vanemad põlvkonnad viisid meid sellele visioonile lähemale, kuid tõid kaasa olulisi kompromisse.

Kaskaadsed häälesüsteemid

Kaskaadsed häälesüsteemid toetuvad mudelite jadale, mis töötlevad iga vooru üksteise järel. Algne ChatGPT Voice sidus kokku kolm mudelit: kõnest tekstiks mudeli sinu kõne transkribeerimiseks, suure keelemudeli vastuse loomiseks ja tekstist kõneks mudeli, mis muutis selle taas kõneks. See lähenemine võimaldas meil esimest korda tipptasemel tehisintellekti mudelitega rääkida, kuid keerukusel oli hind: mudelite vahel võis teave kaduma minna ning vastused olid aeglased ja kohmakad.

Kaskaadne häälesüsteem

Aeglased ja kohmakad vastused, pikad pausid

Transkriptsioon
Näidisvestlus standardhääle režiimis, kasutades GPT-5.5 Kiire mudelit

Voorupõhised häälmudelid

Voorupõhised häälmudelid nagu ChatGPT täiustatud häälrežiim töötlesid ja genereerisid heli ühes mudelis, vähendades viiteaega ja muutes vestlused sujuvamaks — kuid need toimisid endiselt eraldi voorudena. Mudel pidi enne vastamist ootama, kuni kasutaja rääkimise lõpetab, mistõttu edasi-tagasi suhtlus jäi jäigaks. Lisaks, kuna vooru tuvastamine põhineb vaikusel, võis isegi lühikest pausi või taustamüra ekslikult pidada vooru lõpuks — mistõttu mudel katkestas vestluse ebaloomulikel hetkedel.

Voorupõhine häälmudel

Veidi kiiremad ja sujuvamad vastused, kuid mudeliga edasi-tagasi suhtlemine tundub endiselt jäik

Transkriptsioon
Näidisvestlus ChatGPT täiustatud häälrežiimiga

Meie uus lähenemine

GPT‑Live kõrvaldab need piirangud kahe arhitektuurilise muudatusega.

Pidev suhtlus

Esiteks ehitasime GPT‑Live’i pidevaks suhtluseks, kasutades täisdupleksarhitektuuri. Eraldi sõnumite jada töötlemise asemel töötleb GPT‑Live sisendit pidevalt samal ajal, kui see väljundit genereerib. Seetõttu saab mudel mitu korda sekundis otsustada, kuidas suhelda: kas rääkida, edasi kuulata, teha paus, katkestada või tööriist käivitada.

See võimaldab mudelil osaleda loomulikumas edasi-tagasi suhtluses, hoida paremat ajataju ja isegi teha reaalajas tõlget.

Pidev suhtlus

Kiired, loomulikud ja ilmekad vastused ning aktiivsem kuulamine

Transkriptsioon
Näidisvestlus GPT-Live-1-ga, kasutades GPT-5.5 Kiire mudelit

Delegeerimine süvitsi tööks

Teiseks eraldasime GPT‑Live’i — mis tegeleb pideva suhtlusega — sügavamast tööst. Kui küsimus nõuab otsingut, arutlust või agentlikumaid võimekusi, saab GPT‑Live delegeerida ülesande teisele mudelile, näiteks GPT‑5.5‑le. See võimaldab sellel vestlust jätkata ka siis, kui taustal täidetakse mitut ülesannet.

See arhitektuuriline muudatus võimaldab GPT‑Live’il pidevalt kasutada ka uusimaid mudeleid ja agente, ühendades tipptasemel nutikuse loomuliku suhtlusega.

Delegeerimine süvitsi tööks

GPT-Live annab kiireid ja loomulikke vastuseid, samal ajal kui GPT-5.5 tegeleb taustal otsinguga

Transkriptsioon
Näidisvestlus GPT-Live-1-ga, kasutades GPT-5.5 Kiire mudelit

Hindamised

Töötasime välja uued inimhindamised, et mõõta meeldivust ja vestluse sujuvust. Nendes otsestes võrdlustes eelistatakse GPT‑Live‑1 ja GPT‑Live‑1 mini mudeleid selgelt täiustatud häälrežiimile sobitatud 5–10-minutilistes vestlustes, kus mõõdetakse üldist eelistust, vooruvahetust, katkestusi, vestluse sujuvust ja seda, kui loomulik iga suhtlus tundus.

  • GPQA: GPT‑Live‑1 edestab GPQA-s märkimisväärselt täiustatud häälrežiimi; GPQA testib eksperditasemel teaduslikku arutlust bioloogias, keemias ja füüsikas.
  • BrowseComp: GPT‑Live‑1 näitab BrowseCompis tugevat edasiminekut võrreldes täiustatud häälrežiimiga; BrowseComp testib agentlikku veebiotsingut ja võimet leida raskesti leitavat teavet.
  • τ³-Voice Telecom (sisemine variant)**: GPT‑Live‑1 edestab τ³-Voice Telecomis täiustatud häälrežiimi; see testib häälagente realistlikes, mitmevoorulistes telekomitoe ülesannetes.

* GPT‑Live‑1 (Kiire) ja GPT‑Live‑1 mini kasutavad taustal GPT‑5.5 Kiire mudelit, samas kui GPT‑Live‑1 Keskmine ja GPT‑Live‑1 Kõrge kasutavad GPT‑5.5 Thinking mudelit vastavalt keskmise ja kõrge arutluspingutusega.

** Selleks hindamiseks kasutasime kohandatud kasutajamudelit, mida käitavad meie uusimad arutlusmudelid.

Uus ChatGPT Voice’i kogemus

Igal nädalal räägib ChatGPT‑ga enam kui 150 miljonit inimest, kasutades selliseid funktsioone nagu Voice ja Dictation. Nad kasutavad seda igapäevaseks käed-vabad abiks, keelte harjutamiseks, unejuttude rääkimiseks või lihtsalt töölesõidu ajal vestlemiseks.

Alates tänasest saad ChatGPT‑ga rääkimiseks Voice’i nuppu puudutades täiustatud kogemuse, mille taga on GPT‑Live: loomulikumad vestlused, nutikamad vastused, parem kuulamine ja visuaalsed vastused.

Loomulikumad vestlused

ChatGPT‑ga rääkimine peaks nüüd tunduma palju rohkem päris vestlusena. Saad küsimusega vahele segada, mõtete kogumiseks pausi teha või paluda ChatGPT‑l aeglasemalt rääkida. See annab loomulikult märku, et kuulab, kasutades väljendeid nagu „mhmm“ või „sain aru“, nii et tead, et ta on jutuga kaasas. Oleme GPT‑Live’i jaoks uuesti viimistlenud ka ChatGPT üheksa eristuvat häält.

Nutikamad vastused

ChatGPT Voice saab nüüd kasutada meie uusimaid tipptasemel mudeleid, pakkudes sulle vajaduse korral nutikamaid vastuseid. Saad valida ka oma vajadustele sobiva arutluse taseme: Instant kiirete vastuste jaoks või Medium ja High siis, kui soovid, et ChatGPT mõtleks kauem.

Parem kuulamine

Kui vajad hetke mõtlemiseks, siis ChatGPT Voice ootab nüüd, selle asemel et vahele hüpata ja katkestada. Kui palud tal vaikida ja kuulata, teeb ta seda. Ja kui taustal on müra, näiteks mööduv liiklus või läheduses toimuvad vestlused, suudab ChatGPT paremini keskenduda sinu häälele ega lase end nii kergesti segada.

Visuaalsed vastused ühe pilguga

Mõned vastused on kasulikumad siis, kui saad neid näha. Rääkimise ajal saab ChatGPT nüüd kuvada rikkalikke visuaalseid kaarte ilma, aktsiate, spordi ja muude teemade kohta. Voice toetab jätkuvalt ka otsingut, mälu, pilte ja failide üleslaadimist.

Tulemuseks on ChatGPT Voice’i kogemus, mis tundub igapäevaelus loomulikum, võimekam ja kasulikum.

Hääle jaoks loodud ohutus

GPT‑Live loodi vaikimisi ohutuks. See põhineb meie uusimate mudelite ohutusalastel edusammudel ning lisab spetsiaalse ohutuskoolituse peamistes riskivaldkondades ja uued kaitsemeetmed, mis on loodud just hääle jaoks.

Laiendatud ohutustestimine

Et paremini kajastada seda, kuidas inimesed päriselus häält kasutavad, alustasime ohutustestimise laiendamisest uute, helile omaste hindamistega. Lõime ka sünteetilised hindamised, mis kasutavad genereeritud heli, et keskenduda põhjalikumalt peamistele ohutusvaldkondadele, tuginedes täiustatud häälrežiimist õpitule. Nende valdkondade hulka kuuluvad enesevigastamine, psühhoos ja maania, emotsionaalne sõltuvus tehisintellektist, vägivald ja seksuaalne sisu. Siseeksperdid tegid mudelile ka lööktestimist häälele ainuomaste riskide suhtes.

Meie testides toimis GPT‑Live peaaegu kõigis hinnatud valdkondades sama hästi või paremini kui täiustatud häälrežiim. Meie testimise ja kaitsemeetmete kohta saad lähemalt lugeda GPT‑Live’i süsteemikaardilt(avaneb uues aknas).

Sisseehitatud kaitsemeetmed

Kuna häälvestlused toimuvad reaalajas, lõime ka kaitsemeetmed, mis saavad tegutseda ajal, mil mudel räägib. Kui süsteem tuvastab potentsiaalselt ohtliku väljundi, saab see suunata mudeli ohutuma vastuse poole, kuvada täiendavaid ohutussõnumeid või -ressursse või suurema riskiga juhtudel häälvestluse lõpetada. Enesevigastamisega seotud vestluste jaoks kohandasime ChatGPT tugivooge hääle jaoks, sealhulgas pakkudes ekspertide kontrollitud kriisiabiliinide tuge.

Töötasime teismeliste kasutajate toetamiseks välja täiendavad kaitsemeetmed ning treenisime mudelisse otse eakohase käitumise, et vähendada sobimatute vastuste riski. Vanemad saavad vanemliku järelevalve kaudu valida, kas nende teismeline võib ChatGPT Voice’i kasutada, ning seotud vanemaid võidakse teavitada suurema riskiga olukordades, mis viitavad võimalikule enesevigastamisele või suitsiidikavatsusele.

Õppimine tegelikust kasutusest

Samuti võtame kasutusele pikaajalisema mõõtmise ja lansseerimisjärgse seire, mis keskendub emotsionaalsele sõltuvusele, et oma arusaama edasi parandada ja kaitsemeetmeid täpsustada. Tuginedes meie varasemale uurimistööle afektiivse kasutuse ja emotsionaalse heaolu kohta, aitab see meil tuvastada esilekerkivaid mustreid ja parandada süsteemi reageerimist emotsionaalselt tundlikes suhtlustes.

Lõpuks: GPT‑Live on loodud vestluseks, mitte hääle matkimiseks. See kasutab ChatGPT‑s eelmääratletud hääli ning kaitsemeetmeid, mis takistavad päris inimese hääle jäljendamist.

Oleme pühendunud ohutuse ja heaolu toetamisele ning jätkame nende kaitsemeetmete tugevdamist, õppides tegelikust kasutusest.

Saadavus ja piirangud

GPT‑Live jõuab nüüd ChatGPT kasutajateni üle maailma iOS-is, Androidis ja ChatGPT.com-is(avaneb uues aknas). GPT‑Live‑1 saab vaikemudeliks, mis käitab ChatGPT Voice’i Go, Plus ja Pro kasutajatele, ning GPT‑Live‑1 mini saab vaikemudeliks Free kasutajatele. Lisateavet saadavuse kohta leiad meie Abikeskusest(avaneb uues aknas).

Oleme GPT‑Live’i optimeerinud mõnede ChatGPT populaarseimate keelte jaoks. Mõnes keeles võib mudelil olla võõrapärane aktsent või sujuvuses puudujääke. Töötame aktiivselt selle nimel, et kogemust eri keeltes parandada.

Lansseerimisel ei toeta GPT‑Live ChatGPT‑s häält koos video või ekraanijagamisega, kuid töötame selle nimel, et need võimalused peagi lisada. Saad endiselt kasutada ChatGPT Voice’i varasemaid versioone, sealhulgas Standardit ja täiustatud häälrežiimi, kus need funktsioonid on saadaval.

Autor

OpenAI