OpenAI

8. julij 2026

IzdelekIzdaja

Predstavljamo GPT‑Live

Nova generacija glasovnih modelov za naravno interakcijo med ljudmi in umetno inteligenco, ki zdaj poganja Glasovni ChatGPT.

Nalaganje …

Posodobitev z dne 31. julija 2026: Podprte zvočne vsebine, ustvarjene z GPT‑Live prek funkcije Glasovni ChatGPT in API-ja OpenAI, so zdaj opremljene z vodnim žigom SynthID. Naše javno orodje za preverjanje lahko zdaj zazna signale izvora OpenAI v podprtih zvočnih datotekah, uvedli pa smo tudi dostop do preverjanja prek API-ja, da lahko razvijalci in organizacije preverjanje izvora vključijo v svoje delovne postopke. Te posodobitve nadgrajujejo spodaj opisani pristop k varnosti in naša širša prizadevanja, da bi bilo vsebine, ustvarjene z orodji OpenAI, lažje prepoznati.

Predstavljamo GPT‑Live, novo generacijo glasovnih modelov, zaradi katerih je pogovor z UI veliko bolj podoben pravemu pogovoru.

GPT‑Live temelji na arhitekturi »full-duplex«, kar pomeni, da lahko posluša in govori hkrati. Med pogovori lahko GPT‑Live s frazami, kot sta »mhm« ali »ja«, pokaže, da posluša, se vključi v hitro izmenjavo ali pa preprosto ostane tiho, ko potrebujete trenutek za razmislek. Rezultat je glasovna izkušnja, s katero se je osvežujoče lahko pogovarjati.

GPT‑Live je tudi naš najpametnejši glasovni model doslej. Pri vprašanjih, ki zahtevajo spletno iskanje, globlje sklepanje ali bolj zapleteno delo, nalogo v ozadju preda našemu najnovejšemu prelomnemu modelu in rezultat vrne v pogovor, ko je pripravljen. Med delom se lahko GPT‑Live še naprej pogovarja z vami in ohranja tok pogovora. Ob uvedbi bo GPT‑Live v ozadju uporabljal GPT‑5.5. Ko bomo izdajali nove prelomne modele, bomo model, ki ga uporablja GPT‑Live, sproti posodabljali.

Te izboljšave omogočajo novo izkušnjo Glasovnega ChatGPT‑ja, ki je inteligentnejša in naravnejša za uporabo. Verjamemo, da bodo te raziskave sčasoma omogočile uporabo glasu za vse bolj zapleteno, dolgotrajnejše in bolj agentsko delo.

Danes za uporabnike ChatGPT‑ja po vsem svetu začenjamo uvajati dve različici GPT‑Live – GPT‑Live‑1 in GPT‑Live‑1 mini. Kmalu ju nameravamo ponuditi tudi v API-ju, razvijalci in podjetja pa se lahko prek tega obrazca prijavijo na obvestila.

Vstopamo v novo obdobje interakcije med človekom in UI

Naša vizija je omogočiti zares naravno interakcijo med človekom in UI: svet, v katerem je sodelovanje z UI tako tekoče in odzivno kot delo z drugo osebo, medtem ko sklepanje in izvajanje zapletenih nalog nemoteno potekata v ozadju.

Prejšnji pristopi

Starejše generacije glasovnih sistemov UI so nas tej viziji približale, vendar s pomembnimi kompromisi.

Kaskadni glasovni sistemi

Kaskadni glasovni sistemi se pri obdelavi vsake izmenjave zanašajo na zaporedje modelov, ki delujejo drug za drugim. Izvirni Glasovni ChatGPT je povezal tri modele: model za pretvorbo govora v besedilo, ki prepiše vaš govor, velik jezikovni model, ki ustvari odgovor, in model za pretvorbo besedila v govor, ki ga znova pretvori v govor. Ta pristop nam je prvič omogočil pogovor s prelomnimi modeli UI, vendar je imela kompleksnost svojo ceno: informacije so se lahko med modeli izgubljale, odzivi pa so bili počasni in okorni.

Kaskadni glasovni sistem

Počasni in okorni odgovori, dolgi premori

Prepis
Primer pogovora s standardnim glasovnim načinom, ki uporablja GPT-5.5 Instant

Glasovni modeli z izmenjavanjem besede

Glasovni modeli z izmenjavanjem besede, kot je napredni glasovni način ChatGPT, so obdelovali in ustvarjali zvok znotraj enega modela, kar je zmanjšalo zakasnitev in naredilo pogovore bolj tekoče, vendar so še vedno delovali v ločenih izmenjavah. Model je moral pred odgovorom počakati, da je uporabnik nehal govoriti, zato je bilo izmenjavanje besede togo. Ker zaznavanje izmenjav temelji na tišini, je lahko model celo kratek premor ali hrup v ozadju napačno razumel kot konec izmenjave in zato prekinil ob nenaravnem trenutku.

Glasovni model, ki temelji na izmenjavah

Nekoliko hitrejši in bolj tekoči odgovori, vendar je interakcija z modelom še vedno toga

Prepis
Primer pogovora z naprednim glasovnim načinom ChatGPT

Naš novi pristop

GPT‑Live te omejitve odpravlja z dvema arhitekturnima spremembama.

Neprekinjena interakcija

Najprej smo GPT‑Live zasnovali za neprekinjeno interakcijo z arhitekturo full-duplex. Namesto da bi obdeloval zaporedje ločenih sporočil, GPT‑Live neprekinjeno obdeluje vhod, medtem ko že ustvarja izhod. Model lahko zato večkrat na sekundo sprejema odločitve o interakciji: ali naj govori, še naprej posluša, naredi premor, prekine ali prikliče orodje.

To modelu omogoča naravnejšo izmenjavo, boljši občutek za čas in celo prevajanje v živo.

Neprekinjena interakcija

Hitri, naravni in izrazni odzivi ter aktivnejše poslušanje

Prepis
Primer pogovora z GPT-Live-1, z uporabo GPT-5.5 Instant

Delegiranje za poglobljeno delo

Drugič, GPT‑Live, ki skrbi za neprekinjeno interakcijo, smo ločili od poglobljenega dela. Ko vprašanje zahteva iskanje, sklepanje ali bolj agentske zmožnosti, lahko GPT‑Live nalogo delegira drugemu modelu, kakršen je GPT‑5.5. Tako lahko ohranja pogovor, tudi ko v ozadju opravlja več nalog.

Ta arhitekturna sprememba GPT‑Live omogoča tudi stalno uporabo najnovejših modelov in agentov ter združuje prelomno inteligenco z naravno interakcijo.

Delegiranje za globlje delo

GPT-Live zagotavlja hitre, naravne odgovore, medtem ko GPT-5.5 v ozadju skrbi za iskanje

Prepis
Primer pogovora z GPT-Live-1, z uporabo GPT-5.5 Instant

Evalvacije

Razvili smo nove evalvacije z ljudmi za merjenje prijetnosti in toka pogovora. V teh neposrednih primerjavah imata GPT‑Live‑1 in GPT‑Live‑1 mini izrazito prednost pred naprednim glasovnim načinom v primerljivih 5- do 10-minutnih pogovorih, ki merijo splošno preferenco, izmenjavanje besede, prekinitve, tok pogovora in naravnost posamezne interakcije.

  • GPQA: GPT‑Live‑1 pri evalvaciji GPQA bistveno presega napredni glasovni način; ta preizkuša znanstveno sklepanje na strokovni ravni na področjih biologije, kemije in fizike.
  • BrowseComp: GPT‑Live‑1 pri evalvaciji BrowseComp kaže velik napredek v primerjavi z naprednim glasovnim načinom; ta preizkuša agentsko spletno iskanje in zmožnost iskanja težko dostopnih informacij.
  • τ³-Voice Telecom (notranja različica)**: GPT‑Live‑1 presega napredni glasovni način pri τ³-Voice Telecom, ki glasovne agente preizkuša na realističnih nalogah telekomunikacijske podpore z večjim številom izmenjav.

* GPT‑Live‑1 (Takoj) in GPT‑Live‑1 mini v ozadju uporabljata model GPT‑5.5 Instant, medtem ko GPT‑Live‑1 Srednje in GPT‑Live‑1 Visoko uporabljata model GPT‑5.5 Thinking s srednjim oziroma visokim naporom sklepanja.

** Za to evalvacijo smo uporabili prilagojen uporabniški model, ki ga poganjajo naši najnovejši modeli sklepanja.

Nova izkušnja Glasovnega ChatGPT

Vsak teden se več kot 150 milijonov ljudi pogovarja s ChatGPT z uporabo funkcij, kot sta Glas in Narekovanje. Uporabljajo ga za vsakodnevno prostoročno pomoč, vajo jezikov, pripovedovanje pravljic za lahko noč ali preprosto klepet med vožnjo.

Od danes naprej boste ob dotiku gumba Glas za pogovor s ChatGPT dobili izboljšano izkušnjo, ki jo poganja GPT‑Live: naravnejše pogovore, pametnejše odgovore, boljše poslušanje in vizualne odzive.

Naravnejši pogovori

Pogovor s ChatGPT bi se moral zdaj zdeti veliko bolj podoben pravemu pogovoru. Lahko ga prekinete z vprašanjem, se ustavite, da zberete misli, ali prosite ChatGPT, naj govori počasneje. Na to, kar govorite, se naravno odzove z izrazi, kot sta »mhmm« ali »razumem«, zato veste, da vas spremlja. Za GPT‑Live smo na novo obdelali tudi devet prepoznavnih glasov v ChatGPT.

Pametnejši odgovori

Glasovni ChatGPT lahko zdaj uporablja naše najnovejše prelomne modele, zato vam ponudi pametnejše odgovore, ko jih potrebujete. Izberete lahko tudi raven sklepanja, ki ustreza vašim potrebam: »Instant« za hitre odgovore ali »Medium« (srednja raven) in »High« (visoka raven), kadar želite, da si ChatGPT vzame več časa za razmislek.

Boljše poslušanje

Če si vzamete trenutek za razmislek, Glasovni ChatGPT zdaj počaka, namesto da bi vskočil in vas prekinil. Če ga prosite, naj ostane tiho in posluša, bo to storil. Tudi ob hrupu v ozadju, na primer mimo vozečem prometu ali pogovorih v bližini, se ChatGPT bolje osredotoči na vaš glas in ga manj zmotijo motnje.

Vizualni odgovori na prvi pogled

Nekateri odgovori so uporabnejši, ko jih lahko vidite. Med pogovorom lahko ChatGPT zdaj prikaže bogate vizualne kartice za teme, kot so vreme, delnice, šport in drugo. Glas še naprej podpira tudi iskanje, pomnilnik, slike in nalaganje datotek.

Rezultat je izkušnja Glasovnega ChatGPT, ki deluje naravnejše, zmogljivejše in uporabnejše v vsakdanjem življenju.

Varnost, zasnovana za glas

GPT‑Live je zasnovan tako, da je privzeto varen. Nadgrajuje varnostni napredek naših najnovejših modelov, hkrati pa dodaja namensko varnostno usposabljanje na ključnih področjih tveganja in nove zaščite, zasnovane posebej za glas.

Razširjeno varnostno testiranje

Da bi bolje odražali, kako ljudje uporabljajo glas v resničnih okoliščinah, smo varnostno testiranje najprej razširili z novimi evalvacijami, zasnovanimi izvorno za zvok. Ustvarili smo tudi sintetične evalvacije, ki z ustvarjenim zvokom omogočajo intenzivnejše osredotočanje na ključna varnostna področja, pri čemer smo izhajali iz spoznanj iz naprednega glasovnega načina. Ta področja vključujejo samopoškodovanje, psihozo in manijo, čustveno zanašanje na umetno inteligenco, nasilje in spolne vsebine. Notranji strokovnjaki so model preizkusili tudi z red-teamingom glede tveganj, ki so značilna za glas.

V našem testiranju se je GPT‑Live na skoraj vseh ocenjenih področjih odrezal primerljivo z naprednim glasovnim načinom ali bolje od njega. Več o našem testiranju in zaščitah lahko preberete v sistemskem dokumentu(odpre se v novem oknu) za GPT‑Live.

Vgrajene zaščite

Ker glasovni pogovori potekajo v realnem času, smo vgradili tudi zaščite, ki lahko ukrepajo medtem, ko model govori. Ko sistem zazna potencialno nevarne izhodne podatke, lahko model usmeri k varnejšemu odgovoru, prikaže dodatna varnostna sporočila ali vire oziroma v primerih večjega tveganja konča glasovni pogovor. Za pogovore, ki vključujejo samopoškodovanje, smo podporne tokove ChatGPT prilagodili za glas, vključno s podporo kriznih telefonskih linij, ki so jo preverili strokovnjaki.

Zasnovali smo dodatne zaščite za podporo najstniškim uporabnikom, v model pa neposredno vgradili starosti primerno vedenje, da bi zmanjšali tveganje neprimernih odgovorov. Starši lahko prek starševskega nadzora izberejo, ali lahko njihov najstnik uporablja Glasovni ChatGPT, povezani starši pa so lahko obveščeni v primerih večjega tveganja, ki vključujejo znake morebitnega samopoškodovanja ali samomorilnih namenov.

Učenje iz uporabe v resničnem svetu

Uvajamo tudi dolgoročnejše merjenje in spremljanje po uvedbi, osredotočeno na čustveno zanašanje, da bomo še naprej izboljševali razumevanje in izpopolnjevali zaščite. Na podlagi naših prejšnjih raziskav o afektivni uporabi in čustvenem dobrem počutju nam bo to pomagalo prepoznati nastajajoče vzorce in izboljšati odzivanje sistema v čustveno občutljivih interakcijah.

Nazadnje, GPT‑Live je zasnovan za pogovor, ne za posnemanje glasov. Uporablja nabor vnaprej določenih glasov v ChatGPT z zaščitami, ki preprečujejo posnemanje glasu resnične osebe.

Zavezani smo podpori varnosti in dobrega počutja ter bomo te zaščite še naprej krepili, ko se bomo učili iz uporabe v resničnem svetu.

Razpoložljivost in omejitve

GPT‑Live se zdaj uvaja za uporabnike ChatGPT po vsem svetu v iOS, Androidu in na ChatGPT.com(odpre se v novem oknu). GPT‑Live‑1 bo postal privzeti model, ki poganja Glasovni ChatGPT za uporabnike Go, Plus in Pro, GPT‑Live‑1 mini pa bo privzeti za brezplačne uporabnike. Več podrobnosti o razpoložljivosti najdete v našem Centru za pomoč(odpre se v novem oknu).

GPT‑Live smo optimizirali za nekatere najbolj priljubljene jezike v ChatGPT. Pri nekaterih jezikih ima lahko model nenaravni naglas ali vrzeli v tekočem izražanju. Aktivno si prizadevamo izboljšati izkušnjo v različnih jezikih.

Ob uvedbi GPT‑Live v ChatGPT ne bo podpiral glasu z videom ali deljenja zaslona, vendar si prizadevamo, da bi te zmožnosti uvedli kmalu. Še vedno lahko dostopate do starejših različic Glasovnega ChatGPT, vključno s standardnim in naprednim glasovnim načinom, kjer so te funkcije na voljo.

Avtor

OpenAI