Ažuriranje od 31. 7. 2026.: Podržani audiozapisi generirani s pomoću alata GPT‑Live putem značajke ChatGPT Glas i OpenAI API-ja sada uključuju označavanje vodenim žigom SynthID. Naš javni alat za provjeru sada može otkriti OpenAI-jeve signale podrijetla u podržanim audio datotekama, a uveli smo i pristup provjeri putem API-ja kako bi razvojni inženjeri i organizacije mogli uključiti provjere podrijetla u vlastite tijekove rada. Ta se ažuriranja nadovezuju na sigurnosni pristup opisan u nastavku i naš širi rad na tome da se sadržaj generiran s pomoću OpenAI-ja lakše prepoznaje.
Pokrećemo GPT‑Live, novu generaciju glasovnih modela zahvaljujući kojima razgovor s AI-jem mnogo više nalikuje stvarnom razgovoru.
GPT‑Live izgrađen je na arhitekturi punog dupleksa, što znači da može istodobno slušati i govoriti. Tijekom razgovora GPT‑Live može pokazati da prati što govorite izrazima poput „mhm” ili „da”, sudjelovati u brzoj interakciji ili jednostavno ostati tih kad vam treba trenutak za razmišljanje. Rezultat je glasovno iskustvo u kojem je razgovor osvježavajuće jednostavan.
GPT‑Live ujedno je naš najpametniji glasovni model dosad. Za pitanja koja zahtijevaju pretraživanje weba, dublje rasuđivanje ili složeniji rad, u pozadini delegira zadatak našem najnovijem vodećem modelu i vraća rezultat u razgovor kad bude spreman. Dok radi, GPT‑Live može nastaviti razgovarati s vama i održavati tijek razgovora. Pri lansiranju GPT‑Live će u pozadini upotrebljavati GPT‑5.5. Kako budemo objavljivali nove vodeće modele, kontinuirano ćemo ažurirati model koji GPT‑Live upotrebljava.
Ta poboljšanja pokreću novo iskustvo ChatGPT Glasa koje je inteligentnije i prirodnije za upotrebu. S vremenom vjerujemo da će ovo istraživanje omogućiti i upotrebu glasa za sve složenije i dugotrajnije zadatke koji se više oslanjaju na agente.
Danas korisnicima ChatGPT‑a globalno počinjemo uvoditi dvije verzije – GPT‑Live‑1 i GPT‑Live‑1 mini. Uskoro ih planiramo uvesti i u API, a razvojni programeri i poslovni korisnici mogu se prijaviti za obavijesti putem ovog obrasca.
Ulazak u novo doba interakcije čovjeka i AI-ja
Naša je vizija omogućiti doista prirodnu interakciju čovjeka i AI-ja: svijet u kojem je suradnja s AI-jem jednako fluidna i brza u odzivu kao rad s drugom osobom, dok se rasuđivanje i izvršavanje složenih zadataka neprimjetno odvijaju u pozadini.
Prethodni pristupi
Starije generacije glasovnih AI sustava približile su nas toj viziji, ali uz važne kompromise.
Kaskadni glasovni sustavi
Kaskadni glasovni sustavi oslanjaju se na niz modela koji djeluju jedan za drugim kako bi obradili svaku izmjenu u razgovoru. Izvorni ChatGPT Glas povezao je tri modela: model za pretvaranje govora u tekst koji transkribira vaš govor, veliki jezični model koji stvara odgovor i model za pretvaranje teksta u govor koji ga ponovno pretvara u govor. Taj nam je pristup prvi put omogućio razgovor s vodećim AI modelima, ali složenost je imala svoju cijenu: informacije su se mogle gubiti između modela, a odgovori su bili spori i ukočeni.
Kaskadni glasovni sustav
Spori i neprirodni odgovori, duge stanke
Glasovni modeli s izmjenama govornika
Glasovni modeli temeljeni na izmjenama govornika, poput naprednog glasovnog načina rada ChatGPT‑a, obrađivali su i generirali zvuk unutar jednog modela, čime su smanjivali latenciju i činili razgovore prirodnijima – ali i dalje su funkcionirali kroz odvojene izmjene. Model je morao čekati da korisnik prestane govoriti prije nego što odgovori, što je dovodilo do krute interakcije. Osim toga, budući da se prepoznavanje kraja izmjene temelji na tišini, čak se i kratka stanka ili pozadinska buka mogla pogrešno protumačiti kao kraj izmjene, zbog čega bi model prekidao u neprirodnim trenucima.
Glasovni model temeljen na potezima
Nešto brži i uglađeniji odgovori, ali razmjena s modelom i dalje djeluje kruto
Naš novi pristup
GPT‑Live rješava ta ograničenja dvjema arhitekturnim promjenama.
Kontinuirana interakcija
Prvo, izgradili smo GPT‑Live za kontinuiranu interakciju pomoću arhitekture punog dupleksa. Umjesto da obrađuje niz zasebnih poruka, GPT‑Live kontinuirano obrađuje ulazne podatke dok generira izlazne. Model zato može donositi odluke o interakciji mnogo puta u sekundi: hoće li govoriti, nastaviti slušati, zastati, prekinuti ili pozvati alat.
To modelu omogućuje prirodniju interakciju, bolji osjećaj za vrijeme, pa čak i prevođenje uživo.
Kontinuirana interakcija
Brzi, prirodni i izražajni odgovori te aktivnije slušanje
Delegiranje za dublji rad
Drugo, odvojili smo GPT‑Live koji upravlja kontinuiranom interakcijom – od dubljeg rada. Kad pitanje zahtijeva pretraživanje, rasuđivanje ili naprednije agentske sposobnosti, GPT‑Live može delegirati zadatak drugom modelu, primjerice GPT‑5.5. To mu omogućuje da nastavi razgovor čak i dok u pozadini obrađuje više zadataka.
Ta arhitekturna promjena GPT‑Liveu omogućuje i kontinuiranu upotrebu najnovijih modela i agenata, spajajući inteligenciju vodećih modela s prirodnom interakcijom.
Delegiranje za dublji rad
GPT-Live pruža brze, prirodne odgovore, dok GPT-5.5 obrađuje pretraživanje u pozadini
Evaluacije
Izradili smo nove ljudske evaluacije za mjerenje dojma i tijeka razgovora. U tim izravnim usporedbama GPT‑Live‑1 i GPT‑Live‑1 mini imaju znatnu prednost pred naprednim glasovnim načinom rada u usporedivim razgovorima od 5 do 10 minuta, u kojima se mjere ukupna preferencija, izmjenjivanje u razgovoru, prekidanja, tijek razgovora i prirodnost svake interakcije.
- GPQA: GPT‑Live‑1 znatno nadmašuje napredni glasovni način rada na GPQA-u, koji testira znanstveno rasuđivanje na stručnoj razini u biologiji, kemiji i fizici.
- BrowseComp: GPT‑Live‑1 pokazuje snažan napredak u odnosu na napredni glasovni način rada na BrowseCompu, koji testira agentsko pretraživanje weba i sposobnost pronalaženja teško dostupnih informacija.
- τ³-Voice Telecom (interna varijanta)**: GPT‑Live‑1 nadmašuje napredni glasovni način rada na τ³-Voice Telecomu, koji testira glasovne agente na realističnim telekomunikacijskim zadacima podrške s više izmjena.
GPT‑Live‑1 (Instant) i GPT‑Live‑1 mini u pozadini upotrebljavaju model GPT‑5.5 Instant, dok GPT‑Live‑1 Medium i GPT‑Live‑1 High upotrebljavaju model GPT‑5.5 Thinking sa srednjom i visokom razinom rasuđivanja.
** Za ovu evaluaciju upotrijebili smo prilagođeni korisnički model koji pokreću naši najnoviji modeli za rasuđivanje.
Novo iskustvo ChatGPT Glasa
Svakog tjedna više od 150 milijuna ljudi razgovara s ChatGPT‑om putem značajki kao što su Glas i Diktiranje. Koriste ga za svakodnevnu pomoć bez upotrebe ruku, vježbanje jezika, pričanje priča za laku noć ili jednostavno za razgovor tijekom putovanja na posao.
Od danas, kada dodirnete gumb Glas za razgovor s ChatGPT‑om, dobit ćete poboljšano iskustvo koje pokreće GPT‑Live – s prirodnijim razgovorima, pametnijim odgovorima, boljim slušanjem i vizualnim odgovorima.
Prirodniji razgovori
Razgovor s ChatGPT‑om sad bi trebao mnogo više nalikovati pravom razgovoru. Možete ga prekinuti pitanjem, zastati kako biste sabrali misli ili zamoliti ChatGPT da uspori. Prirodno potvrđuje ono što govorite izrazima poput „mhmm” ili „razumijem”, pa znate da vas prati. Za GPT‑Live također smo remasterirali devet prepoznatljivih glasova u ChatGPT‑u.
Pametniji odgovori
ChatGPT Glas sad se može osloniti na naše najnovije najnaprednije modele, dajući vam pametnije odgovore kad su vam potrebni. Možete odabrati i razinu rasuđivanja koja odgovara vašim potrebama: Instant za brze odgovore ili Medium i High kada želite da ChatGPT provede više vremena razmišljajući.
Bolje slušanje
Ako vam treba trenutak za razmišljanje, ChatGPT Glas sad čeka umjesto da se ubaci i prekine vas. Ako ga zamolite da bude tih i sluša, to će i učiniti. A kad postoji pozadinska buka, poput prometa koji prolazi ili razgovora u blizini, ChatGPT se bolje usredotočuje na vaš glas umjesto da mu nešto odvuče pozornost.
Pregledni vizualni odgovori
Neki su odgovori korisniji kad ih možete vidjeti. Dok razgovarate, ChatGPT sad može prikazivati bogate vizualne kartice za teme poput vremena, dionica, sporta i drugih. Glas i dalje podržava pretraživanje, memoriju, slike i prijenos datoteka.



Rezultat je iskustvo ChatGPT Glasa koje djeluje prirodnije, sposobnije i korisnije u svakodnevnom životu.
Sigurnost osmišljena za glas
GPT‑Live osmišljen je tako da bude siguran prema zadanim postavkama. Nadovezuje se na sigurnosna poboljšanja naših najnovijih modela te dodaje ciljano sigurnosno treniranje u ključnim područjima rizika i nove zaštitne mjere osmišljene posebno za glas.
Prošireno sigurnosno testiranje
Kako bi naše sigurnosno testiranje bolje odgovaralo načinu na koji ljudi upotrebljavaju glas u stvarnim okruženjima, najprije smo ga proširili novim evaluacijama izvorno osmišljenima za zvuk. Izradili smo i sintetičke evaluacije koje upotrebljavaju generirani zvuk kako bi se intenzivnije usredotočile na ključna sigurnosna područja, oslanjajući se na ono što smo naučili iz naprednog glasovnog načina rada. Ta područja uključuju samoozljeđivanje, psihozu i maniju, emocionalno oslanjanje na AI, nasilje i seksualni sadržaj. Interni stručnjaci također su provodili red-team testiranje modela za rizike jedinstvene za glas.
U našem testiranju GPT‑Live je u gotovo svim evaluiranim područjima postigao rezultate usporedive s naprednim glasovnim načinom rada ili bolje od njega. Više o našem testiranju i zaštitnim mjerama možete pročitati u GPT‑Live dokumentu o sustavu(otvara se u novom prozoru).
Ugrađene zaštitne mjere
Budući da se glasovni razgovori odvijaju u stvarnom vremenu, ugradili smo i zaštitne mjere koje mogu djelovati dok model govori. Kada sustav otkrije potencijalno nesiguran izlaz, može usmjeriti model prema sigurnijem odgovoru, prikazati dodatne sigurnosne poruke ili resurse ili, u slučajevima višeg rizika, završiti glasovni razgovor. Za razgovore koji uključuju samoozljeđivanje prilagodili smo ChatGPT‑ove tijekove podrške za glas, uključujući stručnjacima provjerenu podršku putem kriznih telefonskih linija.
Osmislili smo dodatne zaštite za podršku tinejdžerima i izravno u model ugradili ponašanje primjereno dobi kako bismo smanjili rizik od neprikladnih odgovora. Roditelji putem roditeljskog nadzora mogu odabrati smije li njihov tinejdžer upotrebljavati ChatGPT Glas, a povezani roditelji mogu biti obaviješteni u situacijama višeg rizika koje uključuju znakove mogućeg samoozljeđivanja ili suicidalne namjere.
Učenje iz stvarne upotrebe
Uvodimo i dugoročnije mjerenje te praćenje nakon lansiranja usmjereno na emocionalno oslanjanje kako bismo nastavili bolje razumijevati i dorađivati zaštitne mjere. Nadovezujući se na naše prethodno istraživanje o afektivnoj upotrebi i emocionalnoj dobrobiti, to će nam pomoći prepoznati nove obrasce i poboljšati način na koji sustav odgovara u emocionalno osjetljivim interakcijama.
Naposljetku, GPT‑Live je osmišljen za razgovor, a ne za oponašanje glasova. Upotrebljava skup unaprijed definiranih glasova u ChatGPT‑u, uz zaštitne mjere koje ga sprječavaju da oponaša glas stvarne osobe.
Predani smo podršci sigurnosti i dobrobiti te ćemo nastaviti jačati te zaštite dok učimo iz stvarne upotrebe.
Dostupnost i ograničenja
GPT‑Live sad se uvodi korisnicima ChatGPT‑a diljem svijeta na iOS-u, Androidu i ChatGPT.com(otvara se u novom prozoru). GPT‑Live‑1 postat će zadani model koji pokreće ChatGPT Glas za korisnike Go, Plus i Pro, a GPT‑Live‑1 mini postat će zadani za korisnike plana Free. Više pojedinosti o dostupnosti možete pronaći u našem Centru za pomoć(otvara se u novom prozoru).
Optimizirali smo GPT‑Live za neke od najpopularnijih jezika u ChatGPT‑u. Za određene jezike model može imati strani naglasak ili nedostatke u tečnosti. Aktivno radimo na poboljšanju iskustva na svim jezicima.
Pri lansiranju GPT‑Live neće podržavati glas s videom ili dijeljenjem zaslona u ChatGPT‑u, ali radimo na tome da uskoro uvedemo te mogućnosti. I dalje možete pristupiti starijim verzijama ChatGPT Glasa, uključujući Standard i napredni glasovni način rada, ondje gdje su te značajke dostupne.


