OpenAI

Predstavljamo GPT‑Live

Nova generacija glasovnih modela za prirodnu interakciju ljudi i AI-ja, koja sada pokreće ChatGPT Voice.

Učitavanje…

Pokrećemo GPT‑Live, novu generaciju glasovnih modela zbog kojih razgovor s umjetnom inteligencijom mnogo više liči na pravi razgovor.

GPT‑Live je izgrađen na full-duplex arhitekturi, što znači da može slušati i govoriti u isto vrijeme. Tokom razgovora, GPT‑Live može pokazati da prati pažnju frazama poput „mhm“ ili „da“, uključiti se u brzu razmjenu ili jednostavno šutjeti kada vam treba trenutak za razmišljanje. Rezultat je glasovno iskustvo s kojim je osvježavajuće lako razgovarati.

GPT‑Live je ujedno naš najpametniji glasovni model do sada. Za pitanja koja zahtijevaju web-pretragu, dublje rezonovanje ili složeniji rad, on u pozadini delegira zadatak našem najnovijem graničnom modelu i vraća rezultat u razgovor kada bude spreman. Dok radi, GPT‑Live može nastaviti razgovarati s vama i održavati tok razgovora. Pri lansiranju, GPT‑Live će u pozadini koristiti GPT‑5.5. Kako budemo objavljivali nove granične modele, kontinuirano ćemo ažurirati model koji GPT‑Live koristi.

Ova unapređenja omogućavaju novo glasovno iskustvo u ChatGPT‑u koje je inteligentnije i prirodnije za korištenje. Vremenom vjerujemo da će ovo istraživanje otvoriti i mogućnost korištenja glasa za sve složenije, dugotrajnije zadatke koji su sve više agentske prirode.

Danas globalno počinjemo uvoditi dvije verzije GPT‑Livea – GPT‑Live‑1 i GPT‑Live‑1 mini – korisnicima ChatGPT‑a. Planiramo ih uskoro donijeti i u API, a programeri i preduzeća mogu se prijaviti da dobiju obavijest putem ovog obrasca.

Ulazak u novu eru interakcije između ljudi i umjetne inteligencije

Naša vizija je omogućiti zaista prirodnu interakciju između ljudi i AI-ja: svijet u kojem saradnja s AI-jem djeluje jednako fluidno i responzivno kao rad s drugom osobom, dok se rezonovanje i izvršavanje složenih zadataka odvijaju neprimjetno u pozadini.

Prethodni pristupi

Starije generacije glasovnih AI sistema približile su nas toj viziji, ali uz važne kompromise.

Kaskadni glasovni sistemi

Kaskadni glasovni sistemi oslanjaju se na niz modela koji djeluju jedan za drugim kako bi obradili svaki red u razgovoru. Izvorni ChatGPT Voice povezao je tri modela: model za pretvaranje govora u tekst koji transkribuje vaš govor, veliki jezički model koji proizvodi odgovor i model za pretvaranje teksta u govor koji ga ponovo pretvara u govor. Ovaj pristup nam je prvi put omogućio da razgovaramo s graničnim AI modelima, ali složenost je imala cijenu: informacije su se mogle gubiti između modela, a odgovori su bili spori i ukočeni.

Kaskadni glasovni sistem

Spori i ukočeni odgovori, duge pauze

Transkript
Primjer razgovora sa standardnim glasovnim načinom rada, uz GPT-5.5 Brzo

Glasovni modeli zasnovani na redovima

Glasovni modeli zasnovani na redovima, poput ChatGPT‑ovog naprednog glasovnog načina rada, obrađivali su i generisali zvuk unutar jednog modela, smanjujući kašnjenje i čineći razgovore ugodnijim — ali su i dalje radili kroz odvojene redove. Model je morao čekati da korisnik prestane govoriti prije nego što odgovori, što je dovodilo do krute razmjene. Osim toga, pošto se prepoznavanje kraja reda zasniva na tišini, čak se i kratka pauza ili pozadinska buka mogla pogrešno protumačiti kao kraj reda — zbog čega bi model prekidao u neprirodnim trenucima.

Glasovni model zasnovan na redovima

Nešto brži i ugodniji odgovori, ali razmjena s modelom i dalje djeluje kruto

Transkript
Primjer razgovora s ChatGPT-ovim naprednim glasovnim načinom rada

Naš novi pristup

GPT‑Live rješava ta ograničenja kroz dvije arhitektonske promjene.

Kontinuirana interakcija

Prvo smo GPT‑Live izgradili za kontinuiranu interakciju koristeći full-duplex arhitekturu. Umjesto da obrađuje niz odvojenih poruka, GPT‑Live kontinuirano obrađuje ulaz dok generiše izlaz. Model zato može donositi odluke o interakciji mnogo puta u sekundi: da li da govori, nastavi slušati, zastane, prekine ili pozove alat.

To omogućava modelu da se uključi u prirodniju razmjenu, bolje održava osjećaj za vrijeme, pa čak i izvodi prevođenje uživo.

Kontinuirana interakcija

Brzi, prirodni, izražajni odgovori i aktivnije slušanje

Transkript
Primjer razgovora s GPT-Live-1, uz GPT-5.5 Brzo

Delegiranje za dublji rad

Drugo, odvojili smo GPT‑Live — koji upravlja kontinuiranom interakcijom — od dubljeg rada. Kada pitanje zahtijeva pretragu, rezonovanje ili više agentskih sposobnosti, GPT‑Live može delegirati zadatak drugom modelu, poput GPT‑5.5. To mu omogućava da nastavi razgovor čak i dok u pozadini obavlja više zadataka.

Ova arhitektonska promjena također omogućava GPT‑Liveu da kontinuirano koristi najnovije modele i agente, spajajući graničnu inteligenciju s prirodnom interakcijom.

Delegiranje za dublji rad

GPT-Live pruža brze, prirodne odgovore, dok GPT-5.5 obavlja pretragu u pozadini

Transkript
Primjer razgovora s GPT-Live-1, uz GPT-5.5 Brzo

Evaluacije

Izgradili smo nove ljudske evaluacije za mjerenje ugodnosti i toka razgovora. U ovim direktnim poređenjima korisnici izrazito daju prednost modelima GPT‑Live‑1 i GPT‑Live‑1 mini u odnosu na napredni glasovni način rada u uparenim razgovorima od 5 do 10 minuta, koji mjere ukupnu preferenciju, smjenjivanje u razgovoru, prekide, tok razgovora i koliko je svaka interakcija djelovala prirodno.

  • GPQA: GPT‑Live‑1 znatno nadmašuje napredni glasovni način rada na GPQA, koji testira naučno rezonovanje na stručnom nivou iz biologije, hemije i fizike.
  • BrowseComp: GPT‑Live‑1 pokazuje velike pomake u odnosu na napredni glasovni način rada na BrowseComp, koji testira agentsku web-pretragu i sposobnost pronalaženja teško dostupnih informacija.
  • τ³-Voice Telecom (interna varijanta)**: GPT‑Live‑1 nadmašuje napredni glasovni način rada na τ³-Voice Telecom, koji testira glasovne agente na realističnim zadacima telekomunikacijske podrške s više razmjena.

* GPT‑Live‑1 (brzo) i GPT‑Live‑1 mini u pozadini koriste model GPT‑5.5 Brzo, dok GPT‑Live‑1 Srednja i GPT‑Live‑1 Visoka koriste model GPT‑5.5 Thinking sa srednjim i visokim naporom rezonovanja.

** Za ovu evaluaciju koristili smo prilagođeni korisnički model, koji pokreću naši najnoviji modeli rezonovanja.

Novo iskustvo ChatGPT Voicea

Svake sedmice više od 150 miliona ljudi razgovara s ChatGPT‑om koristeći funkcije poput Glasa i Diktiranja. Koriste ga za svakodnevnu pomoć bez korištenja ruku, vježbanje jezika, pričanje priča za laku noć ili samo za razgovor tokom putovanja na posao.

Od danas, kada dodirnete dugme Voice da razgovarate s ChatGPT‑om, dobit ćete poboljšano iskustvo koje pokreće GPT‑Live — s prirodnijim razgovorima, pametnijim odgovorima, boljim slušanjem i vizuelnim odgovorima.

Prirodniji razgovori

Razgovor s ChatGPT‑om sada bi trebao mnogo više ličiti na pravi razgovor. Možete ga prekinuti pitanjem, zastati da saberete misli ili zamoliti ChatGPT da uspori. Prirodno potvrđuje ono što govorite frazama poput „mhmm” ili „shvaćam”, tako da znate da vas prati. Također smo remasterovali devet prepoznatljivih glasova u ChatGPT‑u za GPT‑Live.

Pametniji odgovori

ChatGPT Voice sada može koristiti naše najnovije granične modele, što vam daje pametnije odgovore kada su vam potrebni. Možete odabrati i nivo rezonovanja koji odgovara vašim potrebama: Instant za brze odgovore ili Medium i High kada želite da ChatGPT provede više vremena razmišljajući.

Bolje slušanje

Ako vam treba trenutak da razmislite, ChatGPT Voice sada čeka umjesto da uskoči i prekine vas. Ako ga zamolite da šuti i sluša, učinit će to. A kada postoji pozadinska buka, poput saobraćaja u prolazu ili obližnjih razgovora, ChatGPT se bolje fokusira na vaš glas umjesto da mu to odvlači pažnju.

Vizuelni odgovori na prvi pogled

Neki odgovori su korisniji kada ih možete vidjeti. Dok razgovarate, ChatGPT sada može prikazivati bogate vizuelne kartice za teme poput vremena, dionica, sporta i još mnogo toga. Voice i dalje podržava pretragu, memoriju, slike i otpremanje datoteka.

Rezultat je iskustvo ChatGPT Voicea koje djeluje prirodnije, sposobnije i korisnije u svakodnevnom životu.

Sigurnost osmišljena za glas

GPT‑Live je osmišljen da bude siguran po zadanim postavkama. Nadovezuje se na sigurnosni napredak naših najnovijih modela, uz dodatnu namjensku sigurnosnu obuku u ključnim područjima rizika i nove zaštitne mjere posebno osmišljene za glas.

Prošireno sigurnosno testiranje

Kako bismo bolje odrazili način na koji ljudi koriste glas u stvarnim okolnostima, počeli smo proširivanjem sigurnosnog testiranja na nove evaluacije izvorno zasnovane na zvuku. Također smo kreirali sintetičke evaluacije koje koriste generirani zvuk kako bi se intenzivnije usmjerile na ključna sigurnosna područja, oslanjajući se na ono što smo naučili iz Naprednog glasovnog načina rada. Ta područja uključuju samopovređivanje, psihozu i maniju, emocionalno oslanjanje na AI, nasilje i seksualni sadržaj. Interni stručnjaci su također red-team testirali model na rizike jedinstvene za glas.

U našem testiranju, GPT‑Live je u gotovo svim područjima koja smo evaluirali imao učinak uporediv s Naprednim glasovnim načinom rada ili bolji od njega. Više o našem testiranju i zaštitnim mjerama možete pročitati u GPT‑Live kartici sistema(otvara se u novom prozoru).

Ugrađene zaštitne mjere

Budući da se glasovni razgovori odvijaju u stvarnom vremenu, ugradili smo i zaštitne mjere koje mogu djelovati dok model govori. Kada sistem otkrije potencijalno nesiguran izlaz, može usmjeriti model prema sigurnijem odgovoru, prikazati dodatne sigurnosne poruke ili resurse, ili u slučajevima većeg rizika završiti glasovni razgovor. Za razgovore koji uključuju samopovređivanje, prilagodili smo ChatGPT‑ove tokove podrške za glas, uključujući pružanje podrške kriznih linija za pomoć koju su provjerili stručnjaci.

Osmislili smo dodatne zaštite za podršku korisnicima tinejdžerskog uzrasta i direktno u model obučili ponašanje primjereno dobi kako bismo smanjili rizik od neprimjerenih odgovora. Roditelji mogu putem roditeljskog nadzora odabrati može li njihov tinejdžer koristiti ChatGPT Voice, a povezani roditelji mogu biti obaviješteni u situacijama većeg rizika koje uključuju znakove mogućeg samopovređivanja ili suicidalnih namjera.

Učenje iz upotrebe u stvarnom svijetu

Uvodimo i dugoročnije mjerenje i praćenje nakon lansiranja usmjereno na emocionalno oslanjanje, kako bismo nastavili poboljšavati svoje razumijevanje i usavršavati zaštitne mjere. Nadovezujući se na naše prethodno istraživanje afektivne upotrebe i emocionalne dobrobiti, to će nam pomoći da prepoznamo nove obrasce i poboljšamo način na koji sistem odgovara u emocionalno osjetljivim interakcijama.

Konačno, GPT‑Live je osmišljen za razgovor, a ne za imitiranje glasova. Koristi skup unaprijed definisanih glasova u ChatGPT‑u, uz zaštitne mjere koje sprečavaju imitiranje glasa stvarne osobe.

Posvećeni smo podršci sigurnosti i dobrobiti i nastavit ćemo jačati ove zaštite dok učimo iz upotrebe u stvarnom svijetu.

Dostupnost i ograničenja

GPT‑Live se sada uvodi korisnicima ChatGPT‑a širom svijeta na iOS-u, Androidu i ChatGPT.com(otvara se u novom prozoru). GPT‑Live‑1 će postati zadani model koji pokreće ChatGPT Voice za korisnike planova Go, Plus i Pro, a GPT‑Live‑1 mini će postati zadani za korisnike plana Free. Više detalja o dostupnosti možete pronaći u našem Centru za pomoć(otvara se u novom prozoru).

Optimizirali smo GPT‑Live za neke od najpopularnijih jezika u ChatGPT‑u. Za određene jezike model može imati naglasak neizvornog govornika ili praznine u tečnosti izražavanja. Aktivno radimo na poboljšanju iskustva na različitim jezicima.

Pri lansiranju GPT‑Live neće podržavati glas uz video ili dijeljenje ekrana u ChatGPT‑u, ali radimo na tome da uskoro uvedemo te mogućnosti. I dalje možete pristupiti ranijim verzijama ChatGPT Voicea, uključujući Standardni i Napredni glasovni način rada, tamo gdje su te funkcije dostupne.

Autor

OpenAI