OpenAI

8 iulie 2026

ProdusLansare

Îți prezentăm GPT‑Live

O nouă generație de modele vocale pentru interacțiune om-AI naturală, care susține acum ChatGPT Voice.

Se încarcă…

Lansăm GPT‑Live, o nouă generație de modele vocale care fac conversația cu AI-ul să semene mult mai mult cu o conversație reală.

GPT‑Live este construit pe o arhitectură full-duplex, ceea ce înseamnă că poate asculta și vorbi în același timp. În timpul conversațiilor, GPT‑Live poate arăta că este atent prin expresii precum „mhmm” sau „da”, poate participa la schimburi rapide ori poate pur și simplu să tacă atunci când ai nevoie de un moment ca să te gândești. Rezultatul este o experiență vocală cu care este surprinzător de ușor să vorbești.

GPT‑Live este și cel mai inteligent model vocal al nostru de până acum. Pentru întrebările care necesită căutare pe web, raţionament mai profund sau activități mai complexe, acesta deleagă în culise către cel mai recent model de vârf al nostru și readuce rezultatul în conversație când este gata. În timp ce lucrează, GPT‑Live poate continua să vorbească cu tine și să păstreze cursul conversației. La lansare, GPT‑Live va folosi GPT‑5.5 în fundal. Pe măsură ce lansăm noi modele de vârf, vom actualiza continuu modelul folosit de GPT‑Live.

Aceste progrese susțin o nouă experiență ChatGPT Voice, mai inteligentă și mai naturală în utilizare. În timp, credem că această cercetare va permite folosirea vocii pentru activități tot mai complexe, de durată mai mare și mai agentive.

Începem astăzi să lansăm două versiuni de GPT‑Live – GPT‑Live‑1 și GPT‑Live‑1 mini – pentru utilizatorii ChatGPT din întreaga lume. Plănuim să le aducem în curând și în API, iar dezvoltatorii și companiile se pot înscrie pentru notificări folosind acest formular.

Intrarea într-o nouă eră a interacțiunii om–AI

Viziunea noastră este să facem posibilă o interacțiune om–AI cu adevărat naturală: o lume în care colaborarea cu AI-ul se simte la fel de fluidă și promptă ca lucrul cu o altă persoană, în timp ce raţionamentul și executarea sarcinilor complexe au loc fără întreruperi, în fundal.

Abordări anterioare

Generațiile mai vechi de sisteme AI vocale ne-au adus mai aproape de această viziune, dar cu compromisuri importante.

Sisteme vocale în cascadă

Sistemele vocale în cascadă se bazează pe o serie de modele care acționează unul după altul pentru a procesa fiecare schimb de replici. Versiunea originală ChatGPT Voice conecta trei modele: un model de conversie a vorbirii în text pentru a transcrie ceea ce spuneai, un model lingvistic de mari dimensiuni pentru a genera un răspuns și un model de conversie a textului în vorbire pentru a transforma răspunsul înapoi în voce. Această abordare ne-a permis, pentru prima dată, să comunicăm vocal cu modele AI de vârf, însă complexitatea ei a avut un cost: informațiile se puteau pierde la trecerea de la un model la altul, iar răspunsurile erau lente și lipsite de naturalețe.

Sistem vocal în cascadă

Răspunsuri lente și rigide, pauze lungi

Transcriere
Exemplu de conversație cu modul vocal standard, folosind GPT-5.5 Instant

Modele vocale bazate pe schimburi de replici

Modelele vocale bazate pe schimburi de replici, precum Modul vocal avansat ChatGPT, procesau și generau conținut audio în cadrul unui singur model, reducând latența și făcând conversațiile mai fluide, însă funcționau în continuare prin intervenții distincte. Modelul trebuia să aștepte ca utilizatorul să termine de vorbit înainte de a răspunde, ceea ce ducea la schimburi rigide de replici. În plus, deoarece detectarea finalului unui schimb de replici se bazează pe tăcere, chiar și o pauză scurtă sau zgomotul de fundal puteau fi interpretate greșit drept sfârșitul intervenției, determinând modelul să întrerupă în momente nepotrivite.

Model vocal bazat pe schimburi de replici

Răspunsuri ceva mai rapide și mai fluide, dar schimbul cu modelul încă pare rigid

Transcriere
Exemplu de conversație cu modul vocal avansat ChatGPT

Noua noastră abordare

GPT‑Live rezolvă aceste limitări prin două schimbări de arhitectură.

Interacțiune continuă

În primul rând, am construit GPT‑Live pentru interacțiune continuă, folosind o arhitectură full-duplex. În loc să proceseze o succesiune de mesaje separate, GPT‑Live procesează continuu intrarea în timp ce generează ieșirea. Modelul poate astfel să ia decizii de interacțiune de multe ori pe secundă: dacă să vorbească, să continue să asculte, să facă pauză, să întrerupă sau să invoce un instrument.

Acest lucru îi permite modelului să participe la schimburi mai naturale de replici, să păstreze un simț mai bun al timpului și chiar să facă traducere live.

Interacțiune continuă

Răspunsuri rapide, naturale și expresive, plus ascultare mai activă

Transcriere
Exemplu de conversație cu GPT-Live-1, folosind GPT-5.5 Instant

Delegare pentru activități mai complexe

În al doilea rând, am decuplat GPT‑Live — care gestionează interacțiunea continuă — de activitățile mai complexe. Când o întrebare necesită căutare, raţionament sau capacități mai agentive, GPT‑Live poate delega sarcina unui alt model, precum GPT‑5.5. Astfel, poate menține conversația în desfășurare, chiar și atunci când gestionează mai multe sarcini în fundal.

Această schimbare de arhitectură îi permite, de asemenea, lui GPT‑Live să folosească în permanență cele mai recente modele și cei mai noi agenți, combinând inteligența de vârf cu interacțiunea naturală.

Delegare pentru activități mai complexe

GPT-Live oferă răspunsuri rapide și naturale, în timp ce GPT-5.5 gestionează căutarea în fundal

Transcriere
Exemplu de conversație cu GPT-Live-1, folosind GPT-5.5 Instant

Evaluări

Am construit noi evaluări umane pentru a măsura cât de plăcută este conversația și cât de bine curge. În aceste comparații directe, GPT‑Live‑1 și GPT‑Live‑1 mini sunt preferate clar față de modul vocal avansat în conversații echivalente de 5–10 minute, care măsoară preferința generală, gestionarea turelor, întreruperile, cursul conversației și cât de naturală a părut fiecare interacțiune.

  • GPQA: GPT‑Live‑1 depășește semnificativ modul vocal avansat la GPQA, care testează raţionamentul științific la nivel de expert în biologie, chimie și fizică.
  • BrowseComp: GPT‑Live‑1 înregistrează îmbunătățiri importante față de modul vocal avansat la BrowseComp, care testează căutarea web agentivă și capacitatea de a găsi informații greu de localizat.
  • τ³-Voice Telecom (variantă internă)**: GPT‑Live‑1 depășește modul vocal avansat la τ³-Voice Telecom, care testează agenți vocali în sarcini realiste, cu schimb de replici, de asistență telecom.

* GPT‑Live‑1 (Instant) și GPT‑Live‑1 mini folosesc în fundal modelul GPT‑5.5 Instant, în timp ce GPT‑Live‑1 Medie și GPT‑Live‑1 Ridicată folosesc modelul GPT‑5.5 Thinking, cu efort de raţionament mediu și ridicat.

** Pentru această evaluare, am folosit un model de utilizator personalizat, bazat pe cele mai recente modele de raţionament ale noastre.

O nouă experiență ChatGPT Voice

În fiecare săptămână, peste 150 de milioane de persoane vorbesc cu ChatGPT folosind funcții precum Voce și Dictare. Le folosesc pentru ajutor de zi cu zi fără mâini, pentru a exersa limbi străine, a spune povești de seară sau pur și simplu pentru a conversa în drum spre serviciu.

Începând de astăzi, când atingi butonul Voice pentru a vorbi cu ChatGPT, vei avea o experiență îmbunătățită, susținută de GPT‑Live: conversații mai naturale, răspunsuri mai inteligente, ascultare mai bună și răspunsuri vizuale.

Conversații mai naturale

Discuția cu ChatGPT ar trebui să semene acum mult mai mult cu o conversație reală. Poți interveni cu o întrebare, poți face o pauză ca să-ți aduni gândurile sau îi poți cere lui ChatGPT să vorbească mai rar. Confirmă natural ce spui, cu expresii precum „mhmm” sau „am înțeles”, ca să știi că te urmărește. Am remasterizat și cele nouă voci distincte din ChatGPT pentru GPT‑Live.

Răspunsuri mai inteligente

ChatGPT Voice poate folosi acum cele mai recente modele de vârf ale noastre, oferindu-ți răspunsuri mai inteligente atunci când ai nevoie de ele. Poți alege și nivelul de raţionament potrivit nevoilor tale: Instant pentru răspunsuri rapide sau Mediu și Ridicat când vrei ca ChatGPT să petreacă mai mult timp gândind.

Ascultare mai bună

Dacă îți iei un moment să te gândești, ChatGPT Voice așteaptă acum în loc să intervină și să te întrerupă. Dacă îi ceri să tacă și să asculte, o va face. Iar când există zgomot de fundal, precum traficul sau conversațiile din apropiere, ChatGPT se concentrează mai bine pe vocea ta, fără să fie distras.

Răspunsuri vizuale dintr-o privire

Unele răspunsuri sunt mai utile când le poți vedea. În timp ce vorbești, ChatGPT poate afișa acum carduri vizuale bogate pentru subiecte precum vremea, acțiunile, sporturile și altele. Voice continuă, de asemenea, să accepte căutarea, memoria, imaginile și încărcările de fișiere.

Rezultatul este o experiență ChatGPT Voice care se simte mai naturală, mai capabilă și mai utilă în viața de zi cu zi.

Siguranță concepută pentru voce

GPT‑Live a fost conceput să fie sigur în mod implicit. Se bazează pe progresele în siguranță ale celor mai recente modele ale noastre și adaugă instruire dedicată pentru siguranță în principalele zone de risc, precum și noi măsuri de protecție concepute special pentru voce.

Testare de siguranță extinsă

Pentru a reflecta mai bine modul în care oamenii folosesc vocea în situații reale, am început prin a extinde testarea de siguranță pentru a include noi evaluări audio-native. Am creat și evaluări sintetice care folosesc audio generat pentru a se concentra mai intens pe domenii-cheie de siguranță, pornind de la ce am învățat din modul vocal avansat. Aceste domenii includ autovătămarea, psihoza și mania, dependența emoțională de AI, violența și conținutul sexual. Experți interni au supus modelul și unor exerciții de red-teaming pentru riscuri specifice vocii.

În testele noastre, GPT‑Live a avut performanțe comparabile cu sau mai bune decât modul vocal avansat în aproape toate domeniile evaluate. Poți citi mai multe despre testarea și măsurile noastre de protecție în fișa de sistem(se deschide într-o fereastră nouă) GPT‑Live.

Măsuri de protecție integrate

Deoarece conversațiile vocale se desfășoară în timp real, am creat și măsuri de protecție care pot acționa în timp ce modelul vorbește. Când sistemul detectează un rezultat potențial nesigur, poate orienta modelul către un răspuns mai sigur, poate afișa mesaje sau resurse suplimentare de siguranță ori poate încheia conversația vocală în cazurile cu risc mai ridicat. Pentru conversațiile care implică autovătămare, am adaptat fluxurile de sprijin ale ChatGPT pentru voce, inclusiv prin oferirea de asistență prin linii de criză verificate de experți.

Am conceput protecții suplimentare pentru a sprijini utilizatorii adolescenți și am antrenat direct în model un comportament adecvat vârstei, pentru a reduce riscul de răspunsuri nepotrivite. Părinții pot alege, prin controale parentale, dacă adolescentul lor poate folosi ChatGPT Voice, iar părinții conectați pot fi notificați în situații cu risc mai ridicat care implică semne de posibilă autovătămare sau intenție suicidară.

Învățăm din utilizarea în lumea reală

Lansăm și măsurători pe termen mai lung și monitorizare post-lansare axate pe dependența emoțională, pentru a ne îmbunătăți în continuare înțelegerea și a rafina măsurile de protecție. Pornind de la cercetările noastre anterioare despre utilizarea afectivă și bunăstarea emoțională, acest lucru ne va ajuta să identificăm tipare emergente și să îmbunătățim modul în care sistemul răspunde în interacțiuni sensibile emoțional.

În cele din urmă, GPT‑Live este conceput pentru conversație, nu pentru imitarea vocală. Folosește un set de voci predefinite în ChatGPT, cu măsuri de protecție care îl împiedică să imite vocea unei persoane reale.

Ne angajăm să sprijinim siguranța și bunăstarea și vom continua să consolidăm aceste protecții pe măsură ce învățăm din utilizarea în lumea reală.

Disponibilitate și limitări

GPT‑Live este lansat acum pentru utilizatorii ChatGPT la nivel global, pe iOS, Android și ChatGPT.com(se deschide într-o fereastră nouă). GPT‑Live‑1 va deveni modelul implicit care alimentează ChatGPT Voice pentru utilizatorii Go, Plus și Pro, iar GPT‑Live‑1 mini va deveni implicit pentru utilizatorii Free. Mai multe detalii despre disponibilitate se găsesc în Centrul de asistență(se deschide într-o fereastră nouă).

Am optimizat GPT‑Live pentru unele dintre cele mai populare limbi din ChatGPT. Pentru anumite limbi, modelul poate avea un accent nenativ sau lacune de fluență. Lucrăm activ pentru a îmbunătăți experiența în toate limbile.

La lansare, GPT‑Live nu va accepta voce cu video sau partajarea ecranului în ChatGPT, dar lucrăm pentru a introduce aceste capacități în curând. Poți accesa în continuare versiunile anterioare ale ChatGPT Voice, inclusiv Standard și modul vocal avansat, acolo unde aceste funcții sunt disponibile.

Autor

OpenAI