OpenAI

2026 m. liepos 8 d.

ProduktasLeidimas

Pristatome GPT‑Live

Naujos kartos balso modeliai natūraliai žmogaus ir AI sąveikai, dabar veikiantys ChatGPT Balsą.

Įkeliama...

2026 m. liepos 31 d. atnaujinimas: Palaikomame garso turinyje, sugeneruotame naudojant „GPT‑Live“ per „ChatGPT Voice“ ir „OpenAI“ API, dabar įtraukti „SynthID“ vandens ženklai. Mūsų viešoji patikros priemonė dabar gali aptikti „OpenAI“ kilmės signalus palaikomuose garso failuose, o kūrėjams bei organizacijoms suteikėme API prieigą patikroms, kad jie kilmės tikrinimą galėtų integruoti į savo darbo procesus. Šie atnaujinimai papildo toliau aprašytus saugos metodus ir mūsų bendras pastangas siekiant, kad „OpenAI“ sugeneruotą turinį būtų lengviau atpažinti.

Pristatome GPT‑Live – naujos kartos balso modelius, dėl kurių pokalbis su DI tampa daug panašesnis į tikrą pokalbį.

GPT‑Live sukurta pagal visiškojo duplekso architektūrą, todėl gali klausytis ir kalbėti tuo pačiu metu. Pokalbių metu GPT‑Live gali parodyti, kad klausosi, tokiomis frazėmis kaip „mhm“ arba „taip“, greitai įsitraukti į dialogą arba tiesiog patylėti, kai jums reikia akimirkos pagalvoti. Rezultatas – balso patirtis, su kuria kalbėtis stebėtinai lengva.

GPT‑Live taip pat yra išmaniausias mūsų balso modelis iki šiol. Kai klausimams reikia paieškos internete, gilesnio protavimo ar sudėtingesnio darbo, ji fone perduoda užduotį naujausiam mūsų priešakiniam modeliui ir, rezultatui parengus, grąžina jį į pokalbį. Kol GPT‑Live dirba, ji gali toliau su jumis kalbėtis ir išlaikyti pokalbio tėkmę. Paleidimo metu GPT‑Live fone naudos GPT‑5.5. Išleisdami naujus priešakinius modelius, nuolat atnaujinsime GPT‑Live naudojamą modelį.

Šie patobulinimai suteikia naują „ChatGPT Balsas“ patirtį, kuri yra išmanesnė ir natūralesnė naudoti. Ilgainiui tikime, kad šis tyrimas taip pat atvers galimybę balsu atlikti vis sudėtingesnį, ilgiau trunkantį ir agentiškesnį darbą.

Nuo šiandien pradedame diegti dvi GPT‑Live versijas – GPT‑Live‑1 ir GPT‑Live‑1 mini – ChatGPT naudotojams visame pasaulyje. Taip pat planuojame netrukus jas pasiūlyti API, o kūrėjai ir įmonės gali užsiregistruoti pranešimui gauti naudodami šią formą.

Žmogaus ir DI sąveikos naujos eros pradžia

Mūsų vizija – įgalinti išties natūralią žmogaus ir DI sąveiką: pasaulį, kuriame bendradarbiauti su DI yra taip pat sklandu ir reaguojama taip pat greitai, kaip dirbant su kitu žmogumi, o protavimas ir sudėtingų užduočių vykdymas nepastebimai vyksta fone.

Ankstesni metodai

Ankstesnės balso DI sistemų kartos priartino mus prie šios vizijos, tačiau turėjo svarbių kompromisų.

Kaskadinės balso sistemos

Kaskadinės balso sistemos remiasi modelių seka, kurioje jie vienas po kito apdoroja kiekvieną pokalbio ėjimą. Pirmasis ChatGPT Balsas sujungė tris modelius: kalbos atpažinimo modelį jūsų kalbai transkribuoti, didelį kalbos modelį atsakymui parengti ir kalbos sintezės modelį, kad atsakymas vėl būtų paverstas kalba. Šis metodas pirmą kartą leido mums kalbėtis su priešakiniais DI modeliais, tačiau sudėtingumas turėjo kainą: dalis informacijos galėjo pasimesti tarp modelių, o atsakymai buvo lėti ir nenatūralūs.

Pakopinė balso sistema

Lėti, nenatūralūs atsakymai ir ilgos pauzės

Nuorašas
Pokalbio standartiniu balso režimu naudojant „GPT-5.5 Momentinis“ pavyzdys

Eilėmis veikiantys balso modeliai

Eilėmis veikiantys balso modeliai, tokie kaip ChatGPT išplėstinis balso režimas, apdorojo ir generavo garsą viename modelyje, todėl sumažėjo delsa ir pokalbiai tapo sklandesni, tačiau jie vis tiek veikė atskirais ėjimais. Modelis turėjo laukti, kol naudotojas nustos kalbėti, ir tik tada atsakyti, todėl dialogas pirmyn ir atgal buvo sustabarėjęs. Be to, kadangi ėjimo pabaigos aptikimas remiasi tyla, net trumpa pauzė ar foninis triukšmas galėjo būti palaikyti ėjimo pabaiga, todėl modelis pertraukdavo nenatūraliu metu.

Eiliškumu pagrįstas balso modelis

Šiek tiek greitesni ir sklandesni atsakymai, tačiau abipusis bendravimas su modeliu vis dar atrodo suvaržytas

Nuorašas
Pokalbio naudojant „ChatGPT“ išplėstinį balso režimą pavyzdys

Mūsų naujas metodas

GPT‑Live šiuos apribojimus sprendžia dviem architektūriniais pakeitimais.

Nuolatinė sąveika

Pirmiausia sukūrėme GPT‑Live nuolatinei sąveikai, naudodami visiškojo duplekso architektūrą. Užuot apdorojęs atskirų pranešimų seką, GPT‑Live nuolat apdoroja įvestį ir tuo pat metu generuoja išvestį. Todėl modelis gali daug kartų per sekundę priimti sąveikos sprendimus: kalbėti, toliau klausytis, padaryti pauzę, pertraukti arba iškviesti įrankį.

Tai leidžia modeliui natūraliau palaikyti dialogą, geriau jausti laiką ir net atlikti tiesioginį vertimą.

Nuolatinė sąveika

Greiti, natūralūs ir išraiškingi atsakymai bei aktyvesnis klausymasis

Nuorašas
Pokalbio su „GPT-Live-1“ naudojant „GPT-5.5 Momentinis“ pavyzdys

Delegavimas gilesniam darbui

Antra, atskyrėme GPT‑Live, kuri tvarko nuolatinę sąveiką, nuo gilesnio darbo. Kai klausimui reikia paieškos, protavimo ar agentiškesnių gebėjimų, GPT‑Live gali deleguoti užduotį kitam modeliui, pavyzdžiui, GPT‑5.5. Tai leidžia jai palaikyti pokalbį net tada, kai fone atliekamos kelios užduotys.

Šis architektūrinis pakeitimas taip pat leidžia GPT‑Live nuolat naudoti naujausius modelius ir agentus, sujungiant priešakinį intelektą su natūralia sąveika.

Delegavimas gilesniam darbui

„GPT-Live“ pateikia greitus ir natūralius atsakymus, o GPT-5.5 fone atlieka paiešką

Nuorašas
Pokalbio su „GPT-Live-1“ naudojant „GPT-5.5 Momentinis“ pavyzdys

Vertinimai

Sukūrėme naujus žmonių atliekamus vertinimus, kad pamatuotume pokalbio malonumą ir tėkmę. Šiuose tiesioginiuose palyginimuose GPT‑Live‑1 ir GPT‑Live‑1 mini aiškiai teikiama pirmenybė prieš išplėstinį balso režimą suderintuose 5–10 minučių pokalbiuose, kuriuose vertinama bendra pirmenybė, kalbėjimo eilės, pertraukimai, pokalbio tėkmė ir tai, kiek natūrali atrodė kiekviena sąveika.

  • GPQA: GPT‑Live‑1 gerokai pranoksta išplėstinį balso režimą GPQA teste, kuriame tikrinamas ekspertinio lygio mokslinis protavimas biologijos, chemijos ir fizikos srityse.
  • BrowseComp: GPT‑Live‑1 rodo didelę pažangą, palyginti su išplėstiniu balso režimu, BrowseComp teste, kuriame tikrinama agentiška žiniatinklio paieška ir gebėjimas rasti sunkiai aptinkamą informaciją.
  • τ³-Voice Telecom (vidinis variantas)**: „GPT‑Live‑1“ lenkia išplėstinį balso režimą vertinime „τ³-Voice Telecom“, kuriame balso agentai bandomi atliekant realistiškas, kelių etapų telekomunikacijų klientų aptarnavimo užduotis.

* GPT‑Live‑1 (momentinis) ir GPT‑Live‑1 mini fone naudoja GPT‑5.5 Momentinį modelį, o GPT‑Live‑1 Vidutinis ir GPT‑Live‑1 Aukštas naudoja GPT‑5.5 mąstymo modelį su vidutinėmis ir didelėmis protavimo pastangomis.

** Šiam vertinimui naudojome pritaikytą naudotojo modelį, pagrįstą naujausiais mūsų protavimo modeliais.

Nauja ChatGPT Balso patirtis

Kas savaitę daugiau nei 150 mln. žmonių kalbasi su ChatGPT naudodami tokias funkcijas kaip Balsas ir Diktavimas. Jie tai naudoja kasdienei pagalbai be rankų, kalboms mokytis, pasakoms prieš miegą sekti arba tiesiog pasikalbėti keliaudami į darbą.

Nuo šiandien, palietę Balso mygtuką ir kalbėdami su ChatGPT, gausite geresnę GPT‑Live paremtą patirtį: natūralesnius pokalbius, išmanesnius atsakymus, geresnį klausymąsi ir vaizdinius atsakymus.

Natūralesni pokalbiai

Kalbėtis su ChatGPT dabar turėtų būti daug panašiau į tikrą pokalbį. Galite pertraukti klausimu, stabtelėti susikaupti arba paprašyti ChatGPT kalbėti lėčiau. Jis natūraliai parodo, kad girdi, ką sakote, tokiomis frazėmis kaip „mhm“ ar „supratau“, todėl žinote, kad jis seka pokalbį. Taip pat iš naujo parengėme devynis skirtingus ChatGPT balsus GPT‑Live.

Išmanesni atsakymai

ChatGPT Balsas dabar gali pasitelkti naujausius mūsų priešakinius modelius, kad prireikus pateiktų išmanesnius atsakymus. Taip pat galite pasirinkti jūsų poreikiams tinkamą protavimo lygį: Instant greitiems atsakymams arba Medium ir High, kai norite, kad ChatGPT daugiau laiko skirtų apmąstymui.

Geresnis klausymasis

Jei akimirkai susimąstote, ChatGPT Balsas dabar palaukia, užuot įsiterpęs ir pertraukęs. Jei paprašysite patylėti ir klausytis, jis taip ir padarys. O kai fone yra triukšmo, pavyzdžiui, pravažiuojančių automobilių ar netoliese vykstančių pokalbių, ChatGPT geriau susitelkia į jūsų balsą ir nesiblaško.

Vaizdiniai atsakymai iš pirmo žvilgsnio

Kai kurie atsakymai naudingesni, kai juos matote. Kol kalbate, ChatGPT dabar gali rodyti išsamias vaizdines korteles apie orus, akcijas, sportą ir kitas temas. Balsas taip pat toliau palaiko paiešką, atmintį, vaizdus ir failų įkėlimą.

Rezultatas – ChatGPT Balso patirtis, kuri kasdieniame gyvenime atrodo natūralesnė, pajėgesnė ir naudingesnė.

Balsui pritaikyta sauga

GPT‑Live sukurtas taip, kad būtų saugus pagal numatytuosius nustatymus. Jis remiasi naujausių mūsų modelių saugos pažanga ir prideda specialų saugos mokymą svarbiausiose rizikos srityse bei naujas apsaugos priemones, sukurtas būtent balsui.

Išplėstas saugos testavimas

Kad geriau atspindėtume, kaip žmonės naudoja balsą realiomis sąlygomis, pirmiausia išplėtėme saugos testavimą įtraukdami naujus garsui skirtus vertinimus. Taip pat sukūrėme sintetinius vertinimus, kuriuose naudojamas sugeneruotas garsas, kad galėtume nuodugniau nagrinėti svarbias saugos sritis, remdamiesi tuo, ką išmokome iš išplėstinio balso režimo. Šios sritys apima savižalą, psichozę ir maniją, emocinę priklausomybę nuo AI, smurtą ir seksualinį turinį. Vidaus ekspertai taip pat atliko modelio raudonosios komandos testavimą dėl tik balsui būdingų rizikų.

Mūsų bandymuose GPT‑Live beveik visose vertintose srityse pasirodė panašiai kaip išplėstinis balso režimas arba geriau. Daugiau apie mūsų testavimą ir apsaugos priemones galite perskaityti GPT‑Live sistemos kortelėje(atsidaro naujame lange).

Įtaisytos apsaugos priemonės

Kadangi balso pokalbiai vyksta realiuoju laiku, sukūrėme ir apsaugos priemonių, kurios gali veikti modeliui kalbant. Kai sistema aptinka galimai nesaugų išvesties turinį, ji gali nukreipti modelį į saugesnį atsakymą, parodyti papildomus saugos pranešimus ar išteklius arba, didesnės rizikos atvejais, užbaigti balso pokalbį. Pokalbiams apie savižalą pritaikėme ChatGPT pagalbos eigas balsui, įskaitant ekspertų patikrintą krizių pagalbos linijų informaciją.

Sukūrėme papildomų apsaugų paaugliams ir tiesiogiai išmokėme modelį elgtis pagal amžių, kad sumažintume netinkamų atsakymų riziką. Tėvai gali per tėvų kontrolę pasirinkti, ar jų paauglys gali naudoti ChatGPT Balsą, o susieti tėvai gali būti informuojami didesnės rizikos situacijose, kai matyti galimos savižalos ar ketinimo nusižudyti požymių.

Mokymasis iš realaus naudojimo

Taip pat diegiame ilgesnio laikotarpio matavimus ir stebėseną po paleidimo, orientuotą į emocinę priklausomybę, kad toliau gerintume supratimą ir tobulintume apsaugos priemones. Remdamiesi ankstesniais mūsų tyrimais apie afektinį naudojimą ir emocinę gerovę, galėsime nustatyti naujus modelius ir gerinti sistemos atsakus emociškai jautriose sąveikose.

Galiausiai GPT‑Live skirtas pokalbiui, o ne balso apsimetinėjimui. Jis naudoja iš anksto nustatytus ChatGPT balsus ir turi apsaugos priemonių, neleidžiančių imituoti tikro žmogaus balso.

Esame įsipareigoję palaikyti saugą ir gerovę ir toliau stiprinsime šias apsaugas mokydamiesi iš realaus naudojimo.

Prieinamumas ir apribojimai

GPT‑Live jau diegiamas ChatGPT naudotojams visame pasaulyje iOS, Android ir ChatGPT.com(atsidaro naujame lange) platformose. GPT‑Live‑1 taps numatytuoju modeliu, kuriuo veiks ChatGPT Balsas Go, Plus ir Pro naudotojams, o GPT‑Live‑1 mini taps numatytuoju Free naudotojams. Daugiau informacijos apie prieinamumą rasite mūsų Pagalbos centre(atsidaro naujame lange).

GPT‑Live optimizavome kai kurioms populiariausioms ChatGPT kalboms. Tam tikromis kalbomis modelis gali kalbėti su negimtakalbio akcentu arba ne visada sklandžiai. Aktyviai dirbame, kad pagerintume patirtį įvairiomis kalbomis.

Paleidimo metu GPT‑Live nepalaikys balso su vaizdo įrašu ar ekrano bendrinimu ChatGPT, bet dirbame, kad netrukus pristatytume šias galimybes. Vis dar galite naudotis ankstesnėmis ChatGPT Balso versijomis, įskaitant standartinį ir išplėstinį balso režimus, kur šios funkcijos pasiekiamos.

Autorius

OpenAI