OpenAI

2026. gada 8. jūlijs

ProduktsIzlaidums

Iepazīstinām ar GPT‑Live

Jaunas paaudzes balss modeļi dabiskai cilvēka un MI mijiedarbībai, kas tagad darbina ChatGPT Voice.

Notiek ielāde…

Atjauninājums 2026. gada 31. jūlijā: Atbalstītajos audiofailos, kas ģenerēti ar GPT‑Live, izmantojot ChatGPT Balss un OpenAI API, tagad ir iekļauta SynthID ūdenszīmju izmantošana. Mūsu publiskais verifikācijas rīks tagad var noteikt OpenAI izcelsmes signālus atbalstītos audiofailos, un mēs esam ieviesuši API piekļuvi verifikācijai, lai izstrādātāji un organizācijas varētu iekļaut izcelsmes pārbaudes savās darbplūsmās. Šie atjauninājumi papildina tālāk aprakstīto drošības pieeju un mūsu plašāko darbu pie tā, lai OpenAI ģenerētu saturu būtu vieglāk identificēt.

Mēs izlaižam GPT‑Live — jaunas paaudzes balss modeļus, ar kuriem saruna ar MI daudz vairāk līdzinās īstai sarunai.

GPT‑Live ir veidots uz pilna dupleksa arhitektūras, kas nozīmē, ka tas var klausīties un runāt vienlaikus. Sarunu laikā GPT‑Live var parādīt, ka klausās, ar tādām frāzēm kā „mmm” vai „jā”, iesaistīties ātrā viedokļu apmaiņā vai vienkārši klusēt, kad jums vajadzīgs brīdis pārdomām. Rezultāts ir balss pieredze, ar kuru sarunāties ir pārsteidzoši viegli.

GPT‑Live ir arī mūsu līdz šim gudrākais balss modelis. Jautājumiem, kuriem nepieciešama meklēšana tīmeklī, dziļāka spriestspēja vai sarežģītāks darbs, tas fonā deleģē uzdevumu mūsu jaunākajam robežšķirtnes modelim un, kad rezultāts ir gatavs, atgriež to sarunā. Kamēr GPT‑Live strādā, tas var turpināt ar jums sarunāties un uzturēt sarunas plūdumu. Palaišanas brīdī GPT‑Live fonā izmantos GPT‑5.5. Izlaižot jaunus robežšķirtnes modeļus, mēs pastāvīgi atjaunināsim modeli, ko izmanto GPT‑Live.

Šie sasniegumi nodrošina jaunu ChatGPT Voice pieredzi, kas ir viedāka un dabiskāka lietošanā. Laika gaitā, mūsuprāt, šis pētījums arī pavērs iespēju izmantot balsi arvien sarežģītākam, ilgāk veicamam un aģentu darbam.

Šodien sākam pakāpeniski ieviest divas GPT‑Live versijas — GPT‑Live‑1 un GPT‑Live‑1 mini — ChatGPT lietotājiem visā pasaulē. Drīzumā plānojam tās piedāvāt arī API, un izstrādātāji un uzņēmumi var pieteikties paziņojumiem, izmantojot šo veidlapu.

Jauna cilvēka un MI mijiedarbības ēra

Mūsu vīzija ir padarīt iespējamu patiesi dabisku cilvēka un MI mijiedarbību: pasauli, kurā sadarbība ar MI šķiet tikpat plūstoša un atsaucīga kā darbs ar citu cilvēku, bet spriestspēja un sarežģītu uzdevumu izpilde nemanāmi notiek fonā.

Iepriekšējās pieejas

Vecākas balss MI sistēmu paaudzes mūs pietuvināja šai vīzijai, taču ar būtiskiem kompromisiem.

Kaskādes balss sistēmas

Kaskādes balss sistēmas katra sarunas gājiena apstrādei paļaujas uz modeļu virkni, kas darbojas viens pēc otra. Sākotnējā ChatGPT Voice sasaistīja trīs modeļus: runas pārvēršanas tekstā modeli, kas transkribēja jūsu runu, lielu valodas modeli, kas sagatavoja atbildi, un teksta pārvēršanas runā modeli, kas to atkal pārvērta runā. Šī pieeja pirmoreiz ļāva mums sarunāties ar robežšķirtnes MI modeļiem, taču sarežģītība prasīja savu cenu: starp modeļiem varēja pazust informācija, un atbildes bija lēnas un stīvas.

Kaskādes balss sistēma

Lēnas un neveiklas atbildes, garas pauzes

Transkripcija
Sarunas piemērs standarta balss režīmā, izmantojot GPT-5.5 Instant

Gājienos balstīti balss modeļi

Tādi gājienos balstīti balss modeļi kā ChatGPT uzlabotais balss režīms apstrādāja un ģenerēja audio vienā modelī, samazinot latentumu un padarot sarunas plūdenākas, taču tie joprojām darbojās atsevišķos gājienos. Pirms atbildēšanas modelim bija jāgaida, līdz lietotājs beidz runāt, tāpēc saruna turp un atpakaļ kļuva stīva. Turklāt, tā kā gājiena noteikšana balstās uz klusumu, pat īsa pauze vai fona troksnis varēja tikt kļūdaini uztverts kā gājiena beigas, liekot modelim pārtraukt sarunu nedabiskos brīžos.

Uz sarunas kārtām balstīts balss modelis

Nedaudz ātrākas un plūstošākas atbildes, bet dialogs ar modeli joprojām šķiet stīvs

Transkripcija
Sarunas piemērs ar ChatGPT uzlaboto balss režīmu

Mūsu jaunā pieeja

GPT‑Live novērš šos ierobežojumus ar divām arhitektūras izmaiņām.

Nepārtraukta mijiedarbība

Pirmkārt, mēs izveidojām GPT‑Live nepārtrauktai mijiedarbībai, izmantojot pilnda dupleksa arhitektūru. Tā vietā, lai apstrādātu atsevišķu ziņojumu virkni, GPT‑Live nepārtraukti apstrādā ievadi, vienlaikus ģenerējot izvadi. Tāpēc modelis var pieņemt lēmumus par mijiedarbību daudzas reizes sekundē: vai runāt, turpināt klausīties, ieturēt pauzi, pārtraukt vai izsaukt rīku.

Tas ļauj modelim iesaistīties dabiskākā sarunā turp un atpakaļ, labāk uzturēt laika izjūtu un pat veikt tulkošanu tiešraidē.

Nepārtraukta mijiedarbība

Ātras, dabiskas, izteiksmīgas atbildes un aktīvāka klausīšanās

Transkripcija
Sarunas piemērs ar GPT-Live-1, izmantojot GPT-5.5 Instant

Deleģēšana plašākam darbam

Otrkārt, mēs nošķīrām GPT‑Live, kas pārvalda nepārtrauktu mijiedarbību, no padziļinātāka darba. Kad jautājumam nepieciešama meklēšana, spriestspēja vai aģentu spējas, GPT‑Live var deleģēt uzdevumu citam modelim, piemēram, GPT‑5.5. Tas ļauj tam turpināt sarunu pat tad, kad fonā tiek apstrādāti vairāki uzdevumi.

Šī arhitektūras izmaiņa arī ļauj GPT‑Live nepārtraukti izmantot jaunākos modeļus un aģentus, apvienojot robežšķirtnes intelektu ar dabisku mijiedarbību.

Deleģēšana plašākam darbam

GPT-Live nodrošina ātras, dabiskas atbildes, kamēr GPT-5.5 fonā veic meklēšanu

Transkripcija
Sarunas piemērs ar GPT-Live-1, izmantojot GPT-5.5 Instant

Novērtējumi

Mēs izveidojām jaunus cilvēku veiktus novērtējumus, lai mērītu patīkamību un sarunas plūdumu. Šajos tiešajos salīdzinājumos GPT‑Live‑1 un GPT‑Live‑1 mini tiek nepārprotami dota priekšroka salīdzinājumā ar uzlaboto balss režīmu saskaņotās 5–10 minūšu sarunās, kurās mēra vispārējo priekšroku, gājienu maiņu, pārtraukumus, sarunas plūdumu un to, cik dabiska šķita katra mijiedarbība.

  • GPQA: GPT‑Live‑1 būtiski pārspēj uzlaboto balss režīmu GPQA testā, kas pārbauda ekspertu līmeņa zinātnisko spriestspēju bioloģijā, ķīmijā un fizikā.
  • BrowseComp: GPT‑Live‑1 uzrāda ievērojamus uzlabojumus salīdzinājumā ar uzlaboto balss režīmu BrowseComp testā, kas pārbauda aģentu meklēšanu tīmeklī un spēju atrast grūti sameklējamu informāciju.
  • τ³-Voice Telecom (iekšējais variants)**: GPT‑Live‑1 pārspēj uzlaboto balss režīmu τ³-Voice Telecom testā, kas pārbauda balss aģentus reālistiskos, vairāku kārtu telekomunikāciju atbalsta uzdevumos.

* GPT‑Live‑1 (tūlītējs) un GPT‑Live‑1 mini fonā izmanto GPT‑5.5 Tūlītējo modeli, savukārt GPT‑Live‑1 Vidējs un GPT‑Live‑1 Augsts izmanto GPT‑5.5 Thinking modeli ar vidēju un augstu spriestspējas piepūles līmeni.

** Šajā novērtējumā izmantojām pielāgotu lietotāja modeli, ko darbināja mūsu jaunākie spriestspējas modeļi.

Jauna ChatGPT Voice pieredze

Katru nedēļu vairāk nekā 150 miljoni cilvēku sarunājas ar ChatGPT, izmantojot tādas funkcijas kā Voice un Dictation. Viņi to izmanto ikdienas palīdzībai bez roku izmantošanas, valodu praktizēšanai, vakara pasaciņu stāstīšanai vai vienkārši sarunām ceļā uz darbu.

No šodienas, pieskaroties pogai Voice, lai sarunātos ar ChatGPT, jūs iegūsiet uzlabotu pieredzi, ko nodrošina GPT‑Live — ar dabiskākām sarunām, gudrākām atbildēm, labāku klausīšanos un vizuālām atbildēm.

Dabiskākas sarunas

Sarunai ar ChatGPT tagad vajadzētu šķist daudz līdzīgākai īstai sarunai. Varat pārtraukt ar jautājumu, ieturēt pauzi, lai sakārtotu domas, vai lūgt ChatGPT runāt lēnāk. Tas dabiski apliecina, ka uztver teikto, ar frāzēm kā „mhm” vai „sapratu”, lai jūs zinātu, ka tas seko līdzi. Esam arī no jauna apstrādājuši deviņas atšķirīgas ChatGPT balsis GPT‑Live vajadzībām.

Gudrākas atbildes

ChatGPT Voice tagad var izmantot mūsu jaunākos progresīvos modeļus, sniedzot gudrākas atbildes, kad tās nepieciešamas. Varat arī izvēlēties savām vajadzībām atbilstošu spriestspējas līmeni: Instant ātrām atbildēm vai Medium un High, ja vēlaties, lai ChatGPT veltītu vairāk laika domāšanai.

Labāka klausīšanās

Ja jums vajadzīgs brīdis pārdomām, ChatGPT Voice tagad gaida, nevis steidzas iejaukties un pārtraukt. Ja palūgsiet to klusēt un ieklausīties, tas tā arī darīs. Ja fonā ir troksnis, piemēram, garāmbraucoša satiksme vai tuvumā notiekošas sarunas, ChatGPT labāk koncentrējas uz jūsu balsi, nevis novērš uzmanību.

Vizuālas atbildes vienā mirklī

Dažas atbildes ir noderīgākas, kad tās var redzēt. Kamēr sarunājaties, ChatGPT tagad var rādīt bagātīgas vizuālās kartītes par tādām tēmām kā laikapstākļi, akcijas, sports un citas. Balss arī turpina atbalstīt meklēšanu, atmiņu, attēlus un failu augšupielādi.

Rezultāts ir ChatGPT Voice pieredze, kas ikdienā šķiet dabiskāka, spējīgāka un noderīgāka.

Drošība, kas izstrādāta balsij

GPT‑Live ir veidots tā, lai pēc noklusējuma būtu drošs. Tas balstās uz drošības uzlabojumiem mūsu jaunākajos modeļos, vienlaikus pievienojot īpašu drošības apmācību galvenajās riska jomās un jaunus aizsargmehānismus, kas izstrādāti tieši balsij.

Paplašināta drošības testēšana

Lai labāk atspoguļotu, kā cilvēki izmanto balsi reālās situācijās, sākām ar drošības testēšanas paplašināšanu, iekļaujot jaunus audio vidē balstītus novērtējumus. Mēs izveidojām arī sintētiskus novērtējumus, kuros izmantots ģenerēts audio, lai intensīvāk pievērstos galvenajām drošības jomām, balstoties uz to, ko iemācījāmies no uzlabotā balss režīma. Šīs jomas ietver paškaitējumu, psihozi un māniju, emocionālu paļaušanos uz MI, vardarbību un seksuālu saturu. Iekšējie eksperti arī veica modeļa sarkanās komandas testēšanu attiecībā uz riskiem, kas raksturīgi tikai balsij.

Mūsu testos GPT‑Live gandrīz visās izvērtētajās jomās darbojās līdzvērtīgi uzlabotajam balss režīmam vai labāk par to. Vairāk par mūsu testēšanu un aizsargmehānismiem varat lasīt GPT‑Live sistēmas kartē(atveras jaunā logā).

Iebūvēti aizsargmehānismi

Tā kā balss sarunas norisinās reāllaikā, esam izveidojuši arī aizsargmehānismus, kas var darboties, kamēr modelis runā. Kad sistēma konstatē potenciāli nedrošu izvadi, tā var virzīt modeli uz drošāku atbildi, parādīt papildu drošības ziņojumus vai resursus, vai arī augstāka riska gadījumos pārtraukt balss sarunu. Sarunām par paškaitējumu mēs pielāgojām ChatGPT atbalsta plūsmas balsij, tostarp piedāvājot ekspertu pārbaudītu krīzes palīdzības līniju atbalstu.

Mēs izstrādājām papildu aizsardzību pusaudžu lietotāju atbalstam un tieši modelī apmācījām vecumam atbilstošu uzvedību, lai mazinātu neatbilstošu atbilžu risku. Vecāki var izvēlēties, vai viņu pusaudzis drīkst izmantot ChatGPT Voice, izmantojot vecāku kontroli, un saistītie vecāki var saņemt paziņojumus augstāka riska situācijās, kurās ir iespējama paškaitējuma vai pašnāvniecisku nolūku pazīmes.

Mācīšanās no lietojuma reālajā pasaulē

Mēs arī ieviešam ilgāka termiņa mērījumus un pēcpalaišanas uzraudzību, kas vērsta uz emocionālo paļaušanos, lai turpinātu uzlabot izpratni un pilnveidot aizsargmehānismus. Balstoties uz mūsu iepriekšējiem pētījumiem par afektīvu lietojumu un emocionālo labbūtību, tas palīdzēs mums noteikt jaunus modeļus un uzlabot sistēmas reakciju emocionāli jutīgās mijiedarbībās.

Visbeidzot, GPT‑Live ir paredzēts sarunām, nevis balss atdarināšanai. Tas izmanto ChatGPT iepriekš definētu balsu kopu ar aizsargmehānismiem, kas neļauj tam atdarināt reāla cilvēka balsi.

Mēs esam apņēmušies atbalstīt drošību un labbūtību un turpināsim stiprināt šos aizsargmehānismus, mācoties no lietojuma reālajā pasaulē.

Pieejamība un ierobežojumi

GPT‑Live tagad tiek ieviests ChatGPT lietotājiem visā pasaulē iOS, Android un ChatGPT.com(atveras jaunā logā) vidēs. GPT‑Live‑1 kļūs par noklusējuma modeli, kas darbina ChatGPT Voice Go, Plus un Pro lietotājiem, savukārt GPT‑Live‑1 mini kļūs par noklusējumu Free lietotājiem. Plašāku informāciju par pieejamību var atrast mūsu Palīdzības centrā(atveras jaunā logā).

Esam optimizējuši GPT‑Live dažām no populārākajām ChatGPT valodām. Dažās valodās modelim var būt svešvalodai raksturīgs akcents vai raituma trūkumi. Mēs aktīvi strādājam, lai uzlabotu pieredzi dažādās valodās.

Palaišanas brīdī GPT‑Live neatbalstīs balsi ar video vai ekrāna kopīgošanu ChatGPT, taču mēs strādājam, lai drīzumā ieviestu šīs iespējas. Joprojām varat piekļūt ChatGPT Voice mantotajām versijām, tostarp standarta un uzlabotajam balss režīmam, kur šīs funkcijas ir pieejamas.

Autors

OpenAI