Update Hulyo 31, 2026: Kasama na ngayon sa sinusuportahang audio na binuo gamit ang GPT‑Live sa pamamagitan ng ChatGPT Voice at OpenAI API ang SynthID watermarking. Ang aming pampublikong tool sa pagberipika ay nakakatukoy na ngayon ng mga OpenAI provenance signal sa mga sinusuportahang audio file, at ipinakilala namin ang API access para sa pagberipika upang maisama ng mga developer at organisasyon ang mga pagsusuri sa pinagmulan sa sarili nilang mga workflow. Nakabatay ang mga update na ito sa diskarteng pangkaligtasan na inilalarawan sa ibaba at sa mas malawak naming gawain upang gawing mas madaling matukoy ang nilalaman na binuo ng OpenAI.
Inilulunsad namin ang GPT‑Live, isang bagong henerasyon ng mga voice model na nagpaparamdam na mas parang totoong pag-uusap ang pakikipag-usap sa AI.
Nakabatay ang GPT‑Live sa full-duplex na arkitektura, ibig sabihin, kaya nitong makinig at magsalita nang sabay. Sa mga pag-uusap, maipapakita ng GPT‑Live na nakikinig ito sa pamamagitan ng mga pariralang gaya ng “mhmm” o “oo,” makipagpalitan nang mabilis, o manahimik lang kapag kailangan mo ng sandaling mag-isip. Ang resulta ay isang voice experience na nakakapanibagong magaang kausap.
Ang GPT‑Live din ang pinakamatalino naming voice model hanggang ngayon. Para sa mga tanong na nangangailangan ng paghahanap sa web, mas malalim na pangangatwiran, o mas kumplikadong gawain, ipinapasa nito ang gawain sa aming pinakabagong frontier na modelo sa likod ng eksena at ibinabalik ang resulta sa pag-uusap kapag handa na. Habang gumagana ito, kayang patuloy na makipag-usap sa iyo ng GPT‑Live at panatilihin ang daloy ng pag-uusap. Sa paglulunsad, gagamit ang GPT‑Live ng GPT‑5.5 sa background. Habang naglalabas kami ng mga bagong frontier na modelo, tuloy-tuloy naming ia-update ang modelong ginagamit ng GPT‑Live.
Ang mga pagsulong na ito ang nagpapagana sa isang bagong ChatGPT Voice experience na mas matalino at mas natural gamitin. Sa paglipas ng panahon, naniniwala kaming bubuksan din ng pananaliksik na ito ang kakayahang gumamit ng boses para sa mga gawaing papalaking kumplikado, mas matagal, at mas agentic.
Sinisimulan naming ilunsad ngayon sa mga user ng ChatGPT sa buong mundo ang dalawang bersyon ng GPT‑Live – GPT‑Live‑1 at GPT‑Live‑1 mini. Plano rin naming dalhin ang mga ito sa API sa lalong madaling panahon, at maaaring mag-sign up ang mga developer at enterprise para maabisuhan gamit ang form na ito.
Pagpasok sa bagong panahon ng interaksyon ng tao at AI
Ang bisyon namin ay gawing posible ang tunay na natural na interaksyon ng tao at AI: isang mundong ang pakikipagtulungan sa AI ay kasing-dulas at kasing-responsibo ng pakikipagtulungan sa ibang tao, habang maayos na nangyayari sa background ang pangangatwiran at pagsasagawa ng mga kumplikadong gawain.
Mga naunang diskarte
Inilapit tayo ng mas matatandang henerasyon ng mga voice AI system sa bisyong iyon, pero may mahahalagang kapalit.
Mga cascaded na system ng boses
Umaasa ang mga cascaded na system ng boses sa serye ng mga modelo na kumikilos nang sunod-sunod para iproseso ang bawat turn. Pinagdugtong ng orihinal na ChatGPT Voice ang tatlong modelo: isang speech-to-text na modelo para i-transcribe ang iyong sinasabi, isang malaking language model para gumawa ng tugon, at isang text-to-speech na modelo para ibalik ito sa pagsasalita. Dahil sa diskarteng ito, nakausap natin ang mga frontier na AI model sa unang pagkakataon, pero may kapalit ang pagiging kumplikado nito: maaaring mawala ang impormasyon sa pagitan ng mga modelo, at mabagal at hindi natural ang mga tugon.
Naka-cascade na voice system
Mabagal at hindi natural na mga tugon, mahahabang paghinto
Mga turn-based na voice model
Ang mga turn-based na voice model tulad ng Advanced na Voice Mode ng ChatGPT ay nagproseso at gumawa ng audio sa loob ng iisang modelo, kaya nabawasan ang latency at naging mas maayos ang mga pag-uusap — pero gumana pa rin ang mga ito sa hiwa-hiwalay na turn. Kailangang hintayin ng modelo na tumigil magsalita ang user bago tumugon, kaya naging matigas ang palitan. Bukod pa rito, dahil nakabatay sa katahimikan ang pagtukoy ng turn, kahit maikling paghinto o ingay sa background ay maaaring mapagkamalang katapusan ng turn — kaya napapaputol ang modelo sa hindi natural na mga sandali.
Turn-based na modelo ng boses
Bahagyang mas mabilis at mas maayos ang mga tugon, pero ang palitan ng usapan sa modelo ay nananatiling mahigpit pa rin
Ang bago naming diskarte
Tinutugunan ng GPT‑Live ang mga limitasyong ito sa pamamagitan ng dalawang pagbabago sa arkitektura.
Tuloy-tuloy na interaksyon
Una, binuo namin ang GPT‑Live para sa tuloy-tuloy na interaksyon gamit ang full-duplex na arkitektura. Sa halip na magproseso ng magkakahiwalay na mensahe, tuloy-tuloy na pinoproseso ng GPT‑Live ang input habang gumagawa ng output. Kaya nakakapagdesisyon ang modelo tungkol sa interaksyon nang maraming beses kada segundo: kung magsasalita, patuloy na makikinig, hihinto muna, sasabat, o tatawag ng tool.
Dahil dito, mas natural na nakikipagpalitan ang modelo, mas mahusay na nasusundan ang oras, at nakakapagsagawa pa ng live na pagsasalin
Tuloy-tuloy na interaksyon
Mabilis, natural, ekspresibong mga tugon at mas aktibong pakikinig
Pagde-delegate para sa mas malalim na gawain
Ikalawa, inihiwalay namin ang GPT‑Live — na nangangasiwa sa tuloy-tuloy na interaksyon — mula sa mas malalim na gawain. Kapag nangangailangan ang isang tanong ng paghahanap, pangangatwiran, o mas agentic na kakayahan, maaaring i-delegate ng GPT‑Live ang gawain sa ibang modelo tulad ng GPT‑5.5. Dahil dito, napapanatili nito ang tuloy-tuloy na pag-uusap habang pinangangasiwaan ang maraming gawain sa background.
Pinapahintulutan din ng pagbabagong ito sa arkitektura ang GPT‑Live na tuloy-tuloy na gumamit ng pinakabagong mga modelo at agent, na pinagsasama ang frontier intelligence at natural na interaksyon.
Delegation para sa mas malalim na gawain
Nagbibigay ang GPT-Live ng mabilis at natural na mga tugon, habang pinangangasiwaan ng GPT-5.5 ang paghahanap sa background
Mga pagsusuri
Bumuo kami ng mga bagong pagsusuring pantao para sukatin kung gaano kaaya-aya at gaano kadaloy ang pag-uusap. Sa mga head-to-head na paghahambing na ito, mas malinaw na pinipili ang GPT‑Live‑1 at GPT‑Live‑1 mini kaysa Advanced Voice Mode sa magkatugmang 5–10 minutong pag-uusap na sumusukat sa pangkalahatang preference, turn-taking, interruptions, daloy ng usapan, at kung gaano kanatural ang bawat interaksyon.
- GPQA: Malaki ang lamang ng GPT‑Live‑1 sa Advanced Voice Mode sa GPQA, na sumusubok sa expert-level na siyentipikong pangangatwiran sa biology, chemistry, at physics.
- BrowseComp: Nagpapakita ang GPT‑Live‑1 ng malalaking pag-angat kumpara sa Advanced Voice Mode sa BrowseComp, na sumusubok sa agentic na paghahanap sa web at sa kakayahang makahanap ng impormasyong mahirap matukoy ang lokasyon.
- τ³-Voice Telecom (internal variant)**: Nangunguna ang GPT‑Live‑1 kumpara sa Advanced Voice Mode sa τ³-Voice Telecom, na sumusubok sa mga voice agent sa makatotohanang, multi-turn na mga gawain sa telecom support.
* Ginagamit ng GPT‑Live‑1 (instant) at GPT‑Live‑1 mini ang GPT‑5.5 Instant na modelo sa background, habang ginagamit ng GPT‑Live‑1 Medium at GPT‑Live‑1 High ang GPT‑5.5 Thinking na modelo na may medium at high na pagsisikap sa pangangatwiran.
** Gumamit kami ng naka-customize na modelo ng user, na pinapagana ng aming mga pinakabagong nangangatwirang modelo, para sa pagsusuring ito.
Isang bagong karanasan sa ChatGPT Voice
Bawat linggo, mahigit 150 milyong tao ang nakikipag-usap sa ChatGPT gamit ang mga feature tulad ng Voice at Dictation. Ginagamit nila ito para makakuha ng pang-araw-araw na tulong nang hands-free, magpraktis ng mga wika, magkuwento bago matulog, o makipagkuwentuhan lang habang bumibiyahe.
Simula ngayon, kapag tina-tap mo ang Voice button para makipag-usap sa ChatGPT, makakakuha ka ng pinahusay na karanasang pinapagana ng GPT‑Live—na may mas natural na mga pag-uusap, mas matatalinong sagot, mas mahusay na pakikinig, at mga visual na tugon.
Mas natural na mga pag-uusap
Mas mararamdaman na ngayon na parang totoong pag-uusap ang pakikipag-usap sa ChatGPT. Maaari kang sumingit ng tanong, huminto sandali para ayusin ang iniisip mo, o hilingin sa ChatGPT na bagalan ang pagsasalita. Natural nitong kinikilala ang sinasabi mo gamit ang mga pariralang tulad ng “mhmm” o “sige,” kaya alam mong nakakasunod ito. Ni-remaster din namin ang siyam na natatanging boses sa ChatGPT para sa GPT‑Live.
Mas matatalinong sagot
Makakagamit na ngayon ang ChatGPT Voice ng aming pinakabagong mga frontier na modelo, kaya makakakuha ka ng mas matatalinong sagot kapag kailangan mo. Maaari mo ring piliin ang antas ng pangangatwiran na akma sa iyong pangangailangan: Instant para sa mabilis na tugon, o Medium at High kapag gusto mong maglaan ang ChatGPT ng mas maraming oras sa pag-iisip.
Mas mahusay na pakikinig
Kung maglalaan ka ng sandali para mag-isip, maghihintay na ngayon ang ChatGPT Voice sa halip na agad sumingit at mang-abala. Kung hihilingin mong manatili itong tahimik at makinig, gagawin nito iyon. At kapag may ingay sa paligid, tulad ng dumaraang trapiko o mga usapan sa malapit, mas mahusay ang ChatGPT sa pagtutok sa boses mo sa halip na ma-distract.
Mga visual na sagot sa isang sulyap
Mas kapaki-pakinabang ang ilang sagot kapag nakikita mo ang mga ito. Habang nakikipag-usap ka, maaari na ngayong magpakita ang ChatGPT ng mayamang mga visual card para sa mga paksang tulad ng lagay ng panahon, stocks, sports, at iba pa. Patuloy ding sinusuportahan ng Voice ang paghahanap, memory, mga larawan, at pag-upload ng file.



Ang resulta ay isang karanasan sa ChatGPT Voice na mas natural, mas may kakayahan, at mas kapaki-pakinabang sa pang-araw-araw na buhay.
Kaligtasang idinisenyo para sa boses
Idinisenyo ang GPT‑Live na maging ligtas bilang default. Binubuo ito mula sa mga pagsulong sa kaligtasan ng aming pinakabagong mga modelo, habang nagdaragdag ng nakatuong pagsasanay sa kaligtasan sa mahahalagang larangan ng panganib at mga bagong proteksyong partikular na idinisenyo para sa boses.
Pinalawak na pagsusuri sa kaligtasan
Para mas maipakita kung paano ginagamit ng mga tao ang boses sa totoong buhay, nagsimula kami sa pagpapalawak ng aming pagsusuri sa kaligtasan para isama ang mga bagong audio-native na evaluation. Gumawa rin kami ng mga synthetic evaluation na gumagamit ng generated audio para mas masusing pagtuunan ang mahahalagang larangan ng kaligtasan, batay sa natutuhan namin mula sa advanced na voice mode. Kabilang sa mga larangang iyon ang pananakit sa sarili, psychosis at mania, emosyonal na pagdepende sa AI, karahasan, at sekswal na content. Ni-red-team din ng mga internal na eksperto ang modelo para sa mga panganib na natatangi sa boses.
Sa aming pagsusuri, halos kapantay o mas mahusay ang performance ng GPT‑Live kaysa sa Advanced na Voice Mode sa halos lahat ng larangang sinuri namin. Maaari kang magbasa pa tungkol sa aming pagsusuri at mga proteksyon sa GPT‑Live card ng system(magbubukas sa bagong window).
Mga built-in na proteksyon
Dahil nangyayari nang real time ang mga pag-uusap sa boses, gumawa rin kami ng mga proteksyong maaaring kumilos habang nagsasalita ang modelo. Kapag naka-detect ang system ng posibleng hindi ligtas na output, maaari nitong gabayan ang modelo tungo sa mas ligtas na tugon, magpakita ng karagdagang mensahe o resource sa kaligtasan, o tapusin ang pag-uusap sa boses sa mga kasong mas mataas ang panganib. Para sa mga pag-uusap na may kinalaman sa pananakit sa sarili, iniangkop namin para sa boses ang mga support flow ng ChatGPT, kabilang ang pag-aalok ng crisis helpline support na sinuri ng mga eksperto.
Nagdisenyo kami ng karagdagang mga proteksyon para suportahan ang mga teen user, at direktang sinanay sa modelo ang pag-uugaling angkop sa edad para mabawasan ang panganib ng hindi naaangkop na mga tugon. Maaaring piliin ng mga magulang kung magagamit ng kanilang teen ang ChatGPT Voice sa pamamagitan ng Kontrol ng Magulang, at maaaring maabisuhan ang mga naka-link na magulang sa mga sitwasyong mas mataas ang panganib na may mga palatandaan ng posibleng pananakit sa sarili o intensiyong magpakamatay.
Pagkatuto mula sa paggamit sa totoong mundo
Naglulunsad din kami ng mas pangmatagalang pagsukat at post-launch monitoring na nakatuon sa emosyonal na pagdepende para patuloy na pagbutihin ang aming pag-unawa at pinuhin ang mga proteksyon. Batay sa aming naunang pananaliksik tungkol sa affective use at emosyonal na well-being, makakatulong ito sa amin na tukuyin ang mga umuusbong na pattern at pagbutihin kung paano tumutugon ang system sa mga emosyonal na sensitibong pakikipag-ugnayan.
Panghuli, idinisenyo ang GPT‑Live para sa pag-uusap, hindi para sa paggaya ng boses. Gumagamit ito ng isang set ng mga predefined na boses sa ChatGPT, na may mga proteksyon para pigilan itong gayahin ang boses ng isang totoong tao.
Nakatuon kami sa pagsuporta sa kaligtasan at well-being, at patuloy naming palalakasin ang mga proteksyong ito habang natututo kami mula sa paggamit sa totoong mundo.
Availability at mga limitasyon
Inilulunsad na ngayon ang GPT‑Live sa mga user ng ChatGPT sa buong mundo sa iOS, Android, at ChatGPT.com(magbubukas sa bagong window). Magiging default na modelo ang GPT‑Live‑1 na magpapagana sa ChatGPT Voice para sa mga user ng Go, Plus, at Pro, at magiging default naman ang GPT‑Live‑1 mini para sa mga Free user. Makikita ang higit pang detalye tungkol sa availability sa aming Help Center(magbubukas sa bagong window).
In-optimize namin ang GPT‑Live para sa ilan sa mga pinakasikat na wika sa ChatGPT. Para sa ilang wika, maaaring magkaroon ang modelo ng accent na hindi native o mga puwang sa fluency. Aktibo kaming nagtatrabaho para mapahusay ang karanasan sa iba’t ibang wika.
Sa launch, hindi susuportahan ng GPT‑Live ang boses na may video o screen sharing sa ChatGPT, pero nagtatrabaho kami para maipakilala ang mga kakayahang ito sa lalong madaling panahon. Maa-access mo pa rin ang mga legacy na bersiyon ng ChatGPT Voice, kabilang ang Standard at Advanced na Voice Mode, kung saan available ang mga feature na ito.


