OpenAI

8 Julai 2026

ProdukSiaran

Memperkenalkan GPT‑Live

Generasi baharu model suara untuk interaksi manusia-AI yang semula jadi, kini menguasakan ChatGPT Voice.

Memuat…

Kami melancarkan GPT‑Live, generasi baharu model suara yang membuatkan bercakap dengan AI terasa lebih seperti perbualan sebenar.

GPT‑Live dibina pada seni bina dupleks penuh, bermakna ia boleh mendengar dan bercakap pada masa yang sama. Semasa perbualan, GPT‑Live boleh menunjukkan bahawa ia memberi perhatian dengan frasa seperti “mhmm” atau “ya”, terlibat dalam balasan pantas, atau sekadar berdiam diri apabila anda memerlukan masa untuk berfikir. Hasilnya ialah pengalaman suara yang amat mudah untuk diajak berbual.

GPT‑Live juga ialah model suara kami yang paling pintar setakat ini. Untuk soalan yang memerlukan carian web, penaakulan lebih mendalam atau kerja yang lebih kompleks, ia mendelegasikan tugas kepada model termaju terkini kami di sebalik tabir dan membawa hasilnya kembali ke dalam perbualan apabila sudah sedia. Sementara ia bekerja, GPT‑Live boleh terus berbual dengan anda dan mengekalkan aliran perbualan. Pada pelancaran, GPT‑Live akan menggunakan GPT‑5.5 di latar belakang. Apabila kami mengeluarkan model termaju baharu, kami akan terus mengemas kini model yang digunakan oleh GPT‑Live.

Kemajuan ini menggerakkan pengalaman Suara ChatGPT baharu yang lebih pintar dan lebih semula jadi untuk digunakan. Dari masa ke masa, kami percaya penyelidikan ini juga akan membuka keupayaan menggunakan suara untuk kerja yang semakin kompleks, mengambil masa lebih panjang dan lebih bersifat agen.

Kami mula melancarkan dua versi GPT‑Live – GPT‑Live‑1 dan GPT‑Live‑1 mini – kepada pengguna ChatGPT di seluruh dunia hari ini. Kami juga merancang untuk membawanya ke API tidak lama lagi, dan pembangun serta perusahaan boleh mendaftar untuk dimaklumkan menggunakan borang ini.

Memasuki era baharu interaksi manusia-AI

Visi kami adalah untuk membolehkan interaksi manusia–AI yang benar-benar semula jadi: dunia di mana bekerjasama dengan AI terasa selancar dan seresponsif bekerja dengan orang lain, sementara penaakulan dan pelaksanaan tugas kompleks berlaku dengan lancar di latar belakang.

Pendekatan terdahulu

Generasi lama sistem AI suara membawa kami lebih hampir kepada visi itu, tetapi dengan kompromi yang ketara.

Sistem suara berangkai

Sistem suara berangkai bergantung pada satu siri model yang bertindak satu demi satu untuk memproses setiap giliran. ChatGPT Voice yang asal merangkaikan tiga model: model pertuturan-ke-teks untuk mentranskripsikan ucapan anda, model bahasa besar untuk menghasilkan respons, dan model teks-ke-pertuturan untuk menukarnya semula kepada pertuturan. Pendekatan ini membolehkan kami bercakap dengan model AI termaju buat kali pertama, tetapi kerumitannya membawa kos: maklumat boleh hilang merentas model, dan respons menjadi perlahan serta kaku.

Sistem suara berangkai

Respons perlahan dan kaku, jeda yang panjang

Transkrip
Contoh perbualan dengan Mod Suara Standard, menggunakan GPT-5.5 Instant

Model suara berasaskan giliran

Model suara berasaskan giliran seperti Mod Suara Lanjutan ChatGPT memproses dan menjana audio dalam satu model, mengurangkan kependaman dan menjadikan perbualan lebih lancar — tetapi ia masih beroperasi melalui giliran yang berasingan. Model perlu menunggu pengguna berhenti bercakap sebelum memberi respons, menyebabkan interaksi ulang-alik terasa kaku. Selain itu, kerana pengesanan giliran berasaskan senyap, jeda singkat atau bunyi latar sekalipun boleh disalah anggap sebagai tamat giliran — menyebabkan model mencelah pada masa yang tidak semula jadi.

Model suara berasaskan giliran

Respons sedikit lebih pantas dan lancar, tetapi interaksi ulang-alik dengan model masih terasa kaku

Transkrip
Contoh perbualan dengan Mod Suara Lanjutan ChatGPT

Pendekatan baharu kami

GPT‑Live menangani batasan ini melalui dua perubahan seni bina.

Interaksi berterusan

Pertama, kami membina GPT‑Live untuk interaksi berterusan menggunakan seni bina dupleks penuh. Daripada memproses urutan mesej yang berasingan, GPT‑Live memproses input secara berterusan sambil menjana output. Oleh itu, model boleh membuat keputusan interaksi berkali-kali setiap saat: sama ada untuk bercakap, terus mendengar, berhenti seketika, mencelah atau memanggil alat.

Ini membolehkan model terlibat dalam interaksi ulang-alik yang lebih semula jadi, mengekalkan rasa masa yang lebih baik, malah melakukan terjemahan langsung.

Interaksi berterusan

Respons pantas, semula jadi dan ekspresif serta pendengaran yang lebih aktif

Transkrip
Contoh perbualan dengan GPT-Live-1, menggunakan GPT-5.5 Instant

Pendelegasian untuk kerja yang lebih mendalam

Kedua, kami memisahkan GPT‑Live — yang mengendalikan interaksi berterusan — daripada kerja yang lebih mendalam. Apabila soalan memerlukan carian, penaakulan atau keupayaan yang lebih bersifat agen, GPT‑Live boleh mendelegasikan tugas itu kepada model lain seperti GPT‑5.5. Ini membolehkannya meneruskan perbualan, walaupun ia mengendalikan berbilang tugas di latar belakang.

Perubahan seni bina ini juga membolehkan GPT‑Live terus menggunakan model dan agen terkini, menggabungkan kecerdasan termaju dengan interaksi semula jadi.

Perwakilan untuk kerja yang lebih mendalam

GPT-Live memberikan respons pantas dan semula jadi, sementara GPT-5.5 mengendalikan carian di latar belakang

Transkrip
Contoh perbualan dengan GPT-Live-1, menggunakan GPT-5.5 Instant

Penilaian

Kami membina penilaian manusia baharu untuk mengukur keselesaan dan aliran perbualan. Dalam perbandingan secara langsung ini, GPT‑Live‑1 dan GPT‑Live‑1 mini jauh lebih digemari berbanding Mod Suara Lanjutan dalam perbualan 5–10 minit yang sepadan, yang mengukur keutamaan keseluruhan, pengambilan giliran, gangguan, aliran perbualan dan sejauh mana setiap interaksi terasa semula jadi.

  • GPQA: GPT‑Live‑1 mengatasi Mod Suara Lanjutan dengan ketara pada GPQA, yang menguji penaakulan saintifik tahap pakar merentas biologi, kimia dan fizik.
  • BrowseComp: GPT‑Live‑1 menunjukkan peningkatan besar berbanding Mod Suara Lanjutan pada BrowseComp, yang menguji carian web bersifat agen dan keupayaan mencari maklumat yang sukar ditemui.
  • τ³-Voice Telecom (varian dalaman)**: GPT‑Live‑1 mengatasi Mod Suara Lanjutan pada τ³-Voice Telecom, yang menguji ejen suara pada tugas sokongan telekom yang realistik dan berbilang giliran.

* GPT‑Live‑1 (segera) dan GPT‑Live‑1 mini menggunakan model GPT‑5.5 Instant di latar belakang, manakala GPT‑Live‑1 Medium dan GPT‑Live‑1 High menggunakan model GPT‑5.5 Thinking dengan usaha penaakulan sederhana dan tinggi.

** Kami menggunakan model pengguna tersuai, dikuasakan oleh model penaakulan terbaharu kami, untuk penilaian ini.

Pengalaman ChatGPT Voice yang baharu

Setiap minggu, lebih 150 juta orang bercakap dengan ChatGPT menggunakan ciri seperti Voice dan Dictation. Mereka menggunakannya untuk mendapatkan bantuan harian tanpa tangan, berlatih bahasa, bercerita sebelum tidur, atau sekadar berbual semasa berulang-alik.

Mulai hari ini, apabila anda mengetik butang Voice untuk bercakap dengan ChatGPT, anda akan mendapat pengalaman yang dipertingkatkan dikuasakan oleh GPT‑Live—dengan perbualan yang lebih semula jadi, jawapan lebih pintar, pendengaran lebih baik, dan respons visual.

Perbualan yang lebih semula jadi

Berbual dengan ChatGPT kini sepatutnya terasa lebih seperti perbualan sebenar. Anda boleh menyampuk dengan soalan, berhenti sejenak untuk menyusun fikiran, atau meminta ChatGPT memperlahankan percakapannya. Ia mengakui kata-kata anda secara semula jadi dengan frasa seperti “mhmm” atau “faham”, supaya anda tahu ia sedang mengikuti perbualan. Kami juga telah menguasai semula sembilan suara berbeza dalam ChatGPT untuk GPT‑Live.

Jawapan yang lebih pintar

ChatGPT Voice kini boleh memanfaatkan model frontier terkini kami, memberikan jawapan yang lebih pintar apabila anda memerlukannya. Anda juga boleh memilih tahap penaakulan yang sesuai dengan keperluan anda: Instant untuk respons pantas, atau Medium dan High apabila anda mahu ChatGPT meluangkan lebih masa untuk berfikir.

Pendengaran yang lebih baik

Jika anda mengambil masa sejenak untuk berfikir, ChatGPT Voice kini akan menunggu dan bukannya terus mencelah. Jika anda memintanya diam dan mendengar, ia akan berbuat demikian. Dan apabila ada bunyi latar, seperti kenderaan lalu-lalang atau perbualan berdekatan, ChatGPT lebih baik menumpukan perhatian pada suara anda tanpa terganggu.

Jawapan visual sepintas lalu

Sesetengah jawapan lebih berguna apabila anda boleh melihatnya. Semasa anda bercakap, ChatGPT kini boleh memaparkan kad visual kaya untuk topik seperti cuaca, saham, sukan, dan banyak lagi. Voice juga terus menyokong carian, memori, imej, dan muat naik fail.

Hasilnya ialah pengalaman ChatGPT Voice yang terasa lebih semula jadi, lebih berkeupayaan, dan lebih berguna dalam kehidupan seharian.

Keselamatan yang direka untuk suara

GPT‑Live direka supaya selamat secara lalai. Ia dibina atas kemajuan keselamatan daripada model terkini kami sambil menambah latihan keselamatan khusus merentas bidang risiko utama dan perlindungan baharu yang direka khas untuk suara.

Ujian keselamatan yang diperluas

Untuk lebih mencerminkan cara orang menggunakan suara dalam keadaan kehidupan sebenar, kami bermula dengan memperluas ujian keselamatan kami untuk merangkumi penilaian baharu yang asli audio. Kami juga mencipta penilaian sintetik yang menggunakan audio terjana untuk memberi tumpuan lebih mendalam pada bidang keselamatan utama, berdasarkan apa yang kami pelajari daripada Advanced Voice Mode. Bidang tersebut termasuk mencederakan diri, psikosis dan mania, kebergantungan emosi pada AI, keganasan, dan kandungan seksual. Pakar dalaman juga menjalankan red team terhadap model untuk risiko yang unik kepada suara.

Dalam ujian kami, prestasi GPT‑Live setanding atau lebih baik daripada Advanced Voice Mode dalam hampir semua bidang yang kami nilai. Anda boleh membaca lanjut tentang ujian dan perlindungan kami dalam kad sistem(dibuka dalam tetingkap baru) GPT‑Live.

Perlindungan terbina dalam

Oleh sebab perbualan suara berlaku dalam masa nyata, kami juga membina perlindungan yang boleh bertindak ketika model sedang bercakap. Apabila sistem mengesan output yang berpotensi tidak selamat, ia boleh mengarahkan model ke arah respons yang lebih selamat, memaparkan mesej atau sumber keselamatan tambahan, atau menamatkan perbualan suara dalam kes berisiko lebih tinggi. Untuk perbualan yang melibatkan mencederakan diri, kami menyesuaikan aliran sokongan ChatGPT untuk suara, termasuk menawarkan sokongan talian bantuan krisis yang disemak pakar.

Kami mereka bentuk perlindungan tambahan untuk menyokong pengguna remaja, dan melatih tingkah laku sesuai umur terus ke dalam model bagi mengurangkan risiko respons yang tidak sesuai. Ibu bapa boleh memilih sama ada anak remaja mereka boleh menggunakan ChatGPT Voice melalui Parental Controls, dan ibu bapa yang dipautkan mungkin dimaklumkan dalam situasi berisiko lebih tinggi yang melibatkan tanda-tanda kemungkinan mencederakan diri atau niat membunuh diri.

Belajar daripada penggunaan dunia sebenar

Kami juga sedang melancarkan pengukuran jangka panjang dan pemantauan pascapelancaran yang tertumpu pada kebergantungan emosi untuk terus memperbaik pemahaman kami dan memperhalusi perlindungan. Berdasarkan penyelidikan terdahulu kami tentang penggunaan afektif dan kesejahteraan emosi, ini akan membantu kami mengenal pasti corak baharu dan menambah baik cara sistem bertindak balas dalam interaksi yang sensitif dari segi emosi.

Akhir sekali, GPT‑Live direka untuk perbualan, bukan penyamaran suara. Ia menggunakan set suara pratetap dalam ChatGPT, dengan perlindungan untuk menghalangnya daripada meniru suara orang sebenar.

Kami komited untuk menyokong keselamatan dan kesejahteraan, dan akan terus mengukuhkan perlindungan ini sambil kami belajar daripada penggunaan dunia sebenar.

Ketersediaan & batasan

GPT‑Live sedang dilancarkan kepada pengguna ChatGPT di seluruh dunia merentas iOS, Android, dan ChatGPT.com(dibuka dalam tetingkap baru). GPT‑Live‑1 akan menjadi model lalai yang menguasakan ChatGPT Voice untuk pengguna Go, Plus, dan Pro, manakala GPT‑Live‑1 mini akan menjadi lalai untuk pengguna Free. Butiran ketersediaan lanjut boleh didapati di Pusat Bantuan(dibuka dalam tetingkap baru) kami.

Kami telah mengoptimumkan GPT‑Live untuk beberapa bahasa paling popular dalam ChatGPT. Untuk bahasa tertentu, model mungkin mempunyai loghat bukan penutur jati atau jurang kefasihan. Kami sedang giat berusaha menambah baik pengalaman merentas bahasa.

Pada pelancaran, GPT‑Live tidak akan menyokong suara dengan video atau perkongsian skrin dalam ChatGPT, tetapi kami sedang berusaha memperkenalkan keupayaan ini tidak lama lagi. Anda masih boleh mengakses versi lama ChatGPT Voice, termasuk Standard dan Advanced Voice Mode, di tempat ciri ini tersedia.

Penulis

OpenAI