[RUANG LETAK: Tarikh penerbitan akan disahkan.]
[RUANG LETAK: Video testimoni Yelp—video akhir, imej kecil, kapsyen dan transkrip masih belum tersedia.]
Hari ini, kami membawakan GPT‑Live‑1 kepada API, memberikan pembangun model suara berkuasa yang boleh digabungkan dengan kecerdasan termaju dalam aplikasi mereka sendiri. Pertama kali diperkenalkan dalam ChatGPT, GPT‑Live‑1 mampu mendengar dan bercakap serentak serta, seperti yang ditunjukkan melalui Codex dan ChatGPT Kerja(dibuka dalam tetingkap baru), boleh menyerahkan penaakulan dan tindakan yang lebih mendalam kepada model serta alat yang digandingkan dengannya.
Untuk pelancaran GPT‑Live dalam API, kami menumpukan pada keupayaan baharu yang membolehkan pembangun membentuk pengalaman suara mengikut pengguna, aliran kerja dan matlamat mereka. Contohnya, dalam penilaian awal, aplikasi pembelajaran bahasa Speak mendapati bahawa GPT‑Live‑1 mengurangkan gangguan ketika pelajar berhenti sejenak untuk berfikir sebanyak hampir 80% berbanding sistem berasaskan giliran terdahulu—memberi pelajar lebih banyak ruang untuk mencari kata-kata sebelum tutor mencelah.
Pelancaran API ini menambahkan:
Pengendalian gangguan: Satu model menaakul audio masuk dan keluar secara serentak, sekali gus mengelakkan kependaman dan penyerahan rapuh dalam seni bina STT–LLM–TTS berantai.
Orkestrasi ejen: Mengikuti panduan berbilang langkah dengan lebih andal, melaksanakan panggilan alat tersuai dan menyerahkan penaakulan atau tindakan yang lebih mendalam kepada model bahagian belakang atau harnes ejen pilihan pembangun.
Suara tersuai: Menambahkan [XX—bilangan belum ditentukan] suara tersuai baharu merentas [YY—bahasa belum ditentukan] bahasa, membantu jenama mencipta pengalaman suara yang semula jadi dan tersendiri dalam pelbagai bahasa serta dialek.
Kawalan personaliti: Membolehkan pembangun membentuk nada, rentak dan gaya perbualan ejen melalui prom sistem.
Pengurusan konteks senyap & hingar latar: Mengendalikan hingar latar dan kesenyapan dengan lebih baik tanpa mengganggu perbualan atau menyebut setiap langkah dengan kuat.
Kecerdasan fleksibel: Membolehkan pembangun memilih mana-mana model bahagian belakang atau harnes ejen yang sesuai dengan aliran kerja mereka.
Kebolehpercayaan sesi panjang: Meningkatkan pengekalan konteks dan kualiti perbualan sepanjang interaksi yang berlanjutan.
Sokongan telefoni: Membolehkan penggunaan ejen suara dupleks penuh untuk panggilan telefon, daripada tempahan restoran hingga sokongan pelanggan.

[RUANG LETAK: Demo suara interaktif—reka bentuk contoh sumber ditunjukkan; pengalaman akhir GPT‑Live‑1 masih belum tersedia.]
Ejen suara tradisional menggabungkan pertuturan kepada teks, model penaakulan dan teks kepada pertuturan. Setiap penyerahan menambah kependaman dan meningkatkan risiko kehilangan pemasaan, konteks atau rentak semula jadi perbualan. Pembangun sering perlu menyelaraskan sendiri semua peringkat tersebut, termasuk perkara yang berlaku apabila seseorang mencelah, berhenti sejenak atau menukar haluan.
GPT‑Live‑1 mengendalikan pendengaran dan pertuturan dalam satu model, sekali gus memudahkan lapisan suara langsung. Ia boleh memberikan respons kepada gangguan dan pengakuan semasa perkara itu berlaku, sambil menyerahkan penaakulan yang lebih mendalam kepada bahagian belakang. Ini membolehkan perbualan diteruskan sementara tugasan dilaksanakan di latar belakang.
Pembangun memilih model, alat dan harnes ejen di sebalik perbualan. Contohnya, mereka boleh menggandingkan GPT‑Live‑1 dengan model seperti Luna untuk tugasan berjumlah tinggi seperti penjadualan atau kemas kini pesanan, dan menggunakan model seperti Astra untuk isu pelanggan rumit yang memerlukan penaakulan. Fleksibiliti itu membolehkan pembangun memadankan kedalaman penaakulan, kelajuan dan kos dengan setiap tugasan.
GPT‑Llive‑1 menyediakan transkrip ASR dan teks respons secara natif. Ia juga menawarkan pemahaman abjad angka yang kukuh dan menyokong pemberatan kata kunci. Walaupun GPT‑live bukan model berasaskan giliran, ia menyokong pengesanan giliran secara natif, jadi pembangun boleh terus membina berdasarkan sempadan giliran yang jelas.
[RUANG LETAK: Perbandingan audio sebelah menyebelah antara GPT‑Live‑1 dengan sistem suara lata—fail audio dan transkrip masih belum tersedia.]
Dalam semua penilaian kami, GPT‑Live‑1 yang digandingkan dengan GPT‑6 Astra pada tahap usaha penaakulan Sederhana menduduki tempat pertama dalam Tau3, yang mengukur kecerdasan ejen suara termaju bagi tugasan hujung ke hujung, dan tempat pertama dalam Full Duplex Bench, yang menilai interaktiviti, kependaman giliran bercakap, panggilan alat dan kualiti respons.

Pembangun memerlukan suara yang sesuai dengan produk mereka dan kedengaran semula jadi kepada penggunanya. Dengan GPT‑Live‑1, kami memperluas pilihan daripada sebilangan kecil suara masa nyata kepada pelbagai loghat, dialek dan bahasa, sekali gus memberi pembangun lebih banyak pilihan untuk suara pembantu mereka.
Quartz—bahasa Inggeris Australia, feminin, dijana
Ripple—bahasa Inggeris Australia, maskulin, semula jadi
Vesper—bahasa Inggeris British, maskulin, semula jadi
Willow—bahasa Inggeris Ireland, feminin, semula jadi
Stone—bahasa Inggeris Ireland, maskulin, semula jadi
Gleam—bahasa Inggeris Amerika Utara, feminin, semula jadi
Meridian—bahasa Inggeris Amerika Utara, maskulin, semula jadi
Bossa—bahasa Portugis Brazil, feminin, semula jadi
Tempo—bahasa Portugis Brazil, maskulin, semula jadi
Aster—bahasa Inggeris India, feminin, dijana
Beacon—bahasa Inggeris Filipina, maskulin, dijana
Delta—bahasa Inggeris Selatan A.S., feminin, dijana
Cinder—bahasa Inggeris Selatan A.S., maskulin, dijana
[RUANG LETAK: Pemilih suara dengan 3–5 ayat sampel berulang bagi setiap suara—sampel audio dan pengalaman interaktif masih belum tersedia.]
Kami akan terus menambah pilihan suara dan ketersediaan bahasa dalam beberapa bulan akan datang.
GPT‑Live‑1 kini tersedia dalam API pada harga $0.05 seminit untuk lapisan suara bahagian hadapan. Gandingkannya dengan model bahagian belakang dan harnes ejen yang sesuai dengan produk anda, kemudian bina pengalaman suara yang boleh diskalakan mengikut tugasan yang perlu dilaksanakan.
Untuk mengakses suara tersuai, hubungi bahagian jualan bagi mengetahui lebih lanjut tentang kelayakan dan proses permohonan.
Anda boleh bermula dengan GPT‑Live‑1 dengan lebih pantas menggunakan Presence, yang menyokong pengalaman masa nyata merentas suara dan sembang, seperti sokongan pelanggan, jualan keluar dan aliran kerja dalaman berisiko tinggi. Hubungi pengarah akaun OpenAI anda untuk mengetahui lebih lanjut.


