Kami memperkenalkan tiga model audio dalam API yang membuka kelas baharu aplikasi suara untuk pembangun. Dengan model ini, pembangun boleh membina pengalaman suara yang terasa lebih semula jadi, memberi respons dengan lebih pintar, dan mengambil tindakan dalam masa nyata:
- GPT‑Realtime‑2, model suara pertama kami dengan penaakulan kelas GPT‑5 yang boleh mengendalikan permintaan yang lebih sukar dan meneruskan perbualan secara semula jadi.
- GPT‑Realtime‑Translate, model terjemahan langsung baharu yang menterjemahkan pertuturan daripada lebih 70 bahasa input kepada 13 bahasa output sambil mengikuti rentak penutur.
- GPT‑Realtime‑Whisper, model pertuturan-ke-teks penstriman baharu yang mentranskripsi pertuturan secara langsung semasa penutur bercakap.
Cuba GPT-Realtime-2
Apa yang boleh saya tanya?
Selepas anda memulakan sesi, cuba katakan salah satu daripada yang berikut:
- Saya akan menganjurkan makan malam saat akhir malam ini. Saya mempunyai 30 minit, dua rakan vegetarian, seorang yang tidak suka cendawan, dan dapur kecil. Tolong bantu saya merancang menu yang ringkas.
- Saya sedang mengalu-alukan tetamu ke acara langsung di Jepun. Ucapkan selamat datang yang mesra dan semula jadi dalam bahasa Jepun — seperti seorang hos yang memulakan sesuatu yang istimewa.
- Nombor pesanan saya ialah Orbit-742Q. Ulang semula dengan jelas supaya saya boleh mengesahkan bahawa ia betul.
- Tolong saya berlatih untuk memberitahu pasukan saya bahawa kami telah mencapai titik penting pelancaran. Mula-mula ucapkan dengan keyakinan yang tenang, kemudian dengan lebih bersemangat.
- Saya sedang merancang kuiz trivia untuk perjalanan darat. Berikan saya tiga soalan perangkap yang kedengaran mudah tetapi mengelirukan, kemudian terangkan setiap jawapan dalam satu ayat.
Demo ini mempunyai had masa. Dengan menggunakannya, anda bersetuju dengan Terma OpenAI dan mengakui Dasar Privasi kami.
Suara menjadi salah satu cara paling semula jadi untuk orang ramai menggunakan perisian. Ia membolehkan seseorang meminta bantuan semasa memandu, mengubah pelan perjalanan semasa berjalan melalui lapangan terbang, mendapatkan sokongan dalam bahasa pilihan mereka, atau meneruskan tugas tanpa perlu berhenti untuk menaip.
Namun, membina produk suara yang berguna memerlukan lebih daripada sekadar pertukaran giliran yang pantas atau suara yang kedengaran semula jadi. Ejen suara perlu memahami maksud seseorang, menjejak konteks, menyesuaikan apabila permintaan berubah, menggunakan alat semasa perbualan berterusan, dan memberikan respons dengan cara yang sesuai pada ketika tersebut.
Secara bersama, model yang kami lancarkan ini membawa audio masa nyata daripada panggilan-dan-respons yang mudah ke arah antara muka suara yang benar-benar boleh melaksanakan tugas: mendengar, membuat penaakulan, menterjemah, mentranskripsi dan mengambil tindakan semasa perbualan berlangsung.
Apabila suara menjadi cara yang lebih semula jadi untuk menggunakan perisian, kita melihat pembangun membina berasaskan tiga corak yang sedang muncul dalam AI suara:
- Suara kepada tindakan, di mana individu boleh menerangkan keperluan mereka dan sistem boleh menaakul permintaan tersebut, menggunakan alat, dan menyelesaikan tugas. Sebagai contoh, Zillow sedang membangunkan pembantu yang boleh mendengar, menaakul, dan bertindak terhadap permintaan seperti: “Carikan saya rumah dalam lingkungan BuyAbility saya, elakkan jalan yang sibuk, dan jadualkan lawatan pada hari Sabtu.”
- Sistem-ke-suara, di mana perisian boleh menukar konteks menjadi panduan lisan secara langsung. Sebagai contoh, aplikasi perjalanan boleh secara proaktif memberitahu pengembara: “Penerbangan masuk anda tertunda, tetapi anda masih sempat menaiki penerbangan sambungan anda. Saya sudah menemui pintu berlepas yang baharu, memetakan laluan terpantas melalui terminal, dan beg anda masih dijangka akan dipindahkan.”
- Suara-ke-suara, di mana AI boleh membantu perbualan langsung diteruskan merentas bahasa, tugas atau konteks yang berubah. Sebagai contoh, Deutsche Telekom sedang membina pengalaman sokongan suara di mana pelanggan boleh bercakap dalam bahasa yang paling selesa mereka gunakan, sementara model menterjemahkan perbualan tersebut dalam masa sebenar.
Corak ini juga boleh berfungsi bersama-sama. Priceline sedang berusaha ke arah masa depan di mana pengembara boleh menguruskan keseluruhan perjalanan melalui suara: mencari penerbangan dan hotel secara perbualan, menangani perubahan seperti melaraskan tempahan hotel selepas kelewatan penerbangan, mendapatkan kemas kini masa nyata tentang masa menunggu TSA, dan menterjemahkan perbualan sebaik sahaja pengembara tiba di destinasi.
GPT‑Realtime‑2 dibina untuk interaksi suara secara langsung yang mana model tersebut memastikan perbualan terus berjalan sambil ia membuat pertimbangan melalui permintaan, memanggil alatan, mengendalikan pembetulan atau gangguan dan bertindak balas dengan cara yang sesuai dengan masa tersebut.
- Mukadimah: Pembangun boleh mendayakan frasa ringkas sebelum respons utama, seperti “biar saya semak itu” atau “sebentar sementara saya menelitinya,” supaya pengguna tahu ejen sedang memproses permintaan.
- Panggilan alat selari dan ketelusan alat: Model boleh memanggil berbilang alat serentak dan menjadikan tindakan tersebut dapat didengar dengan frasa seperti “menyemak kalendar anda” atau “mencarinya sekarang,” membantu ejen kekal responsif sambil menyelesaikan tugas.
- Tingkah laku pemulihan yang lebih mantap: Model ini boleh dipulihkan dengan lebih lancar dengan mengatakan perkara seperti “Saya menghadapi kesukaran dengan perkara itu buat masa ini,” dan bukannya gagal secara senyap atau mengganggu aliran perbualan.
- Konteks yang lebih panjang untuk aliran kerja agentik: Kami meningkatkan tetingkap konteks daripada 32K kepada 128K untuk menyokong sesi yang lebih panjang dan lebih koheren serta aliran tugas yang lebih kompleks.
- Pemahaman domain yang lebih kukuh: Model ini mengekalkan terminologi khusus dengan lebih baik, kata nama khas, istilah penjagaan kesihatan, dan perbendaharaan kata lain yang penting dalam persekitaran pengeluaran.
- Nada dan penyampaian yang lebih terkawal: Model ini boleh melaraskan nadanya dengan lebih baik—bercakap dengan tenang semasa menyelesaikan isu, secara empati apabila pengguna berasa kecewa, atau dengan ceria apabila mengesahkan tindakan yang berjaya.
- Usaha penaakulan boleh dilaraskan: Pembangun kini boleh memilih daripada tahap penaakulan minimum, rendah, sederhana, tinggi dan xtinggi, dengan rendah sebagai lalai, mengimbangkan kependaman yang lebih rendah untuk interaksi ringkas dengan penaakulan yang lebih teliti untuk permintaan yang kompleks.
Peningkatan ini terlihat dalam penilaian audio yang selari rapat dengan ejen suara produksi: GPT‑Realtime‑2 (high) mencatatkan skor 15.2% lebih tinggi pada Big Bench Audio untuk kecerdasan audio berbanding GPT‑Realtime‑1.5. GPT‑Realtime‑2 (xtinggi) mencatatkan skor 13.8% lebih tinggi pada Audio MultiChallenge untuk mengikuti arahan, meningkat berbanding GPT‑Realtime‑1.5 dan menunjukkan penaakulan, pengurusan konteks, dan kawalan yang lebih kukuh dalam perbualan langsung.
Big Bench Audio menilai keupayaan penaakulan mencabar dalam model bahasa yang menyokong input audio. Audio MultiChallenge(dibuka dalam tetingkap baru) menilai kecerdasan perbualan berbilang giliran dalam sistem dialog pertuturan, termasuk pematuhan arahan, integrasi konteks, konsisten kendiri dan pengendalian pembetulan pertuturan semula jadi.
Keajaiban GPT‑Realtime‑2 terserlah merentas pelbagai kes penggunaan:
Semasa ujian awal, perniagaan menggunakan GPT‑Realtime‑2 untuk membina ejen suara yang membantu pelanggan dan pekerja menyelesaikan urusan melalui perbualan semula jadi:
“Apa yang menonjol tentang GPT-Realtime-2 ialah kecerdasan dan kebolehpercayaan pemanggilan alat yang dibawanya kepada interaksi suara yang kompleks. Pada penanda aras berseteru kami yang paling sukar, ini bersamaan dengan peningkatan sebanyak 26 mata dalam kadar kejayaan panggilan selepas pengoptimuman prom (95% berbanding 69%). GPT-Realtime-2 juga secara ketara lebih teguh dari segi pematuhan Fair Housing, yang amat penting untuk perniagaan kami. Gabungan kecekapan agentik dan kekuatan kawalan inilah yang menjadikannya berdaya maju untuk suara produksi di Zillow.”
GPT‑Realtime‑Translate membantu pembangun membina pengalaman suara berbilang bahasa secara langsung, di mana setiap orang boleh bertutur dalam bahasa pilihan mereka, mendengar perbualan yang diterjemahkan dalam masa nyata dan membaca transkripsi masa nyata. Ia menyokong lebih daripada 70 bahasa input dan 13 bahasa output, menjadikannya berguna untuk sokongan pelanggan, jualan rentas sempadan, pendidikan, acara, media dan platform pencipta yang memberikan perkhidmatan kepada khalayak global.
Bagi pembangun, terjemahan langsung perlu mengekalkan makna sambil mengikuti rentak penutur, walaupun apabila orang bercakap secara semula jadi, menukar konteks, atau menggunakan sebutan serantau dan bahasa khusus domain. Sebagai contoh, Deutsche Telekom sedang menguji model ini untuk interaksi suara pelbagai bahasa, di mana kependaman yang lebih rendah dan kelancaran yang lebih baik dapat menjadikan perbualan rentas bahasa terasa lebih semula jadi.
Dalam video ini, Vimeo menunjukkan cara GPT‑Realtime‑Translate boleh menterjemah video pendidikan produk secara langsung semasa ia dimainkan, supaya pelanggan global boleh mendengar kemas kini dalam bahasa pilihan mereka tanpa perlu menunggu versi yang dihasilkan secara berasingan.
“Membina AI suara untuk India bermaksud menangani fonetik serantau yang pelbagai. Dalam penilaian kami merentas Hindi, Tamil dan Telugu, GPT-Realtime-Translate memberikan Kadar Ralat Perkataan (WER) 12.5% lebih rendah daripada mana-mana model lain yang kami uji, bersama-sama dengan kadar sandaran yang lebih rendah, penyelesaian tugas yang lebih tinggi dan kependaman yang mengekalkan perbualan semula jadi. Ia menetapkan standard baharu untuk AI suara berbilang bahasa.”
GPT‑Realtime‑Whisper ialah model transkripsi penstriman baharu yang dibina untuk pertuturan-ke-teks kependaman rendah. Ia mentranskripsi audio semasa orang bercakap, jadi produk masa nyata boleh berasa lebih pantas, lebih responsif, dan lebih semula jadi—daripada kapsyen yang muncul pada saat itu, hingga nota mesyuarat yang mengikuti rentak perbualan.
Model ini menjadikan pertuturan langsung boleh digunakan dalam aliran kerja perniagaan semasa ia berlaku. Pasukan boleh menjana kapsyen untuk mesyuarat, bilik darjah, siaran, dan acara; menjana nota dan ringkasan semasa perbualan masih berlangsung; bina ejen suara yang perlu memahami pengguna secara berterusan; dan mencipta aliran kerja susulan yang lebih pantas untuk sokongan pelanggan, penjagaan kesihatan, jualan, perekrutan, dan interaksi lisan berkapasiti tinggi yang lain.
API Realtime menggabungkan pelbagai lapisan perlindungan dan mitigasi untuk membantu mencegah penyalahgunaan. Kami menggunakan pengelas aktif dalam sesi Realtime API, yang bermaksud perbualan tertentu boleh dihentikan jika ia dikesan melanggar garis panduan kandungan berbahaya kami. Pembangun juga boleh dengan mudah menambah penghadang keselamatan tambahan mereka sendiri menggunakan SDK Ejen.(dibuka dalam tetingkap baru)
Dasar penggunaan kami melarang penggunaan semula atau pengedaran output daripada perkhidmatan kami untuk spam, penipuan atau tujuan berbahaya yang lain. Pembangun juga mesti menjelaskan kepada pengguna akhir apabila mereka berinteraksi dengan AI, melainkan ia sudah jelas daripada konteksnya.
Realtime API menyokong sepenuhnya lokasi data EU(dibuka dalam tetingkap baru) untuk aplikasi berasaskan EU dan dilindungi oleh komitmen privasi perusahaan kami.
GPT‑Realtime‑2, GPT‑Realtime‑Translate dan GPT‑Realtime‑Whisper tersedia dalam API Realtime. GPT‑Realtime‑2 berharga $32 /1 juta token input audio ($0.40 untuk token input cache) dan $64 / 1 juta token output audio. GPT‑Realtime‑Translate berharga $0.034 seminit. GPT‑Realtime‑Whisper berharga $0.017 seminit.
Anda boleh menguji model suara masa nyata yang baharu di Playground(dibuka dalam tetingkap baru).
Untuk mula membina, buka prom ini dalam Codex untuk menambah GPT‑Realtime‑2 pada aplikasi sedia ada atau memulakan aplikasi baharu. Jika anda belum mempunyai Codex lagi, muat turun aplikasi Codex dahulu.


