Langkau ke kandungan utama
OpenAI

28 Ogos 2025

ProdukSiaran

Memperkenalkan kemas kini gpt-realtime dan API Realtime untuk ejen suara produksi

Kami melancarkan model pertuturan-ke-pertuturan yang lebih maju dan keupayaan API baharu termasuk sokongan pelayan MCP, input imej, dan sokongan panggilan telefon SIP.

Antara muka bergaya yang menunjukkan interaksi suara. Pemain audio berbentuk segi empat tepat bulat dengan pengvisualan bentuk gelombang, butang main/jeda, penunjuk status 'ejen dalam talian', dan cap masa 00:35. Garis melengkung putih dengan titik-titik mengalir merentasi imej, mencadangkan pergerakan audio langsung atau isyarat. Latar belakang berwarna biru terang dengan bentuk bunga kabur dalam tona merah jambu dan ungu.
Memuat…

Hari ini kami menjadikan Realtime API tersedia secara umum dengan ciri baharu yang dayakan pembangun dan perusahaan membina ejen suara yang boleh dipercayai dan sedia untuk pengeluaran. API kini menyokong pelayan MCP jauh, Input imej, dan panggilan telefon melalui Protokol Permulaan Sesi (SIP), menjadikan ejen suara lebih berkemampuan dengan akses kepada alat dan konteks tambahan.

Kami juga melancarkan model pertuturan-ke-pertuturan kami yang paling canggih setakat ini—gpt-realtime. Model baharu menunjukkan peningkatan dalam mengikuti arahan yang kompleks, memanggil alat dengan ketepatan, dan menghasilkan pertuturan yang kedengaran lebih semula jadi dan ekspresif. Ia lebih baik dalam mentafsir mesej sistem dan prom pembangun—sama ada membaca skrip penafian perkataan demi perkataan semasa panggilan sokongan, mengulangi kembali abjad angka, atau bertukar dengan lancar antara bahasa dalam pertengahan ayat. Kami juga melancarkan dua suara baharu, Cedar dan Marin, yang tersedia secara eksklusif dalam Realtime API bermula hari ini.

Sejak kami mula-mula memperkenalkan Realtime API dalam beta awam Oktober lalu, beribu-ribu pembangun telah membina dengan API dan membantu membentuk penambahbaikan yang kami keluarkan hari ini—dioptimumkan untuk kebolehpercayaan, kependaman rendah, dan kualiti tinggi untuk berjaya menggunakan ejen suara dalam produksi. Tidak seperti saluran paip tradisional yang menghubungkan pelbagai model untuk ucapan-ke-teks dan teks-ke-ucapan, Realtime API memproses dan menjana audio secara langsung melalui satu model dan API. Ini mengurangkan kependaman, mengekalkan nuansa dalam pertuturan, dan menghasilkan respons yang lebih semula jadi dan ekspresif.

“Model pertuturan-ke-pertuturan baharu dalam Realtime API OpenAI menunjukkan penaakulan yang lebih kukuh dan pertuturan yang lebih semula jadi—membolehkannya mengendalikan permintaan yang kompleks dan berbilang langkah seperti menyempitkan penyenaraian mengikut keperluan gaya hidup atau membimbing perbincangan keterjangkauan dengan alat seperti skor BuyAbility kami. "Ini boleh menjadikan pencarian rumah di Zillow atau teroka pilihan pembiayaan berasa semula jadi seperti perbualan dengan rakan, membantu memudahkan keputusan seperti membeli, menjual, dan menyewa rumah.”

– Josh Weisberg, Ketua AI di Zillow

Memperkenalkan gpt-realtime

Model pertuturan ke pertuturan baharu—gpt-realtime—ialah model suara kami yang paling maju dan sedia untuk pengeluaran. Kami melatih model ini dengan kerjasama rapat bersama pelanggan untuk cemerlang dalam tugas dunia sebenar seperti sokongan pelanggan, bantuan peribadi, dan pendidikan—menjajarkan model ini dengan cara pembangun membina dan menggunakan ejen suara. Model ini menunjukkan peningkatan dalam kualiti audio, kecerdasan, pematuhan arahan, dan panggilan fungsi.

Kualiti audio

Perbualan yang kedengaran semula jadi adalah penting untuk melancarkan ejen suara di dunia sebenar. Model perlu bercakap dengan intonasi, emosi, dan rentak seperti manusia untuk cipta pengalaman yang menyeronokkan dan menggalakkan perbualan berterusan dengan pengguna. Kami melatih gpt-realtime untuk menghasilkan pertuturan berkualiti tinggi yang kedengaran lebih semula jadi dan boleh mengikut arahan terperinci, seperti "bercakap dengan cepat dan profesional" atau "bercakap dengan empati dalam loghat Perancis."

Kami memperkenalkan dua suara baharu dalam API, Marin dan Cedar, dengan peningkatan paling ketara pada pertuturan yang berbunyi semula jadi. Kami juga sedang mengemas kini lapan suara sedia ada kami untuk mendapat manfaat daripada penambahbaikan ini.

Sampel suara - Marin
Sampel suara - Cedar

Kecerdasan dan pemahaman

gpt-realtime menunjukkan kecerdasan yang lebih tinggi dan dapat memahami audio asli dengan lebih tepat. Model ini boleh menangkap isyarat bukan lisan (seperti ketawa), menukar bahasa di tengah-tengah ayat, dan menyesuaikan nada (“cergas dan profesional” berbanding “baik hati dan empati”). Menurut penilaian dalaman, model ini juga menunjukkan prestasi yang lebih tepat dalam mengesan jujukan alfanumerik (seperti nombor telefon, VIN, dll) dalam bahasa lain, termasuk bahasa Sepanyol, Cina, Jepun, dan Perancis. Dalam penilaian Big Bench Audio yang mengukur keupayaan penaakulan, gpt-realtime mencatatkan ketepatan 82.8%—mengatasi model terdahulu kami dari Disember 2024, yang mencatatkan 65.6%.

Penanda aras Big Bench Audio(dibuka dalam tetingkap baru) ialah set data penilaian untuk menilai keupayaan penaakulan model bahasa yang menyokong Input audio. Set data ini menyesuaikan soalan dari Big Bench Hard—dipilih untuk ujian ketat mengenai penaakulan lanjutan—ke dalam domain audio.

Mengikut arahan

Apabila membina aplikasi pertuturan-ke-pertuturan, pembangun memberikan satu set arahan kepada model tentang cara berkelakuan, termasuk cara bercakap, apa yang perlu dikatakan dalam situasi tertentu, dan apa yang perlu dilakukan atau tidak dilakukan. Kami telah menumpukan penambahbaikan kami pada pematuhan kepada arahan ini, supaya arahan kecil pun memberikan lebih banyak isyarat kepada model. Pada penanda aras audio MultiChallenge yang mengukur ketepatan mengikuti arahan, gpt-realtime mencatatkan 30.5%, peningkatan ketara berbanding model kami sebelumnya dari Disember 2024, yang mencatatkan 20.6%.

MultiChallenge(dibuka dalam tetingkap baru) menilai sejauh mana LLM mengendalikan perbualan berbilang pusingan dengan manusia. Ia memfokuskan pada empat kategori cabaran realistik yang dihadapi oleh model perintis semasa. Cabaran ini memerlukan model untuk menggabungkan pematuhan arahan, pengurusan konteks, dan penaakulan dalam konteks secara serentak. Kami menukar subset soalan ujian yang mesra audio daripada teks ke pertuturan untuk mencipta versi audio penilaian ini.

Panggilan fungsi

Untuk membina ejen suara yang berkemampuan dengan model pertuturan-ke-pertuturan, model tersebut perlu dapat memanggil alat yang betul pada masa yang tepat untuk berguna dalam produksi. Kami telah memperbaiki panggilan fungsi pada tiga aspek: memanggil fungsi yang relevan, memanggil fungsi pada masa yang tepat, dan memanggil fungsi dengan argumen yang sesuai (meningkatkan ketepatan). Dalam penilaian audio ComplexFuncBench yang mengukur prestasi panggilan fungsi, gpt-realtime mencatatkan skor 66.5%, manakala model kami sebelum ini dari Disember 2024 mencatatkan skor 49.7%.

Kami juga telah membuat penambahbaikan pada panggilan fungsi tak segerak(dibuka dalam tetingkap baru). Panggilan fungsi yang berjalan lama tidak lagi akan mengganggu aliran sesi—model boleh teruskan perbualan lancar sambil menunggu keputusan. Ciri ini tersedia secara asli dalam gpt-realtime, jadi pembangun tak perlu mengemas kini kod mereka.

ComplexFuncBench(dibuka dalam tetingkap baru) mengukur sejauh mana model dapat menangani tugas panggilan fungsi yang mencabar. Ia menilai prestasi merentas senario seperti panggilan berbilang langkah, penaakulan mengenai kekangan atau parameter tersirat, dan mengendalikan input yang sangat panjang. Kami menukar prom teks asal kepada pertuturan untuk membina penilaian ini untuk model kami.

Baharu dalam Realtime API

Sokongan pelayan jauh MCP

Anda boleh dayakan sokongan MCP dalam sesi Realtime API dengan memasukkan URL pelayan MCP jauh ke dalam konfigurasi sesi. Setelah disambungkan, API secara automatik mengendalikan panggilan alat untuk anda, jadi tidak perlu menyambungkan integrasi secara manual.

Persediaan ini memudahkan anda untuk melanjutkan ejen dengan keupayaan baharu—hanya arahkan sesi ke pelayan MCP yang berbeza, dan alatan tersebut akan tersedia serta-merta. Untuk ketahui lebih lanjut tentang mengkonfigurasi MCP dengan Realtime, lihat panduan ini(dibuka dalam tetingkap baru).

JavaScript

1
// POST /v1/realtime/client_secrets
2
{
3
"session": {
4
"type": "realtime",
5
"tools": [
6
{
7
"type": "mcp",
8
"server_label": "stripe",
9
"server_url": "https://mcp.stripe.com",
10
"authorization": "{access_token}",
11
"require_approval": "never"
12
}
13
]
14
}
15
}
16

Input imej

Dengan input imej kini disokong dalam gpt-realtime, anda boleh menambah imej, foto, dan tangkapan skrin bersama audio atau teks ke dalam sesi Realtime API. Kini model boleh mengaitkan perbualan dengan apa yang sebenarnya dilihat oleh pengguna, membolehkan pengguna bertanya soalan seperti "apa yang kamu lihat?" atau "baca teks dalam tangkapan skrin ini."

Daripada menganggap imej seperti strim video langsung, sistem menganggapnya lebih seperti menambah gambar ke dalam perbualan. Apl anda boleh menentukan imej mana yang hendak dikongsi dengan model dan bila untuk berkongsinya. Dengan cara ini, anda kekal mengawal apa yang model lihat dan bila ia bertindak balas.

Lihat dokumen(dibuka dalam tetingkap baru) kami untuk mula dengan input imej.

JavaScript

1
{
2
"type": "conversation.item.create",
3
"previous_item_id": null,
4
"item": {
5
"type": "message",
6
"role": "user",
7
"content": [
8
{
9
"type": "input_image",
10
"image_url": "data:image/{format(example: png)};base64,{some_base64_image_bytes}"
11
}
12
]
13
}
14
}
15

Keupayaan tambahan

Kami telah menambah beberapa ciri lain untuk menjadikan Realtime API lebih mudah disepadukan dan lebih fleksibel untuk kegunaan produksi.

Keselamatan & privasi

API Realtime menggabungkan pelbagai lapisan perlindungan dan mitigasi untuk membantu mencegah penyalahgunaan. Anda boleh mengetahui lebih lanjut tentang pendekatan keselamatan kami dan butiran kad sistem dalam blog pengumuman beta. Kami menggunakan pengelas aktif dalam sesi Realtime API, yang bermaksud perbualan tertentu boleh dihentikan jika ia dikesan melanggar garis panduan kandungan berbahaya kami. Pembangun juga boleh dengan mudah menambah penghadang keselamatan tambahan mereka sendiri menggunakan SDK Ejen(dibuka dalam tetingkap baru).

Dasar penggunaan kami melarang penggunaan semula atau pengedaran output daripada perkhidmatan kami untuk spam, penipuan, atau tujuan berbahaya yang lain. Pembangun juga mesti menjelaskan kepada pengguna akhir apabila mereka berinteraksi dengan AI, kecuali ia sudah jelas daripada konteksnya. Realtime API menggunakan suara pratetap untuk membantu mencegah pelaku berniat jahat daripada menyamar sebagai orang lain.

Realtime API menyokong sepenuhnya Kedudukan Data EU(dibuka dalam tetingkap baru) untuk aplikasi berasaskan EU dan dilindungi oleh komitmen privasi perusahaan kami.

Harga & ketersediaan

Realtime API yang tersedia secara umum dan model gpt-realtime baharu boleh diakses oleh semua pembangun mulai hari ini. Kami mengurangkan harga untuk gpt-realtime sebanyak 20% berbanding gpt-4o-realtime-preview—$32 / 1 juta token input audio ($0.40 untuk token input cache) dan $64 / 1 juta token output audio (lihat harga terperinci(dibuka dalam tetingkap baru)). Kami juga telah menambah kawalan terperinci untuk konteks perbualan bagi membolehkan pembangun menetapkan had token pintar dan memotong berbilang giliran pada satu masa, sekali gus mengurangkan kos untuk sesi yang panjang dengan ketara.

Tonton semula siaran langsung

Penulis

OpenAI