Memperkenalkan model audio generasi baharu dalam API
Satu suite model audio baharu untuk memperkasakan ejen suara, kini tersedia kepada pembangun di seluruh dunia.

Kemas kini pada 28 Ogos 2025: Kami mengumumkan ketersediaan umum Realtime API. Ketahui lebih lanjut di sini.
Sepanjang beberapa bulan yang lalu, kami telah melabur dalam memajukan kecerdasan, keupayaan, dan kegunaan ejen berasaskan teks—atau sistem yang menyelesaikan tugas secara sendiri bagi pihak pengguna—dengan pelancaran seperti Operator, Penyelidikan Mendalam, Ejen Penggunaan Komputer, dan Responses API dengan alat terbina dalam. Walau bagaimanapun, agar ejen benar-benar berguna, orang ramai perlu dapat berinteraksi dengan ejen secara lebih mendalam dan lebih intuitif, melangkaui sekadar teks—dengan menggunakan bahasa pertuturan semula jadi untuk berkomunikasi dengan berkesan.
Hari ini, kami melancarkan model audio baharu untuk pertuturan-ke-teks dan teks-ke-pertuturan dalam API—memungkinkan pembinaan ejen suara yang lebih berkuasa, boleh disesuaikan, dan pintar yang menawarkan nilai sebenar. Model pertuturan-ke-teks terkini kami menetapkan penanda aras terkini, mengatasi penyelesaian sedia ada dari segi ketepatan dan kebolehpercayaan—terutamanya dalam senario mencabar yang melibatkan aksen, persekitaran bising, dan kelajuan pertuturan yang berbeza-beza. Penambahbaikan ini meningkatkan kebolehpercayaan transkripsi, menjadikan model sangat sesuai untuk kes penggunaan seperti pusat panggilan pelanggan, transkripsi nota mesyuarat, dan lain-lain.
Buat pertama kali, pembangun juga boleh mengarahkan model teks-ke-tutur untuk bercakap dengan cara tertentu—contohnya, “bercakap seperti ejen perkhidmatan pelanggan yang bersimpati”—membuka kunci tahap penyesuaian baharu untuk ejen suara. Ini membolehkan pelbagai aplikasi yang disesuaikan, daripada suara perkhidmatan pelanggan yang lebih berempati dan dinamik kepada penceritaan yang ekspresif untuk pengalaman penceritaan kreatif.
Kami melancarkan model audio pertama kami pada 2022 dan sejak itu, kami telah berkomitmen untuk meningkatkan kecerdasan, ketepatan, dan kebolehpercayaan model-model ini. Dengan model audio baharu ini, pembangun boleh membina sistem pertuturan-ke-teks yang lebih tepat dan mantap serta suara teks-ke-pertuturan yang ekspresif dan berkarakter—semuanya dalam API.
Kami memperkenalkan model baharu gpt-4o-transcribe dan gpt-4o-mini-transcribe dengan penambahbaikan pada kadar ralat perkataan serta pengecaman bahasa dan ketepatan yang lebih baik, berbanding model Whisper asal.
gpt-4o-transcribe menunjukkan peningkatan prestasi Kadar Ralat Perkataan (WER) berbanding model Whisper sedia ada merentasi pelbagai penanda aras yang ditetapkan, mencerminkan kemajuan ketara dalam teknologi pertuturan-ke-teks kami. Kemajuan ini berpunca secara langsung daripada inovasi yang disasarkan dalam pembelajaran pengukuhan dan latihan pertengahan yang meluas dengan set data audio yang pelbagai dan berkualiti tinggi.
Hasilnya, model pertuturan-ke-teks baharu ini dapat menangkap nuansa pertuturan dengan lebih baik, mengurangkan salah pengecaman, dan meningkatkan kebolehpercayaan transkripsi, terutamanya dalam senario mencabar yang melibatkan aksen, persekitaran bising, dan kelajuan pertuturan yang berbeza-beza. Model-model ini kini tersedia dalam API pertuturan-ke-teks(dibuka dalam tetingkap baru).
Kadar Ralat Perkataan (WER) mengukur ketepatan model pengecaman pertuturan dengan mengira peratusan perkataan yang di transkripsi secara salah berbanding transkrip rujukan—WER yang lebih rendah adalah lebih baik dan bermaksud lebih sedikit kesilapan. Model pertuturan-ke-teks terkini kami mencapai WER yang lebih rendah merentas penanda aras, termasuk FLEURS (Penilaian Pembelajaran Beberapa Percubaan bagi Perwakilan Universal Pertuturan)—penanda aras pertuturan berbilang bahasa yang merangkumi lebih daripada 100 bahasa menggunakan sampel audio yang di transkripsi secara manual. Hasil ini menunjukkan ketepatan transkripsi yang lebih tinggi dan liputan bahasa yang lebih luas. Seperti yang ditunjukkan di sini, model kami secara konsisten mengatasi prestasi Whisper v2 dan Whisper v3 dalam semua penilaian bahasa.
Di FLEURS, model kami memberikan kadar ralat perkataan (WER) yang lebih rendah dan prestasi berbilang bahasa yang kukuh. WER yang lebih rendah adalah lebih baik dan bermaksud terdapat kurang kesilapan. Seperti yang ditunjukkan di sini, model kami menyamai atau mengatasi model terkemuka lain dalam kebanyakan bahasa utama.
Kami juga melancarkan model baharu gpt-4o-mini-tts dengan kebolehkendalian yang lebih baik. Buat pertama kali, pembangun boleh “mengarah” model bukan sahaja tentang apa yang hendak dikatakan tetapi bagaimana untuk mengatakannya—membolehkan pengalaman yang lebih disesuaikan untuk kes penggunaan yang merangkumi daripada perkhidmatan pelanggan hingga penceritaan kreatif. Model ini tersedia dalam API teks-ke-tutur(dibuka dalam tetingkap baru). Sila ambil perhatian bahawa model teks-ke-tutur ini terhad kepada suara buatan yang telah ditetapkan, dan kami memantau untuk memastikan ia sentiasa sepadan dengan pratetap sintetik.
Model audio baharu kami dibina berasaskan seni bina GPT‑4o dan GPT‑4o‑mini serta dipra-latih secara meluas pada set data khusus yang berfokuskan audio, yang sangat penting dalam mengoptimumkan prestasi model. Pendekatan yang disasarkan ini memberikan cerapan yang lebih mendalam tentang nuansa pertuturan dan membolehkan prestasi yang cemerlang dalam tugas berkaitan audio.
Kami telah meningkatkan teknik penyulingan kami, membolehkan pemindahan pengetahuan daripada model audio terbesar kami kepada model yang lebih kecil dan lebih efisien. Dengan memanfaatkan metodologi main kendiri lanjutan, set data penyulingan kami dengan berkesan menangkap dinamik perbualan yang realistik, meniru interaksi pengguna-pembantu yang sebenar. Ini membantu model kami yang lebih kecil menyampaikan kualiti perbualan dan respons yang cemerlang.
Untuk model pertuturan-ke-teks kami, kami telah mengintegrasikan paradigma yang berfokus pada pembelajaran pengukuhan (RL), meningkatkan ketepatan transkripsi ke tahap termaju. Metodologi ini secara dramatik meningkatkan ketepatan dan mengurangkan halusinasi, menjadikan penyelesaian pertuturan-ke-teks kami sangat kompetitif dalam senario pengecaman pertuturan yang kompleks.
Perkembangan ini mewakili kemajuan dalam bidang pemodelan audio, menggabungkan metodologi inovatif dengan penambahbaikan praktikal untuk meningkatkan prestasi dalam aplikasi pertuturan.
Model audio baharu ini kini tersedia untuk semua pembangun – maklumat lanjut tentang membina dengan audio di sini(dibuka dalam tetingkap baru). Bagi pembangun yang sudah membina pengalaman perbualan dengan model berasaskan teks, menambah model pertuturan-ke-teks dan teks-ke-pertuturan kami adalah cara paling mudah untuk membina ejen suara. Kami melancarkan integrasi dengan Agents SDK(dibuka dalam tetingkap baru) yang memudahkan proses pembangunan ini. Untuk pembangun yang ingin membina pengalaman pertuturan kepada pertuturan berkependaman rendah, kami mengesyorkan menggunakan model pertuturan kepada pertuturan kami dalam Realtime API.
Melihat ke hadapan, kami merancang untuk terus melabur dalam meningkatkan kecerdasan dan ketepatan model audio kami serta meneroka cara untuk membolehkan pembangun membawa suara tersuai mereka sendiri bagi membina pengalaman yang lebih diperibadikan dengan cara yang sejajar dengan piawaian keselamatan kami. Selain itu, kami terus melibatkan diri dalam perbualan dengan penggubal dasar, penyelidik, pembangun, dan golongan kreatif mengenai cabaran dan peluang yang boleh dibawa oleh suara sintetik. Kami teruja untuk melihat aplikasi inovatif dan kreatif yang akan dibangunkan oleh pembangun menggunakan keupayaan audio yang dipertingkatkan ini. Kami juga akan melabur dalam modaliti lain—termasuk video—untuk membolehkan pembangun membina pengalaman ejen multimodal.
Penulis
Ketua penyelidikan
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Penyumbang
Penyelidikan
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Kejuruteraan
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produk
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Penaja kepimpinan
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry