Langsung ke konten utama
OpenAI

20 Maret 2025

RilisProduk

Memperkenalkan model audio generasi berikutnya di API

Rangkaian model audio baru untuk mendukung agen suara kini tersedia bagi para pengembang di seluruh dunia.

Gambar utama blog model audio generasi terbaru OpenAI
Memuat…

Pembaruan pada tanggal 28 Agustus 2025: Kami mengumumkan ketersediaan umum API Realtime. Pelajari selengkapnya di sini.


Selama beberapa bulan terakhir, kami telah berinvestasi untuk memajukan kecerdasan, kemampuan, dan kegunaan agen berbasis teks—atau sistem yang secara independen menyelesaikan tugas atas nama pengguna—melalui rilis seperti Operator, Riset Mendalam, Agen Berbasis Komputer, serta API Respons dengan alat bawaan. Namun, agar agen benar-benar berguna, pengguna perlu dapat melakukan interaksi yang lebih mendalam dan lebih intuitif dengan agen, melampaui sekadar teks—dengan menggunakan bahasa lisan alami untuk berkomunikasi secara efektif.

Hari ini, kami meluncurkan model audio baru untuk ucapan-ke-teks dan teks-ke-ucapan di API—memungkinkan Anda membangun agen suara yang lebih kuat, dapat disesuaikan, dan cerdas yang memberikan nilai nyata. Model ucapan-ke-teks terbaru kami menetapkan tolok ukur mutakhir yang baru, melampaui solusi yang ada dalam hal akurasi dan keandalan—terutama dalam skenario menantang yang melibatkan aksen, lingkungan bising, dan kecepatan bicara yang bervariasi. Peningkatan ini memperkuat keandalan transkripsi, sehingga model sangat sesuai untuk kasus penggunaan seperti pusat panggilan pelanggan, transkripsi catatan rapat, dan lainnya.

Untuk pertama kalinya, pengembang juga dapat menginstruksikan model teks-ke-ucapan untuk berbicara dengan cara tertentu—misalnya, “berbicara seperti agen layanan pelanggan yang simpatik”—sehingga membuka tingkat kustomisasi baru untuk agen suara. Hal ini memungkinkan beragam aplikasi yang disesuaikan, mulai dari suara layanan pelanggan yang lebih empatik dan dinamis hingga narasi yang ekspresif untuk pengalaman penceritaan kreatif.

Kami meluncurkan model audio pertama kami pada 2022 dan sejak saat itu berkomitmen untuk terus meningkatkan kecerdasan, akurasi, dan keandalan model-model tersebut. Dengan model audio baru ini, para pengembang dapat membangun sistem pengenalan ucapan-ke-teks yang lebih akurat dan tangguh, serta suara teks-ke-ucapan yang lebih ekspresif dan berkarakter—semuanya tersedia dalam API.

Tenang
Peselancar
Profesional
Kesatria abad pertengahan
Penggemar cerita kejahatan nyata
Dongeng sebelum tidur

Lebih lanjut tentang model audio terbaru kami

Model pengenalan ucapan-ke-teks baru

Kami memperkenalkan model baru gpt-4o-transcribe dan gpt-4o-mini-transcribe dengan peningkatan pada tingkat kesalahan kata, serta pengenalan bahasa dan akurasi yang lebih baik dibandingkan dengan model Whisper asli.

gpt-4o-transcribe menunjukkan peningkatan kinerja Tingkat Kesalahan Kata (WER) dibandingkan model Whisper yang ada di berbagai tolok ukur mapan, yang mencerminkan kemajuan signifikan dalam teknologi pengenalan ucapan-ke-teks kami. Kemajuan ini berasal langsung dari inovasi yang ditargetkan dalam reinforcement learning serta pelatihan menengah yang ekstensif dengan kumpulan data audio yang beragam dan berkualitas tinggi.

Sebagai hasilnya, model ucapan-ke-teks baru ini mampu menangkap nuansa ucapan dengan lebih baik, mengurangi kesalahan pengenalan, serta meningkatkan keandalan transkripsi, terutama dalam skenario yang menantang yang melibatkan aksen, lingkungan bising, dan kecepatan bicara yang bervariasi. Model-model ini kini tersedia di API ucapan-ke-teks(terbuka di jendela baru).

Tingkat Kesalahan Kata (WER) mengukur akurasi model pengenalan ucapan dengan menghitung persentase kata yang salah ditranskripsikan dibandingkan dengan transkrip referensi—WER yang lebih rendah lebih baik dan berarti lebih sedikit kesalahan. Model pengenalan ucapan-ke-teks terbaru kami mencapai WER yang lebih rendah di berbagai tolok ukur, termasuk FLEURS (Evaluasi Pembelajaran Few-shot untuk Representasi Ucapan Universal)—sebuah tolok ukur ucapan multibahasa yang mencakup lebih dari 100 bahasa dengan menggunakan sampel audio yang ditranskripsikan secara manual. Hasil ini menunjukkan akurasi transkripsi yang lebih kuat serta cakupan bahasa yang lebih luas. Seperti yang ditunjukkan di sini, model kami secara konsisten mengungguli Whisper v2 dan Whisper v3 dalam seluruh evaluasi bahasa.

Pada FLEURS, model kami mencapai WER yang lebih rendah serta kinerja multibahasa yang kuat. WER yang lebih rendah menunjukkan performa yang lebih baik dan berarti lebih sedikit kesalahan. Seperti yang ditunjukkan di sini, model kami menyamai atau mengungguli model terkemuka lainnya pada sebagian besar bahasa utama.

Model teks-ke-ucapan yang baru

Kami juga meluncurkan model gpt-4o-mini-tts baru dengan kemampuan pengendalian yang lebih baik. Untuk pertama kalinya, pengembang dapat “mengarahkan” model bukan hanya tentang apa yang harus dikatakan, tetapi juga bagaimana mengatakannya—memungkinkan pengalaman yang lebih disesuaikan untuk berbagai kasus penggunaan, mulai dari layanan pelanggan hingga penceritaan kreatif. Model ini tersedia di API teks-ke-ucapan(terbuka di jendela baru). Perlu diperhatikan bahwa model teks-ke-ucapan ini terbatas pada suara buatan yang telah ditetapkan, yang kami pantau untuk memastikan bahwa suara tersebut secara konsisten sesuai dengan preset sintetis.

Inovasi teknis di balik model-model

Pra-pelatihan dengan dataset audio autentik

Model audio baru kami dibangun berdasarkan arsitektur GPT‑4o dan GPT‑4o‑mini serta dipralatih secara ekstensif pada kumpulan data khusus yang berfokus pada audio, yang menjadi faktor penting dalam mengoptimalkan kinerja model. Pendekatan yang ditargetkan ini memberikan wawasan yang lebih mendalam mengenai nuansa ucapan dan memungkinkan kinerja yang luar biasa dalam berbagai tugas terkait audio.

Metodologi distilasi tingkat lanjut

Kami telah meningkatkan teknik distilasi kami, sehingga memungkinkan transfer pengetahuan dari model audio terbesar kami ke model yang lebih kecil dan lebih efisien. Dengan memanfaatkan metodologi self-play tingkat lanjut, kumpulan data distilasi kami secara efektif menangkap dinamika percakapan yang realistis, mereplikasi interaksi pengguna-asisten yang autentik. Hal ini membantu model kami yang lebih kecil untuk memberikan kualitas percakapan dan daya tanggap yang sangat baik.

Paradigma reinforcement learning

Untuk model ucapan-ke-teks kami, kami telah mengintegrasikan paradigma yang sangat berfokus pada reinforcement learning (RL), yang mendorong akurasi transkripsi ke tingkat mutakhir. Metodologi ini secara signifikan meningkatkan presisi dan mengurangi halusinasi, sehingga menjadikan solusi pengenalan ucapan-ke-teks kami sangat kompetitif dalam skenario pengenalan ucapan yang kompleks.

Perkembangan ini menunjukkan kemajuan dalam bidang pemodelan audio, yang menggabungkan metodologi inovatif dengan peningkatan praktis untuk meningkatkan kinerja dalam aplikasi pengenalan suara.

Ketersediaan API

Model audio baru ini kini tersedia untuk semua pengembang—selengkapnya tentang membangun dengan audio di sini(terbuka di jendela baru). Bagi para pengembang yang telah membangun pengalaman percakapan dengan model berbasis teks, menambahkan model konversi ucapan-ke-teks dan teks-ke-ucapan kami merupakan cara paling sederhana untuk membangun agen suara. Kami merilis integrasi dengan Agents SDK(terbuka di jendela baru) yang menyederhanakan proses pengembangan ini. Bagi para pengembang yang ingin menciptakan pengalaman speech-to-speech dengan latensi rendah, kami merekomendasikan penggunaan model speech-to-speech kami melalui Realtime API.

Selanjutnya

Ke depannya, kami berencana untuk terus berinvestasi dalam peningkatan kecerdasan dan akurasi model audio kami, serta menjajaki cara untuk memungkinkan pengembang membawa suara kustom mereka sendiri guna membangun pengalaman yang lebih dipersonalisasi dengan tetap mematuhi standar keselamatan kami. Selain itu, kami terus terlibat dalam diskusi dengan pembuat kebijakan, peneliti, pengembang, dan kreator mengenai tantangan serta peluang yang dapat dihadirkan oleh suara sintetis. Kami sangat antusias untuk melihat aplikasi inovatif dan kreatif yang akan dibangun oleh para pengembang dengan memanfaatkan kemampuan audio yang telah ditingkatkan ini. Kami juga akan berinvestasi dalam modalitas lain—termasuk video—untuk memungkinkan para pengembang membangun pengalaman agenik multimodal.

Putar ulang siaran langsung

Penulis

OpenAI

Para pemimpin riset

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Kontributor

Riset

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Teknik Rekayasa

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produk

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Sponsor Kepemimpinan

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry