跳至主要內容
OpenAI

2025年3月20日

發布產品

API 平台推出新一代音訊模型

新的音訊模型套件,能為語音智慧體提供動力,現已開放供全球開發者使用。

OpenAI 新一代音訊模型部落格主圖片
載入中…

2025 年 8 月 28 日更新:我們宣布正式全面推出 Realtime API。深入了解


過去幾個月,我們投入資源推進文字型智慧體 (即能代表使用者自主完成任務的系統) 的智慧、功能與實用性,並推出了操作代理、深度研究、電腦操作智慧體,以及內建工具的 Responses API 等產品。然而,為了讓智慧體完全發揮作用,人們需要能與智慧體進行更深入、更直覺的互動,不僅是透過文字,更是使用自然口語有效溝通。

今天,我們在 API 中推出全新的語音轉文字與文字轉語音音訊模型,讓你能打造更強大、可自訂且更智慧的語音智慧體,提供真正的價值。我們最新的語音轉文字模型樹立全新最先進基準,在準確性和可靠性方面超越現有的解決方案,尤其是在涉及口音、雜訊環境和不同語速等具挑戰性的情境中。這些改進提升轉錄可靠性,讓模型特別適合用於客戶呼叫中心、會議記錄轉錄等使用情境。

開發者首次可以指示文字轉語音模型以特定方式說話,例如「像一位富有同理心的客服智慧體說話」,為語音智慧體解鎖全新層級的自訂化。因此各種量身打造的應用程式都成為可能,從更具同理心和動態的客服語音,到為創意敘事體驗提供富有表現力的旁白。

我們在 2022 推出第一款音訊模型,自那時起,我們便致力於提升這些模型的智慧、準確性和可靠性。有了這些全新的音訊模型,開發人員可以在 API 內建立更精確且功能強大的語音轉文字系統,以及更生動且具角色特色的文字轉語音聲音。

冷靜
衝浪愛好者
專業
中世紀騎士
犯罪實錄愛好者
床前故事

深入了解我們最新的音訊模型

全新語音轉文字模型

我們推出全新的 gpt-4o-transcribegpt-4o-mini-transcribe 模型,相較於原始 Whisper 模型,這些模型在單字錯誤率、語言辨識和準確度方面都有所提升。

gpt-4o-transcribe 在多項既有的 Whisper 模型基準測試中,都展現出更佳的單字錯誤率 (WER) 表現,反映出我們的語音轉文字技術已取得大幅進展。這些進步主要來自強化學習層面的定向創新,以及透過多樣化高品質音訊資料集所進行的大規模中期訓練。

因此,這些新的語音轉文字模型能進一步擷取語音細微差異,減少誤辨識,並提高轉錄可靠性,特別是在涉及口音、雜訊環境和不同語速等具挑戰性的情境中。這些模型現已在語音轉文字 API(在新視窗中開啟) 中開放使用。

單字錯誤率 (WER) 用來衡量語音辨識模型的準確度,方法是計算參考逐字稿比錯誤轉錄詞彙的百分比,WER 越低代表錯誤越少、表現越好。我們最新的語音轉文字模型在各項基準測試中都能達到更低的 WER,包括 FLEURS (少樣本語音通用表徵的學習評估)。這是一項使用人工轉錄的音訊樣本的多語言語音基準測試,涵蓋超過 100 種語言。這些結果顯示出更高的轉錄準確性和更全面的語言覆蓋範圍。如同此處所示,我們的模型在所有語言評估中持續優於 Whisper v2 和 Whisper v3。

在 FLEURS 上,我們的模型能提供更低的單字錯誤率 (WER) 和強大的多語言效能。WER 越低,表示錯誤越少、表現越好。如這裡所示,我們的模型與其他頂尖模型相比,在多數主要語言中的表現都勢均力敵或更勝一籌。

全新文字轉語音模型

我們也將推出新的 gpt-4o-mini-tts 模型,可操控性更高。開發者首次可以「指導」模型說什麼,以及如何說——從客戶服務到創意敘事等使用案例,提供更個人化的體驗。該模型已在文字轉語音 API(在新視窗中開啟) 中開放使用。請注意,這些文字轉語音模型僅限於人工預設語音,我們會監控這些模型,以確保模型始終與合成預設一致。

模型背後的技術創新

使用真實音訊資料集進行預先訓練

我們的新音訊模型以 GPT‑4o 和 GPT‑4o‑mini 架構為基礎,並在專門的音訊導向資料集上進行各種預訓練,這些資料集對於最佳化模型效能至關重要。這種方向明確的方式提供對語音細微差異的更深入見解,並在各種音訊相關任務中實現卓越的表現。

進階蒸餾方法

我們已經改進了蒸餾技術,讓知識可以從我們最大型的音訊模型轉移到更小、更高效的模型。利用先進的自博弈方法,我們的蒸餾資料集能有效擷取真實對話動態,重現使用者與助理的真實互動。這有助於我們的小型模型提供優秀的對話品質和回應速度。

強化學習典範

在我們的語音轉文字模型方面,我們整合了以強化學習 (RL) 為主的模式,將轉錄準確性提升至頂尖水準。這種方法大幅提升精確度並減少虛構內容,因此我們的語音轉文字解決方案在複雜的語音辨識情境中具有極強的競爭力。

這些發展代表音訊建模領域的進步,結合創新方法與效能提升,以提高語音應用的效能。

API 可用性

這些新的音訊模型現已開放供所有開發者使用,更多關於使用音訊進行建置的資訊,請見這裡(在新視窗中開啟)。對於已經開始使用文字模型打造對話體驗的開發者,加入我們的語音轉文字和文字轉語音模型,是建立語音智慧體最簡單的方法。我們正在推出與 Agents SDK(在新視窗中開啟) 的整合,簡化這個開發流程。對於希望打造低延遲語音到語音體驗的開發者,我們建議使用我們的語音到語音模型,在 Realtime API 中進行建置。

未來規畫

展望未來,我們計劃持續投資於提升音訊模型的智慧與準確性,並探索讓開發者能夠引入自訂語音的方法,以符合我們安全標準的方式,打造更個人化的體驗。此外,我們也在持續與政策制定者、研究人員、開發者和創作者,就合成語音可能帶來的挑戰與機會進行對話。我們很期待看到開發人員運用這些增強的音訊功能,打造出創新且富有創意的應用程式。我們也將投資其他模態 (包括影片),協助開發人員打造多模態智慧體體驗。

直播重播

作者

OpenAI

研究組長

Christina Kim、Junhua Mao、Yi Shen、Yu Zhang

貢獻者

研究

Alex Paino、Bowen Cheng、Chengxu Zhuang、Chris Koch、Damian Mrowca、Erik Ritter、Jacob Menick、James Betker、Ji Lin、Jamie Kiros、Jiahui Yu、Liang Zhou、Liyu Chen、Kevin Lu、Madeline Boyd、Michael Lampe、Mike Heaton、Nanxin Chen、Nitish Keskar、Saachi Jain、Sam Toizer、Somay Jain、Tao Xu、Tomer Kaplan、Wei Han、Xiangning Chen、Ye Jia

工程

Alina Wu、Andres Garcia Garcia、Arshi Bhatnagar、Avital Oliver、Brendan Quinn、Christina Huang、David Fang、Dragos Oprica、Dominik Kundel、Edede Oiwoh、Iaroslav Tverdokhlib、Jiacheng Feng、Jay Chen、Jenia Varavva、Jordan Sitkin、Joseph Florencio、Lien Mamitsuka、Mada Aflak、Manoli Liodakis、Mark Hudnall、Noah MacCallum、Ola Okelola、Peter Bakkum、Rohan Mehta、Romain Huet、Wanning Jiang、Wayne Chang、Yilei Qian

產品

Anubha Srivastava、Jackie Shannon、Jeff Harris、Reah Miyara、Xiaolin Hao

領導團隊

Aidan Clark、Andrew Gibiansky、David Sasaki、Kevin Weil、Liam Fedus、Mark Chen、Nick Ryder、Nick Turley、Olivier Godement、Prafulla Dhariwal、Shengjia Zhao、Shuchao Bi、Sherwin Wu、Sulman Choudhry