
2025 年 8 月 28 日更新:我們宣佈正式推出 Realtime API。在此了解更多。
在過去幾個月,我們一直投資推進以文字為基礎的智能代理或可代表用戶獨立完成任務的系統的智能程度、能力和實用性,並發佈操作代理、深度研究、電腦操作智能代理,以及內置工具的 Responses API 等。然而,要讓智能代理真正發揮作用,人們需要能夠與智能代理進行更深入、更直觀的互動,不僅僅是透過文字,而是使用自然的口語有效溝通。
今天,我們在 API 推出全新的語音轉文字和文字轉語音的語音模型,讓你能夠構建更強大、可自訂、智能的語音代理程式,帶來真正的價值。我們最新的語音轉文字模型樹立了全新的業界標杆,在準確性和可靠性方面均超越現有的解決方案,尤其是在涉及口音、噪音環境和不同語速等具挑戰性的情境中。這些改進提升了轉錄的可靠性,使模型特別適用於客戶服務中心、會議記錄轉錄等使用情境。
開發人員首次可以指示文字轉語音模型以特定方式說話,例如「像一位富有同理心的客戶服務專員般說話」,讓語音智能代理的自訂程度更上一層樓。這可實現各種量身打造的應用,從更具同理心和活力的客戶服務語音,到創意故事體驗的表現力敘述。
我們在 2022 年推出首個語音模型,自此,我們一直致力於提升這些模型的智能、準確性和可靠性。憑藉這些全新的語音模型,開發人員可以建立更準確、更穩健的語音轉文字系統,以及更具表現力、更有特色的文字轉語音聲音,一切盡在 API 內。
我們正推出全新的 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 模型,與原本的 Whisper 模型相比,這些模型在字詞錯誤率、語言辨識和準確度方面均有所提升。
gpt-4o-transcribe 在多個既定基準測試中,相較現有的 Whisper 模型展現出更好的字詞錯誤率 (WER) 表現,反映我們的語音轉文字技術已取得重大進展。這些進展直接源自強化學習的定向創新,以及使用多樣化、高品質音訊資料集進行的廣泛中期訓練。
因此,這些新的語音轉文字模型能更好地捕捉語音中的細微差異,減少錯誤辨識,並提高轉錄的可靠性,尤其是在涉及口音、嘈雜環境和不同語速等具挑戰性的情境中。這些模型現已在語音轉文字 API(在新視窗中開啟) 中提供。
字詞錯誤率 (WER) 透過計算相對於參考轉錄稿的錯誤轉錄字詞百分比,衡量語音識別模型的準確性,WER 越低越好,代表錯誤較少。我們最新的語音轉文字模型在各項基準測試中達到更低的 WER,包括 FLEURS(少範例學習的通用語音表達評估)—一個多語言語音基準測試,涵蓋超過 100 種語言,並使用人工轉錄的語音樣本。這些結果顯示出更高的轉錄準確性和更強的語言覆蓋範圍。如此處所示,我們的模型在所有語言評估中均持續優於 Whisper v2 和 Whisper v3。
在 FLEURS 上,我們的模型提供更低的 WER,以及強大的多語言效能。WER 越低越好,表示錯誤較少。如此處所示,我們的模型在大多數主要語言中,與其他領先模型相比表現相當或更勝一籌。
我們亦正推出全新的 gpt-4o-mini-tts 模型,具備更佳的可控性。首次,開發人員不僅可以「指示」模型要說甚麼,更可以指示它如何說,讓從客戶服務到創意故事等各種使用案例都能提供更量身打造的體驗。該模型已在文字轉語音 API(在新視窗中開啟) 中提供。請注意,這些文字轉語音模型僅限於人工、預設的語音,我們會加以監控,確保與合成的預設始終保持一致。
我們的新語音模型基於 GPT‑4o 和 GPT‑4o‑mini 架構,並在專門的語音資料集上進行廣泛的預訓練,這對最佳化模型效能至關重要。這種具針對性的方法能深入洞察語音的細微差異,並在各種語音相關任務中發揮出色的效能。
我們已經改進了蒸餾技術,令知識能夠從我們最大型的語音模型轉移到更小、更高效的模型。利用先進的自我對弈方法,我們的蒸餾資料集能有效捕捉真實的對話動態,重現用戶與助手的真實互動。這有助我們的小型模型提供優秀的對話質量和回應速度。
對於我們的語音轉文字模型,我們整合了一個以強化學習 (RL) 為主的模式,將轉錄準確度提升至最先進的水平。此方法論大幅提升精確度並減少錯誤,令我們的語音轉文字解決方案在複雜的語音辨識情境中極具競爭力。
這些發展代表語音建模領域的進展,結合創新的方法學與實用的改進,提升語音應用中的效能。
這些新的語音模型現已向所有開發人員開放,有關如何使用語音進行構建的更多資訊,請按此處(在新視窗中開啟)。對於已經使用以文字為基礎的模型建立對話體驗的開發人員而言,加入我們的語音轉文字和文字轉語音模型,是建立語音智能代理的最簡單方法。我們正在發佈與 Agents SDK(在新視窗中開啟) 的整合,簡化此開發過程。對於希望打造低延遲語音到語音體驗的開發人員,我們建議使用 Realtime API 中的語音到語音模型來構建。
展望未來,我們計劃繼續投資於提升語音模型的智能和準確性,並探索讓開發人員引入自訂語音的方法,以在符合我們安全標準的情況下,創造更個性化的體驗。此外,我們正繼續與政策制定者、研究人員、開發人員及創作者就合成語音可能帶來的挑戰與機遇進行對話。我們期待看到開發人員利用這些增強語音功能,創造創新和富有創意的應用程式。我們亦會投資於影片等其他模態,以便開發人員能夠構建多模態智能代理體驗。
作者
研究主管
Christina Kim、Junhua Mao、Yi Shen、Yu Zhang
專案貢獻者
研究
Alex Paino、Bowen Cheng、Chengxu Zhuang、Chris Koch、Damian Mrowca、Erik Ritter、Jacob Menick、James Betker、Ji Lin、Jamie Kiros、Jiahui Yu、Liang Zhou、Liyu Chen、Kevin Lu、Madeline Boyd、Michael Lampe、Mike Heaton、Nanxin Chen、Nitish Keskar、Saachi Jain、Sam Toizer、Somay Jain、Tao Xu、Tomer Kaplan、Wei Han、Xiangning Chen、Ye Jia
工程
Alina Wu、Andres Garcia Garcia、Arshi Bhatnagar、Avital Oliver、Brendan Quinn、Christina Huang、David Fang、Dragos Oprica、Dominik Kundel、Edede Oiwoh、Iaroslav Tverdokhlib、Jiacheng Feng、Jay Chen、Jenia Varavva、Jordan Sitkin、Joseph Florencio、Lien Mamitsuka、Mada Aflak、Manoli Liodakis、Mark Hudnall、Noah MacCallum、Ola Okelola、Peter Bakkum、Rohan Mehta、Romain Huet、Wanning Jiang、Wayne Chang、Yilei Qian
產品
Anubha Srivastava、Jackie Shannon、Jeff Harris、Reah Miyara、Xiaolin Hao
領袖贊助者
Aidan Clark、Andrew Gibiansky、David Sasaki、Kevin Weil、Liam Fedus、Mark Chen、Nick Ryder、Nick Turley、Olivier Godement、Prafulla Dhariwal、Shengjia Zhao、Shuchao Bi、Sherwin Wu、Sulman Choudhry