
2025 年 8 月 28 日更新:我们宣布 Realtime API 正式可用。了解详情。
最近几个月,我们持续加大投入,提升基于文本的智能体(即可以代表用户独立完成任务的系统)的智能水平、能力与实用性,并陆续发布了 Operator、Deep Research、Computer-Using Agents 以及内置工具版 Responses API 等新品。然而,要让智能体真正发挥价值,人们需要能够与其进行超越纯文本的、更深入且更直观的互动 — 用自然口语实现高效沟通。
今天,我们在 API 中推出全新的语音转文本和文本转语音音频模型,助力开发者轻松打造更强大、更可定制、也更智能的语音智能体,为用户真正创造价值。我们最新的语音转文本模型树立了新的业界标杆,在准确性和可靠性方面优于现有方案,尤其是在口音多样、环境嘈杂或语速不一等具有挑战性的场景中。这些改进显著提升了转写的可靠性,使这些模型尤其适用于客户呼叫中心、会议记录转写等场景。
开发者首次可以让文本转语音模型以特定方式说话,例如“像一位富有同理心的客服人员那样说话”,为语音智能体解锁全新的定制化能力。这为多种定制化应用铺平道路,从更具同理心、更加生动的客服语音,到为创意故事体验提供富有表现力的旁白。
我们在 2022 推出了首个音频模型,自那以后一直致力于提升这些模型的智能水平、准确性和可靠性。借助这些全新的音频模型,开发者可以在 API 内构建更准确、更稳健的语音转文本系统,以及更具表现力和个性化特征的文本转语音声音。
我们推出了全新的 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 模型,相比原始 Whisper 模型,在词错误率、语言识别能力和整体准确性方面均有明显提升。
在多项成熟基准测试中,gpt-4o-transcribe 相较现有 Whisper 模型展现出更优的 Word Error Rate (WER) 表现,体现出我们在语音转文本技术上的重大进步。这些进展直接得益于在强化学习方面的定向创新,以及基于多样化、高质量音频数据集开展的大规模中期训练。
因此,这些全新的语音转文本模型能够更好地捕捉语音细微差异,减少误识别,并提升转写的可靠性,尤其适用于口音复杂、环境嘈杂或语速变化较大的场景。这些模型现已可通过 speech-to-text API(在新窗口中打开) 进行调用。
词错误率(WER)通过比较转写结果和参考文本,计算错误词语所占的比例,用于衡量语音识别模型的准确性;WER 越低,表示错误越少。我们的最新语音转文本模型在多项基准测试中均取得了更低的 WER,其中包括 FLEURS(通用语音表征的少样本学习评估) — 一个覆盖 100 多种语言、基于人工转写音频样本的多语言语音基准测试。这些结果表明,模型在转写准确性和语言覆盖范围方面都有显著提升。如图所示,我们的模型在所有语言评估中始终优于 Whisper v2 和 Whisper v3。
在 FLEURS 基准测试中,我们的模型取得了更低的 WER,并展现出强大的多语言能力。WER 越低,代表错误越少。如图所示,我们的模型在大多数主流语言上与其他领先模型持平或表现更优。
我们还将推出一款新的 gpt-4o-mini-tts 模型,具备更强的可控性。开发者首次可以“指示”模型,不仅告诉它该说什么,还能告诉它如何去说 — 从客户服务到创意叙事等多种场景,都能带来更个性化的体验。该模型可通过 text-to-speech API(在新窗口中打开) 使用。请注意,这些文本转语音模型仅限使用人工预设的声音,我们会持续监控,确保其输出始终与合成预设保持一致。
我们的新音频模型构建于 GPT‑4o 和 GPT‑4o‑mini 架构之上,并在专门面向音频场景构建的大规模数据集上进行了广泛预训练,这些数据集对模型性能优化至关重要。这种有针对性的方法让模型能够更深入地理解语音中的细微差别,并在各类音频任务中发挥卓越表现。
我们改进了蒸馏技术,使得知识可以从我们规模最大的音频模型迁移到更小、更高效的模型上。借助先进的自博弈方法,我们的蒸馏数据集能够有效捕捉真实的对话动态,复现用户与助手之间的真实互动。这使得体量更小的模型也能提供出色的对话质量和响应速度。
在语音转文本模型中,我们采用了一种以强化学习 (RL) 为核心的训练范式,将转写准确率提升至业界领先水平。这种方法显著提升了精度并减少了幻觉现象,让我们的语音转文本解决方案在复杂语音识别场景中极具竞争力。
这些进展为音频建模领域带来了实质性的突破,通过融合创新方法与面向实际应用的性能优化,大幅提升了语音应用的整体表现。
这些全新的音频模型现已向所有开发者开放;如需了解如何利用音频能力构建应用的更多信息,请参阅此处(在新窗口中打开)。对于已在使用文本模型打造对话体验的开发者来说,接入我们的语音转文本和文本转语音模型,是构建语音智能体的最快捷方案。我们发布了与 Agents SDK(在新窗口中打开) 的集成,可进一步简化这一开发流程。对于希望打造低延迟语音到语音体验的开发者,建议在 Realtime API 中使用我们的语音到语音模型。
展望未来,我们将继续投入资源,提升音频模型的智能水平和准确性,并探索让开发者引入自定义语音的方式,在符合安全标准的前提下打造更加个性化的体验。此外,我们也持续与政策制定者、研究人员、开发者和创意人士就合成语音带来的挑战与机遇保持对话。我们期待看到开发者利用这些增强的音频能力打造出更多创新且富有创意的应用。我们也会继续投入到其他模态中(包括视频),以便开发者构建多模态的智能体体验。
作者
研究负责人
Christina Kim、Junhua Mao、Yi Shen、Yu Zhang
贡献者
研究
Alex Paino、Bowen Cheng、Chengxu Zhuang、Chris Koch、Damian Mrowca、Erik Ritter、Jacob Menick、James Betker、Ji Lin、Jamie Kiros、Jiahui Yu、Liang Zhou、Liyu Chen、Kevin Lu、Madeline Boyd、Michael Lampe、Mike Heaton、Nanxin Chen、Nitish Keskar、Saachi Jain、Sam Toizer、Somay Jain、Tao Xu、Tomer Kaplan、Wei Han、Xiangning Chen、Ye Jia
工程
Alina Wu、Andres Garcia Garcia、Arshi Bhatnagar、Avital Oliver、Brendan Quinn、Christina Huang、David Fang、Dragos Oprica、Dominik Kundel、Edede Oiwoh、Iaroslav Tverdokhlib、Jiacheng Feng、Jay Chen、Jenia Varavva、Jordan Sitkin、Joseph Florencio、Lien Mamitsuka、Mada Aflak、Manoli Liodakis、Mark Hudnall、Noah MacCallum、Ola Okelola、Peter Bakkum、Rohan Mehta、Romain Huet、Wanning Jiang、Wayne Chang、Yilei Qian
产品
Anubha Srivastava、Jackie Shannon、Jeff Harris、Reah Miyara、Xiaolin Hao
项目赞助人
Aidan Clark、Andrew Gibiansky、David Sasaki、Kevin Weil、Liam Fedus、Mark Chen、Nick Ryder、Nick Turley、Olivier Godement、Prafulla Dhariwal、Shengjia Zhao、Shuchao Bi、Sherwin Wu、Sulman Choudhry