メインコンテンツにスキップ
OpenAI

2025年3月20日

リリース製品

API に次世代の音声モデルを導入

音声エージェントを強化する新しい音声モデルのスイートが登場。世界中の開発者の皆様にご利用いただけます。

OpenAI 次世代音声モデルのブログ ヒーローイメージ
読み込んでいます...

2025年8月28日更新:Realtime API の一般提供を開始しました。詳細はこちらをご覧ください


過去数か月間、私たちはオペレーター、Deep Research、コンピューター使用エージェント、組み込みツールを備えた Responses API などのリリースを通じて、テキストベースのエージェント(ユーザーに代わって自律的にタスクを遂行するシステム)の知能、能力、有用性の向上に注力してきました。しかし、エージェントが真に有用であるためには、人々がテキストを超えた、より深く直感的なインタラクションをエージェントと行える必要があります。つまり、自然な話し言葉を用いて効果的にコミュニケーションを取ることが求められるのです。

本日、API で新しい音声認識および音声合成のモデルをリリースします。これにより、より強力でカスタマイズ可能かつインテリジェントな音声エージェントを構築し、真の価値を提供できるようになります。当社の最新の音声認識モデルは、最先端の新たなベンチマークを打ち立て、精度と信頼性で既存のソリューションを凌駕しています。特に訛りがある、環境が騒がしい、話すスピードにばらつきがあるといった困難な状況で優れた性能を発揮します。これらの改良により文字起こしの信頼性が向上しており、モデルは特にカスタマーコールセンターや会議議事録の文字起こしなどのユースケースに最適です。

開発者は初めて、音声合成モデルに特定の話し方を指示できるようになりました。例えば「思いやりのあるカスタマーサービス担当者のように話して」といった指示が可能になり、音声エージェントのカスタマイズ性が新たな次元へと進化します。これにより、共感的でダイナミックなカスタマーサービス音声から、創造的なストーリーテリング体験のための表現豊かなナレーションまで、幅広い用途に対応したアプリケーションを実現できます。

私たちは2022年に初めての音声モデルを発表し、それ以来、これらのモデルの知能、精度、信頼性の向上に努めてきました。これらの新しい音声モデルを使用することで、開発者はより正確で堅牢な音声認識システムや、表現力豊かで個性的な音声合成を API 内で構築できます。

冷静
サーファー
専門業務
中世の騎士
犯罪マニア
就寝前のおとぎ話

最新の音声モデルの詳細

新しい音声認識モデル

元の Whisper モデルと比較して、単語誤り率が改善され、言語認識と精度が向上した新しい gpt-4o-transcribe および gpt-4o-mini-transcribe モデルを発表します。

gpt-4o-transcribe は、複数の確立されたベンチマークで既存の Whisper モデルを上回る性能の単語誤り率(WER)を示し、当社の音声認識技術における大きな進歩を反映しています。これらの進歩は、強化学習における特定のイノベーションと、多様で高品質な音声データセットを用いた広範な中間トレーニングに直接起因しています。

その結果、これらの新しい音声認識モデルは、発話のニュアンスをより的確に捉え、誤認識を減らし、特に訛りがある、環境が騒がしい、話すスピードにばらつきがあるといった困難な状況において、文字起こしの信頼性を向上させます。これらのモデルは現在、音声認識 API(新しいウィンドウで開く) で利用可能です。

Word Error Rate(WER)は、参照用の書き起こしと比較して誤って書き起こされた単語の割合を算出することで、音声認識モデルの精度を測定します。WER は低いほど良く、エラーが少ないことを意味します。当社の最新の音声認識モデルは、FLEURS(ユニバーサルな音声表現のフューショット学習評価)を含む各種ベンチマーク全体で、より低い WER を達成しています。FLEURS は、手動で文字起こしされた音声サンプルを用い、100以上の言語にまたがる多言語音声ベンチマークです。これらの結果は、文字起こしの精度が向上し、言語のカバレッジがより強化されていることを示しています。ここに示されているように、当社のモデルは、すべての言語評価において一貫して Whisper v2 および Whisper v3 を上回っています。

FLEURS では、当社のモデルは低い WER と優れた多言語パフォーマンスを発揮します。WER は低いほど良く、エラーが少ないことを意味します。ここに示されているように、当社のモデルは、ほとんどの主要言語で他の主要モデルと同等かそれ以上の性能を示しています。

新しい音声合成モデル

また、操縦性が向上した新しい gpt-4o-mini-tts モデルも発売します。開発者は初めて、モデルに何を言うかだけでなく、どのように言うかを「指示」できるようになり、顧客サービスからクリエイティブなストーリーテリングまで、さまざまなユースケースでよりカスタマイズされた体験を実現できます。このモデルは音声合成 API(新しいウィンドウで開く) で利用可能です。これらの音声合成モデルは、事前に設定された人工音声に限定されており、合成プリセットと常に一致するように当社が監視しています。

モデルの背後にある技術革新

本物の音声データセットを用いた事前トレーニング

当社の新しい音声モデルは GPT‑4o および GPT‑4o‑mini のアーキテクチャを基盤としており、モデルのパフォーマンス最適化に不可欠だった、音声中心の専門データセットで広範に事前トレーニングされています。このターゲットを絞ったアプローチにより、発話のニュアンスに関するより深い洞察が得られ、音声関連タスクにおいて卓越した性能を発揮します。

高度な蒸留手法

当社は蒸留技術を強化し、大規模音声モデルから小型で効率的なモデルへの知識の移転を実現しました。高度な自己対話手法を活用する蒸留データセットは、現実的な会話のダイナミクスを効果的に捕捉し、本物のユーザーとアシスタントのやり取りを再現します。これにより、小型モデルでも優れた会話品質と応答性を提供できます。

強化学習のパラダイム

当社の音声認識モデルには、強化学習(RL)を重視したパラダイムを統合し、文字起こしの精度を最先端のレベルにまで引き上げました。この手法は精度を劇的に向上させ、ハルシネーションを減少させることで、複雑な音声認識シナリオにおいて当社の音声認識ソリューションを非常に競争力のあるものにしています。

これらの開発は、革新的な手法と実用的な機能強化を組み合わせることで音声アプリケーションのパフォーマンスを向上させた、オーディオモデリング分野における進歩を表しています。

API の可用性

これらの新しい音声モデルは現在、すべての開発者が利用できます。音声を使用した開発の詳細については、こちら(新しいウィンドウで開く)をご覧ください。テキストベースのモデルで対話型体験を構築している開発者にとっては、当社の音声認識モデルと音声合成モデルを追加することが、音声エージェントを構築する最も簡単な方法です。私たちは、この開発プロセスを簡素化する Agents SDK(新しいウィンドウで開く) との統合をリリースします。低レイテンシの音声変換体験を構築したい開発者には、Realtime API の音声変換モデルを使用して構築することをお勧めします。

今後の展開

今後も、当社の音声モデルの知能と精度の向上への投資を継続するとともに、当社の安全基準に沿った形で、開発者が独自のカスタム音声を導入し、さらにパーソナライズされた体験を構築できる方法を検討していく予定です。さらに、私たちは、合成音声がもたらす課題と機会について、政策立案者、研究者、開発者、クリエイターとの対話を継続していきます。これらの強化された音声機能を活用して、開発者が革新的で創造的なアプリケーションを構築することを楽しみにしています。また、開発者がマルチモーダルなエージェント体験を構築できるように、ビデオを含む他のモダリティにも投資します。

ライブ配信の再生

著者

OpenAI

研究責任者

Christina Kim、Junhua Mao、Yi Shen、Yu Zhang

貢献者

研究

Alex Paino、Bowen Cheng、Chengxu Zhuang、Chris Koch、Damian Mrowca、Erik Ritter、Jacob Menick、James Betker、Ji Lin、Jamie Kiros、Jiahui Yu、Liang Zhou、Liyu Chen、Kevin Lu、Madeline Boyd、Michael Lampe、Mike Heaton、Nanxin Chen、Nitish Keskar、Saachi Jain、Sam Toizer、Somay Jain、Tao Xu、Tomer Kaplan、Wei Han、Xiangning Chen、Ye Jia

エンジニアリング

Alina Wu、Andres Garcia Garcia、Arshi Bhatnagar、Avital Oliver、Brendan Quinn、Christina Huang、David Fang、Dragos Oprica、Dominik Kundel、Edede Oiwoh、Iaroslav Tverdokhlib、Jiacheng Feng、Jay Chen、Jenia Varavva、Jordan Sitkin、Joseph Florencio、Lien Mamitsuka、Mada Aflak、Manoli Liodakis、Mark Hudnall、Noah MacCallum、Ola Okelola、Peter Bakkum、Rohan Mehta、Romain Huet、Wanning Jiang、Wayne Chang、Yilei Qian

製品

Anubha Srivastava、Jackie Shannon、Jeff Harris、Reah Miyara、Xiaolin Hao

リーダーシップスポンサー

Aidan Clark、Andrew Gibiansky、David Sasaki、Kevin Weil、Liam Fedus、Mark Chen、Nick Ryder、Nick Turley、Olivier Godement、Prafulla Dhariwal、Shengjia Zhao、Shuchao Bi、Sherwin Wu、Sulman Choudhry