GPT‑Live‑1 を API で提供開始します。開発者は、高性能で自然な会話ができる音声モデルを活用して、音声対応アプリやビジネスワークフローを構築できます。最初に ChatGPT に導入された GPT‑Live‑1 は、聞くことと話すことを同時に行えます。また、Codex と ChatGPT Work で示したように(新しいウィンドウで開く)、より深い推論やアクションを、組み合わせたモデルやツールに委任できます。
GPT‑Live‑1 の API 提供にあたり、開発者がユーザー、ワークフロー、目標に合わせて音声体験を制御し、カスタマイズできる新機能の開発に注力しました。GPT‑Live‑1 の主な強みであるスムーズな割り込み処理は、すでにビジネス上の成果につながっています。Speak の初期評価では、GPT‑Live‑1 を使うことで、語学講師が応答するまでに学習者が考える時間をより長く確保でき、従来のターン制システムと比べて割り込みが 80% 近く減少したことが確認されました。
API における GPT‑Live‑1 の主な強み:
割り込み処理:入力音声と出力音声の両方を踏まえて推論する単一のモデルにより、割り込み処理を改善し、STT–LLM–TTS を連結したアーキテクチャの遅延や不安定な受け渡しを回避します。
推論とツール呼び出しの委任:GPT‑Live‑1 は、GPT‑6 Astra などのバックエンドのテキストモデルやサードパーティモデルに、推論とツール呼び出しを委任できます。
口調、話す速さ、スタイル:開発者は、システムプロンプトを通じて、エージェントの口調、話す速さ、会話スタイルを設定できます。
発話を伴わないコンテキスト管理と背景雑音:会話を遮ったり各ステップを逐一読み上げたりせず、背景雑音や沈黙をより適切に処理します。
長時間セッションの信頼性:長時間のやり取りでも、コンテキストの保持力と会話品質が向上します。
電話対応:レストランの予約からカスタマーサポートまで、通話用の全二重音声エージェントを導入できます。
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
このデモは期間限定です。これを利用することで、OpenAI の利用規約に同意し、当社のプライバシーポリシーを確認したものとみなされます。
従来の音声エージェントは、音声認識、リーズニングモデル、音声合成を連結しています。受け渡しのたびに遅延が生じ、会話のタイミングやコンテキスト、自然なリズムが損なわれやすくなります。誰かが割り込んだり、間を置いたり、話題を変えたりした場合の処理も含め、こうした各段階の調整は多くの場合、開発者に委ねられています。
GPT‑Live‑1 は音声の聞き取りと発話を単一のモデルで処理し、音声レイヤーを簡素化します。割り込みや相づちにその場で応答しながら、より深い推論をバックエンドに委任できます。これにより、バックグラウンドで処理を進めながら会話を続けられます。
開発者は、会話を支えるモデル、ツール、エージェントハーネスを選択できます。たとえば、スケジュール調整や注文状況の更新といった大量のタスクには GPT‑Live‑1 と Luna のようなモデルを組み合わせ、推論を要する複雑な顧客課題には Astra のようなモデルを使用できます。この柔軟性により、タスクごとに推論の深さ、速度、コストを最適化できます。
GPT‑Live‑1 は、自動音声認識(ASR)による文字起こしと応答テキストの出力を標準機能として提供します。また、英数字を高精度で理解し、特定のキーワードを認識しやすくする調整にも対応します。GPT‑Live‑1 はターン制モデルではありませんが、ターン検出を標準でサポートしているため、開発者は引き続き、発話の区切りを明確にしたアプリケーションを構築できます。
当社の各種評価では、GPT‑Live‑1 は GPT‑Realtime‑2.1 と比べて Full Duplex Bench のスコアが 30 ポイント高く、話者が交代する際の遅延や、対話中の振る舞いも大幅に改善しました。推論の強度を中程度に設定した GPT‑6 Astra と組み合わせると、最先端の音声エージェントの知的能力をエンドツーエンドのタスクで測る Tau3 でも 1 位を獲得しています。
航空、小売、通信分野における音声によるカスタマーサービスのタスクを評価します。Pass@1 はタスクの成功率を測定し、総合スコアでは各分野を同じ重みで扱っています。
* GPT Live バックエンド:Astra(中程度)
ナレッジ検索と口座関連ツールを使った、音声による銀行の顧客サポートを評価します。Pass@1 は、97件の banking_knowledge タスクのうち正常に完了した割合です。
* GPT Live バックエンド:Astra(中程度)
会話の間への対応、話者の交代、割り込み、相づちを評価します。
周囲から聞こえる話し声、別の相手に向けた発話、聞き手の相づち、割り込みに対する反応をテストします。
ユーザーが発話を終えてから、エージェントが応答を開始するまでの時間を測定します。
自然な間やためらい、言い直しを含む音声リクエストに対して、適切にツールを使用できるかをテストします。Pass@1 は、一連のツール呼び出しを評価します。
* GPT Live バックエンド:Terra(低)
間やためらい、言い直しを含み、ツールの使用を必要とするリクエストに対して、音声で返される回答を評価します。回答が、評価基準となる意図にどの程度沿っているかを採点します。
* GPT Live バックエンド:Terra(低)
開発者には、製品に合い、利用者にとって自然に聞こえる音声が必要です。GPT‑Live‑1 では、これまで限られていたリアルタイム音声の種類を増やし、多様なアクセント、方言、言語から選べるようにすることで、開発者がアシスタントの声を選ぶ際の選択肢を広げます。
今後数か月にわたり、音声オプションと対応言語を引き続き拡充します。
GPT‑Live‑1 は本日より API で提供されており(新しいウィンドウで開く)、フロントエンドの音声レイヤーは1分あたり $0.05 です。製品に適したバックエンドモデルやエージェントハーネスと組み合わせることで、担う業務に応じて拡張できる音声体験を構築できます。
カスタム音声の利用条件や申請手続きについて詳しくは、営業担当にお問い合わせください。
GPT‑Live‑1 を基盤に音声ワークフローを構築するもう1つの方法は、モデルを活用してリアルタイムの音声対話を実現する OpenAI Presence を利用することです。Presence は、企業による信頼できる AI エージェントの導入を支援します。このエージェントは、質問への回答、問題の解決、社内システムの利用、承認されたアクションの実行に対応し、必要に応じて担当者に引き継ぐこともできます。詳しくは、OpenAI のアカウントディレクターにお問い合わせください。

