メインコンテンツにスキップ
OpenAI

2026年9月10日

製品リリース

API の GPT‑Live‑1 で、より自然な音声体験を構築

GPT‑Live‑1 により、ChatGPT のように聞くことと話すことを同時に行える自然な会話が API でも可能になります。音声エージェントの話し方や動作をより細かく制御できます。

読み込んでいます...

GPT‑Live‑1 を API で提供開始します。開発者は、高性能で自然な会話ができる音声モデルを活用して、音声対応アプリやビジネスワークフローを構築できます。最初に ChatGPT に導入された GPT‑Live‑1 は、聞くことと話すことを同時に行えます。また、Codex と ChatGPT Work で示したように⁠(新しいウィンドウで開く)、より深い推論やアクションを、組み合わせたモデルやツールに委任できます。

GPT‑Live‑1 の API 提供にあたり、開発者がユーザー、ワークフロー、目標に合わせて音声体験を制御し、カスタマイズできる新機能の開発に注力しました。GPT‑Live‑1 の主な強みであるスムーズな割り込み処理は、すでにビジネス上の成果につながっています。Speak の初期評価では、GPT‑Live‑1 を使うことで、語学講師が応答するまでに学習者が考える時間をより長く確保でき、従来のターン制システムと比べて割り込みが 80% 近く減少したことが確認されました。

API における GPT‑Live‑1 の主な強み:

  • 割り込み処理:入力音声と出力音声の両方を踏まえて推論する単一のモデルにより、割り込み処理を改善し、STT–LLM–TTS を連結したアーキテクチャの遅延や不安定な受け渡しを回避します。

  • 推論とツール呼び出しの委任:GPT‑Live‑1 は、GPT‑6 Astra などのバックエンドのテキストモデルやサードパーティモデルに、推論とツール呼び出しを委任できます。

  • 口調、話す速さ、スタイル:開発者は、システムプロンプトを通じて、エージェントの口調、話す速さ、会話スタイルを設定できます。

  • 発話を伴わないコンテキスト管理と背景雑音:会話を遮ったり各ステップを逐一読み上げたりせず、背景雑音や沈黙をより適切に処理します。

  • 長時間セッションの信頼性:長時間のやり取りでも、コンテキストの保持力と会話品質が向上します。

  • 電話対応:レストランの予約からカスタマーサポートまで、通話用の全二重音声エージェントを導入できます。

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

このデモは期間限定です。これを利用することで、OpenAI の利用規約に同意し、当社のプライバシーポリシーを確認したものとみなされます。

音声エージェントのアーキテクチャを簡素化し、音声の遅延を低減

従来の音声エージェントは、音声認識、リーズニングモデル、音声合成を連結しています。受け渡しのたびに遅延が生じ、会話のタイミングやコンテキスト、自然なリズムが損なわれやすくなります。誰かが割り込んだり、間を置いたり、話題を変えたりした場合の処理も含め、こうした各段階の調整は多くの場合、開発者に委ねられています。

GPT‑Live‑1 は音声の聞き取りと発話を単一のモデルで処理し、音声レイヤーを簡素化します。割り込みや相づちにその場で応答しながら、より深い推論をバックエンドに委任できます。これにより、バックグラウンドで処理を進めながら会話を続けられます。

“GPT‑Live‑1 により、当社のカスケード型システムと比べてコードベースを 80% 簡素化し、2 万 3,000 行のコードを削減できました。これにより、患者との自然なリアルタイム会話が可能になり、当社チームは予約から受診案内までの体験改善に注力できるようになりました。”
—Tony Stoyanov 氏、共同創業者兼 CTO

開発者は、会話を支えるモデル、ツール、エージェントハーネスを選択できます。たとえば、スケジュール調整や注文状況の更新といった大量のタスクには GPT‑Live‑1 と Luna のようなモデルを組み合わせ、推論を要する複雑な顧客課題には Astra のようなモデルを使用できます。この柔軟性により、タスクごとに推論の深さ、速度、コストを最適化できます。

GPT‑Live‑1 は、自動音声認識(ASR)による文字起こしと応答テキストの出力を標準機能として提供します。また、英数字を高精度で理解し、特定のキーワードを認識しやすくする調整にも対応します。GPT‑Live‑1 はターン制モデルではありませんが、ターン検出を標準でサポートしているため、開発者は引き続き、発話の区切りを明確にしたアプリケーションを構築できます。

全二重方式の優位性を測定

当社の各種評価では、GPT‑Live‑1 は GPT‑Realtime‑2.1 と比べて Full Duplex Bench のスコアが 30 ポイント高く、話者が交代する際の遅延や、対話中の振る舞いも大幅に改善しました。推論の強度を中程度に設定した GPT‑6 Astra と組み合わせると、最先端の音声エージェントの知的能力をエンドツーエンドのタスクで測る Tau3 でも 1 位を獲得しています。

航空、小売、通信分野における音声によるカスタマーサービスのタスクを評価します。Pass@1 はタスクの成功率を測定し、総合スコアでは各分野を同じ重みで扱っています。


* GPT Live バックエンド:Astra(中程度)

ナレッジ検索と口座関連ツールを使った、音声による銀行の顧客サポートを評価します。Pass@1 は、97件の banking_knowledge タスクのうち正常に完了した割合です。


* GPT Live バックエンド:Astra(中程度)

会話の間への対応、話者の交代、割り込み、相づちを評価します。

周囲から聞こえる話し声、別の相手に向けた発話、聞き手の相づち、割り込みに対する反応をテストします。

ユーザーが発話を終えてから、エージェントが応答を開始するまでの時間を測定します。

自然な間やためらい、言い直しを含む音声リクエストに対して、適切にツールを使用できるかをテストします。Pass@1 は、一連のツール呼び出しを評価します。


* GPT Live バックエンド:Terra(低)

間やためらい、言い直しを含み、ツールの使用を必要とするリクエストに対して、音声で返される回答を評価します。回答が、評価基準となる意図にどの程度沿っているかを採点します。


* GPT Live バックエンド:Terra(低)

お客様の声

1/4
“Yelp Host と Hatch に GPT‑Live‑1 を導入したことで、従来の音声アーキテクチャと比べて会話の交代がスムーズになり、精度も向上しました。Yelp Host が GPT‑Live‑1 を使って予約や料理の注文などの電話に応対するようになり、通話対応率に明確な改善が見られています。電話をかけてくる方も、より自然でまとまりのある話し方をするようになりました。このことから、電話をかける側にとっても、これまでとは違う体験になっていることがわかります。”
—Alex Levy 氏、最高技術責任者

新しい音声オプション

開発者には、製品に合い、利用者にとって自然に聞こえる音声が必要です。GPT‑Live‑1 では、これまで限られていたリアルタイム音声の種類を増やし、多様なアクセント、方言、言語から選べるようにすることで、開発者がアシスタントの声を選ぶ際の選択肢を広げます。

新しい音声を聞いてみる

今後数か月にわたり、音声オプションと対応言語を引き続き拡充します。

料金と提供状況

GPT‑Live‑1 は本日より API で提供されており⁠(新しいウィンドウで開く)、フロントエンドの音声レイヤーは1分あたり $0.05 です。製品に適したバックエンドモデルやエージェントハーネスと組み合わせることで、担う業務に応じて拡張できる音声体験を構築できます。

GPT-Live-1 を Codex に接続

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

GPT-Live-1 を Codex に接続します。この抜粋では、アプリケーションが会話コンテキストを Codex に渡し、その回答を GPT-Live-1 に返す方法を示します。接続のセットアップと委任処理については省略しています。

カスタム音声の利用条件や申請手続きについて詳しくは、営業担当にお問い合わせください。

GPT‑Live‑1 を基盤に音声ワークフローを構築するもう1つの方法は、モデルを活用してリアルタイムの音声対話を実現する OpenAI Presence を利用することです。Presence は、企業による信頼できる AI エージェントの導入を支援します。このエージェントは、質問への回答、問題の解決、社内システムの利用、承認されたアクションの実行に対応し、必要に応じて担当者に引き継ぐこともできます。詳しくは、OpenAI のアカウントディレクターにお問い合わせください。