跳至主要内容
OpenAI

2026年9月10日

产品发布

在 API 中使用 GPT‑Live‑1 构建更自然的语音体验

GPT‑Live‑1 将 ChatGPT 自然流畅的全双工对话能力带入 API,让开发者能够更好地控制语音智能体的表达和行为方式

正在加载…

我们现已在 API 中推出 GPT‑Live‑1,为开发者提供一款功能强大、交互自然的语音模型,用于构建支持语音的应用和业务工作流。GPT‑Live‑1 最初在 ChatGPT 中推出,能够同时聆听和说话;正如 Codex 和“ChatGPT 工作”所展示的那样⁠(在新窗口中打开),它还可以将更深入的推理和操作委派给与其搭配的模型和工具。

此次通过 API 推出 GPT‑Live‑1 时,我们重点开发了一系列新能力,让开发者能够根据用户、工作流和目标引导和定制语音体验。顺畅的打断处理是 GPT‑Live‑1 的核心优势之一,而且已经带来实际业务成效:在早期评估中,Speak 发现,相比以往基于轮次的系统,GPT‑Live‑1 会在语言导师回应前为学习者留出更多思考时间,使语言导师打断学习者的情况减少近 80%。

GPT‑Live‑1 在 API 中的主要优势:

  • 打断处理:通过单一模型对传入和传出的音频进行联合推理,改善打断处理,并避免串联式 STT(语音转文本)–LLM(大语言模型)–TTS(文本转语音)架构带来的延迟和不稳定衔接。

  • 推理与工具调用委派:GPT‑Live‑1 可以将推理和工具调用委派给 GPT‑6 Astra 等后端文本模型或第三方模型。

  • 语气、语速和风格:开发者可以通过系统提示词 (system prompt) 塑造智能体的语气、语速和对话风格。

  • 静默上下文管理与背景噪声:更妥善地处理背景噪声和静默,不会打断对话,也不会把每个步骤都说出来。

  • 长会话可靠性:在长时间交互中提升上下文保持能力和对话质量。

  • 电话支持:支持部署用于电话通话的全双工语音智能体,覆盖餐厅预订、客户支持等场景。

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

此演示有时间限制。使用即表示你同意 OpenAI 的《条款》,并确认已知悉我们的《隐私政策》。

简化语音智能体架构,降低语音延迟

传统语音智能体将语音转文本、推理模型和文本转语音串联在一起。每次交接都会增加延迟,也更容易丢失时机、上下文或对话的自然节奏。这些阶段通常需要开发者亲自协调,包括处理对方打断、停顿或改变话题的情况。

GPT‑Live‑1 以单一模型完成聆听和说话,从而简化语音层。它可以即时处理用户的打断和简短回应,同时将更深入的推理交由后端处理。这样一来,即使后台正在处理任务,对话也能继续进行。

“与我们的级联架构相比,GPT‑Live‑1 将代码库简化了 80%,删去了 2.3 万行代码。这不仅实现了自然的实时患者对话,还让团队能腾出精力,改善从预约就诊到就医指引的全流程体验。”
— Tony Stoyanov,联合创始人兼首席技术官

开发者可以选择对话背后的模型、工具和智能体执行框架。例如,他们可以将 GPT‑Live‑1 与 Luna 等模型搭配,用于日程安排或订单更新等高频任务;对于需要推理的复杂客户问题,则可使用 Astra 等模型。这种灵活性让开发者可以根据各项任务调整推理深度、速度和成本。

GPT‑Live‑1 原生提供 ASR(自动语音识别)转写文本和回复文本。它还具备出色的字母数字内容理解能力,并支持关键词偏置 (keyword biasing)。尽管 GPT‑Live‑1 并非基于轮次的模型,但它原生支持轮次检测,因此开发者仍可围绕明确的轮次边界进行开发。

衡量全双工优势

在各项评估中,GPT‑Live‑1 在 Full Duplex Bench(全双工基准测试)上的得分比 GPT‑Realtime‑2.1 高出 30 个百分点,大幅降低了轮次交替延迟,并显著改善了交互行为。与采用中等推理强度的 GPT‑6 Astra 搭配时,它还在 Tau3 上排名第一;该基准用于衡量前沿语音智能体处理端到端任务的智能水平。

评估航空、零售和电信领域的语音客服任务。Pass@1 衡量任务成功率;汇总得分对各领域采用相同权重。


* GPT Live 后端模型:Astra(中等推理强度)。

评估使用知识检索和账户工具的银行语音客服任务。Pass@1 表示 97 项 banking_knowledge 任务中成功完成的比例。


* GPT Live 后端模型:Astra(中等推理强度)。

评估停顿处理、对话中的轮次交替、打断和听者反馈。

测试模型对背景人声、用户对他人说话、听者反馈及打断的反应。

衡量用户一个轮次结束后,智能体开始回复所需的时间。

测试模型根据包含自然停顿、犹豫和自我纠正的语音请求使用工具的能力。Pass@1 根据工具调用序列是否正确进行评分。


* GPT Live 后端模型:Terra(低推理强度)。

评估智能体针对包含停顿、犹豫和自我纠正且需要使用工具的语音请求所作的语音回答。根据回答与参考意图的匹配程度评分。


* GPT Live 后端模型:Terra(低推理强度)。

客户评价

1 条/ 共 4 条
“将 GPT‑Live‑1 引入 Yelp Host 和 Hatch 后,相比传统语音架构,轮次交替和准确性均有所提升。当 Yelp Host 使用 GPT‑Live‑1 接听预订、点餐等来电时,我们发现来电处理率明显提高。来电者说出的句子也更完整、更自然,这说明电话另一端的体验确实有所不同。”
—Alex Levy,首席技术官

全新音色选项

开发者需要契合产品定位、听起来自然的语音。借助 GPT‑Live‑1,我们将少量实时语音扩展为覆盖更多口音、方言和语言的广泛选择,让开发者能更灵活地塑造助手的声音。

试听全新音色

未来几个月,我们将继续增加音色选项并扩大语言支持范围。

价格与可用性

GPT‑Live‑1 现已在 API 中提供⁠(在新窗口中打开),前端语音层的价格为每分钟 0.05 美元。将其与适合你产品的后端模型和智能体执行框架搭配使用,即可构建能够随工作负载灵活扩展的语音体验。

将 GPT-Live-1 连接到 Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

将 GPT-Live-1 连接到 Codex。此节选展示了应用如何将对话上下文传递给 Codex,再将 Codex 的回答返回给 GPT-Live-1。其中省略了连接设置和委派处理部分。

如需获得自定义语音的使用权限,请联系销售团队,了解申请资格和流程。

另一种基于 GPT‑Live‑1 构建语音工作流的方式是使用 OpenAI Presence,它通过该模型实现实时语音交互。Presence 可帮助企业部署可信的 AI 智能体,让它们能够回答问题、解决问题、使用企业内部系统、执行经批准的操作,并在需要时转交人工处理。请联系你的 OpenAI 客户经理,了解更多信息。

作者

OpenAI