我们现已在 API 中推出 GPT‑Live‑1,为开发者提供一款功能强大、交互自然的语音模型,用于构建支持语音的应用和业务工作流。GPT‑Live‑1 最初在 ChatGPT 中推出,能够同时聆听和说话;正如 Codex 和“ChatGPT 工作”所展示的那样(在新窗口中打开),它还可以将更深入的推理和操作委派给与其搭配的模型和工具。
此次通过 API 推出 GPT‑Live‑1 时,我们重点开发了一系列新能力,让开发者能够根据用户、工作流和目标引导和定制语音体验。顺畅的打断处理是 GPT‑Live‑1 的核心优势之一,而且已经带来实际业务成效:在早期评估中,Speak 发现,相比以往基于轮次的系统,GPT‑Live‑1 会在语言导师回应前为学习者留出更多思考时间,使语言导师打断学习者的情况减少近 80%。
GPT‑Live‑1 在 API 中的主要优势:
打断处理:通过单一模型对传入和传出的音频进行联合推理,改善打断处理,并避免串联式 STT(语音转文本)–LLM(大语言模型)–TTS(文本转语音)架构带来的延迟和不稳定衔接。
推理与工具调用委派:GPT‑Live‑1 可以将推理和工具调用委派给 GPT‑6 Astra 等后端文本模型或第三方模型。
语气、语速和风格:开发者可以通过系统提示词 (system prompt) 塑造智能体的语气、语速和对话风格。
静默上下文管理与背景噪声:更妥善地处理背景噪声和静默,不会打断对话,也不会把每个步骤都说出来。
长会话可靠性:在长时间交互中提升上下文保持能力和对话质量。
电话支持:支持部署用于电话通话的全双工语音智能体,覆盖餐厅预订、客户支持等场景。
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
传统语音智能体将语音转文本、推理模型和文本转语音串联在一起。每次交接都会增加延迟,也更容易丢失时机、上下文或对话的自然节奏。这些阶段通常需要开发者亲自协调,包括处理对方打断、停顿或改变话题的情况。
GPT‑Live‑1 以单一模型完成聆听和说话,从而简化语音层。它可以即时处理用户的打断和简短回应,同时将更深入的推理交由后端处理。这样一来,即使后台正在处理任务,对话也能继续进行。
开发者可以选择对话背后的模型、工具和智能体执行框架。例如,他们可以将 GPT‑Live‑1 与 Luna 等模型搭配,用于日程安排或订单更新等高频任务;对于需要推理的复杂客户问题,则可使用 Astra 等模型。这种灵活性让开发者可以根据各项任务调整推理深度、速度和成本。
GPT‑Live‑1 原生提供 ASR(自动语音识别)转写文本和回复文本。它还具备出色的字母数字内容理解能力,并支持关键词偏置 (keyword biasing)。尽管 GPT‑Live‑1 并非基于轮次的模型,但它原生支持轮次检测,因此开发者仍可围绕明确的轮次边界进行开发。
在各项评估中,GPT‑Live‑1 在 Full Duplex Bench(全双工基准测试)上的得分比 GPT‑Realtime‑2.1 高出 30 个百分点,大幅降低了轮次交替延迟,并显著改善了交互行为。与采用中等推理强度的 GPT‑6 Astra 搭配时,它还在 Tau3 上排名第一;该基准用于衡量前沿语音智能体处理端到端任务的智能水平。
评估航空、零售和电信领域的语音客服任务。Pass@1 衡量任务成功率;汇总得分对各领域采用相同权重。
* GPT Live 后端模型:Astra(中等推理强度)。
评估使用知识检索和账户工具的银行语音客服任务。Pass@1 表示 97 项 banking_knowledge 任务中成功完成的比例。
* GPT Live 后端模型:Astra(中等推理强度)。
评估停顿处理、对话中的轮次交替、打断和听者反馈。
测试模型对背景人声、用户对他人说话、听者反馈及打断的反应。
衡量用户一个轮次结束后,智能体开始回复所需的时间。
测试模型根据包含自然停顿、犹豫和自我纠正的语音请求使用工具的能力。Pass@1 根据工具调用序列是否正确进行评分。
* GPT Live 后端模型:Terra(低推理强度)。
评估智能体针对包含停顿、犹豫和自我纠正且需要使用工具的语音请求所作的语音回答。根据回答与参考意图的匹配程度评分。
* GPT Live 后端模型:Terra(低推理强度)。
开发者需要契合产品定位、听起来自然的语音。借助 GPT‑Live‑1,我们将少量实时语音扩展为覆盖更多口音、方言和语言的广泛选择,让开发者能更灵活地塑造助手的声音。
未来几个月,我们将继续增加音色选项并扩大语言支持范围。
GPT‑Live‑1 现已在 API 中提供(在新窗口中打开),前端语音层的价格为每分钟 0.05 美元。将其与适合你产品的后端模型和智能体执行框架搭配使用,即可构建能够随工作负载灵活扩展的语音体验。
如需获得自定义语音的使用权限,请联系销售团队,了解申请资格和流程。
另一种基于 GPT‑Live‑1 构建语音工作流的方式是使用 OpenAI Presence,它通过该模型实现实时语音交互。Presence 可帮助企业部署可信的 AI 智能体,让它们能够回答问题、解决问题、使用企业内部系统、执行经批准的操作,并在需要时转交人工处理。请联系你的 OpenAI 客户经理,了解更多信息。

