跳到主要內容
OpenAI

2026年9月10日

產品發佈

透過 API 使用 GPT‑Live‑1,建立更自然的語音體驗

GPT‑Live‑1 把 ChatGPT 自然流暢的全雙工對話帶到 API,讓你可更靈活控制語音智能代理如何說話及行動。

正在載入...

我們現於 API 推出 GPT‑Live‑1,為開發人員提供功能強大、語音自然的模型,用來建立支援語音的應用程式和業務工作流程。最初在 ChatGPT 推出的 GPT‑Live‑1 能同時聆聽和說話;正如在 Codex 和「ChatGPT 工作」中所見⁠(在新視窗中開啟),它亦可把更深入的推理和操作委派給配搭的模型與工具。

為在 API 推出 GPT‑Live‑1,我們重點開發多項新功能,讓開發人員可以因應用戶、工作流程及目標,調整並自訂語音體驗。GPT‑Live‑1 的核心優勢之一是更順暢地處理對話打斷,而這已帶來實際業務成效:在早期評估中,Speak 發現,相比以往按輪次運作的系統,GPT‑Live‑1 讓學習者在語言導師回應前有更多時間思考,打斷情況減少近 80%。

GPT‑Live‑1 在 API 中的主要優勢:

  • 對話打斷處理:透過單一模型同時對傳入和傳出的音訊進行推理,改善對話打斷處理,避免串連式 STT–LLM–TTS 架構造成的延遲及不穩定交接。

  • 推理及工具調用委派:GPT‑Live‑1 可將推理和工具調用委派給後端文字模型,例如 GPT‑6 Astra 或第三方模型。

  • 語氣、節奏和風格:開發人員可以透過系統提示詞,塑造智能代理的語氣、節奏和對話風格。

  • 靜默情境管理及背景噪音:更妥善處理背景噪音和靜默,不會打斷對話或逐步讀出每項操作。

  • 長時段可靠性:在長時間互動中提升情境保留能力和對話質素。

  • 電話支援:支援部署用於電話通話的全雙工語音智能代理,應用範圍涵蓋餐廳訂座以至客戶支援。

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

此示範設有時間限制。使用即表示你同意 OpenAI 的《使用條款》,並確認已知悉我們的《私隱政策》。

簡化語音智能代理架構,減少語音延遲

傳統語音智能代理會把語音轉文字、推理模型及文字轉語音串連起來。每次交接都會增加延遲,也更容易錯失時機、遺失情境,或破壞對話的自然節奏。協調這些階段的工作往往落在開發者身上,包括處理對方打斷、停頓或改變方向時的情況。

GPT‑Live‑1 以單一模型處理聆聽和說話,簡化語音層。它可即時回應打斷和確認,同時把更深入的推理委派至後端。因此,即使工作在背景進行,對話仍可持續。

“相比我們的串接式架構,GPT‑Live‑1 令程式碼庫簡化 80%,並刪減了 23,000 行程式碼。這不但實現自然的即時病人對話,亦讓團隊可專注改善從預約診症到尋找合適護理服務的整體體驗。”
—聯合創辦人兼技術總監 Tony Stoyanov

開發者可選擇支援對話的模型、工具和智能代理任務執行框架。例如,開發者可把 GPT‑Live‑1 與 Luna 等模型配搭,用於排程或訂單更新等大量工作;遇到需要推理的複雜客戶問題,則可使用 Astra 等模型。這種靈活性讓開發者可因應每項工作,調整推理深度、速度和成本。

GPT‑Live‑1 原生提供 ASR 文字稿和回應文字。它亦具備出色的英數字理解能力,並支援關鍵字偏向設定。雖然 GPT‑Live‑1 並非按輪次運作的模型,但原生支援輪次偵測,因此開發人員仍可按照明確的輪次界線建立系統。

衡量全雙工優勢

在各項評估中,GPT‑Live‑1 的 Full Duplex Bench 表現較 GPT‑Realtime‑2.1 提升 30 個百分點,輪流發言延遲和互動表現均大幅改善。配搭採用中等推理強度的 GPT‑6 Astra 時,它亦在 Tau3 排名第一;Tau3 衡量前沿語音智能代理處理端到端任務的智能表現。

評估航空、零售和電訊範疇的語音客戶服務任務。Pass@1 用於衡量任務是否成功;整體分數對每個範疇採用相同權重。


* GPT Live 後端:Astra(中)。

評估透過語音提供銀行客戶支援的能力,包括檢索知識及使用帳戶工具。Pass@1 是在 97 項 banking_knowledge 任務中成功完成的任務比例。


* GPT Live 後端:Astra(中)。

評估停頓處理、對話中的輪流發言、打斷和簡短回應。

測試對背景人聲、與他人說話、聆聽者的簡短回應和打斷的反應。

衡量用戶完成一輪對話後,智能代理開始回覆的速度。

測試根據包含自然停頓、猶豫和自我修正的口語請求使用工具的能力。Pass@1 為工具調用序列評分。


* GPT Live 後端:Terra(低)。

評估針對帶有停頓、猶豫和自我修正、並涉及工具使用的請求所作出的口語回答。 根據答案與參考意圖的吻合程度評分。


* GPT Live 後端:Terra(低)。

客戶評價

1/4
“在 Yelp Host 和 Hatch 加入 GPT‑Live‑1 後,相比傳統語音架構,輪流發言的表現和準確度均有所提升。Yelp Host 使用 GPT‑Live‑1 接聽訂座和點餐等來電時,我們發現來電處理率顯著提高。來電者亦會使用更完整、自然的句子,反映他們在電話另一端感受到的體驗確實有所不同。”
—首席技術總監 Alex Levy

全新語音選項

開發者需要既切合產品定位,又能讓使用者聽起來自然的語音。透過 GPT‑Live‑1,我們把原本數量有限的即時語音,擴展至涵蓋更多口音、方言和語言的選擇,讓開發者更靈活地塑造助理的聲音。

試聽全新語音

未來數月,我們會繼續增加語音選項及支援的語言。

價格及供應情況

GPT‑Live‑1 現已可透過 API 使用⁠(在新視窗中開啟),前端語音層收費為每分鐘 $0.05。配搭切合產品需要的後端模型和智能代理任務執行框架,即可建立能隨工作規模擴展的語音體驗。

將 GPT-Live-1 連接至 Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

將 GPT-Live-1 連接至 Codex。此摘錄說明應用程式如何將對話上下文傳送至 Codex,再把 Codex 的回答傳回 GPT-Live-1。連線設定和委派處理部分從略。

如欲使用自訂語音,請聯絡銷售團隊,進一步了解資格及申請流程。

使用 GPT‑Live‑1 建立語音工作流程的另一種方式,是透過 OpenAI Presence;當中利用此模型驅動即時語音互動。Presence 可協助企業部署值得信賴的 AI 智能代理,讓 AI 智能代理能夠回答問題、解決問題、使用公司系統、採取已核准的行動,並在需要時升級交由人員處理。如欲進一步了解詳情,請聯絡你的 OpenAI 客戶總監。

作者

OpenAI