跳至主要內容
OpenAI

2026年9月10日

產品發布

使用 API 中的 GPT‑Live‑1 打造更自然的語音體驗

GPT‑Live‑1 將 ChatGPT 自然的全雙工對話帶到 API,讓你能更精準控制語音智慧體說話與行動的方式。

載入中…

我們在 API 中推出 GPT‑Live‑1,提供功能強大、對話自然的語音模型,讓開發者打造支援語音的應用程式和業務工作流程。GPT‑Live‑1 最初於 ChatGPT 推出,能同時聆聽與說話。如同我們在 Codex 與 「ChatGPT 工作」 中的示範⁠(在新視窗中開啟),GPT‑Live‑1 也能將更深入的推理與動作執行委派給搭配使用的模型和工具。

針對 GPT‑Live‑1 的 API 版本,我們著重開發新功能,讓開發者能根據使用者需求、工作流程與目標,調整及自訂語音體驗。GPT‑Live‑1 的核心優勢之一,是能順暢應對插話,這已開始帶來商業效益。在早期評估中,Speak 發現,GPT‑Live‑1 讓學習者在語言導師回應前有更多時間思考,相較於先前的輪流對話系統,打斷學習者的次數減少了近 80%。

GPT‑Live‑1 在 API 中的主要優勢:

  • 插話處理:透過單一模型同時對輸入與輸出的音訊進行推理,更順暢地處理插話,避免串接式 STT-LLM-TTS 架構造成延遲,以及各環節銜接時容易出錯的問題。

  • 推理與工具呼叫委派:GPT‑Live‑1 可將推理與工具呼叫委派給 GPT‑6 Astra 等後端文字模型或第三方模型。

  • 語氣、節奏與風格:開發者可透過系統提示詞調整智慧體的語氣、節奏與對話風格。

  • 靜默情境管理與背景噪音:能更妥善處理背景噪音和沉默,不會打斷對話,也不會把每個步驟都說出來。

  • 長時間工作階段可靠性:提升長時間互動中的情境保留能力與對話品質。

  • 電話支援:可部署用於電話通話的全雙工語音智慧體,涵蓋餐廳訂位、客戶支援等情境。

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

這組示範有時間限制。開始使用 Realtime 的示範內容即表示你同意 OpenAI 的《使用條款》並已知悉了我們的《隱私權政策》。

簡化語音智慧體架構並降低語音延遲

傳統語音智慧體會將語音轉文字、推理模型和文字轉語音串接起來。每次交接都會增加延遲,也更容易失去時機、情境或自然的對話節奏。開發者往往必須自行協調這些階段,包括有人打斷、停頓或改變話題時該如何處理。

GPT‑Live‑1 透過單一模型處理聆聽與說話,簡化語音層。模型能即時回應插話與附和,同時將更深入的推理委派給後端。因此,背景工作執行期間,對話仍可持續進行。

“相較於我們的串接式建置,GPT‑Live‑1 將程式碼庫簡化了 80%,並移除 2.3 萬行程式碼。因此,我們能與病患進行自然、即時的對話,團隊也能專注改善從預約看診到尋找照護服務的整體體驗。”
—Tony Stoyanov,共同創辦人暨技術長

開發者可選擇支援對話的模型、工具與智慧體任務執行框架。例如,可以將 GPT‑Live‑1 搭配 Luna 等模型,處理排程或訂單更新等大量任務;遇到需要推理的複雜客戶問題時,則使用 Astra 等模型。這種彈性讓開發者能針對每項任務調整推理深度、速度與成本。

GPT‑Live‑1 內建自動語音辨識 (ASR) 功能,可提供逐字稿與回應文字。模型也能準確理解字母與數字,並支援關鍵字偏置。雖然 GPT‑Live‑1 並非輪流對話模型,但內建對話輪次偵測功能,因此開發者仍可根據明確的輪次界線設計應用。

衡量全雙工優勢

在我們的各項評估中,GPT‑Live‑1 在 Full Duplex Bench 的表現比 GPT‑Realtime‑2.1 提升了 30 個百分點,對話輪替的延遲與互動行為也大幅改善。搭配採用中等推理強度的 GPT‑6 Astra 時,GPT‑Live‑1 也在 Tau3 排名第一。Tau3 用來衡量最先進的語音智慧體在端對端任務中的智慧能力。

評估航空、零售和電信領域的語音客服任務。Pass@1 衡量任務成功率;整體結果對各領域採用相同權重。


* GPT Live 後端:Astra(中等推理強度)。

評估結合知識檢索與帳戶工具的銀行語音客服。Pass@1 是 97 項 banking_knowledge 任務中成功完成的比例。


* GPT Live 後端:Astra(中等推理強度)。

評估停頓處理、對話輪替、插話,以及聆聽時的簡短回應。

測試模型對背景語音、使用者與他人的交談、聆聽者的簡短回應,以及插話的反應。

衡量使用者說完一輪話後,智慧體開始回覆的速度。

測試模型接到包含自然停頓、猶豫和自我修正的口語請求時,使用工具的表現。Pass@1 用來評估工具呼叫序列。


* GPT Live 後端:Terra(低推理強度)。

評估模型對需要使用工具的請求所做的口語回答;請求中包含停頓、猶豫和自我修正。根據回答符合參考意圖的程度評分。


* GPT Live 後端:Terra(低推理強度)。

客戶怎麼說

1 之 4
“將 GPT‑Live‑1 導入 Yelp Host 和 Hatch 後,對話輪替的流暢度與準確度都比原有的語音架構更好。Yelp Host 使用 GPT‑Live‑1 接聽訂位、點餐等來電時,我們發現來電處理率明顯提升。來電者也會說出更完整、更自然的句子,這讓我們知道,電話另一端的使用體驗確實不一樣了。”
—Alex Levy,技術長

全新語音選項

開發者需要契合產品、在使用者聽來自然的語音。透過 GPT‑Live‑1,我們將少量即時語音擴充為涵蓋更多口音、方言與語言的廣泛選擇,讓開發者能更自由地決定助理的聲音。

聆聽全新的語音

未來幾個月,我們將持續擴充語音選項與支援的語言。

定價與供應情況

GPT‑Live‑1 現已在 API 上推出⁠(在新視窗中開啟),前端語音層的費用為每分鐘 0.05 美元。搭配適合你產品的後端模型與智慧體任務執行框架,就能打造可隨工作需求擴充的語音體驗。

將 GPT-Live-1 連接至 Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

將 GPT-Live-1 連接至 Codex。這段程式碼示範應用程式如何將對話脈絡傳遞給 Codex,再將 Codex 的回答傳回 GPT-Live-1。連線設定與委派處理的部分已省略。

如要使用自訂語音,請聯絡銷售團隊,進一步瞭解資格條件與申請流程。

另一種運用 GPT‑Live‑1 打造語音工作流程的方式,是使用 OpenAI Presence,透過這個模型支援即時語音互動。Presence 可協助企業部署值得信賴的 AI 智慧體,回答問題、解決困難、使用公司系統、執行經核准的動作,並在需要時轉交真人處理。如需進一步瞭解,請聯絡你的 OpenAI 客戶總監。

作者

OpenAI