我們現於 API 推出 GPT‑Live‑1,為開發人員提供功能強大、語音自然的模型,用來建立支援語音的應用程式和業務工作流程。最初在 ChatGPT 推出的 GPT‑Live‑1 能同時聆聽和說話;正如在 Codex 和「ChatGPT 工作」中所見(在新視窗中開啟),它亦可把更深入的推理和操作委派給配搭的模型與工具。
為在 API 推出 GPT‑Live‑1,我們重點開發多項新功能,讓開發人員可以因應用戶、工作流程及目標,調整並自訂語音體驗。GPT‑Live‑1 的核心優勢之一是更順暢地處理對話打斷,而這已帶來實際業務成效:在早期評估中,Speak 發現,相比以往按輪次運作的系統,GPT‑Live‑1 讓學習者在語言導師回應前有更多時間思考,打斷情況減少近 80%。
GPT‑Live‑1 在 API 中的主要優勢:
對話打斷處理:透過單一模型同時對傳入和傳出的音訊進行推理,改善對話打斷處理,避免串連式 STT–LLM–TTS 架構造成的延遲及不穩定交接。
推理及工具調用委派:GPT‑Live‑1 可將推理和工具調用委派給後端文字模型,例如 GPT‑6 Astra 或第三方模型。
語氣、節奏和風格:開發人員可以透過系統提示詞,塑造智能代理的語氣、節奏和對話風格。
靜默情境管理及背景噪音:更妥善處理背景噪音和靜默,不會打斷對話或逐步讀出每項操作。
長時段可靠性:在長時間互動中提升情境保留能力和對話質素。
電話支援:支援部署用於電話通話的全雙工語音智能代理,應用範圍涵蓋餐廳訂座以至客戶支援。
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
傳統語音智能代理會把語音轉文字、推理模型及文字轉語音串連起來。每次交接都會增加延遲,也更容易錯失時機、遺失情境,或破壞對話的自然節奏。協調這些階段的工作往往落在開發者身上,包括處理對方打斷、停頓或改變方向時的情況。
GPT‑Live‑1 以單一模型處理聆聽和說話,簡化語音層。它可即時回應打斷和確認,同時把更深入的推理委派至後端。因此,即使工作在背景進行,對話仍可持續。
開發者可選擇支援對話的模型、工具和智能代理任務執行框架。例如,開發者可把 GPT‑Live‑1 與 Luna 等模型配搭,用於排程或訂單更新等大量工作;遇到需要推理的複雜客戶問題,則可使用 Astra 等模型。這種靈活性讓開發者可因應每項工作,調整推理深度、速度和成本。
GPT‑Live‑1 原生提供 ASR 文字稿和回應文字。它亦具備出色的英數字理解能力,並支援關鍵字偏向設定。雖然 GPT‑Live‑1 並非按輪次運作的模型,但原生支援輪次偵測,因此開發人員仍可按照明確的輪次界線建立系統。
在各項評估中,GPT‑Live‑1 的 Full Duplex Bench 表現較 GPT‑Realtime‑2.1 提升 30 個百分點,輪流發言延遲和互動表現均大幅改善。配搭採用中等推理強度的 GPT‑6 Astra 時,它亦在 Tau3 排名第一;Tau3 衡量前沿語音智能代理處理端到端任務的智能表現。
評估航空、零售和電訊範疇的語音客戶服務任務。Pass@1 用於衡量任務是否成功;整體分數對每個範疇採用相同權重。
* GPT Live 後端:Astra(中)。
評估透過語音提供銀行客戶支援的能力,包括檢索知識及使用帳戶工具。Pass@1 是在 97 項 banking_knowledge 任務中成功完成的任務比例。
* GPT Live 後端:Astra(中)。
評估停頓處理、對話中的輪流發言、打斷和簡短回應。
測試對背景人聲、與他人說話、聆聽者的簡短回應和打斷的反應。
衡量用戶完成一輪對話後,智能代理開始回覆的速度。
測試根據包含自然停頓、猶豫和自我修正的口語請求使用工具的能力。Pass@1 為工具調用序列評分。
* GPT Live 後端:Terra(低)。
評估針對帶有停頓、猶豫和自我修正、並涉及工具使用的請求所作出的口語回答。 根據答案與參考意圖的吻合程度評分。
* GPT Live 後端:Terra(低)。
開發者需要既切合產品定位,又能讓使用者聽起來自然的語音。透過 GPT‑Live‑1,我們把原本數量有限的即時語音,擴展至涵蓋更多口音、方言和語言的選擇,讓開發者更靈活地塑造助理的聲音。
未來數月,我們會繼續增加語音選項及支援的語言。
GPT‑Live‑1 現已可透過 API 使用(在新視窗中開啟),前端語音層收費為每分鐘 $0.05。配搭切合產品需要的後端模型和智能代理任務執行框架,即可建立能隨工作規模擴展的語音體驗。
如欲使用自訂語音,請聯絡銷售團隊,進一步了解資格及申請流程。
使用 GPT‑Live‑1 建立語音工作流程的另一種方式,是透過 OpenAI Presence;當中利用此模型驅動即時語音互動。Presence 可協助企業部署值得信賴的 AI 智能代理,讓 AI 智能代理能夠回答問題、解決問題、使用公司系統、採取已核准的行動,並在需要時升級交由人員處理。如欲進一步了解詳情,請聯絡你的 OpenAI 客戶總監。

