我們在 API 中推出 GPT‑Live‑1,提供功能強大、對話自然的語音模型,讓開發者打造支援語音的應用程式和業務工作流程。GPT‑Live‑1 最初於 ChatGPT 推出,能同時聆聽與說話。如同我們在 Codex 與 「ChatGPT 工作」 中的示範(在新視窗中開啟),GPT‑Live‑1 也能將更深入的推理與動作執行委派給搭配使用的模型和工具。
針對 GPT‑Live‑1 的 API 版本,我們著重開發新功能,讓開發者能根據使用者需求、工作流程與目標,調整及自訂語音體驗。GPT‑Live‑1 的核心優勢之一,是能順暢應對插話,這已開始帶來商業效益。在早期評估中,Speak 發現,GPT‑Live‑1 讓學習者在語言導師回應前有更多時間思考,相較於先前的輪流對話系統,打斷學習者的次數減少了近 80%。
GPT‑Live‑1 在 API 中的主要優勢:
插話處理:透過單一模型同時對輸入與輸出的音訊進行推理,更順暢地處理插話,避免串接式 STT-LLM-TTS 架構造成延遲,以及各環節銜接時容易出錯的問題。
推理與工具呼叫委派:GPT‑Live‑1 可將推理與工具呼叫委派給 GPT‑6 Astra 等後端文字模型或第三方模型。
語氣、節奏與風格:開發者可透過系統提示詞調整智慧體的語氣、節奏與對話風格。
靜默情境管理與背景噪音:能更妥善處理背景噪音和沉默,不會打斷對話,也不會把每個步驟都說出來。
長時間工作階段可靠性:提升長時間互動中的情境保留能力與對話品質。
電話支援:可部署用於電話通話的全雙工語音智慧體,涵蓋餐廳訂位、客戶支援等情境。
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
這組示範有時間限制。開始使用 Realtime 的示範內容即表示你同意 OpenAI 的《使用條款》並已知悉了我們的《隱私權政策》。
傳統語音智慧體會將語音轉文字、推理模型和文字轉語音串接起來。每次交接都會增加延遲,也更容易失去時機、情境或自然的對話節奏。開發者往往必須自行協調這些階段,包括有人打斷、停頓或改變話題時該如何處理。
GPT‑Live‑1 透過單一模型處理聆聽與說話,簡化語音層。模型能即時回應插話與附和,同時將更深入的推理委派給後端。因此,背景工作執行期間,對話仍可持續進行。
開發者可選擇支援對話的模型、工具與智慧體任務執行框架。例如,可以將 GPT‑Live‑1 搭配 Luna 等模型,處理排程或訂單更新等大量任務;遇到需要推理的複雜客戶問題時,則使用 Astra 等模型。這種彈性讓開發者能針對每項任務調整推理深度、速度與成本。
GPT‑Live‑1 內建自動語音辨識 (ASR) 功能,可提供逐字稿與回應文字。模型也能準確理解字母與數字,並支援關鍵字偏置。雖然 GPT‑Live‑1 並非輪流對話模型,但內建對話輪次偵測功能,因此開發者仍可根據明確的輪次界線設計應用。
在我們的各項評估中,GPT‑Live‑1 在 Full Duplex Bench 的表現比 GPT‑Realtime‑2.1 提升了 30 個百分點,對話輪替的延遲與互動行為也大幅改善。搭配採用中等推理強度的 GPT‑6 Astra 時,GPT‑Live‑1 也在 Tau3 排名第一。Tau3 用來衡量最先進的語音智慧體在端對端任務中的智慧能力。
評估航空、零售和電信領域的語音客服任務。Pass@1 衡量任務成功率;整體結果對各領域採用相同權重。
* GPT Live 後端:Astra(中等推理強度)。
評估結合知識檢索與帳戶工具的銀行語音客服。Pass@1 是 97 項 banking_knowledge 任務中成功完成的比例。
* GPT Live 後端:Astra(中等推理強度)。
評估停頓處理、對話輪替、插話,以及聆聽時的簡短回應。
測試模型對背景語音、使用者與他人的交談、聆聽者的簡短回應,以及插話的反應。
衡量使用者說完一輪話後,智慧體開始回覆的速度。
測試模型接到包含自然停頓、猶豫和自我修正的口語請求時,使用工具的表現。Pass@1 用來評估工具呼叫序列。
* GPT Live 後端:Terra(低推理強度)。
評估模型對需要使用工具的請求所做的口語回答;請求中包含停頓、猶豫和自我修正。根據回答符合參考意圖的程度評分。
* GPT Live 後端:Terra(低推理強度)。
開發者需要契合產品、在使用者聽來自然的語音。透過 GPT‑Live‑1,我們將少量即時語音擴充為涵蓋更多口音、方言與語言的廣泛選擇,讓開發者能更自由地決定助理的聲音。
未來幾個月,我們將持續擴充語音選項與支援的語言。
GPT‑Live‑1 現已在 API 上推出(在新視窗中開啟),前端語音層的費用為每分鐘 0.05 美元。搭配適合你產品的後端模型與智慧體任務執行框架,就能打造可隨工作需求擴充的語音體驗。
如要使用自訂語音,請聯絡銷售團隊,進一步瞭解資格條件與申請流程。
另一種運用 GPT‑Live‑1 打造語音工作流程的方式,是使用 OpenAI Presence,透過這個模型支援即時語音互動。Presence 可協助企業部署值得信賴的 AI 智慧體,回答問題、解決困難、使用公司系統、執行經核准的動作,並在需要時轉交真人處理。如需進一步瞭解,請聯絡你的 OpenAI 客戶總監。

