OpenAI

2026年7月8日

產品發布

介紹 GPT‑Live

新一代語音模型,讓人類與 AI 的互動更自然,現已應用於 ChatGPT 語音。

載入中…

我們推出 GPT‑Live,這是新一代語音模型,讓與 AI 對話更接近真人交流。

GPT‑Live 採用全雙工架構,因此能同時聆聽與說話。在對話中,GPT‑Live 可以用「嗯哼」或「對」等語句表示它正在聆聽,也能快速自然地來回對話,或在你需要思考時安靜等待。這讓語音對話體驗更加自然,聊起來格外輕鬆。

GPT‑Live 也是我們迄今最聰明的語音模型。對於需要網路搜尋、更深入推理或更複雜工作的問題,它會在幕後委派給我們最新的前沿模型,等結果準備好後再帶回對話中。在處理工作的同時,GPT‑Live 仍能繼續與你交談,維持對話流暢。推出初期,GPT‑Live 會在背景使用 GPT‑5.5。隨著我們推出新的前沿模型,我們也會持續更新 GPT‑Live 所使用的模型。

這些進展支撐了全新的 ChatGPT 語音體驗,讓使用過程更智慧、更自然。長遠來看,我們相信這項研究也將開啟以語音處理越來越複雜、耗時更長且更仰賴智慧體能力工作的可能性。

從今天起,我們開始向全球 ChatGPT 使用者推出兩個版本的 GPT‑Live:GPT‑Live‑1GPT‑Live‑1 mini。我們也將很快在 API 中提供 GPT‑Live;開發者和企業可透過這份表單登記接收通知。

邁入人類與 AI 互動的新時代

我們的願景是實現真正自然的人類與 AI 互動:在這樣的世界裡,與 AI 協作會像與另一個人共事一樣流暢且反應靈敏,而推理和複雜任務執行則在背景中無縫完成。

過去的語音系統

較早世代的語音 AI 系統讓我們更接近這個願景,但也必須做出重要取捨。

串接式語音系統

串接式語音系統仰賴多個模型依序處理每一輪對話。最初的 ChatGPT 語音將三個模型串接在一起:語音轉文字模型用來轉錄你的語音,大型語言模型用來產生回應,文字轉語音模型則將回應轉回語音。這種方法讓我們首次能與前沿 AI 模型交談,但複雜性也帶來代價:資訊可能在模型之間流失,回應也緩慢而生硬。

串接式語音系統

回應緩慢且生硬,停頓時間長

逐字稿
使用 GPT-5.5 Instant 的標準語音模式對話範例

回合式語音模型

ChatGPT 進階語音模式這樣的回合式語音模型,能在單一模型內處理並生成音訊,降低延遲並讓對話更順暢,但仍採用以回合為單位的互動方式。模型必須等使用者停止說話後才能回應,導致來回互動顯得僵硬。此外,由於回合偵測是以靜音為依據,即使是短暫停頓或背景噪音,也可能被誤認為回合結束,造成模型在不自然的時機插話。

回合式語音模型

回應稍快且更順暢,但與模型的來回互動仍顯僵硬

逐字稿
ChatGPT 進階語音模式對話範例

我們的新方法

GPT‑Live 透過兩項架構改變來解決這些限制。

連續互動

首先,我們以全雙工架構打造 GPT‑Live,使其能進行連續互動GPT‑Live 不再逐則處理彼此獨立的訊息,而是在生成輸出的同時持續處理輸入。因此,模型每秒可多次決定是否要說話、繼續聆聽、暫停、插話,或呼叫工具。

這讓模型能進行更自然的來回對話,更準確掌握對話節奏,甚至提供即時翻譯。

連續互動

回應快速、自然而且富表現力,同時聆聽更主動

逐字稿
使用 GPT-5.5 Instant 的 GPT-Live-1 對話範例

將更深入的工作委派給其他模型

其次,我們將負責持續互動的 GPT‑Live 與負責較深入工作的模型分離。當問題需要搜尋、推理或更強的智慧體能力時,GPT‑Live 可以將任務委派給 GPT‑5.5 之類的另一個模型。如此一來,即使在背景處理多項任務,它也能讓對話持續進行。

這項架構改變也讓 GPT‑Live 能持續使用最新模型和智慧體,將前沿智慧與自然互動結合。

委派處理更深入的工作

GPT-Live 提供快速、自然的回應,而 GPT-5.5 則在背景處理搜尋

逐字稿
使用 GPT-5.5 Instant 的 GPT-Live-1 對話範例

評估

我們建立了新的人類評估,用來衡量對話是否自然流暢,以及整體互動體驗是否令人愉快。在這些一對一比較中,於條件一致的 5–10 分鐘對話裡,GPT‑Live‑1 和 GPT‑Live‑1 mini 相較進階語音模式明顯更受偏好;評估面向包括整體偏好、輪流發言、插話、對話流暢度,以及互動的自然程度。

  • GPQA:GPT‑Live‑1 在 GPQA 上大幅優於進階語音模式;GPQA 測試的是橫跨生物、化學和物理的專家級科學推理能力。
  • BrowseComp:GPT‑Live‑1 在 BrowseComp 上相較進階語音模式有顯著提升;BrowseComp 測試的是智慧體式網路搜尋,以及尋找難以取得資訊的能力。
  • τ³-Voice Telecom(內部變體)**:GPT‑Live‑1 在 τ³-Voice Telecom 上表現優於進階語音模式;τ³-Voice Telecom 測試的是語音智慧體在真實、多輪電信支援任務中的表現。

* GPT‑Live‑1(即時)和 GPT‑Live‑1 mini 在背景使用 GPT‑5.5 Instant 模型,而 GPT‑Live‑1(中)和 GPT‑Live‑1(高)則使用具備中、高推理強度的 GPT‑5.5 Thinking 模型。

** 在這項評估中,我們使用了由最新推理模型驅動的自訂使用者模型。

全新的 ChatGPT 語音體驗

每週有超過 1.5 億人透過語音和聽寫等功能與 ChatGPT 對話,在日常生活中不必動手就能取得協助、練習語言、講睡前故事,或只是在通勤時聊聊天。

從今天起,當你點按語音按鈕與 ChatGPT 對話時,將獲得由 GPT‑Live 提供支援的升級體驗,對話更自然、回答更聰明、聆聽更準確,還能提供視覺化回應。

更自然的對話

現在,與 ChatGPT 交談應該會更像一場真正的對話。你可以插話提問、暫停一下整理思緒,或請 ChatGPT 放慢速度。ChatGPT 會自然地用「嗯嗯」或「了解」等語句回應你說的話,讓你知道有跟上話題。我們也為 GPT‑Live 重新製作了 ChatGPT 中九種各具特色的聲音。

更聰明的回答

ChatGPT 語音現在可運用我們最新的前沿模型,在你需要時提供更聰明的回答。你也可以依需求選擇推理程度:「即時」可快速回覆;當你希望 ChatGPT 花更多時間思考時,則可選擇「中」或「高」。

更好的聆聽能力

如果你需要一點時間思考,ChatGPT 語音現在會等待,而不是搶先插話。如果你要求保持安靜聆聽,ChatGPT 就會照做。而當有背景噪音時,例如車輛經過或附近有人交談,ChatGPT 也更能專注在你的聲音上,不容易被干擾。

一目瞭然的視覺化回答

有些答案看得見時會更有用。在你交談時,ChatGPT 現在可以針對天氣、股票、體育等主題顯示豐富的視覺化卡片。語音也持續支援搜尋、記憶、圖片和檔案上傳。

整體而言,ChatGPT 語音體驗在日常生活中會感覺更自然、更有能力,也更實用。

為語音而設計的安全性

GPT‑Live 在設計上預設以安全為優先。除了延續最新模型在安全方面的進展,也針對關鍵風險領域進行專門的安全訓練,並加入專為語音互動設計的新防護措施。

擴大安全測試

為了更貼近人們在真實情境中使用語音的方式,我們首先擴大安全測試,納入新的音訊原生評估。我們也借鏡進階語音模式的經驗,建立使用生成音訊的合成評估,更集中地檢視關鍵安全領域。這些領域包括自我傷害、精神病與躁症、對 AI 的情感依賴、暴力和性內容。內部專家也針對語音特有的風險對模型進行紅隊演練。

在我們的測試中,GPT‑Live 在幾乎所有評估領域的表現都與進階語音模式相當或更好。你可以在 GPT‑Live 系統說明卡(在新視窗中開啟)中閱讀更多關於我們測試與防護措施的資訊。

內建防護措施

由於語音對話是即時進行的,我們也建立了可在模型說話時發揮作用的防護措施。當系統偵測到可能不安全的輸出時,可以引導模型給出更安全的回應、顯示額外的安全訊息或資源,或在較高風險的情況下結束語音對話。針對涉及自我傷害的對話,我們將 ChatGPT 的支援流程調整為適用於語音,包括提供經專家審核的危機求助專線支援。

我們設計了額外的保護措施來保障青少年使用者,並直接訓練模型採取符合使用者年齡的行為模式,以降低產生不當回應的風險。家長可透過家長控制功能,選擇是否允許青少年子女使用 ChatGPT 語音;若出現可能涉及自我傷害或自殺意圖的跡象,且情況風險較高,已連結帳戶的家長也可能收到通知。

從真實世界使用中學習

我們也正在推出聚焦情感依賴的長期衡量與發布後監控,以持續加深理解並完善防護措施。承接我們先前對情感性使用與情緒福祉的研究,這將協助我們識別新興模式,並改善系統在情緒敏感互動中的回應方式。

最後,GPT‑Live 的設計重點是自然對話,而非模仿特定人物的聲音。GPT‑Live 使用 ChatGPT 內建的一組預設語音,並設有防護措施,防止模型模仿真人的聲音。

我們致力於支持安全與福祉,並會隨著從真實世界使用中學習到的經驗,持續強化這些保護。

供應情況與限制

GPT‑Live 現正於全球向 iOS、Android 和 ChatGPT.com(在新視窗中開啟) 上的 ChatGPT 使用者推出。GPT‑Live‑1 將成為為 Go、Plus 和 Pro 使用者的 ChatGPT 語音提供支援的預設模型,而 GPT‑Live‑1 mini 將成為免費版使用者的預設模型。更多供應情況詳情可參閱我們的說明中心(在新視窗中開啟)

我們已針對 ChatGPT 中部分最常用的語言最佳化 GPT‑Live。對於某些語言,模型可能帶有非母語口音,或在流暢度上有所不足。我們正積極改善各語言的使用體驗。

發布時,GPT‑Live 尚不支援 ChatGPT 中搭配影片或螢幕分享的語音功能,但我們正努力盡快推出這些能力。你仍可使用現行的 ChatGPT 語音,包括標準和進階語音模式;這些版本可使用上述功能。

作者

OpenAI