Spouštíme GPT‑Live, novou generaci hlasových modelů, díky nimž rozhovor s AI působí mnohem víc jako skutečná konverzace.
GPT‑Live je postavený na plně duplexní architektuře, což znamená, že dokáže poslouchat i mluvit zároveň. Během konverzací umí GPT‑Live dávat najevo, že věnuje pozornost, pomocí výrazl jako „hm“ nebo „jo“, rychle vyměňovat kratší repliky nebo prostě mlčet, když potřebujete chvíli na rozmyšlenou. Výsledkem je hlasové prostředí, se kterým se povídá překvapivě snadno.
GPT‑Live je také náš dosud nejchytřejší hlasový model. U otázek, které vyžadují vyhledávání na webu, hlubší uvažování nebo složitější práci, deleguje úkol na pozadí na náš nejnovější průkopnický model a když je výsledek připravený, vrátí ho do konverzace. Zatímco pracuje, GPT‑Live s tebou dokáže dál mluvit a udržovat plynulost konverzace. Při spuštění bude GPT‑Live na pozadí používat GPT‑5.5. S vydáváním nových průkopnických modelů budeme model používaný službou GPT‑Live průběžně aktualizovat.
Tyto pokroky pohánějí nové prostředí ChatGPT Voice, které je inteligentnější a přirozenější na používání. Věříme, že časem tento výzkum také umožní používat hlas pro stále složitější, déle trvající a více agentní práci.
Dnes začínáme uživatelům ChatGPT po celém světě zpřístupňovat dvě verze GPT‑Live – GPT‑Live‑1 a GPT‑Live‑1 mini. Brzy je také plánujeme zpřístupnit v API a vývojáři i firmy se mohou přihlásit k odběru upozornění prostřednictvím tohoto formuláře.
Vstup do nové éry interakce mezi člověkem a AI
Naší vizí je umožnit skutečně přirozenou interakci mezi lidmi a AI: svět, kde spolupráce s AI působí stejně plynule a pohotově jako práce s jiným člověkem, zatímco uvažování a vykonávání složitých úkolů probíhá hladce na pozadí.
Předchozí přístupy
Starší generace AI hlasových systémů nás této vizi přiblížily, ale se značnými kompromisy.
Kaskádové hlasové systémy
Kaskádové hlasové systémy spoléhají na řadu modelů, které při zpracování každého tahu postupují jeden po druhém. Původní ChatGPT Voice propojoval tři modely: model převodu řeči na text, který přepsal tvou řeč, velký jazykový model, který vytvořil odpověď, a model převodu textu na řeč, který ji převedl zpět do mluvené podoby. Tento přístup nám poprvé umožnil mluvit s průkopnickými modely AI, ale složitost měla svou cenu: mezi modely někdy docházelo ke ztrátě informací a odpovědi byly pomalé a nepřirozené.
Kaskádový hlasový systém
Pomalé a nepřirozené odpovědi, dlouhé pauzy
Hlasové modely založené na jednotlivých replikách
Hlasové modely založené na jednotlivých replikách, jako pokročilý hlasový režim ChatGPT, zpracovávaly a generovaly zvuk v rámci jediného modelu, čímž snižovaly latenci a zajišťovaly plynulejší konverzace — stále však fungovaly v oddělených kolech replik. Model musel počkat, až uživatel přestane mluvit, a teprve potom odpovědět, výsledkem čehož bylo nepružné střídání. Protože detekce replik navíc probíhá na základě detekce ticha, i krátká pauza nebo hluk na pozadí někdy byly mylně vyhodnoceny jako konec repliky — a model pak nevhodně skákal do řeči.
Hlasový model založený na výměně replik
O něco rychlejší a plynulejší odpovědi, ale výměna replik s modelem stále působí strnule
Náš nový přístup
GPT‑Live tato omezení řeší dvěma architektonickými změnami.
Nepřetržitá interakce
Zaprvé jsme GPT‑Live vytvořili pro plynulou interakci pomocí plně duplexní architektury. Místo zpracování posloupnosti samostatných zpráv GPT‑Live průběžně zpracovává vstup a zároveň generuje výstup. Model tak může mnohokrát za sekundu rozhodovat o průběhu interakce: zda mluvit, dál poslouchat, udělat pauzu, přerušit uživatele nebo spustit nástroj.
To modelu umožňuje přirozenější výměnu kratších replik, lepší zachování rytmu a dokonce i schopnost provádět živý překlad.
Neustálá interakce
Rychlé, přirozené a expresivní odpovědi a aktivnější naslouchání
Delegování hlubší práce
Zadruhé jsme GPT‑Live — který zajišťuje plynulou interakci — oddělili od hlubší práce. Když otázka vyžaduje vyhledávání, uvažování nebo agentnější schopnosti, může GPT‑Live delegovat úkol na jiný model, například GPT‑5.5. Díky tomu dokáže udržovat konverzaci v chodu, i když na pozadí zpracovává více úkolů.
Tato architektonická změna také GPT‑Live umožňuje průběžně využívat nejnovější modely a agenty a spojovat průkopnickou inteligenci s přirozenou interakcí.
Delegování hlubší práce
GPT-Live poskytuje rychlé a přirozené odpovědi, zatímco GPT-5.5 zpracovává vyhledávání na pozadí
Hodnocení
Vytvořili jsme nová lidská hodnocení, která měří příjemnost a plynulost konverzace. V těchto přímých srovnáních jsou GPT‑Live‑1 a GPT‑Live‑1 mini výrazně upřednostňovány před pokročilým hlasovým režimem ve srovnatelných 5–10minutových konverzacích, které měří celkovou preferenci, střídání replik, skákání do řeči, plynulost konverzace a to, jak přirozeně každá interakce působila.
- GPQA: GPT‑Live‑1 na GPQA výrazně překonává pokročilý hlasový režim; GPQA testuje vědecké uvažování na expertní úrovni v biologii, chemii a fyzice.
- BrowseComp: GPT‑Live‑1 vykazuje oproti pokročilému hlasovému režimu výrazné zlepšení v benchmarku BrowseComp, který testuje agentní vyhledávání na webu a schopnost najít obtížně dohledatelné informace.
- τ³-Voice Telecom (interní varianta)**: GPT‑Live‑1 překonává pokročilý hlasový režim v benchmarku τ³-Voice Telecom, který testuje hlasové agenty na realistických vícekolových úlohách telekomunikační podpory.
* GPT‑Live‑1 (instantní) a GPT‑Live‑1 mini používají na pozadí model GPT‑5.5 Instantní, zatímco GPT‑Live‑1 Střední a GPT‑Live‑1 Vysoká používají model GPT‑5.5 Thinking se střední a vysokou mírou uvažování.
** Pro toto vyhodnocení jsme použili přizpůsobený uživatelský model založený na našich nejnovějších modelech s uvažováním.
Přepracovaná verze ChatGPT Voice
Každý týden s ChatGPT mluví více než 150 milionů lidí pomocí funkcí, jako jsou Voice a Diktování. Používají ho k běžné pomoci bez nutnosti používat ruce, k procvičování jazyků, vyprávění pohádek na dobrou noc nebo jen na pokec cestou do práce.
Od dnešního dne získáte po klepnutí na tlačítko Voice pro rozhovor s ChatGPT vylepšené prostředí poháněné GPT‑Live – s přirozenějšími konverzacemi, chytřejšími odpověďmi, lepším nasloucháním a vizuálními odpověďmi.
Přirozenější konverzace
Rozhovor s ChatGPT by teď měl mnohem víc připomínat skutečnou konverzaci. Můžete ho přerušit otázkou, udělat si pauzu na rozmyšlenou nebo požádat ChatGPT, aby zpomalil. Přirozeně dává najevo, že vás poslouchá, frázemi jako „mhmm“ nebo „rozumím“, takže víte, že drží krok. Také jsme v ChatGPT pro GPT‑Live remastrovali devět různých hlasů.
Chytřejší odpovědi
ChatGPT Voice teď dokáže využívat naše nejnovější průkopnické modely, takže vám nabídne chytřejší odpovědi, když je potřebujete. Můžete si také zvolit úroveň uvažování podle svých potřeb: instantní pro rychlé odpovědi nebo střední či vysokou, když chcete, aby ChatGPT věnoval přemýšlení více času.
Lepší naslouchání
Když se na chvíli zamyslíte, ChatGPT Voice teď počká, místo aby vám skočil do řeči. Když ho požádáte, aby byl zticha a poslouchal, udělá to. A když je v pozadí hluk, třeba projíždějící auta nebo okolní rozhovory, ChatGPT se lépe soustředí na váš hlas a nenechá se rozptylovat.
Vizuální odpovědi na první pohled
Některé odpovědi jsou užitečnější, když je vidíte. Během hovoru může ChatGPT nově zobrazovat bohaté vizuální karty k tématům, jako je počasí, akcie, sport a další. Hlas nadále podporuje také vyhledávání, paměť, obrázky a nahrávání souborů.



Výsledkem je prostředí ChatGPT Voice, které v každodenním životě působí přirozeněji, schopněji a užitečněji.
GPT‑Live byl navržen tak, aby byl bezpečný už ve výchozím nastavení. Staví na bezpečnostních pokrocích našich nejnovějších modelů a přidává specializovaný bezpečnostní trénink v klíčových rizikových oblastech i nové ochranné prvky navržené přímo pro hlas.
Rozšířené testování bezpečnosti
Abychom lépe zachytili, jak lidé hlas používají v reálných situacích, začali jsme rozšířením bezpečnostního testování o nová vyhodnocení nativní pro audio. Vytvořili jsme také syntetická hodnocení, která pomocí vygenerovaného audia intenzivněji zkoumají klíčové bezpečnostní oblasti a vycházejí z poznatků z pokročilého hlasového režimu. Mezi tyto oblasti patří sebepoškozování, psychóza a mánie, emoční závislost na AI, násilí a sexuální obsah. Interní odborníci také model red-teamovali z hlediska rizik, která jsou pro hlas jedinečná.
V našem testování si GPT‑Live vedl srovnatelně nebo lépe než pokročilý hlasový režim téměř ve všech hodnocených oblastech. Více o našem testování a ochranných opatřeních si můžete přečíst v kartě systému(otevře se v novém okně) GPT‑Live.
Vestavěná ochranná opatření
Protože hlasové konverzace probíhají v reálném čase, vytvořili jsme také ochranná opatření, která mohou zasáhnout, když model mluví. Když systém rozpozná potenciálně nebezpečný výstup, může model nasměrovat k bezpečnější odpovědi, zobrazit další bezpečnostní sdělení nebo zdroje, případně v rizikovějších případech hlasovou konverzaci ukončit. Pro konverzace týkající se sebepoškozování jsme přizpůsobili pro hlas podpůrné postupy ChatGPT, včetně nabídky podpory na krizových linkách ověřené odborníky.
Navrhli jsme další ochranná opatření pro dospívající uživatele a přímo do modelu jsme natrénovali chování odpovídající věku, abychom snížili riziko nevhodných odpovědí. Rodiče mohou prostřednictvím rodičovské kontroly zvolit, zda jejich dospívající dítě může používat ChatGPT Voice, a propojení rodiče mohou být upozorněni v rizikovějších situacích se známkami možného sebepoškozování nebo sebevražedného úmyslu.
Poznatky z reálného používání
Zavádíme také dlouhodobější měření a sledování po spuštění zaměřené na emoční závislost, abychom dál zlepšovali porozumění a zpřesňovali ochranná opatření. V návaznosti na náš předchozí výzkum afektivního používání a emoční pohody nám to pomůže rozpoznávat nové vzorce a zlepšit reakce systému v emočně citlivých interakcích.
A konečně, GPT‑Live je navržen pro konverzaci, ne pro napodobování hlasu. Používá sadu předdefinovaných hlasů v ChatGPT a ochranná opatření, která mu brání napodobovat hlas skutečné osoby.
Jsme odhodláni podporovat bezpečnost a pohodu a budeme tyto ochrany dál posilovat na základě poznatků z reálného používání.
Dostupnost a omezení
GPT‑Live je právě teď zaváděn pro uživatele ChatGPT po celém světě na iOS, Androidu a ChatGPT.com(otevře se v novém okně). GPT‑Live‑1 se stane výchozím modelem pohánějícím ChatGPT Voice pro uživatele Go, Plus a Pro a GPT‑Live‑1 mini se stane výchozím modelem pro uživatele Free. Další podrobnosti o dostupnosti najdete v našem Centru nápovědy(otevře se v novém okně).
GPT‑Live jsme optimalizovali pro některé z jazyků, které jsou v ChatGPT nejoblíbenější. U některých jazyků může mít model cizí přízvuk nebo mezery v plynulosti. Aktivně pracujeme na zlepšování prostředí napříč jazyky.
Při spuštění GPT‑Live nebude v ChatGPT podporovat hlas s videem ani sdílením obrazovky, ale pracujeme na tom, abychom tyto možnosti brzy zavedli. Stále můžete používat starší verze ChatGPT Voice, včetně standardního a pokročilého hlasového režimu, kde jsou tyto funkce dostupné.


