OpenAI

8 հուլիսի, 2026 թ.

ԱրտադրանքԹողարկում

Introducing GPT‑Live

A new generation of voice models for natural human-AI interaction, now powering ChatGPT Voice.

Բեռնվում է…

We’re launching GPT‑Live, a new generation of voice models that make talking with AI feel much more like having a real conversation.

GPT‑Live is built on a full-duplex architecture, meaning it can listen and speak at the same time. During conversations, GPT‑Live can show it’s paying attention with phrases like “mhmm” or “yeah”, engage in quick back-and-forth, or just stay quiet when you need a moment to think. The result is a voice experience that is refreshingly easy to talk to.

GPT‑Live is also our smartest voice model yet. For questions that require web search, deeper reasoning, or more complex work, it delegates to our latest frontier model behind the scenes and brings the result back into the conversation when it’s ready. While it works, GPT‑Live can keep talking with you and maintain the flow of conversation. At launch, GPT‑Live will use GPT‑5.5 in the background. As we release new frontier models, we’ll continuously update the model used by GPT‑Live.

These advances power a new ChatGPT Voice experience that is more intelligent and natural to use. Over time, we believe this research will also unlock the ability to use voice for increasingly complex, longer-running, and more agentic work.

We’re beginning to roll out two versions of GPT‑Live – GPT‑Live‑1 and GPT‑Live‑1 mini – to ChatGPT users globally today. We also plan to bring them to the API soon, and developers and enterprises can sign up to be notified using this form.

Entering a new era of human-AI interaction

Our vision is to enable truly natural human–AI interaction: a world where collaborating with AI feels as fluid and responsive as working with another person, while reasoning and complex task execution happen seamlessly in the background.

Previous approaches

Older generations of voice AI systems brought us closer to that vision, but with important tradeoffs.

Cascaded voice systems

Cascaded voice systems rely on a series of models acting one after another to process each turn. The original ChatGPT Voice chained three models together: a speech-to-text model to transcribe your speech, a large language model to produce a response, and a text-to-speech model to convert it back into speech. This approach enabled us to talk to frontier AI models for the first time, but the complexity came at a cost: information could be lost across models, and responses were slow and stilted.

Կասկադային ձայնային համակարգ

Դանդաղ և անբնական պատասխաններ, երկար դադարներ

Տառադարձություն
Ստանդարտ ձայնի ռեժիմով զրույցի օրինակ՝ GPT-5.5 Ակնթարթայինի կիրառմամբ

Turn-based voice models

Turn-based voice models like ChatGPT Advanced Voice Mode processed and generated audio within a single model, reducing latency and making conversations smoother — but they still operated through discrete turns. The model had to wait for the user to stop speaking before responding, resulting in rigid back-and-forth. In addition, because turn detection is based on silence, even a brief pause or background noise could be mistaken for the end of turn — causing the model to interrupt at unnatural times.

Ձայնային մոդել, որը աշխատում է հերթերով

Պատասխանները փոքր-ինչ ավելի արագ և սահուն են, բայց մոդելի հետ փոխադարձ շփումը դեռևս անբնական է թվում

Տառադարձություն
Զրույցի օրինակ՝ ChatGPT-ի ընդլայնված ձայնային ռեժիմով

Our new approach

GPT‑Live addresses these limitations through two architectural changes.

Continuous interaction

First, we built GPT‑Live for continuous interaction using a full-duplex architecture. Instead of processing a sequence of separate messages, GPT‑Live continuously processes input while generating output. The model can therefore make interaction decisions many times per second: whether to speak, continue listening, pause, interrupt, or invoke a tool.

This allows the model to engage in more natural back-and-forth, maintain a better sense of time, and even perform live translation.

Շարունակական փոխգործակցություն

Արագ, բնական, արտահայտիչ պատասխաններ և ավելի ակտիվ ունկնդրում

Տառադարձություն
GPT-Live-1-ի հետ զրույցի օրինակ՝ GPT-5.5 Ակնթարթայինի կիրառմամբ

Delegation for deeper work

Second, we decoupled GPT‑Live — which handles continuous interaction — from deeper work. When a question requires search, reasoning, or more agentic capabilities, GPT‑Live can delegate the task to another model like GPT‑5.5. This allows it to keep the conversation going, even as it handles multiple tasks in the background.

This architectural change also allows GPT‑Live to continuously use the latest models and agents, combining frontier intelligence with natural interaction.

Ավելի բարդ աշխատանքի պատվիրակում

GPT-Live-ը տրամադրում է արագ, բնական պատասխաններ, մինչ GPT-5.5-ը ֆոնային ռեժիմում կատարում է որոնումը

Տառադարձություն
GPT-Live-1-ի հետ զրույցի օրինակ՝ GPT-5.5 Ակնթարթայինի կիրառմամբ

Evaluations

We built new human evaluations to measure pleasantness and the flow of conversation. In these head-to-head comparisons, GPT‑Live‑1 and GPT‑Live‑1 mini are strongly preferred over Advanced Voice Mode in matched 5–10 minute conversations that measure overall preference, turn-taking, interruptions, conversational flow, and how natural each interaction felt.

  • GPQA: GPT‑Live‑1 substantially outperforms Advanced Voice Mode on GPQA, which tests expert-level scientific reasoning across biology, chemistry, and physics.
  • BrowseComp: GPT‑Live‑1 shows strong gains over Advanced Voice Mode on BrowseComp, which tests agentic web search and the ability to find difficult-to-locate information.
  • τ³-Voice Telecom (internal variant)**: GPT‑Live‑1 outperforms Advanced Voice Mode on τ³-Voice Telecom, which tests voice agents on realistic, multi-turn telecom support tasks.

* GPT‑Live‑1 (instant) and GPT‑Live‑1 mini use the GPT‑5.5 Instant model in the background, while GPT‑Live‑1 Medium and GPT‑Live‑1 High use the GPT‑5.5 Thinking model with medium and high reasoning effort.

** We used a customized user model, powered by our latest reasoning models, for this eval.

ChatGPT Voice-ի նոր փորձառություն

Ամեն շաբաթ ավելի քան 150 միլիոն մարդ խոսում է ChatGPT‑ի հետ՝ օգտագործելով Voice-ի և Dictation-ի նման գործառույթներ։ Նրանք օգտվում են դրանից՝ առօրյա օգնություն ստանալու առանց ձեռքերն օգտագործելու, լեզուներ վարժելու, քնից առաջ հեքիաթներ պատմելու կամ պարզապես ճանապարհին զրուցելու համար։

Այսօրվանից, երբ սեղմեք Voice կոճակը՝ ChatGPT‑ի հետ խոսելու համար, կստանաք GPT‑Live‑ով աշխատող բարելավված փորձառություն՝ ավելի բնական զրույցներով, ավելի խելացի պատասխաններով, ավելի լավ լսելով և տեսողական պատասխաններով։

Ավելի բնական զրույցներ

ChatGPT‑ի հետ խոսելը հիմա պետք է շատ ավելի նման լինի իրական զրույցի։ Կարող եք ընդհատել հարցով, դադար առնել մտքերը հավաքելու համար կամ խնդրել ChatGPT‑ին ավելի դանդաղ խոսել։ Այն բնականորեն արձագանքում է ձեր ասածին՝ «մհմ» կամ «հասկացա» արտահայտություններով, որպեսզի իմանաք, որ հետևում է խոսքին։ Մենք նաև վերամշակել ենք ChatGPT‑ի ինը տարբերակվող ձայները GPT‑Live‑ի համար։

Ավելի խելացի պատասխաններ

ChatGPT Voice-ն այժմ կարող է օգտվել մեր ամենավերջին առաջադեմ մոդելներից՝ անհրաժեշտ պահին տալով ավելի խելացի պատասխաններ։ Կարող եք նաև ընտրել ձեր կարիքներին համապատասխան դատողության մակարդակը՝ Instant՝ արագ պատասխանների համար, կամ Medium և High, երբ ուզում եք, որ ChatGPT‑ն ավելի երկար մտածի։

Ավելի լավ լսում

Եթե մի պահ մտածելու համար դադար առնեք, ChatGPT Voice-ն այժմ սպասում է՝ փոխանակ խոսքը կտրելու և ընդհատելու։ Եթե խնդրեք, որ լռի և լսի, այդպես էլ կանի։ Իսկ երբ ֆոնային աղմուկ կա, օրինակ՝ անցնող մեքենաներ կամ մոտակայքում խոսակցություններ, ChatGPT‑ն ավելի լավ է կենտրոնանում ձեր ձայնի վրա՝ շեղվելու փոխարեն։

Տեսողական պատասխաններ՝ մի հայացքով

Որոշ պատասխաններ ավելի օգտակար են, երբ կարող եք դրանք տեսնել։ Մինչ դուք խոսում եք, ChatGPT‑ն այժմ կարող է ցուցադրել հարուստ տեսողական քարտեր այնպիսի թեմաների համար, ինչպիսիք են եղանակը, բաժնետոմսերը, սպորտը և այլն։ Voice-ը նաև շարունակում է աջակցել որոնմանը, հիշողությանը, պատկերներին և ֆայլերի վերբեռնումներին։

Արդյունքում ChatGPT Voice-ի փորձառությունը առօրյայում ավելի բնական, ավելի կարողունակ և ավելի օգտակար է թվում։

Անվտանգություն՝ ստեղծված ձայնի համար

GPT‑Live‑ը նախագծվել է այնպես, որ լռելյայն անվտանգ լինի։ Այն հիմնվում է մեր վերջին մոդելների անվտանգության առաջընթացի վրա՝ միաժամանակ ավելացնելով հատուկ անվտանգության ուսուցում հիմնական ռիսկային ոլորտներում և նոր պաշտպանական մեխանիզմներ՝ ստեղծված հենց ձայնի համար։

Անվտանգության ընդլայնված փորձարկում

Որպեսզի ավելի լավ արտացոլենք, թե ինչպես են մարդիկ ձայնն օգտագործում իրական պայմաններում, մենք սկսեցինք ընդլայնել մեր անվտանգության փորձարկումները՝ ներառելով նոր, աուդիոյին բնորոշ գնահատումներ։ Մենք նաև ստեղծել ենք սինթետիկ գնահատումներ, որոնք օգտագործում են գեներացված աուդիո՝ անվտանգության հիմնական ոլորտների վրա ավելի խորությամբ կենտրոնանալու համար՝ հիմնվելով ընդլայնված ձայնային ռեժիմից ստացած մեր փորձի վրա։ Այդ ոլորտներն են ինքնավնասումը, փսիխոզն ու մանիան, հուզական կախվածությունը AI-ից, բռնությունը և սեռական բովանդակությունը։ Ներքին փորձագետները նաև ռեդ-թիմինգի են ենթարկել մոդելը՝ ձայնին հատուկ ռիսկերի համար։

Մեր փորձարկումներում GPT‑Live‑ը գրեթե բոլոր գնահատված ոլորտներում ցուցաբերեց ընդլայնված ձայնային ռեժիմին համադրելի կամ դրանից ավելի լավ արդյունք։ Մեր փորձարկումների և պաշտպանական մեխանիզմների մասին ավելին կարող եք կարդալ GPT‑Live‑ի համակարգի քարտում(բացվում է նոր պատուհանում)։

Ներկառուցված պաշտպանական մեխանիզմներ

Քանի որ ձայնային զրույցներն ընթանում են իրական ժամանակում, մենք նաև ստեղծել ենք պաշտպանական մեխանիզմներ, որոնք կարող են գործել, մինչ մոդելը խոսում է։ Երբ համակարգը հայտնաբերում է պոտենցիալ վտանգավոր ելք, այն կարող է մոդելին ուղղորդել դեպի ավելի անվտանգ պատասխան, ցուցադրել լրացուցիչ անվտանգության հաղորդագրություններ կամ ռեսուրսներ, իսկ ավելի բարձր ռիսկի դեպքերում՝ ավարտել ձայնային զրույցը։ Ինքնավնասման հետ կապված զրույցների համար մենք ChatGPT‑ի աջակցության հոսքերը հարմարեցրել ենք ձայնին՝ ներառյալ փորձագետների կողմից ստուգված ճգնաժամային թեժ գծերի աջակցության առաջարկը։

Մենք նախագծել ենք լրացուցիչ պաշտպանություններ՝ դեռահաս օգտատերերին աջակցելու համար, և տարիքին համապատասխան վարքագիծը ուղղակիորեն ուսուցանել ենք մոդելին՝ ոչ պատշաճ պատասխանների ռիսկը նվազեցնելու համար։ Ծնողները ծնողական վերահսկողության միջոցով կարող են ընտրել՝ արդյոք իրենց դեռահասը կարող է օգտագործել ChatGPT Voice-ը, իսկ կապված ծնողները կարող են ծանուցվել ավելի բարձր ռիսկի իրավիճակներում, երբ նկատվում են հնարավոր ինքնավնասման կամ ինքնասպանության մտադրության նշաններ։

Սովորել իրական օգտագործումից

Մենք նաև գործարկում ենք երկարաժամկետ չափումներ և հետթողարկումային մոնիթորինգ՝ կենտրոնացած հուզական կախվածության վրա, որպեսզի շարունակենք խորացնել մեր ըմբռնումը և կատարելագործել պաշտպանական մեխանիզմները։ Հիմնվելով աֆեկտիվ օգտագործման և հուզական բարեկեցության վերաբերյալ մեր նախորդ հետազոտության վրա՝ սա կօգնի մեզ բացահայտել ձևավորվող օրինաչափությունները և բարելավել, թե ինչպես է համակարգը արձագանքում հուզականորեն զգայուն փոխազդեցություններում։

Վերջապես, GPT‑Live‑ը ստեղծված է զրույցի, ոչ թե ձայնի նմանակման համար։ Այն օգտագործում է ChatGPT‑ում նախապես սահմանված ձայների հավաքածու՝ պաշտպանական մեխանիզմներով, որոնք թույլ չեն տալիս նմանակել իրական մարդու ձայնը։

Մենք հանձնառու ենք աջակցելու անվտանգությանը և բարեկեցությանը և կշարունակենք ամրապնդել այս պաշտպանությունները՝ իրական օգտագործումից սովորելուն զուգահեռ։

Հասանելիություն և սահմանափակումներ

GPT‑Live‑ն այժմ հասանելի է դառնում ChatGPT‑ի օգտատերերին ամբողջ աշխարհում՝ iOS-ում, Android-ում և ChatGPT.com(բացվում է նոր պատուհանում)-ում։ GPT‑Live‑1‑ը կդառնա ChatGPT Voice-ը սնուցող լռելյայն մոդելը Go, Plus և Pro օգտատերերի համար, իսկ GPT‑Live‑1 mini-ն՝ Free օգտատերերի համար։ Հասանելիության մասին ավելի մանրամասն տեղեկություններ կարող եք գտնել մեր Օգնության կենտրոնում(բացվում է նոր պատուհանում)։

Մենք GPT‑Live‑ը օպտիմալացրել ենք ChatGPT‑ում ամենատարածված լեզուներից մի քանիսի համար։ Որոշ լեզուների դեպքում մոդելը կարող է ունենալ ոչ մայրենի արտասանություն կամ սահունության բացեր։ Մենք ակտիվորեն աշխատում ենք լեզուների միջև փորձառությունը բարելավելու ուղղությամբ։

Թողարկման պահին GPT‑Live‑ը ChatGPT‑ում չի աջակցի ձայնը տեսանյութի կամ էկրանի համօգտագործման հետ, բայց մենք աշխատում ենք շուտով ներկայացնել այս հնարավորությունները։ Դուք դեռ կարող եք օգտվել ChatGPT Voice-ի հին տարբերակներից, այդ թվում՝ Standard-ից և ընդլայնված ձայնային ռեժիմից, որտեղ այս գործառույթները հասանելի են։

Հեղինակ

OpenAI