OpenAI

Представяме GPT‑Live

Ново поколение гласови модели за естествено взаимодействие човек–AI, което вече захранва ChatGPT Voice.

Зареждане…

Актуализация от 31.07.2026 г.: Поддържаното аудио, генерирано с GPT‑Live чрез ChatGPT Voice и OpenAI API, вече включва поставяне на воден знак SynthID. Нашият публичен инструмент за проверка вече може да открива сигнали за произход от OpenAI в поддържани аудиофайлове, а ние въведохме и API достъп за проверка, така че разработчиците и организациите да могат да включват проверки на произхода в собствените си работни процеси. Тези актуализации надграждат подхода към безопасността, описан по-долу, и по-широката ни работа за улесняване на идентифицирането на съдържание, генерирано от OpenAI.

Пускаме GPT‑Live — ново поколение гласови модели, които правят разговора с AI много по-близък до истински разговор.

GPT‑Live е изграден върху архитектура с пълен дуплекс, което означава, че може да слуша и говори едновременно. По време на разговор GPT‑Live може да покаже, че следи казаното, с фрази като „мхм“ или „да“, да участва в бърз обмен или просто да замълчи, когато ви трябва момент да помислите. Резултатът е гласово изживяване, с което се говори освежаващо лесно.

GPT‑Live е и най-интелигентният ни гласов модел досега. При въпроси, които изискват търсене в интернет, по-задълбочено структурирано анализиране или по-сложна работа, той делегира задачата във фонов режим на най-новия ни авангарден модел и връща резултата в разговора, когато е готов. Докато работи, GPT‑Live може да продължи да разговаря с вас и да запази естествения ход на разговора. При пускането си GPT‑Live ще използва GPT‑5.5 във фонов режим. С пускането на нови авангардни модели ще обновяваме непрекъснато модела, използван от GPT‑Live.

Тези подобрения задвижват ново изживяване с ChatGPT Voice, което е по-интелигентно и по-естествено за използване. С времето вярваме, че това изследване ще отключи и възможността гласът да се използва за все по-сложна, по-продължителна и по-агентна работа.

От днес започваме постепенно да пускаме две версии на GPT‑Live – GPT‑Live‑1 и GPT‑Live‑1 mini – за потребителите на ChatGPT по целия свят. Планираме скоро да ги предложим и в API, а разработчиците и компаниите могат да се регистрират за известие чрез този формуляр.

Нашата визия е да направим възможно наистина естествено взаимодействие между хора и AI: свят, в който сътрудничеството с AI се усеща толкова плавно и отзивчиво, колкото работата с друг човек, докато структурираното анализиране и изпълнението на сложни задачи протичат безпроблемно във фонов режим.

Предишни подходи

По-старите поколения гласови AI системи ни доближиха до тази визия, но със значителни компромиси.

Каскадни гласови системи

Каскадните гласови системи разчитат на поредица от модели, които действат един след друг, за да обработят всяка реплика. Първоначалният ChatGPT Voice свързваше три модела: модел за преобразуване на реч в текст, който транскрибира речта ви, голям езиков модел, който създава отговор, и модел за преобразуване на текст в реч, който го превръща обратно в говор. Този подход ни позволи за първи път да разговаряме с авангардни AI модели, но сложността имаше цена: информация можеше да се губи между моделите, а отговорите бяха бавни и сковани.

Каскадна гласова система

Бавни и сковани отговори, дълги паузи

Транскрипция
Примерен разговор със стандартен гласов режим, използващ GPT-5.5 Незабавно

Гласови модели с редуване на реплики

Гласовите модели с редуване на реплики, като разширения гласов режим на ChatGPT, обработваха и генерираха аудио в рамките на един модел, което намаляваше латентността и правеше разговорите по-плавни — но те все още работеха чрез отделни реплики. Моделът трябваше да изчака потребителят да спре да говори, преди да отговори, което водеше до скован обмен. Освен това, тъй като разпознаването на края на репликата се основава на тишина, дори кратка пауза или фонов шум можеше да бъде сбъркан с край на репликата — и моделът да прекъсне в неестествен момент.

Гласов модел с редуване на ходове

Малко по-бързи и по-плавни отговори, но диалогът с модела все още се усеща скован

Транскрипция
Примерен разговор с ChatGPT в разширен гласов режим

Нашият нов подход

GPT‑Live преодолява тези ограничения чрез две архитектурни промени.

Непрекъснато взаимодействие

Първо, създадохме GPT‑Live за непрекъснато взаимодействие чрез архитектура с пълен дуплекс. Вместо да обработва поредица от отделни съобщения, GPT‑Live обработва входа непрекъснато, докато генерира изход. Така моделът може да взема решения за взаимодействието многократно в секунда: дали да говори, да продължи да слуша, да направи пауза, да прекъсне или да извика инструмент.

Това позволява на модела да участва в по-естествен обмен, да поддържа по-добро усещане за време и дори да превежда на живо.

Непрекъснато взаимодействие

Бързи, естествени и изразителни отговори и по-активно слушане

Транскрипция
Примерен разговор с GPT-Live-1, използващ GPT-5.5 Незабавно

Делегиране за по-задълбочена работа

Второ, отделихме GPT‑Live — който се грижи за непрекъснатото взаимодействие — от по-задълбочената работа. Когато даден въпрос изисква търсене, структурирано анализиране или повече агентни възможности, GPT‑Live може да делегира задачата на друг модел, например GPT‑5.5. Това му позволява да поддържа разговора, дори когато обработва няколко задачи във фонов режим.

Тази архитектурна промяна също позволява на GPT‑Live непрекъснато да използва най-новите модели и агенти, съчетавайки авангарден интелект с естествено взаимодействие.

Делегиране за по-задълбочена работа

GPT-Live осигурява бързи и естествени отговори, докато GPT-5.5 обработва търсенето във фонов режим

Транскрипция
Примерен разговор с GPT-Live-1, използващ GPT-5.5 Незабавно

Оценки

Създадохме нови човешки оценки, за да измерим приятността и плавността на разговора. В тези директни сравнения GPT‑Live‑1 и GPT‑Live‑1 mini са силно предпочитани пред разширения гласов режим в съпоставими 5–10-минутни разговори, които измерват общото предпочитание, редуването на репликите, прекъсванията, плавността на разговора и доколко естествено се е усещало всяко взаимодействие.

  • GPQA: GPT‑Live‑1 значително превъзхожда разширения гласов режим на GPQA, който тества научно структурирано анализиране на експертно ниво в биологията, химията и физиката.
  • BrowseComp: GPT‑Live‑1 показва силен напредък спрямо разширения гласов режим на BrowseComp, който тества агентно търсене в уеб и способността да се намира трудна за откриване информация.
  • τ³-Voice Telecom (вътрешен вариант)**: GPT‑Live‑1 превъзхожда разширения гласов режим в τ³-Voice Telecom, който тества гласови агенти върху реалистични, многоходови задачи за телекомуникационна поддръжка.

* GPT‑Live‑1 (Незабавно) и GPT‑Live‑1 mini използват модела GPT‑5.5 Незабавно във фонов режим, докато GPT‑Live‑1 Средно и GPT‑Live‑1 Високо използват модела GPT‑5.5 Thinking със средно и високо усилие за структурирано анализиране.

** За тази оценка използвахме персонализираният потребителски модел, подпомогнат от нашите най-нови модели със структурирано анализиране.

Ново изживяване с ChatGPT Voice

Всяка седмица над 150 милиона души разговарят с ChatGPT чрез функции като Voice и Dictation. Използват го, за да получават ежедневна помощ без ръце, да упражняват езици, да разказват приказки за лека нощ или просто да си побъбрят по пътя.

От днес, когато докоснете бутона Voice, за да говорите с ChatGPT, ще получите подобрено изживяване, захранвано от GPT‑Live — с по-естествени разговори, по-интелигентни отговори, по-добро слушане и визуални отговори.

По-естествени разговори

Разговорът с ChatGPT вече трябва да се усеща много повече като истински разговор. Можете да прекъснете с въпрос, да направите пауза, за да съберете мислите си, или да помолите ChatGPT да говори по-бавно. Той естествено показва, че чува какво казвате, с фрази като „мхм“ или „разбрах“, така че знаете, че ви следи. Също така ремастерирахме деветте отличителни гласа в ChatGPT за GPT‑Live.

По-интелигентни отговори

ChatGPT Voice вече може да използва най-новите ни авангардни модели, за да ви дава по-интелигентни отговори, когато ви трябват. Можете също да изберете нивото на структурирано анализиране според нуждите си: Instant за бързи отговори или Medium и High, когато искате ChatGPT да отдели повече време за мислене.

По-добро слушане

Ако ви трябва момент да помислите, ChatGPT Voice вече изчаква, вместо да се включва и да ви прекъсва. Ако го помолите да мълчи и да слуша, ще го направи. А когато има фонов шум, например преминаващ трафик или разговори наблизо, ChatGPT по-добре се фокусира върху гласа ви, вместо да се разсейва.

Визуални отговори с един поглед

Някои отговори са по-полезни, когато можете да ги видите. Докато говорите, ChatGPT вече може да показва богати визуални карти за теми като време, акции, спорт и други. Voice също продължава да поддържа търсене, памет, изображения и качване на файлове.

Резултатът е изживяване с ChatGPT Voice, което се усеща по-естествено, по-способно и по-полезно в ежедневието.

Безопасност, създадена за глас

GPT‑Live е проектиран да бъде безопасен по подразбиране. Той надгражда напредъка в безопасността от най-новите ни модели, като добавя специализирано обучение за безопасност в ключови рискови области и нови предпазни мерки, създадени специално за глас.

Разширено тестване за безопасност

За да отразим по-добре как хората използват глас в реални ситуации, започнахме с разширяване на тестовете ни за безопасност, така че да включват нови оценки, създадени за аудио. Създадохме и синтетични оценки, които използват генерирано аудио, за да се фокусират по-интензивно върху ключови области на безопасността, като стъпват на наученото от разширен гласов режим. Тези области включват самонараняване, психоза и мания, емоционална зависимост от AI, насилие и сексуално съдържание. Вътрешни експерти също проведоха red-team тестове на модела за рискове, характерни само за гласа.

В нашите тестове GPT‑Live се представи сравнимо или по-добре от разширен гласов режим в почти всички области, които оценявахме. Можете да прочетете повече за нашите тестове и предпазни мерки в картата на системата(отваря се в нов прозорец) за GPT‑Live.

Вградени предпазни мерки

Тъй като гласовите разговори протичат в реално време, изградихме и предпазни мерки, които могат да действат, докато моделът говори. Когато системата открие потенциално опасен изход, тя може да насочи модела към по-безопасен отговор, да покаже допълнителни съобщения или ресурси за безопасност, или да прекрати гласовия разговор при случаи с по-висок риск. За разговори, свързани със самонараняване, адаптирахме потоците за подкрепа на ChatGPT за глас, включително предлагане на кризисна подкрепа по линии за помощ, проверена от експерти.

Създадохме допълнителни защити в подкрепа на тийнейджърите и обучихме поведение, подходящо за възрастта, директно в модела, за да намалим риска от неподходящи отговори. Родителите могат чрез родителски контрол да избират дали техният тийнейджър да използва ChatGPT Voice, а свързаните родители може да бъдат уведомявани в ситуации с по-висок риск, включващи признаци на потенциално самонараняване или суицидни намерения.

Уроци от реалната употреба

Също така въвеждаме по-дългосрочно измерване и наблюдение след пускането, фокусирани върху емоционалната зависимост, за да продължим да подобряваме разбирането си и да усъвършенстваме предпазните мерки. Като надграждаме предишното си изследване на емоционалната употреба и емоционалното благополучие, това ще ни помогне да откриваме нововъзникващи модели и да подобрим начина, по който системата реагира в емоционално чувствителни взаимодействия.

И накрая, GPT‑Live е създаден за разговор, а не за имитиране на гласове. Той използва набор от предварително зададени гласове в ChatGPT, с предпазни мерки, които му пречат да имитира гласа на реален човек.

Ангажирани сме да подкрепяме безопасността и благополучието и ще продължим да укрепваме тези защити, докато се учим от реалната употреба.

Наличност & ограничения

GPT‑Live вече се разпространява за потребителите на ChatGPT по целия свят в iOS, Android и ChatGPT.com(отваря се в нов прозорец). GPT‑Live‑1 ще стане моделът по подразбиране, който захранва ChatGPT Voice за потребителите на Go, Plus и Pro, а GPT‑Live‑1 mini ще стане моделът по подразбиране за потребителите на Free. Повече подробности за наличността можете да намерите в нашия Помощен център(отваря се в нов прозорец).

Оптимизирахме GPT‑Live за някои от най-популярните езици в ChatGPT. За някои езици моделът може да има чужд акцент или пропуски в плавността. Работим активно, за да подобрим изживяването на различни езици.

При пускането GPT‑Live няма да поддържа глас с видео или споделяне на екрана в ChatGPT, но работим скоро да въведем тези възможности. Все още можете да използвате наследени версии на ChatGPT Voice, включително Standard и разширен гласов режим, където тези функции са налични.

Автор

OpenAI