OpenAI

8 липня 2026 р.

ПродуктВипуск

Представляємо GPT‑Live

Нове покоління голосових моделей для природної взаємодії людини й ШІ, що тепер забезпечує роботу ChatGPT Voice.

Завантаження…

Оновлення від 31 липня 2026 року: Підтримувані аудіофайли, згенеровані за допомогою GPT‑Live через ChatGPT Voice та OpenAI API, тепер містять водяні знаки SynthID. Наш загальнодоступний інструмент перевірки тепер може виявляти сигнали походження OpenAI у підтримуваних аудіофайлах. Крім того, ми запровадили доступ до перевірки через API, аби розробники й організації могли інтегрувати перевірки походження у власні робочі процеси. Ці оновлення розвивають підхід до безпеки, описаний нижче, і нашу ширшу роботу, спрямовану на те, щоб контент, згенерований OpenAI, було легше ідентифікувати.

Ми запускаємо GPT‑Live — нове покоління голосових моделей, завдяки яким розмова з ШІ значно більше схожа на справжній діалог.

GPT‑Live побудовано на повнодуплексній архітектурі, тобто він може слухати й говорити одночасно. Під час розмов GPT‑Live може показувати, що уважно слухає, фразами на кшталт «угу» чи «так», швидко обмінюватися репліками або просто мовчати, коли вам потрібна хвилина на роздуми. У результаті голосовий досвід стає напрочуд легким і природним для спілкування.

GPT‑Live також є нашою найрозумнішою голосовою моделлю на сьогодні. Для запитань, що потребують вебпошуку, глибшого міркування або складнішої роботи, він непомітно делегує завдання нашій найновішій передовій моделі й повертає результат у розмову, щойно він буде готовий. Поки триває робота, GPT‑Live може й далі спілкуватися з вами та підтримувати природний перебіг розмови. На момент запуску GPT‑Live використовуватиме GPT‑5.5 у фоновому режимі. У міру випуску нових передових моделей ми постійно оновлюватимемо модель, яку використовує GPT‑Live.

Ці вдосконалення забезпечують новий досвід ChatGPT Voice, розумніший і природніший у використанні. З часом, на нашу думку, це дослідження також відкриє можливість використовувати голос для дедалі складнішої, тривалішої та більш агентної роботи.

Відсьогодні ми починаємо розгортати дві версії GPT‑Live — GPT‑Live‑1 і GPT‑Live‑1 mini — для користувачів ChatGPT у всьому світі. Ми також плануємо невдовзі додати їх до API, а розробники й компанії можуть підписатися на сповіщення за допомогою цієї форми.

Вступ у нову еру взаємодії людини й ШІ

Наше бачення — забезпечити справді природну взаємодію людини й ШІ: світ, у якому співпраця зі ШІ відчувається такою ж плавною та чуйною, як робота з іншою людиною, а міркування й виконання складних завдань непомітно відбуваються у фоновому режимі.

Попередні підходи

Старші покоління голосових систем ШІ наблизили нас до цього бачення, але мали важливі компроміси.

Каскадні голосові системи

Каскадні голосові системи покладаються на низку моделей, які послідовно обробляють кожну репліку. Оригінальний ChatGPT Voice поєднував у ланцюжок три моделі: модель перетворення мовлення на текст для транскрибування вашого мовлення, велику мовну модель для створення відповіді та модель перетворення тексту на мовлення, щоб знову перетворити її на усне мовлення. Цей підхід уперше дав нам змогу говорити з передовими моделями ШІ, але складність мала свою ціну: інформація могла втрачатися між моделями, а відповіді були повільними й неприродно скутими.

Каскадна голосова система

Повільні та неприродні відповіді, довгі паузи

Розшифровка
Приклад розмови зі стандартним голосовим режимом із використанням GPT-5.5 Instant

Покрокові голосові моделі

Покрокові голосові моделі, як-от розширений голосовий режим ChatGPT, обробляли й генерували аудіо в межах однієї моделі, зменшуючи затримку та роблячи розмови плавнішими, але все одно працювали через окремі репліки. Модель мала чекати, доки користувач перестане говорити, і лише тоді відповідати, через що обмін репліками здавався неприроднім. Крім того, оскільки визначення завершення репліки ґрунтується на тиші, навіть коротка пауза чи фоновий шум могли бути помилково сприйняті як кінець репліки, через що модель перебивала в найбільш невідповідні моменти.

Покрокова голосова модель

Відповіді трохи швидші й плавніші, але діалог із моделлю все ще здається недостатньо плавним

Розшифровка
Приклад розмови в розширеному голосовому режимі ChatGPT

Наш новий підхід

GPT‑Live усуває ці обмеження завдяки двом архітектурним змінам.

Безперервна взаємодія

По-перше, ми створили GPT‑Live для безперервної взаємодії на основі повнодуплексної архітектури. Замість того щоб обробляти послідовність окремих повідомлень, GPT‑Live безперервно обробляє вхідні дані, водночас генеруючи вихідні. Тому модель може багато разів на секунду ухвалювати рішення щодо взаємодії: говорити, продовжувати слухати, зробити паузу, перебити або викликати інструмент.

Це дає моделі змогу вести природніший обмін репліками, краще відчувати час і навіть виконувати переклад наживо.

Безперервна взаємодія

Швидкі, природні й виразні відповіді та активніше слухання

Розшифровка
Приклад розмови з GPT-Live-1 із використанням GPT-5.5 Instant

Делегування для більш ретельної роботи

По-друге, ми відокремили GPT‑Live, який відповідає за безперервну взаємодію, від глибшої роботи. Коли запитання потребує пошуку, міркування або більш агентних можливостей, GPT‑Live може делегувати завдання іншій моделі, наприклад GPT‑5.5. Це дає йому змогу підтримувати розмову, навіть коли він виконує кілька завдань у фоновому режимі.

Ця архітектурна зміна також дає GPT‑Live змогу постійно використовувати найновіші моделі й агентів, поєднуючи передовий рівень інтелекту з природною взаємодією.

Делегування для більш ретельної роботи

GPT-Live надає швидкі, природні відповіді, тоді як GPT-5.5 виконує пошук у фоновому режимі

Розшифровка
Приклад розмови з GPT-Live-1 із використанням GPT-5.5 Instant

Оцінювання

Ми створили нові оцінювання за участю людей, щоб вимірювати приємність і перебіг розмови. У цих прямих порівняннях GPT‑Live‑1 і GPT‑Live‑1 mini мають значно вищу перевагу над розширеним голосовим режимом у зіставних 5–10-хвилинних розмовах, де вимірювали загальну перевагу, чергування реплік, перебивання, перебіг розмови та те, наскільки природною відчувалася кожна взаємодія.

  • GPQA: GPT‑Live‑1 суттєво перевершує розширений голосовий режим у GPQA, який перевіряє наукове міркування експертного рівня в біології, хімії та фізиці.
  • BrowseComp: GPT‑Live‑1 демонструє значні покращення порівняно з розширеним голосовим режимом у BrowseComp, який перевіряє агентний вебпошук і здатність знаходити важкодоступну інформацію.
  • τ³-Voice Telecom (внутрішній варіант)**: GPT‑Live‑1 перевершує розширений голосовий режим у τ³-Voice Telecom, що перевіряє голосових агентів на реалістичних багатокрокових завданнях телеком-підтримки.

* GPT‑Live‑1 (Instant) і GPT‑Live‑1 mini використовують у фоновому режимі модель GPT‑5.5 Instant, тоді як GPT‑Live‑1 Середній і GPT‑Live‑1 Високий використовують модель GPT‑5.5 Thinking із середнім і високим обсягом міркування.

Для цієї оцінки ми використали спеціальну користувацьку модель на базі наших найновіших моделей міркування.

Новий досвід ChatGPT Voice

Щотижня понад 150 мільйонів людей спілкуються з ChatGPT за допомогою таких функцій, як Voice і Dictation. Вони використовують його, щоб отримувати повсякденну допомогу без необхідності друку, практикувати мови, розповідати казки на ніч або просто спілкуватися дорогою.

Відсьогодні, натиснувши кнопку Voice, щоб поговорити з ChatGPT, ви отримаєте покращений досвід на базі GPT‑Live — із природнішими розмовами, розумнішими відповідями, кращим слуханням і візуальними відповідями.

Природніші розмови

Тепер розмова з ChatGPT має значно більше відчуватися як справжня розмова. Ви можете перебити помічника запитанням, зробити паузу, щоб зібратися з думками, або попросити ChatGPT говорити повільніше. Він природно реагує на ваші слова фразами на кшталт «угу» чи «зрозуміло», щоб ви знали, що він стежить за розмовою. Ми також оновили дев’ять окремих голосів у ChatGPT для GPT‑Live.

Розумніші відповіді

ChatGPT Voice тепер може використовувати наші найновіші передові моделі, щоб давати розумніші відповіді, коли вони вам потрібні. Ви також можете вибрати рівень міркування відповідно до своїх потреб: Instant для швидких відповідей або «Середній» чи «Високий», коли хочете, щоб ChatGPT витрачав більше часу на обдумування.

Уважніший слухач

Якщо вам потрібна мить на роздуми, ChatGPT Voice тепер чекає замість того, щоб втрутитися чи перебити. Якщо ви попросите його слухати мовчки, він так і зробить. А коли є фоновий шум, наприклад рух транспорту чи розмови поруч, ChatGPT краще зосереджується на вашому голосі й не відволікається.

Миттєві наочні відповіді

Деякі відповіді корисніші, коли їх можна побачити. Поки ви говорите, ChatGPT тепер може показувати насичені візуальні картки на теми на кшталт погоди, акцій, спорту тощо. Voice також і надалі підтримує пошук, пам’ять, зображення та завантаження файлів.

У результаті ChatGPT Voice стає природнішим, спроможнішим і кориснішим у повсякденному житті.

Безпека, створена для голосу

GPT‑Live розроблено так, щоб він був безпечним за замовчуванням. Він спирається на досягнення в безпеці наших найновіших моделей, додаючи спеціалізоване навчання з безпеки в ключових зонах ризику та нові міри захисти, розроблені саме для голосового режиму.

Розширене тестування безпеки

Аби краще відобразити те, як люди використовують голос у реальних умовах, ми почали з розширення тестування безпеки, додавши нові аудіоорієнтовані оцінки. Ми також створили синтетичні оцінки, що використовують згенероване аудіо, щоб інтенсивніше зосередитися на ключових напрямах безпеки, спираючись на досвід розширеного голосового режиму. До цих напрямів належать самоушкодження, психоз і манія, емоційна залежність від ШІ, насильство й сексуальний контент. Внутрішні експерти також проводили редтімінг моделі щодо ризиків, притаманних саме голосу.

У нашому тестуванні GPT‑Live показав результати, порівнянні з розширеним голосовим режимом або кращі за нього, майже в усіх оцінених напрямах. Докладніше про наше тестування й захисні заходи можна прочитати в картці системи(відкривається у новому вікні) GPT‑Live.

Вбудовані засоби захисту

Оскільки голосовий діалог відбувається в реальному часі, ми також створили засоби захисту, які можуть діяти, поки модель говорить. Коли система виявляє потенційно небезпечний результат, вона може спрямувати модель до безпечнішої відповіді, показати додаткові повідомлення чи ресурси з безпеки або завершити голосову розмову у випадках підвищеного ризику. Для розмов, пов’язаних із самоушкодженням, ми адаптували сценарії підтримки ChatGPT в голосовому режимі, зокрема пропонування перевіреної експертами допомоги кризових гарячих ліній.

Ми розробили додаткові засоби захисту для підтримки підлітків і безпосередньо навчили модель відповідної віку поведінки, щоб зменшити ризик неприйнятних відповідей. Батьки можуть через батьківський контроль вибрати, чи може їхня дитина користуватися ChatGPT Voice; підключені батьки можуть отримувати сповіщення в ситуаціях підвищеного ризику, пов’язаних з ознаками потенційного самоушкодження або суїцидальних намірів.

Ми також запускаємо довгострокові вимірювання й моніторинг після запуску, зосереджені на емоційній залежності, щоб і надалі поглиблювати наше розуміння та вдосконалювати засоби захисту. Спираючись на наше попереднє дослідження афективного використання й емоційного добробуту, це допоможе нам виявляти нові закономірності та покращувати реакцію системи в емоційно чутливих взаємодіях.

Нарешті, GPT‑Live створено для розмови, а не для імітації голосу. Він використовує набір заздалегідь визначених голосів у ChatGPT із засобами захисту, що не дають йому імітувати голос реальної людини.

Ми прагнемо підтримувати безпеку й добробут і надалі посилюватимемо ці міри захисту, навчаючись на реальному використанні.

Доступність і обмеження

GPT‑Live уже розгортається для користувачів ChatGPT по всьому світу на iOS, Android і ChatGPT.com(відкривається у новому вікні). GPT‑Live‑1 стане стандартною моделлю, що забезпечує ChatGPT Voice для користувачів Go, Plus і Pro, а GPT‑Live‑1 mini стане стандартною для користувачів Free. Докладніші відомості про доступ можна знайти в нашому Довідковому центрі(відкривається у новому вікні).

Ми оптимізували GPT‑Live для кількох найпопулярніших мов у ChatGPT. Для певних мов модель може мати нерідний акцент або прогалини у плавності мовлення. Ми активно працюємо над покращенням досвіду різними мовами.

На момент запуску GPT‑Live не підтримуватиме голос із відео або демонстрацією екрана в ChatGPT, але ми працюємо над тим, щоб незабаром додати ці можливості. Ви й надалі можете користуватися застарілими версіями ChatGPT Voice, зокрема Standard і розширеним голосовим режимом, там, де ці функції доступні.

Автор

OpenAI