Перейти до основного вмісту
OpenAI

10 вересня 2026 р.

ПродуктВипуск

Створюйте природніші голосові взаємодії з GPT‑Live‑1 в API

GPT‑Live‑1 переносить природні двосторонні розмови ChatGPT у реальному часі в API та дає більше контролю над тим, як голосові агенти говорять і діють.

Завантаження…

Ми запускаємо GPT‑Live‑1 в API, надаючи розробникам потужну модель для природної голосової взаємодії, з якою можна створювати застосунки з голосовими функціями та бізнес-процеси. Уперше представлена в ChatGPT, GPT‑Live‑1 може одночасно слухати й говорити, а також, як показано на прикладі з Codex і ChatGPT Work⁠(відкривається у новому вікні), делегувати складніші завдання з міркування та виконання дій моделям і інструментам, з якими вона працює.

Під час підготовки GPT‑Live‑1 до запуску в API ми зосередилися на нових можливостях, які дають розробникам змогу налаштовувати голосову взаємодію відповідно до потреб користувачів, робочих процесів і цілей. Одна з ключових переваг GPT‑Live‑1, природна обробка перебивань, уже дає відчутні результати для бізнесу. Під час перших оцінювань Speak виявила, що GPT‑Live‑1 дає учням більше часу на роздуми, перш ніж мовний репетитор відповість, завдяки чому кількість перебивань скоротилася майже на 80% порівняно з попередніми системами з почерговими репліками.

Ключові переваги GPT‑Live‑1 в API:

  • Обробка перебивань: одна модель спільно опрацьовує вхідне й вихідне аудіо, завдяки чому краще реагує на перебивання та дає змогу уникнути затримок і ненадійної передачі між компонентами в послідовних архітектурах STT–LLM–TTS.

  • Делегування міркування й викликів інструментів: GPT‑Live‑1 може делегувати міркування та виклики інструментів текстовій моделі бекенду, як-от GPT‑6 Astra, або моделі стороннього постачальника.

  • Тон, темп і стиль: дає розробникам змогу налаштовувати тон, темп і стиль спілкування агента за допомогою системного запиту.

  • Непомітне керування контекстом і фоновим шумом: краще обробляє фоновий шум і паузи, не перериваючи розмову та не проговорюючи вголос кожен свій крок.

  • Надійність під час тривалих сеансів: поліпшує збереження контексту та якість розмови під час тривалої взаємодії.

  • Підтримка телефонії: уможливлює розгортання повнодуплексних голосових агентів для телефонних дзвінків — від бронювання столика в ресторані до обслуговування клієнтів.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Час роботи цієї демонстрації обмежений. Використовуючи її, ви погоджуєтеся з Умовами використання OpenAI та підтверджуєте, що ознайомилися з нашою Політикою конфіденційності.

Спростіть архітектуру голосового агента та зменште затримку голосової взаємодії

Традиційні голосові агенти поєднують розпізнавання мовлення, модель міркування та синтез мовлення. Кожна передача даних збільшує затримку й ризик втратити правильний момент, контекст або природний ритм розмови. Координувати ці етапи часто доводиться розробникам, зокрема визначати, що має відбуватися, коли співрозмовник перебиває, робить паузу або змінює тему.

GPT‑Live‑1 об'єднує слухання й мовлення в одній моделі, спрощуючи голосовий шар. Вона може одразу реагувати на перебивання та короткі репліки співрозмовника, водночас делегуючи складніше міркування бекенду. Завдяки цьому розмова може тривати, поки робота виконується у фоновому режимі.

“Порівняно з нашою каскадною архітектурою GPT‑Live‑1 спростив нашу кодову базу на 80% і дозволив прибрати 23 тисячі рядків коду. Це уможливило природні розмови з пацієнтами в реальному часі та звільнило нашій команді час для вдосконалення досвіду — від запису на прийом до навігації в процесі догляду.”
— Тоні Стоянов, співзасновник і технічний директор

Розробники самостійно обирають моделі, інструменти й агентну інфраструктуру, що стоять за розмовою. Наприклад, вони можуть поєднати GPT‑Live‑1 з моделлю на кшталт Luna для високочастотних завдань, таких як планування зустрічей чи оновлення статусу замовлень, і використовувати модель на кшталт Astra для складних питань клієнтів, що потребують глибшого міркування. Така гнучкість дозволяє розробникам підбирати глибину міркування, швидкість і вартість під кожне конкретне завдання.

GPT‑Live‑1 нативно надає транскрипції ASR і текст відповідей. Вона також добре розпізнає буквено-цифрові послідовності та підтримує налаштування пріоритету ключових слів. Хоча GPT‑Live‑1 не є моделлю з почерговими репліками, вона нативно підтримує визначення меж реплік, тому розробники й надалі можуть будувати системи на основі чітко визначених меж між репліками.

Вимірювання переваги повного дуплексу

За результатами наших оцінювань GPT‑Live‑1 покращує результат у Full Duplex Bench на 30 відсоткових пунктів порівняно з GPT‑Realtime‑2.1, демонструючи значний прогрес у швидкості чергування реплік і якості взаємодії. У поєднанні з GPT‑6 Astra із середнім рівнем зусилля на міркування вона також посідає перше місце в Tau3, що оцінює передові інтелектуальні можливості голосових агентів під час наскрізного виконання завдань.

Оцінює завдання з усного обслуговування клієнтів у сферах авіаперевезень, роздрібної торгівлі та телекомунікацій. Pass@1 вимірює успішність виконання завдань; у підсумковому показнику кожна сфера має однакову вагу.


* Бекенд GPT Live: Astra (середнє).

Оцінює голосову підтримку клієнтів банку з використанням пошуку інформації та інструментів для роботи з рахунками. Pass@1 — це частка з 97 завдань banking_knowledge, які було успішно виконано.


* Бекенд GPT Live: Astra (середнє).

Оцінює обробку пауз, чергування реплік у розмові, перебивання та короткі репліки зворотного зв’язку.

Перевіряє реакцію на фонове мовлення, звернення до іншої людини, короткі репліки слухача та перебивання.

Вимірює, як швидко агент починає відповідь після того, як користувач завершує репліку.

Перевіряє використання інструментів за усними запитами з природними паузами, ваганнями та самовиправленнями. Pass@1 оцінює послідовність викликів інструментів.


* Бекенд GPT Live: Terra (низьке).

Оцінює усну відповідь на запити щодо використання інструментів, які містять паузи, вагання та самовиправлення. Оцінює, наскільки відповідь відповідає наміру, заданому в еталоні.


* Бекенд GPT Live: Terra (низьке).

Що кажуть клієнти

1 із 4
“Інтеграція GPT‑Live‑1 у Yelp Host і Hatch покращила черговість реплік і точність порівняно з нашою традиційною голосовою архітектурою. Коли Yelp Host використовує GPT‑Live‑1 для відповіді на дзвінки, наприклад щодо бронювання столиків і замовлення їжі, ми спостерігаємо суттєве покращення показників обробки дзвінків. Користувачі також говорять повнішими й природнішими реченнями, а це свідчить про те, що спілкування з системою на іншому кінці лінії справді відчувається інакше.”
— Алекс Леві, технічний директор

Нові варіанти голосів

Розробникам потрібні голоси, які підходять їхньому продукту й звучать природно для користувачів. З появою GPT‑Live‑1 ми розширюємо невеликий набір голосів для взаємодії в реальному часі до значно ширшого вибору акцентів, діалектів і мов, даючи розробникам більше свободи у виборі звучання їхніх асистентів.

Слухати нові голоси

Ми й надалі розширюватимемо кількість голосів і доступність мов протягом наступних місяців.

Ціни й доступність

GPT‑Live‑1 уже доступна в API⁠(відкривається у новому вікні) за ціною 0,05 дол. США за хвилину для голосового шару фронтенду. Поєднайте її з моделлю бекенду та системою harness агента, які відповідають вашому продукту, а потім створіть голосову взаємодію, здатну масштабуватися відповідно до обсягу завдань.

Підключення GPT-Live-1 до Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Підключення GPT-Live-1 до Codex. У цьому фрагменті показано, як застосунок передає контекст розмови до Codex і повертає його відповідь у GPT-Live-1. Налаштування підключення та обробку делегування опущено.

Щоб отримати доступ до власних голосів, зверніться до відділу продажів і дізнайтеся більше про умови доступу та порядок подання запиту.

Ще один спосіб створювати голосові робочі процеси на основі GPT‑Live‑1 — використовувати OpenAI Presence, що застосовує цю модель для голосової взаємодії в реальному часі. Presence допомагає компаніям розгортати надійних агентів ШІ, які можуть відповідати на запитання, розв’язувати проблеми, працювати з корпоративними системами, виконувати схвалені дії та за потреби передавати завдання людям. Щоб дізнатися більше, зверніться до свого менеджера OpenAI.