Przejdź do treści głównej
OpenAI

10 września 2026

ProduktPremiera

Twórz bardziej naturalne interakcje głosowe z GPT‑Live‑1 w API

GPT‑Live‑1 udostępnia w API naturalne rozmowy ChatGPT w pełnym dupleksie, z większą kontrolą nad tym, jak agenci głosowi mówią i działają.

Ładowanie…

Wprowadzamy GPT‑Live‑1 do API, oferując deweloperom zaawansowany, naturalnie brzmiący model głosowy do tworzenia aplikacji obsługujących komunikację głosową i firmowych przepływów pracy. Po raz pierwszy zaprezentowany w ChatGPT, GPT‑Live‑1 potrafi jednocześnie słuchać i mówić, a także, jak pokazano w Codex i ChatGPT Work⁠(otwiera nowe okno), delegować głębsze rozumowanie i działania modelom oraz narzędziom, z którymi jest połączony.

W wydaniu GPT‑Live‑1 dla API skupiliśmy się na nowych możliwościach, dzięki którym deweloperzy mogą kierować interakcjami głosowymi i dostosowywać je do użytkowników, procesów i celów. Kluczowa zaleta GPT‑Live‑1, czyli płynna obsługa przerwań, już przynosi korzyści biznesowe: we wczesnych testach Speak ustalił, że GPT‑Live‑1 dawał uczniom więcej czasu na namysł przed odpowiedzią lektora językowego, ograniczając liczbę przerwań o niemal 80% w porównaniu z wcześniejszymi systemami turowymi.

Najważniejsze zalety GPT‑Live‑1 w API:

  • Obsługa przerwań: usprawnia obsługę przerwań dzięki jednemu modelowi, który jednocześnie analizuje dźwięk przychodzący i wychodzący, unikając opóźnień i zawodnych przełączeń typowych dla łańcuchowych architektur STT–LLM–TTS.

  • Delegowanie rozumowania i wywołań narzędzi: GPT‑Live‑1 może delegować rozumowanie i wywołania narzędzi do backendowego modelu tekstowego, takiego jak GPT‑6 Astra, lub modelu innej firmy.

  • Ton, tempo i styl: Pozwala deweloperom kształtować ton, tempo i styl konwersacji agenta za pomocą polecenia systemowego.

  • Ciche zarządzanie kontekstem i hałas w tle: Model lepiej radzi sobie z hałasem w tle i ciszą, nie przerywając rozmowy ani nie relacjonując na głos każdego kroku.

  • Niezawodność długich sesji: Lepsze zachowanie kontekstu i wyższa jakość rozmowy podczas długotrwałych interakcji.

  • Obsługę telefonii: Umożliwia wdrażanie agentów głosowych działających w pełnym dupleksie podczas połączeń telefonicznych — od rezerwacji stolików po obsługę klienta.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

To demo jest ograniczone czasowo. Korzystając z niego, akceptujesz Warunki OpenAI i przyjmujesz do wiadomości nasze Zasady prywatności.

Uprość architekturę agenta głosowego i zmniejsz opóźnienia głosowe

Tradycyjne agenty głosowe łączą rozpoznawanie mowy, model rozumujący i syntezę mowy. Każde przekazanie zwiększa opóźnienie i ryzyko utraty wyczucia czasu, kontekstu lub naturalnego rytmu rozmowy. To deweloperzy często muszą koordynować te etapy, w tym reagować na przerwanie, pauzę lub zmianę kierunku rozmowy.

GPT‑Live‑1 obsługuje słuchanie i mówienie w jednym modelu, upraszczając warstwę głosową. Może na bieżąco reagować na przerwania i potwierdzenia, jednocześnie delegując głębsze rozumowanie do backendu. Dzięki temu rozmowa może trwać, podczas gdy praca odbywa się w tle.

“W porównaniu z naszym rozwiązaniem kaskadowym GPT‑Live‑1 uprościł bazę kodu o 80% i pozwolił usunąć 23 tys. wierszy kodu. Umożliwiło to naturalne rozmowy z pacjentami w czasie rzeczywistym i pozwoliło naszemu zespołowi skupić się na ulepszaniu całego procesu — od rezerwacji wizyty po korzystanie z opieki medycznej.”
— Tony Stoyanov, współzałożyciel i dyrektor ds. technologii

Deweloperzy wybierają modele, narzędzia i otoczenie operacyjne agenta obsługujące rozmowę. Mogą na przykład połączyć GPT‑Live‑1 z modelem takim jak Luna do licznych zadań, takich jak planowanie terminów czy aktualizowanie zamówień, a model taki jak Astra wykorzystać do złożonych spraw klientów wymagających rozumowania. Ta elastyczność pozwala deweloperom dopasować głębokość rozumowania, szybkość i koszt do każdego zadania.

GPT‑Live‑1 natywnie udostępnia transkrypcje ASR i tekst odpowiedzi. Zapewnia również bardzo dobre rozumienie ciągów alfanumerycznych i umożliwia preferencyjne traktowanie słów kluczowych. Choć GPT‑Live‑1 nie jest modelem działającym w turach, natywnie obsługuje wykrywanie tur, dzięki czemu deweloperzy mogą nadal tworzyć rozwiązania oparte na jednoznacznych granicach tur.

Pomiar przewagi pełnego dupleksu

W naszych testach GPT‑Live‑1 poprawia wynik w Full Duplex Bench o 30 punktów procentowych względem GPT‑Realtime‑2.1, znacznie skracając opóźnienie podczas wymiany tur i poprawiając interaktywność. W połączeniu z GPT–6 Astra przy średnim nakładzie na rozumowanie zajmuje również 1. miejsce w Tau3, który mierzy pionierską inteligencję agentów głosowych w kompleksowych zadaniach.

Ocenia głosowe zadania obsługi klienta w dziedzinach lotnictwa, handlu detalicznego i telekomunikacji. Pass@1 mierzy skuteczność wykonania zadań; w wyniku głównym każda dziedzina ma taką samą wagę.


* Backend GPT Live: Astra (średni).

Ocenia głosową obsługę bankową z wykorzystaniem wyszukiwania wiedzy i narzędzi do obsługi konta. Pass@1 to odsetek spośród 97 zadań banking_knowledge ukończonych pomyślnie.


* Backend GPT Live: Astra (średni).

Ocenia obsługę pauz, zabieranie głosu na zmianę, przerywanie i sygnały podtrzymujące rozmowę.

Testuje reakcje na mowę w tle, mowę skierowaną do innej osoby, sygnały zwrotne słuchacza i przerwania.

Mierzy, jak szybko agent zaczyna odpowiadać po zakończeniu wypowiedzi użytkownika.

Testuje korzystanie z narzędzi na podstawie wypowiadanych próśb zawierających naturalne pauzy, wahania i autopoprawki. Pass@1 ocenia sekwencję wywołań narzędzi.


* Backend GPT Live: Terra (niski).

Ocenia mówioną odpowiedź na żądania wymagające użycia narzędzi, zawierające pauzy, wahania i autopoprawki. Ocenia, na ile dobrze odpowiedź odpowiada intencji referencyjnej.


* Backend GPT Live: Terra (niski).

Co mówią klienci

1 z 4
“Dodanie GPT‑Live‑1 do Yelp Host i Hatch usprawniło zabieranie głosu na zmianę i zwiększyło dokładność w porównaniu z naszą tradycyjną architekturą głosową. Gdy Yelp Host używa GPT‑Live‑1 do odbierania połączeń dotyczących na przykład rezerwacji i zamówień jedzenia, obserwujemy znaczącą poprawę wskaźników obsługi połączeń. Dzwoniący wypowiadają też pełniejsze, bardziej naturalne zdania, co pokazuje nam, że doświadczenie po drugiej stronie telefonu rzeczywiście jest inne.”
— Alex Levy, dyrektor ds. technologii

Nowe opcje głosów

Deweloperzy potrzebują głosów, które pasują do ich produktów i brzmią naturalnie dla użytkowników. W GPT‑Live‑1 rozszerzamy niewielki zestaw głosów czasu rzeczywistego o większy wybór akcentów, dialektów i języków, dając deweloperom większy wpływ na brzmienie ich asystentów.

Posłuchaj nowych głosów

W nadchodzących miesiącach będziemy nadal rozszerzać wybór głosów i dostępność języków.

Ceny i dostępność

GPT‑Live‑1 jest już dostępny w API⁠(otwiera nowe okno) w cenie 0,05 USD za minutę korzystania z głosowej warstwy front-endu. Połącz go z modelem backendowym i otoczeniem operacyjnym agenta, które pasują do Twojego produktu, a następnie zbuduj skalowalne środowisko głosowe dostosowane do wykonywanych zadań.

Łączenie GPT-Live-1 z Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Łączenie GPT-Live-1 z Codex. Ten fragment pokazuje, jak aplikacja przekazuje kontekst rozmowy do Codex i zwraca jego odpowiedź do GPT-Live-1. Pominięto konfigurację połączenia i obsługę delegowania.

Aby uzyskać dostęp do niestandardowych głosów, skontaktuj się z działem sprzedaży i dowiedz się więcej o kryteriach kwalifikowalności oraz procesie składania wniosków.

Innym sposobem tworzenia procesów głosowych w oparciu o GPT‑Live‑1 jest OpenAI Presence, które wykorzystuje model do obsługi interakcji głosowych w czasie rzeczywistym. Presence pomaga przedsiębiorstwom wdrażać zaufane agenty AI, potrafiące odpowiadać na pytania, rozwiązywać problemy, korzystać z systemów firmowych, podejmować zatwierdzone działania i w razie potrzeby przekazywać zadania ludziom. Aby dowiedzieć się więcej, skontaktuj się z opiekunem konta OpenAI.

Autorzy

OpenAI