Wprowadzamy GPT‑Live‑1 do API, oferując deweloperom zaawansowany, naturalnie brzmiący model głosowy do tworzenia aplikacji obsługujących komunikację głosową i firmowych przepływów pracy. Po raz pierwszy zaprezentowany w ChatGPT, GPT‑Live‑1 potrafi jednocześnie słuchać i mówić, a także, jak pokazano w Codex i ChatGPT Work(otwiera nowe okno), delegować głębsze rozumowanie i działania modelom oraz narzędziom, z którymi jest połączony.
W wydaniu GPT‑Live‑1 dla API skupiliśmy się na nowych możliwościach, dzięki którym deweloperzy mogą kierować interakcjami głosowymi i dostosowywać je do użytkowników, procesów i celów. Kluczowa zaleta GPT‑Live‑1, czyli płynna obsługa przerwań, już przynosi korzyści biznesowe: we wczesnych testach Speak ustalił, że GPT‑Live‑1 dawał uczniom więcej czasu na namysł przed odpowiedzią lektora językowego, ograniczając liczbę przerwań o niemal 80% w porównaniu z wcześniejszymi systemami turowymi.
Najważniejsze zalety GPT‑Live‑1 w API:
Obsługa przerwań: usprawnia obsługę przerwań dzięki jednemu modelowi, który jednocześnie analizuje dźwięk przychodzący i wychodzący, unikając opóźnień i zawodnych przełączeń typowych dla łańcuchowych architektur STT–LLM–TTS.
Delegowanie rozumowania i wywołań narzędzi: GPT‑Live‑1 może delegować rozumowanie i wywołania narzędzi do backendowego modelu tekstowego, takiego jak GPT‑6 Astra, lub modelu innej firmy.
Ton, tempo i styl: Pozwala deweloperom kształtować ton, tempo i styl konwersacji agenta za pomocą polecenia systemowego.
Ciche zarządzanie kontekstem i hałas w tle: Model lepiej radzi sobie z hałasem w tle i ciszą, nie przerywając rozmowy ani nie relacjonując na głos każdego kroku.
Niezawodność długich sesji: Lepsze zachowanie kontekstu i wyższa jakość rozmowy podczas długotrwałych interakcji.
Obsługę telefonii: Umożliwia wdrażanie agentów głosowych działających w pełnym dupleksie podczas połączeń telefonicznych — od rezerwacji stolików po obsługę klienta.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
To demo jest ograniczone czasowo. Korzystając z niego, akceptujesz Warunki OpenAI i przyjmujesz do wiadomości nasze Zasady prywatności.
Tradycyjne agenty głosowe łączą rozpoznawanie mowy, model rozumujący i syntezę mowy. Każde przekazanie zwiększa opóźnienie i ryzyko utraty wyczucia czasu, kontekstu lub naturalnego rytmu rozmowy. To deweloperzy często muszą koordynować te etapy, w tym reagować na przerwanie, pauzę lub zmianę kierunku rozmowy.
GPT‑Live‑1 obsługuje słuchanie i mówienie w jednym modelu, upraszczając warstwę głosową. Może na bieżąco reagować na przerwania i potwierdzenia, jednocześnie delegując głębsze rozumowanie do backendu. Dzięki temu rozmowa może trwać, podczas gdy praca odbywa się w tle.
Deweloperzy wybierają modele, narzędzia i otoczenie operacyjne agenta obsługujące rozmowę. Mogą na przykład połączyć GPT‑Live‑1 z modelem takim jak Luna do licznych zadań, takich jak planowanie terminów czy aktualizowanie zamówień, a model taki jak Astra wykorzystać do złożonych spraw klientów wymagających rozumowania. Ta elastyczność pozwala deweloperom dopasować głębokość rozumowania, szybkość i koszt do każdego zadania.
GPT‑Live‑1 natywnie udostępnia transkrypcje ASR i tekst odpowiedzi. Zapewnia również bardzo dobre rozumienie ciągów alfanumerycznych i umożliwia preferencyjne traktowanie słów kluczowych. Choć GPT‑Live‑1 nie jest modelem działającym w turach, natywnie obsługuje wykrywanie tur, dzięki czemu deweloperzy mogą nadal tworzyć rozwiązania oparte na jednoznacznych granicach tur.
W naszych testach GPT‑Live‑1 poprawia wynik w Full Duplex Bench o 30 punktów procentowych względem GPT‑Realtime‑2.1, znacznie skracając opóźnienie podczas wymiany tur i poprawiając interaktywność. W połączeniu z GPT–6 Astra przy średnim nakładzie na rozumowanie zajmuje również 1. miejsce w Tau3, który mierzy pionierską inteligencję agentów głosowych w kompleksowych zadaniach.
Ocenia głosowe zadania obsługi klienta w dziedzinach lotnictwa, handlu detalicznego i telekomunikacji. Pass@1 mierzy skuteczność wykonania zadań; w wyniku głównym każda dziedzina ma taką samą wagę.
* Backend GPT Live: Astra (średni).
Ocenia głosową obsługę bankową z wykorzystaniem wyszukiwania wiedzy i narzędzi do obsługi konta. Pass@1 to odsetek spośród 97 zadań banking_knowledge ukończonych pomyślnie.
* Backend GPT Live: Astra (średni).
Ocenia obsługę pauz, zabieranie głosu na zmianę, przerywanie i sygnały podtrzymujące rozmowę.
Testuje reakcje na mowę w tle, mowę skierowaną do innej osoby, sygnały zwrotne słuchacza i przerwania.
Mierzy, jak szybko agent zaczyna odpowiadać po zakończeniu wypowiedzi użytkownika.
Testuje korzystanie z narzędzi na podstawie wypowiadanych próśb zawierających naturalne pauzy, wahania i autopoprawki. Pass@1 ocenia sekwencję wywołań narzędzi.
* Backend GPT Live: Terra (niski).
Ocenia mówioną odpowiedź na żądania wymagające użycia narzędzi, zawierające pauzy, wahania i autopoprawki. Ocenia, na ile dobrze odpowiedź odpowiada intencji referencyjnej.
* Backend GPT Live: Terra (niski).
Deweloperzy potrzebują głosów, które pasują do ich produktów i brzmią naturalnie dla użytkowników. W GPT‑Live‑1 rozszerzamy niewielki zestaw głosów czasu rzeczywistego o większy wybór akcentów, dialektów i języków, dając deweloperom większy wpływ na brzmienie ich asystentów.
W nadchodzących miesiącach będziemy nadal rozszerzać wybór głosów i dostępność języków.
GPT‑Live‑1 jest już dostępny w API(otwiera nowe okno) w cenie 0,05 USD za minutę korzystania z głosowej warstwy front-endu. Połącz go z modelem backendowym i otoczeniem operacyjnym agenta, które pasują do Twojego produktu, a następnie zbuduj skalowalne środowisko głosowe dostosowane do wykonywanych zadań.
Aby uzyskać dostęp do niestandardowych głosów, skontaktuj się z działem sprzedaży i dowiedz się więcej o kryteriach kwalifikowalności oraz procesie składania wniosków.
Innym sposobem tworzenia procesów głosowych w oparciu o GPT‑Live‑1 jest OpenAI Presence, które wykorzystuje model do obsługi interakcji głosowych w czasie rzeczywistym. Presence pomaga przedsiębiorstwom wdrażać zaufane agenty AI, potrafiące odpowiadać na pytania, rozwiązywać problemy, korzystać z systemów firmowych, podejmować zatwierdzone działania i w razie potrzeby przekazywać zadania ludziom. Aby dowiedzieć się więcej, skontaktuj się z opiekunem konta OpenAI.

