Preskočite na glavno vsebino
OpenAI

10. september 2026

IzdelekIzdaja

Predstavljamo GPT‑Live‑1 v API-ju

GPT‑Live‑1 prinaša naravne obojesmerne pogovore iz ChatGPT v API—zdaj z boljšim sledenjem navodilom in delegiranjem, prilagodljivo osebnostjo, telefonijo, zanesljivostjo dolgih sej in tihim upravljanjem konteksta.

Nalaganje …

[OZNAKA MESTA: Datum objave bo potrjen naknadno.]

[OZNAKA MESTA: Videopričevanje podjetja Yelp—končni videoposnetek, sličica, podnapisi in prepis še niso pripravljeni.]

Danes GPT‑Live‑1 uvajamo v API, s čimer razvijalcem omogočamo, da zmogljiv glasovni model v svojih aplikacijah združijo s prelomno inteligenco. GPT‑Live‑1, prvič predstavljen v ChatGPT, lahko hkrati posluša in govori ter lahko, kot smo videli pri Codex in ChatGPT Work(odpre se v novem oknu), poglobljeno sklepanje in dejanja prenese na modele in orodja, s katerimi je povezan.

Pri izdaji GPT‑Live za API smo se osredotočili na nove zmogljivosti, ki razvijalcem omogočajo, da glasovne izkušnje prilagodijo uporabnikom, delovnim tokovom in ciljem. Aplikacija za učenje jezikov Speak je denimo v zgodnjih vrednotenjih ugotovila, da je GPT‑Live‑1 v primerjavi s prejšnjimi sistemi izmeničnega govora za skoraj 80 % zmanjšal število prekinitev med premori za razmislek—učenci imajo tako več časa, da poiščejo prave besede, preden se oglasi učitelj.

Izdaja za API prinaša:

  • Obravnava prekinitev: En sam model skupaj obdeluje dohodni in odhodni zvok ter se tako izogne zakasnitvam in nezanesljivim predajam verižnih arhitektur STT–LLM–TTS.

  • Orkestracija agentov: Zanesljiveje sledi večstopenjskim navodilom, izvaja klice orodij po meri ter poglobljeno sklepanje ali dejanja prenese na zaledni model oziroma ogrodje agenta, ki ga izbere razvijalec.

  • Glasovi po meri: Dodaja [XX—število še ni določeno] novih glasov po meri v [YY—jeziki še niso določeni] jezikih, kar blagovnim znamkam pomaga ustvarjati naravne in prepoznavne glasovne izkušnje v različnih jezikih in narečjih.

  • Prilagodljivost osebnosti: Razvijalcem omogoča, da s sistemskim pozivom oblikujejo ton, tempo in pogovorni slog agenta.

  • Tiho upravljanje konteksta & hrupa v ozadju: Bolje obravnava hrup v ozadju in tišino, ne da bi prekinjal pogovor ali vsak korak opisoval na glas.

  • Prilagodljiva inteligenca: Razvijalcem omogoča izbiro poljubnega zalednega modela ali ogrodja agenta, ki ustreza njihovemu delovnemu toku.

  • Zanesljivost dolgih sej: Izboljšuje ohranjanje konteksta in kakovost pogovora med daljšimi interakcijami.

  • Podpora telefoniji: Omogoča uvedbo obojesmernih glasovnih agentov za telefonske klice, od rezervacij v restavracijah do podpore strankam.

Začasni osnutek glasovne predstavitve z valovno obliko in časovnikom seje; na izvorni grafiki še vedno piše GPT-Realtime-2.

[OZNAKA MESTA: Interaktivna glasovna predstavitev—prikazan je izvorni osnutek; končna izkušnja GPT‑Live‑1 še ni pripravljena.]

Onkraj verižnih glasovnih sistemov: pogovori, ki jim ni treba čakati na vrsto

Običajni glasovni agenti povezujejo pretvorbo govora v besedilo, model sklepanja in pretvorbo besedila v govor. Vsaka predaja poveča zakasnitev in možnost izgube pravega trenutka, konteksta ali naravnega ritma pogovora. Usklajevanje teh faz pogosto ostane razvijalcem, vključno z odzivom na prekinitve, premore ali spremembe smeri pogovora.

GPT‑Live‑1 poslušanje in govor združuje v enem modelu ter tako poenostavi glasovno plast v živo. Na prekinitve in potrditve se lahko odzove sproti, poglobljeno sklepanje pa prenese v zaledje. Tako se lahko pogovor nadaljuje, medtem ko delo poteka v ozadju.

GPT‑Live‑1 je v primerjavi z našo kaskadno rešitvijo poenostavil našo kodno zbirko za 80 % in odpravil 23.000 vrstic kode. To je omogočilo naravne pogovore s pacienti v realnem času & naši ekipi dalo več časa za izboljšanje izkušnje od rezervacije termina do usmerjanja po zdravstveni oskrbi.
—Tony Stoyanov, soustanovitelj & glavni tehnološki direktor, EliseAI

Razvijalci izberejo modele, orodja in ogrodje agenta v ozadju pogovora. GPT‑Live‑1 lahko na primer združijo z modelom Luna za množična opravila, kot so načrtovanje terminov ali obvestila o naročilih, model Astra pa uporabijo za zapletene težave strank, ki zahtevajo sklepanje. Ta prilagodljivost razvijalcem omogoča, da vsakemu opravilu prilagodijo globino sklepanja, hitrost in stroške.

GPT‑Llive‑1 izvorno zagotavlja prepise ASR in besedilo odgovorov. Ponuja tudi dobro razumevanje črk in številk ter podpira prednostno obravnavo ključnih besed. Čeprav GPT‑live ni model izmeničnega govora, izvorno podpira zaznavanje izmenjav, zato lahko razvijalci še naprej gradijo na jasno določenih mejah posameznih izmenjav.

[OZNAKA MESTA: Vzporedna zvočna primerjava GPT‑Live‑1 in kaskadnega glasovnega sistema—zvočne datoteke in prepisi še niso pripravljeni.]

Merjenje prednosti polnega dupleksa

V naših vrednotenjih je GPT‑Live‑1 skupaj z GPT‑6 Astra pri srednji ravni sklepanja zasedel 1. mesto na preizkusu Tau3, ki meri prelomno inteligenco glasovnih agentov pri opravilih od začetka do konca, in 1. mesto na preizkusu Full Duplex Bench, ki ocenjuje interaktivnost, zakasnitev pri izmenjavi govora, klicanje orodij in kakovost odgovorov.

Izvorna grafika primerjalnega preizkusa, ki modele GPT-Live-1 primerja z modeli GPT-Realtime glede inteligence Tau3, interaktivnosti, zakasnitve pri izmenjavi govora, klicanja orodij in kakovosti odgovorov.

Kaj pravijo stranke

1 od 4
Z vključitvijo GPT‑Live‑1 v Yelp Host in Hatch smo v primerjavi z običajno glasovno arhitekturo izboljšali izmenjavo govora in natančnost. Ko Yelp Host uporablja GPT‑Live za sprejemanje klicev, denimo za rezervacije in naročila hrane, opažamo občutno boljšo uspešnost obravnave klicev. Klicatelji govorijo tudi v celovitejših in bolj naravnih stavkih, kar kaže, da je izkušnja na drugi strani telefona resnično drugačna.
—Alex Levy, glavni tehnološki direktor, Yelp

Nove glasovne možnosti

Razvijalci potrebujejo glasove, ki ustrezajo njihovemu izdelku in uporabnikom zvenijo naravno. Z GPT‑Live‑1 majhen nabor glasov v realnem času širimo z večjo izbiro naglasov, narečij in jezikov, zato imajo razvijalci več možnosti pri izbiri glasu svojih pomočnikov.

  • Quartz—avstralska angleščina, ženski, ustvarjen

  • Ripple—avstralska angleščina, moški, naraven

  • Vesper—britanska angleščina, moški, naraven

  • Willow—irska angleščina, ženski, naraven

  • Stone—irska angleščina, moški, naraven

  • Gleam—severnoameriška angleščina, ženski, naraven

  • Meridian—severnoameriška angleščina, moški, naraven

  • Bossa—brazilska portugalščina, ženski, naraven

  • Tempo—brazilska portugalščina, moški, naraven

  • Aster—indijska angleščina, ženski, ustvarjen

  • Beacon—filipinska angleščina, moški, ustvarjen

  • Delta—angleščina juga ZDA, ženski, ustvarjen

  • Cinder—angleščina juga ZDA, moški, ustvarjen

[OZNAKA MESTA: Izbirnik glasov s 3–5 ponavljajočimi se vzorčnimi stavki za vsak glas—zvočni vzorci in interaktivna izkušnja še niso pripravljeni.]

V prihodnjih mesecih bomo še naprej širili izbiro glasov in razpoložljivost jezikov.

Cene & razpoložljivost

GPT‑Live‑1 je od danes na voljo v API-ju po ceni 0,05 USD na minuto za čelno glasovno plast. Združite ga z zalednim modelom in ogrodjem agenta, ki ustrezata vašemu izdelku, nato pa ustvarite glasovno izkušnjo, ki se lahko širi glede na zahtevnost dela.

Za dostop do glasov po meri se obrnite na prodajno ekipo ter izvedite več o pogojih in postopku oddaje zahteve.

GPT‑Live‑1 lahko začnete hitreje uporabljati z rešitvijo Presence, ki podpira glasovne in klepetalne izkušnje v realnem času, kot so podpora strankam, odhodna prodaja in zelo tvegani notranji delovni tokovi. Za več informacij se obrnite na svojega skrbnika računa pri OpenAI.

Avtorji

OpenAI