Lumaktaw sa pangunahing content
OpenAI

Setyembre 10, 2026

ProduktoPaglabas

Bumuo ng mas natural na karanasan sa boses sa GPT‑Live‑1 sa API

Dinadala ng GPT‑Live‑1 ang natural at full-duplex na mga pag-uusap ng ChatGPT sa API, na may higit na kontrol sa paraan ng pagsasalita at pagkilos ng mga voice agent.

Naglo-load…

Inilulunsad namin ang GPT‑Live‑1 sa API, na nagbibigay sa mga developer ng makapangyarihan at natural na modelo ng boses para sa pagbuo ng mga app na may boses at mga workflow sa negosyo. Unang ipinakilala sa ChatGPT, ang GPT‑Live‑1 ay may kakayahang makinig at magsalita nang sabay, at, gaya ng nakikita sa Codex at ChatGPT Work⁠(magbubukas sa bagong window), maaaring magtalaga ng mas malalim na pangangatwiran at mga aksyon sa mga modelo at tool na ipinares dito.

Para sa paglabas ng API ng GPT‑Live‑1, nakatuon kami sa mga bagong kakayahang nagbibigay-daan sa mga developer na gabayan at i-customize ang mga karanasan sa boses para sa kanilang mga user, workflow, at layunin. Isa sa mga pangunahing lakas ng GPT‑Live‑1, maayos na pangangasiwa sa mga pagputol ay nagbibigay na ng mga positibong resulta sa negosyo: sa mga paunang pagsusuri, napag-alaman ng Speak na binigyan ng GPT‑Live‑1 ang mga learner ng mas maraming oras para makapag-isip bago tumugon ang language tutor, kaya nabawasan nang halos 80% ang mga pagputol sa pagsasalita kumpara sa mga naunang turn-based system.

Mga pangunahing lakas ng GPT‑Live‑1 sa API:

  • Pangangasiwa ng mga interruption: Pinapahusay ang pangangasiwa ng mga interruption sa pamamagitan ng modelo na sabay na nagsusuri sa papasok at papalabas na audio, kaya iniiwasan ang latency at hindi matatag na paglilipat sa mga sunod-sunod na arkitekturang STT–LLM–TTS.

  • Pagdelegasyon ng Pangangatwiran at Tool Call: Maaaring i-delegate ng GPT‑Live‑1 ang pangangatwiran at tool call sa backend text model tulad ng GPT‑6 Astra o ng third-party model.

  • Tono, pacing, at istilo: Nagbibigay-daan sa mga developer na hubugin ang tono, pacing, at istilo ng pakikipag-usap ng agent sa pamamagitan ng system prompt.

  • Tahimik na pamamahala ng konteksto & ingay sa background: Mas mahusay na pinangangasiwaan ang ingay sa background at katahimikan nang hindi naaantala ang pag-uusap o isinasalaysay nang malakas ang bawat hakbang.

  • Pagiging maaasahan sa mahahabang session: Pinapahusay ang pagpapanatili ng konteksto at kalidad ng pag-uusap sa kabuuan ng mga pinalawig na pakikipag-ugnayan.

  • Suporta sa telepono: Nagbibigay-daan sa pag-deploy ng mga full-duplex voice agent para sa mga tawag sa telepono, mula sa mga pagreserba sa restaurant hanggang sa suporta sa customer.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

May limitasyon sa oras ang demo na ito. Sa paggamit nito, sumasang-ayon ka sa Mga Tuntunin ng OpenAI at kinikilala mo ang aming Patakaran sa Pribasiya.

Pasimplehin ang architecture ng iyong voice agent at bawasan ang voice latency

Pinagsasama-sama ng mga tradisyunal na voice agent ang speech-to-text, ang nangangatwirang modelo, at text-to-speech. Nagdaragdag ng latency ang bawat handoff at lumilikha ng mas maraming pagkakataong mawala ang timing, konteksto, o natural na ritmo ng pag-uusap. Kadalasan, ang mga developer ang naiiwang nagkokoordina sa mga yugtong iyon, kabilang ang nangyayari kapag may sumabad, huminto, o nagbago ng direksyon.

Pinangangasiwaan ng GPT‑Live‑1 ang pakikinig at pagsasalita sa iisang modelo, na nagpapasimple sa voice layer. Nakakatugon ito sa mga pagsingit at pagkilala habang nangyayari ang mga ito, habang ipinapasa ang mas malalim na pangangatwiran sa back end. Dahil dito, nagpapatuloy ang pag-uusap habang nagaganap ang gawain sa background.

“Kumpara sa aming cascaded build, pinasimple ng GPT‑Live‑1 ang aming code base nang 80% at inalis ang 23K linya ng code. Nagbigay-daan ito sa natural at real-time na pag-uusap sa mga pasyente at nagbigay ng kalayaan sa aming team na pahusayin ang karanasan mula sa pag-book ng appointment hanggang sa pag-navigate sa pangangalaga.”
—Tony Stoyanov, Co-Founder & CTO

Pinipili ng mga developer ang mga modelo, tool, at agent harness sa likod ng usapan. Halimbawa, maaari nilang ipares ang GPT‑Live‑1 sa modelo tulad ng Luna para sa mga gawaing mataas ang volume gaya ng pag-iiskedyul o mga update sa order, at gumamit ng modelo tulad ng Astra para sa mga kumplikadong isyu ng customer na nangangailangan ng pangangatwiran. Ang kakayahang umangkop na iyon ay nagbibigay-daan sa mga developer na itugma ang lalim, bilis, at gastos ng pangangatwiran sa bawat gawain.

Ang GPT‑Live‑1 ay likas na nagbibigay ng mga transcript ng ASR at text ng tugon. Nag-aalok din ito ng mahusay na pag-unawa sa mga alphanumeric na character at sumusuporta sa keyword biasing. Bagama't hindi turn-based na modelo ang GPT‑Live‑1, likas nitong sinusuportahan ang pagtukoy ng turn, kaya maaaring magpatuloy ang mga developer sa pagbuo batay sa mga tahasang hangganan ng turn.

Pagsukat sa full-duplex na bentahe

Sa kabuuan ng aming mga pagsusuri, pinapahusay ng GPT‑Live‑1 ang performance ng Full Duplex Bench nang 30 porsyentong punto kumpara sa GPT‑Realtime‑2.1, na may malalaking pagpapabuti sa latency sa salitan ng pag-uusap at interaktibong gawi. Kapag ipinares sa GPT‑6 Astra sa medium na antas ng pangangatwiran, nasa #1 din ito sa Tau3, na sumusukat sa frontier na intelligence ng voice-agent sa mga end-to-end na gawain.

Sinusuri ang mga pasalitang gawain sa customer service sa mga domain ng airline, retail, at telecom. Sinusukat ng Pass@1 ang tagumpay ng gawain; nagbibigay ang headline ng pantay na timbang sa bawat domain.


* GPT Live na backend: Astra (medium).

Sinusuri ang pasalitang suporta sa pagbabangko gamit ang pagkuha ng kaalaman at mga tool para sa account. Ang Pass@1 ay ang praksyon ng 97 gawain sa banking_knowledge na matagumpay na nakumpleto.


* GPT Live na backend: Astra (medium).

Sinusuri ang pangangasiwa ng paghinto, pagliko ng usapan, mga pagkaantala, at mga backchannel.

Sinusubukan ang mga reaksyon sa pananalita sa background, pananalita sa ibang tao, mga backchannel ng tagapakinig, at mga pagkagambala.

Sinusukat kung gaano kabilis sinisimulan ng agent ang tugon nito pagkatapos matapos ng user ang isang turn.

Sinusubok ang paggamit ng tool mula sa mga pasalitang kahilingan na naglalaman ng mga natural na paghinto, pag-aalinlangan, at pagwawasto sa sarili. Sinusukat ng Pass@1 ang pagkakasunod-sunod ng tool call.


* GPT Live backend: Terra (mababa).

Sinusuri ang pasalitang sagot sa mga kahilingang gumagamit ng tool na may mga paghinto, pag-aalinlangan, at pagwawasto sa sarili. Binibigyan ng marka kung gaano kahusay na tumutugma ang sagot sa layunin ng sanggunian.


* GPT Live backend: Terra (mababa).

Ang sinasabi ng mga customer

1 sa 4
“Pinahusay ng pagdaragdag ng GPT‑Live‑1 sa Yelp Host at Hatch ang pagpapalitan ng pagsasalita at katumpakan kumpara sa aming tradisyonal na voice architecture. Kapag ginagamit ng Yelp Host ang GPT‑Live‑1 para sagutin ang mga tawag, gaya ng para sa mga reservation at order ng pagkain, nakikita namin ang mahahalagang pagpapabuti sa mga rate ng pangangasiwa ng tawag. Mas buo at mas natural na mga pangungusap din ang ginagamit ng mga tumatawag, na nagpapakita na ibang-iba ang pakiramdam sa kabilang linya ng telepono.”
—Alex Levy, Punong Opisyal ng Teknolohiya

Mga bagong opsyon sa boses

Kailangan ng mga developer ng mga boses na babagay sa kanilang produkto at natural pakinggan ng mga taong gumagamit nito. Sa GPT‑Live‑1, pinalalawak namin ang mga real-time voice mula sa iilang pagpipilian tungo sa mas malawak na seleksyon ng accent, diyalekto, at wika, para mas maraming pagpipilian ang mga developer sa tunog ng kanilang assistant.

Makinig sa mga bagong boses

Patuloy naming palalawakin ang mga opsyon sa boses at availability ng wika sa mga darating na buwan.

Pagpepresyo at availability

Available ang GPT‑Live‑1 sa API ngayon⁠(magbubukas sa bagong window) sa halagang $0.05 kada minuto para sa front-end na layer ng boses. I-pair ito sa backend model at agent harness na angkop sa iyong produkto, at bumuo ng voice experience na kayang mag-scale ayon sa workload nito.

Ikonekta ang GPT-Live-1 sa Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Pagkonekta ng GPT-Live-1 sa Codex. Ipinapakita ng siping ito kung paano ipinapasa ng isang application ang konteksto ng pag-uusap sa Codex at ibinabalik ang sagot nito sa GPT-Live-1. Hindi isinama ang pag-set up ng koneksyon at paghawak ng delegation.

Para sa access sa custom na boses, makipag-ugnayan sa sales para malaman pa ang tungkol sa pagiging kwalipikado at proseso ng paghiling.

Ang isa pang paraan para bumuo ng mga voice workflow na nakabatay sa GPT‑Live‑1 ay sa pamamagitan ng OpenAI Presence, na gumagamit ng modelo para paganahin ang mga real-time na interaksyon gamit ang boses. Tinutulungan ng Presence ang mga enterprise na mag-deploy ng mga mapagkakatiwalaang AI agent na kayang sumagot ng mga tanong, lumutas ng isyu, gumamit ng mga sistema ng kumpanya, gumawa ng mga aprubadong aksyon, at mag-escalate sa mga tao kapag kailangan. Makipag-ugnayan sa account director ng OpenAI mo para malaman ang higit pa.

May-akda

OpenAI