Langkau ke kandungan utama
OpenAI

10 September 2026

ProdukKeluaran

Bina pengalaman suara semula jadi dengan GPT‑Live‑1 dalam API

GPT‑Live‑1 membawa perbualan semula jadi dupleks penuh ChatGPT ke API, dengan lebih banyak kawalan terhadap cara ejen suara bercakap dan bertindak.

Memuat…

Kami melancarkan GPT‑Live‑1 dalam API, memberikan pembangun model suara yang berkuasa dan semula jadi untuk membina aplikasi berdaya suara serta aliran kerja perniagaan. Pertama kali diperkenalkan dalam ChatGPT, GPT‑Live‑1 mampu mendengar dan bercakap pada masa yang sama serta, seperti yang ditunjukkan melalui Codex dan ChatGPT Work⁠(dibuka dalam tetingkap baru), boleh menyerahkan penaakulan dan tindakan yang lebih mendalam kepada model serta alat yang digandingkan dengannya.

Untuk pelancaran GPT‑Live‑1 dalam API, kami menumpukan pada keupayaan baharu yang membolehkan pembangun mengawal dan menyesuaikan pengalaman suara mengikut pengguna, aliran kerja dan matlamat mereka. Salah satu kekuatan teras GPT‑Live‑1, iaitu pengendalian gangguan yang lancar, sudah memberikan impak perniagaan: dalam penilaian awal, Speak mendapati bahawa GPT‑Live‑1 memberi pelajar lebih banyak masa untuk berfikir sebelum tutor bahasa memberikan respons, sekali gus mengurangkan gangguan sebanyak hampir 80% berbanding sistem berasaskan giliran terdahulu.

Kekuatan utama GPT‑Live‑1 dalam API:

  • Pengendalian gangguan: Memperbaik pengendalian gangguan melalui satu model yang menaakul audio masuk dan keluar secara serentak, sekali gus mengelakkan kependaman dan penyerahan rapuh dalam seni bina STT–LLM–TTS berantai.

  • Penugasan penaakulan & panggilan alat: GPT‑Live‑1 boleh menyerahkan penaakulan dan panggilan alat kepada model teks bahagian belakang seperti GPT‑6 Astra atau model pihak ketiga.

  • Nada, rentak dan gaya: Membolehkan pembangun membentuk nada, rentak dan gaya perbualan ejen melalui prom sistem.

  • Pengurusan konteks senyap & hingar latar: Mengendalikan hingar latar dan kesenyapan dengan lebih baik tanpa mengganggu perbualan atau menyebut setiap langkah dengan kuat.

  • Kebolehpercayaan sesi panjang: Meningkatkan pengekalan konteks dan kualiti perbualan sepanjang interaksi yang berlanjutan.

  • Sokongan telefoni: Membolehkan penggunaan ejen suara dupleks penuh untuk panggilan telefon, daripada tempahan restoran hingga sokongan pelanggan.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Demo ini mempunyai had masa. Dengan menggunakannya, anda bersetuju dengan Terma OpenAI dan mengakui Dasar Privasi kami.

Permudahkan seni bina ejen suara anda dan kurangkan kependaman suara

Ejen suara tradisional menggabungkan pertuturan kepada teks, model penaakulan dan teks kepada pertuturan. Setiap penyerahan menambah kependaman dan meningkatkan risiko kehilangan pemasaan, konteks atau rentak semula jadi perbualan. Pembangun sering perlu menyelaraskan sendiri semua peringkat tersebut, termasuk perkara yang berlaku apabila seseorang mencelah, berhenti sejenak atau menukar haluan.

GPT‑Live‑1 mengendalikan pendengaran dan pertuturan dalam satu model, sekali gus memudahkan lapisan suara. Ia boleh memberikan respons kepada gangguan dan pengakuan semasa ia berlaku, sambil menyerahkan penaakulan yang lebih mendalam kepada bahagian belakang. Ini membolehkan perbualan diteruskan sementara kerja dilaksanakan di latar belakang.

“Berbanding binaan lata kami, GPT‑Live‑1 memudahkan pangkalan kod kami sebanyak 80% dan menghapuskan 23 ribu baris kod. Ini membolehkan perbualan pesakit masa nyata yang semula jadi & memberi pasukan kami ruang untuk menambah baik pengalaman, daripada menempah janji temu hingga mendapatkan rawatan.”
—Tony Stoyanov, Pengasas Bersama & Ketua Pegawai Teknologi, EliseAI

Pembangun memilih model, alat dan harnes ejen di sebalik perbualan. Contohnya, mereka boleh menggandingkan GPT‑Live‑1 dengan model seperti Luna untuk tugasan berjumlah tinggi seperti penjadualan atau kemas kini pesanan, dan menggunakan model seperti Astra untuk isu pelanggan rumit yang memerlukan penaakulan. Fleksibiliti itu membolehkan pembangun memadankan kedalaman penaakulan, kelajuan dan kos dengan setiap tugasan.

GPT‑Live‑1 menyediakan transkrip ASR dan teks respons secara natif. Ia juga menawarkan pemahaman abjad angka yang kukuh dan menyokong pemberatan kata kunci. Walaupun GPT‑Live‑1 bukan model berasaskan giliran, ia menyokong pengesanan giliran secara natif, jadi pembangun boleh terus membina berdasarkan sempadan giliran yang jelas.

Mengukur kelebihan dupleks penuh

Dalam semua penilaian kami, GPT‑Live‑1 meningkatkan prestasi Full Duplex Bench sebanyak 30 mata peratusan berbanding GPT‑Realtime‑2.1, dengan peningkatan besar dalam kependaman pertukaran giliran dan tingkah laku interaktif. Apabila digandingkan dengan GPT‑6 Astra pada tahap usaha penaakulan sederhana, ia juga menduduki tempat pertama pada Tau3, yang mengukur kecerdasan ejen suara perbatasan dalam tugas hujung ke hujung.

Menilai tugas khidmat pelanggan secara lisan dalam domain penerbangan, runcit dan telekomunikasi. Pass@1 mengukur kejayaan tugas; tajuk utama memberikan wajaran yang sama kepada setiap domain.


* Bahagian belakang GPT Live: Astra (sederhana).

Menilai sokongan perbankan pertuturan dengan dapatan semula pengetahuan dan alat akaun. Pass@1 ialah pecahan daripada 97 tugas banking_knowledge yang berjaya diselesaikan.


* Bahagian belakang GPT Live: Astra (sederhana).

Menilai pengendalian jeda, giliran bercakap dalam perbualan, gangguan dan saluran balas.

Menguji reaksi terhadap pertuturan latar belakang, pertuturan kepada orang lain, respons ringkas pendengar, dan gangguan.

Mengukur seberapa cepat ejen mula memberikan respons selepas pengguna menamatkan satu giliran.

Menguji penggunaan alat berdasarkan permintaan lisan yang mengandungi jeda semula jadi, keraguan dan pembetulan kendiri. Pass@1 menilai urutan panggilan alat.


* Bahagian belakang GPT Live: Terra (rendah).

Menilai jawapan pertuturan kepada permintaan yang menggunakan alat dan mengandungi jeda, keraguan, serta pembetulan kendiri. Memberikan skor sejauh mana jawapan sepadan dengan niat rujukan.


* Bahagian belakang GPT Live: Terra (rendah).

Pendapat pelanggan

1 daripada 4
“Menambah GPT‑Live‑1 pada Yelp Host dan Hatch meningkatkan pengambilan giliran serta ketepatan berbanding seni bina suara tradisional kami. Apabila Yelp Host menggunakan GPT‑Live‑1 untuk menjawab panggilan seperti tempahan dan pesanan makanan, kami melihat peningkatan ketara dalam kadar pengendalian panggilan. Pemanggil juga bercakap dalam ayat yang lebih lengkap dan semula jadi, menunjukkan bahawa pengalaman di hujung talian benar-benar terasa berbeza.”
—Alex Levy, Ketua Pegawai Teknologi

Pilihan suara baharu

Pembangun memerlukan suara yang sesuai dengan produk mereka dan kedengaran semula jadi kepada penggunanya. Dengan GPT‑Live‑1, kami memperluas pilihan daripada sebilangan kecil suara masa nyata kepada pelbagai loghat, dialek dan bahasa, sekali gus memberi pembangun lebih banyak pilihan untuk suara pembantu mereka.

Dengar suara baharu

Kami akan terus menambah pilihan suara dan ketersediaan bahasa dalam beberapa bulan akan datang.

Harga & Ketersediaan

GPT‑Live‑1 kini tersedia dalam API hari ini⁠(dibuka dalam tetingkap baru) pada harga $0.05 seminit untuk lapisan suara bahagian hadapan. Gandingkannya dengan model bahagian belakang dan abah-abah ejen yang sesuai dengan produk anda, kemudian bina pengalaman suara yang boleh diskalakan mengikut tugasan yang perlu dilaksanakan.

Menyambung GPT-Live-1 ke Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Menyambungkan GPT-Live-1 ke Codex. Petikan ini menunjukkan cara aplikasi menghantar konteks perbualan kepada Codex dan mengembalikan jawapannya kepada GPT-Live-1. Persediaan sambungan dan pengendalian delegasi tidak disertakan.

Untuk mengakses suara tersuai, hubungi bahagian jualan bagi mengetahui lebih lanjut tentang kelayakan dan proses permohonan.

Satu lagi cara untuk membina aliran kerja suara menggunakan GPT‑Live‑1 ialah dengan OpenAI Presence, yang menggunakan model untuk menggerakkan interaksi suara masa nyata. Presence membantu perusahaan melaksanakan ejen AI yang dipercayai untuk menjawab soalan, menyelesaikan isu, menggunakan sistem syarikat, mengambil tindakan yang diluluskan dan menyerahkan kepada manusia apabila perlu. Hubungi pengarah akaun OpenAI anda untuk mengetahui lebih lanjut.

Penulis

OpenAI