Langsung ke konten utama
OpenAI

10 September 2026

ProdukRilis

Bangun pengalaman suara yang lebih alami dengan GPT‑Live‑1 di API

GPT‑Live‑1 menghadirkan percakapan full-duplex alami ChatGPT ke API, dengan kontrol lebih besar atas cara agen suara berbicara dan bertindak.

Memuat…

Kami meluncurkan GPT‑Live‑1 melalui API, yang menghadirkan model suara alami dan tangguh bagi para pengembang untuk membangun aplikasi serta alur kerja bisnis berbasis suara. Pertama kali diperkenalkan di ChatGPT, GPT‑Live‑1 dapat mendengarkan dan berbicara secara bersamaan dan, seperti yang terlihat pada Codex dan ChatGPT Work⁠(terbuka di jendela baru), dapat melimpahkan tugas penalaran dan tindakan yang lebih mendalam kepada model dan alat yang dipasangkan dengannya.

Untuk peluncuran GPT‑Live‑1 di API, kami berfokus pada kemampuan baru yang memungkinkan pengembang mengarahkan dan menyesuaikan pengalaman suara berdasarkan pengguna, alur kerja, dan tujuan mereka. Salah satu keunggulan utama GPT‑Live‑1, penanganan interupsi yang lancar, telah memberikan dampak bisnis: dalam evaluasi awal, Speak mendapati bahwa GPT‑Live‑1 memberi lebih banyak waktu untuk berpikir sebelum tutor bahasa merespons kepada pelajar, sehingga mengurangi interupsi hingga hampir 80% dibandingkan sistem berbasis giliran sebelumnya.

Keunggulan utama GPT‑Live‑1 di API:

  • Penanganan interupsi: Meningkatkan penanganan interupsi melalui satu model yang menalar audio masuk dan keluar secara bersamaan, sehingga menghindari latensi dan serah terima yang tidak andal pada arsitektur STT–LLM–TTS berantai.

  • Delegasi penalaran & pemanggilan alat: GPT‑Live‑1 dapat mendelegasikan penalaran dan pemanggilan alat ke model teks backend seperti GPT‑6 Astra atau model pihak ketiga.

  • Nada, tempo, dan gaya: Memungkinkan pengembang membentuk nada, tempo, dan gaya percakapan agen melalui prompt sistem.

  • Pengelolaan konteks senyap & kebisingan latar: Menangani kebisingan latar dan keheningan dengan lebih baik tanpa menginterupsi percakapan atau mengucapkan setiap langkah.

  • Keandalan sesi panjang: Meningkatkan retensi konteks dan kualitas percakapan selama interaksi yang panjang.

  • Dukungan telepon: Memungkinkan penerapan agen suara full-duplex untuk panggilan telepon, mulai dari reservasi restoran hingga dukungan pelanggan.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Demo ini hanya tersedia untuk waktu terbatas. Dengan menggunakannya, Anda menyetujui Ketentuan Penggunaan OpenAI dan mengakui Kebijakan Privasi kami.

Sederhanakan arsitektur agen suara Anda dan kurangi latensi suara

Agen suara tradisional merangkai teknologi ucapan-ke-teks, model penalaran, dan teks-ke-ucapan. Setiap perpindahan menambah latensi dan memperbesar risiko hilangnya ketepatan waktu, konteks, atau ritme alami percakapan. Developer sering kali harus mengoordinasikan sendiri tahapan tersebut, termasuk menentukan apa yang terjadi saat seseorang menyela, berhenti sejenak, atau mengubah arah pembicaraan.

GPT‑Live‑1 menangani proses mendengarkan dan berbicara dalam satu model, sehingga menyederhanakan lapisan suara. Model ini dapat merespons interupsi dan tanda pemahaman saat terjadi, sembari melimpahkan tugas penalaran yang lebih mendalam ke backend. Dengan demikian, percakapan dapat terus berlanjut sementara pekerjaan berlangsung di latar belakang.

“Dibandingkan sistem berantai kami, GPT‑Live‑1 menyederhanakan basis kode kami hingga 80% dan menghapus 23 ribu baris kode. Hal ini memungkinkan percakapan pasien yang alami dan real-time serta membebaskan tim kami untuk meningkatkan pengalaman, mulai dari membuat janji temu hingga mengakses layanan perawatan.”
—Tony Stoyanov, Pendiri Bersama & CTO, EliseAI

Developer memilih model, alat, dan harness agen yang mendukung percakapan. Misalnya, mereka dapat memadukan GPT‑Live‑1 dengan model seperti Luna untuk tugas bervolume tinggi seperti penjadwalan atau pembaruan pesanan, serta menggunakan model seperti Astra untuk masalah pelanggan kompleks yang memerlukan penalaran. Fleksibilitas tersebut memungkinkan developer menyesuaikan kedalaman penalaran, kecepatan, dan biaya untuk setiap tugas.

GPT‑Live‑1 menyediakan transkrip ASR dan teks respons secara native. Model ini juga memiliki pemahaman alfanumerik yang kuat dan mendukung pembobotan kata kunci. Meskipun GPT‑Live‑1 bukan model berbasis giliran, model ini secara native mendukung deteksi giliran, sehingga pengembang tetap dapat membangun sistem berdasarkan batas giliran yang eksplisit.

Mengukur keunggulan full-duplex

Dalam berbagai evaluasi kami, GPT‑Live‑1 meningkatkan performa Full Duplex Bench sebesar 30 poin persentase dibandingkan GPT‑Realtime‑2.1, dengan peningkatan besar dalam latensi pergantian giliran dan perilaku interaktif. Dipasangkan dengan GPT‑6 Astra pada tingkat upaya penalaran sedang, model ini juga menempati peringkat #1 di Tau3, yang mengukur kecerdasan agen suara terdepan pada tugas menyeluruh.

Mengevaluasi tugas layanan pelanggan lisan di domain maskapai, ritel, dan telekomunikasi. Pass@1 mengukur keberhasilan tugas; judul utama memberikan bobot yang sama untuk setiap domain.


* Backend GPT Live: Astra (sedang).

Mengevaluasi dukungan perbankan lisan dengan pengambilan pengetahuan dan alat akun. Pass@1 adalah proporsi dari 97 tugas banking_knowledge yang berhasil diselesaikan.


* Backend GPT Live: Astra (sedang).

Mengevaluasi penanganan jeda, pergantian giliran dalam percakapan, interupsi, dan tanggapan singkat.

Menguji reaksi terhadap ucapan di latar belakang, ucapan kepada orang lain, respons singkat dari pendengar, dan interupsi.

Mengukur seberapa cepat agen memulai responsnya setelah pengguna menyelesaikan satu giliran.

Menguji penggunaan alat dari permintaan lisan yang mengandung jeda alami, keraguan, dan koreksi diri. Pass@1 menilai urutan pemanggilan alat.


* Backend GPT Live: Terra (rendah).

Mengevaluasi jawaban lisan untuk permintaan yang menggunakan alat dan mengandung jeda, keraguan, serta koreksi diri. Menilai seberapa baik jawaban tersebut sesuai dengan maksud referensi.


* Backend GPT Live: Terra (rendah).

Pendapat pelanggan

1 dari 4
“Penambahan GPT‑Live‑1 ke Yelp Host dan Hatch meningkatkan kemampuan pergantian giliran dan akurasi dibandingkan arsitektur suara tradisional kami. Saat Yelp Host menggunakan GPT‑Live‑1 untuk menjawab panggilan, seperti reservasi dan pesanan makanan, kami melihat peningkatan yang berarti pada tingkat penanganan panggilan. Penelepon juga berbicara dengan kalimat yang lebih lengkap dan alami, yang menunjukkan bahwa pengalaman di ujung telepon benar-benar terasa berbeda.”
—Alex Levy, Direktur Teknologi

Opsi suara baru

Developer membutuhkan suara yang sesuai dengan produk mereka dan terdengar alami bagi penggunanya. Dengan GPT‑Live‑1, kami memperluas pilihan dari sejumlah kecil suara real-time menjadi beragam aksen, dialek, dan bahasa, sehingga developer memiliki lebih banyak pilihan untuk menentukan suara asistennya.

Dengarkan suara-suara baru

Kami akan terus memperluas opsi suara dan ketersediaan bahasa dalam beberapa bulan mendatang.

Harga & Ketersediaan

GPT‑Live‑1 kini tersedia di API hari ini⁠(terbuka di jendela baru) dengan harga $0,05 per menit untuk lapisan suara front-end. Pasangkan dengan model backend dan harness agen yang sesuai dengan produk Anda, lalu bangun pengalaman suara yang dapat berkembang seiring tuntutan pekerjaannya.

Hubungkan GPT-Live-1 ke Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Menghubungkan GPT-Live-1 ke Codex. Kutipan ini menunjukkan cara aplikasi meneruskan konteks percakapan ke Codex dan mengembalikan jawabannya ke GPT-Live-1. Penyiapan koneksi dan penanganan pelimpahan tidak disertakan.

Untuk mengakses suara khusus, hubungi tim penjualan guna mempelajari lebih lanjut tentang kelayakan dan proses permintaan.

Cara lain untuk membangun alur kerja suara di atas GPT‑Live‑1 adalah dengan OpenAI Presence, yang menggunakan model untuk mendukung interaksi suara secara real time. Presence membantu perusahaan menerapkan agen AI tepercaya yang dapat menjawab pertanyaan, menyelesaikan masalah, menggunakan sistem perusahaan, mengambil tindakan yang disetujui, dan meneruskan ke manusia bila diperlukan. Hubungi direktur akun OpenAI Anda untuk mengetahui lebih lanjut.

Penulis

OpenAI