Bỏ qua nội dung chính
OpenAI

10 tháng 9, 2026

Sản phẩmPhát hành

Xây dựng trải nghiệm giọng nói tự nhiên với GPT‑Live‑1 trong API

GPT‑Live‑1 đưa các cuộc hội thoại tự nhiên, hai chiều đồng thời của ChatGPT lên API, với khả năng kiểm soát tốt hơn cách các tác nhân thoại nói và hành động.

Đang tải…

Chúng tôi ra mắt GPT‑Live‑1 trên API, mang đến cho nhà phát triển một mô hình giọng nói mạnh mẽ, tự nhiên để xây dựng các ứng dụng hỗ trợ giọng nói và quy trình công việc doanh nghiệp. Được giới thiệu lần đầu trong ChatGPT, GPT‑Live‑1 có thể nghe và nói đồng thời và, như đã thể hiện với Codex và ChatGPT Công việc⁠(mở trong cửa sổ mới), có thể giao phần suy luận chuyên sâu và hành động cho các mô hình và công cụ được kết hợp cùng.

Trong bản phát hành GPT‑Live‑1 dành cho API, chúng tôi tập trung vào các khả năng mới giúp nhà phát triển định hướng và tùy chỉnh trải nghiệm giọng nói theo người dùng, quy trình làm việc và mục tiêu của họ. Một thế mạnh cốt lõi của GPT‑Live‑1 là khả năng xử lý ngắt lời mượt mà, vốn đã mang lại tác động cho doanh nghiệp: trong các đánh giá ban đầu, Speak nhận thấy GPT‑Live‑1 cho người học thêm thời gian suy nghĩ trước khi gia sư ngôn ngữ phản hồi, giảm gần 80% số lần ngắt lời so với các hệ thống luân phiên trước đây.

Các điểm mạnh chính của GPT‑Live‑1 trong API:

  • Xử lý ngắt lời: Cải thiện khả năng xử lý ngắt lời nhờ một mô hình duy nhất suy luận đồng thời trên âm thanh đầu vào và đầu ra, tránh độ trễ và các khâu chuyển giao thiếu ổn định của kiến trúc STT–LLM–TTS nối chuỗi.

  • Ủy quyền suy luận và lệnh gọi công cụ: GPT‑Live‑1 có thể ủy quyền suy luận và lệnh gọi công cụ cho một mô hình văn bản phía máy chủ như GPT‑6 Astra hoặc mô hình của bên thứ ba.

  • Giọng điệu, nhịp độ và phong cách: Cho phép nhà phát triển định hình giọng điệu, nhịp độ và phong cách trò chuyện của tác nhân thông qua câu lệnh hệ thống.

  • Quản lý ngữ cảnh yên lặng & tiếng ồn nền: Xử lý tiếng ồn nền và khoảng lặng tốt hơn mà không làm gián đoạn cuộc trò chuyện hoặc đọc to từng bước.

  • Độ tin cậy trong phiên dài: Cải thiện khả năng duy trì ngữ cảnh và chất lượng hội thoại trong các tương tác kéo dài.

  • Hỗ trợ điện thoại: Cho phép triển khai tác nhân giọng nói hai chiều đồng thời cho cuộc gọi, từ đặt chỗ nhà hàng đến hỗ trợ khách hàng.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Bản demo này có giới hạn thời gian. Bằng cách sử dụng dịch vụ này, bạn đồng ý với Điều khoản của OpenAI và xác nhận đã biết Chính sách quyền riêng tư của chúng tôi.

Đơn giản hóa kiến trúc tác nhân thoại và giảm độ trễ thoại

Các tác nhân giọng nói truyền thống kết nối tính năng chuyển lời nói thành văn bản, một mô hình suy luận và tính năng chuyển văn bản thành lời nói. Mỗi khâu chuyển giao đều làm tăng độ trễ và nguy cơ làm mất nhịp, ngữ cảnh hoặc sự tự nhiên của cuộc trò chuyện. Nhà phát triển thường phải tự điều phối các giai đoạn đó, kể cả cách xử lý khi có người ngắt lời, tạm dừng hoặc đổi hướng.

GPT‑Live‑1 xử lý cả nghe và nói trong một mô hình duy nhất, giúp đơn giản hóa lớp giọng nói. Mô hình có thể phản hồi ngay khi người dùng ngắt lời hoặc xác nhận, đồng thời giao phần suy luận chuyên sâu cho hệ thống phía máy chủ. Nhờ đó, cuộc trò chuyện vẫn tiếp diễn trong khi công việc được xử lý ở chế độ nền.

“So với hệ thống phân tầng của chúng tôi, GPT‑Live‑1 đã đơn giản hóa cơ sở mã đến 80% và loại bỏ 23 nghìn dòng mã. Nhờ đó, bệnh nhân có thể trò chuyện tự nhiên theo thời gian thực, đồng thời đội ngũ của chúng tôi có thêm thời gian cải thiện trải nghiệm từ đặt lịch hẹn đến định hướng chăm sóc.”
—Tony Stoyanov, Đồng sáng lập & Giám đốc Công nghệ, EliseAI

Nhà phát triển lựa chọn các mô hình, công cụ và hệ thống điều khiển tác nhân đứng sau cuộc trò chuyện. Chẳng hạn, họ có thể kết hợp GPT‑Live‑1 với một mô hình như Luna cho các tác vụ khối lượng lớn như lên lịch hoặc cập nhật đơn hàng, đồng thời dùng một mô hình như Astra cho những vấn đề phức tạp của khách hàng cần suy luận. Tính linh hoạt đó cho phép nhà phát triển cân đối độ sâu suy luận, tốc độ và chi phí theo từng tác vụ.

GPT‑Live‑1 cung cấp sẵn bản chép lời ASR và văn bản phản hồi. Mô hình cũng có khả năng nhận biết chữ và số tốt, đồng thời hỗ trợ ưu tiên từ khóa. Mặc dù GPT‑Live‑1 không phải là mô hình theo lượt, mô hình vẫn hỗ trợ sẵn tính năng phát hiện lượt, nhờ đó nhà phát triển có thể tiếp tục xây dựng dựa trên ranh giới lượt rõ ràng.

Đo lường lợi thế hai chiều đồng thời

Trong các đánh giá của chúng tôi, GPT‑Live‑1 cải thiện hiệu suất trên Full Duplex Bench thêm 30 điểm phần trăm so với GPT‑Realtime‑2.1, với những cải tiến đáng kể về độ trễ khi luân phiên hội thoại và hành vi tương tác. Khi kết hợp với GPT‑6 Astra ở mức nỗ lực suy luận vừa, mô hình này cũng đứng hạng 1 trên Tau3, bài đo độ thông minh tiên phong của tác nhân giọng nói trên các tác vụ đầu cuối.

Đánh giá các nhiệm vụ dịch vụ khách hàng qua giọng nói trong các lĩnh vực hàng không, bán lẻ và viễn thông. Pass@1 đo lường mức độ thành công của nhiệm vụ; tiêu đề gán trọng số bằng nhau cho từng lĩnh vực.


* Backend GPT Live: Astra (vừa).

Đánh giá hỗ trợ ngân hàng bằng giọng nói với tính năng truy xuất kiến thức và các công cụ tài khoản. Pass@1 là tỷ lệ các tác vụ banking_knowledge được hoàn thành thành công trong số 97 tác vụ.


* Backend GPT Live: Astra (vừa).

Đánh giá khả năng xử lý khoảng dừng, luân phiên lượt nói trong hội thoại, ngắt lời và các tín hiệu phản hồi ngắn.

Kiểm tra phản ứng với lời nói nền, lời nói với người khác, tín hiệu phản hồi của người nghe và sự ngắt lời.

Đo thời gian tác nhân bắt đầu phản hồi sau khi người dùng kết thúc một lượt tương tác.

Kiểm tra việc sử dụng công cụ từ các yêu cầu bằng lời nói có chứa những khoảng ngừng tự nhiên, sự do dự và tự sửa lời. Pass@1 chấm điểm chuỗi lệnh gọi công cụ.


* Phần phụ trợ GPT Live: Terra (thấp).

Đánh giá câu trả lời bằng lời nói cho các yêu cầu sử dụng công cụ có chứa khoảng dừng, sự do dự và tự chỉnh sửa. Chấm điểm mức độ câu trả lời khớp với ý định tham chiếu.


* Phần phụ trợ GPT Live: Terra (thấp).

Ý kiến của khách hàng

1 trong số 4
“Việc tích hợp GPT‑Live‑1 vào Yelp Host và Hatch đã cải thiện khả năng luân phiên lượt nói và độ chính xác so với kiến trúc giọng nói truyền thống của chúng tôi. Khi Yelp Host dùng GPT‑Live‑1 để trả lời các cuộc gọi về việc đặt chỗ và gọi món, chúng tôi ghi nhận tỷ lệ xử lý cuộc gọi được cải thiện đáng kể. Người gọi cũng nói những câu đầy đủ và tự nhiên hơn, cho thấy trải nghiệm ở đầu dây bên kia thực sự khác biệt.”
—Alex Levy, Giám đốc Công nghệ

Các tùy chọn giọng nói mới

Nhà phát triển cần những giọng nói phù hợp với sản phẩm và nghe tự nhiên đối với người dùng. Với GPT‑Live‑1, chúng tôi đang mở rộng từ một số ít giọng nói theo thời gian thực sang nhiều lựa chọn hơn về chất giọng, phương ngữ và ngôn ngữ, giúp nhà phát triển có thêm lựa chọn về giọng nói của trợ lý.

Nghe các giọng nói mới

Trong những tháng tới, chúng tôi sẽ tiếp tục mở rộng các tùy chọn giọng nói và phạm vi ngôn ngữ hỗ trợ.

Giá & Phạm vi cung cấp

GPT‑Live‑1 hiện đã có trong API ngay hôm nay⁠(mở trong cửa sổ mới) với mức giá $0,05 mỗi phút cho lớp giọng nói phía giao diện người dùng. Hãy kết hợp mô hình này với mô hình phía máy chủ và hệ thống điều khiển tác nhân phù hợp với sản phẩm, rồi xây dựng trải nghiệm giọng nói có thể mở rộng theo khối lượng công việc cần xử lý.

Kết nối GPT-Live-1 với Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Kết nối GPT-Live-1 với Codex. Trích đoạn này cho thấy cách một ứng dụng truyền ngữ cảnh cuộc trò chuyện đến Codex và trả về câu trả lời của Codex cho GPT-Live-1. Phần thiết lập kết nối và xử lý ủy quyền được lược bỏ.

Để được sử dụng giọng nói tùy chỉnh, hãy liên hệ bộ phận kinh doanh nhằm tìm hiểu thêm về điều kiện và quy trình yêu cầu.

Một cách khác để xây dựng quy trình thoại trên nền tảng GPT‑Live‑1 là sử dụng OpenAI Presence, giải pháp sử dụng mô hình để hỗ trợ tương tác thoại theo thời gian thực. Presence giúp doanh nghiệp triển khai các tác nhân AI đáng tin cậy có thể trả lời câu hỏi, giải quyết vấn đề, sử dụng hệ thống của công ty, thực hiện hành động đã được phê duyệt và chuyển tiếp cho con người khi cần. Hãy liên hệ giám đốc phụ trách tài khoản OpenAI của bạn để tìm hiểu thêm.

Tác giả

OpenAI