Giới thiệu GPT‑Live‑1 trên API
GPT‑Live‑1 đưa hội thoại tự nhiên, hai chiều đồng thời của ChatGPT lên API—nay làm theo hướng dẫn và phân công tốt hơn, có thể chỉnh cá tính, hỗ trợ điện thoại, phiên dài ổn định và quản lý ngữ cảnh thầm lặng.
[PLACEHOLDER: Ngày phát hành sẽ được xác nhận sau.]
[PLACEHOLDER: Video chứng thực của Yelp—đang chờ video hoàn chỉnh, ảnh thu nhỏ, phụ đề và bản chép lời.]
Hôm nay, chúng tôi đưa GPT‑Live‑1 lên API, mang đến cho nhà phát triển một mô hình giọng nói mạnh mẽ để kết hợp với trí tuệ tiên phong trong ứng dụng của riêng họ. Được giới thiệu lần đầu trong ChatGPT, GPT‑Live‑1 có thể nghe và nói đồng thời; đồng thời, như đã thể hiện với Codex và ChatGPT Công việc(mở trong cửa sổ mới), có thể giao phần suy luận chuyên sâu và hành động cho các mô hình và công cụ được kết hợp cùng.
Trong bản phát hành GPT‑Live dành cho API, chúng tôi tập trung vào các khả năng mới giúp nhà phát triển định hình trải nghiệm giọng nói xoay quanh người dùng, quy trình làm việc và mục tiêu của họ. Chẳng hạn, trong các đánh giá ban đầu, ứng dụng học ngôn ngữ Speak nhận thấy GPT‑Live‑1 giảm gần 80% số lần ngắt lời khi người học đang dừng lại để suy nghĩ so với các hệ thống luân phiên trước đây—cho người học thêm thời gian tìm từ trước khi gia sư lên tiếng.
Bản phát hành API bổ sung:
Xử lý ngắt lời: Một mô hình duy nhất suy luận đồng thời trên âm thanh đầu vào và đầu ra, tránh độ trễ và các khâu chuyển giao thiếu ổn định của kiến trúc STT–LLM–TTS nối chuỗi.
Điều phối tác nhân: Tuân thủ hướng dẫn nhiều bước đáng tin cậy hơn, thực hiện lệnh gọi công cụ tùy chỉnh và giao phần suy luận chuyên sâu hoặc hành động cho mô hình phía máy chủ hay hệ thống điều khiển tác nhân do nhà phát triển chọn.
Giọng nói tùy chỉnh: Bổ sung [XX—chưa xác định số lượng] giọng nói tùy chỉnh mới cho [YY—chưa xác định ngôn ngữ] ngôn ngữ, giúp thương hiệu tạo ra trải nghiệm giọng nói tự nhiên, khác biệt ở nhiều ngôn ngữ và phương ngữ.
Khả năng điều chỉnh cá tính: Cho phép nhà phát triển định hình giọng điệu, nhịp độ và phong cách trò chuyện của tác nhân thông qua câu lệnh hệ thống.
Quản lý ngữ cảnh yên lặng & tiếng ồn nền: Xử lý tiếng ồn nền và khoảng lặng tốt hơn mà không làm gián đoạn cuộc trò chuyện hoặc đọc to từng bước.
Độ thông minh linh hoạt: Cho phép nhà phát triển chọn bất kỳ mô hình phía máy chủ hoặc hệ thống điều khiển tác nhân nào phù hợp với quy trình làm việc.
Độ tin cậy trong phiên dài: Cải thiện khả năng duy trì ngữ cảnh và chất lượng hội thoại trong các tương tác kéo dài.
Hỗ trợ điện thoại: Cho phép triển khai tác nhân giọng nói hai chiều đồng thời cho cuộc gọi, từ đặt chỗ nhà hàng đến hỗ trợ khách hàng.

[PLACEHOLDER: Bản demo giọng nói tương tác—đang hiển thị bản mô phỏng nguồn; trải nghiệm GPT‑Live‑1 hoàn chỉnh đang chờ xử lý.]
Các tác nhân giọng nói truyền thống kết nối tính năng chuyển lời nói thành văn bản, một mô hình suy luận và tính năng chuyển văn bản thành lời nói. Mỗi khâu chuyển giao đều làm tăng độ trễ và nguy cơ làm mất nhịp, ngữ cảnh hoặc sự tự nhiên của cuộc trò chuyện. Nhà phát triển thường phải tự điều phối các giai đoạn đó, kể cả cách xử lý khi có người ngắt lời, tạm dừng hoặc đổi hướng.
GPT‑Live‑1 xử lý cả nghe và nói trong một mô hình duy nhất, giúp đơn giản hóa lớp giọng nói trực tiếp. Mô hình có thể phản hồi ngay khi người dùng ngắt lời hoặc xác nhận, đồng thời giao phần suy luận chuyên sâu cho hệ thống phía máy chủ. Nhờ đó, cuộc trò chuyện vẫn tiếp diễn trong khi công việc được xử lý ở chế độ nền.
Nhà phát triển lựa chọn các mô hình, công cụ và hệ thống điều khiển tác nhân đứng sau cuộc trò chuyện. Chẳng hạn, họ có thể kết hợp GPT‑Live‑1 với một mô hình như Luna cho các tác vụ khối lượng lớn như lên lịch hoặc cập nhật đơn hàng, đồng thời dùng một mô hình như Astra cho những vấn đề phức tạp của khách hàng cần suy luận. Tính linh hoạt đó cho phép nhà phát triển cân đối độ sâu suy luận, tốc độ và chi phí theo từng tác vụ.
GPT‑Llive‑1 cung cấp sẵn bản chép lời ASR và văn bản phản hồi. Mô hình cũng có khả năng nhận biết chữ và số tốt, đồng thời hỗ trợ ưu tiên từ khóa. Mặc dù GPT‑live không phải là mô hình dựa trên lượt, mô hình vẫn hỗ trợ sẵn tính năng phát hiện lượt, nhờ đó nhà phát triển có thể tiếp tục xây dựng dựa trên ranh giới lượt rõ ràng.
[PLACEHOLDER: So sánh âm thanh song song giữa GPT‑Live‑1 và hệ thống giọng nói phân tầng—đang chờ tệp âm thanh và bản chép lời.]
Trong các đánh giá của chúng tôi, GPT‑Live‑1 kết hợp với GPT‑6 Astra ở mức nỗ lực suy luận Vừa đứng hạng 1 trên Tau3—bài đo trí tuệ tiên phong của tác nhân giọng nói qua các tác vụ đầu cuối—và hạng 1 trên Full Duplex Bench, bài đánh giá tính tương tác, độ trễ khi luân phiên hội thoại, khả năng gọi công cụ và chất lượng phản hồi.

Nhà phát triển cần những giọng nói phù hợp với sản phẩm và nghe tự nhiên đối với người dùng. Với GPT‑Live‑1, chúng tôi đang mở rộng từ một số ít giọng nói theo thời gian thực sang nhiều lựa chọn hơn về chất giọng, phương ngữ và ngôn ngữ, giúp nhà phát triển có thêm lựa chọn về giọng nói của trợ lý.
Quartz—tiếng Anh Úc, giọng nữ, giọng AI tạo sinh
Ripple—tiếng Anh Úc, giọng nam, giọng AI tự nhiên
Vesper—tiếng Anh Anh, giọng nam, giọng AI tự nhiên
Willow—tiếng Anh Ireland, giọng nữ, giọng AI tự nhiên
Stone—tiếng Anh Ireland, giọng nam, giọng AI tự nhiên
Gleam—tiếng Anh Bắc Mỹ, giọng nữ, giọng AI tự nhiên
Meridian—tiếng Anh Bắc Mỹ, giọng nam, giọng AI tự nhiên
Bossa—tiếng Bồ Đào Nha Brazil, giọng nữ, giọng AI tự nhiên
Tempo—tiếng Bồ Đào Nha Brazil, giọng nam, giọng AI tự nhiên
Aster—tiếng Anh Ấn Độ, giọng nữ, giọng AI tạo sinh
Beacon—tiếng Anh Philippines, giọng nam, giọng AI tạo sinh
Delta—tiếng Anh miền Nam Hoa Kỳ, giọng nữ, giọng AI tạo sinh
Cinder—tiếng Anh miền Nam Hoa Kỳ, giọng nam, giọng AI tạo sinh
[PLACEHOLDER: Bộ chọn giọng nói với 3–5 câu mẫu lặp lại cho mỗi giọng—đang chờ mẫu âm thanh và trải nghiệm tương tác.]
Trong những tháng tới, chúng tôi sẽ tiếp tục mở rộng các tùy chọn giọng nói và phạm vi ngôn ngữ hỗ trợ.
GPT‑Live‑1 hiện đã có trên API với mức giá 0,05 USD mỗi phút cho lớp giọng nói phía giao diện người dùng. Hãy kết hợp mô hình này với mô hình phía máy chủ và hệ thống điều khiển tác nhân phù hợp với sản phẩm, rồi xây dựng trải nghiệm giọng nói có thể mở rộng theo khối lượng công việc cần xử lý.
Để được sử dụng giọng nói tùy chỉnh, hãy liên hệ bộ phận kinh doanh nhằm tìm hiểu thêm về điều kiện và quy trình yêu cầu.
Bạn có thể bắt đầu nhanh hơn với GPT‑Live‑1 bằng Presence, giải pháp hỗ trợ trải nghiệm giọng nói và trò chuyện theo thời gian thực như hỗ trợ khách hàng, bán hàng qua cuộc gọi đi và các quy trình nội bộ có rủi ro cao. Hãy liên hệ giám đốc phụ trách tài khoản OpenAI của bạn để tìm hiểu thêm.


