Chúng tôi ra mắt GPT‑Live‑1 trên API, mang đến cho nhà phát triển một mô hình giọng nói mạnh mẽ, tự nhiên để xây dựng các ứng dụng hỗ trợ giọng nói và quy trình công việc doanh nghiệp. Được giới thiệu lần đầu trong ChatGPT, GPT‑Live‑1 có thể nghe và nói đồng thời và, như đã thể hiện với Codex và ChatGPT Công việc(mở trong cửa sổ mới), có thể giao phần suy luận chuyên sâu và hành động cho các mô hình và công cụ được kết hợp cùng.
Trong bản phát hành GPT‑Live‑1 dành cho API, chúng tôi tập trung vào các khả năng mới giúp nhà phát triển định hướng và tùy chỉnh trải nghiệm giọng nói theo người dùng, quy trình làm việc và mục tiêu của họ. Một thế mạnh cốt lõi của GPT‑Live‑1 là khả năng xử lý ngắt lời mượt mà, vốn đã mang lại tác động cho doanh nghiệp: trong các đánh giá ban đầu, Speak nhận thấy GPT‑Live‑1 cho người học thêm thời gian suy nghĩ trước khi gia sư ngôn ngữ phản hồi, giảm gần 80% số lần ngắt lời so với các hệ thống luân phiên trước đây.
Các điểm mạnh chính của GPT‑Live‑1 trong API:
Xử lý ngắt lời: Cải thiện khả năng xử lý ngắt lời nhờ một mô hình duy nhất suy luận đồng thời trên âm thanh đầu vào và đầu ra, tránh độ trễ và các khâu chuyển giao thiếu ổn định của kiến trúc STT–LLM–TTS nối chuỗi.
Ủy quyền suy luận và lệnh gọi công cụ: GPT‑Live‑1 có thể ủy quyền suy luận và lệnh gọi công cụ cho một mô hình văn bản phía máy chủ như GPT‑6 Astra hoặc mô hình của bên thứ ba.
Giọng điệu, nhịp độ và phong cách: Cho phép nhà phát triển định hình giọng điệu, nhịp độ và phong cách trò chuyện của tác nhân thông qua câu lệnh hệ thống.
Quản lý ngữ cảnh yên lặng & tiếng ồn nền: Xử lý tiếng ồn nền và khoảng lặng tốt hơn mà không làm gián đoạn cuộc trò chuyện hoặc đọc to từng bước.
Độ tin cậy trong phiên dài: Cải thiện khả năng duy trì ngữ cảnh và chất lượng hội thoại trong các tương tác kéo dài.
Hỗ trợ điện thoại: Cho phép triển khai tác nhân giọng nói hai chiều đồng thời cho cuộc gọi, từ đặt chỗ nhà hàng đến hỗ trợ khách hàng.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Bản demo này có giới hạn thời gian. Bằng cách sử dụng dịch vụ này, bạn đồng ý với Điều khoản của OpenAI và xác nhận đã biết Chính sách quyền riêng tư của chúng tôi.
Các tác nhân giọng nói truyền thống kết nối tính năng chuyển lời nói thành văn bản, một mô hình suy luận và tính năng chuyển văn bản thành lời nói. Mỗi khâu chuyển giao đều làm tăng độ trễ và nguy cơ làm mất nhịp, ngữ cảnh hoặc sự tự nhiên của cuộc trò chuyện. Nhà phát triển thường phải tự điều phối các giai đoạn đó, kể cả cách xử lý khi có người ngắt lời, tạm dừng hoặc đổi hướng.
GPT‑Live‑1 xử lý cả nghe và nói trong một mô hình duy nhất, giúp đơn giản hóa lớp giọng nói. Mô hình có thể phản hồi ngay khi người dùng ngắt lời hoặc xác nhận, đồng thời giao phần suy luận chuyên sâu cho hệ thống phía máy chủ. Nhờ đó, cuộc trò chuyện vẫn tiếp diễn trong khi công việc được xử lý ở chế độ nền.
Nhà phát triển lựa chọn các mô hình, công cụ và hệ thống điều khiển tác nhân đứng sau cuộc trò chuyện. Chẳng hạn, họ có thể kết hợp GPT‑Live‑1 với một mô hình như Luna cho các tác vụ khối lượng lớn như lên lịch hoặc cập nhật đơn hàng, đồng thời dùng một mô hình như Astra cho những vấn đề phức tạp của khách hàng cần suy luận. Tính linh hoạt đó cho phép nhà phát triển cân đối độ sâu suy luận, tốc độ và chi phí theo từng tác vụ.
GPT‑Live‑1 cung cấp sẵn bản chép lời ASR và văn bản phản hồi. Mô hình cũng có khả năng nhận biết chữ và số tốt, đồng thời hỗ trợ ưu tiên từ khóa. Mặc dù GPT‑Live‑1 không phải là mô hình theo lượt, mô hình vẫn hỗ trợ sẵn tính năng phát hiện lượt, nhờ đó nhà phát triển có thể tiếp tục xây dựng dựa trên ranh giới lượt rõ ràng.
Trong các đánh giá của chúng tôi, GPT‑Live‑1 cải thiện hiệu suất trên Full Duplex Bench thêm 30 điểm phần trăm so với GPT‑Realtime‑2.1, với những cải tiến đáng kể về độ trễ khi luân phiên hội thoại và hành vi tương tác. Khi kết hợp với GPT‑6 Astra ở mức nỗ lực suy luận vừa, mô hình này cũng đứng hạng 1 trên Tau3, bài đo độ thông minh tiên phong của tác nhân giọng nói trên các tác vụ đầu cuối.
Đánh giá các nhiệm vụ dịch vụ khách hàng qua giọng nói trong các lĩnh vực hàng không, bán lẻ và viễn thông. Pass@1 đo lường mức độ thành công của nhiệm vụ; tiêu đề gán trọng số bằng nhau cho từng lĩnh vực.
* Backend GPT Live: Astra (vừa).
Đánh giá hỗ trợ ngân hàng bằng giọng nói với tính năng truy xuất kiến thức và các công cụ tài khoản. Pass@1 là tỷ lệ các tác vụ banking_knowledge được hoàn thành thành công trong số 97 tác vụ.
* Backend GPT Live: Astra (vừa).
Đánh giá khả năng xử lý khoảng dừng, luân phiên lượt nói trong hội thoại, ngắt lời và các tín hiệu phản hồi ngắn.
Kiểm tra phản ứng với lời nói nền, lời nói với người khác, tín hiệu phản hồi của người nghe và sự ngắt lời.
Đo thời gian tác nhân bắt đầu phản hồi sau khi người dùng kết thúc một lượt tương tác.
Kiểm tra việc sử dụng công cụ từ các yêu cầu bằng lời nói có chứa những khoảng ngừng tự nhiên, sự do dự và tự sửa lời. Pass@1 chấm điểm chuỗi lệnh gọi công cụ.
* Phần phụ trợ GPT Live: Terra (thấp).
Đánh giá câu trả lời bằng lời nói cho các yêu cầu sử dụng công cụ có chứa khoảng dừng, sự do dự và tự chỉnh sửa. Chấm điểm mức độ câu trả lời khớp với ý định tham chiếu.
* Phần phụ trợ GPT Live: Terra (thấp).
Nhà phát triển cần những giọng nói phù hợp với sản phẩm và nghe tự nhiên đối với người dùng. Với GPT‑Live‑1, chúng tôi đang mở rộng từ một số ít giọng nói theo thời gian thực sang nhiều lựa chọn hơn về chất giọng, phương ngữ và ngôn ngữ, giúp nhà phát triển có thêm lựa chọn về giọng nói của trợ lý.
Trong những tháng tới, chúng tôi sẽ tiếp tục mở rộng các tùy chọn giọng nói và phạm vi ngôn ngữ hỗ trợ.
GPT‑Live‑1 hiện đã có trong API ngay hôm nay(mở trong cửa sổ mới) với mức giá $0,05 mỗi phút cho lớp giọng nói phía giao diện người dùng. Hãy kết hợp mô hình này với mô hình phía máy chủ và hệ thống điều khiển tác nhân phù hợp với sản phẩm, rồi xây dựng trải nghiệm giọng nói có thể mở rộng theo khối lượng công việc cần xử lý.
Để được sử dụng giọng nói tùy chỉnh, hãy liên hệ bộ phận kinh doanh nhằm tìm hiểu thêm về điều kiện và quy trình yêu cầu.
Một cách khác để xây dựng quy trình thoại trên nền tảng GPT‑Live‑1 là sử dụng OpenAI Presence, giải pháp sử dụng mô hình để hỗ trợ tương tác thoại theo thời gian thực. Presence giúp doanh nghiệp triển khai các tác nhân AI đáng tin cậy có thể trả lời câu hỏi, giải quyết vấn đề, sử dụng hệ thống của công ty, thực hiện hành động đã được phê duyệt và chuyển tiếp cho con người khi cần. Hãy liên hệ giám đốc phụ trách tài khoản OpenAI của bạn để tìm hiểu thêm.

