Bỏ qua nội dung chính
OpenAI

Giới thiệu GPT‑Live‑1 trên API

GPT‑Live‑1 đưa hội thoại tự nhiên, hai chiều đồng thời của ChatGPT lên API—nay làm theo hướng dẫn và phân công tốt hơn, có thể chỉnh cá tính, hỗ trợ điện thoại, phiên dài ổn định và quản lý ngữ cảnh thầm lặng.

Đang tải…

[PLACEHOLDER: Ngày phát hành sẽ được xác nhận sau.]

[PLACEHOLDER: Video chứng thực của Yelp—đang chờ video hoàn chỉnh, ảnh thu nhỏ, phụ đề và bản chép lời.]

Hôm nay, chúng tôi đưa GPT‑Live‑1 lên API, mang đến cho nhà phát triển một mô hình giọng nói mạnh mẽ để kết hợp với trí tuệ tiên phong trong ứng dụng của riêng họ. Được giới thiệu lần đầu trong ChatGPT, GPT‑Live‑1 có thể nghe và nói đồng thời; đồng thời, như đã thể hiện với Codex và ChatGPT Công việc(mở trong cửa sổ mới), có thể giao phần suy luận chuyên sâu và hành động cho các mô hình và công cụ được kết hợp cùng.

Trong bản phát hành GPT‑Live dành cho API, chúng tôi tập trung vào các khả năng mới giúp nhà phát triển định hình trải nghiệm giọng nói xoay quanh người dùng, quy trình làm việc và mục tiêu của họ. Chẳng hạn, trong các đánh giá ban đầu, ứng dụng học ngôn ngữ Speak nhận thấy GPT‑Live‑1 giảm gần 80% số lần ngắt lời khi người học đang dừng lại để suy nghĩ so với các hệ thống luân phiên trước đây—cho người học thêm thời gian tìm từ trước khi gia sư lên tiếng.

Bản phát hành API bổ sung:

  • Xử lý ngắt lời: Một mô hình duy nhất suy luận đồng thời trên âm thanh đầu vào và đầu ra, tránh độ trễ và các khâu chuyển giao thiếu ổn định của kiến trúc STT–LLM–TTS nối chuỗi.

  • Điều phối tác nhân: Tuân thủ hướng dẫn nhiều bước đáng tin cậy hơn, thực hiện lệnh gọi công cụ tùy chỉnh và giao phần suy luận chuyên sâu hoặc hành động cho mô hình phía máy chủ hay hệ thống điều khiển tác nhân do nhà phát triển chọn.

  • Giọng nói tùy chỉnh: Bổ sung [XX—chưa xác định số lượng] giọng nói tùy chỉnh mới cho [YY—chưa xác định ngôn ngữ] ngôn ngữ, giúp thương hiệu tạo ra trải nghiệm giọng nói tự nhiên, khác biệt ở nhiều ngôn ngữ và phương ngữ.

  • Khả năng điều chỉnh cá tính: Cho phép nhà phát triển định hình giọng điệu, nhịp độ và phong cách trò chuyện của tác nhân thông qua câu lệnh hệ thống.

  • Quản lý ngữ cảnh yên lặng & tiếng ồn nền: Xử lý tiếng ồn nền và khoảng lặng tốt hơn mà không làm gián đoạn cuộc trò chuyện hoặc đọc to từng bước.

  • Độ thông minh linh hoạt: Cho phép nhà phát triển chọn bất kỳ mô hình phía máy chủ hoặc hệ thống điều khiển tác nhân nào phù hợp với quy trình làm việc.

  • Độ tin cậy trong phiên dài: Cải thiện khả năng duy trì ngữ cảnh và chất lượng hội thoại trong các tương tác kéo dài.

  • Hỗ trợ điện thoại: Cho phép triển khai tác nhân giọng nói hai chiều đồng thời cho cuộc gọi, từ đặt chỗ nhà hàng đến hỗ trợ khách hàng.

Bản mô phỏng tạm thời cho demo giọng nói, hiển thị dạng sóng và bộ đếm thời gian phiên; hình minh họa nguồn vẫn ghi GPT-Realtime-2.

[PLACEHOLDER: Bản demo giọng nói tương tác—đang hiển thị bản mô phỏng nguồn; trải nghiệm GPT‑Live‑1 hoàn chỉnh đang chờ xử lý.]

Vượt xa hệ thống giọng nói nối chuỗi: cuộc trò chuyện không cần chờ đến lượt

Các tác nhân giọng nói truyền thống kết nối tính năng chuyển lời nói thành văn bản, một mô hình suy luận và tính năng chuyển văn bản thành lời nói. Mỗi khâu chuyển giao đều làm tăng độ trễ và nguy cơ làm mất nhịp, ngữ cảnh hoặc sự tự nhiên của cuộc trò chuyện. Nhà phát triển thường phải tự điều phối các giai đoạn đó, kể cả cách xử lý khi có người ngắt lời, tạm dừng hoặc đổi hướng.

GPT‑Live‑1 xử lý cả nghe và nói trong một mô hình duy nhất, giúp đơn giản hóa lớp giọng nói trực tiếp. Mô hình có thể phản hồi ngay khi người dùng ngắt lời hoặc xác nhận, đồng thời giao phần suy luận chuyên sâu cho hệ thống phía máy chủ. Nhờ đó, cuộc trò chuyện vẫn tiếp diễn trong khi công việc được xử lý ở chế độ nền.

So với hệ thống phân tầng của chúng tôi, GPT‑Live‑1 đã đơn giản hóa cơ sở mã đến 80% và loại bỏ 23 nghìn dòng mã. Nhờ đó, bệnh nhân có thể trò chuyện tự nhiên theo thời gian thực, đồng thời đội ngũ của chúng tôi có thêm thời gian cải thiện trải nghiệm từ đặt lịch hẹn đến định hướng chăm sóc.
—Tony Stoyanov, Đồng sáng lập & Giám đốc Công nghệ, EliseAI

Nhà phát triển lựa chọn các mô hình, công cụ và hệ thống điều khiển tác nhân đứng sau cuộc trò chuyện. Chẳng hạn, họ có thể kết hợp GPT‑Live‑1 với một mô hình như Luna cho các tác vụ khối lượng lớn như lên lịch hoặc cập nhật đơn hàng, đồng thời dùng một mô hình như Astra cho những vấn đề phức tạp của khách hàng cần suy luận. Tính linh hoạt đó cho phép nhà phát triển cân đối độ sâu suy luận, tốc độ và chi phí theo từng tác vụ.

GPT‑Llive‑1 cung cấp sẵn bản chép lời ASR và văn bản phản hồi. Mô hình cũng có khả năng nhận biết chữ và số tốt, đồng thời hỗ trợ ưu tiên từ khóa. Mặc dù GPT‑live không phải là mô hình dựa trên lượt, mô hình vẫn hỗ trợ sẵn tính năng phát hiện lượt, nhờ đó nhà phát triển có thể tiếp tục xây dựng dựa trên ranh giới lượt rõ ràng.

[PLACEHOLDER: So sánh âm thanh song song giữa GPT‑Live‑1 và hệ thống giọng nói phân tầng—đang chờ tệp âm thanh và bản chép lời.]

Đo lường lợi thế hai chiều đồng thời

Trong các đánh giá của chúng tôi, GPT‑Live‑1 kết hợp với GPT‑6 Astra ở mức nỗ lực suy luận Vừa đứng hạng 1 trên Tau3—bài đo trí tuệ tiên phong của tác nhân giọng nói qua các tác vụ đầu cuối—và hạng 1 trên Full Duplex Bench, bài đánh giá tính tương tác, độ trễ khi luân phiên hội thoại, khả năng gọi công cụ và chất lượng phản hồi.

Đồ họa chuẩn đánh giá nguồn so sánh GPT-Live-1 với các mô hình GPT-Realtime về trí tuệ Tau3, tính tương tác, độ trễ khi luân phiên hội thoại, khả năng gọi công cụ và chất lượng phản hồi.

Ý kiến của khách hàng

1 trong số 4
Việc tích hợp GPT‑Live‑1 vào Yelp Host và Hatch đã cải thiện khả năng luân phiên hội thoại và độ chính xác so với kiến trúc giọng nói truyền thống của chúng tôi. Khi Yelp Host dùng GPT‑Live để trả lời các cuộc gọi như đặt chỗ và gọi món, chúng tôi ghi nhận tỷ lệ xử lý cuộc gọi cải thiện đáng kể. Người gọi cũng nói những câu đầy đủ và tự nhiên hơn, cho thấy trải nghiệm ở đầu dây bên kia thực sự khác biệt.
—Alex Levy, Giám đốc Công nghệ, Yelp

Các tùy chọn giọng nói mới

Nhà phát triển cần những giọng nói phù hợp với sản phẩm và nghe tự nhiên đối với người dùng. Với GPT‑Live‑1, chúng tôi đang mở rộng từ một số ít giọng nói theo thời gian thực sang nhiều lựa chọn hơn về chất giọng, phương ngữ và ngôn ngữ, giúp nhà phát triển có thêm lựa chọn về giọng nói của trợ lý.

  • Quartz—tiếng Anh Úc, giọng nữ, giọng AI tạo sinh

  • Ripple—tiếng Anh Úc, giọng nam, giọng AI tự nhiên

  • Vesper—tiếng Anh Anh, giọng nam, giọng AI tự nhiên

  • Willow—tiếng Anh Ireland, giọng nữ, giọng AI tự nhiên

  • Stone—tiếng Anh Ireland, giọng nam, giọng AI tự nhiên

  • Gleam—tiếng Anh Bắc Mỹ, giọng nữ, giọng AI tự nhiên

  • Meridian—tiếng Anh Bắc Mỹ, giọng nam, giọng AI tự nhiên

  • Bossa—tiếng Bồ Đào Nha Brazil, giọng nữ, giọng AI tự nhiên

  • Tempo—tiếng Bồ Đào Nha Brazil, giọng nam, giọng AI tự nhiên

  • Aster—tiếng Anh Ấn Độ, giọng nữ, giọng AI tạo sinh

  • Beacon—tiếng Anh Philippines, giọng nam, giọng AI tạo sinh

  • Delta—tiếng Anh miền Nam Hoa Kỳ, giọng nữ, giọng AI tạo sinh

  • Cinder—tiếng Anh miền Nam Hoa Kỳ, giọng nam, giọng AI tạo sinh

[PLACEHOLDER: Bộ chọn giọng nói với 3–5 câu mẫu lặp lại cho mỗi giọng—đang chờ mẫu âm thanh và trải nghiệm tương tác.]

Trong những tháng tới, chúng tôi sẽ tiếp tục mở rộng các tùy chọn giọng nói và phạm vi ngôn ngữ hỗ trợ.

Giá & Phạm vi cung cấp

GPT‑Live‑1 hiện đã có trên API với mức giá 0,05 USD mỗi phút cho lớp giọng nói phía giao diện người dùng. Hãy kết hợp mô hình này với mô hình phía máy chủ và hệ thống điều khiển tác nhân phù hợp với sản phẩm, rồi xây dựng trải nghiệm giọng nói có thể mở rộng theo khối lượng công việc cần xử lý.

Để được sử dụng giọng nói tùy chỉnh, hãy liên hệ bộ phận kinh doanh nhằm tìm hiểu thêm về điều kiện và quy trình yêu cầu.

Bạn có thể bắt đầu nhanh hơn với GPT‑Live‑1 bằng Presence, giải pháp hỗ trợ trải nghiệm giọng nói và trò chuyện theo thời gian thực như hỗ trợ khách hàng, bán hàng qua cuộc gọi đi và các quy trình nội bộ có rủi ro cao. Hãy liên hệ giám đốc phụ trách tài khoản OpenAI của bạn để tìm hiểu thêm.

Tác giả

OpenAI