Giới thiệu các mô hình âm thanh thế hệ tiếp theo trong API
Một bộ mô hình âm thanh mới để cung cấp năng lượng cho các đại lý giọng nói, hiện có sẵn cho các nhà phát triển trên toàn thế giới.

Cập nhật ngày 28 tháng 8 năm 2025: Chúng tôi đã thông báo về việc API thời gian thực đã sẵn sàng cho mọi người sử dụng. Tìm hiểu thêm tại đây.
Trong vài tháng qua, chúng tôi đã đầu tư để nâng cao trí tuệ, năng lực và tính hữu ích của các tác nhân dựa trên văn bản—hay những hệ thống có khả năng độc lập thực hiện các tác vụ thay cho người dùng—với các bản phát hành như trình vận hành, nghiên cứu sâu, tác nhân sử dụng máy tính và Responses API với các công cụ tích hợp sẵn. Tuy nhiên, để các tác nhân thực sự hữu ích, mọi người cần có khả năng tương tác sâu sắc hơn, trực quan hơn với các tác nhân ngoài chỉ văn bản - sử dụng ngôn ngữ nói tự nhiên để giao tiếp hiệu quả.
Hôm nay, chúng tôi ra mắt các mô hình âm thanh chuyển đổi giọng nói thành văn bản và văn bản thành giọng nói mới trong API—giúp xây dựng các trợ lý giọng nói mạnh mẽ hơn, có thể tùy chỉnh và thông minh hơn, mang lại giá trị thực sự. Các mô hình chuyển lời nói thành văn bản mới nhất của chúng tôi đặt ra một chuẩn mực hiện đại mới, vượt trội hơn các giải pháp hiện có về độ chính xác và độ tin cậy — đặc biệt là trong các tình huống khó khăn liên quan đến điểm nhấn, môi trường ồn ào và tốc độ giọng nói khác nhau. Những cải tiến này làm tăng độ tin cậy của phiên âm, làm cho các mô hình đặc biệt phù hợp cho các trường hợp sử dụng như trung tâm cuộc gọi của khách hàng, phiên âm ghi chú cuộc họp, v.v.
Lần đầu tiên, các nhà phát triển cũng có thể hướng dẫn mô hình chuyển văn bản thành giọng nói nói theo một cách cụ thể - ví dụ: “nói chuyện như một nhân viên dịch vụ khách hàng thông cảm” - mở ra một cấp độ tùy chỉnh mới cho các đại lý thoại. Điều này cho phép một loạt các ứng dụng phù hợp, từ giọng nói dịch vụ khách hàng đồng cảm và năng động hơn đến tường thuật biểu cảm cho trải nghiệm kể chuyện sáng tạo.
Chúng tôi đã ra mắt mô hình âm thanh đầu tiên của mình vào năm 2022 và kể từ đó, chúng tôi cam kết cải thiện trí thông minh, độ chính xác và độ tin cậy của các mô hình này. Với các mô hình âm thanh mới này, các nhà phát triển có thể xây dựng các hệ thống chuyển lời nói thành văn bản chính xác và mạnh mẽ hơn và giọng nói chuyển văn bản thành giọng nói biểu cảm, đặc trưng — tất cả đều nằm trong API.
Chúng tôi đang giới thiệu các mô hình mới gpt-4o-transcribe và gpt-4o-mini-transcribe với những cải tiến về tỷ lệ lỗi từ, khả năng nhận diện ngôn ngữ và độ chính xác tốt hơn so với các mô hình Whisper ban đầu.
gpt-4o-transcribe thể hiện hiệu suất Tỷ lệ lỗi từ (WER) được cải thiện so với các mô hình Whisper hiện có trên nhiều điểm chuẩn đã được thiết lập, phản ánh sự tiến bộ đáng kể trong công nghệ chuyển lời nói thành văn bản của chúng tôi. Những tiến bộ này xuất phát trực tiếp từ những đổi mới được nhắm mục tiêu trong học tập tăng cường và đào tạo giữa sâu rộng với các bộ dữ liệu âm thanh chất lượng cao, đa dạng.
Do đó, các mô hình chuyển lời nói thành văn bản mới này có thể nắm bắt tốt hơn các sắc thái của lời nói, giảm nhận dạng sai và tăng độ tin cậy của phiên âm, đặc biệt là trong các tình huống khó khăn liên quan đến trọng âm, môi trường ồn ào và tốc độ giọng nói khác nhau. Các mô hình này hiện đã có sẵn trong speech-to-text API(mở trong cửa sổ mới).
Tỷ lệ lỗi từ (WER) đo lường độ chính xác của các mô hình nhận dạng giọng nói bằng cách tính toán tỷ lệ phần trăm các từ được phiên âm sai so với bản phiên âm tham chiếu — WER càng thấp càng tốt và có nghĩa là càng ít lỗi. Các mô hình chuyển giọng nói thành văn bản mới nhất của chúng tôi đạt WER thấp hơn trên các bộ chuẩn, bao gồm FLEURS (Đánh giá học ít mẫu về các biểu diễn phổ quát của giọng nói)—một bộ chuẩn giọng nói đa ngôn ngữ bao phủ hơn 100 ngôn ngữ, sử dụng các mẫu âm thanh được phiên âm thủ công. Những kết quả này cho thấy độ chính xác phiên âm cao hơn và độ bao phủ ngôn ngữ mạnh mẽ hơn. Như thể hiện ở đây, các mô hình của chúng tôi luôn vượt trội hơn Whisper v2 và Whisper v3 trên tất cả các đánh giá ngôn ngữ.
Trên nền tảng FLEURS, các mô hình của chúng tôi mang lại tỷ lệ lỗi từ thấp hơn và hiệu năng đa ngôn ngữ mạnh mẽ. WER càng thấp càng tốt và có nghĩa là càng ít lỗi. Như thể hiện ở đây, các mô hình của chúng tôi phù hợp hoặc vượt trội hơn các mô hình hàng đầu khác trên hầu hết các ngôn ngữ chính.
Chúng tôi cũng đang tung ra một mô hình gpt-4o-mini-tts mới với khả năng điều khiển tốt hơn. Lần đầu tiên, các lập trình viên có thể “hướng dẫn” mô hình không chỉ nói gì mà còn cách nói—từ đó cho phép tạo ra những trải nghiệm được tùy chỉnh hơn cho các trường hợp sử dụng, từ dịch vụ khách hàng đến kể chuyện sáng tạo. Mô hình này có sẵn trong API chuyển văn bản thành giọng nói(mở trong cửa sổ mới). Lưu ý rằng các mô hình chuyển văn bản thành giọng nói này chỉ giới hạn ở các giọng nói nhân tạo, đặt trước mà chúng tôi giám sát để đảm bảo chúng phù hợp nhất với các cài đặt trước tổng hợp.
Các mô hình âm thanh mới của chúng tôi được xây dựng dựa trên kiến trúc GPT‑4o và GPT‑4O‑mini và được đào tạo trước rộng rãi trên các bộ dữ liệu chuyên dụng lấy âm thanh làm trung tâm, rất quan trọng trong việc tối ưu hóa hiệu suất mô hình. Cách tiếp cận được nhắm mục tiêu này cung cấp cái nhìn sâu sắc hơn về sắc thái giọng nói và cho phép hiệu suất vượt trội trên các tác vụ liên quan đến âm thanh.
Chúng tôi đã nâng cao kỹ thuật chưng cất, cho phép chuyển giao kiến thức từ các mô hình âm thanh lớn nhất của chúng tôi sang các mô hình nhỏ hơn, hiệu quả hơn. Tận dụng các phương pháp tự chơi tiên tiến, bộ dữ liệu chưng cất của chúng tôi nắm bắt hiệu quả các động lực đàm thoại thực tế, sao chép các tương tác thực sự của trợ lý người dùng. Điều này giúp các mô hình nhỏ hơn của chúng tôi mang lại chất lượng đàm thoại và khả năng đáp ứng tuyệt vời.
Đối với các mô hình chuyển lời nói thành văn bản của chúng tôi, chúng tôi đã tích hợp mô hình học tập tăng cường (RL), đẩy độ chính xác phiên âm lên mức hiện đại. Phương pháp này cải thiện đáng kể độ chính xác và giảm ảo giác, làm cho các giải pháp chuyển giọng nói thành văn bản của chúng tôi trở nên đặc biệt cạnh tranh trong các kịch bản nhận dạng giọng nói phức tạp.
Những phát triển này thể hiện sự tiến bộ trong lĩnh vực mô hình hóa âm thanh, kết hợp các phương pháp sáng tạo với các cải tiến thực tế để nâng cao hiệu suất trong các ứng dụng giọng nói.
Các mô hình âm thanh mới này hiện đã có sẵn cho tất cả các nhà phát triển – tìm hiểu thêm về việc xây dựng ứng dụng với âm thanh tại đây(mở trong cửa sổ mới). Đối với các nhà phát triển đã xây dựng trải nghiệm đàm thoại với các mô hình dựa trên văn bản, việc thêm các mô hình giọng nói thành văn bản và chuyển văn bản thành giọng nói của chúng tôi là cách đơn giản nhất để xây dựng tác nhân thoại. Chúng tôi đang phát hành một tích hợp với Agents SDK(mở trong cửa sổ mới) giúp đơn giản hóa quy trình phát triển này. Đối với các nhà phát triển muốn xây dựng trải nghiệm chuyển giọng nói thành giọng nói có độ trễ thấp, chúng tôi khuyên bạn nên xây dựng với các mô hình giọng nói thành giọng nói của chúng tôi trong API thời gian thực.
Nhìn về phía trước, chúng tôi có kế hoạch tiếp tục đầu tư vào việc cải thiện trí thông minh và độ chính xác của các mô hình âm thanh của mình và khám phá các cách để cho phép các nhà phát triển mang đến tiếng nói tùy chỉnh của riêng họ để xây dựng trải nghiệm cá nhân hóa hơn theo những cách phù hợp với tiêu chuẩn an toàn của chúng tôi. Ngoài ra, chúng tôi đang tiếp tục tham gia vào các cuộc trò chuyện với các nhà hoạch định chính sách, nhà nghiên cứu, nhà phát triển và các nhà sáng tạo xung quanh những thách thức và cơ hội mà tiếng nói tổng hợp có thể mang lại. Chúng tôi rất vui mừng khi thấy các nhà phát triển ứng dụng sáng tạo và sáng tạo sẽ xây dựng bằng cách sử dụng các khả năng âm thanh nâng cao này. Chúng tôi cũng sẽ đầu tư vào các phương thức khác — bao gồm video — để cho phép các nhà phát triển xây dựng trải nghiệm đại lý đa phương thức.
Tác giả
Trưởng nhóm nghiên cứu
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Bên đóng góp
Nghiên cứu
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Kỹ thuật
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Sản phẩm
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Nhà tài trợ lãnh đạo
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry