ขอแนะนำโมเดลเสียงเจนเนอเรชันถัดไปใน API
ชุดโมเดลเสียงใหม่เพื่อขับเคลื่อนตัวแทนเสียง พร้อมให้ใช้งานสำหรับนักพัฒนาทั่วโลกแล้ว

อัปเดตเมื่อวันที่ 28 สิงหาคม 2025: เราได้ประกาศเปิดให้ใช้งาน Realtime API อย่างเป็นทางการแล้ว เรียนรู้เพิ่มเติมที่นี่
ตลอดช่วงไม่กี่เดือนที่ผ่านมา เราได้ลงทุนเพื่อยกระดับความชาญฉลาด ความสามารถ และประโยชน์ใช้สอยของเอเจนต์แบบข้อความ—หรือระบบที่ทำงานให้สำเร็จอย่างอิสระในนามของผู้ใช้—ด้วยการเปิดตัว Operator, การวิจัยเชิงลึก, เอเจนต์ทำงานบนคอมพิวเตอร์แทนผู้ใช้ และ Responses API ที่มีเครื่องมือในตัว อย่างไรก็ตาม เพื่อให้เอเจนต์มีประโยชน์อย่างแท้จริง ผู้คนจำเป็นต้องสามารถมีปฏิสัมพันธ์กับเอเจนต์ได้ลึกซึ้งและเป็นธรรมชาติมากขึ้น นอกเหนือจากแค่ข้อความ โดยใช้ภาษาพูดตามธรรมชาติเพื่อสื่อสารได้อย่างมีประสิทธิภาพ
วันนี้ เรากำลังเปิดตัวโมเดลแปลงเสียงเป็นข้อความและแปลงข้อความเป็นเสียงใหม่ใน API—ทำให้สามารถสร้างเอเจนต์เสียงที่มีความสามารถสูง ปรับแต่งได้ และชาญฉลาดยิ่งขึ้น ซึ่งมอบคุณค่าที่แท้จริงได้ โมเดลแปลงเสียงเป็นข้อความรุ่นล่าสุดของเราสร้างมาตรฐานใหม่ที่ล้ำสมัย โดยมีความแม่นยำและความน่าเชื่อถือเหนือกว่าโซลูชันที่มีอยู่—โดยเฉพาะในสถานการณ์ที่ท้าทาย เช่น การพูดที่มีสำเนียง สภาพแวดล้อมที่มีเสียงรบกวน และความเร็วในการพูดที่แตกต่างกัน การปรับปรุงเหล่านี้ช่วยเพิ่มความน่าเชื่อถือของการถอดเสียง ทำให้โมเดลเหมาะสำหรับการใช้งาน เช่น ศูนย์บริการลูกค้า การถอดเสียงบันทึกการประชุม และอื่นๆ
เป็นครั้งแรกที่นักพัฒนาสามารถสั่งให้โมเดลแปลงข้อความเป็นเสียงพูดในลักษณะเฉพาะได้ เช่น “พูดเหมือนเจ้าหน้าที่บริการลูกค้าที่เห็นอกเห็นใจ” ซึ่งช่วยปลดล็อกการปรับแต่งในระดับใหม่สำหรับเอเจนต์เสียง สิ่งนี้เปิดโอกาสให้มีการใช้งานแอปพลิเคชันที่ปรับแต่งได้หลากหลาย ตั้งแต่เสียงบริการลูกค้าที่มีความเข้าอกเข้าใจและมีความไดนามิกมากขึ้น ไปจนถึงการบรรยายที่แสดงอารมณ์สำหรับประสบการณ์การเล่าเรื่องที่สร้างสรรค์
เราเปิดตัวโมเดลเสียงตัวแรกของเราใน 2022 และนับตั้งแต่นั้นมา เรามุ่งมั่นที่จะปรับปรุงความฉลาด ความแม่นยำ และความน่าเชื่อถือของโมเดลเหล่านี้ ด้วยโมเดลเสียงใหม่เหล่านี้ นักพัฒนาสามารถสร้างระบบแปลงเสียงเป็นข้อความที่มีความแม่นยำและแข็งแกร่งยิ่งขึ้น และเสียงแปลงข้อความเป็นเสียงที่มีความแสดงอารมณ์และมีลักษณะเฉพาะของตัวละคร—ทั้งหมดนี้ภายใน API
เรากำลังเปิดตัวโมเดลใหม่ gpt-4o-transcribe และ gpt-4o-mini-transcribe ที่มีการปรับปรุงอัตราความผิดพลาดของคำ การรู้จำภาษา และความแม่นยำที่ดียิ่งขึ้น เมื่อเทียบกับโมเดล Whisper รุ่นดั้งเดิม
gpt-4o-transcribe แสดงให้เห็นถึงการปรับปรุงประสิทธิภาพของอัตราความผิดพลาดของคำ (WER) เมื่อเทียบกับโมเดล Whisper ที่มีอยู่ในหลายเกณฑ์มาตรฐานที่ได้รับการยอมรับ ซึ่งสะท้อนถึงความก้าวหน้าที่สำคัญในเทคโนโลยีการแปลงเสียงเป็นข้อความของเรา ความก้าวหน้าเหล่านี้เกิดขึ้นโดยตรงจากนวัตกรรมที่มุ่งเน้นในด้านการเรียนรู้แบบเสริมกำลัง และการฝึกกลางอย่างเข้มข้นด้วยชุดข้อมูลเสียงที่หลากหลายและมีคุณภาพสูง
ด้วยเหตุนี้ โมเดลแปลงเสียงเป็นข้อความใหม่เหล่านี้จึงสามารถจับความละเอียดอ่อนของคำพูดได้ดีขึ้น ลดการรู้จำผิดพลาด และเพิ่มความน่าเชื่อถือของการถอดเสียง โดยเฉพาะในสถานการณ์ที่ท้าทายที่เกี่ยวข้องกับสำเนียง สภาพแวดล้อมที่มีเสียงรบกวน และความเร็วในการพูดที่แตกต่างกัน โมเดลเหล่านี้พร้อมใช้งานแล้วใน Speech-to-Text API(เปิดในหน้าต่างใหม่)
อัตราความผิดพลาดของคำ (WER) ใช้วัดความแม่นยำของโมเดลรู้จำเสียงพูด โดยคำนวณเป็นเปอร์เซ็นต์ของคำที่ถอดความผิดเมื่อเทียบกับบทถอดเสียงอ้างอิง ค่า WER ยิ่งต่ำยิ่งดีและหมายถึงมีข้อผิดพลาดน้อยลง โมเดลแปลงเสียงเป็นข้อความล่าสุดของเราทำให้ค่า WER ต่ำลงในเกณฑ์มาตรฐานต่าง ๆ รวมถึง FLEURS (few-shot Learning Evaluation of Universal Representations of Speech) ซึ่งเป็นเกณฑ์มาตรฐานคำพูดแบบหลายภาษาที่ครอบคลุมมากกว่า 100 ภาษา โดยใช้ตัวอย่างเสียงที่ถอดความด้วยมือ ผลลัพธ์เหล่านี้แสดงให้เห็นถึงความแม่นยำในการถอดเสียงที่สูงขึ้นและความครอบคลุมด้านภาษาที่แข็งแกร่งยิ่งขึ้น ดังที่แสดงไว้ที่นี่ โมเดลของเรามีประสิทธิภาพเหนือกว่า Whisper v2 และ Whisper v3 อย่างต่อเนื่องในการประเมินทุกภาษา
บน FLEURS โมเดลของเรามอบอัตราความผิดพลาดของคำ (WER) ที่ต่ำกว่าและประสิทธิภาพแบบหลายภาษาที่แข็งแกร่ง WER ยิ่งต่ำยิ่งดีและหมายถึงมีข้อผิดพลาดน้อยลง ดังที่แสดงไว้ที่นี่ โมเดลของเรามีประสิทธิภาพเทียบเท่าหรือเหนือกว่าโมเดลชั้นนำอื่น ๆ ในภาษาหลักส่วนใหญ่
เรากำลังเปิดตัวโมเดลใหม่ gpt-4o-mini-tts ที่มีความสามารถในการควบคุมทิศทางได้ดียิ่งขึ้น เป็นครั้งแรกที่นักพัฒนาสามารถ “สั่ง” โมเดลได้ ไม่ใช่แค่ว่าควรพูดอะไร แต่ยังรวมถึง วิธีการพูด ด้วย—ทำให้สามารถมอบประสบการณ์ที่ปรับแต่งได้มากขึ้นสำหรับกรณีการใช้งานตั้งแต่การบริการลูกค้าไปจนถึงการเล่าเรื่องเชิงสร้างสรรค์ โมเดลพร้อมใช้งานใน API แปลงข้อความเป็นเสียง(เปิดในหน้าต่างใหม่) โปรดทราบว่าโมเดลแปลงข้อความเป็นเสียงพูดเหล่านี้ถูกจำกัดให้ใช้เฉพาะเสียงประดิษฐ์ที่ตั้งค่าไว้ล่วงหน้า ซึ่งเราตรวจสอบเพื่อให้แน่ใจว่าเสียงเหล่านั้นตรงกับการตั้งค่าแบบสังเคราะห์อย่างสม่ำเสมอ
โมเดลเสียงใหม่ของเราต่อยอดจากสถาปัตยกรรม GPT‑4o และ GPT‑4o‑mini และได้รับการฝึกฝนอย่างเข้มข้นบนชุดข้อมูลเฉพาะทางที่เน้นเสียง ซึ่งมีความสำคัญอย่างยิ่งต่อการเพิ่มประสิทธิภาพของโมเดล แนวทางที่มุ่งเน้นนี้ให้ข้อมูลเชิงลึกที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับรายละเอียดปลีกย่อยของการพูด และช่วยให้มีประสิทธิภาพที่ยอดเยี่ยมในงานที่เกี่ยวข้องกับเสียง
เราได้พัฒนาเทคนิคการกลั่นของเราให้ก้าวหน้า ทำให้สามารถถ่ายทอดความรู้จากโมเดลเสียงขนาดใหญ่ที่สุดของเราไปยังโมเดลที่เล็กกว่าและมีประสิทธิภาพมากกว่าได้ ด้วยการใช้ระเบียบวิธีการเล่นกับตนเองขั้นสูง ชุดข้อมูลการกลั่นของเราสามารถจับพลวัตของการสนทนาที่สมจริงได้อย่างมีประสิทธิภาพ โดยจำลองการโต้ตอบระหว่างผู้ใช้และผู้ช่วยให้เหมือนจริง สิ่งนี้ช่วยให้โมเดลขนาดเล็กของเรามอบคุณภาพการสนทนาที่ยอดเยี่ยมและการตอบสนองที่ดี
สำหรับโมเดลแปลงเสียงเป็นข้อความของเรา เราได้ผสานกระบวนทัศน์ที่เน้นการเรียนรู้แบบเสริมกำลัง (RL) เป็นหลัก ซึ่งช่วยยกระดับความแม่นยำในการถอดเสียงไปสู่ระดับแนวหน้าของวงการ วิธีการนี้ช่วยเพิ่มความแม่นยำอย่างมากและลดการเกิดข้อผิดพลาด ทำให้โซลูชันการแปลงเสียงเป็นข้อความของเรามีความสามารถในการแข่งขันอย่างโดดเด่นในสถานการณ์การรู้จำเสียงพูดที่ซับซ้อน
ความก้าวหน้าเหล่านี้แสดงถึงความก้าวหน้าในด้านการสร้างแบบจำลองเสียง โดยผสานวิธีการที่เป็นนวัตกรรมเข้ากับการปรับปรุงเชิงปฏิบัติ เพื่อเพิ่มประสิทธิภาพในการใช้งานด้านเสียงพูด
โมเดลเสียงใหม่เหล่านี้พร้อมให้ใช้งานสำหรับนักพัฒนาทุกคนแล้ว ดูข้อมูลเพิ่มเติมเกี่ยวกับการพัฒนาด้วยเสียงได้ ที่นี่(เปิดในหน้าต่างใหม่) สำหรับนักพัฒนาที่กำลังสร้างประสบการณ์การสนทนาด้วยโมเดลข้อความอยู่แล้ว การเพิ่มโมเดลแปลงเสียงเป็นข้อความและข้อความเป็นเสียงของเราคือวิธีที่ง่ายที่สุดในการสร้างเอเจนต์เสียง เรากำลังเปิดตัวการผสานรวมกับ Agents SDK(เปิดในหน้าต่างใหม่) ที่ทำให้กระบวนการพัฒนานี้ง่ายขึ้น สำหรับนักพัฒนาที่ต้องการสร้างประสบการณ์การแปลงเสียงเป็นเสียงที่มีความหน่วงต่ำ เราแนะนำให้ใช้โมเดลการแปลงเสียงเป็นเสียงของเราใน Realtime API
มองไปข้างหน้า เราวางแผนที่จะลงทุนอย่างต่อเนื่องในการปรับปรุงความฉลาดและความแม่นยำของโมเดลเสียงของเรา และสำรวจวิธีการที่จะช่วยให้นักพัฒนาสามารถนำเสียงที่กำหนดเองมาใช้ เพื่อสร้างประสบการณ์ที่ปรับให้เหมาะกับแต่ละบุคคลได้มากยิ่งขึ้น ในลักษณะที่สอดคล้องกับมาตรฐานความปลอดภัยของเรา นอกจากนี้ เรายัง ดำเนินการต่อ ในการมีส่วนร่วมในการสนทนากับผู้กำหนดนโยบาย นักวิจัย นักพัฒนา และผู้สร้างสรรค์ เกี่ยวกับความท้าทายและโอกาสที่เสียงสังเคราะห์สามารถนำเสนอได้ เรารู้สึกตื่นเต้นที่จะได้เห็นแอปพลิเคชันที่เป็นนวัตกรรมและสร้างสรรค์ที่นักพัฒนาจะสร้างขึ้นโดยใช้ความสามารถด้านเสียงที่ได้รับการปรับปรุงเหล่านี้ เรายังจะลงทุนในรูปแบบอื่นๆ รวมถึงวิดีโอ เพื่อให้นักพัฒนาสามารถสร้างประสบการณ์มัลติโมดัลแบบเอเจนต์ได้
ผู้เขียน
การวิจัยนำหน้า
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
ผู้มีส่วนร่วม
งานวิจัย
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
วิศวกรรม
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
ฝ่ายผลิตภัณฑ์
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
ผู้สนับสนุนหลัก
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry