முக்கிய உள்ளடக்கத்திற்கு செல்க
OpenAI

API-இல் அடுத்த தலைமுறை ஆடியோ மாதிரிகள் அறிமுகம்

வாய்ஸ் ஏஜென்ட்களை இயக்குவதற்கான புதிய ஆடியோ மாடல்கள் தொகுப்பு, இப்போது உலகம் முழுவதும் உள்ள டெவலப்பர்களுக்கு கிடைக்கிறது.

OpenAI அடுத்த தலைமுறை ஆடியோ மாடல்கள் வலைப்பதிவு ஹீரோ படம்
ஏற்றுகிறது…

ஆகஸ்ட் 28, 2025 அன்று புதுப்பிக்கப்பட்டது: Realtime API இன் பொதுவான கிடைக்கும் தன்மையை நாங்கள் அறிவித்தோம். இங்கே மேலும் அறிக.


கடந்த சில மாதங்களாக, பயனர்களின் சார்பாக தன்னிச்சையாக பணிகளை நிறைவேற்றும் உரை-அடிப்படையிலான ஏஜென்ட்கள் — அதாவது அமைப்புகளின்— அறிவுத்திறன், திறன்கள் மற்றும் பயன்பாட்டுத் தன்மையை மேம்படுத்துவதில் நாங்கள் முதலீடு செய்து வருகிறோம்; இதில் Operator, Deep Research, Computer-Using Agents, மற்றும் உட்பொதிக்கப்பட்ட கருவிகளுடன் கூடிய Responses API போன்ற வெளியீடுகள் அடங்கும். எனினும், ஏஜென்ட்கள் உண்மையில் பயனுள்ளதாக இருக்க, மக்கள் வெறும் உரையைத் தாண்டி ஏஜென்ட்களுடன் மேலும் ஆழமான, மேலும் உள்ளுணர்வான ஊடாடல்களை மேற்கொள்ள முடியும்—இயற்கையான பேசும் மொழியைப் பயன்படுத்தி திறம்பட தொடர்பு கொள்ள வேண்டும்.

இன்று, API-யில் புதிய பேச்சிலிருந்து உரை மற்றும் உரையிலிருந்து பேச்சு ஆடியோ மாடல்களை அறிமுகப்படுத்துகிறோம் - இது உண்மையான மதிப்பை வழங்கும் மிகவும் சக்திவாய்ந்த, தனிப்பயனாக்கக்கூடிய மற்றும் அறிவார்ந்த குரல் ஏஜென்ட்களை உருவாக்குவதை சாத்தியமாக்குகிறது. எங்களின் சமீபத்திய பேச்சு-உரை மாடல்கள் புதிய அதிநவீன அளவுகோலை அமைத்து, துல்லியம் மற்றும் நம்பகத்தன்மையில் தற்போதைய தீர்வுகளை மிஞ்சுகின்றன, குறிப்பாக உச்சரிப்புகள், சத்தமுள்ள சூழல்கள் மற்றும் மாறுபடும் பேச்சு வேகங்களை உள்ளடக்கிய சவாலான சூழ்நிலைகளில். இந்த மேம்பாடுகள் உரைமாற்றத்தின் நம்பகத்தன்மையை அதிகரிக்கின்றன, இதனால் வாடிக்கையாளர் கால் சென்டர்கள், கூட்டக் குறிப்புகள் உரைமாற்றம் போன்ற பயன்பாட்டு நிலைகளுக்கு மாடல்கள் குறிப்பாக மிகவும் பொருத்தமானவையாகின்றன.

முதல் முறையாக, டெவலப்பர்கள் உரையிலிருந்து பேச்சு மாடலை ஒரு குறிப்பிட்ட முறையில் பேசுமாறு வழிமுறையிட முடியும்—உதாரணமாக, “அனுதாபமுள்ள வாடிக்கையாளர் சேவை பிரதிநிதி போல பேசுங்கள்”—இதன் மூலம் குரல் ஏஜென்ட்களுக்கு புதிய அளவிலான தனிப்பயனாக்கத்தைத் திறக்கிறது. இது அனுதாபமிக்க மற்றும் இயக்கமிக்க வாடிக்கையாளர் சேவை குரல்களிலிருந்து படைப்பாற்றல் கதை சொல்லல் அனுபவங்களுக்கான வெளிப்பாடான விவரிப்புவரை, தனிப்பயனாக்கப்பட்ட செயலிகளின் பரந்த வரம்பை செயல்படுத்துகிறது.

நாங்கள் எங்கள் முதல் ஆடியோ மாடலை 2022 இல் வெளியிட்டோம், அதன் பின்னர் இந்த மாடல்களின் நுண்ணறிவு, துல்லியம் மற்றும் நம்பகத்தன்மையை மேம்படுத்த நாங்கள் உறுதியாக உள்ளோம். இந்தப் புதிய ஆடியோ மாடல்கள் மூலம், டெவலப்பர்கள் மிகவும் துல்லியமான மற்றும் வலுவான பேச்சிலிருந்து உரை அமைப்புகளையும், வெளிப்படையான, சிறப்பியல்பு கொண்ட உரையிலிருந்து பேச்சு குரல்களையும் உருவாக்க முடியும் - இவை அனைத்தும் API-க்குள்.

அமைதி
சர்ஃபர்
புரொஃபெஷனல்
இடைக்கால மாவீரன்
உண்மையான குற்ற ஆர்வலர்
படுக்கை நேரக் கதை

எங்கள் சமீபத்திய ஆடியோ மாடல்கள் குறித்து மேலும் அறிக

புதிய பேச்சிலிருந்து உரை மாடல்கள்

அசல் Whisper மாடல்களுடன் ஒப்பிடும்போது, சொல் பிழை விகிதம் மற்றும் சிறந்த மொழி அங்கீகாரம் மற்றும் துல்லியத்தில் மேம்பாடுகளுடன் புதிய gpt-4o-transcribe மற்றும் gpt-4o-mini-transcribe மாடல்களை நாங்கள் அறிமுகப்படுத்துகிறோம்.

gpt-4o-transcribe பல நிறுவப்பட்ட அளவுகோல்களில் தற்போதைய Whisper மாடல்களை விட மேம்பட்ட சொல் பிழை விகிதம் (WER) செயல்திறனை காட்டுகிறது, இது எங்கள் பேச்சு-எழுத்து தொழில்நுட்பத்தில் குறிப்பிடத்தக்க முன்னேற்றத்தை பிரதிபலிக்கிறது. இந்த முன்னேற்றங்கள் ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங் (வலுவூட்டல் கற்றலில்) இலக்கு வைக்கப்பட்ட புதுமைகள் மற்றும் பல்வேறு, உயர்தர ஆடியோ தரவுத்தொகுப்புகளுடன் விரிவான இடைநிலைப் பயிற்சியிலிருந்து நேரடியாக உருவாகின்றன.

இதன் விளைவாக, இந்தப் புதிய பேச்சிலிருந்து உரை மாடல்கள், குறிப்பாக உச்சரிப்புகள், சத்தமான சூழல்கள் மற்றும் மாறுபட்ட பேச்சு வேகங்கள் உள்ளிட்ட சவாலான சூழ்நிலைகளில், பேச்சின் நுணுக்கங்களை சிறப்பாகப் படம்பிடிக்கவும், தவறான அங்கீகாரங்களைக் குறைக்கவும், படியெடுத்தல் நம்பகத்தன்மையை அதிகரிக்கவும் முடியும். இந்த மாடல்கள் இப்போது பேச்சிலிருந்து உரை API(புதிய சாளரத்தில் திறக்கும்) இல் கிடைக்கின்றன.

சொல் பிழை விகிதம் (WER) என்பது, ஒரு குறிப்பு டிரான்ஸ்கிரிப்ட்டுடன் ஒப்பிடும்போது தவறாக டிரான்ஸ்கிரிப்ட் செய்யப்பட்ட சொற்களின் சதவீதத்தைக் கணக்கிடுவதன் மூலம் பேச்சு-அங்கீகார மாடல்களின் துல்லியத்தை அளவிடுகிறது - குறைந்த WER சிறந்தது மற்றும் குறைவான பிழைகளைக் குறிக்கிறது. எங்கள் சமீபத்திய பேச்சிலிருந்து உரை மாடல்கள், FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) உட்பட, அனைத்து அளவுகோல்களிலும் குறைந்த WER ஐ அடைகின்றன - இது கைமுறையாக படியெடுக்கப்பட்ட ஆடியோ மாதிரிகளைப் பயன்படுத்தி 100 க்கும் மேற்பட்ட மொழிகளை உள்ளடக்கிய பன்மொழி பேச்சு அளவுகோலாகும். இந்த முடிவுகள் அதிகமான உரைமாற்ற துல்லியத்தையும் மேலும் உறுதியான மொழி பரப்பையும் காட்டுகின்றன. இங்கே காட்டப்பட்டுள்ளபடி, எங்கள் மாடல்கள் அனைத்து மொழி மதிப்பீடுகளிலும் Whisper v2 மற்றும் Whisper v3 ஐ விட தொடர்ந்து சிறப்பாக செயல்படுகின்றன.

FLEURS-இல், எங்கள் மாடல்கள் குறைந்த சொல் பிழை விகிதம் (WER) மற்றும் வலுவான பன்மொழி செயல்திறனை வழங்குகின்றன. குறைந்த WER சிறந்தது மற்றும் குறைவான பிழைகளை குறிக்கிறது. இங்கே காட்டப்பட்டுள்ளபடி, எங்கள் மாடல்கள் பெரும்பாலான முக்கிய மொழிகளில் மற்ற முன்னணி மாடல்களுடன் சமமாகவோ அல்லது அவற்றை விட சிறப்பாகவோ செயல்படுகின்றன.

புதிய உரையிலிருந்து பேச்சு மாடல்

நாங்கள் மேலும் சிறந்த ஸ்டியரபிலிட்டியுடன் புதிய gpt-4o-mini-tts மாடலை அறிமுகப்படுத்துகிறோம். முதல் முறையாக, டெவலப்பர்கள் மாடலுக்கு என்ன சொல்ல வேண்டும் என்பதோடு மட்டுமல்லாமல் அதை எப்படி சொல்ல வேண்டும் என்பதையும் “அறிவுறுத்த” முடிகிறது. இதனால் வாடிக்கையாளர் சேவை முதல் படைப்பாற்றல் கதைக்களம் வரை உள்ள பயன்பாட்டு நிகழ்வுகளுக்காக மேலும் தனிப்பயனாக்கப்பட்ட அனுபவங்களை உருவாக்க முடிகிறது. மாடல் உரையிலிருந்து பேச்சு API(புதிய சாளரத்தில் திறக்கும்) இல் கிடைக்கிறது. இந்த உரையிலிருந்து பேச்சு மாடல்கள் செயற்கையாக, முன்னமைக்கப்பட்ட குரல்களுக்கு மட்டுமே வரையறுக்கப்பட்டவை என்பதை கவனிக்கவும்; அவை தொடர்ந்து செயற்கை முன்னமைவுகளுடன் பொருந்துவதை உறுதிசெய்ய நாங்கள் அவற்றை கண்காணிக்கிறோம்.

மாடல்களின் பின்னணியில் உள்ள தொழில்நுட்ப நவீனங்கள்

உண்மையான ஆடியோ தரவுத்தொகுப்புகளுடன் முன் பயிற்சி செய்வது

எங்களின் புதிய ஆடியோ மாதிரிகள் GPT‑4o மற்றும் GPT‑4o‑mini கட்டமைப்புகளை அடிப்படையாகக் கொண்டு உருவாக்கப்பட்டுள்ளன மற்றும் மாடல் செயல்திறனை மேம்படுத்துவதில் முக்கிய பங்கு வகித்த சிறப்பு ஆடியோ-மைய தரவுத்தொகுப்புகளில் விரிவாக முன்பயிற்சி பெற்றுள்ளன. இந்த இலக்கு அணுகுமுறை பேச்சு நுணுக்கங்களைப் பற்றிய ஆழமான நுண்ணறிவை வழங்குகிறது மற்றும் ஆடியோ தொடர்பான பணிகளில் விதிவிலக்கான செயல்திறனை செயல்படுத்துகிறது.

மேம்பட்ட சுத்திகரிப்பு முறைவியல்கள்

நாங்கள் எங்கள் டிஸ்டிலேஷன் நுட்பங்களை மேம்படுத்தியுள்ளோம், இதனால் எங்களின் மிகப் பெரிய ஆடியோ மாடல்களிலிருந்து சிறிய மற்றும் திறமையான மாடல்களுக்கு அறிவைப் பரிமாற்றம் செய்ய முடிகிறது. மேம்பட்ட self-play முறைமைகளைப் பயன்படுத்தி, எங்கள் distillation தரவுத்தொகுப்புகள் உண்மையான உரையாடல் இயக்கவியலை திறம்படப் பிடித்து, உண்மையான பயனர்-உதவியாளர் தொடர்புகளை மீளுருவாக்குகின்றன. இது எங்கள் சிறிய மாடல்களுக்கு சிறந்த உரையாடல் தரத்தையும் பதிலளிக்கும் திறனையும் வழங்க உதவுகிறது.

ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங் (வலுவூட்டல் கற்றல்) அணுகுமுறை

எங்களின் பேச்சிலிருந்து உரை மாடல்களுக்காக, நாங்கள் ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங் (RL)-அடிப்படையிலான ஒரு அணுகுமுறையை ஒருங்கிணைத்துள்ளோம், இது டிரான்ஸ்கிரிப்ஷன் துல்லியத்தை முன்னணி நிலைகளுக்கு உயர்த்துகிறது. இந்த முறைமை துல்லியத்தை கணிசமாக மேம்படுத்தி, கற்பனையை குறைக்கிறது; இதனால் சிக்கலான பேச்சு அங்கீகார சூழ்நிலைகளில் எங்கள் பேச்சு-உரை தீர்வுகள் மிகுந்த போட்டித்திறன் பெறுகின்றன.

இந்த முன்னேற்றங்கள் ஆடியோ மாடலிங் துறையில் முன்னேற்றத்தை பிரதிநிதித்துவப்படுத்துகின்றன, புதுமையான முறைவியல் அணுகுமுறைகளை நடைமுறை மேம்பாடுகளுடன் இணைத்து, பேச்சு பயன்பாடுகளில் மேம்பட்ட செயல்திறனை வழங்குகின்றன.

API கிடைக்கும் நிலைமை

இந்த புதிய ஆடியோ மாடல்கள் இப்போது அனைத்து டெவலப்பர்களுக்கும் கிடைக்கின்றன – ஆடியோவுடன் உருவாக்குவது பற்றிய மேலும் தகவலுக்கு இங்கே(புதிய சாளரத்தில் திறக்கும்). உரை அடிப்படையிலான மாடல்களுடன் உரையாடல் அனுபவங்களை ஏற்கனவே உருவாக்கி வரும் டெவலப்பர்களுக்கு, எங்கள் பேச்சிலிருந்து உரை மற்றும் உரையிலிருந்து பேச்சு மாடல்களைச் சேர்ப்பது ஒரு குரல் ஏஜென்டை உருவாக்குவதற்கான மிக எளிய வழியாகும். இந்த மேம்பாட்டு செயல்முறையை எளிமைப்படுத்தும் Agents SDK(புதிய சாளரத்தில் திறக்கும்) உடன் ஒரு ஒருங்கிணைப்பை நாங்கள் வெளியிடுகிறோம். குறைந்த தாமதத்துடன் கூடிய பேச்சிலிருந்து பேச்சு அனுபவங்களை உருவாக்க விரும்பும் டெவலப்பர்களுக்கு, Realtime API-யில் உள்ள எங்கள் பேச்சிலிருந்து பேச்சு மாடல்களைப் பயன்படுத்தி உருவாக்க பரிந்துரைக்கிறோம்.

அடுத்தது என்ன

எதிர்காலத்தை நோக்கி, எங்கள் ஆடியோ மாடல்களின் நுண்ணறிவு மற்றும் துல்லியத்தை மேம்படுத்துவதில் தொடர்ந்து முதலீடு செய்யவும், எங்கள் பாதுகாப்புத் தரநிலைகளுடன் இணங்கும் வகையில் மேலும் தனிப்பயனாக்கப்பட்ட அனுபவங்களை உருவாக்க, டெவலப்பர்கள் தங்களின் சொந்த தனிப்பயன் குரல்களை கொண்டு வர அனுமதிக்கும் வழிகளை ஆராய நாங்கள் திட்டமிட்டுள்ளோம். மேலும், செயற்கை குரல்கள் வழங்கக்கூடிய சவால்கள் மற்றும் வாய்ப்புகள் குறித்து கொள்கை நிர்ணயர்கள், ஆராய்ச்சியாளர்கள், டெவலப்பர்கள், மற்றும் படைப்பாளர்களுடன் உரையாடல்களில் நாங்கள் தொடர்ந்து ஈடுபட்டு வருகிறோம். இந்த மேம்படுத்தப்பட்ட ஆடியோ திறன்களைப் பயன்படுத்தி டெவலப்பர்கள் உருவாக்கவிருக்கும் புதுமையான மற்றும் படைப்பாற்றலான பயன்பாடுகளைப் பார்க்க நாங்கள் மிகுந்த மகிழ்ச்சியில் உள்ளோம். டெவலப்பர்கள் பல்முக ஏஜென்டிக் அனுபவங்களை உருவாக்க இயலுமாறு, வீடியோ உட்பட மற்ற மோடாலிட்டிகளில் நாங்கள் முதலீடு செய்வோம்.

நேரடி ஒளிபரப்பு மறுபதிவு

ஆசிரியர்கள்

OpenAI

ஆராய்ச்சி தலைவர்கள்

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

பங்களிப்பாளர்கள்

ஆராய்ச்சி

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

என்ஜினியரிங்

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

தயாரிப்பு

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

தலைமையகம் ஆதரவாளர்கள்

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry