ప్రధాన కంటెంట్‌కి దాటండి
OpenAI

APIలో నెక్స్ట్-జెనరేషన్ ఆడియో మోడల్స్‌ను పరిచయం చేస్తున్నాము

వాయిస్ ఏజెంట్‌లకు శక్తినిచ్చే కొత్త ఆడియో మోడల్స్ సూట్, ఇప్పుడు ప్రపంచవ్యాప్తంగా డెవలపర్‌లకు లభ్యమవుతోంది.

OpenAI తరువాత తరం ఆడియో మోడల్స్ బ్లాగ్ హీరో చిత్రం
లోడ్ అవుతోంది…

28 ఆగస్టు, 2025 అప్‌డేట్: మేం రియల్‌టైమ్‌ API సాధారణ లభ్యతను ప్రకటించాం. ఇక్కడ మరింత తెలుసుకోండి.


గత కొన్ని నెలలుగా, ఆపరేటర్‌, డీప్ రీసెర్చ్, కంప్యూటర్-యూజింగ్ ఏజెంట్‌లు, మరియు బిల్ట్ ఇన్ టూల్స్‌తో‌తో Responses API వంటి విడుదలలతో, టెక్ట్స్-ఆధారిత ఏజెంట్‌లు—లేదా వినియోగదారుల తరఫున స్వతంత్రంగా పనులను పూర్తి చేసే సిస్టమ్‌ల— మేధస్సు, సామర్థ్యాలు, మరియు ఉపయోగకరతను ముందుకు తీసుకెళ్లడంలో మేం పెట్టుబడి పెట్టాం. అయితే, ఏజెంట్‌లు నిజంగా ఉపయోగకరంగా ఉండాలంటే, ప్రజలు కేవలం టెక్ట్స్‌కు మాత్రమే పరిమితం కాకుండా, సహజంగా మాట్లాడే భాష ఉపయోగించి సమర్థవంతంగా కమ్యూనికేట్ చేయడం ద్వారా ఏజెంట్‌లతో మరింత లోతైన, సహజమైన ఇంటరాక్షన్‌లు ఉండగలగాలి.

ఈరోజు, మేము APIలో కొత్త స్పీచ్-టు-టెక్ట్స్ మరియు టెక్ట్స్-టు-స్పీచ్ ఆడియో మోడల్‌లను ప్రారంభిస్తున్నాం—వాస్తవ విలువను అందించే మరింత శక్తివంతమైన, అనుకూలీకరించదగిన మరియు తెలివైన వాయిస్ ఏజెంట్‌లను నిర్మించడం సాధ్యం చేస్తుంది. మా తాజా స్పీచ్-టు-టెక్ట్స్ మోడల్స్ కొత్త స్టేట్-ఆఫ్-ది-ఆర్ట్ బెంచ్‌మార్క్‌ను స్థాపించాయి, ఖచ్చితత్వం మరియు విశ్వసనీయతలో ఉన్న పరిష్కారాలను మించిపోయాయి—ప్రత్యేకించి యాసలు, శబ్దభరిత వాతావరణాలు, మరియు భిన్నమైన మాట్లాడే వేగాలు వంటి సవాలుతో కూడిన పరిస్థితుల్లో. ఈ మెరుగుదలలు ట్రాన్స్‌స్క్రిప్షన్ విశ్వసనీయతను పెంచుతాయి, కస్టమర్ కాల్ సెంటర్లు, మీటింగ్ నోట్స్ ట్రాన్స్‌స్క్రిప్షన్ వంటి వినియోగ సందర్భాల కోసం మోడల్స్‌ను, ఇంకా మరిన్నింటిని ప్రత్యేకంగా అనుకూలంగా చేస్తాయి.

మొదటిసారిగా, డెవలపర్‌లు టెక్ట్స్-టు-స్పీచ్ మోడల్‌ను ఒక నిర్దిష్ట మార్గంలో మాట్లాడటానికి కూడా సూచించగలదు - ఉదాహరణకు, "సానుభూతిగల కస్టమర్ సర్వీస్ ఏజెంట్‌లాగా మాట్లాడండి" - ఇది వాయిస్ ఏజెంట్‌ల కోసం కొత్త స్థాయి కస్టమైజేషన్ అన్‌లాక్ చేస్తుంది. ఇది మరింత అనుభూతిపూర్వకమైన మరియు డైనమిక్ కస్టమర్ సర్వీస్ వాయిస్‌ల నుండి సృజనాత్మక కథన అనుభవాల కోసం వ్యక్తీకరణాత్మక నరేషన్ వరకు, అవసరాలకు అనుగుణంగా రూపొందించిన విస్తృత శ్రేణి అప్లికేషన్‌లను అందిస్తుంది.

మేం మా మొదటి ఆడియో మోడల్‌ను 2022 లో ప్రారంభించాం, అప్పటి నుండి, ఈ మోడల్స్ తెలివితేటలు, ఖచ్చితత్వం, మరియు విశ్వసనీయతను మెరుగుపరచడానికి మేం కట్టుబడి ఉన్నాం. ఈ కొత్త ఆడియో మోడల్స్‌తో, డెవలపర్‌లు మరింత ఖచ్చితమైన మరియు బలమైన స్పీచ్-టు-టెక్ట్ప్‌సిస్టమ్‌లు మరియు వ్యక్తీకరణతో కూడిన, పాత్రలతో నిండిన టెక్ట్స్-టు-స్పీచ్ వాయిస్‌లను—అన్నింటినీ API లోపలే—నిర్మించగలరు.

ప్రశాంతం
సర్ఫర్
ప్రొఫెషనల్
మెడ్వియల్ నైట్
నిజమైన నేరాల అభిమాని
బెడ్‌టైమ్ స్టోరీ

మా తాజా ఆడియో మోడల్స్ గురించి మరిన్ని వివరాలు

కొత్త స్పీచ్-టు-టెక్ట్ప్‌మోడల్స్

మేం కొత్త gpt-4o-transcribe మరియు gpt-4o-mini-transcribe మోడల్స్‌ను పరిచయం చేస్తున్నాం, ఇవి అసలు Whisper మోడల్స్‌తో పోలిస్తే పదాల పొరపాటు రేటు మరియు భాష గుర్తింపు, ఖచ్చితత్వంలో మెరుగుదల అందిస్తాయి.

gpt-4o-transcribe బహుళ స్థాపించబడిన బెంచ్‌మార్క్‌ల్లో ఇప్పటికే ఉన్న Whisper మోడల్స్ కంటే మెరుగైన వర్డ్ ఎర్రర్ రేట్ (WER) పనితీరును ప్రదర్శిస్తుంది, ఇది మా స్పీచ్-టు-టెక్ట్స్ టెక్నాలజీలో గణనీయమైన పురోగతిని ప్రతిబింబిస్తుంది. ఈ పురోగతులు రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్‌లో లక్ష్యిత ఆవిష్కరణలు మరియు వైవిధ్యమైన, అధిక-నాణ్యత గల ఆడియో డేటాసెట్‌‌లతొో విస్తృతమైన మిడ్‌ట్రైనింగ్ నుండి నేరుగా ఉద్భవించాయి.

దీని ఫలితంగా, ఈ కొత్త స్పీచ్-టు-టెక్ట్ప్‌మోడల్స్ ప్రసంగంలోని సూక్ష్మభేదాలను మెరుగ్గా గుర్తించగలవు, మరిముఖ్యంగా యాసలు, శబ్దభరిత వాతావరణాలు, మరియు మారుతున్న మాట్లాడే వేగాలు వంటి సవాలుతో కూడిన పరిస్థితుల్లో. తప్పు గుర్తింపులను తగ్గించగలవు, మరియు ట్రాన్స్‌క్రిప్షన్ నమ్మకాన్ని పెంచగలవు. ఈ మోడల్ ఇప్పుడు స్పీచ్-టు-టెక్ట్ప్‌API(కొత్త విండోలో తెరుచుకుంటుంది)లో అందుబాటులో ఉంది.

వర్డ్ ఎర్రర్ రేటు (WER) అనేది రిఫరెన్స్ ట్రాన్స్‌స్క్రిప్ట్‌తో పోల్చి తప్పుగా ట్రాన్స్‌స్క్రైబ్ అయిన పదాల శాతాన్ని లెక్కించడం ద్వారా స్పీచ్-రికగ్నిషన్ మోడల్స్ ఖచ్చితత్వాన్ని లెక్కిస్తుంది—WER తక్కువగా ఉంటే మంచిది మరియు అంటే తక్కువ లోపాలుంటాయి. మా తాజా స్పీచ్-టు-టెక్ట్స్ మోడల్‌లు బెంచ్‌మార్క్‌ల్లో తక్కువ WERని సాధిస్తాయి, వాటిలో FLEURS (ఫ్యూ-షాట్ లెర్నింగ్ ఇవాల్యుయేషన్ ఆఫ్ యూనివర్సల్ రిప్రజెంటేషన్స్ ఆఫ్ స్పీచ్) కూడా ఉంటుంది - ఇది మాన్యువల్‌గా ట్రాన్స్‌స్క్రైబ్ చేసిన ఆడియో నమూనాలను ఉపయోగించి 100 కంటే ఎక్కువ భాషలను విస్తరించి ఉన్న బహుభాషా ప్రసంగ బెంచ్‌మార్క్‌ల్లో తక్కువ WER‌ను సాధిస్తున్నాయి.. ఈ ఫలితాలు మెరుగైన ట్రాన్స్‌క్రిప్షన్ ఖచ్చితత్వాన్ని మరియు మరింత బలమైన భాషా కవరేజ్‌ను ప్రదర్శిస్తాయి. ఇక్కడ చూపించినట్లుగా, మా మోడల్స్ అన్ని భాషా మూల్యాంకనాల్లో Whisper v2 మరియు Whisper v3 కంటే నిరంతరం మెరుగైన పనితీరును కనబరుస్తున్నాయి.

FLEURSలో, మా మోడల్స్ తక్కువ WER మరియు బలమైన బహుభాషా పనితీరు అందిస్తాయి. తక్కువ WER మంచిది మరియు తక్కువ లోపాలు సూచిస్తుంది. ఇక్కడ చూపినట్లుగా, మా మోడల్స్ చాలా ప్రధాన భాషల్లో ఇతర ప్రముఖ మోడల్స్‌తో సమానంగా లేదా వాటికంటే మెరుగ్గా పనిచేస్తాయి.

కొత్త టెక్ట్స్-టు-స్పీచ్ మోడల్

మేం మెరుగైన నియంత్రణతో కొత్త gpt-4o-mini-tts మోడల్‌ను కూడా ప్రారంభిస్తున్నాం. మొదటిసారిగా, డెవలపర్‌లు మోడల్‌ను ఏమి చెప్పాలి మాత్రమే కాకుండా ఎలా చెప్పాలని కూడా “ఇన్‌స్ట్రక్ట్” చేయగలరు—దీంతో కస్టమర్ సర్వీస్ నుండి క్రియేటివ్ స్టోరీటెల్లింగ్ వరకు విస్తరించిన వినియోగ సందర్భాల కోసం మరింత అనుకూల అనుభవాలు సాధ్యమవుతాయి. మోడల్ టెక్ట్స్-టు-స్పీచ్ API(కొత్త విండోలో తెరుచుకుంటుంది)లో అందుబాటులో ఉంది. ఈ టెక్ట్స్-టు-స్పీచ్ మోడల్‌లు కృత్రిమ, ప్రీసెట్ వాయిస్‌లకు మాత్రమే పరిమితం అని గమనించండి. అవి సింథటిక్ ప్రీసెట్‌లకు నిరంతరం జత అవుతున్నాయా, లేదా అని నిర్ధారించడానికి మేం వాటిని పర్యవేక్షిస్తాం.

మోడల్స్‌కు వెనుక ఉన్న సాంకేతిక ఆవిష్కరణలు

అసలైన ఆడియో డేటాసెట్‌లతో ప్రీట్రైనింగ్

మా కొత్త ఆడియో మోడల్స్ GPT‑4o మరియు GPT‑4o‑mini ఆర్కిటెక్చర్లపై ఆధారపడి నిర్మించబడ్డాయి మరియు ప్రత్యేక ఆడియో-కేంద్రిత డేటాసెట్లపై విస్తృతంగా ప్రీట్రెయిన్ చేయబడ్డాయి, ఇవి మోడల్ పనితీరును మెరుగుపరచడంలో కీలకంగా ఉన్నాయి. ఈ లక్షిత విధానం మాటల సూక్ష్మ నైపుణ్యాలపై లోతైన అవగాహనను అందిస్తుంది మరియు ఆడియో-సంబంధిత పనులలో అసాధారణమైన పనితీరును సాధించడానికి సాయపడుతుంది.

అధునాతన డిస్టిల్లేషన్ పద్ధతులు

మేం మా డిస్టిలేషన్ పద్ధతులను మెరుగుపరిచాం, దీని ద్వారా మా అతిపెద్ద ఆడియో మోడల్స్ నుండి చిన్న, మరింత సమర్థవంతమైన మోడల్స్‌కు జ్ఞాన బదిలీ సాధ్యమవుతుంది. అధునాతన సెల్ఫ్-ప్లే పద్ధతులను ఉపయోగించి, మా డిస్టిల్లేషన్ డేటాసెట్లు వాస్తవిక సంభాషణ డైనమిక్స్‌ను సమర్థవంతంగా అందుకుంటాయి, నిజమైన యూజర్-అసిస్టెంట్ పరస్పర చర్యలను పునరుత్పత్తి చేస్తాయి. ఇది మా చిన్న మోడల్స్‌కు అద్భుతమైన సంభాషణ నాణ్యత మరియు స్పందనను అందించడంలో సహాయపడుతుంది.

రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ విధానం

మా స్పీచ్-టు-టెక్ట్స్ మోడల్స్ కోసం, మేం రీన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ (RL)-హెవీ పారాడిగ్మ్‌ను ఇంటిగ్రేట్ చేశాం ఇది ట్రాన్స్‌క్రిప్షన్ ఖచ్చితత్వాన్ని అత్యాధునిక స్థాయిలకు నెట్టివేసింది. ఈ విధానం ఖచ్చితత్వాన్ని గణనీయంగా మెరుగుపరుస్తుంది మరియు హాల్యూసినేషన్‌ను తగ్గిస్తుంది, తద్వారా సంక్లిష్టమైన స్పీచ్ రికగ్నిషన్ సందర్భాల్లో మా స్పీచ్-టు-టెక్ట్ప్‌పరిష్కారాలు అసాధారణంగా పోటీతత్త్వం కలిగినవిగా మారతాయి.

ఈ డెవలప్‌మెంట్‌లు ఆడియో మోడలింగ్ రంగంలో పురోగతిని సూచిస్తున్నాయి, ఇన్నోవేటివ్ విధానాలను ప్రాయోగిక మెరుగుదలలతో కలిపి, స్పీచ్ అప్లికేషన్‌ల్లో మెరుగైన పనితీరు కోసం ఉపయోగపడుతున్నాయి.

API లభ్యత

ఈ కొత్త ఆడియో మోడల్స్ ఇప్పుడు డెవలపర్‌లు అందరికీ లభ్యమవుతున్నాయి – ఆడియోతో బిల్డింగ్ గురించి మరింత ఇక్కడ(కొత్త విండోలో తెరుచుకుంటుంది) తెలుసుకోండి. ఇప్పటికే టెక్ట్ప్‌ఆధారిత మోడల్స్‌తో సంభాషణ అనుభవాలను సృష్టిస్తున్న డెవలపర్‌లకు, మా స్పీచ్-టు-టెక్ట్ప్‌మరియు టెక్ట్స్-టు-స్పీచ్ మోడల్స్‌ను చేర్చడం వాయిస్ ఏజెంట్‌ను సృష్టించడానికి అత్యంత సులభమైన మార్గం. ఈ డెవలప్‌మెంట్ ప్రక్రియను సులభతరం చేసే Agents SDK(కొత్త విండోలో తెరుచుకుంటుంది) తో ఒక ఇంటిగ్రేషన్‌ను మేము విడుదల చేస్తున్నాము. లో-లేటెన్సీ స్పీచ్-టు-స్పీచ్ అనుభవాలను నిర్మించాలనుకునే డెవలపర్‌లకు, రియల్‌టైమ్ APIలో మా స్పీచ్-టు-స్పీచ్ మోడల్స్‌తో నిర్మించమని మేం సిఫారసు చేస్తున్నాం.

తదుపరి ఏమిటి

ముందుకు చూస్తూ, మా ఆడియో మోడల్స్ తెలివితేటలు మరియు ఖచ్చితత్వాన్ని మెరుగుపరచడంలో పెట్టుబడి పెట్టడం కొనసాగించడానికి, అలాగే మా భద్రతా ప్రమాణాలకు అనుగుణంగా మరింత వ్యక్తిగత అనుభవాలను సృష్టించడానికి డెవలపర్‌లు తమ స్వంత కస్టమ్ వాయిస్‌లను తీసుకురావడానికి మార్గాలను అన్వేషించడానికి మేం ప్లాన్ చేస్తున్నాం. అదనంగా, మేం విధాననిర్ణేతలు, పరిశోధకులు, డెవలపర్లు, మరియు సృజనకర్తలతో సింథటిక్ వాయిస్లు అందించే సవాళ్లు మరియు అవకాశాలపై సంభాషణల్లో కొనసాగిస్తున్నాం. ఈ మెరుగైన ఆడియో సామర్థ్యాలను ఉపయోగించి డెవలపర్లు సృష్టించే వినూత్న మరియు సృజనాత్మక అనువర్తనాలను చూడటానికి మేము ఆతృతగా ఉన్నాం. డెవలపర్లు మల్టీమోడల్ ఏజెంటిక్ అనుభవాలను నిర్మించడానికి వీలు కల్పించేందుకు, వీడియోతో పాటు ఇతర మోడాలిటీల్లో కూడా మేం పెట్టుబడి పెడతాం.

లైవ్‌స్ట్రీమ్ రీప్లే

రచయితలు

OpenAI

పరిశోధన లీడ్‌లు

క్రిస్టినా కిమ్, జున్హువా మావో, యి షెన్, యు జాంగ్

సహకారులు

రీసెర్చ్

అలెక్స్ పైనో, బోవెన్ చెంగ్, చెంగ్‌షు జువాంగ్, క్రిస్ కోచ్, డామియన్ మ్రోవ్కా, ఎరిక్ రిట్టర్, జేకబ్ మెనిక్, జేమ్స్ బెట్కర్, జి లిన్, జామీ కిరోస్, జియాహుయ్ యు, లియాంగ్ జౌ, లియు చెన్, కెవిన్ లు, మాడెలైన్ బాయ్డ్, మైకేల్ లాంపే, మైక్ హీటన్, నాన్షిన్ చెన్, నితీష్ కేస్కర్, సాచి జైన్, సామ్ టోయిజర్, సోమయ్ జైన్, టావో షు, టోమర్ కాప్లాన్, వెయి హాన్, షియాంగ్‌నింగ్ చెన్, యే జియా

ఇంజనీరింగ్

అలీనా వు, ఆండ్రెస్ గార్సియా గార్సియా, అర్షి భట్నాగర్, అవిటల్ ఒలివర్, బ్రెండన్ క్విన్, క్రిస్టినా హువాంగ్, డేవిడ్ ఫాంగ్, డ్రాగోస్ ఒప్రికా, డొమినిక్ కుండెల్, ఎడెడ్ ఓయివో, ఇయారోస్లావ్ ట్వెర్డోఖ్‌లిబ్, జియాచెంగ్ ఫెంగ్, జే చెన్, జెనియా వరావ్వా, జోర్డన్ సిట్కిన్, జోసెఫ్ ఫ్లోరెన్సియో, లియెన్ మమిట్సుకా, మాడా అఫ్లాక్, మనోలి లియోడాకిస్, మార్క్ హడ్నాల్, నోవా మాక్కాలమ్, ఓలా ఒకెలోలా, పీటర్ బక్కుమ్, రోహన్ మెహతా, రొమైన్ హుయెట్, వానింగ్ జియాంగ్, వేన్ చాంగ్, యిలీ క్వియాన్

ప్రోడక్ట్

అనుభా శ్రీవాస్తవ, జాకీ షానన్, జెఫ్ హారిస్, రియా మియారా, జియోలిన్ హావో

లీడర్‌షిప్ స్పాన్సర్‌లు

ఐడాన్ క్లార్క్, ఆండ్రూ గిబియన్‌స్కీ, డేవిడ్ ససాకి, కెవిన్ వెయిల్, లియామ్ ఫెడస్, మార్క్ చెన్, నిక్ రైడర్, నిక్ టర్లీ, ఒలివియర్ గోడెమెంట్, ప్రఫుల్ల ధరివాల్, షెంగ్జియా జావో, షుచావో బి, షెర్విన్ వు, సుల్మాన్ చౌద్రీ