APIలో నెక్స్ట్-జెనరేషన్ ఆడియో మోడల్స్ను పరిచయం చేస్తున్నాము
వాయిస్ ఏజెంట్లకు శక్తినిచ్చే కొత్త ఆడియో మోడల్స్ సూట్, ఇప్పుడు ప్రపంచవ్యాప్తంగా డెవలపర్లకు లభ్యమవుతోంది.

28 ఆగస్టు, 2025 అప్డేట్: మేం రియల్టైమ్ API సాధారణ లభ్యతను ప్రకటించాం. ఇక్కడ మరింత తెలుసుకోండి.
గత కొన్ని నెలలుగా, ఆపరేటర్, డీప్ రీసెర్చ్, కంప్యూటర్-యూజింగ్ ఏజెంట్లు, మరియు బిల్ట్ ఇన్ టూల్స్తోతో Responses API వంటి విడుదలలతో, టెక్ట్స్-ఆధారిత ఏజెంట్లు—లేదా వినియోగదారుల తరఫున స్వతంత్రంగా పనులను పూర్తి చేసే సిస్టమ్ల— మేధస్సు, సామర్థ్యాలు, మరియు ఉపయోగకరతను ముందుకు తీసుకెళ్లడంలో మేం పెట్టుబడి పెట్టాం. అయితే, ఏజెంట్లు నిజంగా ఉపయోగకరంగా ఉండాలంటే, ప్రజలు కేవలం టెక్ట్స్కు మాత్రమే పరిమితం కాకుండా, సహజంగా మాట్లాడే భాష ఉపయోగించి సమర్థవంతంగా కమ్యూనికేట్ చేయడం ద్వారా ఏజెంట్లతో మరింత లోతైన, సహజమైన ఇంటరాక్షన్లు ఉండగలగాలి.
ఈరోజు, మేము APIలో కొత్త స్పీచ్-టు-టెక్ట్స్ మరియు టెక్ట్స్-టు-స్పీచ్ ఆడియో మోడల్లను ప్రారంభిస్తున్నాం—వాస్తవ విలువను అందించే మరింత శక్తివంతమైన, అనుకూలీకరించదగిన మరియు తెలివైన వాయిస్ ఏజెంట్లను నిర్మించడం సాధ్యం చేస్తుంది. మా తాజా స్పీచ్-టు-టెక్ట్స్ మోడల్స్ కొత్త స్టేట్-ఆఫ్-ది-ఆర్ట్ బెంచ్మార్క్ను స్థాపించాయి, ఖచ్చితత్వం మరియు విశ్వసనీయతలో ఉన్న పరిష్కారాలను మించిపోయాయి—ప్రత్యేకించి యాసలు, శబ్దభరిత వాతావరణాలు, మరియు భిన్నమైన మాట్లాడే వేగాలు వంటి సవాలుతో కూడిన పరిస్థితుల్లో. ఈ మెరుగుదలలు ట్రాన్స్స్క్రిప్షన్ విశ్వసనీయతను పెంచుతాయి, కస్టమర్ కాల్ సెంటర్లు, మీటింగ్ నోట్స్ ట్రాన్స్స్క్రిప్షన్ వంటి వినియోగ సందర్భాల కోసం మోడల్స్ను, ఇంకా మరిన్నింటిని ప్రత్యేకంగా అనుకూలంగా చేస్తాయి.
మొదటిసారిగా, డెవలపర్లు టెక్ట్స్-టు-స్పీచ్ మోడల్ను ఒక నిర్దిష్ట మార్గంలో మాట్లాడటానికి కూడా సూచించగలదు - ఉదాహరణకు, "సానుభూతిగల కస్టమర్ సర్వీస్ ఏజెంట్లాగా మాట్లాడండి" - ఇది వాయిస్ ఏజెంట్ల కోసం కొత్త స్థాయి కస్టమైజేషన్ అన్లాక్ చేస్తుంది. ఇది మరింత అనుభూతిపూర్వకమైన మరియు డైనమిక్ కస్టమర్ సర్వీస్ వాయిస్ల నుండి సృజనాత్మక కథన అనుభవాల కోసం వ్యక్తీకరణాత్మక నరేషన్ వరకు, అవసరాలకు అనుగుణంగా రూపొందించిన విస్తృత శ్రేణి అప్లికేషన్లను అందిస్తుంది.
మేం మా మొదటి ఆడియో మోడల్ను 2022 లో ప్రారంభించాం, అప్పటి నుండి, ఈ మోడల్స్ తెలివితేటలు, ఖచ్చితత్వం, మరియు విశ్వసనీయతను మెరుగుపరచడానికి మేం కట్టుబడి ఉన్నాం. ఈ కొత్త ఆడియో మోడల్స్తో, డెవలపర్లు మరింత ఖచ్చితమైన మరియు బలమైన స్పీచ్-టు-టెక్ట్ప్సిస్టమ్లు మరియు వ్యక్తీకరణతో కూడిన, పాత్రలతో నిండిన టెక్ట్స్-టు-స్పీచ్ వాయిస్లను—అన్నింటినీ API లోపలే—నిర్మించగలరు.
మేం కొత్త gpt-4o-transcribe మరియు gpt-4o-mini-transcribe మోడల్స్ను పరిచయం చేస్తున్నాం, ఇవి అసలు Whisper మోడల్స్తో పోలిస్తే పదాల పొరపాటు రేటు మరియు భాష గుర్తింపు, ఖచ్చితత్వంలో మెరుగుదల అందిస్తాయి.
gpt-4o-transcribe బహుళ స్థాపించబడిన బెంచ్మార్క్ల్లో ఇప్పటికే ఉన్న Whisper మోడల్స్ కంటే మెరుగైన వర్డ్ ఎర్రర్ రేట్ (WER) పనితీరును ప్రదర్శిస్తుంది, ఇది మా స్పీచ్-టు-టెక్ట్స్ టెక్నాలజీలో గణనీయమైన పురోగతిని ప్రతిబింబిస్తుంది. ఈ పురోగతులు రీఇన్ఫోర్స్మెంట్ లెర్నింగ్లో లక్ష్యిత ఆవిష్కరణలు మరియు వైవిధ్యమైన, అధిక-నాణ్యత గల ఆడియో డేటాసెట్లతొో విస్తృతమైన మిడ్ట్రైనింగ్ నుండి నేరుగా ఉద్భవించాయి.
దీని ఫలితంగా, ఈ కొత్త స్పీచ్-టు-టెక్ట్ప్మోడల్స్ ప్రసంగంలోని సూక్ష్మభేదాలను మెరుగ్గా గుర్తించగలవు, మరిముఖ్యంగా యాసలు, శబ్దభరిత వాతావరణాలు, మరియు మారుతున్న మాట్లాడే వేగాలు వంటి సవాలుతో కూడిన పరిస్థితుల్లో. తప్పు గుర్తింపులను తగ్గించగలవు, మరియు ట్రాన్స్క్రిప్షన్ నమ్మకాన్ని పెంచగలవు. ఈ మోడల్ ఇప్పుడు స్పీచ్-టు-టెక్ట్ప్API(కొత్త విండోలో తెరుచుకుంటుంది)లో అందుబాటులో ఉంది.
వర్డ్ ఎర్రర్ రేటు (WER) అనేది రిఫరెన్స్ ట్రాన్స్స్క్రిప్ట్తో పోల్చి తప్పుగా ట్రాన్స్స్క్రైబ్ అయిన పదాల శాతాన్ని లెక్కించడం ద్వారా స్పీచ్-రికగ్నిషన్ మోడల్స్ ఖచ్చితత్వాన్ని లెక్కిస్తుంది—WER తక్కువగా ఉంటే మంచిది మరియు అంటే తక్కువ లోపాలుంటాయి. మా తాజా స్పీచ్-టు-టెక్ట్స్ మోడల్లు బెంచ్మార్క్ల్లో తక్కువ WERని సాధిస్తాయి, వాటిలో FLEURS (ఫ్యూ-షాట్ లెర్నింగ్ ఇవాల్యుయేషన్ ఆఫ్ యూనివర్సల్ రిప్రజెంటేషన్స్ ఆఫ్ స్పీచ్) కూడా ఉంటుంది - ఇది మాన్యువల్గా ట్రాన్స్స్క్రైబ్ చేసిన ఆడియో నమూనాలను ఉపయోగించి 100 కంటే ఎక్కువ భాషలను విస్తరించి ఉన్న బహుభాషా ప్రసంగ బెంచ్మార్క్ల్లో తక్కువ WERను సాధిస్తున్నాయి.. ఈ ఫలితాలు మెరుగైన ట్రాన్స్క్రిప్షన్ ఖచ్చితత్వాన్ని మరియు మరింత బలమైన భాషా కవరేజ్ను ప్రదర్శిస్తాయి. ఇక్కడ చూపించినట్లుగా, మా మోడల్స్ అన్ని భాషా మూల్యాంకనాల్లో Whisper v2 మరియు Whisper v3 కంటే నిరంతరం మెరుగైన పనితీరును కనబరుస్తున్నాయి.
FLEURSలో, మా మోడల్స్ తక్కువ WER మరియు బలమైన బహుభాషా పనితీరు అందిస్తాయి. తక్కువ WER మంచిది మరియు తక్కువ లోపాలు సూచిస్తుంది. ఇక్కడ చూపినట్లుగా, మా మోడల్స్ చాలా ప్రధాన భాషల్లో ఇతర ప్రముఖ మోడల్స్తో సమానంగా లేదా వాటికంటే మెరుగ్గా పనిచేస్తాయి.
మేం మెరుగైన నియంత్రణతో కొత్త gpt-4o-mini-tts మోడల్ను కూడా ప్రారంభిస్తున్నాం. మొదటిసారిగా, డెవలపర్లు మోడల్ను ఏమి చెప్పాలి మాత్రమే కాకుండా ఎలా చెప్పాలని కూడా “ఇన్స్ట్రక్ట్” చేయగలరు—దీంతో కస్టమర్ సర్వీస్ నుండి క్రియేటివ్ స్టోరీటెల్లింగ్ వరకు విస్తరించిన వినియోగ సందర్భాల కోసం మరింత అనుకూల అనుభవాలు సాధ్యమవుతాయి. మోడల్ టెక్ట్స్-టు-స్పీచ్ API(కొత్త విండోలో తెరుచుకుంటుంది)లో అందుబాటులో ఉంది. ఈ టెక్ట్స్-టు-స్పీచ్ మోడల్లు కృత్రిమ, ప్రీసెట్ వాయిస్లకు మాత్రమే పరిమితం అని గమనించండి. అవి సింథటిక్ ప్రీసెట్లకు నిరంతరం జత అవుతున్నాయా, లేదా అని నిర్ధారించడానికి మేం వాటిని పర్యవేక్షిస్తాం.
మా కొత్త ఆడియో మోడల్స్ GPT‑4o మరియు GPT‑4o‑mini ఆర్కిటెక్చర్లపై ఆధారపడి నిర్మించబడ్డాయి మరియు ప్రత్యేక ఆడియో-కేంద్రిత డేటాసెట్లపై విస్తృతంగా ప్రీట్రెయిన్ చేయబడ్డాయి, ఇవి మోడల్ పనితీరును మెరుగుపరచడంలో కీలకంగా ఉన్నాయి. ఈ లక్షిత విధానం మాటల సూక్ష్మ నైపుణ్యాలపై లోతైన అవగాహనను అందిస్తుంది మరియు ఆడియో-సంబంధిత పనులలో అసాధారణమైన పనితీరును సాధించడానికి సాయపడుతుంది.
మేం మా డిస్టిలేషన్ పద్ధతులను మెరుగుపరిచాం, దీని ద్వారా మా అతిపెద్ద ఆడియో మోడల్స్ నుండి చిన్న, మరింత సమర్థవంతమైన మోడల్స్కు జ్ఞాన బదిలీ సాధ్యమవుతుంది. అధునాతన సెల్ఫ్-ప్లే పద్ధతులను ఉపయోగించి, మా డిస్టిల్లేషన్ డేటాసెట్లు వాస్తవిక సంభాషణ డైనమిక్స్ను సమర్థవంతంగా అందుకుంటాయి, నిజమైన యూజర్-అసిస్టెంట్ పరస్పర చర్యలను పునరుత్పత్తి చేస్తాయి. ఇది మా చిన్న మోడల్స్కు అద్భుతమైన సంభాషణ నాణ్యత మరియు స్పందనను అందించడంలో సహాయపడుతుంది.
మా స్పీచ్-టు-టెక్ట్స్ మోడల్స్ కోసం, మేం రీన్ఫోర్స్మెంట్ లెర్నింగ్ (RL)-హెవీ పారాడిగ్మ్ను ఇంటిగ్రేట్ చేశాం ఇది ట్రాన్స్క్రిప్షన్ ఖచ్చితత్వాన్ని అత్యాధునిక స్థాయిలకు నెట్టివేసింది. ఈ విధానం ఖచ్చితత్వాన్ని గణనీయంగా మెరుగుపరుస్తుంది మరియు హాల్యూసినేషన్ను తగ్గిస్తుంది, తద్వారా సంక్లిష్టమైన స్పీచ్ రికగ్నిషన్ సందర్భాల్లో మా స్పీచ్-టు-టెక్ట్ప్పరిష్కారాలు అసాధారణంగా పోటీతత్త్వం కలిగినవిగా మారతాయి.
ఈ డెవలప్మెంట్లు ఆడియో మోడలింగ్ రంగంలో పురోగతిని సూచిస్తున్నాయి, ఇన్నోవేటివ్ విధానాలను ప్రాయోగిక మెరుగుదలలతో కలిపి, స్పీచ్ అప్లికేషన్ల్లో మెరుగైన పనితీరు కోసం ఉపయోగపడుతున్నాయి.
ఈ కొత్త ఆడియో మోడల్స్ ఇప్పుడు డెవలపర్లు అందరికీ లభ్యమవుతున్నాయి – ఆడియోతో బిల్డింగ్ గురించి మరింత ఇక్కడ(కొత్త విండోలో తెరుచుకుంటుంది) తెలుసుకోండి. ఇప్పటికే టెక్ట్ప్ఆధారిత మోడల్స్తో సంభాషణ అనుభవాలను సృష్టిస్తున్న డెవలపర్లకు, మా స్పీచ్-టు-టెక్ట్ప్మరియు టెక్ట్స్-టు-స్పీచ్ మోడల్స్ను చేర్చడం వాయిస్ ఏజెంట్ను సృష్టించడానికి అత్యంత సులభమైన మార్గం. ఈ డెవలప్మెంట్ ప్రక్రియను సులభతరం చేసే Agents SDK(కొత్త విండోలో తెరుచుకుంటుంది) తో ఒక ఇంటిగ్రేషన్ను మేము విడుదల చేస్తున్నాము. లో-లేటెన్సీ స్పీచ్-టు-స్పీచ్ అనుభవాలను నిర్మించాలనుకునే డెవలపర్లకు, రియల్టైమ్ APIలో మా స్పీచ్-టు-స్పీచ్ మోడల్స్తో నిర్మించమని మేం సిఫారసు చేస్తున్నాం.
ముందుకు చూస్తూ, మా ఆడియో మోడల్స్ తెలివితేటలు మరియు ఖచ్చితత్వాన్ని మెరుగుపరచడంలో పెట్టుబడి పెట్టడం కొనసాగించడానికి, అలాగే మా భద్రతా ప్రమాణాలకు అనుగుణంగా మరింత వ్యక్తిగత అనుభవాలను సృష్టించడానికి డెవలపర్లు తమ స్వంత కస్టమ్ వాయిస్లను తీసుకురావడానికి మార్గాలను అన్వేషించడానికి మేం ప్లాన్ చేస్తున్నాం. అదనంగా, మేం విధాననిర్ణేతలు, పరిశోధకులు, డెవలపర్లు, మరియు సృజనకర్తలతో సింథటిక్ వాయిస్లు అందించే సవాళ్లు మరియు అవకాశాలపై సంభాషణల్లో కొనసాగిస్తున్నాం. ఈ మెరుగైన ఆడియో సామర్థ్యాలను ఉపయోగించి డెవలపర్లు సృష్టించే వినూత్న మరియు సృజనాత్మక అనువర్తనాలను చూడటానికి మేము ఆతృతగా ఉన్నాం. డెవలపర్లు మల్టీమోడల్ ఏజెంటిక్ అనుభవాలను నిర్మించడానికి వీలు కల్పించేందుకు, వీడియోతో పాటు ఇతర మోడాలిటీల్లో కూడా మేం పెట్టుబడి పెడతాం.
రచయితలు
పరిశోధన లీడ్లు
క్రిస్టినా కిమ్, జున్హువా మావో, యి షెన్, యు జాంగ్
సహకారులు
రీసెర్చ్
అలెక్స్ పైనో, బోవెన్ చెంగ్, చెంగ్షు జువాంగ్, క్రిస్ కోచ్, డామియన్ మ్రోవ్కా, ఎరిక్ రిట్టర్, జేకబ్ మెనిక్, జేమ్స్ బెట్కర్, జి లిన్, జామీ కిరోస్, జియాహుయ్ యు, లియాంగ్ జౌ, లియు చెన్, కెవిన్ లు, మాడెలైన్ బాయ్డ్, మైకేల్ లాంపే, మైక్ హీటన్, నాన్షిన్ చెన్, నితీష్ కేస్కర్, సాచి జైన్, సామ్ టోయిజర్, సోమయ్ జైన్, టావో షు, టోమర్ కాప్లాన్, వెయి హాన్, షియాంగ్నింగ్ చెన్, యే జియా
ఇంజనీరింగ్
అలీనా వు, ఆండ్రెస్ గార్సియా గార్సియా, అర్షి భట్నాగర్, అవిటల్ ఒలివర్, బ్రెండన్ క్విన్, క్రిస్టినా హువాంగ్, డేవిడ్ ఫాంగ్, డ్రాగోస్ ఒప్రికా, డొమినిక్ కుండెల్, ఎడెడ్ ఓయివో, ఇయారోస్లావ్ ట్వెర్డోఖ్లిబ్, జియాచెంగ్ ఫెంగ్, జే చెన్, జెనియా వరావ్వా, జోర్డన్ సిట్కిన్, జోసెఫ్ ఫ్లోరెన్సియో, లియెన్ మమిట్సుకా, మాడా అఫ్లాక్, మనోలి లియోడాకిస్, మార్క్ హడ్నాల్, నోవా మాక్కాలమ్, ఓలా ఒకెలోలా, పీటర్ బక్కుమ్, రోహన్ మెహతా, రొమైన్ హుయెట్, వానింగ్ జియాంగ్, వేన్ చాంగ్, యిలీ క్వియాన్
ప్రోడక్ట్
అనుభా శ్రీవాస్తవ, జాకీ షానన్, జెఫ్ హారిస్, రియా మియారా, జియోలిన్ హావో
లీడర్షిప్ స్పాన్సర్లు
ఐడాన్ క్లార్క్, ఆండ్రూ గిబియన్స్కీ, డేవిడ్ ససాకి, కెవిన్ వెయిల్, లియామ్ ఫెడస్, మార్క్ చెన్, నిక్ రైడర్, నిక్ టర్లీ, ఒలివియర్ గోడెమెంట్, ప్రఫుల్ల ధరివాల్, షెంగ్జియా జావో, షుచావో బి, షెర్విన్ వు, సుల్మాన్ చౌద్రీ