ወደ ዋና ይዘት እለፍ
OpenAI

20 ማርች 2025

ልቀትምርት

በAPI ውስጥ የቀጣይ ትውልድ የድምጽ ሞዴሎች ማስተዋወቅ

የድምጽ ወኪሎችን ለማብቃት አዲስ የድምጽ ሞዴሎች ስብስብ፣ አሁን በዓለም ዙሪያ ላሉ ገንቢዎች ይገኛል።

የOpenAI ቀጣይ ትውልድ የድምጽ ሞዴሎች የብሎግ ጀግና ምስል
በመጫን ላይ…

ኦገስት 28፣ እ.ኤ.አ 2025 ላይ የወጣ ዝማኔ፦ የእውነተኛ ጊዜ API አጠቃላይ ተገኝነትን አሳውቀናል።እዚህ የበለጠ ይወቁ


ባለፉት ጥቂት ወራት ውስጥ፣ እንደ Operator፣ ጥልቅ ምርምር፣ የኮምፒውተር አጠቃቀም ወኪሎች እና አብሮገነብ መሣሪያዎች ያሉት የምላሽ API ያሉ ልቀቶችን በመጠቀም የጽሑፍ ላይ የተመሰረቱ ወኪሎችን—ወይም በተጠቃሚዎች ምትክ ተግባራትን በተናጥል የሚያከናውኑ ሥርዓቶችን—ብልህነት፣ ችሎታዎች እና ጠቃሚነት ለማሳደግ ኢንቨስት አድርገናል። ይሁን እንጂ፣ ወኪሎች በእውነት ጠቃሚ እንዲሆኑ፣ ሰዎች ከጽሑፍ ባሻገር ከወኪሎች ጋር ጥልቅ እና የበለጠ ለመረዳት የሚያስችሉ ግንኙነቶችን ማድረግ መቻል አለባቸው—ይህም ውጤታማ በሆነ መንገድ ለመግባባት ተፈጥሯዊ የንግግር ቋንቋን መጠቀም ነው።

ዛሬ፣ በAPI ውስጥ አዳዲስ የንግግር-ወደ-ጽሑፍ እና የጽሑፍ-ወደ-ንግግር የድምጽ ሞዴሎችን እየጀመርን ነው—ይህም የበለጠ ኃይለኛ፣ ሊበጁ የሚችሉ እና እውነተኛ ዋጋ የሚሰጡ ብልህ የድምጽ ወኪሎችን መገንባት እንድንችል ያስችለናል። የቅርብ ጊዜ የንግግር-ወደ-ጽሑፍ ሞዴሎቻችን አዲስ ዘመናዊ መለኪያ አዘጋጅተዋል፣ በተለይም ዘዬዎችን፣ ጫጫታ ባለባቸው አካባቢዎች እና የተለያዩ የንግግር ፍጥነትን በሚያካትቱ ፈታኝ ሁኔታዎች ውስጥ ከነባር ትክክለኛ እና አስተማማኝነት—አንፃር የተሻሉ መፍትሄዎችን ያሳያሉ። እነዚህ ማሻሻያዎች የፅሁፍ ቅጂ አስተማማኝነትን ይጨምራሉ፣ ይህም ሞዴሎቹን በተለይ ለደንበኛ ጥሪ ማዕከላት፣ ለስብሰባ ማስታወሻ ግልባጭ እና ለሌሎችም ለአጠቃቀም ጉዳዮች በጣም ተስማሚ ያደርጋቸዋል።

ለመጀመሪያ ጊዜ ገንቢዎች የጽሑፍ-ወደ-ንግግር ሞዴሉን በተወሰነ መንገድ እንዲናገር ማስተማር ይችላሉ—ለምሳሌ፣ «እንደ አዛኝ የደንበኛ አገልግሎት ወኪል ይናገሩ»—ይህም ለድምጽ ወኪሎች አዲስ የማበጀት ደረጃን ይከፍታል። ይህ ከበለጠ ርህራሄ እና ተለዋዋጭ የደንበኞች አገልግሎት ድምጾች እስከ ለፈጠራ ታሪክ አጻጻፍ ተሞክሮዎች ገላጭ ትረካ ድረስ የተለያዩ የተበጁ አፕሊኬሽኖችን ያስችላል።

የመጀመሪያውን የድምጽ ሞዴላችንን እ.ኤ.አ በ2022 ጀምረናል፣ ከዚያን ጊዜ ጀምሮ የእነዚህን ሞዴሎች ብልህነት፣ ትክክለኛነት እና አስተማማኝነት ለማሻሻል ቁርጠኛ ሆነናል። በእነዚህ አዳዲስ የድምጽ ሞዴሎች፣ ገንቢዎች የበለጠ ትክክለኛ እና ጠንካራ የንግግር-ወደ-ጽሑፍ ሥርዓቶችን እና ገላጭ፣ ገጸ-ባህሪ ያላቸው የጽሑፍ-ወደ-ንግግር ድምጾችን መገንባት ይችላሉ—ሁሉም በAPI ውስጥ መገንባት ይችላሉ።

ጸጥ ያለ
ሰርፈር
ሙያዊ
የመካከለኛው ዘመን ባላባት
እውነተኛ የወንጀል አዋቂ
የመኝታ ሰዓት ታሪክ

ስለ የቅርብ ጊዜ የድምጽ ሞዴሎቻችን ተጨማሪ

አዲስ የንግግር-ወደ-ጽሑፍ ሞዴሎች

ከመጀመሪያዎቹ የWhisper ሞዴሎች ጋር ሲነጻጸር በቃላት ስህተት መጠን እና የተሻለ የቋንቋ እውቅና እና ትክክለኛነት ላይ የተሻሻሉ አዳዲስ gpt-4o-transcribe እና gpt-4o-mini-transcribe ሞዴሎችን እያስተዋወቅን ነው።

gpt-4o-transcribe በበርካታ የተቋቋሙ መለኪያዎች ላይ ካሉ ነባር የWhisper ሞዴሎች ጋር ሲነጻጸር የተሻሻለ የቃል ስህተት ፍጥነት (WER) አፈፃፀም ያሳያል፣ ይህም በንግግር-ወደ-ጽሑፍ ቴክኖሎጂያችን ውስጥ ጉልህ የሆነ እድገትን ያንፀባርቃል። እነዚህ እድገቶች በቀጥታ የሚመነጩት በማጠናከሪያ ትምህርት ውስጥ ከተነጣጠሩ ፈጠራዎች እና ከተለያዩ እና ከፍተኛ ጥራት ያላቸው የውሂብ ስብስቦች ጋር ሰፊ የመካከለኛ ስልጠናን በመጠቀም ነው።

በዚህም ምክንያት፣ እነዚህ አዳዲስ የንግግር-ወደ-ጽሑፍ ሞዴሎች የንግግርን ልዩነቶች በተሻለ ሁኔታ መያዝ፣ የተሳሳቱ ግንዛቤዎችን መቀነስ እና በተለይም አነጋገርን፣ ጫጫታ ያላቸውን አካባቢዎች እና የተለያዩ የንግግር ፍጥነትን በሚያካትቱ ፈታኝ ሁኔታዎች ውስጥ የንግግር አስተማማኝነትን ሊጨምሩ ይችላሉ። እነዚህ ሞዴሎች አሁን በንግግር-ወደ-ጽሑፍ API(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ ይገኛሉ።

የቃላት ስህተት መጠን (WER) የንግግር ማወቂያ ሞዴሎችን ትክክለኛነት የሚለካው ከማጣቀሻ ጽሑፍ ጋር ሲነጻጸር በስህተት የተገለበጡ ቃላትን መቶኛ በማስላት ነው—ዝቅተኛው WER የተሻለ ሲሆን ይህም ማለት ያነሱ ስህተቶች ማለት ነው። የቅርብ ጊዜ የንግግር-ወደ-ጽሑፍ ሞዴሎቻችን በመለኪያዎች ውስጥ ዝቅተኛ WER አግኝተዋል፣ FLEURS (እጥር ምጥን የመማሪያ ግምገማ የአጠቃላይ የንግግር ውክልና ግምገማ)—በእጅ የተገለበጡ የድምጽ ናሙናዎችን በመጠቀም ከ100 በላይ ቋንቋዎችን የሚሸፍን ባለብዙ ቋንቋ የንግግር መለኪያ ጨምሮ። እነዚህ ውጤቶች የበለጠ ጠንካራ የጽሑፍ ግልባጭ ትክክለኛነት እና የበለጠ ጠንካራ የቋንቋ ሽፋን ያሳያሉ። እዚህ ላይ እንደሚታየው፣ ሞዴሎቻችን በሁሉም የቋንቋ ግምገማዎች ውስጥ ከWhisper v2 እና ከWhisper v3 ጋር በተከታታይ ይበልጣሉ።

በFLEURS ላይ፣ ሞዴሎቻችን ዝቅተኛ WER እና ጠንካራ ባለብዙ ቋንቋ አፈፃፀም ያቀርባሉ። ዝቅተኛው WER የተሻለ ሲሆን ይህም ማለት ጥቂት ስህተቶች ማለት ነው። እዚህ ላይ እንደሚታየው፣ ሞዴሎቻችን በአብዛኛዎቹ ዋና ዋና ቋንቋዎች ውስጥ ካሉ ሌሎች መሪ ሞዴሎች ጋር ይጣጣማሉ ወይም ይበልጣሉ።

አዲስ የጽሑፍ-ወደ-ንግግር ሞዴል

እንዲሁም የተሻለ የመንዳት አቅም ያለው አዲስ gpt-4o-mini-tts ሞዴል እየጀመርን ነው። ለመጀመሪያ ጊዜ ገንቢዎች ሞዴሉን ምን ማለት እንዳለበት ብቻ ሳይሆን እንዴት መናገር እንዳለበትም «ማስተማር» ይችላሉ—ይህም ከደንበኛ አገልግሎት እስከ የፈጠራ ታሪክ አጻጻፍ ድረስ ለአጠቃቀም ጉዳዮች የበለጠ ብጁ ተሞክሮዎችን ያስችላል። ሞዴሉ በጽሑፍ-ወደ-ንግግር API(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ ይገኛል። እነዚህ የጽሑፍ-ወደ-ንግግር ሞዴሎች በሰው ሠራሽ፣ ቅድመ-ቅምጦች ብቻ የተገደቡ መሆናቸውን ልብ ይበሉ፣ እነዚህንም በተከታታይ ከሰው ሠራሽ ቅድመ-ቅምጦች ጋር እንዲዛመዱ ለማረጋገጥ እንከታተላለን።

ከሞዴሎቹ በስተጀርባ ያሉ የቴክኒክ ፈጠራዎች

ከእውነተኛ የድምጽ ውሂብ ስብስቦች ጋር ቅድመ-ስልጠና

አዲሶቹ የድምጽ ሞዴሎቻችን በGPT‑4o እና GPT‑4o‑ሚኒ አርክቴክቸር ላይ የተመሰረቱ ሲሆኑ የሞዴል አፈጻጸምን በማመቻቸት ረገድ ወሳኝ በሆኑ ልዩ የድምጽ-ተኮር የውሂብ ስብስቦች ላይ በስፋት አስቀድመው የሰለጠኑ ናቸው። ይህ የታለመ አቀራረብ የንግግር ልዩነቶችን በጥልቀት ለመረዳት ያስችላል እና ከድምጽ ጋር በተያያዙ ተግባራት ላይ ልዩ አፈፃፀም እንዲኖር ያስችላል።

የላቀ የማጣራት ዘዴዎች

የማጣራት ዘዴዎቻችንን አሻሽለናል፣ ይህም ከትልቁ የድምጽ ሞዴሎቻችን ወደ ትናንሽ እና የበለጠ ቀልጣፋ ሞዴሎች እውቀት ማስተላለፍን ያስችላል። የላቁ የራስ-ጨዋታ ዘዴዎችን በመጠቀም፣ የማጣራት ውሂብ ስብስቦቻችን እውነተኛ የተጠቃሚ-ረዳት ግንኙነቶችን በመድገም ተጨባጭ የውይይት ተለዋዋጭነትን በብቃት ይይዛሉ። ይህ ትናንሽ ሞዴሎቻችን እጅግ በጣም ጥሩ የውይይት ጥራት እና ምላሽ ሰጪነት እንዲያቀርቡ ይረዳቸዋል።

የማጠናከሪያ ትምህርት ፓራዲየም

ከንግግር ወደ ጽሑፍ ሞዴሎቻችን ጋር በተያያዘ፣ የማጠናከሪያ ትምህርት (RL)-ከባድ ፓራዲየምን አዋህደናል፣ ይህም የጽሑፍ ግልባጭ ትክክለኛነትን ወደ ዘመናዊ ደረጃዎች እንዲደርስ አድርጓል። ይህ ዘዴ ትክክለኛነትን በእጅጉ ያሻሽላል እና ቅዠትን ይቀንሳል፣ ይህም የንግግር-ወደ-ጽሑፍ መፍትሔዎቻችን ውስብስብ የንግግር ማወቂያ ሁኔታዎች ውስጥ እጅግ በጣም ተወዳዳሪ እንዲሆኑ ያደርጋቸዋል።

እነዚህ እድገቶች በድምጽ ሞዴሊንግ መስክ ውስጥ ያለውን እድገት ይወክላሉ፣ ፈጠራ ያላቸውን ዘዴዎች ከተግባራዊ ማሻሻያዎች ጋር በማጣመር በንግግር አፕሊኬሽኖች ውስጥ የተሻሻለ አፈፃፀምን ያሳያሉ።

API ተገኝነት

እነዚህ አዳዲስ የድምጽ ሞዴሎች አሁን ለሁሉም ገንቢዎች ይገኛሉ – ተጨማሪ ስለ ድምጽ ግንባታ እዚህ(በአዲስ መስኮት ውስጥ ይክፈታል)። አስቀድመው በጽሑፍ ላይ በተመሰረቱ ሞዴሎች የውይይት ተሞክሮዎችን ለሚገነቡ ገንቢዎች፣ የንግግር-ወደ-ጽሑፍ እና የጽሑፍ-ወደ-ንግግር ሞዴሎቻችንን ማከል የድምጽ ወኪል ለመገንባት ቀላሉ መንገድ ነው። ይህንን የልማት ሂደት የሚያቃልል ከAgents SDK(በአዲስ መስኮት ውስጥ ይክፈታል) ጋር ውህደት እየለቀቅን ነው። ዝቅተኛ መዘግየት ያለው የንግግር-ወደ-ንግግር ተሞክሮዎችን ለመገንባት ለሚፈልጉ ገንቢዎች፣ በእውነተኛ ጊዜ API ውስጥ ከንግግር-ወደ-ንግግር ሞዴሎቻችን ጋር እንዲገነቡ እንመክራለን።

ቀጣይ ምን ይሆናል?

ወደፊት ስንመለከት፣ የድምጽ ሞዴሎቻችንን ብልህነት እና ትክክለኛነት ለማሻሻል እና ገንቢዎች የራሳቸውን ብጁ ድምጾች ይዘው ከደኅንነት መስፈርቶቻችን ጋር በሚጣጣሙ መንገዶች የበለጠ ግላዊ ልምዶችን እንዲገነቡ የሚያስችሉ መንገዶችን በማሰስ ላይ ኢንቨስት ማድረጋችንን ለመቀጠል አቅደናል። በተጨማሪም፣ ሰው ሠራሽ ድምጾች ሊያቀርቧቸው ስለሚችሏቸው ተግዳሮቶች እና እድሎች ከፖሊሲ አውጪዎች፣ ተመራማሪዎች፣ ገንቢዎች እና ፈጣሪዎች ጋር ውይይቶችን ማድረጋችንን እንቀጥላለን። ገንቢዎች እነዚህን የተሻሻሉ የድምጽ ችሎታዎች በመጠቀም የሚገነቡትን የፈጠራ እና የፈጠራ መተግበሪያዎች በማየታችን በጣም ደስተኞች ነን። ገንቢዎች ባለብዙ ሞዳል ወኪል ተሞክሮዎችን እንዲገነቡ ለማስቻል—ቪዲዮን ጨምሮ—በሌሎች ዘዴዎች ላይ ኢንቨስት እናደርጋለን።

የቀጥታ ስርጭት ዳግም ማሳያ

ደራሲዎች

OpenAI

የምርምር መሪዎች

Christina Kim፣ Junhua Mao፣ Yi Shen፣ Yu Zhang

አስተዋጽኦ አበርካቾች

ምርምር

Alex Paino፣ Bowen Cheng፣ Chengxu Zhuang፣ Chris Koch፣ Damian Mrowca፣ Erik Ritter፣ Jacob Menick፣ James Betker፣ Ji Lin፣ Jamie Kiros፣ Jiahui Yu፣ Liang Zhou፣ Liyu Chen፣ Kevin Lu፣ Madeline Boyd፣ Michael Lampe፣ Mike Heaton፣ Nanxin Chen፣ Nitish Keskar፣ Saachi Jain፣ Sam Toizer፣ Somay Jain፣ Tao Xu፣ Tomer Kaplan፣ Wei Han፣ Xiangning Chen፣ Ye Jia

ምህንድስና

Alina Wu፣ Andres Garcia Garcia፣ Arshi Bhatnagar፣ Avital Oliver፣ Brendan Quinn፣ Christina Huang፣ David Fang፣ Dragos Oprica፣ Dominik Kundel፣ Edede Oiwoh፣ Iaroslav Tverdokhlib፣ Jiacheng Feng፣ Jay Chen፣ Jenia Varavva፣ Jordan Sitkin፣ Joseph Florencio፣ Lien Mamitsuka፣ Mada Aflak፣ Manoli Liodakis፣ Mark Hudnall፣ Noah MacCallum፣ Ola Okelola፣ Peter Bakkum፣ Rohan Mehta፣ Romain Huet፣ Wanning Jiang፣ Wayne Chang፣ Yilei Qian

ምርት

Anubha Srivastava፣ Jackie Shannon፣ Jeff Harris፣ Reah Miyara፣ Xiaolin Hao

አመራር ድጋፍ ሰጪዎች

Aidan Clark፣ Andrew Gibiansky፣ David Sasaki፣ Kevin Weil፣ Liam Fedus፣ Mark Chen፣ Nick Ryder፣ Nick Turley፣ Olivier Godement፣ Prafulla Dhariwal፣ Shengjia Zhao፣ Shuchao Bi፣ Sherwin Wu፣ Sulman Choudhry