API میں اگلی جنریشن کے ماڈلز متعارف کرانا
وائس ایجنٹس کو طاقت فراہم کرنے والے آڈیو ماڈلز کا نیا مجموعہ، جو اب دنیا بھر کے ڈویلپرز کے لیے دستیاب ہے۔

28 اگست، 2025 کو اپ ڈیٹ: ہم نے Realtime API کی عمومی دستیابی کا اعلان کیا۔ یہاں مزید جانیں.
گزشتہ چند مہینوں کے دوران، ہم نے متن پر مبنی ایجنٹس—یا ایسے سسٹمز جو صارفین کی جانب سے خود مختار طور پر کام انجام دیتے ہیں—کی ذہانت، صلاحیتوں، اور افادیت کو بہتر بنانے میں سرمایہ کاری کی ہے، جیسے کہ Operator، ڈیپ ریسرچ، کمپیوٹر-یوزنگ ایجنٹس، اور Responses API جو بِلٹ-اِن ٹولز کے ساتھ ہیں۔ تاہم ایجنٹس کو حقیقی معنوں میں مؤثر بنانے کے لیے ضروری ہے کہ لوگ محض متن تک محدود نہ رہیں، بلکہ فطری طور پر بولی جانے والی —زبان کے ذریعے ان کے ساتھ زیادہ گہری، زیادہ فطری اور بامعنی تعامل کریں تاکہ مؤثر ابلاغ ممکن ہو سکے۔
آج ہم API میں نئے اسپیچ ٹو ٹیکسٹ اور ٹیکسٹ ٹو اسپیچ آڈیو ماڈلز لانچ کر رہے ہیں،— جس سے ایسے زیادہ طاقتور، حسبِ ضرورت ڈھالے جا سکنے والے اور ذہین وائس ایجنٹس بنانا ممکن ہو گیا ہے جو حقیقی افادیت فراہم کرتے ہیں۔ ہمارے جدید ترین اسپیچ ٹو ٹیکسٹ ماڈلز نے ایک نیا اسٹیٹ آف دی آرٹ معیار قائم کیا ہے، جو درستگی اور قابلِ اعتماد کارکردگی میں موجودہ حلوں سے بہتر ہیں—خصوصاً ان مشکل حالات میں جہاں مختلف لہجے، شور والے ماحول، اور بولنے کی رفتار میں فرق شامل ہو۔ یہ بہتریاں ٹرانسکرپشن کی قابلِ اعتمادیت میں اضافہ کرتی ہیں، جس سے ماڈلز خاص طور پر کسٹمر کال سینٹرز، میٹنگ نوٹس کی ٹرانسکرپشن، اور دیگر استعمالات کے لیے بہت موزوں ہو جاتے ہیں۔
اب پہلی بار ڈویلپرز ٹیکسٹ ٹو اسپیچ ماڈل کو یہ ہدایت بھی دے سکتے ہیں کہ وہ کسی خاص انداز میں بات کرے—مثال کے طور پر، “ایک ہمدرد کسٹمر سروس ایجنٹ کی طرح گفتگو کریں”—جس سے وائس ایجنٹس کے لیے حسبِ ضرورت کسٹمائیزیشن (تخصیص) کی ایک نئی سطح ممکن ہو گئی ہے۔ یہ سہولت حسبِ ضرورت ایپلیکیشنز کی ایک وسیع رینج کو ممکن بناتی ہے جس میں زیادہ ہمدرد اور متحرک کسٹمر سروس آوازوں سے لے کر تخلیقی کہانی سنانے کے لیے مؤثر اور جذباتی انداز کی نریشن تک شامل ہے۔
ہم نے اپنا پہلا آڈیو ماڈل 2022 میں لانچ کیا ہے اور تب سے، ہم ان ماڈلز کی ذہانت، درستگی، اور قابلِ اعتمادیت کو بہتر بنانے کے لیے پرعزم ہیں۔ ان نئے آڈیو ماڈلز کے ساتھ ڈویلپرز اب API کے اندر ہی زیادہ درست اور مضبوط اسپیچ ٹو ٹیکسٹ سسٹمز کے ساتھ ساتھ بااثر، کردار سے بھرپور ٹیکسٹ ٹو اسپیچ آوازیں بھی تیار کر سکتے ہیں۔
ہم نئے gpt-4o-transcribe اور gpt-4o-mini-transcribe ماڈل متعارف کروا رہے ہیں، جن میں لفظی غلطی کی شرح (WER) میں بہتری اور زبان کی بہتر شناخت اور درستگی شامل ہے، جو اصل Whisper ماڈل کے مقابلے میں بہتر ہیں۔
gpt-4o-transcribe مختلف مستند بینچ مارکس پر موجودہ Whisper ماڈلز کے مقابلے میں ورڈ ایرر ریٹ (WER) میں بہتر کارکردگی دکھاتا ہے، جو ہماری اسپیچ ٹو ٹیکسٹ ٹیکنالوجی میں نمایاں پیش رفت کی عکاسی کرتا ہے۔ یہ ایڈوانسمنٹ براہِ راست ری اِنفورسمنٹ لرننگ میں مخصوص جدتوں اور متنوع، اعلیٰ معیار کے آڈیو ڈیٹا سیٹس پر کی گئی وسیع مڈ ٹریننگ کا نتیجہ ہیں۔
نتیجتاً، یہ نئے اسپیچ ٹو ٹیکسٹ ماڈلز گفتگو کی باریکیوں کو بہتر طور پر گرفت میں لے سکتے ہیں، غلط شناختوں کو کم کر سکتے ہیں، اور ٹرانسکرپشن کی قابلِ اعتمادیت میں اضافہ کر سکتے ہیں، خاص طور پر ایسے مشکل حالات میں جن میں لہجے، شور والے ماحول، اور گفتگو کی مختلف رفتاریں شامل ہوں۔ یہ ماڈل اب speech-to-text API(نئی ونڈو میں کھلتا ہے) میں دستیاب ہیں۔
Word Error Rate (WER) اسپیچ ریکگنیشن ماڈل کی درستگی کو ناپنے کے لیے استعمال ہوتا ہے، جو کہ ایک حوالہ ٹرانسکرپٹ کے مقابلے میں غلط طور پر نقل کیے گئے الفاظ کے فیصد کا حساب لگاتا ہے۔ کم WER بہتر ہوتا ہے اور اس کا مطلب ہے کہ غلطیاں کم ہیں۔ ہمارے جدید ترین اسپیچ ٹو ٹیکسٹ ماڈلز نے مختلف بینچ مارکس پر کم ورڈ ایرر ریٹ (WER) حاصل کیا ہے، جن میں FLEURS بھی شامل ہے (فیو-شاٹ لرننگ ایویلیوایشن آف یونیورسل ریپریزنٹیشنز آف اسپیچ) — جو ایک کثیر لسانی اسپیچ بینچ مارک ہے اور 100 سے زائد زبانوں پر مشتمل ہے، جہاں آڈیو نمونوں کی دستی نقل کی گئی ہے۔ یہ نتائج زیادہ بہتر ٹرانسکرپشن کی درستگی اور زبان کی زیادہ وسیع کوریج کا مظاہرہ کرتے ہیں۔ جیسا کہ یہاں دکھایا گیا ہے، ہمارے ماڈلز تمام زبانوں کے جائزوں میں مستقل طور پر Whisper v2 اور Whisper v3 سے بہتر کارکردگی دکھاتے ہیں۔
FLEURS پر، ہمارے ماڈل کم WER اور مضبوط کثیر لسانی کارکردگی پیش کرتے ہیں۔ کم WER یعنی زیادہ درستگی اور کم غلطیاں۔ جیسا کہ یہاں دکھایا گیا ہے، ہمارے ماڈلز زیادہ تر بڑی زبانوں میں دیگر نمایاں ماڈلز کے برابر یا ان سے بہتر کارکردگی دکھاتے ہیں۔
ہم ایک نیا gpt-4o-mini-tts ماڈل بھی لانچ کر رہے ہیں جو زیادہ بہتر اسٹیئریبلٹی (کنٹرول کے قابل انداز) کے ساتھ آتا ہے۔ اب پہلی بار ڈویلپرز ماڈل کو صرف یہ نہیں بتا سکتے کہ کیا کہنا ہے بلکہ یہ بھی ہدایت دے سکتے ہیں کہ کیسے کہنا ہے—جس سے کسٹمر سروس سے لے کر تخلیقی کہانی سنانے تک مختلف استعمالات کے لیے زیادہ حسبِ ضرورت تجربات ممکن ہو جاتے ہیں۔ یہ ماڈل text-to-speech API(نئی ونڈو میں کھلتا ہے) میں دستیاب ہے۔ واضح رہے کہ یہ ٹیکسٹ-ٹو-اسپیچ ماڈلز صرف مصنوعی، پہلے سے طے شدہ آوازوں تک محدود ہیں، جن کی ہم نگرانی کرتے ہیں تاکہ وہ مسلسل انہی مصنوعی پری سیٹس سے ہم آہنگ رہیں۔
ہمارے نئے آڈیو ماڈلز GPT‑4o اور GPT‑4o‑mini کی آرکیٹیکچرز پر مبنی ہیں اور انہیں خصوصی آڈیو پر مرکوز ڈیٹا سیٹس پر وسیع پیمانے پر پِری ٹرین کیا گیا ہے، جو ماڈلز کی کارکردگی کو بہتر بنانے میں نہایت اہم ثابت ہوئے ہیں۔ یہ مخصوص طریقہ کار گفتگو کی باریکیوں کو زیادہ گہرائی سے سمجھنے میں مدد دیتا ہے اور آڈیو سے متعلق مختلف کاموں میں غیر معمولی کارکردگی کو ممکن بناتا ہے۔
ہم نے اپنی ڈسٹلیشن تکنیکوں کو مزید بہتر بنایا ہے، جس کے نتیجے میں ہمارے سب سے بڑے آڈیو ماڈلز سے علم کو چھوٹے اور زیادہ مؤثر ماڈلز تک منتقل کرنا ممکن ہو گیا ہے۔ جدید سیلف-پلے کے طریقہ کار کا استعمال کرتے ہوئے، ہمارے ڈسٹلیشن ڈیٹا سیٹس مؤثر طریقے سے حقیقی مکالماتی حرکیات کو محفوظ کرتے ہیں اور حقیقی صارف-معاون تعاملات کی عکاسی کرتے ہیں۔ اس سے ہمارے چھوٹے ماڈلز بھی اعلیٰ مکالماتی معیار اور تیز رفتار ردِعمل فراہم کرنے کے قابل ہو جاتے ہیں۔
ہم نے اپنے اسپیچ ٹو ٹیکسٹ ماڈلز کے لیے ری اِنفورسمنٹ لرننگ (RL) پر مبنی ایک مضبوط طریقہ کار کو شامل کیا ہے، جس سے ٹرانسکرپشن کی درستگی جدید ترین معیار تک پہنچ گئی ہے۔ یہ طریقۂ کار نمایاں طور پر درستگی میں اضافہ کرتا ہے اور ہیلوسینیشن (غلط یا من گھڑت آؤٹ پٹ) کو کم کرتا ہے، جس کے نتیجے میں ہماری اسپیچ ٹو ٹیکسٹ سولیوشن پیچیدہ اسپیچ ریکگنیشن کے حالات میں غیر معمولی طور پر مؤثر اور مسابقتی بن جاتے ہیں۔
یہ پیش رفت آڈیو ماڈلنگ کے شعبے میں ترقی کی نمائندگی کرتی ہے، جہاں جدید طریقۂ کار کو عملی بہتریوں کے ساتھ یکجا کیا گیا ہے تاکہ اسپیچ ایپلیکیشنز میں کارکردگی کو مزید بہتر بنایا جا سکے۔
یہ نئے آڈیو ماڈلز اب تمام ڈویلپرز کے لیے دستیاب ہیں – آڈیو کے ساتھ تخلیق کے بارے میں مزید معلومات یہاں(نئی ونڈو میں کھلتا ہے) حاصل کریں۔ ان ڈویلپرز کے لیے جو پہلے ہی ٹیکسٹ بیسڈ ماڈلز کے ساتھ مکالماتی تجربات بنا رہے ہیں، ہمارے اسپیچ ٹو ٹیکسٹ اور ٹیکسٹ ٹو اسپیچ ماڈلز کو شامل کرنا وائس ایجنٹ بنانے کا سب سے آسان طریقہ ہے۔ ہم Agents SDK(نئی ونڈو میں کھلتا ہے) کے ساتھ ایک انٹیگریشن جاری کر رہے ہیں جو اس ڈویلپمنٹ پراسیس کو آسان بناتا ہے۔ کم تاخیر (لو لیٹنسی) کے ساتھ اسپیچ-ٹو-اسپیچ تجربات بنانے کے خواہشمند ڈویلپرز کے لیے ہم تجویز کرتے ہیں کہ وہ ریئل ٹائم API میں موجود ہمارے اسپیچ-ٹو-اسپیچ ماڈل کے ساتھ کام کریں۔
آگے دیکھتے ہوئے، ہم اپنے آڈیو ماڈلز کی ذہانت اور درستگی کو مزید بہتر بنانے میں سرمایہ کاری جاری رکھنے کا ارادہ رکھتے ہیں، اور ساتھ ہی ایسے طریقوں پر بھی کام کر رہے ہیں جن کے ذریعے ڈویلپرز ہماری حفاظتی معیارات کے مطابق اپنی حسبِ ضرورت آوازیں شامل کر کے مزید ذاتی نوعیت کے تجربات تخلیق کر سکیں۔ مزید برآں، ہم پالیسی سازوں، محققین، ڈویلپرز اور تخلیق کاروں کے ساتھ مسلسل مکالمہ جاری رکھے ہوئے ہیں تاکہ مصنوعی آوازوں سے وابستہ چیلنجز اور مواقع پر مشترکہ طور پر غور کیا جا سکے۔ ہم اس بات کے لیے پُرجوش ہیں کہ ڈویلپرز ان بہتر آڈیو صلاحیتوں کو استعمال کرتے ہوئے کون سی نئی، جدت آمیز اور تخلیقی ایپلیکیشنز تیار کریں گے۔ ہم دیگر موڈیلیٹیز—بشمول ویڈیو—میں بھی سرمایہ کاری کریں گے تاکہ ڈویلپرز کثیرالجہتی (ملٹی موڈل) ایجنٹک تجربات تیار کر سکیں۔
مصنفین
تحقیقی رہنمائی
کرسٹینا کم، جونہوا ماؤ، یی شین، یو ژانگ
شراکت دار
تحقیق
الیکس پائنو، بووین چینگ، چینگشو ژوانگ، کرس کوچ، ڈیمیان مروکا، ایرک رِٹر، جیکب مینک، جیمز بیٹکر، جی لن، جیمی کیروس، جیاہوئی یو، لیانگ ژو، لییو چن، کیون لو، میڈلین بوئڈ، مائیکل لیمپے، مائیک ہیٹن، نانشین چن، نتیش کیسکر، ساچی جین، سیم ٹوئزر، سوماے جین، تاؤ ژو، ٹومر کپلن، وے ہان، شیانگ نِنگ چن، یے جیا
انجینئرنگ
علینہ وو، اینڈریس گارسیا، ارشی بھٹناگر، ایویٹل اولیور، برینڈن کوئن، کرسٹینا ہوانگ، ڈیوڈ فینگ، ڈریگوس اوپریکا، ڈومینک کنڈل، ایڈیڈ اویووہ، ایاروسلاو ٹورڈوخلیب، جیاچینگ فینگ، جے چن، جینیا وراووا، جارڈن سٹکن، جوزف فلورینسیو، لیئن مامیتسوکا، مادا افلاک، منولی لیوڈاکس، مارک ہڈنال، نوح میک کیلم، اولا اوکیلولا، پیٹر بیکم، روہن مہتا، رومین ہوئٹ، واننگ جیانگ، وین چانگ، ییلی کیان
پراڈکٹ
انوبھا سریواستو، جیکی شینن، جیف ہیرس، ریہ میارا، ژاؤلن ہاؤ
لیڈرشپ اسپانسرز
ایڈن کلارک، اینڈریو گیبیانسکی، ڈیوڈ ساساکی، کیون ویل، لائم فیڈس، مارک چن، نک رائیڈر، نک ٹرلی، اولیویئر گوڈیمینٹ، پرفلہ دھاریوال، شینگ جیا ژاؤ، شوچاؤ بی، شیروِن وو، سُلمان چودھری