نقدّم لكم نماذج الصوت من الجيل التالي في الواجهة البرمجية
مجموعة جديدة من النماذج الصوتية لتعزيز قدرات الوكلاء الصوتيين، باتت متوفرة الآن للمطورين في كافة أنحاء العالم.

تحديث في 28 أغسطس 2025: نعلن عن إتاحة واجهة Realtime API لعموم المطورين بشكل رسمي. يُرجى الاطلاع على التفاصيل من هنا.
لقد كرسنا جهودنا خلال الأشهر الماضية لتعزيز ذكاء الوكلاء النصيين، أو تلك الأنظمة التي تتولى إتمام المهام ذاتيًا نيابة عن المستخدمين، وكفاءتها؛ وأطلقنا في سبيل ذلك ابتكارات مثل Operator والبحث المتعمق ووكلاء الذكاء المخصصين للتعامل مع الحاسوب، إلى جانب واجهة Responses API المدعومة بأدوات مدمجة. بيد أنه لضمان تحقيق الاستفادة القصوى من هؤلاء الوكلاء، لابد من تمكين المستخدمين من خوض تجارب تفاعلية أكثر عمقًا وسلاسة لا تقتصر على الكتابة، بل تمتد لتشمل استخدام اللغة المنطوقة الطبيعية كوسيلة تواصل فعالة.
نعلن اليوم عن إطلاق نماذج صوتية متطورة لتحويل الكلام إلى نص وتحويل النص إلى كلام في واجهة API، وهو ما يفتح الباب أمام تطوير وكلاء صوتيين بمستويات أعلى من الذكاء والقدرة على التخصيص لتوفير فوائد ملموسة. وقد حققت أحدث نماذجنا في مجال تحويل الكلام إلى نص تفوقًا نوعيًا غير مسبوق، متجاوزةً التقنيات المتاحة حاليًا من حيث معايير الدقة والاعتمادية، خاصة عند التعامل مع تحديات اللهجات والضوضاء المحيطة وتغير وتيرة التحدث. وتؤدي هذه التطورات إلى رفع جودة التفريغ النصي، مما يجعل النماذج خيارًا مثاليًا لمجالات مثل مراكز خدمة العملاء، وتوثيق محادثات الاجتماعات، وما شابه ذلك.
لأول مرة، أصبح بإمكان المطورين إصدار تعليمات لنماذج تحويل النص إلى كلام لتبني نبرة صوتية معينة، كأن يُطلب منها "التحدث بأسلوب موظف خدمة عملاء ودود"، وهو ما يمنح الوكلاء الصوتيين مستويات غير مسبوقة من المرونة للتخصيص. ويمهد هذا التطور الطريق لمجموعة متنوعة من التطبيقات المصممة خصيصًا، والتي تشمل أصواتًا تفاعلية وأكثر إنسانية لخدمة العملاء، بالإضافة إلى أساليب سردية معبرة في سياق المحتوى القصصي والإبداعي.
ومنذ تدشين أول نماذجنا الصوتية في عام 2022، قطعنا على أنفسنا عهدًا بتطوير ذكاء هذه النماذج وتعزيز دقتها واعتماديتها. وتمنح هذه النماذج الصوتية الحديثة المطورين القدرة على تصميم أنظمة تحويل الكلام إلى نص تتسم بالقوة والإحكام، إلى جانب ابتكار أصوات ناطقة معبرة تفيض بالحيوية والشخصية عند تحويل النصوص إلى كلام، وذلك كله عبر واجهة API مباشرة.
نعلن عن إطلاق النموذجين gpt-4o-transcribe وgpt-4o-mini-transcribe الجديدين، حيث يتميزان بتقليل نسبة الأخطاء اللفظية وتطوير كفاءة تمييز اللغات ودقة النسخ النصي، متفوقين بذلك في أدائهم على إصدارات نماذج Whisper الأصلية.
جسّد نموذج gpt-4o-transcribe تفوقًا ملحوظًا في معايير معدل خطأ الكلمات (WER) على إصدارات Whisper المتاحة حاليًا ضمن مختلف مقاييس الأداء المعيارية، وهو ما يمثل قفزة نوعية في تكنولوجيا تحويل الكلام إلى نص لدينا. وتأتي هذه التحسينات نتيجة مباشرة لابتكارات هادفة في تقنيات التعلم بالتعزيز، إلى جانب مراحل تدريب متوسطة موسعة اعتمدت على قواعد بيانات صوتية شاملة وعالية الكفاءة.
وبناءً على هذه التطورات، أصبح بمقدور نماذج تحويل الكلام إلى نص الحديثة استيعاب أدق تفاصيل الكلام البشري وتقليل احتمالات التفسير الخاطئ للمفردات، مع تعزيز الاعتمادية في تفريغ المحتوى الصوتي؛ خاصةً عند مواجهة ظروف تشغيلية صعبة مثل اختلاف اللهجات، أو التحدث في أماكن صاخبة، أو تغير وتيرة الكلام وسرعته. ويمكن للمطورين الوصول إلى هذه النماذج واستخدامها حاليًا من خلال واجهة speech-to-text API(يفتح في نافذة جديدة).
يقوم معيار معدل خطأ الكلمات (WER) بقياس مدى دقة نماذج التعرف على الكلام من خلال حساب نسبة الكلمات المفرغة نصيًا بشكل خاطئ مقابل النص الأصلي المعتمد، وكلما قل هذا المعدل، زادت دقة النموذج وقلت أخطاؤه. وتمكنت نماذجنا الأخيرة لتحويل الكلام إلى نص من تسجيل أدنى مستويات الخطأ في اختبارات الأداء المعيارية، ومن أبرزها مقياس FLEURS المخصص لتقييم التمثيلات اللغوية العالمية قليلة الأمثلة، والذي يشمل ما يزيد عن 100 لغة ويعتمد على عينات صوتية دقيقة حُولت لنصوص بجهد بشري. وتعكس هذه النتائج كفاءة فائقة في تحويل الكلام إلى نص ودعمًا لغويًا متينًا، إذ تتفوق نماذجنا بشكل ثابت على نماذج Whisper الإصدار الثاني وWhisper الإصدار الثالث في جميع الاختبارات اللغوية.
تقدم نماذجنا على مقياس FLEURS معدلات خطأ كلمات منخفضة وأداءً متميزًا في التعامل مع لغات متعددة، وحيث إن القيمة المنخفضة لمعدل خطأ الكلمات هي الأفضل فإنها تعكس تقليصًا ملموسًا في عدد الأخطاء. وكما يتبين من النتائج، فإن نماذجنا تعادل أو تتفوق على النماذج الرائدة المنافسة في أغلب اللغات العالمية الكبرى.
نعلن عن إطلاق نموذج gpt-4o-mini-tts الجديد مع تعزيز ميزة التحكم في الأداء الصوتي، حيث أصبح بإمكان المطورين لأول مرة إعطاء 'تعليمات' للنموذج تحدد أسلوب النطق وليس مجرد نص الحديث، وهو ما يفتح الباب أمام تجارب مخصصة تلائم مختلف المجالات، من مراكز خدمة العملاء إلى السرد القصصي الإبداعي. النموذج متاح الآن ضمن واجهة text-to-speech API(يفتح في نافذة جديدة). علمًا بأن هذه التقنيات مبرمجة للعمل حصريًا عبر أصوات اصطناعية سابقة الضبط، والتي تخضع لرقابتنا لضمان اتساقها الدائم مع المعايير التركيبية المعتمدة.
اعتمدنا عند إنشاء النماذج الصوتية الحديثة بالاعتماد على بنية النموذجين GPT‑4o وGPT‑4o-mini، مع تدريبهما مسبقًا وبشكل موسع على قواعد بيانات صوتية تخصصية، مما ساهم بشكل جوهري في الوصول بأداء هذه النماذج إلى مستوياتها المثلى. ويسمح هذا النهج المستهدف باكتساب رؤى أعمق حول تفاصيل النطق الدقيقة، مما يضمن كفاءة منقطعة النظير في تنفيذ المهام الصوتية المتنوعة.
لقد عززنا من الأساليب التي نتبعها لاستخلاص المعلومات للنماذج، وهو ما مكننا من نقل الخبرات المعرفية من النماذج الصوتية الكبرى إلى نماذج أخرى تمتاز بصغر الحجم وكفاءة الأداء. وباعتمادنا على منهجيات التعلم الذاتي المتقدمة، استطاعت قواعد بيانات استخلاص المعلومات استيعاب حركية التفاعل الحواري الواقعي بدقة، وإعادة إنتاج المحادثات الفعلية بين المستخدم والمساعد الذكي؛ الأمر الذي يمنح نماذجنا الصغرى قدرة متميزة على إدارة الحوارات بجودة عالية وسلاسة في الاستجابة.
لقد اعتمدنا في تطوير نماذج تحويل الكلام إلى نص على إطار عمل يرتكز بقوة على تقنيات التعلم بالتعزيز، وهو ما ارتقى بدقة التفريغ النصي إلى أعلى المعايير التقنية المعاصرة. وتساهم هذه المنهجية في رفع درجة الإحكام وتقليص احتمالات الهلوسة، الأمر الذي يمنح حلولنا البرمجية قدرة تنافسية فائقة عند التعامل مع التحديات المعقدة في مجالات التعرف على النطق.
وتعد هذه المستجدات خطوة رائدة في قطاع نمذجة الصوت، إذ تدمج بين الأساليب المنهجية المبتكرة والتحسينات التطبيقية لضمان أداء أكثر قوة وفاعلية في مختلف تطبيقات معالجة النطق.
أصبحت النماذج الصوتية الجديدة متاحة لكافة المطورين في الوقت الحالي؛ للحصول على تفاصيل إضافية حول آليات البناء البرمجي باستخدام الصوت يُرجى الضغط هنا(يفتح في نافذة جديدة). وللمطورين الذين يعكفون حاليًا على تطوير تجارب تفاعلية تعتمد على النماذج النصية، فإن دمج تقنياتنا المخصصة لتحويل الكلام إلى نص والنص إلى كلام يعد المسار الأيسر لابتكار وكيل صوتي متكامل. وفي هذا السياق، نطلق ميزة التكامل مع Agents SDK(يفتح في نافذة جديدة) لتسهيل وتيسير مراحل عملية التطوير بالكامل. أما في حال رغبة المطورين في إنشاء تجارب تحويل الكلام إلى كلام التي تتسم بسرعة فائقة وزمن استجابة ضئيل، فإننا ننصح بالتطوير باستخدام نماذجنا المخصصة لذلك في واجهة Realtime API.
في إطار تطلعاتنا المستقبلية، نخطط للاستمرار في تطوير ذكاء النماذج الصوتية وكفاءتها، مع البحث في آليات تتيح للمطورين استخدام أصوات مخصصة لتصميم تجارب فريدة تلتزم بضوابطنا الأمنية. وعلاوة على ذلك، نستمر في التواصل مع المشرعين والباحثين والمطورين والمبدعين لمناقشة آفاق ومخاطر الأصوات المركبة. ويحدونا الشوق لترقب الحلول المبتكرة التي سيبتكرها المطورون بالاستفادة من هذه الإمكانات الصوتية المتطورة. كما سيمتد استثمارنا ليشمل أنماطًا تقنية أخرى — ومنها الفيديو — لفتح المجال أمام المطورين لابتكار تجارب وكلاء ذكاء اصطناعي تعتمد على تعدد الوسائط.
الكاتبان
قادة الفريق البحثي
كريستينا كيم، جونهوا ماو، يي شين، يو تشانغ
المساهمون
البحث
أليكس باينو، بوين تشينغ، تشنغ شو جوانغ، كريس كوتش، داميان مروكا، إريك ريتر، جاكوب مينيك، جيمس بيتكر، جي لين، جيمي كيروس، جياهاوي يو، ليانغ تشو، ليوي تشين، كيفن لو، مادلين بويد، مايكل لامبي، مايك هيتون، نانشين تشين، نيتيش كيسكار، ساشي جاين، سام تويزر، سوماي جاين، تاو شو، تومر كابلان، وي هان، شيانغنينغ تشين، يي جيا
الهندسة
ألينا وو، أندريس غارسيا غارسيا، أرشي بهاتناغار، أفيتال أوليفر، بريندان كوين، كريستينا هوانغ، ديفيد فانغ، دراغوس أوبريكا، دومينيك كوندل، إديدي أويوه، ياروسلاف تفيردوخليب، جيا تشينغ فنغ، جاي تشين، جينيا فاراففا، جوردان سيتكين، جوزيف فلورينسيو، لين ماميتسوكا، مادا أفلاك، مانولي ليوداكيس، مارك هادنال، نواه ماك كالوم، أولا أوكيلولا، بيتر باكوم، روهان ميهتا، رومان هويه، ووانينغ جيانغ، واين تشانغ، ييلي تشيان
المنتج
أنوبها سريفاستافا، جاكي شانون، جيف هاريس، ريا ميارا، شياولين هاو
القادة الداعمون للمشروع
إيدان كلارك، أندرو جيبيانسكي، ديفيد ساساكي، كيفن ويل، ليام فيدوس، مارك تشين، نيك رايدر، نيك تيرلي، أوليفييه غودمان، برافولا داريول، شينجيا تشاو، شوشاو بي، شيروين وو، سولمان شودري