تخطي إلى المحتوى الرئيسي
OpenAI

13 أغسطس 2026

AI التطبيقي

دليل المطوّرين إلى GPT‑5.6

دروس تقنية من شركات ناشئة تعمل في بيئات الإنتاج

جاري التحميل...

يرسي GPT‑5.6 معيارًا جديدًا للقيمة مقابل الأداء

تجعل عائلة نماذج GPT‑5.6 أداء الوكلاء الرائد ميسور التكلفة بدرجة كبيرة، وتوسّع في الوقت نفسه حدود الممكن.

نوضح في هذا الدليل كيف تستخدم الشركات الناشئة اختيارًا أذكى للنماذج وعناصر تحكم جديدة في API، تدعم استمرارية الاستدلال وتنسيق الوكلاء المتعددين واستدعاء الأدوات برمجيًا، لبناء وكلاء أسرع وأعلى قدرة بجزء بسيط من التكلفة.

تجربة أفضل مباشرةً من دون إعداد إضافي

منذ GPT‑5، استهدف كل جيل من النماذج معالجة مهام أطول أمدًا باستخدام رموز أقل. ويواصل GPT‑5.6 هذا المسار، بأداء أقوى للوكلاء وتكاليف أقل، مع تغييرات طفيفة في منظومة التقييم الأساسية.

وتتعزز مكاسب كفاءة التكلفة الإجمالية بزيادة الدقة عند بذل جهد استدلال أقل. فعلى سبيل المثال، تفوّق GPT‑5.6 Sol عند مستوى استدلال «منخفض» على GPT‑5.5 عند مستوى استدلال «عالٍ» في اختبار Agents’ Last Exam، مع ثبات منظومة التقييم. وشهدنا نجاحات مماثلة في اختبارات بيئات الإنتاج، إذ أفادت شركات ناشئة بتحقيق وفورات كبيرة في تكاليف مجموعة من تدفقات العمل عبر خفض جهد الاستدلال عن الإعدادات الافتراضية السابقة.

أضفنا GPT‑5.6 إلى منظومة التقييم لدينا، وحققنا أفضل نتائجنا بجهد استدلال منخفض. كان يدرك متى لا تكون البيانات موجودة ببساطة، ولا يلاحق خيوطًا مضللة، ويصل إلى الإجابة الصحيحة باستخدام رموز أقل.
— إيزي ميلر، رئيس أبحاث الذكاء الاصطناعي، Hex(يفتح في نافذة جديدة)

اختيار النموذج

لطالما كانت الترقية إلى النموذج الرائد بأعلى مستوى استدلال متاح أفضل خيار لحالات الاستخدام طويلة الأمد. ويرجع ذلك إلى حد كبير إلى أن هذه النماذج أعلى قدرة بكثير من النماذج المحسّنة للتكلفة في التعامل مع السياقات الأطول واستدعاء الأدوات. لكن ذلك تغير مع عائلة 5.6؛ فبزيادة القدرة الحاسوبية وقت الاختبار، يستطيع Luna وTerra غالبًا تقديم أداء مماثل لـ GPT‑5.4 وGPT‑5.5 بتكلفة أقل بكثير.

1 من 3
يحافظ Luna على 98% من دقة GPT‑5.5 في الاستخراج، بتكلفة تعادل جزءًا واحدًا من 18. وهذا يمنح وكلاءنا فهمًا عالي الجودة للمستندات بتكلفة تجعل استخدامه عمليًا عبر عدد أكبر بكثير من تدفقات العمل.
— سيرهي شتشوهولييف، قائد هندسة الوكلاء، Hypha(يفتح في نافذة جديدة)

لنتأمل مهام BrowseComp، وهو معيار قائم على البحث يختبر قدرة النموذج على العثور على حقائق غامضة. قبل ثلاثة أشهر، سجل GPT‑5.5 عند مستوى «عالٍ جدًا» نسبة 84.36% في هذا المعيار، بتكلفة إجمالية قدرها 33.27 دولارًا. وعند الإطلاق، يقدّم GPT‑5.6 Luna عند مستوى «عالٍ جدًا» الأداء نفسه تقريبًا، مسجلًا 84.04% بتكلفة 1.33 دولار. ومنذ ذلك الحين، خفّضنا الأسعار أكثر. اطّلع على المزيد حول أحدث تخفيضاتنا للأسعار.

تلائم النماذج الأصغر من عائلة 5.6 أعباء العمل كبيرة الحجم، والتفاعلات الحساسة لزمن الاستجابة، والخطوات المتكررة ضمن تدفقات عمل الوكلاء. فمثلًا، إذا كنت تدير شركة ناشئة في مجال التقنية القانونية تحلل مذكرات مكتوبة بخط اليد قبل أن يعالجها الوكلاء، يمكنك الآن استخدام Terra أو Luna للاستخراج وتحقيق وفورات كبيرة، بدلًا من استخدام نموذج رائد لحالة الاستخدام بأكملها.

تطوير Responses API لبناء وكلاء أكثر كفاءة

إلى جانب تحسين أداء GPT‑5.6 مباشرةً من دون إعداد إضافي، أطلقنا أيضًا مكونات أساسية جديدة في Responses API لتحقيق مزيد من المكاسب. درّبنا GPT‑5.6 بصورة متكاملة باستخدام ثلاثة تحسينات معمارية متكاملة تتيح للوكلاء العمل بكفاءة أكبر:

  1. إعادة استخدام العمل المنجَز: من خلال إتاحة الاحتفاظ بالاستدلال(يفتح في نافذة جديدة) بين أدوار النموذج، واستخدام تكثيف السياق الأصلي(يفتح في نافذة جديدة) لضغط المحادثات الطويلة، يستطيع النموذج الحفاظ على اتساق عمله خلال مهام أطول أمدًا من دون ارتباك أو حاجة إلى إعادة بناء السياق السابق.
  2. التقسيم المتوازي عند ملاءمته: يتيح استخدام التنسيق الأصلي للوكلاء المتعددين(يفتح في نافذة جديدة) تنسيق عدة وكلاء عبر مسارات عمل متوازية لإنجاز المهام المعقدة بسرعة أكبر.
  3. نقل العمل الحتمي إلى التعليمات البرمجية: باستخدام استدعاء الأدوات برمجيًا(يفتح في نافذة جديدة) لتصفية مخرجات الأدوات وتجميعها وتنسيقها خارج نطاق سياق النموذج، وتخصيص رموز النموذج لإصدار الأحكام، وخفض التكلفة وزمن الاستجابة وتدهور السياق.

وعند استخدام هذه التحسينات معًا، قد يكون الفارق هائلًا. فعلى سبيل المثال، سجل GPT‑5.6 Sol نسبة 13.3% في ARC-AGI-3 باستخدام منظومة التقييم القياسية. لكن بعد تفعيل الاحتفاظ بالاستدلال وتكثيف السياق، قفزت النتيجة إلى 38.3%، مع استخدام رموز إخراج أقل بنحو 6 أضعاف. لم يتغير النموذج، لكن الأداء تضاعف ثلاث مرات تقريبًا. يمكنك قراءة المزيد هنا عن دراستنا لمنظومة تقييم ARC-AGI-3.

استدعاء الأدوات برمجيًا

غالبًا ما تتضمن تدفقات عمل الوكلاء نوعين من العمل:

  1. مهام تتطلب إصدار الأحكام
  2. عمل يعتمد أساسًا على نقل البيانات وتصفيتها ودمجها

عندما يسترجع وكيل 100 إفصاح، ويصفيها حسب التاريخ، ويحدد المعاملات ذات الصلة، فلا ينبغي أن يُضطر النموذج إلى الاستدلال في كل نتيجة وسيطة داخل نطاق سياقه. يتيح استدعاء الأدوات برمجيًا لـ GPT‑5.6 كتابة JavaScript لتنسيق الأدوات، وتشغيل الاستدعاءات المستقلة بالتوازي، ومعالجة مخرجاتها خارج نطاق السياق. وبذلك يتفرغ النموذج لما يتطلب الذكاء فعلًا: إصدار الأحكام.

في البحوث المالية، يكمن التحدي في استرجاع الإفصاحات بموثوقية، وتنسيق الأدوات، وتحليل الأرقام. في تقييماتنا، حقق GPT‑5.6، باستخدام استدعاء الأدوات برمجيًا، مستوى الجودة وفق معاييرنا مع استخدام رموز إدخال أقل بنسبة 21%. وهذا هو الفارق بين وكيل يستطيع مناقشة البحوث المالية وآخر يستطيع تنفيذها فعليًا.
— أليكس وانغ، الذكاء الاصطناعي التطبيقي، Rogo(يفتح في نافذة جديدة)

الوكلاء المتعددون

في المهام المعقدة القابلة للتنفيذ بالتوازي، يتيح توزيع الإجراءات والاستدلال على مسارات عمل متعددة للوكلاء إتمام المهام بسرعة أكبر وبمستوى أعلى من الذكاء. في هذه الإعدادات، يتولى الوكيل الرئيسي تنسيق الوكلاء الفرعيين وإسناد المهام إليهم. ويعمل الوكلاء الفرعيون على أهدافهم بالتوازي، ثم يعيدون مخرجاتهم إلى الوكيل الرئيسي ليجري التجميع النهائي. يمكن للفرق بدء الاستفادة من الوكلاء المتعددين بصورة أصلية عبر تفعيل الوكلاء المتعددين(يفتح في نافذة جديدة) في Responses API. وهذه أيضًا آلية عمل إعداد قدرات Ultra في ChatGPT.

1 من 2
تُشغّل Qualia فرقًا من الوكلاء لمعالجة مسائل بحثية مفتوحة، وقد أثبت GPT‑5.6 Sol جدارته ببساطة. أظهر تحسنًا ملحوظًا مقارنةً بـ GPT‑5.5، وأنجز العمل أسرع من جميع النماذج الأخرى التي اختبرناها تقريبًا، وسرعان ما أصبح نموذج OpenAI المفضل لدينا.
— إي تشي، المؤسس، Quadrillion(يفتح في نافذة جديدة)

مع أن GPT‑5.6 يقدّر جيدًا العدد المناسب من الوكلاء الفرعيين ومتى ينشئهم، فإن سلوك الوكلاء المتعددين قابل للتوجيه بدرجة كبيرة. قد يؤدي توجيه النموذج بشأن توقيت استدعاء الوكلاء الفرعيين إلى زيادة احتمال إنشائهم فقط عندما تؤدي نفقات الرموز الإضافية إلى أداء أفضل.

التخزين المؤقت للمطالبات

في عائلة النماذج بأكملها، مُدّدت مدة صلاحية التخزين المؤقت للمطالبات إلى 30 دقيقة على الأقل، وأصبح من الممكن الآن تعيين نقاط توقف التخزين المؤقت بصورة حتمية داخل نطاق سياق النموذج. وقد أتاح ذلك للشركات الناشئة تحسين معدل إصابة ذاكرة التخزين المؤقت بدرجة كبيرة.

أضفنا نقاط توقف للتخزين المؤقت ومفاتيح خاصة بكل مساحة عمل مشتركة إلى مطالبة مشتركة من 29,000 رمز، فخفضنا الإدخال غير المخزّن مؤقتًا بنسبة 28%. وكانت نافذة التخزين المؤقت البالغة 30 دقيقة نقلة مهمة أيضًا، إذ أتاحت لوكلائنا إعادة استخدام السياق نفسه عبر عمليات التشغيل بدلًا من البدء من الصفر.
— لورينزو جينتيلي، مهندس ذكاء اصطناعي، Ploy(يفتح في نافذة جديدة)

إلى جانب تعيين نقاط توقف التخزين المؤقت، فإن مواصلة استخدام prompt_cache_key(يفتح في نافذة جديدة) مناسب تزيد احتمال وصول الطلبات إلى محرك الاستدلال نفسه الذي عالج سابقًا البادئة ذاتها، ما يقلل زمن الاستجابة.

الخلاصة

أبرز ما تكشفه هذه الأمثلة هو مدى تغير الجدوى الاقتصادية لبناء الوكلاء.

أصبح بإمكان حالات استخدام كانت تتطلب سابقًا نموذجًا رائدًا في كل خطوة تحقيق نتائج مماثلة أو أفضل بجزء بسيط من التكلفة، عبر استخدام نماذج أصغر وضبط جهد الاستدلال واتخاذ خيارات معمارية فعالة.

نتطلع بحماس إلى رؤية ما ستبنونه!

  • 2026
  • منصّة الـ API

عن المؤلفين

أعدّ هذا الدليل كل من سامارث مادورو(يفتح في نافذة جديدة)، وبراشانت ميتال(يفتح في نافذة جديدة)، وديف ليو(يفتح في نافذة جديدة)، وجوليان رايمان(يفتح في نافذة جديدة)، استنادًا إلى خبرتهم في العمل عن كثب مع شركات ناشئة تبني باستخدام GPT‑5.6، بدءًا من الاختبارات المبكرة وحتى بيئات الإنتاج.