تخطي إلى المحتوى الرئيسي
OpenAI

26 يونيو 2026

المنتجإصدار

معاينة GPT‑5.6 Sol: نموذج من الجيل التالي

جاري التحميل...

نبدأ معاينة محدودة لسلسلة GPT‑5.6: ‏Sol، النموذج الرائد لدينا؛ وTerra، وهو نموذج متوازن للعمل اليومي؛ وLuna، وهو نموذج سريع وميسور التكلفة. يقدم Terra أداءً منافسًا لـ GPT‑5.5 مع تكلفة أقل بمقدار الضعف، بينما يتيح Luna قدرة قوية بأقل تكلفة لدينا.

يُطلق GPT‑5.6 Sol ومعه أقوى منظومة أمان لدينا حتى الآن. عززنا وسائل الحماية للأنشطة الأعلى خطورة، والطلبات السيبرانية الحساسة، وإساءة الاستخدام المتكررة، وقضينا عدة أسابيع في العثور على نقاط الضعف، واختبار نظامنا تحت الضغط، وتقويته في مواجهة هجمات العالم الحقيقي.

نؤمن بإتاحة الوصول على نطاق واسع، ونخطط لجعل GPT‑5.6 Sol وTerra وLuna متاحة عمومًا خلال الأسابيع المقبلة. في إطار تواصلنا المستمر مع الحكومة الأمريكية، عرضنا مسبقًا خططنا وقدرات النماذج قبل إطلاق اليوم. وبناءً على طلبهم، نبدأ بمعاينة محدودة لمجموعة صغيرة من الشركاء الموثوقين الذين جرت مشاركة مشاركتهم مع الحكومة، قبل إتاحة الإصدار على نطاق أوسع. خلال هذه المعاينة، سنواصل الاختبار والتنسيق الوثيق مع الشركاء بينما نعمل على الوصول إلى إتاحة أوسع. لا نعتقد أن هذا النوع من عمليات وصول الحكومة ينبغي أن يصبح هو الوضع الافتراضي على المدى الطويل. فهو يحجب أفضل الأدوات عن المستخدمين والمطورين والمؤسسات والمدافعين السيبرانيين والشركاء العالميين الذين يحتاجون إليها. نتخذ هذه الخطوة القصيرة الأجل لأننا نعتقد أنها أقوى مسار نحو إتاحة أوسع خلال الأسابيع المقبلة، بينما نعمل مع الإدارة على تطوير إطار الأمر التنفيذي السيبراني وعملية قابلة للتكرار لإصدارات النماذج المستقبلية.

القدرات

GPT‑5.6 Sol هو أقوى نموذج لدينا حتى الآن. لتقديم معاينة لأداء النموذج، نشارك مجموعة من التقييمات التي تبرز تحسن القدرات الوكيلة في البرمجة والأحياء والأمن السيبراني، مع توفر تقييمات إضافية للسلامة والجاهزية في بطاقة النظام(يفتح في نافذة جديدة) لدينا. سنشارك مجموعة موسعة من نتائج التقييم عندما نتيح النموذج على نطاق واسع.

مع GPT‑5.6، نقدم جهد استدلال جديدًا بقيمة `max` لمنح Sol أكبر وقت ممكن للتفكير بعمق. بالإضافة إلى ذلك، نقدم وضعًا جديدًا باسم `ultra` يتجاوز قدرات وكيل واحد عبر الاستفادة من وكلاء فرعيين لتسريع الأعمال المعقدة.

بالنسبة إلى سير عمل البرمجة، يحقق GPT‑5.6 Sol مستوى متقدمًا جديدًا على Terminal‑Bench 2.1، الذي يختبر سير عمل سطر الأوامر التي تتطلب التخطيط والتكرار وتنسيق الأدوات.

يُظهر GPT‑5.6 Sol أيضًا تحسينات واسعة في سير عمل الأحياء. على GeneBench v1، الذي يقيّم تحليلات الجينوم طويلة الأمد والأحياء الكمية، يحقق نتائج أقوى من GPT‑5.5 مع استخدام رموز أقل.

GPT‑5.6 Sol هو أكثر نماذجنا قدرة حتى الآن في الأمن السيبراني. إنه يدفع حدّ الأداء والكفاءة في مهام الأمن طويلة الأمد، بما في ذلك أبحاث الثغرات والاستغلال. على ExploitBench²، ينافس GPT‑5.6 Sol نموذج Mythos Preview باستخدام نحو ثلث رموز المخرجات فقط. على ExploitGym(يفتح في نافذة جديدة)3، وهو معيار أنشأه باحثون من UC Berkeley بالتعاون مع OpenAI ومختبرات حدودية أخرى، تُظهر نماذج GPT‑5.6 Sol وTerra وLuna جميعها تحسينات قوية في القدرات السيبرانية مع زيادة الاستدلال.

قدرات سيبرانية أقوى مع وسائل حماية أقوى

طوّرنا GPT‑5.6 Sol وTerra وLuna بأقوى وسائل الحماية لدينا حتى الآن، مع إعدادات مطابقة لقدرات كل نموذج. مع ازدياد قدرة النموذج، نصمم وسائل حماية تصمد بصورة متزايدة أمام الضغط العدائي في الواقع، مع الحفاظ على الوصول إلى الأعمال المشروعة مثل مراجعة الشيفرة، وأبحاث الثغرات، وتطوير التصحيحات، وتصحيح الأخطاء، والتعليم الأمني، والاختبار الدفاعي. هدفنا هو جعل النشاط الهجومي المحظور أصعب وأقل يقينًا وأكثر قابلية للاكتشاف، من دون تقييد تلك الاستخدامات المفيدة دون داعٍ. استنادًا إلى تقييمنا للنموذج ووسائل الحماية، نتوقع فائدة كبيرة للأعمال الدفاعية المشروعة، مع تقييد ملموس للاستخدام الهجومي المحظور.

GPT‑5.6 Sol أفضل في مساعدة الأشخاص على العثور على الثغرات وإصلاحها منه في تنفيذ هجمات كاملة من البداية إلى النهاية بشكل موثوق. ومع استمرار تقدم هذه القدرات، تظل أولويتنا ضمان وصولها إلى المدافعين واستفادتهم منها، حتى يتمكنوا من استخدام هذه الأدوات للعثور على نقاط الضعف، وتطوير التصحيحات، وتعزيز الأنظمة على نطاق أوسع.

لا يتجاوز GPT‑5.6 Sol عتبة Cyber Critical بموجب Preparedness Framework لدينا. في تقييمات شملت Chromium وFirefox، حدد أخطاءً ولبنات استغلال أولية — وهي مكوّنات بناء الاستغلال — لكنه لم ينتج ذاتيًا استغلالًا وظيفيًا كامل السلسلة في ظل الظروف المختبرة. ومع ذلك، لا تستطيع عتبات المعايير التقاط كل طريقة قد يُستخدم بها نموذج أو يُدمج بها مع أدوات أخرى. وهذا القدر من عدم اليقين، إلى جانب القفزة الأوسع في قدرات النموذج، هو السبب في أننا نقرن القدرات المتزايدة للنموذج بوسائل حماية أقوى وإصدار مرحلي. نشارك مزيدًا من التفاصيل حول وسائل الحماية لدينا في بطاقة النظام لمعاينة GPT‑5.6(يفتح في نافذة جديدة).

منظومة حماية متعددة الطبقات

لا تكفي أي وسيلة حماية منفردة لمواجهة إساءة استخدام مصممة أو متكيفة. في معاينة GPT‑5.6، نستخدم وسائل حماية متعددة الطبقات، مع اختلاف الإعدادات الدقيقة بين النماذج، ونختبرها تحت الضغط لهجمات العالم الحقيقي. تشمل هذه وسائل حماية مدرّبة داخل النموذج، وفحوصًا فورية أثناء التوليد، وإشارات على مستوى الحساب، ووصولًا متمايزًا، ومراقبة، وإنفاذًا، واختبارًا مستمرًا.

دُرّب GPT‑5.6 على رفض المساعدة السيبرانية المحظورة، بما في ذلك عندما يحاول المستخدمون إخفاء نواياهم أو كسر حماية النموذج. ترسم وسائل الحماية على مستوى النموذج هذه الحدّ الأول حول ما ينبغي للنموذج أن يساعد فيه وما لا ينبغي أن يساعد فيه.

توفر مصنفات إساءة الاستخدام السيبراني والبيولوجي في الوقت الفعلي طبقة أخرى من خلال تقييم المخرجات أثناء توليدها. في الحالات الأعلى خطورة، إذا اكتشفت انتهاكًا محتملًا، فقد يتوقف التوليد مؤقتًا بينما يراجع نموذج استدلال أكبر المحادثة وسياقها. إذا قُيّمت المخرجات على أنها غير مسموح بها، تُحجب قبل أن تصل إلى المستخدم.

يمكن أن يؤدي النشاط المعلّم أيضًا إلى مراجعة على مستوى الحساب عبر المحادثات وإشارات المخاطر ذات الصلة، بما يتسق مع شروطنا وسياساتنا بشأن الاحتفاظ بالمحتوى ومراجعته. يساعد النظر إلى ما هو أبعد من محادثة واحدة أنظمتنا على التمييز بين السلوك الخبيث المستمر والعمل الأمني المشروع مزدوج الاستخدام، حيث قد تظهر مفاهيم تقنية متشابهة في سياقات شديدة الاختلاف.

مجتمعةً، تجعل هذه الطبقات النهج العام أكثر متانة من أي وسيلة حماية منفردة. يقلل سلوك النموذج احتمال الاستجابات الضارة، ويمكن للأنظمة الفورية التدخل أثناء التوليد، وتستطيع المراجعة على مستوى الحساب تحديد أنماط أوسع، ويحافظ الوصول المتمايز على الأعمال الدفاعية المهمة من دون إتاحة القدرات الأكثر حساسية على نطاق واسع افتراضيًا.

خصوصًا خلال المعاينة، قد يواجه المستخدمون وسائل حماية تحظر بعض الطلبات أو ترفضها. وقد تستغرق طلبات أخرى وقتًا أطول لأن التوليد يتوقف مؤقتًا للمراجعة الإضافية. قد تتدخل وسائل الحماية أحيانًا في أعمال مشروعة، خاصة في المجالات مزدوجة الاستخدام حيث يمكن أن يبدو النشاط الدفاعي والهجومي متشابهين في البداية.

وهذا جزء مما صُممت المعاينة لاختباره. نريد أن نفهم ليس فقط ما إذا كانت وسائل الحماية تقيّد إساءة الاستخدام، بل أيضًا ما إذا كان المستخدمون المشروعون لا يزالون قادرين على إنجاز أعمالهم المعتادة بموثوقية وكفاءة. ستساعدنا الملاحظات خلال المعاينة على تقليل الحظر والتأخيرات غير الضرورية، وتحسين كيفية تفسير وسائل الحماية للسياق، وتهيئة تجربة أكثر سلاسة قبل الإصدار الأوسع.

نعمل أيضًا مع عملاء المؤسسات على نهج أطول أمدًا، بما في ذلك الكشف مع الحفاظ على الخصوصية، وضوابط أمان يديرها العملاء، ووصول مضبوط وفق مخاطر العميل أو المستخدم أو عبء العمل، من أجل تعزيز السلامة مع دعم متطلبات الخصوصية لدى المؤسسات.

تحسين المتانة من خلال الاختبار الهجومي الآلي

يجب أن تظل وسائل الحماية فعّالة أيضًا عندما يكيّف المهاجمون أساليبهم. الحماية التي تنجح فقط مع مجموعة ثابتة من الهجمات المعروفة ليست متينة بما يكفي لنموذج حدودي.

لهذا نخصص للسلامة قدرًا من الذكاء والحوسبة أكبر من أي وقت مضى، مستخدمين نماذجنا لاكتشاف نقاط الضعف وتحسين وسائل الحماية بسرعة أكبر. خصصنا أكثر من 700,000 ساعة GPU مكافئة لـ A100 للاختبار الهجومي الآلي بهدف العثور على كسر حماية شامل: أي هجمات يمكن أن تنجح عبر مطالبات أو سياقات كثيرة، لا في إعداد ضيق واحد فقط. وقد أتاح لنا التركيز على هذه الهجمات الأصعب والأعمّ اختبار وسائل الحماية بما يتجاوز مجموعة ثابتة من الإخفاقات المعروفة. كما يتيح لنا استكشاف أنماط هجوم أكثر بكثير مما يمكن للاختبار البشري وحده تغطيته، وتحديد أنماط الإخفاق في وقت أبكر، وتقليل المسافة بين اكتشاف نقطة ضعف ومعالجتها.

إلى جانب الاختبار الهجومي الآلي، عملنا مع مختبرين من جهات خارجية لإجراء اختبار هجومي بشري واسع النطاق على يد خبراء، وسيستمر ذلك خلال فترة المعاينة. يكمل الاختبار الهجومي البشري العمل الآلي عبر اختبار وسائل الحماية في مواجهة خبراء مبدعين يحاولون إساءة استخدام النموذج بطرق قد لا تتوقعها أنظمتنا.

لا يمكن لأي تقييم أن يمثل كل إعدادات المنتج، أو كل هجوم متعدد الخطوات، أو كل سير عمل في الواقع. لذلك نحافظ على عملية استجابة سريعة لإعادة إنتاج عمليات كسر الحماية المكتشفة حديثًا وتقييمها وترتيب أولوياتها ومعالجتها، ثم نضيفها إلى تقييماتنا المستمرة حتى نتمكن من الاختبار ضد إخفاقات مشابهة مستقبلًا.

التوفر والأسعار

خلال المعاينة، ستتوفر نماذج GPT‑5.6 مبدئيًا عبر API وCodex لمجموعة مختارة من الشركاء والمؤسسات الموثوقين. نخطط لإتاحتها على نطاق أوسع قريبًا للأشخاص الذين يستخدمون ChatGPT وCodex وAPI.

في نظام التسمية الجديد هذا الذي قُدّم مع GPT‑5.6، يحدد الرقم جيل النموذج، بينما تحدد Sol وTerra وLuna مستويات قدرة ثابتة يمكن أن تتطور وفق إيقاعها الخاص. وتمنح هذه العائلة الأشخاص والمطورين معًا خيارات أوضح عبر الذكاء والسرعة والتكلفة.

تُسعَّر GPT‑5.6 لكل مليون رمز عبر ثلاثة أحجام من النماذج: Sol بسعر 5 دولارات للإدخال / 30 دولارًا للإخراج؛ وTerra بسعر 2.50 دولار للإدخال / 15 دولارًا للإخراج؛ وLuna بسعر 1 دولار للإدخال / 6 دولارات للإخراج. تقدم GPT‑5.6 أيضًا تخزينًا مؤقتًا للمطالبات أكثر قابلية للتنبؤ، بما في ذلك دعم نقاط فصل صريحة للتخزين المؤقت وحد أدنى لعمر التخزين المؤقت قدره 30 دقيقة. بالنسبة إلى GPT‑5.6 والنماذج اللاحقة، تُحتسب كتابات التخزين المؤقت بسعر 1.25 ضعف معدل إدخال النموذج غير المخزن مؤقتًا، بينما تستمر قراءات التخزين المؤقت في الحصول على خصم 90% على الإدخال المخزن مؤقتًا.

نطلق أيضًا GPT‑5.6 Sol على Cerebras بسرعة تصل إلى 750 رمزًا في الثانية في يوليو، لنقدم ذكاءً حدوديًا للعملاء بسرعة غير مسبوقة. سيكون الوصول في البداية محدودًا لعملاء محددين بينما نوسّع السعة.

نحن متحمسون لمواصلة التعلم من فترة المعاينة هذه، ولإتاحة GPT‑5.6 Sol وTerra وLuna لمزيد من الأشخاص قريبًا.


1. نقدّر زمن الاستجابة وتكلفة API من خلال النظر إلى سلوك نماذجنا في الإنتاج، وإجراء محاكاة دون اتصال. تراعي هذه التقديرات تفاصيل استدعاءات الأدوات والرموز المأخوذة بالعينة ورموز الإدخال. قد تختلف النتائج الفعلية اختلافًا كبيرًا، وتعتمد على عوامل كثيرة لا تلتقطها محاكاتنا. نحاكي زمن الاستجابة بسرعات API السريعة، والتكلفة وفق أسعار API العادية.

2. تُقيَّم جميع النماذج باستخدام إطار تشغيل ExploitBench API مع 5 بذور واستمرارية الاستدلال.

3. شغّلنا ExploitGym على واجهة API ألفا لدينا، التي تُخرج الاستجابات أسرع من API العامة، ثم أعدنا التحجيم لمطابقة API العامة. عند إعادة تحجيم أزمنة الاستجابة إلى السرعات المتوقعة لـ API العامة، يؤدي ذلك إلى تجاوز بعض أزمنة الاستجابة المقدرة حدود الوقت البالغة ساعتين و6 ساعات، رغم الالتزام بها بشكل صحيح في تشغيل التقييم. للحصول على سرعات أعلى للأعمال الحساسة للوقت، نوفر المعالجة ذات الأولوية في API والوضع السريع في Codex.

4. تُعرض النماذج التي لا تتضمن رموز مخرجات أو زمن استجابة أو تكلفة مبلغًا عنها على هيئة خطوط أفقية منقطة.

المؤلف

OpenAI