OpenAI

GPT-6 Astra: A new generation of intelligence

جيل جديد من مستوى الذكاء

تحديث بتاريخ 22 سبتمبر 2026: نعمل على توسيع عائلة GPT‑6 لتشمل GPT‑6 Sol وGPT‑6 Luna. تعرّف على المزيد.

نقدم GPT‑6 Astra، النموذج الأكثر ذكاءً ومواءمة في العالم.

يجمع GPT‑6 Astra بين سنوات من البحث واستثمارات ضخمة في التدريب المسبق، والتعلّم بالتعزيز، والمواءمة. ويحتل Astra مكانة رائدة في مجالات استخدام الحاسوب، والتصفح، وهندسة البرمجيات، والأمن السيبراني، والعلوم، والعمل المهني. وقد لامس النموذج عتبة التشبع القصوى في المستوى الرابع من معيار FrontierMath محرزًا 98%، مسهمًا بفاعلية في فك ألغاز مسائل رياضية مستعصية طال انتظار حلولها⁠. كما حسم Astra اختبار ARC-AGI-3 بمعدل تشبع قياسي بلغ 99.9% وسجل العلامة الكاملة بنسبة 100% في مقياس ExploitBench. كما يفتح النموذج فصلًا جديدًا في قدرات التحكم بالحاسوب والتعامل مع متصفحات الويب، مبرهنًا على جدارة استثنائية في إدارة أعباء العمل المهني الأكثر تعقيدًا بمستويات غير مسبوقة من السرعة والضبط وحسن التقدير الموضوعي. 

يبدأ اليوم طرح GPT‑6 Astra لمجموعة محدودة من المؤسسات، وسيصبح متاحًا خلال الأيام المقبلة لجميع مستخدمي ChatGPT Plus وPro وBusiness وEnterprise، وكذلك عبر OpenAI API وMicrosoft Azure وAWS Bedrock.

“في معيار ARC-AGI-3، تفوق Astra على خط الأساس لدينا لكفاءة الأفعال البشرية في 96% من المستويات، ليصل فعليًا إلى مستوى الأداء البشري في هذا المعيار. ليس هذا أفضل نموذج اختبرناه على الإطلاق فحسب، بل يمثل أيضًا نقلة نوعية ملموسة في أداء النماذج الرائدة، ليس فقط في قدرته على التنقل في بيئات جديدة وحلها، بل أيضًا في مدى كفاءته في تعلم ذلك.”
غريغ كامرادت، مؤسسة جائزة ARC

يمثل نموذج Astra قمة التطور في منظومات المواءمة لدينا، محققًا قفزات نوعية في استيعاب مقاصد المستخدمين وإحكام الضوابط السلوكية؛ مما يكفل تفويض الأعباء التشغيلية إليه بثقة تامة لرجاحة معالجته واتزانه التقديري. وضمن مساعينا للتحقق المعياري من ذلك، استحدثنا إطار تقييم استلهم الدروس المستفادة من واقعة Hugging Face، بهدف قياس مدى احتمال انجراف النموذج وتجاوزه لحدود صلاحياته المقررة عند مجابهة مهام معقدة أو متعذرة التنفيذ. وبينما تجاوز نموذج GPT‑5.6 Sol، في غياب ضوابط الحماية في بيئة الإنتاج، الهدف المصرح به في 48% من الحالات، فعل نموذج GPT‑6 Astra ذلك في صفر بالمئة من الحالات.

أفضل نموذج في العالم لاستخدام الكمبيوتر

يُمثل نموذج GPT‑6 Astra نقلة نوعية تفتح مسارًا غير مسبوق في سرعة التحكم بالحاسوب ودقته وسلامة عملياته. فهو يضطلع بإنجاز الأعباء الروتينية المستهلكة للوقت، كاستيفاء بيانات النماذج الرقمية، وتحديث ملفات وسجلات العملاء في منظومات بيانات CRM، وضبط وإدارة التقويم الزمني. كما ينهض بمهام البحث والتقصي عبر الشبكة وتلخيص النتائج وصياغتها ضمن تطبيق البريد الإلكتروني أو محررات النصوص المعتمدة. ويمتلك النموذج القدرة على معالجة البيانات العلمية وتصميم الرسوم البيانية، وبناء المواقع الإلكترونية مع مباشرة اختبارات ضمان جودة الواجهات الأمامية للتحقق من سلامة كافة وظائف المنصة وتشغيلها. وإلى جانب ذلك، يكفل إتمام عمليات تثبيت وتجربة الحزم البرمجية بصورة مستقلة، ورصد المشكلات والعلل التقنية الظاهرة على الشاشة وتشخيصها ومعالجتها فوريًا. وهي طفرة تتجلى بوضوح عبر نتائج اختباراتنا المعيارية المرجعية التي تصدرت أعلى التصنيفات العالمية.

تؤدي هذه التحسينات أيضًا إلى مكاسب كبيرة في الكفاءة في مهام العمل المعرفي الواقعية. في محاكاة زمن الاستجابة على OSWorld 2.0، تحقق Astra أداء أعلى في استخدام الحاسوب في وقت أقل بنحو 47% لكل مهمة مقارنةً بـ GPT‑5.6 Sol، محرزًا نسبة إنجاز بلغت 72.6% في غضون 40 دقيقة تقريبًا لكل مهمة، مقارنةً بنسبة 65.7% في غضون 75 دقيقة تقريبًا.3

تتجلى إمكانات التحكم واستخدام الحاسوب التي يتمتع بها نموذج GPT‑6 Astra عبر مخرجات عملية في قطاعات متعددة؛ تشمل تطوير ألعاب الفيديو، وتطبيقات الهندسة الكهربائية، والمهام المعرفية والإدارية اليومية:

وبالتوازي مع Astra، نحدّث أيضًا منظومة تشغيل Codex لتحسين سرعة استخدام الحاسوب بشكل كبير. وتتضافر هذه الترقية مع فاعلية نموذج Astra لتثمر عن تسريع وتيرة إتمام المهام بمعدل 1.9 ضعف مقارنةً بالأداء الفعلي لنموذج GPT‑5.6 Sol، استنادًا إلى نتائج معيار Mind2Web. وتفتح هذه القفزة في سرعة الاستجابة آفاقاً تتيح للنموذج الاضطلاع بالكثير من الأعباء اليومية المتطلبة للوقت وإنجازها بكفاءة تفوق السرعة البشرية.4

"ندمج GPT‑6 Astra في منظومة التقييم الخاصة بـDevin عند الإطلاق، حيث يحقق أداءً متقدمًا يُعد الأفضل حتى الآن في معيارنا الداخلي للاختبارات. وأدّى تميّزه في استخدام الحاسوب والكتابة وفهم قاعدة الشفرة البرمجية إلى تحسين الاختبار منذ البداية: فأصبحت مقاطع الفيديو أسهل في المتابعة بشكل ملحوظ، وأصبحت التقارير أوضح وأكثر إيجازًا”
سيلاس ألبيرتي، نائب الرئيس الأول للأبحاث، Cognition

نقلة نوعية في العمل المهني

يُقرن نموذج GPT‑6 Astra بين القفزات النوعية في قدرات التحكم الحاسوبي والتدريب التخصصي الموجه لبيئات العمل المؤسسية، ليتولى معالجة أعباء العمل الإجرائية المركبة؛ ويجمع بين مستوى الذكاء المطلوب للمشكلات المعقدة والقدرة على تنفيذ تدفقات عمل متعددة المراحل وإنتاج مستندات وجداول بيانات وعروض تقديمية مصقولة.

يعد نموذج GPT‑6 Astra أفضل نماذجنا في الامتثال للقوالب المعتمدة وتصميم شرائح وعروض تقديمية متسقة التخطيط الهيكلي، تبرز المحاور الجوهرية بإيجاز مدعوم بحبكة سردية متكاملة. ويتولى النموذج صياغة وثائق ومستندات، وعروض تقديمية، ومصنفات بيانات، ودراسات تحليلية عالية التنظيم، تلتزم بنماذجك القياسية وتحاكي نمطك التحريري وهويتك البصرية بدقة. علاوة على ذلك، صُمم Astra ليستخلص بذكاء البيانات السياقية الأكثر أهمية وإدماجها ضمن النتائج، متجاوزًا حشو المعلومات غير المجدية للمهمة قيد التنفيذ؛ مما يفضي إلى إنشاء أصول عمل ومخرجات وظيفية جاهزة للاستخدام الفوري وتنسجم كليًا مع متطلبات بيئة أعمالك ومعاييرها.

يتمتع نموذج GPT‑6 Astra بذائقة وحس بصري متقدم ينعكس جليًا على تصاميم المواقع الإلكترونية، وألعاب الفيديو، والبرمجيات التطبيقية، ونواتج عمليات تحويل الرسوميات التي ينفذها. وباستخدام المواقع⁠(يفتح في نافذة جديدة) في ChatGPT، يمكن لـAstra إنشاء مواقع إلكترونية وتطبيقات ويب وألعاب واستضافتها ومشاركتها مباشرة من خلال مطالبة.

"يمثل نموذج Astra نقلة فارقة تمنحنا أفضلية واضحة على مستويي الكفاءة والأداء التشغيلي؛ إذ ينهض بتنفيذ أشد تدفقات العمل الإبداعية تعقيدًا واحترافية، مع توفير استهلاك الرموز بنسبة تبلغ 20% مقارنة بسائر النماذج المنافسة التي خضعت لاختباراتنا. وتتجلى الفائدة الكبرى لعملائنا في انعكاس هذه الفاعلية بصورة مباشرة على تقديم مخرجات فائقة الدقة والجودة."
أليكس مشرابوف، الرئيس التنفيذي والشريك المؤسس، Higgsfield AI

عندما تترك التعليمات مجالًا للتفسير، يكون GPT‑6 Astra أفضل من النماذج السابقة في اتخاذ القرار الصحيح. حيث يستخدم السياق لسد الفجوات الروتينية، ويطرح أسئلة محددة عندما قد تؤدي الإجابة إلى تغيير النتيجة. أما في Codex، فيمكنه طرح الأسئلة بشكل غير متزامن مع مواصلة العمل الذي لا يعتمد على ردك. وفي حال عدم تلقي رد، فإنه يمضي وفق افتراضات معقولة عند الاقتضاء، لكنه يرجئ اتخاذ القرارات الحاسمة لحين تلقي توجيهاتك المباشرة.

توضح الأمثلة أدناه كيف يتعاون Astra في المهام اليومية التي يمكن أن تؤدي فيها المعلومات الناقصة إلى تغيير الإجابة بشكل جوهري.

يُبدي نموذج Astra أيضًا قدرة أفضل على الحفاظ على مساره مع تطوّر المهمة. كانت النماذج السابقة تتعامل أحيانًا مع رسائل التوجيه باعتبارها هدفًا جديدًا، فتفقد القدرة على تتبع الطلب الأصلي أو القيود السابقة. ويدمج Astra المتطلبات الجديدة، ويغيّر مساره عند الطلب، ويجيب عن الأسئلة الجانبية دون أن يهمل المهمة الأوسع.

"يشكل نموذج Astra قفزة نوعية في معايير الجودة مقارنة بإصدار نموذج GPT‑5.6 Sol في معالجة المهام القانونية المركبة؛ ففي مستهل مراحل الاختبار، لفت Astra الأنظار بمقاربته للأعمال القانونية على غرار فقيه قانوني بصير؛ حيث يعزل المستندات العادية عن السجلات الثابتة المعتمدة، ويسلط الضوء على الفرضيات المجردة من السند، ويعيد صياغة الثغرات ليحولها إلى دفوع ومواقف صياغية إجرائية محكمة."
نيكو جروبن، رئيس الأبحاث التطبيقية في Harvey

البرمجة

نموذج GPT‑6 Astra هو أفضل نموذج لهندسة البرمجيات حتى الآن.

1 من 2
“يقدم GPT‑6 Astra أداءً متقدمًا يعد الأفضل حتى الآن في معاييرنا الداخلية للبرمجة ويظهر تقدمًا واضحًا في تقييمات الحدس في التداول مقارنةً بـ GPT‑5.6 Sol. وعند استخدامه في البرمجة الوكيلة، يتواصل GPT‑6 Astra بطريقة يسهل على المطورين متابعتها وينتج شيفرة تتطلب تكرارات أقل للوصول إلى جودة الإنتاج.”
جون كريبيتزي، مساعدو الذكاء الاصطناعي، Jane Street

بالتزامن مع إطلاق Astra، نطرح آلية مبتكرة تتيح لبيئة Codex إدارة وحفظ السياق البرمجي واستدعائه بكفاءة بمجرد بلوغ نطاق السياق حد الامتلاء. فمن الناحية التاريخية، ركنت النماذج إلى تقنيات "تكثيف السياق" لتلخيص مجريات العمل أثناء الجلسات البرمجية الممتدة، كجلسات تتبع الأعطال البرمجية المستعصية أو إعادة هيكلة الأكواد المصدرية واسعة النطاق؛ وهو أسلوب قد يتسبب في إسقاط حيثيات دقيقة تفسر أسباب تعثر معالجة سابقة أو توضح المحددات التشغيلية لمكون برمجي بعينه. أما اليوم ضمن Codex، فإن Astra يمتلك القدرة على تدوين وتوثيق الملاحظات عبر فترات ونوافذ السياق المتتالية، محتفظًا بالجزئيات التقنية المتراكمة دون اللجوء إلى تقليصها قسرًا واختزالها في ملخص دوري وحيد. كما تظل نطاقات السياق السابقة مهيأة ومتاحة للفهرسة والبحث؛ مما يخول Astra الوصول المباشر إلى بنود المتطلبات ونتائج الاختبارات الواردة في المراسلات ومخرجات الأدوات السابقة، حتى وإن لم ترصدها ملاحظاته المدونة سلفًا. وتستطيع تفعيل هذه الميزة التجريبية في ملف التكوين config.toml الخاص بـ Codex،⁠(يفتح في نافذة جديدة) على أن يُعتمد بوصفه النمط التشغيلي الافتراضي لنموذج Astra خلال الأسابيع القليلة القادمة.

دفع عجلة الاكتشاف العلمي

"خلاصة القصة هي: نهاية عصر، وبداية عصر آخر."
غريغ بيرنهام، EpochAI

يشكل نموذج GPT‑6 Astra طفرة نوعية تدعم مسارات الاستكشاف العلمي، والرياضيات المتقدمة، والرعاية الصحية. ونستعرض اليوم نتيجتين بحثيتين إضافيتين تتناولان الفجوات بين الأعداد الأولية.9 و10

وإلى جانب ذلك، يحقق Astra أرقامًا قياسية جديدة عبر مجموعة من تقييمات الرياضيات والعلوم.

يمتلك نموذج Astra القدرة على إسناد المهام الإجرائية الميدانية التي تدعم مسيرة الاكتشاف العلمي. إذ يدمج بين ملكة التفكير والاستنتاج العلمي وإمكانات التحكم بالحاسوب، مما يتيح له التفاعل المباشر مع المنظومات البرمجية التخصصية لتحليل البيانات وتدقيق النتائج واستخلاص المؤشرات. وتكفل هذه المعالجة للباحثين تقييم الشواهد العلمية بموضوعية واتخاذ قرارات مدروسة حول مسارات الاستقصاء والبحث اللاحقة.

الأمن السيبراني

كما ناقشنا في تحديث السلامة⁠ الخاص بنا، يمثل Astra قفزة كبيرة في القدرات السيبرانية ويستوفي العتبة الحرجة في مجال الأمن السيبراني وفق إطار الجاهزية لدينا. ويمكن لقدرته على اكتشاف وتطوير استغلالات ثغرات يوم الصفر أن تساعد المدافعين في العثور على مكامن الضعف وتصحيحها، لكنها تخلق أيضًا حاجة إلى تدابير وقائية أكثر صرامة. ولفهم مدى اتساع نطاق هذه الإمكانات، أخضعنا Astra لتقييمات داخلية وتقييمات خبراء من جهات خارجية.

اختبرنا النموذج أولًا من دون إجراءات حماية الإنتاج على ExploitBench وExploitGym، اللذين يقيّمان ما إذا كانت النماذج قادرة على تحويل ثغرات برمجية معروفة إلى وسائل استغلال عملية. أحرز نموذج Astra العلامة الكاملة بنسبة 100% في معيار ExploitBench، متفوقًا بفارق ملحوظ على سلفه GPT‑5.6 Sol الذي سجل 78.5%، بوصفه نموذجنا الرائد السابق في مجالات القدرات والأمن السيبراني. وسجل نموذج Astra نسبة نجاح بلغت 42.4% في اختبارات ExploitGym، متفوقًا على نموذج GPT‑5.6 Sol الذي حقق 30.3%، مع تحقيق توفير ملحوظ وانخفاض جوهري في إجمالي رموز المخرجات.13

بالنظر إلى المخاوف من أن التعرض للثغرات البرمجية السابقة ربما أثّر في نتائج الاختبارات المعيارية، قيّمنا Astra أيضًا على اختبارين معياريين جديدين. فعلى سبيل المثال، أنشأنا تقييمًا داخليًا باسم "ExploitBench (يونيو–أغسطس 2026)" لاختبار تطوير استغلال الثغرات باستخدام ثغرات من الأشهر الثلاثة السابقة.14 حقق Astra معدلات أعلى بكثير في تنفيذ التعليمات البرمجية العشوائية مقارنةً بـ GPT‑5.6 Sol على مجموعة البيانات هذه، مع استخدام عدد أقل بكثير من رموز الإخراج. وخلال التقييم، اكتشف Astra أيضًا ثغرتين من ثغرات يوم الصفر لم تكونا معروفتين سابقًا واستخدمهما. ونحن نُفصح عن كلتا الثغرتين للجهات المسؤولة عن صيانتهما.

اختبرنا Astra أيضًا على معيار SRE-Bench15، وهو معيار يقيس قدرة النماذج على إجراء هندسة عكسية للثنائيات البرمجية لفهم منطقها الأساسي دون الوصول إلى الشيفرة المصدرية الخام. وقد استطاع Astra إنجاز 88.0% من المهام بنجاح من المحاولة الأولى، ووصلت النسبة إلى 99.2% في غضون أربع محاولات، وذلك في مقابل 55.9% و68.7% أحرزها سلفه GPT‑5.6 Sol على الترتيب.

وبعيدًا عن المقاييس المرجعية، أظهرت تقييمات قادها خبراء أن Astra، عند تشغيله من دون ضمانات الحماية الخاصة ببيئات الإنتاج، يمكنه توظيف ثغرات أمنية غير معروفة سابقًا لتحقيق تنفيذ تعليمات برمجية عشوائية في متصفحات ويب فائقة التحصين، وإنشاء عمليات استغلال لتصعيد الصلاحيات في أنظمة تشغيل شديدة التحصين.

ومثلما أوضحنا في "نافذة المدافع"، فإن القدرات السيبرانية فائقة التطور تمنح فرق الحماية والدفاع ميزة الكشف الاستباقي عن الثغرات وتسريع معالجتها؛ إلا أنها تيسر كذلك للمهاجمين سبل استغلال نقاط الضعف ذاتها، وهو ما يفرض واقعًا ملحًا يُحتم على مسؤولي الدفاع السيبراني سرعة التأقلم وتحديث آليات التصدي. مع إصدار Astra المطروح اليوم، يمكن لفرق الدفاع استخدامه لإنجاز مهام مثل المراجعة الأمنية للشيفرة وتطبيق التصحيحات.

وفي المقابل، سيمتنع Astra عن تنفيذ مهام الأمن السيبراني الأكثر تقدمًا، مثل إنشاء استغلالات لإثبات المفهوم للثغرات. ومن خلال OpenAI Daybreak⁠، نخطط لتوسيع نطاق الوصول وتطبيق ضمانات أقل تقييدًا خلال الأسابيع القادمة. وسيتيح ذلك المزيد من مسارات العمل الدفاعية، بما في ذلك التحقق من صحة الثغرات الأمنية وإثباتات المفهوم، وتحليل البرمجيات الخبيثة، وهندسة الكشف.

عملنا كذلك على تحصين دفاعاتنا الوقائية لمجابهة مخاطر الاستغلال السيبراني غير المشروع، مواصلين البناء على منظومة تدابير السلامة والحماية المطبقة في نموذج GPT‑5.6 Sol. وتتضمن هذه الإجراءات تعزيز متانة النموذج لمساعدته على التصدي بشكل أفضل لمحاولات تجاوز إجراءات الحماية، إلى جانب تزويد أنظمة المراقبة لدينا بسياق أكثر. وواصلنا إجراء اختبارات صارمة داخلية وخارجية، بما في ذلك تقييمات مؤتمتة باستخدام المهاجمين الداخليين في اختبار تقييم المخاطر لدينا. ويمكن الاطلاع على مزيد من التفاصيل حول إجراءات الحماية السيبرانية واختباراتنا في نظرة Astra العامة على السلامة⁠ وبطاقة النظام⁠(يفتح في نافذة جديدة).

مواءمة نموذج GPT‑6 Astra ونشره بمسؤولية

Astra هو نموذجنا الأكثر توافقًا. يتميز Astra بتوخي العناية، واحترام حدود المهام، والتواصل بشفافية. ويمثل هذا العمل أحدث ثمار برنامجنا البحثي المستمر منذ فترة طويلة، والذي يركز على تدريب نماذج تظل متوافقة مع النوايا البشرية من البداية إلى النهاية.

في البيئات الحساسة، يمضي Astra بحذر يتناسب مع مستوى المخاطر. ففي تقييمٍ لمهام استخدام الحاسوب اختيرت بأسلوب خصومي لاستثارة سلوك غير مرغوب، كان Astra أكثر نجاحًا في تجنّب العواقب غير المقصودة. وأسفر التشغيل مع تدابير الأمان الإضافية المتاحة افتراضيًا عن أداء أقوى حتى.

يتسبب Astra في عدد أقل من النتائج غير المتوائمة مقارنة بأي نماذج رائدة أخرى خضعت للاختبار. ولإجراء مقارنة عادلة، استخدمنا منظومة التقييم عامة لوكيل ذكي للتعامل مع الحاسوب (استنادًا إلى أدوات استخدام الحاسوب الأصلية المتاحة في كل من OpenAI Responses API⁠(يفتح في نافذة جديدة) و Anthropic Messages API⁠(يفتح في نافذة جديدة))، من دون وسائل الحماية الإضافية المطبقة عادةً على مستخدمي Codex وChatGPT Work (المراجعة التلقائية وسياسة التأكيد).

كما يُرجح أن يعمل Astra أيضا ضمن الحدود التي يحددها المستخدم وتوحي بها بيئتها. في تقييم داخلي، لم يحاول Astra مطلقا التحايل على قرار رفض صادر عن المراجعة التلقائية في Codex. ظل ذلك صحيحا حتى عندما تم تكوين المراجعة التلقائية عمدا بحيث يمكن التحايل عليها، وكان من المستحيل إكمال المهمة بخلاف ذلك. ويتسق هذا الاحترام لقيود البيئة مع نتائج تقييمنا لمهمة سيبرانية مستحيلة، التي شاركناها في مقدمة هذه التدوينة، ومع النتائج الأخرى الموثقة في بطاقة النظام⁠(يفتح في نافذة جديدة).

كما يحقق Astra أرقامًا قياسية جديدة في التواصل الشفاف مع المستخدمين. في أحد التقييمات، كان Astra أقل احتمالًا بثلاث مرات من GPT‑5.6 Sol لتقديم تصورات غير دقيقة عن قدراته وإمكاناته.

أظهر نموذج Astra في اختباراتنا لتقييم الهلوسة المتعلقة بالقدرات طفرة ملحوظة مقارنة بنموذج GPT‑5.6 Sol؛ إذ سجل انخفاضًا ملموسًا في الادعاءات غير الدقيقة والمضللة المتعلقة بحدود قدراته الوظيفية.

كشفت تقييماتنا أن مراقبة الاستدلال المكتوب لدى Astra أصعب منها لدى GPT‑5.6 Sol، وذلك استنادًا إلى اختبارات طُلب منه فيها صراحةً التهرب من المراقبة. ونعزو ذلك إلى قدرة Astra الأكبر على التحكم في استدلاله المكتوب في المهام الأبسط، وإلى قدرته على حل المشكلات بخطوات مكتوبة أقل. ومع ذلك، لا يزال Astra يواجه فيما يبدو صعوبة في إخفاء الاستدلال اللازم للمهام المعقدة، لكننا نتعامل مع هذا التراجع بجدية. ويظل تحسين قابلية المراقبة أولوية بحثية، وتعرض بطاقة النظام⁠(يفتح في نافذة جديدة) المصاحبة بالتفصيل نتائجنا والعمل الجاري في هذا المجال.

يُعدّ التدريب على المواءمة ركيزة أساسية في نهجنا للنشر. وكطبقة إضافية من الدفاعات، نبني أيضًا إجراءات حماية للنظام، مثل Codex المراجعة التلقائية⁠(يفتح في نافذة جديدة) ونراقب استدلالات الوكلاء وإجراءاتهم للمساعدة في اكتشاف السلوك غير الآمن واحتوائه. وكما هو موضح في تحديث السلامة⁠ لدينا، ننشر أيضًا مراقبة عدم التوافق في بيئة الإنتاج للنماذج من فئة Astra، بهدف إتاحة رؤية واضحة لعدم التوافق والمساعدة في احتواء أشد حالاته. وتشبه إجراءات الحماية هذه نظام مراقبة عمليات النشر الداخلية لدينا، وتشمل منظومة من المصنّفات التي تتحقق من استدلال النموذج وإجراءاته لرصد السلوك غير المصرّح به، وتوقف تلقائيًا الأنشطة التي يُحتمل أن تكون غير مصرّح بها.

نظرًا للزيادة الكبيرة في قدرات Astra في الأمن السيبراني، فإننا نتوخى حذرًا خاصًا لضمان أن يكون هذا النشر آمنًا ومحميًا. ويمكن أن تؤدي عمليات التحقق الإضافية من السلامة أحيانًا إلى إبطاء الأعمال المشروعة أو إيقافها مؤقتًا أو إيقافها تمامًا، بما في ذلك الأمن السيبراني الدفاعي. وفي حال إيقاف المهمة مؤقتًا في ChatGPT أو Codex، قد يتعين على المستخدم فحص الإجراء التشغيلي واعتماده لاستئناف العمل؛ في حين يؤدي ذلك إلى الإنهاء الفوري للمهمة عند التعامل عبر واجهة API. ومع إدراكنا لما قد تُحدثه عمليات التحقق هذه والتدابير من تعطيل عارض للأنشطة والأعمال المصرح بها، فإننا نكثف مسارات التطوير المرحلي والتحديث المستمر لتخفيف وطأة الانقطاعات غير المبررة. لا يمكن لمراقبة عدم المواءمة أن تحل محل المواءمة: هدفنا هو بناء نماذج تظل ضمن نطاق صلاحياتها بشكل موثوق، بحيث لا تحتاج إجراءات الحماية هذه إلى التدخل.

التوفّر

يبدأ اليوم طرح GPT‑6 Astra لمجموعة محدودة من المؤسسات، وسيصبح متاحًا خلال الأيام المقبلة لجميع مستخدمي ChatGPT Plus وPro وBusiness وEnterprise، وكذلك عبر OpenAI API وMicrosoft Azure وAWS Bedrock. ويُحتسب استخدام Astra ضمن الحصص الحالية للاشتراك، وسيتمكن المستخدمون والشركات أيضًا من شراء أرصدة لاستخدام إضافي. وسيحصل مستخدمو خطط Pro وBusiness وEnterprise أيضًا على إمكانية الوصول إلى GPT‑6 Astra Pro. ويملك مسؤولو Enterprise صلاحية تمكين Astra لمساحات العمل المؤسسية التابعة لهم، مع الإحاطة بأن خاصية الوصول ستكون غير مفعلة بصورة افتراضية مع انطلاق الخدمة.

يدعم Astra عدم الاحتفاظ بالبيانات لعملاء API المؤهلين، وكما أشرنا الشهر الماضي، نختبر Private Safety Processing لتعزيز مراقبة السلامة مع الحفاظ على خصوصية العملاء.

وللمطورين، سيتوفر GPT‑6 Astra في واجهة OpenAI API باسم gpt-6-astra ومن خلال Microsoft Azure وAmazon Bedrock.

وتتحدد خطة التسعير القياسية (Standard pricing) في واجهة OpenAI بواقع 10 دولارات لكل مليون رمز إدخال، و50 دولارًا لكل مليون رمز إخراج، مع اعتماد تعريفات تسعيرية مستقلة لعمليات قراءة التخزين المؤقت وتحديثه. ويتوفر "الوضع السويع" لنموذج GPT‑6 Astra في واجهة API، ويوفّر سرعة تصل إلى ضعفي سرعة المعالجة القياسية، مقابل تكلفة تعادل ضعفي السعر القياسي.

استخدام الحاسوب

استخدام الحاسوب

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08، المجموعة غير المتصلة بالإنترنت، النتيجة الجزئية)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (بدون أدوات)

92.7%

76.9%

-

87.3%17

-

-

احترافي

احترافي

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

مهام التصميم الداخلية

50.0%

47.4%

-

35.8%

-

-

مهام علم البيانات الداخلية

40.9%

30.5%

-

34.7%

-

-

مؤشر مستوى الذكاء الاصطناعي التحليلي الإصدار 4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

البرمجة

البرمجةGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 الموسع (النتيجة)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 الرئيسي (النتيجة)53.3% 847.5%50.9%53.5%53.4%43.6%
مهام داخلية لترحيل قواعد البيانات63.9%42.7%57.8%50.3%--
مؤشر وكيل البرمجة من Artificial Analysis الإصدار 1.467.065.1-67.268.161.2

أكاديمي

أكاديمي

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath المستوى 4 (الإصدار 2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

ماسة GPQA

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

الامتحان الأخير للبشرية (مع الأدوات)

57.2%

-

65.0%

63.8%

63.6%

-

العلوم والصحة

العلوم والصحةGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (داخلي)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (معدّل حسب الطول)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

الأمن السيبراني

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (يونيو-أغسطس 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

التوافق

التوافق

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

معيار السلامة للاستخدام الداخلي للحاسوب (الأقل هو الأفضل)

2.4%

22.0%

9.5%

18.3%

11.5%

-

معيار قياس داخلي لسلامة استخدام الكمبيوتر، مع AutoReview (الأقل هو الأفضل)

1.8%

4.3%

-

-

-

-

المعيار الداخلي لقياس التحايل (الأقل هو الأفضل)

0.00%

0.29%

-

-

-

-

مصيدة ExploitGym الإلكترونية (الأقل هو الأفضل)

0.0%

48.2%

-

-

-

-

ExploitGym المستحيل

100.0%

-

-

-

-

-

معيار داخلي للهلوسة (الأقل هو الأفضل)

4.2%

12.2%

-

-

-

-

السياق الطويل

السياق الطويل

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

الاستدلال المجرد

الاستدلال المجردGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

درجات التقييم هي أعلى الدرجات المحققة عبر مستويات الجهد المختلفة. وأُجريت تقييمات GPT في بيئتنا البحثية أو عبر واجهة API الخاصة بنا، ما قد يؤدي إلى مخرجات تختلف قليلًا عن ChatGPT في بيئة الإنتاج بسبب الاختلافات في مطالبات النظام والأدوات المتاحة وغيرها.

الحواشي

  1. 1

    في ARC-AGI-3، شُغّل GPT-6 Astra باستخدام منظومة التقييم لواجهة برمجة تطبيقات Responses الخاصة بنا⁠، والتي تغيّر إعدادين لمحاكاة الأداء في العالم الواقعي بصورة أفضل. ولا تستهدف هذه التغييرات ARC-AGI-3 تحديدًا.

  2. 2

    يشير GPT-5.6 Sol إلى الإصدار المتاح في واجهة API الخاصة بنا وChatGPT Codex وChatGPT Work. يختلف الإصدار في ChatGPT "دردشة" اختلافًا طفيفًا.⁠

  3. 3

    OSWorld V2-Offline هي مجموعة فرعية من OSWorld V2 الأصلي تعمل دون اتصال بالإنترنت. أعاد المؤلفون إنتاج أداء نموذج Claude على OSWorld-V2 Offline في لوحة الصدارة الرسمية⁠(يفتح في نافذة جديدة). وفي OSWorld 2.0، تستخدم درجات Claude الإعدادات الرسمية، وليس المهام المعدلة والتقييم المعدل الواردين في بطاقة نظام Fable 5.1.

  4. 4

    تمثل أوقات النموذج المدد الزمنية المنقضية المبلّغ عنها لعروض التشغيل التوضيحية المقابلة. والمقاطع المعروضة هي مقتطفات محررة.

  5. 5

    على BenchCAD، تعكس درجات Claude ثلاثة تعديلات على التقييم، وهي مفصلة في بطاقة نظام Fable 5.1⁠(يفتح في نافذة جديدة).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. "LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(يفتح في نافذة جديدة)." arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus⁠(يفتح في نافذة جديدة).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    في FrontierCode، تم تشغيل GPT-6 Astra باستخدام رسالة  مطور مشابهة لقسم من رسالة المطور الخاصة به في Codex⁠(يفتح في نافذة جديدة): "تجنب إنشاء عدد مفرط من ملفات الاختبار. أنشئ ملف اختبار جديدًا فقط عندما تقتضي ذلك اصطلاحات المستودع أو عندما لا يكون أي ملف موجود مكانًا مناسبًا له. تجنّب تنقيح الشيفرة غير المرتبط بالمهمة والتعقيد غير الضروري. أعِد استخدام الأدوات المساعدة الحالية المناسبة. اقرأ تعليمات المستودع ذات الصلة وافحص الشيفرة والاختبارات والوثائق وCI القريبة. اتبع الاصطلاحات المعتمدة. الهدف هو شيفرة نظيفة وقابلة للدمج." لم يتم تحسين المطالبة للتقييم.

  9. 9

    تتعلق الأولى بمدى تقارب الأعداد الأولية من بعضها، مهما ابتعدت على خط الأعداد. لأكثر من عقد، أثبتت أفضل نتيجة معروفة وجود عدد لا نهائي من أزواج الأعداد الأولية التي لا تتجاوز المسافة بينها 246. جوليا شتادلمن⁠(يفتح في نافذة جديدة) حسّنت مؤخرًا ذلك الحد ليصبح 240. ساعد Astra في إثبات حد أقوى قدره 186، مما يبيّن أن عددًا لا نهائيًا من الأزواج يقع ضمن هذه المسافة الأصغر. الفجوات القصيرة بين الأعداد الأولية: البرهان⁠(يفتح في نافذة جديدة) والأبحاث الداعمة⁠(يفتح في نافذة جديدة).

  10. 10

    ويتعلق الثاني بفجوات كبيرة على نحو غير معتاد بين الأعداد الأولية. حسّن Astra عنصرًا في حد لهذه الفجوات ظل دون تغيير لأكثر من 80 عامًا. نشارك البراهين وسلسلة استدلال مختصرة ومواد التحقق الخاصة بالنتيجتين. الفجوات الكبيرة بين الأعداد الأولية: البرهان⁠(يفتح في نافذة جديدة) والأبحاث الداعمة⁠(يفتح في نافذة جديدة).

  11. 11

    أجرينا تقييمًا مستقلًا لجميع نماذج Claude وفقًا للإجراء المعتمد في HealthBench Professional، باستخدام GPT-5.4 للتقييم ودرجات معدّلة حسب الطول وغير مقتطعة. وبالنسبة إلى Fable 5.1، استخدمنا Opus 5 كخيار احتياطي في حالات رفض المزوّد.

  12. 12

    لم يتم تضمين Claude Fable 5 و5.1 في تقييمات LifeSciBench Gold v1 وGeneBench Pro v13 وMedChemBench لأنهما يرفضان الإجابة عن غالبية الأسئلة في هذه التقييمات.

  13. 13

    على ExploitGym، اختبرنا Astra وSol من دون الحد الزمني البالغ ست ساعات، وذلك لتقييم قدراتهما السيبرانية الكاملة على نحو أفضل. إنهما سريعان بما يكفي بحيث لا يكون لذلك سوى تأثير ضئيل.

  14. 14

    يحتوي ExploitBench (يونيو–أغسطس 2026) على 20 ثغرة عالية الخطورة في V8 عبر 13 إصدارًا مستقرًا من Chrome. يختبر هذا المعيار ما إذا كان بإمكان الوكلاء تنفيذ تعليمات برمجية اعتباطية في V8 وإصدارات Chrome الرسمية لنظام Linux من خلال استغلال كل ثغرة محددة. وقد لا تتيح بعض الثغرات الأمنية المدرجة تنفيذ تعليمات برمجية عشوائية ضمن قيود التقييم، ولذلك قد لا يكون من الممكن تحقيق معدل نجاح بنسبة 100%. ملاحظة: إن نتيجة GPT-5.6 Sol البالغة 5.5% هي أثر ناتج عن حد 300 جولة في المعيار، وهو حد لا يواجهه العملاء الفعليون الذين يستخدمون Max. حقق النموذج، في إعدادات مماثلة، درجة قدرها 11.5% عند الوصول إلى عدد أقل من الحدود.

  15. 15
  16. 16

    عند إجراء الاختبارات عبر نماذج تابعة لجهات خارجية، نستخدم إعدادًا بحثيًا أبسط. يتضمن Codex تكوينًا أكثر تعقيدًا في بيئة الإنتاج، ما قد يؤدي إلى اختلاف معدلات أخطاء النموذج الخام. ولا تزال وسائل الحماية لدى الموفرين وتنفيذ أدوات الحاسوب تختلف. لا يواجه المستخدمون سيناريو عدم التأكيد في Codex، لأنه تكوين بحثي داخلي.

  17. 17

    بالنسبة إلى ScreenSpot-Pro وExploitGym، تأتي درجات Fable التي نوردها من Mythos، وهو Fable مزود بضمانات أقل.