GPT-6.1Sol
ذكاء يقترب من Astra بخُمس السعر لأداء رائد ومستدام
نقدّم GPT‑6.1 Sol، ترقيةً لنموذج GPT‑6 Sol بأداء قوي استثنائي في البرمجة الوكيلة، إلى جانب استخدام الحاسوب والعمل المهني. يقرّب هذا التحديث أداء Sol من GPT‑6 Astra في المهام الصعبة، بخُمس أسعار Astra القياسية لرموز المدخلات والمخرجات، ما يتيح للمطوّرين مجالًا أوسع لبناء وكلاء ذوي قدرات عالية وتشغيلهم ضمن الميزانية نفسها.
يقدّم GPT‑6.1 Sol أداءً يقترب من Astra بأسعار Sol، ليكون النموذج الأكثر كفاءة من حيث التكلفة مقابل الأداء بين النماذج المتاحة اليوم. تبلغ تكلفة المدخلات المخزّنة مؤقتًا $0.10 فقط لكل مليون رمز، أي بخصم 95% عن أسعار المدخلات القياسية، ما يجعله أوفر لأعباء عمل الوكلاء التي تتطلب إعادة استخدام السياق عبر طلبات متكررة.
يظل GPT‑6 Astra الأكثر قدرةً إجمالًا بين نماذجنا الرائدة. يقدّم GPT‑6.1 Sol توازنًا جديدًا بين القدرات والتكلفة لإنجاز الأعمال المهمة التي يريد المستخدمون أداءها بوتيرة أكبر، ولعملاء API الذين يبنون التطبيقات ويشغّلونها على نطاق واسع.

يحقّق GPT‑6.1 Sol تحسينات كبيرة مقارنةً بـGPT‑6 Sol في الأعمال المهنية المعقّدة، بدءًا من كتابة الشيفرات وتصحيح أخطائها وصولًا إلى فهم المستندات وتنفيذ سير عمل متعدد الخطوات في الأعمال. وفي عدد من هذه التقييمات، يقترب من أداء GPT‑6 Astra بتكلفة أقل بكثير.
في DeepSWE v1.1، الذي يقيّم مهام هندسة البرمجيات المعقّدة في قواعد شيفرات حقيقية، يضاهي GPT‑6.1 Sol أداء GPT‑6 Astra بخُمس التكلفة تقريبًا، ويتجاوز أفضل نتيجة لنموذج GPT‑6 Sol بفارق 6.4 نقطة مئوية، بجهد استدلال وتكلفة أقل.
في اختبار DeepSWE 1.1(يفتح في نافذة جديدة)، يُنجز وكلاء الذكاء الاصطناعي مهام أصلية في هندسة البرمجيات تتطلب العمل على مدى طويل.
في GDP.pdf، الذي يقيس دقة إجابات النماذج عن الأسئلة المهنية باستخدام مستندات PDF معقّدة تشمل جداول ورسومًا بيانية ومخططات وتفاصيل بخط صغير، يحقّق GPT‑6.1 Sol نتيجة أعلى من Opus 5.5 مع بدائل احتياطية، بأقل من نصف التكلفة لكل مهمة، عبر إعدادات الاستدلال التي خضعت للاختبار. كما يقترب من الأداء المتصدّر لنموذج GPT‑6 Astra بخُمس التكلفة لكل مهمة تقريبًا.
في اختبار GDP.pdf(يفتح في نافذة جديدة)، يتعين على النماذج الاستجابة لطلبات واقعية تتعلق بملفات PDF معقدة مأخوذة من سير عمل مهنية في مجالات التمويل والرعاية الصحية والقانون وسبعة مجالات مهنية أخرى.
في AutomationBench، الذي يقيس ما إذا كان الوكلاء يُتمّون سير عمل الأعمال متعدد الخطوات على نحو صحيح، يتفوّق GPT‑6.1 Sol على Opus 5.5 بفارق 2.2 نقطة مئوية عند جهد استدلال متوسط، بثلث التكلفة تقريبًا. وتزيد هذه النتيجة أيضًا على نتيجة GPT‑6 Sol بمقدار 4.8 نقطة مئوية عند الإعداد نفسه.
In AutomationBench 1.0.6(يفتح في نافذة جديدة), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
يحقّق GPT‑6.1 Sol أيضًا تقدّمًا كبيرًا في المهام التي تتطلب التفاعل مع تطبيقات الحاسوب. في مجموعة الاختبارات غير المتصلة بالإنترنت من OSWorld 2.0، التي تقيّم الوكلاء في مسارات عمل صعبة تتطلب استخدام الحاسوب، يتفوّق GPT‑6.1 Sol على GPT‑6 Sol بسبع نقاط مئوية عند أقصى جهد استدلال، وبأقل من نصف التكلفة. ولا يفصله عن نتيجة Astra عند أقصى جهد استدلال سوى 2.1 نقطة مئوية، بنحو سُبع التكلفة لكل مهمة.
In OSWorld 2.0(يفتح في نافذة جديدة), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
في Terminal-Bench Science 0.1، الذي يقيّم مسارات العمل العلمية بما فيها تحليل البيانات والمحاكاة وإثبات النظريات، يحقّق GPT‑6.1 Sol أكثر من ضعف نتيجة GPT‑6 Sol عند أقصى جهد استدلال، بأقل من نصف التكلفة لكل مهمة. عند أقصى جهد، تبلغ تكلفة GPT‑6.1 Sol في المتوسط $5.47 لكل مهمة، مقارنةً بـ$23.21 لنموذج Opus 5.5 و$23.80 لنموذج Astra، مقدّمًا قدرات علمية كبيرة بتكلفة أقل بأكثر من 75% من كلا النموذجين.
لا يزال GPT‑6 Astra يحقّق أعلى نتيجة بين النماذج التي خضعت للاختبار، بنسبة 68.1%، وينبغي استخدامه لأصعب مهام البحث العلمي.
في اختبار Terminal-Bench Science 0.1(يفتح في نافذة جديدة)، يُنجز الوكلاء مهام سير عمل البحث العلمي باستخدام الشيفرات البرمجية وأدوات سطر الأوامر، بما يشمل تحليل البيانات وإجراء عمليات المحاكاة وملاءمة النماذج.
يحسّن GPT‑6.1 Sol أيضًا دقة الحقائق في الإجابة عن الطلبات الصعبة. عند جهد استدلال عالٍ جدًا، يبلغ معدل أخطاء الحقائق لديه 4.1%، انخفاضًا من 4.5% لنموذج GPT‑6 Sol واقترابًا من معدل Astra البالغ 4.0% عند الإعداد نفسه، مع تكلفة أقل من Astra بنحو 83% لكل مهمة.
يقيس هذا التقييم نسبة الإجابات التي تحتوي على خطأ واحد على الأقل في الحقائق، باستخدام محادثات أُزيلت منها معلومات تحديد الهوية وكان المستخدمون قد أبلغوا فيها عن خطأ ارتكبه نموذج سابق. هذه الطلبات صعبة عمدًا ولا تمثّل الاستخدام المعتاد.
نقيّم دقة الحقائق باستخدام محادثات ChatGPT أُزيلت منها معلومات تحديد الهوية، وكان المستخدمون قد أبلغوا فيها عن خطأ في الحقائق ارتكبه نموذج سابق. ولا تمثّل هذه المحادثات التي تؤدي إلى أخطاء الاستخدام المعتاد، حيث تكون أخطاء الحقائق أكثر ندرة.
يُظهر GPT‑6.1 Sol تحسينات كبيرة مقارنةً بـGPT‑6 Sol في تقييمات المواءمة لدينا، ما يقرّبه من GPT‑6 Astra.
يتّسم GPT‑6.1 Sol بشفافية أكبر بشأن حدوده، وبموثوقية أعلى في الالتزام بقصد المستخدم وقيود السلامة. في التقييمات الصعبة، يُظهر معدلات إخفاق أقل من GPT‑6 Sol في الإفصاح عن تعطّل أدوات البحث، والالتزام بالقيود الصريحة، وتجنّب النتائج غير المصرّح بها أثناء مهام الوكلاء. لم نرصد أي محاولات لتجاوز مراجع سلامة آلي، وهي النتيجة نفسها التي حققها GPT‑6 Astra وGPT‑6 Sol.
تختبر التقييمات أدناه مواقف صعبة عمدًا، ولا تقيس معدلات الإخفاق في الاستخدام المعتاد.
يتوفّر GPT‑6.1 Sol بدءًا من اليوم لجميع مستخدمي Plus وPro وBusiness وEnterprise وEdu في ChatGPT العمل وCodex. هذه النماذج غير متاحة بعد في الدردشة. يمكن للمطوّرين أيضًا الوصول إليه عبر واجهة OpenAI API باسم gpt-6.1-sol. تبلغ أسعاره القياسية عبر API مبلغ $2 لكل مليون رمز إدخال، و$0.10 لكل مليون رمز إدخال مخزّن مؤقتًا، و$10 لكل مليون رمز إخراج.
وبالتزامن مع ذلك، نطلق GPT‑6 Astra Ultrafast، أسرع نموذج رائد في العالم، بسرعة تصل إلى 8 أضعاف سرعة GPT‑6 Astra، إلى جانب GPT‑6.1 Sol Ultrafast. يتوفّر هذان النموذجان عبر API، وكذلك في ChatGPT العمل وCodex لمستخدمي فئة Pro الجديدة ذات أعلى حدود استخدام، مقابل $500 شهريًا. مع GPT‑6.1 Sol Ultrafast، يمكن للمطوّرين الحصول على ذكاء يقترب من Astra بسرعة تصل إلى 8 أضعاف، وبإنفاق عبر API يعادل تقريبًا تكلفة GPT‑6 Astra سابقًا.

