تخطي إلى المحتوى الرئيسي
OpenAI

تقديم GPT‑6 Sol وLuna

طرق أكثر لإدخال الذكاء الرائد في عملك اليومي.

جاري التحميل...

في وقت سابق من هذا الشهر، قدمنا GPT‑6 Astra، النموذج الأذكى والأكثر مواءمة في العالم. مع أن المشاريع الأكثر تطلبًا وأهمية لا تزال تستلزم كامل قدرات Astra، فإن العمل يجري على مستويات وبوتائر وميزانيات مختلفة.

لذلك نوسّع منظومة GPT‑6 بإضافة GPT‑6 Sol وGPT‑6 Luna. أطلق GPT‑6 Astra جيلًا جديدًا من الذكاء، ويساعد هذان النموذجان في تعميم فوائده عبر إرساء معيار رائد لكفاءة التكلفة. درّبنا GPT‑6 Sol وLuna بأساليب مشابهة لتلك المستخدمة مع GPT‑6 Astra، لننقل التطورات الكامنة وراء أداء Astra المتطور في العمل المهني والدقة الواقعية والبرمجة واستخدام الكمبيوتر والمواءمة إلى نماذج أسرع وأقل تكلفة.

تتصدر نماذج GPT‑6 منحنى التكلفة مقابل الذكاء، إذ تجمع بين قدرات استثنائية في كل فئة وبنية تحتية تتيح تقديمها بكفاءة وعلى نطاق واسع. تتيح لنا التحسينات في التخزين المؤقت والاستدلال تقديم هذه النماذج بتكلفة أقل، وننقل هذه الوفورات مباشرة إلى المستخدمين والعملاء عبر خفض أسعار واجهة API لنموذجي Sol وLuna بنسبة 50% مقارنة بأسعارهما الترويجية ضمن GPT‑5.6. تجعل هذه التحسينات مجتمعةً الذكاء الاصطناعي المتقدم عمليًا لمزيد من المهام اليومية والتطبيقات واسعة النطاق.

أسعار واجهة API لنماذج GPT‑6

النموذج

الإدخال

الإخراج

خفض السعر

GPT‑6 Sol
مقابل GPT‑5.6 Sol

$4 ← $2

$20 ← $10

أقل تكلفة بنسبة 50%

GPT‑6 Luna
مقابل GPT‑5.6 Luna

$0.20 ← $0.10

$1.20 ← $0.50

أقل تكلفة بنسبة 50%

الأسعار لكل مليون رمز.

يظل GPT‑6 Astra أفضل نماذجنا في جميع الجوانب. اختره عندما تريد أفضل النتائج وتجربة بلا تنازلات.

تحسّن عبر عائلة النماذج

يجلب GPT‑6 Sol وLuna تحسينات في الذكاء وكفاءة التكلفة إلى النماذج التي تعرفها وتستخدمها بالفعل، ولا سيما في القدرات الأكثر فائدة لإنجاز الأعمال المعقدة.

العمل المهني

يستطيع GPT‑6 Sol تولّي مهام العمل الصعبة مع منحك مجالًا أوسع للتجربة والتحسين المتكرر بفضل حدود الاستخدام الأعلى والتكلفة الأقل، كما يقدم ذكاءً أعلى ونتائج أفضل من نماذج المنافسين المماثلة سعرًا.

في اختبار AutomationBench، الذي يقيس سير العمل التجاري عبر التطبيقات، يتفوق GPT‑6 Sol بمستوى جهد عالٍ جدًا على Claude Opus 5 بمستوى جهد Max، وبتكلفة لا تتجاوز 9% من تكلفة Opus 5 لكل مهمة. عند مستوى جهد عالٍ، يتفوق GPT‑6 Luna على سلفه بـ5.4 نقاط مئوية، مع تكلفة أقل لكل مهمة بنسبة 58%.

في AutomationBench 1.0.6⁠(يفتح في نافذة جديدة)، يُختبر وكلاء الذكاء الاصطناعي في سير عمل متكامل باستخدام 47 أداة في مجالات المبيعات والتسويق والعمليات والدعم والمالية والموارد البشرية. تقلل نقطة بيانات Claude Fable 5.1 من تقدير تكلفته الفعلية، لأنها لا تشمل تكلفة الرجوع إلى Opus 5، وهو ما حدث في نحو 40% من المهام.

يتفوق GPT‑6 Sol أيضًا على Claude Fable 5.1 بتكلفة أقل بكثير، بل ويتجاوز GPT‑6 Astra عند مستوى جهد منخفض.

النموذج (والجهد)

النتيجة

التكلفة لكل مهمة

GPT‑6 Sol (عالٍ جدًا)

33.2%

$0.27

GPT‑6 Astra (منخفض)

30.3%

3.9x GPT‑6 Sol

Claude Opus 5 (Max)

26.9%

11.1x GPT‑6 Sol

Claude Fable 5.1 مع الرجوع إلى Opus 5 (Max)

31.4%

>8.9x GPT‑6 Sol

(لم يُبلَّغ عن تكلفة الرجوع)

في اختبار Agents’ Last Exam، الذي يقيّم الوكلاء في مهام مهنية معقدة، يحقق GPT‑6 Sol عند مستوى جهد Max نتيجة 56.4%، متجاوزًا أعلى نتيجة لـClaude Opus 5 في التقييم، وبتكلفة أقل لكل مهمة بنسبة 60%.

في Agents’ Last Exam V1⁠(يفتح في نافذة جديدة)، يُقيَّم وكلاء الذكاء الاصطناعي في مهام طويلة الأمد وذات قيمة اقتصادية تشمل 55 قطاعًا فرعيًا وتغطي معظم المجالات الرئيسية للعمل المهني المنجز على الكمبيوتر.

الدقة الواقعية

تعتمد فائدة الإجابة على صحة الحقائق، ونواصل إحراز تقدم في الموثوقية الواقعية. في تقييمنا الداخلي للدقة الواقعية، المستند إلى محادثات واقعية منزوعة الهوية أبلغ فيها المستخدمون عن أخطاء ارتكبتها نماذجنا، يرتكب GPT‑6 Sol نحو نصف عدد أخطاء سلفه، مقتربًا من موثوقية Astra بتكلفة أقل بكثير. يتحسن GPT‑6 Luna أيضًا بدرجة كبيرة؛ فعند مستويات الجهد الأعلى، يضاهي GPT‑5.6 Sol بتكلفة تقارب واحدًا من مئة من تكلفته.

نقيّم هنا الدقة الواقعية باستخدام محادثات ChatGPT منزوعة الهوية أبلغ فيها المستخدمون عن خطأ واقعي من نموذج سابق. ولا تمثل هذه المحادثات المحفزة للأخطاء الاستخدام المعتاد، الذي تكون فيه الأخطاء الواقعية أندر. لم تُضبط النتائج بحسب الطول؛ لكن اختباراتنا لمستويات الإسهاب أظهرت أن طول الإجابة لا يؤثر فيها تقريبًا.

البرمجة

بدأ وكلاء البرمجة هذا العام في معالجة مهام أكثر تعقيدًا واتساعًا وطولًا من أي وقت مضى. نما استخدامنا الداخلي في OpenAI نموًا متسارعًا. عند احتساب القيمة بأسعار واجهة API، تجاوز الاستخدام اليومي للرموز 600 دولار للباحث الوسيط و7,000 دولار للباحثين ضمن الشريحة المئوية التسعين (تسريع البحث: نظرة من داخل OpenAI⁠). كلما تولّى وكلاء البرمجة مهام أطول وأكثر تطلبًا، ازدادت أهمية تكلفة الاستخدام المستمر. يجمع GPT‑6 Sol وLuna بين الأداء القوي في البرمجة وانخفاض أسعار واجهة API، ما يمنح المطورين مجالًا أكبر للتكرار ويشجع الفرق على تكليف Codex بمهام أكثر طموحًا.

في اختبار FrontierCode، الذي يقيّم ما إذا كان وكلاء البرمجة ينتجون تغييرات جاهزة للدمج في قواعد شيفرة حقيقية، يتحسن GPT‑6 Sol بدرجة كبيرة مقارنةً بـGPT‑5.6 Sol ويضاهي Claude Fable 5.1 عند مستوى جهد عالٍ جدًا، بتكلفة أقل بكثير.

في FrontierCode 1.1 Main⁠(يفتح في نافذة جديدة)، يكتب وكلاء الذكاء الاصطناعي شيفرة تُقيَّم ليس فقط من حيث صحتها، بل أيضًا من حيث «قابليتها للدمج»، مثل جودة الاختبارات، والانضباط في نطاق العمل، وأسلوب الشيفرة، والالتزام بمعايير قاعدة الشيفرة.

في اختبار DeepSWE v1.1، الذي يقيس الأداء في مهام هندسة برمجيات معقدة ضمن قواعد شيفرة حقيقية، يحقق GPT‑6 Sol عند مستوى جهد Max نتيجة 68.8%، بفارق 1.1 نقطة مئوية فقط عن أعلى نتيجة لـClaude Fable 5 في التقييم، وهي 69.9% عند مستوى جهد عالٍ جدًا، وبتكلفة أقل لكل مهمة بنحو 80%.

يحقق GPT‑6 Luna عند مستوى جهد Max نتيجة 66.6%، وهي مماثلة لنتيجتي Claude Opus 5 وFable 5 عند مستوى جهد متوسط. في هذه المقارنات، تقل تكلفة Luna لكل مهمة بنسبة 93% عن Opus 5 وبنسبة 96% عن Fable 5.

في DeepSWE 1.1⁠(يفتح في نافذة جديدة)، يحل وكلاء الذكاء الاصطناعي مهام أصلية ممتدة في هندسة البرمجيات.

استخدام الكمبيوتر

مع أن GPT‑6 Astra يظل أفضل نموذج في العالم لاستخدام الكمبيوتر، فإن GPT‑6 Sol وLuna يقدمان أداءً أعلى كفاءة من حيث التكلفة مقارنةً بسلفيهما. في اختبار OSWorld 2.0 offline، يحقق GPT‑6 Sol عند مستوى جهد عالٍ جدًا نتيجة مماثلة لـClaude Opus 5 عند مستوى جهد متوسط، وهي 60.5% مقابل 60.3%، وبتكلفة أقل لكل مهمة بنحو 80%. يستطيع GPT‑6 Luna عند مستوى جهد Max التفوق على GPT‑5.6 Sol عند مستوى جهد متوسط، بعُشر تكلفته.

في OSWorld 2.0⁠(يفتح في نافذة جديدة)، يحاول وكلاء الذكاء الاصطناعي تنفيذ مهام طويلة الأمد على الكمبيوتر تشمل أعمالًا يومية ومهنية. نعرض المكافأة الجزئية للمجموعة غير المتصلة من إصدار v2026.08.08.

أسلوب التعاون

نقلنا أيضًا أسلوب التواصل المحسّن في GPT‑6 Astra إلى Sol وLuna، ونعتقد أن أثره سيكون ملحوظًا خصوصًا في المحادثات التقنية والبرمجية. توقع وضوحًا أكبر، ومصطلحات تقنية أقل، وعبارات غريبة أقل، وتفاصيل محدودة القيمة أقل، وإجابات أقصر قليلًا عمومًا من دون فقدان المضمون.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

مع أن الأسلوب مسألة ذاتية، فإننا نفضل رد GPT‑6 Sol هنا. فهو لا يتسرع في استخلاص النتائج، ويقضي وقتًا أقل في تكرار تفاصيل قد تكون بديهية للسائل، مثل أن الموقع يتألف من أربع صفحات، ويستخدم عبارات غامضة أقل، مثل «طابع بينتو» و«إعادة التشكيل... حول ذلك النظام»، ويصرّح بوضوح أكبر بما تحقّق منه وما لم يتحقق منه، ولا يشارك بلا داعٍ تفاصيل التنفيذ مثل مطالبة أداة الصور.

تحسين التخزين المؤقت للوكلاء والمحادثات الطويلة

إلى جانب خفض أسعار الرموز، نساعد المطورين الذين يبنون باستخدام GPT‑6 على توفير المزيد في السياق الذي تعيد تطبيقاتهم استخدامه. حسّنا التخزين المؤقت للمطالبات في GPT‑6 لتوفير معدلات إصابة أعلى افتراضيًا، ما يساعد الوكلاء على إعادة استخدام المزيد من السياق والاستجابة بسرعة أكبر والاستفادة من خصم 90% على قراءة رموز الإدخال المخزنة مؤقتًا.

أصبح لدى المطورين أيضًا طرق أكثر لقياس أداء التخزين المؤقت وتحسينه:

تفيد GitHub بأن هذه التحسينات خفضت خلال الأشهر القليلة الماضية نسبة رموز المطالبات التي تتطلب معالجة جديدة بأكثر من 50% عبر مليارات الطلبات إلى نماذج OpenAI، ما ساعد Copilot على الاستجابة بسرعة أكبر.

مواصلة تحسين المواءمة

يستند GPT‑6 Sol وLuna إلى أعمال المواءمة التي قدمناها مع Astra، أكثر نماذجنا مواءمة حتى الآن. في تقييمات المواءمة لدينا، يُظهر كل من Sol وLuna تحسينات مقارنةً بنظيريهما من GPT‑5.6، بما في ذلك انخفاض معدلات الادعاءات المضللة بشأن عملهما البرمجي.

تختبر التقييمات أدناه مواقف صعبة عمدًا ولا تقيس معدلات الفشل في الاستخدام المعتاد. راجع بطاقة النظام⁠(يفتح في نافذة جديدة) للاطلاع على النتائج الكاملة.

التوافر

يتوفر GPT‑6 Sol وGPT‑6 Luna في ChatGPT العمل وCodex بدءًا من اليوم لجميع مستخدمي Plus وPro وBusiness وEnterprise وEdu. يمكن لمستخدمي Free وGo الوصول إلى GPT‑6 Luna في تطبيق سطح المكتب. هذه النماذج غير متوفرة بعد في الدردشة. تتوفر في واجهة OpenAI API بالاسمين gpt-6-sol وgpt-6-luna.

للحفاظ على استقرار الخدمة للجميع، نعتزم طرح هذه النماذج تدريجيًا في ChatGPT على مدار اليوم. إذا لم تظهر لك النماذج الجديدة في ChatGPT العمل أو Codex، فيُرجى المحاولة مجددًا لاحقًا.


أُجريت تقييمات GPT في بيئة البحث لدينا أو عبر واجهة API، وقد تقدم مخرجات تختلف قليلًا عن إصدار ChatGPT المستخدم فعليًا بسبب اختلاف مطالبات النظام والأدوات المتاحة وغيرها. واستُمدت تقييمات نماذج المنافسين من تقارير متاحة للعامة. وأُبلغ عن نتائج Claude Fable 5 حين لم تتوفر نتائج Claude Fable 5.1.

المؤلف

OpenAI