GPT‑6 Sol اور Luna کا تعارف
اپنے روزمرہ کام میں جدید ترین انٹیلیجنس شامل کرنے کے مزید طریقے۔
اس ماہ کے آغاز میں ہم نے دنیا کا سب سے ذہین اور ہم آہنگ ماڈل، GPT‑6 Astra، متعارف کرایا تھا۔ اگرچہ انتہائی مشکل اور اہم منصوبوں کے لیے اب بھی Astra کی مکمل گہرائی درکار ہے، مگر کام مختلف پیمانوں، رفتار اور بجٹ پر ہوتا ہے۔
اسی لیے ہم GPT‑6 Sol اور GPT‑6 Luna۔ کے ساتھ GPT‑6 کی دنیا کو وسعت دے رہے ہیں۔ GPT‑6 Astra نے انٹیلیجنس کی نئی نسل متعارف کرائی تھی۔ یہ ماڈلز لاگتی کفایت میں جدید ترین حد کو آگے بڑھا کر اس انٹیلیجنس کے فوائد زیادہ وسیع پیمانے پر پہنچاتے ہیں۔ ہم نے GPT‑6 Sol اور Luna کو GPT‑6 Astra جیسے طریقوں سے تربیت دی ہے، جس سے پیشہ ورانہ کام، واقعاتی درستگی، کوڈنگ، کمپیوٹر کے استعمال اور ہم آہنگی میں Astra کی جدید ترین کارکردگی کی بنیاد بننے والی پیش رفت زیادہ تیز اور کم قیمت ماڈلز تک پہنچی ہے۔
GPT‑6 ماڈلز لاگت اور انٹیلیجنس کے پورے منحنی خط پر سب سے آگے ہیں، جہاں ہر درجے کی غیر معمولی صلاحیتیں ایسے بنیادی ڈھانچے کے ساتھ ملتی ہیں جو انہیں بڑے پیمانے پر مؤثر انداز میں فراہم کرتا ہے۔ کیشنگ اور استدلالی عمل میں بہتری سے ہم یہ ماڈلز کم لاگت پر فراہم کر سکتے ہیں، اور GPT‑5.6 کی تشہیری قیمتوں کے مقابلے میں Sol اور Luna کی API قیمتیں 50% کم کر کے یہ بچت براہ راست صارفین اور گاہکوں تک پہنچا رہے ہیں۔ یہ تمام بہتریاں مل کر جدید AI کو روزمرہ کے مزید کاموں اور بڑے پیمانے کی ایپلی کیشنز کے لیے قابلِ عمل بناتی ہیں۔
ماڈل | ان پٹ | آؤٹ پٹ | قیمت میں کمی |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% سستا |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% سستا |
قیمتیں فی 10 لاکھ ٹوکن ہیں۔
GPT‑6 Astra بدستور ہر لحاظ سے ہمارا بہترین ماڈل ہے۔ جب آپ بہترین نتائج اور کسی سمجھوتے کے بغیر تجربہ چاہتے ہوں تو اسے منتخب کریں۔
GPT‑6 Sol اور Luna ان ماڈلز میں بہتر انٹیلیجنس اور لاگتی کفایت لاتے ہیں جنہیں آپ پہلے سے جانتے اور استعمال کرتے ہیں، خاص طور پر ان صلاحیتوں میں جو پیچیدہ کام مکمل کرنے کے لیے سب سے مفید ہیں۔
GPT‑6 Sol مشکل پیشہ ورانہ کام سنبھال سکتا ہے اور زیادہ استعمال کی حدوں اور کم لاگت کی بدولت آپ کو بار بار بہتری کی مزید گنجائش دیتا ہے۔ یکساں قیمت والے حریف ماڈلز کے مقابلے میں یہ زیادہ انٹیلیجنس اور بہتر نتائج فراہم کرتا ہے۔
ایپلی کیشنز میں کاروباری عملی سلسلوں کی جانچ کرنے والے AutomationBench، پر ایکس ہائی محنت کے ساتھ GPT‑6 Sol، Opus 5 کی فی کام لاگت کے صرف 9% پر Max محنت والے Claude Opus 5 سے بہتر کارکردگی دکھاتا ہے۔ ہائی محنت پر GPT‑6 Luna اپنے پیش رو سے 5.4 فیصدی پوائنٹ بہتر کارکردگی دکھاتا ہے، جبکہ فی کام لاگت 58% کم ہے۔
AutomationBench 1.0.6(نئی ونڈو میں کھلتا ہے) میں AI ایجنٹس کو فروخت، مارکیٹنگ، آپریشنز، معاونت، مالیات اور انسانی وسائل کے 47 ٹولز استعمال کرنے والے مکمل عملی سلسلوں پر جانچا جاتا ہے۔ Claude Fable 5.1 کا ڈیٹا نقطہ اس کی اصل لاگت کم ظاہر کرتا ہے کیونکہ اس میں Opus 5 کے متبادل استعمال کی لاگت شامل نہیں، جو تقریباً 40% کاموں میں استعمال ہوا۔
GPT‑6 Sol بہت کم لاگت پر Claude Fable 5.1 سے بھی آگے ہے، حتیٰ کہ کم محنت والے GPT‑6 Astra کو بھی پیچھے چھوڑ دیتا ہے۔
ماڈل اور محنت | اسکور | فی کام لاگت |
|---|---|---|
GPT‑6 Sol، ایکس ہائی | 33.2% | $0.27 |
GPT‑6 Astra، کم | 30.3% | GPT‑6 Sol سے 3.9 گنا |
Claude Opus 5، Max | 26.9% | GPT‑6 Sol سے 11.1 گنا |
Claude Fable 5.1 بمع Opus 5 متبادل، Max | 31.4% | GPT‑6 Sol سے >8.9 گنا متبادل کی لاگت رپورٹ نہیں ہوئی |
پیچیدہ پیشہ ورانہ عملی سلسلوں میں ایجنٹس کا جائزہ لینے والے Agents’ Last Exam پر Max محنت کے ساتھ GPT‑6 Sol کا اسکور 56.4% ہے، جو فی کام 60% کم لاگت پر اس جائزے میں Claude Opus 5 کے سب سے زیادہ اسکور سے بلند ہے۔
Agents’ Last Exam V1(نئی ونڈو میں کھلتا ہے) میں AI ایجنٹس کو 55 ذیلی صنعتوں پر محیط طویل مدتی، معاشی قدر والے کاموں پر جانچا جاتا ہے، جن میں کمپیوٹر پر کیے جانے والے پیشہ ورانہ کام کے بیشتر بڑے شعبے شامل ہیں۔
جواب کی افادیت درست حقائق پر منحصر ہے، اور ہم واقعاتی اعتبار کو مسلسل بہتر بنا رہے ہیں۔ ہمارے اندرونی واقعاتی درستگی کے جائزے میں، جو شناخت سے پاک حقیقی گفتگوؤں پر مبنی ہے جہاں صارفین نے ہمارے ماڈلز کی غلطیوں کی نشان دہی کی تھی، GPT‑6 Sol اپنے پیش رو کے مقابلے میں تقریباً نصف غلطیاں کرتا ہے اور بہت کم لاگت پر Astra جیسا اعتبار حاصل کرنے کے قریب ہے۔ GPT‑6 Luna میں بھی نمایاں بہتری آئی ہے۔ زیادہ محنت کی سطحوں پر یہ تقریباً سویں حصے کی لاگت میں GPT‑5.6 Sol کے برابر ہے۔
یہاں ہم شناخت سے پاک ChatGPT گفتگوؤں میں واقعاتی درستگی کا جائزہ لیتے ہیں، جہاں صارفین نے سابقہ ماڈل کی واقعاتی غلطی کی نشان دہی کی تھی۔ غلطی پیدا کرنے والی یہ گفتگوئیں عام استعمال کی نمائندگی نہیں کرتیں، جہاں واقعاتی غلطیاں نسبتاً کم ہوتی ہیں۔ اسکورز میں طوالت کا اثر قابو نہیں کیا گیا، تاہم اختصار و تفصیل کے ہمارے تجربات میں جواب کی طوالت سے تقریباً کوئی تعلق سامنے نہیں آیا۔
اس سال کوڈنگ ایجنٹس نے پہلے سے کہیں زیادہ پیچیدہ، وسیع اور طویل کام سنبھالنا شروع کیے ہیں۔ OpenAI میں ہمارا اندرونی استعمال غیر معمولی تیزی سے بڑھا ہے۔ API قیمتوں کے مطابق اوسط محقق کا روزانہ ٹوکن استعمال $600 اور 90ویں صدکیہ کے محققین کا $7,000 سے تجاوز کر چکا ہے۔ (تحقیق میں تیزی: OpenAI کے اندر کا منظر)۔ جیسے جیسے کوڈنگ ایجنٹس زیادہ طویل اور مشکل کام سنبھالتے ہیں، مسلسل استعمال کی لاگت زیادہ اہم ہو جاتی ہے۔ GPT‑6 Sol اور Luna مضبوط کوڈنگ کارکردگی کو کم API قیمتوں کے ساتھ یکجا کرتے ہیں، جس سے ڈویلپرز کو بار بار بہتری کی مزید گنجائش اور ٹیموں کو Codex سے زیادہ بلند ہدف والے کام کرانے کا اعتماد ملتا ہے۔
کوڈنگ ایجنٹس کی جانب سے حقیقی کوڈ بیس میں ضم کرنے کے لیے تیار تبدیلیوں کا جائزہ لینے والے FrontierCode پر GPT‑6 Sol، GPT‑5.6 Sol سے نمایاں طور پر بہتر ہے اور بہت کم لاگت پر ایکس ہائی محنت والے Claude Fable 5.1 کے برابر کارکردگی دکھاتا ہے۔
FrontierCode 1.1 Main(نئی ونڈو میں کھلتا ہے) میں AI ایجنٹس ایسا کوڈ لکھتے ہیں جسے صرف درستگی پر نہیں بلکہ ضم کیے جانے کی قابلیت پر بھی جانچا جاتا ہے، مثلاً جانچ کا معیار، دائرۂ کار کی پابندی، کوڈ کا انداز اور کوڈ بیس کے معیارات کی تعمیل۔
حقیقی کوڈ بیس میں سافٹ ویئر انجینئرنگ کے پیچیدہ کاموں کی کارکردگی جانچنے والے DeepSWE v1.1، پر Max محنت کے ساتھ GPT‑6 Sol کا اسکور 68.8% ہے، جو جائزے میں Claude Fable 5 کے سب سے زیادہ اسکور، یعنی ایکس ہائی محنت پر 69.9%، سے صرف 1.1 فیصدی پوائنٹ کم ہے، جبکہ فی کام لاگت تقریباً 80% کم ہے۔
Max محنت کے ساتھ GPT‑6 Luna کا اسکور 66.6% ہے، جو اوسط محنت والے Claude Opus 5 اور Fable 5 کے مقابل ہے۔ ان موازنوں میں Luna کی فی کام لاگت Opus 5 سے 93% اور Fable 5 سے 96% کم ہے۔
DeepSWE 1.1(نئی ونڈو میں کھلتا ہے) میں AI ایجنٹس سافٹ ویئر انجینئرنگ کے اصل اور طویل مدتی کام حل کرتے ہیں۔
اگرچہ GPT‑6 Astra کمپیوٹر کے استعمال کے لیے دنیا کا بہترین ماڈل بدستور ہے، GPT‑6 Sol اور Luna اپنے پیش روؤں سے زیادہ لاگتی کفایت والی کارکردگی دیتے ہیں۔ OSWorld 2.0 آف لائن پر ایکس ہائی محنت کے ساتھ GPT‑6 Sol، اوسط محنت والے Claude Opus 5 جیسا اسکور حاصل کرتا ہے، یعنی 60.5% بمقابلہ 60.3%، جبکہ فی کام لاگت تقریباً 80% کم ہے۔ GPT‑6 Luna، Max پر، GPT‑5.6 Sol، اوسط پر، سے صرف دسواں حصہ لاگت میں آگے نکل جاتا ہے۔
OSWorld 2.0(نئی ونڈو میں کھلتا ہے) میں AI ایجنٹس روزمرہ اور پیشہ ورانہ کاموں پر محیط کمپیوٹر کے استعمال کے طویل عملی سلسلے انجام دینے کی کوشش کرتے ہیں۔ ہم v2026.08.08 اجرا کے آف لائن مجموعے پر جزوی انعام کی اطلاع دیتے ہیں۔
ہم GPT‑6 Astra کا بہتر ابلاغی انداز Sol اور Luna میں بھی لائے ہیں، جو ہمارے خیال میں تکنیکی اور کوڈنگ گفتگوؤں میں خاص طور پر نمایاں ہوگا۔ آپ زیادہ وضاحت، کم اصطلاحی پیچیدگی، کم غیر مانوس طرزِ بیان، کم غیر مفید تفصیلات اور مفہوم برقرار رکھتے ہوئے مجموعی طور پر قدرے مختصر جوابات کی توقع کر سکتے ہیں۔
اگرچہ انداز موضوعی معاملہ ہے، مگر یہاں ہم GPT‑6 Sol کے جواب کو ترجیح دیتے ہیں۔ یہ اتنی جلدی نتیجہ اخذ نہیں کرتا، سوال کرنے والے کے لیے ممکنہ طور پر واضح تفصیلات دہرانے میں کم وقت صرف کرتا ہے، مثلاً یہ کہ ویب سائٹ کے چار صفحات ہیں، مبہم زبان کم استعمال کرتا ہے، مثلاً ”بینٹو جیسا احساس“ اور ”اس نظام کے گرد نئی تشکیل“، اس بارے میں زیادہ صاف گو ہے کہ اس نے کیا جانچا اور کیا نہیں، اور اپنے تصویری ٹول کے پرومپٹ جیسی نفاذی تفصیلات بلا ضرورت پیش نہیں کرتا۔
کم ٹوکن قیمتوں کے ساتھ ہم GPT‑6 استعمال کرنے والے ڈویلپرز کو ان کی ایپلی کیشنز کے بار بار استعمال ہونے والے سیاق پر مزید بچت میں مدد دے رہے ہیں۔ ہم نے GPT‑6 کے لیے پرامپٹ کیچنگ بہتر بنائی ہے تاکہ بطورِ طے شدہ کیش ملنے کی شرح زیادہ ہو، جس سے ایجنٹس زیادہ سیاق دوبارہ استعمال کر سکتے ہیں، تیزی سے جواب دیتے ہیں اور کیش شدہ ان پٹ ٹوکن پڑھنے پر 90% رعایت پاتے ہیں۔
ڈویلپرز کے پاس کیشنگ کی کارکردگی ناپنے اور بہتر بنانے کے مزید طریقے بھی ہیں۔
نگرانی اور تشخیص کریں۔ پرامپٹ کیچنگ ڈیش بورڈ(نئی ونڈو میں کھلتا ہے) دکھاتا ہے کہ کتنا ان پٹ کیش ہوا اور وقت کے ساتھ اس میں کیا تبدیلی آئی۔ تشخیصی ٹول(نئی ونڈو میں کھلتا ہے) کیشنگ کے رہ جانے والے مواقع اور ضروری اصلاحات کی وضاحت میں مدد دیتا ہے۔
کیش کو متاثر کیے بغیر ریزننگ کی محنت اور ٹولز کی دستیابی میں ردوبدل کریں۔ مشکل کاموں کے لیے ریزننگ کی محنت(نئی ونڈو میں کھلتا ہے) بڑھائیں یا آسان ضمنی سوالات کے لیے گھٹائیں، اور ایجنٹ کی ضرورت بدلنے پر ٹولز فعال یا غیر فعال کریں(نئی ونڈو میں کھلتا ہے)۔ دونوں کنٹرول اب کیش میں دوبارہ استعمال کے لیے سابقہ سیاق محفوظ رکھتے ہیں۔
یہ بہتر بنائیں کہ کون سے ابتدائی حصے کیش ہوں۔ واضح وقفہ نقاط ڈویلپرز کو یہ طے کرنے دیتے ہیں کہ پرومپٹ کے کیش شدہ ابتدائی حصے کہاں ختم ہوں۔ اس سے ڈویلپرز کو کیش کے دوبارہ استعمال پر زیادہ اختیار ملتا ہے اور کارکردگی بہتر ہو سکتی ہے۔
GitHub کے مطابق گزشتہ کئی ماہ میں ان بہتریوں نے OpenAI ماڈلز کو کی گئی اربوں درخواستوں میں نئے سرے سے عمل کاری کے محتاج پرومپٹ ٹوکنز کا تناسب 50% سے زیادہ کم کیا ہے، جس سے Copilot زیادہ تیزی سے جواب دیتا ہے۔
GPT‑6 Sol اور Luna، Astra کے ساتھ متعارف کرائے گئے ہم آہنگی کے کام کو آگے بڑھاتے ہیں، جو اب تک ہمارا سب سے زیادہ ہم آہنگ ماڈل ہے۔ ہم آہنگی کے ہمارے جائزوں میں Sol اور Luna دونوں اپنے GPT‑5.6 ہم منصبوں سے بہتر ہیں، جن میں اپنے کوڈنگ کے کام کے بارے میں گمراہ کن دعووں کی کم شرح بھی شامل ہے۔
ذیل کے جائزے دانستہ طور پر مشکل حالات کی جانچ کرتے ہیں اور عام استعمال میں ناکامی کی شرح نہیں ناپتے۔ مکمل نتائج کے لیے سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) دیکھیں۔
GPT‑6 Sol اور GPT‑6 Luna آج سے تمام Plus، Pro، Business، Enterprise اور Edu صارفین کے لیے ChatGPT Work اور Codex میں دستیاب ہیں۔ Free اور Go صارفین ڈیسک ٹاپ ایپ میں GPT‑6 Luna استعمال کر سکتے ہیں۔ یہ ماڈلز فی الحال چیٹ میں دستیاب نہیں ہیں۔ OpenAI API میں یہ gpt-6-sol اور gpt-6-luna کے طور پر دستیاب ہیں۔
سب کے لیے خدمت مستحکم رکھنے کی خاطر ہم یہ ماڈلز پورے دن میں بتدریج ChatGPT میں جاری کرنے کا ارادہ رکھتے ہیں۔ اگر آپ کو ChatGPT Work یا Codex میں نئے ماڈلز نظر نہ آئیں تو براہِ کرم بعد میں دوبارہ کوشش کریں۔
GPT کے جائزے ہمارے تحقیقی ماحول یا API کے ذریعے کیے گئے، جہاں نظامی پرومپٹس، دستیاب ٹولز وغیرہ میں فرق کے باعث آؤٹ پٹ، عملی استعمال والے ChatGPT سے قدرے مختلف ہو سکتا ہے۔ حریف ماڈلز کے جائزے عوامی طور پر دستیاب رپورٹوں سے لیے گئے۔ جہاں Claude Fable 5.1 کے اسکور دستیاب نہیں تھے، وہاں Claude Fable 5 کے اسکور دیے گئے ہیں۔


