انٹیلیجنس کی ایک نئی نسل
22.09.2026 کی اپ ڈیٹ: ہم GPT‑6 Sol اور GPT‑6 Luna کے ساتھ اپنے GPT‑6 خاندان کو وسعت دے رہے ہیں. مزید جانیں.
ہم GPT‑6 Astra متعارف کرا رہے ہیں، جو دنیا کا سب سے ذہین اور ہم آہنگ ماڈل ہے.
GPT‑6 Astra کئی سالہ تحقیق اور پری-ٹریننگ، ری اِنفورسمنٹ لرننگ اور ہم آہنگی میں بڑے داؤ کو یکجا کرتا ہے. Astra کمپیوٹر کے استعمال، براؤزنگ، سافٹ ویئر انجینئرنگ، سائبر سیکیورٹی، سائنس اور پیشہ ورانہ کام میں جدید ترین ہے. Astra نے FrontierMath Tier 4 میں 98% اسکور حاصل کیا ہے اور یہ پہلے ہی ریاضی میں دیرینہ حل طلب کھلے مسائل حل کرنے میں مدد دے چکا ہے. Astra نے 99.9% اسکور کے ساتھ ARC-AGI-3 کو بھی سیر کر دیا اور 100% اسکور کے ساتھ ExploitBench کو سیر کر دیا. یہ کمپیوٹر اور براؤزر کے استعمال میں بھی ایک نیا فرنٹیئر قائم کرتا ہے اور بے مثال رفتار، درستگی اور فیصلہ سازی کے ساتھ سب سے زیادہ تقاضا کرنے والے پیشہ ورانہ کام کو سنبھالتا ہے.
GPT‑6 Astra آج محدود تعداد میں تنظیموں کے لیے جاری کیا جا رہا ہے اور آنے والے دنوں میں یہ تمام ChatGPT Plus، Pro، Business اور Enterprise صارفین کے لیے، نیز OpenAI API، Microsoft Azure اور AWS Bedrock کے ذریعے دستیاب ہو جائے گا.
Astra ہمارا سب سے زیادہ ہم آہنگ ماڈل ہے، جس میں صارف کے ارادے اور ماڈل کے رویّے کو سمجھنے میں نمایاں بہتری آئی ہے—آپ Astra کے فیصلے پر زیادہ اعتماد کے ساتھ ٹاسکس تفویض کر سکتے ہیں. اس کی جانچ کے ایک طریقے کے طور پر، ہم نے Hugging Face واقعے سے حاصل معلومات کی بنیاد پر ایک نئی جانچ تیار کی، جو یہ جانچتی ہے کہ آیا کسی مشکل یا ناممکن کام کا سامنا کرنے والا ماڈل اپنی مطلوبہ حدود سے باہر جائے گا. GPT‑5.6 Sol کے مقابلے میں، جو پروڈکشن سیف گارڈز کے بغیر 48% مواقع پر مجاز ہدف سے آگے بڑھ گیا، GPT‑6 Astra نے 0% معاملات میں ایسا کیا.
کمپیوٹر استعمال کے لیے دنیا کا بہترین ماڈل
GPT‑6 Astra کمپیوٹر کے استعمال کی رفتار، درستگی اور حفاظت میں ایک نیا فرنٹیئر قائم کرتا ہے. یہ آن لائن فارم پُر کرنے، CRM میں کسٹمر ریکارڈز اپ ڈیٹ کرنے اور آپ کا کیلنڈر منظم کرنے جیسے دقت طلب کام سنبھال سکتا ہے. یہ آن لائن تحقیق کر سکتا ہے اور آپ کی ای میل یا دستاویز ایڈیٹر میں خلاصوں کے مسودے تیار کر سکتا ہے. یہ سائنسی ڈیٹا کا تجزیہ کر سکتا ہے، پلاٹس تیار کر سکتا ہے، ایک ویب سائٹ بنا سکتا ہے اور فرنٹ اینڈ QA چیکس چلا سکتا ہے تاکہ یہ یقینی بنایا جا سکے کہ اس سائٹ کے تمام فیچرز کام کرتے ہیں. یہ خودکار طریقے سے سافٹ ویئر انسٹال اور ٹیسٹ کرنے اور اسکرین پر نظر آنے والے مسائل کا ازالہ کرنے میں آپ کی مدد کر سکتا ہے. یہ بہتریاں ہماری جدید ترین جانچ کے نتائج میں بھی منعکس ہوتی ہیں.
ان بہتریوں کے نتیجے میں حقیقی علمی کاموں میں بھی کارکردگی میں نمایاں اضافہ ہوتا ہے. OSWorld 2.0 پر تاخیر کی سیمولیشنز میں، Astra، GPT‑5.6 کے مقابلے میں فی ٹاسک تقریباً 47% کم وقت میں کمپیوٹر کے استعمال کی بہتر کارکردگی حاصل کرتا ہے. Sol نے فی ٹاسک تقریباً 40 منٹ میں 72.6% اسکور کیا، جبکہ تقریباً 75 منٹ میں اسکور 65.7% تھا.3
GPT‑6 Astra کی کمپیوٹر استعمال کرنے کی صلاحیتیں مختلف شعبوں میں حاصل کردہ نتائج میں دیکھی جا سکتی ہیں، جن میں گیم ڈیولپمنٹ، الیکٹریکل انجینئرنگ اور روزمرہ علمی کام شامل ہیں:
Astra کے ساتھ، ہم کمپیوٹر کے استعمال کی رفتار میں نمایاں بہتری لانے کے لیے Codex ہارنیس کو بھی اپ ڈیٹ کر رہے ہیں. Astra کی کارکردگی کے ساتھ مل کر، Mind2Web بینچ مارک پر یہ موجودہ GPT‑5.6 Sol تجربے کے مقابلے میں ٹاسک کی تکمیل کو 1.9x تیز بناتا ہے. ماڈل کی رفتار میں بہتری کا مطلب ہے کہ یہ آپ کے لیے روزمرہ زندگی کے بہت سے وقت طلب کام آپ سے بھی تیزی سے انجام دے سکتا ہے.4
پیشہ ورانہ کام میں ایک بڑی تبدیلی
GPT‑6 Astra کمپیوٹر کے استعمال میں پیش رفتوں کو پیشہ ورانہ ماحول کے لیے مخصوص تربیت کے ساتھ جوڑتا ہے، تاکہ پیچیدہ کاموں سے نمٹنے میں مدد ملے. یہ پیچیدہ مسائل کے لیے درکار انٹیلیجنس کو کثیر مرحلہ ورک فلوز انجام دینے اور نفیس دستاویزات، سپریڈشیٹس اور پریزنٹیشنز تیار کرنے کی صلاحیت کے ساتھ یکجا کرتا ہے.
GPT‑6 Astra ہمارے موجودہ ٹیمپلیٹس کی پیروی کرنے اور ایسی سلائیڈز تیار کرنے کے لیے ہمارا بہترین ماڈل ہے جو اچھی طرح ترتیب دی گئی ہوں اور ایک منظم بیانیے کے ساتھ اہم نکات کو مختصراً بیان کریں. یہ آپ کے ٹیمپلیٹس کے مطابق اور آپ کے تحریری و بصری انداز سے ہم آہنگ واضح، اچھی طرح سے منظم دستاویزات، پریزنٹیشنز، اسپریڈشیٹس اور تجزیے تیار کرتا ہے. Astra کو اس طرح بھی تربیت دی گئی ہے کہ وہ آؤٹ پٹس میں صرف وہی ضروری سیاق و سباق شامل کرے، بجائے اس کے کہ موجودہ کام کے لیے غیر ضروری معلومات دہرائے. اس سب کا مطلب ہے کہ یہ ایسے آرٹیفیکٹس تیار کر سکتا ہے جو فوری طور پر زیادہ قابلِ استعمال ہوں اور آپ کے کاروباری سیاق و سباق اور معیارات سے مطابقت رکھتے ہوں.
GPT‑6 Astra اپنی بنائی ہوئی ویب سائٹس، گیمز، ایپلیکیشنز اور رینڈرنگز میں زیادہ مضبوط بصری فیصلہ سازی بھی لاتا ہے. ChatGPT میں سائٹس(نئی ونڈو میں کھلتا ہے) کے ساتھ، Astra پرومپٹ سے براہ راست ویب سائٹس، ویب ایپس اور گیمز بنا، ہوسٹ اور شیئر کر سکتا ہے.
جب ہدایات تشریح کی گنجائش چھوڑتی ہیں، تو GPT‑6 Astra درست فیصلہ کرنے میں پچھلے ماڈلز سے بہتر ہے. یہ معمول کے خلا پُر کرنے کے لیے سیاق و سباق کا استعمال کرتا ہے اور جب جواب نتیجے کو بدل سکتا ہو تو مرکوز سوالات پوچھتا ہے. Codex میں، یہ آپ کے جواب پر منحصر نہ ہونے والا کام جاری رکھتے ہوئے غیر ہم وقت طریقے سے سوالات پوچھ سکتا ہے. اگر آپ جواب نہیں دیتے ہیں، تو یہ جہاں مناسب ہو معقول مفروضوں کے ساتھ آگے بڑھتا ہے، لیکن دور رس اثرات رکھنے والے فیصلوں کے لیے آپ کی رائے کا انتظار کرتا ہے.
ذیل کی مثالیں دکھاتی ہیں کہ Astra روزمرہ کاموں میں کس طرح تعاون کرتا ہے، جہاں معلومات کی کمی جواب کو نمایاں طور پر تبدیل کر سکتی ہے.
Astra جیسے جیسے کام آگے بڑھتا ہے، اپنی سمت برقرار رکھنے میں بھی بہتر ہے. پہلے کے ماڈلز بعض اوقات اسٹیئرنگ پیغامات کو ایک نیا مقصد سمجھ لیتے تھے، جس سے اصل درخواست یا پہلے کی پابندیاں نظر سے اوجھل ہو جاتی تھیں. Astra نئے تقاضوں کو شامل کرتا ہے، کہے جانے پر سمت بدلتا ہے، اور مجموعی کام کو نظرانداز کیے بغیر ضمنی سوالات کے جواب دیتا ہے.
کوڈنگ
GPT‑6 Astra اب تک سافٹ ویئر انجینئرنگ کے لیے بہترین ماڈل ہے.
"GPT‑6 Astra ہماری داخلی کوڈنگ بینچ مارکس پر جدید ترین کارکردگی فراہم کرتا ہے اور GPT‑5.6 Sol کے مقابلے میں ٹریڈنگ انٹیوشن جانچ میں واضح پیش رفت دکھاتا ہے. ایجنٹک کوڈنگ کے لیے استعمال کیے جانے پر، GPT‑6 Astra اس انداز میں بات چیت کرتا ہے جسے ڈویلپرز کے لیے سمجھنا آسان ہوتا ہے اور ایسا کوڈ تیار کرتا ہے جسے پروڈکشن معیار تک پہنچنے کے لیے کم تکرار درکار ہوتی ہے."
"ہم نے اپنی پہلی جنریشن کی تشخیصات میں سے ایک پر Astra کو کم، اوسط اور ہائی کوشش کے ساتھ آزمایا اور اس نے GPT 5.6 Sol سے نمایاں طور پر بہتر کارکردگی دکھائی." بلند تر کوشش سے ایک نئی بلڈ پر مزید تکرار، براؤزر ٹیسٹنگ کے ذریعے زیادہ تصدیق اور اپلائی-پیچ کے بجائے کوڈ ایگزیکیوشن کو ترجیح دینے کا رجحان پیدا ہوتا ہے. ماڈل اپنی کوشش کیسے صرف کرتا ہے، یہ سمجھنا ہی وہ طریقہ ہے جس سے ہم لاکھوں بلڈرز کو خیال سے کام کرنے والی ایپ تک ایک تیز تر، زیادہ قابلِ اعتماد راستہ فراہم کرتے ہیں."
Astra کے ساتھ، ہم Codex کے لیے سیاق ونڈو بھر جانے پر سیاق کو محفوظ رکھنے اور بازیافت کرنے کا ایک نیا طریقہ متعارف کروا رہے ہیں. تاریخی طور پر، ماڈلز نے طویل سیشنز کے دوران کام کا خلاصہ بنانے کے لیے کمپیکشن استعمال کی ہے، مثلاً پیچیدہ مسائل کو ڈیبگ کرتے وقت یا بڑے ری فیکٹرز سے نمٹتے وقت. ہر کمپیکشن میں اس بات کی تفصیلات رہ سکتی ہیں کہ کوئی فکس کیوں ناکام ہوا یا کوئی جزو کیسے کام کرتا ہے. Codex میں، Astra سیاق ونڈو کے درمیان نوٹس محفوظ رکھ سکتا ہے اور جمع شدہ تفصیلات کو بار بار ایک ہی خلاصے میں کمپریس کیے بغیر برقرار رکھ سکتا ہے. پچھلی سیاق ونڈوز قابلِ تلاش رہتی ہیں، اس لیے Astra پچھلے پیغامات اور ٹول آؤٹ پٹس سے ضروریات یا ٹیسٹ کے نتائج تلاش کر سکتا ہے—خواہ وہ معلومات اس کے نوٹس میں شامل نہ کی گئی ہو. آپ اپنے Codex config.toml(نئی ونڈو میں کھلتا ہے) میں اس تجرباتی فیچر کو فعال کر سکتے ہیں، اور آنے والے ہفتوں میں یہ Astra کے لیے ڈیفالٹ بن جائے گا.
سائنسی دریافت کو آگے بڑھانا
Astra سائنسی دریافت کے پس پردہ عملی کام میں مدد کر سکتا ہے. سائنسی ریزننگ کو کمپیوٹر کے استعمال کے ساتھ ملا کر، یہ ڈیٹا کا جائزہ لینے اور نتائج کا جائزہ لینے کے لیے خصوصی سافٹ ویئر میں براہِ راست کام کر سکتا ہے، جس سے محققین کو شواہد کا جائزہ لینے اور یہ فیصلہ کرنے میں مدد ملتی ہے کہ آگے کس چیز کی تحقیق کرنی ہے.
سائبر سیکیورٹی
جیسا کہ ہم نے اپنی حفاظتی اپ ڈیٹ میں گفتگو کی تھی، Astra سائبر صلاحیتوں میں ایک نمایاں پیش رفت ہے اور ہمارے تیاری کا فریم ورک کے تحت سائبر سکیورٹی میں کریٹیکل حد پر پورا اترتا ہے. زیرو ڈے ایکسپلائٹس کی شناخت اور انہیں تیار کرنے کی اس کی صلاحیت دفاعی ٹیموں کو کمزوریوں کو تلاش کرنے اور انہیں دور کرنے میں مدد دے سکتی ہے، لیکن یہ مضبوط تر حفاظتی اقدامات کی ضرورت بھی پیدا کرتی ہے. یہ سمجھنے کے لیے کہ ان صلاحیتوں کا دائرہ کس حد تک وسیع ہے، ہم نے Astra کو داخلی اور فریقِ ثالث کے ماہرین کے جائزوں پر آزمایا.
ہم نے پہلے ماڈل کو پروڈکشن حفاظتی اقدامات کے بغیر ExploitBench اور ExploitGym پر آزمایا، جو یہ جانچتے ہیں کہ آیا ماڈلز معلوم سافٹ ویئر کمزوریوں کو کام کرنے والی ایکسپلائٹس میں تبدیل کر سکتے ہیں. ExploitBench پر، Astra نے 100% کا مکمل اسکور حاصل کیا، جبکہ ہمارے سابقہ فرنٹیئر سائبر صلاحیت رکھنے والے ماڈل GPT‑5.6 Sol نے 78.5% اسکور حاصل کیا. ExploitGym پر، Astra نے 42.4% کامیابی کی شرح حاصل کی، جبکہ GPT‑5.6 Sol نے 30.3% حاصل کی اور Astra نے نمایاں طور پر کم آؤٹ پٹ ٹوکن استعمال کیے.13
اس تشویش کے پیشِ نظر کہ سابقہ سافٹ ویئر کمزوریوں سے واقفیت نے بینچ مارک کے نتائج کو متاثر کیا ہو سکتا ہے، ہم نے Astra کا دو نئے بینچ مارکس پر بھی جائزہ لیا. ایک بات یہ کہ، ہم نے پچھلے تین مہینوں کی کمزوریوں کا استعمال کرتے ہوئے ایک ایکسپلائٹ ڈیولپمنٹ کو جانچنے کے لیے ایک داخلی "ExploitBench (جون–اگست 2026)" ایویلیوایشن بنائی.14 Astra نے GPT‑5.6 کے مقابلے میں من مانے کوڈ پر عمل درآمد کی نمایاں طور پر زیادہ شرحیں حاصل کیں. اس ڈیٹا مجموعے پر Sol نے بہت کم آؤٹ پٹ ٹوکن استعمال کرتے ہوئے. تشخیص کے دوران، Astra نے دو ایسی زیرو-ڈے کمزوریاں بھی دریافت کیں اور استعمال کیں جو پہلے نامعلوم تھیں. ہم دونوں کمزوریوں کو ان کے متعلقہ مینٹینرز کے سامنے افشا کر رہے ہیں.
ہم نے Astra کو SRE-Bench15 پر بھی آزمایا، جو ایک بینچ مارک ہے جو یہ جانچ کرتا ہے کہ آیا ماڈلز خام سورس کوڈ تک رسائی کے بغیر سافٹ ویئر بائنریز کی ریورس انجینئرنگ کر کے اس کی بنیادی منطق کو سمجھ سکتے ہیں. Astra نے ایک ہی کوشش میں 88.0% کام حل کیے اور چار کوششوں کے اندر 99.2%، جبکہ GPT‑5.6 Sol کے لیے یہ شرحیں بالترتیب 55.9% اور 68.7% تھیں.
بینچ مارکس سے آگے، ماہرین کی قیادت میں کیے گئے جائزوں سے معلوم ہوا کہ Astra، جب اسے پروڈکشن حفاظتی اقدامات کے بغیر چلایا گیا، پہلے نامعلوم کمزوریوں کو استعمال کر کے زیادہ محفوظ بنائے گئے براؤزرز میں من مانا کوڈ چلا سکتا تھا اور زیادہ محفوظ بنائے گئے آپریٹنگ سسٹمز کے لیے مراعات میں اضافے کے ایکسپلائٹس بنا سکتا تھا.
جیسا کہ ہم نے The Defender’s Window میں گفتگو کی تھی، جدید ترین سائبر صلاحیتیں دفاعی ماہرین کو کمزوریوں کو زیادہ تیزی سے تلاش کرنے میں مدد دے سکتی ہیں، لیکن یہ ان کمزوریوں کا استحصال کرنا بھی آسان بناتی ہیں، جس سے دفاعی ماہرین کے لیے موافقت کی فوری ضرورت بڑھ جاتی ہے. Astra کے آج لانچ ہونے والے ورژن کے ساتھ، دفاع کار اسے محفوظ کوڈ ریویو اور پیچنگ جیسے کام مکمل کرنے کے لیے استعمال کر سکتے ہیں.
تاہم، Astra کمزوریوں کے لیے پروف آف کانسیپٹ ایکسپلائٹس بنانے جیسے مزید اعلیٰ درجے کے سائبر سیکیورٹی کاموں کی تعمیل کرنے سے انکار کرے گا. OpenAI Daybreak کے ذریعے، ہم آنے والے ہفتوں میں رسائی کو وسعت دینے اور کم پابندی والے حفاظتی اقدامات متعارف کرانے کا ارادہ رکھتے ہیں. یہ مزید دفاعی ورک فلو کو ممکن بنائے گا، جن میں کمزوریوں اور پروف آف کانسیپٹ کی توثیق، میلویئر کا تجزیہ اور ڈیٹیکشن انجینئرنگ شامل ہیں.
ہم نے GPT‑5.6 Sol کے لیے اپنے حفاظتی اقدامات کے مجموعے کی بنیاد پر، ممکنہ سائبر غلط استعمال کے خلاف اپنے تحفظات بھی مضبوط کیے ہیں. ان میں ممکنہ جیل بریکس کا بہتر طور پر مقابلہ کرنے کے لیے ماڈل کی مضبوطی اور ہمارے نگرانی کے سسٹمز کے لیے مزید سیاق و سباق شامل ہیں. ہم نے اپنے داخلی ریڈ ٹیمنگ حملہ آوروں کے ساتھ خودکار جائزوں سمیت، سخت داخلی اور بیرونی جانچ جاری رکھی ہے. ہمارے سائبر حفاظتی اقدامات اور جانچ کی مزید تفصیلات Astra کے حفاظتی جائزے اور سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) میں دستیاب ہیں..
GPT‑6 Astra کو ذمہ داری سے ہم آہنگ اور تعینات کرنا
Astra ہمارا سب سے زیادہ ہم آہنگ ماڈل ہے. Astra احتیاط برتنے، کام کی حدود کا احترام کرنے اور شفاف انداز میں بات چیت کرنے میں بہترین ہے. یہ کام ہمارے طویل عرصے سے جاری تحقیقی پروگرام کا تازہ ترین نتیجہ ہے، جو ایسے ماڈل کی ٹریننگ پر مرکوز ہے جو شروع سے آخر تک انسانی ارادے کے ساتھ ہم آہنگ رہیں.
حساس ماحول میں، Astra اس سے وابستہ خطرے کے تناسب سے احتیاط برتتا ہے. کمپیوٹر کے استعمال سے متعلق اُن کاموں کی ایک جانچ میں، جنہیں غلط طرزِ عمل کو اُبھارنے کے لیے مخالفانہ انداز میں منتخب کیا گیا تھا، Astra نے غیر ارادی نتائج سے بچنے میں زیادہ کامیابی حاصل کی. ڈیفالٹ طور پر فراہم کیے جانے والے اضافی حفاظتی اقدامات کے ساتھ چلانے سے کارکردگی اور بھی بہتر رہی.
Astra آزمائے گئے دیگر فرنٹیئر ماڈلز کے مقابلے میں کم غیر ہم آہنگ نتائج کا سبب بنتا ہے. منصفانہ موازنے کے لیے، ہم نے ایک عمومی کمپیوٹر یوزنگ ایجنٹ ہارنیس استعمال کیا (جو دونوں OpenAI Responses API(نئی ونڈو میں کھلتا ہے) اور Anthropic Messages API(نئی ونڈو میں کھلتا ہے) میں دستیاب مقامی کمپیوٹر استعمال کے ٹولز پر مبنی ہے) اور ان اضافی تحفظات کے بغیر جو عموماً Codex اور ChatGPT Work کے صارفین کے لیے نافذ کیے جاتے ہیں (آٹو ریویو، تصدیقی پالیسی).
Astra کے صارف کی جانب سے مقرر کردہ اور اس کے ماحول سے ظاہر ہونے والی حدود کے اندر کام کرنے کا امکان بھی زیادہ ہے. ایک اندرونی جانچ میں، Astra نے کبھی بھی Codex آٹو-ریویو کے انکار کو بائی پاس کرنے کی کوشش نہیں کی. یہ بات اس وقت بھی برقرار رہی جب آٹو-جائزہ کو جان بوجھ کر اس طرح کنفیگر کیا گیا تھا کہ اس سے بچا جا سکے اور ورنہ ٹاسک مکمل کرنا ناممکن تھا. ماحول کی پابندیوں کے لیے یہ احترام ہماری ناممکن سائبر ٹاسک جانچ کے نتائج سے مطابقت رکھتا ہے، جنہیں ہم نے اس پوسٹ کے تعارف میں شیئر کیے تھے، اور ہمارے سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) میں درج دیگر نتائج سے بھی.
Astra شفاف صارف مواصلت میں بھی نئے معیار قائم کرتا ہے. ایک جائزے میں، Astra کے GPT‑5.6 کے مقابلے میں تین گنا کم امکان ہے Sol کی نسبت اپنی صلاحیتوں اور دستیاب خصوصیات کے بارے میں غلط تاثر دینے کا امکان کم ہے.
ہماری صلاحیت-ہیلوسینیشن تشخیص میں، Astra نے GPT‑5.6 Sol کے مقابلے میں نمایاں بہتری دکھائی اور اپنی صلاحیتوں کے بارے میں کم گمراہ کن دعوے کیے.
ہماری تشخیصوں سے معلوم ہوا کہ Astra کی تحریری ریزننگ کی نگرانی GPT‑5.6 کی نسبت زیادہ مشکل ہے. Sol کا، ان ٹیسٹس کی بنیاد پر جن میں اسے واضح طور پر نگرانی سے بچنے کو کہا گیا تھا. ہم اس کی وجہ سادہ کاموں میں تحریری ریزننگ پر Astra کے زیادہ کنٹرول اور کم تحریری مراحل کے ساتھ مسائل حل کرنے کی صلاحیت کو قرار دیتے ہیں. Astra اب بھی پیچیدہ کاموں کے لیے درکار ریزننگ کو چھپانے میں دشواری کا شکار دکھائی دیتا ہے، لیکن ہم اس کمی کو سنجیدگی سے لیتے ہیں. مانیٹر ایبلٹی کو بہتر بنانا ایک تحقیقی ترجیح بنا ہوا ہے، اور ساتھ والا سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) ہماری دریافتوں اور جاری کام کی تفصیلات فراہم کرتا ہے.
الائنمنٹ ٹریننگ تعیناتی کے لیے ہمارے طریقۂ کار کی بنیاد ہے. دفاع کی ایک اضافی تہہ کے طور پر، ہم غیر محفوظ رویے کا پتا لگانے اور اسے محدود کرنے میں مدد کے لیے Codex آٹو-ریویو(نئی ونڈو میں کھلتا ہے) جیسی سسٹم کی حفاظتی تدابیر اور ایجنٹس کی ریزننگ اور کارروائیوں کی نگرانی بھی تیار کرتے ہیں. جیسا کہ ہماری حفاظتی اپ ڈیٹ میں بیان کیا گیا ہے، ہم عدم ہم آہنگی پر نظر رکھنے اور اس کی بدترین صورتوں کو محدود کرنے میں مدد کے لیے Astra درجے کے ماڈلز کے پیداواری ماحول میں عدم ہم آہنگی کی نگرانی بھی ڈیپلائے کر رہے ہیں. یہ حفاظتی تدابیر ہماری داخلی ڈیپلائمنٹس کی نگرانی سے ملتی جلتی ہیں اور ایسے درجہ بندوں کے سسٹم پر مشتمل ہیں جو غیر مجاز رویے کے لیے ماڈل کی ریزننگ اور اقدامات کی جانچ کرتے اور ممکنہ غیر مجاز سرگرمی خودکار طور پر روک دیتے ہیں.
Astra کی سائبر سیکیورٹی صلاحیتوں میں نمایاں اضافے کے پیش نظر، ہم اس تعیناتی کو سلامت اور محفوظ بنانے کے لیے خاص طور پر احتیاط برت رہے ہیں. اضافی حفاظتی جانچیں کبھی کبھار جائز کام کو سست، موقوف یا روک سکتی ہیں، جس میں دفاعی سائبر سیکیورٹی بھی شامل ہے. اگر ChatGPT یا Codex میں کسی ٹاسک کو روک دیا جائے، تو جاری رکھنے سے پہلے آپ سے کارروائی کا جائزہ لینے کا کہا جا سکتا ہے. API میں، ٹاسک رک جائے گا. یہ جانچیں کبھی کبھار جائز کام میں خلل ڈال سکتی ہیں اور ہم غیر ضروری رکاوٹوں کو کم کرنے کے لیے اس نظام کو مسلسل بہتر بنانے پر کام کر رہے ہیں. عدم ہم آہنگی کی نگرانی، ہم آہنگی کا متبادل نہیں ہو سکتی: ہمارا مقصد ایسے ماڈل بنانا ہے جو قابلِ اعتماد طور پر اپنی مجاز حدود میں رہیں، تاکہ ان حفاظتی تدابیر کو مداخلت کرنے کی ضرورت نہ پڑے.
دستیابی
GPT‑6 Astra آج محدود تعداد میں تنظیموں کے لیے جاری کیا جا رہا ہے اور آنے والے دنوں میں یہ تمام ChatGPT Plus، Pro، Business اور Enterprise صارفین کے لیے، نیز OpenAI API، Microsoft Azure اور AWS Bedrock کے ذریعے دستیاب ہو جائے گا. Astra کا استعمال موجودہ سبسکرپشن الاؤنسز میں شامل ہے—صارفین اور کاروبار اضافی استعمال کے لیے کریڈٹس بھی خرید سکیں گے. Pro، Business اور Enterprise پلانز کے صارفین کو GPT‑6 Astra Pro تک بھی رسائی ملے گی. Enterprise ایڈمنسٹریٹرز اپنی ورک اسپیس کے لیے Astra فعال کر سکتے ہیں؛ لانچ کے وقت رسائی بطور ڈیفالٹ بند ہے.
Astra اہل API صارفین کے لیے زیرو ڈیٹا ریٹینشن کو سپورٹ کرتا ہے اور جیسا کہ ہم نے گزشتہ ماہ بتایا تھا، ہم صارفین کی رازداری برقرار رکھتے ہوئے حفاظتی نگرانی کو مضبوط بنانے کے لیے نجی حفاظتی پروسیسنگ کی آزمائش کر رہے ہیں.
ڈویلپرز کے لیے، GPT‑6 Astra، OpenAI API میں gpt-6-astra کے طور پر اور Microsoft Azure اور Amazon Bedrock کے ذریعے دستیاب ہوگا.
OpenAI API Standard کی قیمت فی ملین ان پٹ ٹوکن $10 اور فی ملین آؤٹ پٹ ٹوکن $50 ہے. کیشے سے پڑھنے اور کیشے میں لکھنے پر الگ الگ شرحیں لاگو ہوتی ہیں. API میں GPT‑6 Astra کے لیے فاسٹ موڈ دستیاب ہے اور یہ Standard پروسیسنگ کے مقابلے میں 2x تک رفتار، Standard قیمت کے 2x پر فراہم کرتا ہے.
پیشہ ور
پیشہ ور | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
اوپن اسکور اسٹرنگ کوارٹیٹس (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
ڈیزائن ٹاسکس (اندرونی) | 50.0% | 47.4% | - | 35.8% | - | - |
داخلی ڈیٹا سائنس کے کام | 40.9% | 30.5% | - | 34.7% | - | - |
آرٹیفیشل اینالیسس انٹیلیجنس انڈیکس v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
کوڈنگ
| کوڈنگ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 توسیعی (اسکور) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 مرکزی (اسکور) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| اندرونی ڈیٹابیس کی منتقلی کے کام | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| آرٹیفیشل اینالیسس کوڈنگ ایجنٹ انڈیکس v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
علمی
علمی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA ڈائمنڈ | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
انسانیت کا آخری امتحان (ٹولز کے ساتھ) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
ہم آہنگی
ہم آہنگی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
کمپیوٹر کے اندرونی استعمال کا حفاظتی بینچ مارک (کم ہونا بہتر ہے) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
داخلی کمپیوٹر استعمال کی حفاظت کا بینچ مارک، AutoReview کے ساتھ (کم ہونا بہتر ہے) | 1.8% | 4.3% | - | - | - | - |
اندرونی چکمہ دہی بینچ مارک (کم ہونا بہتر ہے) | 0.00% | 0.29% | - | - | - | - |
ExploitGym ہنی پاٹ (کم ہونا بہتر ہے) | 0.0% | 48.2% | - | - | - | - |
ناممکن ExploitGym | 100.0 ٪ | - | - | - | - | - |
داخلی ہیلوسینیشن بینچ مارک (کم ہونا بہتر ہے) | 4.2% | 12.2% | - | - | - | - |
طویل سیاق و سباق
طویل سیاق و سباق | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0 ٪ | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3 ٪ | 73.8% | - | - | - | - |
تجریدی استدلال
| تجریدی ریزننگ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
تشخیصی اسکورز کوشش کی کسی بھی سطح پر زیادہ سے زیادہ ہوتے ہیں. GPT کی تشخیصات ہمارے تحقیقی ماحول میں یا ہماری API کے ذریعے چلائی گئیں، جو سسٹم پرومپٹس، دستیاب ٹولز وغیرہ میں فرق کی وجہ سے پروڈکشن ChatGPT سے تھوڑا مختلف آؤٹ پٹ فراہم کر سکتی ہیں.
حواشی
- 1
ARC-AGI-3 پر، GPT-6 Astra کو ہمارے responses API ہارنیس کے ساتھ چلایا گیا، جو حقیقی دنیا کی کارکردگی سے بہتر مطابقت کے لیے دو سیٹنگز تبدیل کرتا ہے. یہ تبدیلیاں خاص طور پر ARC-AGI-3 کو ہدف نہیں بناتیں.
- 2
GPT-5.6 Sol سے مراد وہ ورژن ہے جو ہمارے API، ChatGPT Codex اور ChatGPT Work میں دستیاب ہے. ChatGPT چیٹ میں موجود ورژن قدرے مختلف ہے.
- 3
OSWorld V2-Offline اصل OSWorld V2 کا ایک ذیلی مجموعہ ہے جو انٹرنیٹ تک رسائی کے بغیر کام کرتا ہے. OSWorld-V2 Offline پر Claude ماڈل کی کارکردگی کو مصنفین نے آفیشل لیڈر بورڈ پر(نئی ونڈو میں کھلتا ہے) دوبارہ پیش کیا. OSWorld 2.0 پر، Claude کے اسکورز آفیشل سیٹنگز استعمال کرتے ہیں، نہ کہ Fable 5.1 سسٹم کارڈ کے ترمیم شدہ ٹاسکس اور ترمیم شدہ گریڈنگ.
- 4
- 5
BenchCAD پر، Claude کی اسکورز تشخِصات میں کی گئی تین ترامیم کی عکاسی کرتے ہیں، جن کی تفصیل Fable 5.1 سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) میں دی گئی ہے.
- 6
گوانگ یانگ، وکٹوریہ ایبرٹ، ناظف تامر، برائن سی یوان ژینگ، لوئیزا پوزوبون، اور نوح اے. اسمتھ. "LEGATO: ٹائپ سیٹ OMR کے لیے بڑے پیمانے کا اینڈ ٹو اینڈ قابلِ تعمیم طریقۂ کار(نئی ونڈو میں کھلتا ہے)." arXiv:2506.19065، 2025.
- 7
مارک آر. ایچ. گوتھم، مورین ریڈبونڈ، برونو باؤر، اور پیٹر جوناس. "اوپن اسکور اسٹرنگ کوارٹیٹ کارپس(نئی ونڈو میں کھلتا ہے)." موسیقیات کے لیے ڈیجیٹل لائبریریوں پر 10ویں بین الاقوامی کانفرنس کی کارروائیاں، صفحات 49–57. ACM، 2023.
- 8
FrontierCode پر، GPT-6 Astra کو Codex میں اس کے ڈویلپر میسج کے ایک سیکشن سے ملتے جلتے ڈویلپر میسج(نئی ونڈو میں کھلتا ہے) کے ساتھ چلایا گیا: "ضرورت سے زیادہ ٹیسٹ فائلیں بنانے سے گریز کریں. نئی ٹیسٹ فائل صرف اسی وقت بنائیں جب ریپوزٹری کے ضوابط کے تحت ضروری ہو یا کوئی موجودہ فائل مناسب جگہ نہ ہو. غیر متعلقہ کلین اَپ اور غیر ضروری پیچیدگی سے گریز کریں. موزوں موجودہ یوٹیلیٹیز کو دوبارہ استعمال کریں. متعلقہ ریپوزٹری کی ہدایات پڑھیں اور قریبی کوڈ، ٹیسٹس، دستاویزات اور CI کا جائزہ لیں. رائج اصولوں کی پیروی کریں. مقصد صاف ستھرا، قابلِ انضمام کوڈ ہے." پرومپٹ کو تشخیص کے لیے بہتر نہیں بنایا گیا تھا.
- 9
پہلا اس بات سے متعلق ہے کہ خواہ آپ خطِ اعداد پر کتنی ہی دور تک چلے جائیں، اعدادِ اول ایک دوسرے کے کتنے قریب واقع ہو سکتے ہیں. ایک دہائی سے زیادہ عرصے تک، سب سے بہتر معلوم نتیجے نے یہ ثابت کیا کہ اعدادِ اولیہ کے جوڑوں کی لامتناہی تعداد ایسی ہے جن کے درمیان فرق زیادہ سے زیادہ 246 ہے. جولیا شٹاڈلمن(نئی ونڈو میں کھلتا ہے) نے حال ہی میں اس حد کو بہتر بنا کر 240 کر دیا. آسٹرا نے 186 کی ایک زیادہ مضبوط حد قائم کرنے میں مدد کی، جس سے ظاہر ہوتا ہے کہ لامحدود تعداد میں جوڑے اس کم فاصلے کے اندر واقع ہوتے ہیں. اعدادِ اول کے مختصر وقفے: ثبوت(نئی ونڈو میں کھلتا ہے) اور معاون تحقیق(نئی ونڈو میں کھلتا ہے).
- 10
دوسرا اعدادِ اولیہ کے درمیان غیر معمولی طور پر بڑے فاصلوں سے متعلق ہے. آسٹرا نے ان فاصلوں کی ایک حد میں موجود ایسے جزو کو بہتر بنایا جو 80 سال سے زیادہ عرصے تک بدلا نہیں تھا. ہم دونوں نتائج کے ثبوت، مختصر سلسلۂ غور و فکر، اور تصدیقی مواد شیئر کر رہے ہیں. اعدادِ اولیہ کے بڑے فاصلے: ثبوت(نئی ونڈو میں کھلتا ہے) اور معاون تحقیق(نئی ونڈو میں کھلتا ہے).
- 11
- 12
- 13
- 14
ExploitBench (جون–اگست 2026) میں 20 ہائی نوعیت کی V8 کمزوریاں شامل ہیں جو 13 مستحکم Chrome ریلیزز میں پھیلی ہوئی ہیں. یہ بینچ مارک جانچ کرتا ہے کہ آیا ایجنٹس ہر مخصوص کمزوری سے فائدہ اٹھا کر V8 اور Linux کے لیے آفیشل Chrome ریلیزز میں من مانے کوڈ پر عمل درآمد حاصل کر سکتے ہیں. شامل کی گئی بعض کمزوریاں تشخیص کی پابندیوں کے تحت من مانے کوڈ پر عمل درآمد کی اجازت نہ دیتی ہوں، اس لیے 100% کامیابی کی شرح قابلِ حصول نہ بھی ہو سکتی ہے. نوٹ: GPT-5.6 Sol کا 5.5% اسکور بینچ مارک میں 300-ٹرن کی حد کا ایک مصنوعی اثر ہے، جو max استعمال کرنے والے حقیقی صارفین کے لیے موجود نہیں ہوتی. اسی طرح کی ترتیبات پر، ماڈل نے کم حدود کا سامنا کرنے پر 11.5% اسکور حاصل کیا۔
- 15
جیریمی اسپینس وغیرہ، "ایجنٹک سائبر سیکیورٹی کے لیے اگلا چیلنج: ایک حقیقت پسندانہ، آلودگی سے پاک ریورس انجینئرنگ بینچ مارک(نئی ونڈو میں کھلتا ہے)." arXiv:2608.11469v1, 2026.
- 16
جب ہم فریقِ ثالث ماڈلز پر جانچ کرتے ہیں، تو ہم ایک سادہ تحقیقی سیٹ اپ استعمال کرتے ہیں. Codex کی پروڈکشن کنفیگریشن زیادہ پیچیدہ ہے، جس کے نتیجے میں خام ماڈل کی غلطی کی شرحیں مختلف ہو سکتی ہیں. فراہم کنندہ کی جانب سے حفاظتی اقدامات اور کمپیوٹر ٹول کے نفاذ اب بھی مختلف ہیں. صارفین Codex میں بغیر تصدیق کے منظرنامے کا تجربہ نہیں کرتے، کیونکہ یہ ایک داخلی تحقیقی کنفیگریشن ہے.
- 17
