OpenAI

GPT-6 Astra: A new generation of intelligence

انٹیلیجنس کی ایک نئی نسل

ہم GPT‑6 Astra متعارف کرا رہے ہیں، جو دنیا کا سب سے ذہین اور ہم آہنگ ماڈل ہے.

GPT‑6 Astra کئی سالہ تحقیق اور پری-ٹریننگ، ری اِنفورسمنٹ لرننگ اور ہم آہنگی میں بڑے داؤ کو یکجا کرتا ہے. Astra کمپیوٹر کے استعمال، براؤزنگ، سافٹ ویئر انجینئرنگ، سائبر سیکیورٹی، سائنس اور پیشہ ورانہ کام میں جدید ترین ہے. Astra نے FrontierMath Tier 4 میں 98% اسکور حاصل کیا ہے اور یہ پہلے ہی ریاضی میں دیرینہ حل طلب کھلے مسائل حل کرنے میں مدد دے چکا ہے. Astra نے 99.9% اسکور کے ساتھ ARC-AGI-3 کو بھی سیر کر دیا اور 100% اسکور کے ساتھ ExploitBench کو سیر کر دیا. یہ کمپیوٹر اور براؤزر کے استعمال میں بھی ایک نیا فرنٹیئر قائم کرتا ہے اور بے مثال رفتار، درستگی اور فیصلہ سازی کے ساتھ سب سے زیادہ تقاضا کرنے والے پیشہ ورانہ کام کو سنبھالتا ہے. 

GPT‑6 Astra آج محدود تعداد میں تنظیموں کے لیے جاری کیا جا رہا ہے اور آنے والے دنوں میں یہ تمام ChatGPT Plus، Pro، Business اور Enterprise صارفین کے لیے، نیز OpenAI API، Microsoft Azure اور AWS Bedrock کے ذریعے دستیاب ہو جائے گا.

"ARC-AGI-3 پر، Astra نے 96% لیولز پر ہمارے انسانی عملی کارکردگی کے بنیادی معیار کو پیچھے چھوڑ دیا، اور مؤثر طور پر بینچ مارک پر انسانی برابری حاصل کر لی. یہ نہ صرف اب تک کا بہترین ماڈل ہے جس کا ہم نے تجربہ کیا ہے، بلکہ یہ جدید ترین ماڈل کی کارکردگی میں ایک بامعنی بڑی تبدیلی بھی ہے—نہ صرف نئے ماحول میں نیویگیٹ کرنے اور انہیں حل کرنے کی اپنی صلاحیت میں، بلکہ یہ سیکھنے کی اپنی کارکردگی میں بھی کہ ایسا کس قدر مؤثر طریقے سے کیا جائے."
گریگ کیمرڈٹ، ARC Prize Foundation

Astra ہمارا سب سے زیادہ ہم آہنگ ماڈل ہے، جس میں صارف کے ارادے اور ماڈل کے رویّے کو سمجھنے میں نمایاں بہتری آئی ہے—آپ Astra کے فیصلے پر زیادہ اعتماد کے ساتھ ٹاسکس تفویض کر سکتے ہیں. اس کی جانچ کے ایک طریقے کے طور پر، ہم نے Hugging Face واقعے سے حاصل معلومات کی بنیاد پر ایک نئی جانچ تیار کی، جو یہ جانچتی ہے کہ آیا کسی مشکل یا ناممکن کام کا سامنا کرنے والا ماڈل اپنی مطلوبہ حدود سے باہر جائے گا. GPT‑5.6 Sol کے مقابلے میں، جو پروڈکشن سیف گارڈز کے بغیر 48% مواقع پر مجاز ہدف سے آگے بڑھ گیا، GPT‑6 Astra نے 0% معاملات میں ایسا کیا.

کمپیوٹر استعمال کے لیے دنیا کا بہترین ماڈل

GPT‑6 Astra کمپیوٹر کے استعمال کی رفتار، درستگی اور حفاظت میں ایک نیا فرنٹیئر قائم کرتا ہے. یہ آن لائن فارم پُر کرنے، CRM میں کسٹمر ریکارڈز اپ ڈیٹ کرنے اور آپ کا کیلنڈر منظم کرنے جیسے دقت طلب کام سنبھال سکتا ہے. یہ آن لائن تحقیق کر سکتا ہے اور آپ کی ای میل یا دستاویز ایڈیٹر میں خلاصوں کے مسودے تیار کر سکتا ہے. یہ سائنسی ڈیٹا کا تجزیہ کر سکتا ہے، پلاٹس تیار کر سکتا ہے، ایک ویب سائٹ بنا سکتا ہے اور فرنٹ اینڈ QA چیکس چلا سکتا ہے تاکہ یہ یقینی بنایا جا سکے کہ اس سائٹ کے تمام فیچرز کام کرتے ہیں. یہ خودکار طریقے سے سافٹ ویئر انسٹال اور ٹیسٹ کرنے اور اسکرین پر نظر آنے والے مسائل کا ازالہ کرنے میں آپ کی مدد کر سکتا ہے. یہ بہتریاں ہماری جدید ترین جانچ کے نتائج میں بھی منعکس ہوتی ہیں.

ان بہتریوں کے نتیجے میں حقیقی علمی کاموں میں بھی کارکردگی میں نمایاں اضافہ ہوتا ہے. OSWorld 2.0 پر تاخیر کی سیمولیشنز میں، Astra، GPT‑5.6 کے مقابلے میں فی ٹاسک تقریباً 47% کم وقت میں کمپیوٹر کے استعمال کی بہتر کارکردگی حاصل کرتا ہے. Sol نے فی ٹاسک تقریباً 40 منٹ میں 72.6% اسکور کیا، جبکہ تقریباً 75 منٹ میں اسکور 65.7% تھا.3

GPT‑6 Astra کی کمپیوٹر استعمال کرنے کی صلاحیتیں مختلف شعبوں میں حاصل کردہ نتائج میں دیکھی جا سکتی ہیں، جن میں گیم ڈیولپمنٹ، الیکٹریکل انجینئرنگ اور روزمرہ علمی کام شامل ہیں:

Astra کے ساتھ، ہم کمپیوٹر کے استعمال کی رفتار میں نمایاں بہتری لانے کے لیے Codex ہارنیس کو بھی اپ ڈیٹ کر رہے ہیں. Astra کی کارکردگی کے ساتھ مل کر، Mind2Web بینچ مارک پر یہ موجودہ GPT‑5.6 Sol تجربے کے مقابلے میں ٹاسک کی تکمیل کو 1.9x تیز بناتا ہے. ماڈل کی رفتار میں بہتری کا مطلب ہے کہ یہ آپ کے لیے روزمرہ زندگی کے بہت سے وقت طلب کام آپ سے بھی تیزی سے انجام دے سکتا ہے.

"ہم لانچ کے دن GPT‑6 Astra کو Devin کے ہارنیس میں ضم کر رہے ہیں، جہاں یہ ہمارے اندرونی ٹیسٹنگ بینچ مارک پر جدید ترین کارکردگی فراہم کرتا ہے. کمپیوٹر استعمال کرنے، لکھنے اور کوڈ بیس کو سمجھنے کی اس کی عمدہ صلاحیت نے بغیر کسی اضافی سیٹ اَپ کے ٹیسٹنگ کو بہتر بنا دیا: ویڈیوز کو سمجھنا نمایاں طور پر آسان ہے، اور رپورٹس زیادہ واضح اور مختصر ہیں"
سائلس البرٹی، SVP ریسرچ، Cognition

پیشہ ورانہ کام میں ایک بڑی تبدیلی

GPT‑6 Astra کمپیوٹر کے استعمال میں پیش رفتوں کو پیشہ ورانہ ماحول کے لیے مخصوص تربیت کے ساتھ جوڑتا ہے، تاکہ پیچیدہ کاموں سے نمٹنے میں مدد ملے. یہ پیچیدہ مسائل کے لیے درکار انٹیلیجنس کو کثیر مرحلہ ورک فلوز انجام دینے اور نفیس دستاویزات، سپریڈشیٹس اور پریزنٹیشنز تیار کرنے کی صلاحیت کے ساتھ یکجا کرتا ہے.

GPT‑6 Astra ہمارے موجودہ ٹیمپلیٹس کی پیروی کرنے اور ایسی سلائیڈز تیار کرنے کے لیے ہمارا بہترین ماڈل ہے جو اچھی طرح ترتیب دی گئی ہوں اور ایک منظم بیانیے کے ساتھ اہم نکات کو مختصراً بیان کریں. یہ آپ کے ٹیمپلیٹس کے مطابق اور آپ کے تحریری و بصری انداز سے ہم آہنگ واضح، اچھی طرح سے منظم دستاویزات، پریزنٹیشنز، اسپریڈشیٹس اور تجزیے تیار کرتا ہے. Astra کو اس طرح بھی تربیت دی گئی ہے کہ وہ آؤٹ پٹس میں صرف وہی ضروری سیاق و سباق شامل کرے، بجائے اس کے کہ موجودہ کام کے لیے غیر ضروری معلومات دہرائے. اس سب کا مطلب ہے کہ یہ ایسے آرٹیفیکٹس تیار کر سکتا ہے جو فوری طور پر زیادہ قابلِ استعمال ہوں اور آپ کے کاروباری سیاق و سباق اور معیارات سے مطابقت رکھتے ہوں.

GPT‑6 Astra اپنی بنائی ہوئی ویب سائٹس، گیمز، ایپلیکیشنز اور رینڈرنگز میں زیادہ مضبوط بصری فیصلہ سازی بھی لاتا ہے. ChatGPT میں سائٹس(نئی ونڈو میں کھلتا ہے) کے ساتھ، Astra پرومپٹ سے براہ راست ویب سائٹس، ویب ایپس اور گیمز بنا، ہوسٹ اور شیئر کر سکتا ہے.

"Astra ہمیں صلاحیت اور کارکردگی دونوں میں نمایاں برتری دیتا ہے. یہ ان دیگر ماڈلز کے مقابلے میں جن کا ہم نے تجربہ کیا ہے، 20% تک کم ٹوکن استعمال کرتے ہوئے ہمارے سب سے پیچیدہ تخلیقی ورک فلو کو کامیابی سے انجام دیتا ہے. سب سے اہم بات یہ ہے کہ ہمارے صارفین کے لیے، اس کا مطلب اعلٰی معیار کا آؤٹ پٹ ہے.
Alex Mashrabov، CEO اور شریک بانی، Higgsfield AI

جب ہدایات تشریح کی گنجائش چھوڑتی ہیں، تو GPT‑6 Astra درست فیصلہ کرنے میں پچھلے ماڈلز سے بہتر ہے. یہ معمول کے خلا پُر کرنے کے لیے سیاق و سباق کا استعمال کرتا ہے اور جب جواب نتیجے کو بدل سکتا ہو تو مرکوز سوالات پوچھتا ہے. Codex میں، یہ آپ کے جواب پر منحصر نہ ہونے والا کام جاری رکھتے ہوئے غیر ہم وقت طریقے سے سوالات پوچھ سکتا ہے. اگر آپ جواب نہیں دیتے ہیں، تو یہ جہاں مناسب ہو معقول مفروضوں کے ساتھ آگے بڑھتا ہے، لیکن دور رس اثرات رکھنے والے فیصلوں کے لیے آپ کی رائے کا انتظار کرتا ہے.

ذیل کی مثالیں دکھاتی ہیں کہ Astra روزمرہ کاموں میں کس طرح تعاون کرتا ہے، جہاں معلومات کی کمی جواب کو نمایاں طور پر تبدیل کر سکتی ہے.

Astra جیسے جیسے کام آگے بڑھتا ہے، اپنی سمت برقرار رکھنے میں بھی بہتر ہے. پہلے کے ماڈلز بعض اوقات اسٹیئرنگ پیغامات کو ایک نیا مقصد سمجھ لیتے تھے، جس سے اصل درخواست یا پہلے کی پابندیاں نظر سے اوجھل ہو جاتی تھیں. Astra نئے تقاضوں کو شامل کرتا ہے، کہے جانے پر سمت بدلتا ہے، اور مجموعی کام کو نظرانداز کیے بغیر ضمنی سوالات کے جواب دیتا ہے.

"Astra پیچیدہ قانونی کاموں میں GPT‑5.6 Sol کے مقابلے میں معیار میں ایک نمایاں بہتری ہے. ہماری ابتدائی جانچ میں، Astra اس بات کی وجہ سے نمایاں رہا کہ یہ قانونی کام کو ایک صاحبِ بصیرت وکیل کے انداز میں انجام دیتا ہے: یہ دستاویزات کو مستند ریکارڈز سے ممتاز کرتا ہے، بے بنیاد مفروضوں کو سامنے لاتا اور خلا کو مسودہ سازی کے ٹھوس مؤقف میں بدل دیتا ہے."
نیکو گروپن، سربراہ برائے اطلاقی تحقیق، ہاروی (Harvey)

کوڈنگ

GPT‑6 Astra اب تک سافٹ ویئر انجینئرنگ کے لیے بہترین ماڈل ہے.

2 از 1
"GPT‑6 Astra ہماری داخلی کوڈنگ بینچ مارکس پر جدید ترین کارکردگی فراہم کرتا ہے اور GPT‑5.6 Sol کے مقابلے میں ٹریڈنگ انٹیوشن جانچ میں واضح پیش رفت دکھاتا ہے. ایجنٹک کوڈنگ کے لیے استعمال کیے جانے پر، GPT‑6 Astra اس انداز میں بات چیت کرتا ہے جسے ڈویلپرز کے لیے سمجھنا آسان ہوتا ہے اور ایسا کوڈ تیار کرتا ہے جسے پروڈکشن معیار تک پہنچنے کے لیے کم تکرار درکار ہوتی ہے."
جان کریپیزی، مصنوعی ذہانت کے معاونین، Jane Street

Astra کے ساتھ، ہم Codex کے لیے سیاق ونڈو بھر جانے پر سیاق کو محفوظ رکھنے اور بازیافت کرنے کا ایک نیا طریقہ متعارف کروا رہے ہیں. تاریخی طور پر، ماڈلز نے طویل سیشنز کے دوران کام کا خلاصہ بنانے کے لیے کمپیکشن استعمال کی ہے، مثلاً پیچیدہ مسائل کو ڈیبگ کرتے وقت یا بڑے ری فیکٹرز سے نمٹتے وقت. ہر کمپیکشن میں اس بات کی تفصیلات رہ سکتی ہیں کہ کوئی فکس کیوں ناکام ہوا یا کوئی جزو کیسے کام کرتا ہے. Codex میں، Astra سیاق ونڈو کے درمیان نوٹس محفوظ رکھ سکتا ہے اور جمع شدہ تفصیلات کو بار بار ایک ہی خلاصے میں کمپریس کیے بغیر برقرار رکھ سکتا ہے. پچھلی سیاق ونڈوز قابلِ تلاش رہتی ہیں، اس لیے Astra پچھلے پیغامات اور ٹول آؤٹ پٹس سے ضروریات یا ٹیسٹ کے نتائج تلاش کر سکتا ہے—خواہ وہ معلومات اس کے نوٹس میں شامل نہ کی گئی ہو. آپ اپنے Codex config.toml(نئی ونڈو میں کھلتا ہے) میں اس تجرباتی فیچر کو فعال کر سکتے ہیں، اور آنے والے ہفتوں میں یہ Astra کے لیے ڈیفالٹ بن جائے گا.

سائنسی دریافت کو آگے بڑھانا

"کہانی یہ ہے: ایک دور کا اختتام، دوسرے کا آغاز."
گریگ برنہم، EpochAI

GPT‑6 Astra سائنسی دریافت، ریاضی اور صحت کے لیے ایک بڑی پیش رفت ہے. آج ہم اعدادِ اولیہ کے درمیان فاصلوں پر مزید دو نتائج شیئر کر رہے ہیں [WITH LINK]. Astra سائنسی جائزوں کے ایک مجموعے میں نئے ریکارڈز بھی قائم کرتا ہے:

Astra سائنسی دریافت کے پس پردہ عملی کام میں مدد کر سکتا ہے. سائنسی ریزننگ کو کمپیوٹر کے استعمال کے ساتھ ملا کر، یہ ڈیٹا کا جائزہ لینے اور نتائج کا جائزہ لینے کے لیے خصوصی سافٹ ویئر میں براہِ راست کام کر سکتا ہے، جس سے محققین کو شواہد کا جائزہ لینے اور یہ فیصلہ کرنے میں مدد ملتی ہے کہ آگے کس چیز کی تحقیق کرنی ہے.

سائبر سیکیورٹی

Astra سائبر سیکیورٹی صلاحیتوں میں ایک نمایاں تبدیلی ہے. زیرو ڈے ایکسپلائٹس کی شناخت اور انہیں تیار کرنے کی اس کی صلاحیت دفاعی ٹیموں کو کمزوریوں کو دور کرنے میں مدد دے سکتی ہے، لیکن یہ مضبوط تر حفاظتی اقدامات کی ضرورت بھی پیدا کرتی ہے. یہ سمجھنے کے لیے کہ ان صلاحیتوں کا دائرہ کس حد تک وسیع ہے، ہم نے داخلی اور فریقِ ثالث کے ماہرین کے جائزوں کا استعمال کیا.

ہم نے پہلے Astra کو ExploitBench اور ExploitGym پر آزمایا، جو یہ جانچ کرتے ہیں کہ آیا ماڈلز غیر محفوظ کوڈ بیسز میں من مانی کوڈ پر عمل درآمد حاصل کر سکتے ہیں.

اس ممکنہ تشویش کے پیشِ نظر کہ سابقہ سافٹ ویئر کمزوریوں سے واقفیت نے بینچ مارک کے نتائج کو متاثر کیا ہو سکتا ہے، ہم نے Astra کا دو نئے بینچ مارکس پر بھی جائزہ لیا. ایک بات یہ کہ، ہم نے پچھلے تین مہینوں کی کمزوریوں کا استعمال کرتے ہوئے ایکسپلائٹ ڈیولپمنٹ کو جانچنے کے لیے ایک داخلی "ExploitBench (جون–اگست 2026)" ایویلیوایشن بنائی. 2 Astra نے اس ڈیٹا مجموعے پر بہت کم آؤٹ پٹ ٹوکنز استعمال کرتے ہوئے GPT‑5.6 Sol کے مقابلے میں من مانے کوڈ پر عمل درآمد کی نمایاں طور پر زیادہ ہائی شرحیں حاصل کیں. تشخیص کے دوران، Astra نے Chrome V8 ہیپ-سینڈباکس سے فرار کی دو ایسی تکنیکیں دریافت کیں اور استعمال کیں جو پہلے نامعلوم تھیں. ہم دونوں کمزوریوں کو ان کے متعلقہ مینٹینرز کے سامنے افشا کر رہے ہیں.

ہم نے Astra کو SRE-Bench پر بھی آزمایا، جو ایک بینچ مارک ہے جو یہ جانچتا ہے کہ آیا ماڈلز بائنری سافٹ ویئر کی ریورس انجینئرنگ کر کے اس کی بنیادی منطق کو سمجھ سکتے ہیں. بینچ مارک کے مصنفین نے سافٹ ویئر شروع سے بنایا اور اس کا سورس کوڈ نجی رکھا. Astra نے ایک ہی کوشش میں 88.0% کام حل کیے اور چار کوششوں کے اندر 99.2%، جبکہ GPT‑5.6 Sol کے لیے یہ شرحیں بالترتیب 55.9% اور 68.7% تھیں.

بینچ مارکس سے آگے، ماہرین کی قیادت میں کیے گئے جائزوں سے معلوم ہوا کہ Astra پہلے نامعلوم کمزوریوں کو استعمال کر کے زیادہ محفوظ بنائے گئے براؤزرز میں من مانا کوڈ چلا سکتا تھا اور زیادہ محفوظ بنائے گئے آپریٹنگ سسٹمز کے لیے اختیارات میں اضافے کے ایکسپلائٹس بنا سکتا تھا. مجموعی طور پر، ان نتائج نے ہمارے اس فیصلے کی رہنمائی کی کہ Astra ہمارے تیاری کا فریم ورک کے تحت سائبر سکیورٹی میں کریٹیکل حد تک پہنچ گیا ہے.

جیسا کہ ہم نے The Defender’s Window میں گفتگو کی تھی، جدید ترین سائبر صلاحیتیں دفاعی ماہرین کو کمزوریوں کو زیادہ تیزی سے تلاش کرنے میں مدد دے سکتی ہیں، لیکن یہ ان کمزوریوں کا استحصال کرنا بھی آسان بناتی ہیں، جس سے دفاعی ماہرین کے لیے موافقت کی فوری ضرورت بڑھ جاتی ہے.

Astra کے آج لانچ ہونے والے ورژن کے لیے، ہم محفوظ کوڈ ریویو، پیچنگ اور تھریٹ ماڈلنگ جیسے اہم دفاعی کاموں کی معاونت کرتے ہیں. تاہم، ڈیفالٹ طور پر، Astra اعلیٰ درجے کے سائبر سیکیورٹی کاموں، جیسے ایکسپلائٹ کی دریافت، کی تعمیل کرنے سے انکار کرے گا. OpenAI Daybreak کے ذریعے، ہم OpenAI Daybreak پروگرام میں قابلِ اعتماد سائبر سیکیورٹی محافظوں کے ایک الفا گروپ کے لیے کم پابندی والی رسائی متعارف کر رہے ہیں. اس سے دفاعی ورک فلو تک رسائی میں وسعت آتی ہے، جن میں کمزوریوں کی ترجیح بندی اور توثیق، میلویئر کا تجزیہ، ڈیٹیکشن انجینئرنگ اور پیچ کی توثیق شامل ہیں. ہم Daybreak Blue کے ذریعے رسائی کو مزید وسعت دینے کا ارادہ رکھتے ہیں.

ہم نے GPT‑5.6 Sol کے لیے اپنے حفاظتی اقدامات کے مجموعے کی بنیاد پر، ممکنہ سائبر غلط استعمال کے خلاف اپنے تحفظات بھی مضبوط کیے ہیں. ان میں ممکنہ جیل بریکس کا بہتر طور پر مقابلہ کرنے کے لیے ماڈل کی مضبوطی کے لیے مزید بہتر تربیت اور ہمارے نگرانی کے سسٹمز کے لیے مزید سیاق و سباق شامل ہیں. ہم نے اپنے داخلی ریڈ ٹیمنگ حملہ آوروں کے ساتھ خودکار جانچ سمیت، سخت داخلی اور بیرونی جانچ جاری رکھی ہے. ہمارے سائبر حفاظتی اقدامات اور جانچ کی مزید تفصیلات Astra کے سسٹم کارڈ اور ہمارے بلاگ میں دستیاب ہیں.

GPT‑6 Astra کو ذمہ داری سے ہم آہنگ اور تعینات کرنا

Astra ہمارا سب سے زیادہ ہم آہنگ ماڈل ہے. Astra احتیاط برتنے، کام کی حدود کا احترام کرنے اور شفاف انداز میں بات چیت کرنے میں بہترین ہے. یہ کام ہمارے طویل عرصے سے جاری تحقیقی پروگرام کا تازہ ترین نتیجہ ہے، جو ایسے ماڈل کی ٹریننگ پر مرکوز ہے جو شروع سے آخر تک انسانی ارادے کے ساتھ ہم آہنگ رہیں.

حساس ماحول میں، Astra اس سے وابستہ خطرے کے تناسب سے احتیاط برتتا ہے. کمپیوٹر کے استعمال سے متعلق اُن کاموں کی ایک جانچ میں، جنہیں غلط طرزِ عمل کو اُبھارنے کے لیے مخالفانہ انداز میں منتخب کیا گیا تھا، Astra نے غیر ارادی نتائج سے بچنے میں زیادہ کامیابی حاصل کی. ڈیفالٹ طور پر فراہم کیے جانے والے اضافی حفاظتی اقدامات کے ساتھ چلانے سے کارکردگی اور بھی بہتر رہی.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(نئی ونڈو میں کھلتا ہے) and Anthropic Messages API(نئی ونڈو میں کھلتا ہے)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra کے صارف کی جانب سے مقرر کردہ اور اس کے ماحول سے ظاہر ہونے والی حدود کے اندر کام کرنے کا امکان بھی زیادہ ہے. ایک اندرونی جانچ میں، Astra نے کبھی بھی Codex آٹو-ریویو کے انکار کو بائی پاس کرنے کی کوشش نہیں کی. یہ بات اس وقت بھی برقرار رہی جب آٹو-جائزہ کو جان بوجھ کر اس طرح کنفیگر کیا گیا تھا کہ اس سے بچا جا سکے اور ورنہ ٹاسک مکمل کرنا ناممکن تھا. ماحول کی پابندیوں کے لیے یہ احترام ہماری ناممکن سائبر ٹاسک جانچ کے نتائج سے مطابقت رکھتا ہے، جنہیں ہم نے اس پوسٹ کے تعارف میں شیئر کیے تھے، اور ہمارے سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) میں درج دیگر نتائج سے بھی.

Astra میں دھوکہ دہی پر مبنی رویّے میں نمایاں کمی بھی دکھائی دیتی ہے. کام تفویض کرنے والے لوگوں کو ایک ماڈل کی صلاحیتوں کی واضح سمجھ اور اس کی پیش رفت کی ایماندارانہ رپورٹنگ درکار ہوتی ہے. یہ دیانت داری کے ایک پہلو کی پیمائش کرتا ہے؛ جان بوجھ کر دھوکہ دہی کو کم کرنا ہماری الائنمنٹ سے متعلق کوششوں کا ایک وسیع تر مرکزِ توجہ رہے گا.

ہماری صلاحیت-ہیلوسینیشن تشخیص میں، Astra نے GPT‑5.6 Sol کے مقابلے میں نمایاں بہتری دکھائی اور اپنی صلاحیتوں کے بارے میں کم گمراہ کن دعوے کیے.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(نئی ونڈو میں کھلتا ہے) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(نئی ونڈو میں کھلتا ہے) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

دستیابی

GPT‑6 Astra آج انٹرپرائزز اور ہمارے Trusted Access Program کے صارفین کے لیے جاری کیا جا رہا ہے، جبکہ ChatGPT Plus، Pro، Business اور Enterprise کو سبسکرائب کرنے والے لوگوں کے لیے وسیع دستیابی اگلے چند دنوں میں ہوگی. Astra کا استعمال $100 اور $200 کے Pro پلانز اور $100 Business پلان میں موجودہ استعمال کی حد میں شامل ہے اور اس پر کوئی اضافی ریٹ لمٹ یا پابندیاں نہیں ہیں. $20 Plus سبسکرپشن رکھنے والے لوگ اور معیاری Business پلان کے صارفین کم استعمال کی حدود کے ساتھ GPT‑6 Astra تک رسائی حاصل کر سکتے ہیں اور اضافی رسائی کے لیے کریڈٹس خریدنے کا اختیار بھی رکھتے ہیں. Enterprise ایڈمنسٹریٹرز اپنی ورک اسپیس کے لیے Astra فعال کر سکتے ہیں؛ لانچ کے وقت رسائی بطور ڈیفالٹ بند ہے.

Pro Lite، Pro، Business اور Enterprise کے صارفین Chat میں GPT‑6 Astra بھی استعمال کر سکتے ہیں. Astra اہل API صارفین کے لیے زیرو ڈیٹا ریٹینشن کو سپورٹ کرتا ہے اور جیسا کہ ہم نے گزشتہ ماہ بتایا تھا، ہم صارفین کی رازداری برقرار رکھتے ہوئے حفاظتی نگرانی کو مضبوط بنانے کے لیے نجی حفاظتی پروسیسنگ کی آزمائش کر رہے ہیں.

ڈویلپرز کے لیے، GPT‑6 Astra، OpenAI API میں gpt-6-astra کے طور پر دستیاب ہے اور AWS Bedrock میں بھی دستیاب ہے. OpenAI API Standard کی قیمت فی ملین ان پٹ ٹوکن $10 اور فی ملین آؤٹ پٹ ٹوکن $50 ہے. کیشے سے پڑھنے اور کیشے میں لکھنے پر الگ الگ شرحیں لاگو ہوتی ہیں. API میں GPT‑6 Astra کے لیے فاسٹ موڈ دستیاب ہے اور یہ Standard پروسیسنگ کی 2.5x تک رفتار، Standard قیمت کے 2x پر فراہم کرتا ہے.

کمپیوٹر کا استعمال

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

سائنس اور ہیلتھ

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

سائبر سیکیورٹی

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

ہم آہنگی

ہم آہنگی

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

کمپیوٹر کے اندرونی استعمال کا حفاظتی بینچ مارک (کم ہونا بہتر ہے)

2.4%

22.0%

9.5%

18.3%

11.5%

-

داخلی کمپیوٹر استعمال کی حفاظت کا بینچ مارک، AutoReview کے ساتھ (کم ہونا بہتر ہے)

1.8%

4.3%

-

-

-

-

اندرونی چکمہ دہی بینچ مارک (کم ہونا بہتر ہے)

0.00%

0.29%

-

-

-

-

ExploitGym ہنی پاٹ (کم ہونا بہتر ہے)

0.0%

48.2%

-

-

-

-

ناممکن ExploitGym

100.0 ٪

-

-

-

-

-

داخلی ہیلوسینیشن بینچ مارک (کم ہونا بہتر ہے)

4.2%

12.2%

-

-

-

-

طویل سیاق و سباق

طویل سیاق و سباق

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0 ٪

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3 ٪

73.8%

-

-

-

-

تجریدی استدلال

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

تشخیصی اسکورز کوشش کی کسی بھی سطح پر زیادہ سے زیادہ ہوتے ہیں. GPT کی تشخیصات ہمارے تحقیقی ماحول میں یا ہماری API کے ذریعے چلائی گئیں، جو سسٹم پرومپٹس، دستیاب ٹولز وغیرہ میں فرق کی وجہ سے پروڈکشن ChatGPT سے تھوڑا مختلف آؤٹ پٹ فراہم کر سکتی ہیں.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(نئی ونڈو میں کھلتا ہے). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(نئی ونڈو میں کھلتا ہے).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(نئی ونڈو میں کھلتا ہے).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(نئی ونڈو میں کھلتا ہے).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(نئی ونڈو میں کھلتا ہے): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(نئی ونڈو میں کھلتا ہے) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(نئی ونڈو میں کھلتا ہے) and supporting research(نئی ونڈو میں کھلتا ہے).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(نئی ونڈو میں کھلتا ہے) and supporting research(نئی ونڈو میں کھلتا ہے).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.