مرکزی مواد پر جائیں
OpenAI

۱۰ اگست، ۲۰۲۶

سیکیورٹیحفاظت

سائبر ڈیفنس کی مدت محدود ہونے کے ساتھ Daybreak کو وسعت دینا

ہمارے تازہ ترین سائبر سیکیورٹی کے لیے مخصوص ماڈل GPT‑5.6‑Cyber کے ساتھ مل کر ایڈوانسڈ سائبر صلاحیتیں بروئے کار لانے کے نئے طریقے متعارف کرا رہے ہیں.

سائبر سیکیورٹی کی دنیا تیزی سے بدل رہی ہے—خطرہ پیدا کرنے والے عناصر مکمل خودکار طریقوں سمیت، بے مثال رفتار اور پیمانے پر سائبر حملے کرنے کے لیے AI کا بڑھتا ہوا استعمال کریں گے. ان صلاحیتوں کے پھیلنے کے ساتھ، ڈیفینڈرز کے پاس تیاری کے لیے دستیاب وقت محدود ہوتا جا رہا ہے. ہمارا جواب یہ ہے کہ حملہ آوروں کے بڑے پیمانے پر جارحانہ AI صلاحیتیں ڈیپلائے کرنے سے پہلے دنیا بھر کے قابل اعتماد ڈیفینڈرز کو جدید ترین انٹیلیجنس فراہم کی جائے.

ہم OpenAI Daybreak کو رسائی کی دو سطحوں کے ساتھ وسعت دے رہے ہیں، جو منظور شدہ ڈیفینڈرز کو ان کے کام کے لیے موزوں صلاحیتیں فراہم کرنے کے لیے بنائی گئی ہیں:

  • Daybreak Blue مجاز دفاعی سیکیورٹی کام کے لیے موزوں حفاظتی اقدامات کے ساتھ GPT‑5.6 Sol سمیت جدید ترین عمومی مقاصد کے ماڈلز تک رسائی فراہم کرتا ہے. یہ بیشتر ڈیفینڈرز کے لیے تجویز کردہ نقطۂ آغاز ہے اور کمزوریوں کی دریافت، محفوظ کوڈ جائزے، میل ویئر تجزیے، واقعات پر ردعمل اور پیچ کی توثیق میں معاون ہے.
  • Daybreak Red مجاز کمزوریوں کی تحقیق، ایکسپلائٹ توثیق اور سیکیورٹی ٹیسٹنگ کے لیے ہمارے مخصوص طور پر تربیت یافتہ سائبر سیکیورٹی کے لیے مخصوص ماڈلز تک رسائی فراہم کرتا ہے.

ہم GPT‑5.6‑Cyber بھی متعارف کرا رہے ہیں، جو Daybreak Red کے ذریعے دستیاب ہے. GPT‑5.6 Sol پر مبنی یہ ماڈل کئی خصوصی سائبر سیکیورٹی کاموں، (مثلاً زیرو ڈے کمزوریوں کی نشاندہی کرنے اور ایکسپلائٹ چینز بنانے)، میں صلاحیتیں بہتر کرنے اور بعض زیادہ خطرے والے دوہرے استعمال والے سائبر ٹاسکس پر انکار کم کرنے کے لیے تربیت یافتہ ہے.

Daybreak ایڈوانسڈ سائبر صلاحیتیں بروئے کار لاتا ہے

جیسا کہ ہم پہلے بتا چکے ہیں، GPT‑5.6 Sol سائبر سیکیورٹی کاموں میں جدید ترین کارکردگی پیش کرتا ہے. پروڈکشن میں ہم غلط استعمال روکنے کے لیے سائبر سیکیورٹی سے متعلق درخواستوں کی جانچ کے سسٹم لیول حفاظتی اقدامات لگاتے ہیں، مگر یہ جائز دفاعی کام بھی روک سکتے ہیں. Daybreak Blue رسائی یہ پابندیاں ہٹا دیتی ہے، جس سے ڈیفینڈر واقعات کی شناخت و ردعمل، تحقیقات، کمزوریوں کے انتظام اور سیکیورٹی جائزوں سمیت حقیقی دنیا کے سیکیورٹی کاموں میں ماڈل سے زیادہ فائدہ اٹھا سکتے ہیں.

سسٹم لیول کی حفاظتی پابندیوں کے بغیر بھی سائبر سیکیورٹی کے بعض انتہائی دوہرے استعمال والے پرومپٹس موجود ہیں (مثلاً پروڈکشن سسٹمز کی پینیٹریشن ٹیسٹنگ)، جن پر GPT‑5.6 Sol عمل کرنے سے انکار کرے گا. اس مسئلے کے لیے ہم نے Daybreak Red رسائی کے ذریعے دستیاب GPT‑5.6‑Cyber کو بعض کاموں میں انکار مزید کم کرنے اور کارکردگی بہتر بنانے کی تربیت دی. GPT‑5.6‑Cyber قابل اعتماد ڈیفینڈرز کو جائز سیکیورٹی سرگرمیاں انجام دینے میں مدد دیتا ہے.

Daybreak Red کے ذریعے GPT‑5.6‑Cyber سے حاصل ہونے والی انکار کی کم شرح کو جانچنے کے لیے ہم نے ایک داخلی جائزہ، (Advanced Cybersecurity Completion Rate) بنایا جو یہ پیمائش کرتا ہے کہ ماڈلز ایکسپلائٹ چین کی تیاری، توثیق بائی پاس، پرولیج ایسکلیشن اور دیگر جدید سائبر سیکیورٹی منظرناموں سے متعلق درخواستوں کا کتنی بار جواب دیتے ہیں1. GPT‑5.6‑Cyber ان درخواستوں میں سے 95.0% مکمل کرتا ہے، جبکہ GPT‑5.6 Sol صرف 1.5% اور Daybreak Blue رسائی کے ساتھ 2.0% مکمل کرتا ہے. یہ GPT‑5.5‑Cyber سے بھی زیادہ درخواستیں مکمل کرتا ہے، جو صرف 57.3% درخواستیں مکمل کرتا ہے، یوں پچھلے ماڈل کے مسلسل انکار کا سامنا کرنے والے سیکیورٹی محققین کے فیڈبیک کو ایڈریس کرتا ہے.

ذیل میں ہم سائبر سیکیورٹی پرومپٹس اور ان سے متعلق ماڈل کے جوابات کی ایک سلسلہ وار مثال دکھاتے ہیں: نظامی پابندیوں والا GPT‑5.6 Sol، GPT‑5.6 Sol (Daybreak Blue)، GPT‑5.5‑Cyber (Daybreak Red) اور GPT‑5.6‑Cyber (Daybreak Red).

سائبر سیکیورٹی کی کارکردگی میں بہتری

GPT‑5.6‑Cyber ماڈل کو ایکسپلائٹ ڈیولپمنٹ اور ایڈوانسڈ سیکیورٹی ریسرچ سے متعلق مخصوص سائبر سیکیورٹی کاموں میں کارکردگی بہتر بنانے کی تربیت دی گئی ہے. ExploitGym2 یہ جانچتا ہے کہ آیا ایجنٹس معلوم کمزوریوں کو ایسے کارآمد ایکسپلائٹس میں بدل سکتے ہیں جو کنٹرول شدہ ماحول میں من مانی کوڈ کے نفاذ کو ممکن بنائیں. اس میں GPT‑5.6‑Cyber، GPT‑5.6 Sol اور GPT‑5.5 Cyber دونوں سے بہتر ہے.

GPT‑5.6‑Cyber کا ایک اور شعبہ جس میں بہتری لانے کا مقصد ہے، نئی زیرو ڈے کمزوریوں کی نشاندہی کرنے اور ان کی شدت کا درست تعین کرنے کی صلاحیت ہے. ہم نے ایک داخلی جائزہ جاتی ڈیٹا مجموعہ بنایا، جس میں ماڈلز کو اوپن سورس ریپوزٹری کا موجودہ ریلیز فراہم کی جاتی ہے. پھر ہم ان سے اپنے نتائج کی تکنیکی تفصیل کے ساتھ زیادہ سے زیادہ ممکنہ اثر رکھنے والے پروف آف کانسیپٹ ایکسپلائٹس بنانے کو کہتے ہیں. ماڈلز کا جائزہ ان کے نتائج کی سنگینی اور اثر، نیز ساتھ دی گئی تکنیکی تفصیل کی درستی اور معیار کے لحاظ سے لیا جاتا ہے. خصوصی تربیت کے باعث GPT‑5.6‑Cyber (Daybreak Red) نے اس بینچ مارک پر GPT‑5.6 Sol (Daybreak Blue) سے بہتر کارکردگی دکھائی.

ہم نے GPT‑5.6‑Cyber کا اپنے داخلی Vulnerability Discovery and Report Writing کے جائزے پر بھی جانچا، جس میں ایجنٹ کو معلوم کمزوری والی ریپو میں کمزوریاں تلاش کرنے کا اوپن اینڈڈ پرومپٹ دیا جاتا ہے. ماڈلز اس جائزے میں سنگین اور قابل عمل کمزوریوں، (خواہ نئی ہوں یا معلوم)، کی نشاندہی کرنے، قابل عمل پروف آف کانسیپٹ بنانے اور اعلیٰ معیار کی کمزوری رپورٹ جمع کرانے پر پوائنٹس حاصل کرتے ہیں. GPT‑5.6 Sol اور GPT‑5.6‑Cyber دونوں GPT‑5.5‑Cyber سے بہتر کارکردگی دکھاتے ہیں. اس جائزے میں GPT‑5.6‑Cyber کی کارکردگی GPT‑5.6 Sol سے کمتر کارکردگی دکھاتا ہے. ہمارے خیال میں اس کی وجہ یہ ہے کہ ماڈل کبھی کبھار مختصر اور کم تفصیلی کمزوری رپورٹس بناتا ہے.

آخر میں، ہم نے ExploitBench3 پر ایکسپلائٹ ڈیولپمنٹ کی صلاحیتیں ناپیں. یہ جائزہ V8 کی کمزوری کو مکمل ایکسپلائٹ میں بدلنے کی ایجنٹ کی صلاحیت جانچتا ہے. یہ ایکسپلائٹیشن ٹاسک ExploitGym سے زیادہ مشکل ہے — V8 سینڈ باکس جیسے مزید دفاعی تحفظات فعال رہتے ہیں اور ایجنٹ کو ایکسپلائٹ کی جانے والی کمزوری کے بارے میں کم معلومات دی جاتی ہیں. معیاری سیٹنگ میں، جہاں ایجنٹس 300 ٹرنز تک محدود ہوتے ہیں، GPT‑5.6 Sol (Daybreak Blue) کم ٹوکن میں زیادہ مؤثر طور پر کام حل کرتا اور بہترین کارکردگی دکھاتا ہے. اگر ہم معیاری 300 ٹرنز کی حد کو بڑھا کر 600 ٹرنز کر دیں تو دونوں ماڈلز کی کارکردگی کا فرق کم ہو جاتا ہے.

جائزہ بینچ مارکس کے نتائج کے علاوہ، ہم نے قابل اعتماد کسٹمر پارٹنرز کے ایک گروپ کو GPT‑5.6‑Cyber تک ابتدائی رسائی بھی دی. ان کسٹمرز نے ماڈلز کو اپنے دفاعی ورک فلوز کی رفتار بڑھانے کے لیے نہایت کامیابی سے استعمال کیا ہے:

حقیقی سافٹ ویئر میں کمزوریاں تلاش کرنا اور درست کرنا

GPT‑5.6‑Cyber کی صلاحیتیں تحقیقی بینچ مارک کی کارکردگی سے آگے حقیقی دنیا کی کمزوری تحقیق تک پھیلی ہوئی ہیں. حقیقی دنیا کی کمزوری تحقیق میں اکثر بڑے اور غیر مانوس کوڈ بیسز پر مسلسل ریزننگ درکار ہوتی ہے. محققین کو مفروضے قائم اور جانچنے، متعدد اجزا کے درمیان تعاملات کو ٹریک کرنے، غیر متوقع رویہ دوبارہ پیدا کرنے اور یہ طے کرنے کی ضرورت ہوتی ہے کہ مشتبہ کمزوری کا عملی استحصال ممکن ہے یا نہیں.

GPT‑5.6‑Cyber ماڈل کی تربیت مکمل ہونے کے بعد سے ہم نے اسے منتخب سافٹ ویئر پروجیکٹس کے وسیع مطالعے اور بہتری کے لیے استعمال کیا ہے. مثلاً ہم نے GPT‑5.6‑Cyber کو Chrome میں استعمال ہونے والے JavaScript انجن V8 کی تحقیق کے لیے استعمال کیا. ہم نے دو ایسی کمزوریاں جو پہلے نامعلوم تھیں دریافت کیں جنہیں ایک چین میں جوڑ کر میموری خراب کی جا سکتی اور V8 ہیپ سینڈ باکس سے فرار حاصل کیا جا سکتا تھا. ہمارے محققین نے نتائج کی توثیق کی اور مربوط کمزوری کے انکشاف کے ذریعے Google کو ان کی اطلاع دی. Google نے کمزوری درست کر کے اسے CVE-2026-15903 تفویض کیا.

CVE-2026-15903، Chrome کے JavaScript انجن V8 میں ایک انتہائی سنگین کمزوری ہے. اس کا آپٹمائزنگ کمپائلر اقدار کو انٹیجرز میں بدلتے وقت غلطی سے ایک حفاظتی جانچ کو نظر انداز کر دیتا تھا، جس سے غیر متعین اقدار متوقع نتیجے کے بجائے غیر متوقع طور پر غیر متوقع طور پر بڑی تعداد بنا سکتی تھیں.

اگر اس عدد کو ارے انڈیکس کے طور پر استعمال کیا جائے تو کمپائلر غلط طور پر یہ فرض کر سکتا ہے کہ وہ صف کی حدود میں ہے اور معمول کی حدود کی معمول کی جانچ کو نظر انداز کر سکتا ہے. پھر حملہ آور دیگر اشیا سے متعلق میموری کو پڑھ یا اوور رائٹ کر سکتا ہے اور ممکنہ طور پر Chrome کے سینڈ باکس میں من مانی کوڈ چلا سکتا ہے. ہیپ سینڈ باکس سے نکلنے کے لیے عموماً دوسری کمزوری درکار ہوتی، جو GPT‑5.6‑Cyber نے بھی تلاش کر لی. ذیل کا خاکہ اس زیادہ شدت کی کمزوری کا مجموعی جائزہ پیش کرتا ہے.

JIT کمپائلر بگ حد سے باہر اسٹرنگ بناتی ہے، جس سے سینڈ باکس کے اندر من مانی ریڈ اور رائٹ ممکن ہوتی ہے. اس کے بعد JSPI اسٹیک ایسکیپ مقامی کوڈ چلانے، V8CTF فلیگ حاصل کرنے یا براؤزر سینڈ باکس مرحلے تک پہنچنے کو ممکن بناتا ہے.

V8 کی ان کمزوریوں کے علاوہ، ہم نے GPT‑5.6‑Cyber کو مقبول ڈیٹابیسز سے موبائل فونز تک مختلف سافٹ ویئر میں انتہائی سنگین مسائل شناخت کرنے کے لیے بھی استعمال کیا ہے:

  • ایک مقبول موبائل آپریٹنگ سسٹم میں کم از کم پانچ کمزوریاں، جن میں غیر معتبر ایپ سے مقامی اختیارات بڑھانے تک کی چین شامل ہے.
  • ایک مقبول ڈیٹابیس میں تین انتہائی سنگین کمزوریاں، جن میں دور سے کوڈ چلانے کا راستہ بھی شامل ہے.
  • ایک مقبول آپریٹنگ سسٹم کرنل میں 400 سے زیادہ کمزوریاں جو اختیارات بڑھانے کا سبب بن سکتی ہیں.

ہم موبائل آپریٹنگ سسٹم، ڈیٹابیس اور کرنل کی ان کمزوریوں کے انکشاف اور تدارک کے لیے Daybreak پارٹنرز اور اوپن سورس کمیونٹی کے اراکین کے ساتھ مل کر کام کر رہے ہیں.

تیاری کے جائزے

ہمارے تیاری کے فریم ورک کے تحت GPT‑5.6 Sol ماڈل کو سائبر سیکیورٹی صلاحیت میں ہائی اور انتہائی سنگین حد سے نیچے قرار دیا گیا. GPT‑5.6‑Cyber کے لانچ سے پہلے ہم نے اس کی جدید ترین سائبر صلاحیتوں کا بھی جائزہ لیا اور طے کیا کہ یہ بھی High تھریش ہولڈ تک پہنچتا ہے، لیکن Critical تھریش ہولڈ تک نہیں پہنچتا. ماڈل نے بعض خصوصی سائبر کاموں میں GPT‑5.6 Sol سے بہتری دکھائی، جن کے لیے اسے براہ راست تربیت دی گئی تھی، لیکن اتنی نہیں کہ ہمارے Critical تھریش ہولڈ تک پہنچ سکے. یاد رہے، جیسا کہ ہم نے Hugging Face واقعے سے متعلق تازہ معلومات میں بتایا تھا، GPT‑5.6‑Cyber کا Hugging Face کے استحصال میں کوئی کردار نہیں تھا اور نہ آئندہ جاری ہونے والے کسی دوسرے ماڈلز کا تھا.

ہم بعد میں GPT‑5.6‑Cyber کے مزید جائزوں کے ساتھ ایک سسٹم کارڈ شائع کریں گے.

رسائی اور حفاظتی اقدامات

کم حفاظتی اقدامات کے ساتھ چلنے والے ماڈلز میں عام ماڈل استعمال سے زیادہ خطرات ہوتے ہیں، خواہ وہ غلط استعمال سے ہوں یا عدم ہم آہنگی سے. ان خطرات کے باوجود ہمارا ماننا ہے کہ سائبر دفاع کو تیز اور خودکار بنانے کے لیے ڈیفینڈرز کو جدید ترین انٹیلیجنس تک وسیع رسائی دینا ضروری ہے.

Daybreak Blue اور Daybreak Red کی رسائی مجاز کام کرنے والے منظور شدہ افراد(نئی ونڈو میں کھلتا ہے) اور اداروں کے لیے دستیاب ہے. ہم شناخت کی توثیق، اکاؤنٹ سیکیورٹی، نگرانی، منظور شدہ استعمال کی پابندیوں اور قانونی تصدیقات کے ذریعے رسائی کو کنٹرول کرتے ہیں.

ہم سائبر ماڈلز کے زیادہ محفوظ استعمال کے لیے اضافی اقدامات بھی کر رہے ہیں:

  • ہم Codex استعمال کرنے والے Daybreak کسٹمرز کو ایپ کی ڈیفالٹ ترتیبات اور UI فیچرز کے ذریعے مکمل رسائی موڈ سے آٹو ریویو موڈ پر منتقل ہونے کی بھرپور ترغیب دے رہے ہیں. خودکار جائزہ عمل درآمد سے پہلے ایسی کارروائیاں جن کے لیے اضافی اجازت درکار ہوتی ہے اور ایسی درخواستوں کو روک سکتا ہے جو تباہ کن رویے کا نمایاں خطرہ پیدا کرتی ہوں.
  • ہم ایک ستمبر 2026 سے Daybreak کے تمام انفرادی اکاؤنٹس کے لیے ہارڈ ویئر سیکیورٹی کلیدیں اپنانا لازمی کر رہے ہیں.
  • ہم بہتر نگرانی سمیت اضافی سیکیورٹی اقدامات پر سرگرمی سے کام کر رہے ہیں، جنہیں آئندہ ہفتوں میں متعارف کرانے کا ارادہ ہے.
  • ہم Daybreak کے آئندہ لانچ کے لیے الائنمنٹ ٹریننگ اور ٹیسٹنگ کو ترجیح دے رہے ہیں.
  • ہم نے حفاظتی بہترین طریقوں سے متعلق Codex دستاویزات اپ ڈیٹ کر دی ہیں، تاکہ ٹیمیں سائبر صلاحیت رکھنے والے ایجنٹس کو ان کی مقررہ سیکیورٹی حدود میں رکھ سکیں.

Daybreak سلسلے کے استعمال کے بہترین طریقوں میں شامل ہیں:

  • سینڈ باکس میں رکھیں اور الگ تھلگ کریں. سیکیورٹی ورک فلو حساس پروڈکشن سسٹمز یا کھلے انٹرنیٹ تک رسائی کے بغیر کنٹرول شدہ ماحول میں چلائیں. سینڈ باکس کی حدود باقاعدگی سے جانچیں.
  • ایجنٹ کی کارروائیوں کی نگرانی کریں. Codex سینڈ باکس سے باہر ٹول کالز کا عمل درآمد سے پہلے جائزہ لینے کے لیے خودکار جائزہ موڈ(نئی ونڈو میں کھلتا ہے) استعمال کریں. زیادہ خطرے والے کاموں کے لیے مزید نگرانی اور انسانی نگاہ شامل کریں.
  • دائرۂ کار متعین کریں. واضح کریں کہ کن سسٹمز اور کارروائیوں کی اجازت ہے. ان حدود کو نافذ کرنے کے لیے محدود دائرۂ کار والی اجازت کی پروفائلز(نئی ونڈو میں کھلتا ہے) استعمال کریں.

ادارے اپنے مخصوص کاموں کے لیے جائزہ پالیسی کو حسب ضرورت(نئی ونڈو میں کھلتا ہے) بھی بنا سکتے ہیں.

ہم بیشتر ڈیفینڈرز کے لیے Daybreak Blue کو نقطۂ آغاز کے طور پر تجویز کرتے ہیں. جن ٹیموں کے مجاز کام میں اعلیٰ کمزوری تحقیق، ایکسپلائٹ ڈیولپمنٹ یا ریڈ ٹیمنگ شامل ہو، وہ ہمارے جدید ترین سائبر ماڈلز کے لیے Daybreak Red رسائی کی درخواست دے سکتی ہیں. پروگرام میں شامل ہونے کے لیے openai.com/daybreak/partners پر درخواست دیں.


1. تمام جائزوں میں ہم ہر ماڈل کی کارکردگی عوامی طور پر دستیاب بلند ترین ریزننگ سطح پر دکھاتے ہیں. یاد رہے کہ GPT‑5.6‑Cyber اپنے ریزننگ بجٹ میں GPT‑5.6 Sol کے مقابلے میں زیادہ وسیع اور جامع ہوتا ہے، جس کے نتیجے میں ٹوکنز کا زیادہ استعمال ہوتا ہے.

2. ExploitGym کے تمام جائزے ہماری نئی اندرونی نفاذ کے ذریعے سیکیورٹی کے لحاظ سے مضبوط، الگ تھلگ ماحول میں کیے گئے، جہاں غیر موافق رویوں کی سخت نگرانی کی گئی.

3. ExploitBench کے جائزے ہماری اندرونی نفاذ کے ذریعے سیکیورٹی کے لحاظ سے مضبوط، الگ تھلگ ماحول میں کیے گئے.

مصنف

OpenAI