लोड किया जा रहा है...
आज हम GPT‑6 Astra जारी कर रहे हैं, जो व्यापक रूप से तैनात हमारा अब तक का सबसे सक्षम मॉडल है. Astra हमारा पहला मॉडल है, जो प्रिपेयर्डनेस फ़्रेमवर्क के तहत साइबर सुरक्षा क्षमता के क्रिटिकल स्तर तक पहुँचा है.
इस लॉन्च की सुरक्षा के बारे में जानने योग्य सबसे महत्वपूर्ण बातें ये हैं:
- GPT‑6 Astra की साइबर क्षमताएँ काफ़ी उन्नत हैं और यह हमारे क्रिटिकल स्तर की सीमा को पूरा करता है. इसका अर्थ है कि सही टूल और पहुँच मिलने पर GPT‑6 Astra पहले से अज्ञात सुरक्षा खामियाँ खोज सकता है और कई अत्यधिक सुरक्षित प्रणालियों में उनका लाभ उठाने के नए तरीके विकसित कर सकता है, वह भी बिना किसी व्यक्ति के हर चरण पर मार्गदर्शन के. इसलिए हमने मॉडल द्वारा दुरुपयोग या गलत संरेखण के कारण हानिकारक साइबर कार्रवाइयाँ किए जाने से बचाने वाले उपायों को काफ़ी मज़बूत किया है. हमने Astra और इसी तरह के मॉडलों के अपने आंतरिक विकास और परिनियोजन को सुरक्षित करने के लिए भी कदम उठाए हैं. इनमें अधिक सख्त पृथक्करण, चेकपॉइंट कूटलेखन, विचार-शृंखलाओं (CoT) सहित संपूर्ण कार्य-क्रम की सार्वभौमिक निगरानी और आंतरिक उपयोग से पहले असुरक्षित पाए जाने पर रोक लगाने वाली संरेखण मूल्यांकन प्रक्रिया शामिल हैं.
- GPT‑6 Astra अपने पूर्ववर्ती मॉडलों की तुलना में काफ़ी अधिक सुदृढ़ है. सुदृढ़ता बढ़ाने वाली नई सुरक्षा प्रशिक्षण तकनीकों को शामिल करने के कारण GPT‑6 Astra, GPT‑5.6 Sol की तुलना में जेलब्रेक के विरुद्ध काफ़ी अधिक सुदृढ़ है, यहाँ तक कि लंबे कार्य-क्रमों में भी. यह निष्कर्ष हमारे ऑफ़लाइन परीक्षणों और जेलब्रेक के कठोर आंतरिक व बाहरी परीक्षण तथा उनके निवारण के हमारे कार्यक्रम पर आधारित है. संभावित रूप से उच्च जोखिम वाले चिह्नित उपयोगकर्ताओं के लिए हमने मॉडल को यह क्षमता भी सिखाई है कि वह अपनी अस्वीकार करने की सीमा को अधिक सतर्क बना सके और दोहरे उपयोग से जुड़े अधिक व्यापक जोखिमों को समेट सके. हम प्रतिगमन परीक्षण से सुनिश्चित करते हैं कि Astra पिछली परीक्षण अवधियों में मिले जेलब्रेक के विरुद्ध सुदृढ़ बना रहे. अपने नवीनतम आंतरिक रेड टीमिंग आक्रमणकारी मॉडलों के साथ स्वचालित रेड टीमिंग के नए दौर चलाकर हमने अपने सुधारों की पुष्टि भी की.
- GPT‑6 Astra, GPT‑5.6 Sol की तुलना में बेहतर संरेखित है. Astra मॉडल संरेखण में एक महत्वपूर्ण प्रगति है. इसमें हमारे प्री-ट्रेनिंग डेटा की संरचना से लेकर रीइंफ़ोर्समेंट लर्निंग के दौरान हमारे मूल्यांकन तक, संरेखण से जुड़े सुधार शामिल हैं. हम संरेखण मूल्यांकनों का एक नया समूह(एक नई विंडो में खुलेगा) प्रस्तुत करते हैं और पाते हैं कि GPT‑6 Astra सुरक्षा सीमाओं का पालन करने तथा अपने अधिकृत दायरे में रहने में अधिक सक्षम है. 54,000 से अधिक आंतरिक Codex कार्यों(एक नई विंडो में खुलेगा) वाले एक अनुकरण में Astra को Sol की तुलना में अधिक गंभीर असंरेखित व्यवहार के लगभग आधे संकेत मिले.
- हम बड़े पैमाने पर असंरेखण निगरानी लागू कर रहे हैं. हम मॉडल संरेखण को अपने मॉडलों के संभावित असंरेखित व्यवहार को रोकने का मुख्य साधन मानते हैं. हालाँकि, निगरानी से अत्याधुनिक मॉडल के व्यवहार की व्यापक जानकारी मिलती है और संरेखण व सुरक्षा को और बेहतर बनाने के अवसर सामने आते हैं. इसके अलावा, निगरानी पहचाने गए असंरेखित व्यवहार के विरुद्ध सुरक्षा की एक अतिरिक्त परत का काम करती है. इन्हीं कारणों से हमने Astra के बाहरी परिनियोजन में टूल का उपयोग करने वाले सभी अनुमान-प्रक्रमों पर असंरेखण निगरानी भी लागू की है, जिसकी संगणन लागत काफ़ी अधिक है. यह प्रणाली हमारी आंतरिक व्यवस्था के समानांतर काम करती है.
- GPT‑6 Astra की निगरानी-क्षमता GPT‑5.6 Sol की तुलना में घटी है. हमने GPT‑6 Astra की निगरानी-क्षमता(एक नई विंडो में खुलेगा) और नियंत्रण-क्षमता(एक नई विंडो में खुलेगा) की व्यापक जाँच की है. हमने पाया कि GPT‑6 Astra अपने CoT को नियंत्रित करने में GPT‑5.6 Sol से अधिक सक्षम है और अपने CoT में दोष सिद्ध करने वाली जानकारी शामिल करने की संभावना कम रखता है. प्रतिकूल परिस्थितियों में, जहाँ हम मॉडल को अपनी निगरानी प्रणालियों से बच निकलने के लिए प्रेरित करते हैं, हमने पाया कि मॉडल मूल्यांकनों में जानबूझकर कम प्रदर्शन करते समय बिना पहचान में आए रह सकता है, जिसे सैंडबैगिंग कहते हैं. तोड़फोड़ के कुछ कार्य(एक नई विंडो में खुलेगा) करने को कहे जाने पर वह कभी-कभी हमारी आंतरिक निगरानी प्रणालियों से भी बच निकलता है. हमें गुप्त-संकेतन वाली CoT रीज़निंग का प्रमाण नहीं मिला है, जैसे सामान्य और असंबंधित दिखने वाले पाठ में छिपी रीज़निंग को छिपाना. इससे संकेत मिलता है कि बच निकलने का जोखिम मुख्यतः कम रीज़निंग वाले कार्यों तक सीमित हो सकता है.
- इन निष्कर्षों से संकेत मिलता है कि Astra श्रेणी के मॉडल प्रतिकूल परिस्थितियों में हमारी CoT निगरानी प्रणालियों से बच निकल सकते हैं. फ़िलहाल ये निष्कर्ष मुख्यतः प्रतिकूल मूल्यांकनों पर आधारित हैं, यानी उन स्थितियों पर जहाँ हम मॉडल को निगरानी से बच निकलने का निर्देश देते हैं. कुल मिलाकर हमारे संरेखण मूल्यांकन दिखाते हैं कि Astra के सुरक्षा संबंधी प्रतिबंधों का उल्लंघन करने की संभावना GPT‑5.6 Sol से कम है.
- फिर भी, हम इस रुझान को गंभीरता से लेते हैं. हमारे मॉडलों की क्षमताएँ बढ़ने के साथ हम इन निष्कर्षों और निगरानी-क्षमता पर उनके प्रभावों की जाँच जारी रखे हुए हैं. OpenAI ने विचार-शृंखला की निगरानी को बनाए रखने और उसका उपयोग करने के लिए काम किया है. CoT की निगरानी-क्षमता बनाए रखना इस शोध कार्यक्रम का प्रमुख लक्ष्य है. हालाँकि, ये परिणाम मॉडल की विचार-शृंखला की जाँच से आगे बढ़कर संरेखण की लेखापरीक्षा तकनीकें विकसित करने का महत्व भी रेखांकित करते हैं.
- GPT‑6 Astra वेब ब्राउज़िंग और कार्यस्थल की परिस्थितियों को अधिक ज़िम्मेदारी से संभालता है: GPT‑6 Astra, GPT‑5.6 Sol की तुलना में प्रॉम्प्ट में दुर्भावनापूर्ण निर्देश डालने के हमलों के विरुद्ध काफ़ी अधिक सुदृढ़ है. हमने वास्तविक ब्राउज़िंग और पेशेवर कंप्यूटर परिवेशों में भी मॉडल के व्यवहार का परीक्षण किया है. GPT‑5.6 Sol की तुलना में मॉडल के असंरेखित और संभावित रूप से विनाशकारी कार्रवाइयाँ करने की संभावना काफ़ी कम है, जैसे अनधिकृत लेन-देन, डेटा की हानि, आवश्यकता से अधिक पहुँच या नियंत्रणों को दरकिनार करना. स्वायत्त रूप से कार्य करने वाली परिस्थितियों में हानिकारक अनुरोधों को संभालते समय भी यह अधिक सुरक्षित ढंग से काम करता है, जैसे हिंसक हमले की योजना बनाने या धोखाधड़ी करने में सहायता के अनुरोध.
- अधिक जोखिम वाली परिस्थितियों में GPT‑6 Astra काफ़ी सुरक्षित है. वास्तविक उपयोग और मनुष्यों द्वारा की गई प्रतिकूल रेड टीमिंग से लिए गए चुनौतीपूर्ण अनुरोधों पर GPT‑6 Astra, GPT‑5.6 Sol की तुलना में अधिक सुरक्षित उत्तर देता है. Astra असुरक्षित अनुरोधों को सुरक्षित ढंग से पूरा करने और अहानिकर अनुरोधों को अनावश्यक रूप से अस्वीकार करने से बचने, दोनों में पारेटो सुधार हासिल करता है. ये सुधार उन अत्यधिक गंभीर परिस्थितियों में भी लागू होते हैं, जहाँ हानि का जोखिम किसी स्पष्ट अनुरोध के बजाय व्यापक संदर्भ से उत्पन्न होता है. Astra 18 वर्ष से कम आयु के उपयोगकर्ताओं के लिए आयु के अनुरूप सुरक्षा सीमाएँ भी अधिक सुसंगत ढंग से लागू करता है.
अधिक जानकारी के लिए पूरा सिस्टम कार्ड(एक नई विंडो में खुलेगा) देखें.
लेखक
OpenAI


