लोड होत आहे...
आज आम्ही GPT‑6 Astra प्रकाशित करत आहोत. व्यापकपणे डीप्लॉय केलेले हे आमचे आजवरचे सर्वाधिक सक्षम मॉडेल आहे. आमच्या प्रिपेयर्डनेस फ्रेमवर्कनुसार सायबरसुरक्षा क्षमतेची गंभीर पातळी गाठणारे Astra हे आमचे पहिले मॉडेल आहे.
या लाँचच्या सुरक्षेबद्दल जाणून घेण्यासारख्या सर्वांत महत्त्वाच्या बाबी पुढीलप्रमाणे आहेत:
- GPT‑6 Astra च्या सायबर क्षमतांमध्ये लक्षणीय वाढ झाली असून ते आमची गंभीर पातळीची मर्यादा पूर्ण करते. याचा अर्थ असा की, योग्य साधने आणि प्रवेश उपलब्ध असल्यास, GPT‑6 Astra पूर्वी अज्ञात असलेल्या सुरक्षा त्रुटी शोधू शकते आणि प्रत्येक टप्प्यावर मानवी मार्गदर्शनाशिवाय अनेक अत्यंत सुरक्षित प्रणालींमध्ये त्यांचा गैरफायदा घेण्याचे नवे मार्ग विकसित करू शकते. त्यामुळे गैरवापरामुळे किंवा विसंगतीमुळे मॉडेलने हानिकारक सायबर कृती करू नयेत यासाठी आम्ही आमची संरक्षणे मोठ्या प्रमाणात मजबूत केली आहेत. Astra आणि तत्सम मॉडेलचा अंतर्गत विकास व डीप्लॉयमेंट सुरक्षित करण्यासाठीही आम्ही उपाय केले आहेत. त्यांत अधिक कठोर विलगीकरण, तपासणी-बिंदू कूटलेखन, विचारसाखळ्यांसह (CoT) संपूर्ण कार्यक्रमांचे सार्वत्रिक निरीक्षण आणि अंतर्गत वापरापूर्वी कृती रोखू शकणारी संरेखन मूल्यमापन प्रक्रिया यांचा समावेश आहे.
- GPT‑6 Astra हे त्याच्या पूर्वीच्या मॉडेलपेक्षा लक्षणीयरीत्या अधिक भक्कम आहे. भक्कमपणासाठीची नवी सुरक्षा प्रशिक्षण तंत्रे समाविष्ट केल्यामुळे, दीर्घ कार्यक्रमांमध्येही GPT‑6 Astra हे GPT‑5.6 Sol पेक्षा जेलब्रेकविरुद्ध लक्षणीयरीत्या अधिक भक्कम आहे. संगणकाबाहेरील चाचण्या तसेच कठोर अंतर्गत व बाह्य जेलब्रेक चाचण्या आणि त्रुटीनिवारणाच्या आमच्या कार्यक्रमातून आम्हाला हे समजले आहे. संभाव्यतः उच्च-जोखमीचे म्हणून चिन्हांकित केलेल्या वापरकर्त्यांसाठी, मॉडेलची नकार देण्याची मर्यादा अधिक सावध करता यावी आणि दुहेरी वापराच्या अधिक व्यापक जोखमी समाविष्ट करता याव्यात, यासाठीही आम्ही त्याला प्रशिक्षण दिले आहे. मागील चाचणी कालावधीत आढळलेल्या जेलब्रेकविरुद्ध Astra भक्कम असल्याची खात्री करण्यासाठी आम्ही प्रतिगमन चाचण्या वापरतो. आमच्या सुधारणांची खातरजमा करण्यासाठी अद्ययावत अंतर्गत रेड टीमिंग आक्रमकांचा वापर करून स्वयंचलित रेड टीमिंगच्या नव्या फेऱ्याही घेतल्या.
- GPT‑6 Astra हे GPT‑5.6 Sol पेक्षा अधिक चांगल्या प्रकारे संरेखित आहे. मॉडेल संरेखनाच्या दृष्टीने Astra हे मोठे पुढचे पाऊल आहे. आमच्या प्री-ट्रेनिंग माहितीच्या रचनेपासून रीइन्फोर्समेंट लर्निंगदरम्यानच्या श्रेणीकरणापर्यंत अनेक संरेखन सुधारणा त्यात समाविष्ट आहेत. आम्ही संरेखन मूल्यमापनांचा नवा संच(नवीन विंडोमध्ये उघडेल) सादर केला आहे. GPT‑6 Astra सुरक्षा मर्यादांचा आदर करण्यात आणि अधिकृत कार्यकक्षेत राहण्यात अधिक सक्षम असल्याचे आम्हाला आढळले. 54,000 हून अधिक अंतर्गत Codex कार्ये(नवीन विंडोमध्ये उघडेल) वापरून केलेल्या प्रतिरूपणात, अधिक गंभीर विसंगत वर्तनासाठी Astra ला Sol च्या तुलनेत सुमारे निम्मे इशारे मिळाले.
- आम्ही विसंगतीचे निरीक्षण व्यापक प्रमाणावर डीप्लॉय करत आहोत. आमच्या मॉडेलचे संभाव्य विसंगत वर्तन रोखण्यासाठी मॉडेल संरेखन हे प्रमुख साधन असल्याचे आम्ही मानतो. तथापि, निरीक्षणामुळे अत्याधुनिक मॉडेलच्या वर्तनाचे व्यापक चित्र दिसते आणि संरेखन व सुरक्षा आणखी सुधारण्याच्या संधी स्पष्ट होतात. याशिवाय, आढळलेल्या विसंगत वर्तनाविरुद्ध निरीक्षण हा संरक्षणाचा आणखी एक स्तर ठरतो. या कारणांमुळे, मोठा संगणकीय खर्च करूनही आम्ही Astra च्या बाह्य डीप्लॉयमेंटमधील साधने वापरणाऱ्या सर्व अनुमान प्रक्रियांमध्ये विसंगतीचे निरीक्षण जोडले आहे. ही प्रणाली आमच्या अंतर्गत व्यवस्थेसारखीच आहे.
- GPT‑5.6 Sol च्या तुलनेत GPT‑6 Astra ची निरीक्षणक्षमता कमी झाली आहे. आम्ही GPT‑6 Astra ची निरीक्षणक्षमता(नवीन विंडोमध्ये उघडेल) आणि नियंत्रणक्षमता(नवीन विंडोमध्ये उघडेल) यांचा सखोल अभ्यास केला आहे. GPT‑5.6 Sol पेक्षा GPT‑6 Astra स्वतःची CoT नियंत्रित करण्यात अधिक सक्षम असून त्याच्या CoT मध्ये दोषदर्शक माहिती समाविष्ट करण्याची शक्यता कमी असल्याचे आम्हाला आढळले. प्रतिकूल परिस्थितींमध्ये, म्हणजे आम्ही मॉडेलला आमच्या निरीक्षकांना चुकवण्यास प्रवृत्त करतो तेव्हा, मूल्यमापनांत जाणीवपूर्वक कमी कामगिरी करताना ते आढळून न येण्यात यशस्वी होते आणि काही घातपाती कार्ये(नवीन विंडोमध्ये उघडेल) करण्यास सांगितल्यास कधीकधी आमच्या अंतर्गत निरीक्षकांना चुकवू शकते. गुप्तलेखनात्मक CoT रीझनिंगचा, उदाहरणार्थ सर्वसाधारण आणि असंबंधित भासणाऱ्या मजकुरात छुपे रीझनिंग लपवण्याचा, कोणताही पुरावा आम्हाला आढळलेला नाही. त्यामुळे निरीक्षण चुकवण्याचा धोका प्रामुख्याने कमी पातळीच्या रीझनिंग कार्यांपुरता मर्यादित असू शकतो.
- या निष्कर्षांवरून असे दिसते की प्रतिकूल परिस्थितीत Astra श्रेणीतील मॉडेल आमच्या CoT निरीक्षकांना चुकवू शकतात. सध्या हे निष्कर्ष प्रामुख्याने प्रतिकूल मूल्यमापनांवर, म्हणजे मॉडेलला निरीक्षण चुकवण्याची सूचना दिलेल्या परिस्थितींवर, आधारित आहेत. एकंदरीत, आमच्या संरेखन मूल्यमापनांनुसार Astra कडून सुरक्षा निर्बंधांचे उल्लंघन होण्याची शक्यता GPT‑5.6 Sol पेक्षा कमी आहे.
- तरीही, आम्ही ही प्रवृत्ती गांभीर्याने घेत आहोत. आमची मॉडेल अधिक सक्षम होत असताना या निष्कर्षांचा आणि निरीक्षणक्षमतेवरील त्यांच्या परिणामांचा अभ्यास आम्ही सुरू ठेवला आहे. OpenAI ने विचारसाखळीचे निरीक्षण जतन करून त्याचा वापर करण्यासाठी प्रयत्न केले आहेत आणि CoT निरीक्षणक्षमता जपणे हे संशोधन कार्यक्रमाचे मुख्य उद्दिष्ट आहे. तथापि, हे परिणाम मॉडेलच्या विचारसाखळीच्या तपासणीपलीकडे जाणारी संरेखन लेखापरीक्षण तंत्रे विकसित करण्याचे महत्त्वही अधोरेखित करतात.
- GPT‑6 Astra वेब ब्राउझिंग आणि कामाच्या ठिकाणच्या परिस्थिती अधिक जबाबदारीने हाताळते: GPT‑5.6 Sol च्या तुलनेत GPT‑6 Astra हे प्रॉम्प्ट अंतःक्षेपांविरुद्ध लक्षणीयरीत्या अधिक भक्कम आहे. वास्तववादी वेब ब्राउझिंग आणि व्यावसायिक संगणकीय वातावरणांमध्येही आम्ही मॉडेलच्या वर्तनाची चाचणी केली. GPT‑5.6 Sol च्या तुलनेत हे मॉडेल विसंगत आणि संभाव्य विनाशकारी कृती, उदाहरणार्थ अनधिकृत व्यवहार, माहितीची हानी, गरजेपेक्षा जास्त प्रवेश किंवा नियंत्रणांना बगल देणे, करण्याची शक्यता लक्षणीयरीत्या कमी असल्याचे आढळले. स्वायत्त एजंटच्या परिस्थितींमध्ये हिंसक हल्ल्याचे नियोजन करण्यास मदत करणे किंवा फसवणूक करणे यांसारख्या हानिकारक विनंत्या हाताळतानाही ते अधिक सुरक्षितपणे वागते.
- अधिक जोखमीच्या परिस्थितींमध्ये GPT‑6 Astra लक्षणीयरीत्या अधिक सुरक्षित आहे. प्रत्यक्ष वापरातून आणि मानवी प्रतिकूल रेड टीमिंगमधून घेतलेल्या आव्हानात्मक विनंत्यांना GPT‑6 Astra हे GPT‑5.6 Sol पेक्षा अधिक सुरक्षितपणे प्रतिसाद देते. असुरक्षित विनंत्या सुरक्षितपणे पूर्ण करण्यात आणि निरुपद्रवी विनंत्यांना अनावश्यक नकार देणे टाळण्यात Astra पॅरेटो सुधारणा साधते. स्पष्ट विनंतीऐवजी व्यापक संदर्भातून हानीचा धोका निर्माण होणाऱ्या अत्यंत गंभीर परिस्थितींमध्येही या सुधारणा दिसतात. 18 वर्षांखालील वापरकर्त्यांसाठी Astra वयानुरूप सुरक्षा मर्यादाही अधिक सातत्याने लागू करते.
अधिक माहितीसाठी संपूर्ण सिस्टम कार्ड(नवीन विंडोमध्ये उघडेल) पाहा.
लेखक
OpenAI


