मुख्य मजकूराकडे जा
OpenAI

१८ ऑगस्ट, २०२६

कंपनीप्रकाशन

सायबर-महत्त्वपूर्ण क्षमतांच्या युगात मॉडेल विकासाचा वेग

लोड होत आहे...

गेल्या काही आठवड्यांत, वाढत्या क्षमतेच्या AI प्रणालींशी संबंधित जोखमी अधोरेखित करणाऱ्या दोन घडामोडी झाल्या आहेत: OpenAI-हगिंग फेस घटना आणि स्वतंत्रपणे, आमच्या आगामी मॉडेल्सपैकी एक असलेले Astra हे मॉडेल आमच्या प्रिपेयर्डनेस फ्रेमवर्कनुसार सायबर सुरक्षेच्या महत्त्वपूर्ण क्षमतेची पातळी गाठू शकते, याचा प्राथमिक पुरावा. या दोन्ही घडामोडींमुळे आणि आमच्या अंतर्गत संशोधनातील वेगवान प्रगतीमुळे, प्रशिक्षण प्रक्रियेच्या सर्व टप्प्यांवर देखरेख, सुसंरेखन आणि नियंत्रणासाठी असलेली आमची संरक्षणे अधिक बळकट करण्याच्या कामाला आणखी तातडीचे महत्त्व निर्माण झाले आहे.

मॉडेल अधिक सक्षम होत असताना, त्यांचा अंतर्गत विकास आणि चाचणी यांच्याशी संबंधित जोखमीही वाढतात. देखरेख, सुसंरेखन आणि सुरक्षा यांसाठीची आमची मानके त्या जोखमींच्या पुढे राहिली पाहिजेत. ती मानके पूर्ण करण्यासाठी आवश्यक वेळ घेता यावा म्हणून आम्ही विस्ताराचा वेग तात्पुरता कमी केला. याअंतर्गत, संशोधन वातावरण अधिक सुरक्षित करून त्यावर प्रतिकूल परिस्थितीतील चाचण्या करत असताना आणि देखरेख प्रणालींची व्याप्ती वाढवत असताना, तैनातीसाठी असलेल्या आमच्या नवीनतम मॉडेलचे रीइन्फोर्समेंट लर्निंग (RL) प्रशिक्षण दोन आठवड्यांसाठी थांबवण्यात आले. मॉडेलच्या वर्तनाचे मूल्यमापन करण्यासाठी, आमची संरक्षणे प्रमाणित करण्यासाठी आणि पुढे जाण्यापूर्वी सुसंरेखनाचे अधिक पुरावे मिळवण्यासाठी आम्ही लहान स्तरावरील प्रशिक्षण आणि मूल्यमापन करत आहोत; त्यामुळे आमची नियोजित सर्वांत मोठी अत्याधुनिक RL प्रशिक्षण प्रक्रिया अद्याप स्थगित आहे.

AI प्रणालींनी अपेक्षेनुसार वागावे आणि मानवी देखरेखीला प्रतिसाद द्यावा यासाठी केले जाणारे सुसंरेखनाचे काम दीर्घकाळापासून आमच्या संशोधन कार्यक्रमाच्या केंद्रस्थानी आहे. आधीच सुरू असलेल्या संशोधन आणि मूल्यमापनाच्या आधारावर, आता आम्हाला संपूर्ण प्रशिक्षणादरम्यान सुसंरेखित वर्तनाचे अधिक ठोस पुरावे आवश्यक आहेत. वाढत्या क्षमतेच्या प्रणाली सुसंरेखित ठेवण्याचे आव्हान संपूर्ण क्षेत्राला हाताळावे लागेल. आगामी मॉडेलच्या प्रगतीतून मिळणारे संकेत स्पष्ट करतात की आम्हाला सध्याच्या प्रिपेयर्डनेस फ्रेमवर्कवर आधारित, पण त्याच्या पलीकडे जाणारा व्यापक दृष्टिकोन आवश्यक आहे.

आमचा दृष्टिकोन कसा बदलत आहे, याबद्दल पारदर्शक राहणे महत्त्वाचे आहे, असे आम्हाला वाटते. आमच्या संशोधन प्रक्रिया आणि पायाभूत सुविधांमध्ये आम्ही आधीच केलेले बदल आणि अद्याप सुरू असलेले काम खाली दिले आहे.

अधिक सक्षम मॉडेलसाठी संरक्षणे बळकट करणे

अधिक सक्षम मॉडेल विकसित करण्याचा आमचा दृष्टिकोन परस्परांना बळ देणाऱ्या तीन संरक्षणांवर आधारित आहे:

  1. देखरेख, जी चिंताजनक वर्तन शोधते आणि त्याला प्रतिसाद देणे शक्य करते.
  2. सुसंरेखन, जे हानिकारक किंवा अनधिकृत कृतींची शक्यता कमी करते.
  3. सुरक्षा उपाय, जे AI प्रणाली काय ॲक्सेस करू शकतात किंवा कशावर परिणाम करू शकतात, यावर मर्यादा घालतात.

इतर मॉडेलपासून संरक्षण करण्यासह बहुतांश सुरक्षा कार्य लवकरच मॉडेल्स करतील, अशी आमची अपेक्षा आहे. यामुळे तिन्ही सुरक्षा उपाय मॉडेलच्या क्षमतेनुसार विस्तारता येतील आणि हे आम्हाला अत्यंत महत्त्वाचे वाटते.

प्रत्येक मॉडेलची क्षमता, कार्यरत वातावरण आणि जोखमीची पातळी यानुसार बदल करून आम्ही ही संरक्षणे संशोधनापासून तैनातीपर्यंत सर्वत्र लागू करतो.

आमची संशोधन वातावरणे सुरक्षित करणे

अत्याधुनिक मॉडेलच्या सायबर सुरक्षा क्षमता वाढत असल्याने, त्यांना प्रशिक्षण देण्यासाठी आणि त्यांचे मूल्यमापन करण्यासाठी वापरल्या जाणाऱ्या वातावरणांची सुरक्षा मानके आम्ही उंचावत आहोत. ही मानके पूर्ण करण्यासाठी मोठ्या प्रमाणावर अभियांत्रिकी काम करावे लागले असून, त्यामुळे अत्याधुनिक संशोधनासाठी मोठा खर्च आणि विलंब झाला आहे. OpenAI-हगिंग फेस घटनेनंतर* लगेचच, कोड कार्यान्वित करू शकणाऱ्या किंवा इंटरनेट ॲक्सेस करू शकणारी साधने वापरणाऱ्या प्रक्रियांसाठी संशोधन समूहांमधील अत्याधुनिक मॉडेलचे अनुमान आम्ही थांबवले. कोड कार्यान्वित करण्यासाठी अधिक मर्यादित आणि सुरक्षित मार्ग आम्ही बऱ्यापैकी लवकर पूर्ववत केला. त्यानंतर प्रत्येक कार्यभार सुरक्षितपणे पुन्हा सुरू करता येईल का, हे आम्ही स्वतंत्रपणे तपासले. काही संशोधन कार्यभार या नव्या नियंत्रणांखाली पुन्हा सुरू झाले, तर इतरांसाठी अतिरिक्त बदल करावे लागले.

त्यानंतरच्या आठवड्यांत, अत्याधुनिक संशोधन कार्यभारांसाठी अधिक कठोर सुरक्षा आवश्यकता आम्ही निश्चित केल्या आणि त्यांची अंमलबजावणी सुरू केली. उदाहरणार्थ:

  • कार्यभाराचे विलगीकरण: मॉडेलने तयार केलेला किंवा अन्य अविश्वसनीय कोड कार्यान्वित करणाऱ्या कार्यभारांसाठी आता आम्हाला अधिक कठोर विलगीकरणाची, म्हणजेच "सुरक्षित स्वतंत्र वातावरणांची", आवश्यकता आहे. मॉडेलच्या निष्पत्तीवर प्रक्रिया करताना धोक्यात येऊ शकणाऱ्या सॉफ्टवेअरनाही हे लागू होते.
  • नेटवर्कचे विलगीकरण: अधिक जोखमीचे आणि अविश्वसनीय कार्यभार इंटरनेटपासून वेगळे ठेवण्यासाठी आम्ही अधिक नियंत्रणे लागू केली आहेत. एखादा कार्यभार किंवा साहाय्यक सेवा एकदा धोक्यात आली, तरी केवळ त्यामुळे इंटरनेट किंवा इतर अंतर्गत नेटवर्क्समध्ये अनधिकृत ॲक्सेस मिळू नये, अशा प्रकारे ही नियंत्रणे तयार केली आहेत.
  • सतत सुरक्षा चाचणी: संभाव्यतः असुरक्षित शेअर्ड सेवा काढून टाकण्यासाठी, कायमस्वरूपी विशेषाधिकार कमी करण्यासाठी आणि सुरक्षा व विश्वासाच्या सीमा सुधारण्यासाठी आम्ही आमच्या वातावरणाची पुनर्रचना केली आहे. सुरक्षा नोंदी संकलित करण्याची आणि त्यांवर देखरेख ठेवण्याची आमची क्षमताही आम्ही सुधारत आहोत. शेवटी, प्रतिकृतीरूप हल्ल्यांच्या विरोधात या सीमांची सतत चाचणी करण्यासाठी आमची मॉडेल वापरणाऱ्या ऑटोमेशनमध्ये आम्ही गुंतवणूक करत आहोत.

ही सर्व नियंत्रणे एकत्रितपणे अनेक स्तरांचे संरक्षण देतात आणि आमच्या संशोधन वातावरणाचे हल्ल्यांपासून रक्षण करण्यास मदत करतात. Astra मॉडेलमध्ये सायबर क्षमतेची महत्त्वपूर्ण पातळी असू शकते, असे आम्ही ठरवले असल्याने Astra किंवा सायबर मॉडेलशी संबंधित कार्यभारांसाठी सध्या आम्ही सर्वांत कठोर सुरक्षा संरक्षणे अनिवार्य केली आहेत. ही संरक्षणे सायबरशी संबंधित इतर सर्व कार्यभारांनाही लागू होतात.

Astra चे काही प्रशिक्षण आणि मूल्यमापन या आवश्यकता पूर्ण करत असले, तरी मोठ्या संख्येने कार्यभारांचे पूर्ण स्थलांतर आणि नव्या सुरक्षा मानकानुसार सुधारणा होईपर्यंत ते स्थगित राहतील. या नव्या वातावरणांमध्ये स्थलांतर करताना आम्ही सुरक्षा आणि सुसंरेखनाशी संबंधित कार्यभारांना प्रथम प्राधान्य देत आहोत.

चेन-ऑफ-थॉट देखरेखीचा विस्तार

अंतर्गत कोडिंग एजंटवरील देखरेख आणि दीर्घकाळ चालणारी सत्रे यांसह, देखरेख हा दीर्घकाळापासून आमच्या मॉडेल विकास प्रक्रियेचा महत्त्वाचा भाग राहिला आहे. आमच्या देखरेखीचे प्रयत्न विशेषतः अत्याधुनिक मॉडेलच्या अंतर्गत तैनाती आणि अत्याधुनिक RL प्रशिक्षण प्रक्रियांवर केंद्रित होते. प्रगत मॉडेल क्षमता आणि साधने, संवेदनशील प्रणाली तसेच अंतर्गत किंवा बाह्य नेटवर्क्सचा ॲक्सेस एकत्र येऊ शकत असल्यामुळे आम्ही हे सर्वाधिक जोखमीचे कार्यभार मानले होते. साधने वापरणाऱ्या सर्व अनुमान आणि प्रशिक्षण प्रक्रियांना ही देखरेख लागू केली नव्हती. आमच्या नव्या देखरेख व्यवस्थेसह आम्ही आमचा दृष्टिकोन सुधारला आणि त्याची व्याप्ती वाढवली आहे.

ही नवी देखरेख व्यवस्था अनेक टप्प्यांची आहे. प्रत्येक नमुना टोकनवर चालणाऱ्या ॲक्टिव्हेशन वर्गीकारकांपासून, (म्हणजे मॉडेलच्या अंतर्गत ॲक्टिव्हिटी तपासणाऱ्या शोधकांपासून) ती सुरू होते आणि संभाव्य चिंताजनक बाबी अधिकाधिक प्रगत व मोठी संगणकीय क्षमता वापरणाऱ्या स्वयंचलित तपासकांकडे पाठवते. त्या प्रणाली अनधिकृत ॲक्सेस, माहितीची चोरी, विध्वंसक वर्तन आणि संरक्षणे निष्प्रभ करण्याचे प्रयत्न शोधण्यासाठी साधनांनी केलेल्या कृती, उपलब्ध रीझनिंग आणि सर्व हालचालींचा संपूर्ण क्रम तपासतात. आमच्या देखरेख प्रणालीद्वारे चिंताजनक हालचाल समोर आल्यानंतर 30 मिनिटांच्या आत इशारा देण्याचे आमचे उद्दिष्ट आहे. देखरेख प्रणालीला महत्त्वाच्या सुरक्षा सीमेचे संभाव्य उल्लंघन आढळल्यास, ती सर्वोच्च प्राधान्याचा इशारा तयार करते. आमच्या सध्याच्या अंमलबजावणीत सुरक्षा, संरक्षण आणि संशोधन पथकांना तातडीची सूचना पाठवली जाते. हा इशारा चुकीचा आहे, असे ती पथके 30 मिनिटांत निर्णायकपणे ठरवू शकली नाहीत, तर त्यांनी ती हालचाल थांबवणे अपेक्षित आहे.

Sol इतकी किंवा त्यापेक्षा अधिक क्षमता असलेल्या मॉडेलसाठी साधनांचा समावेश असलेल्या सर्व RL प्रशिक्षण आणि मूल्यमापनात ही देखरेख अनिवार्य आहे. 7 ऑगस्ट रोजी Astra मध्ये महत्त्वपूर्ण सायबर क्षमता असू शकतात, असे आम्ही ठरवल्यानंतर, साधनांचा वापर करणाऱ्या Astra च्या सर्व अनुमानांसाठी, केवळ RL प्रशिक्षण आणि मूल्यमापनासाठी नव्हे, आम्ही अतिरिक्त देखरेख अनिवार्य केली.

या संरक्षणांसाठी मोठ्या प्रमाणात संगणकीय क्षमता आवश्यक आहे. आमच्या सध्याच्या अंदाजानुसार देखरेखीसाठी होणारा अतिरिक्त संगणकीय वापर हा देखरेखीखालील अनुमानासाठी लागणाऱ्या संगणकीय वापराच्या सुमारे 20% आहे. मात्र प्रशिक्षण आणि मूल्यमापनाच्या कार्यभारानुसार हा खर्च मोठ्या प्रमाणात बदलतो. लवकरच प्रकाशित होणाऱ्या ब्लॉग लेखात आम्ही या प्रणालीबद्दल अधिक तपशील शेअर करू.

सुसंरेखन संशोधनात प्रगती

सुसंरेखन संशोधन आमच्या ध्येयाच्या केंद्रस्थानी आहे. आर्टिफिशियल जनरल इंटेलिजन्सचा लाभ संपूर्ण मानवजातीला मिळेल, हे सुनिश्चित करणे आमचे ध्येय आहे. मॉडेलना सायबर हल्ला करण्यासारख्या प्रगत क्षमता मिळत असताना आणि ती अधिक जटिल वातावरणांत कार्यरत होत असताना, रिवॉर्ड हॅकिंग (अपेक्षित परिणाम प्रत्यक्षात साध्य न करता प्रशिक्षणात मोठे बक्षीस मिळवण्याचे मार्ग शोधणे), फसवणूक किंवा अनधिकृत ॲक्सेस यांसारख्या विसंगत वर्तनामुळे अधिकाधिक गंभीर जोखीम निर्माण होईल.

सर्वाधिक सक्षम मॉडेलवरील RL प्रक्रियांसाठी आता आम्ही प्रशिक्षण प्रक्रियेच्या अधिक टप्प्यांवर आमची मुख्य सुसंरेखन तंत्रे लागू करत आहोत. यामध्ये विविध कार्ये आणि वातावरणांतील असुरक्षित वर्तन अधिक चांगल्या प्रकारे शोधून त्याला परावृत्त करण्यासाठी रिवॉर्ड मॉडेल सुधारणे, मॉडेलना त्यांच्या कृती, क्षमता आणि मर्यादांबद्दल अधिक प्रामाणिक राहण्याचे प्रशिक्षण देणे आणि रिवॉर्ड, मूल्यांकनकर्ते, साधने किंवा देखरेखीतील कमकुवतपणाचा गैरफायदा घेणारे वर्तन कमी करणे यांचा समावेश आहे. मॉडेल बाह्य प्रणाली किंवा संसाधनांशी संवाद साधताना हानी पोहोचवू शकणाऱ्या वर्तनासाठीही आम्ही प्रशिक्षणाची व्याप्ती वाढवत आहोत.

सुसंरेखन संशोधनात मोठी गुंतवणूक करणे, मूल्यमापनाची व्याप्ती वाढवणे आणि मिळालेल्या ज्ञानाचा प्रशिक्षण व संरक्षणांसाठी उपयोग करणे आम्ही सुरू ठेवत आहोत. मॉडेलच्या वर्तनाबद्दल आम्ही काय शिकत आहोत आणि आम्हाला कोणतीही नवी आव्हाने आढळत आहेत का, यांसह आमच्या सुसंरेखन संशोधनाबद्दल नजीकच्या भविष्यात बरीच अधिक माहिती सामायिक करण्याची आमची योजना आहे.

पुढे काय

प्रशिक्षण आणि तैनातीदरम्यान ही संरक्षणे एकत्र आणण्यासाठी तसेच भविष्यातील मॉडेलच्या क्षमता आणि ती कार्यरत असलेल्या वातावरणांचे अधिक अचूक प्रतिबिंब दाखवण्यासाठी आम्ही आमचे प्रिपेयर्डनेस फ्रेमवर्क विकसित करू. त्या क्षमतांनुसार विस्तारू शकणाऱ्या पद्धती विकसित करण्यासाठी मॉडेलच्या साहाय्याने चालणाऱ्या सुरक्षेत सातत्यपूर्ण गुंतवणूक, अधिक प्रभावी देखरेख आणि सुसंरेखन संशोधनातील निरंतर प्रगती आवश्यक असेल. आमचा दृष्टिकोन विकसित होत असताना बाह्य संस्थांना सहभागी करून घेण्याचा आणि आम्ही शिकत असलेली अधिक माहिती सामायिक करण्याचा आमचा मानस आहे.

अत्याधुनिक मॉडेलच्या क्षमता झपाट्याने वाढत आहेत. त्यांना समजून घेण्याची, सुसंरेखित करण्याची आणि सुरक्षित ठेवण्याची आमची क्षमता त्यापेक्षा पुढे राहिली पाहिजे.


*येत्या काही आठवड्यांत आम्ही आमच्या निष्कर्षांचा तांत्रिक अहवाल प्रकाशित करू.