समन्वित मॉडेल-डिस्टिलेशन मोहिमेला अटकाव
आमच्या मॉडेलमधून संरक्षित रीझनिंग काढून घेण्यासाठी आखलेली एक समन्वित मोहीम आम्ही अलीकडेच शोधून तिला अटकाव केला. या मोहिमेतील सर्वात सुरुवातीच्या हालचाली जुलैच्या पहिल्या आठवड्यात आढळल्या. हे कृत्य दुर्भावनापूर्ण डिस्टिलेशनच्या स्वरूपाशी जुळते: म्हणजे दुसऱ्या मॉडेलला प्रशिक्षित करण्यासाठी, त्याची पुनर्निर्मिती करण्यासाठी किंवा त्यात सुधारणा करण्यासाठी एका मॉडेलचे प्रतिसाद किंवा रीझनिंग यांचा पद्धतशीर आणि अनधिकृत वापर करणे. संरक्षित रीझनिंग म्हणजे एखादे काम सोडवताना मॉडेलने केलेल्या प्रक्रियेची अंतर्गत नोंद. ती काढून घेतल्यास अंतिम उत्तरात न दिलेली माहिती उघड होऊ शकते आणि इतरांना मॉडेलच्या क्षमतांची पुनर्निर्मिती करण्यास मदत होऊ शकते.
ही मोहीम चालवणाऱ्यांनी आमचे कूटलेखन भेदले नाही, कोणत्याही डेटाबेसमध्ये घुसखोरी केली नाही किंवा साठवलेल्या वापरकर्ता संभाषणांमध्ये थेट प्रवेश मिळवला नाही. त्याऐवजी, त्यांनी मॉडेलशी होणाऱ्या संवादात फेरफार केला, जेणेकरून संरक्षित रीझनिंग विनंती करणाऱ्याला दिसेल अशा स्वरूपात पुन्हा सादर करता येईल. हे समन्वितपणे आणि मोठ्या प्रमाणावर केले गेले व त्यामुळे आमच्या सेवा अटींचे उल्लंघन झाले. अशा फेरफाराला वाव देणारी असुरक्षितता केवळ OpenAI च्या मॉडेलपुरती मर्यादित नाही. दुर्भावनापूर्ण डिस्टिलेशनविरुद्ध सामूहिक संरक्षण बळकट करण्यासाठी आम्ही फ्रंटियर मॉडेल फोरमच्या माध्यमातून उद्योगातील भागीदारांना याबद्दल माहिती दिली आहे.
ही माहिती प्रकाशित करण्यापूर्वी, आम्ही या प्रकाराची व्याप्ती आणि संभाव्य परिणाम तपासले व आमचे स्वतःचे प्रतिबंधात्मक उपाय लागू केले. अशा हल्ल्यांपासून संरक्षणाची व्यवस्था असल्याची खात्री करण्यासाठी आम्ही संशोधक आणि उद्योगातील भागीदारांना माहिती दिली व त्यांचा अभिप्रायही घेतला. अतिरिक्त प्रतिबंधात्मक उपाय आणि तपासाचे काम सुरू आहे. आम्हाला मिळालेली माहिती आता सामायिक केल्याने व्यापक परिसंस्थेला आपले संरक्षण बळकट करण्यास मदत होईल, असे आम्हाला वाटते.
ही मोहीम चालवणारे संरक्षित रीझनिंग काढून घेण्यासाठी नवीन मार्ग वापरत असल्याचे आम्हाला दिसले. यात एका संभाषणातील कूटलेखित रीझनिंगची प्रत घेऊन, दुसऱ्या संभाषणात मॉडेलला ते उलगडण्यास आणि त्यातील लपवलेला रीझनिंग मजकूर उतरवून देण्यास सांगण्याचाही समावेश होता.
स्वतंत्र सुरक्षा संशोधकांनीही(नवीन विंडोमध्ये उघडेल) जबाबदार प्रकटीकरणाच्या प्रक्रियेद्वारे विविध मॉडेलमधील परस्पर वापराशी आणि संभाषणांच्या कॉम्पॅक्शनशी संबंधित असुरक्षितता आमच्या निदर्शनास आणून दिल्या. आम्ही त्यांच्या निष्कर्षांचा तपास केला आणि त्यांनी शोधलेले हल्ल्याचे मार्ग प्रत्यक्षात अस्तित्वात असल्याची पुष्टी केली. त्यांच्या कामामुळे आम्हाला अशा हल्ल्यांचा व्यापक प्रकार समजून घेण्यास आणि प्रतिबंधात्मक उपायांना गती देण्यास मदत झाली.
या हालचाली 1 जुलै रोजी सुरू झाल्या आणि सुरुवातीला त्यांचे प्रमाण कमी होते. मात्र 24 आणि 25 जुलै रोजी त्यात मोठी वाढ आढळली: माहिती काढून घेण्याची संबंधित पद्धत वापरून 4,000 हून अधिक वापरकर्त्यांनी 16,000 विनंत्या1 केल्या. पुढील तपासात 15,000 हून अधिक वापरकर्त्यांच्या एका समूहात संबंधित प्रॉम्प्ट-पद्धतीचा वापर आढळला. आम्ही 28 जुलैपर्यंत या हालचालींना पूर्णपणे अटकाव केला.
काळानुसार या हालचालींचे स्वरूप बदलत गेले. यावरून पुन्हा स्पष्ट झाले की दुर्भावनापूर्ण डिस्टिलेशन हे एक व्यापक सुरक्षा आव्हान आहे आणि त्यासाठी बहुस्तरीय, परिस्थितीनुसार बदलणारे संरक्षण आवश्यक आहे.
संबंधित कालावधीत आम्हाला आढळलेल्या सर्व मोहिमाचालकांमागे एकच व्यक्ती किंवा संस्था होती का, हे स्पष्ट नाही. मात्र, या हालचालींतील एका मुख्य समूहाचा संबंध किमीची निर्माती असलेल्या मूनशॉट एआयशी संबंधित व्यक्तींशी असल्याचे आमचे आकलन आहे.
दुर्भावनापूर्ण डिस्टिलेशनमुळे सुरक्षिततेला आणि राष्ट्रीय सुरक्षेला धोके निर्माण होतात. मूळ मॉडेलच्या वापरकर्त्यांना दिसणाऱ्या प्रतिसादांवर लागू केलेले सुरक्षा उपाय कायम न ठेवता, काढून घेतलेल्या रीझनिंगचा वापर दुसऱ्या मॉडेलला प्रशिक्षित करण्यासाठी केला जाऊ शकतो. मोठ्या प्रमाणावर केल्या जाणाऱ्या डिस्टिलेशनमुळे सुरक्षिततेत तितकीच गुंतवणूक न करताही प्रगत क्षमतांचे हस्तांतरण वेगाने होऊ शकते. हितकारक आणि अपायकारक अशा दोन्ही हेतूंसाठी वापर होऊ शकणाऱ्या क्षेत्रांत मॉडेलच्या क्षमता वाढत असताना या चिंता अधिक तीव्र होतात.
हा धोका केवळ OpenAI पुरता मर्यादित नाही. वर नमूद केल्याप्रमाणे, अशाच तंत्रांचा इतर प्रगत कृत्रिम बुद्धिमत्ता प्रणालींवरही परिणाम होऊ शकतो. त्यामुळे हे एक सामायिक सुरक्षा आव्हान असून त्यासाठी संपूर्ण उद्योगात समन्वय आवश्यक आहे.
खात्यांवर नियमांनुसार कारवाई, तांत्रिक नियंत्रणे आणि भागीदारांशी समन्वय या उपायांचा एकत्रित वापर करून आम्ही अलीकडील या डिस्टिलेशन मोहिमेला आळा घातला. आम्ही फसवणूक करणाऱ्या खात्यांवर बंदी घातली किंवा निर्बंध लादले, नोंदणी आणि पायाभूत सुविधांवरील नियंत्रणे बळकट केली आणि संबंधित जाळ्यांवरील देखरेख वाढवली.
आम्ही वापरकर्ते, कार्यक्षेत्रे, संस्था आणि मॉडेल समूह या सर्व स्तरांवर लपवलेल्या रीझनिंगचे संरक्षणही बळकट केले. दुसऱ्या वापरकर्त्याचे कूटलेखित रीझनिंग आधीच ताब्यात असलेल्या व्यक्तीला ते पुन्हा सादर करून त्यातील मजकूर मिळवण्याचा एक मार्ग आम्ही बंद केला. तसेच, रीझनिंग उघड करू शकणारा प्रवाहित प्रतिसाद ओळखून रोखण्यासाठी तपासण्या जोडल्या. संबंधित हालचाली तृतीय-पक्ष सेवांमार्फत सुरू झाल्या तेव्हा, आम्ही त्या सेवा पुरवठादारांसोबत काम करून त्यात सहभागी खाती शोधली आणि त्यांना अटकाव केला.
शेवटी, आम्ही फ्रंटियर मॉडेल फोरम आणि माहितीच्या देवाणघेवाणीसाठी असलेल्या योग्य सरकारी माध्यमांतून संबंधित निष्कर्ष सामायिक केले. यामुळे अत्याधुनिक मॉडेलचे इतर विकासक आणि सार्वजनिक क्षेत्रातील भागीदारांना अशा हालचाली शोधता येतील आणि स्वतःचे संरक्षण बळकट करता येईल. इतरत्र नेता येणाऱ्या किंवा पुन्हा सादर करता येणाऱ्या रीझनिंग नोंदींना आधार देणाऱ्या प्रणालींनाही संबंधित धोके भेडसावू शकतात.
अत्याधुनिक मॉडेलमध्ये सुधारणा होत जातील आणि त्यांच्या क्षमतांचे अनुकरण करण्यासाठी संबंधित घटक स्वस्त मार्ग शोधतील, तसतसे दुर्भावनापूर्ण डिस्टिलेशनचे प्रयत्न अधिक प्रगत होतील, अशी आमची अपेक्षा आहे. या हालचालींपासून संरक्षण करण्यासाठी बहुस्तरीय नियंत्रणे आणि परिस्थितीनुसार सतत बदल आवश्यक आहेत.
हे काम अद्याप पूर्ण झालेले नाही. भागीदारांच्या प्रणालींवर चालणाऱ्या सेवांनाही थेट आमच्याकडून दिल्या जाणाऱ्या सेवांइतकेच संरक्षण आवश्यक आहे. तसेच, साधनांच्या प्रतिसादांद्वारे होणाऱ्या हल्ल्यांपासून संरक्षण करण्यासाठी केवळ नेहमीचा दृश्य मजकूर तपासणे पुरेसे नाही. आम्ही साधनांचे संरक्षण, वर्गीकरण प्रणालींच्या तपासणीची व्याप्ती आणि मॉडेलची नकार देण्याची क्षमता यांत सुधारणा करत आहोत. तसेच, क्लाउड भागीदारांमध्ये संबंधित नियंत्रणे लागू करत आहोत.
आमच्या उपाययोजनांचा भर यापुढेही तीन क्षेत्रांवर राहील: माहिती काढून घेण्याविरुद्ध अधिक भक्कम तांत्रिक संरक्षण, समन्वित मोहिमा अधिक प्रभावीपणे शोधून त्यांच्यावर कारवाई करणे, आणि उद्योग व सरकार यांच्यात धोक्यांविषयीच्या माहितीची अधिक सखोल देवाणघेवाण.

