मुख्य मजकूराकडे जा
OpenAI

३० सप्टेंबर, २०२६

सुरक्षा

समन्वित मॉडेल-डिस्टिलेशन मोहिमेला अटकाव

लोड होत आहे...

आमच्या मॉडेलमधून संरक्षित रीझनिंग काढून घेण्यासाठी आखलेली एक समन्वित मोहीम आम्ही अलीकडेच शोधून तिला अटकाव केला. या मोहिमेतील सर्वात सुरुवातीच्या हालचाली जुलैच्या पहिल्या आठवड्यात आढळल्या. हे कृत्य दुर्भावनापूर्ण डिस्टिलेशनच्या स्वरूपाशी जुळते: म्हणजे दुसऱ्या मॉडेलला प्रशिक्षित करण्यासाठी, त्याची पुनर्निर्मिती करण्यासाठी किंवा त्यात सुधारणा करण्यासाठी एका मॉडेलचे प्रतिसाद किंवा रीझनिंग यांचा पद्धतशीर आणि अनधिकृत वापर करणे. संरक्षित रीझनिंग म्हणजे एखादे काम सोडवताना मॉडेलने केलेल्या प्रक्रियेची अंतर्गत नोंद. ती काढून घेतल्यास अंतिम उत्तरात न दिलेली माहिती उघड होऊ शकते आणि इतरांना मॉडेलच्या क्षमतांची पुनर्निर्मिती करण्यास मदत होऊ शकते.

ही मोहीम चालवणाऱ्यांनी आमचे कूटलेखन भेदले नाही, कोणत्याही डेटाबेसमध्ये घुसखोरी केली नाही किंवा साठवलेल्या वापरकर्ता संभाषणांमध्ये थेट प्रवेश मिळवला नाही. त्याऐवजी, त्यांनी मॉडेलशी होणाऱ्या संवादात फेरफार केला, जेणेकरून संरक्षित रीझनिंग विनंती करणाऱ्याला दिसेल अशा स्वरूपात पुन्हा सादर करता येईल. हे समन्वितपणे आणि मोठ्या प्रमाणावर केले गेले व त्यामुळे आमच्या सेवा अटींचे उल्लंघन झाले. अशा फेरफाराला वाव देणारी असुरक्षितता केवळ OpenAI च्या मॉडेलपुरती मर्यादित नाही. दुर्भावनापूर्ण डिस्टिलेशनविरुद्ध सामूहिक संरक्षण बळकट करण्यासाठी आम्ही फ्रंटियर मॉडेल फोरमच्या माध्यमातून उद्योगातील भागीदारांना याबद्दल माहिती दिली आहे.

ही माहिती प्रकाशित करण्यापूर्वी, आम्ही या प्रकाराची व्याप्ती आणि संभाव्य परिणाम तपासले व आमचे स्वतःचे प्रतिबंधात्मक उपाय लागू केले. अशा हल्ल्यांपासून संरक्षणाची व्यवस्था असल्याची खात्री करण्यासाठी आम्ही संशोधक आणि उद्योगातील भागीदारांना माहिती दिली व त्यांचा अभिप्रायही घेतला. अतिरिक्त प्रतिबंधात्मक उपाय आणि तपासाचे काम सुरू आहे. आम्हाला मिळालेली माहिती आता सामायिक केल्याने व्यापक परिसंस्थेला आपले संरक्षण बळकट करण्यास मदत होईल, असे आम्हाला वाटते.

आम्हाला काय आढळले

ही मोहीम चालवणारे संरक्षित रीझनिंग काढून घेण्यासाठी नवीन मार्ग वापरत असल्याचे आम्हाला दिसले. यात एका संभाषणातील कूटलेखित रीझनिंगची प्रत घेऊन, दुसऱ्या संभाषणात मॉडेलला ते उलगडण्यास आणि त्यातील लपवलेला रीझनिंग मजकूर उतरवून देण्यास सांगण्याचाही समावेश होता.

स्वतंत्र सुरक्षा संशोधकांनीही⁠(नवीन विंडोमध्ये उघडेल) जबाबदार प्रकटीकरणाच्या प्रक्रियेद्वारे विविध मॉडेलमधील परस्पर वापराशी आणि संभाषणांच्या कॉम्पॅक्शनशी संबंधित असुरक्षितता आमच्या निदर्शनास आणून दिल्या. आम्ही त्यांच्या निष्कर्षांचा तपास केला आणि त्यांनी शोधलेले हल्ल्याचे मार्ग प्रत्यक्षात अस्तित्वात असल्याची पुष्टी केली. त्यांच्या कामामुळे आम्हाला अशा हल्ल्यांचा व्यापक प्रकार समजून घेण्यास आणि प्रतिबंधात्मक उपायांना गती देण्यास मदत झाली.

या हालचाली 1 जुलै रोजी सुरू झाल्या आणि सुरुवातीला त्यांचे प्रमाण कमी होते. मात्र 24 आणि 25 जुलै रोजी त्यात मोठी वाढ आढळली: माहिती काढून घेण्याची संबंधित पद्धत वापरून 4,000 हून अधिक वापरकर्त्यांनी 16,000 विनंत्या1 केल्या. पुढील तपासात 15,000 हून अधिक वापरकर्त्यांच्या एका समूहात संबंधित प्रॉम्प्ट-पद्धतीचा वापर आढळला. आम्ही 28 जुलैपर्यंत या हालचालींना पूर्णपणे अटकाव केला.

काळानुसार या हालचालींचे स्वरूप बदलत गेले. यावरून पुन्हा स्पष्ट झाले की दुर्भावनापूर्ण डिस्टिलेशन हे एक व्यापक सुरक्षा आव्हान आहे आणि त्यासाठी बहुस्तरीय, परिस्थितीनुसार बदलणारे संरक्षण आवश्यक आहे.

यामागे कोण होते याबाबत आमचे आकलन

संबंधित कालावधीत आम्हाला आढळलेल्या सर्व मोहिमाचालकांमागे एकच व्यक्ती किंवा संस्था होती का, हे स्पष्ट नाही. मात्र, या हालचालींतील एका मुख्य समूहाचा संबंध किमीची निर्माती असलेल्या मूनशॉट एआयशी संबंधित व्यक्तींशी असल्याचे आमचे आकलन आहे.

हे महत्त्वाचे का आहे

दुर्भावनापूर्ण डिस्टिलेशनमुळे सुरक्षिततेला आणि राष्ट्रीय सुरक्षेला धोके निर्माण होतात. मूळ मॉडेलच्या वापरकर्त्यांना दिसणाऱ्या प्रतिसादांवर लागू केलेले सुरक्षा उपाय कायम न ठेवता, काढून घेतलेल्या रीझनिंगचा वापर दुसऱ्या मॉडेलला प्रशिक्षित करण्यासाठी केला जाऊ शकतो. मोठ्या प्रमाणावर केल्या जाणाऱ्या डिस्टिलेशनमुळे सुरक्षिततेत तितकीच गुंतवणूक न करताही प्रगत क्षमतांचे हस्तांतरण वेगाने होऊ शकते. हितकारक आणि अपायकारक अशा दोन्ही हेतूंसाठी वापर होऊ शकणाऱ्या क्षेत्रांत मॉडेलच्या क्षमता वाढत असताना या चिंता अधिक तीव्र होतात.

हा धोका केवळ OpenAI पुरता मर्यादित नाही. वर नमूद केल्याप्रमाणे, अशाच तंत्रांचा इतर प्रगत कृत्रिम बुद्धिमत्ता प्रणालींवरही परिणाम होऊ शकतो. त्यामुळे हे एक सामायिक सुरक्षा आव्हान असून त्यासाठी संपूर्ण उद्योगात समन्वय आवश्यक आहे.

आम्ही कोणती पावले उचलली

खात्यांवर नियमांनुसार कारवाई, तांत्रिक नियंत्रणे आणि भागीदारांशी समन्वय या उपायांचा एकत्रित वापर करून आम्ही अलीकडील या डिस्टिलेशन मोहिमेला आळा घातला. आम्ही फसवणूक करणाऱ्या खात्यांवर बंदी घातली किंवा निर्बंध लादले, नोंदणी आणि पायाभूत सुविधांवरील नियंत्रणे बळकट केली आणि संबंधित जाळ्यांवरील देखरेख वाढवली.

आम्ही वापरकर्ते, कार्यक्षेत्रे, संस्था आणि मॉडेल समूह या सर्व स्तरांवर लपवलेल्या रीझनिंगचे संरक्षणही बळकट केले. दुसऱ्या वापरकर्त्याचे कूटलेखित रीझनिंग आधीच ताब्यात असलेल्या व्यक्तीला ते पुन्हा सादर करून त्यातील मजकूर मिळवण्याचा एक मार्ग आम्ही बंद केला. तसेच, रीझनिंग उघड करू शकणारा प्रवाहित प्रतिसाद ओळखून रोखण्यासाठी तपासण्या जोडल्या. संबंधित हालचाली तृतीय-पक्ष सेवांमार्फत सुरू झाल्या तेव्हा, आम्ही त्या सेवा पुरवठादारांसोबत काम करून त्यात सहभागी खाती शोधली आणि त्यांना अटकाव केला.

शेवटी, आम्ही फ्रंटियर मॉडेल फोरम आणि माहितीच्या देवाणघेवाणीसाठी असलेल्या योग्य सरकारी माध्यमांतून संबंधित निष्कर्ष सामायिक केले. यामुळे अत्याधुनिक मॉडेलचे इतर विकासक आणि सार्वजनिक क्षेत्रातील भागीदारांना अशा हालचाली शोधता येतील आणि स्वतःचे संरक्षण बळकट करता येईल. इतरत्र नेता येणाऱ्या किंवा पुन्हा सादर करता येणाऱ्या रीझनिंग नोंदींना आधार देणाऱ्या प्रणालींनाही संबंधित धोके भेडसावू शकतात.

पुढील वाटचाल

अत्याधुनिक मॉडेलमध्ये सुधारणा होत जातील आणि त्यांच्या क्षमतांचे अनुकरण करण्यासाठी संबंधित घटक स्वस्त मार्ग शोधतील, तसतसे दुर्भावनापूर्ण डिस्टिलेशनचे प्रयत्न अधिक प्रगत होतील, अशी आमची अपेक्षा आहे. या हालचालींपासून संरक्षण करण्यासाठी बहुस्तरीय नियंत्रणे आणि परिस्थितीनुसार सतत बदल आवश्यक आहेत.

हे काम अद्याप पूर्ण झालेले नाही. भागीदारांच्या प्रणालींवर चालणाऱ्या सेवांनाही थेट आमच्याकडून दिल्या जाणाऱ्या सेवांइतकेच संरक्षण आवश्यक आहे. तसेच, साधनांच्या प्रतिसादांद्वारे होणाऱ्या हल्ल्यांपासून संरक्षण करण्यासाठी केवळ नेहमीचा दृश्य मजकूर तपासणे पुरेसे नाही. आम्ही साधनांचे संरक्षण, वर्गीकरण प्रणालींच्या तपासणीची व्याप्ती आणि मॉडेलची नकार देण्याची क्षमता यांत सुधारणा करत आहोत. तसेच, क्लाउड भागीदारांमध्ये संबंधित नियंत्रणे लागू करत आहोत.

आमच्या उपाययोजनांचा भर यापुढेही तीन क्षेत्रांवर राहील: माहिती काढून घेण्याविरुद्ध अधिक भक्कम तांत्रिक संरक्षण, समन्वित मोहिमा अधिक प्रभावीपणे शोधून त्यांच्यावर कारवाई करणे, आणि उद्योग व सरकार यांच्यात धोक्यांविषयीच्या माहितीची अधिक सखोल देवाणघेवाण.

लेखक

OpenAI

तळटीपा

  1. 1

    हे आकडे माहिती काढून घेण्याच्या प्रयत्नांचे आहेत; ते प्रयत्न यशस्वी झालेच असे नाही.