मॉडल-डिस्टिलेशन के समन्वित अभियान को रोकना
हमने हाल ही में अपने मॉडलों से संरक्षित रीज़निंग निकालने के उद्देश्य से चलाए जा रहे एक समन्वित अभियान की पहचान कर उसे रोक दिया. इससे जुड़ी गतिविधि पहली बार जुलाई के पहले सप्ताह में देखी गई थी. यह गतिविधि दुर्भावनापूर्ण डिस्टिलेशन से मेल खाती है: यानी किसी दूसरे मॉडल को प्रशिक्षित करने, उसकी क्षमताएँ दोहराने या उसे बेहतर बनाने के लिए एक मॉडल के परिणामों या रीज़निंग का व्यवस्थित और अनधिकृत इस्तेमाल. संरक्षित रीज़निंग, किसी कार्य को हल करने की प्रक्रिया का मॉडल का आंतरिक रिकॉर्ड है. इसे निकालने से ऐसी जानकारी सामने आ सकती है जो अंतिम उत्तर में नहीं दी गई हो, और दूसरों को मॉडल की क्षमताएँ दोहराने में मदद मिल सकती है.
अभियान चलाने वालों ने न तो हमारा एन्क्रिप्शन तोड़ा, न किसी डेटाबेस में सेंध लगाई और न ही उपयोगकर्ताओं की सहेजी गई बातचीत तक सीधे पहुँच हासिल की. इसके बजाय, उन्होंने मॉडल के साथ बातचीत में हेरफेर किया, ताकि संरक्षित रीज़निंग को ऐसे रूपों में दोहराया जा सके जो अनुरोध करने वाले को दिखाई दें. यह काम समन्वित ढंग से बड़े पैमाने पर किया गया और इससे हमारी सेवा की शर्तों का उल्लंघन हुआ. इस हेरफेर में इस्तेमाल की गई कमज़ोरी केवल OpenAI के मॉडलों तक सीमित नहीं है. दुर्भावनापूर्ण डिस्टिलेशन के विरुद्ध सामूहिक बचाव मज़बूत करने के लिए हमने फ़्रंटियर मॉडल फ़ोरम के माध्यम से उद्योग के साझेदारों के साथ इसकी जानकारी साझा की है.
यह जानकारी प्रकाशित करने से पहले हमने अभियान के दायरे और संभावित प्रभाव की जाँच की, अपने स्तर पर बचाव के उपाय लागू किए, और शोधकर्ताओं व उद्योग के साझेदारों के साथ जानकारी साझा करके उनकी प्रतिक्रिया ली, ताकि इस तरह के हमलों से सुरक्षा सुनिश्चित हो सके. बचाव के अतिरिक्त उपायों और जाँच पर काम जारी है. हमारा मानना है कि अब तक मिली जानकारी साझा करने से इस क्षेत्र से जुड़े अन्य लोगों और संगठनों को अपना बचाव मज़बूत करने में मदद मिलेगी.
हमने देखा कि अभियान चलाने वालों ने संरक्षित रीज़निंग निकालने के नए तरीके आज़माए. इनमें एक बातचीत से एन्क्रिप्टेड रीज़निंग की प्रतिलिपि लेकर दूसरी बातचीत में किसी मॉडल से उसे डिक्रिप्ट करने और छिपी हुई रीज़निंग को लिखकर दिखाने के लिए कहना भी शामिल था.
स्वतंत्र सुरक्षा शोधकर्ताओं(एक नई विंडो में खुलेगा) ने भी ज़िम्मेदार तरीके से जानकारी साझा करते हुए अलग-अलग मॉडलों के बीच उपयोग और बातचीत के कम्पैक्शन से जुड़ी कमज़ोरियों की ओर हमारा ध्यान दिलाया. हमने उनके निष्कर्षों की जाँच की और पुष्टि की कि उनके बताए तरीकों से वास्तव में हमला किया जा सकता था. उनके काम से हमें इस व्यापक श्रेणी के हमलों को समझने और बचाव के उपाय तेज़ी से लागू करने में मदद मिली.
यह गतिविधि 1 जुलाई को शुरू हुई और शुरुआती दौर में सीमित रही. फिर 24 और 25 जुलाई को हमने इसमें तेज़ उछाल देखा: 4,000 से अधिक उपयोगकर्ताओं ने जानकारी निकालने के एक संबंधित पैटर्न का इस्तेमाल करते हुए 16,000 अनुरोध1 किए. आगे की जाँच में 15,000 से अधिक उपयोगकर्ताओं के एक समूह में प्रॉम्प्ट के संबंधित पैटर्न वाली गतिविधि का पता चला, जिसे हमने 28 जुलाई तक पूरी तरह रोक दिया.
समय के साथ यह गतिविधि अपना रूप बदलती रही. इससे यह बात और स्पष्ट होती है कि दुर्भावनापूर्ण डिस्टिलेशन एक व्यापक सुरक्षा चुनौती है, जिसके लिए कई स्तरों वाले और परिस्थितियों के अनुसार ढलने वाले बचाव की ज़रूरत है.
यह स्पष्ट नहीं है कि संबंधित अवधि में हमने जिन लोगों को यह गतिविधि करते देखा, वे सभी किसी एक ही पक्ष से जुड़े थे या नहीं. हालाँकि, हमारे आकलन के अनुसार, इस गतिविधि का एक प्रमुख समूह कीमी के विकासकर्ता मूनशॉट एआई से जुड़े व्यक्तियों द्वारा संचालित था.
दुर्भावनापूर्ण डिस्टिलेशन से सुरक्षा और राष्ट्रीय सुरक्षा के लिए जोखिम पैदा होते हैं. निकाली गई रीज़निंग का इस्तेमाल किसी दूसरे मॉडल को प्रशिक्षित करने के लिए किया जा सकता है, बिना उन सुरक्षा उपायों को बनाए रखे जो मूल मॉडल के उपयोगकर्ताओं को दिखाए जाने वाले परिणामों पर लागू थे. बड़े पैमाने पर डिस्टिलेशन से उन्नत क्षमताओं का हस्तांतरण भी तेज़ हो सकता है, जबकि सुरक्षा में उतना ही निवेश करने की ज़रूरत नहीं पड़ती. जैसे-जैसे मॉडल ऐसे क्षेत्रों में क्षमताएँ हासिल करते हैं जिनका लाभकारी और हानिकारक, दोनों तरह से उपयोग हो सकता है, ये चिंताएँ और बढ़ जाती हैं.
यह जोखिम केवल OpenAI तक सीमित नहीं है. जैसा कि ऊपर बताया गया है, इसी तरह की तकनीकें अन्य उन्नत एआई प्रणालियों को भी प्रभावित कर सकती हैं. इसलिए यह एक साझा सुरक्षा चुनौती है, जिसके लिए पूरे उद्योग में समन्वय की ज़रूरत है.
हमने खातों पर कार्रवाई, तकनीकी नियंत्रणों और साझेदारों के साथ समन्वय के ज़रिए इस हालिया डिस्टिलेशन अभियान पर अंकुश लगाया. हमने धोखाधड़ी वाले खातों को प्रतिबंधित किया या उन पर पाबंदियाँ लगाईं, पंजीकरण और बुनियादी ढाँचे से जुड़े नियंत्रण मज़बूत किए, और संबंधित नेटवर्कों की निगरानी बढ़ाई.
हमने विभिन्न उपयोगकर्ताओं, कार्यस्थलों, संगठनों और मॉडल परिवारों में छिपी हुई रीज़निंग की सुरक्षा भी मज़बूत की. हमने वह रास्ता बंद किया जिससे किसी अन्य उपयोगकर्ता की एन्क्रिप्टेड रीज़निंग पहले से रखने वाला व्यक्ति उसे फिर से चलाकर उसकी सामग्री हासिल कर सकता था. साथ ही, हमने ऐसे जाँच तंत्र जोड़े जो क्रमशः भेजे जा रहे परिणामों में रीज़निंग उजागर करने वाली सामग्री का पता लगाकर उसे रोक सकें. जब संबंधित गतिविधि तृतीय-पक्ष सेवाओं के ज़रिए होने लगी, तो हमने उन सेवा प्रदाताओं के साथ मिलकर इसमें शामिल खातों की पहचान की और उनकी गतिविधि रोकी.
अंत में, हमने फ़्रंटियर मॉडल फ़ोरम और जानकारी साझा करने के उपयुक्त सरकारी माध्यमों से संबंधित निष्कर्ष साझा किए, ताकि अत्याधुनिक मॉडल बनाने वाले अन्य विकासकर्ता और सार्वजनिक क्षेत्र के साझेदार ऐसी गतिविधियों का पता लगा सकें और अपना बचाव मज़बूत कर सकें. जो प्रणालियाँ रीज़निंग के रिकॉर्ड को दूसरी जगह ले जाने या फिर से चलाने की सुविधा देती हैं, उन्हें भी ऐसे जोखिमों का सामना करना पड़ सकता है.
हमारा अनुमान है कि जैसे-जैसे अत्याधुनिक मॉडल बेहतर होंगे और उनकी क्षमताओं की नकल करने के सस्ते तरीके खोजे जाएँगे, दुर्भावनापूर्ण डिस्टिलेशन के प्रयास और परिष्कृत होते जाएँगे. इस गतिविधि से बचाव के लिए कई स्तरों वाले नियंत्रणों और लगातार बदलती परिस्थितियों के अनुसार ढलने की ज़रूरत है.
यह काम अभी पूरा नहीं हुआ है. साझेदारों के यहाँ संचालित प्रणालियों को भी वही सुरक्षा चाहिए जो सीधे हमारी ओर से दी जाने वाली सेवाओं को मिलती है. वहीं, उपकरणों से मिले परिणामों के ज़रिए होने वाले हमलों से बचाव के लिए ऐसे उपाय चाहिए जो सामान्य रूप से दिखाई देने वाले पाठ से आगे बढ़कर जाँच करें. हम उपकरणों की सुरक्षा, वर्गीकारकों की जाँच का दायरा और अनुचित अनुरोध ठुकराने की मॉडल की क्षमता बेहतर बना रहे हैं. साथ ही, क्लाउड साझेदारों के यहाँ भी संबंधित नियंत्रण लागू कर रहे हैं.
हमारे प्रयास आगे भी तीन क्षेत्रों पर केंद्रित रहेंगे: जानकारी निकालने से रोकने के लिए अधिक मज़बूत तकनीकी सुरक्षा, समन्वित अभियानों की बेहतर पहचान और उनके विरुद्ध कार्रवाई, तथा उद्योग और सरकार के बीच खतरों से जुड़ी जानकारी का अधिक व्यापक आदान-प्रदान.

