Hugging Face घटना आणि विसंगत मॉडेलमुळे तृतीय पक्षांवर झालेले इतर परिणाम
AI बुद्धिमत्तेचे सिस्टम्स अधिक सक्षम आणि स्वायत्त होत असताना, त्यांचे विसंगत वर्तन सायबरसुरक्षा घटना आणि डेव्हलपर्सना अपेक्षित नसलेले इतर परिणाम यांसह प्रत्यक्ष जगात गंभीर परिणाम करणाऱ्या कृतींमध्ये रूपांतरित होऊ शकते. त्यामुळे हे वर्तन कसे उद्भवते, कसे तीव्र होते आणि ते ओळखून त्याला प्रतिसाद कसा द्यायचा, हे समजून घेणे प्रगत AI सिस्टम्स सुरक्षितपणे तयार व डिप्लॉय करण्यासाठी अधिकाधिक महत्त्वाचे ठरत आहे.
सुरुवातीला आम्ही Hugging Face घटनेकडे प्रामुख्याने सुरक्षेचा प्रश्न म्हणून पाहिले, कारण त्यात प्लॅटफॉर्म-स्तरीय सुरक्षाभंग झाला होता. आमच्या मॉडेलमधून आजवर आढळलेली अशा प्रकारची ही सर्वांत गंभीर कृती आहे आणि ती प्रामुख्याने केवळ अंतर्गत वापरासाठी असलेल्या अत्यंत सक्षम संशोधन मॉडेलमुळे घडली. त्यानंतर आम्हाला समजले की Hugging Face तांत्रिक अहवालात नोंदवल्याप्रमाणे, कठीण टास्क्स सोडवण्यासाठी मॉडेल्सने विसंगत धोरणांचा अवलंब केल्यामुळे ही घुसखोरी झाली. सायबरसुरक्षा घटना हे त्या जोखमीचे एक रूप आहे. विसंगतीमुळे पारंपरिक सुरक्षा प्रकारांबाहेरील इतर अनपेक्षित किंवा चिंताजनक वर्तनही होऊ शकते, जसे आमच्या मॉडेलनी तृतीय पक्ष वेबसाइट्सवर पोस्ट करणे. याला आम्ही “एजंट स्पॅम” म्हणत आहोत. आणि आम्हाला या दोन्ही बाबी हाताळणे आवश्यक आहे.
आम्ही व्यापक कृतींचा आढावा सुरू ठेवला आहे. त्यात अधिक गंभीर घटनांना प्राधान्य देत एजंट स्पॅमसह कमी तीव्रतेच्या विसंगत कृतींचाही आढावा घेत आहोत.
या पेजवर Hugging Face घटना, संबंधित संशोधन व सार्वजनिक प्रेझेंटेशन्स, आम्ही ओळखलेल्या अतिरिक्त कृती, मॉडेलमधील विसंगतीच्या भूमिकेबद्दल मिळालेले धडे आणि आमच्या सिस्टम्सना अधिक बळकट करण्यासाठी आम्ही करत असलेल्या उपाययोजनांविषयीचे अहवाल व अपडेट्स एकत्र दिले आहेत. आमचा तपास पुढे सरकेल तसतसे आम्ही या पेजला अपडेट करू.
तृतीय पक्षांवर परिणाम करणाऱ्या कृती
या अनपेक्षित वर्तनाची व्याप्ती अधिक चांगल्या प्रकारे समजून घेण्यासाठी, प्रशिक्षण आणि मूल्यमापनादरम्यान इंटरनेटवरील आमच्या मॉडेल्सच्या कृतींचा आम्ही व्यापक आढावा घेत आहोत. आमच्या आढाव्याचा भाग म्हणून आम्ही तृतीय पक्षांना टप्प्याटप्प्याने ओळखून सूचना देत आहोत. सुरुवात पुढील प्रकरणांपासून केली आहे:
आमच्या मॉडेल्सनी तृतीय पक्षाची सुरक्षा नियंत्रणे टाळली असण्याची किंवा ऑनलाइन सेवेच्या उपलब्धतेत अडथळा आणला असण्याची शक्यता आहे; किंवा
विसंगतीच्या प्रकरणांमुळे तृतीय पक्ष वेबसाइट्स किंवा सेवांवर नकारात्मक परिणाम झाला.
आजवरच्या आढाव्यानुसार, वरील निकष वापरून आम्ही अनेक तृतीय पक्षांना सूचना दिल्या आहेत. मागील कृतींचा आमचा आढावा सुरू असून त्यासाठी बराच वेळ आणि संसाधने लागतील. हे काम सुरू असताना आम्ही आणखी तृतीय पक्षांना सूचना देऊ.
आम्ही पाहिलेल्या विसंगत कृतींचे प्रकार स्पष्ट करण्यासाठी खाली निनावी सारांश प्रकाशित करत आहोत. आणखी तृतीय पक्षांना सूचना देताना आणि आमचे आकलन विकसित होत असताना आम्ही ही वर्णने अपडेट करू. याव्यतिरिक्त, आढाव्याच्या स्थितीशी संबंधित अपडेट्स आम्ही शेअर करू. बाधित पक्षांचे संरक्षण करण्यासाठी आवश्यक तेथे आम्ही सामान्यतः नावे आणि ओळख पटवणारे इतर तपशील वगळू. मात्र, माहिती मिळवणारे पक्ष त्यांना आम्ही पुरवलेली माहिती सार्वजनिकरीत्या शेअर करू शकतात.
आढळलेल्या कृतींचे सारांश
आजवरच्या आमच्या आढावा व सूचना प्रक्रियेत कृतींचे पुढील प्रकार आढळले आहेत:
ॲक्सेस नियंत्रणे टाळणे: एजंटने सामान्यतः ओळख तपासणी, विशिष्ट परवानगी, सदस्यता किंवा खाते आवश्यक असलेली माहिती अथवा वैशिष्ट्ये गाठली. उदाहरणार्थ, एजंटने वेगळा वेब पत्ता वापरला, विनंतीतील तपशील बदलले किंवा अपेक्षेपेक्षा अधिक ॲक्सेस देणाऱ्या लॉग इन सत्राचा आधार घेतला.
उघड झालेल्या क्रेडेन्शियल्सचा वापर: एजंटना सार्वजनिकरीत्या उपलब्ध केलेले लॉग इन तपशील किंवा ॲक्सेस कीज सापडल्या आणि त्यांनी त्या सेवा ॲक्सेस करण्यासाठी वापरल्या.
क्वेरी किंवा कमांड इंजेक्शन: एजंट्सने वेबसाइट किंवा सेवेमध्ये असा मजकूर प्रविष्ट केला, ज्याला सेवेने सामान्य इनपुट ऐवजी सूचना मानले. यामुळे सेवा तिच्या सर्व्हरवर डेटाबेस क्वेरी, ॲप्लिकेशन कोड किंवा कमांड चालवू शकते.
रनटाइमच्या अंतर्गत घटकांमध्ये ॲक्सेस: एजंट्सने सेवेच्या अंमलबजावणीशी संबंधित फाइल्स वाचल्या किंवा अंतर्गत वापरासाठी असलेल्या पार्श्वभूमी सिस्टमसोबत इंटरॅक्शन केली. या प्रकरणांत एजंट्सने सेवेतील त्याच्यासाठी निर्धारित ॲक्सेसच्या बाहेरील भागांत प्रवेश केला.
एजंट स्पॅम: एजंट तृतीय पक्ष वेबसाइट्सवर अशी माहिती टाकतात, ज्यामुळे तेथील माहिती बदलू शकते आणि स्वच्छता करावी लागू शकते. उदाहरणार्थ, सार्वजनिक विकी पेजेसचा शेअर केलेले मेसेज बोर्ड म्हणून वापर करणे.