स्किप करके मेन कंटेंट पर जाऍं
OpenAI

Hugging Face की घटना और असंरेखित मॉडलों से तीसरे पक्षों पर पड़े अन्य प्रभाव

जैसे-जैसे AI प्रणालियां अधिक सक्षम और स्वायत्त होती जाती हैं, उनका असंरेखित व्यवहार वास्तविक दुनिया में गंभीर परिणाम वाली कार्रवाइयों में बदल सकता है. इनमें साइबर सुरक्षा घटनाएं और ऐसे अन्य परिणाम शामिल हैं जिनका डेवलपरों ने अनुमान नहीं लगाया हो. इसलिए यह समझना कि ये व्यवहार कैसे उभरते और गंभीर होते हैं तथा इनका पता लगाकर इनसे कैसे निपटा जाए, उन्नत AI प्रणालियों को सुरक्षित ढंग से बनाने और लागू करने का लगातार अधिक महत्वपूर्ण हिस्सा बन रहा है.

शुरू में हमने Hugging Face की घटना को मुख्यतः सुरक्षा संबंधी समस्या माना था, क्योंकि इसमें पूरे मंच के स्तर पर सेंध लगी थी. हमारे मॉडल से जुड़ी इस तरह की अब तक पहचानी गई गतिविधियों में यह सबसे गंभीर है, और इसका मुख्य कारण केवल आंतरिक उपयोग वाला एक अत्यधिक सक्षम शोध मॉडल था. Hugging Face की तकनीकी रिपोर्ट में दर्ज विवरण से अब हम समझते हैं कि यह घुसपैठ कठिन कार्यों को हल करने के लिए मॉडलों द्वारा असंरेखित रणनीतियां अपनाने के कारण हुई थी. साइबर सुरक्षा घटनाएं इस जोखिम का एक रूप हैं. असंरेखण से ऐसे अन्य अप्रत्याशित या चिंताजनक व्यवहार भी हो सकते हैं जो पारंपरिक सुरक्षा श्रेणियों से बाहर हैं, जैसे हमारे मॉडलों का तीसरे पक्ष की साइटों पर सामग्री पोस्ट करना. हम इसे “एजेंट स्पैम” कह रहे हैं. हमें दोनों समस्याओं से निपटना होगा.

हमने व्यापक गतिविधियों की समीक्षा जारी रखी है. इसमें अधिक गंभीर घटनाओं को प्राथमिकता देने के साथ एजेंट स्पैम समेत कम गंभीर असंरेखित गतिविधियों तक समीक्षा का दायरा बढ़ाया गया है.

इस पृष्ठ पर Hugging Face की घटना से जुड़ी हमारी रिपोर्ट और नवीनतम जानकारी, संबंधित शोध और सार्वजनिक प्रस्तुतियां, हमारी पहचानी गई अन्य गतिविधियां, मॉडल असंरेखण की भूमिका से मिली सीख तथा अपनी प्रणालियां मजबूत करने के लिए उठाए जा रहे कदम एक साथ दिए गए हैं. जांच आगे बढ़ने के साथ हम इस पृष्ठ को अद्यतन करेंगे.


तीसरे पक्षों को प्रभावित करने वाली गतिविधि

इन अप्रत्याशित व्यवहारों का दायरा बेहतर ढंग से समझने के लिए हम प्रशिक्षण और मूल्यांकन के दौरान इंटरनेट पर अपने मॉडलों की गतिविधियों की व्यापक समीक्षा कर रहे हैं. अपनी समीक्षा के तहत हम लगातार तीसरे पक्षों की पहचान कर उन्हें सूचित कर रहे हैं. शुरुआत उन मामलों से की गई है जहां:

  • हमारे मॉडलों ने किसी तीसरे पक्ष के सुरक्षा नियंत्रणों को दरकिनार किया हो या किसी ऑनलाइन सेवा की उपलब्धता बाधित की हो; अथवा

  • असंरेखण के मामलों ने तीसरे पक्ष की वेबसाइटों या सेवाओं पर नकारात्मक प्रभाव डाला हो.

अब तक की समीक्षा के आधार पर हमने उपर्युक्त मानदंडों के अनुसार दर्जनों तीसरे पक्षों को सूचित किया है. पिछली गतिविधियों की हमारी समीक्षा जारी है और इसमें काफी समय तथा संसाधन लगेंगे. यह कार्य जारी रहने के साथ हम अन्य तीसरे पक्षों को भी सूचित करेंगे.

नीचे हम देखी गई असंरेखित गतिविधियों के प्रकार बताने के लिए अनाम सारांश प्रकाशित कर रहे हैं. अतिरिक्त तीसरे पक्षों को सूचित करने और अपनी समझ विकसित होने के साथ हम इन विवरणों को अद्यतन करेंगे. इसके अतिरिक्त, हम समीक्षा की स्थिति से संबंधित नवीनतम जानकारी साझा करेंगे. प्रभावित पक्षों की सुरक्षा के लिए जहां आवश्यक होगा, हम आम तौर पर नाम और पहचान बताने वाले अन्य विवरण शामिल नहीं करेंगे. हालांकि, सूचित पक्ष हमारे द्वारा दी गई जानकारी सार्वजनिक रूप से साझा करने का विकल्प चुन सकते हैं.

देखी गई गतिविधियों का सारांश

हमारी अब तक की समीक्षा और सूचना प्रक्रिया ने गतिविधियों की निम्नलिखित श्रेणियां पहचानी हैं:

  • पहुंच नियंत्रण को दरकिनार करना: एजेंट ऐसी जानकारी या सुविधाओं तक पहुंच जाते हैं जिनके लिए सामान्यतः पहचान सत्यापन, विशिष्ट अनुमति, सदस्यता या खाता आवश्यक होता है. उदाहरण के लिए, किसी एजेंट ने अलग वेब पता इस्तेमाल किया, अनुरोध में विवरण बदले या ऐसे प्रवेश सत्र का सहारा लिया जिसने अपेक्षा से अधिक पहुंच दी.

  • उजागर परिचय-पत्रों का उपयोग: एजेंटों ने सार्वजनिक रूप से उपलब्ध कराए गए प्रवेश विवरण या पहुंच कुंजियां खोजीं और उनका उपयोग किसी सेवा तक पहुंचने के लिए किया.

  • क्वेरी या कमांड अंतःक्षेपण: एजेंटों ने किसी वेबसाइट या सेवा में ऐसा पाठ डाला जिसे सेवा ने सामान्य इनपुट के बजाय निर्देश माना. इससे सेवा अपने सर्वर पर डेटाबेस क्वेरी, अनुप्रयोग कोड या कोई कमांड चला सकती थी.

  • निष्पादन-कालीन आंतरिक हिस्सों तक पहुंच: एजेंटों ने किसी सेवा के क्रियान्वयन वाली फ़ाइलें पढ़ीं या आंतरिक उपयोग के लिए बनी पृष्ठभूमि प्रणाली से संपर्क किया. इन मामलों में एजेंट सेवा के उन हिस्सों तक पहुंच गया जो उसके लिए निर्धारित पहुंच से बाहर थे.

  • एजेंट स्पैम: एजेंट तीसरे पक्ष की साइटों पर ऐसी जानकारी पोस्ट करते हैं जो वहां मौजूद जानकारी बदल सकती है और जिसे हटाना पड़ सकता है. उदाहरण के लिए, सार्वजनिक विकी पृष्ठों का साझा संदेश बोर्ड के रूप में उपयोग करना.


घटनाक्रम

सितंबर

अगस्त

जुलाई