स्किप करके मेन कंटेंट पर जाऍं
OpenAI

21 जुलाई 2026

सिक्योरिटी

मॉडल मूल्यांकन के दौरान सुरक्षा घटना पर OpenAI और Hugging Face की साझेदारी

लोड किया जा रहा है...

हम बाहरी सलाहकारों के साथ और सेफ़्टी कमेटी की निगरानी में एक गहन समीक्षा कर रहे हैं. समीक्षा पूरी हो जाने के बाद, हम आने वाले सप्ताहों में अपनी सीखी गई बातों पर एक तकनीकी रिपोर्ट प्रकाशित करेंगे.

28 जुलाई, 2026 का अपडेट:

  • आगामी रिलीज़ के लिए नियोजित कोई भी मॉडल Hugging Face का दुरुपयोग करने में शामिल नहीं था. हमारे ब्लॉग पोस्ट में उल्लेखित प्री-रिलीज़ मॉडल केवल आंतरिक उपयोग के लिए बनाया गया एक शोध प्रोटोटाइप है और इसे कभी भी सार्वजनिक रूप से रिलीज़ करने का इरादा नहीं था. घटना के बाद, हमने इसे निष्क्रिय कर दिया, एन्क्रिप्ट किया, और शोध संबंधी पहुँच से प्रतिबंधित कर दिया.

  • ExploitGym मूल्यांकन परिवेश ने मॉडलों को सीधा इंटरनेट एक्सेस प्रदान नहीं किया. इंटरनेट एक्सेस पाने के लिए, मॉडल ने Artifactory(एक नई विंडो में खुलेगा), जो एक पैकेज रजिस्ट्री कैश प्रॉक्सी है, में पहले से अज्ञात ज़ीरो-डे भेद्यता की पहचान की और उसका उपयोग किया. हमने इस भेद्यता के साथ-साथ हमारी समीक्षा के दौरान हमारे मॉडल द्वारा पहचानी गई अन्य Artifactory भेद्यताओं को विक्रेता को सूचित किया. 

  • हमारी समीक्षा जारी रहने के साथ-साथ, हम Hugging Face के साथ सहयोग करना जारी रखे हुए हैं, जिसमें उनके घटना-पश्चात विश्लेषण(एक नई विंडो में खुलेगा) में योगदान देना भी शामिल है. हमने उन्हें अपने Trusted Access for Cyber Program में भी शामिल किया है. 

  • अब तक की हमारी समीक्षा के आधार पर, हमने Hugging Face से संबंधित साझा की गई घटना—जिसमें प्लेटफ़ॉर्म-स्तरीय सेंध शामिल थी—के बराबर गंभीरता या पैमाने की किसी अन्य गतिविधि की पहचान नहीं की है.

  • Hugging Face में घुसपैठ और हमारे मॉडल की व्यापक गतिविधि की हमारी जारी समीक्षा में, हमें कुछ कम संख्या में ऐसे मामले मिल रहे हैं जहाँ मॉडल ने सार्वजनिक रूप से उपलब्ध अन्य सेवाओं पर खाता-स्तर पर सार्वजनिक रूप से उजागर प्रमाण-पत्रों की पहचान की और उनका उपयोग किया. इसमें Hugging Face इंसीडेंट के तहत चार सर्विसेज़ पर चार अकाउंट्स (और अन्य इवैल्यूएशंस के तहत एक्सेस किए गए कुछ अकाउंट्स) शामिल हैं. इन चार अकाउंट्स में से एक का उपयोग आउटबाउंड रिले और स्टेजिंग पथ के रूप में किया गया था, और दूसरे खाते का उपयोग डेटा संग्रहण के लिए किया गया था. शेष दो अकाउंट्स को मॉडल द्वारा केवल पढ़ने के तरीके से एक्सेस किया गया था, और Hugging Face को समझौता करने के उद्देश्य से उनका उपयोग नहीं किया गया था. हम सेवा स्वामियों को सीधे सूचित करना जारी रखेंगे, और हमें इन प्रदाताओं या उनकी सेवाओं पर मौजूद अन्य अकाउंट्स पर व्यापक प्रभाव का कोई साक्ष्य नहीं मिला है.

  • मॉडल ने इसके अतिरिक्त सार्वजनिक रूप से उपलब्ध कई सेवाओं का उपयोग किया, जिनमें कोड पेस्ट वेबसाइटें, अनुरोध कैप्चर सेवाएँ, स्क्रीनशॉट सेवाएँ, और अन्य वेब उपयोगिताएँ शामिल थीं. इन मामलों में प्लेटफ़ॉर्म या अकाउंट स्तर पर कोई कॉम्प्रोमाइज़ नहीं हुआ था. 

  • हम लगातार अधिक सक्षम होती जा रही एआई प्रणालियों से उत्पन्न जोखिमों की पहचान करने और उनके लिए तैयारी करने की अपनी ज़िम्मेदारी को गंभीरता से लेते हैं. एक बार जब हम अपनी समीक्षा पूरी कर लेंगे, तो हम अपने प्रिपेयर्डनेस फ़्रेमवर्क के अंतर्गत सुरक्षा एवं सुरक्षा समिति और सुरक्षा सलाहकार समूह के साथ इसकी समीक्षा करेंगे.


पिछले सप्ताह, Hugging Face ने एक AI एजेंट का पता लगाकर उसे रोका, जिसने उनके इन्फ्रास्ट्रक्चर से समझौता किया था, और इसके बाद उन्होंने एक नए प्रकार की सुरक्षा घटना का खुलासा किया(एक नई विंडो में खुलेगा); हमारा मानना है कि साइबर रूप से बढ़ती क्षमता वाले मॉडल के प्रसार के साथ ऐसी घटनाएं अधिक आम होंगी. जांच के बाद अब हमें पता है कि यह विशेष घटना OpenAI मॉडल के संयोजन से हुई थी — जिनमें GPT‑5.6 Sol और एक और भी सक्षम प्री-रिलीज़ मॉडल शामिल था, सभी में मूल्यांकन उद्देश्यों के लिए साइबर अस्वीकरण कम किए गए थे — और यह साइबर क्षमताओं के एक बेंचमार्क(एक नई विंडो में खुलेगा) पर आंतरिक परीक्षण के दौरान हुई.

हम इस घटना को एक अभूतपूर्व साइबर घटना मानते हैं, जिसमें अत्याधुनिक साइबर क्षमताएं शामिल थीं, और उसी के अनुरूप प्रतिक्रिया दे रहे हैं. हम इस चरण में शुरुआती निष्कर्ष साझा कर रहे हैं ताकि रक्षक समझ सकें कि क्या हुआ और यह आकलन कर सकें कि मॉडल अब क्या करने में सक्षम हैं. हम Hugging Face के साथ मिलकर गहन जांच जारी रखेंगे और जांच पूरी होने पर कमजोरियों, घटना और निष्कर्षों के बारे में अधिक जानकारी साझा करेंगे.

इस घटना के दौरान क्या हुआ

यह घटना एक आंतरिक मूल्यांकन के दौरान हुई, जिसमें मॉडल को अपनी साइबर क्षमताओं को मापने के प्रयास में जटिल हमले के रास्तों का उपयोग कर उन्नत शोषण करने के लिए प्रेरित किया जाता है. हम यह मूल्यांकन उन प्रोडक्शन क्लासिफायर के बिना चलाकर अधिकतम साइबर क्षमताओं का अनुमान लगाते हैं, जिनका उपयोग मॉडल को उच्च-जोखिम वाली साइबर गतिविधि करने से रोकने के लिए किया जाता है. हमारे बेंचमार्क अत्यधिक पृथक वातावरण में चलते हैं, जहां नेटवर्क एक्सेस केवल आंतरिक रूप से होस्ट किए गए थर्ड-पार्टी सॉफ़्टवेयर के माध्यम से पैकेज इंस्टॉल करने की क्षमता तक सीमित होता है, जो पैकेज रजिस्ट्रियों के लिए प्रॉक्सी और कैश के रूप में काम करता है.

मॉडल ने OpenAI के अनुसंधान वातावरण और Hugging Face के प्रोडक्शन इन्फ्रास्ट्रक्चर में कमजोरियों की पहचान की और उन्हें जोड़कर, Hugging Face के प्रोडक्शन डेटाबेस से सीधे परीक्षण समाधान प्राप्त किए. सभी साक्ष्य बताते हैं कि मॉडल ExploitGym का समाधान खोजने पर अत्यधिक केंद्रित थे और एक काफी संकीर्ण परीक्षण लक्ष्य हासिल करने के लिए चरम सीमा तक गए.

हमारे सैंडबॉक्स्ड परीक्षण वातावरण में काम करते हुए, हमारे मॉडल ने मूल्यांकन समस्या हल करने के प्रयास में खुले इंटरनेट एक्सेस का तरीका खोजने पर काफी इन्फरेंस कंप्यूट खर्च किया. एक्सेस पाने के लिए, मॉडल ने पैकेज रजिस्ट्री कैश प्रॉक्सी में एक ज़ीरो-डे कमजोरी की पहचान की और उसका फायदा उठाया, जिसका खुलासा हमने अब विक्रेता को ज़िम्मेदारी से कर दिया है. इस एक्सेस के साथ, हमारे मॉडल ने हमारे अनुसंधान परीक्षण वातावरण में प्रिविलेज एस्केलेशन और लैटरल मूवमेंट की कई कार्रवाइयां कीं, जब तक कि मॉडल इंटरनेट एक्सेस वाले एक नोड तक नहीं पहुंच गए.

इंटरनेट एक्सेस मिलने के बाद, मॉडल ने अनुमान लगाया कि Hugging Face संभवतः ExploitGym के लिए मॉडल, डेटासेट और समाधान होस्ट करता है. यह जानकर, मॉडल ने ऐसी गुप्त जानकारी तक पहुंच पाने के तरीके खोजे और सफलतापूर्वक पाए, जिसका उपयोग वह मूल्यांकन में धोखा देने के लिए कर सकता था. एक उदाहरण में, मॉडल ने कई हमले के वेक्टरों को जोड़ा, जिनमें चोरी किए गए क्रेडेंशियल और ज़ीरो-डे कमजोरियों का उपयोग करके Hugging Face सर्वरों पर रिमोट कोड एक्ज़ीक्यूशन का रास्ता खोजना शामिल था. OpenAI की सुरक्षा टीम ने इस असामान्य गतिविधि का आंतरिक रूप से पता लगाया.

जब हमारी टीमें जुड़ीं, तब तक Hugging Face की सुरक्षा टीम और एजेंटों ने अपने इन्फ्रास्ट्रक्चर पर इस गतिविधि का पता लगाकर उसे रोक दिया था और अपने ही ओपन-सोर्स मॉडल के साथ कंटेनमेंट और फॉरेंसिक पुनर्निर्माण शुरू कर दिया था. हम इस घटना की जांच जारी रखने के लिए उनके साथ सक्रिय रूप से काम कर रहे हैं. हम जांच और सुधार पर Hugging Face के तेज़ और घनिष्ठ सहयोग के लिए आभारी हैं.

हम अभी जो कदम उठा रहे हैं

  1. जांच के हिस्से के रूप में, कमजोरियों को पैच किए जाने तक हम अनुसंधान की गति की कीमत पर इन्फ्रास्ट्रक्चर कॉन्फ़िगरेशन में सख्त नियंत्रण लागू कर रहे हैं. हम इन नियंत्रणों और उनके प्रभाव के बारे में अपनी Safety and Security Committee को नियमित रूप से जानकारी दे रहे हैं.

  2. हम इस घटना की फॉरेंसिक जांच के लिए Hugging Face के साथ काम कर रहे हैं.

  3. हमने आंतरिक रूप से होस्ट किए गए थर्ड-पार्टी सॉफ़्टवेयर में पहचानी गई ज़ीरो-डे कमजोरी का ज़िम्मेदारी से खुलासा किया है और उसे पैच करने के लिए उनके साथ काम कर रहे हैं.

  4. हमने Hugging Face को विश्वसनीय एक्सेस प्रोग्राम में शामिल किया है और उनकी टीमों को अपने बचाव बेहतर बनाने के लिए हमारे मॉडल की क्षमताओं का तेज़ी से उपयोग करने में सहायता कर रहे हैं.

  5. हम भविष्य के प्रशिक्षण और मूल्यांकनों के लिए सुरक्षा को बेहतर और अधिक मजबूत बना रहे हैं. इस सप्ताह हमने लंबी अवधि वाले मॉडल के दौर में सुरक्षा और अलाइनमेंट बेहतर बनाने पर एक ब्लॉग प्रकाशित किया. इस मूल्यांकन के दौरान इन डिप्लॉयमेंट सुरक्षा उपायों को जानबूझकर सक्षम नहीं किया गया था, क्योंकि इसका उद्देश्य साइबर कमजोरियों की जांच करना था. यह घटना दिखाती है कि हमारे मॉडल के अलाइनमेंट, मूल्यांकन के समय साइबर सुरक्षा उपायों और आंतरिक परीक्षण के दौरान निगरानी को और मजबूत करने की आवश्यकता है.

उन्नत साइबर क्षमताओं के मूल्यांकन के प्रति हमारा दृष्टिकोण

जैसा कि हमने हाल ही में साझा किया, AI कमजोरियों की खोज और उनके दुरुपयोग को तेज़ कर रहा है. इस घटना से मुख्य सीख यह है कि मॉडल की सुरक्षा और सेफ़्टी को तेज़ी से बढ़ती क्षमताओं के साथ कदम मिलाकर चलना होगा. हम मॉडल विकास के दौरान इस्तेमाल किए जाने वाले कंटेनमेंट, निगरानी, एक्सेस नियंत्रण और मूल्यांकन प्रक्रियाओं को मजबूत कर रहे हैं.

UK AISI का मूल्यांकन दिखाता है कि GPT‑5.6 Sol जैसे मॉडल लंबे टाइम होराइज़न में जटिल, बहु-चरणीय साइबर ऑपरेशन लगातार चलाने में अधिक सक्षम हो रहे हैं. यह घटना संकेत देती है कि ये सैद्धांतिक क्षमताएं वास्तविक दुनिया की स्थितियों में लागू होती हैं.

UK AI Security Institute का चार्ट, जिसमें हालिया ओपन-वेट मॉडल और अत्याधुनिक मॉडल की तुलना लॉन्ग-होराइज़न साइबर रेंज पर की गई है.

यह घटना यह भी स्पष्ट करती है कि उन्नत मॉडल सोर्स-कोड एक्सेस के बिना वास्तविक दुनिया की प्रणालियों में नए हमले के रास्ते खोजकर उनका फायदा उठा सकते हैं. यह रेखांकित करती है कि उन्नत साइबर क्षमताओं को मजबूत सुरक्षा उपायों और रक्षात्मक टूल के साथ-साथ विकसित किया जाना चाहिए.

हम मानते हैं कि उन्नत साइबर-समर्थ मॉडल को सुरक्षा टीमों की मदद करनी चाहिए ताकि वे हमलावरों से पहले कमजोरियां खोज सकें, समझ सकें कि कमजोरियों को कैसे जोड़ा जा सकता है, और मशीन की गति से उनका समाधान कर सकें. हम इन क्षमताओं का उपयोग इन्फ्रास्ट्रक्चर कॉन्फ़िगरेशन और मॉडल मूल्यांकन वातावरणों के आसपास सुरक्षा को लगातार मजबूत करने के लिए कर रहे हैं; सीखने के साथ हम अपने निष्कर्ष और सर्वोत्तम प्रक्रियाएं साझा करेंगे. हम अन्य रक्षकों को विश्वसनीय एक्सेस के लिए आवेदन करने और इन मॉडल के साथ अभी प्रयोग करने के लिए प्रोत्साहित करते हैं, ताकि इन क्षमताओं को बेहतर रोकथाम, तेज़ पहचान और अधिक प्रभावी घटना प्रतिक्रिया में बदला जा सके.

“हम इस और अन्य विषयों पर OpenAI के साथ सहयोग के लिए आभारी हैं. यह घटना, संभवतः अपनी तरह की पहली, उस बात को साबित करती है जिस पर हम लंबे समय से विश्वास करते आए हैं: एआई सुरक्षा को गुप्त रूप से काम करने वाली कोई एक कंपनी अकेले हल नहीं कर सकती. इसे खुले तौर पर, सहयोगात्मक ढंग से, हर जगह हर रक्षक के लिए AI तक व्यापक पहुँच के साथ हल किया जाएगा.
—Clem Delangue, सह-संस्थापक और CEO, Hugging Face