स्किप करके मेन कंटेंट पर जाऍं
OpenAI

21 जुलाई 2026

सिक्योरिटी

मॉडल मूल्यांकन के दौरान सुरक्षा घटना पर OpenAI और Hugging Face की साझेदारी

लोड किया जा रहा है...

पिछले सप्ताह, Hugging Face ने एक AI एजेंट का पता लगाकर उसे रोका, जिसने उनके इन्फ्रास्ट्रक्चर से समझौता किया था, और इसके बाद उन्होंने एक नए प्रकार की सुरक्षा घटना का खुलासा किया(एक नई विंडो में खुलेगा); हमारा मानना है कि साइबर रूप से बढ़ती क्षमता वाले मॉडल के प्रसार के साथ ऐसी घटनाएं अधिक आम होंगी. जांच के बाद अब हमें पता है कि यह विशेष घटना OpenAI मॉडल के संयोजन से हुई थी — जिनमें GPT‑5.6 Sol और एक और भी सक्षम प्री-रिलीज़ मॉडल शामिल था, सभी में मूल्यांकन उद्देश्यों के लिए साइबर अस्वीकरण कम किए गए थे — और यह साइबर क्षमताओं के एक बेंचमार्क(एक नई विंडो में खुलेगा) पर आंतरिक परीक्षण के दौरान हुई.

हम इस घटना को एक अभूतपूर्व साइबर घटना मानते हैं, जिसमें अत्याधुनिक साइबर क्षमताएं शामिल थीं, और उसी के अनुरूप प्रतिक्रिया दे रहे हैं. हम इस चरण में शुरुआती निष्कर्ष साझा कर रहे हैं ताकि रक्षक समझ सकें कि क्या हुआ और यह आकलन कर सकें कि मॉडल अब क्या करने में सक्षम हैं. हम Hugging Face के साथ मिलकर गहन जांच जारी रखेंगे और जांच पूरी होने पर कमजोरियों, घटना और निष्कर्षों के बारे में अधिक जानकारी साझा करेंगे.

इस घटना के दौरान क्या हुआ

यह घटना एक आंतरिक मूल्यांकन के दौरान हुई, जिसमें मॉडल को अपनी साइबर क्षमताओं को मापने के प्रयास में जटिल हमले के रास्तों का उपयोग कर उन्नत शोषण करने के लिए प्रेरित किया जाता है. हम यह मूल्यांकन उन प्रोडक्शन क्लासिफायर के बिना चलाकर अधिकतम साइबर क्षमताओं का अनुमान लगाते हैं, जिनका उपयोग मॉडल को उच्च-जोखिम वाली साइबर गतिविधि करने से रोकने के लिए किया जाता है. हमारे बेंचमार्क अत्यधिक पृथक वातावरण में चलते हैं, जहां नेटवर्क एक्सेस केवल आंतरिक रूप से होस्ट किए गए थर्ड-पार्टी सॉफ़्टवेयर के माध्यम से पैकेज इंस्टॉल करने की क्षमता तक सीमित होता है, जो पैकेज रजिस्ट्रियों के लिए प्रॉक्सी और कैश के रूप में काम करता है.

मॉडल ने OpenAI के अनुसंधान वातावरण और Hugging Face के प्रोडक्शन इन्फ्रास्ट्रक्चर में कमजोरियों की पहचान की और उन्हें जोड़कर, Hugging Face के प्रोडक्शन डेटाबेस से सीधे परीक्षण समाधान प्राप्त किए. सभी साक्ष्य बताते हैं कि मॉडल ExploitGym का समाधान खोजने पर अत्यधिक केंद्रित थे और एक काफी संकीर्ण परीक्षण लक्ष्य हासिल करने के लिए चरम सीमा तक गए.

हमारे सैंडबॉक्स्ड परीक्षण वातावरण में काम करते हुए, हमारे मॉडल ने मूल्यांकन समस्या हल करने के प्रयास में खुले इंटरनेट एक्सेस का तरीका खोजने पर काफी इन्फरेंस कंप्यूट खर्च किया. एक्सेस पाने के लिए, मॉडल ने पैकेज रजिस्ट्री कैश प्रॉक्सी में एक ज़ीरो-डे कमजोरी की पहचान की और उसका फायदा उठाया, जिसका खुलासा हमने अब विक्रेता को ज़िम्मेदारी से कर दिया है. इस एक्सेस के साथ, हमारे मॉडल ने हमारे अनुसंधान परीक्षण वातावरण में प्रिविलेज एस्केलेशन और लैटरल मूवमेंट की कई कार्रवाइयां कीं, जब तक कि मॉडल इंटरनेट एक्सेस वाले एक नोड तक नहीं पहुंच गए.

इंटरनेट एक्सेस मिलने के बाद, मॉडल ने अनुमान लगाया कि Hugging Face संभवतः ExploitGym के लिए मॉडल, डेटासेट और समाधान होस्ट करता है. यह जानकर, मॉडल ने ऐसी गुप्त जानकारी तक पहुंच पाने के तरीके खोजे और सफलतापूर्वक पाए, जिसका उपयोग वह मूल्यांकन में धोखा देने के लिए कर सकता था. एक उदाहरण में, मॉडल ने कई हमले के वेक्टरों को जोड़ा, जिनमें चोरी किए गए क्रेडेंशियल और ज़ीरो-डे कमजोरियों का उपयोग करके Hugging Face सर्वरों पर रिमोट कोड एक्ज़ीक्यूशन का रास्ता खोजना शामिल था. OpenAI की सुरक्षा टीम ने इस असामान्य गतिविधि का आंतरिक रूप से पता लगाया.

जब हमारी टीमें जुड़ीं, तब तक Hugging Face की सुरक्षा टीम और एजेंटों ने अपने इन्फ्रास्ट्रक्चर पर इस गतिविधि का पता लगाकर उसे रोक दिया था और अपने ही ओपन-सोर्स मॉडल के साथ कंटेनमेंट और फॉरेंसिक पुनर्निर्माण शुरू कर दिया था. हम इस घटना की जांच जारी रखने के लिए उनके साथ सक्रिय रूप से काम कर रहे हैं. हम जांच और सुधार पर Hugging Face के तेज़ और घनिष्ठ सहयोग के लिए आभारी हैं.

हम अभी जो कदम उठा रहे हैं

  1. जांच के हिस्से के रूप में, कमजोरियों को पैच किए जाने तक हम अनुसंधान की गति की कीमत पर इन्फ्रास्ट्रक्चर कॉन्फ़िगरेशन में सख्त नियंत्रण लागू कर रहे हैं. हम इन नियंत्रणों और उनके प्रभाव के बारे में अपनी Safety and Security Committee को नियमित रूप से जानकारी दे रहे हैं.
  2. हम इस घटना की फॉरेंसिक जांच के लिए Hugging Face के साथ काम कर रहे हैं.
  3. हमने आंतरिक रूप से होस्ट किए गए थर्ड-पार्टी सॉफ़्टवेयर में पहचानी गई ज़ीरो-डे कमजोरी का ज़िम्मेदारी से खुलासा किया है और उसे पैच करने के लिए उनके साथ काम कर रहे हैं.
  4. हमने Hugging Face को विश्वसनीय एक्सेस प्रोग्राम में शामिल किया है और उनकी टीमों को अपने बचाव बेहतर बनाने के लिए हमारे मॉडल की क्षमताओं का तेज़ी से उपयोग करने में सहायता कर रहे हैं.
  5. हम भविष्य के प्रशिक्षण और मूल्यांकनों के लिए सुरक्षा को बेहतर और अधिक मजबूत बना रहे हैं. इस सप्ताह हमने लंबी अवधि वाले मॉडल के दौर में सुरक्षा और अलाइनमेंट बेहतर बनाने पर एक ब्लॉग प्रकाशित किया. इस मूल्यांकन के दौरान इन डिप्लॉयमेंट सुरक्षा उपायों को जानबूझकर सक्षम नहीं किया गया था, क्योंकि इसका उद्देश्य साइबर कमजोरियों की जांच करना था. यह घटना दिखाती है कि हमारे मॉडल के अलाइनमेंट, मूल्यांकन के समय साइबर सुरक्षा उपायों और आंतरिक परीक्षण के दौरान निगरानी को और मजबूत करने की आवश्यकता है.

उन्नत साइबर क्षमताओं के मूल्यांकन के प्रति हमारा दृष्टिकोण

जैसा कि हमने हाल ही में साझा किया, AI कमजोरियों की खोज और उनके दुरुपयोग को तेज़ कर रहा है. इस घटना से मुख्य सीख यह है कि मॉडल की सुरक्षा और सेफ़्टी को तेज़ी से बढ़ती क्षमताओं के साथ कदम मिलाकर चलना होगा. हम मॉडल विकास के दौरान इस्तेमाल किए जाने वाले कंटेनमेंट, निगरानी, एक्सेस नियंत्रण और मूल्यांकन प्रक्रियाओं को मजबूत कर रहे हैं.

UK AISI का मूल्यांकन दिखाता है कि GPT‑5.6 Sol जैसे मॉडल लंबे टाइम होराइज़न में जटिल, बहु-चरणीय साइबर ऑपरेशन लगातार चलाने में अधिक सक्षम हो रहे हैं. यह घटना संकेत देती है कि ये सैद्धांतिक क्षमताएं वास्तविक दुनिया की स्थितियों में लागू होती हैं.

UK AI Security Institute का चार्ट, जिसमें हालिया ओपन-वेट मॉडल और अत्याधुनिक मॉडल की तुलना लॉन्ग-होराइज़न साइबर रेंज पर की गई है.

यह घटना यह भी स्पष्ट करती है कि उन्नत मॉडल सोर्स-कोड एक्सेस के बिना वास्तविक दुनिया की प्रणालियों में नए हमले के रास्ते खोजकर उनका फायदा उठा सकते हैं. यह रेखांकित करती है कि उन्नत साइबर क्षमताओं को मजबूत सुरक्षा उपायों और रक्षात्मक टूल के साथ-साथ विकसित किया जाना चाहिए.

हम मानते हैं कि उन्नत साइबर-समर्थ मॉडल को सुरक्षा टीमों की मदद करनी चाहिए ताकि वे हमलावरों से पहले कमजोरियां खोज सकें, समझ सकें कि कमजोरियों को कैसे जोड़ा जा सकता है, और मशीन की गति से उनका समाधान कर सकें. हम इन क्षमताओं का उपयोग इन्फ्रास्ट्रक्चर कॉन्फ़िगरेशन और मॉडल मूल्यांकन वातावरणों के आसपास सुरक्षा को लगातार मजबूत करने के लिए कर रहे हैं; सीखने के साथ हम अपने निष्कर्ष और सर्वोत्तम प्रक्रियाएं साझा करेंगे. हम अन्य रक्षकों को विश्वसनीय एक्सेस के लिए आवेदन करने और इन मॉडल के साथ अभी प्रयोग करने के लिए प्रोत्साहित करते हैं, ताकि इन क्षमताओं को बेहतर रोकथाम, तेज़ पहचान और अधिक प्रभावी घटना प्रतिक्रिया में बदला जा सके.

“हम इस और अन्य विषयों पर OpenAI के साथ सहयोग के लिए आभारी हैं. यह घटना, जो संभवतः अपनी तरह की पहली है, उस बात को साबित करती है जिस पर हम लंबे समय से विश्वास करते रहे हैं: AI सुरक्षा किसी एक कंपनी के गुप्त रूप से काम करने से हल नहीं होगी. इसका समाधान खुले तौर पर, सहयोग से, और हर जगह हर रक्षक को AI की व्यापक पहुंच देकर होगा.”
—Clem Delangue, सह-संस्थापक और CEO, Hugging Face

लेखक

OpenAI