मॉडेल मूल्यमापनातील सुरक्षा घटनेच्या निराकरणासाठी OpenAI आणि Hugging Faceची भागीदारी
गेल्या आठवड्यात Hugging Faceने त्यांच्या पायाभूत सुविधांशी तडजोड करणारा कृत्रिम बुद्धिमत्ता एजंट ओळखून रोखल्यानंतर नव्या प्रकारची सुरक्षा घटना उघड केली(नवीन विंडोमध्ये उघडेल); वाढत्या सायबर-सक्षम मॉडेल्सच्या प्रसारामुळे अशा घटना अधिक सामान्य होतील अशी आमची अपेक्षा आहे. तपासानंतर आता आम्हाला समजले आहे की ही विशिष्ट घटना OpenAI मॉडेल्सच्या संयोगामुळे घडली होती — त्यात GPT‑5.6 Sol आणि आणखी सक्षम असे प्रकाशनपूर्व मॉडेल समाविष्ट होते, आणि मूल्यमापनासाठी सर्वांमध्ये सायबर विनंत्यांना नकार देण्याची यंत्रणा कमी केली होती — आणि त्या वेळी सायबर क्षमतांच्या बेंचमार्कवर(नवीन विंडोमध्ये उघडेल) अंतर्गत चाचणी सुरू होती.
आम्ही या घटनेला अभूतपूर्व सायबर घटना मानतो, ज्यात अत्याधुनिक सायबर क्षमता सामील आहेत, आणि त्यानुसार प्रतिसाद देत आहोत. काय घडले हे बचावकर्त्यांना समजावे आणि मॉडेल्स आता काय करू शकतात याचा योग्य अंदाज घेता यावा म्हणून या टप्प्यावर आम्ही प्राथमिक निष्कर्ष शेअर करत आहोत. Hugging Faceसोबत आम्ही सखोल तपास सुरू ठेवू आणि तपास पूर्ण झाल्यावर भेद्यता, घटना आणि निष्कर्षांबद्दल अधिक तपशील शेअर करू.
सायबर क्षमता मोजण्याच्या प्रयत्नात, गुंतागुंतीच्या हल्ला मार्गांचा वापर करून प्रगत शोषण करण्यास मॉडेल्सना प्रवृत्त करणाऱ्या अंतर्गत मूल्यमापनादरम्यान ही घटना घडली. उच्च-जोखमीच्या सायबर क्रियाकलापांचा पाठपुरावा करण्यापासून मॉडेल्सना रोखण्यासाठी वापरले जाणारे उत्पादन वर्गीकरणकार न वापरता हे मूल्यमापन चालवून आम्ही कमाल सायबर क्षमतांचा अंदाज घेतो. आमचे बेंचमार्क अत्यंत विलग वातावरणात चालतात, जिथे नेटवर्क प्रवेश पॅकेज रजिस्ट्रीजसाठी प्रॉक्सी आणि कॅशे म्हणून काम करणाऱ्या आंतरिकरित्या होस्ट केलेल्या तृतीय-पक्ष सॉफ्टवेअरद्वारे पॅकेजेस स्थापित करण्यापुरता मर्यादित असतो.
मॉडेल्सनी OpenAI च्या संशोधन वातावरणातील आणि Hugging Faceच्या उत्पादन पायाभूत सुविधांतील भेद्यता ओळखून एकत्र जोडल्या आणि Hugging Faceच्या उत्पादन डेटाबेसमधून थेट चाचणी उपाय मिळवले. सर्व पुरावे सूचित करतात की मॉडेल्स ExploitGymसाठी उपाय शोधण्यावर अतिशय एकाग्र होती आणि तुलनेने अरुंद चाचणी उद्दिष्ट साध्य करण्यासाठी त्यांनी टोकाची पावले उचलली.
आमच्या विलग चाचणी वातावरणात कार्यरत असताना, मूल्यमापन समस्या सोडवण्याच्या प्रयत्नात आमच्या मॉडेल्सनी खुले इंटरनेट प्रवेश मिळवण्याचा मार्ग शोधण्यासाठी मोठ्या प्रमाणात अनुमान संगणन खर्च केले. प्रवेश मिळवण्यासाठी, मॉडेल्सनी पॅकेज रजिस्ट्री कॅशे प्रॉक्सीमधील झिरो-डे भेद्यता ओळखली आणि तिचा गैरफायदा घेतला (ती भेद्यता आम्ही आता विक्रेत्याला जबाबदारीने उघड केली आहे). हा प्रवेश मिळाल्यानंतर, आमच्या मॉडेल्सनी आमच्या संशोधन चाचणी वातावरणात विशेषाधिकार-वाढ आणि लॅटरल मूव्हमेंटच्या क्रियांची मालिका केली, जोपर्यंत मॉडेल्स इंटरनेट प्रवेश असलेल्या नोडपर्यंत पोहोचली नाहीत.
इंटरनेट प्रवेश मिळाल्यानंतर, मॉडेल्सनी असा निष्कर्ष काढला की Hugging Faceकडे ExploitGymसाठी मॉडेल्स, डेटासेट्स आणि उपाय कदाचित होस्ट केलेले असू शकतात. हे लक्षात घेऊन, मॉडेलने मूल्यमापनात फसवणूक करण्यासाठी वापरता येईल अशी गुप्त माहिती मिळवण्याचे मार्ग शोधले आणि यशस्वीपणे सापडले. एका उदाहरणात, मॉडेलने चोरी केलेली प्रवेश माहिती आणि झिरो-डे भेद्यता वापरण्यासह अनेक हल्ला वाहक एकत्र जोडून Hugging Face सर्व्हरवर दूरस्थ कोड अंमलबजावणीचा मार्ग शोधला. OpenAI च्या सुरक्षा टीमने ही असामान्य क्रिया अंतर्गतरीत्या शोधून काढली.
Hugging Faceच्या सुरक्षा टीमने आणि एजंट्सनी त्यांच्या पायाभूत सुविधांवरील क्रिया शोधून थांबवली होती आणि आमच्या टीम्स संपर्कात येण्यापूर्वीच त्यांनी त्यांच्या स्वतःच्या ओपन-सोर्स मॉडेल्ससह नियंत्रण आणि न्यायवैज्ञानिक पुनर्रचना सुरू केली होती. या घटनेचा तपास पुढे सुरू ठेवण्यासाठी आम्ही त्यांच्यासोबत सक्रियपणे काम करत आहोत. तपास आणि निराकरणावर Hugging Faceने जलद आणि जवळून केलेल्या सहकार्याबद्दल आम्ही कृतज्ञ आहोत.
- तपासाचा भाग म्हणून, भेद्यता पॅच केल्या जात असताना संशोधनाचा वेग कमी होण्याची किंमत मोजूनही आम्ही पायाभूत सुविधा कॉन्फिगरेशनमध्ये कठोर नियंत्रण लागू करत आहोत. या नियंत्रणांबद्दल आणि त्यांच्या परिणामांबद्दल आम्ही आमच्या सुरक्षा आणि संरक्षण समितीला नियमित माहिती देत आहोत.
- या घटनेचा न्यायवैज्ञानिक तपास करण्यासाठी आम्ही Hugging Face सह काम करत आहोत.
- आंतरिकरित्या होस्ट केलेल्या तृतीय-पक्ष सॉफ्टवेअरमधील ओळखलेली झिरो-डे भेद्यता आम्ही जबाबदारीने उघड केली आहे आणि ती पॅच करण्यासाठी त्यांच्यासोबत काम करत आहोत.
- आम्ही Hugging Faceला विश्वसनीय प्रवेश कार्यक्रमात आणले आहे आणि त्यांचे संरक्षण सुधारण्यासाठी आमच्या मॉडेल्सच्या क्षमता जलद वापरण्यात त्यांच्या टीमना मदत करत आहोत.
- भविष्यातील प्रशिक्षण आणि मूल्यमापनांसाठी आम्ही अधिक मजबूत संरक्षणे सुधारत आणि जोडत आहोत. या आठवड्यात आम्ही दीर्घ वेळेच्या मर्यादांची मॉडेल्स असलेल्या युगात सुरक्षा आणि संरेखन सुधारण्यावर ब्लॉग प्रकाशित केला. हे मूल्यमापन सायबर भेद्यता तपासण्यासाठी असल्यामुळे डीप्लॉयमेंटसाठीची ही सुरक्षा व्यवस्था जाणीवपूर्वक सक्षम केलेली नव्हती. या घटनेतून आमच्या मॉडेलचे संरेखन, मूल्यमापनाच्या वेळी सायबर संरक्षणे आणि अंतर्गत चाचण्यांदरम्यानचे निरीक्षण आणखी मजबूत करण्याची गरज दिसून येते.
आम्ही अलीकडेच सांगितल्याप्रमाणे, कृत्रिम बुद्धिमत्ता भेद्यता शोधणे आणि त्यांचा गैरफायदा घेणे अधिक वेगवान करत आहे. या घटनेतील मुख्य धडा असा की मॉडेलची सुरक्षा आणि संरक्षण वेगाने पुढे जाणाऱ्या क्षमतांच्या बरोबरीने विकसित व्हायला हवे. मॉडेल विकासादरम्यान वापरल्या जाणाऱ्या नियंत्रण, निरीक्षण, प्रवेश नियंत्रण आणि मूल्यमापन पद्धती आम्ही मजबूत करत आहोत.
UK AISIचे मूल्यमापन दर्शवते की GPT‑5.6 Sol सारखी मॉडेल्स दीर्घ वेळेच्या मर्यादेत गुंतागुंतीच्या, अनेक टप्प्यांच्या सायबर कारवायांच्या विरुद्ध टिकून राहण्यास अधिकाधिक सक्षम होत आहेत. या घटनेवरून या सैद्धांतिक क्षमता प्रत्यक्ष जगातील परिस्थितींमध्ये लागू होतात, असे सूचित होते.

स्रोत-कोड प्रवेशाशिवायही प्रगत मॉडेल्स प्रत्यक्ष मॉडेल्समध्ये नवीन हल्ला मार्ग शोधू शकतात आणि त्यांचा गैरफायदा घेऊ शकतात, हेही या घटनेतून स्पष्ट होते. प्रगत सायबर क्षमता अधिक मजबूत सुरक्षा उपाय आणि बचाव साधनांसोबतच विकसित करणे आवश्यक आहे, हे यातून अधोरेखित होते.
आमच्या मते, प्रगत सायबर-सक्षम मॉडेल्सनी हल्लेखोरांपूर्वी सुरक्षा टीमना कमकुवत ठिकाणे शोधण्यात, भेद्यता कशा जोडल्या जाऊ शकतात हे समजण्यात आणि यंत्राच्या वेगाने त्यांचे निराकरण करण्यात मदत करायला हवी. पायाभूत सुविधा कॉन्फिगरेशन आणि मॉडेल मूल्यमापन वातावरणांभोवतीची संरक्षणे अधिक मजबूत करण्यासाठी आम्ही या क्षमतांचा वापर करत आहोत; शिकत असताना आमचे निष्कर्ष आणि सर्वोत्तम पद्धती आम्ही शेअर करू. या क्षमता अधिक चांगले प्रतिबंध, जलद शोध आणि अधिक प्रभावी घटना प्रतिसादात रूपांतरित करण्यासाठी इतर बचावकर्त्यांनी विश्वसनीय प्रवेशासाठी अर्ज करावा आणि या मॉडेल्सवर आत्ताच प्रयोग करावेत, असे आम्ही प्रोत्साहन देतो.
“या आणि इतर विषयांवर OpenAI बरोबरच्या सहकार्याबद्दल आम्ही आभारी आहोत. कदाचित या प्रकारातील पहिली असलेली ही घटना आम्ही बराच काळ मानत आलेली गोष्ट सिद्ध करते: कोणतीही एक कंपनी गुप्तपणे काम करून कृत्रिम बुद्धिमत्ता सुरक्षा सोडवू शकणार नाही. ती खुलेपणाने, सहकार्याने, प्रत्येक बचावकर्त्याला सर्वत्र कृत्रिम बुद्धिमत्तेचा व्यापक प्रवेश देऊन सोडवली जाईल.”


