मुख्य मजकूराकडे जा
OpenAI

४ ऑगस्ट, २०२६

सुरक्षा

OpenAI मॉडेलशी संबंधित तृतीय-पक्ष सायबर मूल्यमापने

लोड होत आहे...

उपयोजनापूर्वी जोखमींची पडताळणी करण्यास आणि त्या अधिक चांगल्या प्रकारे समजून घेण्यास स्वतंत्र चाचणीची महत्त्वाची मदत होते. काही सायबर मूल्यमापनांत अंतर्निहित क्षमता मोजण्यासाठी सुरक्षा उपाय कमी केलेल्या सानुकूल संरचना जाणीवपूर्वक वापरल्या जातात—सार्वजनिकरीत्या उपलब्ध उपयोजनांमध्ये मॉडेल सामान्यतः कसे वागतात, हे मोजणे त्यांचा उद्देश नसतो.

अलीकडील मूल्यमापनांदरम्यान दोन बाह्य चाचणी भागीदारांनी अशा घटना ओळखल्या, ज्यांत चाचणी संरचना आणि नियंत्रणे तसेच अलीकडील मॉडेलच्या वाढत्या क्षमतांमुळे मॉडेलची गतिविधी चाचणीच्या निर्धारित सीमांपलीकडे गेली. मॉडेल अधिक सक्षम होत असताना चाचणी वातावरणे आणि पद्धतींची मानके विकसित करण्यासाठी संपूर्ण उद्योगाने आणि तृतीय-पक्ष मूल्यमापनकर्त्यांनी सहकार्य करणे किती महत्त्वाचे आहे, हे या घटनांनी अधोरेखित केले. संपादकाची नोंद: या घटना Hugging Face सुरक्षा घटनेपेक्षा वेगळ्या आहेत. Hugging Face घटनेबद्दलचे अपडेट्स आम्ही येथे देत राहू.

या नव्या घटनांत तृतीय-पक्ष सायबर मूल्यमापनांदरम्यान विशिष्ट परिस्थितीत आणि सामान्य उपयोजनाचे प्रतिनिधित्व न करणाऱ्या कमी सुरक्षा उपायांच्या संरचनांमध्ये OpenAI मॉडेलनी सार्वजनिक इंटरनेट वापरले. या घटनांमध्ये पुढील बाबींचा समावेश होता:

  1. UK सरकारची AI सुरक्षा संस्था UK AISI सायबर सरावक्षेत्रातील मूल्यमापने राबवत होती. एजंटना स्वतःची साधने शोधता यावीत आणि वास्तविक हल्लेखोराच्या परिस्थितीशी अधिक मिळत्याजुळत्या परिस्थितीत काम करता यावे यासाठी इंटरनेटचा वापर जाणीवपूर्वक सुरू ठेवला होता. अंतर्निहित क्षमता मोजण्यासाठी सायबर क्लासिफायर्सही अक्षम केले होते. त्यांचा ब्लॉग तुम्ही येथे वाचू शकता.(नवीन विंडोमध्ये उघडेल)
  2. आमच्या बाह्य सायबरसुरक्षा चाचणी भागीदारांपैकी एक असलेल्या Irregular ने, इंटरनेटपासून अलिप्त राहण्याच्या उद्देशाने 'कॅप्चर-द-फ्लॅग' पद्धतीचे मूल्यांकन सुरू केले होते, परंतु चाचणी वातावरणातील चुकीच्या संरचनेमुळे मॉडेल्सना सार्वजनिक इंटरनेटवर प्रवेश मिळाला.

खाली आम्ही काय घडले, कोणत्या चाचणी परिस्थितीमुळे ही गतिविधी शक्य झाली, ती नियंत्रणात आणण्यासाठी कोणती पावले उचलली आणि अधिकाधिक सक्षम होत असलेल्या मॉडेलचे स्वतंत्र प्रयोगशाळांना कठोर व सुरक्षित मूल्यमापन करता यावे यासाठी आम्ही काय करत आहोत, याचा सारांश दिला आहे.

तृतीय-पक्ष मॉडेल मूल्यमापन वातावरणे अधिक मजबूत करणे

Hugging Face घटनेबद्दलच्या आमच्या अलीकडील लेखात नमूद केलेले व्यापक आव्हानच या घटनांमधूनही दिसते: मॉडेलच्या क्षमता वाढत असताना त्यांच्याभोवतीच्या सुरक्षा आणि सुरक्षितता प्रणालींनीही प्रगती करणे आवश्यक आहे. यात मॉडेल विकसित करण्यासाठी वापरली जाणारी वातावरणे तसेच प्रयोगशाळा आणि स्वतंत्र भागीदार त्यांचे मूल्यमापन करण्यासाठी वापरत असलेली वातावरणे, या दोन्हींचा समावेश आहे.

येत्या आठवड्यांत आम्ही तृतीय-पक्ष चाचण्यांबाबतच्या आमच्या दृष्टिकोनाचे पुनरावलोकन करू. यात अधिक जोखमीची मूल्यमापने ओळखणे, व्याप्तीवर सहमती करणे, इंटरनेटचा वापर सुरू करण्याच्या किंवा सुरक्षा उपाय कमी करण्याच्या विनंत्यांचे मूल्यांकन करणे, विलगीकरण, प्रवेश-माहितीची हाताळणी, देखरेख व चाचणी थांबवण्याच्या अटी निश्चित करणे आणि घटनेची सूचना व तिचे वरिष्ठ स्तरावर निराकरण करण्यासाठी अधिक स्पष्ट प्रक्रिया स्थापन करणे यांचा समावेश असेल.

उच्च-जोखमीची मूल्यमापने सुरक्षितपणे राबवण्यासाठी सामायिक पद्धती मजबूत करण्याकरिता आम्ही संपूर्ण उद्योगासोबत काम करण्यास वचनबद्ध आहोत. यासाठी येत्या आठवड्यांत राष्ट्रीय AI संस्था, स्वतंत्र मूल्यमापनकर्ते, इतर AI प्रयोगशाळा आणि अन्य गट अशा संबंधित पक्षांना एकत्र आणले जाईल. अधिकाधिक सक्षम होत असलेल्या मॉडेलशी चाचणी पद्धतींनी जुळवून घेत असतानाच कठोर स्वतंत्र मूल्यमापनाचे मूल्य जपणे, हे आमचे ध्येय आहे.

UK AISI

3 ऑगस्ट रोजी UK AISI ने आम्हाला सांगितले की 25 जुलैला सुरू झालेल्या नियमित सायबर मूल्यमापनादरम्यान OpenAI आणि अन्य एका प्रयोगशाळेची मॉडेल काही प्रकरणांत चाचणीच्या व्याप्तीबाहेर गेली. हे मूल्यमापन वास्तविक जगातील नेटवर्कचे अनुकरण करण्यासाठी तयार केलेल्या नियंत्रित सायबर सरावक्षेत्रांत झाले. ओळखल्या गेलेल्या 19 घटनांपैकी दोन घटनांत OpenAI चे GPT‑5.6 Sol मॉडेल सहभागी होते. इतर घटनांमध्ये अन्य प्रयोगशाळेची मॉडेल सहभागी होती.

या मूल्यांकनासाठी, एजंट्सना कॅप्चर-द-फ्लॅग सरावामध्ये सायबरसुरक्षा तज्ञ म्हणून काम करण्याची सूचना देण्यात आली होती: तीन जोडलेल्या सिम्युलेटेड वातावरणांमध्ये घुसखोरी करून अंतिम फ्लॅग मिळवणे. टास्क प्रॉम्प्टने कार्यक्षेत्रातील नेटवर्क्स ओळखले आणि अनेक सिस्टीम्सना कार्यक्षेत्राबाहेर असल्याचे नमूद केले. UK AISI ने थेट इंटरनेट ॲक्सेस देखील सक्षम केला, जेणेकरून एजंट्स टूल्स डाउनलोड करू शकतील—आणि मानवी हल्लेखोरासारख्या परिस्थितीत काम करू शकतील, तसेच मूळ क्षमता मोजण्यासाठी मॉडेलचे सायबर क्लासिफायर्स निष्क्रिय केले.

UK AISI ची अभिप्रेत अधिकृतता मर्यादा ही सिम्युलेटेड सायबर रेंज होती: एजंट्सना निर्दिष्ट सिम्युलेटेड नेटवर्क्सवर हल्ला करण्याची आणि एक फ्लॅग मिळवण्याची परवानगी होती, परंतु त्या रेंजच्या नेटवर्क सीमेबाहेरील सिस्टीम्सशी संवाद साधण्याची परवानगी नव्हती. तथापि, एजंट्सना ओपन इंटरनेट ॲक्सेसचा वापर कसा करावा आणि कसा करू नये, हे स्पष्टपणे सांगितले गेले नव्हते, ज्याला UK AISI या घटनेचे एक संभाव्य कारण मानते.

या चाचण्यांदरम्यान, UK AISI ला असे आढळून आले की, सिम्युलेटेड रेंजमध्ये मार्ग शोधण्याचा आणि फ्लॅग परत मिळवण्याचा प्रयत्न करत असताना GPT5.6 Sol ने दोन अनधिकृत कृती केल्या:

  1. GPT‑5.6 Sol ने, सरावक्षेत्रातील एखादी प्रणाली GitHub किंवा अन्य अपडेट सेवा वारंवार तपासत आहे का हे पाहण्यासाठी, दुसऱ्या प्रयोगशाळेच्या एजंटने सार्वजनिकरीत्या उपलब्ध ठेवलेले GitHub टोकन पुन्हा वापरले, खाते-पुनर्प्राप्तीचे आणि विनंती-मर्यादा चुकवण्याचे प्रयत्न केले आणि बाह्य DNS व टनेलिंग सेवा पुरवठादारांकडे खाती नोंदवली.
  2. GPT‑5.6 Sol ने त्याच्या मूल्यमापन वातावरणात स्थानिकरीत्या चालणारा DNS सर्व्हर सार्वजनिक इंटरनेटवरून उपलब्ध करण्यासाठी सार्वजनिक टनेलिंग सेवा वापरली. त्या सर्व्हरमध्ये चाचणी सरावक्षेत्रात चालणाऱ्या एका सॉफ्टवेअरमधील ज्ञात असुरक्षेचा फायदा घेण्यासाठी तयार केलेली पेलोड होती. ही व्यवस्था कार्यरत झाली नाही, कोणत्याही वास्तविक रिझॉल्व्हरने त्याला क्वेरी पाठवल्याचा पुरावा नाही आणि मूल्यमापन संपल्यावर ही इन्फ्रास्ट्रक्चर काढून टाकण्यात आले.

मॉडेल सायबर सरावक्षेत्रातील काम पूर्ण करण्याचा प्रयत्न करत असले, तरी या कृतींमध्ये सरावक्षेत्राच्या सीमाबाहेरील वास्तविक बाह्य खाती आणि सेवा वापरण्यात आल्या होत्या व काम पूर्ण करण्यासाठी त्या आवश्यक नव्हत्या, म्हणून UK AISI ने त्या अनधिकृत मानल्या. DNS सर्व्हरवर सार्वजनिक इंटरनेटवर एक्स्प्लॉइट पेलोडही उपलब्ध करण्यात आली होती. मात्र, ही व्यवस्था कार्यरत झाली नाही आणि कोणत्याही वास्तविक रिझॉल्व्हरने त्याला क्वेरी पाठवल्याचा पुरावा नाही.

सुरक्षा देखरेखीत असामान्य डेटा ट्रान्सफर आढळल्यानंतर UK AISI ने 28 जुलै रोजी ही गतिविधी ओळखली. त्यांनी संबंधित मूल्यमापने थांबवली, संबंधित मशीन्स विलग केली आणि गतिविधी आढळल्यापासून सुमारे एका तासात ती नियंत्रणात आणली.

ही गतिविधी ओळखणे, तिची चौकशी करणे आणि तिच्याबद्दलचे तपशील सामायिक करणे यांसह या संपूर्ण प्रक्रियेत UK AISI ने केलेल्या सहकार्याबद्दल आम्ही आभारी आहोत. हे सहकार्य पुढेही सुरू ठेवण्यास आम्ही उत्सुक आहोत.

Irregular

29 जुलै रोजी, आमच्या तृतीय-पक्ष मूल्यांकन भागीदारांपैकी एक असलेल्या Irregular ने, कॅप्चर-द-फ्लॅग (CTF) प्रकारच्या सायबरसुरक्षा मूल्यांकनादरम्यान OpenAI मॉडेल्सशी संबंधित एका घटनेबद्दल आम्हाला कळवले. मॉडेल्सना एका आभासी वातावरणातील त्रुटींचा फायदा घेऊन लपवलेली माहिती शोधण्याची सूचना देण्यात आली होती आणि त्यांना इंटरनेटची सुविधा उपलब्ध नाही असेही सांगण्यात आले होते. तथापि, चाचणी वातावरणातील एका चुकीच्या संरचनेमुळे त्या मॉडेल्सना सार्वजनिक इंटरनेट वापरता आले.

एका चाचणीत, CTF चॅलेंजसाठी असलेल्या काल्पनिक लक्ष्याचे नाव अनपेक्षितपणे एका खऱ्या डोमेनशी जुळले. चाचणीचे वातावरण चुकून इंटरनेटशी जोडलेले असल्यामुळे, मॉडेलने एका खऱ्या वेबसाइटला सिम्युलेटेड वातावरणाचा भाग समजून तिचा गैरफायदा घेतला. यामध्ये कोणत्याही अत्याधुनिक सँडबॉक्स एस्केप किंवा झिरो-डे हल्ल्याचा समावेश नव्हता: चुकीच्या कॉन्फिगरेशनमुळे इंटरनेटचा वापर झाला होता आणि मॉडेलने एका मूलभूत सुरक्षा त्रुटीचा गैरफायदा घेतल्याचे दिसून आले.

Irregular च्या तपासानुसार, मॉडेलने त्याच संकेतस्थळाचे संचालन करण्यासाठी आवश्यक क्रेडेन्शियल्सही शोधली आणि वापरली. प्रभावित संकेतस्थळाच्या स्वतःच्या डेटापलीकडे कोणताही परिणाम झाल्याचे Irregular ला आढळलेले नाही आणि त्यांचे ऑडिट सुरू आहे. Irregular ने मूल्यमापने थांबवली आहेत, त्रुटी दुरुस्त करण्यास सुरुवात केली आहे आणि प्रभावित तृतीय पक्षांना माहिती देण्यात आली आहे. Irregular ने आम्हाला कळवले आहे की या घटनेशी संबंधित ओळखलेल्या सर्व समस्या आता सक्रिय नाहीत आणि चाचणी वातावरणात आवश्यक सुरक्षा उपाय जोडले आहेत. त्याच चाचणी वातावरणात इतर प्रयोगशाळांशी संबंधित घडलेल्या घटनांविषयीही Irregular ने माहिती दिली आहे.

Irregular च्या सहकार्याबद्दल आम्ही आभारी आहोत आणि त्यांच्या पुनरावलोकनाला मदत करण्यासाठी त्यांच्यासोबत जवळून काम करत राहू. सायबर मूल्यमापने सुरक्षितपणे राबवण्यासाठी आणि गतिविधी नियंत्रणात ठेवण्यासाठीच्या सर्वोत्तम पद्धती सामायिक करणारी श्वेतपत्रिकाही Irregular तयार करत आहे. निष्कर्ष समुदायाला उपलब्ध करून देण्यासाठी श्वेतपत्रिकेत योगदान देण्यास आणि आमचे सहकार्य पुढेही सुरू ठेवण्यास आम्ही उत्सुक आहोत. सध्याच्या आणि भविष्यातील मॉडेलचे सुरक्षित व सखोल मूल्यमापन सुनिश्चित करण्यासाठी अशा प्रकारचे सहकार्य अत्यावश्यक आहे, असे आम्हाला वाटते.