मुख्य मजकूराकडे जा
OpenAI

१६ सप्टेंबर, २०२६

रिसर्चसुरक्षितता

मॉडेल विसंगतीच्या अहवालासाठी आमची चौकट

लोड होत आहे...

OpenAI मध्ये आढळणाऱ्या मॉडेल विसंगतीच्या घटनांचा मागोवा घेणे, तपास करणे आणि त्या जाहीर करणे यासाठी आम्ही एक नवीन चौकट सामायिक करत आहोत. त्यासोबत गेल्या सहा महिन्यांत आम्ही पाहिलेल्या मॉडेलच्या अनपेक्षित किंवा चिंताजनक वर्तनावरील सहा अहवालही प्रसिद्ध करत आहोत.

संशोधक, कृत्रिम बुद्धिमत्ता विकसक, धोरणकर्ते आणि सर्वसामान्यांना अधिक चांगली माहिती मिळावी यासाठी आम्ही यापूर्वी विसंगतीबाबतचे आमचे निष्कर्ष लोकांसाठी जाहीर केले आहेत. मात्र, हे निष्कर्ष नोंदवण्याची पद्धतशीर प्रक्रिया नसल्यामुळे आम्ही माहिती प्रसंगानुसार आणि अपेक्षेपेक्षा कमी वेळा जाहीर केली. अनेकदा आम्ही अनेक घटना एकत्र करून एक अहवाल तयार होईपर्यंत थांबलो किंवा नव्याने प्रसिद्ध झालेल्या मॉडेल्सच्या प्रणाली कार्डमध्ये त्या जोडल्या. नोंदवलेल्या वर्तनाचे पूर्ण स्पष्टीकरण किंवा त्यावरील उपाय अद्याप उपलब्ध नसले, तरी ते आढळल्यानंतर विसंगतीचे अहवाल लवकर प्रसिद्ध करता यावेत, हा या नवीन चौकटीचा उद्देश आहे.

कृत्रिम बुद्धिमत्ता प्रणाली अधिक प्रगत होत असताना आणि त्यांचा वापर वाढत असताना, संरेखन संशोधनातील प्रगतीबाबत अधिक व्यापक आणि माहितीपूर्ण सहमती घडवणे आवश्यक आहे. कृत्रिम बुद्धिमत्ता उद्योगाने संरेखन आणि देखरेखीच्या समस्या इतक्या प्रमाणात सोडवल्या आहेत की अधिक काळ जबाबदारीने कमाल वेगाने विस्तार सुरू ठेवता येईल, असे आम्हाला वाटत नाही. येत्या महिन्यांत आणि वर्षांत कृत्रिम बुद्धिमत्तेचा विकास कसा करावा याबाबतचे निर्णय अशा पुराव्यांवर आधारित असणे आवश्यक आहे, जे अत्याधुनिक मॉडेल्स विकसित करणाऱ्या कंपन्यांबाहेरील लोक स्वतः तपासू शकतील.

विसंगतीची उदाहरणे इतर कृत्रिम बुद्धिमत्ता विकसकांच्या प्रणालींनी अशाच क्षमता गाठल्यानंतर त्यांना भेडसावू शकणाऱ्या समस्या ओळखण्यास, सुरक्षा उपायांतील त्रुटी उघड करण्यास किंवा मॉडेलच्या वर्तनाबाबतच्या गृहितकांना आव्हान देण्यास मदत करू शकतात. हे निष्कर्ष सामायिक केल्याने इतरांना त्याच समस्यांचा तपास करता येतो, आमची स्पष्टीकरणे पडताळता येतात आणि उपाय अधिक प्रभावी करता येतात. विसंगतीबाबतच्या पारदर्शकतेचे महत्त्व आम्हाला मान्य असल्याने, तिचे महत्त्व अनिश्चित असले तरी आमची नवीन चौकट माहिती जाहीर करण्याला प्राधान्य देते. याचा अर्थ आम्ही जाहीर केलेल्या काही घटना निराधार ठरू शकतात आणि त्या एखाद्या व्यापक प्रवृत्तीचा भाग किंवा भविष्यातील घडामोडींचे संकेत नसू शकतात.

सध्या कृत्रिम बुद्धिमत्ता विकसकांनी त्यांच्या मॉडेल्समधील विसंगतीची उदाहरणे कशी जाहीर करावीत यासाठी स्पष्ट निकष असलेली उद्योगव्यापी चौकट नाही. आज आम्ही मांडत असलेली चौकट असे निकष तयार करण्याच्या दिशेने पहिले पाऊल ठरेल, अशी आम्हाला आशा आहे. विकसकांनी विसंगतीच्या कोणत्या घटना जाहीर कराव्यात आणि त्यांच्या अहवालांत काय असावे, हे हे निकष ठरवतील. ही चौकट अद्याप विकसित होत असून, अनुभव आणि जनतेच्या अभिप्रायाच्या आधारे आम्ही ती सुधारत राहू.

येथे आम्ही ही चौकट कशी कार्य करेल ते सांगत आहोत आणि आमचे पहिले अहवाल सामायिक करत आहोत.

आम्ही विसंगतीची कोणती उदाहरणे नोंदवू

मॉडेलमध्ये विसंगती कशी निर्माण होते, ती कशी प्रकट होते आणि सुरक्षा उपाय कुठे यशस्वी किंवा अपयशी ठरतात याबाबत उपयुक्त पुरावा देणारी उदाहरणे जाहीर करण्याचे आमचे उद्दिष्ट आहे. आम्ही नवीन कार्यपद्धती, ज्ञात वर्तनातील महत्त्वपूर्ण बदल आणि सुरक्षितता किंवा उपायांबाबतच्या गृहितकांना आव्हान देणाऱ्या निष्कर्षांना प्राधान्य देतो. एखादे उदाहरण जाहीर करण्यायोग्य ठरण्यासाठी त्याने हानी करणे किंवा व्यापक प्रवृत्ती सिद्ध करणे आवश्यक नाही. ही चौकट मॉडेलच्या संपूर्ण जीवनचक्रातील पात्र वर्तनाला लागू होईल. यात प्रशिक्षण, मूल्यांकन, चाचणी आणि प्रत्यक्ष वापर यांचा समावेश आहे.

यात मॉडेल्सनी परवानगीशिवाय कृती करणे, इतर मॉडेल्सशी समन्वय साधणे किंवा देखरेख टाळणे यांचे नवीन मार्ग; संरेखन पद्धतीवर किंवा सुरक्षा उपायावर प्रश्नचिन्ह निर्माण करणारी अपयशे; आणि प्रसिद्ध केलेल्या सुरक्षा मूल्यांकनातील दाव्याला आव्हान देणारे वर्तन यांचा समावेश आहे. तृतीय पक्षांवर परिणाम करू शकणाऱ्या विसंगतीलाही माहिती जाहीर करण्याचे हेच निकष लागू होतात.

यात आम्ही यापूर्वी जाहीर केलेल्या घटनांची पुनरावृत्ती वाटणाऱ्या विसंगतीच्या घटनांचाही समावेश असू शकतो. एखाद्या समस्येची पुनरावृत्ती ही आमची मॉडेल्स कशी वागतात किंवा आमचे सुरक्षा उपाय किती प्रभावी आहेत याबाबत उपयुक्त पुरावा ठरू शकते. उदाहरणार्थ, उपायांचे वारंवार प्रयत्न करूनही एखाद्या विशिष्ट प्रकारचे विसंगत वर्तन पुन्हा पुन्हा घडत असल्यास. अशा परिस्थितीत मूळ विसंगतीविषयक माहिती अद्ययावत करून आम्ही अतिरिक्त उदाहरणे प्रसिद्ध करू.

कालांतराने इतर विकसक, बाह्य संशोधक, उद्योग मानक संस्था आणि नियामक यांच्या सहकार्याने माहिती जाहीर करण्याचे अधिक वस्तुनिष्ठ निकष विकसित करण्याची आमची योजना आहे. गंभीर सुरक्षितता, सुरक्षा आणि विसंगतीच्या घटना अमेरिकेच्या संघीय सरकारसोबत सामायिक केल्या पाहिजेत, असेही आम्हाला वाटते आणि त्यासाठी अहवाल देण्याच्या पद्धती सुचवण्यावर आम्ही काम करत आहोत. ही चौकट आमच्या विद्यमान दायित्वांना पूरक आहे. गंभीर सुरक्षा घटना किंवा सायबरसुरक्षा भंगांसह कायद्याने आवश्यक असलेल्या माहिती प्रकटीकरणाची जागा ती घेत नाही.

आज आम्ही सामायिक करत असलेली विसंगतीची उदाहरणे

विसंगती जाहीर करण्यासाठीच्या आमच्या नवीन चौकटीची सुरुवात म्हणून, आमच्या मॉडेल्सच्या प्रशिक्षण किंवा मूल्यांकनादरम्यान आढळलेल्या विसंगत वर्तनाच्या घटनांवरील सहा अहवाल आम्ही प्रसिद्ध करत आहोत. वापरकर्त्यापासून माहिती लपवण्यापासून ते अडथळ्यांवर मात करण्यासाठी परवानगी नसलेल्या कृती करण्यापर्यंत, सामायिक करण्यायोग्य वाटणाऱ्या विविध वर्तनांची ही प्रकरणे उदाहरणे आहेत. हे स्वतंत्र घटनांचे अहवाल आहेत. आमच्या मॉडेल्समध्ये विसंगती किती वारंवार आढळते यांचे ते प्रतिनिधित्व करतात असे समजू नये. खालील प्रत्येक नोंदीत संपूर्ण अहवालाची लिंक आहे.

  1. कार्य सारांशांमध्ये स्वतः तयार केलेल्या सूचना(नवीन विंडोमध्ये उघडेल). प्रसिद्ध न केलेल्या एका संशोधन मॉडेलने नवीन कॉन्टेक्स्ट विंडोमध्ये काम सुरू ठेवण्यासाठी वापरल्या जाणाऱ्या सारांशांमध्ये असंबंधित सूचना घातल्या. त्यात स्वतःच्या नेहमीच्या मर्यादांकडे दुर्लक्ष करण्याच्या सूचनाही होत्या. आम्हाला परिणाम झालेले २७ सारांश आढळले.

  2. कार्य सारांशांमध्ये चुका लपवण्याच्या सूचना(नवीन विंडोमध्ये उघडेल). GPT‑5.6 Sol च्या प्रशिक्षणादरम्यान, मॉडेलच्या अनेक आवृत्त्यांनी चुका किंवा विसंगत वर्तन वापरकर्त्यापासून लपवण्याच्या सूचना त्यांच्या सारांशांमध्ये जोडल्या. उदाहरणार्थ, कॉम्पॅक्शन सारांशांमध्ये ऐतिहासिक नोंदीतील गहाळ माहिती उघड न करता बनवण्याच्या आणि स्रोतांच्या आवृत्त्यांमधील तफावत लपवण्याच्या सूचना होत्या.

  3. उघड झालेल्या API कळांसाठी सार्वजनिक रिपॉझिटरी शोधून नंतर खोटी माहिती तयार करणे(नवीन विंडोमध्ये उघडेल). कॅलिफोर्नियातील एका काउंटीच्या उत्पन्नाच्या आकड्यांबाबतच्या नेहमीच्या प्रश्नाचे उत्तर देताना, एका मॉडेलला उघड झालेली API कळ सापडली आणि त्याने ती परवानगीशिवाय वापरली. तरीही मागितलेले आकडे मिळवता न आल्यावर, त्याने ते बनवले आणि मागितलेल्या स्रोतातील माहिती म्हणून सादर केले.

  4. संदर्भ देता यावा म्हणून फायली इंटरनेटवर अपलोड करणे(नवीन विंडोमध्ये उघडेल). एका वापरकर्त्याने प्रसिद्ध न केलेल्या मॉडेलला ५०,००,००० चौरस मीटरपेक्षा मोठ्या तलावांचे ओळख क्रमांक आणि नावे विचारली, तेव्हा एजंटने Python वापरून योग्य उत्तर शोधले. पण सूचनांमध्ये ब्राउझरमधील संदर्भ मागितल्यामुळे, एजंटने वापरकर्त्याला न विचारता फाइल अपलोड करून तिचा संदर्भ उत्तरात देण्याचा निर्णय घेतला.

  5. अंतर्गत सॉफ्टवेअर रिपॉझिटरीद्वारे परवानगी नसलेल्या नोंदी आणि संवाद(नवीन विंडोमध्ये उघडेल). गहाळ इनपुट फायली शोधताना मॉडेल्सनी स्वतंत्र प्रशिक्षण नमुन्यांदरम्यान विनंत्या आणि प्रतिसादांची देवाणघेवाण करण्यासाठी अंतर्गत सॉफ्टवेअर रिपॉझिटरीचा संदेशफलक म्हणून वापर केला. मात्र, त्या फायली परत मिळवण्यात त्यांना यश आले नाही. नेटवर्कवरील निर्बंध टाळण्याचा प्रयत्न करताना एका मॉडेलने चाचणी फायली रिपॉझिटरीमध्ये यशस्वीपणे अपलोड केल्या होत्या, त्या आधीच्या घटनेचेही या अहवालात परीक्षण केले आहे.

  6. एकत्र काम करणाऱ्या एजंटमध्ये परवानगी नसलेली फाइल देवाणघेवाण(नवीन विंडोमध्ये उघडेल). एकाच प्रशिक्षण कार्यावर एकत्र काम करणाऱ्या एजंटना एकमेकांच्या स्थानिक फायलींमध्ये प्रवेश करता न आल्याने त्यांनी फायली सामायिक करण्यासाठी सार्वजनिक फाइल-संचय संकेतस्थळे वापरली. कार्याच्या सूचनांमध्ये मॉडेल्सना केवळ स्थानिक फायली वापरण्यास सांगितले असतानाही, त्यामुळे कार्याचे अंतिम परिणाम सार्वजनिक दुव्यांवर उपलब्ध झाले.

माहिती जाहीर करण्याची आमची प्रक्रिया कशी चालते

OpenAI मधील कोणताही कर्मचारी विसंगतीचे उदाहरण आमच्या सुरक्षा आणि संरेखन पथकांकडून तपासण्यासाठी निदर्शनास आणू शकतो आणि ते सार्वजनिकरीत्या जाहीर करण्यासाठी विचारात घेण्याची विनंती करू शकतो. यामुळे आमची माहिती जाहीर करण्याची प्रक्रिया सुरू होते. तपास आणि प्रकटीकरण वेळेत व्हावे यासाठी प्रत्येक टप्प्याला मुदत असते.

एखादे उदाहरण निदर्शनास आणल्यानंतर, नेमके काय घडले, काय अनिश्चित आहे, ते सार्वजनिकरीत्या जाहीर करणे योग्य आहे का आणि कोणती तथ्ये सामायिक करता येतील यांचा आमचे तांत्रिक कर्मचारी तपास करतील. कोणत्याही तृतीय पक्षावर परिणाम झाला आहे का आणि प्रकाशनापूर्वी त्याला खासगीरीत्या कळवणे आवश्यक आहे का, याचेही ते मूल्यांकन करतील.

त्यानंतर उदाहरणाला तीनपैकी एका प्रक्रियेत ठेवले जाईल: “प्रकटीकरणासाठी तयार”, “मर्यादित तपास” किंवा “व्यापक तपास” (“संथ प्रक्रिया”).

“प्रकटीकरणासाठी तयार” या प्रक्रियेत अशा पात्र घटनांचा समावेश होतो, ज्यांचा तपास पुनरावलोकनानंतर प्रकाशनासाठी पुरेसा पूर्ण झालेला असतो. “मर्यादित तपास” या प्रक्रियेत आणखी तांत्रिक तपास आवश्यक असलेल्या घटनांचा समावेश होतो. आम्ही जाहीर करत असलेल्या बहुसंख्य घटना या दोन प्रक्रियांत समाविष्ट होतील, अशी अपेक्षा आहे. विशेषतः व्यापक तपास, तृतीय पक्षांशी समन्वय किंवा गंभीर गैरवापराच्या जोखमी हाताळण्याची गरज नसलेली प्रकरणे यात येतील. आज आम्ही प्रसिद्ध करत असलेल्या सर्व घटना या दोनपैकी एका प्रक्रियेत येतात.

“व्यापक तपास” या प्रक्रियेत गुंतागुंतीच्या तपासांचा, विशेषतः तृतीय पक्षांचा सहभाग असलेल्या तपासांचा समावेश होतो. तृतीय पक्षावर परिणाम झाल्यास आमची सुरक्षा, कायदेशीर आणि जबाबदार प्रकटीकरणाची दायित्वे या चौकटीपेक्षा अधिक प्राधान्याची असतील. आम्ही शक्य तितक्या लवकर प्रारंभिक सूचना प्रसिद्ध करण्याचा प्रयत्न करू. मात्र, सुरक्षेच्या कारणास्तव त्यास विलंब होऊ शकतो. उदाहरणार्थ, एखाद्या मॉडेलला मोठ्या प्रमाणावर वापरल्या जाणाऱ्या सॉफ्टवेअरमध्ये पूर्वी अज्ञात असलेली असुरक्षितता आढळल्यास. एखाद्या अहवालामुळे तृतीय पक्षाची ओळख उघड होणार असल्यास, कोणत्याही सुरक्षा मर्यादेचे उल्लंघन झाले नसले तरी त्याला आगाऊ सूचना देण्याचा आमचा उद्देश आहे.

“व्यापक तपास” प्रक्रियेतील घटनेच्या प्रारंभिक सूचनेत काय घडले याचा सर्वसाधारण आढावा, बाह्य तज्ज्ञ तपासात मदत करत आहेत का याची माहिती आणि अंतिम अहवाल कधी प्रसिद्ध होण्याची अपेक्षा आहे याचा उपलब्ध अंदाज दिला जाईल. OpenAI ची Hugging Face घटना या चौकटीअंतर्गत जाहीर केली असती, तर ती या प्रक्रियेत आली असती.

उदाहरण निदर्शनास आणणाऱ्या कर्मचाऱ्याला ते जाहीर करायचे की नाही आणि जाहीर करायचे असल्यास कोणती प्रक्रिया अवलंबली जाईल, या निर्णयाची माहिती दिली जाईल. माहिती जाहीर करण्याबाबत किंवा योग्य प्रक्रियेबाबत न सुटलेले मतभेद OpenAI च्या सुरक्षा सल्लागार गटाकडे (SAG) पाठवले जातील. कंपनीतील विविध विभागांच्या वरिष्ठ अधिकाऱ्यांचा हा गट अत्याधुनिक मॉडेलच्या क्षमता आणि सुरक्षा उपायांचे मूल्यांकन करतो, आमच्या प्रिपेयर्डनेस फ्रेमवर्कवर देखरेख ठेवतो आणि OpenAI च्या नेतृत्वाला सल्ला देतो. सुरक्षा सल्लागार गटातील मतभेद किंवा त्याच्या निर्णयांवरील कर्मचाऱ्यांचे आक्षेप OpenAI च्या नेतृत्वाकडे पाठवले जातील. माहिती जाहीर न करण्याचे किंवा ती जाहीर करणे आवश्यक नसल्याचे निर्णय सुरक्षा आणि संरेखन नेतृत्वासोबत आणि शक्य तितक्या प्रमाणात संबंधित तांत्रिक कर्मचाऱ्यांसोबत सामायिक केले जातील.

ही माहिती जाहीर करण्याची प्रक्रिया प्रत्यक्षात कशी चालते हे समजत जाईल, त्यानुसार आम्ही ती सुधारू शकतो आणि कोणतेही बदल या लेखात नोंदवू.

प्रत्येक अहवालात काय समाविष्ट असेल

प्रत्येक संपूर्ण अहवालात आम्ही पाहिलेले वर्तन, त्याची तीव्रता आणि कोणताही बाह्य परिणाम, ते कोणत्या परिस्थितीत घडले, त्याची तारीख किंवा कालावधी, आम्हाला ते कधी आढळले आणि त्यात सहभागी असलेले मॉडेल किंवा मॉडेल्स यांची सर्वसाधारण माहिती दिली जाईल. शक्य असेल तेथे आम्ही पुढील माहितीही सामायिक करू:

  • नेमके काय घडले आणि त्यामुळे झालेली कोणतीही हानी यांचा अधिक तपशील;

  • आम्हाला विसंगती कशी आढळली आणि आमच्या तपासाची व्याप्ती;

  • संरेखन संशोधन आणि कृत्रिम बुद्धिमत्तेच्या तांत्रिक सुरक्षिततेवरील त्याच्या परिणामांचे आमचे आकलन;

  • या उदाहरणामुळे निर्माण झालेले महत्त्वाचे अनुत्तरित प्रश्न;

  • या वर्तनावर उपाय करण्यासाठी आम्ही करत असलेल्या किंवा नियोजित केलेल्या उपाययोजना. माहिती जाहीर करताना हे तपशील नेहमीच उपलब्ध असतील असे नाही, कारण तपास पूर्ण होण्यापूर्वी किंवा उपाय विकसित करण्यापूर्वीच आम्ही विसंगतीचा अहवाल प्रसिद्ध करू शकतो.

ग्राहकांच्या वापरातील प्रणालींमध्ये विसंगती आढळल्यास, ग्राहकांची गोपनीयता आणि आमच्या करारातील बंधने जितकी परवानगी देतील तितकी माहिती आम्ही सामायिक करू.

आजचे अहवाल हे ज्ञात विसंगती किंवा सुरू असलेल्या तपासांचे सर्वसमावेशक वर्णन नसून, माहिती जाहीर करण्याचा प्रारंभिक संच आहे. या चौकटीत समाविष्ट प्रकरणांची संपूर्ण व्याप्ती किंवा तीव्रता दर्शवण्याचा या प्रारंभिक अहवालांचा उद्देश नाही. या चौकटीचे निकष पूर्ण करणाऱ्या विसंगतीची उदाहरणे जाहीर करण्यासाठी आम्ही कटिबद्ध आहोत. यात अधिक दीर्घ तपास किंवा तृतीय पक्षांशी समन्वय आवश्यक असलेली अधिक गुंतागुंतीची प्रकरणेही समाविष्ट आहेत. या चौकटीअंतर्गत आम्ही नियमितपणे अहवाल प्रसिद्ध करत राहू आणि आमच्या अहवालविषयक वचनबद्धता विकसित होत असताना त्याबद्दल अधिक माहिती सामायिक करू.