अत्याधुनिक कृत्रिम बुद्धिमत्ता प्रशिक्षणासाठी सुरक्षा युक्तिवादांच्या दिशेने
आमच्या मते, आपण एका नव्या युगात प्रवेश करत आहोत. यात अत्याधुनिक रीइन्फोर्समेंट लर्निंगचे कोणतेही प्रशिक्षण सत्र पुढे सुरू ठेवण्याआधी संरचित सुरक्षा दस्तऐवजीकरण अनिवार्य असले पाहिजे. आदर्शतः, अशा दस्तऐवजीकरणाने “सुरक्षा युक्तिवादां”ची पातळी गाठली पाहिजे. म्हणजेच, जिथे सुरक्षा अत्यंत महत्त्वाची असते अशा इतर उद्योगांमध्ये वापरले जाणारे, जोखमीबाबतचे सर्वसमावेशक, संरचित आणि पुराव्याधारित युक्तिवाद. सुरक्षा युक्तिवाद हे आमच्या प्रयत्नांना दिशा देणारे महत्त्वाकांक्षी ध्येय आहे. मात्र, कृत्रिम बुद्धिमत्तेच्या क्षमतेच्या प्रत्येक नव्या पातळीवर उद्भवणाऱ्या गुंतागुंतीमुळे, विमान वाहतूक किंवा अणुऊर्जेइतकेच काटेकोर सुरक्षा युक्तिवाद कृत्रिम बुद्धिमत्ता मॉडेलसाठी तयार करणे आव्हानात्मक आहे, हेही आम्ही मान्य करतो. या कार्यपद्धतींना नियमबद्ध स्वरूप देण्यासाठी आम्ही एका आराखड्यावर काम करत आहोत.
अत्याधुनिक कृत्रिम बुद्धिमत्ता प्रशिक्षणासाठीच्या अशा सुरक्षा युक्तिवादांमध्ये असावीत, असे आम्हाला वाटणारी काही प्राथमिक मार्गदर्शक तत्त्वे खाली दिली आहेत. या उत्तम कार्यपद्धती आमच्या आतापर्यंतच्या शिकवणुकीवर आधारित आहेत. काळजीपूर्वक विकासासाठीच्या अंतर्गत प्रक्रियांत आम्ही सतत सुधारणा करत राहू, तशा या पद्धतीही विकसित होतील, अशी आमची अपेक्षा आहे. आमची सध्याची भूमिका पारदर्शकपणे मांडण्यासाठी आणि समुदायाकडून अभिप्राय मागवण्यासाठी आम्ही त्या आता सामायिक करत आहोत. लक्षात घ्या की हा दस्तऐवज अत्याधुनिक रीइन्फोर्समेंट लर्निंग प्रशिक्षणावर केंद्रित आहे; अंतर्गत आणि बाह्य उपयोजनासाठी उद्दिष्ट-सुसंगतीशी संबंधित गुणधर्मांचा अधिक व्यापक विचार करावा लागतो.
सुरक्षा युक्तिवादांमध्ये तांत्रिक व्यवस्थेच्या तीन पैलूंचा समावेश असावा: उद्दिष्ट-सुसंगती प्रशिक्षण, बंदिस्तता आणि निरीक्षण. या संरक्षण उपायांमुळे मॉडेल उद्दिष्टांशी विसंगत कृती करण्याचा प्रयत्न करणार नाही, तसा प्रयत्न केलाच तरी बंदिस्ततेतून बाहेर पडणे कठीण असेल आणि हानी होण्याआधीच निरीक्षणातून ते लक्षात येईल, याची खात्री करण्यास मदत होते.
मॉडेलची उद्दिष्ट-सुसंगती: मॉडेलना उद्दिष्टांशी सुसंगत राहण्याचे, म्हणजेच आपल्या अपेक्षेप्रमाणे विश्वासार्हपणे वागण्याचे प्रशिक्षण देणे, हा संरक्षणाचा पहिला स्तर असावा. यात पुढील बाबींचा समावेश असू शकतो:
प्रशिक्षण वातावरणे आणि गुणांकन: प्रशिक्षणादरम्यान बक्षीस मिळवण्यासाठी वापरलेल्या पळवाटांना सकारात्मक प्रोत्साहन मिळू न दिल्यास मॉडेलमध्ये उद्दिष्टांशी विसंगत वर्तन विकसित होण्याचा धोका कमी करता येईल. यात पुढील बाबींचा समावेश असू शकतो:
माहितीसंचांचे स्वयंचलित पुनरावलोकन: अपेक्षित वर्तनाऐवजी त्रुटींचा गैरफायदा घेऊन विसंगत कृतीक्रमांना मोठे बक्षीस मिळवून देऊ शकणारी रीइन्फोर्समेंट लर्निंग वातावरणे शोधण्यासाठी आणि दुरुस्त करण्यासाठी एजंट वापरावेत. यामुळे प्रशिक्षणादरम्यान उद्दिष्ट-विसंगतीला प्रोत्साहन मिळण्याच्या संधी कमी होतील.
माहितीसंचांचे मानवी पुनरावलोकन: उद्दिष्टांशी विसंगत वर्तनाला अनवधानाने प्रोत्साहन देऊ शकणारी सदोष कार्ये शोधण्यासाठी, स्वयंचलित रेड टीमिंगला पूरक म्हणून माहितीसंचांचे मानवी पुनरावलोकन आणि गुणवत्ता तपासण्या कराव्यात.
गुणांकन यंत्रणांचे समायोजन: प्रशिक्षणादरम्यान रीइन्फोर्समेंट लर्निंग वातावरणातील त्रुटींचा गैरफायदा घेण्याच्या किंवा त्यात फेरफार करण्याच्या मॉडेलच्या प्रयत्नांना दंड मिळेल, अशा प्रकारे गुणांकन यंत्रणा समायोजित कराव्यात.
आधीच्या सत्रांचे विश्लेषण: गुणांकन यंत्रणा अपेक्षेप्रमाणे काम करत असल्याची खात्री करण्यासाठी आधीच्या प्रयोगांतील कृतीनोंदींवर वर्गीकरण यंत्रणा चालवाव्यात.
उद्दिष्ट-सुसंगतीचे मापन: उद्दिष्ट-सुसंगती प्रशिक्षणाची परिणामकारकता मोजण्यासाठी मॉडेलमधील उद्दिष्ट-विसंगतीच्या प्रवृत्तींचा मागोवा घेणारी मूल्यमापने करावीत. यात पुढील बाबींचा समावेश असू शकतो:
प्रत्यक्ष वापराबाहेरील उद्दिष्ट-सुसंगती मूल्यमापने: अत्याधुनिक प्रशिक्षण सत्रांदरम्यान उद्दिष्ट-सुसंगतीची मूल्यमापने करून प्रशिक्षण अपेक्षेप्रमाणे चालले आहे का ते तपासावे आणि कोणत्याही लक्षणीय घसरणीचा शोध घ्यावा.
पूर्वघटनांवर पडताळणी: उद्दिष्ट-सुसंगतीची मूल्यमापने पूर्वीच्या घटनांवर तपासावीत, जेणेकरून ती पूर्वी उद्दिष्टांशी विसंगत असलेली मॉडेल ओळखतात आणि केवळ विशिष्ट घटनांपुरतीच अतिअनुकूलित केलेली नाहीत, याची खात्री होईल.
मूल्यमापनाला चकवा देण्यावर लक्ष ठेवणे: वर्तनात बदल घडवू शकणाऱ्या मूल्यमापन जागरूकतेचा किंवा चाचणीची जाणीव झाल्याने ती आपल्या फायद्यासाठी वापरण्याच्या प्रयत्नांचा मागोवा घ्यावा. यासाठी अडवणुकीचे ठरावीक उंबरठे असावेत (उदा., उद्दिष्ट-सुसंगती मूल्यमापनांमध्ये अशा जागरूकतेवर आणि प्रयत्नांवर लक्ष ठेवणाऱ्या यंत्रणा सक्षम कराव्यात).
अत्यंत प्रतिकूल परिस्थितीतील ताणचाचण्या: सर्वाधिक गंभीर गैरवर्तन उद्भवेल अशी परिस्थिती निर्माण करावी आणि किमान एक मूल्यमापन ते शोधू शकते का हे तपासावे.
चेन-ऑफ-थॉटवर आधारित प्रशिक्षण टाळणे: मॉडेल चेन-ऑफ-थॉट निरीक्षण यंत्रणांना चकवा देण्यास शिकू नयेत म्हणून रीइन्फोर्समेंट लर्निंगमध्ये स्वयंचलित गुणांकन यंत्रणांना चेन-ऑफ-थॉट पाहू देऊ नये.
बंदिस्तता: मॉडेल उद्दिष्टांशी विसंगत झाले तरी हानिकारक कृती घडू नयेत, यासाठी विलगीकृत कार्यक्षेत्र आणि सुरक्षा पुरेशी मजबूत करावी. यात पुढील बाबींचा समावेश असू शकतो:
पायाभूत सुविधांच्या सुरक्षेचे अनेक स्तर: मॉडेल चालते ते विलगीकृत कार्यक्षेत्र आणि त्या कार्यक्षेत्राला आधार देणाऱ्या संशोधनाच्या पायाभूत सुविधा, या दोन्हींच्या सुरक्षा बळकटीकरणात मोठी गुंतवणूक करावी. यामुळे मॉडेल विलगीकृत कार्यक्षेत्रातून निसटले तरी संरक्षणाचा आणखी एक स्तर उपलब्ध असेल.
बंदिस्ततेचे रेड टीमिंग: सुरक्षा विश्लेषणाच्या अधीन राहून, अत्याधुनिक प्रशिक्षण सत्रांतील जतन केलेल्या मध्यवर्ती आवृत्त्या वापरून या यंत्रणांचे वारंवार रेड टीमिंग करावे. त्यातून उणिवा शोधून दूर कराव्यात आणि विलगीकृत कार्यक्षेत्र, संशोधनाच्या पायाभूत सुविधा व बाह्य सीमा यांची सुरक्षा सुधारावी. प्रशिक्षणादरम्यान मॉडेलचा संपर्क येऊ शकणाऱ्या सर्व सेवांचीही आक्रमक सुरक्षा चाचणी करावी (उदा., आंतरजालातील माहितीचा तात्पुरता साठा).
नमुन्यांदरम्यान संवाद: नमुन्यांदरम्यान मोठ्या प्रमाणावर माहितीची देवाणघेवाण केवळ बहु-एजंट साधनव्यवस्थेसारख्या मंजूर मार्गांनीच होऊ द्यावी. पायाभूत सुविधांतील मोठ्या प्रमाणावर माहिती वाहून नेऊ शकणारे आणि एजंटना सहज सापडू शकणारे अप्रत्यक्ष संवादमार्ग बंद करावेत.
अपरिवर्तनीय संवादनोंदी: सर्व रीइन्फोर्समेंट लर्निंग प्रशिक्षण, मूल्यमापन आणि अंतर्गत उपयोजनांतील एजंटच्या संवादनोंदी वाजवी कालावधीसाठी बदल करता येणार नाही अशा प्रकारे जतन कराव्यात (उदा., एकदाच लिहिता येणाऱ्या संचयन खात्यांमध्ये). यामुळे घटनांचा विश्वासार्ह तपास करता येईल आणि अनवधानाने होणारे बदल टाळता येतील.
निरीक्षण: मॉडेल उद्दिष्टांशी विसंगत कृती करू लागल्यास संभाव्य विसंगती शोधण्यासाठी प्रत्यक्ष वेळेत निरीक्षण करणारी यंत्रणा असावी. गंभीर घटना घडण्याआधी प्राधान्याच्या समस्यांवर वेगाने उपाय करावेत. यात पुढील बाबींचा समावेश असू शकतो:
निरीक्षणक्षमता अनिवार्य करणे: चिंताजनक वर्तन लवकर ओळखता यावे म्हणून मॉडेलचे निरीक्षण करता येत असल्याची खात्री करावी. त्यासाठी स्पष्ट उंबरठे असलेल्या, निरीक्षणक्षमता आणि निरीक्षणाला चकवा देण्याच्या क्षमतेच्या मूल्यमापनांतून मोजमाप करावे.
ज्ञात समस्या शोधण्याचा उच्च दर: प्रशिक्षणापासून वेगळे ठेवलेल्या मूल्यमापनात निरीक्षण यंत्रणा पूर्वीच्या घटनांपैकी मोठ्या प्रमाणातील घटना शोधू शकते, याची खात्री करावी.
निरीक्षण यंत्रणांसाठी अद्ययावत मूल्यमापने: नव्या सत्रांसाठी पूर्णपणे नव्या जोखमींचे प्रतिनिधित्व करणारे मूल्यमापन नमुने तयार करावेत. यामुळे निरीक्षण यंत्रणांच्या समस्या शोधण्याच्या दराची आणि अचूकतेची मोजमापे कालबाह्य होणार नाहीत.
जलद प्रतिसाद: मॉडेलने हानी करण्याआधी, निश्चित सेवा-स्तर करारातील वेळेत कृती घडवून आणणारे प्राधान्य इशारे लागू करावेत. त्यासाठी तत्पर सेवेसाठी नियुक्त व्यक्तीला तातडीचा संदेश पाठवावा किंवा प्रभावित सत्र आपोआप थांबवावे (उदा., दिवसा घटना घडल्यास तत्पर सुरक्षा कर्मचाऱ्याला आणि सत्रप्रमुखाला संदेश पाठवावा; रात्री इशाऱ्यांची दखल न घेतल्यास सत्रे आपोआप थांबवावीत).
तांत्रिक संरक्षण उपायांच्या शिफारशींसोबतच, अत्याधुनिक कृत्रिम बुद्धिमत्तेच्या प्रशिक्षण सत्रासाठी सुरक्षा युक्तिवाद तयार करताना अवलंबायच्या उत्तम कार्यपद्धतींवरही आम्ही काम करत आहोत. यांमध्ये पुढील बाबींचा समावेश असू शकतो:
असहमती नोंदवणे (संभाव्य अपयशाचे पूर्वविश्लेषण): सुरक्षा युक्तिवादाचा मसुदा तयार झाल्यानंतर, त्यातील संभाव्य उणिवा शोधण्यासाठी दुसऱ्या संघातील सदस्याने लेखी असहमती नोंदवावी आणि जोखमीचे संतुलित आकलन मांडावे. त्यानंतर प्रशिक्षण संघाने या मुद्द्यांवर उपाय करावेत, जेणेकरून सुरक्षा युक्तिवाद अधिक भक्कम होतील.
मंजुऱ्या: वरिष्ठ नेतृत्वातील सदस्यांनी सुरक्षा युक्तिवादाचा आढावा घ्यावा. प्रशिक्षण सत्रावर अनेक अंतर्गत नियंत्रण यंत्रणा असाव्यात यासाठी या प्रत्येक सदस्याला सत्र रोखण्याचा अधिकार असावा (उदा., संशोधन विभागप्रमुख / उपाध्यक्ष, सुरक्षा प्रमुख आणि मुख्य शास्त्रज्ञ).
उत्तरदायित्व: प्रशिक्षण सत्राची जबाबदारी असलेला वरिष्ठ अधिकारी (उदा., संशोधन विभागप्रमुख / संशोधन उपाध्यक्ष) सुरक्षा युक्तिवाद आणि कोणत्याही घटनेला दिलेल्या प्रतिसादासाठी उत्तरदायी असावा. कामगिरीच्या आढाव्यातही हे विचारात घ्यावे, जेणेकरून प्रशिक्षण संघांनाही सुरक्षा आणि उद्दिष्ट-सुसंगतीसाठी प्रयत्न करण्यास प्रोत्साहन मिळेल.
सत्रे थांबवणे: सुरक्षा युक्तिवाद अवैध ठरवणाऱ्या समस्या आढळल्यास (उदा., नवी सुरक्षा समस्या), त्याच्या कक्षेत येणारी सर्व सत्रे थांबवण्यासाठी कृतीसूची, तांत्रिक नियंत्रणे आणि सेवा-स्तर करार उपलब्ध असल्याची खात्री करावी.
अंतर्गत पारदर्शकता: सुरक्षा युक्तिवाद अंतर्गत देखरेख गटांना (उदा., सुरक्षा आणि संरक्षण समिती) उपलब्ध करून द्यावेत.
लेखापरीक्षणे: सुरक्षा युक्तिवादातील दावे वैध आणि भक्कम आहेत का हे पडताळण्यासाठी आणि आढळलेल्या उणिवा नोंदवण्यासाठी लेखापरीक्षकांना पुरेसा प्रवेश द्यावा.
वरिष्ठांकडे प्रकरणे सोपवणे: उद्दिष्ट-विसंगतीची प्रकरणे वरिष्ठांकडे सोपवण्यासाठी स्पष्ट प्रक्रिया आणि विसंगतीच्या निश्चित केलेल्या तीव्रता पातळ्यांचा तक्ता असावा. प्रशिक्षण सत्रातील विसंगती विशिष्ट तीव्रता पातळीवर पोहोचल्यास वरिष्ठ अधिकाऱ्यांना (उदा., मुख्य कार्यकारी अधिकारी) तातडीचा संदेश पाठवू शकणारी व्यक्ती तत्पर सेवेसाठी नियुक्त असावी.
तांत्रिक नियंत्रणे: माणसांना आणि एजंटना नियमांचे पालन न करणारी सत्रे सुरू करणे कठीण असावे. निरीक्षण आणि स्वयंचलितपणे सत्र थांबवणे यांसारखी सुरक्षा वैशिष्ट्ये निकामी झाल्यास सत्रही थांबले पाहिजे (उदा., योग्य निरीक्षण सक्षम केल्याशिवाय सत्रे सुरू करता येऊ नयेत किंवा रीइन्फोर्समेंट लर्निंग प्रशिक्षण, मूल्यमापन अथवा अंतर्गत उपयोजनातून निरीक्षण यंत्रणा बंद करता येऊ नये).
परिणाम पूर्ववत करण्याची क्षमता: उद्दिष्टांशी विसंगत मॉडेलचा प्रशिक्षण प्रक्रियेतील पुढील टप्प्यांवर कुठे कुठे वापर झाला आहे (उदा., माहिती निर्मिती किंवा गुणांकन), हे सहज ओळखता यावे. त्यामुळे गरज पडल्यास विसंगत प्रतिसादांचे परिणाम पूर्ववत करता येतील.
उर्वरित जोखमींची संपूर्ण नोंद: सध्या लागू असलेल्या जोखीम-कपात उपायांनी हाताळल्या न जाणाऱ्या उर्वरित जोखमींची शक्य तितकी सर्वसमावेशक यादी सुरक्षा युक्तिवादांमध्ये द्यावी, जेणेकरून संपूर्ण माहितीच्या आधारे जोखीम स्वीकारण्याचे निर्णय घेता येतील.
या आमच्या सध्याच्या शिफारशी आहेत आणि OpenAI मध्ये त्यांची अंमलबजावणी सुरू आहे. येत्या काही आठवड्यांत आमच्या कार्यपद्धती विकसित होत राहतील, अशी आमची अपेक्षा आहे.
कृत्रिम बुद्धिमत्तेतील उद्दिष्ट-विसंगतीच्या गंभीर घटनांचा तपास करण्यासाठीही आम्ही काही उत्तम कार्यपद्धती विकसित करत आहोत. भविष्यात अशा घटना टाळता याव्यात म्हणून प्रयोगशाळांनी प्रत्येक घटनेतून शक्य तितके शिकण्याचा प्रयत्न करावा (गंभीर परिणामांचा धोका असलेल्या इतर उद्योगांतील तपास पद्धतींप्रमाणे(नवीन विंडोमध्ये उघडेल)). अशा कृतींची काही उदाहरणे:
अंतर्गत पारदर्शकता: तपास पूर्ण होण्यास बराच वेळ लागू शकतो. त्यामुळे घटनांच्या तपासाची अद्ययावत माहिती नियमितपणे संस्थेत सादर करावी (उदा., सुरू असलेल्या तपासांबाबत रोजची अद्ययावत माहिती). कर्मचाऱ्यांना अधिक प्रवेश मिळवण्यासाठी निश्चित मार्ग उपलब्ध असावेत. यात मूळ संवादनोंदी पाहणे आणि उद्दिष्टांशी विसंगत मॉडेलमधून प्रतिसादांचे नमुने घेणे यांचा समावेश असावा, जर ते सुरक्षित आणि त्यांच्या कामाशी संबंधित असेल.
उद्दिष्ट-विसंगतीचे मूळ कारण: विसंगत वर्तन कसे निर्माण झाले हे समजण्यासाठी संशोधकांनी प्रशिक्षणातील घडामोडींच्या मुळाशी जावे (उदा., विशिष्ट घटक वगळून केलेले प्रयोग किंवा पुन्हा नमुने घेण्याचे प्रयोग). यामुळे उद्दिष्ट-विसंगतीमागील शास्त्र अधिक चांगले समजेल आणि भविष्यात ती अधिक प्रभावीपणे टाळता येईल.
घटनोत्तर विश्लेषण: घटनेला कारणीभूत ठरलेल्या सर्व बाबी समजून घेण्यासाठी कार्यपद्धती आणि संस्थात्मक संस्कृतीचे घटनोत्तर विश्लेषण करावे. उदाहरणार्थ, समस्या का निर्माण झाल्या आणि घटनेपूर्वी त्या का आढळल्या नाहीत किंवा वरिष्ठांपर्यंत का पोहोचवल्या गेल्या नाहीत, हे तपासावे.
शोध: घटनेतून मिळालेल्या माहितीच्या (उदा., संवादनोंदी किंवा घटनेचा सारांश) आधारे थेट कामगिरी सुधारत न जाता, अशी घटना घडवण्याची प्रवृत्ती शोधू शकणाऱ्या उद्दिष्ट-सुसंगती चाचणी पद्धती आपण विकसित केल्या पाहिजेत. भविष्यातील मॉडेलमध्ये अगदी तत्सम घटनांत उद्दिष्ट-विसंगतीची प्रवृत्ती दिसू नये, याची खात्री करण्यासाठी घटनांवर आधारित मूल्यमापने “पुनरावृत्ती-प्रतिबंधक चाचण्या” म्हणून तयार करावीत.
सार्वजनिक प्रकटीकरण: तपास पूर्ण झाल्यानंतर त्याचे निष्कर्ष, घटनोत्तर विश्लेषणे आणि कार्यपद्धतींतील बदल जनतेसमोर मांडावेत. प्रभावित तृतीय पक्षांना शक्य तितक्या लवकर कळवावे.


