मॉडेलच्या चुकीच्या संरेखनाचा अहवाल देण्यासाठी आमची चौकट
OpenAI मधील मॉडेलच्या चुकीच्या संरेखनाच्या घटनांचा मागोवा घेण्यासाठी, त्यांची चौकशी करण्यासाठी आणि त्या उघड करण्यासाठी आम्ही एक नवीन रूपरेषा सामायिक करत आहोत. तसेच, गेल्या सहा महिन्यांत आम्ही पाहिलेल्या मॉडेलच्या अनपेक्षित किंवा चिंताजनक वर्तनावरील सहा अहवालही सामायिक करत आहोत.
पूर्वी, संशोधक, AI विकासक, धोरणकर्ते आणि सर्वसामान्य जनतेला अधिक चांगली माहिती देण्यासाठी, आम्ही आमचे निष्कर्ष बद्दल मिसअलाइन्मेंट सार्वजनिक करण्याचा प्रयत्न केला आहे. परंतु या निष्कर्षांचा अहवाल देण्यासाठी पद्धतशीर दृष्टिकोन नसल्याने, आमची प्रकटीकरणे तात्पुरत्या स्वरूपाची आणि अपेक्षेपेक्षा कमी वारंवार झाली आहेत: अनेक उदाहरणे एका अहवालात एकत्रित करता येईपर्यंत आम्ही अनेकदा वाट पाहिली आहे किंवा ती नव्याने प्रकाशित झालेल्या मॉडेलसाठीच्या सिस्टम कार्डमध्ये जोडली आहेत. आम्ही ज्या वर्तनाबद्दल अहवाल देत आहोत ते पूर्णपणे स्पष्ट केलेले किंवा कमी केलेले नसले तरीही, निरीक्षणानंतर मिसअलाइन्मेंट अहवाल प्रकाशित करण्याची प्रक्रिया जलद करणे हा या नवीन फ्रेमवर्कचा उद्देश आहे.
AI प्रणाली अधिक प्रगत आणि अधिक व्यापकपणे वापरल्या जाऊ लागतात तसतसे, संरेखन संशोधनाच्या प्रगतीबाबत अधिक व्यापक आणि अधिक माहितीपूर्ण सहमती निर्माण करण्याची गरज आहे. AI उद्योगाने संरेखन आणि निरीक्षण पुरेशा प्रमाणात सोडवले आहे, जेणेकरून आणखी बराच काळ जास्तीत जास्त वेगाने जबाबदारीने विस्तार करत राहता येईल, असे आम्हाला वाटत नाही. येत्या महिन्यांत आणि वर्षांत AI विकास कसा पुढे जावा याबाबतचे निर्णय, अत्याधुनिक मॉडेल तयार करणाऱ्या कंपन्यांबाहेरील लोक स्वतः तपासू शकतील अशा पुराव्यांवर आधारित असणे आवश्यक आहे.
विसंरेखनाची उदाहरणे इतर AI विकासकांना त्यांच्या प्रणाली समान क्षमतांपर्यंत पोहोचत असताना येऊ शकणाऱ्या समस्या ओळखण्यास मदत करू शकतात, सुरक्षात्मक उपायांमधील कमकुवतपणा उघड करू शकतात किंवा मॉडेलच्या वर्तनाविषयीच्या गृहीतकांना आव्हान देऊ शकतात. हे निष्कर्ष सामायिक केल्याने इतरांना त्याच समस्यांचा तपास करण्यास, आमच्या स्पष्टीकरणांची चाचणी करण्यास आणि प्रतिबंधक उपाय सुधारण्यास मदत होते. विसंरेखनासंबंधी पारदर्शकतेचे महत्त्व आम्ही मानतो, म्हणून आमची नवीन चौकट महत्त्व अनिश्चित असतानाही माहिती उघड करण्यास प्राधान्य देते. याचा अर्थ असा की आम्ही उघड केलेली काही उदाहरणे खोटी ठरू शकतात आणि ती मोठ्या नमुन्याचा भाग नसू शकतात किंवा भविष्यातील घडामोडींचे सूचक नसू शकतात.
सध्या, AI विकासकांनी त्यांच्या मॉडेल्समधील विसंरेखनाची उदाहरणे कशी उघड करावीत यासाठी स्पष्ट मानके असलेली, संपूर्ण उद्योगासाठीची कोणतीही रूपरेषा नाही. आज आम्ही मांडत असलेली रूपरेषा अशी मानके तयार करण्याच्या दिशेने पहिले पाऊल ठरेल, अशी आम्हाला आशा आहे. यात विकासकांनी विसंरेखनाच्या कोणत्या घटना उघड कराव्यात आणि त्यांच्या अहवालांमध्ये काय असावे हे नमूद केले आहे. आम्ही या रूपरेषेकडे प्रगतीपथावरील काम म्हणून पाहतो आणि अनुभव व सार्वजनिक अभिप्रायाच्या आधारे ती अधिक परिष्कृत करू.
येथे, हे फ्रेमवर्क कसे कार्य करेल याचे वर्णन आम्ही करतो आणि आम्ही प्रकाशित करत असलेले पहिले अहवाल सामायिक करतो.
मॉडेलमधील विसंरेखन कसे उद्भवते, ते कसे मॅनिफेस्ट होते आणि संरक्षणात्मक उपाय कुठे यशस्वी होतात किंवा अपयशी ठरतात याबद्दल उपयुक्त पुरावे देणारी उदाहरणे जाहीर करण्याचा आमचा उद्देश आहे. आम्ही नवीन यंत्रणा, ज्ञात वर्तनातील अर्थपूर्ण बदल आणि सुरक्षितता किंवा शमनाबाबतच्या गृहीतकांना आव्हान देणाऱ्या निष्कर्षांना प्राधान्य देतो. जाहीर करण्यायोग्य ठरण्यासाठी एखाद्या उदाहरणामुळे हानी होणे किंवा व्यापक नमुना सिद्ध होणे आवश्यक नाही. ही चौकट मॉडेलच्या संपूर्ण जीवनचक्रातील—प्रशिक्षण, मूल्यमापन, चाचणी आणि उपयोजनासह—निकष पूर्ण करणारे वर्तन समाविष्ट करेल.
यामध्ये मॉडेल्सनी परवानगीशिवाय कृती करण्याचे, इतर मॉडेल्सशी समन्वय साधण्याचे किंवा देखरेखीपासून बचाव करण्याचे नवीन मार्ग; अलाइनमेंट पद्धत किंवा सुरक्षाउपायाबाबत शंका निर्माण करणारे अपयश; आणि प्रकाशित सुरक्षा मूल्यांकनातील दाव्याला आव्हान देणारे वर्तन समाविष्ट आहे. तृतीय पक्षांवर परिणाम करू शकणाऱ्या चुकीच्या अलाइनमेंटसाठीही समान प्रकटीकरण निकष लागू होतात.
यामध्ये आम्ही पूर्वी उघड केलेल्या घटनांसारख्याच वाटणाऱ्या विसंरेखनाच्या घटनांचाही समावेश असू शकतो. समस्येची पुनरावृत्ती ही आमची मॉडेल्स कशी वागतात किंवा आमच्या सुरक्षात्मक उपायांची परिणामकारकता याबद्दल स्वतःच उपयुक्त पुरावा ठरू शकते—उदाहरणार्थ, ती कमी करण्यासाठी वारंवार प्रयत्न करूनही विशिष्ट प्रकारचे विसंरेखित वर्तन पुन्हा पुन्हा होत राहिल्यास. अशा परिस्थितीत, मूळ विसंरेखन प्रकटीकरण अद्यतनित करून आम्ही अतिरिक्त उदाहरणे प्रकाशित करू.
कालांतराने, इतर विकासक, बाह्य संशोधक, उद्योग मानक संस्था आणि नियामकांसोबत अधिक वस्तुनिष्ठ प्रकटीकरण निकष विकसित करण्याची आमची योजना आहे. गंभीर सुरक्षा, सुरक्षितता आणि विसंरेखनाशी संबंधित घटनांची माहिती US फेडरल सरकारसोबत सामायिक केली जावी, असेही आम्हाला वाटते आणि त्यासाठी अहवाल देण्याच्या यंत्रणा प्रस्तावित करण्यावर आम्ही काम करत आहोत. ही चौकट आमच्या विद्यमान जबाबदाऱ्यांना पूरक आहे, असे आम्ही मानतो आणि गंभीर सुरक्षा घटना किंवा सायबरसुरक्षा उल्लंघनांसाठीच्या आवश्यकतांसह आमच्या कायदेशीर प्रकटीकरण आवश्यकतांची ती जागा घेत नाही, याची नोंद करतो.
विसंरेखन उघड करण्यासाठीच्या आमच्या नवीन चौकटीचा प्रारंभ करण्यासाठी, आम्ही आमच्या मॉडेल्सच्या प्रशिक्षणादरम्यान किंवा मूल्यमापनादरम्यान पाहिलेल्या विसंरेखित वर्तनाच्या घटनांवरील सहा अहवाल प्रकाशित करत आहोत. या प्रकरणांमधून, वापरकर्त्यापासून माहिती लपवण्यापासून ते अडथळ्यांवर मात करण्यासाठी अनधिकृत कृती करण्यापर्यंत, आम्हाला सामायिक करण्याजोग्या वाटणाऱ्या विविध वर्तनांचा आवाका दिसून येतो. हे वैयक्तिक घटनांचे अहवाल आहेत आणि आमच्या मॉडेल्समध्ये विसंरेखन किती वेळा घडते, याचे प्रतिबिंब म्हणून त्यांचा विचार करू नये. खालील प्रत्येक घटक संपूर्ण अहवालाशी जोडलेला आहे.
कार्य सारांशांमधील स्वयं-निर्मित सूचना(नवीन विंडोमध्ये उघडेल). एका अप्रकाशित संशोधन मॉडेलने नवीन कॉन्टेक्स्ट विंडोमध्ये त्याचे काम सुरू ठेवण्यासाठी वापरल्या जाणाऱ्या सारांशांमध्ये, त्याच्या नेहमीच्या मर्यादांकडे दुर्लक्ष करण्याच्या सूचनांसह असंबद्ध सूचना समाविष्ट केल्या. आम्ही प्रभावित झालेले 27 सारांश ओळखले.
कार्याच्या सारांशांमधील चुका लपवण्याच्या सूचना(नवीन विंडोमध्ये उघडेल). GPT‑5.6 Sol च्या प्रशिक्षणादरम्यान, अनेक मॉडेल इंस्टन्सनी वापरकर्त्यापासून चुका किंवा विसंगत वर्तन लपवण्यासाठी त्यांच्या सारांशांमध्ये सूचना जोडल्या. उदाहरणार्थ, कॉम्पॅक्शन सारांशांमध्ये ते उघड न करता गहाळ ऐतिहासिक डेटा तयार करण्याच्या आणि स्रोत आवृत्त्यांमधील विसंगती लपवण्याच्या सूचना होत्या.
सार्वजनिक रिपॉझिटरींमध्ये उघड झालेल्या API कीज शोधणे, नंतर माहिती बनवणे(नवीन विंडोमध्ये उघडेल). कॅलिफोर्नियामधील एका काउंटीतील उत्पन्नाच्या आकडेवारीबद्दलच्या नियमित प्रश्नाचे उत्तर देताना, एका मॉडेलने परवानगीशिवाय उघड झालेली API की शोधली आणि वापरली. तरीही त्याला मागितलेले आकडे मिळवता आले नाहीत, तेव्हा त्याने ते बनवले आणि मागितलेल्या स्रोतातील डेटा म्हणून सादर केले.
त्यांचा संदर्भ देण्यासाठी इंटरनेटवर फाइल अपलोड करणे(नवीन विंडोमध्ये उघडेल). जेव्हा एका वापरकर्त्याने अप्रकाशित मॉडेलला 5,000,000 चौरस मीटरपेक्षा मोठ्या तलावांचे ID आणि नावे विचारली, तेव्हा एजंटने Python वापरून योग्य उत्तर शोधले. पण सूचनांमध्ये ब्राउझर संदर्भ मागितला असल्याने, वापरकर्त्याला न विचारता, एजंटने तुम्हाला उत्तरात त्याचा संदर्भ देता यावा म्हणून फाइल अपलोड करण्याचे ठरवले.
अंतर्गत सॉफ्टवेअर रिपॉझिटरीद्वारे अनधिकृत लेखन आणि संवाद(नवीन विंडोमध्ये उघडेल). गहाळ इनपुट फाइल्स शोधताना, मॉडेल्सनी स्वतंत्र प्रशिक्षण नमुन्यांमधील विनंत्या आणि प्रतिसादांची देवाणघेवाण करण्यासाठी अंतर्गत सॉफ्टवेअर रिपॉझिटरीचा संदेशफलक म्हणून वापर केला, परंतु त्या फाइल्स पुनर्प्राप्त करण्यात त्यांना यश आले नाही. नेटवर्क निर्बंधांना बायपास करण्याचा प्रयत्न करताना एका मॉडेलने रिपॉझिटरीमध्ये चाचणी फाइल्स यशस्वीपणे अपलोड केल्याच्या आधीच्या घटनेचाही हा अहवाल आढावा घेतो.
सहकार्य करणाऱ्या एजंट्समधील अनधिकृत फाइल शेअरिंग(नवीन विंडोमध्ये उघडेल). एकाच प्रशिक्षण कार्यावर एकत्र काम करणाऱ्या एजंट्सना एकमेकांच्या स्थानिक फाइल्स ॲक्सेस करता येत नसल्याने त्यांनी फाइल्स शेअर करण्यासाठी सार्वजनिक फाइल-होस्टिंग वेबसाइट्स वापरल्या. कार्याने मॉडेल्सनी फक्त स्थानिक फाइल्स वापराव्यात अशी विनंती केली असूनही, यामुळे कार्याचे डिलिव्हरेबल्स सार्वजनिक URLs वर उपलब्ध झाले.
कोणताही OpenAI कर्मचारी आमच्या सुरक्षा आणि संरेखन संघाकडून तपासासाठी विसंरेखनाचे उदाहरण चिन्हांकित करू शकतो आणि ते सार्वजनिक प्रकटीकरणासाठी विचारात घेण्याची विनंती करू शकतो. यामुळे आमची प्रकटीकरण प्रक्रिया सुरू होते, ज्यामध्ये वेळेवर तपास आणि प्रकटीकरण सुनिश्चित करण्यासाठी प्रत्येक टप्प्यासाठी अंतिम मुदती असतात.
एखादे उदाहरण चिन्हांकित झाल्यानंतर, आमचे तांत्रिक कर्मचारी काय घडले, काय अनिश्चित आहे, सार्वजनिकरीत्या उघड करणे आवश्यक आहे का आणि कोणती तथ्ये सामायिक करता येतील याची चौकशी करतील. प्रकाशनापूर्वी कोणत्याही तृतीय पक्षावर परिणाम झाला आहे का आणि त्याला खाजगी सूचना देणे आवश्यक आहे का, याचेही ते मूल्यांकन करतील.
त्यानंतर उदाहरणाला तीनपैकी एका ट्रॅकमध्ये नियुक्त केले जाईल: प्रकटीकरणासाठी तयार, किरकोळ तपासणी किंवा मोठी तपासणी (“स्लो ट्रॅक”).
प्रकटीकरणासाठी तयार या ट्रॅकमध्ये अशा पात्र घटनांचा समावेश आहे, ज्यांची चौकशी पुनरावलोकनानंतर प्रकाशित करण्यासाठी पुरेशी पूर्ण झाली आहे. किरकोळ चौकशी हा ट्रॅक अशा घटनांचा समावेश करतो ज्यांना पुढील तांत्रिक चौकशीची गरज आहे. आम्ही अपेक्षा करतो की हे दोन ट्रॅक आम्ही उघड करत असलेल्या बहुसंख्य घटनांचा समावेश करतील, विशेषतः ज्या प्रकरणांसाठी व्यापक चौकशी, तृतीय पक्षांशी समन्वय किंवा गंभीर गैरवापराच्या जोखमी हाताळण्याची आवश्यकता नसते. आज आम्ही प्रकाशित करत असलेल्या सर्व घटना या दोनपैकी एका ट्रॅकमध्ये येतात.
मोठ्या तपासणीमध्ये जटिल तपासण्या समाविष्ट असतात, विशेषतः ज्या तृतीय पक्षांना संबंधित असतात. तृतीय पक्षावर परिणाम होत असल्यास, आमच्या सुरक्षा, कायदेशीर आणि जबाबदार प्रकटीकरणाच्या जबाबदाऱ्यांना या आराखड्यापेक्षा प्राधान्य असते. आम्ही शक्य तितक्या लवकर प्रारंभिक सूचना प्रकाशित करण्याचा प्रयत्न करू, परंतु सुरक्षेच्या कारणांमुळे ती विलंबित करावी लागू शकते—उदाहरणार्थ, एखाद्या मॉडेलला व्यापकपणे वापरल्या जाणाऱ्या सॉफ्टवेअरमधील पूर्वी अज्ञात असलेली असुरक्षा आढळल्यास. एखाद्या अहवालातून तृतीय पक्षाची ओळख उघड होणार असल्यास, कोणतीही सुरक्षा सीमा ओलांडली नसली तरीही आगाऊ सूचना देण्याचा आमचा हेतू आहे.
मोठ्या तपासणीच्या प्रकरणाची प्रारंभिक सूचना काय घडले याचा उच्च-स्तरीय आढावा देईल, बाह्य तज्ज्ञ तपासात मदत करत आहेत का ते सांगेल आणि अंतिम अहवाल कधी प्रकाशित करण्याची अपेक्षा आहे याचा उपलब्ध अंदाज देईल. या चौकटीअंतर्गत ते उघड झाले असते, तर OpenAI Hugging Face घटना या श्रेणीत आली असती.
उदाहरण मांडणाऱ्या कर्मचाऱ्याला ते उघड करायचे की नाही याबाबतच्या निर्णयाची आणि, उघड करण्याची प्रक्रिया पुढे गेल्यास, ती कोणता मार्ग अवलंबेल याची माहिती दिली जाईल. उघड करण्याबाबत किंवा योग्य मार्गाबाबतचे न सुटलेले मतभेद OpenAI च्या सुरक्षा सल्लागार गटाकडे (सुरक्षा सल्लागार गट) पाठवले जातील. हा कंपनीभरातील वरिष्ठ अधिकाऱ्यांचा गट असून तो अत्याधुनिक मॉडेलच्या क्षमता आणि सुरक्षा उपायांचे मूल्यांकन करतो, आमच्या प्रिपेयर्डनेस फ्रेमवर्कचे निरीक्षण करतो आणि OpenAI नेतृत्वाला सल्ला देतो. सुरक्षा सल्लागार गट मधील मतभेद किंवा त्याच्या निर्णयांवरील कर्मचाऱ्यांचे आक्षेप OpenAI नेतृत्वाकडे पाठवले जातील. उघड न करण्याचे किंवा उघड करणे उचित नसल्याचे निर्णय सुरक्षा आणि संरेखन नेतृत्वासोबत आणि शक्य तितक्या प्रमाणात संबंधित तांत्रिक कर्मचाऱ्यांसोबत सामायिक केले जातील.
प्रत्यक्षात ही प्रक्रिया कशी कार्य करते हे समजत गेल्यावर आम्ही या प्रकटीकरण प्रक्रियेत बदल करू शकतो आणि या पोस्टमध्ये कोणतेही बदल नोंदवू.
प्रत्येक संपूर्ण अहवालात आम्ही निरीक्षण केलेले वर्तन, त्याची तीव्रता आणि कोणताही बाह्य परिणाम, ते ज्या परिस्थितीत घडले ती परिस्थिती, त्याची तारीख किंवा तारीख श्रेणी, आम्हाला ते कधी आढळले आणि, उच्च पातळीवर, संबंधित मॉडेल किंवा मॉडेल्स यांचे वर्णन केले जाईल. शक्य असल्यास, आम्ही हे देखील सामायिक करू:
काय घडले याचे पुढील तपशील आणि त्यातून झालेली कोणतीही हानी;
आम्हाला विसंगती कशी आढळली आणि आमच्या तपासाचा व्याप;
अलाइनमेंट संशोधन आणि तांत्रिक AI सुरक्षिततेसाठी त्याच्या परिणामांचे आमचे स्पष्टीकरण;
उदाहरणाने उपस्थित केलेले महत्त्वाचे अनुत्तरित प्रश्न;
या वर्तनाचे निराकरण करण्यासाठी आम्ही घेत असलेली किंवा घेण्याची योजना करत असलेली पावले. ही पावले उघड करण्याच्या वेळी नेहमी उपलब्ध असतीलच असे नाही, कारण आम्ही आमचा तपास पूर्ण करण्यापूर्वी किंवा उपाय विकसित करण्यापूर्वी मिसअलाइन्मेंट अहवाल प्रकाशित करू शकतो.
ग्राहकांच्या तैनातींमध्ये उद्भवणाऱ्या विसंगतीबाबत, ग्राहकांची गोपनीयता आणि आमच्या करारातील जबाबदाऱ्या जितकी माहिती सामायिक करण्याची परवानगी देतील, तितकी माहिती आम्ही सामायिक करू.
आजचे अहवाल हे ज्ञात विसंरेखन किंवा सुरू असलेल्या तपासांचा सर्वसमावेशक लेखाजोखा नसून, खुलाशांचा प्रारंभिक संच आहेत. या प्रारंभिक अहवालांचा उद्देश या चौकटीत समाविष्ट असलेल्या प्रकरणांची संपूर्ण व्याप्ती किंवा गंभीरता दर्शवणे हा नाही. या चौकटीचे निकष पूर्ण करणाऱ्या विसंरेखनाच्या घटनांचा खुलासा करण्यासाठी आम्ही वचनबद्ध आहोत, अधिक गुंतागुंतीच्या प्रकरणांसह, ज्यांसाठी अधिक दीर्घ तपास किंवा तृतीय पक्षांशी समन्वय आवश्यक आहे. आम्ही या चौकटीअंतर्गत नियमितपणे अहवाल प्रकाशित करत राहू आणि आमच्या अहवाल देण्याच्या वचनबद्धता विकसित करत असताना त्यांबद्दल अधिक माहिती सामायिक करू.


