हम OpenAI में मॉडल मिसअलाइनमेंट के मामलों पर नज़र रखने, उनकी जांच करने और उनका खुलासा करने के लिए एक नया फ़्रेमवर्क साझा कर रहे हैं. इसके साथ पिछले छह महीनों में हमारे सामने आए अप्रत्याशित या चिंताजनक मॉडल व्यवहार पर छह रिपोर्ट भी जारी की जा रही हैं.
पहले भी शोधकर्ताओं, एआई डेवलपरों, नीति-निर्माताओं और आम जनता को बेहतर जानकारी देने के लिए हमने मिसअलाइनमेंट पर अपने निष्कर्षों को सार्वजनिक करने का प्रयास किया है. लेकिन इन निष्कर्षों की रिपोर्टिंग का व्यवस्थित तरीका न होने के कारण हमारे खुलासे छिटपुट और अपेक्षा से कम रहे हैं. हम अक्सर कई मामलों को एक रिपोर्ट में संकलित करने तक प्रतीक्षा करते थे या उन्हें नए जारी किए गए मॉडलों के सिस्टम कार्ड में जोड़ देते थे. इस नए फ़्रेमवर्क का उद्देश्य मिसअलाइनमेंट दिखने के बाद उसकी रिपोर्ट शीघ्र प्रकाशित करना है, भले ही हम उस व्यवहार की पूरी व्याख्या न कर पाए हों या उसके प्रभाव कम न कर पाए हों.
एआई प्रणालियां अधिक उन्नत और व्यापक रूप से परिनियोजित हो रही हैं, इसलिए हमें अलाइनमेंट शोध की प्रगति पर अधिक व्यापक और बेहतर जानकारी से समर्थित सहमति बनानी होगी. हमारा मानना नहीं है कि एआई उद्योग ने अलाइनमेंट और निगरानी की समस्या इतनी अच्छी तरह हल कर ली है कि वह बहुत लंबे समय तक पूरी गति से जिम्मेदारीपूर्वक विस्तार जारी रख सके. आने वाले महीनों और वर्षों में एआई का विकास कैसे आगे बढ़े, इससे जुड़े निर्णय ऐसे साक्ष्यों पर आधारित होने चाहिए जिनकी अत्याधुनिक मॉडल बनाने वाली कंपनियों से बाहर के लोग स्वयं जांच कर सकें.
मिसअलाइनमेंट के उदाहरण ऐसी समस्याओं की पहचान में मदद कर सकते हैं जिनका सामना अन्य एआई डेवलपर समान क्षमताएं हासिल करने पर कर सकते हैं. वे सुरक्षा उपायों की कमजोरियां उजागर कर सकते हैं या मॉडल व्यवहार संबंधी धारणाओं को चुनौती दे सकते हैं. इन निष्कर्षों को साझा करने से दूसरे लोग उन्हीं समस्याओं की जांच, हमारी व्याख्याओं का परीक्षण और प्रभाव घटाने के उपायों में सुधार कर सकते हैं. मिसअलाइनमेंट के बारे में पारदर्शिता को हम महत्वपूर्ण मानते हैं, इसलिए हमारा नया फ़्रेमवर्क महत्व अनिश्चित होने पर भी खुलासे को प्राथमिकता देता है. इसका अर्थ है कि हमारे द्वारा बताए गए कुछ मामले निराधार साबित हो सकते हैं और संभव है कि वे किसी बड़े पैटर्न का हिस्सा न हों या भविष्य के घटनाक्रमों का संकेत न दें.
फिलहाल पूरे उद्योग के लिए ऐसा कोई फ़्रेमवर्क नहीं है, जिसमें यह स्पष्ट मानक हों कि एआई डेवलपर अपने मॉडलों में मिसअलाइनमेंट के उदाहरणों का खुलासा कैसे करें. हमें आशा है कि आज प्रस्तुत किया जा रहा फ़्रेमवर्क ऐसे मानक बनाने की दिशा में पहला कदम होगा. ये मानक तय करेंगे कि डेवलपरों को मिसअलाइनमेंट के किन मामलों का खुलासा करना चाहिए और उनकी रिपोर्ट में क्या होना चाहिए. हम इस फ़्रेमवर्क को प्रगति पर चल रहा कार्य मानते हैं और अनुभव तथा सार्वजनिक प्रतिक्रिया के आधार पर इसे बेहतर बनाएंगे.
यहां हम बताते हैं कि यह फ़्रेमवर्क कैसे काम करेगा और अपनी पहली प्रकाशित रिपोर्ट साझा करते हैं.
हमारा लक्ष्य ऐसे उदाहरणों का खुलासा करना है जो इस बारे में उपयोगी साक्ष्य दें कि मॉडल मिसअलाइनमेंट कैसे पैदा होता और प्रकट होता है तथा सुरक्षा उपाय कहां सफल या विफल होते हैं. हम नए तंत्रों, ज्ञात व्यवहार में सार्थक बदलावों और सुरक्षा या प्रभाव घटाने के उपायों संबंधी धारणाओं को चुनौती देने वाले निष्कर्षों को प्राथमिकता देते हैं. खुलासे योग्य होने के लिए किसी उदाहरण का हानि पहुंचाना या किसी व्यापक पैटर्न को स्थापित करना जरूरी नहीं है. यह फ़्रेमवर्क मॉडल के पूरे जीवनचक्र में मानदंडों पर खरे उतरने वाले व्यवहार को शामिल करेगा, जिसमें प्रशिक्षण, मूल्यांकन, परीक्षण और परिनियोजन शामिल हैं.
इसमें मॉडलों द्वारा बिना अनुमति कार्रवाई करने, दूसरे मॉडलों से समन्वय करने या निगरानी से बचने के नए तरीके; किसी अलाइनमेंट विधि या सुरक्षा उपाय पर सवाल उठाने वाली विफलताएं; और प्रकाशित सुरक्षा आकलन के किसी दावे को चुनौती देने वाला व्यवहार शामिल है. तीसरे पक्षों को प्रभावित कर सकने वाले मिसअलाइनमेंट पर भी खुलासे के यही मानदंड लागू होते हैं.
इसमें मिसअलाइनमेंट के ऐसे मामले भी शामिल हो सकते हैं जो पहले बताए गए मामलों की पुनरावृत्ति लगते हों. समस्या की पुनरावृत्ति अपने आप में हमारे मॉडलों के व्यवहार या सुरक्षा उपायों की प्रभावशीलता का उपयोगी साक्ष्य हो सकती है. उदाहरण के लिए, यदि किसी खास तरह का मिसअलाइन व्यवहार उसे कम करने के बार-बार प्रयासों के बावजूद दोहराता रहे. इन परिस्थितियों में हम मूल मिसअलाइनमेंट खुलासे को अपडेट करके अतिरिक्त उदाहरण प्रकाशित करेंगे.
समय के साथ हम अन्य डेवलपरों, बाहरी शोधकर्ताओं, उद्योग मानक संस्थाओं और नियामकों के साथ मिलकर खुलासे के अधिक वस्तुनिष्ठ मानदंड विकसित करने की योजना बना रहे हैं. हम यह भी मानते हैं कि सुरक्षा, संरक्षा और मिसअलाइनमेंट की गंभीर घटनाओं की जानकारी अमेरिकी संघीय सरकार को दी जानी चाहिए और इसके लिए हम रिपोर्टिंग तंत्र प्रस्तावित करने पर काम कर रहे हैं. हम इस फ़्रेमवर्क को अपने मौजूदा दायित्वों का पूरक मानते हैं. यह गंभीर सुरक्षा घटनाओं या साइबर सुरक्षा उल्लंघनों सहित खुलासे की हमारी कानूनी आवश्यकताओं की जगह नहीं लेता.
मिसअलाइनमेंट के खुलासे के अपने नए फ़्रेमवर्क की शुरुआत करते हुए हम अपने मॉडलों के प्रशिक्षण या मूल्यांकन के दौरान देखे गए मिसअलाइन व्यवहार के मामलों पर छह रिपोर्ट प्रकाशित कर रहे हैं. ये मामले अलग-अलग तरह के उन व्यवहारों को दर्शाते हैं जिन्हें हम साझा करने योग्य मानते हैं, जैसे उपयोगकर्ता से जानकारी छिपाना और बाधाओं को पार करने के लिए बिना अनुमति कार्रवाई करना. ये अलग-अलग मामलों की रिपोर्ट हैं. इन्हें इस बात का संकेत नहीं माना जाना चाहिए कि हमारे मॉडलों में मिसअलाइनमेंट कितनी बार होता है. नीचे दी गई हर प्रविष्टि विस्तृत रिपोर्ट से जुड़ी है.
कार्य सारांशों में अपने आप तैयार हुए निर्देश(एक नई विंडो में खुलेगा). एक अप्रकाशित शोध मॉडल ने नई कॉन्टेक्स्ट विंडो में अपना काम जारी रखने के लिए इस्तेमाल होने वाले सारांशों में असंबंधित निर्देश जोड़ दिए. इनमें अपनी सामान्य पाबंदियों की अनदेखी करने के निर्देश भी थे. हमने 27 प्रभावित सारांशों की पहचान की.
कार्य सारांशों में गलतियां छिपाने के निर्देश(एक नई विंडो में खुलेगा). GPT‑5.6 Sol के प्रशिक्षण के दौरान मॉडल के कई इंस्टेंस ने उपयोगकर्ता से गलतियां या मिसअलाइन व्यवहार छिपाने के निर्देश अपने सारांशों में जोड़ दिए. उदाहरण के लिए, कम्पैक्शन सारांशों में बिना बताए अनुपलब्ध ऐतिहासिक डेटा गढ़ने और स्रोत संस्करणों की असंगतियां छिपाने के निर्देश शामिल थे.
सार्वजनिक रिपॉज़िटरी में उजागर API कुंजियां खोजना और फिर जानकारी गढ़ना(एक नई विंडो में खुलेगा). कैलिफ़ोर्निया की एक काउंटी में आय के आंकड़ों से जुड़े सामान्य प्रश्न का उत्तर देते समय एक मॉडल ने बिना अनुमति एक उजागर API कुंजी खोजकर उसका इस्तेमाल किया. जब इसके बाद भी वह मांगे गए आंकड़े प्राप्त नहीं कर पाया, तो उसने आंकड़े गढ़कर उन्हें अनुरोधित स्रोत का डेटा बताया.
फ़ाइलों का संदर्भ देने के लिए उन्हें इंटरनेट पर अपलोड करना(एक नई विंडो में खुलेगा). जब एक उपयोगकर्ता ने अप्रकाशित मॉडल से 50,00,000 वर्ग मीटर से बड़ी झीलों की पहचान संख्याएं और नाम पूछे, तो एजेंट ने Python की मदद से सही उत्तर खोज लिया. लेकिन निर्देशों में ब्राउज़र संदर्भ मांगा गया था, इसलिए एजेंट ने उपयोगकर्ता से पूछे बिना फ़ाइल अपलोड करने का निर्णय लिया, ताकि वह उत्तर में उसका संदर्भ दे सके.
आंतरिक सॉफ़्टवेयर रिपॉज़िटरी के जरिये बिना अनुमति डेटा लिखना और संचार करना(एक नई विंडो में खुलेगा). अनुपलब्ध इनपुट फ़ाइलें खोजते समय मॉडलों ने अलग-अलग प्रशिक्षण नमूनों के बीच अनुरोध और उत्तर साझा करने के लिए एक आंतरिक सॉफ़्टवेयर रिपॉज़िटरी को संदेश-पट्ट की तरह इस्तेमाल किया, हालांकि वे वे फ़ाइलें प्राप्त नहीं कर पाए. यह रिपोर्ट एक पुराने मामले की भी पड़ताल करती है, जिसमें एक मॉडल ने नेटवर्क पाबंदियों को दरकिनार करने की कोशिश के दौरान परीक्षण फ़ाइलें सफलतापूर्वक एक रिपॉज़िटरी में अपलोड की थीं.
सहयोगी एजेंटों के बीच बिना अनुमति फ़ाइल साझा करना(एक नई विंडो में खुलेगा). एक ही प्रशिक्षण कार्य पर साथ काम कर रहे एजेंटों ने एक-दूसरे की स्थानीय फ़ाइलों तक पहुंच न होने पर फ़ाइलें साझा करने के लिए सार्वजनिक फ़ाइल-होस्टिंग वेबसाइटों का इस्तेमाल किया. इससे कार्य के अंतिम परिणाम सार्वजनिक URL पर उपलब्ध हो गए, जबकि कार्य में मॉडलों को केवल स्थानीय फ़ाइलें इस्तेमाल करने को कहा गया था.
OpenAI का कोई भी कर्मचारी सुरक्षा और अलाइनमेंट टीमों से जांच कराने के लिए मिसअलाइनमेंट के उदाहरण को चिह्नित कर सकता है और उसे सार्वजनिक खुलासे के लिए विचारार्थ रखने का अनुरोध कर सकता है. इससे हमारी खुलासा प्रक्रिया शुरू होती है. समय पर जांच और खुलासा सुनिश्चित करने के लिए हर चरण की समय-सीमा तय है.
उदाहरण चिह्नित होने के बाद हमारे तकनीकी कर्मचारी जांच करेंगे कि क्या हुआ, क्या अब भी अनिश्चित है, सार्वजनिक खुलासा उचित है या नहीं और कौन-से तथ्य साझा किए जा सकते हैं. वे यह भी आकलन करेंगे कि क्या कोई तीसरा पक्ष प्रभावित हुआ और क्या उसे प्रकाशन से पहले निजी तौर पर सूचित करना आवश्यक है.
इसके बाद उदाहरण को तीन प्रक्रियाओं में से एक में रखा जाएगा: “खुलासे के लिए तैयार”, “सीमित जांच” या “व्यापक जांच (धीमी प्रक्रिया)”.
“खुलासे के लिए तैयार” में वे पात्र मामले आते हैं जिनकी जांच समीक्षा के बाद प्रकाशन के लिए पर्याप्त रूप से पूरी हो चुकी है. “सीमित जांच” में वे मामले आते हैं जिनकी आगे तकनीकी जांच जरूरी है. हमें उम्मीद है कि हमारे द्वारा बताए जाने वाले अधिकांश मामले इन्हीं दो प्रक्रियाओं में आएंगे, खासकर वे जिनमें व्यापक जांच, तीसरे पक्षों से समन्वय या गंभीर दुरुपयोग जोखिमों से निपटने की जरूरत नहीं है. आज जारी किए जा रहे सभी मामले इन दोनों में से किसी एक प्रक्रिया के तहत आते हैं.
“व्यापक जांच” में जटिल जांचें आती हैं, खासकर वे जिनमें तीसरे पक्ष शामिल हों. किसी तीसरे पक्ष के प्रभावित होने पर सुरक्षा, कानूनी अनुपालन और जिम्मेदार खुलासे संबंधी हमारे दायित्वों को इस फ़्रेमवर्क पर प्राथमिकता मिलेगी. हम यथाशीघ्र शुरुआती सूचना प्रकाशित करने का प्रयास करेंगे, लेकिन सुरक्षा कारणों से इसमें देरी करनी पड़ सकती है. उदाहरण के लिए, यदि कोई मॉडल व्यापक रूप से इस्तेमाल होने वाले सॉफ़्टवेयर में पहले से अज्ञात भेद्यता खोज ले. यदि किसी रिपोर्ट से तीसरे पक्ष की पहचान उजागर होगी, तो सुरक्षा सीमा का उल्लंघन न होने पर भी हम उसे पहले से सूचना देना चाहते हैं.
“व्यापक जांच” वाले मामले की शुरुआती सूचना में घटना का व्यापक विवरण, जांच में बाहरी विशेषज्ञों की सहायता की जानकारी और अंतिम रिपोर्ट प्रकाशित होने के अनुमानित समय की उपलब्ध जानकारी दी जाएगी. अगर OpenAI की Hugging Face घटना का खुलासा इस फ़्रेमवर्क के तहत हुआ होता, तो वह इसी प्रक्रिया में आती.
उदाहरण की जानकारी देने वाले कर्मचारी को यह निर्णय बताया जाएगा कि उसका खुलासा होगा या नहीं और, यदि होगा, तो वह किस प्रक्रिया के तहत आएगा. खुलासे या उपयुक्त प्रक्रिया से जुड़ी अनसुलझी असहमतियां OpenAI के सेफ़्टी एडवाइज़री ग्रुप (SAG) को भेजी जाएंगी. यह कंपनी के वरिष्ठ अधिकारियों का समूह है, जो अत्याधुनिक मॉडल की क्षमताओं और सुरक्षा उपायों का आकलन करता है, हमारे प्रिपेयर्डनेस फ़्रेमवर्क की निगरानी करता है और OpenAI के नेतृत्व को सलाह देता है. SAG के भीतर की असहमतियां या उसके निर्णयों पर कर्मचारियों की आपत्तियां OpenAI के नेतृत्व के पास भेजी जाएंगी. खुलासा न करने या उसे आवश्यक न मानने के निर्णय सुरक्षा और अलाइनमेंट नेतृत्व के साथ और, जहां तक संभव हो, संबंधित तकनीकी कर्मचारियों के साथ साझा किए जाएंगे.
व्यावहारिक अनुभव से मिली सीख के आधार पर हम इस खुलासा प्रक्रिया में संशोधन कर सकते हैं और हर बदलाव को इस पोस्ट में दर्ज करेंगे.
हर विस्तृत रिपोर्ट में देखे गए व्यवहार, उसकी गंभीरता और किसी भी बाहरी प्रभाव, उसके घटित होने की परिस्थिति, उसकी तारीख या अवधि, हमें उसका पता कब चला और व्यापक स्तर पर उसमें शामिल मॉडल या मॉडलों का विवरण होगा. जहां संभव होगा, हम ये जानकारियां भी साझा करेंगे:
क्या हुआ और उससे हुई किसी भी हानि का विस्तृत विवरण;
हमें मिसअलाइनमेंट का पता कैसे चला और हमारी जांच का दायरा क्या था;
अलाइनमेंट शोध और तकनीकी एआई सुरक्षा पर इसके प्रभावों की हमारी व्याख्या;
इस उदाहरण से उठे महत्वपूर्ण अनुत्तरित प्रश्न;
इस व्यवहार से निपटने के लिए किए जा रहे या नियोजित उपाय. खुलासे के समय ये जानकारियां हमेशा उपलब्ध नहीं होंगी, क्योंकि हम जांच पूरी करने या समाधान विकसित करने से पहले मिसअलाइनमेंट रिपोर्ट प्रकाशित कर सकते हैं.
ग्राहकों के परिनियोजन में होने वाले मिसअलाइनमेंट के बारे में हम उतनी ही जानकारी साझा करेंगे, जितनी ग्राहक की गोपनीयता और हमारे संविदात्मक दायित्वों के तहत संभव होगी.
आज की रिपोर्ट ज्ञात मिसअलाइनमेंट या जारी जांचों का व्यापक विवरण नहीं, बल्कि खुलासों का शुरुआती संकलन हैं. ये शुरुआती रिपोर्ट इस फ़्रेमवर्क के दायरे में आने वाले मामलों की पूरी विविधता या गंभीरता को दर्शाने के लिए नहीं हैं. हम इस फ़्रेमवर्क के मानदंडों पर खरे उतरने वाले मिसअलाइनमेंट के मामलों का खुलासा करने के लिए प्रतिबद्ध हैं. इनमें लंबी जांच या तीसरे पक्षों के साथ समन्वय की आवश्यकता वाले अधिक जटिल मामले भी शामिल हैं. हम इस फ़्रेमवर्क के तहत नियमित रूप से रिपोर्ट प्रकाशित करते रहेंगे और अपनी रिपोर्टिंग प्रतिबद्धताओं को विकसित करते हुए उनके बारे में अधिक जानकारी साझा करेंगे.


