सारांश
समस्या
कमज़ोरियाँ खोजने और हमारे मॉडलों की मजबूती सुधारने के लिए रेड टीमिंग आवश्यक है. हालाँकि, मौजूदा तरीके स्केल नहीं हो पाते, जिससे अड़चन पैदा होती है.
आम तौर पर इस्तेमाल किए जाने वाले मजबूती मूल्यांकन हमारे नवीनतम मॉडलों से पहले ही संतृप्त हो चुके हैं.
हमें ऐसे तरीके विकसित करने होंगे जिनसे सुरक्षा और अलाइनमेंट मॉडल क्षमताओं के साथ-साथ स्केल हो सकें.
हमने क्या किया
हमने GPT‑Red को प्रशिक्षित किया, जो एक स्वचालित रेड टीमिंग मॉडल है और कमज़ोरियाँ खोजने की हमारी क्षमता को बढ़ाता है, ताकि व्यापक डिप्लॉयमेंट से पहले हम उन्हें ठीक कर सकें.
GPT‑Red एक मजबूत रेड टीमिंग मॉडल है, और हमारे पिछले मॉडल इसके प्रॉम्प्ट इंजेक्शन हमलों के प्रति अत्यधिक संवेदनशील हैं.
हम GPT‑5.6 को विरोधी ढंग से प्रशिक्षित करने के लिए GPT‑Red का उपयोग करते हैं, जिससे यह प्रॉम्प्ट इंजेक्शन के प्रति कहीं अधिक मजबूत बनता है.
हम मानव और तृतीय-पक्ष रेड टीमिंग, बहु-स्तरीय सुरक्षा उपायों और रियल-टाइम निगरानी के साथ इस तरीके को आगे भी स्केल करते रहेंगे.
AI प्रणालियाँ आम तौर पर ब्राउज़र, कनेक्टेड ऐप, स्थानीय फ़ाइलों और अन्य टूल के ज़रिए तृतीय-पक्ष डेटा से सामना करती हैं. वास्तविक दुनिया के कार्य करने के लिए ये सुविधाएँ आवश्यक हैं, लेकिन ये दुर्भावनापूर्ण तत्वों को मॉडल के व्यवहार को प्रभावित करने के अधिक अवसर भी देती हैं. उदाहरण के लिए, कोई तृतीय पक्ष किसी ईमेल, वेबपेज, टूल प्रतिक्रिया या कोड रिपॉज़िटरी में सावधानी से तैयार किया गया निर्देश एम्बेड कर सकता है, जिसे मॉडल को संवेदनशील डेटा किसी बाहरी सर्वर पर अपलोड करने के लिए छलने के उद्देश्य से बनाया गया हो.
मानव रेड टीमिंग हमारे सुरक्षा कार्य का अहम हिस्सा है, जो डिप्लॉयमेंट से पहले इन कमज़ोरियों को उजागर करने और सही सुरक्षा उपाय लागू करने में हमारी मदद करती है. लेकिन केवल मानव रेड टीमिंग को स्केल करना कठिन है. इन अभ्यासों को डिज़ाइन और संचालित करने में बहुत समय लगता है, जिससे नई विफलता स्थितियों की पहचान करने और उन्हें मजबूत सुरक्षा उपायों में शामिल करने की हमारी गति सीमित हो जाती है. इसके अलावा, ये अभ्यास सफल हमलों के मूल्यवान उदाहरण देते हैं, लेकिन वे प्रशिक्षण के ज़रिए मॉडल की मजबूती सुधारने के लिए आवश्यक विरोधी डेटा की मात्रा और विविधता पैदा नहीं कर सकते.
लगातार अधिक सक्षम होते मॉडलों के साथ कदम मिलाने के लिए रेड टीमिंग को भी स्केल करना होगा. इसी उद्देश्य से, हम स्वचालित, केवल-आंतरिक रेड टीमिंग मॉडल प्रशिक्षित कर रहे हैं, जो डिप्लॉयमेंट से पहले कमज़ोरियाँ उजागर करते हैं और मजबूती सुधारने के लिए मॉडल प्रशिक्षण के दौरान हमले बनाते हैं. हमारा मानना है कि स्वचालित रेड टीमिंग सुरक्षा के लिए स्व-सुधार का एक अहम रूप खोलती है: आज के मॉडलों का उपयोग करके भविष्य के मॉडलों को सीधे अधिक सुरक्षित बनाना.
GPT‑Red इन प्रयासों का परिणाम है और सुरक्षा के लिए हमारा वर्तमान सर्वश्रेष्ठ स्वचालित रेड टीमिंग मॉडल है. मानव रेड टीमिंग विशेषज्ञ जिस तरह हमले तैयार करते हैं, उसी तरह यह मॉडल एक प्रॉम्प्ट भेजकर, GPT मॉडलों की प्रतिक्रिया देखकर और फिर दोहराते हुए लक्ष्य की ओर काम करता है. हमने GPT‑Red को OpenAI में अपने कुछ सबसे बड़े पोस्ट-ट्रेनिंग रन के कंप्यूट पैमाने पर प्रशिक्षित किया, यानी सुरक्षा सुधारने के लिए पूरी तरह समर्पित अभूतपूर्व मात्रा का कंप्यूट.
हम GPT‑Red को अपने प्रोडक्शन मॉडलों की प्रशिक्षण प्रक्रिया में सीधे शामिल करते हैं. परिणामस्वरूप, GPT‑5.6 Sol आज तक प्रॉम्प्ट इंजेक्शन के विरुद्ध हमारा सबसे मजबूत मॉडल है, जिसने हमारे सबसे कठिन प्रत्यक्ष प्रॉम्प्ट इंजेक्शन बेंचमार्क पर केवल चार महीने पहले के हमारे सर्वश्रेष्ठ प्रोडक्शन मॉडल की तुलना में 6 गुना कम विफलताएँ हासिल कीं. हमारे तरीके की स्केलेबिलिटी हमें भविष्य में और भी मजबूत परिणामों के लिए उत्साहित करती है, क्योंकि हम अधिक मजबूत रेड टीमिंग मॉडल प्रशिक्षित करना जारी रखते हैं.
GPT‑Red को सेल्फ-प्ले रीइंफ़ोर्समेंट लर्निंग से प्रशिक्षित किया जाता है, जहाँ मॉडल और विविध डिफेंडर LLM के एक संग्रह को रेड टीमिंग परिदृश्यों के व्यापक सेट पर साथ-साथ प्रशिक्षित किया जाता है. GPT‑Red को सफल प्रॉम्प्ट इंजेक्शन जैसी वैध विफलता करवाने पर रिवॉर्ड मिलता है, जबकि डिफेंडर मॉडल को हमले का प्रतिरोध करने और अपने मूल कार्य पूरे करने पर रिवॉर्ड मिलता है. जैसे-जैसे डिफेंडर अधिक मजबूत होते हैं, GPT‑Red को और शक्तिशाली तथा विविध हमले खोजने पड़ते हैं.
सेल्फ-प्ले प्रशिक्षण को सहारा देने के लिए, हम यथार्थवादी परिदृश्यों का एक विस्तृत सेट बनाते हैं जहाँ प्रॉम्प्ट इंजेक्शन डाले जा सकते हैं. हर वातावरण में एक थ्रेट मॉडल होता है, जो बताता है कि GPT‑Red क्या नियंत्रित कर सकता है और सफल हमला किसे माना जाएगा. उदाहरण के लिए, GPT‑Red किसी स्थानीय फ़ाइल का हिस्सा, वेबपेज बैनर, ईमेल का मुख्य भाग या किसी टूल का आउटपुट नियंत्रित कर सकता है.
अपने प्रशिक्षण के अंत तक GPT‑Red बहुत मजबूत हमलावर बन जाता है: यह जिन लगभग सभी मॉडलों के विरुद्ध उतारा जाता है, उन्हें तोड़ सकता है, जिनमें GPT‑5.5 तक के आंतरिक और प्रोडक्शन मॉडल शामिल हैं. GPT‑Red का प्रशिक्षण पूरा होने के बाद, हमने GPT‑5.6 के प्रशिक्षण के लिए प्रॉम्प्ट इंजेक्शन बनाने में इसका उपयोग किया, जिससे मॉडल GPT‑Red के हमलों के प्रति अत्यधिक प्रतिरोधी हो गया.
हम GPT‑Red को उन मॉडलों से अलग रखते हैं जिन्हें हम डिप्लॉय करते हैं. इससे वे दुर्भावनापूर्ण क्षमताएँ, जिन्हें हम खास तौर पर GPT‑Red में प्रशिक्षित करते हैं, विरोधी तत्वों के हाथों से दूर रहती हैं, जबकि हमारे प्रोडक्शन मॉडलों में मजबूती आती है.
GPT‑Red उन डिफेंडर मॉडलों और रेड टीमिंग परिदृश्यों के समूह के विरुद्ध अत्यधिक प्रभावी है जिन पर इसे प्रशिक्षित किया गया था. हम यह भी मूल्यांकन करते हैं कि व्यापक रूप से OpenAI में सुरक्षा को लाभ पहुँचाने के लिए यह मॉडल सामान्य-उद्देश्य वाले रेड टीमिंग एजेंट के रूप में उपयोगी है या नहीं. इसके लिए, हम नए सुरक्षा वातावरणों और लक्ष्य मॉडलों पर GPT‑Red की प्रभावशीलता का परीक्षण करते हैं.
सबसे पहले हम Dziemian आदि (2025) के अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन एरीना(एक नई विंडो में खुलेगा) के दोहराए गए संस्करण का उपयोग करके नए रेड टीमिंग परिदृश्यों में GPT‑Red की सामान्यीकरण क्षमता का मूल्यांकन करते हैं. इस चुनौती में, मानव रेड टीमिंग विशेषज्ञों और GPT‑Red दोनों ने पूर्व-निर्धारित वातावरणों के एक सेट में GPT‑5.1 के विरुद्ध स्वतंत्र रूप से हमले प्रस्तावित किए. ये रेड टीमिंग परिदृश्य और लक्ष्य GPT‑Red को प्रशिक्षित करने में इस्तेमाल किए गए परिदृश्यों और लक्ष्यों से अलग हैं. GPT‑Red काफ़ी अधिक हमला सफलता दर हासिल करता है, जहाँ उसे 84% परिदृश्यों में सफलता मिलती है, जबकि मनुष्यों के लिए यह 13% है.
GPT‑Red स्वचालित रेड टीमिंग मॉडल के रूप में उत्कृष्ट है. एक आंतरिक मिरर का उपयोग करते हुए, GPT‑Red Dziemian आदि (2025) के अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन एरीना में मानव रेड टीमिंग विशेषज्ञों की तुलना में कहीं अधिक परिदृश्यों में GPT‑5.1 के विरुद्ध सफल हमले बना सकता है.
किसी रेड टीमिंग विशेषज्ञ की अंतिम परीक्षा यह है कि वह वास्तविक दुनिया की एजेंट-आधारित प्रणालियों के विरुद्ध लक्षित दुर्भावनापूर्ण लक्ष्य हासिल कर सके, जबकि उसे प्रणाली के अंतर्निहित मॉडल और हार्नेस डिज़ाइन की अधूरी जानकारी हो. इस परिवेश में हमारे पहले प्रयोग में GPT‑Red को OpenAI कार्यालय की AI-संचालित वेंडिंग मशीन के विरुद्ध उतारा गया, जिसे Andon Labs ने बनाया था और जो Project Vend(एक नई विंडो में खुलेगा) जैसी थी. हमने GPT‑Red को प्रणाली का विवरण, हमले भेजने की क्षमता, और उस सिम्युलेटेड एजेंट की टूल कॉल्स देखने की क्षमता दी, जो वास्तविक दुनिया के डिप्लॉयमेंट से काफ़ी मिलता-जुलता है. हमलों पर कई बार काम करने के बाद, GPT‑Red ने अपना हमला प्रोडक्शन एजेंट के विरुद्ध डिप्लॉय किया और अपने तीनों दुर्भावनापूर्ण उद्देश्य हासिल किए:
- स्टॉक में मौजूद किसी महँगी वस्तु की कीमत बदलकर अनुमत न्यूनतम कीमत $0.50 करना;
- $100+ की नई वस्तु ऑर्डर करना और उसे $0.50 में पेश करना; और
- किसी दूसरे ग्राहक का ऑर्डर रद्द करना.
हमने इन कमज़ोरियों की सूचना दे दी है और नए सुरक्षा उपायों का सक्रिय रूप से परीक्षण किया जा रहा है.
GPT‑Red, Vendy नाम के एक लाइव स्वायत्त एजेंट को तोड़ सकता है, जो वेंडिंग मशीन का प्रबंधन करता है. GPT‑Red ने पहले सिमुलेशन में परीक्षण करके और फिर हमलों को लाइव एजेंट पर स्थानांतरित करके प्रोडक्शन एजेंट से महँगी वस्तुओं को सस्ता करवाया और दूसरे ग्राहकों के ऑर्डर रद्द करवाए.
हम GPT‑Red का उपयोग GPT‑5.4 mini पर आधारित Codex CLI एजेंट पर भी करते हैं, 10 अलग रखे गए डेटा-एक्सफ़िल्ट्रेशन परिदृश्यों के सेट में हमला करने के लिए. हम अपनी प्रशिक्षण प्रक्रिया के अलग रखे गए रेड टीमिंग प्रदर्शन पर प्रभाव का अध्ययन करने के लिए इस मॉडल की तुलना प्रॉम्प्ट किए गए GPT‑5.5 बेसलाइन से करते हैं. GPT‑Red अधिक प्रभावी है, क्योंकि यह अधिक परिदृश्यों में एजेंट से संवेदनशील डेटा एक्सफ़िल्ट्रेट करवाने में सफल हो सकता है, और यह टोकन के लिहाज़ से भी अधिक कुशल है.
GPT‑Red लाइव Codex एजेंटों को तोड़ने में अधिक प्रभावी और कुशल है. हम GPT‑5.4 Mini द्वारा समर्थित एक Codex एजेंट को डेटा एक्सफ़िल्ट्रेशन के 10 कार्यों के कस्टम समूह पर परखते हैं.
GPT‑Red का अंतिम लक्ष्य हमारे मॉडलों की मजबूती सुधारना है. पिछले छह महीनों में, हमने अधिक कंप्यूट के साथ क्रमशः मजबूत होते रेड टीमिंग मॉडल, यानी GPT‑Red के पूर्ववर्ती, प्रशिक्षित किए हैं और GPT‑5.3 के बाद से हर अगले प्रोडक्शन मॉडल के प्रशिक्षण में इन मॉडलों का उपयोग किया है. समय के साथ, हर अगली GPT रिलीज़ अधिक मजबूत हुई है.
एक उदाहरण के रूप में, GPT‑Red के शुरुआती संस्करण ने प्रत्यक्ष प्रॉम्प्ट इंजेक्शन हमलों की एक नई श्रेणी खोजी, जिसे “नकली चेन-ऑफ-थॉट” हमले कहा जाता है. इन हमलों ने GPT‑5.1 पर 95% से अधिक सफलता दर हासिल की थी, लेकिन GPT‑5.6 Sol के लिए अब ये 10% से कम हैं. इसी तरह, डेवलपर टूल और ब्राउज़िंग में हमलों को लक्षित करने वाले हमारे कई अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन बेंचमार्क हमारे नवीनतम मॉडल से संतृप्त हो चुके हैं (>97% सटीकता).
GPT‑Red के प्रति मजबूती में भी काफ़ी सुधार हुआ है. मजबूती वातावरणों के व्यापक सेट में, GPT‑Red की हमला सफलता दर समय के साथ लगातार घटी है. हमारी नवीनतम मॉडल रिलीज़ के साथ, GPT‑5.6 Sol GPT‑Red के प्रत्यक्ष प्रॉम्प्ट इंजेक्शन के केवल 0.05% मामलों में विफल होता है.
प्रॉम्प्ट इंजेक्शन के लिए सेल्फ-प्ले प्रशिक्षण को बढ़ाते रहने पर हमें ऐसे नए ख़तरे मिले हैं जो मौजूदा मॉडल को तोड़ सकते हैं. फिर भी, इस विस्तार ने इन हमलों के प्रति मजबूती को भी काफ़ी बेहतर किया है. हमला सफलता दर, अलग रखे गए वातावरणों में GPT‑Red के सभी प्रयासों की औसत सफलता के रूप में गणना की जाती है.
कोई मॉडल अधिक अनुरोधों को अस्वीकार करके या कम सक्षम होकर अधिक सुरक्षित दिखाई दे सकता है. जो मॉडल कम काम करता है, उस पर हमला करना स्वाभाविक रूप से कठिन होता है, लेकिन यह उपयोगी मजबूती नहीं है.
हम सामान्य अत्याधुनिक क्षमताओं के साथ-साथ हमारे द्वारा डिज़ाइन किए गए लक्षित अत्यधिक-अस्वीकरण कार्यों का भी गहन मूल्यांकन करते हैं. हम पाते हैं कि मजबूती में उल्लेखनीय सुधार के साथ सभी सामान्य क्षमताएँ अप्रभावित रहती हैं. इससे संकेत मिलता है कि मजबूती में हुए लाभ गलत टूल-उपयोग या वैध अनुरोधों को डिफ़ॉल्ट रूप से अस्वीकार करने के बजाय दुर्भावनापूर्ण निर्देशों के बेहतर प्रतिरोध से आए.
AI एजेंट पहले से ही हमारे अगली पीढ़ी के मॉडलों की क्षमताएँ सुधारने के लिए उपयोग किए जा रहे हैं. हम मानते हैं कि GPT‑Red के साथ हमने सुरक्षा के लिए भी ऐसा ही फ्लाईव्हील खोलना शुरू किया है, जहाँ आज के मॉडल कल के मॉडलों को अधिक मजबूत, अलाइंड और भरोसेमंद बनाने में सीधे मदद कर सकते हैं. हम कंप्यूट और डेटा को स्केल करते रहेंगे और एल्गोरिदमिक सुधार करते रहेंगे, ताकि GPT‑Red के भविष्य के ऐसे संस्करण प्रशिक्षित किए जा सकें जो आज के मॉडल से अधिक मजबूत हों. और बदले में, ये मॉडल भविष्य की GPT रिलीज़ को अधिक सुरक्षित बनाने में मदद करेंगे.
हम इस सप्ताह के अंत में अधिक विवरणों के साथ एक प्री-प्रिंट जारी करेंगे.


