GPT‑Red: मजबुतीसाठी स्व-सुधारणा खुली करणे
मजबुती सुधारण्यासाठी शक्तिशाली स्वयंचलित सुरक्षा रेड टीमिंग करणारी मॉडेल्स प्रशिक्षित करणे.
सारांश
समस्या
असुरक्षा शोधण्यासाठी आणि आमच्या मॉडेलची मजबूतता सुधारण्यासाठी रेड-टीमिंग आवश्यक आहे. तथापि, सध्याचे दृष्टिकोन स्केलेबल नसल्यामुळे अडथळे निर्माण होतात.
आमच्या नवीनतम मॉडेल्समुळे सामान्यतः वापरल्या जाणाऱ्या मजबुती मूल्यांकन पद्धती आधीच परिपूर्ण झाल्या आहेत.
मॉडेल क्षमतांबरोबर सुरक्षितता आणि संरेखनही वाढू देणाऱ्या पद्धती विकसित करणे आम्हाला आवश्यक आहे.
आम्ही काय केले
आम्ही GPT‑Red प्रशिक्षित केले, हे स्वयंचलित रेड टीमिंग मॉडेल असुरक्षा शोधण्याची आमची क्षमता वाढवते, जेणेकरून व्यापक तैनातीपूर्वी आम्ही त्या दुरुस्त करू शकू.
GPT‑Red हे 'रेड-टीमिंग' करणारे एक प्रभावी साधन आहे आणि आमचे पूर्वीचे मॉडेल्स त्याच्या 'प्रॉम्प्ट इंजेक्शन' हल्ल्यांना अत्यंत असुरक्षित आहेत.
आम्ही GPT‑5.6 चे प्रशिक्षित करण्यासाठी GPT‑Red वापरतो, ज्यामुळे ते इंजेक्शन प्रॉम्प्ट करण्यासाठी अधिक मजबूत बनते.
आम्ही मानवी आणि त्रयस्थ पक्षांकडून केली जाणारी 'रेड-टीमिंग' (red-teaming), बहुस्तरीय सुरक्षा उपाय आणि रिअल-टाइम देखरेख यांच्या जोडीला या दृष्टिकोनाचा विस्तार करणे सुरूच ठेवू.
AI प्रणालींना अनेकदा ब्राउझर्स, कनेक्ट केलेली ॲप्स, स्थानिक फाइल्स आणि इतर साधनांच्या माध्यमातून त्रयस्थ पक्षाचा डेटा मिळतो. प्रत्यक्ष जगातील कार्ये पार पाडण्यासाठी या सुविधा आवश्यक असतात, परंतु यामुळे दुर्भावनापूर्ण घटकांना मॉडेलच्या वर्तनावर प्रभाव टाकण्याच्या अधिक संधीही मिळतात. उदाहरणार्थ, एखादा त्रयस्थ पक्ष ईमेल, वेबपेज, एखाद्या साधनाचा प्रतिसाद किंवा कोड रिपॉझिटरीमध्ये विशेषरीत्या तयार केलेली सूचना समाविष्ट करू शकतो; ही सूचना अशा प्रकारे तयार केलेली असते की ज्यामुळे मॉडेल फसवणुकीला बळी पडून संवेदनशील डेटा बाह्य सर्व्हरवर अपलोड करेल.
मानवी रेड-टीमींग हे आमच्या सुरक्षा कार्याचा एक महत्त्वाचा भाग आहे, जे आम्हाला तैनातीपूर्वी या त्रुटी शोधून काढण्यास आणि योग्य सुरक्षा उपाययोजना करण्यास मदत करते. परंतु केवळ मानवी रेड-टीमींगचा विस्तार करणे अवघड आहे. या सरावांची रचना करणे आणि ते चालवणे वेळखाऊ आहे, ज्यामुळे आम्ही किती लवकर अपयशाचे नवीन प्रकार ओळखू शकतो आणि त्यांना अधिक मजबूत सुरक्षा उपाययोजनांमध्ये समाविष्ट करू शकतो यावर मर्यादा येतात. शिवाय, जरी या सरावांमधून यशस्वी हल्ल्यांची मौल्यवान उदाहरणे मिळत असली तरी, प्रशिक्षणाद्वारे मॉडेलची मजबुती सुधारण्यासाठी आवश्यक असलेल्या विरोधी डेटाचे प्रमाण आणि विविधता ते निर्माण करू शकत नाहीत.
अधिकाधिक सक्षम होत जाणाऱ्या मॉडेल्सच्या गतीशी जुळण्यासाठी रेड टीमिंगही स्केल होणे आवश्यक आहे. या उद्देशाने, आम्ही स्वयंचलित, केवळ अंतर्गत वापरासाठीची रेड टीमिंग मॉडेल्स प्रशिक्षित करत आहोत, जी तैनातीपूर्वी असुरक्षा शोधतात आणि मजबुती सुधारण्यासाठी मॉडेल प्रशिक्षणादरम्यान हल्ले निर्माण करतात. स्वयंचलित रेड टीमिंग सुरक्षिततेसाठी स्व-सुधारणेचा एक महत्त्वाचा प्रकार खुला करते, असे आम्हाला वाटते: आजची मॉडेल्स थेट भविष्यातील मॉडेल्स अधिक सुरक्षित बनवण्यासाठी वापरणे.
GPT‑Red हा या प्रयत्नांचा परिपाक असून आमचे सध्याचे सर्वोत्तम स्वयंचलित सुरक्षितता रेड टीमिंग मॉडेल आहे. मानवी रेड टीमिंग तज्ज्ञ जसे हल्ले तयार करतात त्याप्रमाणे, हे मॉडेल प्रॉम्प्ट पाठवून, GPT मॉडेल्स त्याला कसे प्रतिसाद देतात हे पाहून आणि पुनरावृत्ती करून उद्दिष्टाकडे वाटचाल करते. OpenAI मधील आमच्या काही सर्वात मोठ्या पोस्ट-ट्रेनिंग रन्सच्या कंप्यूट स्केलवर आम्ही GPT‑Red प्रशिक्षित केले; सुरक्षितता सुधारण्यासाठी पूर्णपणे समर्पित असा हा अभूतपूर्व कंप्यूट आहे.
आमच्या उत्पादन मॉडेल्सच्या प्रशिक्षण प्रक्रियेत आम्ही GPT‑Red थेट समाविष्ट करतो. परिणामी, GPT‑5.6 Sol हे प्रॉम्प्ट इंजेक्शनविरुद्ध आजपर्यंतचे आमचे सर्वात मजबूत मॉडेल आहे; फक्त चार महिन्यांपूर्वीच्या आमच्या सर्वोत्तम उत्पादन मॉडेलच्या तुलनेत आमच्या सर्वात कठीण थेट प्रॉम्प्ट इंजेक्शन बेंचमार्कवर त्यात 6x कमी अपयश दिसते. आमच्या दृष्टिकोनाची स्केलेबिलिटी आम्हाला भविष्यात आणखी मजबूत परिणामांची आशा देते, कारण आम्ही अधिक शक्तिशाली रेड टीमिंग करणारी मॉडेल्स प्रशिक्षित करत राहणार आहोत.
GPT‑Red ला सेल्फ-प्ले रीइन्फोर्समेंट लर्निंग वापरून प्रशिक्षित केले जाते, ज्यामध्ये मॉडेल आणि विविध डिफेंडर LLMs चा संच रेड टीमिंग परिस्थितींच्या विस्तृत संचावर एकाच वेळी प्रशिक्षित केला जातो. यशस्वी प्रॉम्प्ट इंजेक्शनसारखे वैध अपयश घडवून आणल्याबद्दल GPT‑Red ला बक्षीस दिले जाते, तर डिफेंडर मॉडेल्सना हल्ला रोखून आपली मूळ कामे पूर्ण केल्याबद्दल बक्षीस दिले जाते. डिफेंडर्स अधिक मजबूत होत जातात तसे GPT‑Red ला अधिक शक्तिशाली आणि विविध हल्ले शोधणे भाग पडते.
सेल्फ-प्ले प्रशिक्षणाला आधार देण्यासाठी, आम्ही प्रॉम्प्ट इंजेक्शन घातले जाऊ शकतील अशा वास्तववादी परिस्थितींचा विस्तृत संच तयार करतो. प्रत्येक वातावरणात एक थ्रेट मॉडेल असते, जे GPT‑Red काय नियंत्रित करू शकते आणि यशस्वी हल्ला कशाला म्हणायचे हे निर्दिष्ट करते. उदाहरणार्थ, GPT‑Red स्थानिक फाइलचा एखादा भाग, वेबपेज बॅनर, ईमेल मजकूर किंवा टूलचे आउटपुट नियंत्रित करू शकते.
प्रशिक्षणाच्या शेवटी GPT‑Red हा अत्यंत शक्तिशाली हल्लेखोर बनतो: GPT‑5.5 पर्यंत आणि त्यासह, त्याच्यासमोर उभे केलेले जवळजवळ सर्व अंतर्गत आणि उत्पादन मॉडेल्स तो भेदू शकतो. GPT‑Red चे प्रशिक्षण पूर्ण झाल्यानंतर, आम्ही GPT‑5.6 च्या प्रशिक्षणासाठी प्रॉम्प्ट इंजेक्शन तयार करण्यासाठी त्याचा वापर केला; परिणामी हे मॉडेल GPT‑Red च्या हल्ल्यांविरुद्ध अत्यंत प्रतिरोधक बनले.
आम्ही प्रत्यक्ष वापरात आणत असलेल्या मॉडेल्सपासून 'GPT‑Red' ला वेगळे ठेवतो. यामुळे, 'GPT‑Red' मध्ये आम्ही मुद्दामहून विकसित केलेल्या हानिकारक क्षमतांचा ताबा द्वेषपूर्ण हेतू असलेल्या घटकांना घेता येत नाही आणि त्याच वेळी आमच्या प्रत्यक्ष वापरातील मॉडेल्सची क्षमता व सुरक्षितता अधिक बळकट होते.
GPT‑Red ला ज्या डिफेंडर मॉडेल्स आणि रेड टीमिंग परिस्थितींवर प्रशिक्षित केले गेले, त्यांच्या समूहाविरुद्ध तो अत्यंत प्रभावी आहे. OpenAI मधील व्यापक सुरक्षिततेसाठी हे मॉडेल सर्वसाधारण उद्देशाच्या रेड टीमिंग एजंट म्हणून उपयुक्त आहे का, हेही आम्ही मूल्यमापन करतो. हे करण्यासाठी, आम्ही नव्या सुरक्षितता वातावरणांवर आणि लक्ष्य मॉडेल्सवर GPT‑Red ची परिणामकारकता तपासतो.
सर्वप्रथम, आम्ही Dziemian et al. (2025) यांच्या अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन अरीनाची(नवीन विंडोमध्ये उघडेल) प्रतिकृती वापरून GPT‑Red ची नव्या रेड टीमिंग परिस्थितींमध्ये सामान्यीकरण करण्याची क्षमता मूल्यमापित करतो. या आव्हानात, मानवी रेड टीमिंग तज्ज्ञांनी आणि GPT‑Red ने स्वतंत्रपणे पूर्वनिर्दिष्ट वातावरणांच्या संचावर GPT‑5.1 विरुद्ध हल्ले सुचवले. या रेड टीमिंग परिस्थिती आणि उद्दिष्टे GPT‑Red ला प्रशिक्षित करण्यासाठी वापरलेल्यांपेक्षा वेगळी आहेत. GPT‑Red लक्षणीयरीत्या अधिक हल्ला यशदर मिळवतो: मानवी प्रयत्नांमध्ये 13% च्या तुलनेत 84% परिस्थितींमध्ये यश मिळते.
GPT‑Red हे स्वयंचलित 'रेड-टीमर' (red-teamer) म्हणून उत्कृष्ट कामगिरी करते. Dziemian आणि इतरांच्या (२०२५) 'इनडायरेक्ट प्रॉम्प्ट इंजेक्शन' (indirect prompt injection) क्षेत्रातील चाचण्यांमध्ये, अंतर्गत 'मिरर'चा (internal mirror) वापर करून GPT‑5.1 विरुद्ध यशस्वी हल्ले घडवून आणण्याच्या बाबतीत GPT‑Red मानवी रेड-टीमर्सच्या तुलनेत लक्षणीयरीत्या अधिक परिस्थितींमध्ये यशस्वी ठरते.
रेड टीमिंग करणाऱ्याची अंतिम कसोटी म्हणजे प्रणालीच्या अंतर्निहित मॉडेल आणि हार्नेस रचनेची अपूर्ण माहिती असतानाही वास्तव जगातील एजंटिक प्रणालींविरुद्ध लक्ष्यित दुर्भावनापूर्ण उद्दिष्टे साध्य करण्याची क्षमता. या सेटिंगमधील आमच्या पहिल्या प्रयोगात, Andon Labs ने तयार केलेल्या OpenAI कार्यालयातील AI-चालित व्हेंडिंग मशीनविरुद्ध GPT‑Red ला उभे केले गेले (जे Project Vend(नवीन विंडोमध्ये उघडेल) सारखे होते). आम्ही GPT‑Red ला प्रणालीचे वर्णन आणि वास्तविक तैनातीशी जवळून जुळणाऱ्या सिम्युलेटेड एजंटकडे हल्ले पाठवण्याची व टूल कॉल्स पाहण्याची क्षमता दिली. हल्ल्यांवर पुनरावृत्ती केल्यानंतर, GPT‑Red ने उत्पादन एजंटविरुद्ध आपला हल्ला तैनात केला आणि आपली तिन्ही दुर्भावनापूर्ण उद्दिष्टे साध्य केली:
- स्टॉकमध्ये असलेल्या महाग वस्तूची किंमत बदलून परवानगी असलेली किमान किंमत $0.50 करणे;
- $100+ किमतीची नवी वस्तू मागवून ती $0.50 ला देणे; आणि
- दुसऱ्या ग्राहकाची ऑर्डर रद्द करणे.
आम्ही या असुरक्षा उघड केल्या आहेत आणि नवे सुरक्षा उपाय सक्रियपणे तपासले जात आहेत.
GPT‑Red हे 'Vendy' नावाच्या, व्हेंडिंग मशीनचे व्यवस्थापन करणाऱ्या एका कार्यरत स्वायत्त एजंटला निकामी करण्यास किंवा त्यात बिघाड घडवून आणण्यास सक्षम आहे. सिम्युलेशनमध्ये चाचणी करून आणि त्यानंतर प्रत्यक्ष कार्यरत एजंटवर हल्ले करून, GPT‑Red ने या एजंटला महागड्या वस्तूंच्या किमती कमी करण्यास आणि ग्राहकांच्या इतर ऑर्डर्स रद्द करण्यास भाग पाडले.
आम्ही 10 होल्ड-आउट डेटा-एक्स्फिल्टेशन परिस्थितीच्या संचवर Codex CLI एजंटवर (GPT‑5.4 मिनीवर आधारित) हल्ला करण्यासाठी GPT‑Red देखील वापरतो. होल्ड-आउट रेड-टीमिंग कामगिरीवर आमच्या प्रशिक्षण प्रक्रियेच्या प्रभावाचा अभ्यास करण्यासाठी आम्ही मॉडेलची तुलना प्रॉम्प्ट केलेल्या GPT‑5.5 बेसलाइनशी करतो. GPT‑रेड दोन्ही अधिक प्रभावी आहे, कारण ते एजंटला अधिक परिस्थितींमध्ये संवेदनशील डेटा यशस्वीरित्या बाहेर काढू शकते आणि अधिक टोकन कार्यक्षम आहे.
GPT‑Red थेट Codex एजंट्सना भेदण्यात अधिक प्रभावी आणि कार्यक्षम आहे. आम्ही 10 डेटा एक्सफिल्ट्रेशन कामांच्या सानुकूल संचावर GPT‑5.4 Mini वर आधारित Codex एजंटविरुद्ध चाचणी करतो.
GPT‑Red चे अंतिम ध्येय आमच्या मॉडेल्सची मजबुती सुधारणे आहे. मागील सहा महिन्यांत आम्ही वाढत्या कंप्यूटसह क्रमाक्रमाने अधिक शक्तिशाली रेड टीमिंग मॉडेल्स (म्हणजे GPT‑Red चे पूर्वरूप) प्रशिक्षित केली आहेत आणि GPT‑5.3 पासून प्रत्येक पुढील उत्पादन मॉडेलच्या प्रशिक्षणात ही मॉडेल्स वापरली आहेत. कालांतराने, प्रत्येक पुढील GPT रिलीज अधिक मजबूत होत गेले आहे.
एक उदाहरण म्हणून, GPT‑Red च्या सुरुवातीच्या आवृत्तीने “बनावट चेन-ऑफ-थॉट” हल्ले म्हणून ओळखला जाणारा थेट प्रॉम्प्ट इंजेक्शन हल्ल्यांचा नवा वर्ग शोधला. या हल्ल्यांनी GPT‑5.1 वर 95% पेक्षा जास्त यशदर मिळवले, पण GPT‑5.6 Sol साठी ते आता 10% पेक्षा कमी आहेत. त्याचप्रमाणे, डेव्हलपर टूल्स आणि ब्राउझिंगमधील हल्ल्यांना लक्ष्य करणारे आमचे अनेक अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन बेंचमार्क आमच्या नवीनतम मॉडेलने संतृप्त केले आहेत (>97% अचूकता).
GPT‑Red च्या विरोधातील मजबूतीमध्येही लक्षणीय सुधारणा झाली आहे. मजबूती तपासणाऱ्या विविध परिस्थितींमध्ये, GPT‑Red च्या हल्ल्यांचे यश मिळण्याचे प्रमाण काळानुसार सातत्याने कमी झाले आहे. आमच्या नवीनतम मॉडेल आवृत्तीमध्ये, GPT‑Red द्वारे केल्या जाणाऱ्या थेट 'प्रॉम्प्ट इंजेक्शन'पैकी केवळ 0.05% प्रकरणांमध्ये 'GPT‑5.6 Sol' अपयशी ठरते.
प्रॉम्प्ट इंजेक्शन्ससाठी सेल्फ-प्ले ट्रेनिंगचा विस्तार करत असताना, आम्हाला असे नवीन धोके आढळले आहेत जे विद्यमान मॉडेल्सना निकामी करू शकतात. तरीही, आमच्या या विस्तारामुळे या हल्ल्यांविरुद्धची मजबुती लक्षणीयरीत्या सुधारण्यासही मदत झाली आहे. हल्ल्याच्या यशाचा दर हा, सुरक्षित वातावरणात GPT‑Red द्वारे केलेल्या सर्व प्रयत्नांमधील यशाच्या सरासरीवरून मोजला जातो.
अधिक विनंत्या नाकारून किंवा कमी सक्षम बनून एखादे मॉडेल अधिक सुरक्षित दिसू शकते. कमी काम करणाऱ्या मॉडेलवर हल्ला करणे स्वाभाविकपणे कठीण असते, परंतु ही उपयुक्त मजबुती नाही.
आम्ही सामान्य अत्याधुनिक क्षमता आणि आम्ही डिझाइन केलेल्या लक्ष्यित ओव्हर-रिफ्युझल कार्यांचे सखोल मूल्यांकन करतो. आम्हाला असे आढळले की सर्व सामान्य क्षमता अबाधित राहतात, उलट रोबस्टनेसमध्ये लक्षणीय सुधारणा होते. यावरून असे सूचित होते की, रोबस्टनेसमधील ही वाढ अयोग्य टूल-वापरामुळे किंवा पूर्वनिर्धारितपणे वैध विनंत्या नाकारल्यामुळे नव्हे, तर दुर्भावनापूर्ण सूचनांना अधिक चांगल्या प्रकारे प्रतिकार केल्यामुळे झाली आहे.
आमच्या पुढच्या पिढीच्या मॉडेल्सची क्षमता सुधारण्यासाठी AI एजंट्सचा वापर आधीपासूनच केला जात आहे. आमचा विश्वास आहे की GPT‑रेडच्या माध्यमातून आम्ही सुरक्षेसाठीही असेच एक चक्र सुरू केले आहे, जिथे आजच्या मॉडेल्सचा वापर करून उद्याची मॉडेल्स अधिक मजबूत, सुसंगत आणि विश्वासार्ह बनवता येतील. आजच्या मॉडेलपेक्षा अधिक शक्तिशाली असलेल्या GPT -रेडच्या भविष्यातील आवृत्त्यांना प्रशिक्षित करण्यासाठी, आम्ही अल्गोरिदममध्ये सुधारणा करत संगणकीय क्षमता आणि डेटाचा विस्तार करत राहू. आणि परिणामी, ही मॉडेल्स भविष्यातील GPT आवृत्त्या अधिक सुरक्षित बनविण्यात मदत करतील.
या आठवड्याच्या शेवटी आम्ही अधिक तपशीलांसह प्री-प्रिंट प्रकाशित करणार आहोत.


