GPT‑Red: உறுதித்தன்மைக்கான சுய மேம்பாட்டை திறத்தல்
உறுதித்தன்மையை மேம்படுத்த வலுவான தானியக்க பாதுகாப்பு ரெட் டீமிங் நிபுணர்களைப் பயிற்றுவித்தல்.
சுருக்கம்
சிக்கல்
பலவீனங்களைக் கண்டறிந்து எங்கள் மாடல்களின் உறுதித்தன்மையை மேம்படுத்த ரெட் டீமிங் அவசியம். ஆனால், தற்போதைய அணுகுமுறைகள் விரிவுபடுத்தக் கூடியவை அல்ல; இதனால் ஒரு தடங்கல் உருவாகிறது.
பொதுவாகப் பயன்படுத்தப்படும் உறுதித்தன்மை மதிப்பீடுகள் எங்கள் சமீபத்திய மாடல்களால் ஏற்கனவே நிரம்பிவிட்டன.
மாடல் திறன்களுடன் பாதுகாப்பும் சீரமைப்பும் விரிவாக்க உதவும் முறைகளை நாம் உருவாக்க வேண்டும்.
நாங்கள் செய்தது
பரந்த வெளியீட்டுக்கு முன் பலவீனங்களை கண்டறிந்து சரிசெய்யும் திறனை விரிவுபடுத்தும் தானியக்க ரெட் டீமிங் மாடலான GPT‑Red‑ஐ நாங்கள் பயிற்றுவித்தோம்.
GPT‑Red ஒரு வலுவான ரெட் டீமிங் நிபுணத்துவமானது; எங்கள் முந்தைய மாடல்கள் அதன் ப்ராம்ப்ட் இன்ஜெக்ஷன் தாக்குதல்களுக்கு மிகவும் பாதிக்கப்படக்கூடியவை.
GPT‑5.6‑ஐ எதிர்மறை முறையில் பயிற்றுவிக்க GPT‑Red‑ஐப் பயன்படுத்துகிறோம்; இதனால் அது ப்ராம்ப்ட் இன்ஜெக்ஷன்களுக்கு மிகவும் உறுதியானதாகிறது.
மனித மற்றும் மூன்றாம் தரப்பு ரெட் டீமிங், அடுக்குகள் கொண்ட பாதுகாப்புகள், நேரடி கண்காணிப்பு ஆகியவற்றுடன் இந்த அணுகுமுறையையும் தொடர்ந்து விரிவுபடுத்துவோம்.
AI முறைமைகள் பொதுவாக உலாவிகள், இணைக்கப்பட்ட செயலிகள், உள் கோப்புகள் மற்றும் பிற கருவிகள் வழியாக மூன்றாம் தரப்பு தரவை எதிர்கொள்கின்றன. நிஜ உலகப் பணிகளைச் செய்ய இந்த வசதிகள் தேவையானவை; ஆனால் மாடல் நடத்தையைப் பாதிக்க மேலும் வாய்ப்புகளையும் தீங்கு விளைவிக்கும் செயற்பாட்டாளர்கள் உருவாக்குகின்றன. உதாரணமாக, நுணுக்கமான தரவை வெளிப்புற சேவையகத்திற்கு பதிவேற்ற மாடலை ஏமாற்ற வடிவமைக்கப்பட்ட கவனமாக உருவாக்கப்பட்ட அறிவுறுத்தலை ஒரு மூன்றாம் தரப்பு மின்னஞ்சல், இணையப்பக்கம், கருவி பதில் அல்லது கோடிங் களஞ்சியத்தில் உட்பொதிக்கக்கூடும்.
மனித ரெட் டீமிங் எங்கள் பாதுகாப்புப் பணியின் முக்கியமான பகுதியாகும்; வெளியீட்டுக்கு முன் இந்த பலவீனங்களை கண்டறிந்து சரியான பாதுகாப்புகளை அமைக்க இது உதவுகிறது. ஆனால் மனித ரெட் டீமிங் மட்டும் விரிவாக்க கடினமானது. இந்தப் பயிற்சிகளை வடிவமைத்து இயக்குவது நேரம் பிடிக்கும்; புதிய தோல்வி முறைகளை எவ்வளவு விரைவாக அடையாளம் கண்டு வலுவான பாதுகாப்புகளில் சேர்க்க முடியும் என்பதைக் கட்டுப்படுத்துகிறது. மேலும், இந்தப் பயிற்சிகள் வெற்றிகரமான தாக்குதல்களின் மதிப்புள்ள எடுத்துக்காட்டுகளை வழங்கினாலும், பயிற்சி மூலம் மாடல் உறுதித்தன்மையை மேம்படுத்தத் தேவையான எதிர்மறை தரவின் அளவையும் பல்வகைத்தன்மையையும் உருவாக்க முடியாது.
திறன் அதிகரிக்கும் மாடல்களுடன் வேகம் கூட, ரெட் டீமிங்கும் விரிவாக்கப்பட வேண்டும். இந்த நோக்கத்திற்காக, வெளியீட்டுக்கு முன் பலவீனங்களை கண்டறிந்து, உறுதித்தன்மையை மேம்படுத்த மாடல் பயிற்சியின்போது தாக்குதல்களை உருவாக்கும் தானியக்க, உள் பயன்பாட்டிற்கே உரிய ரெட் டீமிங் மாடல்களைப் பயிற்றுவித்து வருகிறோம். தானியக்க ரெட் டீமிங் பாதுகாப்பிற்கான முக்கியமான ஒரு வகை சுய மேம்பாட்டைத் திறக்கிறது என்று நாங்கள் நம்புகிறோம்: இன்றைய மாடல்களைப் பயன்படுத்தி எதிர்கால மாடல்களை நேரடியாக மேலும் பாதுகாப்பானவையாக மாற்றுவது.
GPT‑Red இந்த முயற்சிகளின் நிறைவு மற்றும் எங்கள் தற்போதைய சிறந்த தானியக்க பாதுகாப்பு ரெட் டீமிங் மாடல் ஆகும். மனித ரெட் டீமிங் நிபுணர்கள் தாக்குதல்களை உருவாக்குவது போலவே, இந்த மாடல் ஒரு ப்ராம்ப்ட் அனுப்பி, GPT மாடல்கள் அதற்கு எவ்வாறு பதிலளிக்கின்றன என்பதை கவனித்து, தொடர்ந்து திருத்தி ஓர் இலக்கை நோக்கிப் பணிபுரிகிறது. OpenAI-இல் எங்கள் மிகப் பெரிய சில பயிற்சிக்குப் பிந்தைய இயக்கங்களின் கணிப்பொறி வள அளவில் GPT‑Red‑ஐ பயிற்றுவித்தோம்; இது பாதுகாப்பை மேம்படுத்துவதற்காக மட்டுமே ஒதுக்கப்பட்ட முன்னெப்போதும் இல்லாத அளவு கணிப்பொறி வளமாகும்.
எங்கள் தயாரிப்பு மாடல்களின் பயிற்சி செயல்முறையில் GPT‑Red‑ஐ நேரடியாக இணைக்கிறோம். இதன் விளைவாக, GPT‑5.6 Sol இதுவரை ப்ராம்ப்ட் இன்ஜெக்ஷன்களுக்கு எதிராக எங்கள் மிக உறுதியான மாடலாக உள்ளது; நான்கு மாதங்களுக்கு முன் இருந்த எங்கள் சிறந்த தயாரிப்பு மாடலுடன் ஒப்பிடும்போது, எங்கள் கடினமான நேரடி ப்ராம்ப்ட் இன்ஜெக்ஷன் அளவுகோலில் 6 மடங்கு குறைவான தோல்விகளை அடைகிறது. மேலும் வலுவான ரெட் டீமிங் நிபுணர்களை தொடர்ந்து பயிற்றுவிக்கும்போது, எங்கள் அணுகுமுறையின் விரிவுபடுத்தும் திறன் எதிர்காலத்தில் இன்னும் வலுவான முடிவுகளை எதிர்பார்க்கச் செய்கிறது.
self-play ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங் மூலம் GPT‑Red பயிற்றுவிக்கப்படுகிறது; இதில் மாடலும் பல்வேறு பாதுகாப்பாளர் LLMகளின் தொகுப்பும் பரந்த ரெட் டீமிங் சூழ்நிலைகளில் ஒரே நேரத்தில் பயிற்றுவிக்கப்படுகின்றன. வெற்றிகரமான ப்ராம்ப்ட் இன்ஜெக்ஷன் போன்ற செல்லுபடியாகும் தோல்வியை உருவாக்குவதற்கு GPT‑Red‑க்கு வெகுமதி வழங்கப்படுகிறது; பாதுகாப்பாளர் மாடல்களுக்கு தாக்குதலை எதிர்த்து தங்கள் முதன்மைப் பணிகளை முடிப்பதற்கு வெகுமதி வழங்கப்படுகிறது. பாதுகாப்பாளர்கள் மேலும் உறுதியானவர்களாகும்போது, வலுவானதும் பல்வகையானதுமான தாக்குதல்களை கண்டுபிடிக்க GPT‑Red தள்ளப்படுகிறது.
Self-play பயிற்சியை ஆதரிக்க, ப்ராம்ப்ட் இன்ஜெக்ஷன்கள் சேர்க்கப்படக்கூடிய நிஜத்தன்மை வாய்ந்த சூழ்நிலைகளின் விரிவான தொகுப்பை உருவாக்குகிறோம். ஒவ்வொரு சூழலிலும், GPT‑Red எதைக் கட்டுப்படுத்த முடியும், எது வெற்றிகரமான தாக்குதலாகக் கருதப்படும் என்பதைக் குறிப்பிடும் அச்சுறுத்தல் மாடல் உள்ளது. உதாரணமாக, ஓர் உள் கோப்பின் பகுதி, இணையப்பக்க பேனர், மின்னஞ்சல் அங்கம் அல்லது கருவியின் வெளியீட்டை GPT‑Red கட்டுப்படுத்தக்கூடும்.
பயிற்சி முடிவில், GPT‑Red மிக வலுவான தாக்குதலாளியாக உள்ளது: GPT‑5.5 வரை உள்ள உள் மற்றும் தயாரிப்பு மாடல்கள் உட்பட, அதற்கு எதிராக நிறுத்தப்படும் கிட்டத்தட்ட எல்லா மாடல்களையும் இது முறியடிக்க முடியும். GPT‑Red பயிற்சியை முடித்த பிறகு, GPT‑5.6‑ஐப் பயிற்றுவிக்க ப்ராம்ப்ட் இன்ஜெக்ஷன்களை உருவாக்க அதைப் பயன்படுத்தினோம்; இதனால் GPT‑Red தாக்குதல்களுக்கு அந்த மாடல் மிகுந்த எதிர்ப்புத் திறன் பெற்றது.
நாங்கள் வெளியிடும் மாடல்களிலிருந்து தனியாக GPT‑Red-ஐ வைத்திருக்கிறோம். இதனால், GPT‑Red‑இல் நாம் குறிப்பாகப் பயிற்றுவிக்கும் தீங்கு விளைவிக்கும் திறன்கள் எதிர்மறை செயற்பாட்டாளர்களின் கைகளுக்குச் செல்லாமல் இருக்கும்; அதே நேரத்தில் எங்கள் தயாரிப்பு மாடல்களில் உறுதித்தன்மை உருவாகிறது.
பயிற்றுவிக்கப்பட்ட பாதுகாப்பாளர் மாடல்கள் மற்றும் ரெட் டீமிங் சூழ்நிலைகளின் தொகுப்புக்கு எதிராக மிகவும் பயனுள்ளதாக GPT‑Red உள்ளது. OpenAI-இல் பாதுகாப்பை பரவலாக மேம்படுத்த, இந்த மாடல் பொதுப் பயன்பாட்டு ரெட் டீமிங் ஏஜென்டாக பயனுள்ளதா என்பதையும் மதிப்பிடுகிறோம். அதற்காக, புதிய பாதுகாப்புச் சூழல்கள் மற்றும் இலக்கு மாடல்களில் GPT‑Red எவ்வளவு பயனுள்ளதாக உள்ளது என்பதைச் சோதிக்கிறோம்.
முதலில், டிசீமியன் உள்ளிட்டோர் (2025) உருவாக்கிய மறைமுக ப்ராம்ப்ட் இன்ஜெக்ஷன் அரங்கின்(புதிய சாளரத்தில் திறக்கும்) மறுபிரதி பதிப்பைப் பயன்படுத்தி, புதிய ரெட் டீமிங் சூழ்நிலைகளுக்கு GPT‑Red பொதுப்படுத்தும் திறனை மதிப்பிடுகிறோம். இந்தச் சவாலில், முன்கூட்டியே குறிப்பிட்ட சூழல்களின் தொகுப்பில் GPT‑5.1‑க்கு எதிரான தாக்குதல்களை மனித ரெட் டீமிங் நிபுணர்களும் GPT‑Red‑உம் தனித்தனியாக முன்மொழிந்தனர். இந்த ரெட் டீமிங் சூழ்நிலைகளும் இலக்குகளும் GPT‑Red‑ஐப் பயிற்றுவிக்கப் பயன்படுத்தியவற்றிலிருந்து வேறுபட்டவை. கணிசமாக அதிக தாக்குதல் வெற்றி விகிதங்களை GPT‑Red அடைகிறது; மனிதர்களுக்கு 13% மட்டுமே இருந்த நிலையில், 84% சூழ்நிலைகளில் வெற்றி கண்டது.
தானியக்க ரெட் டீமிங் நிபுணராக GPT‑Red சிறந்து விளங்குகிறது. உள் பிரதிபலிப்பைப் பயன்படுத்தி, டிசீமியன் உள்ளிட்டோர் (2025) உருவாக்கிய மறைமுக ப்ராம்ப்ட் இன்ஜெக்ஷன் அரங்கில், மனித ரெட் டீமிங் நிபுணர்களைவிட GPT‑5.1‑க்கு எதிராக அதிகமான சூழல்களில் வெற்றிகரமான தாக்குதல்களை GPT‑Red உருவாக்க முடிகிறது.
ஒரு ரெட் டீமிங் நிபுணருக்கான இறுதி சோதனை, முறைமையின் அடிப்படை மாடல் மற்றும் சூழல் பணி அமைவு வடிவமைப்பு குறித்த முழுமையற்ற அறிவுடன், நிஜ உலக ஏஜென்ட் முறைமைகளுக்கு எதிராக குறிவைக்கப்பட்ட தீங்கு விளைவிக்கும் இலக்குகளை அடையும் திறனாகும். இந்த அமைப்பில் எங்கள் முதல் பரிசோதனையில், Andon Labs உருவாக்கிய OpenAI அலுவலகத்தில் உள்ள AI இயக்கும் விற்பனை இயந்திரத்திற்கு எதிராக GPT‑Red‑ஐ நிறுத்தினோம்; அது Project Vend(புதிய சாளரத்தில் திறக்கும்)-ஐ ஒத்தது. முறைமையின் விளக்கத்தையும், நிஜ உலக வெளியீட்டை நெருக்கமாக பிரதிபலிக்கும் உருவகப்படுத்தப்பட்ட ஏஜென்டிடமிருந்து தாக்குதல்களை அனுப்பவும் கருவி அழைப்புகளை கவனிக்கவும் கூடிய திறனையும் GPT‑Red‑க்கு வழங்கினோம். தாக்குதல்களில் பலமுறை மாற்றியமைத்த பிறகு, GPT‑Red தனது தாக்குதலை தயாரிப்பு ஏஜென்டுக்கு எதிராகப் பயன்படுத்தி, அதன் மூன்று தீங்கு விளைவிக்கும் நோக்கங்களையும் அடைந்தது:
- கையிருப்பில் உள்ள விலையுயர்ந்த பொருளின் விலையை அனுமதிக்கப்பட்ட குறைந்தபட்ச விலையான $0.50-க்கு மாற்றுதல்;
- புதிய $100+ பொருளை ஆர்டர் செய்து அதை $0.50-க்கு வழங்குதல்; மேலும்
- மற்றொரு வாடிக்கையாளரின் ஆர்டரை ரத்துசெய்தல்.
இந்த பலவீனங்களை நாங்கள் வெளிப்படுத்தியுள்ளோம்; புதிய பாதுகாப்புகள் தீவிரமாகச் சோதிக்கப்பட்டு வருகின்றன.
விற்பனை இயந்திரத்தை நிர்வகிக்கும் Vendy எனப்படும் நேரடி தன்னாட்சி ஏஜென்டை GPT‑Red முறியடிக்க முடிகிறது. முதலில் உருவகப்படுத்தலில் சோதித்து, பின்னர் தாக்குதல்களை நேரடி ஏஜென்டுக்கு மாற்றுவதன் மூலம், விலையுயர்ந்த பொருட்களை மலிவாக மாற்றவும் பிற வாடிக்கையாளர் ஆர்டர்களை ரத்துசெய்யவும் தயாரிப்பு ஏஜென்டை GPT‑Red தூண்ட முடிந்தது.
ஒதுக்கி வைக்கப்பட்ட 10 தரவு-வெளியேற்றச் சூழ்நிலைகளின் தொகுப்பில், Codex CLI ஏஜென்டை (GPT‑5.4 mini அடிப்படையிலானது) தாக்கவும் GPT‑Red‑ஐப் பயன்படுத்துகிறோம். ஒதுக்கி வைக்கப்பட்ட ரெட் டீமிங் செயல்திறனில் எங்கள் பயிற்சி நடைமுறை ஏற்படுத்தும் தாக்கத்தை ஆய்வு செய்ய, இந்த மாடலை ப்ராம்ப்ட் செய்யப்பட்ட GPT‑5.5 அடிப்படையுடன் ஒப்பிடுகிறோம். GPT‑Red அதிக பயனுள்ளதாகவும், அதிக டோக்கன் திறனுள்ளதாகவும் உள்ளது; அதாவது, மேலும் பல சூழல்களில் ஏஜென்டை நுணுக்கமான தரவை வெளியேற்றச் செய்ய முடிகிறது.
நேரடி Codex ஏஜென்ட்களை முறியடிப்பதில் GPT‑Red மேலும் பயனுள்ளதாகவும் திறனுள்ளதாகவும் உள்ளது. GPT‑5.4 Mini ஆதரிக்கும் Codex ஏஜென்டுக்கு எதிராக, 10 தனிப்பயன் தரவு வெளியேற்றப் பணிகளின் தொகுப்பில் சோதிக்கிறோம்.
GPT‑Red‑இன் இறுதி இலக்கு எங்கள் மாடல்களின் உறுதித்தன்மையை மேம்படுத்துவதாகும். கடந்த ஆறு மாதங்களில், அதிகரித்த கணிப்பொறி வளத்துடன் படிப்படியாக வலுவான ரெட் டீமிங் மாடல்களை (GPT‑Red‑க்கு முன்னோடிகள்) பயிற்றுவித்து, GPT‑5.3 முதல் ஒவ்வொரு அடுத்தடுத்த தயாரிப்பு மாடலின் பயிற்சியிலும் இந்த மாடல்களைப் பயன்படுத்தியுள்ளோம். காலப்போக்கில், ஒவ்வொரு அடுத்தடுத்த GPT வெளியீடும் மேலும் உறுதியானதாகியுள்ளது.
ஓர் எடுத்துக்காட்டாக, GPT‑Red‑இன் ஆரம்ப பதிப்பு “போலி செயின்-ஆஃப்-தாட்” தாக்குதல்கள் எனப்படும் புதிய வகை நேரடி ப்ராம்ப்ட் இன்ஜெக்ஷன் தாக்குதல்களைக் கண்டறிந்தது. இந்தத் தாக்குதல்கள் GPT‑5.1‑இல் 95%க்கும் மேற்பட்ட வெற்றி விகிதங்களை அடைந்தன; ஆனால் GPT‑5.6 Sol-இல் இப்போது 10%க்கும் குறைவாக உள்ளன. அதேபோல், டெவலப்பர் கருவிகள் மற்றும் உலாவலில் உள்ள தாக்குதல்களை இலக்காக்கும் எங்கள் பல மறைமுக ப்ராம்ப்ட் இன்ஜெக்ஷன் அளவுகோல்கள் எங்கள் சமீபத்திய மாடலால் நிரம்பிவிட்டன (>97% துல்லியம்).
GPT‑Red‑க்கு எதிரான உறுதித்தன்மையும் கணிசமாக மேம்பட்டுள்ளது. பரந்த உறுதித்தன்மை சூழல்களின் தொகுப்பில், GPT‑Red‑இன் தாக்குதல் வெற்றி விகிதங்கள் காலப்போக்கில் தொடர்ந்து குறைந்துள்ளன. எங்கள் சமீபத்திய மாடல் வெளியீட்டில், GPT‑Red‑இன் நேரடி ப்ராம்ப்ட் இன்ஜெக்ஷன்களில் 0.05% மட்டுமே GPT‑5.6 Sol தோல்வியடைகிறது.
ப்ராம்ப்ட் இன்ஜெக்ஷன்களுக்கான self-play பயிற்சியை தொடர்ந்து விரிவுபடுத்தியபோது, தற்போதைய மாடல்களை முறியடிக்கக்கூடிய புதிய அச்சுறுத்தல்களைக் கண்டறிந்தோம். அதே சமயம், எங்களின் விரிவுபடுத்தல் இந்தத் தாக்குதல்களுக்கு எதிரான உறுதித்தன்மையையும் கணிசமாக மேம்படுத்தியுள்ளது. ஒதுக்கி வைக்கப்பட்ட சூழல்களில் GPT‑Red மேற்கொண்ட அனைத்து முயற்சிகளின் சராசரி வெற்றியாக தாக்குதல் வெற்றி விகிதம் கணக்கிடப்படுகிறது.
அதிக கோரிக்கைகளை மறுப்பதன் மூலம் அல்லது குறைந்த திறனுடையதாக மாறுவதன் மூலம் ஒரு மாடல் பாதுகாப்பானதாகத் தோன்றலாம். குறைவாகச் செயல்படும் மாடலைத் தாக்குவது இயல்பாகவே கடினம்; ஆனால் அது பயனுள்ள உறுதித்தன்மை அல்ல.
நாம் வடிவமைக்கும் குறிவைக்கப்பட்ட அதிக மறுப்பு பணிகளுடன், பொதுவான அதிநவீன திறன்களையும் முழுமையாக மதிப்பிடுகிறோம். உறுதித்தன்மை கணிசமாக மேம்பட்ட போதிலும், அனைத்து இயல்பான திறன்களும் பாதிக்கப்படாமல் இருப்பதை கண்டறிகிறோம். இது, தவறான கருவி பயன்பாடு அல்லது செல்லுபடியான கோரிக்கைகளை இயல்பாக மறுப்பது அல்லாமல், தீங்கு விளைவிக்கும் அறிவுறுத்தல்களுக்கு மேம்பட்ட எதிர்ப்பிலிருந்தே உறுதித்தன்மை உயர்வுகள் வந்ததாகக் காட்டுகிறது.
எங்கள் அடுத்த தலைமுறை மாடல்களின் திறன்களை மேம்படுத்த AI ஏஜென்ட்கள் ஏற்கனவே பயன்படுத்தப்படுகின்றன. GPT‑Red மூலம் பாதுகாப்பிற்கும் இதே போன்ற ஒரு தொடர் மேம்பாட்டுச் சுழற்சியைத் திறக்கத் தொடங்கியுள்ளோம் என்று நாங்கள் நம்புகிறோம்; இன்றைய மாடல்களைப் பயன்படுத்தி நாளைய மாடல்களை மேலும் உறுதியான, ஒழுங்குபடுத்தப்பட்ட, நம்பத்தகுந்தவையாக மாற்றலாம். இன்றைய மாடலைவிட வலுவான GPT‑Red‑இன் எதிர்கால பதிப்புகளைப் பயிற்றுவிக்க, அல்காரிதம் மேம்பாடுகளைச் செய்யும் போதே கணிப்பொறி வளத்தையும் தரவையும் தொடர்ந்து விரிவுபடுத்துவோம். இதன் மூலம், இந்த மாடல்கள் எதிர்கால GPT வெளியீடுகளை மேலும் பாதுகாப்பானவையாக மாற்ற உதவும்.
மேலும் விவரங்களுடன் ஒரு முன்பதிப்பை இந்த வார இறுதியில் வெளியிடுவோம்.


