பாதுகாப்புக் கண்ணோட்டம்: GPT‑6 Astra
ஏற்றுகிறது…
இதுவரை நாங்கள் பரவலாகப் பயன்பாட்டுக்குக் கொண்டுவந்தவற்றிலேயே மிகத் திறன்மிக்க மாடலான GPT‑6 Astra-வை இன்று வெளியிடுகிறோம். எங்கள் பிரிபேர்ட்நெஸ் ஃப்ரேம்வொர்க்கின்படி இணையப் பாதுகாப்புத் திறனில் மிகத் தீவிர நிலையை எட்டிய எங்களின் முதல் மாடல் Astra ஆகும்.
இந்த வெளியீட்டின் பாதுகாப்பு குறித்து அறிந்துகொள்ள வேண்டிய மிக முக்கியமான விஷயங்கள் பின்வருமாறு:
- GPT‑6 Astra இணையவெளித் திறன்களில் குறிப்பிடத்தக்க முன்னேற்றம் கண்டுள்ளதுடன், எங்களின் மிகத் தீவிர வரம்பையும் எட்டியுள்ளது. சரியான கருவிகளும் அணுகலும் இருந்தால், ஒவ்வொரு படிநிலையிலும் ஒருவர் வழிகாட்டாமலேயே, நன்கு பாதுகாக்கப்பட்ட பல அமைப்புகளில் இதுவரை அறியப்படாத பாதுகாப்புக் குறைபாடுகளைக் கண்டறிந்து, அவற்றைப் பயன்படுத்திக்கொள்ளும் புதிய வழிகளை GPT‑6 Astra-வால் உருவாக்க முடியும் என்பதே இதன் பொருள். எனவே, தவறான பயன்பாடு அல்லது தவறான ஒத்திசைவு காரணமாக மாடல் தீங்கான இணையவெளிச் செயல்களை மேற்கொள்வதைத் தடுக்கும் பாதுகாப்புகளை நாங்கள் கணிசமாக வலுப்படுத்தியுள்ளோம். Astra மற்றும் அதைப் போன்ற மாடல்களின் உள் உருவாக்கம் மற்றும் பயன்பாட்டை பாதுகாப்பாக்கவும் நடவடிக்கைகள் எடுத்துள்ளோம். கடுமையான தனிமைப்படுத்தல், சோதனைநிலைத் தரவின் மறையாக்கம், எண்ணத் தொடர்கள் (CoT) உட்பட முழுச் செயல்பாட்டுப் பாதைகளின் அனைத்தளவிலான கண்காணிப்பு, உள் பயன்பாட்டுக்கு முந்தைய தடுப்பு ஒத்திசைவு மதிப்பீட்டுச் செயல்முறை ஆகியவை இதில் அடங்கும்.
- GPT‑6 Astra அதன் முந்தைய மாடல்களைவிடக் கணிசமாக அதிக உறுதித்தன்மை கொண்டது. புதிய பாதுகாப்பு உறுதித்தன்மைப் பயிற்சி நுட்பங்களைப் பயன்படுத்துவதால், நீண்ட செயல்பாட்டுப் பாதைகள் உட்பட ஜெயில்பிரேக்குகளை எதிர்கொள்வதில் GPT‑5.6 Sol-ஐவிட GPT‑6 Astra கணிசமாக அதிக உறுதித்தன்மை கொண்டுள்ளது. இணையத் தொடர்பில்லாத சோதனைகளும், கடுமையான உள் மற்றும் வெளிப்புற ஜெயில்பிரேக் சோதனை மற்றும் குறைதீர்ப்புத் திட்டமும் இதை உறுதிப்படுத்துகின்றன. அதிக ஆபத்து இருக்கக்கூடும் எனக் குறிக்கப்பட்ட பயனர்களுக்காக, மாடலின் மறுப்பு எல்லையை மேலும் எச்சரிக்கையானதாக மாற்றி, இரட்டைப் பயன்பாடு சார்ந்த பரந்த அளவிலான ஆபத்துகளை உள்ளடக்கும் திறனையும் கூடுதலாகப் பயிற்றுவித்துள்ளோம். முந்தைய சோதனைக் காலங்களில் கண்டறியப்பட்ட ஜெயில்பிரேக்குகளை Astra உறுதியாக எதிர்கொள்வதை உறுதிசெய்ய பின்னடைவு சோதனைகளைப் பயன்படுத்துகிறோம். எங்களின் மேம்பாடுகளைச் சரிபார்க்க, சமீபத்திய உள் ரெட் டீமிங் தாக்குதல் மாடல்களைக் கொண்டு புதிய சுற்றுத் தானியங்கு ரெட் டீமிங்கையும் மேற்கொண்டோம்.
- GPT‑5.6 Sol-ஐவிட GPT‑6 Astra சிறப்பாக ஒத்திசைக்கப்பட்டுள்ளது. மாடல் ஒத்திசைவில் Astra குறிப்பிடத்தக்க முன்னேற்றமாகும். எங்கள் ப்ரீ-ட்ரெயினிங் தரவின் தொகுப்பிலிருந்து ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங்கின்போதான தரமிடல் வரை பல ஒத்திசைவு மேம்பாடுகள் இதில் அடங்கும். புதிய ஒத்திசைவு மதிப்பீட்டுத் தொகுப்பை(புதிய சாளரத்தில் திறக்கும்) நாங்கள் வெளியிட்டுள்ளோம். பாதுகாப்பு எல்லைகளை மதிப்பதிலும், அனுமதிக்கப்பட்ட செயல்பாட்டு வரம்புக்குள் இருப்பதிலும் GPT‑6 Astra மேம்பட்டிருப்பதைக் கண்டறிந்தோம். 54,000-க்கும் மேற்பட்ட உள் Codex பணிகளைப்(புதிய சாளரத்தில் திறக்கும்) பயன்படுத்திய உருவகப்படுத்துதலில், அதிகத் தீவிரமுள்ள தவறான ஒத்திசைவு நடத்தைக்காக Sol பெற்ற எச்சரிக்கைகளில் சுமார் பாதியையே Astra பெற்றது.
- தவறான ஒத்திசைவைக் கண்காணிப்பதை நாங்கள் பரவலாக நடைமுறைப்படுத்துகிறோம். எங்கள் மாடல்களின் சாத்தியமான தவறான ஒத்திசைவு நடத்தையைத் தடுப்பதற்கான முதன்மை வழிமுறையாக மாடல் ஒத்திசைவை நாங்கள் கருதுகிறோம். இருப்பினும், அதிநவீன மாடலின் நடத்தையை விரிவாகப் புரிந்துகொள்ள கண்காணிப்பு உதவுவதுடன், ஒத்திசைவையும் பாதுகாப்பையும் மேலும் மேம்படுத்துவதற்கான வாய்ப்புகளையும் வெளிப்படுத்துகிறது. மேலும், கண்டறியப்படும் தவறான ஒத்திசைவு நடத்தைக்கு எதிரான கூடுதல் பாதுகாப்பு அடுக்காகவும் கண்காணிப்பு செயல்படுகிறது. இந்தக் காரணங்களால், அதிகமான கணினித் திறன் செலவு ஏற்பட்டாலும், Astra-வின் வெளிப்புறப் பயன்பாட்டில் கருவிகளைப் பயன்படுத்தும் அனைத்து அனுமானச் செயல்முறைகளிலும் தவறான ஒத்திசைவுக் கண்காணிப்பைக் கூடுதலாகச் சேர்த்துள்ளோம். இந்த அமைப்பு எங்கள் உள் கட்டமைப்பைப் போன்றே செயல்படுகிறது.
- GPT‑5.6 Sol உடன் ஒப்பிடும்போது GPT‑6 Astra-வின் கண்காணிப்புத் திறன் குறைந்துள்ளது. GPT‑6 Astra-வின் கண்காணிப்புத் திறன்(புதிய சாளரத்தில் திறக்கும்) மற்றும் கட்டுப்பாட்டுத் திறன்(புதிய சாளரத்தில் திறக்கும்) குறித்து விரிவான ஆய்வுகளை மேற்கொண்டுள்ளோம். GPT‑5.6 Sol-ஐவிட GPT‑6 Astra தனது சொந்த CoT-ஐ அதிகமாகக் கட்டுப்படுத்தக்கூடியது என்றும், அதன் CoT-இல் குற்றத்தை வெளிப்படுத்தும் தகவல்களைச் சேர்ப்பதற்கான வாய்ப்பு குறைவு என்றும் கண்டறிந்துள்ளோம். எதிர்தாக்குதல் சூழல்களில், அதாவது எங்கள் கண்காணிப்பு அமைப்புகளைத் தவிர்க்குமாறு மாடலைத் தூண்டும்போது, மதிப்பீடுகளில் திட்டமிட்டு குறைவாகச் செயல்பட்டு போலித் தோற்றத்தை ஏற்படுத்துகையில் மாடல் கண்டறியப்படாமல் இருக்க முடிகிறது. மேலும், சில நாசவேலைப் பணிகளைச்(புதிய சாளரத்தில் திறக்கும்) செய்யுமாறு கேட்டால், சில நேரங்களில் எங்கள் உள் கண்காணிப்பு அமைப்புகளையும் அதனால் தவிர்க்க முடிகிறது. மறைதகவல் குறியீட்டைப் பயன்படுத்தும் CoT ரீஸனிங்கிற்கு, எடுத்துக்காட்டாகச் சாதாரணமானதும் தொடர்பற்றதுபோல் தோன்றும் உரைக்குள் மறைமுக ரீஸனிங்கை ஒளிப்பதற்கு, எந்த ஆதாரத்தையும் நாங்கள் காணவில்லை. எனவே, இந்தத் தவிர்ப்பு ஆபத்து பெரும்பாலும் குறைந்த ரீஸனிங் தேவைப்படும் பணிகளுக்குள் மட்டுப்படலாம்.
- எதிர்தாக்குதல் சூழல்களில் Astra வகை மாடல்களால் எங்கள் CoT கண்காணிப்பு அமைப்புகளைத் தவிர்க்க முடியும் என்பதை இந்தக் கண்டுபிடிப்புகள் சுட்டிக்காட்டுகின்றன. தற்போது, இந்தக் கண்டுபிடிப்புகள் பெரும்பாலும் எதிர்தாக்குதல் மதிப்பீடுகளை, அதாவது கண்காணிப்பைத் தவிர்க்குமாறு மாடலுக்கு நாங்கள் அறிவுறுத்தும் சூழல்களை, அடிப்படையாகக் கொண்டவை. இருப்பினும், பாதுகாப்புக் கட்டுப்பாடுகளை மீறுவதற்கான வாய்ப்பு GPT‑5.6 Sol-ஐவிட Astra-வுக்கு ஒட்டுமொத்தமாகக் குறைவு என்பதை எங்கள் ஒத்திசைவு மதிப்பீடுகள் காட்டுகின்றன.
- எனினும், இந்தப் போக்கை நாங்கள் முக்கியமானதாகக் கருதுகிறோம். எங்கள் மாடல்களின் திறன் அதிகரிக்கும்போது, இந்தக் கண்டுபிடிப்புகளையும் கண்காணிப்புத் திறனில் அவற்றின் தாக்கங்களையும் தொடர்ந்து ஆராய்ந்து வருகிறோம். எண்ணத் தொடர் கண்காணிப்பைப் பாதுகாத்துப் பயன்படுத்த OpenAI பணியாற்றியுள்ளது. CoT கண்காணிப்புத் திறனைப் பாதுகாப்பது இந்த ஆராய்ச்சித் திட்டத்தின் முக்கிய இலக்காகும். எனினும், மாடலின் எண்ணத் தொடரை ஆராய்வதற்கும் அப்பாற்பட்ட ஒத்திசைவுத் தணிக்கை நுட்பங்களை உருவாக்குவதன் முக்கியத்துவத்தையும் இந்த முடிவுகள் வலியுறுத்துகின்றன.
- இணைய உலாவல் மற்றும் பணியிடச் சூழல்களை GPT‑6 Astra அதிகப் பொறுப்புடன் கையாள்கிறது: GPT‑5.6 Sol-ஐவிட ப்ராம்ப்ட் ஊடுருவல்களை எதிர்கொள்வதில் GPT‑6 Astra கணிசமாக அதிக உறுதித்தன்மை கொண்டுள்ளது. நடைமுறைக்கு நெருக்கமான இணைய உலாவல் மற்றும் தொழில்முறை கணினிச் சூழல்களிலும் மாடலின் நடத்தையைச் சோதித்துள்ளோம். GPT‑5.6 Sol உடன் ஒப்பிடும்போது, தவறாக ஒத்திசைந்த மற்றும் அழிவை ஏற்படுத்தக்கூடிய செயல்களை, எடுத்துக்காட்டாக அனுமதியற்ற பரிவர்த்தனைகள், தரவு இழப்பு, அளவுக்கு மீறிய அணுகல் அல்லது கட்டுப்பாடுகளை மீறுதல் ஆகியவற்றை, இந்த மாடல் மேற்கொள்வதற்கான வாய்ப்பு கணிசமாகக் குறைவாக இருப்பதைக் கண்டறிந்தோம். வன்முறைத் தாக்குதலைத் திட்டமிட உதவுவது அல்லது மோசடி செய்வது போன்ற தீங்கான கோரிக்கைகளைத் தன்னிச்சையாகச் செயல்படும் சூழல்களில் கையாளும்போதும் இது அதிகப் பாதுகாப்புடன் செயல்படுகிறது.
- அதிக ஆபத்துள்ள சூழல்களில் GPT‑6 Astra கணிசமாகப் பாதுகாப்பானது. நடைமுறைப் பயன்பாட்டிலிருந்தும் மனிதர்களின் எதிர்தாக்குதல் ரெட் டீமிங்கிலிருந்தும் பெறப்பட்ட சவாலான கோரிக்கைகளுக்கு, GPT‑5.6 Sol-ஐவிட GPT‑6 Astra அதிகப் பாதுகாப்புடன் பதிலளிக்கிறது. பாதுகாப்பற்ற கோரிக்கைகளைப் பாதுகாப்பாக நிறைவேற்றுவதிலும், தீங்கற்ற கோரிக்கைகளைத் தேவையின்றி மறுப்பதைத் தவிர்ப்பதிலும் Astra பரேட்டோ மேம்பாட்டை அடைகிறது. வெளிப்படையான கோரிக்கையால் அல்லாமல் விரிவான சூழலால் தீங்கு ஏற்படும் ஆபத்து உருவாகக்கூடிய மிகத் தீவிரச் சூழல்களிலும் இந்த மேம்பாடுகள் காணப்படுகின்றன. 18 வயதிற்குட்பட்ட பயனர்களுக்கான வயதுக்கேற்ற பாதுகாப்பு எல்லைகளையும் Astra மேலும் சீராகப் பயன்படுத்துகிறது.
மேலும் தகவலுக்கு, முழு சிஸ்டம் கார்டைப்(புதிய சாளரத்தில் திறக்கும்) பார்க்கவும்.
ஆசிரியர்
OpenAI


