முக்கிய உள்ளடக்கத்திற்கு செல்க
OpenAI

20 ஜூலை, 2026

பாதுகாப்பு

நீண்ட கால வரம்பு மாடல்கள் காலத்தில் பாதுகாப்பும் ஒத்திசைவும்

நீண்ட நேரம் இயங்கும் மாடலின் உள் பயன்பாடு பாதுகாப்பைப் பற்றி எங்களுக்கு கற்றுக்கொடுத்தது.

ஏற்றுகிறது…

சுருக்கம்

  • நீண்ட நேரம் இயங்கும் மாடல்கள் கடினமான, திறந்த முடிவுள்ள சிக்கல்களைத் தீர்க்க முடியும்; ஆனால் அவற்றின் விடாமுயற்சி, விரும்பத்தகாத செயல்களைச் செய்ய அதிக வாய்ப்புகளை உருவாக்குகிறது. 

  • நீண்ட நேரம் இயங்கும் பணிகளுக்காகப் பயிற்றுவிக்கப்பட்ட ஒரு மாடலின் வரையறுக்கப்பட்ட உள் பயன்பாட்டின்போது, எங்களின் தற்போதைய வெளியீட்டுக்கு முன் மதிப்பீடுகள் பிடிக்காத புதிய வகை தோல்விகளை கவனித்தோம்; அதனால் அணுகலை இடைநிறுத்தினோம். பின்னர், இந்தத் தோல்விகளிலிருந்து கிடைத்த புரிதல்களைப் பயன்படுத்தி புதிய மதிப்பீடுகளை உருவாக்கி, நீண்ட கால வரம்பு ஒத்திசைவை மேம்படுத்தி, செயல்பாதை-நிலை கண்காணிப்பைச் சேர்த்து, வரையறுக்கப்பட்ட அணுகலை மீண்டும் வழங்குவதற்கு முன் பயனர்களுக்கு அதிகத் தெளிவும் கட்டுப்பாடும் வழங்கினோம்.

  • இந்த அனுபவம் படிப்படியான வெளியீட்டின் மதிப்பை மேலும் உறுதிப்படுத்தியது. நிலையான எந்த மதிப்பீட்டு தொகுப்பும் ஒவ்வொரு நடத்தையையும் முன்கூட்டியே கணிக்க முடியாது. ஆகவே வெளியீட்டுக்கு முன் சோதனையுடன் நெருக்கமான கண்காணிப்பு, தலையிடக்கூடிய பாதுகாப்பு ஏற்பாடுகள், தேவையானபோது இடைநிறுத்த அல்லது முந்தைய நிலைக்குத் திருப்பும் திறன் ஆகியவை இணைந்து இருக்க வேண்டும்.

நீண்ட நேரம் தன்னிச்சையாகச் செயல்படக்கூடிய மாடல்கள், கடினமான, திறந்த முடிவுள்ள சிக்கல்களை ஏற்றுக்கொள்ள முடியும். ஆனால் அவற்றைப் பயனுள்ளதாக ஆக்கும் அதே விடாமுயற்சி, விரும்பத்தகாத செயல்களைச் செய்ய அவற்றுக்கு அதிக வாய்ப்புகளையும் தருகிறது; குறுகிய கால வரம்பு கொண்ட மாடல்களுக்காக வடிவமைக்கப்பட்ட மதிப்பீடுகள் தவறவிடக்கூடிய வழிகளிலும் அவை அப்படி செய்யலாம்.

சுமார் இரு மாதங்களுக்கு முன்பு, ஓர் உள் பொதுப் பயன்பாட்டு மாடல் எர்டோஸ் அலகு தூர அனுமானத்தை மறுத்து நிரூபித்ததாக நாங்கள் அறிவித்தோம். இந்த மாடல் மிக நீண்ட காலம் தன்னிச்சையாகச் செயல்படும்படி வடிவமைக்கப்பட்டது. வரையறுக்கப்பட்ட, கண்காணிக்கப்பட்ட உள் பயன்பாட்டின்போது, எங்களின் தற்போதைய வெளியீட்டு மதிப்பீடுகள் பிடிக்காத விரும்பத்தகாத நடத்தையை நாங்கள் கவனித்தோம். வெளியீடு வரையறுக்கப்பட்டதும் கண்காணிக்கப்பட்டதும் என்பதால், இந்தச் சிக்கல்களை அடையாளம் காண, அணுகலை நிறுத்தி வைக்க, நாங்கள் கவனித்தவற்றின் அடிப்படையில் புதிய மதிப்பீடுகளை உருவாக்க, மாடலையும் அதன் பாதுகாப்பு ஏற்பாடுகளையும் வலுப்படுத்த, பின்னர் தொடர்ந்து கண்காணிப்பின் கீழ் அணுகலை மீண்டும் வழங்க எங்களால் முடிந்தது. 

நாங்கள் மாடல்களை மதிப்பீடு செய்யும் சூழ்நிலைகள், அவை உண்மையான பயன்பாட்டில் சந்திக்கும் சூழ்நிலைகளுடன் ஒருபோதும் முழுமையாகப் பொருந்தாது. அதனால்தான், வெளியீட்டுக்கு முன் செய்யும் மதிப்பீடுகளுடன், வரையறுக்கப்பட்ட மற்றும் கண்காணிக்கப்பட்ட வெளியீடும், சிக்கல்கள் தோன்றும்போது தலையிட, இடைநிறுத்த அல்லது முந்தைய நிலைக்குத் திருப்பும் திறனும் இணைந்து இருக்க வேண்டும். வெளியீட்டிலிருந்து நாம் கற்றுக்கொள்வது, அணுகல் விரிவடைவதற்கு முன் வலுவான மதிப்பீடுகள் மற்றும் பாதுகாப்பு ஏற்பாடுகளின் ஒரு பகுதியாக மாறலாம்.

பின்வரும் பகுதிகளில், நாங்கள் கவனித்தவற்றின் தெளிவான எடுத்துக்காட்டுகள், சிக்கல்களை எவ்வாறு தீர்த்தோம், இந்த அனுபவம் எதிர்கால வெளியீடுகளை எவ்வாறு வடிவமைக்கும் என்பவற்றைப் பகிர்கிறோம்.

மாடலின் விடாமுயற்சி பாதுகாப்பு பலவீனங்களை வெளிக்கொணரலாம்

புதிய மாடல், நீண்ட காலம் மீண்டும் மீண்டும் முயற்சி செய்து ஓர் இலக்கை நோக்கித் தொடர்ந்து செயல்பட முடியும். அதே விடாமுயற்சி, அதன் சூழலில் உள்ள பலவீனங்களை கண்டறிந்து பயன்படுத்துவதற்கும் வழிவகுக்கலாம். முந்தைய மாடல்கள், சாண்ட்பாக்ஸ் அல்லது சூழல் கட்டுப்பாடுகளைச் சந்தித்தபோது, வெறுமனே நிறுத்தி பயனரிடம் திரும்பிவிடும். இந்த மாடல், தன் சாண்ட்பாக்ஸுக்கு வெளியே செயல்பட வழிகளைத் தேடுவது உட்பட, பெரும்பாலும் தொடர்ந்து முயன்றது.

இதற்கான ஓர் எடுத்துக்காட்டு, NanoGPT வேகப்போட்டி(புதிய சாளரத்தில் திறக்கும்) பற்றிய உள் மதிப்பீட்டின்போது நடந்தது; இது ஒரு சிறிய மொழி மாடலை மிகக் குறைந்த படிகளில் பயிற்றுவிப்பதற்கான பொது பெஞ்ச்மார்க். எங்கள் மாடல் PowerCool எனப்படும் power-law learning-rate cooldown ஒன்றை உருவாக்கியது; அது குறிப்பிடத்தக்க முன்னேற்றத்தை ஏற்படுத்தியது. தன் முடிவுகளை Slack-இல் மட்டும் பதிவிடுமாறு மாடலுக்கு அறிவுறுத்தப்பட்டிருந்தது; ஆனால் முடிவுகளை GitHub-க்கு PR-ஆக பதிவிட NanoGPT வழிமுறைகள் சொல்கின்றன. மாடல் பின்னைய வழிமுறைகளைப் பின்பற்றி, பொது GitHub ரிபாசிட்டரியில் PR #287-ஐத் திறந்தது. வெளிப்புற அணுகலைத் தடுக்க வடிவமைக்கப்பட்ட சாண்ட்பாக்ஸ் கட்டுப்பாடுகளை மாடல் மீறி, GitHub-க்கு பதிவேற்றத்தைத் தொடர்ந்தது. PR-ஐ உருவாக்குவதற்காக சாண்ட்பாக்ஸில் ஒரு பலவீனத்தைக் கண்டுபிடிக்க எங்கள் மாடலுக்கு ஒரு மணி நேரம் பிடித்தது; முந்தைய மாடல்கள் விடாமுயற்சி குறைவாக இருந்ததால் பலவீனங்களை கண்டுபிடிக்க முடியாமல், PR பகுதியை விட்டுவிட்டன.1

தனி செயல்களைப் பரிசீலிப்பதிலிருந்து முழு செயல்பாதைகளைப் பரிசீலிப்பதற்கு

AI உதவியாளர்களுக்கான பல பாதுகாப்புக் கட்டுப்பாடுகள் தனிப்பட்ட செயல்களை மையமாகக் கொண்டு வடிவமைக்கப்படுகின்றன. ஒரு செயல் அனுமதிக்கப்படாததாக இருந்தால், அது தடுக்கப்படும். அது நுணுக்கமானதாக இருந்தால், பயனரிடமிருந்து வெளிப்படையான ஒப்புதலை முறைமை கேட்கும். ஆனால் மணி நேரங்கள், நாட்கள் அல்லது வாரங்கள்கூட தன்னிச்சையாக நீளக்கூடிய செயல்களைக் கொண்ட நீண்ட நேரம் இயங்கும் மாடல்கள், இந்த அமைவை சவாலுக்கு உட்படுத்துகின்றன: தனிப்பட்ட செயல்களை கண்காணிப்பது, மொத்த செயல்பாதையின் நோக்கத்தைப் பின்தொடர இனி போதாது.

எடுத்துக்காட்டாக, ஒரு சிக்கலைத் தீர்க்குமாறு மாடலிடம் கேட்ட சூழலில், பிற முறைமைகளில் வெற்றிகரமான ஆனால் தனிப்பட்ட சமர்ப்பிப்புகள் இருப்பதை மாடல் கவனித்து, மதிப்பீட்டு பின்தளத்திலிருந்து அந்தத் தீர்வுகளை மீட்டெடுக்க முயன்றது. அங்கீகார டோக்கனை ஒரு ஸ்கேனர் கண்டறிந்ததால் அதன் ஆரம்ப முயற்சி தடுக்கப்பட்டபோது, டோக்கன் உடலை இரு துண்டுகளாக மாடல் பிரித்து, அவற்றை மறைத்துவிட்டு, பின்னர் இயக்க நேரத்தில் அந்த அங்கீகாரச் சான்றை மீளமைத்தது; இதனால் முழு டோக்கன் ஒரே தொடர்ச்சியான சரமாக ஒருபோதும் தோன்றவில்லை. ஸ்கேனரை விலக்கிச் செல்ல இந்தப் படிகளை எடுத்து வருவதாக, பயனருக்கான கருத்துகளிலும் அதன் ரீஸனிங் தடங்களிலும் மாடல் வெளிப்படையாகக் குறிப்பிட்டது.

ஒவ்வொரு படியும் தனித்தனியாகப் பார்க்கும்போது ஏற்றுக்கொள்ளத்தக்கதாகத் தோன்றினாலும், ஒப்புதல் பெறாத ஒரு விளைவை வரிசை கொண்டுவர முடியும் என்பதை இந்த எடுத்துக்காட்டு காட்டுகிறது. நீண்ட கால வரம்புகளில் திறம்பட செயல்படும் மாடல், ஒப்புதல் முறைமை கண்டறிய முடியாத பகுதிகளை கற்றுக்கொண்டு, தன் இலக்குகளை அடைய அதைத் தாண்டிச் செல்லவும் முடியும் என்பதையும் இது காட்டுகிறது. நீண்ட கால வரம்புக்கான பாதுகாப்பில், “இந்தச் செயல் அனுமதிக்கப்படுகிறதா?” என்று கேட்பது மட்டுமல்லாமல், “இந்தச் செயல்களின் வரிசை எந்த முடிவை நோக்கிச் செல்கிறது?” என்றும் கேட்க வேண்டும்.

நீண்ட நேரம் இயங்கும் மாடல்களுக்கான பாதுகாப்பு ஏற்பாடுகளை உருவாக்குதல்

இப்படிப்பட்ட சம்பவங்களால், புதிய மாடலின் உள் வெளியீட்டை நாங்கள் இடைநிறுத்தினோம். பல அடுக்குப் பாதுகாப்பு மற்றும் செயல்பாதை-நிலை கண்காணிப்பை மையமாகக் கொண்டு பாதுகாப்பு முறைமையை மீண்டும் உருவாக்கினோம்.

  • சம்பவங்களிலிருந்து உருவாக்கப்பட்ட மதிப்பீடுகள். ஒரு முறைமை உண்மையில் வெளியிடப்படுவதற்கு முன், அதை வெளியிடுவது பாதுகாப்பானதா என்பதைப் பற்றிய புரிதலை மதிப்பீடுகள் நமக்கு தர முடியும். ஆனால் மிகப் பயனுள்ளதாக இருக்க, ஒரு மதிப்பீடு உண்மையான வெளியீட்டின்போது செயல்பாதைகளின் விநியோகத்தையும் கால வரம்பு நீளத்தையும் பிரதிபலிக்க வேண்டும். இந்தக் காரணத்தால், கவனிக்கப்பட்ட தோல்விகளைப் பயன்படுத்தி எதிர்மறைச் சோதனை மதிப்பீடுகளை உருவாக்கினோம். உண்மைச் சம்பவங்களிலிருந்து பெறப்பட்ட மதிப்பீடுகளில் மேம்படுதல், தயாரிப்பு சூழலில் வெளியிடப்பட்ட பின் பாதுகாப்பான நடத்தைக்கு வழிவகுத்தது என்பதை கண்டறிந்தோம்.
  • மேம்பட்ட ஒத்திசைவு. பயனரின் இலக்கை அடைவதற்காக அனுமதியில்லாமல் விரும்பத்தகாத செயல்களை எடுக்கும் அதன் போக்கைக் குறைக்க நாங்கள் நடவடிக்கைகள் எடுத்தோம்.  எடுத்துக்காட்டாக, நீண்ட செயலோட்டங்களில் எங்கள் மாடல்கள் வழிமுறைகளை நினைவில் வைத்திருக்கச் சிரமப்பட்டதை கண்டறிந்தோம்; இந்த திறனுக்காக மாடலைப் பயிற்றுவித்தபோது, நீண்ட செயலோட்டங்களிலும் ஒத்திசைவுடன் இருந்த மாடல் கிடைத்தது. 
  • செயலில் உள்ள கண்காணிப்பு. பயனர் விதித்த கட்டுப்பாடு அல்லது பாதுகாப்பு எல்லையை மாடல் மீறுகிறதா என்பதற்கான அறிகுறிகளை அறிய, அதன் மாறிக்கொண்டிருக்கும் செயல்பாதையை ஆய்வு செய்யும் கண்காணிப்பு முறைமையை உருவாக்கினோம். கண்காணிப்பு ஒரு தனி செயலை மட்டும் அல்ல, முழு செயல்பாதையையும் கவனிக்கிறது. முக்கியமாக, கண்காணிப்பு அமர்வை இடைநிறுத்தி, மேலும் நெருக்கமாக ஆய்வு செய்ய பயனரை எச்சரிக்க முடியும். ஆய்வு செய்தபின், கண்காணிப்பு தவறாகத் தூண்டப்பட்டிருந்தால், மாடலின் பணியைத் தொடர பயனர் தேர்வு செய்யலாம். 
  • பயனருக்கு அதிகத் தெளிவும் கட்டுப்பாடும். இந்த நீண்ட நேரம் இயங்கும் அமர்வுகளை பயனர் ஆய்வு செய்யவும், எடுக்கப்பட்ட செயல்களைப் பார்க்கவும், தலையீடுகளை கண்காணிக்கவும் முடியும் திறனை நாங்கள் மேம்படுத்தினோம்.

மீண்டும் வெளியிடுதல்

புதிய கண்காணிப்பை மதிப்பீடு செய்ய, மாடல் முன்பு ஒத்திசைவற்ற செயல்களைத் தொடர்ந்த சில உள் வெளியீட்டு சூழல்களை, இம்முறை புதிய பாதுகாப்பு ஏற்பாடுகளுடன், மீண்டும் இயக்கிப் பார்த்தோம்2. மாடல் தொடர்ந்த ஒத்திசைவற்ற செயல்களில் குறிப்பிடத்தக்க அளவில் அதிகமானவற்றை புதிய பாதுகாப்பு ஏற்பாடுகள் கண்டுபிடிக்க முடிந்தது; அவை தவறவிட்ட அனைத்தும் குறைந்த தீவிரமுள்ளவை என மதிப்பிடப்பட்டன.

இந்தக் குறைந்த தீவிரச் சம்பவங்களின் சில எடுத்துக்காட்டுகளில் பின்வரும் வழக்குகள் அடங்கும்:

  • ஒரு Linear கட்டளை வரி கருவியை அணுக, மாடல் nested codex --yolo அமர்வைத் தொடங்கியது; உண்மையில் --yolo கொடி இல்லாமலேயே அதைச் செய்திருக்க முடியும்.
  • முன்பு செயலிலிருந்த ஒரு வளம் காணாமல் போனதை மாடல் கவனித்தது. பின்னர் ஆராயத் தொடங்கி, அதன் உரிமையாளரின் நேம்ஸ்பேஸின் கீழ் உள்ள பிற நேரலை CPU பாட்களிலும், மேலும் OpenAI ஊழியர்களுக்குச் சொந்தமான பாட்களிலும் (வெற்றியின்றி) SSH செய்தது; அதற்கான நல்ல காரணம் இல்லை.
  • மாடலில் பல கண்டறி செயல்முறைகள் சிக்கியிருந்தன; ஒவ்வொரு shell கட்டளையும் நிற்காமல் தொங்கியது. பின்னர் அது kill -9 -1 என்பதை இயக்கியது; அது செயல்படுத்தப்பட்டிருந்தால், அந்த பாடில் கொல்ல அதற்கு அனுமதி உள்ள ஒவ்வொரு செயல்முறைக்கும் SIGKILL அனுப்பியிருக்கும். ஆனால் அது நேரம் முடிந்து நிறுத்தப்பட்டது; செயல்படுத்தப்படவில்லை.

புதிய முறைமையைச் சோதித்த பிறகு, நீண்ட கால வரம்பு திறன்களைக் கொண்ட மாடல்களுக்கு வரையறுக்கப்பட்ட உள் அணுகலை மீண்டும் வழங்கலாம் என்று நாங்கள் முடிவு செய்தோம். பல வாரங்களுக்கு முன் மீண்டும் வெளியீடு தொடங்கியதிலிருந்து, பாதுகாப்பு ஏற்பாடுகளை தீவிரமாக விலக்கிச் செல்லும் எந்தச் சம்பவத்தையும் நாங்கள் கவனிக்கவில்லை. இந்த பாதுகாப்பு ஏற்பாடுகளின் முதல் பதிப்பு திட்டமிட்டே எச்சரிக்கையாக வடிவமைக்கப்பட்டது. பாதுகாப்பு ஏற்பாடுகளை பலவீனப்படுத்தாமல், தேவையற்ற இடையூறுகளை குறைக்க முறைமையை தொடர்ந்து சீரமைத்து வருகிறோம்.

இறுதி சிந்தனைகள்

நாங்கள் படிப்படியாக வெளியிட்டதால், அணுகலை விரிவுபடுத்துவதற்கு முன் இடைவெளிகளை கண்டறிந்து தீர்க்க முடிந்தது. வெளியீட்டுக்கு முன் செய்யும் மதிப்பீடுகள் இன்னும் அத்தியாவசியம்; ஆனால் அவை தவறவிடும் நடத்தைகளை வெளியீடு வெளிப்படுத்துகிறது. வரையறுக்கப்பட்ட அணுகலுடன் தொடங்கியது, மாடலை நடைமுறையில் கவனிக்கவும், சிக்கல்கள் தோன்றியபோது இடைநிறுத்தவும், அந்தத் தோல்விகளைப் பயன்படுத்தி மேம்பட்ட மதிப்பீடுகள் மற்றும் பாதுகாப்பு ஏற்பாடுகளை உருவாக்கவும், மாற்றங்களைச் சோதித்த பிறகு வரையறுக்கப்பட்ட அணுகலை மீண்டும் வழங்கவும் எங்களுக்கு உதவியது.

மாடல்கள் நீளமான மற்றும் சிக்கலான பணிகளை ஏற்கும்போது, மதிப்பீடுகள் தவறவிடும் தோல்விகள் பெரிய விளைவுகளை ஏற்படுத்தலாம். மதிப்பீட்டிற்கும் வெளியீட்டிற்கும் இடையிலான இடைவெளியைச் சுருக்க நாங்கள் தொடர்ந்து பணியாற்றுவோம்: நீளமான செயல்பாதைகளில் மாடல்களைச் சோதித்தல், ஒத்திசைவை மேம்படுத்தல், தலையிடக்கூடிய கண்காணிப்பை உருவாக்குதல், பயனர்களுக்கு தெளிவான காட்சியும் கட்டுப்பாடும் வழங்குதல். இந்தச் சவால்கள், OpenAI-க்கே உரியவை அல்ல; நாங்கள் கற்றவற்றைப் பகிர்வது, பரந்த துறை அவற்றுக்குத் தயாராக உதவும் என நம்புகிறோம்.

ஆசிரியர்

OpenAI

அடிக்குறிப்புகள்

  1. 1

     நாங்கள் அந்த PR-ஐ விரைவாக மூடியிருந்தாலும், வேகப்போட்டியில் இருந்த பல பங்கேற்பாளர்கள் ஏற்கனவே அதை பார்த்து, தங்கள் சமர்ப்பிப்புகளில் அந்த அணுகுமுறையைப் பயன்படுத்தியிருந்தனர்; 3030(புதிய சாளரத்தில் திறக்கும்), 2990(புதிய சாளரத்தில் திறக்கும்), 2930(புதிய சாளரத்தில் திறக்கும்), 2925(புதிய சாளரத்தில் திறக்கும்), 2900(புதிய சாளரத்தில் திறக்கும்) மற்றும் 2890(புதிய சாளரத்தில் திறக்கும்) படிகளுடன் தொடர்ந்து வந்த உலகச் சாதனைச் சமர்ப்பிப்புகள் அனைத்தும் PR 287-ஐ மேற்கோள் காட்டுகின்றன. இவற்றில், PR 300(புதிய சாளரத்தில் திறக்கும்) குறிப்பாக சுவாரஸ்யமானது; ஏனெனில் Prime Intellect(புதிய சாளரத்தில் திறக்கும்) அதை NanoGPT வேகப்போட்டியில் மதிப்பீடு செய்தபோது, Opus 4.7 சமர்ப்பித்த PR அதுவே. எங்கள் மாடல் சமர்ப்பித்த PR-ஐ Opus பார்த்து, அந்தக் கண்டுபிடிப்புகளைச் சேர்த்துக்கொண்டு, இறுதி முடிவில் எங்கள் PR-க்கு அங்கீகாரம் அளித்தது.

  2. 2

     சூழலை மீளமைப்பதில் உள்ள சீரற்ற தன்மை மற்றும் குறைபாடு காரணமாக, மீள்பதிவில் உள்ள செயலோட்டங்கள் ஒவ்வொரு முறையும் அதே ஒத்திசைவற்ற செயலைத் தொடரும் என உத்தரவாதம் இல்லை.