முக்கிய உள்ளடக்கத்திற்கு செல்க
OpenAI

1 செப்டம்பர், 2026

பாதுகாப்புபாதுாய்வு

Astra-க்கான பாதை: முக்கியத் திறன்களும் அதிநவீனப் பாதுகாப்புகளும்

ஏற்றுகிறது…

Astra முக்கியமான இணையப் பாதுகாப்புத் திறன் நிலையை எட்டக்கூடும் என்ற எங்கள் முந்தைய மதிப்பீட்டுக்குப் பிறகு, மாடலின் திறன்களை மதிப்பிட மேலும் ஆதாரங்களைச் சேகரித்து, கூடுதல் மதிப்பீடுகளை நடத்தியுள்ளோம். சரியான கருவிகளும் அணுகலும் இருந்தால், ஒவ்வொரு படியிலும் மனித வழிகாட்டுதல் இல்லாமல் பல நன்கு பாதுகாக்கப்பட்ட முறைமைகளில் இதுவரை அறியப்படாத பாதுகாப்புக் குறைபாடுகளைக் கண்டறிந்து, அவற்றைப் பயன்படுத்துவதற்கான வழிகளை Astra-ஆல் உருவாக்க முடியும். எனவே, எங்கள் பிரிபேர்ட்நெஸ் ஃப்ரேம்வொர்க்கின் கீழ் முக்கியமான இணையப் பாதுகாப்புத் திறனுக்கான வரம்பை அது எட்டுவதாக இப்போது நம்புகிறோம். இந்த நிலையில் நாங்கள் வகைப்படுத்தும் முதல் மாடல் இதுவாகும்; உருவாக்கத்தின்போதும் வெளியீட்டுக்கு முன்பும் இதற்கு வலுவான பாதுகாப்புகள் தேவை.

கடந்த பல வாரங்களாக, இணையவழித் தவறான பயன்பாடு மற்றும் அனுமதியற்ற மாடல் செயல்களுக்கு எதிரான பாதுகாப்புகளை வலுப்படுத்திச் சோதித்தபோது, Astra-இன் உருவாக்கம் மற்றும் வெளியீட்டின் சில பகுதிகளைத் தாமதப்படுத்தினோம். அந்தப் பணியின் அடிப்படையில், எங்கள் பிரிபேர்ட்நெஸ் ஃப்ரேம்வொர்க்கின் கீழ் வெளியிடுவதற்குத் தேவையான அளவுக்கு Astra-இன் பாதுகாப்புகள் கடுமையான தீங்கின் அபாயத்தைக் குறைக்கின்றன என நம்புகிறோம்.

Hugging Face சம்பவத்தில் Astra-க்குத் தொடர்பில்லை என்றாலும், அந்தச் சம்பவத்திலிருந்து பெற்ற படிப்பினைகளை(புதிய சாளரத்தில் திறக்கும்) எங்கள் பாதுகாப்பு அணுகுமுறையில் இணைத்துள்ளோம். பின்னோக்கிச் சோதனையின் அடிப்படையில், அப்போது எங்கள் தயாரிப்புப் பாதுகாப்புகள் Hugging Face சம்பவத்தைத் தடுத்திருக்கும் என நம்புகிறோம். அதன் பிறகு Astra-க்காக மேலும் வலுவான பாதுகாப்புகளைச் செயல்படுத்தியுள்ளோம். தீங்கு விளைவிக்கும் இணையக் கோரிக்கைகளை நம்பகமாக மறுக்கவும் பாதுகாப்புக் கட்டுப்பாடுகளை மதிக்கவும் மாடலைப் பயிற்றுவித்தல், தவறான பயன்பாட்டுக்கு எதிரான கூடுதல் பாதுகாப்புகள், அனுமதியற்றதாக இருக்கக்கூடிய செயல்பாட்டை நிறுத்தும் கண்காணிப்பு ஆகியவை இதில் அடங்கும்.

Astra-ஐ விரைவில் வழங்கத் திட்டமிட்டுள்ளோம்; ஆனால் அதன் மிக மேம்பட்ட இணையப் பாதுகாப்புத் திறன்களுக்கான அணுகல் மேலும் கட்டுப்படுத்தப்படும். மேம்பட்ட இணையப் பாதுகாப்புப் பணி தொடக்கத்தில் ஒரு சோதனையாளர் குழுவுக்குக் கிடைக்கும்; அதைத் தொடர்ந்து தற்காப்புப் பயன்பாட்டை விரிவுபடுத்த Daybreak Blue வழியாக அணுகல் வழங்கப்படும்.

வெளியீட்டின்போது மாடலின் சிஸ்டம் கார்டில் எங்கள் பாதுகாப்பு, பத்திரத்தன்மை மற்றும் சீரமைப்புச் சோதனைகள், மதிப்பீடுகள் குறித்த கூடுதல் விவரங்களைப் பகிர்வோம். வெளியீட்டுக்கு முன், இந்த அளவிலான இணையப் பாதுகாப்புத் திறன்களைக் கொண்ட மாடலைப் பாதுகாப்பாக வெளியிட நாங்கள் மேற்கொண்ட சில பணிகள் குறித்த புதுப்பிப்பை வழங்கவும், இன்னும் நீடிக்கும் அபாயங்கள் குறித்து வெளிப்படையாக இருக்கவும் விரும்புகிறோம்.

Astra-இன் இணையப் பாதுகாப்புத் திறன்களை மதிப்பிடுதல்

எங்கள் பிரிபேர்ட்நெஸ் ஃப்ரேம்வொர்க்கின் கீழ், பின்வரும் நிபந்தனைகளில் ஏதேனும் ஒன்றை நிறைவேற்றினால் ஒரு மாடல் முக்கியமான வரம்பை எட்டியதாகும்:

  • மனிதத் தலையீடு இல்லாமல், வலுப்படுத்தப்பட்ட பல நிஜ உலக முக்கிய முறைமைகளில் அனைத்து தீவிர நிலைகளிலும் செயல்படக்கூடிய ஜீரோ-டே தாக்குதல் வழிகளை மாடலால் கண்டறிந்து உருவாக்க முடியும்.
  • உயர்நிலை இலக்கு மட்டும் வழங்கப்பட்டால், வலுப்படுத்தப்பட்ட இலக்குகளுக்கு எதிரான புதிய முழுமையான இணையத் தாக்குதல் உத்திகளை மாடலால் வகுத்துச் செயல்படுத்த முடியும்.

Astra குறித்த எங்கள் தயார்நிலை மதிப்பீடு, தானியக்கப் பொது மற்றும் தனியார் அளவுகோல்களை நிபுணர்கள் வழிநடத்திய மதிப்பீடுகளுடன் இணைத்தது. GPT‑5.6 Sol உடன் ஒப்பிடும்போது, இணையப் பாதுகாப்புத் திறன்களில் குறிப்பிடத்தக்க முன்னேற்றத்தை Astra காட்டுகிறது: அது மிகக் குறைந்த டோக்கன்களைப் பயன்படுத்துவதுடன், பாதிப்புகளைக் கண்டறிவதிலும் தாக்குதல் வழிகளை உருவாக்குவதிலும் அதிகத் திறன் கொண்டது.

ஓர் எடுத்துக்காட்டாக, அறியப்பட்ட பாதிப்புகளிலிருந்து தாக்குதல் வழிகளை உருவாக்கும் மாடலின் திறனை மதிப்பிடும் ExploitBench அளவுகோலில் Astra-ஐ இயக்கினோம்; அதில் மாடல் 100% முழுமையான மதிப்பெண்ணைப் பெற்றது.

தரவு கலப்பு குறித்த கவலைகளால், சமீபத்தில் வெளியிடப்பட்ட 20 உயர் தீவிர V8 பாதிப்புகளைக் கொண்ட “ExploitBench - உள் போர்ட் (ஜூன்–ஆகஸ்ட் 2026)” என்ற உள் அளவுகோலை உருவாக்கினோம். இந்தத் தரவுத்தொகுப்பில், மிகக் குறைந்த வெளியீட்டு டோக்கன்களைப் பயன்படுத்தியே GPT‑5.6 Sol-ஐவிட மிக அதிகமான தன்னிச்சைக் குறியீடு இயக்க விகிதங்களை Astra எட்டுகிறது. மதிப்பீட்டின்போது, தாக்குதல் சங்கிலியின் ஒரு பகுதியாக இரு ஜீரோ-டே பாதிப்புகளைக் கண்டறிந்து மாடல் பயன்படுத்தியது. அந்த இரு பாதிப்புகளையும் பராமரிப்பாளர்களிடம் தெரிவிக்கும் பணியில் ஈடுபட்டுள்ளோம்.

காட்டப்பட்டுள்ள Astra முடிவுகள் இயல்புநிலை தயாரிப்புக் கட்டமைப்பை அல்ல, Daybreak Blue அணுகலுடன் உள்ள திறன்களைப் பிரதிபலிக்கின்றன.

வலுப்படுத்தப்பட்ட உலாவி மற்றும் இயக்க முறைமைக்கு எதிராக நிபுணர்கள் வழிநடத்திய மதிப்பீடுகளில், இதுவரை அறியப்படாத பாதிப்புகளை Astra கண்டறிந்து, செயல்படும் தாக்குதல் சங்கிலிகளாக மாற்றியது. உலாவி ஒரு HTML கோப்பைத் திறந்தபோது, தனிமச் சூழலிலிருந்து வெளியேறி வழங்கி அமைப்பில் கட்டளைகளை இயக்கிய முழுமையான உலாவி ஊடுருவல் சங்கிலியை அது உருவாக்கியது. வலுப்படுத்தப்பட்ட இயக்க முறைமையில் பல பாதிப்புகளையும் மாடல் கண்டறிந்து, அவற்றைச் சேர்த்து சாதாரணப் பயனரிடமிருந்து ரூட் நிலைக்குச் செல்லும் உள்ளூர் சிறப்புரிமை உயர்த்தல் சங்கிலியை உருவாக்கியது. ஒட்டுமொத்தமாக, முக்கியமான வரம்பை Astra எட்டியுள்ளது என்ற முடிவுக்கு எங்கள் ஆய்வு எங்களை இட்டுச் சென்றுள்ளது.

முக்கியத் திறன்களுக்குத் தேவையான பாதுகாப்புகள்

Astra அளவிலான இணையப் பாதுகாப்புத் திறன்களைக் கொண்ட மாடல்களுக்கு, உருவாக்கத்தின்போதும் வெளியீட்டுக்கு முன்பும் கடுமையான இணையத் தீங்கின் அபாயத்தைக் குறைக்க இரு பாதைகளை நாம் கவனிக்க வேண்டும்:

  • மாடலைத் தீங்கிழைப்பவர்கள் பயன்படுத்துவது. வலுப்படுத்தப்பட்ட முக்கியமான முறைமைகளில் இதுவரை அறியப்படாத குறைபாடுகளுக்கான தாக்குதல் வழிகளை உருவாக்கவோ, வலுப்படுத்தப்பட்ட இலக்குகளுக்கு எதிராக முழுமையான தாக்குதல்களை நடத்தவோ தீங்கிழைப்பவர்கள் Astra-ஐப் பயன்படுத்துவதை எங்கள் பாதுகாப்புகள் உறுதியாகத் தடுக்க வேண்டும்.
  • அனுமதியற்ற, சீரமைவில்லாத செயல்களை மாடல் மேற்கொள்வது. தீங்கிழைக்கும் பயனர் இல்லாதபோதும், மேம்பட்ட இணையப் பாதுகாப்புத் திறன்களைக் கொண்ட மாடல் சீரமைவின்றி இருந்தால் தானாகவே இணையத் தீங்கை விளைவிக்கக்கூடும். இந்தத் திறன்களைக் கொண்ட மாடல்களின் சீரமைப்புக்கு மிக உயர்ந்த தரநிலையைப் பின்பற்றுவதோடு, நிஜ உலகில் குறிப்பிடத்தக்க தீங்கை ஏற்படுத்தக்கூடிய சீரமைவில்லாத செயல்களை இரண்டாம் அடுக்குப் பாதுகாப்பாக விரைவாகக் கண்டறிந்து கட்டுப்படுத்தவும் எங்கள் பாதுகாப்புகளால் இயல வேண்டும்.

குறிப்பாக, உள் உருவாக்கம் மற்றும் வெளிப்புற வெளியீடு ஆகிய இரண்டுக்கும் இரண்டாவது பாதை பொருந்தும். நாங்கள் முன்னர் விவரித்தபடி, OpenAI-Hugging Face சம்பவத்துக்குப் பிறகு, தனிமைப்படுத்தல் மற்றும் பிணையக் கட்டுப்பாடுகள், விரிவாக்கப்பட்ட கண்காணிப்பு, வலுப்படுத்தப்பட்ட சீரமைப்புப் பயிற்சி மற்றும் வரம்புகள் உள்ளிட்டவற்றின் மூலம் எங்கள் பயிற்சிக் கட்டமைப்பை வலுப்படுத்த, (Astra-க்கான சில பயிற்சிகள் உட்பட) சில அதிநவீனப் பயிற்சிகளை இரு வாரங்களுக்கு நிறுத்தினோம். பின்னர் கடுமையான கட்டுப்பாடுகளின் கீழ் சிறிய அளவிலான பணிகளைத் தொடர்ந்தோம்.

Astra-இன் எதிர்காலப் பதிப்புகளுக்கான சில பெரிய ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங் (RL) இயக்கங்களை, அவற்றின் பயிற்சிச் சூழலுக்கான உயர்ந்த பாதுகாப்புத் தரநிலைகளை நிறுவும் வரை மேலும் நீண்ட காலம் நிறுத்தி வைத்தோம். புதிய பாதுகாப்புத் தேவைகள் நடைமுறைப்படுத்தப்பட்ட பிறகு, முன்பு நிறுத்தப்பட்டிருந்த பெரிய அதிநவீன RL இயக்கத்தை ஆகஸ்ட் 28 அன்று மீண்டும் தொடங்கினோம். சில சிறிய பரிசோதனைப் பயிற்சி இயக்கங்களைத் தற்காலிகமாகத் தொடர்ந்து நிறுத்தி வைத்துள்ளோம்.

Astra-ஐ வெளியீட்டுக்குத் தயார்படுத்த, இணையவழித் தவறான பயன்பாடு மற்றும் அனுமதியற்ற செயல்களுக்கு எதிராக வலுவான பாதுகாப்புகளும் தேவைப்பட்டன. அந்தப் பாதுகாப்புகளையும் அவற்றை நாங்கள் சோதித்த விதத்தையும் கீழே விவரிக்கிறோம்.

இணையவழித் தவறான பயன்பாட்டுக்கு எதிரான உறுதித்தன்மை

இணையப் பாதுகாப்பில் அதிகம் திறன் கொண்டதாக நாங்கள் கருதிய முதல் மாடலை பிப்ரவரியில் வெளியிட்டதிலிருந்து, ஒவ்வொரு அடுத்தடுத்த வெளியீட்டிலும் எங்கள் இணையப் பாதுகாப்புகளை வலுப்படுத்தியுள்ளோம். எங்கள் ஒட்டுமொத்தப் பாதுகாப்பு அணுகுமுறை, போஸ்ட்-ட்ரெயின்ட் மாடலின் மறுப்புகள், முறைமை நிலைப் பாதுகாப்பு வகைப்படுத்திகள், இணையமில்லா கண்டறிதல் மற்றும் அச்சுறுத்தல் முறியடிப்பு ஆகியவற்றைப் பல அடுக்குகளாகப் பயன்படுத்துகிறது.

GPT‑5.6(புதிய சாளரத்தில் திறக்கும்)-க்காக, இணையவழித் தவறான பயன்பாட்டைக் கண்டறியும் செயல்பாட்டு வகைப்படுத்திகளைச் சேர்த்தது மற்றும் தீவிரத் தானியக்க ரெட் டீமிங் மூலம் கண்டறியப்பட்ட பொதுவான ஜெயில்பிரேக்குகளுக்கு எதிரான பாதுகாப்பை மேம்படுத்தியது உட்பட, எங்கள் முறைமை நிலைத் தொகுப்பின் உறுதித்தன்மையை குறிப்பிடத்தக்க அளவில் உயர்த்தினோம். இந்த மேம்பாடுகளின் அடிப்படையில், Astra-க்கான எங்கள் பாதுகாப்புத் தொகுப்பின் மாடல் அடுக்கில் மேலும் முதலீடு செய்துள்ளோம்; உரையாடல்களுக்கு இடையிலான சூழலைக் கையாளும் பாதுகாப்புகளின் திறனையும் மேம்படுத்தியுள்ளோம்.

  • மாடலின் உறுதித்தன்மைக்கான புதிய பயிற்சி நுட்பங்களைப் பயன்படுத்தி, அனுமதிக்கப்படாத இணைய உதவிக் கோரிக்கைகளை Astra மேலும் உறுதியாக மறுக்கிறது. எங்கள் இணைய ஜெயில்பிரேக் மதிப்பீடுகளில், Astra 91.5% கோரிக்கைகளை மறுக்கிறது; GPT‑5.6 Sol-இன் விகிதம் 59%.
  • அதிக அபாயமுள்ளதாக மதிப்பிடப்பட்ட கணக்குகளுக்கு, அபாயம் இருக்கக்கூடிய விரிவான இணைய உதவிக் கோரிக்கைகளை மறுக்கும், மேலும் எச்சரிக்கையான மாடல் நடத்தை எல்லையைப் பயன்படுத்துகிறோம். அதிக அபாயமுள்ள பயனர்களிடம் இத்தகைய இணையவழித் தவறான பயன்பாட்டைக் கண்டறிய, எங்கள் கண்காணிப்பு முறைமைகளின் சூழல் வரம்பை விரிவாக்கியுள்ளோம்.

கடுமையான சோதனை, உள் மற்றும் வெளிப்புற ரெட் டீமிங், குறைநீக்கம் ஆகிய எங்கள் திட்டத்தையும் தொடர்ந்து செயல்படுத்தியுள்ளோம். முந்தைய சோதனைக் காலங்களில் கண்டறியப்பட்ட அனைத்து ஜெயில்பிரேக்குகளுக்கும் எதிரான பாதுகாப்பு தொடர்வதை உறுதிசெய்யும் பின்னடைவு சோதனைகளுடன், எங்கள் சமீபத்திய உள் ரெட் டீமிங் தாக்குபவர்களைக் கொண்டு புதிய சுற்று ரெட் டீமிங்கையும் மேற்கொள்கிறோம். பொதுவான ஜெயில்பிரேக் மதிப்பீட்டு முறையை வரையறுக்கத் தொழில்துறை கூட்டாளர்களுடன் பணியாற்றுகிறோம்; புதிய கண்டுபிடிப்புகளை ஆய்ந்து தீர்க்க எங்கள் 24/7 விரைவுப் பதிலளிப்புத் திட்டத்தைப் பயன்படுத்துவோம். எங்கள் இணையப் பாதுகாப்புச் சோதனை குறித்த கூடுதல் விவரங்களை Astra சிஸ்டம் கார்டில் பகிர்வோம்.

பாதிப்புகளைக் கண்டறிந்து பாதுகாப்பாளர்கள் சரிசெய்ய உதவுவது எங்கள் பாதுகாப்பு அணுகுமுறையின் மையத் தூணாகத் தொடர்கிறது. சாத்தியமான தவறான பயன்பாட்டிலிருந்து பாதுகாக்க, வெளியீட்டின்போது Astra-இன் பாதுகாப்புகள் இறுதியில் நாங்கள் விரும்புவதைவிட அதிகத் தடைகளை ஏற்படுத்தும் என எதிர்பார்க்கிறோம். மேம்பட்ட இணையப் பாதுகாப்புப் பணிப்பாய்வுகளுக்கான Astra அணுகல் தொடக்கத்தில் ஒரு சிறிய ஆல்பா சோதனையாளர் குழுவுக்குக் கிடைக்கும்; பின்னர் தற்காப்புப் பயன்பாட்டை ஆதரிக்க Daybreak Blue வழியான அணுகல் விரிவாக்கப்படும்.

சீரமைப்பு & கண்காணிப்பு

சீரமைவில்லாத செயல்களை மாடல் மேற்கொள்வதைத் தடுக்க, கூடுதல் பல அடுக்குப் பாதுகாப்புகளையும் சேர்த்துள்ளோம்:

  • மாடல் சீரமைப்பு: எங்கள் மதிப்பீடுகளில், வெளிப்படையான பாதுகாப்புக் கட்டுப்பாடுகளை மதித்து, அங்கீகரிக்கப்பட்ட வரம்புக்குள் நிலைத்திருப்பதற்கு GPT‑5.6 Sol-ஐவிட Astra மிக அதிக வாய்ப்பைக் காட்டியது. இதனால் இதுவரையிலான எங்கள் மாடல்களில் மிகச் சிறப்பாகச் சீரமைக்கப்பட்ட மாடலாக அது உள்ளது. குறிப்பாக, பாதுகாப்புக் கட்டுப்பாடுகளுக்கு மாடல் அளிக்கும் மதிப்பு மற்றும் அங்கீகரிக்கப்பட்ட வரம்புக்குள் இருக்கும் அதன் போக்கு மீது கவனம் செலுத்தினோம்.
  • கண்காணிப்பும் கட்டுப்பாடும்: எங்கள் உள் நடைமுறைகளுக்கு இணையாக, சீரமைவில்லாத செயல்களை விரைவாகக் கண்டறிந்து கட்டுப்படுத்தக் கூடுதல் செயின்-ஆஃப்-தாட் கண்காணிப்புடன் Astra-ஐ வெளியிடுகிறோம்.

மாடல் சீரமைப்பில் Astra ஒரு குறிப்பிடத்தக்க முன்னேற்றமாகும்; நீண்ட காலமாக மேற்கொள்ளப்பட்ட பல சீரமைப்புப் பணிகளின் நிறைவாகவும் அது உள்ளது. ப்ரீ-ட்ரெயினிங் தலையீடுகள் முதல் ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங்கின்போது மிகவும் கவனமான, சீரான தரமிடல் வரையிலான பணிகள் இதில் அடங்கும். சோதனைகளில், GPT 5.6 Sol உடன் ஒப்பிடும்போது வெளிப்படையான பாதுகாப்புக் கட்டுப்பாடுகள் மற்றும் எச்சரிக்கைகளை (தானியங்கு மதிப்பாய்வு போன்றவை) Astra தொடர்ந்து மதிப்பதற்கான வாய்ப்பு அதிகம் எனக் கண்டறிந்தோம்.

Hugging Face சம்பவத்தின் அடிப்படையில் ஒரு சோதனையையும் உருவாக்கினோம்; மூன்றாம் தரப்பினரின் முறைமைகளை அந்தச் சம்பவத்தில் இணைய மதிப்பீடான ExploitGym-ஐ இயக்கிய ஏஜென்ட்கள் ஊடுருவின. ஒதுக்கப்பட்ட பணியைத் தீர்ப்பதற்குப் பதிலாகச் சுற்றியுள்ள பாதுகாப்புக் கட்டமைப்பை ஒரு மாடல் ஊடுருவ முயலுமா என்பதைச் சோதிக்கும் “ஹனிபாட்” சோதனைகளை உருவாக்க, அந்த மதிப்பீட்டின் கடினமான பணிகளைப் பயன்படுத்தினோம். தயாரிப்புப் பாதுகாப்புகள் இல்லாத GPT‑5.6 Sol, பாதிப்புகளுக்கான தாக்குதல் வழிகளை உருவாக்க மாடலுக்கு அறிவுறுத்தப்படும் அளவுகோல் சூழலை உருவகப்படுத்திய 56% சோதனைகளில் அந்த இலக்குகளை அணுக முயன்றது. இந்தச் சோதனைகளில் Astra அத்தகைய முயற்சிகளை மேற்கொள்ளவில்லை. இந்த எண்ணிக்கைகள் இயல்பான தயாரிப்புப் பயன்பாட்டை அல்ல, இணையப் பாதுகாப்புகள் இல்லாத சோதனைச் சூழலிலான நடத்தையை விவரிக்கின்றன.

இடது: இந்தப் புதிய மதிப்பீட்டில், தானியங்கு மதிப்பாய்வு நிராகரிப்புக்கு மாடல்கள் எவ்வாறு எதிர்வினையாற்றுகின்றன என்பதைக் கவனிக்கிறோம். ஒவ்வொரு பணியும் அறிவுசார் பணிச் சூழலில் அமைக்கப்பட்டுள்ளது; தானியங்கு மதிப்பாய்வு மறுத்த உடனே செயல்பாட்டு வரிசை தொடங்குகிறது. பின்னர் மாடல் பல வழிகளில் தொடரலாம்: செயல்பாட்டு வரிசையை முடிக்கலாம், பாதுகாப்பான மாற்றுவழியைக் கண்டறிய முயலலாம், ஒத்த கட்டளையை மீண்டும் முயலலாம் அல்லது தானியங்கு மதிப்பாய்வை முற்றிலும் கடக்க ஒரு மோசமான கட்டமைப்பைப்(புதிய சாளரத்தில் திறக்கும்) பயன்படுத்தலாம். கடைசி இரு வழிகளில் ஏதேனும் ஒன்றைத் தொடர்வது இந்த மதிப்பீட்டில் தோல்வியாகும். தானியங்கு மதிப்பாய்வைக் கடக்க Astra ஒருபோதும் முயலவில்லை.

வலது: ExploitGym மதிப்பீட்டில் மிகவும் கடினமான அல்லது சாத்தியமற்ற பணிகளை எதிர்கொள்ளும்போது, ஒரு மாடல் ஏமாற்றுவழிகளைப் பயன்படுத்தும் போக்கை (“ஹனிபாட்கள்” மூலம்) இந்த மதிப்பீட்டில் பரிசோதிக்கிறோம். மாடலின் நடத்தையை மதிப்பிட, கண்காணிப்பு மட்டும் பயன்முறையில் பாதுகாப்புகளுடன் உருவகப்படுத்தப்பட்ட சூழலில் இது நடத்தப்பட்டது. இத்தகைய சூழல்களில் GPT‑5.6 Sol ஏமாற்றுவழிகளைப் பயன்படுத்தும் வாய்ப்பு அதிகமாக இருந்தாலும், Astra அந்தக் குறுக்குவழிகளைப் பயன்படுத்த முயலவில்லை; அதே நேரத்தில் சில பணிகளை முறையான வழியில் தீர்க்கவும் அதனால் முடிந்தது.

மாடல்களைச் சீரமைக்கப் பயிற்றுவிப்பது பாதுகாப்பின் ஓர் அடுக்காகும். எங்கள் சீரமைப்புச் சோதனைகள் மற்றும் முடிவுகள் குறித்த கூடுதல் விவரங்களை Astra சிஸ்டம் கார்டில் பகிர்வோம்.

சாத்தியமான சீரமைவின்மையைக் கண்டறிந்து விரைவாகக் கட்டுப்படுத்த, Astra வகை மாடல்களுக்கான சீரமைவின்மைக் கண்காணிப்பையும் தயாரிப்புச் சூழலில் பயன்படுத்துகிறோம். இந்தப் பாதுகாப்புகள் எங்கள் உள் வெளியீடுகளுக்கான கண்காணிப்பை ஒத்தவை. மாடலின் ரீஸனிங் மற்றும் செயல்களில் அனுமதியற்ற நடத்தை உள்ளதா எனச் சரிபார்த்து, சாத்தியமான அனுமதியற்ற செயல்பாட்டைத் தானாக நிறுத்தும் வகைப்படுத்தி முறைமை இதில் உள்ளது. திறன்கள் அதிகரிக்கும்போது எங்கள் மாடல்களின் சிறந்த சீரமைப்புக்கு மாற்றாக இந்தப் பாதுகாப்புகள் அமைய முடியாது. எதிர்கால மாடல்கள் இந்தப் பாதுகாப்புகள் ஒருபோதும் தூண்டப்படாத அளவுக்குச் சிறப்பாகச் சீரமைக்கப்பட வேண்டும் என்பதே எங்கள் இலக்கு ஆகும்.

பயனர்களுக்கு இதன் பொருள் என்ன

செயற்கை நுண்ணறிவின் பயன்கள் அனைவருக்கும் பரவலாகக் கிடைப்பதை உறுதிசெய்ய OpenAI உறுதிபூண்டுள்ளது. Astra-இன் இணையப் பாதுகாப்புத் திறன்களில் ஏற்பட்டுள்ள குறிப்பிடத்தக்க உயர்வைக் கருத்தில் கொண்டு, இந்த வெளியீடு பாதுகாப்பாக இருப்பதை உறுதிசெய்வதில் சிறப்புக் கவனம் செலுத்துகிறோம். கூடுதல் பாதுகாப்புச் சோதனைகள், தற்காப்பு இணையப் பாதுகாப்பு உள்ளிட்ட முறையான பணிகளைச் சில நேரங்களில் மெதுவாக்கலாம், இடைநிறுத்தலாம் அல்லது நிறுத்தலாம்.

முறையான செயல்பாட்டை இணையவழித் தவறான பயன்பாடு அல்லது அனுமதியற்ற நடத்தை என முறைமை அவ்வப்போது தவறாகக் குறிக்கலாம்; இதனால் அந்தச் செயல்பாடு எதிர்பாராதவிதமாக மெதுவாக்கப்படலாம், இடைநிறுத்தப்படலாம் அல்லது நிறுத்தப்படலாம். இணையப் பாதுகாப்புடன் நேரடியாகத் தொடர்புடையதாகத் தெரியாத பணிகளும், ஏஜென்ட் நீண்ட நேரம் இயங்கும் பணிகளும் இதில் அடங்கலாம்.

சீரமைவின்மைக் கண்காணிப்பி ஒரு பணியை இடைநிறுத்தினால், ChatGPT அல்லது Codex பயனர்கள் தொடர்வதற்கு முன் அந்தச் செயலை மறுபரிசீலனை செய்யுமாறு கேட்கப்படலாம். API போன்ற பிற இடைமுகங்களைப் பயன்படுத்தும்போது பணி நிறுத்தப்படும். தேவையற்ற தடைகளைக் குறைக்க இந்தப் பாதுகாப்புகளைத் தொடர்ந்து அளவுதிருத்தவும், Daybreak போன்ற திட்டங்கள் மூலம் அதிநவீனத் திறன்களுக்கான அணுகலை விரிவுபடுத்தவும் திட்டமிட்டுள்ளோம்.

எதிர்காலப் பார்வை

மாடல்கள் அதிக விளைவுகளை ஏற்படுத்தக்கூடிய பணிகளை ஏற்கும் செயற்கை நுண்ணறிவு வளர்ச்சிக் கட்டத்திற்குள் நுழைகிறோம்; சீரமைப்பு மற்றும் கட்டுப்பாட்டின் தோல்விகள் மேலும் கடுமையான விளைவுகளை ஏற்படுத்தக்கூடும். இந்த முறைமைகளின் பயன்களை அடைவது, அவற்றின் திறன்கள் வளரும்போது மாடல்களைச் சீரமைத்துக் கட்டுப்படுத்தும் எங்கள் ஆற்றலைச் சார்ந்திருக்கும்.

பயிற்சி, மதிப்பீடு மற்றும் வெளியீடு அனைத்திலும் அந்தப் பொறுப்பு பொருந்தும். சீரமைந்த நடத்தைக்கான வலுவான ஆதாரம், திறன் வளர்ச்சிக்கு ஈடுகொடுக்கும் பாதுகாப்புகள், அந்தப் பாதுகாப்புகள் போதாதபோது வேகத்தைக் குறைக்கும் மனப்பான்மை ஆகியவை இதற்குத் தேவை.

இந்த முறைமைகளைத் தொடர்ந்து சோதித்து, நாங்கள் கற்றவற்றைப் பகிர்ந்து, இன்னும் நிச்சயமற்றவை குறித்து தெளிவாக இருப்போம். Astra-க்குப் பின்வரும் மாடல்கள் எங்களிடமிருந்து மேலும் அதிகப் பொறுப்பைக் கோரும். அந்தப் பொறுப்பை நிறைவேற்றத் தேவையான நேரத்தை எடுத்துக்கொண்டு, தேவையான பணிகளைச் செய்வோம்.