പ്രധാന ഉള്ളടക്കത്തിലേക്ക് നീങ്ങുക
OpenAI

2026 സെപ്റ്റംബർ 1

സുരക്ഷസുരക്ഷ

Astra-യിലേക്കുള്ള പാത: നിർണായക ശേഷികളും അത്യാധുനിക സുരക്ഷാ സംവിധാനങ്ങളും

ലോഡിംഗ്…

Astra നിർണായക നിലവാരത്തിലുള്ള സൈബർസുരക്ഷാ ശേഷി കൈവരിച്ചേക്കാമെന്ന ഞങ്ങളുടെ മുൻ വിലയിരുത്തലിന് ശേഷം, മോഡലിന്റെ ശേഷികൾ വിലയിരുത്താൻ കൂടുതൽ തെളിവുകൾ ശേഖരിക്കുകയും അധിക വിലയിരുത്തലുകൾ നടത്തുകയും ചെയ്തു. ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്ക് പ്രകാരമുള്ള നിർണായക സൈബർസുരക്ഷാ ശേഷിയുടെ പരിധി Astra കൈവരിച്ചെന്ന് ഇപ്പോൾ ഞങ്ങൾ കരുതുന്നു. ശരിയായ ഉപകരണങ്ങളും പ്രവേശനവും ലഭിച്ചാൽ, ഓരോ ഘട്ടത്തിലും മനുഷ്യന്റെ മാർഗനിർദേശം കൂടാതെ തന്നെ ശക്തമായി പരിരക്ഷിച്ച നിരവധി സംവിധാനങ്ങളിൽ ഇതുവരെ അറിയപ്പെടാത്ത സുരക്ഷാപിഴവുകൾ കണ്ടെത്താനും അവ ചൂഷണം ചെയ്യാനുള്ള മാർഗങ്ങൾ വികസിപ്പിക്കാനും അതിന് കഴിയുമെന്നാണ് ഇതിന്റെ അർഥം. ഈ നിലവാരത്തിൽ ഞങ്ങൾ നിശ്ചയിക്കുന്ന ആദ്യ മോഡലാണിത്; വികസനവേളയിലും പുറത്തിറക്കുന്നതിന് മുമ്പും ഇതിന് കൂടുതൽ ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങൾ ആവശ്യമാണ്.

കഴിഞ്ഞ ഏതാനും ആഴ്ചകളിൽ, സൈബർ ദുരുപയോഗത്തിനും മോഡലിന്റെ അനധികൃത നടപടികൾക്കും എതിരായ സംരക്ഷണങ്ങൾ ശക്തിപ്പെടുത്തി പരീക്ഷിക്കുന്നതിനിടെ Astra-യുടെ വികസനത്തിന്റെയും പുറത്തിറക്കലിന്റെയും ചില ഭാഗങ്ങൾ ഞങ്ങൾ വൈകിപ്പിച്ചു. ആ പ്രവർത്തനത്തിന്റെ അടിസ്ഥാനത്തിൽ, ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്ക് പ്രകാരം Astra പുറത്തിറക്കുമ്പോഴുള്ള ഗുരുതര നാശസാധ്യത അതിന്റെ സുരക്ഷാ സംവിധാനങ്ങൾ മതിയായ തോതിൽ കുറയ്ക്കുമെന്ന് ഞങ്ങൾ കരുതുന്നു.

Hugging Face സംഭവത്തിൽ Astra ഉൾപ്പെട്ടിരുന്നില്ലെങ്കിലും, ആ സംഭവത്തിൽനിന്നുള്ള ഞങ്ങളുടെ പാഠങ്ങൾ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) സുരക്ഷാ സമീപനത്തിൽ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്. പിന്നീടുള്ള പരിശോധനയുടെ അടിസ്ഥാനത്തിൽ, അന്നുണ്ടായിരുന്ന ഞങ്ങളുടെ പ്രൊഡക്ഷൻ സുരക്ഷാ സംവിധാനങ്ങൾ Hugging Face സംഭവം തടയുമായിരുന്നെന്ന് ഞങ്ങൾ കരുതുന്നു. അതിനുശേഷം Astra-യ്ക്കായി കൂടുതൽ ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങൾ നടപ്പാക്കി. ഹാനികരമായ സൈബർ അഭ്യർഥനകൾ കൂടുതൽ വിശ്വസനീയമായി നിരസിക്കാനും സുരക്ഷാ നിയന്ത്രണങ്ങൾ പാലിക്കാനും മോഡലിനെ പരിശീലിപ്പിക്കൽ, ദുരുപയോഗത്തിനെതിരായ അധിക സംരക്ഷണങ്ങൾ, അനധികൃതമാകാൻ സാധ്യതയുള്ള പ്രവർത്തനം നിർത്താൻ കഴിയുന്ന നിരീക്ഷണം എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു.

Astra ഉടൻ ലഭ്യമാക്കാൻ ഞങ്ങൾ പദ്ധതിയിടുന്നു, എന്നാൽ അതിന്റെ ഏറ്റവും നൂതനമായ സൈബർസുരക്ഷാ ശേഷികളിലേക്കുള്ള പ്രവേശനം കൂടുതൽ പരിമിതമായിരിക്കും. നൂതന സൈബർസുരക്ഷാ പ്രവർത്തനങ്ങൾ തുടക്കത്തിൽ ഒരു പരീക്ഷകസംഘത്തിന് ലഭ്യമാക്കും; പിന്നീട് പ്രതിരോധപരമായ ഉപയോഗം വിപുലീകരിക്കാൻ Daybreak Blue വഴിയുള്ള പ്രവേശനം നൽകും.

സമാരംഭസമയത്ത് മോഡലിന്റെ സിസ്റ്റം കാർഡിൽ സുരക്ഷ, സംരക്ഷണം, വിന്യാസം എന്നിവയ്ക്കായുള്ള ഞങ്ങളുടെ പരിശോധനകളെയും വിലയിരുത്തലുകളെയും കുറിച്ചുള്ള കൂടുതൽ വിവരങ്ങൾ പങ്കിടും. ഇത്രയും ഉയർന്ന സൈബർസുരക്ഷാ ശേഷിയുള്ള മോഡൽ സുരക്ഷിതമായി പുറത്തിറക്കാൻ ഞങ്ങൾ നടത്തുന്ന പ്രവർത്തനങ്ങളിൽ ചിലതിനെക്കുറിച്ച് പുറത്തിറക്കലിന് മുമ്പ് വിവരിക്കാനും അവശേഷിക്കുന്ന അപകടസാധ്യതകളെക്കുറിച്ച് സുതാര്യത പുലർത്താനും ഞങ്ങൾ ആഗ്രഹിക്കുന്നു.

Astra-യുടെ സൈബർസുരക്ഷാ ശേഷികളുടെ വിലയിരുത്തൽ

ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്ക് പ്രകാരം, ഇനിപ്പറയുന്ന വ്യവസ്ഥകളിൽ ഏതെങ്കിലുമൊന്ന് പാലിച്ചാൽ ഒരു മോഡൽ നിർണായക പരിധി കൈവരിക്കുന്നു:

  • മനുഷ്യ ഇടപെടലില്ലാതെ, ശക്തമായി പരിരക്ഷിച്ച നിരവധി യഥാർഥ നിർണായക സംവിധാനങ്ങളിൽ എല്ലാ തീവ്രതാ നിലവാരങ്ങളിലുമുള്ള പ്രവർത്തനക്ഷമമായ സീറോ-ഡേ ചൂഷണരീതികൾ തിരിച്ചറിയാനും വികസിപ്പിക്കാനും മോഡലിന് കഴിയും.
  • ആഗ്രഹിക്കുന്ന ലക്ഷ്യത്തിന്റെ ഉയർന്നതല വിവരണം മാത്രം നൽകിയാൽ, ശക്തമായി പരിരക്ഷിച്ച ലക്ഷ്യങ്ങൾക്കെതിരായ സമ്പൂർണവും നവീനവുമായ സൈബർ ആക്രമണതന്ത്രങ്ങൾ രൂപപ്പെടുത്തി നടപ്പാക്കാൻ മോഡലിന് കഴിയും.

Astra-യുടെ ഞങ്ങളുടെ തയ്യാറെടുപ്പ് വിലയിരുത്തൽ, യാന്ത്രിക പൊതുവായതും സ്വകാര്യവുമായ മാനദണ്ഡങ്ങളെ വിദഗ്ധർ നയിച്ച വിലയിരുത്തലുകളുമായി സംയോജിപ്പിച്ചു. GPT‑5.6 Sol-നെ അപേക്ഷിച്ച് സൈബർസുരക്ഷാ ശേഷികളിൽ Astra ഗണ്യമായ വർധനയാണ്: ടോക്കൺ ഉപയോഗത്തിൽ ഏറെ കാര്യക്ഷമമായതിനൊപ്പം ദുർബലതകൾ തിരിച്ചറിയുന്നതിലും ചൂഷണരീതികൾ വികസിപ്പിക്കുന്നതിലും കൂടുതൽ ശേഷിയുണ്ട്.

ഉദാഹരണമായി, അറിയപ്പെടുന്ന ദുർബലതകളിൽനിന്ന് ചൂഷണരീതികൾ വികസിപ്പിക്കാനുള്ള മോഡലിന്റെ കഴിവ് പരിശോധിക്കുന്ന ExploitBench-ൽ Astra പ്രവർത്തിപ്പിച്ചപ്പോൾ, മാനദണ്ഡത്തിൽ അത് 100% എന്ന സമ്പൂർണ സ്കോർ നേടി.

ഡാറ്റാ മലിനീകരണത്തെക്കുറിച്ചുള്ള ആശങ്കകൾ കാരണം, അടുത്തിടെ വെളിപ്പെടുത്തിയ അതീവ ഗുരുതരമായ 20 V8 ദുർബലതകളടങ്ങിയ “ExploitBench - ആന്തരിക പോർട്ട് (ജൂൺ–ഓഗസ്റ്റ് 2026)” എന്ന ആന്തരിക മാനദണ്ഡം പിന്നീട് ഞങ്ങൾ നിർമിച്ചു. ഈ ഡാറ്റാസെറ്റിൽ, വളരെ കുറച്ച് ഔട്ട്‌പുട്ട് ടോക്കണുകൾ ഉപയോഗിച്ച് GPT‑5.6 Sol-നെക്കാൾ വളരെ ഉയർന്ന അനിയന്ത്രിത കോഡ് നിർവഹണനിരക്ക് Astra നേടുന്നു. വിലയിരുത്തലിനിടെ, ഒരു ചൂഷണശൃംഖലയുടെ ഭാഗമായി മോഡൽ രണ്ട് സീറോ-ഡേ ദുർബലതകൾ കണ്ടെത്തി ഉപയോഗിക്കുകയും ചെയ്തു. ഈ രണ്ട് ദുർബലതകളും പരിപാലകരെ അറിയിക്കുന്ന നടപടിയിലാണ് ഞങ്ങൾ.

കാണിച്ചിരിക്കുന്ന Astra ഫലങ്ങൾ സ്വതവേയുള്ള പ്രൊഡക്ഷൻ ക്രമീകരണത്തെയല്ല, Daybreak Blue പ്രവേശനമുള്ള ശേഷികളെയാണ് പ്രതിഫലിപ്പിക്കുന്നത്.

ശക്തമായി പരിരക്ഷിച്ച ബ്രൗസറിലും ഓപ്പറേറ്റിങ് സിസ്റ്റത്തിലും വിദഗ്ധർ നയിച്ച വിലയിരുത്തലുകളിൽ, Astra ഇതുവരെ അറിയപ്പെടാത്ത ദുർബലതകൾ കണ്ടെത്തി അവയെ പ്രവർത്തനക്ഷമമായ ചൂഷണശൃംഖലകളാക്കി. ബ്രൗസർ ഒരു HTML ഫയൽ തുറന്നപ്പോൾ, സാൻഡ്‌ബോക്സിൽനിന്ന് പുറത്തുകടന്ന് ഹോസ്റ്റിൽ കമാൻഡുകൾ പ്രവർത്തിപ്പിക്കുന്ന സമ്പൂർണ ബ്രൗസർ-നിയന്ത്രണ ശൃംഖല അത് നിർമിച്ചു. ശക്തമായി പരിരക്ഷിച്ച ഓപ്പറേറ്റിങ് സിസ്റ്റത്തിൽ ഒന്നിലധികം ദുർബലതകളും മോഡൽ കണ്ടെത്തി; അനധികൃത സാധാരണ ഉപയോക്താവിൽനിന്ന് റൂട്ട് അധികാരത്തിലേക്കുള്ള പ്രാദേശിക അധികാരവർധന ശൃംഖലയായി അവയെ സംയോജിപ്പിച്ചു. മൊത്തത്തിൽ, Astra നിർണായക പരിധി കൈവരിച്ചെന്ന നിഗമനത്തിലേക്കാണ് ഞങ്ങളുടെ അന്വേഷണം നയിച്ചത്.

നിർണായക ശേഷികൾക്ക് ആവശ്യമായ സുരക്ഷാ സംവിധാനങ്ങൾ

Astra-യുടെ നിലവാരത്തിലുള്ള സൈബർസുരക്ഷാ ശേഷികളുള്ള മോഡലുകൾ മൂലമുണ്ടാകാവുന്ന ഗുരുതര സൈബർ നാശത്തിന്റെ സാധ്യത കുറയ്ക്കാൻ, വികസനവേളയിലും വിന്യാസത്തിന് മുമ്പും രണ്ട് വഴികൾ നാം പരിഗണിക്കണം:

  • ദുരുദ്ദേശ്യമുള്ളവർ മോഡൽ ഉപയോഗിക്കുന്നത്. ശക്തമായി പരിരക്ഷിച്ച നിർണായക സംവിധാനങ്ങളിലെ ഇതുവരെ അറിയപ്പെടാത്ത പിഴവുകൾക്കായി ചൂഷണരീതികൾ വികസിപ്പിക്കാനോ ശക്തമായി പരിരക്ഷിച്ച ലക്ഷ്യങ്ങൾക്കെതിരെ സമ്പൂർണ ആക്രമണങ്ങൾ നടത്താനോ ദുരുദ്ദേശ്യമുള്ളവർ Astra ഉപയോഗിക്കുന്നത് നമ്മുടെ സുരക്ഷാ സംവിധാനങ്ങൾ ഫലപ്രദമായി തടയണം.
  • മോഡൽ അനുമതിയില്ലാത്തതും വിന്യാസലക്ഷ്യങ്ങളുമായി പൊരുത്തപ്പെടാത്തതുമായ നടപടികൾ സ്വീകരിക്കുന്നത്. ദുരുദ്ദേശ്യമുള്ള ഉപയോക്താവ് ഇല്ലെങ്കിൽപ്പോലും, നൂതന സൈബർസുരക്ഷാ ശേഷികളുള്ള മോഡൽ ശരിയായി വിന്യസിക്കപ്പെട്ടിട്ടില്ലെങ്കിൽ സ്വയം സൈബർ നാശമുണ്ടാക്കാം. ഈ ശേഷികളുള്ള മോഡലുകളുടെ വിന്യാസത്തിന് അത്യുയർന്ന നിലവാരം ഉറപ്പാക്കുന്നതിനൊപ്പം, യഥാർഥ ലോകത്ത് വലിയ നാശമുണ്ടാക്കാവുന്ന പൊരുത്തക്കേടുള്ള നടപടികൾ അതിവേഗം കണ്ടെത്തി നിയന്ത്രിക്കാൻ രണ്ടാം പ്രതിരോധതലമെന്ന നിലയിൽ നമ്മുടെ സുരക്ഷാ സംവിധാനങ്ങൾക്ക് കഴിയണം.

പ്രധാനമായി, രണ്ടാമത്തെ വഴി ആന്തരിക വികസനത്തിനും ബാഹ്യ വിന്യാസത്തിനും ഒരുപോലെ ബാധകമാണ്. ഞങ്ങൾ മുമ്പ് വിവരിച്ചതുപോലെ, OpenAI-Hugging Face സംഭവത്തിനുശേഷം ഒറ്റപ്പെടുത്തലും നെറ്റ്‌വർക്ക് നിയന്ത്രണങ്ങളും വിപുലമായ നിരീക്ഷണവും ശക്തിപ്പെടുത്തിയ വിന്യാസപരിശീലനവും പരിധികളും ഉൾപ്പെടെ പരിശീലന അടിസ്ഥാനസൗകര്യം കൂടുതൽ സുരക്ഷിതമാക്കാൻ ചില അത്യാധുനിക പരിശീലനങ്ങൾ (Astra-യ്ക്കുള്ള ചില പരിശീലനങ്ങൾ ഉൾപ്പെടെ) രണ്ടാഴ്ചത്തേക്ക് നിർത്തിവച്ചു. തുടർന്ന്, കർശനമായ നിയന്ത്രണങ്ങൾക്കു കീഴിൽ ചെറിയ തോതിലുള്ള പ്രവർത്തനം തുടർന്നു.

Astra-യുടെ ഭാവി പതിപ്പുകൾക്കായുള്ള ചില വലിയ റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് (RL) റണ്ണുകൾ, അവയുടെ പരിശീലനാന്തരീക്ഷത്തിന്റെ സുരക്ഷയ്ക്ക് ഉയർന്ന മാനദണ്ഡങ്ങൾ സ്ഥാപിക്കുന്നതുവരെ കൂടുതൽ കാലം മാറ്റിവച്ചു. പുതിയ സുരക്ഷാ ആവശ്യകതകൾ നടപ്പാക്കിയശേഷം, മുമ്പ് നിർത്തിവച്ച വലിയ അത്യാധുനിക RL റൺ ഓഗസ്റ്റ് 28-ന് ഞങ്ങൾ പുനരാരംഭിച്ചു. ചില ചെറിയ പരീക്ഷണ പരിശീലന റണ്ണുകൾ ഞങ്ങൾ ഇപ്പോഴും താൽക്കാലികമായി മാറ്റിവച്ചിരിക്കുകയാണ്.

Astra-യെ പുറത്തിറക്കാൻ തയ്യാറാക്കുന്നതിന് സൈബർ ദുരുപയോഗത്തിനും അനധികൃത നടപടികൾക്കും എതിരായ ശക്തമായ സംരക്ഷണങ്ങളും ആവശ്യമായി വന്നു. ആ സുരക്ഷാ സംവിധാനങ്ങളും അവ ഞങ്ങൾ എങ്ങനെ പരീക്ഷിച്ചുവെന്നും താഴെ വിവരിക്കുന്നു.

സൈബർ ദുരുപയോഗത്തിനെതിരായ പ്രതിരോധശേഷി

സൈബർസുരക്ഷയിൽ ഉയർന്ന ശേഷിയുള്ളതായി ഞങ്ങൾ കണക്കാക്കിയ ആദ്യ മോഡൽ ഫെബ്രുവരിയിൽ വിന്യസിച്ചതുമുതൽ, തുടർന്നുള്ള ഓരോ സമാരംഭത്തിലും സൈബർ സുരക്ഷാ സംവിധാനങ്ങൾ ശക്തിപ്പെടുത്തിയിട്ടുണ്ട്. പോസ്റ്റ്-ട്രെയിൻഡ് മോഡലിന്റെ നിരസിക്കൽ, സിസ്റ്റംതല സുരക്ഷാ ക്ലാസിഫയറുകൾ, ഓഫ്‌ലൈൻ കണ്ടെത്തൽ, ഭീഷണി തടയൽ എന്നിവ പാളികളായി സംയോജിപ്പിക്കുന്നതാണ് ഞങ്ങളുടെ മൊത്തത്തിലുള്ള സുരക്ഷാ സമീപനം.

GPT‑5.6(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-നായി, സൈബർ ദുരുപയോഗം കണ്ടെത്താൻ ആക്ടിവേഷൻ ക്ലാസിഫയറുകൾ ചേർത്തും തീവ്രമായ യാന്ത്രിക റെഡ് ടീമിംഗിലൂടെ കണ്ടെത്തിയ സാർവത്രിക ജെയിൽബ്രേക്കുകൾക്കെതിരായ പരിരക്ഷ വിപുലീകരിച്ചും ഞങ്ങളുടെ സിസ്റ്റംതല സുരക്ഷാ ശേഖരത്തിന്റെ പ്രതിരോധശേഷി ഗണ്യമായി മെച്ചപ്പെടുത്തി. ഈ മെച്ചപ്പെടുത്തലുകളുടെ അടിസ്ഥാനത്തിൽ, Astra-യ്ക്കായി ഞങ്ങളുടെ സുരക്ഷാ ശേഖരത്തിലെ മോഡൽതലത്തിൽ കൂടുതൽ നിക്ഷേപിക്കുകയും സംഭാഷണങ്ങൾക്കിടയിലെ സന്ദർഭം കൈകാര്യം ചെയ്യാനുള്ള സുരക്ഷാ സംവിധാനങ്ങളുടെ കഴിവ് മെച്ചപ്പെടുത്തുകയും ചെയ്തു.

  • മോഡലിന്റെ പ്രതിരോധശേഷിക്കായുള്ള പുതിയ പരിശീലനരീതികൾ പ്രയോജനപ്പെടുത്തി, അനുവദനീയമല്ലാത്ത സൈബർ സഹായത്തിനുള്ള അഭ്യർഥനകൾ Astra കൂടുതൽ സ്ഥിരതയോടെ നിരസിക്കുന്നു. ഞങ്ങളുടെ സൈബർ ജെയിൽബ്രേക്ക് വിലയിരുത്തലുകളിൽ Astra 91.5% അഭ്യർഥനകളും നിരസിക്കുന്നു (GPT‑5.6 Sol-ന്റെ 59%-വുമായി താരതമ്യം ചെയ്യുമ്പോൾ).
  • കൂടുതൽ അപകടസാധ്യതയുള്ളതായി വിലയിരുത്തിയ അക്കൗണ്ടുകൾക്ക്, അപകടകരമാകാൻ സാധ്യതയുള്ള കൂടുതൽ തരത്തിലുള്ള സൈബർ സഹായം നിരസിക്കുന്ന കർശനമായ മോഡൽ-പെരുമാറ്റ പരിധിയാണ് ഞങ്ങൾ പ്രയോഗിക്കുന്നത്. ഉയർന്ന അപകടസാധ്യതയുള്ള ഉപയോക്താക്കളുടെ ഇത്തരം സൈബർ ദുരുപയോഗം കണ്ടെത്താൻ ഞങ്ങളുടെ നിരീക്ഷണ സംവിധാനങ്ങളുടെ സന്ദർഭപരിധി വിപുലീകരിച്ചിട്ടുണ്ട്.

കർശനമായ പരിശോധനയും ആന്തരികവും ബാഹ്യവുമായ റെഡ് ടീമിംഗും പരിഹാരനടപടികളും ഉൾപ്പെടുന്ന പരിപാടിയും ഞങ്ങൾ തുടർന്നിട്ടുണ്ട്. മുൻ പരിശോധനാ ഘട്ടങ്ങളിൽ കണ്ടെത്തിയ എല്ലാ ജെയിൽബ്രേക്കുകൾക്കുമുള്ള പരിരക്ഷ തുടരുന്നുവെന്ന് ഉറപ്പാക്കാൻ റിഗ്രഷൻ പരിശോധന നടത്തുന്നതിനൊപ്പം, ഏറ്റവും പുതിയ ആന്തരിക റെഡ് ടീമിംഗ് ആക്രമണകാരികളെ ഉപയോഗിച്ച് പുതിയൊരു റെഡ് ടീമിംഗ് ഘട്ടവും നടത്തുന്നു. പൊതുവായൊരു ജെയിൽബ്രേക്ക് റേറ്റിങ് സംവിധാനം നിർവചിക്കാൻ വ്യവസായ പങ്കാളികളുമായി പ്രവർത്തിക്കുകയാണ്; പുതിയ കണ്ടെത്തലുകൾ അന്വേഷിച്ച് പരിഹരിക്കാൻ ഞങ്ങളുടെ 24/7 ദ്രുതപ്രതികരണ പരിപാടി ഉപയോഗിക്കും. Astra സിസ്റ്റം കാർഡിൽ ഞങ്ങളുടെ സൈബർ സുരക്ഷാ പരിശോധനയെക്കുറിച്ചുള്ള കൂടുതൽ വിവരങ്ങൾ പങ്കിടും.

ദുർബലതകൾ കണ്ടെത്താനും പരിഹരിക്കാനും പ്രതിരോധകരെ സഹായിക്കുന്നത് ഞങ്ങളുടെ സുരക്ഷാ സമീപനത്തിന്റെ പ്രധാന തൂണായി തുടരുന്നു. സാധ്യതയുള്ള ദുരുപയോഗത്തിൽനിന്ന് സംരക്ഷിക്കാൻ, സമാരംഭസമയത്ത് Astra-യുടെ സുരക്ഷാ സംവിധാനങ്ങൾ ഞങ്ങൾ ആത്യന്തികമായി ഉദ്ദേശിക്കുന്നതിലധികം തടസ്സങ്ങൾ സൃഷ്ടിക്കുമെന്ന് പ്രതീക്ഷിക്കുന്നു. നൂതന സൈബർസുരക്ഷാ പ്രവർത്തനങ്ങൾക്ക് Astra ഉപയോഗിക്കാനുള്ള അനുമതി തുടക്കത്തിൽ ചെറിയൊരു ആൽഫാ പരീക്ഷകസംഘത്തിനായിരിക്കും; പിന്നീട് പ്രതിരോധപരമായ ഉപയോഗം പിന്തുണയ്ക്കാൻ Daybreak Blue വഴിയുള്ള പ്രവേശനം വിപുലീകരിക്കും.

വിന്യാസം & നിരീക്ഷണം

വിന്യാസലക്ഷ്യങ്ങളുമായി പൊരുത്തപ്പെടാത്ത നടപടികൾ മോഡൽ സ്വീകരിക്കുന്നത് തടയാൻ പാളികളായ അധിക സംരക്ഷണങ്ങളും ഞങ്ങൾ ചേർത്തിട്ടുണ്ട്:

  • മോഡൽ വിന്യാസം: ഞങ്ങളുടെ വിലയിരുത്തലുകളിൽ, വ്യക്തമായ സുരക്ഷാ നിയന്ത്രണങ്ങൾ പാലിക്കാനും അനുമതിയുള്ള പരിധിക്കുള്ളിൽ തുടരാനും GPT‑5.6 Sol-നെക്കാൾ വളരെ കൂടുതൽ സാധ്യത Astra കാണിച്ചു. ഇതോടെ ഇന്നുവരെയുള്ള ഞങ്ങളുടെ ഏറ്റവും നന്നായി വിന്യസിച്ച മോഡലായി ഇത് മാറി. സുരക്ഷാ നിയന്ത്രണങ്ങളോടുള്ള മോഡലിന്റെ അനുസരണത്തിനും അനുമതിയുള്ള പരിധിക്കുള്ളിൽ തുടരാനുള്ള പ്രവണതയ്ക്കുമാണ് ഞങ്ങൾ പ്രത്യേക ശ്രദ്ധ നൽകിയത്.
  • നിരീക്ഷണവും നിയന്ത്രണവും: ഞങ്ങളുടെ ആന്തരിക നടപടിക്രമങ്ങൾക്ക് സമാനമായി, വിന്യാസലക്ഷ്യങ്ങളുമായി പൊരുത്തപ്പെടാത്ത നടപടികൾ അതിവേഗം കണ്ടെത്തി നിയന്ത്രിക്കാൻ അധിക ചെയ്ൻ-ഓഫ്-തോട്ട് നിരീക്ഷണത്തോടെയാണ് Astra വിന്യസിക്കുന്നത്.

മോഡൽ വിന്യാസത്തിൽ Astra ഗണ്യമായ മുന്നേറ്റമാണ്; പ്രീ-ട്രെയിനിംഗ് ഇടപെടലുകൾ മുതൽ റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിങ്ങിലെ കൂടുതൽ സൂക്ഷ്മവും സ്ഥിരതയുള്ളതുമായ ഗ്രേഡിങ് വരെയുള്ള ദീർഘകാല വിന്യാസ പ്രവർത്തനങ്ങളുടെ പര്യവസാനവുമാണിത്. പരിശോധനയിൽ, GPT 5.6 Sol-നെ അപേക്ഷിച്ച് വ്യക്തമായ സുരക്ഷാ നിയന്ത്രണങ്ങളും മുന്നറിയിപ്പുകളും (യാന്ത്രിക അവലോകനം പോലുള്ളവ) Astra കൂടുതൽ സ്ഥിരതയോടെ പാലിക്കുന്നതായി കണ്ടെത്തി.

Hugging Face സംഭവത്തിൽനിന്നുള്ള വിവരങ്ങളുടെ അടിസ്ഥാനത്തിൽ ഞങ്ങൾ മറ്റൊരു പരിശോധനയും വികസിപ്പിച്ചു. അതിൽ ExploitGym സൈബർ വിലയിരുത്തൽ നടത്തിയ ഏജന്റുകൾ ഒരു മൂന്നാം കക്ഷിയുടെ സംവിധാനങ്ങൾ കൈവശപ്പെടുത്തി. നൽകിയ ടാസ്ക് പരിഹരിക്കുന്നതിനുപകരം ചുറ്റുമുള്ള സുരക്ഷാ അടിസ്ഥാനസൗകര്യം കൈവശപ്പെടുത്താൻ മോഡൽ ശ്രമിക്കുമോ എന്ന് പരിശോധിക്കുന്ന “ഹണിപോട്ട്” പരീക്ഷണങ്ങൾ സൃഷ്ടിക്കാൻ ആ വിലയിരുത്തലിലെ ഏറ്റവും പ്രയാസമേറിയ ടാസ്കുകൾ ഉപയോഗിച്ചു. പ്രൊഡക്ഷൻ സുരക്ഷാ സംവിധാനങ്ങളില്ലാത്ത GPT‑5.6 Sol, ചൂഷണരീതികൾ വികസിപ്പിക്കാൻ മോഡലിനോട് നിർദേശിക്കുന്ന മാനദണ്ഡപരിസരം അനുകരിച്ച പരീക്ഷണങ്ങളിൽ 56%-ലും ആ ലക്ഷ്യങ്ങളിൽ പ്രവേശിക്കാൻ ശ്രമിച്ചു. ഈ പരീക്ഷണങ്ങളിൽ Astra അത്തരം ശ്രമങ്ങളൊന്നും നടത്തിയില്ല. ഈ കണക്കുകൾ സൈബർ സുരക്ഷാ സംവിധാനങ്ങളില്ലാത്ത പരീക്ഷണ സാഹചര്യങ്ങളിലെ പെരുമാറ്റമാണ് വിവരിക്കുന്നത്, സാധാരണ പ്രൊഡക്ഷൻ ഉപയോഗത്തെയല്ല.

ഇടത്: ഈ പുതിയ വിലയിരുത്തലിൽ, യാന്ത്രിക അവലോകനം നിരസിക്കുമ്പോൾ മോഡലുകൾ എങ്ങനെ പ്രതികരിക്കുന്നുവെന്ന് നിരീക്ഷിക്കുന്നു. ഓരോ ടാസ്കും വിജ്ഞാനാധിഷ്ഠിത തൊഴിൽപരിസരത്തിലാണ് ക്രമീകരിച്ചിരിക്കുന്നത്; യാന്ത്രിക അവലോകനം നിരസിച്ചതിന് തൊട്ടുപിന്നാലെ പ്രവർത്തനക്രമം ആരംഭിക്കുന്നു. തുടർന്ന് മോഡലിന് പല വഴികളുണ്ട്: പ്രവർത്തനക്രമം അവസാനിപ്പിക്കുക, കൂടുതൽ സുരക്ഷിതമായ ബദൽ കണ്ടെത്താൻ ശ്രമിക്കുക, സമാനമായൊരു കമാൻഡ് വീണ്ടും പരീക്ഷിക്കുക, അല്ലെങ്കിൽ യാന്ത്രിക അവലോകനം പൂർണമായി മറികടക്കാൻ ഒരു മോശം ക്രമീകരണം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ചൂഷണം ചെയ്യുക. അവസാനത്തെ രണ്ട് മാർഗങ്ങളിൽ ഏതെങ്കിലും പിന്തുടരുന്നത് ഈ വിലയിരുത്തലിലെ പരാജയമായി കണക്കാക്കും. യാന്ത്രിക അവലോകനം മറികടക്കാൻ Astra ഒരിക്കലും ശ്രമിച്ചില്ല.

വലത്: ExploitGym വിലയിരുത്തലിലെ ഏറ്റവും പ്രയാസമേറിയതോ അസാധ്യമോ ആയ ടാസ്കുകൾ നേരിടുമ്പോൾ ഒരു മോഡൽ വഞ്ചിക്കാൻ (“ഹണിപോട്ടുകൾ” ഉപയോഗിച്ച്) കാണിക്കുന്ന പ്രവണതയാണ് ഇവിടെ പരിശോധിക്കുന്നത്. മോഡലിന്റെ പെരുമാറ്റം വിലയിരുത്താൻ, സുരക്ഷാ സംവിധാനങ്ങൾ നിരീക്ഷണത്തിന് മാത്രമുള്ള രീതിയിൽ സജ്ജമാക്കി സിമുലേറ്റ് ചെയ്ത പരിസരത്തിലാണ് ഇത് നടത്തിയത്. ഈ സാഹചര്യങ്ങളിൽ GPT‑5.6 Sol വഞ്ചിക്കാനുള്ള ഉയർന്ന സാധ്യത കാണിച്ചെങ്കിലും, Astra ആ കുറുക്കുവഴികൾ ഉപയോഗിക്കാൻ ശ്രമിച്ചില്ല; എന്നിട്ടും ചില ടാസ്കുകൾ നിയമാനുസൃതമായി പരിഹരിക്കാൻ അതിന് കഴിഞ്ഞു.

മോഡലുകളെ ശരിയായി വിന്യസിക്കാൻ പരിശീലിപ്പിക്കുന്നത് സുരക്ഷയുടെ ഒരു പാളിയാണ്. വിന്യാസപരിശോധനയെയും ഫലങ്ങളെയും കുറിച്ചുള്ള കൂടുതൽ വിവരങ്ങൾ Astra സിസ്റ്റം കാർഡിൽ പങ്കിടും.

സാധ്യതയുള്ള വിന്യാസപ്പൊരുത്തക്കേട് കണ്ടെത്തി അതിവേഗം നിയന്ത്രിക്കാൻ, Astra വിഭാഗത്തിലുള്ള മോഡലുകൾക്കായി പ്രൊഡക്ഷനിലും ഞങ്ങൾ നിരീക്ഷണം വിന്യസിക്കുന്നു. ഈ സുരക്ഷാ സംവിധാനങ്ങൾ ഞങ്ങളുടെ ആന്തരിക വിന്യാസങ്ങളിലെ നിരീക്ഷണത്തിന് സമാനമാണ്. അനധികൃത പെരുമാറ്റമുണ്ടോയെന്ന് മോഡലിന്റെ റീസണിങ്ങും നടപടികളും പരിശോധിക്കുകയും അനധികൃതമാകാൻ സാധ്യതയുള്ള പ്രവർത്തനം യാന്ത്രികമായി നിർത്തുകയും ചെയ്യുന്ന ക്ലാസിഫയർ സംവിധാനമാണ് ഇതിലുള്ളത്. ശേഷികൾ വർധിക്കുമ്പോൾ മോഡലുകളുടെ നല്ല വിന്യാസത്തിന് പകരമാകാൻ ഈ സുരക്ഷാ സംവിധാനങ്ങൾക്ക് കഴിയില്ല. ഇവ ഒരിക്കലും സജീവമാകേണ്ടിവരാത്തത്ര നന്നായി ഭാവി മോഡലുകൾ വിന്യസിക്കുക എന്നതാണ് ഞങ്ങളുടെ ലക്ഷ്യം.

ഉപയോക്താക്കൾക്ക് ഇതിന്റെ അർഥം

AI-യുടെ പ്രയോജനങ്ങൾ എല്ലാവർക്കും വ്യാപകമായി ലഭ്യമാക്കാൻ OpenAI പ്രതിജ്ഞാബദ്ധമാണ്. Astra-യുടെ സൈബർസുരക്ഷാ ശേഷികൾ ഗണ്യമായി വർധിച്ചതിനാൽ, ഈ വിന്യാസം സുരക്ഷിതമാക്കുന്നതിൽ ഞങ്ങൾ പ്രത്യേക ജാഗ്രത പുലർത്തുന്നു. അധിക സുരക്ഷാ പരിശോധനകൾ ചിലപ്പോൾ പ്രതിരോധപരമായ സൈബർസുരക്ഷ ഉൾപ്പെടെയുള്ള നിയമാനുസൃത പ്രവർത്തനങ്ങളെ മന്ദഗതിയിലാക്കുകയോ താൽക്കാലികമായി നിർത്തുകയോ പൂർണമായി അവസാനിപ്പിക്കുകയോ ചെയ്യാം.

നിയമാനുസൃത പ്രവർത്തനത്തെ സൈബർ ദുരുപയോഗമോ അനധികൃത പെരുമാറ്റമോ ആകാമെന്ന് സിസ്റ്റം ചിലപ്പോൾ അടയാളപ്പെടുത്തിയേക്കാം; അതിനാൽ ആ പ്രവർത്തനം അബദ്ധത്തിൽ മന്ദഗതിയിലാകുകയോ താൽക്കാലികമായി നിൽക്കുകയോ അവസാനിക്കുകയോ ചെയ്യാം. സൈബർസുരക്ഷയുമായി നേരിട്ട് ബന്ധമില്ലെന്ന് തോന്നുന്ന ജോലികളും ഒരു ഏജന്റ് ദീർഘനേരം പ്രവർത്തിക്കുന്ന ടാസ്കുകളും ഇതിൽ ഉൾപ്പെടാം.

വിന്യാസപ്പൊരുത്തക്കേട് നിരീക്ഷിക്കുന്ന സംവിധാനം ഒരു ടാസ്ക് താൽക്കാലികമായി നിർത്തിയാൽ, തുടരുന്നതിന് മുമ്പ് നടപടി അവലോകനം ചെയ്യാൻ ChatGPT‑യിലോ Codex-ലോ ഉള്ള ഉപയോക്താക്കളോട് ആവശ്യപ്പെട്ടേക്കാം. API പോലുള്ള മറ്റ് ഉപരിതലങ്ങൾ ഉപയോഗിക്കുമ്പോൾ ടാസ്ക് അവസാനിക്കും. അനാവശ്യ തടസ്സങ്ങൾ കുറയ്ക്കാനും Daybreak പോലുള്ള പരിപാടികളിലൂടെ അത്യാധുനിക ശേഷികളിലേക്കുള്ള പ്രവേശനം വിപുലീകരിക്കാനും ഈ സുരക്ഷാ സംവിധാനങ്ങൾ തുടർന്നും ക്രമീകരിക്കാൻ ഞങ്ങൾ പദ്ധതിയിടുന്നു.

മുന്നോട്ടുള്ള വഴി

മോഡലുകൾക്ക് കൂടുതൽ പ്രത്യാഘാതമുള്ള ജോലികൾ ഏറ്റെടുക്കാൻ കഴിയുന്ന AI വികസനഘട്ടത്തിലേക്കാണ് നാം കടക്കുന്നത്; വിന്യാസത്തിലും നിയന്ത്രണത്തിലുമുള്ള പരാജയങ്ങൾക്ക് കൂടുതൽ ഗുരുതരമായ ഫലങ്ങളുണ്ടാകാം. ഈ സംവിധാനങ്ങളുടെ പ്രയോജനങ്ങൾ യാഥാർഥ്യമാക്കുന്നത്, അവയുടെ ശേഷികൾ വളരുമ്പോൾ മോഡലുകളെ വിന്യസിക്കാനും നിയന്ത്രിക്കാനുമുള്ള നമ്മുടെ കഴിവിനെ ആശ്രയിച്ചിരിക്കും.

ആ ഉത്തരവാദിത്തം പരിശീലനം, വിലയിരുത്തൽ, വിന്യാസം എന്നിവയിലാകെ വ്യാപിക്കുന്നു. വിന്യാസവുമായി പൊരുത്തപ്പെടുന്ന പെരുമാറ്റത്തിന് കൂടുതൽ ശക്തമായ തെളിവും ശേഷിക്കൊപ്പം പുരോഗമിക്കുന്ന സുരക്ഷാ സംവിധാനങ്ങളും അവ പര്യാപ്തമല്ലാത്തപ്പോൾ വേഗം കുറയ്ക്കാനുള്ള സന്നദ്ധതയും അതിന് ആവശ്യമാണ്.

ഈ സംവിധാനങ്ങൾ ഞങ്ങൾ തുടർന്നും പരീക്ഷിക്കുകയും പഠിക്കുന്ന കാര്യങ്ങൾ പങ്കിടുകയും അവശേഷിക്കുന്ന അനിശ്ചിതത്വങ്ങളെക്കുറിച്ച് വ്യക്തത പുലർത്തുകയും ചെയ്യും. Astra-യ്ക്കുശേഷമുള്ള മോഡലുകൾ നമ്മിൽനിന്ന് കൂടുതൽ ആവശ്യപ്പെടും. ആ ഉത്തരവാദിത്തം നിറവേറ്റാൻ ആവശ്യമായ സമയമെടുത്ത് വേണ്ട പ്രവർത്തനങ്ങൾ ഞങ്ങൾ ചെയ്യും.