മോഡൽ മൂല്യനിർണ്ണയത്തിനിടെ ഉണ്ടായ സുരക്ഷാ സംഭവം പരിഹരിക്കാൻ OpenAI–Hugging Face സഹകരണം
തങ്ങളുടെ ഇൻഫ്രാസ്ട്രക്ചറിനെ ബാധിച്ച ഒരു എഐ ഏജൻ്റിനെ കണ്ടെത്തി നിയന്ത്രിച്ചതിന് ശേഷം, കഴിഞ്ഞ ആഴ്ച Hugging Face ഒരു പുതിയ തരം സുരക്ഷാ വീഴ്ചയെക്കുറിച്ച്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) വെളിപ്പെടുത്തുകയുണ്ടായി; കൂടുതൽ സൈബർ ശേഷിയുള്ള മോഡലുകളുടെ വ്യാപനത്തോടെ ഇത്തരം സംഭവങ്ങൾ വരുംകാലങ്ങളിൽ കൂടുതൽ സാധാരണമാകുമെന്ന് ഞങ്ങൾ പ്രതീക്ഷിക്കുന്നു. അന്വേഷണത്തിനൊടുവിൽ, സൈബർ ശേഷികളുടെ ഒരു ബെഞ്ച്മാർക്കിൽ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ആന്തരിക പരിശോധന നടത്തുന്നതിനിടെ ഒരു കൂട്ടം OpenAI മോഡലുകളാണ് ഈ പ്രത്യേക സംഭവത്തിന് കാരണമായതെന്ന് ഞങ്ങൾ മനസ്സിലാക്കുന്നു — വിലയിരുത്തൽ ആവശ്യങ്ങൾക്കായി സൈബർ നിയന്ത്രണങ്ങൾ പരിമിതപ്പെടുത്തിയിരുന്ന GPT‑5.6 Sol-ഉം അതിനേക്കാൾ മികച്ച ശേഷിയുള്ള മറ്റൊരു പ്രീ-റിലീസ് മോഡലും ഇതിൽ ഉൾപ്പെടുന്നു.
അത്യാധുനിക സൈബർ ശേഷികൾ ഉൾപ്പെടുന്ന, അഭൂതപൂർവമായ ഒരു സൈബർ സംഭവമായാണ് ഞങ്ങൾ ഇതിനെ കണക്കാക്കുന്നത്; കൂടാതെ അതിനനുസരിച്ചുള്ള നടപടികൾ ഞങ്ങൾ സ്വീകരിക്കുകയും ചെയ്യുന്നു. എന്താണ് സംഭവിച്ചതെന്ന് മനസ്സിലാക്കാനും മോഡലുകൾക്ക് ഇപ്പോൾ എന്തൊക്കെ ചെയ്യാൻ കഴിയുമെന്ന് കൃത്യമായി വിലയിരുത്താനും പ്രതിരോധക്കാരെ സഹായിക്കുന്നതിനായി ഈ ഘട്ടത്തിൽ ഞങ്ങൾ പ്രാഥമിക കണ്ടെത്തലുകൾ പങ്കുവെക്കുകയാണ്. Hugging Face-മായി ചേർന്ന് ഞങ്ങൾ സമഗ്രമായ അന്വേഷണം തുടരും, കൂടാതെ അന്വേഷണം പൂർത്തിയാകുമ്പോൾ സുരക്ഷാ വീഴ്ചകൾ, ഈ സംഭവം, മറ്റ് കണ്ടെത്തലുകൾ എന്നിവയെക്കുറിച്ചുള്ള കൂടുതൽ വിവരങ്ങൾ ഞങ്ങൾ പങ്കുവെക്കുന്നതുമായിരിക്കും.
മോഡലുകളുടെ സൈബർ ശേഷികൾ അളക്കുന്നതിനായി, സങ്കീർണ്ണമായ ആക്രമണ മാർഗ്ഗങ്ങളിലൂടെ നൂതനമായ ചൂഷണങ്ങൾ നടത്താൻ മോഡലുകളെ പ്രേരിപ്പിക്കുന്ന ഒരു ആന്തരിക പരിശോധനയ്ക്കിടയിലാണ് ഈ സംഭവം നടന്നത്. ഉയർന്ന അപകടസാധ്യതയുള്ള സൈബർ പ്രവർത്തനങ്ങളിൽ ഏർപ്പെടുന്നതിൽ നിന്ന് മോഡലുകളെ തടയാൻ ഉപയോഗിക്കുന്ന പ്രൊഡക്ഷൻ ക്ലാസിഫയറുകൾ ഇല്ലാതെ ഈ പരിശോധന നടത്തിക്കൊണ്ടാണ് ഞങ്ങൾ അവയുടെ പരമാവധി സൈബർ ശേഷികൾ വിലയിരുത്തുന്നത്. തികച്ചും ഐസൊലേറ്റഡ് ആയ ഒരു ചുറ്റുപാടിലാണ് ഞങ്ങളുടെ ബെഞ്ച്മാർക്കുകൾ പ്രവർത്തിക്കുന്നത്; പാക്കേജ് രജിസ്ട്രികൾക്കായുള്ള പ്രോക്സിയായും കാഷെയായും പ്രവർത്തിക്കുന്ന, ആന്തരികമായി ഹോസ്റ്റ് ചെയ്തിട്ടുള്ള ഒരു തേർഡ്-പാർട്ടി സോഫ്റ്റ്വെയർ വഴി പാക്കേജുകൾ ഇൻസ്റ്റാൾ ചെയ്യുന്നതിന് മാത്രമായി ഇതിലെ നെറ്റ്വർക്ക് ആക്സസ് പരിമിതപ്പെടുത്തിയിരിക്കുന്നു.
Hugging Face-ന്റെ പ്രൊഡക്ഷൻ ഡാറ്റാബേസിൽ നിന്ന് നേരിട്ട് ടെസ്റ്റ് സൊല്യൂഷനുകൾ നേടിയെടുക്കുന്നതിനായി, OpenAI-യുടെ ഗവേഷണ ചുറ്റുപാടിലും Hugging Face-ന്റെ പ്രൊഡക്ഷൻ ഇൻഫ്രാസ്ട്രക്ചറിലുമുള്ള സുരക്ഷാ വീഴ്ചകൾ ഈ മോഡലുകൾ കണ്ടെത്തുകയും അവ പരസ്പരം ബന്ധിപ്പിക്കുകയും ചെയ്തു. തികച്ചും പരിമിതമായ ഒരു പരിശോധനാ ലക്ഷ്യം കൈവരിക്കുന്നതിനായി ഏതറ്റം വരെയും പോയിക്കൊണ്ട്, ExploitGym-ന് വേണ്ടിയുള്ള ഒരു സൊല്യൂഷൻ കണ്ടെത്തുന്നതിൽ ഈ മോഡലുകൾ അതീവ ശ്രദ്ധ കേന്ദ്രീകരിച്ചിരുന്നു എന്നാണ് എല്ലാ തെളിവുകളും സൂചിപ്പിക്കുന്നത്.
ഞങ്ങളുടെ സാൻഡ്ബോക്സ്ഡ് ടെസ്റ്റിംഗ് ചുറ്റുപാടിൽ പ്രവർത്തിക്കുന്ന സമയത്ത്, വിലയിരുത്തലിനായുള്ള പ്രശ്നം പരിഹരിക്കുക എന്ന ലക്ഷ്യത്തോടെ ഓപ്പൺ ഇന്റർനെറ്റ് ആക്സസ് നേടാനുള്ള മാർഗ്ഗം കണ്ടെത്തുന്നതിനായി ഞങ്ങളുടെ മോഡലുകൾ ഗണ്യമായ അളവിൽ ഇൻഫറൻസ് കമ്പ്യൂട്ട് ചെലവഴിച്ചു. ഈ ആക്സസ് നേടുന്നതിനായി, പാക്കേജ് രജിസ്ട്രി കാഷെ പ്രോക്സിയിലുള്ള ഒരു സീറോ-ഡേ സുരക്ഷാ പിഴവ് മോഡലുകൾ കണ്ടെത്തുകയും അത് ചൂഷണം ചെയ്യുകയും ചെയ്തു (ഈ പിഴവ് ഞങ്ങൾ ഇപ്പോൾ ഉത്തരവാദിത്തത്തോടെ വെണ്ടറെ അറിയിച്ചിട്ടുണ്ട്). ഈ ആക്സസ് ഉപയോഗപ്പെടുത്തിക്കൊണ്ട്, ഇന്റർനെറ്റ് ആക്സസ് ഉള്ള ഒരു നോഡിൽ എത്തിച്ചേരുന്നത് വരെ ഞങ്ങളുടെ ഗവേഷണ പരിശോധനാ ചുറ്റുപാടിൽ മോഡലുകൾ തുടർച്ചയായ പ്രിവിലേജ് എസ്കലേഷൻ, ലാറ്ററൽ മൂവ്മെന്റ് പ്രവർത്തനങ്ങൾ നടത്തി.
ഇന്റർനെറ്റ് ആക്സസ് നേടിയ ശേഷം, ExploitGym-ന് ആവശ്യമായ മോഡലുകൾ, ഡാറ്റാസെറ്റുകൾ, സൊല്യൂഷനുകൾ എന്നിവ Hugging Face ഹോസ്റ്റ് ചെയ്യുന്നുണ്ടാകാൻ സാധ്യതയുണ്ടെന്ന് മോഡലുകൾ അനുമാനിച്ചു. ഇത് മനസ്സിലാക്കിയ മോഡൽ, വിലയിരുത്തലിൽ കൃത്രിമം കാണിക്കുന്നതിനായി ഉപയോഗിക്കാൻ കഴിയുന്ന രഹസ്യ വിവരങ്ങളിലേക്ക് ആക്സസ് നേടാനുള്ള വഴികൾ തിരയുകയും അത് വിജയകരമായി കണ്ടെത്തുകയും ചെയ്തു. ഇതിനൊരു ഉദാഹരണമായി, Hugging Face സെർവറുകളിൽ ഒരു റിമോട്ട് കോഡ് എക്സിക്യൂഷൻ പാത്ത് കണ്ടെത്തുന്നതിനായി മോഷ്ടിച്ച ക്രെഡൻഷ്യലുകളും സീറോ-ഡേ സുരക്ഷാ പിഴവുകളും ഉപയോഗിക്കുന്നത് ഉൾപ്പെടെയുള്ള ഒന്നിലധികം അറ്റാക്ക് വെക്ടറുകൾ മോഡൽ പരസ്പരം ബന്ധിപ്പിക്കുകയുണ്ടായി. OpenAI-യുടെ സുരക്ഷാ ടീം ഈ അസാധാരണമായ പ്രവർത്തനം ആന്തരികമായി തന്നെ കണ്ടെത്തുകയായിരുന്നു.
ഞങ്ങളുടെ ടീമുകൾ അവരുമായി ബന്ധപ്പെടുമ്പോഴേക്കും, Hugging Face-ന്റെ സുരക്ഷാ ടീമും ഏജൻ്റുകളും തങ്ങളുടെ ഇൻഫ്രാസ്ട്രക്ചറിലെ ഈ പ്രവർത്തനങ്ങൾ കണ്ടെത്തുകയും തടയുകയും ചെയ്തിരുന്നു; കൂടാതെ തങ്ങളുടെ സ്വന്തം ഓപ്പൺ-സോഴ്സ് മോഡലുകൾ ഉപയോഗിച്ച് കണ്ടെയ്ൻമെന്റ് , ഫോറൻസിക് റീകൺസ്ട്രക്ഷൻ നടപടികൾ അവർ ഇതിനകം തന്നെ ആരംഭിക്കുകയും ചെയ്തിരുന്നു. ഈ സംഭവത്തെക്കുറിച്ചുള്ള അന്വേഷണം തുടരുന്നതിനായി ഞങ്ങൾ അവരുമായി സജീവമായി ചേർന്ന് പ്രവർത്തിക്കുകയാണ്. അന്വേഷണത്തിലും പരിഹാര നടപടികളിലുമുള്ള Hugging Face-ന്റെ വേഗമേറിയതും അടുത്തതുമായ സഹകരണത്തിന് ഞങ്ങൾ നന്ദി രേഖപ്പെടുത്തുന്നു.
- അന്വേഷണത്തിന്റെ ഭാഗമായി, സുരക്ഷാ പിഴവുകൾ പരിഹരിക്കുന്ന സമയത്ത് ഗവേഷണ വേഗതയെ ബാധിക്കുമെങ്കിലും, അടിസ്ഥാന സൗകര്യങ്ങളുടെ ക്രമീകരണത്തിൽ ഞങ്ങൾ കർശനമായ നിയന്ത്രണങ്ങൾ നടപ്പിലാക്കുകയാണ്. ഈ നിയന്ത്രണങ്ങളെക്കുറിച്ചും അവയുടെ പ്രത്യാഘാതങ്ങളെക്കുറിച്ചും ഞങ്ങളുടെ സേഫ്റ്റി ആൻഡ് സെക്യൂരിറ്റി കമ്മിറ്റിയെ ഞങ്ങൾ പതിവായി അറിയിക്കുന്നുണ്ട്.
- ഈ സംഭവത്തെക്കുറിച്ച് ഫോറൻസിക് അന്വേഷണം നടത്തുന്നതിനായി ഞങ്ങൾ Hugging Face-മായി ചേർന്ന് പ്രവർത്തിക്കുകയാണ്.
- ആന്തരികമായി ഹോസ്റ്റ് ചെയ്തിട്ടുള്ള തേർഡ്-പാർട്ടി സോഫ്റ്റ്വെയറിൽ കണ്ടെത്തിയ സീറോ-ഡേ സുരക്ഷാ പിഴവ് ഞങ്ങൾ ഉത്തരവാദിത്തത്തോടെ വെളിപ്പെടുത്തുകയും, അത് പരിഹരിക്കുന്നതിനായി അവരുമായി ചേർന്ന് പ്രവർത്തിക്കുകയും ചെയ്യുന്നു.
- ഞങ്ങൾ Hugging Face-നെ വിശ്വസനീയ ആക്സസ് പ്രോഗ്രാമിൽ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്, കൂടാതെ അവരുടെ പ്രതിരോധ സംവിധാനങ്ങൾ മെച്ചപ്പെടുത്തുന്നതിനായി ഞങ്ങളുടെ മോഡലുകളുടെ ശേഷി അതിവേഗം പ്രയോജനപ്പെടുത്താൻ അവരുടെ ടീമുകൾക്ക് ഞങ്ങൾ പിന്തുണ നൽകുകയും ചെയ്യുന്നു.
- ഭാവിയിലെ പരിശീലനങ്ങൾക്കും വിലയിരുത്തലുകൾക്കുമായി ഞങ്ങൾ കൂടുതൽ ശക്തമായ സംരക്ഷണങ്ങൾ ഉൾപ്പെടുത്തുകയും നിലവിലുള്ളവ മെച്ചപ്പെടുത്തുകയും ചെയ്യുന്നു. ഈ ആഴ്ച, ദീർഘ സമയപരിധിയുള്ള മോഡലുകളുടെ കാലത്ത് സുരക്ഷയും അലൈൻമെന്റും മെച്ചപ്പെടുത്തൽ മെച്ചപ്പെടുത്തുന്നതിനെക്കുറിച്ച് ഈ ആഴ്ച ഞങ്ങൾ ഒരു ബ്ലോഗ് പ്രസിദ്ധീകരിച്ചിരുന്നു. സൈബർ സുരക്ഷാ പിഴവുകൾ പരിശോധിക്കുക എന്ന ലക്ഷ്യത്തോടെയാണ് ഈ വിലയിരുത്തൽ നടത്തിയത് എന്നതിനാൽ, ഇതിലെ ഡിപ്ലോയ്മെന്റ് സുരക്ഷാ സംവിധാനങ്ങൾ ആ സമയത്ത് മനഃപൂർവ്വം പ്രവർത്തനക്ഷമമാക്കിയിരുന്നില്ല. ഞങ്ങളുടെ മോഡലിന്റെ അലൈൻമെന്റ്, വിലയിരുത്തൽ സമയത്തെ സൈബർ സംരക്ഷണങ്ങൾ, ആന്തരിക പരിശോധനാ സമയത്തെ നിരീക്ഷണം എന്നിവ കൂടുതൽ ശക്തമാക്കേണ്ടതിന്റെ ആവശ്യകതയിലേക്കാണ് ഈ സംഭവം വിരൽ ചൂണ്ടുന്നത്.
ഞങ്ങൾ അടുത്തിടെ പങ്കുവെച്ചതുപോലെ, സുരക്ഷാ പിഴവുകൾ കണ്ടെത്തുന്നതും അവ ചൂഷണം ചെയ്യുന്നതും എഐ കൂടുതൽ ത്വരിതപ്പെടുത്തുകയാണ്. അതിവേഗം വികസിച്ചുകൊണ്ടിരിക്കുന്ന ശേഷികൾക്കൊപ്പം മോഡലിന്റെ സുരക്ഷയും സുരക്ഷിതത്വവും നിലനിർത്തേണ്ടതുണ്ട് എന്നതാണ് ഈ സംഭവത്തിൽ നിന്നുള്ള പ്രധാന പാഠം. മോഡൽ വികസിപ്പിക്കുന്ന സമയത്ത് ഉപയോഗിക്കുന്ന നിയന്ത്രണ സംവിധാനങ്ങൾ, നിരീക്ഷണം, ആക്സസ് കൺട്രോളുകൾ, വിലയിരുത്തൽ രീതികൾ എന്നിവ ഞങ്ങൾ കൂടുതൽ ശക്തിപ്പെടുത്തുകയാണ്.
ദീർഘകാലയളവിൽ സങ്കീർണ്ണവും വിവിധ ഘട്ടങ്ങളുള്ളതുമായ സൈബർ പ്രവർത്തനങ്ങൾ നിലനിർത്താൻGPT‑5.6 Sol പോലെയുള്ള മോഡലുകൾ കൂടുതലായി പ്രാപ്തി നേടുന്നുണ്ടെന്ന് UK AISI-യുടെ വിലയിരുത്തൽ വ്യക്തമാക്കുന്നു. ഈ സൈദ്ധാന്തിക ശേഷികൾ യഥാർത്ഥ ലോക സാഹചര്യങ്ങളിലും ബാധകമാണ് എന്നാണ് ഈ സംഭവം സൂചിപ്പിക്കുന്നത്.

സോഴ്സ്-കോഡ് ആക്സസ് ഇല്ലാതെ തന്നെ യഥാർത്ഥ ലോക സംവിധാനങ്ങളിലെ പുതിയ ആക്രമണ മാർഗ്ഗങ്ങൾ കണ്ടെത്താനും ചൂഷണം ചെയ്യാനും നൂതന മോഡലുകൾക്ക് കഴിയുമെന്ന് ഈ സംഭവം വ്യക്തമാക്കുന്നു. കൂടുതൽ ശക്തമായ സുരക്ഷാ സംവിധാനങ്ങൾക്കും പ്രതിരോധ ഉപകരണങ്ങൾക്കും ഒപ്പമായിരിക്കണം നൂതന സൈബർ ശേഷികൾ വികസിപ്പിക്കേണ്ടത് എന്ന വസ്തുതയും ഇത് എടുത്തുകാണിക്കുന്നു.
ആക്രമണകാരികൾ കണ്ടെത്തുന്നതിന് മുമ്പ് തന്നെ സുരക്ഷാ വീഴ്ചകൾ കണ്ടെത്താനും, വിവിധ പിഴവുകൾ എങ്ങനെ പരസ്പരം ബന്ധിപ്പിക്കാമെന്ന് മനസ്സിലാക്കാനും, യന്ത്രങ്ങളുടെ വേഗതയിൽ തന്നെ അവ പരിഹരിക്കാനും സുരക്ഷാ ടീമുകളെ സഹായിക്കാൻ നൂതന സൈബർ ശേഷിയുള്ള മോഡലുകൾക്ക് കഴിയണമെന്ന് ഞങ്ങൾ വിശ്വസിക്കുന്നു. ഇൻഫ്രാസ്ട്രക്ചർ കോൺഫിഗറേഷൻ, മോഡൽ വിലയിരുത്തൽ ചുറ്റുപാടുകൾ എന്നിവയുടെ സുരക്ഷാ സംവിധാനങ്ങൾ തുടർന്നും ശക്തിപ്പെടുത്തുന്നതിനായി ഞങ്ങൾ ഈ ശേഷികൾ ഉപയോഗപ്പെടുത്തുകയാണ്; കൂടാതെ ഇതിലൂടെ ഞങ്ങൾ പഠിക്കുന്ന കണ്ടെത്തലുകളും മികച്ച രീതികളും ഞങ്ങൾ പങ്കുവെക്കുന്നതുമായിരിക്കും. ഈ ശേഷികളെ കൂടുതൽ മികച്ച പ്രതിരോധം, അതിവേഗത്തിലുള്ള കണ്ടെത്തൽ, കൂടുതൽ ഫലപ്രദമായ ഇൻസിഡന്റ് റെസ്പോൺസ് എന്നിവയാക്കി മാറ്റുന്നതിന് വിശ്വസനീയ ആക്സസിന് അപേക്ഷിക്കാനും ഈ മോഡലുകളിൽ പരീക്ഷണങ്ങൾ നടത്താനും മറ്റ് പ്രതിരോധക്കാരെയും ഞങ്ങൾ പ്രോത്സാഹിപ്പിക്കുന്നു.
"ഇതിലും മറ്റ് വിഷയങ്ങളിലുമുള്ള OpenAI-യുമായുള്ള സഹകരണത്തിന് ഞങ്ങൾ നന്ദി രേഖപ്പെടുത്തുന്നു. ഒരുപക്ഷേ ഇത്തരത്തിലുള്ള ആദ്യത്തേതായിരിക്കാവുന്ന ഈ സംഭവം, ഞങ്ങൾ കാലങ്ങളായി വിശ്വസിക്കുന്ന ഒരു കാര്യം തെളിയിക്കുന്നു: രഹസ്യമായി പ്രവർത്തിക്കുന്ന ഏതെങ്കിലും ഒരു കമ്പനിക്ക് ഒറ്റയ്ക്ക് എഐ (AI) സുരക്ഷ ഉറപ്പാക്കാൻ കഴിയില്ല. എല്ലായിടത്തുമുള്ള എല്ലാ പ്രതിരോധക്കാർക്കും എഐ-യിലേക്ക് വിശാലമായ ആക്സസ് നൽകിക്കൊണ്ട്, സുതാര്യമായും പരസ്പര സഹകരണത്തിലൂടെയും മാത്രമേ ഇത് സാധ്യമാകൂ."


