പ്രധാന ഉള്ളടക്കത്തിലേക്ക് നീങ്ങുക
OpenAI

2026 സെപ്റ്റംബർ 30

സുരക്ഷ

ഏകോപിത മോഡൽ ഡിസ്റ്റിലേഷൻ നീക്കം തടഞ്ഞു

ലോഡിംഗ്…

ഞങ്ങളുടെ മോഡലുകളിൽനിന്ന് സംരക്ഷിത റീസണിംഗ് ചോർത്താനുള്ള ഏകോപിത നീക്കം അടുത്തിടെ ഞങ്ങൾ കണ്ടെത്തി തടഞ്ഞു. ജൂലൈ ആദ്യവാരത്തിലാണ് ഇതിന്റെ ആദ്യ പ്രവർത്തനങ്ങൾ ശ്രദ്ധയിൽപ്പെട്ടത്. ഈ പ്രവർത്തനം ദുരുദ്ദേശ്യപരമായ ഡിസ്റ്റിലേഷനുമായി പൊരുത്തപ്പെടുന്നു: മറ്റൊരു മോഡലിനെ പരിശീലിപ്പിക്കാനോ പുനഃസൃഷ്ടിക്കാനോ മെച്ചപ്പെടുത്താനോ ഒരു മോഡലിന്റെ ഔട്ട്പുട്ടുകളോ റീസണിംഗോ വ്യവസ്ഥാപിതമായും അനുമതിയില്ലാതെയും ഉപയോഗിക്കുന്ന രീതിയാണിത്. ഒരു ദൗത്യം നിർവഹിക്കുമ്പോഴുള്ള മോഡലിന്റെ ആന്തരിക രേഖയാണ് സംരക്ഷിത റീസണിംഗ്. ഇത് ചോർത്തുന്നത് അന്തിമ ഉത്തരത്തിൽ ഉൾപ്പെടുത്താത്ത വിവരങ്ങൾ വെളിപ്പെടുത്തുകയും മോഡലിന്റെ കഴിവുകൾ പുനഃസൃഷ്ടിക്കാൻ മറ്റുള്ളവരെ സഹായിക്കുകയും ചെയ്യാം.

ഇതിന് പിന്നിലുള്ളവർ ഞങ്ങളുടെ എൻക്രിപ്ഷൻ ഭേദിക്കുകയോ ഡാറ്റാബേസിൽ നുഴഞ്ഞുകയറുകയോ സംഭരിച്ച ഉപയോക്തൃ സംഭാഷണങ്ങളിലേക്ക് നേരിട്ട് പ്രവേശിക്കുകയോ ചെയ്തിട്ടില്ല. പകരം, സംരക്ഷിത റീസണിംഗ് ആവശ്യപ്പെടുന്നയാൾക്ക് കാണാവുന്ന രൂപത്തിൽ പുനഃസൃഷ്ടിക്കാൻ അവർ മോഡലുമായുള്ള ഇടപെടലുകളിൽ കൃത്രിമം കാട്ടി. ഏകോപിതമായും വലിയ തോതിലുമുള്ള ഈ പ്രവർത്തനം ഞങ്ങളുടെ സേവന നിബന്ധനകൾ ലംഘിച്ചു. ഈ കൃത്രിമം OpenAI മോഡലുകൾക്ക് മാത്രമുള്ള സുരക്ഷാ ദൗർബല്യമല്ല. ദുരുദ്ദേശ്യപരമായ ഡിസ്റ്റിലേഷനെതിരായ കൂട്ടായ പ്രതിരോധം ശക്തമാക്കാൻ ഫ്രോണ്ടിയർ മോഡൽ ഫോറം വഴി വ്യവസായ പങ്കാളികളുമായി ഇതിനെക്കുറിച്ചുള്ള വിവരങ്ങൾ ഞങ്ങൾ പങ്കിട്ടു.

പ്രസിദ്ധീകരിക്കുന്നതിനുമുമ്പ്, ഇതിന്റെ വ്യാപ്തിയും സാധ്യതയുള്ള ആഘാതവും അന്വേഷിച്ച് ഞങ്ങളുടേതായ പ്രതിരോധ നടപടികൾ നടപ്പാക്കി. ഇത്തരം ആക്രമണങ്ങൾക്കെതിരെ സംരക്ഷണം ഉറപ്പാക്കാൻ ഗവേഷകരുമായും വ്യവസായ പങ്കാളികളുമായും വിവരങ്ങൾ പങ്കിടുകയും അവരുടെ അഭിപ്രായങ്ങൾ സ്വീകരിക്കുകയും ചെയ്തു. കൂടുതൽ പ്രതിരോധ നടപടികളും അന്വേഷണവും തുടരുകയാണ്. ഇപ്പോൾ ഞങ്ങൾ മനസ്സിലാക്കിയ കാര്യങ്ങൾ പങ്കിടുന്നത് ഈ മേഖലയിലുടനീളം പ്രതിരോധം ശക്തമാക്കാൻ സഹായിക്കുമെന്ന് ഞങ്ങൾ വിശ്വസിക്കുന്നു.

ഞങ്ങൾ നിരീക്ഷിച്ചത്

പുതിയ രീതികളിലൂടെ സംരക്ഷിത റീസണിംഗ് ചോർത്താനുള്ള ശ്രമങ്ങൾ ഞങ്ങൾ കണ്ടു. ഒരു സംഭാഷണത്തിലെ എൻക്രിപ്റ്റ് ചെയ്ത റീസണിംഗ് പകർത്തി, മറ്റൊരു സംഭാഷണത്തിലെ മോഡലിനോട് അതിന്റെ എൻക്രിപ്ഷൻ നീക്കി മറഞ്ഞിരിക്കുന്ന റീസണിംഗ് ഉള്ളടക്കം എഴുതി നൽകാൻ ആവശ്യപ്പെടുന്നതും ഇതിലുൾപ്പെടുന്നു.

സ്വതന്ത്ര സുരക്ഷാ ഗവേഷകരും⁠(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഉത്തരവാദിത്തപൂർവമായ വെളിപ്പെടുത്തലിലൂടെ ഇതുമായി ബന്ധപ്പെട്ട, മോഡലുകൾക്കിടയിലും സംഭാഷണ കമ്പാക്ഷനിലുമുള്ള സുരക്ഷാ ദൗർബല്യങ്ങൾ ഞങ്ങളുടെ ശ്രദ്ധയിൽപ്പെടുത്തി. അവരുടെ കണ്ടെത്തലുകൾ അന്വേഷിച്ച ഞങ്ങൾ, അവർ ചൂണ്ടിക്കാട്ടിയ വഴികളിലൂടെ ആക്രമണം നടത്താൻ കഴിയുമെന്ന് സ്ഥിരീകരിച്ചു. ഈ വിഭാഗത്തിലെ ആക്രമണങ്ങളെ കൂടുതൽ വിശാലമായി മനസ്സിലാക്കാനും പ്രതിരോധ നടപടികൾ വേഗത്തിലാക്കാനും അവരുടെ പ്രവർത്തനം ഞങ്ങളെ സഹായിച്ചു.

ജൂലൈ 1-ന് ആരംഭിച്ച ഈ പ്രവർത്തനം തുടക്കത്തിൽ ചെറിയ തോതിലായിരുന്നു. ജൂലൈ 24, 25 തീയതികളിൽ ഇത് കുത്തനെ വർധിച്ചതായി ഞങ്ങൾ കണ്ടു: 4,000-ലധികം ഉപയോക്താക്കളിൽനിന്ന്, ബന്ധപ്പെട്ട ചോർത്തൽ രീതി ഉപയോഗിച്ചുള്ള 16,000 അഭ്യർഥനകൾ1 വന്നു. തുടർന്നുള്ള അന്വേഷണത്തിൽ 15,000-ലധികം ഉപയോക്താക്കളുടെ ഒരു കൂട്ടത്തിൽ സമാന പ്രോംപ്റ്റ് രീതിയിലുള്ള പ്രവർത്തനം കണ്ടെത്തി. ജൂലൈ 28-ഓടെ ഇത് പൂർണമായും തടഞ്ഞു.

കാലക്രമേണ ഈ പ്രവർത്തനത്തിന്റെ രീതി മാറി. ദുരുദ്ദേശ്യപരമായ ഡിസ്റ്റിലേഷൻ, പല തലങ്ങളിലുള്ളതും സാഹചര്യത്തിനനുസരിച്ച് മാറുന്നതുമായ പ്രതിരോധം ആവശ്യപ്പെടുന്ന വിശാലമായ സുരക്ഷാ വെല്ലുവിളിയാണെന്ന് ഇത് അടിവരയിടുന്നു.

പിന്നിൽ പ്രവർത്തിച്ചവരെക്കുറിച്ചുള്ള ഞങ്ങളുടെ വിലയിരുത്തൽ

പ്രസ്തുത കാലയളവിൽ ഞങ്ങൾ നിരീക്ഷിച്ച പ്രവർത്തകരെല്ലാം ഒരേ കക്ഷിയുടെ ഭാഗമായിരുന്നോ എന്ന് വ്യക്തമല്ല. എന്നാൽ, ഈ പ്രവർത്തനത്തിന്റെ ഒരു മുഖ്യ കൂട്ടത്തിന് പിന്നിൽ കിമിയുടെ നിർമാതാക്കളായ മൂൺഷോട്ട് എഐയുമായി ബന്ധപ്പെട്ട വ്യക്തികളാണെന്നാണ് ഞങ്ങളുടെ വിലയിരുത്തൽ.

ഇത് പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

ദുരുദ്ദേശ്യപരമായ ഡിസ്റ്റിലേഷൻ സുരക്ഷയ്ക്കും ദേശീയ സുരക്ഷയ്ക്കും അപകടസാധ്യതകൾ സൃഷ്ടിക്കുന്നു. യഥാർഥ മോഡൽ ഉപയോക്താക്കൾക്ക് നൽകുന്ന ഔട്ട്പുട്ടുകളിൽ ഏർപ്പെടുത്തിയ സുരക്ഷാ സംവിധാനങ്ങൾ നിലനിർത്താതെ മറ്റൊരു മോഡലിനെ പരിശീലിപ്പിക്കാൻ ചോർത്തിയ റീസണിംഗ് ഉപയോഗിക്കാം. വലിയ തോതിൽ നടത്തുമ്പോൾ, സുരക്ഷയിൽ അതേ നിക്ഷേപം ആവശ്യമില്ലാതെതന്നെ നൂതന കഴിവുകളുടെ കൈമാറ്റം വേഗത്തിലാക്കാനും ഡിസ്റ്റിലേഷന് കഴിയും. നല്ലതിനും ദോഷത്തിനും ഉപയോഗിക്കാവുന്ന മേഖലകളിൽ മോഡലുകൾ കഴിവുകൾ നേടുന്നതോടെ ഈ ആശങ്കകൾ വർധിക്കുന്നു.

ഈ അപകടസാധ്യത OpenAI-ക്ക് മാത്രമുള്ളതല്ല. മുകളിൽ സൂചിപ്പിച്ചതുപോലെ, സമാന രീതികൾ മറ്റ് നൂതന എഐ സംവിധാനങ്ങളെയും ബാധിക്കാം. അതിനാൽ വ്യവസായ മേഖലയിലുടനീളം ഏകോപനം ആവശ്യമായ ഒരു പൊതു സുരക്ഷാ വെല്ലുവിളിയാണിത്.

ഞങ്ങൾ സ്വീകരിച്ച നടപടികൾ

അക്കൗണ്ടുകൾക്കെതിരായ നടപടികൾ, സാങ്കേതിക നിയന്ത്രണങ്ങൾ, പങ്കാളികളുമായുള്ള ഏകോപനം എന്നിവയിലൂടെ അടുത്തിടെയുണ്ടായ ഈ ഡിസ്റ്റിലേഷൻ നീക്കത്തെ ഞങ്ങൾ പ്രതിരോധിച്ചു. വഞ്ചനാപരമായ അക്കൗണ്ടുകൾ നിരോധിക്കുകയോ നിയന്ത്രിക്കുകയോ ചെയ്തു. അക്കൗണ്ട് രജിസ്ട്രേഷനിലും അടിസ്ഥാനസൗകര്യങ്ങളിലുമുള്ള നിയന്ത്രണങ്ങൾ ശക്തമാക്കി, ബന്ധപ്പെട്ട ശൃംഖലകളുടെ നിരീക്ഷണം വിപുലപ്പെടുത്തി.

ഉപയോക്താക്കൾ, പ്രവർത്തനയിടങ്ങൾ, സ്ഥാപനങ്ങൾ, മോഡൽ കുടുംബങ്ങൾ എന്നിവയിലുടനീളം മറഞ്ഞിരിക്കുന്ന റീസണിംഗിനുള്ള സംരക്ഷണവും ശക്തമാക്കി. മറ്റൊരു ഉപയോക്താവിന്റെ എൻക്രിപ്റ്റ് ചെയ്ത റീസണിംഗ് കൈവശമുള്ളവർക്ക് അത് വീണ്ടും സമർപ്പിച്ച് ഉള്ളടക്കം വീണ്ടെടുക്കാൻ അവസരം നൽകിയ വഴി ഞങ്ങൾ അടച്ചു. റീസണിംഗ് വെളിപ്പെടുത്തിയേക്കാവുന്ന, തുടർച്ചയായി പുറത്തുവരുന്ന ഔട്ട്പുട്ട് കണ്ടെത്തി തടഞ്ഞുവയ്ക്കാനുള്ള പരിശോധനകളും ചേർത്തു. ബന്ധപ്പെട്ട പ്രവർത്തനങ്ങൾ മൂന്നാംകക്ഷി സേവനങ്ങളിലൂടെ നടന്നപ്പോൾ, ഉൾപ്പെട്ട അക്കൗണ്ടുകൾ കണ്ടെത്തി തടയാൻ ആ സേവനദാതാക്കളുമായി സഹകരിച്ചു.

അവസാനമായി, ഫ്രോണ്ടിയർ മോഡൽ ഫോറത്തിലൂടെയും അനുയോജ്യമായ സർക്കാർ വിവരപങ്കിടൽ സംവിധാനങ്ങളിലൂടെയും പ്രസക്തമായ കണ്ടെത്തലുകൾ പങ്കിട്ടു. മറ്റ് അത്യാധുനിക മോഡൽ വികസിപ്പിക്കുന്നവർക്കും പൊതുമേഖലാ പങ്കാളികൾക്കും സമാന പ്രവർത്തനങ്ങൾ കണ്ടെത്താനും സ്വന്തം പ്രതിരോധം ശക്തമാക്കാനും സഹായിക്കാനാണിത്. മറ്റിടങ്ങളിലേക്ക് മാറ്റാനോ വീണ്ടും സമർപ്പിക്കാനോ കഴിയുന്ന റീസണിംഗ് രേഖകളെ പിന്തുണയ്ക്കുന്ന സംവിധാനങ്ങൾക്കും സമാന അപകടസാധ്യതകൾ ഉണ്ടായേക്കാം.

ഇനി എന്ത്

അത്യാധുനിക മോഡലുകൾ മെച്ചപ്പെടുകയും അവയുടെ കഴിവുകൾ കുറഞ്ഞ ചെലവിൽ അനുകരിക്കാനുള്ള വഴികൾ ആളുകൾ തേടുകയും ചെയ്യുന്നതോടെ, ദുരുദ്ദേശ്യപരമായ ഡിസ്റ്റിലേഷൻ ശ്രമങ്ങൾ കൂടുതൽ സങ്കീർണമാകുമെന്ന് ഞങ്ങൾ പ്രതീക്ഷിക്കുന്നു. ഈ പ്രവർത്തനത്തെ പ്രതിരോധിക്കാൻ പല തലങ്ങളിലുള്ള നിയന്ത്രണങ്ങളും തുടർച്ചയായ പൊരുത്തപ്പെടുത്തലുകളും ആവശ്യമാണ്.

ഈ ജോലി പൂർത്തിയായിട്ടില്ല. നേരിട്ട് നൽകുന്ന സേവനങ്ങൾക്കുള്ള അതേ സംരക്ഷണം പങ്കാളികൾ ഹോസ്റ്റ് ചെയ്യുന്ന വിന്യാസങ്ങൾക്കും ആവശ്യമാണ്. ടൂൾ ഔട്ട്പുട്ട് വഴിയുള്ള ആക്രമണങ്ങളെ തടയാൻ, സാധാരണ കാണാവുന്ന വാചകങ്ങൾക്കപ്പുറമുള്ള കാര്യങ്ങളും പരിശോധിക്കുന്ന സംരക്ഷണ സംവിധാനങ്ങൾ വേണം. ടൂളുകളുടെ പ്രതിരോധം, വർഗീകരണ സംവിധാനങ്ങളുടെ പരിശോധനാ വ്യാപ്തി, മോഡലുകളുടെ നിരസിക്കൽ ശേഷി എന്നിവ ഞങ്ങൾ തുടർന്നും മെച്ചപ്പെടുത്തുകയാണ്. പ്രസക്തമായ നിയന്ത്രണങ്ങൾ ക്ലൗഡ് പങ്കാളികളിലുടനീളം നടപ്പാക്കുകയും ചെയ്യുന്നു.

ഞങ്ങളുടെ നടപടികൾ തുടർന്നും മൂന്ന് മേഖലകളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കും: ചോർത്തലിനെതിരെ കൂടുതൽ ശക്തമായ സാങ്കേതിക സംരക്ഷണം, ഏകോപിത നീക്കങ്ങൾ കൂടുതൽ ഫലപ്രദമായി കണ്ടെത്തലും അവയ്ക്കെതിരായ നടപടികളും, വ്യവസായ-സർക്കാർ മേഖലകളിലുടനീളം ഭീഷണിവിവരങ്ങൾ കൂടുതൽ ആഴത്തിൽ പങ്കിടൽ.

രചയിതാവ്

OpenAI

അടിക്കുറിപ്പുകൾ

  1. 1

    ഈ കണക്കുകൾ വിവരിക്കുന്നത് വിവരങ്ങൾ ചോർത്താനുള്ള ശ്രമങ്ങളെയാണ്; അവ വിജയിച്ചിരിക്കണമെന്നില്ല.