ലോഡിംഗ്…
ഞങ്ങൾ വ്യാപകമായി വിന്യസിച്ചിട്ടുള്ളതിൽ ഏറ്റവും ശേഷിയുള്ള മോഡലായ GPT‑6 Astra ഇന്ന് പുറത്തിറക്കുന്നു. ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്കിന് കീഴിൽ സൈബർസുരക്ഷാശേഷിയുടെ നിർണായക നിലയിലെത്തുന്ന ആദ്യ മോഡലാണ് Astra.
ഈ പുറത്തിറക്കലിന്റെ സുരക്ഷയെക്കുറിച്ച് അറിഞ്ഞിരിക്കേണ്ട ഏറ്റവും പ്രധാനപ്പെട്ട കാര്യങ്ങൾ ഇവയാണ്:
- സൈബർ ശേഷികളിൽ GPT‑6 Astra വലിയൊരു മുന്നേറ്റമാണ്, അത് ഞങ്ങളുടെ നിർണായക പരിധി കൈവരിക്കുന്നു. ശരിയായ ഉപകരണങ്ങളും പ്രവേശനവും ലഭിച്ചാൽ, ഓരോ ഘട്ടത്തിലും ഒരാളുടെ മാർഗനിർദേശം കൂടാതെ തന്നെ, ശക്തമായി പരിരക്ഷിച്ചിരിക്കുന്ന നിരവധി സിസ്റ്റങ്ങളിലെ ഇതുവരെ അറിയപ്പെടാത്ത സുരക്ഷാപിഴവുകൾ കണ്ടെത്താനും അവ മുതലെടുക്കാനുള്ള പുതിയ മാർഗങ്ങൾ വികസിപ്പിക്കാനും GPT‑6 Astra-യ്ക്ക് കഴിയുമെന്നാണ് ഇതിനർഥം. അതിനാൽ, ദുരുപയോഗമോ പൊരുത്തക്കേടോ കാരണമായി മോഡൽ ഹാനികരമായ സൈബർ നടപടികൾ സ്വീകരിക്കുന്നത് തടയാനുള്ള സംരക്ഷണങ്ങൾ ഞങ്ങൾ ഗണ്യമായി ശക്തിപ്പെടുത്തി. കൂടുതൽ കർശനമായ വേർതിരിക്കൽ, ചെക്ക്പോയിന്റ് എൻക്രിപ്ഷൻ, ചിന്താശൃംഖലകൾ (CoT) ഉൾപ്പെടെയുള്ള പൂർണ പ്രവർത്തനക്രമങ്ങളുടെ സമഗ്ര നിരീക്ഷണം, ആഭ്യന്തര ഉപയോഗത്തിനു മുമ്പുള്ള നിർബന്ധിത പൊരുത്ത വിലയിരുത്തൽ എന്നിവയിലൂടെ Astra-യുടെയും സമാന മോഡലുകളുടെയും ആഭ്യന്തര വികസനവും വിന്യാസവും സുരക്ഷിതമാക്കാനുള്ള നടപടികളും സ്വീകരിച്ചു.
- GPT‑6 Astra അതിന്റെ മുൻഗാമികളേക്കാൾ ഗണ്യമായി കൂടുതൽ പ്രതിരോധശേഷിയുള്ളതാണ്. പുതിയ സുരക്ഷാ പ്രതിരോധ പരിശീലനരീതികൾ ഉൾപ്പെടുത്തിയതിനാൽ, ദൈർഘ്യമേറിയ പ്രവർത്തനക്രമങ്ങളിൽ ഉൾപ്പെടെ, GPT‑5.6 Sol-നെ അപേക്ഷിച്ച് ജെയിൽബ്രേക്കുകൾക്കെതിരെ GPT‑6 Astra ഗണ്യമായി കൂടുതൽ പ്രതിരോധശേഷിയുള്ളതാണ്. ഓഫ്ലൈൻ പരിശോധനകളിലൂടെയും കർശനമായ ആഭ്യന്തര-ബാഹ്യ ജെയിൽബ്രേക്ക് പരിശോധനയും പരിഹാരനടപടികളും ഉൾപ്പെടുന്ന ഞങ്ങളുടെ പരിപാടിയിലൂടെയുമാണ് ഞങ്ങൾ ഇത് മനസ്സിലാക്കിയത്. ഉയർന്ന അപകടസാധ്യതയുള്ളവരെന്ന് അടയാളപ്പെടുത്തിയ ഉപയോക്താക്കൾക്കായി, മോഡലിന്റെ നിരസിക്കൽ പരിധി കൂടുതൽ ജാഗ്രതയുള്ളതാക്കാനും ഇരട്ട ഉപയോഗവുമായി ബന്ധപ്പെട്ട കൂടുതൽ വിപുലമായ അപകടസാധ്യതകൾ ഉൾക്കൊള്ളിക്കാനും കഴിയുന്ന വിധത്തിലും ഞങ്ങൾ പരിശീലനം നൽകിയിട്ടുണ്ട്. മുൻ പരിശോധനാഘട്ടങ്ങളിൽ കണ്ടെത്തിയ ജെയിൽബ്രേക്കുകൾക്കെതിരെ Astra പ്രതിരോധശേഷി നിലനിർത്തുന്നുവെന്ന് ഉറപ്പാക്കാൻ ഞങ്ങൾ റിഗ്രഷൻ പരിശോധന ഉപയോഗിക്കുന്നു. മെച്ചപ്പെടുത്തലുകൾ സാധൂകരിക്കാൻ ഞങ്ങളുടെ ഏറ്റവും പുതിയ ആഭ്യന്തര റെഡ് ടീമിംഗ് ആക്രമണ സംവിധാനങ്ങൾ ഉപയോഗിച്ച് പുതിയ ഘട്ടങ്ങളിലുള്ള യാന്ത്രിക റെഡ് ടീമിംഗും നടത്തി.
- GPT‑5.6 Sol-നെക്കാൾ മികച്ച രീതിയിൽ പൊരുത്തപ്പെടുത്തിയതാണ് GPT‑6 Astra. മോഡൽ പൊരുത്തപ്പെടുത്തലിൽ Astra വലിയൊരു മുന്നേറ്റമാണ്. പ്രീ-ട്രെയിനിംഗ് ഡാറ്റയുടെ ഘടന മുതൽ റീഇൻഫോഴ്സ്മെന്റ് ലേണിംഗിലെ മൂല്യനിർണയം വരെയുള്ള മെച്ചപ്പെടുത്തലുകൾ ഇതിൽ ഉൾപ്പെടുന്നു. ഞങ്ങൾ പൊരുത്ത വിലയിരുത്തലുകളുടെ പുതിയൊരു സമുച്ചയം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)അവതരിപ്പിക്കുന്നു. സുരക്ഷാ പരിധികൾ പാലിക്കുന്നതിലും അനുവദിച്ച പ്രവർത്തനപരിധിക്കുള്ളിൽ തുടരുന്നതിലും GPT‑6 Astra കൂടുതൽ മികവുള്ളതാണെന്ന് കണ്ടെത്തി. 54,000-ത്തിലധികം ആഭ്യന്തര Codex ചുമതലകൾ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)ഉപയോഗിച്ചുള്ള അനുകരണത്തിൽ, കൂടുതൽ ഗുരുതരമായ പൊരുത്തക്കേടുള്ള പെരുമാറ്റത്തിന് Sol-ന് ലഭിച്ചതിന്റെ പകുതിയോളം അടയാളപ്പെടുത്തലുകൾ മാത്രമാണ് Astra-യ്ക്ക് ലഭിച്ചത്.
- പൊരുത്തക്കേട് നിരീക്ഷണം ഞങ്ങൾ വ്യാപകമായി വിന്യസിക്കുന്നു. ഞങ്ങളുടെ മോഡലുകളിൽ നിന്നുണ്ടാകാവുന്ന പൊരുത്തക്കേടുള്ള പെരുമാറ്റം തടയാനുള്ള പ്രധാന മാർഗമായാണ് മോഡൽ പൊരുത്തപ്പെടുത്തലിനെ ഞങ്ങൾ കാണുന്നത്. എന്നിരുന്നാലും, അത്യാധുനിക മോഡലുകളുടെ പെരുമാറ്റത്തെക്കുറിച്ച് നിരീക്ഷണം വിപുലമായ ദൃശ്യത നൽകുകയും പൊരുത്തവും സുരക്ഷയും കൂടുതൽ മെച്ചപ്പെടുത്താനുള്ള അവസരങ്ങൾ വെളിപ്പെടുത്തുകയും ചെയ്യുന്നു. കൂടാതെ, കണ്ടെത്തുന്ന പൊരുത്തക്കേടുള്ള പെരുമാറ്റത്തിനെതിരായ ഒരു അധിക സംരക്ഷണപാളിയായും നിരീക്ഷണം പ്രവർത്തിക്കുന്നു. ഇക്കാരണങ്ങളാൽ, ഗണ്യമായ കംപ്യൂട്ടിങ് ചെലവ് വേണ്ടിവന്നിട്ടും, Astra-യുടെ ബാഹ്യ വിന്യാസത്തിൽ ഉപകരണങ്ങൾ ഉപയോഗിക്കുന്ന എല്ലാ അനുമാനപ്രക്രിയകളിലും പൊരുത്തക്കേട് നിരീക്ഷണം ഞങ്ങൾ ചേർത്തിട്ടുണ്ട്. ഈ സിസ്റ്റം ഞങ്ങളുടെ ആഭ്യന്തര ക്രമീകരണത്തിന് സമാനമാണ്.
- GPT‑5.6 Sol-നെ അപേക്ഷിച്ച് GPT‑6 Astra-യെ നിരീക്ഷിക്കാനുള്ള സാധ്യത കുറഞ്ഞിട്ടുണ്ട്. GPT‑6 Astra-യുടെ നിരീക്ഷണക്ഷമതയെയും(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) നിയന്ത്രണക്ഷമതയെയും(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കുറിച്ച് ഞങ്ങൾ വിപുലമായ അന്വേഷണങ്ങൾ നടത്തിയിട്ടുണ്ട്. സ്വന്തം CoT നിയന്ത്രിക്കാൻ GPT‑5.6 Sol-നെക്കാൾ GPT‑6 Astra-യ്ക്ക് കൂടുതൽ ശേഷിയുണ്ടെന്നും, കുറ്റകരമെന്ന് സൂചിപ്പിക്കുന്ന വിവരങ്ങൾ അതിന്റെ CoT-യിൽ ഉൾപ്പെടുത്താനുള്ള സാധ്യത കുറവാണെന്നും കണ്ടെത്തി. പ്രതികൂല സാഹചര്യങ്ങളിൽ (ഞങ്ങളുടെ നിരീക്ഷണ സംവിധാനങ്ങളെ മറികടക്കാൻ മോഡലിനെ പ്രേരിപ്പിക്കുമ്പോൾ), വിലയിരുത്തലുകളിൽ തന്ത്രപരമായി ബോധപൂർവം മോശം പ്രകടനം നടത്തുമ്പോഴും പിടിക്കപ്പെടാതെ തുടരാൻ മോഡലിന് സാധിക്കുന്നുണ്ടെന്നും, ചില അട്ടിമറി പ്രവർത്തനങ്ങൾ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) നടത്താൻ ആവശ്യപ്പെടുമ്പോൾ ഞങ്ങളുടെ ആന്തരിക മോണിറ്ററുകളെ ചിലപ്പോഴൊക്കെ വെട്ടിക്കാൻ കഴിയുന്നുണ്ടെന്നും ഞങ്ങൾ നിരീക്ഷിച്ചു. എന്നാൽ സാധാരണവും പരസ്പരബന്ധമില്ലാത്തതുമായ വാചകങ്ങൾക്കുള്ളിൽ ഒളിഞ്ഞിരിക്കുന്ന റീസണിംഗ് മറച്ചുവെക്കുന്ന സ്റ്റെഗനോഗ്രാഫിക് CoT റീസണിംഗിന്റെ തെളിവുകളൊന്നും ഞങ്ങൾ കണ്ടിട്ടില്ല; ഇത് സൂചിപ്പിക്കുന്നത് നിരീക്ഷണത്തെ മറികടക്കാനുള്ള ഇത്തരം അപകടസാധ്യതകൾ പ്രധാനമായും ലളിതമായ റീസണിംഗ് ടാസ്കുകളിൽ മാത്രമായി പരിമിതപ്പെട്ടേക്കാം എന്നാണ്.
- പ്രതികൂല സാഹചര്യങ്ങളിൽ Astra വിഭാഗത്തിലെ മോഡലുകൾക്ക് ഞങ്ങളുടെ CoT നിരീക്ഷണങ്ങളിൽനിന്ന് ഒഴിഞ്ഞുമാറാൻ കഴിയുമെന്നാണ് ഈ കണ്ടെത്തലുകൾ സൂചിപ്പിക്കുന്നത്. നിലവിൽ ഈ കണ്ടെത്തലുകൾ പ്രധാനമായും പ്രതികൂല വിലയിരുത്തലുകളെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്, അതായത് നിരീക്ഷണത്തിൽനിന്ന് ഒഴിഞ്ഞുമാറാൻ ഞങ്ങൾ മോഡലിനോട് നിർദേശിക്കുന്ന സാഹചര്യങ്ങൾ. മൊത്തത്തിൽ, സുരക്ഷാനിബന്ധനകൾ ലംഘിക്കാനുള്ള സാധ്യത GPT‑5.6 Sol-നെക്കാൾ Astra-യ്ക്ക് കുറവാണെന്ന് ഞങ്ങളുടെ പൊരുത്ത വിലയിരുത്തലുകൾ കാണിക്കുന്നു.
- എന്നിരുന്നാലും, ഈ പ്രവണതയെ ഞങ്ങൾ ഗൗരവമായി കാണുന്നു. ഞങ്ങളുടെ മോഡലുകളുടെ ശേഷി വർധിക്കുന്നതിനനുസരിച്ച്, ഈ കണ്ടെത്തലുകളെക്കുറിച്ചും നിരീക്ഷണയോഗ്യതയിൽ അവയ്ക്കുള്ള പ്രത്യാഘാതങ്ങളെക്കുറിച്ചും അന്വേഷണം തുടരുന്നു. ചിന്താശൃംഖലാ നിരീക്ഷണം സംരക്ഷിക്കാനും പ്രയോജനപ്പെടുത്താനും OpenAI പ്രവർത്തിച്ചിട്ടുണ്ട്. CoT നിരീക്ഷണയോഗ്യത നിലനിർത്തുന്നത് ഈ ഗവേഷണപരിപാടിയുടെ പ്രധാന ലക്ഷ്യമാണ്. എന്നാൽ, മോഡലിന്റെ ചിന്താശൃംഖല പരിശോധിക്കുന്നതിനപ്പുറമുള്ള പൊരുത്ത പരിശോധനാ സാങ്കേതികവിദ്യകൾ വികസിപ്പിക്കേണ്ടതിന്റെ പ്രാധാന്യവും ഈ ഫലങ്ങൾ അടിവരയിടുന്നു.
- ബ്രൗസിംഗും ജോലിസ്ഥലത്തെ കമ്പ്യൂട്ടർ സാഹചര്യങ്ങളും കൂടുതൽ ഉത്തരവാദിത്തത്തോടെ GPT‑6 Astra കൈകാര്യം ചെയ്യുന്നു: GPT‑5.6 Sol-നെ അപേക്ഷിച്ച് പ്രോംപ്റ്റ് ഇൻജക്ഷനുകളെ പ്രതിരോധിക്കുന്നതിൽ GPT‑6 Astra വളരെ മുന്നിലാണ്. കൂടാതെ, യഥാർത്ഥ ബ്രൗസിംഗ് സാഹചര്യങ്ങളിലും പ്രൊഫഷണൽ കമ്പ്യൂട്ടർ എൻവയോൺമെന്റുകളിലും ഞങ്ങൾ ഈ മോഡലിന്റെ പ്രവർത്തനം പരീക്ഷിച്ചു; GPT‑5.6 Sol-മായി താരതമ്യം ചെയ്യുമ്പോൾ, തെറ്റായതോ വിനാശകരമായേക്കാവുന്നതോ ആയ പ്രവർത്തനങ്ങൾ (ഉദാഹരണത്തിന് അനുമതിയില്ലാത്ത സാമ്പത്തിക ഇടപാടുകൾ, ഡാറ്റ നഷ്ടപ്പെടൽ, അമിതമായ ആക്സസ് എടുക്കൽ, അല്ലെങ്കിൽ നിയന്ത്രണങ്ങൾ മറികടക്കൽ എന്നിവ) നടത്താനുള്ള സാധ്യത ഈ മോഡലിൽ വളരെ കുറവാണെന്ന് ഞങ്ങൾ കണ്ടെത്തി. അക്രമാസക്തമായ ആക്രമണങ്ങൾ ആസൂത്രണം ചെയ്യുകയോ സാമ്പത്തിക തട്ടിപ്പുകൾ നടത്തുകയോ പോലുള്ള ഏജന്റിക് സാഹചര്യങ്ങളിലെ ഹാനികരമായ ആവശ്യങ്ങൾ കൈകാര്യം ചെയ്യുമ്പോഴും ഇത് കൂടുതൽ സുരക്ഷിതമായി പ്രവർത്തിക്കുന്നു.
- ഉയർന്ന അപകടസാധ്യതയുള്ള സാഹചര്യങ്ങളിൽ GPT‑6 Astra ഗണ്യമായി കൂടുതൽ സുരക്ഷിതമാണ്. യഥാർഥ ഉപയോഗസാഹചര്യങ്ങളിൽനിന്നും മനുഷ്യർ നടത്തുന്ന പ്രതികൂല റെഡ് ടീമിംഗിൽനിന്നും എടുത്ത വെല്ലുവിളി നിറഞ്ഞ അഭ്യർഥനകളോട് GPT‑5.6 Sol-നെക്കാൾ സുരക്ഷിതമായാണ് GPT‑6 Astra പ്രതികരിക്കുന്നത്. സുരക്ഷിതമല്ലാത്ത അഭ്യർഥനകൾ സുരക്ഷിതമായി കൈകാര്യം ചെയ്യുന്നതിലും നിരുപദ്രവകരമായ അഭ്യർഥനകൾ അനാവശ്യമായി നിരസിക്കുന്നത് ഒഴിവാക്കുന്നതിലും Astra പാരെറ്റോ മെച്ചപ്പെടുത്തൽ കൈവരിക്കുന്നു. വ്യക്തമായ അഭ്യർഥനയിൽനിന്നല്ലാതെ വിശാലമായ പശ്ചാത്തലത്തിൽനിന്ന് ഹാനിയുടെ അപകടസാധ്യത ഉയർന്നുവരുന്ന അതീവ ഗുരുതര സാഹചര്യങ്ങളിലേക്കും ഈ മെച്ചപ്പെടുത്തലുകൾ വ്യാപിക്കുന്നു. 18 വയസ്സിൽ താഴെയുള്ള ഉപയോക്താക്കൾക്കായി പ്രായത്തിന് അനുയോജ്യമായ സുരക്ഷാപരിധികളും Astra കൂടുതൽ സ്ഥിരതയോടെ പ്രയോഗിക്കുന്നു.
കൂടുതൽ വിവരങ്ങൾക്ക് പൂർണ സിസ്റ്റം കാർഡ്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കാണുക.
രചയിതാവ്
OpenAI


