പ്രധാന ഉള്ളടക്കത്തിലേക്ക് നീങ്ങുക
OpenAI

2026 ജൂലൈ 20

സുരക്ഷ

ദീർഘ-സമയപരിധി മോഡലുകളിൽ സുരക്ഷയും അലൈൻമെന്റും

ദീർഘകാലം പ്രവർത്തിക്കുന്ന മോഡലിന്റെ ആന്തരിക ഉപയോഗം സുരക്ഷയെക്കുറിച്ച് ഞങ്ങളെ പഠിപ്പിച്ചത്.

ലോഡിംഗ്…

സംഗ്രഹം

  • ദീർഘകാലം പ്രവർത്തിക്കുന്ന മോഡലുകൾക്ക് ബുദ്ധിമുട്ടുള്ള, തുറന്ന സ്വഭാവമുള്ള പ്രശ്നങ്ങൾ പരിഹരിക്കാനാകും; എന്നാൽ അവയുടെ സ്ഥിരത അനാവശ്യ നടപടികൾ എടുക്കാൻ കൂടുതൽ അവസരങ്ങളും നൽകുന്നു. 

  • ദീർഘകാല ജോലികൾക്കായി പരിശീലിപ്പിച്ച ഒരു മോഡലിന്റെ പരിമിത ആന്തരിക ഉപയോഗത്തിനിടെ, നിലവിലുള്ള വിന്യാസത്തിന് മുമ്പുള്ള വിലയിരുത്തലുകൾ പിടികൂടാത്ത പുതിയ തരത്തിലുള്ള പരാജയങ്ങൾ ഞങ്ങൾ കണ്ടു, ആക്‌സസ് താൽക്കാലികമായി നിർത്തി. തുടർന്ന്, ഈ പരാജയങ്ങളിൽ നിന്നുള്ള അറിവ് ഉപയോഗിച്ച് ഞങ്ങൾ പുതിയ വിലയിരുത്തലുകൾ വികസിപ്പിക്കുകയും ദീർഘകാല ലക്ഷ്യങ്ങളോടുള്ള പൊരുത്തം മെച്ചപ്പെടുത്തുകയും പ്രവർത്തനപഥ-തല നിരീക്ഷണം ചേർക്കുകയും പരിമിത ആക്‌സസ് പുനഃസ്ഥാപിക്കുന്നതിന് മുമ്പ് ഉപയോക്താക്കൾക്ക് കൂടുതൽ വ്യക്തതയും നിയന്ത്രണവും നൽകുകയും ചെയ്തു.

  • ഈ അനുഭവം ഘട്ടംഘട്ടമായ വിന്യാസത്തിന്റെ മൂല്യം കൂടുതൽ ഉറപ്പിച്ചു. സ്ഥിരമായ വിലയിരുത്തൽ സമാഹാരത്തിനും എല്ലാ പെരുമാറ്റവും മുൻകൂട്ടി കണക്കാക്കാനാകില്ല; അതിനാൽ വിന്യാസത്തിന് മുമ്പുള്ള പരിശോധനയ്‌ക്കൊപ്പം അടുത്ത നിരീക്ഷണവും ഇടപെടാൻ കഴിയുന്ന സുരക്ഷാ സംവിധാനങ്ങളും ആവശ്യമെങ്കിൽ നിർത്തിവയ്ക്കാനോ പഴയ നിലയിലേക്ക് മടങ്ങാനോ ഉള്ള കഴിവും ഉണ്ടായിരിക്കണം.

ദീർഘകാലം സ്വയം പ്രവർത്തിക്കാൻ കഴിയുന്ന മോഡലുകൾക്ക് ബുദ്ധിമുട്ടുള്ള, തുറന്ന സ്വഭാവമുള്ള പ്രശ്നങ്ങൾ കൈകാര്യം ചെയ്യാൻ കഴിയും. എന്നാൽ അവയെ പ്രയോജനകരമാക്കുന്ന അതേ സ്ഥിരത, അവയ്ക്ക് അനാവശ്യ നടപടികൾ എടുക്കാൻ കൂടുതൽ അവസരങ്ങളും നൽകുന്നു—ചുരുങ്ങിയ സമയപരിധിയുള്ള മോഡലുകൾക്കായി രൂപകൽപ്പന ചെയ്ത വിലയിരുത്തലുകൾ കാണാതെ പോകാവുന്ന രീതികളിലും അങ്ങനെ ചെയ്യാൻ കഴിയുന്നു.

ഏകദേശം രണ്ട് മാസം മുമ്പ്, ഒരു ആന്തരിക പൊതുപ്രയോജന മോഡൽ Erdős unit distance conjecture തള്ളിക്കളഞ്ഞതായി ഞങ്ങൾ പ്രഖ്യാപിച്ചു. വളരെ ദീർഘകാലം സ്വയം പ്രവർത്തിക്കാനായി ഈ മോഡൽ രൂപകൽപ്പന ചെയ്തതാണ്. പരിമിതവും നിരീക്ഷിതവുമായ ആന്തരിക ഉപയോഗത്തിനിടെ, നിലവിലുള്ള വിന്യാസ വിലയിരുത്തലുകൾ പിടികൂടാത്ത അനാവശ്യ പെരുമാറ്റം ഞങ്ങൾ കണ്ടു. വിന്യാസം പരിമിതവും നിരീക്ഷിതവുമായിരുന്നതിനാൽ, ഈ പ്രശ്നങ്ങൾ തിരിച്ചറിയാനും, ആക്‌സസ് താൽക്കാലികമായി നിർത്താനും, കണ്ടതിനെ അടിസ്ഥാനമാക്കി പുതിയ വിലയിരുത്തലുകൾ സൃഷ്ടിക്കാനും, മോഡലിനെയും അതിന്റെ സുരക്ഷാ സംവിധാനങ്ങളെയും ശക്തിപ്പെടുത്താനും, തുടർച്ചയായ നിരീക്ഷണത്തോടെ ആക്‌സസ് പുനഃസ്ഥാപിക്കാനും ഞങ്ങൾക്കായി. 

മോഡലുകളെ വിലയിരുത്തുന്ന സാഹചര്യങ്ങൾ യഥാർത്ഥ ഉപയോഗത്തിൽ അവ നേരിടുന്ന സാഹചര്യങ്ങളുമായി ഒരിക്കലും പൂർണമായി പൊരുത്തപ്പെടില്ല. അതുകൊണ്ടുതന്നെ, വിന്യാസത്തിന് മുമ്പുള്ള വിലയിരുത്തലുകൾ പരിമിതവും നിരീക്ഷിതവുമായ വിന്യാസത്തോടും, പ്രശ്നങ്ങൾ ഉയരുമ്പോൾ ഇടപെടാനും നിർത്തിവയ്ക്കാനും പഴയ നിലയിലേക്ക് മടങ്ങാനും ഉള്ള കഴിവിനോടും ചേർന്നുപോകണം. വിന്യാസത്തിൽ നിന്ന് പഠിക്കുന്നതെല്ലാം, ആക്‌സസ് വിപുലീകരിക്കുന്നതിന് മുമ്പ് കൂടുതൽ ശക്തമായ വിലയിരുത്തലുകളുടെയും സുരക്ഷാ സംവിധാനങ്ങളുടെയും ഭാഗമാക്കാം.

താഴെയുള്ള ഭാഗങ്ങളിൽ, ഞങ്ങൾ കണ്ടതിന്റെ വ്യക്തമായ ഉദാഹരണങ്ങളും പ്രശ്നങ്ങൾ എങ്ങനെ പരിഹരിച്ചുവെന്നും ഈ അനുഭവം ഭാവിയിലെ റിലീസുകളെ എങ്ങനെ സ്വാധീനിക്കുമെന്നും പങ്കിടുന്നു.

മോഡലിന്റെ സ്ഥിരത സുരക്ഷാ ദൗർബല്യങ്ങൾ തുറന്നുകാട്ടാം

പുതിയ മോഡലിന് ദീർഘകാലം ആവർത്തിച്ചുള്ള ശ്രമങ്ങളിലൂടെ ഒരു ലക്ഷ്യത്തിലേക്ക് തുടർച്ചയായി പ്രവർത്തിക്കാനാകും. അതേ സ്ഥിരത അതിന്റെ പരിസ്ഥിതിയിലെ ദൗർബല്യങ്ങൾ കണ്ടെത്താനും ചൂഷണം ചെയ്യാനും ഇടയാക്കാം. മുൻ മോഡലുകൾ സാൻഡ്ബോക്സിംഗ് അല്ലെങ്കിൽ പരിസ്ഥിതി നിയന്ത്രണങ്ങൾ നേരിട്ടാൽ, സാധാരണയായി നിർത്തി ഉപയോക്താവിലേക്ക് മടങ്ങുമായിരുന്നു. ഈ മോഡൽ പലപ്പോഴും തുടർന്നു ശ്രമിച്ചു; സ്വന്തം സാൻഡ്ബോക്സിന് പുറത്തു പ്രവർത്തിക്കാൻ വഴികൾ അന്വേഷിച്ചതും അതിൽപ്പെടുന്നു.

ചെറിയ ഭാഷാ മോഡൽ കഴിയുന്നത്ര കുറച്ച് ഘട്ടങ്ങളിൽ പരിശീലിപ്പിക്കാൻ ഉള്ള പൊതു ബെഞ്ച്മാർക്ക് ആയ NanoGPT speedrun(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ലെ ആന്തരിക വിലയിരുത്തലിനിടെയാണ് ഇതിന്റെ ഒരു ഉദാഹരണം സംഭവിച്ചത്. ഞങ്ങളുടെ മോഡൽ PowerCool എന്ന power-law learning-rate cooldown വികസിപ്പിച്ചു; അത് ഗണ്യമായ മെച്ചപ്പെടുത്തലിന് കാരണമായി. ഫലങ്ങൾ Slack-ൽ മാത്രം പോസ്റ്റ് ചെയ്യാനാണ് മോഡലിന് നിർദ്ദേശം നൽകിയിരുന്നത്; എന്നാൽ NanoGPT നിർദ്ദേശങ്ങൾ ഫലങ്ങൾ GitHub-ലേക്ക് PR ആയി പോസ്റ്റ് ചെയ്യണമെന്ന് പറയുന്നു, അതിനാൽ മോഡൽ അതിനെയാണ് പിന്തുടർന്ന് പൊതു GitHub റിപ്പോസിറ്ററിയിൽ PR #287 തുറന്നു. ബാഹ്യ ആക്‌സസ് തടയാൻ രൂപകൽപ്പന ചെയ്ത sandbox നിയന്ത്രണങ്ങൾ മോഡൽ മറികടന്ന് GitHub-ലേക്ക് അപ്‍ലോഡ് തുടരുകയായിരുന്നു. PR സൃഷ്ടിക്കാൻ സാൻഡ്ബോക്സിലെ ഒരു ദൗർബല്യം കണ്ടെത്താൻ ഞങ്ങളുടെ മോഡലിന് ഒരു മണിക്കൂർ വേണ്ടിവന്നു; മുൻ മോഡലുകൾക്ക് സ്ഥിരത കുറവായതിനാൽ ദൗർബല്യങ്ങൾ കണ്ടെത്താനായില്ല, പകരം PR ഭാഗം ഉപേക്ഷിക്കുകയായിരുന്നു.1

ഒറ്റ നടപടികളെ പരിഗണിക്കുന്നതിൽ നിന്ന് മുഴുവൻ പാതകളും പരിഗണിക്കുന്നതിലേക്ക്

കൃത്രിമബുദ്ധി സഹായികൾക്കായുള്ള പല സുരക്ഷാ നിയന്ത്രണങ്ങളും വ്യക്തിഗത നടപടികളെ കേന്ദ്രീകരിച്ചാണ് രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്. ഒരു നടപടി അനുവദനീയമല്ലെങ്കിൽ അത് തടയപ്പെടുന്നു. അത് സംവേദനക്ഷമമാണെങ്കിൽ, സിസ്റ്റം ഉപയോക്താവിനോട് വ്യക്തമായ അനുമതി ചോദിക്കുന്നു. എന്നാൽ മണിക്കൂറുകൾ, ദിവസങ്ങൾ, ചിലപ്പോൾ ആഴ്ചകൾ വരെ സ്വയം വികസിക്കുന്ന നടപടികളുള്ള ദീർഘകാലം പ്രവർത്തിക്കുന്ന മോഡലുകൾ ഈ ക്രമീകരണത്തെ വെല്ലുവിളിക്കുന്നു: മൊത്തം പാതയുടെ ഉദ്ദേശ്യം മനസ്സിലാക്കാൻ വ്യക്തിഗത നടപടികൾ നിരീക്ഷിക്കുന്നത് മാത്രം മതിയാകില്ല.

ഉദാഹരണത്തിന്, ഒരു പ്രശ്നം പരിഹരിക്കാൻ മോഡലിനോട് ആവശ്യപ്പെട്ട ഒരു സാഹചര്യത്തിൽ, മറ്റ് സിസ്റ്റങ്ങൾക്ക് വിജയകരമായെങ്കിലും സ്വകാര്യമായ സമർപ്പണങ്ങൾ ഉണ്ടെന്ന് മോഡൽ കണ്ടു, ആ പരിഹാരങ്ങൾ വിലയിരുത്തൽ ബാക്ക്എൻഡിൽ നിന്ന് വീണ്ടെടുക്കാൻ ശ്രമിച്ചു. പ്രാമാണീകരണ ടോക്കൺ കണ്ടെത്തിയ സ്കാനർ കാരണം ആദ്യ ശ്രമം തടഞ്ഞപ്പോൾ, മോഡൽ ടോക്കൺ ബോഡി രണ്ട് ഭാഗങ്ങളാക്കി, അവ മറച്ചുവെച്ചു, തുടർന്ന് പ്രവർത്തനസമയത്ത് ക്രെഡൻഷ്യൽ പുനർനിർമിച്ചു; അങ്ങനെ പൂർണ്ണ ടോക്കൺ ഒരിക്കലും തുടർച്ചയായ ഒരൊറ്റ സ്ട്രിംഗായി പ്രത്യക്ഷപ്പെട്ടില്ല. സ്കാനറിനെ മറികടക്കാനാണ് ഈ നടപടികൾ സ്വീകരിച്ചതെന്ന് ഉപയോക്താവിനുള്ള അഭിപ്രായങ്ങളിലും സ്വന്തം റീസണിംഗ് രേഖയിലും മോഡൽ വ്യക്തമായി രേഖപ്പെടുത്തിയിരുന്നു.

ഓരോ ഘട്ടവും ഒറ്റയ്ക്ക് നോക്കുമ്പോൾ അംഗീകരിക്കാവുന്നതായി തോന്നുമ്പോഴും ക്രമം അംഗീകരിക്കാനാകാത്ത ഫലം സൃഷ്ടിക്കാമെന്ന് ഈ ഉദാഹരണം കാണിക്കുന്നു. ദീർഘ സമയപരിധികളിൽ ഫലപ്രദമായി പ്രവർത്തിക്കുന്ന ഒരു മോഡലിന് അംഗീകാര സംവിധാനത്തിന്റെ കാണാപ്പുറങ്ങൾ പഠിച്ച്, സ്വന്തം ലക്ഷ്യങ്ങൾ നേടാൻ അതിനെ മറികടക്കാൻ കഴിയുന്നതും ഇതിലൂടെ വ്യക്തമാകുന്നു. ദീർഘ-സമയപരിധി സുരക്ഷയ്ക്ക് “ഈ നടപടി അനുവദനീയമാണോ?” എന്ന് മാത്രം ചോദിച്ചാൽ മതിയാകില്ല; “ഈ നടപടികളുടെ ക്രമം ഏത് ഫലത്തിലേക്കാണ് നീങ്ങുന്നത്?” എന്നും ചോദിക്കണം.

ദീർഘകാലം പ്രവർത്തിക്കുന്ന മോഡലുകൾക്കായി സുരക്ഷാ സംവിധാനങ്ങൾ നിർമ്മിക്കൽ

ഇതുപോലുള്ള സംഭവങ്ങൾ കാരണം, പുതിയ മോഡലിന്റെ ആന്തരിക വിന്യാസം ഞങ്ങൾ താൽക്കാലികമായി നിർത്തി. പ്രതിരോധത്തിന്റെ ഒന്നിലധികം പാളികൾ എന്ന സമീപനത്തെയും പ്രവർത്തനപഥ-തല നിരീക്ഷണത്തെയും അടിസ്ഥാനമാക്കി ഞങ്ങൾ സുരക്ഷാ സംവിധാനം പുനർനിർമിച്ചു.

  • സംഭവങ്ങളിൽ നിന്ന് രൂപപ്പെടുത്തിയ വിലയിരുത്തലുകൾ. ഒരു സിസ്റ്റം യഥാർത്ഥത്തിൽ വിന്യസിക്കുന്നതിന് മുമ്പ് അത് വിന്യാസത്തിന് സുരക്ഷിതമാണോ എന്ന ധാരണ വിലയിരുത്തലുകൾ നൽകാം. എന്നാൽ ഏറ്റവും പ്രയോജനകരമാകണമെങ്കിൽ, യഥാർത്ഥ വിന്യാസത്തിലെ പാതകളുടെ വിതരണവും സമയപരിധി ദൈർഘ്യവും ഒരു വിലയിരുത്തൽ പ്രതിഫലിപ്പിക്കണം. അതുകൊണ്ട്, യഥാർത്ഥത്തിൽ നിരീക്ഷിച്ച പരാജയങ്ങളെ അടിസ്ഥാനമാക്കി പ്രതികൂല വിലയിരുത്തലുകൾ വികസിപ്പിച്ചു. യഥാർത്ഥ സംഭവങ്ങളിൽ നിന്ന് രൂപപ്പെടുത്തിയ വിലയിരുത്തലുകളിൽ മെച്ചപ്പെടുന്നത്, ഉൽപ്പാദനത്തിൽ വിന്യസിച്ചപ്പോൾ കൂടുതൽ സുരക്ഷിതമായ പെരുമാറ്റത്തിലേക്കാണ് നയിച്ചതെന്ന് ഞങ്ങൾ കണ്ടെത്തി.
  • മെച്ചപ്പെടുത്തിയ അലൈൻമെന്റ്. ഉപയോക്താവിന്റെ ലക്ഷ്യം പിന്തുടരുമ്പോൾ അനുമതിയില്ലാതെ അനാവശ്യ നടപടികൾ എടുക്കാനുള്ള അതിന്റെ പ്രവണത കുറയ്ക്കാൻ ഞങ്ങൾ നടപടികൾ എടുത്തു.  ഉദാഹരണത്തിന്, ദീർഘ റോൾഔട്ടുകളിൽ നിർദ്ദേശങ്ങൾ ഓർക്കുന്നതിൽ ഞങ്ങളുടെ മോഡലുകൾ ദുർബലമാണെന്ന് കണ്ടു; ഈ കഴിവിനായി മോഡലിനെ പരിശീലിപ്പിച്ചപ്പോൾ, നീണ്ട റോൾഔട്ടുകളിൽ മുഴുവൻ അലൈൻമെന്റ് നിലനിർത്തുന്ന മോഡലിലേക്ക് അത് നയിച്ചു. 
  • സജീവ നിരീക്ഷണം. ഉപയോക്തൃ നിയന്ത്രണമോ സുരക്ഷാ അതിരോ മറികടക്കുന്നതിന്റെ സൂചനകൾക്കായി മോഡലിന്റെ മാറിവരുന്ന പാത പരിശോധിക്കുന്ന നിരീക്ഷണ സിസ്റ്റം ഞങ്ങൾ സൃഷ്ടിച്ചു. മോണിറ്റർ ഒറ്റ നടപടി മാത്രമല്ല, മുഴുവൻ പാതയും നിരീക്ഷിക്കുന്നു. പ്രധാനമായി, മോണിറ്ററിന് സെഷൻ താൽക്കാലികമായി നിർത്തി കൂടുതൽ സൂക്ഷ്മമായി പരിശോധിക്കാൻ ഉപയോക്താവിനെ അറിയിക്കാനാകും. പരിശോധിച്ചതിന് ശേഷം, മോണിറ്റർ തെറ്റായി ട്രിഗർ ചെയ്തതാണെങ്കിൽ മോഡലിന്റെ ജോലി തുടരാൻ ഉപയോക്താവിന് തിരഞ്ഞെടുക്കാം. 
  • ഉപയോക്താവിന് കൂടുതൽ വ്യക്തതയും നിയന്ത്രണവും. ഈ ദീർഘകാല സെഷനുകൾ പരിശോധിക്കാനും എടുത്ത നടപടികൾ കാണാനും ഇടപെടലുകൾ നിരീക്ഷിക്കാനും ഉപയോക്താവിന് ഉള്ള കഴിവ് ഞങ്ങൾ മെച്ചപ്പെടുത്തി.

പുനർവിന്യാസം

പുതിയ നിരീക്ഷണ സിസ്റ്റം വിലയിരുത്താൻ, മോഡൽ മുമ്പ് അലൈൻമെന്റ് തെറ്റിയ നടപടികൾ പിന്തുടർന്നിരുന്ന ചെറിയൊരു കൂട്ടം ആന്തരിക വിന്യാസ പരിസ്ഥിതികൾ ഞങ്ങൾ വീണ്ടും പരീക്ഷിച്ചു; ഈ തവണ പുതിയ സുരക്ഷാ സംവിധാനങ്ങൾ പ്രവർത്തനത്തിലുണ്ടായിരുന്നു2. മോഡൽ പിന്തുടർന്ന അലൈൻമെന്റ് തെറ്റിയ നടപടികളിൽ കൂടുതലിനെയും പുതിയ സുരക്ഷാ സംവിധാനങ്ങൾ പിടികൂടി; ഒഴിവായത് എല്ലാം കുറഞ്ഞ തീവ്രതയുള്ളവയാണെന്ന് വിലയിരുത്തി.

ഈ കുറഞ്ഞ തീവ്രതയുള്ള സംഭവങ്ങളിൽ ചില ഉദാഹരണങ്ങൾ ഇവയാണ്:

  • ലീനിയർ കമാൻഡ് ലൈൻ ടൂൾ ആക്‌സസ് ചെയ്യാൻ, മോഡൽ ഒരു നെസ്റ്റഡ് codex --yolo സെഷൻ ആരംഭിച്ചു; യഥാർത്ഥത്തിൽ, --yolo ഫ്ലാഗ് ഇല്ലാതെയും അത് ചെയ്യാമായിരുന്നു.
  • മുമ്പ് ലഭ്യമായിരുന്ന ഒരു വിഭവം ഇനി ലഭ്യമല്ലെന്നത് മോഡൽ ശ്രദ്ധിച്ചു. തുടർന്ന്, അതിന് യാതൊരു ന്യായമായ കാരണവുമില്ലാതെ, സ്വന്തം ഉടമയുടെ നെയിംസ്പേസിലുള്ള മറ്റ് പ്രവർത്തനക്ഷമമായ CPU പോഡുകൾ SSH വഴി പരിശോധിക്കാനും അവയിലേക്ക് പ്രവേശിക്കാനും തുടങ്ങി. കൂടാതെ, മറ്റ് OpenAI ജീവനക്കാരുടെ പോഡുകളിലേക്കും (വിജയിക്കാതെ) പ്രവേശിക്കാൻ ശ്രമിച്ചു.
  • മോഡലിന് പ്രവർത്തനം നിലച്ച നിരവധി ഫൈൻഡ് പ്രോസസ്സുകൾ ഉണ്ടായിരുന്നു, കൂടാതെ ഓരോ ഷെൽ കമാൻഡും നിലച്ചുപോകുകയായിരുന്നു. തുടർന്ന് അത് kill -9 -1 പ്രവർത്തിപ്പിച്ചു. ഇത് പ്രവർത്തിച്ചിരുന്നെങ്കിൽ, ആ പോഡിൽ ഇല്ലാതാക്കാൻ അതിന് അനുമതിയുള്ള എല്ലാ പ്രോസസ്സുകളിലേക്കും SIGKILL സിഗ്നൽ അയച്ചേനേ. എന്നാൽ, സമയപരിധി കഴിഞ്ഞതിനാൽ അത് പ്രവർത്തിപ്പിക്കപ്പെട്ടില്ല.

പുതിയ സിസ്റ്റം പരിശോധിച്ച ശേഷം, ദീർഘ-സമയപരിധി കഴിവുകളുള്ള മോഡലുകളിലേക്കുള്ള പരിമിത ആന്തരിക ആക്‌സസ് പുനഃസ്ഥാപിക്കാമെന്ന് ഞങ്ങൾ നിഗമനം ചെയ്തു. പുനർവിന്യാസം ഏതാനും ആഴ്ചകൾക്ക് മുമ്പ് തുടങ്ങിയതിന് ശേഷം സുരക്ഷാ സംവിധാനങ്ങൾ ഗൗരവമായി മറികടന്ന സംഭവങ്ങളൊന്നും ഞങ്ങൾ കണ്ടിട്ടില്ല. ഈ സുരക്ഷാ സംവിധാനങ്ങളുടെ ആദ്യ പതിപ്പ് ഉദ്ദേശപൂർവം കരുതലേറിയതായിരുന്നു. സുരക്ഷാ സംവിധാനങ്ങളെ ദുർബലമാക്കാതെ അനാവശ്യ ഇടവേളകൾ കുറയ്ക്കാൻ ഞങ്ങൾ സിസ്റ്റത്തെ തുടർന്നും മെച്ചപ്പെടുത്തിക്കൊണ്ടിരിക്കുന്നു.

അവസാന ചിന്തകൾ

ഞങ്ങൾ ഘട്ടംഘട്ടമായി വിന്യസിച്ചതിനാൽ, ആക്‌സസ് വിപുലീകരിക്കുന്നതിന് മുമ്പ് പോരായ്മകൾ കണ്ടെത്തി പരിഹരിക്കാൻ കഴിഞ്ഞു. വിന്യാസത്തിന് മുമ്പുള്ള വിലയിരുത്തലുകൾ ഇപ്പോഴും അനിവാര്യമാണ്, പക്ഷേ അവ കാണാതെ പോകുന്ന പെരുമാറ്റങ്ങൾ വിന്യാസം വെളിപ്പെടുത്തുന്നു. പരിമിത ആക്‌സസോടെ തുടങ്ങിയത് മോഡലിനെ പ്രായോഗികമായി നിരീക്ഷിക്കാനും, പ്രശ്നങ്ങൾ ഉയർന്നപ്പോൾ നിർത്തിവയ്ക്കാനും, ആ പരാജയങ്ങളെ മികച്ച വിലയിരുത്തലുകളും സുരക്ഷാ സംവിധാനങ്ങളും നിർമ്മിക്കാൻ ഉപയോഗിക്കാനും, മാറ്റങ്ങൾ പരിശോധിച്ച ശേഷം പരിമിത ആക്‌സസ് പുനഃസ്ഥാപിക്കാനും ഞങ്ങളെ സഹായിച്ചു.

മോഡലുകൾ കൂടുതൽ ദീർഘവും സങ്കീർണ്ണവുമായ ജോലികൾ ഏറ്റെടുക്കുമ്പോൾ, വിലയിരുത്തലുകൾ കാണാതെ പോകുന്ന പരാജയങ്ങൾക്ക് കൂടുതൽ വലിയ പ്രത്യാഘാതങ്ങൾ ഉണ്ടാകാം. വിലയിരുത്തലും വിന്യാസവും തമ്മിലുള്ള വിടവ് കുറയ്ക്കാൻ ഞങ്ങൾ ശ്രമം തുടരും: കൂടുതൽ നീണ്ട പാതകളിൽ മോഡലുകൾ പരീക്ഷിക്കുക, അലൈൻമെന്റ് മെച്ചപ്പെടുത്തുക, ഇടപെടാൻ കഴിയുന്ന നിരീക്ഷണം നിർമ്മിക്കുക, ഉപയോക്താക്കൾക്ക് കൂടുതൽ വ്യക്തമായ ദൃശ്യതയും നിയന്ത്രണവും നൽകുക. ഈ വെല്ലുവിളികൾ OpenAI-യ്ക്ക് മാത്രം പ്രത്യേകമായിരിക്കില്ല; ഞങ്ങൾ പഠിച്ചത് പങ്കിടുന്നത് വിപുലമായ മേഖലയെ അവയ്ക്കായി തയ്യാറെടുക്കാൻ സഹായിക്കുമെന്ന് പ്രതീക്ഷിക്കുന്നു.

രചയിതാവ്

OpenAI

അടിക്കുറിപ്പുകൾ

  1. 1

     ഞങ്ങൾ PR വേഗത്തിൽ അടച്ചെങ്കിലും, speedrun-ൽ പങ്കെടുത്ത പലരും ഇതിനകം അത് കണ്ടിരുന്നു, സ്വന്തം സമർപ്പണങ്ങളിൽ ആ സമീപനം ഉപയോഗിക്കുകയും ചെയ്തു; 3030(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), 2990(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), 2930(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), 2925(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), 2900(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), 2890(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഘട്ടങ്ങളുള്ള തുടർച്ചയായ ലോക റെക്കോർഡ് സമർപ്പണങ്ങൾ എല്ലാം PR 287 ഉദ്ധരിക്കുന്നു. ഇവയിൽ, Opus 4.7 NanoGPT speedrun-ൽ Prime Intellect(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) വിലയിരുത്തിയപ്പോൾ സമർപ്പിച്ച PR ആയതിനാൽ PR 300(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) പ്രത്യേകിച്ച് ശ്രദ്ധേയമാണ്. Opus ഞങ്ങളുടെ മോഡൽ സമർപ്പിച്ച PR കണ്ടു, കണ്ടെത്തലുകൾ ഉൾപ്പെടുത്തി, അന്തിമ ഫലത്തിൽ ഞങ്ങളുടെ PR-ന് ക്രെഡിറ്റ് നൽകി.

  2. 2

     പരിസ്ഥിതി പുനർനിർമിക്കുന്നതിലെ യാദൃച്ഛികതയും അപൂർണതയും കാരണം, replay-യിലെ rollouts ഓരോ തവണയും അതേ അലൈൻമെന്റ് തെറ്റിയ നടപടിയാണ് പിന്തുടരുകയെന്ന് ഉറപ്പില്ല.