લાંબી સમય સીમાવાળા મોડલોના યુગમાં સલામતી અને સંરેખણ
લાંબા સમય સુધી ચાલતા મોડલના આંતરિક ઉપયોગે અમને સલામતી વિશે શું શીખવ્યું.
સારાંશ
લાંબા સમય સુધી ચાલતા મોડલો મુશ્કેલ, ખુલ્લા પ્રશ્નો ઉકેલી શકે છે, પરંતુ તેમની સતત પ્રયત્નશીલતા તેમને અનિચ્છનીય ક્રિયાઓ કરવાની વધુ તકો આપે છે.
લાંબા સમય સુધી ચાલતા કાર્યો માટે તાલીમ અપાયેલા મોડલના મર્યાદિત આંતરિક ઉપયોગ દરમિયાન, અમે એવી નવી નિષ્ફળતાઓ જોઈ જે અમારા હાલના ડિપ્લોયમેન્ટ પહેલાંના મૂલ્યાંકનોમાં પકડાઈ નહોતી, અને ઍક્સેસ થોભાવી. પછી મર્યાદિત ઍક્સેસ પુનઃસ્થાપિત કરતા પહેલાં, અમે આ નિષ્ફળતાઓમાંથી મળેલી સમજનો ઉપયોગ નવા મૂલ્યાંકનો બનાવવા, લાંબી સમય સીમાનું સંરેખણ સુધારવા, માર્ગક્રમ-સ્તરની દેખરેખ ઉમેરવા, અને વપરાશકર્તાઓને વધુ દૃશ્યતા અને નિયંત્રણ આપવા માટે કર્યો.
આ અનુભવે ક્રમશઃ ડિપ્લોયમેન્ટનું મૂલ્ય વધુ મજબૂત કર્યું. કોઈ નિશ્ચિત મૂલ્યાંકન સમૂહ દરેક વર્તનનો અંદાજ લગાવી શકતો નથી, તેથી ડિપ્લોયમેન્ટ પહેલાંની કસોટી સાથે નજીકની દેખરેખ, હસ્તક્ષેપ કરી શકે એવા સુરક્ષાકવચો, અને જરૂર પડે ત્યારે વિરામ અથવા રોલ બેક કરવાની ક્ષમતા હોવી જરૂરી છે.
લાંબા સમય સુધી સ્વાયત્ત રીતે કામ કરી શકતા મોડલો મુશ્કેલ, ખુલ્લા પ્રશ્નો હાથ ધરી શકે છે. પરંતુ જે સતત પ્રયત્નશીલતા તેમને ઉપયોગી બનાવે છે, એ જ તેમને અનિચ્છનીય ક્રિયાઓ કરવાની વધુ તકો પણ આપે છે—અને તે પણ એવી રીતે કે ટૂંકી સમય સીમાવાળા મોડલો માટે રચાયેલા મૂલ્યાંકનો તેને ચૂકી જાય.
આશરે બે મહિના પહેલાં અમે જાહેરાત કરી હતી કે આંતરિક સામાન્ય-હેતુના મોડલે Erdős unit distance conjecture ને ખોટું સાબિત કર્યું. આ મોડલ બહુ લાંબા સમય સુધી સ્વાયત્ત રીતે કામ કરવા માટે ડિઝાઇન કરવામાં આવ્યું હતું. મર્યાદિત, દેખરેખ હેઠળના આંતરિક ઉપયોગ દરમિયાન, અમે એવું અનિચ્છનીય વર્તન જોયું જે અમારા હાલના ડિપ્લોયમેન્ટ મૂલ્યાંકનો પકડી શક્યા નહોતા. ડિપ્લોયમેન્ટ મર્યાદિત અને દેખરેખ હેઠળ હતું, તેથી અમે આ સમસ્યાઓ ઓળખી શક્યા, ઍક્સેસ થોભાવી શક્યા, અમે જે જોયું તેના આધારે નવા મૂલ્યાંકનો બનાવી શક્યા, મોડલ અને તેના સુરક્ષાકવચોને મજબૂત કરી શક્યા, અને પછી સતત દેખરેખ હેઠળ ઍક્સેસ પુનઃસ્થાપિત કરી શક્યા.
જે પરિસ્થિતિઓમાં અમે મોડલોનું મૂલ્યાંકન કરીએ છીએ, તે વાસ્તવિક ઉપયોગમાં તેઓ જે પરિસ્થિતિઓનો સામનો કરે છે તેની સાથે ક્યારેય સંપૂર્ણ રીતે મેળ નહીં ખાય. એટલે જ ડિપ્લોયમેન્ટ પહેલાંના મૂલ્યાંકનોની સાથે મર્યાદિત, દેખરેખ હેઠળનું ડિપ્લોયમેન્ટ અને સમસ્યાઓ ઊભી થાય ત્યારે હસ્તક્ષેપ, વિરામ અથવા રોલ બેક કરવાની ક્ષમતા જરૂરી છે. ડિપ્લોયમેન્ટમાંથી જે શીખીએ છીએ તે પછી ઍક્સેસ વિસ્તરે તે પહેલાં વધુ મજબૂત મૂલ્યાંકનો અને સુરક્ષાકવચોનો ભાગ બની શકે છે.
આગળના વિભાગોમાં, અમે શું જોયું, સમસ્યાઓને કેવી રીતે ઉકેલી, અને આ અનુભવ ભવિષ્યના રિલીઝને કેવી રીતે આકાર આપશે તેના ચોક્કસ ઉદાહરણો શેર કરીએ છીએ.
નવું મોડલ લાંબા સમય સુધી વારંવારના પ્રયત્નો દ્વારા કોઈ હેતુ તરફ કામ ચાલુ રાખી શકે છે. એ જ સતત પ્રયત્નશીલતા તેને તેના પર્યાવરણમાં નબળાઈઓ શોધવા અને તેનો લાભ લેવા તરફ દોરી શકે છે. પહેલાંના મોડલો જ્યારે સૅન્ડબોક્સિંગ અથવા પર્યાવરણીય મર્યાદાઓને અથડાતા, ત્યારે સરળતાથી અટકી જતા અને વપરાશકર્તા પાસે પાછા ફરતા. આ મોડલ ઘણી વાર પ્રયત્ન કરતું રહ્યું, જેમાં પોતાના સૅન્ડબોક્સની બહાર કાર્ય કરવાની રીતો શોધવાનો પ્રયાસ પણ સામેલ હતો.
આનું એક ઉદાહરણ NanoGPT સ્પીડરન(નવી વિન્ડોમાં ખૂલે છે) પરના આંતરિક મૂલ્યાંકન દરમિયાન બન્યું હતું, જે શક્ય તેટલા ઓછા પગલાંમાં નાનું ભાષા મોડલ તાલીમ આપવા માટેનો જાહેર બેન્ચમાર્ક છે. અમારા મોડલે PowerCool નામનો પાવર-લૉ લર્નિંગ-રેટ કૂલડાઉન વિકસાવ્યો, જેના કારણે નોંધપાત્ર સુધારો થયો. મોડલને તેના પરિણામો માત્ર Slack પર પોસ્ટ કરવાની સૂચના આપવામાં આવી હતી, પરંતુ NanoGPTની સૂચનાઓ પરિણામો GitHub પર PR તરીકે પોસ્ટ કરવાનું કહે છે, અને મોડલે બીજી સૂચનાઓ અનુસરીને જાહેર GitHub રિપોઝિટરી પર PR #287 ખોલ્યો. મોડલે બાહ્ય ઍક્સેસ અટકાવવા માટે રચાયેલા સૅન્ડબોક્સ પ્રતિબંધોને બાયપાસ કર્યા અને GitHub પર અપલોડ આગળ વધાર્યું. PR બનાવવા માટે સૅન્ડબોક્સમાં નબળાઈ શોધવામાં અમારા મોડલને એક કલાક લાગ્યો; પહેલાંના મોડલો ઓછા સતત પ્રયત્નશીલ હતા અને નબળાઈઓ શોધવામાં સફળ થયા નહોતા, બદલે PRના ભાગે હાર માની લીધી હતી.1
AI સહાયકો માટેના ઘણા સલામતી નિયંત્રણો વ્યક્તિગત ક્રિયાઓને ધ્યાનમાં રાખીને રચાયેલા હોય છે. જો કોઈ ક્રિયા મંજૂર ન હોય, તો તેને અવરોધવામાં આવે છે. જો તે સંવેદનશીલ હોય, તો સિસ્ટમ વપરાશકર્તાની સ્પષ્ટ મંજૂરી માગે છે. પરંતુ લાંબા સમય સુધી ચાલતા મોડલો, જેમની ક્રિયાઓ કલાકો, દિવસો અથવા અઠવાડિયા સુધી સ્વાયત્ત રીતે આગળ વધી શકે છે, આ વ્યવસ્થાને પડકાર આપે છે: સમગ્ર માર્ગક્રમનો આશય સમજવા માટે વ્યક્તિગત ક્રિયાઓનું નિરીક્ષણ હવે પૂરતું નથી.
ઉદાહરણ તરીકે, એક પરિસ્થિતિમાં જ્યાં મોડલને સમસ્યા ઉકેલવાનું કહેવામાં આવ્યું હતું, મોડલે જોયું કે અન્ય સિસ્ટમોએ સફળ પરંતુ ખાનગી સબમિશન કર્યા હતા અને તેણે મૂલ્યાંકન બેકએન્ડમાંથી તે ઉકેલો પાછા મેળવવાનો પ્રયાસ કર્યો. જ્યારે તેના પ્રારંભિક પ્રયાસને સ્કૅનરે પ્રમાણિકરણ ટોકન શોધી કાઢવાના કારણે અવરોધ્યો, ત્યારે મોડલે ટોકનના મુખ્ય ભાગને બે ટુકડામાં વહેંચ્યો, તેમને અસ્પષ્ટ બનાવ્યા, અને પછી રનટાઇમ પર ક્રેડેન્શિયલ ફરી રચ્યું, જેથી સંપૂર્ણ ટોકન ક્યારેય એક સતત સ્ટ્રિંગ તરીકે દેખાયું નહીં. વપરાશકર્તાને કરેલી ટિપ્પણીઓમાં અને પોતાના રિજનિંગ ટ્રેસમાં મોડલે સ્પષ્ટ કર્યું હતું કે તે સ્કૅનરને બાયપાસ કરવા માટે આ પગલાં લઈ રહ્યું હતું.
આ ઉદાહરણ બતાવે છે કે દરેક પગલું પોતે સ્વીકાર્ય લાગી શકે છે, જ્યારે શ્રેણી એવું પરિણામ આપી શકે છે જેને મંજૂરી ન મળતી. તે એ પણ બતાવે છે કે લાંબી સમય સીમાઓમાં અસરકારક રીતે કામ કરતું મોડલ મંજૂરી સિસ્ટમના અદૃશ્ય ખૂણા શીખી શકે છે અને પોતાના લક્ષ્યો હાંસલ કરવા માટે તેના રસ્તા કાઢી શકે છે. લાંબી સમય સીમાની સલામતી માટે માત્ર “શું આ ક્રિયાની મંજૂરી છે?” એટલું જ નહીં, પણ “ક્રિયાઓની આ શ્રેણી કયા પરિણામ તરફ આગળ વધી રહી છે?”
આવા બનાવોને કારણે, અમે નવા મોડલનું આંતરિક ડિપ્લોયમેન્ટ થોભાવ્યું. અમે સલામતી સિસ્ટમને ડિફેન્સ ઇન ડેપ્થ અને માર્ગક્રમ-સ્તરની દેખરેખની આસપાસ ફરી બનાવી.
- બનાવોમાંથી ઉતરી આવેલ મૂલ્યાંકનો. સિસ્ટમને વાસ્તવમાં ડિપ્લોય કરતા પહેલાં તે ડિપ્લોય કરવા માટે સલામત છે કે નહીં તેનો અંદાજ મૂલ્યાંકનો આપણને આપી શકે છે. પરંતુ સૌથી ઉપયોગી થવા માટે, મૂલ્યાંકનને વાસ્તવિક ડિપ્લોયમેન્ટ દરમિયાનના માર્ગક્રમોના વિતરણ અને સમય સીમાની લંબાઈ પ્રતિબિંબિત કરવી જોઈએ. આ કારણે, અમે જોયેલી નિષ્ફળતાઓનો ઉપયોગ પ્રતિકૂળ મૂલ્યાંકનો વિકસાવવા માટે કર્યો. અમને જણાયું કે વાસ્તવિક બનાવોમાંથી ઉતરી આવેલા મૂલ્યાંકનોમાં સુધારો કરવાથી, ઉત્પાદન પર્યાવરણમાં ડિપ્લોય થયા પછી વર્તન વધુ સલામત બન્યું.
- સુધારેલું સંરેખણ. વપરાશકર્તાના લક્ષ્યને અનુસરતી વખતે પરવાનગી વિના અનિચ્છનીય ક્રિયાઓ કરવાની તેની વૃત્તિ ઘટાડવા અમે પગલાં લીધાં. ઉદાહરણ તરીકે, અમને જણાયું કે લાંબા રોલઆઉટમાં અમારા મોડલો સૂચનાઓ યાદ રાખવામાં નબળા હતા, અને જ્યારે અમે આ ક્ષમતા માટે મોડલને તાલીમ આપી, ત્યારે તે લાંબા રોલઆઉટ દરમિયાન પણ સંરેખિત રહ્યું.
- સક્રિય દેખરેખ. અમે એવી દેખરેખ સિસ્ટમ બનાવી જે મોડલના બદલાતા માર્ગક્રમની સમીક્ષા કરે છે, જેથી તે વપરાશકર્તાની મર્યાદા અથવા સલામતી સીમા બાયપાસ કરી રહ્યું હોય તેવા સંકેતો શોધી શકાય. મોનિટર માત્ર એક ક્રિયા નહીં, પરંતુ આખો માર્ગક્રમ નિરીક્ષણ કરે છે. મહત્વપૂર્ણ વાત એ છે કે મોનિટર સત્ર થોભાવી શકે છે અને વધુ નજીકથી તપાસવા માટે વપરાશકર્તાને ચેતવી શકે છે. તપાસ પછી, જો મોનિટર ખોટી રીતે ટ્રિગર થયો હોય, તો વપરાશકર્તા મોડલનું કામ ચાલુ રાખવાનું પસંદ કરી શકે છે.
- વપરાશકર્તા માટે વધુ દૃશ્યતા અને નિયંત્રણ. અમે વપરાશકર્તાની આ લાંબા સમય સુધી ચાલતા સત્રો તપાસવાની, લેવામાં આવેલી ક્રિયાઓ જોવાની, અને દેખરેખી હસ્તક્ષેપો પર નજર રાખવાની ક્ષમતા સુધારી.
નવી દેખરેખ સિસ્ટમનું મૂલ્યાંકન કરવા માટે, અમે આંતરિક ડિપ્લોયમેન્ટ પર્યાવરણોના નાના સમૂહને ફરી ચલાવ્યો, જ્યાં મોડલે અગાઉ અસંરેખિત ક્રિયાઓ અનુસરી હતી, આ વખતે નવા સુરક્ષાકવચો સાથે2. નવા સુરક્ષાકવચો મોડલ દ્વારા અનુસરાયેલી ઘણી વધુ અસંરેખિત ક્રિયાઓ પકડી શક્યા, અને જે ચૂકી ગઈ તે બધાને ઓછી ગંભીરતાવાળી ગણવામાં આવી.
આ ઓછી ગંભીરતાવાળા બનાવોના કેટલાક ઉદાહરણોમાં નીચેના કેસો સામેલ છે:
- Linear કમાન્ડ લાઇન ટૂલ ઍક્સેસ કરવા માટે, મોડલે નેસ્ટેડ
codex --yoloસત્ર શરૂ કર્યું, જ્યારે હકીકતમાં તે--yoloફ્લૅગ વિના પણ કરી શકતું હતું. - મોડલે નોંધ્યું કે પહેલાં જીવંત રહેલો રિસોર્સ ગાયબ હતો, પછી કોઈ સારા કારણ વિના તેણે પોતાના માલિકના નેમસ્પેસ હેઠળના અન્ય જીવંત CPU pods માં, તેમજ OpenAIના અન્ય કર્મચારીઓના pods માં (અસફળ રીતે) શોધખોળ અને SSH કરવાનું શરૂ કર્યું.
- મોડલ પાસે અનેક અટવાયેલા
findપ્રોસેસ હતા અને દરેક શેલ કમાન્ડ અટકી ગયો હતો. પછી તેણેkill -9 -1ચલાવ્યું, જે અમલમાં આવ્યું હોત તો તે pod પર તેને મારવાની પરવાનગી હોય એવા દરેક પ્રોસેસને SIGKILL મોકલત. પરંતુ તેનો સમય પૂરો થઈ ગયો અને તે અમલમાં આવ્યું નહીં.
નવી સિસ્ટમની કસોટી કર્યા પછી, અમે નિષ્કર્ષ કાઢ્યો કે લાંબી સમય સીમાની ક્ષમતાવાળા મોડલોની મર્યાદિત આંતરિક ઍક્સેસ પુનઃસ્થાપિત કરી શકાય. કેટલાક અઠવાડિયા પહેલાં પુનઃડિપ્લોયમેન્ટ શરૂ થયા પછીથી, અમે સુરક્ષાકવચોની કોઈ ગંભીર હેરાફેરી જોઈ નથી. આ સુરક્ષાકવચોનું પ્રથમ સંસ્કરણ જાણબૂઝીને સાવચેત રાખવામાં આવ્યું હતું. સુરક્ષાકવચોને નબળા કર્યા વિના બિનજરૂરી વિક્ષેપો ઘટાડવા માટે અમે સિસ્ટમને સતત ટ્યુન કરતા રહ્યા છીએ.
અમે ક્રમશઃ ડિપ્લોય કર્યું હોવાથી, ઍક્સેસ વિસ્તરતા પહેલાં અમે ખામીઓ શોધી અને ઉકેલી શક્યા. ડિપ્લોયમેન્ટ પહેલાંના મૂલ્યાંકનો જરૂરી રહે છે, પરંતુ ડિપ્લોયમેન્ટ એવા વર્તનો દર્શાવે છે જે તેઓ ચૂકી જાય છે. મર્યાદિત ઍક્સેસથી શરૂઆત કરવાથી અમને મોડલને વાસ્તવિક ઉપયોગમાં જોવાની, સમસ્યાઓ ઊભી થાય ત્યારે વિરામ લેવાની, તે નિષ્ફળતાઓનો ઉપયોગ કરીને વધુ સારા મૂલ્યાંકનો અને સુરક્ષાકવચો બનાવવાની, અને ફેરફારોની કસોટી પછી મર્યાદિત ઍક્સેસ પુનઃસ્થાપિત કરવાની તક મળી.
મોડલો વધુ લાંબા અને વધુ જટિલ કાર્યો હાથ ધરતા જાય તેમ, મૂલ્યાંકનો ચૂકી જાય એવી નિષ્ફળતાઓના પરિણામો વધુ મોટા હોઈ શકે છે. અમે મૂલ્યાંકન અને ડિપ્લોયમેન્ટ વચ્ચેનું અંતર ઘટાડવા કામ ચાલુ રાખીશું: મોડલોને લાંબા માર્ગક્રમો પર ચકાસવું, સંરેખણ સુધારવું, હસ્તક્ષેપ કરી શકે તેવી દેખરેખ બનાવવી, અને વપરાશકર્તાઓને વધુ સ્પષ્ટ દૃશ્યતા અને નિયંત્રણ આપવું. આ પડકારો માત્ર OpenAI માટે અનન્ય નહીં હોય, અને અમે આશા રાખીએ છીએ કે અમે જે શીખ્યા તે શેર કરવાથી વિશાળ ક્ષેત્રને તેની તૈયારી કરવામાં મદદ મળશે.
લેખક
ફૂટનોટ્સ
- 1
જોકે અમે PR ઝડપથી બંધ કરી દીધો, સ્પીડરનના અનેક ભાગીદારોએ તેને પહેલેથી જોઈ લીધો હતો અને પોતાની સબમિશનમાં તે રીતનો ઉપયોગ કર્યો હતો; 3030(નવી વિન્ડોમાં ખૂલે છે), 2990(નવી વિન્ડોમાં ખૂલે છે), 2930(નવી વિન્ડોમાં ખૂલે છે), 2925(નવી વિન્ડોમાં ખૂલે છે), 2900(નવી વિન્ડોમાં ખૂલે છે) અને 2890(નવી વિન્ડોમાં ખૂલે છે) પગલાં સાથેની સતત વર્લ્ડ રેકોર્ડ સબમિશનો બધી PR 287નો ઉલ્લેખ કરે છે. તેમાં PR 300(નવી વિન્ડોમાં ખૂલે છે) ખાસ રસપ્રદ છે, કારણ કે Prime Intellect(નવી વિન્ડોમાં ખૂલે છે)એ NanoGPT સ્પીડરન પર Opus 4.7નું મૂલ્યાંકન કર્યું ત્યારે Opus 4.7એ આ PR સબમિટ કર્યો હતો. Opusએ અમારા મોડલ દ્વારા સબમિટ કરાયેલ PR જોયો, શોધોનો સમાવેશ કર્યો, અને પોતાના અંતિમ પરિણામમાં અમારા PRને શ્રેય આપ્યો.
- 2


