મોડલ મૂલ્યાંકન દરમિયાનની સુરક્ષા ઘટના સંબોધવા OpenAI અને Hugging Faceની ભાગીદારી
ગયા અઠવાડિયે, Hugging Faceએ તેમની ઇન્ફ્રાસ્ટ્રક્ચરમાં ઘૂસેલા એક કૃત્રિમ બુદ્ધિ એજન્ટને શોધી અને કાબૂમાં લીધા પછી એક નવા પ્રકારની સુરક્ષા ઘટના જાહેર કરી(નવી વિન્ડોમાં ખૂલે છે); વધતી સાઇબર-ક્ષમતા ધરાવતા મોડલોના પ્રસાર સાથે આવી ઘટનાઓ વધુ સામાન્ય બનશે એવી અમારી અપેક્ષા છે. તપાસ પછી, હવે અમને ખબર છે કે સાઇબર ક્ષમતાઓના બેન્ચમાર્ક(નવી વિન્ડોમાં ખૂલે છે) પર આંતરિક રીતે પરીક્ષણ કરતી વખતે આ ખાસ ઘટના OpenAI મોડલોના સંયોજનથી થઈ હતી — જેમાં GPT‑5.6 Sol અને તેનાથી પણ વધુ સક્ષમ પ્રી-રિલીઝ મોડલ સામેલ હતા, અને મૂલ્યાંકન હેતુઓ માટે બધામાં સાઇબર ઇનકારો ઘટાડવામાં આવ્યા હતા— જ્યારે સાયબર ક્ષમતાઓના બેન્ચમાર્ક પર તેમનું આંતરિક રીતે પરીક્ષણ કરવામાં આવી રહ્યું હતું.
અમે આ ઘટનાને અભૂતપૂર્વ સાઇબર ઘટના માનીએ છીએ, જેમાં અત્યાધુનિક સાઇબર ક્ષમતાઓ સામેલ છે, અને તે પ્રમાણે પ્રતિસાદ આપી રહ્યા છીએ. આ તબક્કે અમે પ્રાથમિક તારણો શેર કરી રહ્યા છીએ, જેથી રક્ષકોને શું થયું તે સમજવામાં અને મોડલો હવે શું કરી શકે છે તે વિશે યોગ્ય અંદાજ બાંધવામાં મદદ મળે. અમે Hugging Face સાથે મળીને સંપૂર્ણ તપાસ ચાલુ રાખીશું અને અમારી તપાસ પૂરી થશે ત્યારે ખામીઓ, ઘટના અને તારણો વિશે વધુ વિગતો શેર કરીશું.
આ ઘટના એક આંતરિક મૂલ્યાંકન દરમિયાન બની હતી, જે મોડલોને તેમની સાઇબર ક્ષમતાઓ માપવા માટે જટિલ હુમલા માર્ગોનો ઉપયોગ કરીને અદ્યતન દુરુપયોગ કરવાનો પ્રયાસ કરવા પ્રેરિત કરે છે. મોડલોને ઉચ્ચ-જોખમી સાઇબર પ્રવૃત્તિ કરવાથી અટકાવવા માટે વપરાતા પ્રોડક્શન વર્ગીકરણકારો વિના આ મૂલ્યાંકન ચલાવીને અમે મહત્તમ સાઇબર ક્ષમતાઓનો અંદાજ કરીએ છીએ. અમારા બેન્ચમાર્ક્સ અત્યંત અલગ પર્યાવરણમાં ચાલે છે, જેમાં નેટવર્ક ઍક્સેસ માત્ર આંતરિક રીતે હોસ્ટ કરાયેલા તૃતીય-પક્ષ સોફ્ટવેર મારફતે પેકેજ ઇન્સ્ટોલ કરવાની ક્ષમતા સુધી મર્યાદિત છે; આ સોફ્ટવેર પેકેજ રજિસ્ટ્રીઓ માટે પ્રોક્સી અને કૅશ તરીકે કામ કરે છે.
મોડલોએ OpenAIના સંશોધન પર્યાવરણ અને Hugging Faceની પ્રોડક્શન ઇન્ફ્રાસ્ટ્રક્ચરમાં ખામીઓ ઓળખી અને જોડીને Hugging Faceના પ્રોડક્શન ડેટાબેઝમાંથી સીધા પરીક્ષણ ઉકેલો મેળવ્યા. તમામ પુરાવા સૂચવે છે કે મોડલો ExploitGym માટે ઉકેલ શોધવામાં અત્યંત એકાગ્ર હતા અને એકદમ સાંકડા પરીક્ષણ લક્ષ્યને હાંસલ કરવા અતિશય પ્રયત્નો કરી રહ્યા હતા.
અમારા સેન્ડબોક્સ્ડ ટેસ્ટિંગ એન્વાયર્નમેન્ટમાં કાર્ય કરતી વખતે, અમારા મોડલ્સે મૂલ્યાંકનની સમસ્યાને ઉકેલવાના પ્રયાસરૂપે ઓપન ઇન્ટરનેટ ઍક્સેસ મેળવવાનો માર્ગ શોધવા માટે નોંધપાત્ર પ્રમાણમાં ઇન્ફરન્સ કમ્પ્યુટનો ઉપયોગ કર્યો. ઍક્સેસ મેળવવા માટે, મોડલોએ પેકેજ રજિસ્ટ્રી કૅશ પ્રોક્સીમાં ઝીરો-ડે ખામી ઓળખી અને તેનો દુરુપયોગ કર્યો (જે અમે હવે વેન્ડરને જવાબદારીપૂર્વક જાહેર કરી છે). આ ઍક્સેસ સાથે, અમારા મોડલોએ અમારા સંશોધન પરીક્ષણ પર્યાવરણમાં પ્રિવિલેજ એસ્કલેશન અને લેટરલ મૂવમેન્ટની શ્રેણીબદ્ધ ક્રિયાઓ કરી, જ્યાં સુધી મોડલો ઇન્ટરનેટ ઍક્સેસ ધરાવતા નોડ સુધી પહોંચ્યા નહીં.
ઇન્ટરનેટ ઍક્સેસ મળ્યા પછી, મોડલોએ અનુમાન લગાવ્યું કે Hugging Face કદાચ ExploitGym માટે મોડલો, ડેટાસેટ્સ અને ઉકેલો હોસ્ટ કરતું હશે. આ જાણીને, મોડલે મૂલ્યાંકનમાં છેતરપિંડી કરવા ઉપયોગી થઈ શકે તેવી ગુપ્ત માહિતી મેળવવાના માર્ગો શોધ્યા અને સફળતાપૂર્વક શોધી કાઢ્યા. એક ઉદાહરણમાં, મોડલે ચોરાયેલા ક્રેડેન્શિયલ્સ અને ઝીરો-ડે ખામીઓનો ઉપયોગ સહિત અનેક હુમલા વેક્ટરોને જોડીને Hugging Face સર્વરો પર રિમોટ કોડ એક્ઝિક્યુશનનો માર્ગ શોધ્યો. OpenAIની સુરક્ષા ટીમે આ અસામાન્ય પ્રવૃત્તિ આંતરિક રીતે શોધી કાઢી.
Hugging Faceની સુરક્ષા ટીમ અને એજન્ટોએ તેમની ઇન્ફ્રાસ્ટ્રક્ચર પર આ પ્રવૃત્તિ શોધી અને રોકી, અને અમારી ટીમો જોડાય તે પહેલાં જ તેઓ પોતાના ઓપન-સોર્સ મોડલો સાથે કન્ટેઇનમેન્ટ અને ફોરેન્સિક પુનર્નિર્માણ શરૂ કરી ચૂક્યા હતા. અમે ઘટનાની તપાસ ચાલુ રાખવા માટે તેમની સાથે સક્રિય રીતે કામ કરી રહ્યા છીએ. તપાસ અને ઉપચારમાં Hugging Faceના ઝડપી અને નજીકના સહયોગ માટે અમે આભારી છીએ.
- તપાસના ભાગરૂપે, ખામીઓ ઠીક થાય ત્યાં સુધી અમે સંશોધનની ગતિના ભોગે ઇન્ફ્રાસ્ટ્રક્ચર કન્ફિગરેશનમાં કડક નિયંત્રણો અમલમાં મૂકી રહ્યા છીએ. અમે આ નિયંત્રણો અને તેમની અસર વિશે અમારી સલામતી અને સુરક્ષા સમિતિને નિયમિત રીતે માહિતગાર કરી રહ્યા છીએ.
- અમે ઘટનાની ફોરેન્સિક તપાસ માટે Hugging Face સાથે કામ કરી રહ્યા છીએ.
- અમે આંતરિક રીતે હોસ્ટ કરાયેલા તૃતીય-પક્ષ સોફ્ટવેરમાં ઓળખાયેલી ઝીરો-ડે ખામી જવાબદારીપૂર્વક જાહેર કરી છે અને તેને ઠીક કરવા તેમની સાથે કામ કરી રહ્યા છીએ.
- અમે Hugging Faceને વિશ્વસનીય ઍક્સેસ પ્રોગ્રામમાં સામેલ કર્યું છે અને તેમની સુરક્ષા સુધારવા માટે અમારા મોડલોની ક્ષમતાઓનો ઝડપથી ઉપયોગ કરવામાં તેમની ટીમોને સહાય આપી રહ્યા છીએ.
- અમે ભવિષ્યની તાલીમ અને મૂલ્યાંકનો માટે વધુ મજબૂત સુરક્ષાઓ સુધારી અને ઉમેરી રહ્યા છીએ. આ અઠવાડિયે, અમે લાંબી સમય સીમાવાળા મોડલોના યુગમાં સલામતી અને સંરેખણ સુધારવા વિશે એક બ્લોગ પ્રકાશિત કર્યો. આ મૂલ્યાંકન સાઇબર ખામીઓનું પરીક્ષણ કરવા માટે હતું, તેથી આ ડિપ્લોયમેન્ટ સુરક્ષાઓ ઇરાદાપૂર્વક ચાલુ કરવામાં આવી નહોતી. આ ઘટના બતાવે છે કે અમારે અમારા મોડલનું સંરેખણ, મૂલ્યાંકન સમયે સાઇબર સુરક્ષાઓ અને આંતરિક પરીક્ષણ દરમિયાન મોનિટરિંગ વધુ મજબૂત કરવાની જરૂર છે.
જેમ અમે તાજેતરમાં જણાવ્યું હતું, કૃત્રિમ બુદ્ધિ ખામીઓ શોધવા અને તેમનો દુરુપયોગ કરવાની ગતિ વધારી રહી છે. આ ઘટનામાંથી મુખ્ય પાઠ એ છે કે મોડલની સુરક્ષા અને સલામતીએ ઝડપથી વધતી ક્ષમતાઓની સાથે ગતિ જાળવવી જ જોઈએ. અમે મોડલ વિકાસ દરમિયાન વપરાતી કન્ટેઇનમેન્ટ, મોનિટરિંગ, ઍક્સેસ નિયંત્રણો અને મૂલ્યાંકન પદ્ધતિઓ મજબૂત કરી રહ્યા છીએ.
UK AISIનું મૂલ્યાંકન બતાવે છે કે GPT‑5.6 Sol જેવા મોડલો લાંબી સમય સીમામાં જટિલ, બહુ-પગલાંવાળી સાઇબર કામગીરી જાળવી રાખવામાં વધુને વધુ સક્ષમ બની રહ્યા છે. આ ઘટના સૂચવે છે કે આ સૈદ્ધાંતિક ક્ષમતાઓ વાસ્તવિક પરિસ્થિતિઓમાં પણ લાગુ પડે છે.

આ ઘટના એ પણ સ્પષ્ટ કરે છે કે અદ્યતન મોડલો સોર્સ-કોડ ઍક્સેસ વિના વાસ્તવિક સિસ્ટમોમાં નવા હુમલા માર્ગો શોધી અને તેમનો દુરુપયોગ કરી શકે છે. તે દર્શાવે છે કે અદ્યતન સાઇબર ક્ષમતાઓ વધુ મજબૂત સુરક્ષાઓ અને રક્ષણાત્મક સાધનો સાથે વિકસાવવી જરૂરી છે.
અમારું માનવું છે કે અદ્યતન સાઇબર ક્ષમતા ધરાવતા મોડલોએ સુરક્ષા ટીમોને હુમલાખોરો પહેલાં નબળાઈઓ શોધવામાં, ખામીઓ કેવી રીતે એકબીજા સાથે જોડાઈ શકે તે સમજવામાં અને મશીનની ઝડપે તેનો ઉપાય કરવામાં મદદ કરવી જોઈએ. અમે આ ક્ષમતાઓનો ઉપયોગ ઇન્ફ્રાસ્ટ્રક્ચર કન્ફિગરેશન અને મોડલ મૂલ્યાંકન પર્યાવરણોની આસપાસની સુરક્ષાઓ સતત મજબૂત કરવા માટે કરી રહ્યા છીએ; શીખતા જઈશું તેમ અમે અમારા તારણો અને શ્રેષ્ઠ પદ્ધતિઓ શેર કરીશું. અમે અન્ય રક્ષકોને વિશ્વસનીય ઍક્સેસ માટે અરજી કરવા અને આ મોડલો સાથે અત્યારે જ પ્રયોગ કરવા પ્રોત્સાહિત કરીએ છીએ, જેથી આ ક્ષમતાઓને વધુ સારી અટકાયત, ઝડપી શોધ અને વધુ અસરકારક ઘટના પ્રતિસાદમાં ફેરવી શકાય.
“આ અને અન્ય વિષયો પર OpenAI સાથેના સહયોગ માટે અમે આભારી છીએ. આ ઘટના, કદાચ પોતાની જાતની પહેલી, એ વાત સાબિત કરે છે જે અમે લાંબા સમયથી માનીએ છીએ: કૃત્રિમ બુદ્ધિની સલામતી કોઈ એક કંપની ગુપ્ત રીતે કામ કરીને ઉકેલી શકશે નહીં. તેનો ઉકેલ ખુલ્લેઆમ અને સહયોગથી આવશે, જેમાં દરેક જગ્યાના દરેક રક્ષકને કૃત્રિમ બુદ્ધિની વ્યાપક ઍક્સેસ મળશે.”


