મુખ્ય વિષય-સામગ્રી પર જાવો
OpenAI

18 ઑગસ્ટ, 2026

કંપનીપ્રકાશન

સાયબર-નિર્ણાયક ક્ષમતાના યુગમાં મોડલ વિકાસની ગતિ

લોડિંગ…

છેલ્લા કેટલાક અઠવાડિયામાં બે ઘટનાક્રમોએ વધુને વધુ સક્ષમ બનતી AI પ્રણાલીઓ સાથે સંકળાયેલા વધતા જોખમોને ઉજાગર કર્યાં છે: OpenAI-Hugging Face ઘટના અને, તેનાથી અલગ, પ્રારંભિક પુરાવા કે અમારું આગામી મોડલ Astra અમારા પ્રિપેરડનેસ ફ્રેમવર્ક હેઠળની નિર્ણાયક સાયબર સુરક્ષા ક્ષમતાની મર્યાદાએ પહોંચી શકે છે. આ બંને ઘટનાક્રમો અને અમારા આંતરિક સંશોધનમાં થયેલી ઝડપી પ્રગતિએ તાલીમ પ્રક્રિયાના તમામ તબક્કે દેખરેખ, સંરેખણ અને નિયંત્રણ માટેનાં સુરક્ષા ઉપાયો મજબૂત કરવાના અમારા કાર્યને વધુ તાત્કાલિક બનાવ્યું છે.

મોડલ વધુ સક્ષમ બનતાં જાય છે તેમ તેમ તેમને આંતરિક રીતે વિકસાવવા અને ચકાસવા સાથે સંકળાયેલાં જોખમો પણ વધે છે. દેખરેખ, સંરેખણ અને સુરક્ષા માટેનાં અમારાં ધોરણો એ જોખમોથી હંમેશાં આગળ રહેવાં જોઈએ. અમે એ ધોરણો પૂરાં કરવા જરૂરી સમય લેવા માગતા હતા, તેથી અમે ક્ષમતા વધારવાની ગતિ અસ્થાયી રીતે ધીમી કરી. આ અંતર્ગત, ઉપયોગમાં મૂકવા માટેનાં અમારાં નવીનતમ મોડલ પર રીઇન્ફોર્સમેન્ટ લર્નિંગ (RL) તાલીમ બે અઠવાડિયાં માટે અટકાવવામાં આવી હતી. આ દરમિયાન અમે અમારા સંશોધન વાતાવરણને વધુ સુરક્ષિત બનાવ્યું, તેની પ્રતિકૂળ પરીક્ષા કરી અને દેખરેખ પ્રણાલીઓનો વ્યાપ વધાર્યો. અમારી સૌથી મોટી આયોજિત અત્યાધુનિક RL તાલીમ હાલ પણ અટકેલી છે. આગળ વધતાં પહેલાં અમે નાના પાયે તાલીમ અને મૂલ્યાંકન કરીને મોડલની વર્તણૂકનું આકલન, સુરક્ષા ઉપાયોની ચકાસણી અને સંરેખણના વધુ પુરાવા સ્થાપિત કરી રહ્યા છીએ.

સંરેખણ એટલે AI પ્રણાલીઓ ઇચ્છિત રીતે વર્તે અને માનવીય દેખરેખને પ્રતિસાદ આપે તે સુનિશ્ચિત કરવાનું કાર્ય. તે લાંબા સમયથી અમારા સંશોધન કાર્યક્રમના કેન્દ્રમાં રહ્યું છે. ચાલુ સંશોધન અને મૂલ્યાંકનોને આધારે હવે અમે સમગ્ર તાલીમ દરમિયાન સંરેખિત વર્તણૂકના વધુ મજબૂત પુરાવા ફરજિયાત કર્યા છે. વધુને વધુ સક્ષમ બનતી પ્રણાલીઓને સંરેખિત રાખવાનો પડકાર સમગ્ર ક્ષેત્રે ઉકેલવો પડશે. આગામી મોડલની પ્રગતિમાંથી મળતા સંકેતો સ્પષ્ટ કરે છે કે અમારે વધુ વ્યાપક અભિગમની જરૂર છે, જે વર્તમાન પ્રિપેરડનેસ ફ્રેમવર્ક પર આધારિત હોવા ઉપરાંત તેનાથી આગળ પણ જાય.

અમારો અભિગમ કેવી રીતે બદલાઈ રહ્યો છે તે વિશે પારદર્શક રહેવું અમને મહત્ત્વપૂર્ણ લાગે છે. નીચે અમે અમારી સંશોધન પ્રક્રિયાઓ અને માળખામાં કરેલા ફેરફારો તેમજ હજી ચાલી રહેલા કાર્યનું વર્ણન કરીએ છીએ.

વધુ સક્ષમ મોડલ માટે સુરક્ષા ઉપાયો મજબૂત કરવા

વધુ સક્ષમ મોડલ વિકસાવવાનો અમારો અભિગમ એકબીજાને મજબૂત કરતા ત્રણ સુરક્ષા ઉપાયો પર આધારિત છે:

  1. દેખરેખ, જે ચિંતાજનક વર્તણૂક શોધીને અમને તેનો પ્રતિસાદ આપવા સક્ષમ બનાવે છે.
  2. સંરેખણ, જે હાનિકારક અથવા અનધિકૃત પગલાંની સંભાવના ઘટાડે છે.
  3. સુરક્ષા ઉપાયો, જે AI પ્રણાલીઓ શેનો ઉપયોગ કરી શકે અથવા શેને અસર કરી શકે તે મર્યાદિત કરે છે.

અમને અપેક્ષા છે કે ટૂંક સમયમાં અન્ય મોડલ સામે રક્ષણ સહિતનું મોટાભાગનું સુરક્ષા કાર્ય મોડલ સંભાળશે. આનાથી ત્રણેય સુરક્ષા ઉપાયો મોડલની ક્ષમતા સાથે વિસ્તારી શકાશે, જેને અમે અત્યંત મહત્ત્વપૂર્ણ માનીએ છીએ.

અમે આ સુરક્ષા ઉપાયો સંશોધન અને ઉપયોગ બંનેમાં લાગુ કરીએ છીએ અને દરેક મોડલની ક્ષમતાઓ, કાર્યકારી વાતાવરણ તથા જોખમના સ્તર અનુસાર તેમને અનુકૂળ બનાવીએ છીએ.

અમારા સંશોધન વાતાવરણને સુરક્ષિત બનાવવું

અત્યાધુનિક મોડલની સાયબર સુરક્ષા ક્ષમતાઓ વધતાં અમે તેમને તાલીમ અને મૂલ્યાંકન આપતા વાતાવરણ માટેનાં સુરક્ષા ધોરણો વધારી રહ્યા છીએ. આ ધોરણો પૂરાં કરવા નોંધપાત્ર ઇજનેરી કાર્ય જરૂરી બન્યું છે તથા અત્યાધુનિક સંશોધનમાં મોટો ખર્ચ અને વિલંબ થયો છે. OpenAI-Hugging Face ઘટના* પછી તરત જ અમે એવા સંશોધન ક્લસ્ટરમાં અત્યાધુનિક મોડલનું અનુમાન અટકાવ્યું, જ્યાં પ્રક્રિયાઓ કોડ ચલાવી શકતી હતી અથવા ઇન્ટરનેટ વાપરી શકતાં સાધનોનો ઉપયોગ કરી શકતી હતી. અમે કોડ ચલાવવા માટેનો વધુ મર્યાદિત અને સુરક્ષિત માર્ગ ઘણો ઝડપથી પુનઃસ્થાપિત કર્યો. ત્યાર બાદ દરેક કાર્યભાર સુરક્ષિત રીતે ફરી શરૂ થઈ શકે છે કે નહીં તે અલગથી તપાસ્યું. કેટલાક સંશોધન કાર્યભાર આ નવા નિયંત્રણો હેઠળ ફરી શરૂ થયા, જ્યારે અન્ય માટે વધારાના ફેરફારો જરૂરી હતા.

ત્યાર પછીનાં અઠવાડિયાંમાં અમે અત્યાધુનિક સંશોધન કાર્યભાર માટે વધુ કડક સુરક્ષા આવશ્યકતાઓ નિર્ધારિત કરી અને તેમનો અમલ શરૂ કર્યો છે. ઉદાહરણ તરીકે:

  • કાર્યભારનું અલગીકરણ: મોડલે બનાવેલો અથવા અન્યથા અવિશ્વસનીય કોડ ચલાવતા કાર્યભાર માટે હવે અમે વધુ મજબૂત અલગીકરણ એટલે કે “અલગ સુરક્ષિત વાતાવરણ” ફરજિયાત બનાવ્યું છે. મોડલનાં પરિણામો પર પ્રક્રિયા કરતી વખતે જોખમમાં મુકાઈ શકે એવા સૉફ્ટવેરને પણ આ લાગુ પડે છે.
  • નેટવર્કનું અલગીકરણ: વધુ જોખમી અને અવિશ્વસનીય કાર્યભારને ઇન્ટરનેટથી અલગ રાખવા અમે વધુ નિયંત્રણો લાગુ કર્યાં છે. અમે આ નિયંત્રણો એવી રીતે રચ્યાં છે કે કોઈ એક કાર્યભાર અથવા સહાયક સેવા જોખમમાં મુકાય તો માત્ર તેના કારણે ઇન્ટરનેટ કે અન્ય આંતરિક નેટવર્કમાં અનધિકૃત પ્રવેશ ન મળી શકે.
  • સતત સુરક્ષા પરીક્ષણ: સંભવિતપણે અસુરક્ષિત સહિયારી સેવાઓ દૂર કરવા, કાયમી વિશેષાધિકારો ઘટાડવા અને સુરક્ષા તથા વિશ્વાસની સીમાઓ સુધારવા અમે અમારા વાતાવરણની પુનઃગોઠવણી કરી છે. અમે સુરક્ષા નોંધો એકત્ર કરવાની અને તેમની દેખરેખ રાખવાની અમારી ક્ષમતામાં પણ સુધારો કરી રહ્યા છીએ. અંતે, અમે કૃત્રિમ હુમલાઓ સામે આ સીમાઓની સતત ચકાસણી કરવા અમારા મોડલનો ઉપયોગ કરીને સ્વચાલનમાં રોકાણ કરી રહ્યા છીએ.

આ નિયંત્રણો સાથે મળીને બહુસ્તરીય સુરક્ષા પૂરી પાડે છે અને અમારા સંશોધન વાતાવરણને હુમલાઓથી બચાવવામાં મદદ કરે છે. Astra મોડલમાં નિર્ણાયક સ્તરની સાયબર ક્ષમતા હોઈ શકે છે એવું અમે નક્કી કર્યું હોવાથી હાલમાં Astra અથવા સાયબર મોડલ સાથે સંકળાયેલા કાર્યભાર માટે સૌથી કડક સુરક્ષા ઉપાયો ફરજિયાત છે. આ સુરક્ષા ઉપાયો સાયબર સંબંધિત અન્ય તમામ કાર્યભારને પણ લાગુ પડે છે.

Astraની કેટલીક તાલીમ અને મૂલ્યાંકન આ આવશ્યકતાઓ પૂરાં કરે છે, પરંતુ મોટી સંખ્યામાં કાર્યભારને સંપૂર્ણપણે નવા વાતાવરણમાં ખસેડીને નવા સુરક્ષા ધોરણ મુજબ મજબૂત ન કરાય ત્યાં સુધી તે અટકેલા રહેશે. અમે સલામતી અને સંરેખણ સંબંધિત કાર્યભારને સૌથી પહેલાં આ નવા વાતાવરણમાં ખસેડવાની પ્રાથમિકતા આપી રહ્યા છીએ.

ચેન-ઓફ-થોટની દેખરેખનો વિસ્તાર

આંતરિક કોડિંગ એજન્ટોની દેખરેખ અને લાંબા સમય સુધી ચાલતા સત્રો સહિતની દેખરેખ લાંબા સમયથી અમારી મોડલ વિકાસ પ્રક્રિયાનો મહત્ત્વપૂર્ણ ભાગ રહી છે. અમારા દેખરેખના પ્રયાસો ખાસ કરીને અત્યાધુનિક મોડલના આંતરિક ઉપયોગ અને અત્યાધુનિક RL તાલીમ પર કેન્દ્રિત હતા. અમે તેમને સૌથી વધુ જોખમી કાર્યભાર માનતા હતા, કારણ કે તેમાં અદ્યતન મોડલ ક્ષમતાઓ સાથે સાધનો, સંવેદનશીલ પ્રણાલીઓ અને આંતરિક કે બાહ્ય નેટવર્કનો ઉપયોગ જોડાઈ શકે છે. સાધનોનો ઉપયોગ કરતી તમામ અનુમાન અને તાલીમ પ્રક્રિયાઓ પર તે લાગુ કરાયા નહોતા. અમારી નવી દેખરેખ વ્યવસ્થા સાથે અમે અમારા અભિગમમાં સુધારો કરીને તેનો વિસ્તાર કર્યો છે.

આ નવી દેખરેખ વ્યવસ્થા બહુતબક્કીય છે. તે સક્રિયતા વર્ગીકરણકારોથી શરૂ થાય છે, જે મોડલની આંતરિક પ્રવૃત્તિ તપાસતા શોધકો છે. તેઓ નમૂના તરીકે લેવાતા દરેક ટોકન પર કાર્ય કરે છે અને સંભવિત ચિંતાઓને ક્રમશઃ વધુ અદ્યતન તથા વધુ ગણનાશક્તિ વાપરતા સ્વચાલિત તપાસકર્તાઓ સુધી પહોંચાડે છે. આ પ્રણાલીઓ અનધિકૃત પ્રવેશ, માહિતીની ચોરી, વિનાશક વર્તણૂક અને સુરક્ષા ઉપાયો નિષ્ફળ કરવાના પ્રયાસો શોધવા માટે સાધનો દ્વારા લેવાયેલાં પગલાં, ઉપલબ્ધ રિઝનિંગ અને પ્રવૃત્તિનો સંપૂર્ણ ક્રમ તપાસે છે. અમારી દેખરેખ પ્રણાલી દ્વારા ચિંતાજનક પ્રવૃત્તિ સામે આવ્યા પછી 30 મિનિટમાં ચેતવણી આપવાનું અમારું લક્ષ્ય છે. જો દેખરેખ પ્રણાલી નિર્ણાયક સુરક્ષા સીમાના સંભવિત ઉલ્લંઘનને ઓળખે, તો તે સર્વોચ્ચ પ્રાથમિકતાની ચેતવણી આપે છે. અમારા વર્તમાન અમલીકરણમાં સલામતી, સુરક્ષા અને સંશોધન ટીમોને તાત્કાલિક સૂચના મોકલવામાં આવે છે. જો તેઓ 30 મિનિટમાં નિશ્ચિતપણે નક્કી ન કરી શકે કે ચિહ્નિત કરાયેલી ઘટના ખોટી ચેતવણી છે, તો આ ટીમોએ તે પ્રવૃત્તિ અટકાવવાની હોય છે.

Sol જેટલી કે તેનાથી વધુ ક્ષમતા ધરાવતા મોડલ માટે સાધનો સાથે સંકળાયેલી તમામ RL તાલીમ અને મૂલ્યાંકનમાં આ દેખરેખ ફરજિયાત છે. 7 ઑગસ્ટે Astraમાં નિર્ણાયક સાયબર ક્ષમતાઓ હોઈ શકે છે એવું નક્કી કર્યા પછી અમે સાધનો સાથે Astraના તમામ અનુમાન માટે વધારાની દેખરેખ ફરજિયાત કરી, માત્ર RL તાલીમ અને મૂલ્યાંકન માટે જ નહીં.

આ સુરક્ષા ઉપાયો માટે નોંધપાત્ર ગણનાશક્તિ જરૂરી છે. અમારા વર્તમાન અંદાજ મુજબ દેખરેખ માટેની વધારાની ગણનાશક્તિ દેખરેખ હેઠળની અનુમાન ગણનાશક્તિના આશરે 20% જેટલી છે, જોકે વિવિધ તાલીમ અને મૂલ્યાંકન કાર્યભાર વચ્ચે ખર્ચ ઘણો બદલાય છે. અમે આગામી બ્લૉગ લેખમાં આ પ્રણાલી વિશે વધુ વિગતો રજૂ કરીશું.

સંરેખણ સંશોધનને આગળ વધારવું

સંરેખણ સંશોધન અમારા ધ્યેયના કેન્દ્રમાં છે. આર્ટિફિશિયલ જનરલ ઇન્ટેલિજન્સ સમગ્ર માનવજાતને લાભ આપે તે સુનિશ્ચિત કરવું અમારું ધ્યેય છે. મોડલ સાયબર હુમલા કરવાની ક્ષમતા જેવી અદ્યતન ક્ષમતાઓ મેળવે અને વધુ જટિલ વાતાવરણમાં કાર્ય કરે તેમ રિવોર્ડ હેકિંગ, છેતરપિંડી કે અનધિકૃત પ્રવેશ જેવી અસંરેખિત વર્તણૂકો વધુ ગંભીર જોખમ ઊભું કરશે. રિવોર્ડ હેકિંગ એટલે તાલીમમાં ઇચ્છિત પરિણામ ખરેખર મેળવ્યા વિના ઊંચું પારિતોષિક મેળવવાના રસ્તા શોધવા.

સૌથી સક્ષમ મોડલની RL પ્રક્રિયાઓમાં હવે અમે તાલીમના વધુ તબક્કે અમારી મુખ્ય સંરેખણ તકનીકો લાગુ કરી રહ્યા છીએ. આમાં વિવિધ કાર્યો અને વાતાવરણમાં અસુરક્ષિત વર્તણૂકને વધુ સારી રીતે શોધવા તથા રોકવા માટે પારિતોષિક મોડલ સુધારવાં, મોડલને તેમનાં પગલાં, ક્ષમતાઓ અને મર્યાદાઓ વિશે વધુ પ્રામાણિક રહેવાની તાલીમ આપવી તથા પારિતોષિક, મૂલ્યાંકનકાર, સાધનો કે દેખરેખની નબળાઈનો લાભ લેતી વર્તણૂક ઘટાડવી સામેલ છે. મોડલ બાહ્ય પ્રણાલીઓ અથવા સંસાધનો સાથે ક્રિયાપ્રતિક્રિયા કરે ત્યારે નુકસાન કરી શકે એવી વર્તણૂકો માટે અમે તાલીમનો વ્યાપ પણ વધારી રહ્યા છીએ.

અમે સંરેખણ સંશોધનમાં મોટા પાયે રોકાણ ચાલુ રાખી રહ્યા છીએ, મૂલ્યાંકનનો વ્યાપ વધારી રહ્યા છીએ અને શીખેલી બાબતોનો ઉપયોગ તાલીમ તથા સુરક્ષા ઉપાયોને દિશા આપવા કરી રહ્યા છીએ. મોડલની વર્તણૂક વિશે અમે શું શીખી રહ્યા છીએ અને અમને મળતા કોઈ પણ નવા પડકારો સહિત અમારા સંરેખણ સંશોધન વિશે નજીકના ભવિષ્યમાં ઘણી વધુ માહિતી વહેંચવાની અમારી યોજના છે.

આગળ શું થશે

તાલીમ અને ઉપયોગના તમામ તબક્કે આ સુરક્ષા ઉપાયોને એકસાથે લાવવા તથા ભાવિ મોડલની ક્ષમતાઓ અને તેમના કાર્યકારી વાતાવરણને વધુ સારી રીતે પ્રતિબિંબિત કરવા અમે અમારા પ્રિપેરડનેસ ફ્રેમવર્કને વિકસાવીશું. આ ક્ષમતાઓ સાથે વિસ્તરી શકે એવી પદ્ધતિઓ વિકસાવવા માટે મોડલ-સહાયિત સુરક્ષામાં સતત રોકાણ, વધુ અસરકારક દેખરેખ અને સંરેખણ સંશોધનમાં અવિરત પ્રગતિ જરૂરી બનશે. અમારો અભિગમ વિકસે તેમ અમે બાહ્ય સંસ્થાઓને સામેલ કરવા અને અમે શીખેલી વધુ બાબતો શેર કરવા ઇચ્છીએ છીએ.

અત્યાધુનિક મોડલની ક્ષમતાઓ ઝડપથી વધી રહી છે. તેમને સમજવાની, સંરેખિત કરવાની અને સુરક્ષિત રાખવાની અમારી ક્ષમતા તેનાથી આગળ રહેવી જોઈએ.


*આગામી અઠવાડિયાંમાં અમે શીખેલી બાબતોનો તકનીકી અહેવાલ પ્રકાશિત કરીશું.