મુખ્ય વિષય-સામગ્રી પર જાવો
OpenAI

30 સપ્ટેમ્બર, 2026

સુરક્ષા

સંકલિત મોડલ-ડિસ્ટિલેશન અભિયાનને અટકાવવું

લોડિંગ…

અમે તાજેતરમાં અમારા મોડલમાંથી સુરક્ષિત રিজনিং બહાર કાઢવા માટે રચાયેલું એક સંકલિત અભિયાન ઓળખીને અટકાવ્યું. તેની સૌથી પહેલી પ્રવૃત્તિ જુલાઈના પ્રથમ અઠવાડિયામાં જોવા મળી હતી. આ પ્રવૃત્તિ દુર્ભાવનાપૂર્ણ ડિસ્ટિલેશન સાથે મેળ ખાય છે: એટલે કે, એક મોડલનાં પરિણામો અથવા રিজনিংનો વ્યવસ્થિત અને અનધિકૃત ઉપયોગ કરીને બીજા મોડલને તાલીમ આપવામાં, તેની ક્ષમતાઓનું પુનઃનિર્માણ કરવામાં અથવા તેને સુધારવામાં મદદ કરવી. સુરક્ષિત રিজনিং એ કોઈ કાર્ય ઉકેલતી વખતે મોડલ રાખે છે તે આંતરિક નોંધ છે. તેને બહાર કાઢવાથી અંતિમ જવાબમાં ન અપાયેલી માહિતી જાહેર થઈ શકે છે અને અન્ય લોકોને મોડલની ક્ષમતાઓનું પુનઃનિર્માણ કરવામાં મદદ મળી શકે છે.

આ પ્રવૃત્તિ ચલાવનારાઓએ અમારું એન્ક્રિપ્શન તોડ્યું નહોતું, કોઈ ડેટાબેઝમાં ઘૂસણખોરી કરી નહોતી કે સંગ્રહિત વપરાશકર્તા વાતચીતોની સીધી ઍક્સેસ મેળવી નહોતી. તેના બદલે, તેમણે મોડલ સાથેની ક્રિયાપ્રતિક્રિયાઓમાં એવી ચાલાકી કરી કે સુરક્ષિત રিজনিং વિનંતી કરનારને દેખાય તેવા સ્વરૂપમાં ફરી રજૂ થઈ શકે. આ કામ સંકલિત રીતે અને મોટા પાયે કરવામાં આવ્યું હતું, જે અમારી સેવાની શરતોનું ઉલ્લંઘન હતું. આવી ચાલાકી શક્ય બનાવતી નબળાઈ માત્ર OpenAIનાં મોડલ પૂરતી મર્યાદિત નથી. દુર્ભાવનાપૂર્ણ ડિસ્ટિલેશન સામે સામૂહિક સંરક્ષણ મજબૂત કરવા માટે અમે અત્યાધુનિક મોડલ ફોરમ મારફતે ઉદ્યોગના ભાગીદારો સાથે તેની માહિતી વહેંચી છે.

આ માહિતી પ્રકાશિત કરતાં પહેલાં, અમે તેના વ્યાપ અને સંભવિત અસરની તપાસ કરી, અમારા પોતાના નિવારક ઉપાયો અમલમાં મૂક્યા અને સંશોધકો તથા ઉદ્યોગના ભાગીદારો સાથે માહિતી વહેંચીને તેમનો પ્રતિસાદ મેળવ્યો. આનો હેતુ આ પ્રકારના હુમલા સામે સુરક્ષાના ઉપાયો અમલમાં હોય તેની ખાતરી કરવાનો હતો. વધારાના નિવારક ઉપાયો અને તપાસનું કામ ચાલુ છે. અમારું માનવું છે કે અમે જે શીખ્યા છીએ તે અત્યારે વહેંચવાથી આ ક્ષેત્રનું વ્યાપક તંત્ર પોતાનું સંરક્ષણ મજબૂત કરી શકશે.

અમને શું જોવા મળ્યું

અમે આ પ્રવૃત્તિ ચલાવનારાઓને નવી રીતોથી સુરક્ષિત રিজনিং બહાર કાઢવાનો પ્રયાસ કરતા જોયા. તેમાં એક વાતચીતમાંથી એન્ક્રિપ્ટ કરેલું રিজনিং નકલ કરીને બીજી વાતચીતમાં મોડલને તે ડિક્રિપ્ટ કરવા અને છુપાયેલી રিজনিং સામગ્રી લખી આપવા કહેવાનો પણ સમાવેશ થતો હતો.

સ્વતંત્ર સુરક્ષા સંશોધકોએ⁠(નવી વિન્ડોમાં ખૂલે છે) પણ જવાબદારીપૂર્વક જાણ કરીને વિવિધ મોડલ વચ્ચેના ઉપયોગ અને વાતચીતના કૉમ્પેક્શન સાથે સંકળાયેલી નબળાઈઓ અમારા ધ્યાન પર લાવી હતી. અમે તેમના તારણોની તપાસ કરી અને પુષ્ટિ કરી કે તેમણે ઓળખેલા માર્ગો દ્વારા ખરેખર હુમલા થઈ શકે છે. તેમના કામથી અમને આ પ્રકારના હુમલાઓનો વ્યાપ વધુ સારી રીતે સમજવામાં અને નિવારક ઉપાયો ઝડપથી અમલમાં મૂકવામાં મદદ મળી.

આ પ્રવૃત્તિ 1 જુલાઈએ શરૂ થઈ હતી અને શરૂઆતમાં તેનું પ્રમાણ ઓછું હતું. પછી 24 અને 25 જુલાઈએ અમને તેમાં મોટો ઉછાળો જોવા મળ્યો: 4,000થી વધુ વપરાશકર્તાઓએ માહિતી બહાર કાઢવાની સંબંધિત પદ્ધતિનો ઉપયોગ કરીને 16,000 વિનંતીઓ1 કરી હતી. વધુ તપાસમાં 15,000થી વધુ વપરાશકર્તાઓના એક જૂથમાં સંબંધિત પ્રોમ્પ્ટ પદ્ધતિનો ઉપયોગ કરતી પ્રવૃત્તિ મળી આવી, જેને અમે 28 જુલાઈ સુધીમાં સંપૂર્ણપણે અટકાવી દીધી.

સમય જતાં આ પ્રવૃત્તિનું સ્વરૂપ બદલાતું ગયું. આથી વધુ સ્પષ્ટ થયું કે દુર્ભાવનાપૂર્ણ ડિસ્ટિલેશન એક વ્યાપક સુરક્ષા પડકાર છે, જેના માટે બહુસ્તરીય અને બદલાતા સંજોગોને અનુરૂપ સંરક્ષણ જરૂરી છે.

આ પ્રવૃત્તિ પાછળ કોણ હતું તે અંગે અમારું મૂલ્યાંકન

સંબંધિત સમયગાળા દરમિયાન અમને જોવા મળેલા તમામ સંચાલકો એક જ પક્ષ સાથે જોડાયેલા હતા કે નહીં તે સ્પષ્ટ નથી. જોકે, અમારા મૂલ્યાંકન મુજબ આ પ્રવૃત્તિના એક મુખ્ય જૂથ પાછળ કિમીના વિકાસકર્તા મૂનશૉટ એઆઈ સાથે સંકળાયેલી વ્યક્તિઓ હતી.

આ શા માટે મહત્વનું છે

દુર્ભાવનાપૂર્ણ ડિસ્ટિલેશન સલામતી અને રાષ્ટ્રીય સુરક્ષા માટે જોખમો ઊભાં કરે છે. બહાર કાઢેલા રিজনিংનો ઉપયોગ બીજા મોડલને તાલીમ આપવા માટે થઈ શકે છે, જેમાં મૂળ મોડલ વપરાશકર્તાઓને આપતાં પરિણામો પર લાગુ કરાયેલા સુરક્ષા ઉપાયો જાળવવામાં ન આવે. મોટા પાયે કરવામાં આવતું ડિસ્ટિલેશન સલામતીમાં એટલું જ રોકાણ કર્યા વિના અદ્યતન ક્ષમતાઓનું હસ્તાંતરણ પણ ઝડપી બનાવી શકે છે. મોડલ લાભદાયી અને હાનિકારક એમ બંને પ્રકારના ઉપયોગ ધરાવતાં ક્ષેત્રોમાં ક્ષમતાઓ મેળવે તેમ આ ચિંતાઓ વધુ ગંભીર બને છે.

આ જોખમ માત્ર OpenAI પૂરતું મર્યાદિત નથી. ઉપર જણાવ્યા મુજબ, આવી જ રીતો અન્ય અદ્યતન કૃત્રિમ બુદ્ધિમત્તા પ્રણાલીઓને પણ અસર કરી શકે છે. તેથી આ એક સહિયારો સુરક્ષા પડકાર છે, જેના માટે સમગ્ર ઉદ્યોગમાં સંકલન જરૂરી છે.

અમે કયા પગલાં લીધાં

અમે ખાતાં સામે નિયમભંગ બદલ કાર્યવાહી, તકનીકી નિયંત્રણો અને ભાગીદારો સાથેના સંકલન દ્વારા આ તાજેતરના ડિસ્ટિલેશન અભિયાનને કાબૂમાં લીધું. અમે છેતરપિંડી કરતાં ખાતાં પર પ્રતિબંધ મૂક્યો અથવા તેમને મર્યાદિત કર્યાં, નોંધણી અને માળખાગત સુવિધાઓનાં નિયંત્રણો મજબૂત બનાવ્યાં અને સંબંધિત નેટવર્ક પર દેખરેખ વધારી.

અમે વપરાશકર્તાઓ, કાર્યસ્થળો, સંસ્થાઓ અને મોડલનાં જુદાં જુદાં જૂથોમાં છુપાયેલા રিজনিং માટેના સુરક્ષા ઉપાયો પણ મજબૂત બનાવ્યા. અમે એવો માર્ગ બંધ કર્યો જેના દ્વારા કોઈ વ્યક્તિ પાસે બીજા વપરાશકર્તાનું એન્ક્રિપ્ટ કરેલું રিজনিং પહેલેથી હોય તો તે તેને ફરી રજૂ કરીને તેની સામગ્રી મેળવી શકતી હતી. ઉપરાંત, ક્રમશઃ મોકલાતાં પરિણામોમાંથી રিজনিং જાહેર થઈ શકે તેવા ભાગોને શોધીને રોકવા માટે તપાસો ઉમેરી. જ્યારે સંબંધિત પ્રવૃત્તિ તૃતીય-પક્ષ સેવાઓ મારફતે થવા લાગી, ત્યારે અમે તે સેવા પ્રદાતાઓ સાથે મળીને તેમાં સંકળાયેલાં ખાતાં ઓળખવા અને તેમની પ્રવૃત્તિ અટકાવવા કામ કર્યું.

છેલ્લે, અમે અત્યાધુનિક મોડલ ફોરમ અને માહિતીની આપલે માટેની યોગ્ય સરકારી વ્યવસ્થાઓ મારફતે સંબંધિત તારણો વહેંચ્યાં. આમ, અત્યાધુનિક મોડલના અન્ય વિકાસકર્તાઓ અને જાહેર ક્ષેત્રના ભાગીદારો આવી પ્રવૃત્તિ શોધી શકે અને પોતાનું સંરક્ષણ મજબૂત કરી શકે. અન્યત્ર લઈ જઈ શકાય અથવા ફરી રજૂ કરી શકાય તેવી રিজনিং નોંધોને સમર્થન આપતી પ્રણાલીઓ પણ સંબંધિત જોખમોનો સામનો કરી શકે છે.

આગળનાં પગલાં

અત્યાધુનિક મોડલમાં સુધારો થાય અને તેમની ક્ષમતાઓની નકલ કરવા ઇચ્છતા લોકો સસ્તી રીતો શોધે તેમ દુર્ભાવનાપૂર્ણ ડિસ્ટિલેશનના પ્રયાસો વધુ જટિલ બનશે એવી અમારી અપેક્ષા છે. આ પ્રવૃત્તિ સામે સંરક્ષણ માટે બહુસ્તરીય નિયંત્રણો અને સતત અનુકૂલન જરૂરી છે.

આ કામ હજી પૂરું થયું નથી. ભાગીદારો દ્વારા હોસ્ટ કરાતી પ્રણાલીઓને અમારી પોતાની સેવાઓ જેવા જ સુરક્ષા ઉપાયોની જરૂર છે. સાધનોનાં પરિણામો મારફતે થતા હુમલા સામે એવા સુરક્ષા ઉપાયો જરૂરી છે જે સામાન્ય રીતે દેખાતા લખાણ ઉપરાંતની સામગ્રી પણ તપાસે. અમે સાધનોના સંરક્ષણ, વર્ગીકરણ પ્રણાલીઓના વ્યાપ અને મોડલની અયોગ્ય વિનંતીઓને નકારવાની ક્ષમતામાં સતત સુધારો કરી રહ્યા છીએ. સાથે જ, ક્લાઉડ ભાગીદારોમાં સંબંધિત નિયંત્રણોનો અમલ વિસ્તારી રહ્યા છીએ.

અમારી કાર્યવાહી ત્રણ ક્ષેત્રો પર કેન્દ્રિત રહેશે: માહિતી બહાર કાઢવા સામે વધુ મજબૂત તકનીકી સુરક્ષા, સંકલિત અભિયાનોની વધુ સારી ઓળખ અને તેમની સામે કાર્યવાહી, તથા ઉદ્યોગ અને સરકાર વચ્ચે જોખમોની માહિતીની વધુ વ્યાપક આપલે.

લેખક

OpenAI

પાદટીપો

  1. 1

    આ આંકડા માહિતી બહાર કાઢવાના પ્રયાસો દર્શાવે છે, જરૂરી નથી કે તે સફળ થયા હોય.