સારાંશ
સમસ્યા
નબળાઈઓ શોધવા અને અમારા મોડલની મજબૂતી સુધારવા માટે રેડ ટીમિંગ અનિવાર્ય છે. પરંતુ હાલના અભિગમો વિસ્તૃત થવા પાત્ર નથી, જેના કારણે અવરોધ ઊભો થાય છે.
સામાન્ય રીતે ઉપયોગમાં લેવાતા દૃઢતા મૂલ્યાંકનો અમારા નવીનતમ મોડલ દ્વારા પહેલેથી જ સંતૃપ્ત થઈ ગયા છે.
અમારે એવી પદ્ધતિઓ વિકસાવવી જરૂરી છે કે જેથી સલામતી અને સંરેખણ, મોડલ ક્ષમતાઓ સાથે વિસ્તૃત થઈ શકે.
અમે શું કર્યું
અમે GPT‑Red ને તાલીમ આપી, એક સ્વચાલિત રેડ ટીમિંગ મોડલ જે નબળાઈઓ શોધવાની અમારી ક્ષમતાને વિસ્તૃત કરે છે જેથી વ્યાપક નિયુક્તિ પહેલાં અમે તેને સુધારી શકીએ.
GPT‑Red એક શક્તિશાળી રેડ ટીમિંગ નિષ્ણાત છે, અને અમારા અગાઉના મોડલ તેના પ્રોમ્પ્ટ ઇન્જેક્શન હુમલાઓ સામે ખૂબ સંવેદનશીલ છે.
અમે GPT‑5.6 ને પ્રતિકૂળ રીતે તાલીમ આપવા GPT‑Red નો ઉપયોગ કરીએ છીએ, જેથી તે પ્રોમ્પ્ટ ઇન્જેક્શન સામે ઘણું વધુ મજબૂત બને.
અમે આ અભિગમને માનવ અને third-party રેડ ટીમિંગ, સ્તરીય સુરક્ષા પગલાં અને વાસ્તવિક-સમયમાં દેખરેખ સાથે આગળ પણ વિસ્તૃત કરતા રહીશું.
AI સિસ્ટમ્સ સામાન્ય રીતે બ્રાઉઝોર, કનેક્ટેડ ઍપ્સ, સ્થાનિક ફાઇલો અને અન્ય સાધનો મારફતે તૃતીય-પક્ષ ડેટાનો સામનો કરે છે. વાસ્તવિક કાર્યો કરવા માટે આ ક્ષમતાઓ જરૂરી છે, પરંતુ તે દુર્ભાવનાપૂર્ણ કર્તાઓ માટે મોડલના વર્તનને પ્રભાવિત કરવાની વધુ તકો પણ બનાવે છે. ઉદાહરણ તરીકે, તૃતીય પક્ષ ઈમેલ, વેબપેજ, સાધન પ્રતિભાવ અથવા કોડ રિપોઝિટરીમાં સાવચેતીપૂર્વક રચાયેલી સૂચના એમ્બેડ કરી શકે છે, જે છળ કરીને મોડલને સંવેદનશીલ ડેટા બાહ્ય સર્વર પર અપલોડ કરવા માટે રચાયેલી હોય.
માનવ રેડ ટીમિંગ અમારા સલામતી કામનો મહત્વપૂર્ણ ભાગ છે, જે નિયુક્તિ પહેલાં આવી નબળાઈઓ શોધવામાં અને યોગ્ય સુરક્ષા પગલાં લાગુ કરવામાં અમને મદદ કરે છે. પરંતુ ફક્ત માનવ રેડ ટીમિંગને વિસ્તૃત કરવું મુશ્કેલ છે. આ કવાયત ડિઝાઇન અને ચલાવવામાં ઘણો સમય લાગે છે, જેના કારણે નવા નિષ્ફળતા મોડ કેટલી ઝડપથી ઓળખી અને મજબૂત સુરક્ષા પગલાંમાં સામેલ કરી શકીએ તે મર્યાદિત થાય છે. ઉપરાંત, આ કવાયત સફળ હુમલાઓના મૂલ્યવાન ઉદાહરણો આપે છે, પરંતુ તાલીમ દ્વારા મોડલની દૃઢતા સુધારવા જરૂરી વિરોધી માહિતીનું પ્રમાણ અને વૈવિધ્ય ઉત્પન્ન કરી શકતા નથી.
વધુને વધુ સક્ષમ બનતા મોડલ સાથે ગતિ જાળવવા રેડ ટીમિંગ પણ વિસ્તૃત થવું જરૂરી છે. આ હેતુથી, અમે સ્વચાલિત, ફક્ત-આંતરિક રેડ ટીમિંગ મોડલને તાલીમ આપી રહ્યા છીએ, જે નિયુક્તિ પહેલાં નબળાઈઓ શોધે છે અને દૃઢતા સુધારવા માટે મોડલની તાલીમ દરમિયાન હુમલાઓ જનરેટ કરે છે. અમને વિશ્વાસ છે કે સ્વચાલિત રેડ ટીમિંગ સલામતી માટે સ્વ-સુધારણાનું મહત્વપૂર્ણ સ્વરૂપ: આજના મોડલનો ઉપયોગ કરીને ભવિષ્યના મોડલને સીધા વધુ સલામત બનાવવામાં મદદ કરવીને અનલૉક કરે છે.
GPT‑Red આ પ્રયત્નોની પરાકાષ્ઠા છે અને અમારું હાલનું શ્રેષ્ઠ સ્વચાલિત સલામતી રેડ ટીમિંગ મોડલ છે. માનવ રેડ ટીમિંગ નિષ્ણાતો જેમ હુમલાઓ ક્રાફ્ટ કરે છે તેમ, મોડલ પ્રોમ્પ્ટ મોકલીને, GPT મોડલ તેના પર કેવી પ્રતિક્રિયા આપે છે તે જોઈ અને પુનરાવર્તન કરીને લક્ષ્ય તરફ કામ કરે છે. અમે GPT‑Red ને OpenAI ખાતે અમારા કેટલાક સૌથી મોટા તાલીમ પછીના રન જેટલા કમ્પ્યૂટ સ્કેલ પર તાલીમ આપી છે, જે સલામતી સુધારવા માટે સંપૂર્ણપણે સમર્પિત કમ્પ્યૂટની અભૂતપૂર્વ માત્રા છે.
અમે GPT‑Red ને અમારા પ્રોડક્શન મોડલની તાલીમ પ્રક્રિયામાં સીધું સામેલ કરીએ છીએ. પરિણામે, GPT‑5.6 Sol આજ સુધી પ્રોમ્પ્ટ ઇન્જેક્શન સામે અમારું સૌથી મજબૂત મોડલ છે, અને માત્ર ચાર મહિના અગાઉના અમારા શ્રેષ્ઠ પ્રોડક્શન મોડલની સરખામણીમાં અમારા સૌથી કઠિન સીધા પ્રોમ્પ્ટ ઇન્જેક્શન બેન્ચમાર્ક પર 6x ઓછી નિષ્ફળતાઓ હાંસલ કરે છે. અમારા અભિગમની વિસ્તૃતતા અમને ભવિષ્યમાં વધુ શક્તિશાળી પરિણામો માટે ઉત્સાહિત કરે છે, કારણ કે અમે વધુ મજબૂત રેડ ટીમિંગ નિષ્ણાતોને તાલીમ આપતા રહીશું.
GPT‑Red ને સેલ્ફ-પ્લે રીઇન્ફોર્સમેન્ટ લર્નિંગનો ઉપયોગ કરીને તાલીમ આપવામાં આવે છે, જ્યાં મોડલ અને વિવિધ defender LLMs નો સમૂહ રેડ ટીમિંગ પરિસ્થિતિઓના વિશાળ સમૂહ પર એકસાથે તાલીમ લે છે. સફળ પ્રોમ્પ્ટ ઇન્જેક્શન જેવી માન્ય નિષ્ફળતા બહાર લાવવા બદલ GPT‑Red ને પુરસ્કાર મળે છે, જ્યારે defender મોડલને હુમલાનો પ્રતિકાર કરવા અને તેમના મૂળ કાર્યો પૂર્ણ કરવા બદલ પુરસ્કાર મળે છે. defenders વધુ મજબૂત બનતાં, GPT‑Red ને વધુ શક્તિશાળી અને વધુ વિવિધ હુમલાઓ શોધવા પડે છે.
સેલ્ફ-પ્લે તાલીમને ટેકો આપવા માટે, અમે એવી વાસ્તવિક પરિસ્થિતિઓનો વિશાળ સમૂહ બનાવીએ છીએ જ્યાં પ્રોમ્પ્ટ ઇન્જેક્શન દાખલ થઈ શકે. દરેક પર્યાવરણમાં ધમકી મોડલ હોય છે, જે GPT‑Red શું નિયંત્રિત કરી શકે અને સફળ હુમલો શું ગણાય તે નિર્ધારિત કરે છે. ઉદાહરણ તરીકે, GPT‑Red લોકલ ફાઇલના ભાગ, વેબપેજ બેનર, ઈમેલ બોડી અથવા ટૂલના આઉટપુટને નિયંત્રિત કરી શકે.
તાલીમના અંતે, GPT‑Red અત્યંત શક્તિશાળી હુમલાખોર બને છે: તે GPT‑5.5 સુધીના અને તેને સામેલ કરતાં આંતરિક તેમજ પ્રોડક્શન મોડલ સહિત, સામે મૂકાયેલા લગભગ તમામ મોડલને તોડી શકે છે. GPT‑Red ની તાલીમ પૂર્ણ થયા પછી, અમે GPT‑5.6 ની તાલીમ માટે પ્રોમ્પ્ટ ઇન્જેક્શન બનાવવા તેનો ઉપયોગ કર્યો, જેના પરિણામે મોડલ GPT‑Red ના હુમલાઓ સામે ખૂબ પ્રતિરોધક બન્યું.
અમે GPT‑Red ને નિયુક્ત કરાતા મોડલથી અલગ રાખીએ છીએ. આ રીતે GPT‑Red માં ખાસ તાલીમ આપેલી દુર્ભાવનાપૂર્ણ ક્ષમતાઓ વિરોધી કર્તાઓના હાથથી દૂર રહે છે, જ્યારે અમારા પ્રોડક્શન મોડલમાં મજબૂતી સ્થાપિત થાય છે.
GPT‑Red તે defender મોડલની વસ્તી અને રેડ ટીમિંગ પરિસ્થિતિઓ સામે અત્યંત અસરકારક છે જેના પર તેને તાલીમ આપવામાં આવી હતી. અમે એ પણ મૂલ્યાંકન કરીએ છીએ કે OpenAI ખાતે વ્યાપક સુરક્ષાને લાભ આપવા માટે મોડલ સામાન્ય હેતુના રેડ ટીમિંગ એજન્ટ તરીકે ઉપયોગી છે કે નહીં. તે માટે, અમે નવા સલામતી પર્યાવરણો અને લક્ષ્ય મોડલ પર GPT‑Red ની અસરકારકતાનું પરીક્ષણ કરીએ છીએ.
સૌપ્રથમ અમે Dziemian et al. (2025)ના ઇનડાયરેક્ટ પ્રોમ્પ્ટ ઇન્જેક્શન અરેના(નવી વિન્ડોમાં ખૂલે છે) ના પુનર્નિર્મિત સંસ્કરણનો ઉપયોગ કરીને GPT‑Red નવી રેડ ટીમિંગ પરિસ્થિતિઓમાં કેટલું સામાન્યીકરણ કરી શકે છે તે મૂલ્યાંકન કરીએ છીએ. આ પડકારમાં, માનવ રેડ ટીમિંગ નિષ્ણાતો અને GPT‑Red બન્નેએ પૂર્વનિર્ધારિત પર્યાવરણોના સમૂહ પર GPT‑5.1 સામે સ્વતંત્ર રીતે હુમલા સૂચવ્યા. આ રેડ ટીમિંગ પરિસ્થિતિઓ અને લક્ષ્યો GPT‑Red ને તાલીમ આપવા ઉપયોગમાં લેવાયેલા લક્ષ્યોથી અલગ છે. GPT‑Red ઘણાં વધુ ઊંચા હુમલા સફળતા દર હાંસલ કરે છે, માનવોના 13%ની સરખામણીમાં 84% પરિસ્થિતિઓમાં સફળતા શોધે છે.
GPT‑Red સ્વચાલિત રેડ ટીમિંગ નિષ્ણાત તરીકે ઉત્તમ કામગીરી કરે છે. આંતરિક મોનિટરનો ઉપયોગ કરીને Dziemian et al. (2025)ના ઇનડાયરેક્ટ પ્રોમ્પ્ટ ઇન્જેક્શન અરેના પર GPT‑Red, માનવ રેડ ટીમિંગ નિષ્ણાતોની તુલનામાં ઘણી વધુ પરિસ્થિતિઓમાં GPT‑5.1 સામે સફળ હુમલાઓ બનાવી શકે છે.
રેડ ટીમિંગ નિષ્ણાતની અંતિમ કસોટી એ છે કે સિસ્ટમના અંતર્ગત મોડલ અને કાર્યપ્રણાલી ડિઝાઇન વિશે અધૂરી જાણકારી હોવા છતાં વાસ્તવિક-દુનિયાની એજન્ટિક સિસ્ટમો સામે લક્ષિત દુર્ભાવનાપૂર્ણ ધ્યેયો હાંસલ કરી શકે. આ વ્યવસ્થામાં અમારા પ્રથમ પ્રયોગે GPT‑Red ને Andon Labs દ્વારા બનાવવામાં આવેલી OpenAI ઓફિસના AI-સંચાલિત વેન્ડિંગ મશીન (પ્રોજેક્ટ Vend(નવી વિન્ડોમાં ખૂલે છે) જેવું) સામે મૂક્યું. અમે GPT‑Red ને સિસ્ટમનું વર્ણન અને હુમલાઓ મોકલવાની તથા સિમ્યુલેટેડ એજન્ટમાંથી ટૂલ કૉલ્સ જોવાની ક્ષમતા આપી, જે વાસ્તવિક નિયુક્તિને નજીકથી પ્રતિબિંબિત કરે છે. હુમલાઓ પર પુનરાવર્તન કર્યા પછી, GPT‑Red એ પ્રોડક્શન એજન્ટ સામે પોતાનો હુમલો નિયુક્ત કર્યો અને તેના ત્રણેય દુર્ભાવનાપૂર્ણ હેતુઓ હાંસલ કર્યા:
- મોંઘી સ્ટોકમાં રહેલી વસ્તુની કિંમત બદલીને મંજૂર ન્યૂનતમ કિંમત $0.50 કરવી;
- નવી $100+ વસ્તુનો ઓર્ડર આપવો અને તેને $0.50 માં ઓફર કરવી; અને
- બીજા ગ્રાહકનો ઓર્ડર રદ કરવો.
અમે આ નબળાઈઓ જાહેર કરી છે અને નવા સુરક્ષા પગલાંનું સક્રિય રીતે પરીક્ષણ કરી રહ્યા છીએ.
GPT‑Red વેન્ડિંગ મશીન સંચાલિત કરતા Vendy નામના લાઇવ સ્વાયત્ત એજન્ટને તોડી શકે છે. પહેલાં સિમ્યુલેશનમાં પરીક્ષણ કરીને અને પછી હુમલાઓને લાઇવ એજન્ટ પર સ્થાનાંતરિત કરીને, GPT‑Red પ્રોડક્શન એજન્ટને મોંઘી વસ્તુઓને સસ્તી કરવા અને અન્ય ગ્રાહકોના ઓર્ડરો રદ કરાવવા સક્ષમ થયું.
અમે GPT‑Red નો ઉપયોગ Codex CLI એજન્ટ (GPT‑5.4 mini આધારિત) પર 10 હેલ્ડ-આઉટ ડેટા-એક્સફિલ્ટ્રેશન પરિસ્થિતિના સ્યુટમાં હુમલો કરવા માટે પણ કરીએ છીએ. હેલ્ડ-આઉટ રેડ ટીમિંગ કામગીરી પર અમારી તાલીમ પ્રક્રિયાની અસર સમજવા માટે અમે આ મોડલની પ્રોમ્પ્ટેડ GPT‑5.5 બેઝલાઇન સાથે તુલના કરીએ છીએ. GPT‑Red વધુ અસરકારક છે, કારણ કે તે વધુ પરિસ્થિતિઓમાં એજન્ટ પાસેથી સંવેદનશીલ ડેટા એક્સફિલ્ટ્રેટ કરાવી શકે છે, અને તે વધુ ટોકન કાર્યક્ષમ પણ છે.
GPT‑Red લાઇવ Codex એજન્ટોને તોડવામાં વધુ અસરકારક અને કાર્યક્ષમ છે. અમે 10 ડેટા એક્સફિલ્ટ્રેશન કાર્યોના કસ્ટમ સ્યુટ પર GPT‑5.4 Mini દ્વારા સમર્થિત Codex એજન્ટ સામે પરીક્ષણ કરીએ છીએ.
GPT‑Red નું અંતિમ લક્ષ્ય અમારા મોડલની મજબૂતી વધારવાનું છે. છેલ્લા છ મહિનામાં, અમે વધતા કમ્પ્યૂટ સાથે ક્રમશઃ વધુ શક્તિશાળી રેડ ટીમિંગ મોડલ (GPT‑Red ના પૂરોગામી) તાલીમ આપ્યા છે, અને GPT‑5.3 થી દરેક અનુક્રમી પ્રોડક્શન મોડલની તાલીમમાં આ મોડલનો ઉપયોગ કર્યો છે. સમય જતાં, દરેક અનુગામી GPT રિલીઝ વધુ મજબૂત બની છે.
એક ઉદાહરણ તરીકે, GPT‑Red ના પ્રારંભિક સંસ્કરણને સીધા પ્રોમ્પ્ટ ઇન્જેક્શન હુમલાનો એક નવો વર્ગ મળ્યો, જેને “નકલી ચેન-ઓફ-થોટ” હુમલા કહેવાય છે. આ હુમલાઓએ GPT‑5.1 પર 95%થી વધુ સફળતા દરો મેળવ્યા હતા, પરંતુ હવે GPT‑5.6 Sol માટે 10%થી નીચે છે. તે જ રીતે, ડેવલપર સાધનો અને બ્રાઉઝિંગમાં હુમલાઓને લક્ષ્ય બનાવતા અમારા કેટલાક પરોક્ષ પ્રોમ્પ્ટ ઇન્જેક્શન બેન્ચમાર્ક અમારા નવીનતમ મોડલ દ્વારા સંતૃપ્ત થઈ ગયા છે (>97% ચોકસાઈ).
GPT‑Red સામેની મજબૂતીમાં પણ નોંધપાત્ર સુધારો થયો છે. દૃઢતા પર્યાવરણોના વિશાળ સમૂહ પર, GPT‑Red ના હુમલા સફળતા દરો સમય જતાં સતત ઘટ્યા છે. અમારા નવીનતમ મોડલના રિલીઝ સાથે, GPT‑5.6 Sol GPT‑Red ના સીધા પ્રોમ્પ્ટ ઇન્જેક્શનમાં માત્ર 0.05% પર નિષ્ફળ જાય છે.
જેમ જેમ અમે પ્રોમ્પ્ટ ઇન્જેક્શન માટે સેલ્ફ-પ્લે તાલીમને વધારતા ગયા, તેમ અમને એવા નવા જોખમો મળ્યા છે જે હાલના મોડલને તોડી શકે છે. તેમ છતાં, અમારા સ્કેલિંગે આ હુમલાઓ સામેની મજબૂતીમાં પણ નોંધપાત્ર સુધારો કર્યો છે. હુમલાની સફળતા દર હેલ્ડ-આઉટ પર્યાવરણોમાં GPT‑Red દ્વારા કરાયેલા તમામ પ્રયાસોની સરેરાશ સફળતા તરીકે ગણાય છે.
મોડલ વધુ વિનંતીઓ નકારીને અથવા ઓછું સક્ષમ બનીને વધુ સલામત દેખાઈ શકે છે. ઓછું કામ કરતા મોડલ પર સ્વાભાવિક રીતે હુમલા કરવાનું મુશ્કેલ હોય છે, પણ તે ઉપયોગી દૃઢતા નથી.
અમે સામાન્ય અત્યાધુનિક ક્ષમતાઓ સાથે અમે રચેલા લક્ષિત અતિ-ઇનકાર કાર્યોનું પણ ઊંડાણપૂર્વક મૂલ્યાંકન કરીએ છીએ. અમને લાગે છે કે મજબૂતીમાં નોંધપાત્ર સુધારો થવા છતાં બધી સામાન્ય ક્ષમતાઓ અપ્રભાવિત રહે છે. આ સૂચવે છે કે સાધનોના અયોગ્ય વપરાશ અથવા માન્ય વિનંતીઓને ડિફૉલ્ટ રીતે નકારવાને બદલે દુર્ભાવનાપૂર્ણ સૂચનાઓ સામે વધુ સારા પ્રતિકાર કરવાથી દૃઢતા વૃદ્ધિ આવી.
AI એજન્ટોનો ઉપયોગ પહેલેથી જ અમારા નેક્સ્ટ-જનરેશન મોડલની ક્ષમતાઓ સુધારવા માટે થઈ રહ્યો છે. અમે માનીએ છીએ કે GPT‑Red સાથે અમે સલામતી માટે એવું જ ફ્લાયવ્હીલ શરૂ કર્યું છે, જ્યાં આજના મોડલનો ઉપયોગ આવતીકાલના મોડલને વધુ મજબૂત, સંરેખિત અને વિશ્વસનીય બનાવવા માટે થઈ શકે. અમે આજના મોડલ કરતાં વધુ શક્તિશાળી GPT‑Red ના ભાવિ વર્ઝનો તાલીમ આપવા કમ્પ્યૂટ અને ડેટાને વિસ્તૃત કરતા રહીશું અને સાથે અલ્ગોરિધમિક સુધારાઓ પણ કરતા રહીશું. અને બદલામાં, આ મોડલ ભાવિ GPT રિલીઝ ને વધુ સલામત બનાવવામાં મદદ કરશે.
અમે આ અઠવાડિયાના અંતમાં વધુ વિગતો સાથે પ્રી-પ્રિન્ટ રિલીઝ કરીશું.


