આજે, અમે સુરક્ષા વર્ગીકરણના કાર્યો માટેના અમારા ઓપન-વેઇટ રિઝનિંગ મોડલો, gpt-oss-safeguardનું રિસર્ચ પ્રિવ્યૂ રિલીઝ કરી રહ્યા છીએ, જે બે સાઇઝમાં ઉપલબ્ધ છે: gpt-oss-safeguard-120b અને gpt-oss-safeguard-20b. આ મોડલો અમારા gpt-oss ઓપન મોડલોના સુધારેલા વર્ઝન છે અને સમાન છૂટછાટ આપતા Apache 2.0 લાઇસન્સ હેઠળ ઉપલબ્ધ છે, જે કોઈપણ વ્યક્તિને મુક્તપણે તેનો ઉપયોગ કરવાની, તેમાં ફેરફાર કરવાની અને તેને ડિપ્લોય કરવાની મંજૂરી આપે છે. બંને મોડલ આજે Hugging Face(નવી વિન્ડોમાં ખૂલે છે) પરથી ડાઉનલોડ કરી શકાય છે.
gpt-oss-safeguard મોડલો ઇન્ફરન્સ સમયે ડેવલપર દ્વારા પ્રદાન કરવામાં આવેલી નીતિનું સીધું અર્થઘટન કરવા માટે રિઝનિંગનો ઉપયોગ કરે છે—જે ડેવલપરની જરૂરિયાતો અનુસાર વપરાશકર્તાના મેસેજ, પ્રતિભાવો અને સંપૂર્ણ ચૅટનું વર્ગીકરણ કરે છે. ડેવલપર હંમેશા નક્કી કરે છે કે કઈ નીતિનો ઉપયોગ કરવો, જેથી પ્રતિસાદો વધુ સુસંગત અને ડેવલપરના ઉપયોગના કિસ્સા મુજબ અનુકૂળ હોય છે. મોડલ ચેન-ઓફ-થોટનો ઉપયોગ કરે છે, જેને ડેવલપર મોડલ તેના નિર્ણયો સુધી કેવી રીતે પહોંચે છે તે સમજવા માટે સમીક્ષા કરી શકે છે. વધુમાં, નીતિને મોડલમાં ટ્રેન કરવાને બદલે અનુમાન દરમિયાન પ્રદાન કરવામાં આવે છે, જેથી ડેવલપરો માટે કાર્યક્ષમતા વધારવા માટે નીતિઓને પુનરાવર્તિત રીતે સુધારવી સરળ રહે છે. આ અભિગમ, જેને અમે શરૂઆતમાં આંતરિક ઉપયોગ માટે વિકસાવ્યો હતો, તે મોટી સંખ્યામાં લેબલવાળા ઉદાહરણો પરથી અપ્રત્યક્ષ રીતે નિર્ણયની સીમા તારવવા માટે ક્લાસિફાયરને તાલીમ આપવાની પરંપરાગત પદ્ધતિ કરતાં નોંધપાત્ર રીતે વધુ લવચીક છે.
gpt-oss-safeguard ડેવલપરોને તેમના ઉપયોગના કિસ્સાને શ્રેષ્ઠ રીતે અનુકૂળ હોય તેવી નીતિની સીમાઓ નક્કી કરવા સક્ષમ બનાવે છે. ઉદાહરણ તરીકે, કોઈ વીડિયો ગેમિંગ ચર્ચા મંચ ગેમમાં છેતરપિંડીની ચર્ચા કરતી પોસ્ટ્સનું વર્ગીકરણ કરવા માટે કોઈ નીતિ વિકસાવવા માંગતું હોઈ શકે છે, અથવા એક પ્રોડક્ટ રિવ્યૂ સાઇટ નકલી હોવાની શક્યતા ધરાવતા રિવ્યૂને તપાસવા માટે પોતાની નીતિનો ઉપયોગ કરવા માંગતી હોઈ શકે છે.
મોડલ એકસાથે બે ઇનપુટ લે છે—એક નીતિ અને તે નીતિ હેઠળ વર્ગીકૃત કરવા માટેની સામગ્રી—અને તેના રિઝનિંગ સાથે, સામગ્રી ક્યાં આવે છે તે વિશેનો નિષ્કર્ષ આપે છે. ડેવલપરો નક્કી કરે છે કે તેમની પોતાની સુરક્ષા પાઇપલાઇન્સમાં તે નિષ્કર્ષોનો ઉપયોગ કરવો કે કેમ, અને જો કરવો હોય તો કેવી રીતે કરવો. અમે જોયું છે કે આ રિઝનિંગ-આધારિત અભિગમ એવી પરિસ્થિતિઓમાં ખાસ કરીને સારું પ્રદર્શન કરે છે જ્યાં:
- સંભવિત નુકસાન ઉભરી રહ્યું હોય અથવા વિકસી રહ્યું હોય, અને નીતિઓને ઝડપથી અનુકૂળ કરવાની જરૂર હોય.
- ક્ષેત્ર અત્યંત ઝીણવટભર્યું હોય અને નાના વર્ગીકારકો માટે તેને સંભાળવું મુશ્કેલ હોય.
- તેમના પ્લેટફોર્મ પરના દરેક જોખમ માટે ઉચ્ચ-ગુણવત્તાવાળા ક્લાસિફાયરને ટ્રેન કરવા માટે ડેવલપરો પાસે પૂરતા નમૂના ન હોય.
- ઉચ્ચ-ગુણવત્તાવાળા, સમજાવી શકાય તેવા લેબલ તૈયાર કરવા કરતાં લેટન્સી ઓછી મહત્વની હોય.
અમે રિસર્ચ અને સુરક્ષા સમુદાય પાસેથી પ્રતિસાદ મેળવવા અને મોડલના પ્રદર્શનમાં વધુ સુધારો કરવા માટે gpt-oss-safeguardનું આ પ્રિવ્યૂ રિલીઝ કરી રહ્યા છીએ. ડેવલપરની મહત્વપૂર્ણ જરૂરિયાતોને ઓળખવા, મોડલનું પરીક્ષણ કરવા અને ડેવલપર ડોક્યુમેન્ટેશન તૈયાર કરવા માટે, અમે મહિનાઓ સુધી ROOST(નવી વિન્ડોમાં ખૂલે છે) સાથે મળીને આ ઓપન વેઇટ રિલીઝ પર કામ કર્યું છે. આ લૉન્ચના ભાગરૂપે, ROOST એક મોડલ કમ્યુનિટી(નવી વિન્ડોમાં ખૂલે છે)ની સ્થાપના કરશે, જે આજે લૉન્ચ પણ થઈ રહી છે, જેથી ઓનલાઇન સ્પેસને સુરક્ષિત કરવા માટે ઓપન AI મોડલોનું અન્વેષણ કરી શકાય. આ રિલીઝની સાથે, અમે એક ટૂંકો ટેકનિકલ રિપોર્ટ પ્રકાશિત કરી રહ્યા છીએ જે આ પ્રિવ્યૂ મોડલના સુરક્ષા પ્રદર્શનની વિગતો આપે છે.
સુરક્ષાની વાત આવે ત્યારે, અમે બહુસ્તરીય સંરક્ષણમાં માનીએ છીએ. અમે અમારા મોડલોને સુરક્ષિત રીતે પ્રતિસાદ આપવા માટે ટ્રેન કરીએ છીએ, અને અમારી નીતિઓ હેઠળ સંભવિત રીતે અસુરક્ષિત ઇનપુટ્સ અને આઉટપુટ્સને શોધી કાઢવા અને તેનું નિવારણ કરવા માટે અમે સુરક્ષાના વધારાના સ્તરો અમલમાં મૂકીએ છીએ. સુરક્ષા વર્ગીકારકો, જે કોઈ ચોક્કસ જોખમી ક્ષેત્રમાં સુરક્ષિત સામગ્રીને અસુરક્ષિત સામગ્રીથી અલગ પાડે છે, તે લાંબા સમયથી અમારા પોતાના અને અન્ય લાર્જ લેંગ્વેજ મોડલો માટે સંરક્ષણનું પ્રાથમિક સ્તર રહ્યા છે.
પરંપરાગત સુરક્ષા વર્ગીકારકો, જેમ કે અમારા Moderation API(નવી વિન્ડોમાં ખૂલે છે) દ્વારા ઉપલબ્ધ છે, પૂર્વ-નિર્ધારિત સુરક્ષા નીતિઓ હેઠળ સુરક્ષિત અને અસુરક્ષિત સામગ્રીના હજારો ઉદાહરણોને મેન્યુઅલી ક્યુરેટ કરીને વિકસાવવામાં આવે છે. આ ટ્રેન કરેલા ડેટા પરથી, વર્ગીકારક સુરક્ષિત આઉટપુટ્સને અસુરક્ષિત આઉટપુટ્સથી અલગ પાડવાનું શીખે છે. આ પરંપરાગત અભિગમમાં, વર્ગીકારક ખરેખર ક્યારેય સુરક્ષા નીતિને જોતું નથી. તેના બદલે, તે અસુરક્ષિત તરીકે લેબલ કરાયેલી સામગ્રીમાં સમાનતાઓ અને અસુરક્ષિત અને સુરક્ષિત સામગ્રી વચ્ચેના તફાવતો શોધીને, ઉદાહરણોને લેબલ કરવા માટે ઉપયોગમાં લેવાયેલી મૂળ નીતિને તારવવાનો પ્રયાસ કરે છે.
પરંપરાગત વર્ગીકારકો ઓછી લેટન્સી અને ઓપરેટિંગ ખર્ચ સાથે ઉચ્ચ પ્રદર્શન આપી શકે છે. પરંતુ પૂરતી માત્રામાં ટ્રેન કરેલા ઉદાહરણો એકત્રિત કરવાનું વધુ સમય માંગી લે તેવું અને ખર્ચાળ હોઈ શકે છે, અને નીતિને અપડેટ કરવા અથવા બદલવા માટે વર્ગીકારકને ફરીથી ટ્રેન કરવાની જરૂર પડે છે.
gpt-oss-safeguard અલગ છે કારણ કે તેની રિઝનિંગ ક્ષમતાઓ ડેવલપરોને કોઈ પણ નીતિ લાગુ કરવાની મંજૂરી આપે છે, જેમાં તેઓ પોતે લખેલી અથવા અન્ય સ્ત્રોતોમાંથી મેળવેલી નીતિઓ સામેલ છે, અને રિઝનિંગ મોડલોને નવી લખાયેલી નીતિઓ પર સામાન્યીકરણ કરવામાં મદદ કરે છે. સુરક્ષા નીતિઓ ઉપરાંત, ચોક્કસ પ્રોડક્ટ્સ અને પ્લેટફોર્મ માટે મહત્વપૂર્ણ હોય તેવી અન્ય રીતે સામગ્રીને લેબલ કરવા માટે પણ gpt-oss-safeguardનો ઉપયોગ કરી શકાય છે.
અમારા પ્રાથમિક રિઝનિંગ મોડલો હવે અમારી સુરક્ષા નીતિઓ સીધી રીતે શીખે છે, અને શું સુરક્ષિત છે તે વિશે તર્ક કરવા માટે તેમની રિઝનિંગ ક્ષમતાઓનો ઉપયોગ કરે છે. આ અભિગમ, જેને અમે વિચાર-વિમર્શ આધારિત અલાઇનમેન્ટ કહીએ છીએ, તે અગાઉની સુરક્ષા ટ્રેન કરવાની પદ્ધતિઓમાં નોંધપાત્ર સુધારો કરે છે અને અમારા રિઝનિંગ મોડલોને રિઝનિંગ વિનાના અગાઉના મોડલો કરતાં અનેક રીતે વધુ સુરક્ષિત બનાવે છે, ભલે તેમની ક્ષમતાઓમાં વધારો થતો હોય. પરંતુ રિઝનિંગ માત્ર મોડલોને પોતાને ટ્રેન કરવા માટે જ ઉપયોગી નથી. તે ઊંડાણપૂર્વકના સંરક્ષણ માટે નવી શક્યતાઓ પણ ઊભી કરે છે. રિઝનિંગ-આધારિત અભિગમો વધુ લવચીક હોય છે અને તેમની અગાઉની ટ્રેન કરેલી વિગતોથી ઓછા મર્યાદિત હોય છે, આ એવા ફાયદાઓ છે જે કેટલીકવાર તેમાં સામેલ વધારાના કમ્પ્યુટ ખર્ચ અને લેટન્સીને પૂરેપૂરા વાજબી ઠેરવે છે.
gpt-oss-safeguard એ અમે આંતરિક રીતે વિકસાવેલા એક અભિગમનું ઓપન-વેઇટ અમલીકરણ છે, જે એક ટૂલમાં છે જેને અમે Safety Reasoner કહીએ છીએ. અમે નીતિ લેબલિંગ કાર્યો પર રીઇન્ફોર્સમેન્ટ ફાઇન-ટ્યુનિંગથી શરૂઆત કરી, જેમાં માનવ નિષ્ણાતોના સાચા નિર્ણયોને પ્રતિબિંબિત કરવા બદલ મોડલને પુરસ્કૃત કરવામાં આવ્યું. આનાથી મોડલ એ વિશે તર્ક કરતા શીખ્યું કે નીતિ કેવી રીતે તેના નિર્ણય સુધી દોરી જાય છે. આજે, Safety Reasoner અમને ક્લાસિફાયરને ફરીથી ટ્રેન કરવામાં લાગતા સમય કરતા ઓછા સમયમાં પ્રોડક્શનમાં અમારી સુરક્ષા નીતિઓને ડાયનેમિકલી અપડેટ કરવા સક્ષમ બનાવે છે. આ Safety Reasonerને પુનરાવર્તિત ડિપ્લોયમેન્ટ માટે એક મુખ્ય ટૂલ બનાવે છે: જ્યારે અમે નવા મોડલોને પ્રોડક્શનમાં ડિપ્લોય કરીએ છીએ, ત્યારે અમે મોટેભાગે વધુ કડક પોલિસીઓ સાથે શરૂઆત કરીએ છીએ અને Safety Reasoner તે પોલિસીઓને કાળજીપૂર્વક લાગુ કરી શકે તે માટે જ્યાં જરૂર હોય ત્યાં પ્રમાણમાં વધુ કમ્પ્યુટનો ઉપયોગ કરીએ છીએ. ત્યારબાદ, જેમ જેમ પ્રોડક્શનમાં રહેલા જોખમો વિશેની અમારી સમજ સુધરે છે, તેમ અમે અમારી નીતિઓમાં ફેરફાર કરીએ છીએ. અમારા કેટલાક તાજેતરના લૉન્ચમાં, સલામતી રિઝનિંગ માટે ફાળવવામાં આવેલા કુલ કમ્પ્યુટનો હિસ્સો 16% જેટલો ઊંચો રહ્યો છે.
Safety Reasoner અમારા સલામતી સ્ટૅકનો એક મુખ્ય ઘટક બની ગયું છે. ઇમેજ જનરેશન અને Sora 2 માટે, તે અસુરક્ષિત જનરેશનને વાસ્તવિક સમયમાં ઓળખવા અને અવરોધિત કરવા માટે આઉટપુટનું ગતિશીલ, તબક્કાવાર મૂલ્યાંકન કરે છે. બાયોલોજી અને આત્મહાનિ જેવા સ્વ-ઈજા જેવા ક્ષેત્રોમાં, કઈ સામગ્રી રુચિના ક્ષેત્રમાં આવે છે તે નક્કી કરવા માટે અમે Moderation APIમાં ઉપયોગમાં લેવાતા મોડલો જેવા મોડલોને નાના, ઝડપી અને ઉચ્ચ-રિકૉલ વર્ગીકારકો તરીકે ચલાવીએ છીએ, અને પછી તે સામગ્રીની સમીક્ષા કરવા માટે Safety Reasonerનો ઉપયોગ કરીએ છીએ. કેવી રીતે શ્રેષ્ઠ પ્રતિસાદ આપવો તે નક્કી કરવા માટે Safety Reasoner વિગતવાર વર્ગીકરણ વ્યવસ્થાના આધારે મોડલ આઉટપુટને વર્ગીકૃત કરે છે, જે GPT‑5 અને ChatGPT એજન્ટ જેવી સિસ્ટમ્સમાં અમારા બહુ-સ્તરીય સુરક્ષા ઉપાયોનો એક ભાગ છે. અને હવે, gpt-oss-safeguard મોડલો કોઈપણ માટે આ જ અભિગમ ઉપલબ્ધ કરાવે છે.
અમે આંતરિક અને બાહ્ય બંને મૂલ્યાંકન સેટ્સ પર gpt-oss-safeguard મોડલોનું મૂલ્યાંકન કર્યું.
આંતરિક મૂલ્યાંકનમાં, અમે gpt-oss-safeguard ને અનુમાન સમયે એકસાથે બહુવિધ નીતિઓ પ્રદાન કરી. દરેક પરીક્ષણ ઇનપુટ માટે, અમે મૂલ્યાંકન કરીએ છીએ કે gpt-oss-safeguard સામેલ કરેલી તમામ નીતિઓ હેઠળ લખાણને યોગ્ય રીતે વર્ગીકૃત કરે છે કે કેમ. આ એક પડકારજનક કાર્ય છે—મોડલને માત્ર ત્યારે જ સચોટ ગણવામાં આવે છે જો તે સામેલ કરેલી તમામ નીતિઓ માટે ગોલ્ડન સેટ લેબલ્સ સાથે બરાબર મેળ ખાતું હોય.
અમારા gpt-oss-safeguard મોડલો અને આંતરિક Safety Reasoner બહુ-નીતિ સચોટતામાં gpt-5-thinking અને gpt-oss ઓપન મોડલો કરતાં સારું પ્રદર્શન કરે છે. પહેલાંના મોડલોના નાના કદને ધ્યાનમાં લેતાં, gpt-oss-safeguard મોડલોનું gpt-5-thinking કરતાં સારું પ્રદર્શન કરવું એ ખાસ કરીને આશ્ચર્યજનક છે.
અમે અમારા 2022ના સંશોધન પત્ર(નવી વિન્ડોમાં ખૂલે છે) સાથે બહાર પાડેલા મૉડરેશન ડેટાસેટ(નવી વિન્ડોમાં ખૂલે છે) પર અને ઓપન-સોર્સ ચૅટબૉટ માટે વપરાશકર્તાની પૂછપરછો પર આધારિત સાર્વજનિક માપદંડ, ToxicChat(નવી વિન્ડોમાં ખૂલે છે) પર આ મોડલોનું વધુ મૂલ્યાંકન કર્યું.
2022ના મૉડરેશન મૂલ્યાંકન સેટ પર, અમે અમારી આંતરિક સલામતી નીતિઓનો ઉપયોગ કરીને મૂલ્યાંકન કર્યું (અનુગામી ફેરફારોને ધ્યાનમાં લેવા માટે એક નીતિને અનુકૂળ કરીને). gpt-oss-safeguard એ અમારા આંતરિક Safety Reasoner અને gpt-5-thinking સહિત પરીક્ષણ કરાયેલા અન્ય તમામ મોડલો કરતાં થોડું ચડિયાતું પ્રદર્શન કર્યું, જોકે Safety Reasoner અને gpt-oss-safeguard વચ્ચેનો આ તફાવત આંકડાકીય રીતે નોંધપાત્ર નથી.
ToxicChat માટે, અમે અમારી કેટલીક આંતરિક નીતિઓમાંથી અનુકૂળ કરેલા એક ટૂંકા હસ્તલિખિત પ્રોમ્પ્ટનો ઉપયોગ કરીને મૂલ્યાંકન કર્યું. અમારી આંતરિક Safety Reasoner એ ફરીથી gpt-5-thinking કરતાં સારું પ્રદર્શન કર્યું, જ્યારે કે gpt-5-thinking અને Safety Reasoner બંને gpt-oss-safeguard-120b અને gpt-oss-safeguard-20b કરતાં નજીવા પ્રમાણમાં ચડિયાતું પ્રદર્શન કરે છે. અમે અપેક્ષા રાખીએ છીએ કે gpt-oss-safeguardનું પ્રમાણમાં નાનું કદ હજી પણ તેને આ પ્રકારના કાર્ય માટે પસંદગીપાત્ર બનાવે છે.
gpt-oss-safeguard ની બે ચોક્કસ મર્યાદાઓ છે. પ્રથમ, અમે અવલોકન કર્યું છે કે જ્યારે gpt-oss-safeguard સીધું નીતિ પરથી રિઝનિંગ કરે છે તેના કરતાં, હજારો ઉચ્ચ-ગુણવત્તાવાળા લેબલ કરેલા નમૂનાઓ પર પ્રશિક્ષિત વર્ગીકારકો સામગ્રીને વર્ગીકૃત કરવામાં હજી પણ વધુ સારું પ્રદર્શન કરી શકે છે. વધુ જટિલ જોખમો પર ઉચ્ચ પ્રદર્શન માટે એક સમર્પિત વર્ગીકારકને ટ્રેન કરવામાં સમય ફાળવવાનું પસંદ કરી શકાય છે.
બીજું, gpt-oss-safeguardમાં ઘણો સમય અને કમ્પ્યુટનો ઉપયોગ થઈ શકે છે, જે તેને તમામ પ્લૅટફૉર્મ સામગ્રી પર સ્કેલ કરવાનું પડકારજનક બનાવે છે. આંતરિક રીતે, અમે Safety Reasoner સાથે આને કેટલીક રીતે સંભાળીએ છીએ: (1) કઈ સામગ્રીનું મૂલ્યાંકન કરવું તે નક્કી કરવા માટે અમે નાના અને ઝડપી વર્ગીકારકોનો ઉપયોગ કરીએ છીએ અને (2) કેટલાક સંજોગોમાં, વપરાશકર્તાને ઓછા વિલંબવાળો અનુભવ પ્રદાન કરવા માટે અમે Safety Reasonerનો અસિંક્રોનસ રીતે ઉપયોગ કરીએ છીએ, જ્યારે કે જો અમે અસુરક્ષિત સામગ્રી શોધી કાઢીએ તો હસ્તક્ષેપ કરવાની ક્ષમતા પણ જાળવી રાખીએ છીએ.
gpt-oss-safeguard એ સમુદાય સાથે મળીને બનાવવામાં આવેલ OpenAIનો ઓપન સેફ્ટી મોડલોનો પ્રથમ સેટ છે. પ્રારંભિક પરીક્ષણના ભાગરૂપે, અમે SafetyKit, ROOST, Tomoro અને Discordના ટ્રસ્ટ અને સેફ્ટી નિષ્ણાતો સાથે મળીને gpt-oss-safeguard પર સતત ચકાસણી અને ક્રમિક સુધારાઓ કર્યા છે. ROOSTના CTO વિનય રાવ કહે છે કે, “gpt-oss-safeguard એ ‘તમારી પોતાની પોલિસીઓ અને નુકસાનની વ્યાખ્યાઓ લાવો’ ડિઝાઇન ધરાવતું પ્રથમ ઓપન સોર્સ રિઝનિંગ મોડલ છે.” સંસ્થાઓ નિર્ણાયક સેફ્ટી ટેક્નોલોજીઓનો મુક્તપણે અભ્યાસ કરવા, તેમાં ફેરફાર કરવા અને તેનો ઉપયોગ કરવા તથા નવીનતા લાવવામાં સક્ષમ બનવા માટે હકદાર છે. અમારા પરીક્ષણમાં, તે વિવિધ પોલિસીઓને સમજવામાં, તેનું રિઝનિંગ સમજાવવામાં અને પોલિસીઓને લાગુ કરવામાં સૂક્ષ્મતા દર્શાવવામાં કુશળ હતું, જે અમારું માનવું છે કે બિલ્ડર્સ અને સેફ્ટી ટીમો માટે ફાયદાકારક રહેશે.”
અમે ROOST મોડલ Community (RMC) સહિત, ઓપન સેફ્ટી ટૂલિંગને સુધારવા માટે સમુદાય સાથે પુનરાવર્તન કરવાનું ચાલુ રાખીશું. RMC સેફ્ટી વર્કફ્લોમાં ઓપન સોર્સ AI મોડલોને અમલમાં મૂકવા માટેની શ્રેષ્ઠ પ્રથાઓ શેર કરવા માટે સેફ્ટી પ્રેક્ટિશનર્સ અને સંશોધકોને એકસાથે લાવે છે, જેમાં મૂલ્યાંકનના પરિણામો અને મોડલ પ્રતિકિયાનો સમાવેશ થાય છે. આ ભાગીદારી વિશે વધુ જાણવા અને તેમાં કેવી રીતે જોડાવા માટે RMC GitHub રિપોઝિટરી(નવી વિન્ડોમાં ખૂલે છે) પર જાઓ.
આ મોડલો સાથે નિર્માણ શરૂ કરવા માટે, તેમને Hugging Face(નવી વિન્ડોમાં ખૂલે છે) પરથી ડાઉનલોડ કરો.

