အဓိက အကြောင်းအရာသို့ ကျော်သွားရန်
OpenAI

၂၀၂၅ အောက်တိုဘာ ၂၉

ထုတ်ကုန်ဖြန့်ချိမှု

gpt-oss-safeguard ကို မိတ်ဆက်ခြင်း

စိတ်ကြိုက်ဘေးကင်းရေးမူဝါဒများကို ပံ့ပိုးပေးသည့် ပွင့်လင်းသောဘေးကင်းရေးဆိုင်ရာ ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်အသစ်များ (120b နှင့် 20b)။

ဖွင့်နေသည်…

ယနေ့တွင် ကျွန်ုပ်တို့၏ ဘေးကင်းရေး အမျိုးအစားခွဲခြားမှု လုပ်ငန်းများအတွက် open-weight ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်များဖြစ်သည့် gpt-oss-safeguard ၏ သုတေသနအကြိုမြင်ကွင်းကို ထုတ်ပြန်လျက်ရှိပြီး၊ gpt-oss-safeguard-120b နှင့် gpt-oss-safeguard-20b ဟူသော အရွယ်အစား နှစ်မျိုးဖြင့် ရရှိနိုင်ပါသည်။ ဤ မော်ဒယ်များသည် ကျွန်ုပ်တို့၏ gpt-oss အများသုံးနိုင်ရန် ပြုလုပ်ပေးထားသော မော်ဒယ်များကို ပြုပြင်မွမ်းမံထားသော ဗားရှင်းများဖြစ်ပြီး တူညီသော အသုံးပြုခွင့်ပေးသော Apache 2.0 လိုင်စင်အောက်တွင် ရရှိနိုင်သဖြင့် မည်သူမဆို ၎င်းတို့ကို လွတ်လပ်စွာ အသုံးပြုနိုင်၊ ပြင်ဆင်နိုင်၊ တပ်ဆင်အသုံးပြုနိုင်ပါသည်။ မော်ဒယ် နှစ်ခုလုံးကို ယနေ့ Hugging Face(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) မှ ဒေါင်းလုဒ်လုပ်နိုင်ပါသည်။

gpt-oss-safeguard မော်ဒယ်များသည် inference ပြုလုပ်သည့်အချိန်တွင် developer က ပေးထားသော မူဝါဒကို တိုက်ရိုက် အဓိပ္ပာယ်ကောက်ယူရန် ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော နည်းလမ်းကို အသုံးပြုကာ—developer ၏ လိုအပ်ချက်များအရ အသုံးပြုသူ မက်ဆေ့ချ်များ၊ completions နှင့် chat အပြည့်အစုံများကို အမျိုးအစားခွဲခြားပါသည်။ အသုံးပြုမည့် မူဝါဒကို ဆော့ဖ်ဝဲရေးသားသူက အမြဲဆုံးဖြတ်သောကြောင့်၊ တုံ့ပြန်ချက်များသည် ဆော့ဖ်ဝဲရေးသားသူ၏ အသုံးပြုမှုအခြေအနေနှင့် ပိုမိုဆက်စပ်ကိုက်ညီသဖြင့် အထူးချိန်ညှိထားသော အကြောင်းအရာများ ဖြစ်လာသည်။ မော်ဒယ်သည် အတွေးကွင်းဆက်ကို အသုံးပြုပြီး developer သည် မော်ဒယ်က ၎င်း၏ ဆုံးဖြတ်ချက်များသို့ မည်သို့ ရောက်ရှိနေသည်ကို နားလည်ရန် ၎င်းကို ပြန်လည်သုံးသပ်နိုင်ပါသည်။ ထို့အပြင်၊ မူဝါဒကို မော်ဒယ်အတွင်းသို့ လေ့ကျင့်ထည့်သွင်းထားခြင်းမဟုတ်ဘဲ inference ပြုလုပ်စဉ်အတွင်း ပေးထားသဖြင့် ဆော့ဖ်ဝဲရေးသားသူများ (developers) အနေဖြင့် စွမ်းဆောင်ရည် မြှင့်တင်ရန် မူဝါဒများကို စဉ်ဆက်မပြတ် ပြန်လည်ပြင်ဆင်ရန် လွယ်ကူပါသည်။ ကျွန်ုပ်တို့က အစပိုင်းတွင် အဖွဲ့အစည်းအတွင်း အသုံးပြုရန် ဖွံ့ဖြိုးတီထွင်ခဲ့သော ဤချဉ်းကပ်နည်းသည် label တပ်ထားသော ဥပမာအများအပြားမှ ဆုံးဖြတ်ချက်နယ်နိမိတ် (decision boundary) တစ်ခုကို သွယ်ဝိုက်၍ ခန့်မှန်းဖော်ထုတ်နိုင်ရန် classifier တစ်ခုကို လေ့ကျင့်ပေးသည့် ရိုးရာနည်းလမ်းထက် သိသိသာသာ ပိုမိုပြောင်းလွယ်ပြင်လွယ်ရှိသည်။

gpt-oss-safeguard သည် ဆော့ဖ်ဝဲဖန်တီးသူများအား ၎င်းတို့၏ အသုံးပြုမှုအခြေအနေနှင့် အကောင်းဆုံးကိုက်ညီသော မူဝါဒဆိုင်ရာ နယ်နိမိတ်များကို သတ်မှတ်နိုင်စေသည်။ ဥပမာအားဖြင့်၊ ဗီဒီယိုဂိမ်း ဆွေးနွေးဖိုရမ်တစ်ခုသည် ဂိမ်းအတွင်း မသမာနည်းလမ်းများ အသုံးပြုခြင်းအကြောင်း ဆွေးနွေးထားသော ပို့စ်များကို အမျိုးအစားခွဲခြားရန် မူဝါဒတစ်ခုကို ဖန်တီးလိုနိုင်သည်၊ သို့မဟုတ် ထုတ်ကုန်သုံးသပ်ချက် ဝဘ်ဆိုက်တစ်ခုသည် အတုဖြစ်နိုင်ခြေရှိသည်ဟု ထင်ရသော သုံးသပ်ချက်များကို စိစစ်ရန် ၎င်း၏ကိုယ်ပိုင်မူဝါဒကို အသုံးပြုလိုနိုင်သည်။

မော်ဒယ်သည် မူဝါဒတစ်ခုနှင့် ထိုမူဝါဒအောက်တွင် အမျိုးအစားခွဲရန် အကြောင်းအရာကို တစ်ပြိုင်နက်တည်း ထည့်သွင်းချက်နှစ်ခုအဖြစ် လက်ခံပြီး၊ အကြောင်းအရာ၏ အကျုံးဝင်ရာနေရာနှင့် ၎င်း၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားချက်ကို ထုတ်ပေးပါသည်။ ထိုကောက်ချက်များကို ၎င်းတို့၏ ကိုယ်ပိုင် ဘေးကင်းလုံခြုံရေး ပိုက်လိုင်းများတွင် အသုံးပြုမည်၊ မအသုံးပြုမည်နှင့် အသုံးပြုမည်ဆိုပါက မည်သို့အသုံးပြုမည်ကို ဖန်တီးသူများက ဆုံးဖြတ်ကြသည်။ ဤ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော ချဉ်းကပ်ပုံသည် အောက်ပါအခြေအနေများတွင် အထူးကောင်းမွန်စွာ လုပ်ဆောင်သည်ကို ကျွန်ုပ်တို့ တွေ့မြင်ခဲ့ရပါသည်။

  • ဖြစ်ပေါ်နိုင်သော ထိခိုက်နစ်နာမှုသည် ပေါ်ပေါက်လာနေခြင်း သို့မဟုတ် ဆက်လက်ပြောင်းလဲနေခြင်း ဖြစ်ပြီး၊ မူဝါဒများကို အမြန် လိုက်လျောညီထွေဖြစ်အောင် ပြင်ဆင်ရန် လိုအပ်သည်။
  • ဤနယ်ပယ်သည် အသေးစိတ်ကွဲပြားချက်များစွာ ပါဝင်ပြီး ခွဲခြားရေးမော်ဒယ်ငယ်များအတွက် ကိုင်တွယ်ရန် ခက်ခဲသည်။
  • Developer များတွင် ၎င်းတို့၏ ပလက်ဖောင်းပေါ်ရှိ အန္တရာယ်တစ်ခုချင်းစီအတွက် အရည်အသွေးမြင့် ခွဲခြားစနစ်တစ်ခုကို လေ့ကျင့်ရန် နမူနာများ လုံလောက်စွာ မရှိပါ။
  • တုံ့ပြန်ချိန်နှောင့်နှေးမှုသည် အရည်အသွေးမြင့်၍ ရှင်းပြနိုင်သော တံဆိပ်များကို ထုတ်လုပ်ခြင်းထက် အရေးမကြီးပါ။

သုတေသနနှင့် ဘေးကင်းရေး အသိုင်းအဝိုင်းထံမှ အကြံပြုချက်များကို ရယူရန်နှင့် မော်ဒယ်၏ စွမ်းဆောင်ရည်ကို ဆက်လက် တိုးတက်အောင်လုပ်ဆောင်ရန် gpt-oss-safeguard ၏ ဤအစမ်းသုံးဗားရှင်းကို ကျွန်ုပ်တို့ ဖြန့်ချိလိုက်ပါသည်။ လအတော်ကြာအတွင်း developer ၏ အရေးကြီးလိုအပ်ချက်များကို ဖော်ထုတ်ရန်၊ မော်ဒယ်ကို စမ်းသပ်ရန်နှင့် developer စာတမ်းအချက်အလက်များကို ပြုစုရန် ROOST(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့်အတူ ဤ open weight ကို ကျွန်ုပ်တို့ ဖြန့်ချိခဲ့ပါသည်။ ဤမိတ်ဆက်မှု၏ တစ်စိတ်တစ်ပိုင်းအဖြစ် ROOST သည် အွန်လိုင်းနေရာများကို ကာကွယ်ရန် open AI မော်ဒယ်များကို လေ့လာရန်အတွက် ယနေ့လည်း စတင်မိတ်ဆက်သည့် မော်ဒယ် အသိုင်းအဝိုင်း(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) တစ်ခုကို တည်ထောင်မည်ဖြစ်ပါသည်။ ဤဖြန့်ချိမှုနှင့်အတူ ဤအစမ်းသုံး မော်ဒယ်၏ ဘေးကင်းရေး စွမ်းဆောင်ရည်ကို အသေးစိတ်ဖော်ပြထားသော တိုတောင်းသည့် နည်းပညာဆိုင်ရာ အစီရင်ခံစာ တစ်စောင်ကိုလည်း ကျွန်ုပ်တို့ ထုတ်ပြန်လိုက်ပါသည်။

စနစ်အဆင့် ဘေးကင်းရေး- ဘေးကင်းရေး အမျိုးအစားခွဲခြားသူများ၏ အခန်းကဏ္ဍ

ဘေးကင်းလုံခြုံမှုနှင့်ပတ်သက်လာလျှင်၊ ကျွန်ုပ်တို့သည် အလွှာလိုက် ကာကွယ်ရေး ကို ယုံကြည်ပါသည်။ ကျွန်ုပ်တို့၏ မူဝါဒများအောက်တွင် ဖြစ်နိုင်ခြေရှိသော မလုံခြုံသော အဝင်များနှင့် အထွက်များကို ရှာဖွေဖော်ထုတ်ပြီး ကိုင်တွယ်ဖြေရှင်းရန် ကျွန်ုပ်တို့၏ မော်ဒယ်များကို လုံခြုံစွာ တုံ့ပြန်နိုင်အောင် လေ့ကျင့်သင်ကြားပေးပြီး၊ အပို ကာကွယ်ရေးအလွှာများကိုလည်း အကောင်အထည်ဖော်ထားပါသည်။ သတ်မှတ်ထားသော အန္တရာယ်နယ်ပယ်တစ်ခုတွင် လုံခြုံသော အကြောင်းအရာနှင့် မလုံခြုံသော အကြောင်းအရာကို ခွဲခြားသတ်မှတ်ပေးသည့် ဘေးကင်းရေး အမျိုးအစားခွဲခြားကိရိယာများသည် ကျွန်ုပ်တို့၏ ကိုယ်ပိုင်နှင့် အခြား ကြီးမားသော ဘာသာစကား မော်ဒယ်များအတွက် အဓိက ကာကွယ်ရေးအလွှာတစ်ခုအဖြစ် ကာလရှည်ကြာ တည်ရှိခဲ့ပါသည်။

ကျွန်ုပ်တို့၏ Moderation API(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) မှတစ်ဆင့် ရရှိနိုင်သော စနစ်များကဲ့သို့သော သမားရိုးကျ လုံခြုံရေး အမျိုးအစားခွဲစနစ်များကို ကြိုတင်သတ်မှတ်ထားသော လုံခြုံရေးမူဝါဒများအောက်တွင် ဘေးကင်းသောနှင့် ဘေးမကင်းသော အကြောင်းအရာ နမူနာထောင်ပေါင်းများစွာကို လူကိုယ်တိုင် စနစ်တကျ ရွေးချယ်စုစည်းခြင်းဖြင့် ဖန်တီးတည်ဆောက်ထားသည်။ ဤလေ့ကျင့်ရေးဒေတာမှတစ်ဆင့် ခွဲခြားစနစ်သည် လုံခြုံသော အထွက်များနှင့် မလုံခြုံသော အထွက်များကို ခွဲခြားနိုင်ရန် သင်ယူသည်။ ဤအစဉ်အလာနည်းလမ်းတွင်၊ ခွဲခြားသတ်မှတ်သည့် မော်ဒယ်သည် ဘေးကင်းလုံခြုံရေးမူဝါဒကို အမှန်တကယ် တစ်ခါမျှ မတွေ့မြင်ရပါ။ ထိုအစား၊ ၎င်းသည် မလုံခြုံဟု တံဆိပ်ကပ်ထားသော အကြောင်းအရာထဲရှိ ဆင်တူချက်များနှင့် မလုံခြုံသော အကြောင်းအရာနှင့် လုံခြုံသော အကြောင်းအရာတို့အကြားရှိ ကွဲပြားချက်များကို ရှာဖွေခြင်းအားဖြင့်၊ နမူနာများကို တံဆိပ်ကပ်ရာတွင် အသုံးပြုခဲ့သော အခြေခံမူဝါဒကို ခန့်မှန်းရန် ကြိုးပမ်းသည်။

ရိုးရာ အမျိုးအစားခွဲခြားကိရိယာများသည် စွမ်းဆောင်ရည်အမြင့်ဖြင့်၊ တုံ့ပြန်ချိန်နှောင့်နှေးမှုနှင့် လည်ပတ်မှုကုန်ကျစရိတ်နည်းပါးနိုင်သည်။ သို့သော် လုံလောက်သောပမာဏရှိသည့် လေ့ကျင့်ရေးနမူနာများကို စုဆောင်းခြင်းသည် အချိန်ကုန်ပြီး၊ ကုန်ကျစရိတ်များနိုင်သလို၊ မူဝါဒကို အပ်ဒိတ်လုပ်ရန် သို့မဟုတ် ပြောင်းလဲရန်အတွက်လည်း အမျိုးအစားခွဲခြားကိရိယာကို ပြန်လည်လေ့ကျင့်ပေးရန် လိုအပ်သည်။

gpt-oss-safeguard သည် ကွဲပြားသည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်း၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော စွမ်းရည်များကြောင့် developer များသည် ၎င်းတို့ကိုယ်တိုင် ရေးသားထားသော သို့မဟုတ် အခြားရင်းမြစ်များမှ ယူထားသော မူဝါဒများအပါအဝင် မည်သည့် မူဝါဒကိုမဆို အသုံးချနိုင်ပြီး၊ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော လုပ်ဆောင်ချက်သည် မော်ဒယ်များကို အသစ်ရေးသားထားသော မူဝါဒများအပေါ် ယေဘုယျအသုံးချနိုင်စေရန် ကူညီပေးသည်။ ဘေးကင်းလုံခြုံရေး မူဝါဒများအပြင်၊ gpt-oss-safeguard ကို သီးခြားထုတ်ကုန်များနှင့် ပလက်ဖောင်းများအတွက် အရေးကြီးသော အခြားနည်းလမ်းများဖြင့် အကြောင်းအရာများကို အမှတ်အသားပြု သတ်မှတ်ရန်လည်း အသုံးပြုနိုင်သည်။

‘gpt-oss-safeguard ဖြင့် မူဝါဒအခြေပြု ကျိုးကြောင်းဆင်ခြင်ခြင်း’ ဟု အမည်ပေးထားသော စီးဆင်းမှုဇယား။ ဆော့ဖ်ဝဲရေးသားသူက ပေးထားသော မူဝါဒများနှင့် အသုံးပြုသူက ပေးထားသော အကြောင်းအရာများကို GPT-OSS-Safeguard ထဲသို့ ထည့်သွင်းသည်။ မော်ဒယ်က အတွေးကွင်းဆက်တစ်ခု၊ ထို့နောက် မူဝါဒဆိုင်ရာ ဆုံးဖြတ်ချက်တစ်ခုကို ထုတ်ပေးပြီး၊ မူဝါဒများ ပိုကောင်းမွန်စေရန် ပြန်လည်ထည့်သွင်းပေးသော ‘policy iteration’ ဟု အညွှန်းတပ်ထားသည့် ကွင်းဆက်တစ်ခု ပါရှိသည်။ legend သည် developer input၊ user input နှင့် မော်ဒယ် output တို့ကို ညွှန်ပြသည်။

ဘေးကင်းရေး ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးခြင်းကို အတွင်းပိုင်းတွင် အသုံးပြုပုံ

ကျွန်ုပ်တို့၏ အဓိက ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်များသည် ယခုအခါ ကျွန်ုပ်တို့၏ ဘေးကင်းရေး မူဝါဒများကို တိုက်ရိုက် သင်ယူပြီး၊ လုံခြုံသောအရာသည် မည်သည်ကို ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော နိုင်စွမ်းများကို အသုံးပြုပါသည်။ ကျွန်ုပ်တို့က စဉ်းစားဆုံးဖြတ်ပြီး ကိုက်ညီစေမှု ဟု ခေါ်သော ဤနည်းလမ်းသည် ယခင် ဘေးကင်းရေး လေ့ကျင့်သင်ကြားမှု နည်းလမ်းများထက် သိသိသာသာ ပိုမိုကောင်းမွန်စေပြီး၊ ၎င်းတို့၏ စွမ်းရည်များ တိုးလာသည်နှင့်အမျှပင် ကျွန်ုပ်တို့၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်များကို ကျိုးကြောင်းသင့်လျော်စွာ မစဉ်းစားပေးသော ယခင်မျိုးဆက်များထက် အချက်အလက်အမျိုးမျိုးတွင် ပိုမိုလုံခြုံစေပါသည်။ သို့သော် ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသောသည် မော်ဒယ်များကိုယ်တိုင် လေ့ကျင့်ရန်အတွက်သာ အသုံးဝင်သည် မဟုတ်ပါ။ ၎င်းသည် အလွှာလိုက် ကာကွယ်ရေးအတွက် ဖြစ်နိုင်ခြေအသစ်များကိုလည်း ဖန်တီးပေးသည်။ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော အခြေပြု နည်းလမ်းများသည် ပိုမိုပြောင်းလွယ်ပြင်လွယ်ရှိပြီး ၎င်းတို့၏ ယခင် လေ့ကျင့်သင်ကြားမှု၏ အသေးစိတ်အချက်အလက်များကြောင့် ကန့်သတ်မှု နည်းပါးကာ၊ ထိုအားသာချက်များသည် တစ်ခါတစ်ရံ ၎င်းတို့တွင် ပါဝင်သော ထပ်ဆောင်း ကွန်ပျူတ် စရိတ်နှင့် ကြန့်ကြာချိန်ကို လုံလောက်ရုံသာမက ကျော်လွန်၍ပင် အကြောင်းပြနိုင်ပါသည်။

gpt-oss-safeguard သည် ကျွန်ုပ်တို့အတွင်းပိုင်းတွင် ဖွံ့ဖြိုးတီထွင်ခဲ့သော ချဉ်းကပ်နည်းတစ်ခုကို အလေးချိန်များ ဖွင့်လှစ်ထားသည့် ပုံစံဖြင့် အကောင်အထည်ဖော်ထားခြင်းဖြစ်ပြီး ထိုကိရိယာကို ကျွန်ုပ်တို့ Safety Reasoner ဟု ခေါ်ပါသည်။ ကျွန်ုပ်တို့သည် မူဝါဒ အညွှန်းတပ်ခြင်း လုပ်ငန်းတာဝန်များတွင် အားဖြည့် မွမ်းမံပြင်ဆင်ခြင်းဖြင့် စတင်ခဲ့ပြီး၊ လူသား ကျွမ်းကျင်သူများ၏ မှန်ကန်သော စီရင်ဆုံးဖြတ်ချက်များကို ထင်ဟပ်စေသည့် မော်ဒယ်ကို ဆုချခဲ့ပါသည်။ ဤအရာက မူဝါဒသည် ၎င်း၏ စီရင်ဆုံးဖြတ်ချက်သို့ မည်သို့ ဦးတည်စေသည်ကို မော်ဒယ်က ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားနိုင်ရန် သင်ပေးခဲ့သည်။ ယနေ့တွင် Safety Reasoner သည် classifier တစ်ခုကို ပြန်လည်လေ့ကျင့်ရန် ကြာမြင့်မည့်အချိန်ထက် ပိုနည်းသောအချိန်အတွင်း ထုတ်လုပ်မှု ပတ်ဝန်းကျင်တွင် ကျွန်ုပ်တို့၏ ဘေးကင်းရေးမူဝါဒများကို တိကျစွာ အပ်ဒိတ်လုပ်နိုင်စေပါသည်။ ဤအရာက Safety Reasoner ကို iterative deployment အတွက် အဓိက ကိရိယာတစ်ခု ဖြစ်စေပါသည်၊ ကျွန်ုပ်တို့သည် မော်ဒယ်အသစ်များကို ထုတ်လုပ်မှုသို့ တပ်ဆင်အသုံးပြုသည့်အခါ ပိုမိုတင်းကျပ်သော မူဝါဒများဖြင့် စတင်လေ့ရှိပြီး Safety Reasoner က ထိုမူဝါဒများကို ဂရုတစိုက် အသုံးချနိုင်ရန် လိုအပ်သည့်နေရာများတွင် ကွန်ပျူတာ အရေအတွက် အတော်လေး များစွာကို အသုံးပြုပါသည်။ ထို့နောက် ထုတ်လုပ်မှုအတွင်းရှိ အန္တရာယ်များကို နားလည်သဘောပေါက်မှု ပိုမိုကောင်းမွန်လာသည့်အတိုင်း ကျွန်ုပ်တို့၏ မူဝါဒများကို ချိန်ညှိပြင်ဆင်ပါသည်။ ကျွန်ုပ်တို့၏ မကြာသေးမီက မိတ်ဆက်ခဲ့သော ထုတ်ကုန်အချို့တွင် ဘေးကင်းရေးဆိုင်ရာ ကျိုးကြောင်းဆင်ခြင်မှုအတွက် ရည်စူးထားသော စုစုပေါင်းတွက်ချက်မှု၏ အစိတ်အပိုင်းမှာ ၁၆% အထိ မြင့်မားပါသည်။

Safety Reasoner သည် ကျွန်ုပ်တို့၏ ဘေးကင်းလုံခြုံရေးစနစ်အစုတွင် အဓိကအစိတ်အပိုင်းတစ်ခု ဖြစ်လာခဲ့သည်။ ရုပ်ပုံ ထုတ်လုပ်မှု နှင့် Sora 2 အတွက် ၎င်းသည် မလုံခြုံသော ထုတ်လုပ်မှုများကို အချိန်နှင့်တပြေးညီ ဖော်ထုတ်ကာ ပိတ်ဆို့ရန် အထွက်များကို လှုပ်ရှားပြောင်းလဲနေသော၊ အဆင့်လိုက် အကဲဖြတ်မှုများ ပြုလုပ်ပါသည်။ ဇီဝဗေဒနှင့် ကိုယ်ကိုယ်ကို ထိခိုက်စေခြင်းကဲ့သို့သော နယ်ပယ်များတွင် စိတ်ဝင်စားသည့် နယ်ပယ်တစ်ခုအတွင်း မည်သည့် အကြောင်းအရာ ပါဝင်သည်ကို သတ်မှတ်ရန် ကျွန်ုပ်တို့သည် Moderation API တွင် အသုံးပြုထားသော မော်ဒယ်များကဲ့သို့သော မော်ဒယ်များကို သေးငယ်သော၊ မြန်ဆန်သော၊ ပြန်လည်ရှာဖွေရေး (recall) မြင့်သော အမျိုးအစားခွဲခြားရေးစနစ်များအဖြစ် လည်ပတ်စေပြီး၊ ထို့နောက် ထိုအကြောင်းအရာကို ပြန်လည်သုံးသပ်ရန် Safety Reasoner ကို အသုံးပြုပါသည်။ Safety Reasoner သည် မည်သို့ တုံ့ပြန်သင့်သည်ကို သတ်မှတ်ရန် မော်ဒယ် အထွက်များကို အသေးစိတ် taxonomy တစ်ခုနှင့် တိုက်ဆိုင်အောင် အမျိုးအစားခွဲခြားပြီး၊ GPT‑5 နှင့် ChatGPT Agent ကဲ့သို့သော စနစ်များတစ်လျှောက် ကျွန်ုပ်တို့၏ အလွှာစုံ ကာကွယ်မှုများ၏ အစိတ်အပိုင်းတစ်ခုအဖြစ် ဖွဲ့စည်းပါသည်။ ယခုအခါ၊ gpt-oss-safeguard မော်ဒယ်များက ဤတူညီသော ချဉ်းကပ်ပုံကို မည်သူမဆိုအတွက် ရရှိနိုင်စေပါသည်။

gpt-oss-safeguard ၏ စွမ်းဆောင်ရည်

ကျွန်ုပ်တို့သည် gpt-oss-safeguard မော်ဒယ်များကို အတွင်းပိုင်းနှင့် ပြင်ပ အကဲဖြတ်မှုအစုံ နှစ်ခုစလုံးတွင် အကဲဖြတ်ခဲ့ပါသည်။

အတွင်းပိုင်း အကဲဖြတ်မှုတွင်၊ inference ပြုလုပ်ချိန်၌ မူဝါဒများစွာကို gpt-oss-safeguard သို့ တစ်ပြိုင်နက်တည်း ပေးအပ်ခဲ့သည်။ စမ်းသပ်ထည့်သွင်းချက် တစ်ခုစီအတွက်၊ ပါဝင်သော မူဝါဒများအားလုံးအောက်တွင် gpt-oss-safeguard သည် စာသားကို မှန်ကန်စွာ အမျိုးအစားခွဲခြားထားခြင်း ရှိ၊ မရှိကို ကျွန်ုပ်တို့ အကဲဖြတ်သည်။ ဤသည်မှာ စိန်ခေါ်မှုရှိသော တာဝန်တစ်ခုဖြစ်ပြီး- ပါဝင်သော မူဝါဒအားလုံးအတွက် golden set labels များနှင့် အတိအကျ ကိုက်ညီသည့်အခါမှသာ မော်ဒယ်ကို တိကျသည်ဟု သတ်မှတ်ပါသည်။

ကျွန်ုပ်တို့၏ gpt-oss-safeguard မော်ဒယ်များနှင့် အတွင်းပိုင်း Safety Reasoner သည် မူဝါဒများစွာဆိုင်ရာ တိကျမှုတွင် gpt-5-thinking နှင့် gpt-oss အများသုံးနိုင်ရန် ပြုလုပ်ပေးထားသော မော်ဒယ်များထက် ပိုမိုကောင်းမွန်သည်။ ယခင်ဖော်ပြထားသော မော်ဒယ်များ၏ အရွယ်အစားသေးငယ်မှုကို ထည့်သွင်းစဉ်းစားလျှင် gpt-oss-safeguard မော်ဒယ်များက gpt-5-thinking ထက် ပိုမိုကောင်းမွန်နေခြင်းသည် အထူးပင် အံ့အားသင့်ဖွယ်ဖြစ်သည်။

ကျွန်ုပ်တို့သည် ဤမော်ဒယ်များကို ကျွန်ုပ်တို့၏ ထိန်းချုပ်မှု ဒေတာစုစည်းမှု(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ကို ၂၀၂၂ ခုနှစ် သုတေသနစာတမ်း(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့်အတူ ထုတ်ပြန်ခဲ့ပြီး၊ open-source chatbot တစ်ခုသို့ အသုံးပြုသူများ၏ မေးမြန်းချက်များအပေါ် အခြေခံထားသော အများပြည်သူသုံး စမ်းသပ်မှုဖြစ်သည့် ToxicChat(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ပေါ်တွင်လည်း ထပ်မံအကဲဖြတ်ခဲ့ပါသည်။

2022 မော်ဒရေးရှင်း အကဲဖြတ်မှု ဒေတာစုတွင် ကျွန်ုပ်တို့၏ အဖွဲ့အစည်းအတွင်း အသုံးပြုသော လုံခြုံရေးမူဝါဒများကို အသုံးပြု၍ အကဲဖြတ်ခဲ့သည် (နောက်ပိုင်း ပြောင်းလဲမှုများကို ထည့်သွင်းစဉ်းစားနိုင်ရန် မူဝါဒတစ်ခုကို ပြင်ဆင်အသုံးပြုခဲ့သည်)။ gpt-oss-safeguard သည် ကျွန်ုပ်တို့၏ အတွင်းပိုင်း ဘေးကင်းရေးအကြောင်းပြချက်နှင့် gpt-5-thinking အပါအဝင် အခြားစမ်းသပ်ထားသော မော်ဒယ်အားလုံးထက် အနည်းငယ်သာလွန်ကောင်းမွန်သော်လည်း၊ ဘေးကင်းရေးအကြောင်းပြချက်နှင့် gpt-oss-safeguard အကြား ဤကွာခြားချက်သည် စာရင်းအင်းအရ သိသာထင်ရှားမှုမရှိပါ။

ToxicChat အတွက်၊ ကျွန်ုပ်တို့၏ အတွင်းပိုင်း မူဝါဒအချို့မှ လိုက်လျောညီထွေဖြစ်အောင် ပြင်ဆင်ထားသော လက်ဖြင့်ရေးထားသည့် တိုတောင်းသော တုံ့ပြန်ညွှန်ကြားချက်ကို အသုံးပြု၍ အကဲဖြတ်ခဲ့သည်။ ကျွန်ုပ်တို့၏ အတွင်းပိုင်း Safety Reasoner သည် gpt-5-thinking ထက် ထပ်မံ သာလွန်စွာ စွမ်းဆောင်နိုင်ခဲ့ပြီး၊ gpt-5-thinking နှင့် Safety Reasoner နှစ်ခုစလုံးသည် gpt-oss-safeguard-120b နှင့် gpt-oss-safeguard-20b တို့ထက် အနည်းငယ်သာလွန်စွာ စွမ်းဆောင်နိုင်ခဲ့သည်။ gpt-oss-safeguard ၏ အရွယ်အစားမှာ အတော်လေး သေးငယ်သော်လည်း၊ ဤအမျိုးအစားတာဝန်အတွက် ၎င်းကို ရွေးချယ်သုံးစွဲရန် ပိုမိုသင့်တော်စေသေးသည်ဟု ကျွန်ုပ်တို့ မျှော်လင့်ပါသည်။

ကန့်သတ်ချက်များ

gpt-oss-safeguard တွင် သီးခြား ကန့်သတ်ချက်နှစ်ခု ရှိသည်။ ပထမအနေဖြင့်၊ အရည်အသွေးမြင့် တပ်ဆင်ထားသော နမူနာ သောင်းကျော်ပေါ်တွင် လေ့ကျင့်ထားသော classifier များသည် မူဝါဒမှ တိုက်ရိုက် ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားသောအခါ gpt-oss-safeguard ထက် အကြောင်းအရာများကို ပိုမိုကောင်းမွန်စွာ အမျိုးအစားခွဲခြားနိုင်ကြောင်း ကျွန်ုပ်တို့ တွေ့ရှိထားပါသည်။ ပိုမိုရှုပ်ထွေးသော အန္တရာယ်များအတွက် ပိုမိုမြင့်မားသော စွမ်းဆောင်ရည်ရရှိစေရန် သီးသန့် ကလပ်စီဖိုင်ယာ (classifier) တစ်ခုကို လေ့ကျင့်ရန် အချိန်ယူခြင်းကို ပိုမိုသင့်တော်သည်ဟု ယူဆနိုင်ပါသည်။

ဒုတိယအနေဖြင့် gpt-oss-safeguard သည် အချိန်နှင့် တွက်ချက်မှုအရင်းအမြစ်များစွာ လိုအပ်နိုင်သောကြောင့် ပလက်ဖောင်းရှိ အကြောင်းအရာအားလုံးတစ်လျှောက် ချဲ့ထွင်အသုံးပြုရန် ခက်ခဲစေသည်။ အတွင်းပိုင်းတွင် ကျွန်ုပ်တို့သည် Safety Reasoner ဖြင့် ဤအရာကို နည်းလမ်းအများအပြားဖြင့် ကိုင်တွယ်ပါသည်။ (1) မည်သည့်အကြောင်းအရာကို အကဲဖြတ်ရမည်ကို သတ်မှတ်ရန် ပိုမိုသေးငယ်ပြီး ပိုမိုမြန်ဆန်သော အမျိုးအစားခွဲခြားသည့် မော်ဒယ်များကို အသုံးပြုသည်၊ နှင့် (2) အချို့သောအခြေအနေများတွင်၊ အန္တရာယ်ရှိနိုင်သော အကြောင်းအရာကို တွေ့ရှိပါက ဝင်ရောက်စွက်ဖက်နိုင်စွမ်းကို ဆက်လက်ထိန်းသိမ်းထားစဉ် တုံ့ပြန်နှောင့်နှေးမှုနည်းသော အသုံးပြုသူအတွေ့အကြုံကို ပေးနိုင်ရန် Safety Reasoner ကို အချိန်မစောင့်ဘဲ အသုံးပြုသည်။

ရှေ့ဆက်ရမည့်လမ်းကြောင်း - အသိုင်းအဝိုင်းနှင့်အတူ ဆက်လက်တည်ဆောက်သွားခြင်း

gpt-oss-safeguard သည် အသိုင်းအဝိုင်းနှင့်အတူ တည်ဆောက်ထားသော OpenAI ၏ ပထမဆုံး ဖွင့်လှစ်ထားသည့် ဘေးကင်းရေး မော်ဒယ်များအစု ဖြစ်သည်။ အစောပိုင်း စမ်းသပ်မှု၏ တစ်စိတ်တစ်ပိုင်းအဖြစ် SafetyKit၊ ROOST၊ Tomoro၊ နှင့် Discord တို့မှ ယုံကြည်မှုနှင့် ဘေးကင်းလုံခြုံရေး အထူးကျွမ်းကျင်သူများနှင့်အတူ gpt-oss-safeguard ကို အဆင့်ဆင့် ပြင်ဆင်တိုးတက်အောင် လုပ်ဆောင်ခဲ့ပါသည်။ ROOST CTO Vinay Rao က “gpt-oss-safeguard သည် ‘သင့်ကိုယ်ပိုင် မူဝါဒများနှင့် အန္တရာယ်၏ သတ်မှတ်ချက်များကို ယူဆောင်လာပါ’ ဒီဇိုင်းပါသော ပထမဆုံး open source ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ် ဖြစ်သည်။ အဖွဲ့အစည်းများသည် ဘေးကင်းလုံခြုံရေးအတွက် အလွန်အရေးပါသော နည်းပညာများကို လွတ်လပ်စွာ လေ့လာ၊ ပြင်ဆင်မွမ်းမံ၊ အသုံးပြုနိုင်ပြီး ဆန်းသစ်တီထွင်နိုင်ရန် အခွင့်အရေးရှိသင့်သည်။ ကျွန်ုပ်တို့၏ စမ်းသပ်မှုတွင် ၎င်းသည် မတူညီသော မူဝါဒများကို နားလည်ခြင်း၊ ၎င်း၏ ကျိုးကြောင်းဆင်ခြင်ချက်ကို ရှင်းပြခြင်းနှင့် မူဝါဒများကို အသုံးချရာတွင် သိမ်မွေ့သော သိမ်မွေ့မှုများကို ပြသခြင်းတို့တွင် ကျွမ်းကျင်ပြီး ၎င်းသည် ဆောက်လုပ်ရေးသမားများနှင့် ဘေးကင်းရေးအဖွဲ့များအတွက် အကျိုးရှိလိမ့်မည်ဟု ကျွန်ုပ်တို့ ယုံကြည်ပါသည်။

ကျွန်ုပ်တို့သည် ROOST မော်ဒယ် Community (RMC) မှတစ်ဆင့် အပါအဝင် အများသုံးနိုင်ရန် ပြုလုပ်ပေးထားသော ဘေးကင်းရေး ကိရိယာများကို တိုးတက်ကောင်းမွန်အောင် ပြုလုပ်ရန် အသိုင်းအဝိုင်းနှင့်အတူ ဆက်လက် ပြင်ဆင်တိုးတက်အောင် လုပ်ဆောင်သွားမည်ဖြစ်ပါသည်။ RMC သည် အကဲဖြတ်မှု ရလဒ်များနှင့် မော်ဒယ် အကြံပြုချက်များ အပါအဝင် open source AI မော်ဒယ်များကို ဘေးကင်းရေး လုပ်ငန်းစဉ်များတွင် အကောင်အထည်ဖော်ရန်အတွက် အကောင်းဆုံး လုပ်ဆောင်နည်းများကို မျှဝေရန် ဘေးကင်းရေး လက်တွေ့လုပ်ဆောင်သူများနှင့် သုတေသီများကို စုစည်းပေးပါသည်။ ဤပူးပေါင်းဆောင်ရွက်မှုအကြောင်းနှင့် ပါဝင်နိုင်ပုံကို ပိုမိုလေ့လာရန် RMC GitHub repo(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) သို့ ဝင်ရောက်ကြည့်ရှုပါ။

ဤမော်ဒယ်များဖြင့် စတင်တည်ဆောက်ရန် ၎င်းတို့ကို Hugging Face(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) မှ ဒေါင်းလုဒ်လုပ်ပါ။

စာရေးသူ

OpenAI