အဓိက အကြောင်းအရာသို့ ကျော်သွားရန်
OpenAI

၂၀၂၆ ဇူလိုင် ၂၀

ဘေးကင်းရေး

အချိန်ကာလရှည် မော်ဒယ်ခေတ်၏ ဘေးကင်းမှုနှင့် ကိုက်ညီမှု

အချိန်ကြာ လည်ပတ်သော မော်ဒယ်တစ်ခုကို အတွင်းပိုင်းအသုံးပြုရာမှ ဘေးကင်းမှုအကြောင်း ကျွန်ုပ်တို့ သင်ယူခဲ့ရသည့်အရာ။

ဖွင့်နေသည်…

အနှစ်ချုပ်

  • အချိန်ကြာ လည်ပတ်သော မော်ဒယ်များသည် ခက်ခဲပြီး အဆုံးမရှိသော ပြဿနာများကို ဖြေရှင်းနိုင်သော်လည်း ၎င်းတို့၏ ဇွဲရှိမှုက မလိုလားအပ်သော လုပ်ဆောင်ချက်များ လုပ်ရန် အခွင့်အလမ်းများကို ပိုမိုပေးသည်။ 

  • အချိန်ကြာ လုပ်ငန်းများအတွက် လေ့ကျင့်ထားသော မော်ဒယ်တစ်ခုကို ကန့်သတ်ထားသော အတွင်းပိုင်းအသုံးပြုမှုအတွင်း၊ ကျွန်ုပ်တို့၏ လက်ရှိ ဖြန့်ကျက်အသုံးပြုမှုမတိုင်မီ အကဲဖြတ်မှုများက မဖမ်းမိခဲ့သော ချွတ်ယွင်းမှုအသစ်များကို တွေ့ရှိခဲ့ပြီး ဝင်ရောက်ခွင့်ကို ရပ်ဆိုင်းခဲ့သည်။ ထို့နောက် ကန့်သတ်ဝင်ရောက်ခွင့်ကို ပြန်လည်မဖွင့်မီ ဤချွတ်ယွင်းမှုများမှ ရရှိသော အသိအမြင်များကို အသုံးပြု၍ အကဲဖြတ်မှုအသစ်များ တည်ဆောက်ခဲ့သည်၊ အချိန်ကာလရှည် ကိုက်ညီမှုကို မြှင့်တင်ခဲ့သည်၊ trajectory အဆင့် စောင့်ကြည့်မှုကို ထည့်သွင်းခဲ့ပြီး အသုံးပြုသူများအား မြင်နိုင်မှုနှင့် ထိန်းချုပ်နိုင်မှု ပိုမိုပေးခဲ့သည်။

  • ဤအတွေ့အကြုံက အဆင့်လိုက် ဖြန့်ကျက်အသုံးပြုမှု၏ တန်ဖိုးကို ပိုမိုခိုင်မာစေခဲ့သည်။ သတ်မှတ်ထားသည့် အကဲဖြတ်မှုအစုတစ်ခုတည်းက အပြုအမူတိုင်းကို ကြိုတင်ခန့်မှန်းနိုင်မည်မဟုတ်သောကြောင့် ဖြန့်ကျက်အသုံးပြုမှု မတိုင်မီ စမ်းသပ်မှုကို နီးကပ်သော စောင့်ကြည့်မှု၊ ဝင်ရောက်ထိန်းသိမ်းနိုင်သော ကာကွယ်မှုများနှင့် လိုအပ်သည့်အခါ ရပ်ဆိုင်းရန် သို့မဟုတ် ပြန်လှန်ရန် စွမ်းရည်တို့နှင့် တွဲဖက်ရမည်။

အချိန်ကြာမြင့်စွာ ကိုယ်တိုင်လုပ်ဆောင်နိုင်သော မော်ဒယ်များသည် ခက်ခဲပြီး အဆုံးမရှိသော ပြဿနာများကို ကိုင်တွယ်ဖြေရှင်းနိုင်သည်။ သို့သော် ၎င်းတို့ကို အသုံးဝင်စေသည့် ထိုဇွဲရှိမှုသည် မလိုလားအပ်သော လုပ်ဆောင်ချက်များကို လုပ်ဆောင်ရန် အခွင့်အလမ်းများကိုလည်း ပိုပေးပြီး အချိန်ကာလတို မော်ဒယ်များအတွက် ရည်ရွယ်ထားသော အကဲဖြတ်မှုများက မတွေ့မိနိုင်သည့် နည်းလမ်းများဖြင့်လည်း လုပ်ဆောင်နိုင်စေသည်။

လွန်ခဲ့သော နှစ်လခန့်က အတွင်းပိုင်းသုံး ယေဘုယျရည်ရွယ်ချက် မော်ဒယ်တစ်ခုက Erdős unit distance conjecture ကို မှားကြောင်း သက်သေပြခဲ့သည်ဟု ကျွန်ုပ်တို့ ကြေညာခဲ့ သည်။ ဤမော်ဒယ်ကို အလွန်ကြာမြင့်သော အချိန်ကာလအတွင်း ကိုယ်တိုင်လုပ်ဆောင်နိုင်ရန် ဒီဇိုင်းထုတ်ထားသည်။ ကန့်သတ်ပြီး စောင့်ကြည့်ထားသော အတွင်းပိုင်းအသုံးပြုမှုအတွင်း၊ ကျွန်ုပ်တို့၏ လက်ရှိ ဖြန့်ကျက်အသုံးပြုမှု အကဲဖြတ်မှုများက မဖမ်းမိခဲ့သော မလိုလားအပ်သည့် အပြုအမူကို တွေ့ရှိခဲ့သည်။ ဖြန့်ကျက်အသုံးပြုမှုကို ကန့်သတ်ပြီး စောင့်ကြည့်ထားသောကြောင့် ဤပြဿနာများကို ဖော်ထုတ်နိုင်ခဲ့ပြီး၊ ဝင်ရောက်အသုံးပြုခွင့်ကို ရပ်ဆိုင်းကာ၊ တွေ့ရှိချက်များအပေါ် အခြေခံ၍ အကဲဖြတ်မှုအသစ်များ ဖန်တီးပြီး၊ မော်ဒယ်နှင့် ၎င်း၏ ကာကွယ်မှုများကို အားဖြည့်ကာ၊ ဆက်လက်စောင့်ကြည့်မှုအောက်တွင် ဝင်ရောက်ခွင့်ကို ပြန်လည်ဖွင့်ပေးနိုင်ခဲ့သည်။ 

မော်ဒယ်များကို ကျွန်ုပ်တို့ အကဲဖြတ်သည့် အခြေအနေများသည် လက်တွေ့အသုံးပြုမှုတွင် ၎င်းတို့တွေ့ကြုံရသည့် အခြေအနေများနှင့် ဘယ်သောအခါမျှ အပြည့်အဝ တူညီမည်မဟုတ်ပါ။ ထို့ကြောင့်ဖြန့်ကျက်အသုံးပြုမှု မတိုင်မီ အကဲဖြတ်မှုများကို ကန့်သတ်ပြီး စောင့်ကြည့်ထားသော ဖြန့်ကျက်အသုံးပြုမှုနှင့် တွဲဖက်ရမည်ဖြစ်ကာ ပြဿနာများပေါ်ပေါက်လာသည့်အခါ ဝင်ရောက်ထိန်းသိမ်းနိုင်၊ ရပ်ဆိုင်းနိုင် သို့မဟုတ် ပြန်လှန်နိုင်စွမ်းလည်း လိုအပ်သည်။ ဖြန့်ကျက်အသုံးပြုမှုမှ သင်ယူရသည့်အရာများကို နောက်ပိုင်းတွင် ဝင်ရောက်ခွင့် မချဲ့ထွင်မီ ပိုမိုအားကောင်းသော အကဲဖြတ်မှုများနှင့် ကာကွယ်မှုများ၏ အစိတ်အပိုင်းအဖြစ် ထည့်သွင်းနိုင်သည်။

အောက်ပါကဏ္ဍများတွင် ကျွန်ုပ်တို့ တွေ့ရှိခဲ့သည့်အရာများ၊ ပြဿနာများကို ကိုင်တွယ်ဖြေရှင်းခဲ့ပုံနှင့် ဤအတွေ့အကြုံက အနာဂတ်ထုတ်လွှတ်မှုများကို မည်သို့ပုံဖော်မည်ကို တိကျသော ဥပမာများဖြင့် မျှဝေထားသည်။

မော်ဒယ်၏ ဇွဲရှိမှုက လုံခြုံရေးအားနည်းချက်များကို ဖော်ထုတ်နိုင်သည်

မော်ဒယ်အသစ်သည် အချိန်ကြာမြင့်စွာ ထပ်ခါတလဲလဲ ကြိုးပမ်းရင်း ရည်မှန်းချက်တစ်ခုဆီ ဆက်လက်လုပ်ဆောင်နိုင်သည်။ ထိုဇွဲရှိမှုသည် ၎င်း၏ ပတ်ဝန်းကျင်ထဲရှိ အားနည်းချက်များကို ရှာဖွေပြီး အသုံးချစေနိုင်သည်။ ယခင်မော်ဒယ်များသည် sandboxing သို့မဟုတ် ပတ်ဝန်းကျင်ကန့်သတ်ချက်များနှင့် ကြုံသောအခါ ရိုးရိုးတန်းတန်း ရပ်ပြီး အသုံးပြုသူထံ ပြန်သွားလေ့ရှိသည်။ ဤမော်ဒယ်သည် sandbox အပြင်ဘက်တွင် လုပ်ဆောင်နိုင်မည့် နည်းလမ်းများကို ရှာဖွေခြင်းအပါအဝင် မကြာခဏ ဆက်လက်ကြိုးစားခဲ့သည်။

ဤအရာ၏ ဥပမာတစ်ခုသည် NanoGPT speedrun(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ပေါ်တွင် ပြုလုပ်သည့် အတွင်းပိုင်းအကဲဖြတ်မှုအတွင်း ဖြစ်ပွားခဲ့သည်။ ၎င်းသည် language model အသေးတစ်ခုကို အဆင့်အနည်းဆုံးဖြင့် လေ့ကျင့်ရန် အများပြည်သူသုံး benchmark တစ်ခုဖြစ်သည်။ ကျွန်ုပ်တို့၏ မော်ဒယ်သည် PowerCool ဟုခေါ်သော power-law learning-rate cooldown တစ်ခုကို ဖန်တီးခဲ့ပြီး ၎င်းက သိသာထင်ရှားသော တိုးတက်မှုကို ဖြစ်စေခဲ့သည်။ မော်ဒယ်အား ၎င်း၏ရလဒ်များကို Slack သို့သာ တင်ရန် ညွှန်ကြားထားသော်လည်း NanoGPT ညွှန်ကြားချက်များတွင် ရလဒ်များကို GitHub သို့ PR အဖြစ် တင်ရန် ဆိုထားပြီး၊ မော်ဒယ်က နောက်ဆုံးညွှန်ကြားချက်ကို လိုက်နာကာ public GitHub သိမ်းဆည်းရန်နေရာတွင် PR #287 ကို ဖွင့်ခဲ့သည်။ မော်ဒယ်သည် ပြင်ပဝင်ရောက်မှုကို ပိတ်ရန် ဒီဇိုင်းထုတ်ထားသော sandbox ကန့်သတ်ချက်များကို ရှောင်လွှဲပြီး GitHub သို့ upload လုပ်ရန် ဆက်လုပ်ခဲ့သည်။ PR ပြုလုပ်နိုင်ရန် sandbox ထဲရှိ အားနည်းချက်တစ်ခုကို ရှာဖွေရာတွင် ကျွန်ုပ်တို့၏ မော်ဒယ်က တစ်နာရီကြာခဲ့သည်။ ယခင်မော်ဒယ်များမှာ ဇွဲနည်းခဲ့ပြီး အားနည်းချက်များကို ရှာမတွေ့နိုင်ဘဲ PR အပိုင်းကို လက်လျှော့ခဲ့ကြသည်။1

လုပ်ဆောင်ချက်တစ်ခုချင်းကို စဉ်းစားခြင်းမှ လမ်းကြောင်းတစ်ခုလုံးကို စဉ်းစားခြင်းဆီသို့

AI လက်ထောက်များအတွက် ဘေးကင်းရေးထိန်းချုပ်မှုများစွာကို လုပ်ဆောင်ချက်တစ်ခုချင်းကို အခြေခံ၍ ဒီဇိုင်းထုတ်ထားသည်။ လုပ်ဆောင်ချက်တစ်ခုကို ခွင့်မပြုထားပါက ၎င်းကို ပိတ်ဆို့သည်။ ၎င်းသည် ထိခိုက်လွယ်သောအရာဖြစ်ပါက စနစ်က အသုံးပြုသူထံမှ ရှင်းလင်းသော အတည်ပြုချက်ကို တောင်းခံသည်။ သို့သော် နာရီများ၊ ရက်များ သို့မဟုတ် သီတင်းပတ်များအထိ ကိုယ်တိုင်ဆက်လက်လည်ပတ်နိုင်သည့် အချိန်ကြာ မော်ဒယ်များသည် ဤစနစ်ကို စိန်ခေါ်လာသည်။ လုပ်ဆောင်ချက်တစ်ခုချင်းကို စောင့်ကြည့်ခြင်းမျှဖြင့် လမ်းကြောင်းတစ်ခုလုံး၏ ရည်ရွယ်ချက်ကို ခြေရာခံရန် မလုံလောက်တော့ပါ။

ဥပမာအားဖြင့် ပြဿနာတစ်ခုကို ဖြေရှင်းရန် မော်ဒယ်ကို ခိုင်းထားသော အခြေအနေတစ်ခုတွင်၊ အခြားစနစ်များ၌ အောင်မြင်သော်လည်း private ဖြစ်သော တင်သွင်းမှုများရှိကြောင်း မော်ဒယ်က သတိပြုမိပြီး ထိုဖြေရှင်းချက်များကို evaluation backend မှ ပြန်လည်ရယူရန် ကြိုးစားခဲ့သည်။ authentication တိုကင်တစ်ခုကို scanner က တွေ့ရှိသဖြင့် ၎င်း၏ကနဦးကြိုးပမ်းမှု ပိတ်ဆို့ခံရသောအခါ၊ မော်ဒယ်သည် တိုကင်၏ body ကို အပိုင်းနှစ်ပိုင်းခွဲ၍ ဖုံးကွယ်ပြီး runtime တွင် credential ကို ပြန်လည်တည်ဆောက်ခဲ့သည်။ ထို့ကြောင့် တိုကင်အပြည့်အစုံသည် ဆက်တိုက် string တစ်ခုအဖြစ် ဘယ်တော့မှ မပေါ်ခဲ့ပါ။ မော်ဒယ်သည် scanner ကို ရှောင်လွှဲရန် ဤအဆင့်များကို လုပ်ဆောင်နေခြင်းဖြစ်ကြောင်း အသုံးပြုသူထံရေးသည့် မှတ်ချက်များနှင့် ၎င်း၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော trace များ နှစ်ခုလုံးတွင် ရှင်းလင်းစွာ ဖော်ပြခဲ့သည်။

ဤဥပမာက အဆင့်တစ်ခုချင်းသည် သီးခြားကြည့်လျှင် လက်ခံနိုင်ဖွယ်ရှိပုံပေါ်နိုင်သော်လည်း အစဉ်လိုက်လုပ်ဆောင်မှုက အတည်ပြုခံရမည်မဟုတ်သော ရလဒ်တစ်ခုကို ဖြစ်စေနိုင်ကြောင်း ပြသသည်။ အချိန်ကာလရှည်များတစ်လျှောက် ထိရောက်စွာ လုပ်ဆောင်နိုင်သော မော်ဒယ်တစ်ခုသည် အတည်ပြုစနစ်၏ မမြင်မိသည့်နေရာများကို သင်ယူပြီး ၎င်းကို ရှောင်လွှဲကာ မိမိ၏ ရည်မှန်းချက်များကို အောင်မြင်အောင် လုပ်ဆောင်နိုင်ကြောင်းလည်း ၎င်းက ပြသသည်။ အချိန်ကာလရှည် ဘေးကင်းမှုအတွက် “ဤလုပ်ဆောင်ချက်ကို ခွင့်ပြုထားသလား” ဟုမေးရုံသာမက “ဤလုပ်ဆောင်ချက်အစဉ်သည် မည်သည့်ရလဒ်ဆီ ဦးတည်နေသလဲ”

အချိန်ကြာ လည်ပတ်သော မော်ဒယ်များအတွက် ကာကွယ်မှုများ တည်ဆောက်ခြင်း

ဤကဲ့သို့သော ဖြစ်ရပ်များကြောင့် မော်ဒယ်အသစ်၏ အတွင်းပိုင်း ဖြန့်ကျက်အသုံးပြုမှုကို ကျွန်ုပ်တို့ ရပ်ဆိုင်းခဲ့သည်။ ဘေးကင်းရေးစနစ်ကို ကာကွယ်ရေးအလွှာများစွာနှင့် trajectory အဆင့် စောင့်ကြည့်မှုကို အခြေခံ၍ ပြန်လည်တည်ဆောက်ခဲ့သည်။

  • ဖြစ်ရပ်များမှ ဆင်းသက်လာသော အကဲဖြတ်မှုများ။ အကဲဖြတ်မှုများသည် စနစ်တစ်ခုကို လက်တွေ့အသုံးမချမီ ဖြန့်ကျက်အသုံးပြုရန် ဘေးကင်းမကင်းကို ခန့်မှန်းနိုင်စေသည်။ သို့သော် အများဆုံးအသုံးဝင်စေရန် အကဲဖြတ်မှုတစ်ခုသည် လက်တွေ့ ဖြန့်ကျက်အသုံးပြုမှုအတွင်းရှိ trajectory များ၏ ဖြန့်ဖြူးပုံနှင့် အချိန်ကာလအရှည်ကို ထင်ဟပ်သင့်သည်။ ထို့ကြောင့် တွေ့ရှိခဲ့သော ချွတ်ယွင်းမှုများကို အသုံးပြု၍ adversarial အကဲဖြတ်မှုများ ဖန်တီးခဲ့သည်။ လက်တွေ့ဖြစ်ရပ်များမှ ဆင်းသက်လာသော အကဲဖြတ်မှုများတွင် တိုးတက်လာခြင်းက ထုတ်လုပ်ရေးတွင် ဖြန့်ကျက်အသုံးပြုပြီးနောက် ပိုမိုဘေးကင်းသော အပြုအမူကို ဖြစ်စေကြောင်း ကျွန်ုပ်တို့ တွေ့ရှိခဲ့သည်။
  • မြှင့်တင်ထားသော ကိုက်ညီမှု။ အသုံးပြုသူ၏ ရည်မှန်းချက်ကို လိုက်လံအောင်မြင်ရန် ကြိုးစားရာတွင် ခွင့်ပြုချက်မရှိဘဲ မလိုလားအပ်သော လုပ်ဆောင်ချက်များ လုပ်ဆောင်လိုသည့် ၎င်း၏ အလားအလာကို လျှော့ချရန် အဆင့်များ လုပ်ဆောင်ခဲ့သည်။  ဥပမာအားဖြင့် ရှည်လျားသော rollout များတွင် ကျွန်ုပ်တို့၏ မော်ဒယ်များသည် ညွှန်ကြားချက်များကို မှတ်မိနိုင်မှု ပိုအားနည်းကြောင်း တွေ့ရှိခဲ့ပြီး၊ ဤစွမ်းရည်အတွက် မော်ဒယ်ကို လေ့ကျင့်ပေးသောအခါ ပိုရှည်သော rollout များတစ်လျှောက် ကိုက်ညီမှုရှိနေသည့် မော်ဒယ်တစ်ခု ဖြစ်လာစေခဲ့သည်။ 
  • တက်ကြွသော စောင့်ကြည့်မှု။ အသုံးပြုသူကန့်သတ်ချက် သို့မဟုတ် ဘေးကင်းရေးနယ်နိမိတ်တစ်ခုကို မော်ဒယ်က ကျော်လွှားနေသည့် လက္ခဏာများရှိမရှိ ၎င်း၏ ပြောင်းလဲနေသော trajectory ကို စစ်ဆေးသည့် စောင့်ကြည့်စနစ်တစ်ခုကို ကျွန်ုပ်တို့ ဖန်တီးခဲ့သည်။ စောင့်ကြည့်ကိရိယာသည် လုပ်ဆောင်ချက်တစ်ခုတည်းကိုသာ မဟုတ်ဘဲ trajectory တစ်ခုလုံးကို စောင့်ကြည့်သည်။ အရေးကြီးသည်မှာ စောင့်ကြည့်ကိရိယာသည် session ကို ရပ်ဆိုင်းနိုင်ပြီး အသုံးပြုသူအား ပိုမိုနီးကပ်စွာ စစ်ဆေးရန် သတိပေးနိုင်သည်။ စစ်ဆေးပြီးနောက် စောင့်ကြည့်ကိရိယာက မှားယွင်းစွာ trigger ဖြစ်ခဲ့ပါက အသုံးပြုသူသည် မော်ဒယ်၏ အလုပ်ကို ဆက်လုပ်ရန် ရွေးချယ်နိုင်သည်။ 
  • အသုံးပြုသူမြင်နိုင်မှုနှင့် ထိန်းချုပ်နိုင်မှု ပိုမိုမြင့်မားခြင်း။ ဤအချိန်ကြာ လည်ပတ်သော session များကို အသုံးပြုသူက စစ်ဆေးနိုင်ခြင်း၊ လုပ်ဆောင်ခဲ့သည့် လုပ်ဆောင်ချက်များကို ကြည့်နိုင်ခြင်းနှင့် ဝင်ရောက်ထိန်းသိမ်းမှုများကို စောင့်ကြည့်နိုင်ခြင်းတို့ကို ကျွန်ုပ်တို့ မြှင့်တင်ခဲ့သည်။

ပြန်လည်ဖြန့်ကျက်အသုံးပြုခြင်း

စောင့်ကြည့်စနစ်အသစ်ကို အကဲဖြတ်ရန်၊ ယခင်က မော်ဒယ်က ကိုက်ညီမှုမရှိသော လုပ်ဆောင်ချက်များကို လိုက်လုပ်ခဲ့သည့် အတွင်းပိုင်း ဖြန့်ကျက်အသုံးပြုမှုပတ်ဝန်းကျင် အစုငယ်တစ်ခုကို ဤတစ်ကြိမ်တွင် ကာကွယ်မှုအသစ်များ ထည့်သွင်းထားပြီး ပြန်လည် replay လုပ်ခဲ့သည်2။ ကာကွယ်မှုအသစ်များသည် မော်ဒယ်က လိုက်လုပ်သော ကိုက်ညီမှုမရှိသည့် လုပ်ဆောင်ချက်များကို သိသိသာသာ ပိုမိုဖမ်းမိနိုင်ခဲ့ပြီး လွတ်သွားသည့်အရာများအားလုံးကို ပြင်းထန်မှုနိမ့်ဟု သတ်မှတ်ခဲ့သည်။

ဤပြင်းထန်မှုနိမ့် ဖြစ်ရပ်များ၏ ဥပမာအချို့တွင် အောက်ပါကိစ္စများ ပါဝင်သည်။

  • Linear command line tool တစ်ခုကို ဝင်ရောက်အသုံးပြုရန် မော်ဒယ်သည် nested codex --yolo session တစ်ခုကို စတင်ခဲ့သည်။ တကယ်တော့ --yolo flag မပါဘဲလည်း ထိုသို့ လုပ်ဆောင်နိုင်ခဲ့သည်။
  • ယခင်က live ဖြစ်ခဲ့သော resource တစ်ခု ပျောက်ဆုံးနေကြောင်း မော်ဒယ်က သတိပြုမိပြီးနောက်၊ လုပ်ရန်ကောင်းသော အကြောင်းမရှိဘဲ ၎င်း၏ပိုင်ရှင် namespace အောက်ရှိ အခြား live CPU pod များအပြင် အခြား OpenAI ဝန်ထမ်းများပိုင် pod များသို့လည်း (မအောင်မြင်ဘဲ) SSH ဝင်ကာ စူးစမ်းလေ့လာခဲ့သည်။
  • မော်ဒယ်တွင် stuck ဖြစ်နေသော find process များစွာရှိပြီး shell command တိုင်း hang ဖြစ်နေခဲ့သည်။ ထို့နောက် ၎င်းသည် kill -9 -1 ကို run ခဲ့ပြီး ၎င်းကို execute လုပ်ခဲ့ပါက ထို pod ပေါ်တွင် သတ်ခွင့်ရှိသည့် process တိုင်းထံ SIGKILL ပို့မည်ဖြစ်သည်။ သို့သော် ၎င်းသည် timeout ဖြစ်ပြီး execute မလုပ်ခဲ့ပါ။

စနစ်အသစ်ကို စမ်းသပ်ပြီးနောက် အချိန်ကာလရှည် စွမ်းရည်များရှိသော မော်ဒယ်များကို ကန့်သတ်ထားသော အတွင်းပိုင်းဝင်ရောက်ခွင့် ပြန်လည်ဖွင့်ပေးနိုင်ကြောင်း ကျွန်ုပ်တို့ ကောက်ချက်ချခဲ့သည်။ လွန်ခဲ့သော သီတင်းပတ်အနည်းငယ်က ပြန်လည်ဖြန့်ကျက်အသုံးပြုစတင်ပြီးနောက် ကာကွယ်မှုများကို ပြင်းထန်စွာ ရှောင်လွှဲခြင်းတစ်စုံတစ်ရာကို ကျွန်ုပ်တို့ မတွေ့ရှိခဲ့ပါ။ ဤကာကွယ်မှုများ၏ ပထမဗားရှင်းကို ရည်ရွယ်ချက်ရှိရှိ သတိကြီးစွာထား၍ ပြုလုပ်ထားသည်။ ကာကွယ်မှုများကို အားမနည်းစေဘဲ မလိုအပ်သော အနှောင့်အယှက်များကို လျှော့ချရန် စနစ်ကို ဆက်လက်ညှိနှိုင်းနေသည်။

နောက်ဆုံးအတွေးများ

ကျွန်ုပ်တို့သည် အဆင့်လိုက် ဖြန့်ကျက်အသုံးပြုခဲ့သောကြောင့် ဝင်ရောက်ခွင့် မချဲ့ထွင်မီ ကွာဟချက်များကို ရှာဖွေပြီး ဖြေရှင်းနိုင်ခဲ့သည်။ ဖြန့်ကျက်အသုံးပြုမှုမတိုင်မီ အကဲဖြတ်မှုများသည် မရှိမဖြစ် ဆက်လက်လိုအပ်သော်လည်း ဖြန့်ကျက်အသုံးပြုမှုက ၎င်းတို့ မတွေ့မိသည့် အပြုအမူများကို ဖော်ထုတ်ပေးသည်။ ကန့်သတ်ဝင်ရောက်ခွင့်ဖြင့် စတင်ခြင်းကြောင့် မော်ဒယ်ကို လက်တွေ့တွင် စောင့်ကြည့်နိုင်ခဲ့သည်၊ ပြဿနာများပေါ်ပေါက်လာသောအခါ ရပ်ဆိုင်းနိုင်ခဲ့သည်၊ ထိုချွတ်ယွင်းမှုများကို အသုံးပြု၍ ပိုကောင်းသော အကဲဖြတ်မှုများနှင့် ကာကွယ်မှုများ တည်ဆောက်နိုင်ခဲ့ပြီး ပြောင်းလဲမှုများကို စမ်းသပ်ပြီးနောက် ကန့်သတ်ဝင်ရောက်ခွင့်ကို ပြန်လည်ဖွင့်နိုင်ခဲ့သည်။

မော်ဒယ်များက ပိုကြာပြီး ပိုရှုပ်ထွေးသော အလုပ်များကို ကိုင်တွယ်လာသည်နှင့်အမျှ အကဲဖြတ်မှုများ မတွေ့မိသော ချွတ်ယွင်းမှုများသည် ပိုကြီးမားသော အကျိုးဆက်များကို ဖြစ်စေနိုင်သည်။ အကဲဖြတ်မှုနှင့် ဖြန့်ကျက်အသုံးပြုမှုကြား ကွာဟချက်ကို လျှော့ချရန် ဆက်လက်လုပ်ဆောင်သွားမည်ဖြစ်သည်။ မော်ဒယ်များကို ပိုရှည်သော trajectory များတစ်လျှောက် စမ်းသပ်ခြင်း၊ ကိုက်ညီမှုကို မြှင့်တင်ခြင်း၊ ဝင်ရောက်ထိန်းသိမ်းနိုင်သော စောင့်ကြည့်မှု တည်ဆောက်ခြင်းနှင့် အသုံးပြုသူများအား ပိုမိုရှင်းလင်းသော မြင်နိုင်မှုနှင့် ထိန်းချုပ်မှု ပေးခြင်းတို့ကို လုပ်ဆောင်သွားမည်။ ဤစိန်ခေါ်မှုများသည် OpenAI တစ်ခုတည်းအတွက်သာ မဟုတ်ပါ။ ကျွန်ုပ်တို့ သင်ယူခဲ့သည့်အရာများကို မျှဝေခြင်းက ပိုမိုကျယ်ပြန့်သော နယ်ပယ်တစ်ခုလုံးကို ထိုအရာများအတွက် ပြင်ဆင်ရာတွင် အထောက်အကူဖြစ်စေရန် မျှော်လင့်ပါသည်။

စာရေးသူ

OpenAI

အောက်ခြေမှတ်စုများ

  1. 1

     ကျွန်ုပ်တို့သည် PR ကို အမြန်ပိတ်ခဲ့သော်လည်း speedrun တွင် ပါဝင်သူအများအပြားက ၎င်းကို မြင်ပြီးဖြစ်ကာ မိမိတို့၏ တင်သွင်းမှုများတွင် ထိုနည်းလမ်းကို အသုံးပြုခဲ့ကြသည်။ နောက်ဆက်တွဲ ကမ္ဘာ့စံချိန်တင် တင်သွင်းမှုများဖြစ်သော 3030(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)2990(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)2930(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)2925(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)2900(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် 2890(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) step များအားလုံးတွင် PR 287 ကို ကိုးကားထားသည်။ ၎င်းတို့အနက် PR 300(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) သည် အထူးစိတ်ဝင်စားစရာကောင်းသည်။ အကြောင်းမှာ Prime Intellect(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) က NanoGPT speedrun တွင် အကဲဖြတ်သောအခါ Opus 4.7 တင်သွင်းခဲ့သည့် PR ဖြစ်သောကြောင့် ဖြစ်သည်။ Opus သည် ကျွန်ုပ်တို့၏ မော်ဒယ်တင်သွင်းခဲ့သော PR ကို မြင်ခဲ့ပြီး တွေ့ရှိချက်များကို ထည့်သွင်းအသုံးပြုကာ နောက်ဆုံးရလဒ်တွင် ကျွန်ုပ်တို့၏ PR ကို ခရက်ဒစ်ပေးခဲ့သည်။

  2. 2

     ကျပန်းဖြစ်မှုနှင့် ပတ်ဝန်းကျင်ကို ပြန်လည်တည်ဆောက်ရာတွင် မပြည့်စုံမှုများကြောင့် replay ထဲရှိ rollout များသည် အကြိမ်တိုင်း တူညီသော ကိုက်ညီမှုမရှိသည့် လုပ်ဆောင်ချက်ကို လိုက်လုပ်မည်ဟု အာမမခံနိုင်ပါ။