ဉာဏ်ရည်၏ မျိုးဆက်သစ်
စက်တင်ဘာလ ၂၂ ရက် ၂၀၂၆ ခုနှစ် အပ်ဒိတ် - GPT‑6 Sol နှင့် GPT‑6 Luna တို့ဖြင့် ကျွန်ုပ်တို့၏ GPT‑6 မိသားစုကို တိုးချဲ့နေပါသည်။ ပိုမိုလေ့လာရန်။
ကျွန်ုပ်တို့သည် ကမ္ဘာ့ဉာဏ်ရည်အမြင့်ဆုံးနှင့် ညှိနှိုင်းကိုက်ညီမှုအကောင်းဆုံး မော်ဒယ်ဖြစ်သည့် GPT‑6 Astra ကို မိတ်ဆက်ပေးလိုက်ပါသည်။
GPT‑6 Astra သည် အကြိုလေ့ကျင့်သင်ကြားခြင်း၊ အားဖြည့် သင်ယူလေ့လာခြင်းနှင့် ကိုက်ညီစေမှုတို့တွင် နှစ်ပေါင်းများစွာ သုတေသနပြုလုပ်မှုနှင့် ကြီးမားသော ရင်းနှီးမြှုပ်နှံမှုများကို ပေါင်းစည်းထားသည်။ Astra သည် ကွန်ပျူတာအသုံးပြုမှု၊ ဝဘ်ရှာဖွေကြည့်ရှုမှု၊ ဆော့ဖ်ဝဲအင်ဂျင်နီယာလုပ်ငန်း၊ ဆိုက်ဘာလုံခြုံရေး၊ သိပ္ပံနှင့် ပရော်ဖက်ရှင်နယ်လုပ်ငန်းများတွင် ခေတ်မီနည်းပညာအဆင့်မြင့်ဆုံး စွမ်းဆောင်ရည်ကို ပြသသည်။ Astra သည် FrontierMath အဆင့် 4 တွင် 98% ရမှတ်ဖြင့် အမြင့်ဆုံးနီးပါး စွမ်းဆောင်နိုင်ခဲ့ပြီး၊ သင်္ချာပညာရပ်တွင် ကာလရှည်ကြာ မဖြေရှင်းနိုင်ခဲ့သော ပြဿနာများကို ဖြေရှင်းရာတွင် ကူညီပြီးဖြစ်သည်။ Astra သည် ARC-AGI-3 တွင် 99.9% ရမှတ်ဖြင့်လည်းကောင်း၊ ExploitBench တွင် 100% ရမှတ်ဖြင့်လည်းကောင်း အမြင့်ဆုံးစွမ်းဆောင်ရည်ကို ရရှိသည်။ ၎င်းသည် ကွန်ပျူတာနှင့် ဘရောက်ဆာ အသုံးပြုမှုတွင်လည်း စွမ်းဆောင်ရည်အမြင့်ဆုံး အဆင့်သစ်တစ်ခု သတ်မှတ်ကာ အခက်ခဲဆုံး ပရော်ဖက်ရှင်နယ်လုပ်ငန်းများကို ယှဉ်မမီသော မြန်နှုန်း၊ တိကျမှုနှင့် ဆင်ခြင်ဆုံးဖြတ်နိုင်စွမ်းတို့ဖြင့် ကိုင်တွယ်ဆောင်ရွက်သည်။
GPT‑6 Astra ကို ယနေ့တွင် အဖွဲ့အစည်းအနည်းစုအတွက် အဆင့်လိုက် ဖြန့်ချိနေပြီး၊ လာမည့်ရက်အနည်းငယ်အတွင်း ChatGPT Plus၊ Pro၊ Business နှင့် Enterprise အသုံးပြုသူအားလုံးအတွက်သာမက OpenAI API၊ Microsoft Azure နှင့် AWS Bedrock မှတစ်ဆင့်လည်း ရရှိလာမည်ဖြစ်ပါသည်။
Astra သည် အသုံးပြုသူ၏ ရည်ရွယ်ချက်နှင့် မော်ဒယ်၏ အပြုအမူကို နားလည်ရာတွင် သိသိသာသာ တိုးတက်ကောင်းမွန်ထားသည့် ကျွန်ုပ်တို့၏ အကိုက်ညီဆုံး မော်ဒယ်ဖြစ်သောကြောင့် Astra ၏ ဆုံးဖြတ်ချက်အပေါ် ပိုမိုယုံကြည်စိတ်ချစွာဖြင့် လုပ်ငန်းတာဝန်များကို လွှဲအပ်နိုင်ပါသည်။ ဤအချက်ကို စမ်းသပ်သည့် နည်းလမ်းတစ်ခုအနေဖြင့် ခက်ခဲသော သို့မဟုတ် မဖြစ်နိုင်သော လုပ်ငန်းတာဝန်တစ်ခုကို ရင်ဆိုင်ရသည့် မော်ဒယ်က ၎င်း၏ ရည်ရွယ်ထားသော နယ်ပယ်ကို ကျော်လွန်မည်လားဆိုသည်ကို အကဲဖြတ်သည့် Hugging Face ဖြစ်ရပ်မှ အချက်အလက်များကို အခြေခံထားသော အကဲဖြတ်မှုအသစ်တစ်ခုကို ကျွန်ုပ်တို့ ဖန်တီးခဲ့သည်။ ထုတ်လုပ်မှုကာကွယ်မှုများမပါဘဲ ခွင့်ပြုထားသောပစ်မှတ်ထက် 48 % ကျော်လွန်သွားသော GPT‑5.6 Sol နှင့်နှိုင်းယှဉ်ပါက GPT‑6 Astra သည် 0% တွင် ဤသို့ပြုလုပ်ခဲ့သည်။
ကမ္ဘာ့အကောင်းဆုံး ကွန်ပျူတာအသုံးပြုမှု မော်ဒယ်
GPT‑6 Astra သည် ကွန်ပျူတာအသုံးပြုမှု၏ မြန်နှုန်း၊ တိကျမှုနှင့် ဘေးကင်းလုံခြုံမှုတို့တွင် စွမ်းဆောင်ရည်အမြင့်ဆုံး အဆင့်သစ်တစ်ခုကို ဖော်ဆောင်ပေးသည်။ ၎င်းသည် အွန်လိုင်းဖောင်များ ဖြည့်သွင်းခြင်း၊ CRM ထဲရှိ ဖောက်သည်မှတ်တမ်းများကို အပ်ဒိတ်လုပ်ခြင်းနှင့် သင့်ပြက္ခဒိန်ကို စီစဉ်ခြင်းကဲ့သို့သော ငြီးငွေ့ဖွယ်ကောင်းသော လုပ်ငန်းများကို လုပ်ဆောင်ပေးနိုင်သည်။ ၎င်းသည် အွန်လိုင်းတွင် သုတေသနပြုလုပ်နိုင်ပြီး သင့်အီးမေးလ် သို့မဟုတ် သင့်စာရွက်စာတမ်းတည်းဖြတ်ကိရိယာထဲတွင် အနှစ်ချုပ်များကို မူကြမ်းရေးဆွဲပေးနိုင်သည်။ ၎င်းသည် သိပ္ပံဆိုင်ရာ ဒေတာများကို ခွဲခြမ်းစိတ်ဖြာနိုင်ပြီး၊ ဂရပ်များ ဖန်တီးနိုင်သည်၊ ဝဘ်ဆိုက်တစ်ခု ဖန်တီးနိုင်ကာ၊ ထိုဝဘ်ဆိုက်ပေါ်ရှိ အင်္ဂါရပ်အားလုံး မှန်ကန်စွာ အလုပ်လုပ်ကြောင်း သေချာစေရန် frontend အရည်အသွေးအာမခံချက် စစ်ဆေးမှုများကိုလည်း လုပ်ဆောင်နိုင်သည်။ ၎င်းသည် ဆော့ဖ်ဝဲကို အလိုအလျောက် ထည့်သွင်းပြီး စမ်းသပ်နိုင်ရန်နှင့် မျက်နှာပြင်ပေါ်တွင် သင်မြင်ရသော ပြဿနာများကို ရှာဖွေဖြေရှင်းနိုင်ရန် ကူညီပေးနိုင်သည်။ ဤတိုးတက်မှုများသည် ကျွန်ုပ်တို့၏ အဆင့်မြင့်ဆုံး အကဲဖြတ်မှုရလဒ်များတွင်လည်း ထင်ဟပ်နေပါသည်။
ဤတိုးတက်မှုများသည်လည်း အမှန်တကယ် အသိပညာအခြေပြု လုပ်ငန်းတာဝန်များတွင် ထိရောက်မှု သိသိသာသာ တိုးတက်မှုများ ဖြစ်ပေါ်စေသည်။ OSWorld 2.0 တွင် တုံ့ပြန်ချိန် သရုပ်ဖော်မှုများအရ AAstra သည် GPT‑5.6 Sol ထက် အလုပ်တစ်ခုလျှင် အချိန် 47% ခန့် လျော့နည်း၍ ပိုမိုမြင့်မားသော ကွန်ပျူတာအသုံးပြုမှု စွမ်းဆောင်ရည်ကို ရရှိသည် လုပ်ငန်းတာဝန်တစ်ခုလျှင် ခန့်မှန်းခြေ ၄၀ မိနစ်ဖြင့် 72.6% ရမှတ်ရရှိခဲ့ပြီး၊ လုပ်ငန်းတာဝန်တစ်ခုလျှင် ခန့်မှန်းခြေ ၇၅ မိနစ်ဖြင့် 65.7% ရမှတ်ရရှိသည့် ရလဒ်နှင့် နှိုင်းယှဉ်ထားသည်။3
GPT‑6 Astra ၏ ကွန်ပျူတာအသုံးပြုနိုင်စွမ်းများကို ဂိမ်းဖွံ့ဖြိုးတိုးတက်မှု၊ လျှပ်စစ်အင်ဂျင်နီယာနှင့် နေ့စဉ် အသိပညာအခြေပြုလုပ်ငန်းများအပါအဝင် နယ်ပယ်အမျိုးမျိုးမှ ရလဒ်များတွင် တွေ့မြင်နိုင်သည်-
Astra နှင့်အတူ၊ ကွန်ပျူတာအသုံးပြုမှု၏ မြန်နှုန်းကို သိသိသာသာ မြှင့်တင်ရန် Codex အကဲဖြတ်စမ်းသပ်မှု စနစ်ကိုလည်း အပ်ဒိတ်လုပ်နေပါသည်။ Astra ၏ ထိရောက်မှုနှင့် ပေါင်းစပ်လိုက်သောအခါ၊ Mind2Web စံနှုန်းတွင် လက်ရှိ GPT‑5.6 Sol အတွေ့အကြုံနှင့် နှိုင်းယှဉ်ပါက လုပ်ငန်းပြီးစီးမှု 1.9x ပိုမြန်လာစေသည်။ မော်ဒယ်၏ မြန်နှုန်းဆိုင်ရာ တိုးတက်မှုများကြောင့် သင်လုပ်နိုင်သည်ထက် ပိုမြန်စွာ အချိန်ယူရသော နေ့စဉ်ဘဝလုပ်ငန်းများစွာကို ၎င်းက သင့်အတွက် လုပ်ဆောင်ပေးနိုင်သည်။4
ပရော်ဖက်ရှင်နယ် အလုပ်တွင် ကြီးမားသော အပြောင်းအလဲတစ်ရပ်
GPT‑6 Astra သည် ရှုပ်ထွေးသော အလုပ်တာဝန်များကို ကိုင်တွယ်ဖြေရှင်းရာတွင် ကူညီပေးရန် ကွန်ပျူတာအသုံးပြုမှုဆိုင်ရာ တိုးတက်မှုများကို ပရော်ဖက်ရှင်နယ် ပတ်ဝန်းကျင်များအတွက် ရည်ရွယ်ထားသော လေ့ကျင့်သင်ကြားမှုနှင့် ပေါင်းစပ်ထားသည်။ ၎င်းသည် ရှုပ်ထွေးသော ပြဿနာများအတွက် လိုအပ်သော ဉာဏ်ရည်ကို အဆင့်များစွာပါဝင်သည့် လုပ်ငန်းစဉ်များကို ဆောင်ရွက်နိုင်စွမ်း၊ အရည်အသွေးမြင့် စာရွက်စာတမ်းများ၊ ဇယားစာရွက်များနှင့် တင်ပြချက်များကို ဖန်တီးနိုင်စွမ်းတို့နှင့် ပေါင်းစပ်ထားသည်။
GPT‑6 Astra သည် ရှိပြီးသား တမ်းပလိတ်များကို လိုက်နာပြီး အပြင်အဆင်ကောင်းမွန်ကာ ဖွဲ့စည်းပုံရှိသော ဇာတ်ကြောင်းဖြင့် အဓိကအချက်များကို တိုတောင်းရှင်းလင်းစွာ ဖော်ပြသည့် ဆလိုက်များ ထုတ်လုပ်ရာတွင် ကျွန်ုပ်တို့၏ အကောင်းဆုံး မော်ဒယ်ဖြစ်သည်။ ၎င်းသည် သင့်နမူနာပုံစံများကို လိုက်နာပြီး သင့်ရေးသားပုံနှင့် မြင်ကွင်းပိုင်းဆိုင်ရာ စတိုင်တို့နှင့် ကိုက်ညီသော ရှင်းလင်းပြီး ဖွဲ့စည်းပုံကောင်းမွန်သည့် စာရွက်စာတမ်းများ၊ တင်ပြချက်များ၊ စာရင်းဇယားများနှင့် ခွဲခြမ်းစိတ်ဖြာချက်များကို ဖန်တီးပေးသည်။ Astra ကိုလည်း လက်ရှိလုပ်ဆောင်နေသည့်အလုပ်အတွက် မလိုအပ်သောအချက်အလက်များကို ထပ်ခါတလဲလဲ မဖော်ပြဘဲ၊ အရေးကြီးသည့်ဆက်စပ်အကြောင်းအရာများကိုသာ ထုတ်ပေးသည့်ရလဒ်များထဲသို့ သီးသန့်ထည့်သွင်းနိုင်ရန် လေ့ကျင့်ပေးထားသည်။ ဤအချက်များအားလုံးကြောင့် ၎င်းသည် သင့်လုပ်ငန်းဆိုင်ရာ ဆက်စပ်အခြေအနေများနှင့် စံနှုန်းများနှင့် ကိုက်ညီသော၊ ချက်ချင်းအသုံးပြုနိုင်မှု ပိုမိုမြင့်မားသော ရလဒ်ပစ္စည်းများကို ထုတ်ပေးနိုင်သည်။
GPT‑6 Astra သည် ၎င်းဖန်တီးသော ဝဘ်ဆိုက်များ၊ ဂိမ်းများ၊ အပလီကေးရှင်းများနှင့် ရင်းဒါးပုံရိပ်များအတွက် ပိုမိုအားကောင်းသော အမြင်ပိုင်းဆိုင်ရာ စီရင်ဆုံးဖြတ်နိုင်စွမ်းကိုလည်း ဆောင်ကျဉ်းပေးသည်။ ChatGPT ရှိ ဆိုက်များ(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ဖြင့် Astra သည် တုံ့ပြန်ညွှန်ကြားချက်တစ်ခုမှ ဝဘ်ဆိုက်များ၊ ဝဘ်အက်ပ်များနှင့် ဂိမ်းများကို တိုက်ရိုက် ဖန်တီး၊ ဟိုစ့်လုပ်ပြီး မျှဝေနိုင်သည်။
ညွှန်ကြားချက်များတွင် အဓိပ္ပာယ်ဖွင့်ဆိုရန် နေရာလွတ်ရှိသည့်အခါ GPT‑6 Astra သည် မှန်ကန်သော ဆုံးဖြတ်ချက်ချရာတွင် ယခင်မော်ဒယ်များထက် ပိုကောင်းသည်။ ၎င်းသည် ပုံမှန်ဖြစ်လေ့ရှိသော ကွက်လပ်များကို ဖြည့်ရန် ဆက်စပ်အချက်အလက်ကို အသုံးပြုပြီး၊ အဖြေကြောင့် ရလဒ် ပြောင်းလဲနိုင်သည့်အခါတွင် တိကျသော မေးခွန်းများကို မေးသည်။ Codex တွင် သင့်အဖြေပေါ်တွင် မမူတည်သော အလုပ်များကို ဆက်လက်လုပ်ဆောင်ရင်း တစ်ပြိုင်နက်တည်းမဟုတ်ဘဲ မေးခွန်းများ မေးမြန်းနိုင်သည်။ သင် မတုံ့ပြန်ပါက သင့်လျော်သည့်နေရာများတွင် အကျိုးသင့်အကြောင်းသင့်ရှိသော ခန့်မှန်းချက်များဖြင့် ဆက်လက်လုပ်ဆောင်မည်ဖြစ်သော်လည်း၊ အကျိုးသက်ရောက်မှုကြီးသော ဆုံးဖြတ်ချက်များအတွက်မူ သင့်ထံမှ ထည့်သွင်းချက်ကို စောင့်ဆိုင်းပါမည်။
အောက်ပါဥပမာများသည် မပါရှိသော အချက်အလက်များက အဖြေကို အရေးပါသည့်အတိုင်းအတာအထိ ပြောင်းလဲစေနိုင်သော နေ့စဉ်လုပ်ဆောင်မှုများတွင် Astra က ပူးပေါင်းကူညီပုံကို ပြသထားသည်။
Astra သည် လုပ်ငန်းတာဝန်တစ်ခု ပြောင်းလဲတိုးတက်လာသည်နှင့်အမျှ ဦးတည်ချက်မပျောက်ဘဲ ဆက်လက်နားလည်ထားနိုင်ရာတွင်လည်း ပိုမိုကောင်းမွန်သည်။ အစောပိုင်း မော်ဒယ်များသည် တစ်ခါတစ်ရံ လမ်းညွှန်မက်ဆေ့ချ်များကို ရည်မှန်းချက်အသစ်တစ်ခုအဖြစ် သဘောထားမိသဖြင့် မူလတောင်းဆိုချက် သို့မဟုတ် အစောပိုင်းကန့်သတ်ချက်များကို မျက်ခြည်ပြတ်သွားတတ်သည်။ Astra သည် လိုအပ်ချက်အသစ်များကို ထည့်သွင်းအသုံးချနိုင်ပြီး၊ တောင်းဆိုလာပါက ဦးတည်ချက်ကို ပြောင်းလဲနိုင်ကာ၊ ပိုမိုကျယ်ပြန့်သော လုပ်ငန်းတာဝန်ကို မပစ်ပယ်ဘဲ ဘေးထွက်မေးခွန်းများကိုလည်း ဖြေဆိုနိုင်သည်။
ကုဒ်ရေးခြင်း
GPT‑6 Astra သည် ယနေ့အထိ ဆော့ဖ်ဝဲ အင်ဂျင်နီယာလုပ်ငန်းအတွက် အကောင်းဆုံး မော်ဒယ်ဖြစ်သည်။
“GPT‑6 Astra သည် ကျွန်ုပ်တို့၏ အတွင်းပိုင်း ကုဒ်ရေးသားမှု စံသတ်မှတ်ချက်များတွင် အဆင့်မြင့်ဆုံး စွမ်းဆောင်ရည်ကို ပေးစွမ်းပြီး GPT‑5.6 Sol နှင့် နှိုင်းယှဉ်ပါက trading intuition အကဲဖြတ်မှုများတွင် သိသာထင်ရှားသော တိုးတက်မှုကို ပြသသည်။ agentic coding အတွက် အသုံးပြုသည့်အခါ GPT‑6 Astra သည် developer များ လိုက်နာနားလည်ရန် ပိုမိုလွယ်ကူသော ပုံစံဖြင့် ဆက်သွယ်ပြီး ထုတ်လုပ်မှုအဆင့် အရည်အသွေးသို့ ရောက်ရှိရန် ထပ်တလဲလဲ ပြင်ဆင်မှု နည်းပါးသော ကုဒ်ကို ထုတ်လုပ်သည်။”
“ကျွန်ုပ်တို့၏ ပထမမျိုးဆက် အကဲဖြတ်စမ်းသပ်မှုများထဲမှ တစ်ခုတွင် Astra ကို အနိမ့်၊ အလယ်အလတ်နှင့် အမြင့် ကြိုးပမ်းအားထုတ်မှုအဆင့်များဖြင့် စမ်းသပ်ခဲ့ရာ GPT 5.6 Sol ထက် သိသိသာသာ ပိုမိုကောင်းမွန်သော ရလဒ်ရရှိခဲ့သည်။ ပိုမိုမြင့်မားသော ကြိုးပမ်းအားထုတ်မှုအဆင့်က အသစ်တည်ဆောက်ထားသည့် တည်ဆောက်မှုတွင် ထပ်မံလုပ်ဆောင်မှုများ ပိုမိုရရှိစေပြီး ဘရောက်ဇာ စမ်းသပ်မှုမှတစ်ဆင့် အတည်ပြုမှုများ ပိုမိုလုပ်ဆောင်နိုင်စေကာ apply-patch ထက် code execution ကို ပိုမိုဦးစားပေးစေသည်။ မော်ဒယ်တစ်ခုက ၎င်း၏ ကြိုးပမ်းအားထုတ်မှုကို မည်သို့အသုံးပြုသည်ကို နားလည်ခြင်းက တည်ဆောက်သူ သန်းပေါင်းများစွာအတွက် စိတ်ကူးမှ အလုပ်လုပ်နိုင်သော app အထိ ပိုမိုမြန်ဆန်ပြီး ပိုမိုယုံကြည်စိတ်ချရသည့် လမ်းကြောင်းကို ကျွန်ုပ်တို့ ပေးနိုင်သည့်နည်းလမ်းဖြစ်သည်။”
Astra ဖြင့် context window ပြည့်သွားသည့်အခါ Codex က အကြောင်းအရာကို ထိန်းသိမ်းပြီး ပြန်လည်ရယူနိုင်စေမည့် နည်းလမ်းသစ်တစ်ခုကို မိတ်ဆက်ပေးနေပါသည်။ ယခင်က မော်ဒယ်များသည် ရှုပ်ထွေးသော ပြဿနာများကို အမှားရှာဖွေဖြေရှင်းသည့်အခါ သို့မဟုတ် ကြီးမားသော refactor များကို ကိုင်တွယ်သည့်အခါကဲ့သို့ ရှည်လျားသော ဆက်ရှင်များအတွင်း အလုပ်ကို အနှစ်ချုပ်ရန် အကျဉ်းချုံ့ခြင်းကို အသုံးပြုခဲ့ကြသည်။ အကျဉ်းချုံ့ခြင်းတစ်ကြိမ်စီသည် ပြင်ဆင်ချက်တစ်ခု အဘယ်ကြောင့် မအောင်မြင်ခဲ့သည် သို့မဟုတ် အစိတ်အပိုင်းတစ်ခု မည်သို့လုပ်ဆောင်သည်ဆိုသည့် အသေးစိတ်အချက်အလက်များကို ချန်လှပ်ထားနိုင်သည်။ Codex တွင် Astra သည် context window များအကြား မှတ်စုများကို ထိန်းသိမ်းထားနိုင်ပြီး စုပုံလာသော အသေးစိတ်အချက်အလက်များကို အနှစ်ချုပ်တစ်ခုတည်းအဖြစ် ထပ်ခါတလဲလဲ အကျဉ်းချုံ့စရာမလိုဘဲ ထိန်းသိမ်းထားနိုင်သည်။ ယခင် context window များကို ဆက်လက်ရှာဖွေနိုင်သောကြောင့် Astra သည် ထိုအချက်အလက်များကို ၎င်း၏မှတ်စုများတွင် မှတ်တမ်းတင်မထားခဲ့လျှင်ပင် ယခင်မက်ဆေ့ချ်များနှင့် ကိရိယာရလဒ်များမှ လိုအပ်ချက်များ သို့မဟုတ် စမ်းသပ်ရလဒ်များကို ရှာဖွေနိုင်သည်။ ဤစမ်းသပ်ဆဲလုပ်ဆောင်ချက်ကို သင့်၏ Codex config.toml တွင် ဖွင့်အသုံးပြုနိုင်သည်၊(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ပြီးတော့ ၎င်းသည် လာမည့်သီတင်းပတ်များအတွင်း Astra အတွက် ပုံသေသတ်မှတ်ချက် ဖြစ်လာပါမည်။
သိပ္ပံဆိုင်ရာ ရှာဖွေတွေ့ရှိမှုကို တိုးတက်စေခြင်း
GPT‑6 Astra သည် သိပ္ပံဆိုင်ရာ ရှာဖွေတွေ့ရှိမှု၊ သင်္ချာနှင့် ကျန်းမာရေးအတွက် အရေးပါသော တိုးတက်မှုကြီးတစ်ခု ဖြစ်သည်။ ယနေ့၊ ကျွန်ုပ်တို့သည် သုဒ္ဓကိန်းများအကြားရှိ ကွာဟချက်များနှင့် ပတ်သက်သော ထပ်မံရလဒ်နှစ်ခုကို မျှဝေလိုက်ပါသည်။9နှင့် 10
Astra သည် သင်္ချာနှင့် သိပ္ပံဆိုင်ရာ အကဲဖြတ်စမ်းသပ်မှုများစွာတွင်လည်း စံချိန်သစ်များ တင်နိုင်ခဲ့သည်။
Astra သည် သိပ္ပံဆိုင်ရာ ရှာဖွေတွေ့ရှိမှုများ၏ နောက်ကွယ်မှ လက်တွေ့လုပ်ငန်းများတွင် ကူညီပေးနိုင်သည်။ သိပ္ပံဆိုင်ရာ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော စွမ်းရည်ကို ကွန်ပျူတာအသုံးပြုမှုနှင့် ပေါင်းစပ်ခြင်းဖြင့်၊ ၎င်းသည် ဒေတာကို စစ်ဆေးပြီး ရလဒ်များကို စူးစမ်းလေ့လာရန် အထူးပြု ဆော့ဖ်ဝဲတွင် တိုက်ရိုက်လုပ်ဆောင်နိုင်ကာ၊ သုတေသီများအား အထောက်အထားကို အကဲဖြတ်ပြီး နောက်တစ်ဆင့် မည်သည်ကို စုံစမ်းလေ့လာရမည်ကို ဆုံးဖြတ်နိုင်ရန် ကူညီပေးသည်။
ဆိုက်ဘာလုံခြုံရေး
ကျွန်ုပ်တို့၏ လုံခြုံရေးဆိုင်ရာ အပ်ဒိတ် တွင် ဆွေးနွေးခဲ့သည့်အတိုင်း Astra သည် ဆိုက်ဘာစွမ်းရည်များတွင် သိသာထင်ရှားသော တိုးတက်မှုတစ်ရပ်ဖြစ်ပြီး ဆိုက်ဘာလုံခြုံရေးတွင် အရေးကြီးအဆင့် သတ်မှတ်ချက် ကို ကျွန်ုပ်တို့၏ ကြိုတင်ပြင်ဆင်ထားခြင်းဆိုင်ရာ ဖွဲ့စည်းမှု အရ ပြည့်မီပါသည်။ ၎င်း၏ zero-day exploit များကို ခွဲခြားသတ်မှတ်ပြီး တီထွင်ဖန်တီးနိုင်စွမ်းသည် ကာကွယ်ရေးအဖွဲ့များအား အားနည်းချက်များကို ရှာဖွေပြီး ပြင်ဆင်ရာတွင် အထောက်အကူပြုနိုင်သော်လည်း ပိုမိုခိုင်မာသော အကာအကွယ်အစီအမံများ လိုအပ်လာစေသည်။ ဤလုပ်ဆောင်နိုင်စွမ်းများ ဘယ်အတိုင်းအတာအထိ ကျယ်ပြန့်သည်ကို နားလည်နိုင်ရန်၊ ကျွန်ုပ်တို့သည် Astra ကို အဖွဲ့အစည်းအတွင်းပိုင်းနှင့် တတိယပါတီ ကျွမ်းကျင်သူများ၏ အကဲဖြတ်မှုများတွင် စမ်းသပ်အသုံးပြုခဲ့သည်။
ထုတ်လုပ်ရေးအကာအကွယ်များမပါဘဲ မော်ဒယ်ကို ExploitBench နှင့် ExploitGym တွင် ဦးစွာ စမ်းသပ်ခဲ့သည်။ ၎င်းတို့သည် မော်ဒယ်များက သိရှိပြီးသား ဆော့ဖ်ဝဲအားနည်းချက်များကို အလုပ်လုပ်နိုင်သော exploit များအဖြစ် ပြောင်းလဲနိုင်ခြင်းရှိမရှိ အကဲဖြတ်သည်။ ExploitBench တွင် Astra သည် 100% ပြည့်စုံသော ရမှတ်ကို ရရှိခဲ့ပြီး၊ ကျွန်ုပ်တို့၏ ယခင် စွမ်းဆောင်ရည်အမြင့်ဆုံး ဆိုက်ဘာစွမ်းရည်ရှိ မော်ဒယ် GPT‑5.6 Sol သည် 78.5% ရရှိခဲ့သည်။ ExploitGym တွင် Astra သည် အထွက်တိုကင်များကို သိသိသာသာ နည်းပါးစွာ အသုံးပြုရင်း အောင်မြင်မှုနှုန်း 42.4% ရရှိခဲ့ပြီး၊ GPT‑5.6 Sol သည် 30.3% ရရှိခဲ့သည်။13
ယခင်က မှတ်တမ်းတင်ထားသော ဆော့ဖ်ဝဲ အားနည်းချက်များနှင့် ထိတွေ့ခဲ့မှုကြောင့် စံပြိုင်ရလဒ်များ ထိခိုက်ခဲ့နိုင်သည်ဆိုသော စိုးရိမ်ချက်များ ရှိသဖြင့်၊ ကျွန်ုပ်တို့သည် Astra ကို အသစ်တီထွင်ထားသော စံပြိုင်နှစ်ခုတွင်လည်း အကဲဖြတ်ခဲ့ပါသည်။ ဥပမာတစ်ခုအနေဖြင့်၊ ကျွန်ုပ်တို့သည် ပြီးခဲ့သည့် သုံးလအတွင်းရှိ အားနည်းချက်များကို အသုံးပြုကာ exploit ဖွံ့ဖြိုးတီထွင်မှုကို စမ်းသပ်ရန် အတွင်းပိုင်း “ExploitBench (ဇွန်လ–ဩဂုတ်လ ၂၀၂၆ ခုနှစ်)” အကဲဖြတ်မှုတစ်ခုကို တည်ဆောက်ခဲ့သည်။14 Astra သည် ဤဒေတာစုတွင် GPT‑5.6 Sol ထက် အထွက်တိုကင်အနည်းငယ်သာ အသုံးပြုသော်လည်း မည်သည့်ကုဒ်မဆို လုပ်ဆောင်နိုင်သည့်နှုန်းကို သိသိသာသာ ပိုမိုမြင့်မားစွာ ရရှိခဲ့သည်။ အကဲဖြတ်မှုအတွင်း Astra သည် ယခင်က မသိရှိရသေးသော zero-day အားနည်းချက်နှစ်ခုကိုပင် ရှာဖွေတွေ့ရှိပြီး အသုံးပြုခဲ့သည်။ ကျွန်ုပ်တို့သည် အားနည်းချက်နှစ်ခုစလုံးကို ၎င်းတို့၏ ထိန်းသိမ်းသူများထံ ထုတ်ဖော်အသိပေးနေပါသည်။
ကျွန်ုပ်တို့သည် Astra ကို SRE-Bench15 တွင်လည်း စမ်းသပ်ခဲ့သည်။ ၎င်းသည် မော်ဒယ်များက မူရင်းအရင်းအမြစ်ကုဒ်ကို အသုံးပြုခွင့်မရှိဘဲ ဆော့ဖ်ဝဲ ဘိုင်နရီများကို reverse engineer ပြုလုပ်၍ ၎င်းတို့၏ အဓိက ယုတ္တိဗေဒကို နားလည်နိုင်ခြင်း ရှိ၊ မရှိကို တိုင်းတာသည့် စံနှုန်းစမ်းသပ်မှုတစ်ခုဖြစ်သည်။ Astra သည် လုပ်ငန်းတာဝန်များ၏ 88.0% ကို တစ်ကြိမ်တည်း ကြိုးပမ်းမှုဖြင့် ဖြေရှင်းခဲ့ပြီး 99.2% ကို လေးကြိမ်ကြိုးပမ်းမှုအတွင်း ဖြေရှင်းခဲ့သည်။ GPT‑5.6 Sol ၏ 55.9% နှင့် 68.7% တို့နှင့် အသီးသီး နှိုင်းယှဉ်ထားခြင်း ဖြစ်သည်။
စံနှုန်းတိုင်းတာစမ်းသပ်မှုများထက် ပို၍၊ ကျွမ်းကျင်ပညာရှင်များ ဦးဆောင်သော အကဲဖြတ်မှုများအရ Astra သည် ထုတ်လုပ်မှုအသုံးပြုမှုအတွက် လုံခြုံရေးကာကွယ်မှုများ မပါဘဲ လည်ပတ်စေသည့်အခါ ယခင်က မသိရှိရသေးသော အားနည်းချက်များကို အသုံးပြု၍ လုံခြုံရေး တင်းကျပ်ထားသော ဘရောက်ဇာများတွင် မိမိနှစ်သက်ရာကုဒ်ကို လုပ်ဆောင်နိုင်ပြီး၊ လုံခြုံရေး တင်းကျပ်ထားသော လည်ပတ်မှုစနစ်များအတွက် အခွင့်အရေးအဆင့် မြှင့်တင်နိုင်သော အသုံးချတိုက်ခိုက်မှုများကို ဖန်တီးနိုင်ကြောင်း တွေ့ရှိခဲ့သည်။
ကျွန်ုပ်တို့ ကာကွယ်သူများ၏ အခွင့်အလမ်းကာလ တွင် ဆွေးနွေးခဲ့သည့်အတိုင်း၊ စွမ်းဆောင်ရည်အမြင့်ဆုံး ဆိုက်ဘာစွမ်းရည်များသည် ကာကွယ်သူများအား အားနည်းချက်များကို ပိုမိုမြန်ဆန်စွာ ရှာဖွေတွေ့ရှိရန် ကူညီပေးနိုင်သော်လည်း၊ ထိုအားနည်းချက်များကို တိုက်ခိုက်အသုံးချရန်လည်း ပိုမိုလွယ်ကူစေသဖြင့် ကာကွယ်သူများအနေဖြင့် အလိုက်သင့်ပြောင်းလဲရန် အရေးတကြီးလိုအပ်မှုကို မြင့်တက်စေပါသည်။ ယနေ့ စတင်ထုတ်လွှင့်သည့် Astra ဗားရှင်းကို အသုံးပြု၍ ကာကွယ်သူများသည် လုံခြုံရေးကုဒ်ပြန်လည်သုံးသပ်ခြင်းနှင့် ပက်ခ်တင်ခြင်းကဲ့သို့သော လုပ်ငန်းတာဝန်များကို ဆောင်ရွက်ပြီးမြောက်နိုင်သည်။
သို့သော် Astra သည် အားနည်းချက်များအတွက် proof-of-concept exploits များ ဖန်တီးခြင်းကဲ့သို့သော ပိုမိုအဆင့်မြင့်သော ဆိုက်ဘာလုံခြုံရေးဆိုင်ရာ လုပ်ငန်းတာဝန်များကို လိုက်နာဆောင်ရွက်ရန် ငြင်းဆိုမည်။ OpenAI Daybreak မှတစ်ဆင့် ကျွန်ုပ်တို့သည် လာမည့်အပတ်အနည်းငယ်အတွင်း အသုံးပြုခွင့်ကို တိုးချဲ့ကာ ကန့်သတ်ချက်နည်းသော ကာကွယ်ရေးအစီအစဉ်များကို ဖြန့်ချိရန် စီစဉ်ထားပါသည်။ ၎င်းသည် အားနည်းချက်နှင့် အယူအဆသက်သေပြမှု အတည်ပြုစစ်ဆေးခြင်း၊ မဲလ်ဝဲလ် ခွဲခြမ်းစိတ်ဖြာခြင်း၊ ထောက်လှမ်းမှုဆိုင်ရာ အင်ဂျင်နီယာလုပ်ငန်းတို့ အပါအဝင် ကာကွယ်ရေးဆိုင်ရာ လုပ်ငန်းစဉ်များကို ပိုမိုလုပ်ဆောင်နိုင်စေပါမည်။
GPT‑5.6 Sol အတွက် ကျွန်ုပ်တို့၏ ကာကွယ်ရေးအစီအမံအလွှာကို အခြေခံ၍ ဖြစ်နိုင်ခြေရှိသော ဆိုက်ဘာ အလွဲသုံးစားမှုများကို ကာကွယ်ရန် ကျွန်ုပ်တို့၏ အကာအကွယ်များကိုလည်း အားကောင်းစေခဲ့သည်။ ၎င်းတို့တွင် ဖြစ်နိုင်ခြေရှိသော Jailbreak များကို ပိုမိုခံနိုင်ရည်ရှိစေရန် မော်ဒယ်၏ ခံနိုင်ရည်ကို ပိုမိုအားကောင်းစေခြင်းနှင့် ကျွန်ုပ်တို့၏ စောင့်ကြည့်စနစ်များအတွက် ဆက်စပ်အကြောင်းအရာများ ပိုမိုထည့်သွင်းပေးခြင်းတို့ ပါဝင်သည်။ ကျွန်ုပ်တို့၏ အတွင်းပိုင်း ထိုးဖောက်စမ်းသပ်ခြင်း တိုက်ခိုက်သူများနှင့်အတူ အလိုအလျောက် အကဲဖြတ်မှုများအပါအဝင် တင်းကျပ်သော အတွင်းပိုင်းနှင့် ပြင်ပ စမ်းသပ်မှုများကို ဆက်လက်လုပ်ဆောင်ခဲ့သည်။ ကျွန်ုပ်တို့၏ ဆိုက်ဘာကာကွယ်ရေးအစီအမံများနှင့် စမ်းသပ်မှုများအကြောင်း အသေးစိတ်ကို Astra ဘေးကင်းရေး အနှစ်ချုပ် နှင့် စနစ်ကဒ်(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)တွင် ရရှိနိုင်သည်။
GPT‑6 Astra ကို တာဝန်ယူမှုရှိစွာ ကိုက်ညီအောင်လုပ်ဆောင်ခြင်းနှင့် ဖြန့်ကျက်အသုံးပြုခြင်း
Astra သည် ကျွန်ုပ်တို့၏ အကိုက်ညီဆုံး မော်ဒယ်ဖြစ်သည်။ Astra သည် ဂရုတစိုက် ဆောင်ရွက်ခြင်း၊ လုပ်ငန်းတာဝန်၏ ကန့်သတ်ချက်များကို လေးစားလိုက်နာခြင်းနှင့် ပွင့်လင်းမြင်သာစွာ ဆက်သွယ်ပြောဆိုခြင်းတို့တွင် အထူးပြောင်းမြောက်သည်။ ဤလုပ်ငန်းသည် အစမှအဆုံးအထိ လူသား၏ ရည်ရွယ်ချက်နှင့် ကိုက်ညီနေသည့် မော်ဒယ်များကို လေ့ကျင့်ပေးရန် အာရုံစိုက်သော ကျွန်ုပ်တို့၏ နှစ်ရှည်သုတေသနအစီအစဉ်မှ နောက်ဆုံးရလဒ်ဖြစ်သည်။
အထိခိုက်မခံနိုင်သော ပတ်ဝန်းကျင်များတွင် Astra သည် ၎င်း၏ အန္တရာယ်အဆင့်နှင့် ကိုက်ညီသည့် သတိထားမှုဖြင့် ဆောင်ရွက်သည်။ မသင့်လျော်သော အပြုအမူများ ဖြစ်ပေါ်စေရန် ရန်ဘက်သဘောဖြင့် ရွေးချယ်ထားသော ကွန်ပျူတာအသုံးပြုမှု လုပ်ငန်းတာဝန်များကို အကဲဖြတ်ရာတွင် Astra သည် မရည်ရွယ်ထားသော အကျိုးဆက်များကို ရှောင်ရှားရာ၌ ပိုမိုအောင်မြင်ခဲ့သည်။ မူလသတ်မှတ်ချက်အတိုင်း ပေးထားသော အပိုလုံခြုံရေးအစီအမံများဖြင့် လည်ပတ်စေသောအခါ စွမ်းဆောင်ရည် ပိုမိုကောင်းမွန်လာခဲ့သည်။
Astra သည် စမ်းသပ်ခဲ့သော အခြားမည်သည့် စွမ်းဆောင်ရည်အမြင့်ဆုံး မော်ဒယ်များထက်မဆို မကိုက်ညီသော ရလဒ်များကို ပိုမိုနည်းပါးစွာ ဖြစ်ပေါ်စေသည်။ မျှတသော နှိုင်းယှဉ်မှုအတွက်၊ ကျွန်ုပ်တို့သည် ( OpenAI Responses API(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် Anthropic Messages API(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှစ်ခုလုံးတွင် ရရှိနိုင်သော မူရင်း ကွန်ပြူတာ အသုံးပြုမှု ကိရိယာများကို အခြေခံထားသည့်) ယေဘုယျ ကွန်ပြူတာ အသုံးပြုသည့် အေးဂျင့် အကဲဖြတ်စမ်းသပ်မှု စနစ်ကို အသုံးပြုခဲ့ပြီး၊ Codex နှင့် ChatGPT အလုပ် အသုံးပြုသူများအတွက် ပုံမှန်အားဖြင့် ဖြန့်ကျက်အသုံးပြုထားသော ထပ်ဆောင်းကာကွယ်မှုများ (အလိုအလျောက် ပြန်လည်သုံးသပ်ခြင်း၊ အတည်ပြုမှု မူဝါဒ) မပါဘဲ အသုံးပြုခဲ့ပါသည်။
Astra သည် အသုံးပြုသူက သတ်မှတ်ထားသော ဘောင်များနှင့် ၎င်း၏ ပတ်ဝန်းကျင်အခြေအနေက သွယ်ဝိုက်ညွှန်ပြသော ဘောင်များအတွင်း လုပ်ဆောင်နိုင်ခြေ ပိုများပါသည်။ အတွင်းပိုင်း အကဲဖြတ်မှုတစ်ခုတွင် Astra သည် Codex Auto-Review ၏ ငြင်းပယ်မှုကို ကျော်လွှားရန် တစ်ကြိမ်မျှ မကြိုးစားခဲ့ပါ။ Auto-review ကို ရည်ရွယ်ချက်ရှိရှိ ကျော်လွှားနိုင်အောင် စီစဉ်သတ်မှတ်ထားပြီး၊ ထိုသို့မဟုတ်ပါက အလုပ်တာဝန်ကို ပြီးမြောက်အောင် လုပ်ဆောင်နိုင်မည်မဟုတ်သည့် အခြေအနေတွင်ပင် ဤအချက်သည် မှန်ကန်နေဆဲဖြစ်သည်။ ပတ်ဝန်းကျင်ဆိုင်ရာ ကန့်သတ်ချက်များကို ဤသို့ လေးစားလိုက်နာခြင်းသည် ဤပို့စ်၏ နိဒါန်းတွင် ကျွန်ုပ်တို့ မျှဝေခဲ့သော မဖြစ်နိုင်သည့် ဆိုက်ဘာလုပ်ငန်း အကဲဖြတ်မှုရလဒ်များနှင့် ကျွန်ုပ်တို့၏ စနစ်ကဒ်(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)တွင် မှတ်တမ်းတင်ထားသော အခြားတွေ့ရှိချက်များနှင့် ကိုက်ညီသည်။
ထို့အပြင် Astra သည် အသုံးပြုသူများနှင့် ပွင့်လင်းမြင်သာသော ဆက်သွယ်ပြောဆိုမှုတွင် စံနှုန်းသစ်များကို သတ်မှတ်ပေးပါသည်။ အကဲဖြတ်မှုတစ်ခုတွင် Astra သည် ၎င်း၏ စွမ်းရည်များနှင့် အသုံးပြုနိုင်စွမ်းများအပေါ် မမှန်ကန်စွာ ဖော်ပြပြောဆိုရန် GPT‑ 5.6 Sol ထက် သုံးဆနည်းသော ဖြစ်နိုင်ခြေရှိသည်။
ကျွန်ုပ်တို့၏ စွမ်းရည်-စိတ်ကူးယဉ်အချက်အလက် အကဲဖြတ်မှုတွင် Astra သည် GPT‑5.6 Sol ထက် သိသာထင်ရှားစွာ တိုးတက်မှုကို ပြသခဲ့ပြီး၊ ၎င်း၏ စွမ်းရည်များနှင့်ပတ်သက်၍ အထင်အမြင်လွဲမှားစေနိုင်သော အဆိုများကို ပိုမိုနည်းပါးစွာ ပြုလုပ်ခဲ့ပါသည်။
ကျွန်ုပ်တို့၏ အကဲဖြတ်မှုများအရ Astra ၏ ရေးသားထားသော ကျိုးကြောင်းဆင်ခြင်မှုသည် GPT‑5.6 Sol များထက် စောင့်ကြည့်ရန် ပိုမိုခက်ခဲကြောင်း တွေ့ရှိခဲ့ပြီး စောင့်ကြည့်ခြင်းကို ရှောင်ရှားရန် ရှင်းလင်းစွာ တောင်းဆိုထားသည့် စမ်းသပ်မှုများအပေါ် အခြေခံထားသည်။ ဤအရာသည် ပိုမိုရိုးရှင်းသော လုပ်ငန်းတာဝန်များတွင် စာဖြင့်ဖော်ပြသော ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော အပေါ် Astra ၏ ထိန်းချုပ်နိုင်စွမ်း ပိုမိုမြင့်မားခြင်းနှင့် စာဖြင့်ဖော်ပြသည့် အဆင့်များ ပိုနည်းစွာဖြင့် ပြဿနာများကို ဖြေရှင်းနိုင်စွမ်းတို့ကြောင့်ဟု ကျွန်ုပ်တို့ ယူဆသည်။ Astra သည် ရှုပ်ထွေးသော လုပ်ငန်းတာဝန်များအတွက် လိုအပ်သည့် ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော ကို ဖုံးကွယ်ရန် အခက်အခဲရှိနေဆဲဟု ထင်ရသော်လည်း ဤကျဆင်းမှုကို ကျွန်ုပ်တို့ အလေးအနက်ထားသည်။ စောင့်ကြည့်နိုင်စွမ်းကို ပိုမိုကောင်းမွန်စေရေးသည် သုတေသန၏ ဦးစားပေးအဖြစ် ဆက်လက်ရှိနေပြီး၊ တွဲဖက်ပါရှိသော စနစ်ကဒ်(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) တွင် ကျွန်ုပ်တို့၏ တွေ့ရှိချက်များနှင့် ဆက်လက်လုပ်ဆောင်နေသော အလုပ်များကို အသေးစိတ် ဖော်ပြထားသည်။
ရည်ရွယ်ချက်နှင့်ကိုက်ညီစေရေးဆိုင်ရာ လေ့ကျင့်ပေးခြင်းသည် ဖြန့်ချိအသုံးချမှုအတွက် ကျွန်ုပ်တို့၏ ချဉ်းကပ်နည်းတွင် အဓိကကျသည်။ ထပ်ဆင့်ကာကွယ်ရေးအလွှာအဖြစ် မလုံခြုံသော အပြုအမူများကို ရှာဖွေဖော်ထုတ်ပြီး ထိန်းချုပ်နိုင်ရန် Codex Auto-review(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ကဲ့သို့သော စနစ်အကာအကွယ်များနှင့် အေးဂျင့်များ၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော နှင့် လုပ်ဆောင်ချက်များကို စောင့်ကြည့်ခြင်းတို့ကိုလည်း တည်ဆောက်ထားသည်။ ကျွန်ုပ်တို့၏ လုံခြုံရေး အပ်ဒိတ်တွင် ဖော်ပြထားသည့်အတိုင်း ရည်ရွယ်ချက်မကိုက်ညီမှုကို မြင်တွေ့သိရှိနိုင်ရန်နှင့် အဆိုးရွားဆုံးဖြစ်ရပ်များကို ထိန်းချုပ်နိုင်ရန် Astra အဆင့် မော်ဒယ်များအတွက် ထုတ်လုပ်ရေးတွင် ရည်ရွယ်ချက်မကိုက်ညီမှု စောင့်ကြည့်စနစ်ကိုလည်း ဖြန့်ချိအသုံးချနေသည်။ ဤအကာအကွယ်များသည် အတွင်းပိုင်းဖြန့်ချိမှုများအတွက် စောင့်ကြည့်ပုံနှင့် ဆင်တူပြီး ခွင့်မပြုထားသော အပြုအမူရှိမရှိ မော်ဒယ်၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော လုပ်ငန်းစဉ်နှင့် လုပ်ဆောင်ချက်များကို စစ်ဆေးကာ ခွင့်မပြုထားနိုင်သည့် လှုပ်ရှားမှုကို အလိုအလျောက် ရပ်တန့်ပေးသော အမျိုးအစားခွဲစနစ်တစ်ခု ပါဝင်သည်။
Astra ၏ ဆိုက်ဘာလုံခြုံရေး စွမ်းဆောင်ရည်များ သိသိသာသာ တိုးမြင့်လာမှုကြောင့်၊ ဤဖြန့်ချထားမှုကို ဘေးကင်းပြီး လုံခြုံစေရန် ကျွန်ုပ်တို့သည် အထူးဂရုစိုက်ဆောင်ရွက်နေပါသည်။ ထပ်ဆောင်း လုံခြုံရေးစစ်ဆေးမှုများသည် တစ်ခါတစ်ရံ ကာကွယ်ရေးဆိုင်ရာ ဆိုက်ဘာလုံခြုံရေးအလုပ်များ အပါအဝင် တရားဝင်လုပ်ငန်းများကို နှေးကွေးစေခြင်း၊ ခေတ္တရပ်ဆိုင်းစေခြင်း သို့မဟုတ် ရပ်တန့်စေခြင်း ဖြစ်နိုင်သည်။ လုပ်ငန်းတာဝန်တစ်ခုကို ChatGPT သို့မဟုတ် Codex တွင် ခေတ္တရပ်ထားပါက၊ ဆက်လက်မလုပ်ဆောင်မီ လုပ်ဆောင်ချက်ကို ပြန်လည်သုံးသပ်ရန် သင့်အား တောင်းဆိုနိုင်သည်။ API တွင် လုပ်ငန်းတာဝန် ရပ်တန့်သွားပါမည်။ ဤစစ်ဆေးမှုများသည် တစ်ခါတစ်ရံ တရားဝင် လုပ်ငန်းဆောင်တာများကို အနှောင့်အယှက်ဖြစ်စေနိုင်သဖြင့်၊ မလိုအပ်သော အနှောင့်အယှက်များကို လျှော့ချရန် ဤစနစ်ကို ဆက်လက်ပြင်ဆင်တိုးတက်အောင် လုပ်ဆောင်နေပါသည်။ ရည်ရွယ်ချက်မကိုက်ညီမှု စောင့်ကြည့်စနစ်သည် ရည်ရွယ်ချက်ကိုက်ညီမှုကို အစားမထိုးနိုင်ပါ- ကျွန်ုပ်တို့၏ ရည်မှန်းချက်မှာ ၎င်းတို့၏ ခွင့်ပြုထားသော နယ်ပယ်အတွင်း ယုံကြည်စိတ်ချစွာ ရှိနေသော မော်ဒယ်များကို တည်ဆောက်ရန်ဖြစ်ပြီး၊ ထို့ကြောင့် ဤအကာအကွယ်များက ကြားဝင်ဆောင်ရွက်ရန် မလိုအပ်စေရန် ဖြစ်သည်။
ရရှိနိုင်မှု
GPT‑6 Astra ကို ယနေ့တွင် အဖွဲ့အစည်းအနည်းစုအတွက် အဆင့်လိုက် ဖြန့်ချိနေပြီး၊ လာမည့်ရက်အနည်းငယ်အတွင်း ChatGPT Plus၊ Pro၊ Business နှင့် Enterprise အသုံးပြုသူအားလုံးအတွက်သာမက OpenAI API၊ Microsoft Azure နှင့် AWS Bedrock မှတစ်ဆင့်လည်း ရရှိလာမည်ဖြစ်ပါသည်။ Astra အသုံးပြုမှုသည် ရှိပြီးသား စာရင်းသွင်းမှု အသုံးပြုခွင့်ပမာဏများတွင် ပါဝင်ပြီး၊ အသုံးပြုသူများနှင့် လုပ်ငန်းများသည် ထပ်ဆောင်းအသုံးပြုမှုအတွက် ခရက်ဒစ်များကိုလည်း ဝယ်ယူနိုင်မည်ဖြစ်ပါသည်။ Pro၊ Business နှင့် Enterprise အစီအစဉ်များရှိ အသုံးပြုသူများသည် GPT‑6 Astra Pro ကိုလည်း အသုံးပြုခွင့် ရရှိမည်ဖြစ်ပါသည်။ Enterprise အုပ်ချုပ်ရေးမှူးများသည် ၎င်းတို့၏ အလုပ်နေရာအတွက် Astra ကို ဖွင့်နိုင်ပြီး၊ စတင်ဖြန့်ချိချိန်တွင် အသုံးပြုခွင့်ကို မူလအတိုင်း ပိတ်ထားပါသည်။
Astra သည် အကျုံးဝင်သော API ဖောက်သည်များအတွက် ဒေတာ လုံးဝသိမ်းဆည်းမထားခြင်းကို ပံ့ပိုးပေးပြီး ပြီးခဲ့သည့်လတွင် ကျွန်ုပ်တို့ မျှဝေခဲ့သည့်အတိုင်း ဖောက်သည်များ၏ ကိုယ်ရေးလုံခြုံမှုကို ထိန်းသိမ်းထားစဉ် လုံခြုံရေးစောင့်ကြည့်မှုကို အားကောင်းစေရန် သီးသန့် လုံခြုံရေး စိစစ်ဆောင်ရွက်မှု ကို စမ်းသပ်နေပါသည်။
ဆော့ဖ်ဝဲရေးသားသူများအတွက် GPT‑6 Astra ကို OpenAI API တွင် gpt-6-astra အဖြစ်နှင့် Microsoft Azure နှင့် Amazon Bedrock မှတစ်ဆင့် ရရှိနိုင်မည်ဖြစ်သည်။
OpenAI API Standard ဈေးနှုန်းမှာ input တိုကင်တစ်သန်းလျှင် ဒေါ်လာ ၁၀ နှင့် output တိုကင်တစ်သန်းလျှင် ဒေါ်လာ ၅၀ ဖြစ်ပါသည်။ cache read နှင့် write များအတွက် သီးခြားနှုန်းထားများ သက်ရောက်ပါသည်။ API တွင် GPT‑6 Astra အတွက် အမြန်မုဒ်ကို အသုံးပြုနိုင်ပြီး Standard လုပ်ဆောင်မှု၏ အမြန်နှုန်းထက် 2x အထိ ပိုမိုမြန်ဆန်စွာ 2x Standard ဈေးနှုန်းဖြင့် ပေးစွမ်းပါသည်။
ကွန်ပျူတာ အသုံးပြုမှု
ပရော်ဖက်ရှင်နယ်
ပရော်ဖက်ရှင်နယ် | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore ကြိုးတပ်တူရိယာ လေးမျိုးတီးဝိုင်းများ (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
အဖွဲ့အစည်းအတွင်း ဒီဇိုင်းတာဝန်များ | 50.0% | 47.4% | - | 35.8% | - | - |
အတွင်းပိုင်း ဒေတာသိပ္ပံ လုပ်ငန်းများ | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis ဉာဏ်ရည်အညွှန်းကိန်း v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
ကုဒ်ရေးခြင်း
| ကုဒ်ရေးသားခြင်း | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (ရမှတ်) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 ပင်မ (ရမှတ်) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| အတွင်းပိုင်း ဒေတာဘေ့စ် ရွှေ့ပြောင်းခြင်း လုပ်ငန်းတာဝန်များ | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis ကုဒ်ရေးသားရေးအေးဂျင့် ညွှန်းကိန်း v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
ပညာရေးဆိုင်ရာ
ပညာရေးဆိုင်ရာ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath အဆင့် 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
လူသားမျိုးနွယ်၏ နောက်ဆုံး စာမေးပွဲ (ကိရိယာများဖြင့်) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
သိပ္ပံနှင့် ကျန်းမာရေး
ချိန်ညှိမှု
ချိန်ညှိမှု | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
အတွင်းပိုင်း ကွန်ပျူတာအသုံးပြုမှု လုံခြုံရေး စံနှိုင်းတိုင်းတာချက် (နိမ့်လေ ကောင်းလေ) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
အတွင်းပိုင်း ကွန်ပျူတာအသုံးပြုမှု ဘေးကင်းရေး စံနှိုင်းတိုင်းတာချက်၊ AutoReview ပါဝင်သည် (နိမ့်လေ ကောင်းလေ) | 1.8% | 4.3% | - | - | - | - |
အတွင်းပိုင်း ကျော်လွှားမှု စံနှိုင်းတိုင်းတာချက် (နိမ့်လေ ကောင်းလေ) | 0.00% | 0.29% | - | - | - | - |
ExploitGym honeypot (နိမ့်လေ ကောင်းလေ) | 0.0% | 48.2% | - | - | - | - |
မဖြစ်နိုင်သော ExploitGym | 100.0% | - | - | - | - | - |
အတွင်းပိုင်း ဟယ်လူစီနေးရှင်း ဘင်ချ်မတ် (နိမ့်လေ ကောင်းလေ) | 4.2% | 12.2% | - | - | - | - |
ရှည်လျားသော context
ရှည်လျားသော context | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
သဘောတရား ကျိုးကြောင်းဆင်ခြင်ခြင်း
| စိတ္တဇ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash | |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
အကဲဖြတ်မှုရမှတ်များသည် မည်သည့် ကြိုးပမ်းအားထုတ်မှုအဆင့်တွင်မဆို အမြင့်ဆုံးဖြစ်ပါသည်။ GPT အကဲဖြတ်မှုများကို ကျွန်ုပ်တို့၏ သုတေသနပတ်ဝန်းကျင်တွင် သို့မဟုတ် ကျွန်ုပ်တို့၏ API မှတစ်ဆင့် လုပ်ဆောင်ခဲ့ပြီး၊ စနစ် တုံ့ပြန်ညွှန်ကြားချက်များ၊ အသုံးပြုနိုင်သော ကိရိယာများ စသည်တို့၏ ကွာခြားချက်များကြောင့် ထုတ်လုပ်ရေး ChatGPT နှင့် အနည်းငယ်ကွဲပြားသော ထုတ်ပေးချက်ကို ပေးနိုင်ပါသည်။
အောက်ခြေမှတ်စုများ
- 1
ARC-AGI-3 တွင် GPT-6 Astra ကို ကျွန်ုပ်တို့၏ responses API အကဲဖြတ်စမ်းသပ်မှု စနစ်ဖြင့် လုပ်ဆောင်ခဲ့ပြီး၊ ၎င်းသည် လက်တွေ့ကမ္ဘာ စွမ်းဆောင်ရည်နှင့် ပိုမိုကိုက်ညီစေရန် ဆက်တင်နှစ်ခုကို ပြောင်းလဲပေးသည်။ ဤပြောင်းလဲမှုများသည် ARC-AGI-3 ကို အထူးရည်ရွယ်ထားခြင်းမဟုတ်ပါ။
- 2
GPT-5.6 Sol သည် ကျွန်ုပ်တို့၏ API၊ ChatGPT Codex နှင့် ChatGPT အလုပ်တွင် ရရှိနိုင်သော ဗားရှင်းကို ရည်ညွှန်းပါသည်။ ChatGPT စကားပြောရှိ ဗားရှင်းသည် အနည်းငယ်ကွဲပြားပါသည်။
- 3
OSWorld V2-Offline သည် အင်တာနက်အသုံးပြုခွင့် မလိုအပ်ဘဲ အလုပ်လုပ်နိုင်သော မူရင်း OSWorld V2 ၏ အစုခွဲတစ်ခု ဖြစ်သည်။ OSWorld-V2 Offline တွင် Claude မော်ဒယ်၏ စွမ်းဆောင်ရည်ကို ရေးသားသူများက တွင် တရားဝင် အဆင့်သတ်မှတ်ဇယား(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ပြန်လည်ထုတ်လုပ်ခဲ့သည်။ OSWorld 2.0 တွင် Claude အတွက် ရမှတ်များသည် တရားဝင်ဆက်တင်များကို အသုံးပြုထားပြီး၊ Fable 5.1 စနစ်ကဒ်မှ ပြင်ဆင်ထားသော လုပ်ဆောင်စရာများနှင့် ပြင်ဆင်ထားသော အကဲဖြတ်မှုများကို အသုံးမပြုထားပါ။
- 4
- 5
BenchCAD တွင် Claude ၏ ရမှတ်များသည် အကဲဖြတ်မှုတွင် ပြင်ဆင်ချက် 3 ခုကို ထင်ဟပ်စေပြီး၊ ၎င်းတို့ကို Fable 5.1 စနစ်ကဒ်(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)တွင် အသေးစိတ်ဖော်ပြထားသည်။
- 6
Guang Yang၊ Victoria Ebert၊ Nazif Tamer၊ Brian Siyuan Zheng၊ Luiza Pozzobon၊ နှင့် Noah A. Smith။ “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်).” arXiv:2506.19065၊ 2025.
- 7
Mark R. H. Gotham၊ Maureen Redbond၊ Bruno Bower နှင့် Peter Jonas. “OpenScore ကြိုးတပ်တူရိယာ လေးမျိုးတီးဝိုင်း စုစည်းမှု(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)။” ဂီတဗေဒအတွက် ဒစ်ဂျစ်တယ်စာကြည့်တိုက်များဆိုင်ရာ ၁၀ ကြိမ်မြောက် နိုင်ငံတကာ ညီလာခံ စာတမ်းများ၊ စာမျက်နှာ 49-57။ ACM၊ 2023။
- 8
FrontierCode တွင် GPT-6 Astra ကို Codex ရှိ ၎င်း၏ ဆော့ဖ်ဝဲရေးသားသူ မက်ဆေ့ချ်၏ အပိုင်းတစ်ခု(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)နှင့် ဆင်တူသော ဆော့ဖ်ဝဲရေးသားသူမက်ဆေ့ချ်ဖြင့် လုပ်ဆောင်ခဲ့သည်- "စမ်းသပ်ဖိုင်များကို အလွန်အကျွံ ဖန်တီးခြင်းမှ ရှောင်ကြဉ်ပါ။ သိမ်းဆည်းရန်နေရာ စံသတ်မှတ်ချက်များအရ လိုအပ်သည့်အခါ သို့မဟုတ် သင့်လျော်စွာ ထားရှိနိုင်သော ရှိပြီးသားဖိုင် မရှိသည့်အခါမှသာ စမ်းသပ်ဖိုင်အသစ်တစ်ခု ဖန်တီးပါ။ မသက်ဆိုင်သော ရှင်းလင်းပြင်ဆင်မှုများနှင့် မလိုအပ်သော ရှုပ်ထွေးမှုများကို ရှောင်ပါ။ သင့်လျော်သော ရှိပြီးသား utility များကို ပြန်လည်အသုံးပြုပါ။ သက်ဆိုင်ရာ သိမ်းဆည်းရန်နေရာ လမ်းညွှန်ချက်များကို ဖတ်ရှုပြီး အနီးအနားရှိ ကုဒ်၊ စမ်းသပ်မှုများ၊ မှတ်တမ်းစာရွက်စာတမ်းများနှင့် စဉ်ဆက်မပြတ် ပေါင်းစည်းမှု (CI) ကို စစ်ဆေးပါ။ သတ်မှတ်ထားသော စံလုပ်ထုံးလုပ်နည်းများကို လိုက်နာပါ။ ရည်မှန်းချက်မှာ သန့်ရှင်းပြီး ပေါင်းစည်းနိုင်သော ကုဒ် ဖြစ်သည်။" အကဲဖြတ်မှုအတွက် တုံ့ပြန်ညွှန်ကြားချက်ကို အကောင်းဆုံးဖြစ်အောင် ပြုလုပ်ထားခြင်းမရှိပါ။
- 9
ပထမအချက်မှာ ကိန်းမျဉ်းပေါ်တွင် မည်မျှဝေးဝေး သွားပါစေ၊ သုဒ္ဓကိန်းများသည် အချင်းချင်း မည်မျှနီးကပ်စွာ ဖြစ်ပေါ်နိုင်သည်ကို သက်ဆိုင်သည်။ ဆယ်စုနှစ်တစ်ခုကျော်ကြာအောင် သိရှိထားသည့် အကောင်းဆုံးရလဒ်က သုဒ္ဓကိန်းအတွဲများ အဆုံးမဲ့များပြားစွာရှိပြီး ၎င်းတို့၏ ကွာဟချက်မှာ 246 ထက်မပိုကြောင်း သက်သေပြထားခဲ့သည်။ Julia Stadlmann(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) သည် မကြာသေးမီက ထိုကန့်သတ်တန်ဖိုးကို 240 အထိ မြှင့်တင်ခဲ့သည်။ Astra သည် ပိုမိုတင်းကျပ်သော ကန့်သတ်ချက် 186 ကို သတ်မှတ်ရာတွင် ကူညီခဲ့ပြီး၊ ဤပိုသေးငယ်သော အကွာအဝေးအတွင်း အဆုံးမရှိများပြားသော အတွဲများ ပေါ်ပေါက်ကြောင်း ပြသခဲ့သည်။ သုဒ္ဓကိန်းများအကြား ကွာဟချက်တိုများ- သက်သေပြချက်(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် အထောက်အကူပြု သုတေသန(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)။
- 10
ဒုတိယအချက်မှာ သုဒ္ဓကိန်းများအကြားရှိ ပုံမှန်မဟုတ်လောက်အောင် ကြီးမားသော အကွာအဝေးများနှင့် သက်ဆိုင်သည်။ Astra သည် ဤကွာဟချက်များအပေါ်ထားရှိသော ကန့်သတ်ချက်တစ်ခုထဲရှိ နှစ် ၈၀ ကျော် မပြောင်းလဲဘဲ ရှိနေခဲ့သော ကိန်းစုတစ်ခုကို ပိုမိုကောင်းမွန်အောင် ပြုပြင်ခဲ့သည်။ ရလဒ်နှစ်ခုလုံးအတွက် သက်သေအထောက်အထားများ၊ အကျဉ်းချုပ်ထားသော အတွေးကွင်းဆက်နှင့် အတည်ပြုခြင်းဆိုင်ရာ အချက်အလက်များကို ကျွန်ုပ်တို့ မျှဝေထားပါသည်။ ကြီးမားသော ပရိုင်းကိန်းကွာဟချက်များ- သက်သေပြချက်(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် ပံ့ပိုးသည့် သုတေသန(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)။
- 11
ရည်ရွယ်ထားသော HealthBench Professional လုပ်ထုံးလုပ်နည်းအတိုင်း Claude မော်ဒယ်အားလုံးကို GPT‑5.4 ကို အသုံးပြု၍ ကျွန်ုပ်တို့က လွတ်လပ်စွာ အကဲဖြတ်ခဲ့သည်။ အဆင့်သတ်မှတ်ခြင်းနှင့် အရှည်အလိုက် ချိန်ညှိထားပြီး ဖြတ်တောက်ကန့်သတ်မထားသော ရမှတ်များ။ Fable 5.1 အတွက်၊ ပံ့ပိုးသူမှ ငြင်းဆိုမှုများ ဖြစ်ပေါ်သည့်အခါ Opus 5 ကို fallback အဖြစ် အသုံးပြုခဲ့သည်။
- 12
- 13
- 14
ExploitBench (၂၀၂၆ ခုနှစ် ဇွန်လ-ဩဂုတ်လ) တွင် ပြင်းထန်မှုအမြင့်ရှိသော V8 အားနည်းချက် 20 ခုကို တည်ငြိမ်သော Chrome ထုတ်ဝေမှု 13 ခုတွင် တွေ့ရှိရသည်။ စံနှုန်းစမ်းသပ်မှုသည် သတ်မှတ်ထားသော အားနည်းချက်တစ်ခုချင်းစီကို အသုံးချခြင်းဖြင့် Linux အတွက် V8 နှင့် တရားဝင် Chrome ထုတ်ဝေမှုများတွင် အေးဂျင့်များသည် မည်သည့်ကုဒ်မဆို လုပ်ဆောင်နိုင်မှု ရရှိနိုင်မနိုင်ကို စမ်းသပ်သည်။ ပါဝင်ထားသော အားနည်းချက်အချို့သည် အကဲဖြတ်မှု၏ ကန့်သတ်ချက်များအောက်တွင် မိမိစိတ်ကြိုက်ကုဒ်ကို လုပ်ဆောင်ခွင့်မပြုနိုင်သောကြောင့် 100% အောင်မြင်နှုန်းကို ရရှိနိုင်မည်မဟုတ်ပါ။ မှတ်ချက်- GPT-5.6 Sol ၏ 5.5% အမှတ်သည် စံနှုန်းစမ်းသပ်မှုအတွင်း အလှည့် 300 ကန့်သတ်ချက်ကြောင့် ဖြစ်ပေါ်လာခြင်းဖြစ်ပြီး max ကို အသုံးပြုသော အမှန်တကယ် ဖောက်သည်များတွင် ထိုကန့်သတ်ချက် မရှိပါ။ ဆင်တူသော ဆက်တင်များတွင် မော်ဒယ်သည် ကန့်သတ်ချက်များကို ပိုမိုနည်းပါးစွာ ကြုံတွေ့ရသည့်အခါ 11.5% ရမှတ်ကို ရရှိခဲ့သည်။
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်).” arXiv:2608.11469v1, 2026 ခုနှစ်။
- 16
ကျွန်ုပ်တို့သည် ပြင်ပဝန်ဆောင်မှုပေးသူများ၏ မော်ဒယ်များတစ်လျှောက် စမ်းသပ်သည့်အခါ ပိုမိုရိုးရှင်းသော သုတေသန ပြင်ဆင်သတ်မှတ်မှုကို အသုံးပြုပါသည်။ Codex တွင် ပိုမိုရှုပ်ထွေးသော ထုတ်လုပ်ရေးဆိုင်ရာ ပြင်ဆင်သတ်မှတ်မှုရှိပြီး ၎င်းကြောင့် မူလမော်ဒယ် အမှားနှုန်းများ ကွဲပြားနိုင်ပါသည်။ ဝန်ဆောင်မှုပေးသူဘက်မှ ကာကွယ်ရေးအစီအမံများနှင့် ကွန်ပျူတာကိရိယာ အကောင်အထည်ဖော်မှုများမှာလည်း ကွဲပြားနေဆဲဖြစ်ပါသည်။ Codex တွင် အတည်ပြုချက်မလိုအပ်သော အခြေအနေကို အသုံးပြုသူများ မတွေ့ကြုံရပါ။ အကြောင်းမှာ ၎င်းသည် အတွင်းပိုင်း သုတေသန ပြင်ဆင်သတ်မှတ်မှုဖြစ်သောကြောင့် ဖြစ်ပါသည်။
- 17
