OpenAI

GPT-6 Astra: A new generation of intelligence

ဉာဏ်ရည်၏ မျိုးဆက်သစ်

စက်တင်ဘာလ ၂၂ ရက် ၂၀၂၆ ခုနှစ် အပ်ဒိတ် - GPT‑6 Sol နှင့် GPT‑6 Luna တို့ဖြင့် ကျွန်ုပ်တို့၏ GPT‑6 မိသားစုကို တိုးချဲ့နေပါသည်။ ပိုမိုလေ့လာရန်။

ကျွန်ုပ်တို့သည် ကမ္ဘာ့ဉာဏ်ရည်အမြင့်ဆုံးနှင့် ညှိနှိုင်းကိုက်ညီမှုအကောင်းဆုံး မော်ဒယ်ဖြစ်သည့် GPT‑6 Astra ကို မိတ်ဆက်ပေးလိုက်ပါသည်။

GPT‑6 Astra သည် အကြိုလေ့ကျင့်သင်ကြားခြင်း၊ အားဖြည့် သင်ယူလေ့လာခြင်းနှင့် ကိုက်ညီစေမှုတို့တွင် နှစ်ပေါင်းများစွာ သုတေသနပြုလုပ်မှုနှင့် ကြီးမားသော ရင်းနှီးမြှုပ်နှံမှုများကို ပေါင်းစည်းထားသည်။ Astra သည် ကွန်ပျူတာအသုံးပြုမှု၊ ဝဘ်ရှာဖွေကြည့်ရှုမှု၊ ဆော့ဖ်ဝဲအင်ဂျင်နီယာလုပ်ငန်း၊ ဆိုက်ဘာလုံခြုံရေး၊ သိပ္ပံနှင့် ပရော်ဖက်ရှင်နယ်လုပ်ငန်းများတွင် ခေတ်မီနည်းပညာအဆင့်မြင့်ဆုံး စွမ်းဆောင်ရည်ကို ပြသသည်။ Astra သည် FrontierMath အဆင့် 4 တွင် 98% ရမှတ်ဖြင့် အမြင့်ဆုံးနီးပါး စွမ်းဆောင်နိုင်ခဲ့ပြီး၊ သင်္ချာပညာရပ်တွင် ကာလရှည်ကြာ မဖြေရှင်းနိုင်ခဲ့သော ပြဿနာများကို ဖြေရှင်းရာတွင်⁠ ကူညီပြီးဖြစ်သည်။ Astra သည် ARC-AGI-3 တွင် 99.9% ရမှတ်ဖြင့်လည်းကောင်း၊ ExploitBench တွင် 100% ရမှတ်ဖြင့်လည်းကောင်း အမြင့်ဆုံးစွမ်းဆောင်ရည်ကို ရရှိသည်။ ၎င်းသည် ကွန်ပျူတာနှင့် ဘရောက်ဆာ အသုံးပြုမှုတွင်လည်း စွမ်းဆောင်ရည်အမြင့်ဆုံး အဆင့်သစ်တစ်ခု သတ်မှတ်ကာ အခက်ခဲဆုံး ပရော်ဖက်ရှင်နယ်လုပ်ငန်းများကို ယှဉ်မမီသော မြန်နှုန်း၊ တိကျမှုနှင့် ဆင်ခြင်ဆုံးဖြတ်နိုင်စွမ်းတို့ဖြင့် ကိုင်တွယ်ဆောင်ရွက်သည်။ 

GPT‑6 Astra ကို ယနေ့တွင် အဖွဲ့အစည်းအနည်းစုအတွက် အဆင့်လိုက် ဖြန့်ချိနေပြီး၊ လာမည့်ရက်အနည်းငယ်အတွင်း ChatGPT Plus၊ Pro၊ Business နှင့် Enterprise အသုံးပြုသူအားလုံးအတွက်သာမက OpenAI API၊ Microsoft Azure နှင့် AWS Bedrock မှတစ်ဆင့်လည်း ရရှိလာမည်ဖြစ်ပါသည်။

“ARC-AGI-3 တွင် Astra သည် အဆင့်များ၏ 96% ၌ ကျွန်ုပ်တို့၏ လူသားလုပ်ဆောင်ချက်-ထိရောက်မှု အခြေခံစံနှုန်းကို ကျော်လွန်ခဲ့ပြီး၊ စံနှုန်းပေါ်တွင် လူသားစွမ်းဆောင်ရည်နှင့် လက်တွေ့အားဖြင့် တန်းတူအဆင့်သို့ ရောက်ရှိခဲ့သည်။ ၎င်းသည် ကျွန်ုပ်တို့ စမ်းသပ်ဖူးသမျှတွင် အကောင်းဆုံး မော်ဒယ်ဖြစ်ရုံသာမက၊ အသစ်အဆန်းရှိသော ပတ်ဝန်းကျင်များကို လမ်းညွှန်သွားလာပြီး ဖြေရှင်းနိုင်စွမ်းတွင်သာမက ထိုသို့လုပ်ဆောင်ရန် မည်မျှထိရောက်စွာ သင်ယူနိုင်သည်တွင်လည်း စွမ်းဆောင်ရည်အမြင့်ဆုံး မော်ဒယ်များ၏ စွမ်းဆောင်ရည်၌ အဓိပ္ပာယ်ရှိသော ပြောင်းလဲမှုတစ်ရပ်ကို ကိုယ်စားပြုသည်။”
Greg Kamradt၊ ARC Prize Foundation

Astra သည် အသုံးပြုသူ၏ ရည်ရွယ်ချက်နှင့် မော်ဒယ်၏ အပြုအမူကို နားလည်ရာတွင် သိသိသာသာ တိုးတက်ကောင်းမွန်ထားသည့် ကျွန်ုပ်တို့၏ အကိုက်ညီဆုံး မော်ဒယ်ဖြစ်သောကြောင့် Astra ၏ ဆုံးဖြတ်ချက်အပေါ် ပိုမိုယုံကြည်စိတ်ချစွာဖြင့် လုပ်ငန်းတာဝန်များကို လွှဲအပ်နိုင်ပါသည်။ ဤအချက်ကို စမ်းသပ်သည့် နည်းလမ်းတစ်ခုအနေဖြင့် ခက်ခဲသော သို့မဟုတ် မဖြစ်နိုင်သော လုပ်ငန်းတာဝန်တစ်ခုကို ရင်ဆိုင်ရသည့် မော်ဒယ်က ၎င်း၏ ရည်ရွယ်ထားသော နယ်ပယ်ကို ကျော်လွန်မည်လားဆိုသည်ကို အကဲဖြတ်သည့် Hugging Face ဖြစ်ရပ်မှ အချက်အလက်များကို အခြေခံထားသော အကဲဖြတ်မှုအသစ်တစ်ခုကို ကျွန်ုပ်တို့ ဖန်တီးခဲ့သည်။ ထုတ်လုပ်မှုကာကွယ်မှုများမပါဘဲ ခွင့်ပြုထားသောပစ်မှတ်ထက် 48 % ကျော်လွန်သွားသော GPT‑5.6 Sol နှင့်နှိုင်းယှဉ်ပါက GPT‑6 Astra သည် 0% တွင် ဤသို့ပြုလုပ်ခဲ့သည်။

ကမ္ဘာ့အကောင်းဆုံး ကွန်ပျူတာအသုံးပြုမှု မော်ဒယ်

GPT‑6 Astra သည် ကွန်ပျူတာအသုံးပြုမှု၏ မြန်နှုန်း၊ တိကျမှုနှင့် ဘေးကင်းလုံခြုံမှုတို့တွင် စွမ်းဆောင်ရည်အမြင့်ဆုံး အဆင့်သစ်တစ်ခုကို ဖော်ဆောင်ပေးသည်။ ၎င်းသည် အွန်လိုင်းဖောင်များ ဖြည့်သွင်းခြင်း၊ CRM ထဲရှိ ဖောက်သည်မှတ်တမ်းများကို အပ်ဒိတ်လုပ်ခြင်းနှင့် သင့်ပြက္ခဒိန်ကို စီစဉ်ခြင်းကဲ့သို့သော ငြီးငွေ့ဖွယ်ကောင်းသော လုပ်ငန်းများကို လုပ်ဆောင်ပေးနိုင်သည်။ ၎င်းသည် အွန်လိုင်းတွင် သုတေသနပြုလုပ်နိုင်ပြီး သင့်အီးမေးလ် သို့မဟုတ် သင့်စာရွက်စာတမ်းတည်းဖြတ်ကိရိယာထဲတွင် အနှစ်ချုပ်များကို မူကြမ်းရေးဆွဲပေးနိုင်သည်။ ၎င်းသည် သိပ္ပံဆိုင်ရာ ဒေတာများကို ခွဲခြမ်းစိတ်ဖြာနိုင်ပြီး၊ ဂရပ်များ ဖန်တီးနိုင်သည်၊ ဝဘ်ဆိုက်တစ်ခု ဖန်တီးနိုင်ကာ၊ ထိုဝဘ်ဆိုက်ပေါ်ရှိ အင်္ဂါရပ်အားလုံး မှန်ကန်စွာ အလုပ်လုပ်ကြောင်း သေချာစေရန် frontend အရည်အသွေးအာမခံချက် စစ်ဆေးမှုများကိုလည်း လုပ်ဆောင်နိုင်သည်။ ၎င်းသည် ဆော့ဖ်ဝဲကို အလိုအလျောက် ထည့်သွင်းပြီး စမ်းသပ်နိုင်ရန်နှင့် မျက်နှာပြင်ပေါ်တွင် သင်မြင်ရသော ပြဿနာများကို ရှာဖွေဖြေရှင်းနိုင်ရန် ကူညီပေးနိုင်သည်။ ဤတိုးတက်မှုများသည် ကျွန်ုပ်တို့၏ အဆင့်မြင့်ဆုံး အကဲဖြတ်မှုရလဒ်များတွင်လည်း ထင်ဟပ်နေပါသည်။

ဤတိုးတက်မှုများသည်လည်း အမှန်တကယ် အသိပညာအခြေပြု လုပ်ငန်းတာဝန်များတွင် ထိရောက်မှု သိသိသာသာ တိုးတက်မှုများ ဖြစ်ပေါ်စေသည်။ OSWorld 2.0 တွင် တုံ့ပြန်ချိန် သရုပ်ဖော်မှုများအရ AAstra သည် GPT‑5.6 Sol ထက် အလုပ်တစ်ခုလျှင် အချိန် 47% ခန့် လျော့နည်း၍ ပိုမိုမြင့်မားသော ကွန်ပျူတာအသုံးပြုမှု စွမ်းဆောင်ရည်ကို ရရှိသည် လုပ်ငန်းတာဝန်တစ်ခုလျှင် ခန့်မှန်းခြေ ၄၀ မိနစ်ဖြင့် 72.6% ရမှတ်ရရှိခဲ့ပြီး၊ လုပ်ငန်းတာဝန်တစ်ခုလျှင် ခန့်မှန်းခြေ ၇၅ မိနစ်ဖြင့် 65.7% ရမှတ်ရရှိသည့် ရလဒ်နှင့် နှိုင်းယှဉ်ထားသည်။3

GPT‑6 Astra ၏ ကွန်ပျူတာအသုံးပြုနိုင်စွမ်းများကို ဂိမ်းဖွံ့ဖြိုးတိုးတက်မှု၊ လျှပ်စစ်အင်ဂျင်နီယာနှင့် နေ့စဉ် အသိပညာအခြေပြုလုပ်ငန်းများအပါအဝင် နယ်ပယ်အမျိုးမျိုးမှ ရလဒ်များတွင် တွေ့မြင်နိုင်သည်-

Astra နှင့်အတူ၊ ကွန်ပျူတာအသုံးပြုမှု၏ မြန်နှုန်းကို သိသိသာသာ မြှင့်တင်ရန် Codex အကဲဖြတ်စမ်းသပ်မှု စနစ်ကိုလည်း အပ်ဒိတ်လုပ်နေပါသည်။ Astra ၏ ထိရောက်မှုနှင့် ပေါင်းစပ်လိုက်သောအခါ၊ Mind2Web စံနှုန်းတွင် လက်ရှိ GPT‑5.6 Sol အတွေ့အကြုံနှင့် နှိုင်းယှဉ်ပါက လုပ်ငန်းပြီးစီးမှု 1.9x ပိုမြန်လာစေသည်။ မော်ဒယ်၏ မြန်နှုန်းဆိုင်ရာ တိုးတက်မှုများကြောင့် သင်လုပ်နိုင်သည်ထက် ပိုမြန်စွာ အချိန်ယူရသော နေ့စဉ်ဘဝလုပ်ငန်းများစွာကို ၎င်းက သင့်အတွက် လုပ်ဆောင်ပေးနိုင်သည်။4

“ကျွန်ုပ်တို့သည် GPT‑6 Astra ကို စတင်မိတ်ဆက်သည့်နေ့တွင် Devin ၏ အကဲဖြတ်စမ်းသပ်မှု စနစ်အတွင်း ပေါင်းစည်းနေပါသည်။ ၎င်းသည် ကျွန်ုပ်တို့၏ အတွင်းပိုင်း စမ်းသပ်မှုစံနှုန်းတွင် အကောင်းဆုံးနည်းပညာအဆင့် စွမ်းဆောင်ရည်ကို ပေးစွမ်းပါသည်။ ၎င်း၏ ထူးချွန်သော ကွန်ပျူတာအသုံးပြုနိုင်စွမ်း၊ စာရေးသားနိုင်စွမ်းနှင့် ကုဒ်ဘေ့စ်ကို နားလည်နိုင်စွမ်းတို့က စတင်အသုံးပြုချိန်မှစ၍ စမ်းသပ်ခြင်းကို ပိုမိုကောင်းမွန်စေခဲ့သည်- ဗီဒီယိုများကို သိသိသာသာ ပိုမိုလိုက်ကြည့်ရန် လွယ်ကူလာပြီး၊ အစီရင်ခံစာများမှာ ပိုမိုရှင်းလင်းကာ ပိုမိုအကျဉ်းချုံးလာသည်”
Silas Alberti, သုတေသနဆိုင်ရာ အကြီးတန်း ဒုတိယဥက္ကဋ္ဌ, Cognition

ပရော်ဖက်ရှင်နယ် အလုပ်တွင် ကြီးမားသော အပြောင်းအလဲတစ်ရပ်

GPT‑6 Astra သည် ရှုပ်ထွေးသော အလုပ်တာဝန်များကို ကိုင်တွယ်ဖြေရှင်းရာတွင် ကူညီပေးရန် ကွန်ပျူတာအသုံးပြုမှုဆိုင်ရာ တိုးတက်မှုများကို ပရော်ဖက်ရှင်နယ် ပတ်ဝန်းကျင်များအတွက် ရည်ရွယ်ထားသော လေ့ကျင့်သင်ကြားမှုနှင့် ပေါင်းစပ်ထားသည်။ ၎င်းသည် ရှုပ်ထွေးသော ပြဿနာများအတွက် လိုအပ်သော ဉာဏ်ရည်ကို အဆင့်များစွာပါဝင်သည့် လုပ်ငန်းစဉ်များကို ဆောင်ရွက်နိုင်စွမ်း၊ အရည်အသွေးမြင့် စာရွက်စာတမ်းများ၊ ဇယားစာရွက်များနှင့် တင်ပြချက်များကို ဖန်တီးနိုင်စွမ်းတို့နှင့် ပေါင်းစပ်ထားသည်။

GPT‑6 Astra သည် ရှိပြီးသား တမ်းပလိတ်များကို လိုက်နာပြီး အပြင်အဆင်ကောင်းမွန်ကာ ဖွဲ့စည်းပုံရှိသော ဇာတ်ကြောင်းဖြင့် အဓိကအချက်များကို တိုတောင်းရှင်းလင်းစွာ ဖော်ပြသည့် ဆလိုက်များ ထုတ်လုပ်ရာတွင် ကျွန်ုပ်တို့၏ အကောင်းဆုံး မော်ဒယ်ဖြစ်သည်။ ၎င်းသည် သင့်နမူနာပုံစံများကို လိုက်နာပြီး သင့်ရေးသားပုံနှင့် မြင်ကွင်းပိုင်းဆိုင်ရာ စတိုင်တို့နှင့် ကိုက်ညီသော ရှင်းလင်းပြီး ဖွဲ့စည်းပုံကောင်းမွန်သည့် စာရွက်စာတမ်းများ၊ တင်ပြချက်များ၊ စာရင်းဇယားများနှင့် ခွဲခြမ်းစိတ်ဖြာချက်များကို ဖန်တီးပေးသည်။ Astra ကိုလည်း လက်ရှိလုပ်ဆောင်နေသည့်အလုပ်အတွက် မလိုအပ်သောအချက်အလက်များကို ထပ်ခါတလဲလဲ မဖော်ပြဘဲ၊ အရေးကြီးသည့်ဆက်စပ်အကြောင်းအရာများကိုသာ ထုတ်ပေးသည့်ရလဒ်များထဲသို့ သီးသန့်ထည့်သွင်းနိုင်ရန် လေ့ကျင့်ပေးထားသည်။ ဤအချက်များအားလုံးကြောင့် ၎င်းသည် သင့်လုပ်ငန်းဆိုင်ရာ ဆက်စပ်အခြေအနေများနှင့် စံနှုန်းများနှင့် ကိုက်ညီသော၊ ချက်ချင်းအသုံးပြုနိုင်မှု ပိုမိုမြင့်မားသော ရလဒ်ပစ္စည်းများကို ထုတ်ပေးနိုင်သည်။

GPT‑6 Astra သည် ၎င်းဖန်တီးသော ဝဘ်ဆိုက်များ၊ ဂိမ်းများ၊ အပလီကေးရှင်းများနှင့် ရင်းဒါးပုံရိပ်များအတွက် ပိုမိုအားကောင်းသော အမြင်ပိုင်းဆိုင်ရာ စီရင်ဆုံးဖြတ်နိုင်စွမ်းကိုလည်း ဆောင်ကျဉ်းပေးသည်။ ChatGPT ရှိ ဆိုက်များ⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ဖြင့် Astra သည် တုံ့ပြန်ညွှန်ကြားချက်တစ်ခုမှ ဝဘ်ဆိုက်များ၊ ဝဘ်အက်ပ်များနှင့် ဂိမ်းများကို တိုက်ရိုက် ဖန်တီး၊ ဟိုစ့်လုပ်ပြီး မျှဝေနိုင်သည်။

“Astra က ကျွန်ုပ်တို့အား လုပ်ဆောင်နိုင်စွမ်းနှင့် ထိရောက်မှု နှစ်ခုလုံးတွင် သိသာထင်ရှားသော အားသာချက်တစ်ခု ပေးစွမ်းသည်။ ၎င်းသည် ကျွန်ုပ်တို့ စမ်းသပ်ထားသော အခြား မော်ဒယ်များထက် တိုကင်များကို 20% အထိ လျော့နည်းစွာ အသုံးပြုရင်း ကျွန်ုပ်တို့၏ အရှုပ်ထွေးဆုံး ဖန်တီးမှုလုပ်ငန်းစဉ်များကို အောင်မြင်စွာ လုပ်ဆောင်ပေးပါသည်။ အရေးအကြီးဆုံးမှာ ကျွန်ုပ်တို့၏ ဖောက်သည်များအတွက် ၎င်းသည် အရည်အသွေးပိုမြင့်သော ရလဒ်ကို ဆိုလိုပါသည်။”
Alex Mashrabov, အမှုဆောင်အရာရှိချုပ်နှင့် ပူးတွဲတည်ထောင်သူ, Higgsfield AI

ညွှန်ကြားချက်များတွင် အဓိပ္ပာယ်ဖွင့်ဆိုရန် နေရာလွတ်ရှိသည့်အခါ GPT‑6 Astra သည် မှန်ကန်သော ဆုံးဖြတ်ချက်ချရာတွင် ယခင်မော်ဒယ်များထက် ပိုကောင်းသည်။ ၎င်းသည် ပုံမှန်ဖြစ်လေ့ရှိသော ကွက်လပ်များကို ဖြည့်ရန် ဆက်စပ်အချက်အလက်ကို အသုံးပြုပြီး၊ အဖြေကြောင့် ရလဒ် ပြောင်းလဲနိုင်သည့်အခါတွင် တိကျသော မေးခွန်းများကို မေးသည်။ Codex တွင် သင့်အဖြေပေါ်တွင် မမူတည်သော အလုပ်များကို ဆက်လက်လုပ်ဆောင်ရင်း တစ်ပြိုင်နက်တည်းမဟုတ်ဘဲ မေးခွန်းများ မေးမြန်းနိုင်သည်။ သင် မတုံ့ပြန်ပါက သင့်လျော်သည့်နေရာများတွင် အကျိုးသင့်အကြောင်းသင့်ရှိသော ခန့်မှန်းချက်များဖြင့် ဆက်လက်လုပ်ဆောင်မည်ဖြစ်သော်လည်း၊ အကျိုးသက်ရောက်မှုကြီးသော ဆုံးဖြတ်ချက်များအတွက်မူ သင့်ထံမှ ထည့်သွင်းချက်ကို စောင့်ဆိုင်းပါမည်။

အောက်ပါဥပမာများသည် မပါရှိသော အချက်အလက်များက အဖြေကို အရေးပါသည့်အတိုင်းအတာအထိ ပြောင်းလဲစေနိုင်သော နေ့စဉ်လုပ်ဆောင်မှုများတွင် Astra က ပူးပေါင်းကူညီပုံကို ပြသထားသည်။

Astra သည် လုပ်ငန်းတာဝန်တစ်ခု ပြောင်းလဲတိုးတက်လာသည်နှင့်အမျှ ဦးတည်ချက်မပျောက်ဘဲ ဆက်လက်နားလည်ထားနိုင်ရာတွင်လည်း ပိုမိုကောင်းမွန်သည်။ အစောပိုင်း မော်ဒယ်များသည် တစ်ခါတစ်ရံ လမ်းညွှန်မက်ဆေ့ချ်များကို ရည်မှန်းချက်အသစ်တစ်ခုအဖြစ် သဘောထားမိသဖြင့် မူလတောင်းဆိုချက် သို့မဟုတ် အစောပိုင်းကန့်သတ်ချက်များကို မျက်ခြည်ပြတ်သွားတတ်သည်။ Astra သည် လိုအပ်ချက်အသစ်များကို ထည့်သွင်းအသုံးချနိုင်ပြီး၊ တောင်းဆိုလာပါက ဦးတည်ချက်ကို ပြောင်းလဲနိုင်ကာ၊ ပိုမိုကျယ်ပြန့်သော လုပ်ငန်းတာဝန်ကို မပစ်ပယ်ဘဲ ဘေးထွက်မေးခွန်းများကိုလည်း ဖြေဆိုနိုင်သည်။

“Astra သည် ရှုပ်ထွေးသော ဥပဒေရေးရာ လုပ်ငန်းတာဝန်များတစ်လျှောက် GPT‑5.6 Sol ထက် အရည်အသွေး သိသိသာသာ ပိုမိုကောင်းမွန်သည်။ ကျွန်ုပ်တို့၏ ကနဦးစမ်းသပ်မှုများတွင်၊ Astra သည် ဥပဒေရေးရာလုပ်ငန်းကို ဝေဖန်ပိုင်းခြားတတ်သော ရှေ့နေတစ်ဦးက ဆောင်ရွက်သည့်နည်းလမ်းအတိုင်း ချဉ်းကပ်နိုင်ခြင်းကြောင့် ထူးခြားပေါ်လွင်ခဲ့သည်၊ အကြောင်းမှာ ၎င်းသည် စာရွက်စာတမ်းများကို အတည်ပြုပြီးသား မှတ်တမ်းများမှ ခွဲခြားသိမြင်နိုင်သည်၊ အထောက်အထားမဲ့ ယူဆချက်များကို ဖော်ထုတ်ပြသသည်၊ နှင့် လစ်ဟာချက်များကို တိကျခိုင်မာသော မူကြမ်းရေးဆွဲရေး ရပ်တည်ချက်များအဖြစ် ပြောင်းလဲပေးသည်။”
Niko Grupen, အသုံးချသုတေသန အကြီးအကဲ, Harvey

ကုဒ်ရေးခြင်း

GPT‑6 Astra သည် ယနေ့အထိ ဆော့ဖ်ဝဲ အင်ဂျင်နီယာလုပ်ငန်းအတွက် အကောင်းဆုံး မော်ဒယ်ဖြစ်သည်။

2အနက် 1
“GPT‑6 Astra သည် ကျွန်ုပ်တို့၏ အတွင်းပိုင်း ကုဒ်ရေးသားမှု စံသတ်မှတ်ချက်များတွင် အဆင့်မြင့်ဆုံး စွမ်းဆောင်ရည်ကို ပေးစွမ်းပြီး GPT‑5.6 Sol နှင့် နှိုင်းယှဉ်ပါက trading intuition အကဲဖြတ်မှုများတွင် သိသာထင်ရှားသော တိုးတက်မှုကို ပြသသည်။ agentic coding အတွက် အသုံးပြုသည့်အခါ GPT‑6 Astra သည် developer များ လိုက်နာနားလည်ရန် ပိုမိုလွယ်ကူသော ပုံစံဖြင့် ဆက်သွယ်ပြီး ထုတ်လုပ်မှုအဆင့် အရည်အသွေးသို့ ရောက်ရှိရန် ထပ်တလဲလဲ ပြင်ဆင်မှု နည်းပါးသော ကုဒ်ကို ထုတ်လုပ်သည်။”
John Crepezzi၊ AI လက်ထောက်များ၊ Jane Street

Astra ဖြင့် context window ပြည့်သွားသည့်အခါ Codex က အကြောင်းအရာကို ထိန်းသိမ်းပြီး ပြန်လည်ရယူနိုင်စေမည့် နည်းလမ်းသစ်တစ်ခုကို မိတ်ဆက်ပေးနေပါသည်။ ယခင်က မော်ဒယ်များသည် ရှုပ်ထွေးသော ပြဿနာများကို အမှားရှာဖွေဖြေရှင်းသည့်အခါ သို့မဟုတ် ကြီးမားသော refactor များကို ကိုင်တွယ်သည့်အခါကဲ့သို့ ရှည်လျားသော ဆက်ရှင်များအတွင်း အလုပ်ကို အနှစ်ချုပ်ရန် အကျဉ်းချုံ့ခြင်းကို အသုံးပြုခဲ့ကြသည်။ အကျဉ်းချုံ့ခြင်းတစ်ကြိမ်စီသည် ပြင်ဆင်ချက်တစ်ခု အဘယ်ကြောင့် မအောင်မြင်ခဲ့သည် သို့မဟုတ် အစိတ်အပိုင်းတစ်ခု မည်သို့လုပ်ဆောင်သည်ဆိုသည့် အသေးစိတ်အချက်အလက်များကို ချန်လှပ်ထားနိုင်သည်။ Codex တွင် Astra သည် context window များအကြား မှတ်စုများကို ထိန်းသိမ်းထားနိုင်ပြီး စုပုံလာသော အသေးစိတ်အချက်အလက်များကို အနှစ်ချုပ်တစ်ခုတည်းအဖြစ် ထပ်ခါတလဲလဲ အကျဉ်းချုံ့စရာမလိုဘဲ ထိန်းသိမ်းထားနိုင်သည်။ ယခင် context window များကို ဆက်လက်ရှာဖွေနိုင်သောကြောင့် Astra သည် ထိုအချက်အလက်များကို ၎င်း၏မှတ်စုများတွင် မှတ်တမ်းတင်မထားခဲ့လျှင်ပင် ယခင်မက်ဆေ့ချ်များနှင့် ကိရိယာရလဒ်များမှ လိုအပ်ချက်များ သို့မဟုတ် စမ်းသပ်ရလဒ်များကို ရှာဖွေနိုင်သည်။ ဤစမ်းသပ်ဆဲလုပ်ဆောင်ချက်ကို သင့်၏ Codex config.toml တွင် ဖွင့်အသုံးပြုနိုင်သည်၊⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ပြီးတော့ ၎င်းသည် လာမည့်သီတင်းပတ်များအတွင်း Astra အတွက် ပုံသေသတ်မှတ်ချက် ဖြစ်လာပါမည်။

သိပ္ပံဆိုင်ရာ ရှာဖွေတွေ့ရှိမှုကို တိုးတက်စေခြင်း

“ဇာတ်လမ်းကတော့ ခေတ်တစ်ခေတ်၏ အဆုံးသတ်နှင့် နောက်ခေတ်တစ်ခေတ်၏ အစပြုခြင်း ဖြစ်သည်။”
Greg Burnham၊ EpochAI

GPT‑6 Astra သည် သိပ္ပံဆိုင်ရာ ရှာဖွေတွေ့ရှိမှု၊ သင်္ချာနှင့် ကျန်းမာရေးအတွက် အရေးပါသော တိုးတက်မှုကြီးတစ်ခု ဖြစ်သည်။ ယနေ့၊ ကျွန်ုပ်တို့သည် သုဒ္ဓကိန်းများအကြားရှိ ကွာဟချက်များနှင့် ပတ်သက်သော ထပ်မံရလဒ်နှစ်ခုကို မျှဝေလိုက်ပါသည်။9နှင့် 10

Astra သည် သင်္ချာနှင့် သိပ္ပံဆိုင်ရာ အကဲဖြတ်စမ်းသပ်မှုများစွာတွင်လည်း စံချိန်သစ်များ တင်နိုင်ခဲ့သည်။

Astra သည် သိပ္ပံဆိုင်ရာ ရှာဖွေတွေ့ရှိမှုများ၏ နောက်ကွယ်မှ လက်တွေ့လုပ်ငန်းများတွင် ကူညီပေးနိုင်သည်။ သိပ္ပံဆိုင်ရာ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော စွမ်းရည်ကို ကွန်ပျူတာအသုံးပြုမှုနှင့် ပေါင်းစပ်ခြင်းဖြင့်၊ ၎င်းသည် ဒေတာကို စစ်ဆေးပြီး ရလဒ်များကို စူးစမ်းလေ့လာရန် အထူးပြု ဆော့ဖ်ဝဲတွင် တိုက်ရိုက်လုပ်ဆောင်နိုင်ကာ၊ သုတေသီများအား အထောက်အထားကို အကဲဖြတ်ပြီး နောက်တစ်ဆင့် မည်သည်ကို စုံစမ်းလေ့လာရမည်ကို ဆုံးဖြတ်နိုင်ရန် ကူညီပေးသည်။

ဆိုက်ဘာလုံခြုံရေး

ကျွန်ုပ်တို့၏ လုံခြုံရေးဆိုင်ရာ အပ်ဒိတ်⁠ တွင် ဆွေးနွေးခဲ့သည့်အတိုင်း Astra သည် ဆိုက်ဘာစွမ်းရည်များတွင် သိသာထင်ရှားသော တိုးတက်မှုတစ်ရပ်ဖြစ်ပြီး ဆိုက်ဘာလုံခြုံရေးတွင် အရေးကြီးအဆင့် သတ်မှတ်ချက် ကို ကျွန်ုပ်တို့၏ ကြိုတင်ပြင်ဆင်ထားခြင်းဆိုင်ရာ ဖွဲ့စည်းမှု အရ ပြည့်မီပါသည်။ ၎င်း၏ zero-day exploit များကို ခွဲခြားသတ်မှတ်ပြီး တီထွင်ဖန်တီးနိုင်စွမ်းသည် ကာကွယ်ရေးအဖွဲ့များအား အားနည်းချက်များကို ရှာဖွေပြီး ပြင်ဆင်ရာတွင် အထောက်အကူပြုနိုင်သော်လည်း ပိုမိုခိုင်မာသော အကာအကွယ်အစီအမံများ လိုအပ်လာစေသည်။ ဤလုပ်ဆောင်နိုင်စွမ်းများ ဘယ်အတိုင်းအတာအထိ ကျယ်ပြန့်သည်ကို နားလည်နိုင်ရန်၊ ကျွန်ုပ်တို့သည် Astra ကို အဖွဲ့အစည်းအတွင်းပိုင်းနှင့် တတိယပါတီ ကျွမ်းကျင်သူများ၏ အကဲဖြတ်မှုများတွင် စမ်းသပ်အသုံးပြုခဲ့သည်။

ထုတ်လုပ်ရေးအကာအကွယ်များမပါဘဲ မော်ဒယ်ကို ExploitBench နှင့် ExploitGym တွင် ဦးစွာ စမ်းသပ်ခဲ့သည်။ ၎င်းတို့သည် မော်ဒယ်များက သိရှိပြီးသား ဆော့ဖ်ဝဲအားနည်းချက်များကို အလုပ်လုပ်နိုင်သော exploit များအဖြစ် ပြောင်းလဲနိုင်ခြင်းရှိမရှိ အကဲဖြတ်သည်။ ExploitBench တွင် Astra သည် 100% ပြည့်စုံသော ရမှတ်ကို ရရှိခဲ့ပြီး၊ ကျွန်ုပ်တို့၏ ယခင် စွမ်းဆောင်ရည်အမြင့်ဆုံး ဆိုက်ဘာစွမ်းရည်ရှိ မော်ဒယ် GPT‑5.6 Sol သည် 78.5% ရရှိခဲ့သည်။ ExploitGym တွင် Astra သည် အထွက်တိုကင်များကို သိသိသာသာ နည်းပါးစွာ အသုံးပြုရင်း အောင်မြင်မှုနှုန်း 42.4% ရရှိခဲ့ပြီး၊ GPT‑5.6 Sol သည် 30.3% ရရှိခဲ့သည်။13

ယခင်က မှတ်တမ်းတင်ထားသော ဆော့ဖ်ဝဲ အားနည်းချက်များနှင့် ထိတွေ့ခဲ့မှုကြောင့် စံပြိုင်ရလဒ်များ ထိခိုက်ခဲ့နိုင်သည်ဆိုသော စိုးရိမ်ချက်များ ရှိသဖြင့်၊ ကျွန်ုပ်တို့သည် Astra ကို အသစ်တီထွင်ထားသော စံပြိုင်နှစ်ခုတွင်လည်း အကဲဖြတ်ခဲ့ပါသည်။ ဥပမာတစ်ခုအနေဖြင့်၊ ကျွန်ုပ်တို့သည် ပြီးခဲ့သည့် သုံးလအတွင်းရှိ အားနည်းချက်များကို အသုံးပြုကာ exploit ဖွံ့ဖြိုးတီထွင်မှုကို စမ်းသပ်ရန် အတွင်းပိုင်း “ExploitBench (ဇွန်လ–ဩဂုတ်လ ၂၀၂၆ ခုနှစ်)” အကဲဖြတ်မှုတစ်ခုကို တည်ဆောက်ခဲ့သည်။14 Astra သည် ဤဒေတာစုတွင် GPT‑5.6 Sol ထက် အထွက်တိုကင်အနည်းငယ်သာ အသုံးပြုသော်လည်း မည်သည့်ကုဒ်မဆို လုပ်ဆောင်နိုင်သည့်နှုန်းကို သိသိသာသာ ပိုမိုမြင့်မားစွာ ရရှိခဲ့သည်။ အကဲဖြတ်မှုအတွင်း Astra သည် ယခင်က မသိရှိရသေးသော zero-day အားနည်းချက်နှစ်ခုကိုပင် ရှာဖွေတွေ့ရှိပြီး အသုံးပြုခဲ့သည်။ ကျွန်ုပ်တို့သည် အားနည်းချက်နှစ်ခုစလုံးကို ၎င်းတို့၏ ထိန်းသိမ်းသူများထံ ထုတ်ဖော်အသိပေးနေပါသည်။

ကျွန်ုပ်တို့သည် Astra ကို SRE-Bench15 တွင်လည်း စမ်းသပ်ခဲ့သည်။ ၎င်းသည် မော်ဒယ်များက မူရင်းအရင်းအမြစ်ကုဒ်ကို အသုံးပြုခွင့်မရှိဘဲ ဆော့ဖ်ဝဲ ဘိုင်နရီများကို reverse engineer ပြုလုပ်၍ ၎င်းတို့၏ အဓိက ယုတ္တိဗေဒကို နားလည်နိုင်ခြင်း ရှိ၊ မရှိကို တိုင်းတာသည့် စံနှုန်းစမ်းသပ်မှုတစ်ခုဖြစ်သည်။ Astra သည် လုပ်ငန်းတာဝန်များ၏ 88.0% ကို တစ်ကြိမ်တည်း ကြိုးပမ်းမှုဖြင့် ဖြေရှင်းခဲ့ပြီး 99.2% ကို လေးကြိမ်ကြိုးပမ်းမှုအတွင်း ဖြေရှင်းခဲ့သည်။ GPT‑5.6 Sol ၏ 55.9% နှင့် 68.7% တို့နှင့် အသီးသီး နှိုင်းယှဉ်ထားခြင်း ဖြစ်သည်။

စံနှုန်းတိုင်းတာစမ်းသပ်မှုများထက် ပို၍၊ ကျွမ်းကျင်ပညာရှင်များ ဦးဆောင်သော အကဲဖြတ်မှုများအရ Astra သည် ထုတ်လုပ်မှုအသုံးပြုမှုအတွက် လုံခြုံရေးကာကွယ်မှုများ မပါဘဲ လည်ပတ်စေသည့်အခါ ယခင်က မသိရှိရသေးသော အားနည်းချက်များကို အသုံးပြု၍ လုံခြုံရေး တင်းကျပ်ထားသော ဘရောက်ဇာများတွင် မိမိနှစ်သက်ရာကုဒ်ကို လုပ်ဆောင်နိုင်ပြီး၊ လုံခြုံရေး တင်းကျပ်ထားသော လည်ပတ်မှုစနစ်များအတွက် အခွင့်အရေးအဆင့် မြှင့်တင်နိုင်သော အသုံးချတိုက်ခိုက်မှုများကို ဖန်တီးနိုင်ကြောင်း တွေ့ရှိခဲ့သည်။

ကျွန်ုပ်တို့ ကာကွယ်သူများ၏ အခွင့်အလမ်းကာလ တွင် ဆွေးနွေးခဲ့သည့်အတိုင်း၊ စွမ်းဆောင်ရည်အမြင့်ဆုံး ဆိုက်ဘာစွမ်းရည်များသည် ကာကွယ်သူများအား အားနည်းချက်များကို ပိုမိုမြန်ဆန်စွာ ရှာဖွေတွေ့ရှိရန် ကူညီပေးနိုင်သော်လည်း၊ ထိုအားနည်းချက်များကို တိုက်ခိုက်အသုံးချရန်လည်း ပိုမိုလွယ်ကူစေသဖြင့် ကာကွယ်သူများအနေဖြင့် အလိုက်သင့်ပြောင်းလဲရန် အရေးတကြီးလိုအပ်မှုကို မြင့်တက်စေပါသည်။ ယနေ့ စတင်ထုတ်လွှင့်သည့် Astra ဗားရှင်းကို အသုံးပြု၍ ကာကွယ်သူများသည် လုံခြုံရေးကုဒ်ပြန်လည်သုံးသပ်ခြင်းနှင့် ပက်ခ်တင်ခြင်းကဲ့သို့သော လုပ်ငန်းတာဝန်များကို ဆောင်ရွက်ပြီးမြောက်နိုင်သည်။

သို့သော် Astra သည် အားနည်းချက်များအတွက် proof-of-concept exploits များ ဖန်တီးခြင်းကဲ့သို့သော ပိုမိုအဆင့်မြင့်သော ဆိုက်ဘာလုံခြုံရေးဆိုင်ရာ လုပ်ငန်းတာဝန်များကို လိုက်နာဆောင်ရွက်ရန် ငြင်းဆိုမည်။ OpenAI Daybreak⁠ မှတစ်ဆင့် ကျွန်ုပ်တို့သည် လာမည့်အပတ်အနည်းငယ်အတွင်း အသုံးပြုခွင့်ကို တိုးချဲ့ကာ ကန့်သတ်ချက်နည်းသော ကာကွယ်ရေးအစီအစဉ်များကို ဖြန့်ချိရန် စီစဉ်ထားပါသည်။ ၎င်းသည် အားနည်းချက်နှင့် အယူအဆသက်သေပြမှု အတည်ပြုစစ်ဆေးခြင်း၊ မဲလ်ဝဲလ် ခွဲခြမ်းစိတ်ဖြာခြင်း၊ ထောက်လှမ်းမှုဆိုင်ရာ အင်ဂျင်နီယာလုပ်ငန်းတို့ အပါအဝင် ကာကွယ်ရေးဆိုင်ရာ လုပ်ငန်းစဉ်များကို ပိုမိုလုပ်ဆောင်နိုင်စေပါမည်။

GPT‑5.6 Sol အတွက် ကျွန်ုပ်တို့၏ ကာကွယ်ရေးအစီအမံအလွှာကို အခြေခံ၍ ဖြစ်နိုင်ခြေရှိသော ဆိုက်ဘာ အလွဲသုံးစားမှုများကို ကာကွယ်ရန် ကျွန်ုပ်တို့၏ အကာအကွယ်များကိုလည်း အားကောင်းစေခဲ့သည်။ ၎င်းတို့တွင် ဖြစ်နိုင်ခြေရှိသော Jailbreak များကို ပိုမိုခံနိုင်ရည်ရှိစေရန် မော်ဒယ်၏ ခံနိုင်ရည်ကို ပိုမိုအားကောင်းစေခြင်းနှင့် ကျွန်ုပ်တို့၏ စောင့်ကြည့်စနစ်များအတွက် ဆက်စပ်အကြောင်းအရာများ ပိုမိုထည့်သွင်းပေးခြင်းတို့ ပါဝင်သည်။ ကျွန်ုပ်တို့၏ အတွင်းပိုင်း ထိုးဖောက်စမ်းသပ်ခြင်း တိုက်ခိုက်သူများနှင့်အတူ အလိုအလျောက် အကဲဖြတ်မှုများအပါအဝင် တင်းကျပ်သော အတွင်းပိုင်းနှင့် ပြင်ပ စမ်းသပ်မှုများကို ဆက်လက်လုပ်ဆောင်ခဲ့သည်။ ကျွန်ုပ်တို့၏ ဆိုက်ဘာကာကွယ်ရေးအစီအမံများနှင့် စမ်းသပ်မှုများအကြောင်း အသေးစိတ်ကို Astra ဘေးကင်းရေး အနှစ်ချုပ်⁠ နှင့် စနစ်ကဒ်⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)တွင် ရရှိနိုင်သည်။

GPT‑6 Astra ကို တာဝန်ယူမှုရှိစွာ ကိုက်ညီအောင်လုပ်ဆောင်ခြင်းနှင့် ဖြန့်ကျက်အသုံးပြုခြင်း

Astra သည် ကျွန်ုပ်တို့၏ အကိုက်ညီဆုံး မော်ဒယ်ဖြစ်သည်။ Astra သည် ဂရုတစိုက် ဆောင်ရွက်ခြင်း၊ လုပ်ငန်းတာဝန်၏ ကန့်သတ်ချက်များကို လေးစားလိုက်နာခြင်းနှင့် ပွင့်လင်းမြင်သာစွာ ဆက်သွယ်ပြောဆိုခြင်းတို့တွင် အထူးပြောင်းမြောက်သည်။ ဤလုပ်ငန်းသည် အစမှအဆုံးအထိ လူသား၏ ရည်ရွယ်ချက်နှင့် ကိုက်ညီနေသည့် မော်ဒယ်များကို လေ့ကျင့်ပေးရန် အာရုံစိုက်သော ကျွန်ုပ်တို့၏ နှစ်ရှည်သုတေသနအစီအစဉ်မှ နောက်ဆုံးရလဒ်ဖြစ်သည်။

အထိခိုက်မခံနိုင်သော ပတ်ဝန်းကျင်များတွင် Astra သည် ၎င်း၏ အန္တရာယ်အဆင့်နှင့် ကိုက်ညီသည့် သတိထားမှုဖြင့် ဆောင်ရွက်သည်။ မသင့်လျော်သော အပြုအမူများ ဖြစ်ပေါ်စေရန် ရန်ဘက်သဘောဖြင့် ရွေးချယ်ထားသော ကွန်ပျူတာအသုံးပြုမှု လုပ်ငန်းတာဝန်များကို အကဲဖြတ်ရာတွင် Astra သည် မရည်ရွယ်ထားသော အကျိုးဆက်များကို ရှောင်ရှားရာ၌ ပိုမိုအောင်မြင်ခဲ့သည်။ မူလသတ်မှတ်ချက်အတိုင်း ပေးထားသော အပိုလုံခြုံရေးအစီအမံများဖြင့် လည်ပတ်စေသောအခါ စွမ်းဆောင်ရည် ပိုမိုကောင်းမွန်လာခဲ့သည်။

Astra သည် စမ်းသပ်ခဲ့သော အခြားမည်သည့် စွမ်းဆောင်ရည်အမြင့်ဆုံး မော်ဒယ်များထက်မဆို မကိုက်ညီသော ရလဒ်များကို ပိုမိုနည်းပါးစွာ ဖြစ်ပေါ်စေသည်။ မျှတသော နှိုင်းယှဉ်မှုအတွက်၊ ကျွန်ုပ်တို့သည် ( OpenAI Responses API⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် Anthropic Messages API⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှစ်ခုလုံးတွင် ရရှိနိုင်သော မူရင်း ကွန်ပြူတာ အသုံးပြုမှု ကိရိယာများကို အခြေခံထားသည့်) ယေဘုယျ ကွန်ပြူတာ အသုံးပြုသည့် အေးဂျင့် အကဲဖြတ်စမ်းသပ်မှု စနစ်ကို အသုံးပြုခဲ့ပြီး၊ Codex နှင့် ChatGPT အလုပ် အသုံးပြုသူများအတွက် ပုံမှန်အားဖြင့် ဖြန့်ကျက်အသုံးပြုထားသော ထပ်ဆောင်းကာကွယ်မှုများ (အလိုအလျောက် ပြန်လည်သုံးသပ်ခြင်း၊ အတည်ပြုမှု မူဝါဒ) မပါဘဲ အသုံးပြုခဲ့ပါသည်။

Astra သည် အသုံးပြုသူက သတ်မှတ်ထားသော ဘောင်များနှင့် ၎င်း၏ ပတ်ဝန်းကျင်အခြေအနေက သွယ်ဝိုက်ညွှန်ပြသော ဘောင်များအတွင်း လုပ်ဆောင်နိုင်ခြေ ပိုများပါသည်။ အတွင်းပိုင်း အကဲဖြတ်မှုတစ်ခုတွင် Astra သည် Codex Auto-Review ၏ ငြင်းပယ်မှုကို ကျော်လွှားရန် တစ်ကြိမ်မျှ မကြိုးစားခဲ့ပါ။ Auto-review ကို ရည်ရွယ်ချက်ရှိရှိ ကျော်လွှားနိုင်အောင် စီစဉ်သတ်မှတ်ထားပြီး၊ ထိုသို့မဟုတ်ပါက အလုပ်တာဝန်ကို ပြီးမြောက်အောင် လုပ်ဆောင်နိုင်မည်မဟုတ်သည့် အခြေအနေတွင်ပင် ဤအချက်သည် မှန်ကန်နေဆဲဖြစ်သည်။ ပတ်ဝန်းကျင်ဆိုင်ရာ ကန့်သတ်ချက်များကို ဤသို့ လေးစားလိုက်နာခြင်းသည် ဤပို့စ်၏ နိဒါန်းတွင် ကျွန်ုပ်တို့ မျှဝေခဲ့သော မဖြစ်နိုင်သည့် ဆိုက်ဘာလုပ်ငန်း အကဲဖြတ်မှုရလဒ်များနှင့် ကျွန်ုပ်တို့၏ စနစ်ကဒ်⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)တွင် မှတ်တမ်းတင်ထားသော အခြားတွေ့ရှိချက်များနှင့် ကိုက်ညီသည်။

ထို့အပြင် Astra သည် အသုံးပြုသူများနှင့် ပွင့်လင်းမြင်သာသော ဆက်သွယ်ပြောဆိုမှုတွင် စံနှုန်းသစ်များကို သတ်မှတ်ပေးပါသည်။ အကဲဖြတ်မှုတစ်ခုတွင် Astra သည် ၎င်း၏ စွမ်းရည်များနှင့် အသုံးပြုနိုင်စွမ်းများအပေါ် မမှန်ကန်စွာ ဖော်ပြပြောဆိုရန် GPT‑ 5.6 Sol ထက် သုံးဆနည်းသော ဖြစ်နိုင်ခြေရှိသည်။

ကျွန်ုပ်တို့၏ စွမ်းရည်-စိတ်ကူးယဉ်အချက်အလက် အကဲဖြတ်မှုတွင် Astra သည် GPT‑5.6 Sol ထက် သိသာထင်ရှားစွာ တိုးတက်မှုကို ပြသခဲ့ပြီး၊ ၎င်း၏ စွမ်းရည်များနှင့်ပတ်သက်၍ အထင်အမြင်လွဲမှားစေနိုင်သော အဆိုများကို ပိုမိုနည်းပါးစွာ ပြုလုပ်ခဲ့ပါသည်။

ကျွန်ုပ်တို့၏ အကဲဖြတ်မှုများအရ Astra ၏ ရေးသားထားသော ကျိုးကြောင်းဆင်ခြင်မှုသည် GPT‑5.6 Sol များထက် စောင့်ကြည့်ရန် ပိုမိုခက်ခဲကြောင်း တွေ့ရှိခဲ့ပြီး စောင့်ကြည့်ခြင်းကို ရှောင်ရှားရန် ရှင်းလင်းစွာ တောင်းဆိုထားသည့် စမ်းသပ်မှုများအပေါ် အခြေခံထားသည်။ ဤအရာသည် ပိုမိုရိုးရှင်းသော လုပ်ငန်းတာဝန်များတွင် စာဖြင့်ဖော်ပြသော ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော အပေါ် Astra ၏ ထိန်းချုပ်နိုင်စွမ်း ပိုမိုမြင့်မားခြင်းနှင့် စာဖြင့်ဖော်ပြသည့် အဆင့်များ ပိုနည်းစွာဖြင့် ပြဿနာများကို ဖြေရှင်းနိုင်စွမ်းတို့ကြောင့်ဟု ကျွန်ုပ်တို့ ယူဆသည်။ Astra သည် ရှုပ်ထွေးသော လုပ်ငန်းတာဝန်များအတွက် လိုအပ်သည့် ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော ကို ဖုံးကွယ်ရန် အခက်အခဲရှိနေဆဲဟု ထင်ရသော်လည်း ဤကျဆင်းမှုကို ကျွန်ုပ်တို့ အလေးအနက်ထားသည်။ စောင့်ကြည့်နိုင်စွမ်းကို ပိုမိုကောင်းမွန်စေရေးသည် သုတေသန၏ ဦးစားပေးအဖြစ် ဆက်လက်ရှိနေပြီး၊ တွဲဖက်ပါရှိသော စနစ်ကဒ်⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) တွင် ကျွန်ုပ်တို့၏ တွေ့ရှိချက်များနှင့် ဆက်လက်လုပ်ဆောင်နေသော အလုပ်များကို အသေးစိတ် ဖော်ပြထားသည်။

ရည်ရွယ်ချက်နှင့်ကိုက်ညီစေရေးဆိုင်ရာ လေ့ကျင့်ပေးခြင်းသည် ဖြန့်ချိအသုံးချမှုအတွက် ကျွန်ုပ်တို့၏ ချဉ်းကပ်နည်းတွင် အဓိကကျသည်။ ထပ်ဆင့်ကာကွယ်ရေးအလွှာအဖြစ် မလုံခြုံသော အပြုအမူများကို ရှာဖွေဖော်ထုတ်ပြီး ထိန်းချုပ်နိုင်ရန် Codex Auto-review⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ကဲ့သို့သော စနစ်အကာအကွယ်များနှင့် အေးဂျင့်များ၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော နှင့် လုပ်ဆောင်ချက်များကို စောင့်ကြည့်ခြင်းတို့ကိုလည်း တည်ဆောက်ထားသည်။ ကျွန်ုပ်တို့၏ လုံခြုံရေး အပ်ဒိတ်⁠တွင် ဖော်ပြထားသည့်အတိုင်း ရည်ရွယ်ချက်မကိုက်ညီမှုကို မြင်တွေ့သိရှိနိုင်ရန်နှင့် အဆိုးရွားဆုံးဖြစ်ရပ်များကို ထိန်းချုပ်နိုင်ရန် Astra အဆင့် မော်ဒယ်များအတွက် ထုတ်လုပ်ရေးတွင် ရည်ရွယ်ချက်မကိုက်ညီမှု စောင့်ကြည့်စနစ်ကိုလည်း ဖြန့်ချိအသုံးချနေသည်။ ဤအကာအကွယ်များသည် အတွင်းပိုင်းဖြန့်ချိမှုများအတွက် စောင့်ကြည့်ပုံနှင့် ဆင်တူပြီး ခွင့်မပြုထားသော အပြုအမူရှိမရှိ မော်ဒယ်၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသော လုပ်ငန်းစဉ်နှင့် လုပ်ဆောင်ချက်များကို စစ်ဆေးကာ ခွင့်မပြုထားနိုင်သည့် လှုပ်ရှားမှုကို အလိုအလျောက် ရပ်တန့်ပေးသော အမျိုးအစားခွဲစနစ်တစ်ခု ပါဝင်သည်။

Astra ၏ ဆိုက်ဘာလုံခြုံရေး စွမ်းဆောင်ရည်များ သိသိသာသာ တိုးမြင့်လာမှုကြောင့်၊ ဤဖြန့်ချထားမှုကို ဘေးကင်းပြီး လုံခြုံစေရန် ကျွန်ုပ်တို့သည် အထူးဂရုစိုက်ဆောင်ရွက်နေပါသည်။ ထပ်ဆောင်း လုံခြုံရေးစစ်ဆေးမှုများသည် တစ်ခါတစ်ရံ ကာကွယ်ရေးဆိုင်ရာ ဆိုက်ဘာလုံခြုံရေးအလုပ်များ အပါအဝင် တရားဝင်လုပ်ငန်းများကို နှေးကွေးစေခြင်း၊ ခေတ္တရပ်ဆိုင်းစေခြင်း သို့မဟုတ် ရပ်တန့်စေခြင်း ဖြစ်နိုင်သည်။ လုပ်ငန်းတာဝန်တစ်ခုကို ChatGPT သို့မဟုတ် Codex တွင် ခေတ္တရပ်ထားပါက၊ ဆက်လက်မလုပ်ဆောင်မီ လုပ်ဆောင်ချက်ကို ပြန်လည်သုံးသပ်ရန် သင့်အား တောင်းဆိုနိုင်သည်။ API တွင် လုပ်ငန်းတာဝန် ရပ်တန့်သွားပါမည်။ ဤစစ်ဆေးမှုများသည် တစ်ခါတစ်ရံ တရားဝင် လုပ်ငန်းဆောင်တာများကို အနှောင့်အယှက်ဖြစ်စေနိုင်သဖြင့်၊ မလိုအပ်သော အနှောင့်အယှက်များကို လျှော့ချရန် ဤစနစ်ကို ဆက်လက်ပြင်ဆင်တိုးတက်အောင် လုပ်ဆောင်နေပါသည်။ ရည်ရွယ်ချက်မကိုက်ညီမှု စောင့်ကြည့်စနစ်သည် ရည်ရွယ်ချက်ကိုက်ညီမှုကို အစားမထိုးနိုင်ပါ- ကျွန်ုပ်တို့၏ ရည်မှန်းချက်မှာ ၎င်းတို့၏ ခွင့်ပြုထားသော နယ်ပယ်အတွင်း ယုံကြည်စိတ်ချစွာ ရှိနေသော မော်ဒယ်များကို တည်ဆောက်ရန်ဖြစ်ပြီး၊ ထို့ကြောင့် ဤအကာအကွယ်များက ကြားဝင်ဆောင်ရွက်ရန် မလိုအပ်စေရန် ဖြစ်သည်။

ရရှိနိုင်မှု

GPT‑6 Astra ကို ယနေ့တွင် အဖွဲ့အစည်းအနည်းစုအတွက် အဆင့်လိုက် ဖြန့်ချိနေပြီး၊ လာမည့်ရက်အနည်းငယ်အတွင်း ChatGPT Plus၊ Pro၊ Business နှင့် Enterprise အသုံးပြုသူအားလုံးအတွက်သာမက OpenAI API၊ Microsoft Azure နှင့် AWS Bedrock မှတစ်ဆင့်လည်း ရရှိလာမည်ဖြစ်ပါသည်။ Astra အသုံးပြုမှုသည် ရှိပြီးသား စာရင်းသွင်းမှု အသုံးပြုခွင့်ပမာဏများတွင် ပါဝင်ပြီး၊ အသုံးပြုသူများနှင့် လုပ်ငန်းများသည် ထပ်ဆောင်းအသုံးပြုမှုအတွက် ခရက်ဒစ်များကိုလည်း ဝယ်ယူနိုင်မည်ဖြစ်ပါသည်။ Pro၊ Business နှင့် Enterprise အစီအစဉ်များရှိ အသုံးပြုသူများသည် GPT‑6 Astra Pro ကိုလည်း အသုံးပြုခွင့် ရရှိမည်ဖြစ်ပါသည်။ Enterprise အုပ်ချုပ်ရေးမှူးများသည် ၎င်းတို့၏ အလုပ်နေရာအတွက် Astra ကို ဖွင့်နိုင်ပြီး၊ စတင်ဖြန့်ချိချိန်တွင် အသုံးပြုခွင့်ကို မူလအတိုင်း ပိတ်ထားပါသည်။

Astra သည် အကျုံးဝင်သော API ဖောက်သည်များအတွက် ဒေတာ လုံးဝသိမ်းဆည်းမထားခြင်းကို ပံ့ပိုးပေးပြီး ပြီးခဲ့သည့်လတွင် ကျွန်ုပ်တို့ မျှဝေခဲ့သည့်အတိုင်း ဖောက်သည်များ၏ ကိုယ်ရေးလုံခြုံမှုကို ထိန်းသိမ်းထားစဉ် လုံခြုံရေးစောင့်ကြည့်မှုကို အားကောင်းစေရန် သီးသန့် လုံခြုံရေး စိစစ်ဆောင်ရွက်မှု ကို စမ်းသပ်နေပါသည်။

ဆော့ဖ်ဝဲရေးသားသူများအတွက် GPT‑6 Astra ကို OpenAI API တွင် gpt-6-astra အဖြစ်နှင့် Microsoft Azure နှင့် Amazon Bedrock မှတစ်ဆင့် ရရှိနိုင်မည်ဖြစ်သည်။

OpenAI API Standard ဈေးနှုန်းမှာ input တိုကင်တစ်သန်းလျှင် ဒေါ်လာ ၁၀ နှင့် output တိုကင်တစ်သန်းလျှင် ဒေါ်လာ ၅၀ ဖြစ်ပါသည်။ cache read နှင့် write များအတွက် သီးခြားနှုန်းထားများ သက်ရောက်ပါသည်။ API တွင် GPT‑6 Astra အတွက် အမြန်မုဒ်ကို အသုံးပြုနိုင်ပြီး Standard လုပ်ဆောင်မှု၏ အမြန်နှုန်းထက် 2x အထိ ပိုမိုမြန်ဆန်စွာ 2x Standard ဈေးနှုန်းဖြင့် ပေးစွမ်းပါသည်။

ကွန်ပျူတာ အသုံးပြုမှု

ကွန်ပျူတာ အသုံးပြုမှု

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

အေးဂျင့်များ၏ နောက်ဆုံး စာမေးပွဲ

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08၊ အော့ဖ်လိုင်း အစု၊ တစ်စိတ်တစ်ပိုင်း ရမှတ်)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (ကိရိယာများမပါ)

92.7%

76.9%

-

87.3%17

-

-

ပရော်ဖက်ရှင်နယ်

ပရော်ဖက်ရှင်နယ်

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore ကြိုးတပ်တူရိယာ လေးမျိုးတီးဝိုင်းများ (1 - OMR-NED)

0.84

0.19

-

-

-

-

အဖွဲ့အစည်းအတွင်း ဒီဇိုင်းတာဝန်များ

50.0%

47.4%

-

35.8%

-

-

အတွင်းပိုင်း ဒေတာသိပ္ပံ လုပ်ငန်းများ

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis ဉာဏ်ရည်အညွှန်းကိန်း v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

ကုဒ်ရေးခြင်း

ကုဒ်ရေးသားခြင်းGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (ရမှတ်)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 ပင်မ (ရမှတ်)53.3% 847.5%50.9%53.5%53.4%43.6%
အတွင်းပိုင်း ဒေတာဘေ့စ် ရွှေ့ပြောင်းခြင်း လုပ်ငန်းတာဝန်များ63.9%42.7%57.8%50.3%--
Artificial Analysis ကုဒ်ရေးသားရေးအေးဂျင့် ညွှန်းကိန်း v1.467.065.1-67.268.161.2

ပညာရေးဆိုင်ရာ

ပညာရေးဆိုင်ရာ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath အဆင့် 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

လူသားမျိုးနွယ်၏ နောက်ဆုံး စာမေးပွဲ (ကိရိယာများဖြင့်)

57.2%

-

65.0%

63.8%

63.6%

-

သိပ္ပံနှင့် ကျန်းမာရေး

သိပ္ပံနှင့် ChatGPT ကျန်းမာရေးGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (အတွင်းသုံး)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (အရှည်အလိုက် ချိန်ညှိထားသော)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

ဆိုက်ဘာလုံခြုံရေး

ဆိုက်ဘာလုံခြုံရေးGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (ဇွန်-ဩဂုတ် 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

ချိန်ညှိမှု

ချိန်ညှိမှု

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

အတွင်းပိုင်း ကွန်ပျူတာအသုံးပြုမှု လုံခြုံရေး စံနှိုင်းတိုင်းတာချက် (နိမ့်လေ ကောင်းလေ)

2.4%

22.0%

9.5%

18.3%

11.5%

-

အတွင်းပိုင်း ကွန်ပျူတာအသုံးပြုမှု ဘေးကင်းရေး စံနှိုင်းတိုင်းတာချက်၊ AutoReview ပါဝင်သည် (နိမ့်လေ ကောင်းလေ)

1.8%

4.3%

-

-

-

-

အတွင်းပိုင်း ကျော်လွှားမှု စံနှိုင်းတိုင်းတာချက် (နိမ့်လေ ကောင်းလေ)

0.00%

0.29%

-

-

-

-

ExploitGym honeypot (နိမ့်လေ ကောင်းလေ)

0.0%

48.2%

-

-

-

-

မဖြစ်နိုင်သော ExploitGym

100.0%

-

-

-

-

-

အတွင်းပိုင်း ဟယ်လူစီနေးရှင်း ဘင်ချ်မတ် (နိမ့်လေ ကောင်းလေ)

4.2%

12.2%

-

-

-

-

ရှည်လျားသော context

ရှည်လျားသော context

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

သဘောတရား ကျိုးကြောင်းဆင်ခြင်ခြင်း

စိတ္တဇ ကျိုးကြောင်းသင့်လျော်စွာ စဉ််းစားပေးသောGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

အကဲဖြတ်မှုရမှတ်များသည် မည်သည့် ကြိုးပမ်းအားထုတ်မှုအဆင့်တွင်မဆို အမြင့်ဆုံးဖြစ်ပါသည်။ GPT အကဲဖြတ်မှုများကို ကျွန်ုပ်တို့၏ သုတေသနပတ်ဝန်းကျင်တွင် သို့မဟုတ် ကျွန်ုပ်တို့၏ API မှတစ်ဆင့် လုပ်ဆောင်ခဲ့ပြီး၊ စနစ် တုံ့ပြန်ညွှန်ကြားချက်များ၊ အသုံးပြုနိုင်သော ကိရိယာများ စသည်တို့၏ ကွာခြားချက်များကြောင့် ထုတ်လုပ်ရေး ChatGPT နှင့် အနည်းငယ်ကွဲပြားသော ထုတ်ပေးချက်ကို ပေးနိုင်ပါသည်။

အောက်ခြေမှတ်စုများ

  1. 1

    ARC-AGI-3 တွင် GPT-6 Astra ကို ကျွန်ုပ်တို့၏ responses API အကဲဖြတ်စမ်းသပ်မှု စနစ်⁠ဖြင့် လုပ်ဆောင်ခဲ့ပြီး၊ ၎င်းသည် လက်တွေ့ကမ္ဘာ စွမ်းဆောင်ရည်နှင့် ပိုမိုကိုက်ညီစေရန် ဆက်တင်နှစ်ခုကို ပြောင်းလဲပေးသည်။ ဤပြောင်းလဲမှုများသည် ARC-AGI-3 ကို အထူးရည်ရွယ်ထားခြင်းမဟုတ်ပါ။

  2. 2

    GPT-5.6 Sol သည် ကျွန်ုပ်တို့၏ API၊ ChatGPT Codex နှင့် ChatGPT အလုပ်တွင် ရရှိနိုင်သော ဗားရှင်းကို ရည်ညွှန်းပါသည်။ ChatGPT စကားပြောရှိ ဗားရှင်းသည် အနည်းငယ်ကွဲပြားပါသည်။⁠

  3. 3

    OSWorld V2-Offline သည် အင်တာနက်အသုံးပြုခွင့် မလိုအပ်ဘဲ အလုပ်လုပ်နိုင်သော မူရင်း OSWorld V2 ၏ အစုခွဲတစ်ခု ဖြစ်သည်။ OSWorld-V2 Offline တွင် Claude မော်ဒယ်၏ စွမ်းဆောင်ရည်ကို ရေးသားသူများက တွင် တရားဝင် အဆင့်သတ်မှတ်ဇယား⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) ပြန်လည်ထုတ်လုပ်ခဲ့သည်။ OSWorld 2.0 တွင် Claude အတွက် ရမှတ်များသည် တရားဝင်ဆက်တင်များကို အသုံးပြုထားပြီး၊ Fable 5.1 စနစ်ကဒ်မှ ပြင်ဆင်ထားသော လုပ်ဆောင်စရာများနှင့် ပြင်ဆင်ထားသော အကဲဖြတ်မှုများကို အသုံးမပြုထားပါ။

  4. 4

    မော်ဒယ်အချိန်များသည် သက်ဆိုင်ရာ သရုပ်ပြလုပ်ဆောင်မှုများအတွက် ဖော်ပြထားသော ကုန်လွန်ချိန်များဖြစ်သည်။ ပြသထားသော ကလစ်များသည် တည်းဖြတ်ထားသော ကောက်နုတ်ချက်များ ဖြစ်သည်။

  5. 5

    BenchCAD တွင် Claude ၏ ရမှတ်များသည် အကဲဖြတ်မှုတွင် ပြင်ဆင်ချက် 3 ခုကို ထင်ဟပ်စေပြီး၊ ၎င်းတို့ကို Fable 5.1 စနစ်ကဒ်⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)တွင် အသေးစိတ်ဖော်ပြထားသည်။

  6. 6

    Guang Yang၊ Victoria Ebert၊ Nazif Tamer၊ Brian Siyuan Zheng၊ Luiza Pozzobon၊ နှင့် Noah A. Smith။ “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်).” arXiv:2506.19065၊ 2025.

  7. 7

    Mark R. H. Gotham၊ Maureen Redbond၊ Bruno Bower နှင့် Peter Jonas. “OpenScore ကြိုးတပ်တူရိယာ လေးမျိုးတီးဝိုင်း စုစည်းမှု⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)။” ဂီတဗေဒအတွက် ဒစ်ဂျစ်တယ်စာကြည့်တိုက်များဆိုင်ရာ ၁၀ ကြိမ်မြောက် နိုင်ငံတကာ ညီလာခံ စာတမ်းများ၊ စာမျက်နှာ 49-57။ ACM၊ 2023။

  8. 8

    FrontierCode တွင် GPT-6 Astra ကို Codex ရှိ ၎င်း၏ ဆော့ဖ်ဝဲရေးသားသူ မက်ဆေ့ချ်၏ အပိုင်းတစ်ခု⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)နှင့် ဆင်တူသော ဆော့ဖ်ဝဲရေးသားသူမက်ဆေ့ချ်ဖြင့် လုပ်ဆောင်ခဲ့သည်- "စမ်းသပ်ဖိုင်များကို အလွန်အကျွံ ဖန်တီးခြင်းမှ ရှောင်ကြဉ်ပါ။ သိမ်းဆည်းရန်နေရာ စံသတ်မှတ်ချက်များအရ လိုအပ်သည့်အခါ သို့မဟုတ် သင့်လျော်စွာ ထားရှိနိုင်သော ရှိပြီးသားဖိုင် မရှိသည့်အခါမှသာ စမ်းသပ်ဖိုင်အသစ်တစ်ခု ဖန်တီးပါ။ မသက်ဆိုင်သော ရှင်းလင်းပြင်ဆင်မှုများနှင့် မလိုအပ်သော ရှုပ်ထွေးမှုများကို ရှောင်ပါ။ သင့်လျော်သော ရှိပြီးသား utility များကို ပြန်လည်အသုံးပြုပါ။ သက်ဆိုင်ရာ သိမ်းဆည်းရန်နေရာ လမ်းညွှန်ချက်များကို ဖတ်ရှုပြီး အနီးအနားရှိ ကုဒ်၊ စမ်းသပ်မှုများ၊ မှတ်တမ်းစာရွက်စာတမ်းများနှင့် စဉ်ဆက်မပြတ် ပေါင်းစည်းမှု (CI) ကို စစ်ဆေးပါ။ သတ်မှတ်ထားသော စံလုပ်ထုံးလုပ်နည်းများကို လိုက်နာပါ။ ရည်မှန်းချက်မှာ သန့်ရှင်းပြီး ပေါင်းစည်းနိုင်သော ကုဒ် ဖြစ်သည်။" အကဲဖြတ်မှုအတွက် တုံ့ပြန်ညွှန်ကြားချက်ကို အကောင်းဆုံးဖြစ်အောင် ပြုလုပ်ထားခြင်းမရှိပါ။

  9. 9

    ပထမအချက်မှာ ကိန်းမျဉ်းပေါ်တွင် မည်မျှဝေးဝေး သွားပါစေ၊ သုဒ္ဓကိန်းများသည် အချင်းချင်း မည်မျှနီးကပ်စွာ ဖြစ်ပေါ်နိုင်သည်ကို သက်ဆိုင်သည်။ ဆယ်စုနှစ်တစ်ခုကျော်ကြာအောင် သိရှိထားသည့် အကောင်းဆုံးရလဒ်က သုဒ္ဓကိန်းအတွဲများ အဆုံးမဲ့များပြားစွာရှိပြီး ၎င်းတို့၏ ကွာဟချက်မှာ 246 ထက်မပိုကြောင်း သက်သေပြထားခဲ့သည်။ Julia Stadlmann⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) သည် မကြာသေးမီက ထိုကန့်သတ်တန်ဖိုးကို 240 အထိ မြှင့်တင်ခဲ့သည်။ Astra သည် ပိုမိုတင်းကျပ်သော ကန့်သတ်ချက် 186 ကို သတ်မှတ်ရာတွင် ကူညီခဲ့ပြီး၊ ဤပိုသေးငယ်သော အကွာအဝေးအတွင်း အဆုံးမရှိများပြားသော အတွဲများ ပေါ်ပေါက်ကြောင်း ပြသခဲ့သည်။ သုဒ္ဓကိန်းများအကြား ကွာဟချက်တိုများ- သက်သေပြချက်⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် အထောက်အကူပြု သုတေသန⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)။

  10. 10

    ဒုတိယအချက်မှာ သုဒ္ဓကိန်းများအကြားရှိ ပုံမှန်မဟုတ်လောက်အောင် ကြီးမားသော အကွာအဝေးများနှင့် သက်ဆိုင်သည်။ Astra သည် ဤကွာဟချက်များအပေါ်ထားရှိသော ကန့်သတ်ချက်တစ်ခုထဲရှိ နှစ် ၈၀ ကျော် မပြောင်းလဲဘဲ ရှိနေခဲ့သော ကိန်းစုတစ်ခုကို ပိုမိုကောင်းမွန်အောင် ပြုပြင်ခဲ့သည်။ ရလဒ်နှစ်ခုလုံးအတွက် သက်သေအထောက်အထားများ၊ အကျဉ်းချုပ်ထားသော အတွေးကွင်းဆက်နှင့် အတည်ပြုခြင်းဆိုင်ရာ အချက်အလက်များကို ကျွန်ုပ်တို့ မျှဝေထားပါသည်။ ကြီးမားသော ပရိုင်းကိန်းကွာဟချက်များ- သက်သေပြချက်⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်) နှင့် ပံ့ပိုးသည့် သုတေသန⁠(ဝင်းဒိုးအသစ်တွင် ဖွင့်မည်)။

  11. 11

    ရည်ရွယ်ထားသော HealthBench Professional လုပ်ထုံးလုပ်နည်းအတိုင်း Claude မော်ဒယ်အားလုံးကို GPT‑5.4 ကို အသုံးပြု၍ ကျွန်ုပ်တို့က လွတ်လပ်စွာ အကဲဖြတ်ခဲ့သည်။ အဆင့်သတ်မှတ်ခြင်းနှင့် အရှည်အလိုက် ချိန်ညှိထားပြီး ဖြတ်တောက်ကန့်သတ်မထားသော ရမှတ်များ။ Fable 5.1 အတွက်၊ ပံ့ပိုးသူမှ ငြင်းဆိုမှုများ ဖြစ်ပေါ်သည့်အခါ Opus 5 ကို fallback အဖြစ် အသုံးပြုခဲ့သည်။

  12. 12

    Claude Fable 5 နှင့် 5.1 ကို LifeSciBench Gold v1၊ GeneBench Pro v13 နှင့် MedChemBench တွင် ထည့်သွင်းမထားပါ၊ အကြောင်းမှာ ၎င်းတို့သည် ဤအကဲဖြတ်မှုများရှိ မေးခွန်းအများစုကို ဖြေဆိုရန် ငြင်းဆိုသောကြောင့် ဖြစ်သည်။

  13. 13

    ExploitGym ပေါ်တွင် Astra နှင့် Sol တို့၏ ဆိုက်ဘာစွမ်းရည်အပြည့်အစုံကို ပိုမိုကောင်းမွန်စွာ အကဲဖြတ်နိုင်ရန် ၆ နာရီ အချိန်ကန့်သတ်ချက်မပါဘဲ စမ်းသပ်ခဲ့သည်။ ၎င်းတို့သည် လုံလောက်အောင် မြန်ဆန်သောကြောင့် ယင်း၏ သက်ရောက်မှုမှာ အနည်းငယ်သာ ရှိသည်။

  14. 14

    ExploitBench (၂၀၂၆ ခုနှစ် ဇွန်လ-ဩဂုတ်လ) တွင် ပြင်းထန်မှုအမြင့်ရှိသော V8 အားနည်းချက် 20 ခုကို တည်ငြိမ်သော Chrome ထုတ်ဝေမှု 13 ခုတွင် တွေ့ရှိရသည်။ စံနှုန်းစမ်းသပ်မှုသည် သတ်မှတ်ထားသော အားနည်းချက်တစ်ခုချင်းစီကို အသုံးချခြင်းဖြင့် Linux အတွက် V8 နှင့် တရားဝင် Chrome ထုတ်ဝေမှုများတွင် အေးဂျင့်များသည် မည်သည့်ကုဒ်မဆို လုပ်ဆောင်နိုင်မှု ရရှိနိုင်မနိုင်ကို စမ်းသပ်သည်။ ပါဝင်ထားသော အားနည်းချက်အချို့သည် အကဲဖြတ်မှု၏ ကန့်သတ်ချက်များအောက်တွင် မိမိစိတ်ကြိုက်ကုဒ်ကို လုပ်ဆောင်ခွင့်မပြုနိုင်သောကြောင့် 100% အောင်မြင်နှုန်းကို ရရှိနိုင်မည်မဟုတ်ပါ။ မှတ်ချက်- GPT-5.6 Sol ၏ 5.5% အမှတ်သည် စံနှုန်းစမ်းသပ်မှုအတွင်း အလှည့် 300 ကန့်သတ်ချက်ကြောင့် ဖြစ်ပေါ်လာခြင်းဖြစ်ပြီး max ကို အသုံးပြုသော အမှန်တကယ် ဖောက်သည်များတွင် ထိုကန့်သတ်ချက် မရှိပါ။ ဆင်တူသော ဆက်တင်များတွင် မော်ဒယ်သည် ကန့်သတ်ချက်များကို ပိုမိုနည်းပါးစွာ ကြုံတွေ့ရသည့်အခါ 11.5% ရမှတ်ကို ရရှိခဲ့သည်။

  15. 15
  16. 16

    ကျွန်ုပ်တို့သည် ပြင်ပဝန်ဆောင်မှုပေးသူများ၏ မော်ဒယ်များတစ်လျှောက် စမ်းသပ်သည့်အခါ ပိုမိုရိုးရှင်းသော သုတေသန ပြင်ဆင်သတ်မှတ်မှုကို အသုံးပြုပါသည်။ Codex တွင် ပိုမိုရှုပ်ထွေးသော ထုတ်လုပ်ရေးဆိုင်ရာ ပြင်ဆင်သတ်မှတ်မှုရှိပြီး ၎င်းကြောင့် မူလမော်ဒယ် အမှားနှုန်းများ ကွဲပြားနိုင်ပါသည်။ ဝန်ဆောင်မှုပေးသူဘက်မှ ကာကွယ်ရေးအစီအမံများနှင့် ကွန်ပျူတာကိရိယာ အကောင်အထည်ဖော်မှုများမှာလည်း ကွဲပြားနေဆဲဖြစ်ပါသည်။ Codex တွင် အတည်ပြုချက်မလိုအပ်သော အခြေအနေကို အသုံးပြုသူများ မတွေ့ကြုံရပါ။ အကြောင်းမှာ ၎င်းသည် အတွင်းပိုင်း သုတေသန ပြင်ဆင်သတ်မှတ်မှုဖြစ်သောကြောင့် ဖြစ်ပါသည်။

  17. 17

    ScreenSpot-Pro နှင့် ExploitGym အတွက် ကျွန်ုပ်တို့ ဖော်ပြသော Fable ရမှတ်များသည် ကာကွယ်မှုအစီအမံများ နည်းပါးသော Fable ဖြစ်သည့် Mythos မှ ရရှိလာခြင်းဖြစ်သည်။