OpenAI

GPT-6 Astra: A new generation of intelligence

አዲስ የአስተውሎት ትውልድ

የ2026 ሴፕቴምበር 22 ዝማኔ፦ የGPT‑6 ቤተሰባችንን በ GPT‑6 Sol እና GPT‑6 Luna እያሰፋን ነው። ተጨማሪ ይወቁ።

የዓለማችን እጅግ ብልህ እና የተቀናጀ ሞዴል የሆነውን GPT‑6 Astraን እያስተዋወቅን እንገኛለን።

GPT‑6 Astra በቅድመ-ስልጠና፣ በማጠናከሪያ ትምህርት እና በአሰላለፍ ዘርፎች ለዓመታት የተካሄዱ ምርምሮችን እና ትልቅ የምርምር ውርርዶችን ያጣምራል። Astra በኮምፒውተር አጠቃቀም፣ በድር አሰሳ፣ በሶፍትዌር ምህንድስና፣ በሳይበር ደህንነት፣ በሳይንስ እና በሙያዊ ሥራ ዘርፎች የዘመኑን ምርጥ ደረጃ ይወክላል። Astra በFrontierMath Tier 4 ላይ የ98% ውጤት በማስመዝገብ የመመዘኛውን ጣሪያ ደርሷል፤ ቀድሞውኑም በሒሳብ ውስጥ ለረጅም ጊዜ ያልተፈቱ ክፍት ችግሮችን ለመፍታት⁠ አግዟል። Astra በARC-AGI-3 99.9% ውጤት እና በExploitBench 100% ውጤት በማስመዝገብም ከፍተኛውን የአፈጻጸም ደረጃ አሳክቷል። በተጨማሪም በኮምፒውተር እና በአሳሽ አጠቃቀም ላይ አዲስ ግንባር ቀደም የሚከፍት ሲሆን፣ እጅግ ፈታኝ የሆኑ ሙያዊ ሥራዎችን ወደር በሌለው ፍጥነት፣ ትክክለኛነት እና ውሳኔ ሰጪነት ያከናውናል። 

GPT‑6 Astra ዛሬ ለተወሰኑ ድርጅቶች እየተለቀቀ ሲሆን፣ በሚቀጥሉት ቀናት ለሁሉም የChatGPT Plus፣ Pro፣ Business እና Enterprise ተጠቃሚዎች እንዲሁም በOpenAI API፣ Microsoft Azure እና AWS Bedrock በኩል ይገኛል።

“በ ARC-AGI-3 ላይ፣ Astra በ96% ደረጃዎች ላይ የሰው ድርጊት-ብቃት መነሻ መለኪያችንን በማለፍ፣ በመመዘኛው ላይ በተግባር ከሰው ጋር እኩል ደረጃ ደርሷል።” ይህ እስካሁን ከሞከርናቸው ሞዴሎች ሁሉ የተሻለው ሞዴል ብቻ ሳይሆን፣ በግንባር ቀደም ሞዴሎች አፈጻጸም ላይ ጉልህ የደረጃ ለውጥንም ያሳያል—አዳዲስ አካባቢዎችን የመዳሰስና የመፍታት ችሎታው ላይ ብቻ ሳይሆን፣ ያንን ማድረግ በምን ያህል ብቃት እንደሚማርም ጭምር።”
Greg Kamradt፣ የARC Prize ፋውንዴሽን

Astra የተጠቃሚን ፍላጎት በመረዳት እና በሞዴል ባህሪ ላይ ከፍተኛ ማሻሻያዎች የተደረጉበት እጅግ የተቀናጀ (aligned) ሞዴላችን ነው—በ Astra ውሳኔ ሰጪነት ላይ በሚኖርዎት በበለጠ እምነት ሥራዎችን መወከል ይችላሉ። ይህንን ከምንፈትሽባቸው መንገዶች አንዱ እንደመሆኑ፣ በHugging Face ክስተት መረጃ ላይ የተመሠረተ አዲስ የግምገማ ዘዴ የገነባን ሲሆን፣ ይህም አስቸጋሪ ወይም የማይቻል ሥራ የገጠመው ሞዴል ከተመደበለት ወሰን ውጭ ይወጣ እንደሆነ ይገመግማል። የምርት ጥበቃዎች ሳይኖሩት 48% ጊዜ ከተፈቀደው ኢላማ ያለፈው GPT‑5.6 Sol ጋር ሲነጻጸር፣ GPT‑6 Astra ይህን ያደረገው በ0% ጉዳዮች ነው።

በዓለም ላይ ምርጡ የኮምፒውተር አጠቃቀም ሞዴል

GPT‑6 Astra በኮምፒውተር አጠቃቀም ፍጥነት፣ ትክክለኛነት እና ደህንነት ላይ አዲስ ምዕራፍን ያመላክታል። እንደ የኢንተርኔት ፎርሞችን መሙላት፣ በ CRM ውስጥ የደንበኞች መረጃዎችን ማዘመን እና የቀን መቁጠሪያዎን ማደራጀት ያሉ አሰልቺ ሥራዎችን ማከናወን ይችላል። በኢንተርኔት ላይ ምርምር ማድረግ እና በኢሜይልዎ ወይም በሰነድ ማዘጋጃዎ ውስጥ የአጭር መግለጫዎችን ረቂቅ ማዘጋጀት ይችላል። ሳይንሳዊ መረጃዎችን መተንተን፣ ንድፎችን ማዘጋጀት፣ ድህረ ገጽ መፍጠር፣ እና የዚያ ድህረ ገጽ ሁሉም አገልግሎቶች መስራታቸውን ለማረጋገጥ የፊት ለፊት ገጽ የጥራት ማረጋገጫ ፍተሻዎችን ማካሄድ ይችላል። ሶፍትዌሮችን በራሱ መንገድ ለመጫን እና ለመፈተሽ፣ እንዲሁም በማያ ገጽዎ ላይ የሚያዩዋቸውን ችግሮች ለመፍታት ሊረዳዎት ይችላል። እነዚህ ማሻሻያዎች በከፍተኛ ደረጃ ግምገማዎቻችን ውጤቶች ላይም ተንፀባርቀዋል።

እነዚህ መሻሻሎችም በተጨባጭ የእውቀት ሥራ ተግባራት ላይ ጉልህ የቅልጥፍና መሻሻል ያስገኛሉ። በOSWorld 2.0 የመዘግየት ማስመሰያዎች ውስጥ፣ Astra ከ GPT‑5.6 ይልቅ በእያንዳንዱ ተግባር በ47% ገደማ ባነሰ ጊዜ ከፍ ያለ የኮምፒውተር አጠቃቀም አፈጻጸም ያስመዘግባል Sol፣ በአንድ ተግባር በግምት 40 ደቂቃ ወስዶ 72.6% ውጤት አስመዝግቧል፤ ይህም በግምት 75 ደቂቃ ወስዶ 65.7% ውጤት ካስመዘገበው ይበልጣል።3

የGPT‑6 Astra የኮምፒውተር አጠቃቀም ብቃቶች የጨዋታ ልማትን፣ የኤሌክትሪክ ምህንድስናን እና የዕለት ተዕለት የዕውቀት ሥራን ጨምሮ በተለያዩ ዘርፎች በሚገኙ ውጤቶች ውስጥ ሊታዩ ይችላሉ፦

ከAstra ጎን ለጎን፣ የኮምፒውተር አጠቃቀምን ፍጥነት በከፍተኛ ሁኔታ ለማሻሻል የCodex መደበቂያንም እያዘመንን ነው። ይህ ከAstra ቅልጥፍና ጋር ሲጣመር፣ በMind2Web መመዘኛ ላይ ካለው የአሁኑ GPT‑5.6 Sol ተሞክሮ ጋር ሲነጻጸር 1.9 እጥፍ ፈጣን የተግባር ማጠናቀቅን ያስገኛል። የሞዴሉ የፍጥነት ማሻሻያዎች እርስዎ ከሚያከናውኗቸው ይልቅ በፍጥነት ብዙ ጊዜ የሚወስዱ የዕለት ተዕለት ተግባራትን እንዲያከናውን ያስችሉታል።4

“GPT‑6 Astra በሚጀመርበት ቀን ወደ Devin መደበቂያ እያዋሃድነው ሲሆን፣ በዚያም በውስጣዊ የሙከራ መለኪያችን ላይ የዘመኑን የላቀ አፈጻጸም ያስመዘግባል። ኮምፒውተርን የመጠቀም እጅግ ጥሩ ችሎታው፣ የጽሑፍ አጻጻፉ እና የኮድቤዝ ግንዛቤው ሙከራን ከመጀመሪያው ጀምሮ አሻሽሎታል፦ ቪዲዮዎችን መከታተል በግልጽ ሁኔታ ቀላል ሆኗል፣ እና ሪፖርቶች ይበልጥ ግልጽና አጭር ሆነዋል”
ሲላስ አልበርቲ፣ ከፍተኛ ምክትል ፕሬዚዳንት ለምርምር፣ እውቀት

በሙያዊ ሥራ ላይ ከፍተኛ ለውጥ

GPT‑6 Astra በኮምፒውተር አጠቃቀም ላይ የተደረጉ እድገቶችን ለሙያዊ አካባቢዎች ከተሰጠ ዓላማ ተኮር ስልጠና ጋር በማጣመር፣ ውስብስብ የሥራ ተግባራትን ለመወጣት ይረዳል። ለውስብስብ ችግሮች የሚያስፈልገውን አስተውሎት በባለብዙ ደረጃ የሥራ ሂደቶችን የማከናወን፣ እንዲሁም በጥራት የተዘጋጁ ሰነዶችን፣ የተመን ሉሆችን እና አቀራረቦችን የማዘጋጀት ችሎታ ጋር ያጣምራል።

GPT‑6 Astra ነባር አብነቶችን በመከተል፣ በጥሩ ሁኔታ የተቀናጁ እና ዋና ዋና ነጥቦችን በተዋቀረ ትረካ በአጭሩ የሚያስተላልፉ የስላይድ ገጾችን በመፍጠር ረገድ ምርጡ ሞዴላችን ነው። የእርስዎን አብነቶች የሚከተሉ፣ እንዲሁም ከጽሑፍ እና የእይታ ዘይቤዎ ጋር የሚጣጣሙ ግልጽና በጥሩ ሁኔታ የተዋቀሩ ሰነዶችን፣ ገለጻዎችን ፣ የተመን ሉሆችን እና ትንተናዎችን ይፈጥራል። በተጨማሪም Astra ለእጁ ላይ ላለው ሥራ አስፈላጊ ያልሆኑ መረጃዎችን ከመድገም ይልቅ፣ አስፈላጊ የሆነውን አውድ ብቻ ለይቶ ወደ ውጤቱ እንዲያመጣ ተደርጎ የሠለጠነ ነው። ይህ ሁሉ የሚያሳየው ከንግድዎ አውድ እና መመዘኛዎች ጋር የሚጣጣሙ፣ ወዲያውኑ ለጥቅም የሚውሉ ውጤቶችን ማዘጋጀት እንደሚችል ነው።

GPT‑6 Astra ለሚገነባቸው ድር ጣቢያዎች፣ ጨዋታዎች፣ መተግበሪያዎች እና ምስላዊ ቅርጾች የበለጠ ጠንካራ የዕይታ ውሳኔ ሰጪነትን ይዞ ይመጣል። በChatGPT ውስጥ ባሉት ጣቢያዎች⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ፣ Astra ድር ጣቢያዎችን፣ የድር መተግበሪያዎችን እና ጨዋታዎችን ከእርምጃ በቀጥታ መፍጠር፣ ማስተናገድ እና ማጋራት ይችላል።

“Astra በአቅምና በቅልጥፍና በሁለቱም ረገድ ከፍተኛ ብልጫ ይሰጠናል። የሞከርናቸው ሌሎች ሞዴሎች ከሚጠቀሙት እስከ 20% ያነሱ tokenን እየተጠቀመ፣ እጅግ ውስብስብ የፈጠራ የሥራ ፍሰቶቻችንን በተሳካ ሁኔታ ያከናውናል። ከሁሉም በላይ፣ ለደንበኞቻችን ይህ ከፍተኛ ጥራት ያለው ውጤት ማለት ነው።”
Alex Mashrabov፣ ዋና ሥራ አስፈፃሚ እና ተባባሪ መሥራች፣ Higgsfield AI

መመሪያዎች ለትርጓሜ ቦታ ሲተዉ፣ GPT‑6 Astra ከቀድሞ ሞዴሎች ይልቅ ትክክለኛውን ውሳኔ በማድረግ የተሻለ ነው። መደበኛ ክፍተቶችን ለመሙላት ዐውድን ይጠቀማል፣ እና መልሱ ውጤቱን ሊቀይር በሚችልበት ጊዜ ትኩረት ያላቸው ጥያቄዎችን ይጠይቃል። በCodex ውስጥ፣ በምላሽዎ ላይ የማይመረኮዘውን ሥራ እያስቀጠለ በተመሳሳይ ጊዜ ሳይሆን ጥያቄ ሊያቀርብ ይችላል። ካልመለሱ፣ ተገቢ በሆነበት ጊዜ ምክንያታዊ ግምቶችን በመውሰድ ይቀጥላል፣ ነገር ግን በትልቅ ተጽዕኖ ያላቸው ውሳኔዎች ላይ የእርስዎን ግብዓት ይጠብቃል።

ከዚህ በታች ያሉት ምሳሌዎች፣ የጎደለ መረጃ መልሱን በከፍተኛ ሁኔታ ሊቀይር በሚችልባቸው የዕለት ተዕለት ተግባራት ላይ Astra እንዴት እንደሚተባበር ያሳያሉ።

Astra ተግባሩ እየተለዋወጠ በሚሄድበት ጊዜ አቅጣጫውን ጠብቆ በመቆየት ረገድም የተሻለ ነው። ቀደም ያሉ ሞዴሎች አንዳንድ ጊዜ የመመሪያ መልዕክቶችን እንደ አዲስ ግብ በመውሰድ፣ ዋናውን ጥያቄ ወይም ቀደም ያሉትን ገደቦች ይዘነጉ ነበር። Astra ሰፊውን ሥራ ሳይተው፣ አዳዲስ መስፈርቶችን ያካትታል፣ ሲጠየቅ አቅጣጫውን ይቀይራል፣ እና ተጓዳኝ ጥያቄዎችን ይመልሳል።

“Astra በውስብስብ የሕግ ተግባራት ላይ ከ GPT‑5.6 Sol ጋር ሲነጻጸር ከፍተኛ የጥራት መሻሻል ያሳያል። በመጀመሪያዎቹ ሙከራዎቻችን ውስጥ፣ አስትራ የሕግ ሥራን አስተዋይ ጠበቃ እንደሚቀርበው በመቅረቡ ጎልቶ ታየ፦ ሰነዶችን ከተረጋገጡ መዝገቦች ይለያል፣ በማስረጃ ያልተደገፉ ግምቶችን ወደ ፊት ያወጣል፣ እንዲሁም ክፍተቶችን ወደ ተጨባጭ የሰነድ ማርቀቅ አቋሞች ይቀይራል።”
Niko Grupen፣ የተግባራዊ ምርምር ኃላፊ፣ Harvey

ኮዲንግ

GPT‑6 Astra እስካሁን ለሶፍትዌር ምህንድስና ምርጡ ሞዴል ነው።

1 ከ 2
“GPT‑6 Astra በውስጣዊ የኮዲንግ መለኪያዎቻችን ላይ ዘመናዊ ከፍተኛ ደረጃ አፈጻጸም ያሳያል፤ እንዲሁም ከGPT‑5.6 Sol ጋር ሲነጻጸር በየንግድ ስሜት ግምገማዎች ላይ ግልጽ መሻሻል እንዳለው ያሳያል። ለወኪል-ተኮር ኮዲንግ ሲውል፣ GPT‑6 Astra ለገንቢዎች ለመከተል ቀላል በሆነ መንገድ ይግባባል፤ እንዲሁም ወደ ምርት ደረጃ ጥራት ለመድረስ ያነሱ የማሻሻያ ዙሮች የሚያስፈልጉትን ኮድ ያመነጫል።”
John Crepezzi፣ የሰው ሠራሽ አስተውሎት (AI) ረዳቶች፣ Jane Street

ከAstra ጋር፣ የዐውድ መስኮቱ ሲሞላ Codex ዐውዱን ጠብቆ የሚያቆይበትን እና መልሶ የሚያገኝበትን አዲስ መንገድ እያስተዋወቅን እንገኛለን። ከዚህ ቀደም፣ ሞዴሎች እንደ ውስብስብ ችግሮችን መፍታት ወይም ትላልቅ የኮድ ማሻሻያዎችን ማከናወን ባሉ ረጅም የሥራ ሂደቶች ወቅት ሥራውን ለማጠቃለል ኮምፓክሽንን ይጠቀሙ ነበር። እያንዳንዱ ኮምፓክሽን የሆነ መፍትሔ ለምን እንዳልሠራ ወይም አንድ የኮድ ክፍል እንዴት እንደሚሠራ የሚገልጹ ዝርዝሮችን ትቶ ሊያልፍ ይችላል። በCodex ውስጥ፣ Astra የተከማቹ ዝርዝሮችን ደጋግሞ ወደ አንድ ማጠቃለያ ሳያመቀው፣ በይዘት መስኮቶች መካከል ማስታወሻዎችን ጠብቆ ማቆየት ይችላል። ቀደሙት የይዘት መስኮቶች ተፈልገው የሚገኙ ሆነው ስለሚቆዩ፣ መረጃው በማስታወሻዎቹ ውስጥ ባይያዝ እንኳ Astra ከቀደሙት መልእክቶች እና የመሣሪያ ውጤቶች መስፈርቶችን ወይም የፈተና ውጤቶችን ማግኘት ይችላል። ይህንን የሙከራ ባህሪ በእርስዎ Codex config.toml⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ፋይል ውስጥ ማንቃት ይችላሉ እና በሚመጡት ሳምንታት ለAstra ነባሪው ይሆናል።

ሳይንሳዊ ግኝትን ማራመድ

“ታሪኩ ይህ ነው፦ የአንድ ዘመን መጨረሻ፣ የሌላ ዘመን መጀመሪያ።”
ግሬግ በርንሃም፣ EpochAI

GPT‑6 Astra ለሳይንሳዊ ግኝት፣ ለሒሳብ እና ለጤና ትልቅ እመርታ ነው። ዛሬ፣ በዋና ቁጥሮች መካከል ስላሉ ክፍተቶች ሁለት ተጨማሪ ውጤቶችን እናጋራለን።9 እና 10

Astra እንዲሁም በሒሳብና በሳይንስ ግምገማዎች ስብስብ ላይ አዳዲስ ሪከርዶችን ያስመዘግባል።

Astra ከሳይንሳዊ ግኝት በስተጀርባ ባለው ተግባራዊ ሥራ ላይ ሊያግዝ ይችላል። ሳይንሳዊ ማመዛዘንን ከኮምፒውተር አጠቃቀም ጋር በማጣመር፣ ውሂብን ለመመርመር እና ውጤቶችን ለማሰስ በልዩ ሶፍትዌር ውስጥ በቀጥታ መሥራት ይችላል፤ ይህም ተመራማሪዎች ማስረጃውን እንዲገመግሙ እና ቀጥሎ ምን እንደሚመረምሩ እንዲወስኑ ያግዛል።

የሳይበር ደኅንነት

በእኛ የደኅንነት ዝማኔ ላይ⁠ እንደተወያየነው፣ Astra በሳይበር አቅሞች ላይ ጉልበት ያሳየ ሲሆን፣ በእኛ የዝግጁነት ማዕቀፍ መሠረት በሳይበር ደኅንነት ዘርፍ ያለውን ወሳኝ ገደብ ያሟላል። የዜሮ ቀን ጀብዱዎችን የመለየት እና የማዘጋጀት ችሎታው ተከላካዮች ድክመቶችን እንዲያገኙ እና እንዲያስተካክሉ ሊረዳቸው ይችላል፣ ነገር ግን ጠንካራ መከላከያዎች አስፈላጊነትንም ይፈጥራል። እነዚህ ችሎታዎች ምን ያህል እንደተራዘሙ ለመረዳት፣ Astraን በውስጥ እና በሥስተኛ ወገን የባለሙያ ግምገማዎች ላይ አስኬድነናል።

በመጀመሪያ ሞዴሉ የታወቁ የሶፍትዌር ተጋላጭነቶችን ወደ በተግባር የሚሠሩ የጥቃት መንገዶች መቀየር መቻሉን በሚገመግሙት ExploitBench እና ExploitGym ላይ፣ ያለ የምርት ጥበቃዎች ፈትነነዋል። በExploitBench ላይ፣ Astra 100% ፍጹም ውጤት አስመዝግቧል፤ ይህም ከቀደመው ግንባር ቀደም የሳይበር ችሎታ ያለው ሞዴላችን GPT‑5.6 Sol 78.5% ጋር ሲነጻጸር ነው። በExploitGym ላይ፣ Astra 42.4% የስኬት መጠን አስመዝግቧል፤ GPT‑5.6 Sol 30.3% ሲያስመዘግብ፣ Astra በእጅጉ ያነሱ የውጤት tokenዎችን ተጠቅሟል።13

ቀደም ሲል ለተመዘገቡ የሶፍትዌር ተጋላጭነቶች መጋለጥ የመመዘኛ ውጤቶችን ሊነካ ይችላል የሚሉ ስጋቶችን ከግምት በማስገባት፣ Astraን በሁለት አዳዲስ መመዘኛዎች ላይም ገምግመናል። ከምሳሌዎቹ አንዱ፣ ባለፉት ሦስት ወራት የተገኙ ተጋላጭነቶችን በመጠቀም የኤክስፕሎይት ልማትን ለመፈተሽ የውስጥ “ExploitBench (June–August 2026)” ግምገማ ገንብተናል።14 Astra ከGPT‑5.6 ይልቅ በዘፈቀደ ኮድ ማስፈጸሚያ መጠኖች በከፍተኛ ሁኔታ የተሻለ ውጤት አስመዝግቧል በዚህ የውሂብ ስብስብ ላይ Sol እጅግ ጥቂት የውጤት ቶከኖችን በመጠቀም። በግምገማው ወቅት፣ Astra እንዲያውም ሁለት ከዚህ በፊት ያልታወቁ zero-day ተጋላጭነቶችን አግኝቶ ተጠቅሟል። ሁለቱንም ተጋላጭነቶች ለጠባቂዎቻቸው እያሳወቅን ነው።

በተጨማሪም Astraን SRE-Bench15 ላይ ፈትነናል፤ ይህ መለኪያ ሞዴሎች ጥሬ የምንጭ ኮድ ሳያገኙ ዋና አመክንዮውን ለመረዳት የሶፍትዌር ባይነሪዎችን የኋሊዮሽ ምህንድስና ማካሄድ መቻላቸውን ይለካል። Astra በካደገው የመጀመሪያ ሙከራ 88.0%፣ በአራት ሙከራዎች ውስጥ ደግሞ 99.2% የሚሆኑትን ሥራዎች የፈታ ሲሆን፤ ይህም ለ GPT‑5.6 Sol በቅደም ተከተል ከነበረው 55.9% እና 68.7% ጋር ሲነፃፀር የበላይ ነው።

ከመለኪያዎች ባሻገር፣ በባለሙያዎች የተመሩ ግምገማዎች እንዳመለከቱት፣ Astra የምርት አካባቢ የደህንነት መከላከያዎች ሳይኖሩት ሲካሄድ፣ ከዚህ ቀደም ያልታወቁ ተጋላጭነቶችን በመጠቀም በተጠናከሩ አሳሾች ውስጥ የዘፈቀደ ኮድ ማስፈጸም እና ለተጠናከሩ ኦፐሬቲንግ ሲስተሞች የመብት ማሳደጊያ ኤክስፕሎይቶችን መፍጠር ችሏል።

በ የተከላካዩ መስኮት ላይ እንደተወያየነው፣ ግንባር ቀደም የሳይበር ችሎታዎች ተከላካዮች ድክመቶችን በፍጥነት እንዲያገኙ ሊያግዟቸው ይችላሉ፣ ነገር ግን እነዚያን ድክመቶች ለመበዝበዝ ቀላል ስለሚያደርጉ፣ ተከላካዮች እንዲላመዱ ያለውን አጣዳፊነት ያሳድጋሉ። ዛሬ በሚለቀቀው የAstra ስሪት፣ ተከላካዮች እንደ የደህንነት ኮድ ግምገማ እና ፓች ማድረግ ያሉ ተግባራትን ለማጠናቀቅ ሊጠቀሙበት ይችላሉ።

ሆኖም፣ Astra እንደ ለተጋላጭነቶች የጽንሰ-ሐሳብ ማረጋገጫ መበዝበዣዎችን መፍጠር ያሉ ይበልጥ የላቁ የሳይበር ደህንነት ተግባራትን ለመፈጸም እምቢ ይላል። በ OpenAI Daybreak⁠ በኩል፣ በሚቀጥሉት ሳምንታት ተደራሽነትን ለማስፋት እና ያነሰ ገዳቢ የጥበቃ መርሆችን ለመልቀቅ አቅደናል። ይህ የተጋላጭነትን እና የማረጋገጫ ሙከራን፣ የማልዌር ትንተናን እና የመለየት ምህንድስናን ጨምሮ ተጨማሪ የመከላከያ የሥራ ፍሰቶችን ያስችላል።

እንዲሁም ለGPT‑5.6 Sol የኛን የጥበቃ ቁልል በመገንባት ሊከሰቱ ከሚችሉ የሳይበር አላግባብ መጠቀም ጥበቃዎቻችንን አጠናክረናል። እነዚህም ሊሆኑ የሚችሉ የjailbreak ጥቃቶችን በተሻለ ሁኔታ ለመቋቋም የሚያስችል ጠንካራ የሞዴል ጥንካሬ እና ለክትትል ሥርዓቶቻችን የበለጠ አውድ ያካትታሉ። ከውስጣዊ በእሳት መፈተን አጥቂዎቻችን ጋር የሚደረጉ ራስ-ሰር ግምገማዎችን ጨምሮ፣ ጥብቅ የውስጥና የውጭ ሙከራዎችን ቀጥለናል። ስለ ሳይበር መከላከያዎቻችን እና ሙከራዎቻችን ተጨማሪ ዝርዝሮች በአስትራ የደኅንነት አጠቃላይ እይታ⁠ እና የሥርዓት ካርድ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ ይገኛሉ።

GPT‑6 Astraን በኃላፊነት ማስማማት እና ማሰማራት

Astra እጅግ የተጣጣመ ሞዴላችን ነው። Astra ጥንቃቄ በማድረግ፣ የተግባር ወሰኖችን በማክበር፣ እና በግልጽነት በመግባባት የላቀ ነው። ይህ ሥራ ሞዴሎች ከመጀመሪያ እስከመጨረሻ ከሰው ልጅ ዓላማ ጋር ተስማምተው እንዲቆዩ በማሠልጠን ላይ ያተኮረው የረጅም ጊዜ የምርምር መርሐግብራችን የቅርብ ጊዜ ውጤት ነው።

በስሱ አካባቢዎች፣ Astra ከአደጋው መጠን ጋር በሚመጣጠን ጥንቃቄ ይሠራል። ያልተገባ ባህሪን ለማነሳሳት በፈታኝ መንገድ የተመረጡ የኮምፒውተር አጠቃቀም ተግባራት ግምገማ ውስጥ፣ Astra ያልታሰቡ ውጤቶችን ከማስወገድ አንጻር የበለጠ ስኬታማ ነበር። በነባሪነት የሚቀርቡ ተጨማሪ የደህንነት እርምጃዎችን አብሮ በማስኬድ፣ የበለጠ ጠንካራ አፈጻጸም አስገኝቷል።

Astra ከተፈተኑት ማናቸውም ሌሎች ግንባር ቀደም ሞዴሎች ያነሱ ያልተጣጣሙ ውጤቶችን ያስከትላል። ፍትሐዊ ንጽጽር ለማድረግ፣ በሁለቱም OpenAI የምላሾች API⁠(በአዲስ መስኮት ውስጥ ይክፈታል) እና Anthropic Messages API⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ በሚገኙ ቤተኛ የኮምፒውተር አጠቃቀም መሣሪያዎች ላይ የተመሠረተ አጠቃላይ የኮምፒውተር የሚጠቀም ወኪል መደበቂያ ተጠቀምን፣ እንዲሁም በመደበኛነት ለCodex እና ChatGPT ሥራ ተጠቃሚዎች የሚተገበሩ ተጨማሪ ጥበቃዎችን (ራስ-ሰር ግምገማ፣ የማረጋገጫ ፖሊሲ) ሳናካትት።

Astraም በተጠቃሚው የተቀመጡትና በሥራ አካባቢው በተዘዋዋሪ የሚጠቆሙት ወሰኖች ውስጥ የመሥራት ዕድሉ የበለጠ ነው። በውስጣዊ ግምገማ ውስጥ፣ Astra የCodex ራስ-ሰር ግምገማ እምቢታን ለማለፍ ፈጽሞ አልሞከረም። ይህ እውነት ሆኖ ቀጠለ፣ Auto-review ሆን ተብሎ ሊዘለል እንዲችል ተዋቅሮ እና ከዚያ ውጭ ሥራውን ማጠናቀቅ የማይቻል ቢሆንም እንኳ። ለአካባቢው ገደቦች የሚሰጠው ይህ ክብር በዚህ ጽሑፍ መግቢያ ላይ ያጋራነው የማይቻል የሳይበር ተግባር ግምገማ ውጤቶች እና በ የሥርዓት ካርድ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ ከተመዘገቡ ሌሎች ግኝቶች ጋር ይጣጣማል።

Astra በተጨማሪም በግልጽ የተጠቃሚ ግንኙነት ውስጥ አዳዲስ ደረጃዎችን ያስቀምጣል። በአንድ ግምገማ፣ Astra ከGPT‑5.6 በሦስት እጥፍ ያነሰ ዕድል አለው Sol ስለችሎታዎቹ እና ስለሚያስችላቸው ነገሮች ትክክል ያልሆኑ ውክልናዎችን የመስጠት።

በችሎታ-ቅዠት ግምገማችን ውስጥ፣ Astra ስለችሎታዎቹ የሚያሳስቱ አባባሎችን በመቀነስ፣ ከ GPT‑5.6 Sol ጋር ሲነጻጸር ከፍተኛ መሻሻል ያሳያል።

የእኛ ግምገማዎች የAstraን በጽሑፍ የቀረበ ማመዛዘን ከGPT‑5.6 ይልቅ ለመከታተል የበለጠ አስቸጋሪ መሆኑን አግኝተዋል Sol ለመከታተል የበለጠ አስቸጋሪ መሆኑን፣ ክትትልን እንዲያመልጥ በግልጽ በጠየቁት ፈተናዎች ላይ በመመስረት፣ አግኝተናል። ይህን በቀላል ተግባራት ላይ Astra በጽሑፍ ማመዛዘኑን በበለጠ መቆጣጠር መቻሉ እና ችግሮችን በጥቂት የጽሑፍ እርምጃዎች መፍታት መቻሉ እንደሆነ እንገምታለን። Astra ለውስብስብ ተግባራት የሚያስፈልገውን ማመዛዘን ለመደበቅ አሁንም የሚቸገር ይመስላል፣ ነገር ግን መቀነሱን በቁም ነገር እንወስደዋለን። የክትትል ችሎታን ማሻሻል የምርምር ቅድሚያ ሆኖ ይቀጥላል፣ እና ተያያዡ የሥርዓት ካርድ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ግኝቶቻችንን እና ቀጣይ ሥራችንን በዝርዝር ያቀርባል።

የማቀናጀት ሥልጠና የሞዴሎችን አጠቃቀም የማሰማራት አቀራረባችን ዋና አካል ነው። እንደ ተጨማሪ የመከላከያ ሽፋን፣ ደኅንነቱ ያልተጠበቀ ባህሪን ለመለየትና ለመገደብ እንዲረዱ እንደ Codex ራስ-ሰር ክለሳ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) እና የወኪሎችን ማመዛዘንና ድርጊቶች መከታተል ያሉ የሥርዓት ጥበቃዎችንም እንገነባለን። በደኅንነት ዝመናችን⁠ ላይ እንደተገለጸው፣ የአስትራ-ክላስ ሞዴሎችን በማምረት ሂደት ውስጥ የተሳሳተ አቀማመጥን መከታተል እና የተሳሳተ አቀማመጥን ታይነት እንዲኖረው እና በጣም መጥፎ ሁኔታዎችን ለማስወገድ እንሠራለን። እነዚህ መከላከያዎች ውስጣዊ ማሰማራቶችን የምንከታተልበትን ሁኔታ የሚመስሉ ሲሆን የሞዴሉን ምክንያት እና ያልተፈቀደ ባህሪ ለማረጋገጥ የሚፈትሹ እና ያልተፈቀደ ሊሆን የሚችል እንቅስቃሴን በራስ-ሰር የሚያስቆሙ የክላሲፋየሮችን ስርዓት ያካትታሉ።

በAstra የሳይበር ደህንነት አቅሞች ውስጥ ያለውን ከፍተኛ ጭማሪ ከግምት በማስገባት፣ ይህን ዝርጋታ ደኅንነቱ የተጠበቀና አስተማማኝ ለማድረግ በተለይ ጥንቃቄ እያደረግን ነው። ተጨማሪ የደህንነት ፍተሻዎች አንዳንድ ጊዜ ሕጋዊ ሥራዎችን፣ የመከላከያ የሳይበር ደህንነት ሥራን ጨምሮ፣ ሊያዘገዩ፣ ለጊዜው ሊያቆሙ ወይም ሊያስቆሙ ይችላሉ። አንድ ሥራ በ ChatGPT ወይም በ Codex ውስጥ ከቆመ፣ ከመቀጠልዎ በፊት ድርጊቱን እንዲገመግሙ ሊጠየቁ ይችላሉ። በ API ውስጥ ከሆነ ግን ሥራው ይቆማል። እነዚህ ፍተሻዎች አንዳንድ ጊዜ ሕጋዊ ሥራዎችን ሊያቋርጡ ይችላሉ፤ አላስፈላጊ ማቋረጦችን ለመቀነስ በዚህ ስርዓት ላይ ማሻሻያዎችን ማድረጋችንን እንቀጥላለን። የአሰላለፍ መዛባት ክትትል አሰላለፍን ሊተካ አይችልም፤ ግባችን ሞዴሎች በተፈቀደላቸው ወሰን ውስጥ በአስተማማኝ ሁኔታ እንዲቆዩ መገንባት ነው፣ ስለዚህ እነዚህ ጥበቃዎች ጣልቃ መግባት እንዳያስፈልጋቸው።

ተገኝነት

GPT‑6 Astra ዛሬ ለተወሰኑ ድርጅቶች እየተለቀቀ ሲሆን፣ በሚቀጥሉት ቀናት ለሁሉም የChatGPT Plus፣ Pro፣ Business እና Enterprise ተጠቃሚዎች እንዲሁም በOpenAI API፣ Microsoft Azure እና AWS Bedrock በኩል ይገኛል። Astra አጠቃቀም በነባር የደንበኝነት ምዝገባ የአጠቃቀም ገደቦች ውስጥ የተካተተ ሲሆን፣ ተጠቃሚዎችና ድርጅቶች ለተጨማሪ አጠቃቀም ክሬዲቶችን መግዛትም ይችላሉ። የPro፣ Business እና Enterprise ዕቅድ ተጠቃሚዎች GPT‑6 Astra Proንም ማግኘት ይችላሉ። የEnterprise አስተዳዳሪዎች Astraን ለሥራ ቦታቸው ማንቃት ይችላሉ፤ በሚጀመርበት ጊዜ መዳረሻው በነባሪነት ጠፍቷል።

Astra ብቁ ለሆኑ የAPI ደንበኞች ዜሮ ውሂብ ማቆየትን ይደግፋል፤ እንዲሁም ባለፈው ወር እንዳጋራነው፣ የደንበኞችን ግላዊነት እየጠበቅን የደህንነት ክትትልን ለማጠናከር የግል ደህንነት ሂደትን እየሞከርን ነው።

ለገንቢዎች፣ GPT‑6 Astra በOpenAI API ላይ gpt-6-astra በሚለው ስም እና በMicrosoft Azure እና Amazon Bedrock በኩል ይገኛል።

የOpenAI API መደበኛ ዋጋ ለአንድ ሚሊዮን የግቤት ቶከኖች $10 እና ለአንድ ሚሊዮን የውጤት ቶከኖች $50 ነው። ለካሽ የንባብ እና የመጻፍ ክወናዎች የተለያዩ ተመኖች ይተገበራሉ። ፈጣን ሁነታ ለGPT‑6 Astra በAPI ላይ ይገኛል፤ ይህም ከመደበኛው የሂደት ፍጥነት እስከ 2 እጥፍ ፍጥነት በመደበኛው ዋጋ 2 እጥፍ ያቀርባል።

የኮምፒውተር አጠቃቀም

የኮምፒውተር አጠቃቀምGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (የኦገስት ልቀት፣ ከፊል ውጤት)---66.1%70.6%-
OSWorld 2.0 (የነሐሴ ልቀት፣ ከመስመር ውጭ ንዑስ ስብስብ፣ ከፊል ውጤት)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

ሙያዊ

ሙያዊ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore የስትሪንግ ኳርቴቶች (1 - OMR-NED)

0.84

0.19

-

-

-

-

የውስጥ የዲዛይን ተግባራት

50.0%

47.4%

-

35.8%

-

-

የውስጥ የውሂብ ሳይንስ ተግባራት

40.9%

30.5%

-

34.7%

-

-

የሰው ሠራሽ ትንተና አስተውሎት መረጃ ጠቋሚ v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

ኮዲንግ

«ኮዲንግ»፣«GPT‑6 Astra»፣«GPT‑5.6 Sol»፣«Claude Fable 5.1»፣«Claude Fable 5»፣«Claude Opus 5»፣«Gemini 3.8 Flash»
«Terminal-Bench 4.0»፣«57.9%»፣«37.3%»፣«55.8%»፣«44.5%»፣«52.6%»፣«19.1%»
«DeepSWE v1.1»፣«74.1%»፣«72.7%»፣«67.4%»፣«69.9%»፣«73.7%»፣«73.8%»
«FrontierCode 1.1 የተራዘመ (ውጤት)»፣«64.5% 8»፣«60.6%»፣«63.6%»፣«64.9%»፣«63.6%»፣«56.3%»
«FrontierCode 1.1 ዋና (ውጤት)»፣«53.3% 8»፣«47.5%»፣«50.9%»፣«53.5%»፣«53.4%»፣«43.6%»
«የውስጥ የውሂብ ጎታ ፍልሰት ተግባራት»፣«63.9%»፣«42.7%»፣«57.8%»፣«50.3%»፣«-»፣«-»
«የArtificial Analysis የኮዲንግ ወኪል መረጃ ጠቋሚ v1.4»፣«67.0»፣«65.1»፣«-»፣«67.2»፣«68.1»፣«61.2»

አካዳሚክ

አካዳሚክ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath ደረጃ 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

የሰው ዘር የመጨረሻ ፈተና (ከመሣሪያዎች ጋር)

57.2%

-

65.0%

63.8%

63.6%

-

ሳይንስ እና ጤንነት

«ሳይንስ እና ChatGPT Health»፣«GPT‑6 Astra»፣«GPT‑5.6 Sol»፣«Claude Fable 5.1»፣«Claude Fable 5»፣«Claude Opus 5»፣«Gemini 3.8 Flash»
«GeneBench Pro»፣«37.1%»፣«32.3%»፣«-»፣«-»፣«-»፣«-»
«MedChemBench (ውስጣዊ)»፣«49.3%»፣«47.4%»፣«-»፣«-»፣«-»፣«-»
«LifeSciBench»፣«60.3%»፣«59.9%»፣«-»፣«-»፣«-»፣«-»
«HealthBench Professional (በርዝመት የተስተካከለ)»፣«63.4%»፣«60.5%»፣«58.1% 11»፣«60.9% 11»፣«56.4% 11»፣«52.1%»

የሳይበር ደኅንነት

«የሳይበር ደኅንነት»፣«GPT‑6 Astra»፣«GPT‑5.6 Sol»፣«Claude Fable 5.1»፣«Claude Fable 5»፣«Claude Opus 5»፣«Gemini 3.8 Flash»
«ExploitBench»፣«100.0%»፣«78.5%»፣«-»፣«-»፣«70%»፣«-»
«ExploitGym»፣«42.4% 13»፣«30.3% 13»፣«30.4% 17»፣«28.4%17»፣«22.0%»፣«-»
«ExploitBench (እ.ኤ.አ ጁን-ኦገስት 2026)»፣«39.0%»፣«5.5%»፣«-»፣«-»፣«-»፣«-»
«SRE-Bench»፣«88.0%»፣«55.9%»፣«-»፣«-»፣«12.5%»፣«-»
«SEC-Bench Pro»፣«85.4%»፣«79.1%»፣«-»፣«-»፣«-»፣«-»

ማስተካከያ

ማስተካከያ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

የውስጥ የኮምፒውተር አጠቃቀም ደህንነት መመዘኛ (ዝቅተኛ የተሻለ ነው)

2.4%

22.0%

9.5%

18.3%

11.5%

-

የውስጥ የኮምፒውተር አጠቃቀም ደህንነት መመዘኛ፣ ከAutoReview ጋር (ዝቅተኛ የተሻለ ነው)

1.8%

4.3%

-

-

-

-

ውስጣዊ የማለፍ መለኪያ (ዝቅተኛው የተሻለ ነው)

0.00%

0.29%

-

-

-

-

ExploitGym የማጥመጃ ሥርዓት (ዝቅተኛ ይሻላል)

0.0%

48.2%

-

-

-

-

የማይቻል ExploitGym

100.0%

-

-

-

-

-

ውስጣዊ የቅዠት መለኪያ (ዝቅተኛ የተሻለ ነው)

4.2%

12.2%

-

-

-

-

ረጅም አውድ

ረጅም አውድ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8- መርፌ 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8- መርፌ 512K-1M

96.3%

73.8%

-

-

-

-

ረቂቅ የማመዘን ችሎታ

«ረቂቅ ማመዛዘን»፣«GPT‑6 Astra»፣«GPT‑5.6 Sol»፣«Claude Fable 5.1»፣«Claude Fable 5»፣«Claude Opus 5»፣«Gemini 3.8 Flash»
«ARC-AGI-3»፣«99.9% 1»፣«7.8%»፣«-»፣«-»፣«30.2%»፣«-»
«ARC-AGI-2»፣«95.0%»፣«92.5%»፣«90.0%»፣«89.2%»፣«90.4%»፣«-»
«ARC-AGI-1»፣«98.5%»፣«97.5%»፣«97.5%»፣«98.5%»፣«97.5%»፣«-»

የግምገማ ውጤቶች በማንኛውም የጥረት ደረጃ ከፍተኛው ናቸው። የGPT ግምገማዎች በምርምር አካባቢያችን ወይም በAPI በኩል የተካሄዱ ሲሆን፣ ይህም በሲስተም ጥያቄዎች፣ በሚገኙ መሣሪያዎች እና በሌሎች ልዩነቶች ምክንያት በተግባር ላይ ካለው ChatGPT ትንሽ የተለየ ውጤት ሊሰጥ ይችላል።

የግርጌ ማስታወሻዎች

  1. 1

    በARC-AGI-3 ላይ፣ GPT-6 Astra ከ የእኛ የምላሾች API መደበቂያ⁠ ጋር ተከናውኗል፤ ይህም ከእውነተኛው ዓለም አፈጻጸም ጋር በተሻለ እንዲጣጣም ሁለት ቅንብሮችን ይለውጣል። እነዚህ ለውጦች ARC-AGI-3ን በተለይ ዒላማ አያደርጉም።

  2. 2

    GPT-5.6 Sol በእኛ API፣ ChatGPT Codex እና ChatGPT ሥራ ውስጥ የሚገኘውን ስሪት ያመለክታል። በChatGPT ውይይት ውስጥ ያለው ስሪት ትንሽ የተለየ ነው።⁠

  3. 3

    OSWorld V2-Offline ያለ የበይነመረብ መዳረሻ የሚሠራ የመጀመሪያው OSWorld V2 ንዑስ ስብስብ ነው። በOSWorld-V2 Offline ላይ የClaude ሞዴል አፈጻጸም በደራሲዎቹ በ ኦፊሴላዊው የደረጃ ሰንጠረዥ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ላይ ተደግሟል። በOSWorld 2.0 ላይ የClaude ውጤቶች ኦፊሴላዊ ቅንብሮችን የሚጠቀሙ ሲሆን፣ በFable 5.1 የሥርዓት ካርድ ውስጥ ባሉ የተሻሻሉ ተግባሮችና በተሻሻለው ግምገማ አይጠቀሙም።

  4. 4

    የሞዴል ጊዜዎች ለተዛማጅ የማሳያ አሂዶች የተዘገቡ ያለፉ ጊዜዎች ናቸው። የሚታዩት የቪዲዮ ቅንጥቦች ተቀናብረው የተዘጋጁ ናቸው።

  5. 5

    በBenchCAD ላይ፣ የClaude ውጤቶች በ Fable 5.1 የሥርዓት ካርድ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ በዝርዝር የተገለጹ በግምገማው ላይ የተደረጉ 3 ማሻሻያዎችን ያንጸባርቃሉ።

  6. 6
  7. 7

    Mark R. H. Gotham፣ Maureen Redbond፣ Bruno Bower እና Peter Jonas። “OpenScore የስትሪንግ ኳርቴቶች ኮርፐስ⁠(በአዲስ መስኮት ውስጥ ይክፈታል)።” የ10ኛው ዓለም አቀፍ ለሙዚቃ ጥናት ዲጂታል ቤተ መጻሕፍት ጉባኤ ጽሑፎች፣ ገጾች 49–57. ACM፣ 2023።

  8. 8

    በFrontierCode ላይ፣ GPT-6 Astra በCodex ውስጥ ካለው የገንቢ  መልዕክት ክፍል⁠(በአዲስ መስኮት ውስጥ ይክፈታል) ጋር ተመሳሳይ በሆነ የገንቢ መልዕክት ተካሂዷል፦ "ከመጠን ያለፉ የሙከራ ፋይሎችን ከመፍጠር ተቆጠብ። በማከማቻ ልማዶች ሲጠየቅ ወይም ምንም ነባር ፋይል ተስማሚ ቦታ በማይሆንበት ጊዜ ብቻ አዲስ የሙከራ ፋይል ይፍጠሩ። ተዛማጅ ያልሆነ ማጽዳትን እና አስፈላጊ ያልሆነ ውስብስብነትን ያስወግዱ። ተስማሚ የሆኑ ነባር መገልገያዎችን እንደገና ይጠቀሙ። ተዛማጅ የማከማቻ መመሪያዎችን ያንብቡ፣ እና በአቅራቢያ ያሉ ኮዶችን፣ ሙከራዎችን፣ ሰነዶችን እና CIን ይመርምሩ። የተለመዱ አሠራሮችን ይከተሉ። ግቡ ንጹህ፣ ሊዋሃድ የሚችል ኮድ ነው።" እርምጃው ለግምገማው አልተመቻቸም።

  9. 9

    የመጀመሪያው፣ በቁጥር መስመሩ ላይ ምንም ያህል ርቀው ቢሄዱም፣ ዋና ቁጥሮች ምን ያህል ተቀራርበው ሊገኙ እንደሚችሉ ይመለከታል። ከአሥር ዓመት በላይ፣ በጣም የታወቀው ውጤት፣ ልዩነታቸው ከ246 የማይበልጥ በቁጥር የማይወሰኑ የዋና ቁጥሮች ጥንዶች እንዳሉ አረጋግጦ ነበር። Julia Stadlmann⁠(በአዲስ መስኮት ውስጥ ይክፈታል) በቅርቡ ያንን ወሰን ወደ 240 አሻሽላለች። Astra 186 የሆነ ይበልጥ ጠባብ ገደብ ለማረጋገጥ አግዟል፣ ይህም ማለቂያ የሌላቸው ብዙ ጥንዶች በዚህ አነስተኛ ርቀት ውስጥ እንደሚከሰቱ ያሳያል። አጫጭር የዋና ቁጥሮች ክፍተቶች፦ ማረጋገጫ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) እና ደጋፊ ምርምር⁠(በአዲስ መስኮት ውስጥ ይክፈታል)።

  10. 10

    ሁለተኛው በዋና ቁጥሮች መካከል ያሉ ከተለመደው በላይ ትልቅ ክፍተቶችን ይመለከታል። Astra ከ80 ዓመታት በላይ ሳይለወጥ ቆይቶ የነበረውን፣ በእነዚህ ክፍተቶች ላይ በተቀመጠው ገደብ ውስጥ ያለ አንድ አባል አሻሻለ። ለሁለቱም ውጤቶች ማረጋገጫዎቹን፣ የተጠቃለለ የሐሳብ ሰንሰለትን እና የማረጋገጫ ቁሳቁሶችን እያጋራን ነው። ትልቅ የዋና ቁጥሮች ክፍተቶች፦ ማስረጃ⁠(በአዲስ መስኮት ውስጥ ይክፈታል) እና ደጋፊ ምርምር⁠(በአዲስ መስኮት ውስጥ ይክፈታል)።

  11. 11

    ሁሉንም የClaude ሞዴሎች የታሰበውን የHealthBench Professional ሂደት በመከተል፣ GPT‑5.4 በመጠቀም በገለልተኛነት ገምግመናል ደረጃ መስጠትና በርዝመት የተስተካከሉ፣ ያልተገደቡ ውጤቶች። ለFable 5.1፣ በአቅራቢ እምቢታዎች ጊዜ የOpus 5 ተጠባባቂ አማራጭን ተጠቅመናል።

  12. 12

    Claude Fable 5 እና 5.1 በእነዚህ ግምገማዎች ውስጥ አብዛኞቹን ጥያቄዎች ለመመለስ እምቢ ስለሚሉ፣ በLifeSciBench Gold v1፣ GeneBench Pro v13 እና MedChemBench ውስጥ አልተካተቱም።

  13. 13

    በExploitGym ላይ፣ Astra እና Solን ሙሉ የሳይበር ችሎታዎቻቸውን በተሻለ ለመገምገም፣ ያለ የ6 ሰዓት የጊዜ ገደብ ፈተናቸውን አካሄድን። በበቂ ፍጥነት ስለሚሠሩ፣ ይህ እምብዛም ተጽዕኖ አያሳድርም።

  14. 14

    ExploitBench (እ.ኤ.አ ጁን–ኦገስት 2026) 20 ከፍተኛ ክብደት ያላቸው የV8 ተጋላጭነቶችን በ13 የተረጋጉ የChrome ልቀቶች ውስጥ ይዟል። የመለኪያ ሙከራው ወኪሎች እያንዳንዱን የተጠቀሰውን ተጋላጭነት በመጠቀም፣ በV8 እና በLinux ላይ ለሚሠሩ ኦፊሴላዊ የChrome ልቀቶች ውስጥ በዘፈቀደ ኮድ ማስፈጸም መቻላቸውን ይፈትናል። አንዳንድ የተካተቱ ተጋላጭነቶች በግምገማው ገደቦች ስር የዘፈቀደ ኮድ አፈፃፀምን ላይፈቅዱ ይችላሉ፣ ስለዚህ 100% የስኬት መጠን ሊደረስበት ላይችል ይችላል። ማሳሰቢያ፦ የGPT-5.6 Sol 5.5% ውጤት በቤንችማርች ውስጥ የ300-ተርን ገደብ ቅርስ ሲሆን ይህም ከፍተኛውን የሚጠቀሙ እውነተኛ ደንበኞች ሊኖራቸው የሚችለው ገደብ አይደለም። በተመሳሳይ ቅንብሮች ላይ ያለው ሞዴል አነስተኛ ገደቦችን በማሳካት 11.5% ውጤት አስመዝግቧል።

  15. 15
  16. 16

    በሦስተኛ ወገን ሞዴሎች ላይ ስንሞክር፣ ቀላል የምርምር ቅንብር እንጠቀማለን። Codex የበለጠ ውስብስብ የምርት ውቅር አለው፣ ይህም የተለያዩ ጥሬ-ሞዴል የስህተት መጠኖችን ሊያስከትል ይችላል። በአቅራቢው በኩል ያሉ የደህንነት ጥበቃዎች እና የኮምፒውተር-መሣሪያ አተገባበሮች አሁንም ይለያያሉ። የማረጋገጫ የሌለውን ሁኔታ ተጠቃሚዎች በCodex ውስጥ አያጋጥማቸውም፣ ምክንያቱም ይህ ውስጣዊ የምርምር ውቅር ነው።

  17. 17

    ለScreenSpot-Pro እና ExploitGym፣ የምናቀርባቸው የFable ውጤቶች የሚመጡት ከMythos ነው፤ Mythos ደግሞ ከFable ያነሱ የደህንነት ጥበቃዎች ያሉት ሞዴል ነው።