OpenAI

GPT-6 Astra: A new generation of intelligence

አዲስ የአስተውሎት ትውልድ

የዓለማችን እጅግ ብልህ እና የተቀናጀ ሞዴል የሆነውን GPT‑6 Astraን እያስተዋወቅን እንገኛለን።

GPT‑6 Astra በቅድመ-ስልጠና፣ በማጠናከሪያ ትምህርት እና በአሰላለፍ ዘርፎች ለዓመታት የተካሄዱ ምርምሮችን እና ትልቅ የምርምር ውርርዶችን ያጣምራል። Astra በኮምፒውተር አጠቃቀም፣ በድር አሰሳ፣ በሶፍትዌር ምህንድስና፣ በሳይበር ደህንነት፣ በሳይንስ እና በሙያዊ ሥራ ዘርፎች የዘመኑን ምርጥ ደረጃ ይወክላል። Astra በFrontierMath Tier 4 ላይ የ98% ውጤት በማስመዝገብ የመመዘኛውን ጣሪያ ደርሷል፤ ቀድሞውኑም በሒሳብ ውስጥ ለረጅም ጊዜ ያልተፈቱ ክፍት ችግሮችን ለመፍታት አግዟል። Astra በARC-AGI-3 99.9% ውጤት እና በExploitBench 100% ውጤት በማስመዝገብም ከፍተኛውን የአፈጻጸም ደረጃ አሳክቷል። በተጨማሪም በኮምፒውተር እና በአሳሽ አጠቃቀም ላይ አዲስ ግንባር ቀደም የሚከፍት ሲሆን፣ እጅግ ፈታኝ የሆኑ ሙያዊ ሥራዎችን ወደር በሌለው ፍጥነት፣ ትክክለኛነት እና ውሳኔ ሰጪነት ያከናውናል። 

GPT‑6 Astra ዛሬ ለተወሰኑ ድርጅቶች እየተለቀቀ ሲሆን፣ በሚቀጥሉት ቀናት ለሁሉም የChatGPT Plus፣ Pro፣ Business እና Enterprise ተጠቃሚዎች እንዲሁም በOpenAI API፣ Microsoft Azure እና AWS Bedrock በኩል ይገኛል።

“በ ARC-AGI-3 ላይ፣ Astra በ96% ደረጃዎች ላይ የሰው ድርጊት-ብቃት መነሻ መለኪያችንን በማለፍ፣ በመመዘኛው ላይ በተግባር ከሰው ጋር እኩል ደረጃ ደርሷል።” ይህ እስካሁን ከሞከርናቸው ሞዴሎች ሁሉ የተሻለው ሞዴል ብቻ ሳይሆን፣ በግንባር ቀደም ሞዴሎች አፈጻጸም ላይ ጉልህ የደረጃ ለውጥንም ያሳያል—አዳዲስ አካባቢዎችን የመዳሰስና የመፍታት ችሎታው ላይ ብቻ ሳይሆን፣ ያንን ማድረግ በምን ያህል ብቃት እንደሚማርም ጭምር።”
Greg Kamradt፣ የARC Prize ፋውንዴሽን

Astra የተጠቃሚን ፍላጎት በመረዳት እና በሞዴል ባህሪ ላይ ከፍተኛ ማሻሻያዎች የተደረጉበት እጅግ የተቀናጀ (aligned) ሞዴላችን ነው—በ Astra ውሳኔ ሰጪነት ላይ በሚኖርዎት በበለጠ እምነት ሥራዎችን መወከል ይችላሉ። ይህንን ከምንፈትሽባቸው መንገዶች አንዱ እንደመሆኑ፣ በHugging Face ክስተት መረጃ ላይ የተመሠረተ አዲስ የግምገማ ዘዴ የገነባን ሲሆን፣ ይህም አስቸጋሪ ወይም የማይቻል ሥራ የገጠመው ሞዴል ከተመደበለት ወሰን ውጭ ይወጣ እንደሆነ ይገመግማል። የምርት ጥበቃዎች ሳይኖሩት 48% ጊዜ ከተፈቀደው ኢላማ ያለፈው GPT‑5.6 Sol ጋር ሲነጻጸር፣ GPT‑6 Astra ይህን ያደረገው በ0% ጉዳዮች ነው።

በዓለም ላይ ምርጡ የኮምፒውተር አጠቃቀም ሞዴል

GPT‑6 Astra በኮምፒውተር አጠቃቀም ፍጥነት፣ ትክክለኛነት እና ደህንነት ላይ አዲስ ምዕራፍን ያመላክታል። እንደ የኢንተርኔት ፎርሞችን መሙላት፣ በ CRM ውስጥ የደንበኞች መረጃዎችን ማዘመን እና የቀን መቁጠሪያዎን ማደራጀት ያሉ አሰልቺ ሥራዎችን ማከናወን ይችላል። በኢንተርኔት ላይ ምርምር ማድረግ እና በኢሜይልዎ ወይም በሰነድ ማዘጋጃዎ ውስጥ የአጭር መግለጫዎችን ረቂቅ ማዘጋጀት ይችላል። ሳይንሳዊ መረጃዎችን መተንተን፣ ንድፎችን ማዘጋጀት፣ ድህረ ገጽ መፍጠር፣ እና የዚያ ድህረ ገጽ ሁሉም አገልግሎቶች መስራታቸውን ለማረጋገጥ የፊት ለፊት ገጽ የጥራት ማረጋገጫ ፍተሻዎችን ማካሄድ ይችላል። ሶፍትዌሮችን በራሱ መንገድ ለመጫን እና ለመፈተሽ፣ እንዲሁም በማያ ገጽዎ ላይ የሚያዩዋቸውን ችግሮች ለመፍታት ሊረዳዎት ይችላል። እነዚህ ማሻሻያዎች በከፍተኛ ደረጃ ግምገማዎቻችን ውጤቶች ላይም ተንፀባርቀዋል።

እነዚህ መሻሻሎችም በተጨባጭ የእውቀት ሥራ ተግባራት ላይ ጉልህ የቅልጥፍና መሻሻል ያስገኛሉ። በOSWorld 2.0 የመዘግየት ማስመሰያዎች ውስጥ፣ Astra ከ GPT‑5.6 ይልቅ በእያንዳንዱ ተግባር በ47% ገደማ ባነሰ ጊዜ ከፍ ያለ የኮምፒውተር አጠቃቀም አፈጻጸም ያስመዘግባል Sol፣ በአንድ ተግባር በግምት 40 ደቂቃ ወስዶ 72.6% ውጤት አስመዝግቧል፤ ይህም በግምት 75 ደቂቃ ወስዶ 65.7% ውጤት ካስመዘገበው ይበልጣል።3

የGPT‑6 Astra የኮምፒውተር አጠቃቀም ብቃቶች የጨዋታ ልማትን፣ የኤሌክትሪክ ምህንድስናን እና የዕለት ተዕለት የዕውቀት ሥራን ጨምሮ በተለያዩ ዘርፎች በሚገኙ ውጤቶች ውስጥ ሊታዩ ይችላሉ፦

ከAstra ጎን ለጎን፣ የኮምፒውተር አጠቃቀምን ፍጥነት በከፍተኛ ሁኔታ ለማሻሻል የCodex መደበቂያንም እያዘመንን ነው። ይህ ከAstra ቅልጥፍና ጋር ሲጣመር፣ በMind2Web መመዘኛ ላይ ካለው የአሁኑ GPT‑5.6 Sol ተሞክሮ ጋር ሲነጻጸር 1.9 እጥፍ ፈጣን የተግባር ማጠናቀቅን ያስገኛል። የሞዴሉ የፍጥነት ማሻሻያዎች እርስዎ ከሚያከናውኗቸው በፍጥነት ብዙ ጊዜ የሚወስዱ የዕለት ተዕለት ተግባራትን እንዲያከናውን ያስችሉታል።

“GPT‑6 Astra በሚጀመርበት ቀን ወደ Devin መደበቂያ እያዋሃድነው ሲሆን፣ በዚያም በውስጣዊ የሙከራ መለኪያችን ላይ የዘመኑን የላቀ አፈጻጸም ያስመዘግባል። ኮምፒውተርን የመጠቀም እጅግ ጥሩ ችሎታው፣ የጽሑፍ አጻጻፉ እና የኮድቤዝ ግንዛቤው ሙከራን ከመጀመሪያው ጀምሮ አሻሽሎታል፦ ቪዲዮዎችን መከታተል በግልጽ ሁኔታ ቀላል ሆኗል፣ እና ሪፖርቶች ይበልጥ ግልጽና አጭር ሆነዋል”
ሲላስ አልበርቲ፣ ከፍተኛ ምክትል ፕሬዚዳንት ለምርምር፣ እውቀት

በሙያዊ ሥራ ላይ ከፍተኛ ለውጥ

GPT‑6 Astra በኮምፒውተር አጠቃቀም ላይ የተደረጉ እድገቶችን ለሙያዊ አካባቢዎች ከተሰጠ ዓላማ ተኮር ስልጠና ጋር በማጣመር፣ ውስብስብ የሥራ ተግባራትን ለመወጣት ይረዳል። ለውስብስብ ችግሮች የሚያስፈልገውን አስተውሎት በባለብዙ ደረጃ የሥራ ሂደቶችን የማከናወን፣ እንዲሁም በጥራት የተዘጋጁ ሰነዶችን፣ የተመን ሉሆችን እና አቀራረቦችን የማዘጋጀት ችሎታ ጋር ያጣምራል።

GPT‑6 Astra ነባር አብነቶችን በመከተል፣ በጥሩ ሁኔታ የተቀናጁ እና ዋና ዋና ነጥቦችን በተዋቀረ ትረካ በአጭሩ የሚያስተላልፉ የስላይድ ገጾችን በመፍጠር ረገድ ምርጡ ሞዴላችን ነው። የእርስዎን አብነቶች የሚከተሉ፣ እንዲሁም ከጽሑፍ እና የእይታ ዘይቤዎ ጋር የሚጣጣሙ ግልጽና በጥሩ ሁኔታ የተዋቀሩ ሰነዶችን፣ ገለጻዎችን ፣ የተመን ሉሆችን እና ትንተናዎችን ይፈጥራል። በተጨማሪም Astra ለእጁ ላይ ላለው ሥራ አስፈላጊ ያልሆኑ መረጃዎችን ከመድገም ይልቅ፣ አስፈላጊ የሆነውን አውድ ብቻ ለይቶ ወደ ውጤቱ እንዲያመጣ ተደርጎ የሠለጠነ ነው። ይህ ሁሉ የሚያሳየው ከንግድዎ አውድ እና መመዘኛዎች ጋር የሚጣጣሙ፣ ወዲያውኑ ለጥቅም የሚውሉ ውጤቶችን ማዘጋጀት እንደሚችል ነው።

GPT‑6 Astra ለሚገነባቸው ድር ጣቢያዎች፣ ጨዋታዎች፣ መተግበሪያዎች እና ምስላዊ ቅርጾች የበለጠ ጠንካራ የዕይታ ውሳኔ ሰጪነትን ይዞ ይመጣል። በChatGPT ውስጥ ባሉት ጣቢያዎች(በአዲስ መስኮት ውስጥ ይክፈታል) ፣ Astra ድር ጣቢያዎችን፣ የድር መተግበሪያዎችን እና ጨዋታዎችን ከእርምጃ በቀጥታ መፍጠር፣ ማስተናገድ እና ማጋራት ይችላል።

“Astra በአቅምና በቅልጥፍና በሁለቱም ረገድ ከፍተኛ ብልጫ ይሰጠናል። የሞከርናቸው ሌሎች ሞዴሎች ከሚጠቀሙት እስከ 20% ያነሱ tokenን እየተጠቀመ፣ እጅግ ውስብስብ የፈጠራ የሥራ ፍሰቶቻችንን በተሳካ ሁኔታ ያከናውናል። ከሁሉም በላይ፣ ለደንበኞቻችን ይህ ከፍተኛ ጥራት ያለው ውጤት ማለት ነው።”
Alex Mashrabov፣ ዋና ሥራ አስፈፃሚ እና ተባባሪ መሥራች፣ Higgsfield AI

መመሪያዎች ለትርጓሜ ቦታ ሲተዉ፣ GPT‑6 Astra ከቀድሞ ሞዴሎች ይልቅ ትክክለኛውን ውሳኔ በማድረግ የተሻለ ነው። መደበኛ ክፍተቶችን ለመሙላት ዐውድን ይጠቀማል፣ እና መልሱ ውጤቱን ሊቀይር በሚችልበት ጊዜ ትኩረት ያላቸው ጥያቄዎችን ይጠይቃል። በCodex ውስጥ፣ በምላሽዎ ላይ የማይመረኮዘውን ሥራ እያስቀጠለ በተመሳሳይ ጊዜ ሳይሆን ጥያቄ ሊያቀርብ ይችላል። ካልመለሱ፣ ተገቢ በሆነበት ጊዜ ምክንያታዊ ግምቶችን በመውሰድ ይቀጥላል፣ ነገር ግን በትልቅ ተጽዕኖ ያላቸው ውሳኔዎች ላይ የእርስዎን ግብዓት ይጠብቃል።

ከዚህ በታች ያሉት ምሳሌዎች፣ የጎደለ መረጃ መልሱን በከፍተኛ ሁኔታ ሊቀይር በሚችልባቸው የዕለት ተዕለት ተግባራት ላይ Astra እንዴት እንደሚተባበር ያሳያሉ።

Astra ተግባሩ እየተለዋወጠ በሚሄድበት ጊዜ አቅጣጫውን ጠብቆ በመቆየት ረገድም የተሻለ ነው። ቀደም ያሉ ሞዴሎች አንዳንድ ጊዜ የመመሪያ መልዕክቶችን እንደ አዲስ ግብ በመውሰድ፣ ዋናውን ጥያቄ ወይም ቀደም ያሉትን ገደቦች ይዘነጉ ነበር። Astra ሰፊውን ሥራ ሳይተው፣ አዳዲስ መስፈርቶችን ያካትታል፣ ሲጠየቅ አቅጣጫውን ይቀይራል፣ እና ተጓዳኝ ጥያቄዎችን ይመልሳል።

“Astra በውስብስብ የሕግ ተግባራት ላይ ከ GPT‑5.6 Sol ጋር ሲነጻጸር ከፍተኛ የጥራት መሻሻል ያሳያል። በመጀመሪያዎቹ ሙከራዎቻችን ውስጥ፣ አስትራ የሕግ ሥራን አስተዋይ ጠበቃ እንደሚቀርበው በመቅረቡ ጎልቶ ታየ፦ ሰነዶችን ከተረጋገጡ መዝገቦች ይለያል፣ በማስረጃ ያልተደገፉ ግምቶችን ወደ ፊት ያወጣል፣ እንዲሁም ክፍተቶችን ወደ ተጨባጭ የሰነድ ማርቀቅ አቋሞች ይቀይራል።”
Niko Grupen፣ የተግባራዊ ምርምር ኃላፊ፣ Harvey

ኮዲንግ

GPT‑6 Astra እስካሁን ለሶፍትዌር ምህንድስና ምርጡ ሞዴል ነው።

1 ከ 2
“GPT‑6 Astra በውስጣዊ የኮዲንግ መለኪያዎቻችን ላይ ዘመናዊ ከፍተኛ ደረጃ አፈጻጸም ያሳያል፤ እንዲሁም ከGPT‑5.6 Sol ጋር ሲነጻጸር በየንግድ ስሜት ግምገማዎች ላይ ግልጽ መሻሻል እንዳለው ያሳያል። ለወኪል-ተኮር ኮዲንግ ሲውል፣ GPT‑6 Astra ለገንቢዎች ለመከተል ቀላል በሆነ መንገድ ይግባባል፤ እንዲሁም ወደ ምርት ደረጃ ጥራት ለመድረስ ያነሱ የማሻሻያ ዙሮች የሚያስፈልጉትን ኮድ ያመነጫል።”
John Crepezzi፣ የሰው ሠራሽ አስተውሎት (AI) ረዳቶች፣ Jane Street

ከAstra ጋር፣ የዐውድ መስኮቱ ሲሞላ Codex ዐውዱን ጠብቆ የሚያቆይበትን እና መልሶ የሚያገኝበትን አዲስ መንገድ እያስተዋወቅን እንገኛለን። ከዚህ ቀደም፣ ሞዴሎች እንደ ውስብስብ ችግሮችን መፍታት ወይም ትላልቅ የኮድ ማሻሻያዎችን ማከናወን ባሉ ረጅም የሥራ ሂደቶች ወቅት ሥራውን ለማጠቃለል ኮምፓክሽንን ይጠቀሙ ነበር። እያንዳንዱ ኮምፓክሽን የሆነ መፍትሔ ለምን እንዳልሠራ ወይም አንድ የኮድ ክፍል እንዴት እንደሚሠራ የሚገልጹ ዝርዝሮችን ትቶ ሊያልፍ ይችላል። በCodex ውስጥ፣ Astra የተከማቹ ዝርዝሮችን ደጋግሞ ወደ አንድ ማጠቃለያ ሳያመቀው፣ በይዘት መስኮቶች መካከል ማስታወሻዎችን ጠብቆ ማቆየት ይችላል። ቀደሙት የይዘት መስኮቶች ተፈልገው የሚገኙ ሆነው ስለሚቆዩ፣ መረጃው በማስታወሻዎቹ ውስጥ ባይያዝ እንኳ Astra ከቀደሙት መልእክቶች እና የመሣሪያ ውጤቶች መስፈርቶችን ወይም የፈተና ውጤቶችን ማግኘት ይችላል። ይህንን የሙከራ ባህሪ በእርስዎ Codex config.toml(በአዲስ መስኮት ውስጥ ይክፈታል) ፋይል ውስጥ ማንቃት ይችላሉ እና በሚመጡት ሳምንታት ለAstra ነባሪው ይሆናል።

ሳይንሳዊ ግኝትን ማራመድ

“ታሪኩ ይህ ነው፦ የአንድ ዘመን መጨረሻ፣ የሌላ ዘመን መጀመሪያ።”
ግሬግ በርንሃም፣ EpochAI

GPT‑6 Astra ለሳይንሳዊ ግኝት፣ ለሒሳብ እና ለጤና ትልቅ እመርታ ነው። ዛሬ፣ በዋና ቁጥሮች መካከል ስላሉ ክፍተቶች ሁለት ተጨማሪ ውጤቶችን እያጋራን ነው [WITH LINK]። Astra እንዲሁም በሳይንስ ግምገማዎች ስብስብ ላይ አዳዲስ ሪከርዶችን ያስመዘግባል፦

Astra ከሳይንሳዊ ግኝት በስተጀርባ ባለው ተግባራዊ ሥራ ላይ ሊያግዝ ይችላል። ሳይንሳዊ ማመዛዘንን ከኮምፒውተር አጠቃቀም ጋር በማጣመር፣ ውሂብን ለመመርመር እና ውጤቶችን ለማሰስ በልዩ ሶፍትዌር ውስጥ በቀጥታ መሥራት ይችላል፤ ይህም ተመራማሪዎች ማስረጃውን እንዲገመግሙ እና ቀጥሎ ምን እንደሚመረምሩ እንዲወስኑ ያግዛል።

የሳይበር ደኅንነት

Astra በሳይበር ደህንነት አቅሞች ላይ ትልቅ ደረጃ የተሻገረ ማሻሻያ ነው። ያልታወቁ የደህንነት ክፍተቶችን የመለየት እና የማልማት አቅሙ ተከላካዮች ድክመቶችን እንዲያስተካክሉ ሊረዳቸው ይችላል፤ ነገር ግን ጠንካራ የደህንነት ጥበቃዎች እንዲኖሩ አስፈላጊነትንም ይፈጥራል። እነዚህ አቅሞች ምን ያህል እንደሚራመዱ ለመረዳት፣ የውስጥ እና የሦስተኛ ወገን ባለሙያዎች ግምገማዎችን ተጠቅመናል።

በመጀመሪያ Astraን ሞዴሎች ተጋላጭ በሆኑ የኮድ መሠረቶች ውስጥ የፈለጉትን ኮድ ማስኬድ ማከናወን መቻላቸውን በሚለኩት ExploitBench እና ExploitGym ላይ ፈትነነዋል።

ቀደም ሲል ለተመዘገቡ የሶፍትዌር ተጋላጭነቶች መጋለጥ የመመዘኛ ውጤቶችን ሊነካ ይችላል የሚሉ ሊኖሩ የሚችሉ ስጋቶችን ከግምት በማስገባት፣ Astraን በሁለት አዳዲስ መመዘኛዎች ላይም ገምግመናል። እንደ አንድ ምሳሌ፣ ባለፉት ሦስት ወራት ውስጥ የተገኙ ተጋላጭነቶችን በመጠቀም የኤክስፕሎይት ልማትን ለመፈተሽ የውስጥ “ExploitBench (June–August 2026)” ግምገማ አዘጋጀን። 2 Astra በዚህ የውሂብ ስብስብ፣ ከGPT‑5.6 Sol እጅግ ያነሱ የውጤት ቶክኖችን በመጠቀም በዘፈቀደ ኮድ የማስፈጸም መጠኑ እጅግ ከፍ ያለ ነው። በግምገማው ወቅት፣ Astra ከዚህ በፊት ያልታወቁ ሁለት የChrome V8 heap-sandbox ማምለጫ ቴክኒኮችን አግኝቶ ተጠቅሟል። ሁለቱንም ተጋላጭነቶች ለጠባቂዎቻቸው እያሳወቅን ነው።

በተጨማሪም የbinary ሶፍትዌሮችን መሠረታዊ አመክንዮ ለመረዳት ሞዴሎች የኋሊዮሽ ኢንጂነሪንግ ማካሄድ መቻላቸውን በሚለካው SRE-Bench የተሰኘ መለኪያ ላይ Astraን ፈትነነዋል። የመለኪያው አዘጋጆች ሶፍትዌሩን ከባዶ የገነቡት ሲሆን ምንጭ ኮዱንም ምስጢራዊ አድርገው ጠብቀውታል። Astra በካደገው የመጀመሪያ ሙከራ 88.0%፣ በአራት ሙከራዎች ውስጥ ደግሞ 99.2% የሚሆኑትን ሥራዎች የፈታ ሲሆን፤ ይህም ለ GPT‑5.6 Sol በቅደም ተከተል ከነበረው 55.9% እና 68.7% ጋር ሲነፃፀር የበላይ ነው።

ከመለኪያ ፈተናዎች ባሻገር፣ በባለሙያዎች የተመሩ ግምገማዎች እንደሚያሳዩት Astra ከዚህ ቀደም ያልታወቁ የደህንነት ክፍተቶችን በመጠቀም በተጠበቁ ብሮውዘሮች ላይ የፈለገውን ኮድ ማስኬድ እና በተጠበቁ ኦፐሬቲንግ ሲስተሞች ላይ የመብት ማሳደጊያ ነጥቦችን መፍጠር ችሏል። በአጠቃላይ እነዚህ ውጤቶች Astra የዝግጁነት ማዕቀፋችን መሠረት በሳይበር ደህንነት ዘ his Critical የተሰኘው ወሳኝ ደረጃ ላይ መድረሱን ውሳኔ እንድንሰጥ አግዘውናል።

The Defender’s Window ላይ እንደተወያየነው፣ ግንባር ቀደም የሳይበር ችሎታዎች ተከላካዮች ድክመቶችን በፍጥነት እንዲያገኙ ሊያግዟቸው ይችላሉ፣ ነገር ግን እነዚያን ድክመቶች ለመበዝበዝ ቀላል ስለሚያደርጉ፣ ተከላካዮች እንዲላመዱ ያለውን አጣዳፊነት ያሳድጋሉ።

ዛሬ ለሚለቀቀው የAstra ስሪት፣ እንደ ደኅንነቱ የተጠበቀ ኮድ ግምገማ፣ ፓች ማድረግ እና የስጋት ሞዴሊንግ ያሉ አስፈላጊ የመከላከያ ተግባራትን እንደግፋለን። ሆኖም፣ በነባሪነት Astra እንደ የመበዝበዣ ዘዴዎችን ማግኘት ያሉ የላቁ የሳይበር ደኅንነት ተግባራትን ለመፈጸም እምቢ ይላል። በOpenAI Daybreak በኩል፣ በ OpenAI Daybreak ፕሮግራም ውስጥ ላሉ በአልፋ ደረጃ ለተመረጡ የታመኑ የሳይበር ደኅንነት ተከላካዮች ያነሰ ገደብ ያለው መዳረሻ በመልቀቅ ላይ ነን። ይህ የደህንነት ክፍተቶችን መለየት እና ማረጋገጥ ፣ የተንኮል አዘል ሶፍትዌሮች ትንተና፣ የመለየሪያ ኢንጂነሪንግ እና የማስተካከያ ማረጋገጥን ጨምሮ የመከላከያ ስራዎችን ተራሽነት ያሰፋል። በDaybreak Blue በኩል ተደራሽነትን የበለጠ ለማስፋት እቅድ አለን።

በተጨማሪም ለ GPT‑5.6 Sol በገነባነው የደህንነት ጥበቃ ላይ በመመስረት፣ ሊከሰቱ የሚችሉ የሳይበር አላግባብ መጠቀሞችን የመከላከያ አቅማችንን አጠናክረናል። እነዚህም ሊከሰቱ የሚችሉ የደህንነት ጥሰቶችን በተሻለ ሁኔታ ለመቋቋም የሚያስችል ጠንካራ የሞዴል ጥንካሬ ስልጠናን እና ለክትትል ስርአቶቻችን የተሻለ አውድን ያካትታሉ። የውስጥ የሳይበር ጥቃት አድራጊ ቡድኖቻችንን በመጠቀም የሚደረጉ አውቶሜትድ ፈተናዎችን ጨምሮ ጥብቅ የሆኑ የውስጥ እና የውጭ ፈተናዎችን ማካሄዳችንን ቀጥለናል። ስለ ሳይበር መከላከያዎቻችን እና ሙከራዎቻችን ተጨማሪ ዝርዝሮች በAstra የሥርዓት ካርድ እና በእኛ ብሎግ ላይ ይገኛሉ።

GPT‑6 Astraን በኃላፊነት ማስማማት እና ማሰማራት

Astra እጅግ የተጣጣመ ሞዴላችን ነው። Astra ጥንቃቄ በማድረግ፣ የተግባር ወሰኖችን በማክበር፣ እና በግልጽነት በመግባባት የላቀ ነው። ይህ ሥራ ሞዴሎች ከመጀመሪያ እስከመጨረሻ ከሰው ልጅ ዓላማ ጋር ተስማምተው እንዲቆዩ በማሠልጠን ላይ ያተኮረው የረጅም ጊዜ የምርምር መርሐግብራችን የቅርብ ጊዜ ውጤት ነው።

በስሱ አካባቢዎች፣ Astra ከአደጋው መጠን ጋር በሚመጣጠን ጥንቃቄ ይሠራል። ያልተገባ ባህሪን ለማነሳሳት በፈታኝ መንገድ የተመረጡ የኮምፒውተር አጠቃቀም ተግባራት ግምገማ ውስጥ፣ Astra ያልታሰቡ ውጤቶችን ከማስወገድ አንጻር የበለጠ ስኬታማ ነበር። በነባሪነት የሚቀርቡ ተጨማሪ የደህንነት እርምጃዎችን አብሮ በማስኬድ፣ የበለጠ ጠንካራ አፈጻጸም አስገኝቷል።

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(በአዲስ መስኮት ውስጥ ይክፈታል) and Anthropic Messages API(በአዲስ መስኮት ውስጥ ይክፈታል)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astraም በተጠቃሚው የተቀመጡትና በሥራ አካባቢው በተዘዋዋሪ የሚጠቆሙት ወሰኖች ውስጥ የመሥራት ዕድሉ የበለጠ ነው። በውስጣዊ ግምገማ ውስጥ፣ Astra የCodex ራስ-ሰር ግምገማ እምቢታን ለማለፍ ፈጽሞ አልሞከረም። ይህ እውነት ሆኖ ቀጠለ፣ Auto-review ሆን ተብሎ ሊዘለል እንዲችል ተዋቅሮ እና ከዚያ ውጭ ሥራውን ማጠናቀቅ የማይቻል ቢሆንም እንኳ። ለአካባቢው ገደቦች የሚሰጠው ይህ ክብር በዚህ ጽሑፍ መግቢያ ላይ ያጋራነው የማይቻል የሳይበር ተግባር ግምገማ ውጤቶች እና በ የሥርዓት ካርድ(በአዲስ መስኮት ውስጥ ይክፈታል) ውስጥ ከተመዘገቡ ሌሎች ግኝቶች ጋር ይጣጣማል።

አስትራ በተጨማሪም ጉልህ በአታላይ ባህሪ ላይ ቅነሳዎችንያሳያል።ሥራ ውክልና የሚሰጡ ሰዎች ስለ ሞዴል አቅሞች ግልጽ ግንዛቤ እና ስለ እድገቱ ታማኝ ሪፖርት ያስፈልጋቸዋል። ይህ የሐቀኝነትን አንድ ገጽታ ይለካል፤ ሆን ተብሎ የሚደረግ ማታለልን መቀነስ ግን በአሰላለፍ ሥራችን ውስጥ ሰፊ ትኩረት ሆኖ ይቀጥላል።

በችሎታ-ቅዠት ግምገማችን ውስጥ፣ Astra ስለችሎታዎቹ የሚያሳስቱ አባባሎችን በመቀነስ፣ ከ GPT‑5.6 Sol ጋር ሲነጻጸር ከፍተኛ መሻሻል ያሳያል።

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(በአዲስ መስኮት ውስጥ ይክፈታል) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(በአዲስ መስኮት ውስጥ ይክፈታል) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

ተገኝነት

GPT‑6 Astra ዛሬ ለድርጅቶች እና በእኛ Trusted Access Program ውስጥ ላሉ ደንበኞች እየተለቀቀ ሲሆን፣ ለChatGPT Plus፣ Pro፣ Business እና Enterprise የደንበኝነት ምዝገባ ላላቸው ሰዎች በሚቀጥሉት ጥቂት ቀናት ውስጥ በሰፊው ይገኛል። Astra አጠቃቀም በ$100 እና $200 የPro ዕቅዶች እንዲሁም በ$100 የBusiness ዕቅድ ውስጥ ባለው ነባር የአጠቃቀም ገደብ ውስጥ የተካተተ ሲሆን፣ ምንም ተጨማሪ የተመን ገደቦች ወይም እገዳዎች የሉም። የ$20 Plus የደንበኝነት ምዝገባ ያላቸው ሰዎች እና በመደበኛው የBusiness ዕቅድ ላይ ያሉ ደንበኞች፣ ለተጨማሪ መዳረሻ ክሬዲቶችን የመግዛት አማራጭ ጋር GPT‑6 Astraን በዝቅተኛ ገደቦች መጠቀም ይችላሉ። የEnterprise አስተዳዳሪዎች Astraን ለሥራ ቦታቸው ማንቃት ይችላሉ፤ በሚጀመርበት ጊዜ መዳረሻው በነባሪነት ጠፍቷል።

የPro Lite፣ Pro፣ Business እና Enterprise ተጠቃሚዎች GPT‑6 Astraን በውይይት ውስጥ መጠቀምም ይችላሉ። Astra ብቁ ለሆኑ የAPI ደንበኞች ዜሮ ውሂብ ማቆየትን ይደግፋል፤ እንዲሁም ባለፈው ወር እንዳጋራነው፣ የደንበኞችን ግላዊነት እየጠበቅን የደኅንነት ክትትልን ለማጠናከር የግላዊ ደኅንነት ሂደትን እየሞከርን ነው።

ለገንቢዎች፣ GPT‑6 Astra በOpenAI API ውስጥ gpt-6-astra በመባል ይገኛል፣ እንዲሁም በAWS Bedrock ውስጥ ይገኛል። የOpenAI API መደበኛ ዋጋ ለአንድ ሚሊዮን የግቤት tokenዎች $10 እና ለአንድ ሚሊዮን የውጤት tokenዎች $50 ነው። ለካሽ የንባብ እና የመጻፍ ክወናዎች የተለያዩ ተመኖች ይተገበራሉ። ፈጣን ሁነታ ለGPT‑6 Astra በAPI ውስጥ የሚገኝ ሲሆን፣ በመደበኛው ዋጋ 2x ሲሆን፣ እስከ 2.5x የመደበኛ ሂደት ፍጥነትን ያቀርባል።

የኮምፒውተር አጠቃቀም

የኮምፒውተር አጠቃቀምGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (የኦገስት ልቀት፣ ከፊል ውጤት)---66.1%70.6%-
OSWorld 2.0 (የነሐሴ ልቀት፣ ከመስመር ውጭ ንዑስ ስብስብ፣ ከፊል ውጤት)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

አካዳሚክ

አካዳሚክ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath ደረጃ 4 (v2)

97.6%

83.0%

87.8%

87.8%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

የሰው ዘር የመጨረሻ ፈተና (ከመሣሪያዎች ጋር)

57.2%

-

65.0%

63.8%

63.6%

-

ሳይንስ እና ጤንነት

ሳይንስ እና ጤንነትGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (ውስጣዊ)49.7%47.4%----
LifeSci Bench60.8%59.9%----
HealthBench ባለሙያ (በርዝመት የተስተካከለ)63.4%60.5%62.1%60.9%59.8%48.7%

የሳይበር ደኅንነት

የሳይበር ደኅንነትGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
CVE-Bench-94.1%----
የብንዲራዎቹን ይያዙ ተግዳሮቶች-96.7%----
SEC-Bench Pro85.4%79.1%----
CyberGym-84.5%----
ExploitBench100.0%78.5%--70.0%-
ExploitGym (2 ሰዓት)-33.7%?--171-
ExploitGym (6 ሰዓት)-33.7%?--191-

ማስተካከያ

ማስተካከያ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

የውስጥ የኮምፒውተር አጠቃቀም ደህንነት መመዘኛ (ዝቅተኛ የተሻለ ነው)

2.4%

22.0%

9.5%

18.3%

11.5%

-

የውስጥ የኮምፒውተር አጠቃቀም ደህንነት መመዘኛ፣ ከAutoReview ጋር (ዝቅተኛ የተሻለ ነው)

1.8%

4.3%

-

-

-

-

ውስጣዊ የማለፍ መለኪያ (ዝቅተኛው የተሻለ ነው)

0.00%

0.29%

-

-

-

-

ExploitGym የማጥመጃ ሥርዓት (ዝቅተኛ ይሻላል)

0.0%

48.2%

-

-

-

-

የማይቻል ExploitGym

100.0%

-

-

-

-

-

ውስጣዊ የቅዠት መለኪያ (ዝቅተኛ የተሻለ ነው)

4.2%

12.2%

-

-

-

-

ረጅም አውድ

ረጅም አውድ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8- መርፌ 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8- መርፌ 512K-1M

96.3%

73.8%

-

-

-

-

ረቂቅ የማመዘን ችሎታ

ረቂቅ የማመዘን ችሎታGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
ARC-AGI-399.9%7.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%84.6%
ARC-AGI-1fi98.5%97.5%97.5%98.5%97.5%95.5%

የግምገማ ውጤቶች በማንኛውም የጥረት ደረጃ ከፍተኛው ናቸው። የGPT ግምገማዎች በምርምር አካባቢያችን ወይም በAPI በኩል የተካሄዱ ሲሆን፣ ይህም በሲስተም ጥያቄዎች፣ በሚገኙ መሣሪያዎች እና በሌሎች ልዩነቶች ምክንያት በተግባር ላይ ካለው ChatGPT ትንሽ የተለየ ውጤት ሊሰጥ ይችላል።

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(በአዲስ መስኮት ውስጥ ይክፈታል). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(በአዲስ መስኮት ውስጥ ይክፈታል).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(በአዲስ መስኮት ውስጥ ይክፈታል).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(በአዲስ መስኮት ውስጥ ይክፈታል).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(በአዲስ መስኮት ውስጥ ይክፈታል): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(በአዲስ መስኮት ውስጥ ይክፈታል) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(በአዲስ መስኮት ውስጥ ይክፈታል) and supporting research(በአዲስ መስኮት ውስጥ ይክፈታል).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(በአዲስ መስኮት ውስጥ ይክፈታል) and supporting research(በአዲስ መስኮት ውስጥ ይክፈታል).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.