ወደ ዋና ይዘት እለፍ
OpenAI

29 ጁላይ 2026

ምርምርሕትመት

ሁለት ቅንብሮችን ማንቃት የARC-AGI-3 ውጤታችንን እንዴት በሦስት እጥፍ እንዳሳደገው

በመጫን ላይ…

GPT‑5.6 Sol በARC-AGI-3 መለኪያ ውስጥ ያሉ እንቆቅልሾችን፣ በይፋዊው መደበቂያ (ግራ) እና ማመዛዘንን በሚያቆይና ኮምፓክሽንን በሚያነቃው የResponses ኤፒአይ መደበቂያችን (ቀኝ) ለመፍታት ሲሞክር የሚያሳይ የተፋጠነ ቪዲዮ። በዚህ ጨዋታ(በአዲስ መስኮት ውስጥ ይክፈታል) የውጤት ሰሌዳ ላይ፣ ከመጀመሪያው በኋላ ያለውን ምንም ደረጃ የሚፈታ ግንባር ቀደም ሞዴል የለም። በእኛ መደበቂያ GPT‑5.6 Sol ስድስቱንም ይፈታል።

GPT‑5.6 Sol በARC-AGI-3(በአዲስ መስኮት ውስጥ ይክፈታል) መለኪያ ያስመዘገበውን ዝቅተኛ ውጤት መጀመሪያ ስናይ ግራ ገባን።

GPT‑5.6 Sol እንደ የዑደት ድርብ ሽፋን ግምት(በአዲስ መስኮት ውስጥ ይክፈታል) ያሉ ለረጅም ጊዜ ሳይፈቱ የቆዩ የሒሳብ ችግሮችን ፈትቷል፤ እንደ Pokémon FireRed ያሉ ጨዋታዎችንም አሸንፏል። ነገር ግን፣ የ2D እንቆቅልሽ ጨዋታዎች መለኪያ በሆነው ARC-AGI-3፣ GPT‑5.6 Sol 7.8% ብቻ ሲያስመዘግብ፣ GPT‑5.5 ደግሞ ጨዋታዎቹን መጫወት እንኳ ከብዶት 0.4% ብቻ አስመዘገበ።

የ2D እንቆቅልሽ ጨዋታዎች ለሞዴሎቻችን ከተለመደው በላይ ከባድ ነበሩ? ወይስ ሌላ ነገር ነበር?

መለኪያዎች የAI ሞዴሎችን ብቻቸውን የሚለኩት አልፎ አልፎ ነው። ስለ ኤፒአይ ቅንብሮች፣ መደበቂያ ንድፍና ጥያቄ አቀራረብ የሚደረጉ ብዙም የማይታዩ ምርጫዎችንም ይለካሉ። በARC-AGI-3 ጉዳይ፣ በChatGPT እና Codex የምንጠቀምባቸውን ሁለት የኤፒአይ ቅንብሮች—ማመዛዘንን ማቆየትና ኮምፓክሽንን—ማብራት በይፋዊው የተግባር ስብስብ ላይ ውጤቱን በሦስት እጥፍ እንዳሳደገና የውጤት ቶከኖችን በ6 እጥፍ እንደቀነሰ ደርሰንበታል።

በይፋዊው መደበቂያ፣ GPT‑5.6 Sol በARC-AGI-3 ይፋዊ ስብስብ 13.3% አስመዝግቧል። ማመዛዘንን በማቆየትና ኮምፓክሽንን በመጠቀም 38.3% አስመዝግቧል። ውጤቶቹ አንጻራዊ የሰው ድርጊት ብቃትን (RHAE(በአዲስ መስኮት ውስጥ ይክፈታል))የሞዴሉን አፈጻጸም ከሰው መነሻ አፈጻጸም ጋር የሚያነጻጽር መለኪያይለካሉ። በይፋዊ የጨዋታ መዝገቦች(በአዲስ መስኮት ውስጥ ይክፈታል) መሠረት፣ አማካይ ሰው ፈታኝ 48% እንዳስመዘገበ እንገምታለን። ሞዴሎቹ ውጤታቸው እንዴት እንደሚሰላ አይነገራቸውም፤ በሂደቱም ውጤታቸውን ማየት አይችሉምድርጊቶቹ የሚመልሱት የእያንዳንዱን ፍሬም ጽሑፋዊ መግለጫና ያሉበትን ደረጃ ብቻ ነው።

ARC-AGI-3

ARC-AGI-3 የሰው ሠራሽ አስተውሎት (AI) ወኪሎች የመማርና የማመዛዘን ብቃትን ለመለካት የተነደፈ መለኪያ ነው። ወኪሎቹ ያልተለመዱ የ2D ጨዋታዎችን በማሰስ፣ ግልጽ መመሪያ ሳይሰጣቸው አሠራራቸውን ይገነዘባሉ። በarcprize.org/tasks(በአዲስ መስኮት ውስጥ ይክፈታል) 25 የሙከራ ጨዋታዎችን መጫወት ይችላሉ።

ARC-AGI-3 መሣሪያዎች ወይም ልዩ ባህሪያት የሌሉትን፣ ሆን ተብሎ አጠቃላይ የተደረገ መደበቂያ ይጠቀማል። የARC ማመዛዘን፣ ቀላል መደበቂያ የሞዴሉን ድክመቶች ይበልጥ ግልጽ እንደሚያደርግና የሞዴሎችን ንጽጽር ይበልጥ ፍትሐዊ እንደሚያደርግ ነበር። በአንጻሩ፣ የንግድ ገንቢዎች መደበቂያዎችን ለእያንዳንዱ ሞዴል ባህሪያትና ልዩ ባሕርያት ያመቻቻሉ።

በጨዋታዎች ረገድ፣ GPT‑5.6 Sol በምስል ብቻ በሚጠቀም መደበቂያ Pokémon FireRedን (GPT_Plays_Pokemon(በአዲስ መስኮት ውስጥ ይክፈታል) በቀጥታ እንዳስተላለፈው)፣ Codex የኮምፒውተር አጠቃቀምን ተጠቅሞ Slay the Spireን (EpochAI(በአዲስ መስኮት ውስጥ ይክፈታል) በቀጥታ እንዳስተላለፈው)፣ እንዲሁም የBaba Is Youን የመጀመሪያ ደረጃዎች (Piotr Migdał & Piotr Grabowski(በአዲስ መስኮት ውስጥ ይክፈታል) እንዳጋሩት) አሸንፏል። ታዲያ ARC-AGI-3ን ይህን ያህል የተለየ ያደረገው ምን ነበር?

GPT-5.6 Sol በCodex ውስጥ በSlay the Spire 2 በዘፈቀደ የተዘጋጀ ዕለታዊ ፈተናን ሲያጠናቅቅ።

Ethan Mollick፣ GPT‑5.6 Sol በCodex ውስጥ ከእውቀት ማብቂያ ቀኑ በኋላ በወጣው Slay the Spire 2 ጨዋታ ላይ በዘፈቀደ የተዘጋጀ ዕለታዊ ፈተናን ሲያሸንፍ ያሳያል(በአዲስ መስኮት ውስጥ ይክፈታል)

ARC የGPT‑5.5 ድክመቶች ትንተና(በአዲስ መስኮት ውስጥ ይክፈታል) ተነሳስተን፣ አንዳንድ የGPT‑5.6 Sol ሙከራዎችን መረመርን። እንደ ARC፣ እኛም ሞዴሉ ብዙም ብልህ እንዳልመሰለ አየን። በእያንዳንዱ ድርጊት ላይ ለረጅም ጊዜ ያስብ ነበር፤ እድገት ማድረግም ይቸግረው ነበር።

ነገር ግን በጥልቀት ስንመለከት፣ አብዛኛው የሞዴሉ ግራ መጋባት ከራሱ ከሞዴሉ የመጣ ሳይሆን በመደበቂያው ቅንብሮች ምክንያት እንደነበር ደረስንበት።

በመጀመሪያ፣ ከእያንዳንዱ የጨዋታ ድርጊት በኋላ ሁሉም የግል ማመዛዘን እንደሚሰረዝ አስተዋልን። ይህም GPT‑5.6 Sol የቀድሞ ሐሳቡን ማስታወስ ስለማይችል፣ በእያንዳንዱ ድርጊት ጨዋታውን ከአዲስ እንዲረዳ ይጠየቅ ነበር ማለት ነው። ሞዴሉ የቀድሞ እንቅስቃሴዎችን መዝገብና አጭር ተጓዳኝ ማስታወሻዎችን ማየት ይችል ነበር፤ ወደ እነሱ ያደረሱትን ዕቅዶች፣ ግንዛቤዎች ወይም ሐሳቦች ግን ማየት አይችልም ነበር።

ሁለተኛ፣ መደበቂያው ተንከባላይ የመቁረጫ መስኮት እንደሚጠቀምና ታሪኩ እያደገ ሲሄድ የቆዩ ድርጊቶች እንዳይታዩ እንደሚያደርግ አየን። ስለዚህ GPT‑5.6 Sol የቀድሞ ሐሳቡን ማስታወስ ብቻ ሳይሆን፣ የቀድሞ ድርጊቶቹንም እየረሳ ነበር።

እነዚህ ሁለት የመደበቂያው ባህሪያት—ማመዛዘንን መሰረዝና ተንከባላይ መቁረጥ—GPT‑5.6 Sol በጊዜ ሂደት ለመማር ለምን እንደተቸገረ ያስረዳሉ።

ወኪሎች ያደረጉትን ሲያስታውሱ የተሻለ ይሠራሉ

ሞዴሎቻችን ምላሾችን ወይም የመሣሪያ ጥሪዎችን ከማውጣታቸው በፊት በግል የማመዛዘን መልዕክቶች እንዲያስቡ ሥልጠና አግኝተዋል። እነዚህ የግል የማሰብ መልዕክቶች የውይይት ታሪኩ አካል ሆነው ይቆያሉ። ውይይቱ በጣም ከረዘመ፣ አጠቃለን እንቀጥላለን።

በረጅም ጊዜ በሚካሄድ ተግባር ውስጥ የሞዴል ማመዛዘን፣ የመሣሪያ ጥሪዎች፣ የውይይት ታሪክና የአውድ ኮምፓክሽን እንዴት አብረው እንደሚሠሩ የሚያሳይ ሥዕላዊ መግለጫ።

ሞዴሎቻችን የሚሠለጥኑት በዚህ መንገድ ነው፤ በChatGPT እና Codex ውስጥም የሚሰማሩት እንዲሁ ነው። ከምርት አካባቢያችን ጋር በተሻለ ሁኔታ እንዲጣጣም፣ የARC-AGI-3 መደበቂያን በResponses ኤፒአይ(በአዲስ መስኮት ውስጥ ይክፈታል)ያችን ተገበርን። ኤፒአይያችን አውድን ማስተዳደር ቀላል ያደርገዋል፤ ለGPT‑5.6 የቀድሞውን የምላሽ መታወቂያ ማስተላለፍ በመሣሪያ ጥሪዎችና በውይይት ተራዎች መካከል ማመዛዘንን በራስ-ሰር ያቆያል።

ማመዛዘን ሲቆይ፣ ሁለት ትልልቅ ለውጦችን አስተዋልን። በመጀመሪያ፣ GPT‑5.6 Sol በእያንዳንዱ ተራ ጨዋታውን ከባዶ መተርጎም ስላላስፈለገው፣ ከእያንዳንዱ ድርጊት በፊት በማሰብ የሚያሳልፈው ጊዜ ቀነሰ። ሁለተኛ፣ GPT‑5.6 Sol የቀድሞ ሐሳቦቹን ማስታወስ ሲችል፣ በጊዜ ሂደት የመማርና ወጥ የሆኑ ስልቶችን የመጠቀም ብቃቱ እጅግ ተሻሻለ።

ቀጣዩ ማሻሻያ ተንከባላይ መቁረጥን በኮምፓክሽን(በአዲስ መስኮት ውስጥ ይክፈታል)፣ በResponses API ውስጥ ባለ ሌላ ቅንብር፣ በመተካት መጣ።

የARC-AGI-3 መደበቂያ የአውድ ገደቦችን በተንከባላይ መቁረጥ ይፈታል። የውይይቱ አውድ ከ175,000 ቁምፊዎች ሲያልፍ፣ ከሁሉ የቆዩት መልዕክቶች ይሰረዛሉ።

ተንከባላይ መቁረጥ ሁለት ጉዳቶች አሉት። በመጀመሪያ፣ ሞዴሉ የቀድሞ ምልከታዎችንና ድርጊቶችን ያጣል። ሁለተኛ፣ አብዛኛውን የተግባር ጊዜ በተሞላ የአውድ መስኮት ይሠራል፤ ይህም አፈጻጸሙን በትንሹ ሊጎዳ ይችላል።

በARC-AGI-3 ላይ ኮምፓክሽንን ስናነቃ፣ GPT‑5.6 Sol ስለ እያንዳንዱ ጨዋታ የተማረውን በረጅም ሂደቶች ውስጥ በተሻለ ሁኔታ ማቆየት ችሎ፣ በአነስተኛ የውጤት ቶከኖች ከፍተኛ ውጤት አስመዘገበ።

ማመዛዘንን የማቆየትና ኮምፓክሽንን የማንቃት ተጽዕኖ ለማሳየት፣ GPT‑5.6 Sol በእያንዳንዱ መደበቂያ ተከታታይ የARC-AGI-3 እንቆቅልሾችን ሲፈታ የ175K የአውድ መስኮቱ እንዴት እንደሚጠቀም የሚያሳይ እነማ እነሆ።

በመሃል ያሉት ሁለት ዓምዶች የሞዴሉ የውድ መስኮት በእያንዳንዱ መደበቂያ እንዴት በተለየ መንገድ እንደሚጠቀም ያሳያሉ። GPT‑5.6 Sol የቀድሞ ድርጊቶቹን በተሻለ ስለሚያስታውስ፣ በእያንዳንዱ ድርጊት ያነሰ ያስባል፤ በጣም ፈጥኖም ይራመዳል። ማስታወሻ፦ የእኛ ትግበራ በቁምፊዎች ፈንታ የ175,000 ቶከኖች ገደብ ይጠቀማል፤ ነገር ግን አብዛኛው ጽሑፍ በቶከን ከፋያችን በ1:1 ጥምርታ የሚከፋፈሉ የድርጊት ሰንጠረዦች ስለሆኑ፣ ውጤቱ በእጅጉ ተመሳሳይ ይሆናል።

ማመዛዘንን ማቆየትና ኮምፓክሽን በአንድነት፣ GPT‑5.6 Sol (Max) በ6 እጥፍ ያነሱ የውጤት ቶከኖች በመጠቀም በግምት 3 እጥፍ ውጤት እንዲያስመዘግብ ያስችሉታል።

ማጠቃለያና ምክረ ሐሳቦች

እነዚህ ሙከራዎች ግምገማዎች ሞዴሎችን ብቻቸውን የሚለኩት አልፎ አልፎ እንደሆነ—ስለ API ቅንብሮች፣ መደበቂያ ንድፍና ጥያቄ አቀራረብ የሚደረጉ ብዙም የማይታዩ ምርጫዎችንም እንደሚለኩ—ማስታወሻ እንዲሆኑ ተስፋ እናደርጋለን። በይፋዊ መለኪያ ዝቅተኛ ውጤት አስገርሞን፣ ከዚያም የግምገማ አስኪያጁ የማመዛዘን መልዕክቶችን የሚጥል አጠቃላይ መደበቂያ እየተጠቀመ እንደነበር ስናውቅ ይህ የመጀመሪያችን አይደለም።

ከፍተኛውን አፈጻጸም ለማግኘት የሚሞክሩ የኤፒአይ ገንቢ ከሆኑ፣ በራሳችን ምርቶች ውስጥ የምንጠቀምባቸውን ቅንብሮች እንዲጠቀሙ እንመክራለን፦

  • ከቀድሞው የውይይት ማጠናቀቂያዎች ኤፒአይ ይልቅ የResponses ኤፒአይያችንን ይጠቀሙ
  • ማመዛዘንን ያቆዩ
  • ኮምፓክሽንን ይጠቀሙ

ሞዴሎችን እያነጻጸሩ ከሆነም፣ ከChatGPT እና Codex እውነተኛ አጠቃቀም ጋር በተሻለ የሚጣጣሙትን ከላይ ያሉትን ቅንብሮች በሚጠቀሙ ግምገማዎች ላይ እንዲመኩ እንመክራለን።

ARC በAGI ግምገማ ላይ ላከናወነው የዓመታት ፈጠራ ሥራና ይህን ጉዳይ በቅርበት እንድንመረምር ላነሳሳን ትንተናው እናመሰግናለን።

የራስዎን ችሎታ ከግንባር ቀደም ሞዴሎች ጋር መፈተሽ ከፈለጉ፣ በarcprize.org/tasks(በአዲስ መስኮት ውስጥ ይክፈታል) ይፋዊ ጨዋታዎቹን ራስዎ ይሞክሩ።

ደራሲ

Ilan Bigio እና Ted Sanders