രണ്ട് ക്രമീകരണങ്ങൾ പ്രവർത്തനക്ഷമമാക്കി ARC-AGI-3 സ്കോർ മൂന്നിരട്ടിയാക്കിയ വിധം
ARC-AGI-3 മാനദണ്ഡത്തിലെ പസിലുകൾ പരിഹരിക്കാൻ GPT‑5.6 Sol ശ്രമിക്കുന്നതിന്റെ വേഗം കൂട്ടിയ ദൃശ്യമാണ് ഇത്. ഇടതുവശത്ത് ഔദ്യോഗിക ഹാർനെസും വലതുവശത്ത് റീസണിംഗ് നിലനിർത്തുകയും കമ്പാക്ഷൻ പ്രവർത്തനക്ഷമമാക്കുകയും ചെയ്യുന്ന ഞങ്ങളുടെ Responses API ഹാർനെസുമാണ്. ഈ ഗെയിമിന്റെ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) മുൻനിരപ്പട്ടികയിൽ ഒരു അത്യാധുനിക മോഡലും ആദ്യ ലെവലിനപ്പുറം പരിഹരിക്കുന്നില്ല. ഞങ്ങളുടെ ഹാർനെസ് ഉപയോഗിച്ച് GPT‑5.6 Sol ആറ് ലെവലുകളും പരിഹരിക്കുന്നു.
ARC-AGI-3(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) മാനദണ്ഡത്തിൽ GPT‑5.6 Sol നേടിയ കുറഞ്ഞ സ്കോറുകൾ ആദ്യം കണ്ടപ്പോൾ ഞങ്ങൾക്ക് ആശയക്കുഴപ്പമായി.
സൈക്കിൾ ഡബിൾ കവർ അനുമാനം(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) പോലുള്ള ഗണിതശാസ്ത്രത്തിലെ ദീർഘകാലമായി പരിഹരിക്കപ്പെടാതിരുന്ന പ്രശ്നങ്ങൾ GPT‑5.6 Sol പരിഹരിക്കുകയും Pokémon FireRed പോലുള്ള ഗെയിമുകൾ ജയിക്കുകയും ചെയ്തിട്ടുണ്ട്. എന്നാൽ ദ്വിമാന പസിൽ ഗെയിമുകളുടെ മാനദണ്ഡമായ ARC-AGI-3-ൽ GPT‑5.6 Sol വെറും 7.8% മാത്രമാണ് നേടിയത്. GPT‑5.5 ഗെയിമുകൾ കളിക്കാൻതന്നെ ഏറെ ബുദ്ധിമുട്ടി; ലഭിച്ചത് തുച്ഛമായ 0.4% മാത്രം.
ഞങ്ങളുടെ മോഡലുകൾക്ക് ദ്വിമാന പസിൽ ഗെയിമുകൾ അസാധാരണമാംവിധം ദുഷ്കരമായിരുന്നോ? അതോ മറ്റെന്തെങ്കിലുമാണോ സംഭവിച്ചിരുന്നത്?
മാനദണ്ഡങ്ങൾ അപൂർവമായേ AI മോഡലുകളെ ഒറ്റയ്ക്ക് അളക്കാറുള്ളൂ. API ക്രമീകരണങ്ങൾ, ഹാർനെസ് രൂപകൽപ്പന, നിർദേശം നൽകുന്ന രീതി എന്നിവയെക്കുറിച്ചുള്ള അത്ര പ്രകടമല്ലാത്ത തീരുമാനങ്ങളും അവ അളക്കുന്നു. ARC-AGI-3-യുടെ കാര്യത്തിൽ, ChatGPT‑യിലും Codex-ലും ഞങ്ങൾ ഉപയോഗിക്കുന്ന രണ്ട് API ക്രമീകരണങ്ങളായ റീസണിംഗ് നിലനിർത്തലും കമ്പാക്ഷനും പ്രവർത്തനക്ഷമമാക്കിയപ്പോൾ പൊതു ടാസ്ക് സെറ്റിലെ സ്കോർ മൂന്നിരട്ടിയാകുകയും ഔട്ട്പുട്ട് ടോക്കണുകൾ ആറിലൊന്നായി കുറയുകയും ചെയ്തതായി കണ്ടെത്തി.
ഔദ്യോഗിക ഹാർനെസ് ഉപയോഗിച്ചപ്പോൾ, ARC-AGI-3 പൊതു സെറ്റിൽ GPT‑5.6 Sol 13.3% സ്കോർ നേടി. റീസണിംഗ് നിലനിർത്തുകയും കമ്പാക്ഷൻ ഉപയോഗിക്കുകയും ചെയ്തപ്പോൾ 38.3% നേടി. സ്കോറുകൾ ആപേക്ഷിക മനുഷ്യ പ്രവർത്തന കാര്യക്ഷമതയെ (RHAE(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു))—മോഡലിന്റെ പ്രകടനത്തെ മനുഷ്യരുടെ അടിസ്ഥാന പ്രകടനവുമായി താരതമ്യം ചെയ്യുന്ന മാനദണ്ഡത്തെ—അളക്കുന്നു. ഔദ്യോഗിക ഗെയിംപ്ലേ രേഖകൾ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) അടിസ്ഥാനമാക്കി, ശരാശരി മനുഷ്യ പരീക്ഷകൻ 48% നേടിയതായി ഞങ്ങൾ കണക്കാക്കുന്നു. സ്കോർ നിർണയിക്കുന്ന വിധം മോഡലുകളോട് പറയുന്നില്ല; കളിക്കുമ്പോൾ അവയ്ക്ക് സ്വന്തം സ്കോർ കാണാനുമാകില്ല—ഓരോ പ്രവർത്തനത്തിനും ലഭിക്കുന്നത് ഓരോ ഫ്രെയിമിന്റെയും നിലവിലെ ലെവലിന്റെയും വാചകരൂപത്തിലുള്ള വിവരണം മാത്രമാണ്.
AI ഏജന്റുകൾ എത്ര നന്നായി പഠിക്കുകയും റീസണിംഗ് നടത്തുകയും ചെയ്യുന്നുവെന്ന് അളക്കാൻ രൂപകൽപ്പന ചെയ്ത മാനദണ്ഡമാണ് ARC-AGI-3. ഏജന്റുകൾ പരിചയമില്ലാത്ത ദ്വിമാന ഗെയിമുകൾ പരിശോധിച്ച്, വ്യക്തമായ നിർദേശങ്ങളില്ലാതെ അവ പ്രവർത്തിക്കുന്ന വിധം അനുമാനിക്കുന്നു. arcprize.org/tasks(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ൽ നിങ്ങൾക്ക് 25 മാതൃകാ ഗെയിമുകൾ കളിക്കാം.
ഉപകരണങ്ങളോ പ്രത്യേക സൗകര്യങ്ങളോ ഇല്ലാത്ത, മനഃപൂർവം പൊതുവായി രൂപകൽപ്പന ചെയ്ത ഹാർനെസാണ് ARC-AGI-3 ഉപയോഗിക്കുന്നത്. ലളിതമായ ഹാർനെസ് മോഡലിന്റെ പോരായ്മകൾ കൂടുതൽ വ്യക്തമാക്കുകയും മോഡലുകൾ തമ്മിലുള്ള താരതമ്യം കൂടുതൽ നീതിയുക്തമാക്കുകയും ചെയ്യുമെന്നതായിരുന്നു ARC-യുടെ ന്യായം. അതേസമയം, വാണിജ്യ ഡെവലപ്പർമാർ ഓരോ മോഡലിന്റെയും സവിശേഷതകൾക്കും പ്രത്യേക സ്വഭാവങ്ങൾക്കും അനുസരിച്ച് ഹാർനെസുകൾ മെച്ചപ്പെടുത്തുന്നു.
ഗെയിമുകളിൽ, ദൃശ്യം മാത്രം ഉപയോഗിക്കുന്ന ഹാർനെസിലൂടെ GPT‑5.6 Sol Pokémon FireRed ജയിച്ചിട്ടുണ്ട് (GPT_Plays_Pokemon(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) സംപ്രേഷണം ചെയ്തത്). Codex-ന്റെ കമ്പ്യൂട്ടർ ഉപയോഗത്തിലൂടെ Slay the Spire ജയിച്ചിട്ടുണ്ട് (EpochAI(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) സംപ്രേഷണം ചെയ്തത്). Baba Is You-ന്റെ ആദ്യ ഘട്ടങ്ങളും പൂർത്തിയാക്കിയിട്ടുണ്ട് (Piotr Migdał & Piotr Grabowski(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) പങ്കുവെച്ചത്). ARC-AGI-3-ൽ ഇത്ര വ്യത്യസ്തമായിരുന്നത് എന്താണ്?

GPT‑5.6 Sol-ന്റെ അറിവ് അവസാനിക്കുന്ന തീയതിക്കുശേഷം പുറത്തിറങ്ങിയ Slay the Spire 2-ൽ, Codex ഉപയോഗിച്ച് GPT‑5.6 Sol ഒരു ക്രമരഹിത ദൈനംദിന വെല്ലുവിളി ജയിക്കുന്നത് Ethan Mollickകാണിക്കുന്നു(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു).
GPT‑5.5‑ന്റെ പോരായ്മകളെക്കുറിച്ചുള്ള ARC-യുടെ വിശകലനത്തിൽ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) നിന്ന് പ്രചോദനം ഉൾക്കൊണ്ട്, GPT‑5.6 Sol നടത്തിയ ചില ശ്രമങ്ങൾ ഞങ്ങൾ പരിശോധിച്ചു. ARC കണ്ടതുപോലെ, മോഡൽ അത്ര മിടുക്കുള്ളതായി ഞങ്ങൾക്കും തോന്നിയില്ല. ഓരോ പ്രവർത്തനത്തെക്കുറിച്ചും അത് ദീർഘനേരം ആലോചിക്കുകയും മുന്നോട്ടുപോകാൻ ബുദ്ധിമുട്ടുകയും ചെയ്തു.
എന്നാൽ കൂടുതൽ ആഴത്തിൽ പരിശോധിച്ചപ്പോൾ, മോഡലിന്റെ ആശയക്കുഴപ്പത്തിൽ ഏറിയ പങ്കും മോഡലിന്റെ സഹജമായ പ്രശ്നമല്ലെന്നും ഹാർനെസിലെ ക്രമീകരണങ്ങൾ മൂലമാണെന്നും കണ്ടെത്തി.
ആദ്യം, ഗെയിമിലെ ഓരോ പ്രവർത്തനത്തിനുശേഷവും എല്ലാ സ്വകാര്യ റീസണിംഗും ഉപേക്ഷിക്കുന്നതായി ഞങ്ങൾ ശ്രദ്ധിച്ചു. അതുകൊണ്ട്, ഓരോ പ്രവർത്തനത്തിലും മുൻ ചിന്തകൾ ഓർക്കാനാകാതെ GPT‑5.6 Sol-നോട് ഗെയിം വീണ്ടും ആദ്യം മുതൽ മനസ്സിലാക്കാൻ ആവശ്യപ്പെടുകയായിരുന്നു. മുൻ നീക്കങ്ങളുടെയും അവയ്ക്കൊപ്പമുള്ള ചെറിയ കുറിപ്പുകളുടെയും രേഖ മോഡലിന് അപ്പോഴും കാണാമായിരുന്നു. എന്നാൽ അവയിലേക്ക് നയിച്ച പദ്ധതികളോ ഉൾക്കാഴ്ചകളോ ചിന്തകളോ കാണാനായില്ല.
രണ്ടാമതായി, ഹാർനെസ് ക്രമാനുഗത വെട്ടിച്ചുരുക്കൽ പരിധി ഉപയോഗിക്കുന്നതിനാൽ ചരിത്രം വളരുന്നതിനൊപ്പം പഴയ പ്രവർത്തനങ്ങൾ അദൃശ്യമാകുന്നതായി കണ്ടു. അതിനാൽ GPT‑5.6 Sol-ന് മുൻ ചിന്തകൾ ഓർക്കാനായില്ലെന്നു മാത്രമല്ല, മുൻ പ്രവർത്തനങ്ങളെക്കുറിച്ചുള്ള ഓർമയും നഷ്ടപ്പെടുകയായിരുന്നു.
റീസണിംഗ് ഉപേക്ഷിക്കലും ക്രമാനുഗത വെട്ടിച്ചുരുക്കലും എന്ന ഹാർനെസിന്റെ ഈ രണ്ട് സവിശേഷതകൾ, കാലക്രമേണ പഠിക്കാൻ GPT‑5.6 Sol ബുദ്ധിമുട്ടിയതിന്റെ കാരണം വിശദീകരിക്കാൻ സഹായിച്ചു.
മറുപടികളോ ഉപകരണ വിളികളോ നൽകുന്നതിനുമുമ്പ് സ്വകാര്യ റീസണിംഗ് സന്ദേശങ്ങളിലൂടെ ചിന്തിക്കാനാണ് ഞങ്ങളുടെ മോഡലുകളെ പരിശീലിപ്പിച്ചിരിക്കുന്നത്. ഈ സ്വകാര്യ ചിന്താസന്ദേശങ്ങൾ സംഭാഷണ ചരിത്രത്തിന്റെ ഭാഗമായി നിലനിർത്തുന്നു. ഒരു സംഭാഷണം വളരെ നീണ്ടാൽ, ഞങ്ങൾ അത് സംഗ്രഹിച്ച് തുടരുന്നു.
ഞങ്ങളുടെ മോഡലുകളെ പരിശീലിപ്പിക്കുന്നതും ChatGPT‑യിലും Codex-ലും വിന്യസിക്കുന്നതും ഇങ്ങനെയാണ്. ഞങ്ങളുടെ ഉൽപ്പാദന സംവിധാനവുമായി കൂടുതൽ പൊരുത്തപ്പെടാൻ, Responses API(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഉപയോഗിച്ച് ARC-AGI-3 ഹാർനെസ് നടപ്പാക്കി. സന്ദർഭം കൈകാര്യം ചെയ്യുന്നത് ഞങ്ങളുടെ API എളുപ്പമാക്കുന്നു. GPT‑5.6‑ന് മുൻ മറുപടിയുടെ ID നൽകിയാൽ, ഉപകരണ വിളികളിലും സംഭാഷണ ഊഴങ്ങളിലും റീസണിംഗ് സ്വയമേവ നിലനിർത്തപ്പെടും.
റീസണിംഗ് നിലനിർത്തിയപ്പോൾ രണ്ട് വലിയ മാറ്റങ്ങൾ ഞങ്ങൾ ശ്രദ്ധിച്ചു. ഒന്നാമതായി, ഓരോ ഊഴത്തിലും ഗെയിം ആദ്യം മുതൽ വ്യാഖ്യാനിക്കേണ്ടതില്ലാത്തതിനാൽ ഓരോ പ്രവർത്തനത്തിനുമുമ്പും GPT‑5.6 Sol ചിന്തിക്കാൻ കുറച്ചുസമയം മാത്രമെടുത്തു. രണ്ടാമതായി, മുൻ ചിന്തകൾ ഓർക്കാനായപ്പോൾ കാലക്രമേണ പഠിക്കുന്നതിലും യുക്തിസഹമായ തന്ത്രങ്ങൾ പ്രയോഗിക്കുന്നതിലും GPT‑5.6 Sol വളരെ മെച്ചപ്പെട്ടു.
ക്രമാനുഗത വെട്ടിച്ചുരുക്കലിന് പകരം Responses API-യിലെ മറ്റൊരു ക്രമീകരണമായ കമ്പാക്ഷൻ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഉപയോഗിച്ചതാണ് അടുത്ത മെച്ചപ്പെടുത്തൽ.
ക്രമാനുഗത വെട്ടിച്ചുരുക്കലിലൂടെയാണ് ARC-AGI-3 ഹാർനെസ് സന്ദർഭ പരിധികൾ കൈകാര്യം ചെയ്യുന്നത്. സംഭാഷണ സന്ദർഭം 175,000 അക്ഷരങ്ങൾ കവിഞ്ഞാൽ, ഏറ്റവും പഴയ സന്ദേശങ്ങൾ ഉപേക്ഷിക്കും.
ക്രമാനുഗത വെട്ടിച്ചുരുക്കലിന് രണ്ട് പോരായ്മകളുണ്ട്. ഒന്നാമതായി, മോഡലിന് മുൻ നിരീക്ഷണങ്ങളും പ്രവർത്തനങ്ങളും നഷ്ടപ്പെടുന്നു. രണ്ടാമതായി, ടാസ്കുകളുടെ ഭൂരിഭാഗവും കൂടുതൽ നിറഞ്ഞ സന്ദർഭ പരിധിയിലാണ് അത് പ്രവർത്തിക്കുന്നത്. ഇത് പ്രകടനത്തെ ചെറുതായി ബാധിക്കാം.
ARC-AGI-3-ൽ കമ്പാക്ഷൻ പ്രവർത്തനക്ഷമമാക്കിയപ്പോൾ, ദൈർഘ്യമേറിയ പ്രവർത്തനങ്ങളിലുടനീളം ഓരോ ഗെയിമിനെക്കുറിച്ചും പഠിച്ച കാര്യങ്ങൾ GPT‑5.6 Sol-ന് കൂടുതൽ നന്നായി നിലനിർത്താനായി. കുറഞ്ഞ ഔട്ട്പുട്ട് ടോക്കണുകൾ ഉപയോഗിച്ച് ഉയർന്ന സ്കോറും നേടി.
റീസണിംഗ് നിലനിർത്തുന്നതിന്റെയും കമ്പാക്ഷൻ പ്രവർത്തനക്ഷമമാക്കുന്നതിന്റെയും ഫലം വ്യക്തമാക്കാൻ, ഓരോ ഹാർനെസും ഉപയോഗിച്ച് ARC-AGI-3 പസിലുകളുടെ ഒരു പരമ്പര പരിഹരിക്കുമ്പോൾ GPT‑5.6 Sol-ന്റെ 175K സന്ദർഭ പരിധി കാണിക്കുന്ന ചലച്ചിത്രം ഇതാ.
ഓരോ ഹാർനെസും മോഡലിന്റെ സന്ദർഭ പരിധി വ്യത്യസ്തമായി ഉപയോഗിക്കുന്ന വിധമാണ് നടുവിലെ രണ്ട് നിരകൾ കാണിക്കുന്നത്. മുൻ കാര്യങ്ങൾ കൂടുതൽ നന്നായി ഓർക്കുന്നതിനാൽ ഓരോ പ്രവർത്തനത്തിനും GPT‑5.6 Sol കുറച്ചുമാത്രം ചിന്തിക്കുകയും വളരെ വേഗത്തിൽ മുന്നോട്ടുപോകുകയും ചെയ്യുന്നു. ശ്രദ്ധിക്കുക: ഞങ്ങളുടെ നടപ്പാക്കലിൽ അക്ഷരങ്ങൾക്കുപകരം 175,000 ടോക്കണുകളുടെ പരിധിയാണ് ഉപയോഗിക്കുന്നത്. എന്നാൽ വാചകത്തിന്റെ ബഹുഭൂരിപക്ഷവും ഞങ്ങളുടെ ടോക്കണൈസർ 1:1 അനുപാതത്തിൽ ടോക്കണുകളാക്കുന്ന പ്രവർത്തന ഗ്രിഡുകളായതിനാൽ, രണ്ടും ഏറെക്കുറെ സമാനമാണ്.
റീസണിംഗ് നിലനിർത്തലും കമ്പാക്ഷനും ചേർന്ന്, ആറിലൊന്ന് ഔട്ട്പുട്ട് ടോക്കണുകൾ ഉപയോഗിച്ച് ഏകദേശം മൂന്നിരട്ടി സ്കോർ നേടാൻ GPT‑5.6 Sol-നെ (Max) സഹായിക്കുന്നു.
മൂല്യനിർണയങ്ങൾ അപൂർവമായേ മോഡലുകളെ ഒറ്റയ്ക്ക് അളക്കാറുള്ളൂ എന്ന ഓർമപ്പെടുത്തലാകട്ടെ ഈ പരീക്ഷണങ്ങൾ. API ക്രമീകരണങ്ങൾ, ഹാർനെസ് രൂപകൽപ്പന, നിർദേശം നൽകുന്ന രീതി എന്നിവയെക്കുറിച്ചുള്ള അത്ര പ്രകടമല്ലാത്ത ഒരു കൂട്ടം തീരുമാനങ്ങളും അവ അളക്കുന്നു. ഒരു പൊതു മാനദണ്ഡത്തിലെ കുറഞ്ഞ സ്കോറുകൾ ഞങ്ങളെ അത്ഭുതപ്പെടുത്തുകയും തുടർന്ന് മൂല്യനിർണയ സംവിധാനം റീസണിംഗ് സന്ദേശങ്ങൾ ഒഴിവാക്കുന്ന പൊതുവായ ഹാർനെസാണ് ഉപയോഗിക്കുന്നതെന്ന് കണ്ടെത്തുകയും ചെയ്യുന്നത് ഇതാദ്യമല്ല.
പ്രകടനം പരമാവധിയാക്കാൻ ശ്രമിക്കുന്ന API ഡെവലപ്പറാണ് നിങ്ങളെങ്കിൽ, ഞങ്ങളുടെ ഉൽപ്പന്നങ്ങളിൽ വിന്യസിക്കുന്ന അതേ ക്രമീകരണങ്ങൾ ഉപയോഗിക്കാൻ ശുപാർശ ചെയ്യുന്നു:
- ഞങ്ങളുടെ പഴയ ചാറ്റ് കംപ്ലീഷൻസ് API-ക്കുപകരം Responses API ഉപയോഗിക്കുക
- റീസണിംഗ് നിലനിർത്തുക
- കമ്പാക്ഷൻ ഉപയോഗിക്കുക
മോഡലുകളെ താരതമ്യം ചെയ്യുകയാണെങ്കിൽ, മുകളിലെ ക്രമീകരണങ്ങൾ ഉപയോഗിക്കുന്ന മൂല്യനിർണയങ്ങളെ ആശ്രയിക്കാൻ ഞങ്ങൾ ശുപാർശ ചെയ്യുന്നു. ChatGPT‑യിലെയും Codex-ലെയും യഥാർഥ ഉപയോഗവുമായി ഏറ്റവും നന്നായി പൊരുത്തപ്പെടുന്നത് അവയാണ്.
AGI മൂല്യനിർണയത്തിൽ ARC വർഷങ്ങളായി നടത്തിയ സർഗാത്മക പ്രവർത്തനങ്ങൾക്കും ഇവിടെ കൂടുതൽ സൂക്ഷ്മമായി പരിശോധിക്കാൻ ഞങ്ങളെ പ്രേരിപ്പിച്ച അവരുടെ വിശകലനത്തിനും ഞങ്ങൾ നന്ദിയുള്ളവരാണ്.
അത്യാധുനിക മോഡലുകൾക്കെതിരെ നിങ്ങളുടെ കഴിവ് പരീക്ഷിക്കണമെങ്കിൽ, arcprize.org/tasks(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)-ലെ പൊതു ഗെയിമുകൾ സ്വയം കളിച്ചുനോക്കൂ.


