ARC-AGI-3 அளவுகோலில் உள்ள புதிர்களை GPT‑5.6 Sol தீர்க்க முயல்வதைக் காட்டும் வேகப்படுத்தப்பட்ட காணொளி. இடதுபுறம் அதிகாரப்பூர்வச் சூழல் பணி அமைவும், வலதுபுறம் ரீஸனிங்கைத் தக்கவைத்து சுருக்குதலை இயக்கும் எங்கள் Responses API சூழல் பணி அமைவும் காட்டப்படுகின்றன. இந்த விளையாட்டின்(புதிய சாளரத்தில் திறக்கும்) தரவரிசைப் பட்டியலில், எந்த அதிநவீன மாடலும் முதல் நிலைக்கு அடுத்த எந்த நிலையையும் தீர்க்கவில்லை. எங்கள் சூழல் பணி அமைவுடன் GPT‑5.6 Sol ஆறு நிலைகளையும் தீர்க்கிறது.
ARC-AGI-3(புதிய சாளரத்தில் திறக்கும்) அளவுகோலில் GPT‑5.6 Sol பெற்ற குறைந்த மதிப்பெண்களை முதன்முதலில் பார்த்தபோது எங்களுக்குக் குழப்பமாக இருந்தது.
GPT‑5.6 Sol, கணிதத்தில் நீண்டகாலமாகத் தீர்க்கப்படாமல் இருந்த சுழற்சி இரட்டை உறை அனுமானம்(புதிய சாளரத்தில் திறக்கும்) போன்ற சிக்கல்களைத் தீர்த்துள்ளது; Pokémon FireRed போன்ற விளையாட்டுகளையும் வென்றுள்ளது. ஆனால் இருபரிமாணப் புதிர் விளையாட்டுகளுக்கான அளவுகோலான ARC-AGI-3 இல் GPT‑5.6 Sol வெறும் 7.8% மட்டுமே பெற்றது; GPT‑5.5‑ஆல் விளையாட்டுகளை ஏறக்குறைய விளையாடவே முடியாமல், மிகக் குறைவான 0.4% மட்டுமே பெற முடிந்தது.
எங்கள் மாடல்களுக்கு இருபரிமாணப் புதிர் விளையாட்டுகள் வழக்கத்துக்கு மாறாகக் கடினமாக இருந்தனவா? அல்லது வேறு ஏதாவது காரணமா?
AI மாடல்களை மட்டும் அளவுகோல்கள் தனித்துப் பார்ப்பது அரிது. API அமைப்புகள், சூழல் பணி அமைவின் வடிவமைப்பு, அறிவுறுத்தல்கள் ஆகியவை தொடர்பான, வெளிப்படையாகத் தெரியாத தேர்வுகளையும் அவை அளவிடுகின்றன. ARC-AGI-3-ஐப் பொறுத்தவரை, ChatGPT மற்றும் Codex-இல் நாங்கள் பயன்படுத்தும் ரீஸனிங்கைத் தக்கவைத்தல், சுருக்குதல் ஆகிய இரண்டு API அமைப்புகளை இயக்கியபோது, பொதுப் பணித் தொகுப்பில் மதிப்பெண்கள் மும்மடங்கானதுடன் வெளியீட்டு டோக்கன்கள் ஆறில் ஒரு பங்காகக் குறைந்ததையும் கண்டறிந்தோம்.
அதிகாரப்பூர்வச் சூழல் பணி அமைவில், ARC-AGI-3 பொதுத் தொகுப்பில் 13.3%-ஐ GPT‑5.6 Sol பெற்றது. ரீஸனிங் தக்கவைக்கப்பட்டு சுருக்குதல் பயன்படுத்தப்பட்டபோது, அது 38.3% பெற்றது. மாடலின் செயல்திறனை மனித அடிப்படையுடன் ஒப்பிடும் அளவீடான ஒப்பீட்டு மனிதச் செயல் திறன் (RHAE(புதிய சாளரத்தில் திறக்கும்))—என்பதால் மதிப்பெண்கள் அளவிடப்படுகின்றன. அதிகாரப்பூர்வ விளையாட்டுப் பதிவுகளின்(புதிய சாளரத்தில் திறக்கும்) அடிப்படையில், சராசரி மனிதச் சோதனையாளர் 48% பெற்றதாக மதிப்பிடுகிறோம். மதிப்பெண் எவ்வாறு கணக்கிடப்படும் என்பது மாடல்களுக்குத் தெரிவிக்கப்படுவதில்லை; செயல்பாட்டின்போது அவற்றால் மதிப்பெண்ணைப் பார்க்கவும் முடியாது—செயல்களுக்குப் பதிலாக ஒவ்வொரு சட்டகத்தின் உரை வடிவமும் அவை உள்ள நிலையும் மட்டுமே திரும்பக் கிடைக்கும்.
AI ஏஜென்ட்கள் எந்த அளவுக்குச் சிறப்பாகக் கற்று ரீஸனிங் செய்கின்றன என்பதை அளவிடுவதற்காக ARC-AGI-3 வடிவமைக்கப்பட்டுள்ளது. ஏஜென்ட்கள் அறிமுகமில்லாத இருபரிமாண விளையாட்டுகளை ஆராய்ந்து, வெளிப்படையான வழிமுறைகள் ஏதுமின்றி அவை எவ்வாறு செயல்படுகின்றன என்பதை ஊகித்தறிகின்றன. arcprize.org/tasks(புதிய சாளரத்தில் திறக்கும்) தளத்தில் 25 செயல்விளக்க விளையாட்டுகளை நீங்கள் விளையாடலாம்.
கருவிகளோ சிறப்பு அம்சங்களோ இல்லாத, வேண்டுமென்றே பொதுவாக அமைக்கப்பட்ட சூழல் பணி அமைவை ARC-AGI-3 பயன்படுத்துகிறது. எளிய சூழல் பணி அமைவு, மாடலின் குறைபாடுகளைத் தெளிவாகக் காட்டுவதுடன் மாடல்களுக்கு இடையிலான ஒப்பீடுகளையும் நியாயமானதாக்கும் என்பதே ARC-இன் தர்க்கம். மாறாக, வணிக உருவாக்குநர்கள் ஒவ்வொரு மாடலின் அம்சங்களுக்கும் தனித்தன்மைகளுக்கும் ஏற்றவாறு சூழல் பணி அமைவுகளை மேம்படுத்துகின்றனர்.
விளையாட்டுகளைப் பொறுத்தவரை, பார்வையை மட்டுமே பயன்படுத்தும் சூழல் பணி அமைவுடன் Pokémon FireRed-ஐ GPT‑5.6 Sol வென்றுள்ளது. இதை GPT_Plays_Pokemon(புதிய சாளரத்தில் திறக்கும்) நேரலையில் ஒளிபரப்பியது. Codex கணினிப் பயன்பாட்டுடன் Slay the Spire-ஐயும் வென்றுள்ளது. இதை EpochAI(புதிய சாளரத்தில் திறக்கும்) நேரலையில் ஒளிபரப்பியது. மேலும், Baba Is You விளையாட்டின் தொடக்க நிலைகளையும் வென்றுள்ளது. இதை Piotr Migdał & Piotr Grabowski(புதிய சாளரத்தில் திறக்கும்) பகிர்ந்துள்ளனர். ARC-AGI-3-இல் மட்டும் அப்படி என்ன வேறுபாடு இருந்தது?

GPT‑5.6 Sol-இன் அறிவு வரம்புக்குப் பிறகு வெளியான Slay the Spire 2 விளையாட்டில், Codex வழியாகச் சீரற்ற தினசரிச் சவாலை GPT‑5.6 Sol வெல்வதை ஈத்தன் மாலிக் காட்டுகிறார்(புதிய சாளரத்தில் திறக்கும்).
GPT‑5.5‑இன் குறைபாடுகள் குறித்த ARC-இன் பகுப்பாய்வு(புதிய சாளரத்தில் திறக்கும்) அளித்த உந்துதலால், GPT‑5.6 Sol மேற்கொண்ட சில முயற்சிகளை ஆய்வுசெய்தோம். ARC கண்டதைப் போலவே, மாடல் அவ்வளவு திறம்படச் செயல்படாததை நாங்களும் கண்டோம். ஒவ்வொரு செயலிலும் அது நீண்ட நேரம் செலவிட்டதுடன், முன்னேறவும் சிரமப்பட்டது.
ஆனால் ஆழமாக ஆராய்ந்தபோது, மாடலின் பெரும்பாலான குழப்பம் அதன் இயல்பான குறைபாட்டால் ஏற்படவில்லை; சூழல் பணி அமைவின் அமைப்புகளால்தான் ஏற்பட்டது என்பதைக் கண்டறிந்தோம்.
முதலில், ஒவ்வொரு விளையாட்டுச் செயலுக்குப் பிறகும் தனிப்பட்ட ரீஸனிங் முழுவதுமாக நீக்கப்பட்டதை கவனித்தோம். இதனால், ஒவ்வொரு செயலின்போதும் முந்தைய சிந்தனையை நினைவில் கொள்ள முடியாத GPT‑5.6 Sol, விளையாட்டை மீண்டும் புதிதாகப் புரிந்துகொள்ள வேண்டியிருந்தது. முந்தைய நகர்வுகளின் பதிவையும் அவற்றுடன் இருந்த சுருக்கமான குறிப்புகளையும் மாடலால் பார்க்க முடிந்தது. ஆனால் அந்த நகர்வுகளுக்கு வழிவகுத்த திட்டங்கள், புரிதல்கள் அல்லது சிந்தனைகளை அதனால் பார்க்க முடியவில்லை.
இரண்டாவதாக, நகரும் துண்டிப்புச் சாளரத்தை சூழல் பணி அமைவு பயன்படுத்தியதால், வரலாறு நீளும்போது பழைய செயல்கள் மறைந்துவிடுவதைக் கண்டோம். எனவே GPT‑5.6 Sol தனது முந்தைய சிந்தனையை நினைவில் கொள்ள முடியாததுடன், முந்தைய செயல்களைப் பற்றிய நினைவையும் இழந்து வந்தது.
ரீஸனிங்கை நீக்குதல், நகரும் துண்டிப்பு ஆகிய சூழல் பணி அமைவின் இந்த இரண்டு அம்சங்களும், காலப்போக்கில் கற்க GPT‑5.6 Sol ஏன் சிரமப்பட்டது என்பதை விளக்க உதவின.
பதில்கள் அல்லது கருவி அழைப்புகளை வெளியிடுவதற்கு முன்பு தனிப்பட்ட ரீஸனிங் செய்திகள் மூலம் சிந்திக்குமாறு எங்கள் மாடல்கள் பயிற்றுவிக்கப்படுகின்றன. இந்தத் தனிப்பட்ட சிந்தனைச் செய்திகள் உரையாடல் வரலாற்றின் ஒரு பகுதியாகத் தக்கவைக்கப்படுகின்றன. உரையாடல் மிகவும் நீண்டுவிட்டால், அதைச் சுருக்கிவிட்டுத் தொடர்கிறோம்.
எங்கள் மாடல்கள் இப்படித்தான் பயிற்றுவிக்கப்படுகின்றன; ChatGPT மற்றும் Codex-இலும் இப்படித்தான் பயன்பாட்டுக்கு வழங்கப்படுகின்றன. எங்கள் நடைமுறைப் பயன்பாட்டு அமைவுடன் இன்னும் நெருக்கமாகப் பொருந்த, எங்கள் Responses API(புதிய சாளரத்தில் திறக்கும்) மூலம் ARC-AGI-3 சூழல் பணி அமைவைச் செயல்படுத்தினோம். சூழலை நிர்வகிப்பதை எங்கள் API எளிதாக்குகிறது. GPT‑5.6‑ஐப் பொறுத்தவரை, முந்தைய பதிலின் அடையாளத்தை அனுப்பினால் கருவி அழைப்புகள் மற்றும் உரையாடல் சுற்றுகள் முழுவதிலும் ரீஸனிங் தானாகவே தக்கவைக்கப்படும்.
ரீஸனிங் தக்கவைக்கப்பட்டபோது இரண்டு பெரிய மாற்றங்களைக் கவனித்தோம். முதலாவதாக, ஒவ்வொரு சுற்றிலும் விளையாட்டைப் புதிதாகப் புரிந்துகொள்ள வேண்டிய அவசியம் இல்லாததால், ஒவ்வொரு செயலுக்கும் முன்பு GPT‑5.6 Sol சிந்திக்கச் செலவிட்ட நேரம் குறைந்தது. இரண்டாவதாக, முந்தைய சிந்தனைகளை நினைவில் கொள்ள முடிந்தபோது, காலப்போக்கில் கற்பதிலும் ஒத்திசைவான உத்திகளைப் பயன்படுத்துவதிலும் GPT‑5.6 Sol மிகச் சிறப்பாகச் செயல்பட்டது.
நகரும் துண்டிப்புக்குப் பதிலாக Responses API இன் மற்றொரு அமைப்பான சுருக்குதலைப்(புதிய சாளரத்தில் திறக்கும்) பயன்படுத்தியதால் அடுத்த மேம்பாடு கிடைத்தது.
ARC-AGI-3 சூழல் பணி அமைவு, சூழல் வரம்புகளை நகரும் துண்டிப்பு மூலம் கையாள்கிறது. உரையாடல் சூழல் 175,000 எழுத்துகளைத் தாண்டும்போது, மிகப் பழைய செய்திகள் நீக்கப்படுகின்றன.
நகரும் துண்டிப்பில் இரண்டு குறைபாடுகள் உள்ளன. முதலாவதாக, மாடல் முந்தைய அவதானிப்புகளையும் செயல்களையும் இழக்கிறது. இரண்டாவதாக, பணிகளின் பெரும்பகுதியை நிறைவான சூழல் சாளரத்துடன் அது மேற்கொள்கிறது; இது செயல்திறனைச் சற்று பாதிக்கலாம்.
ARC-AGI-3 இல் சுருக்குதலை இயக்கியபோது, ஒவ்வொரு விளையாட்டைப் பற்றியும் கற்றவற்றை நீண்ட செயல்பாடுகள் முழுவதும் GPT‑5.6 Sol-ஆல் சிறப்பாகத் தக்கவைக்க முடிந்தது; குறைவான வெளியீட்டு டோக்கன்களுடன் அதிக மதிப்பெண்ணையும் பெற்றது.
ரீஸனிங்கைத் தக்கவைத்து சுருக்குதலை இயக்குவதன் விளைவை விளக்க, ஒவ்வொரு சூழல் பணி அமைவுடனும் GPT‑5.6 Sol தொடர்ச்சியான ARC-AGI-3 புதிர்களைத் தீர்க்கும்போது அதன் 175K சூழல் சாளரம் செயல்படும் விதத்தைக் காட்டும் அசைவூட்டம் இங்கே உள்ளது.
ஒவ்வொரு சூழல் பணி அமைவும் மாடலின் சூழல் சாளரத்தை எவ்வாறு வெவ்வேறு விதமாகப் பயன்படுத்துகிறது என்பதை நடுவிலுள்ள இரண்டு நெடுவரிசைகள் காட்டுகின்றன. தனது முந்தைய செயல்களைச் சிறப்பாக நினைவில் வைத்திருப்பதால், ஒவ்வொரு செயலுக்கும் GPT‑5.6 Sol குறைவாகச் சிந்தித்து மிக வேகமாக முன்னேறுகிறது. குறிப்பு: எழுத்துகளுக்குப் பதிலாக 175,000 டோக்கன்கள் என்ற வரம்பை எங்கள் செயலாக்கம் பயன்படுத்துகிறது. எனினும், உரையின் பெரும்பகுதி செயல் கட்டங்களாக இருப்பதாலும் அவற்றை 1:1 விகிதத்தில் எங்கள் டோக்கனாக்கி டோக்கன்களாக்குவதாலும், இரண்டும் பெருமளவில் ஒரே மாதிரியாக அமைகின்றன.
ரீஸனிங்கைத் தக்கவைத்தலும் சுருக்குதலும் இணைந்து, GPT‑5.6 Sol (Max) ஏறக்குறைய மும்மடங்கு மதிப்பெண்ணை ஆறில் ஒரு பங்கு வெளியீட்டு டோக்கன்களுடன் பெற உதவுகின்றன.
மாடல்களை மட்டும் மதிப்பீடுகள் தனித்து அளவிடுவது அரிது என்பதை இந்தச் சோதனைகள் நினைவூட்டும் என நம்புகிறோம். API அமைப்புகள், சூழல் பணி அமைவின் வடிவமைப்பு, அறிவுறுத்தல்கள் ஆகியவை தொடர்பான, வெளிப்படையாகத் தெரியாத தேர்வுகளின் தொகுப்பையும் அவை அளவிடுகின்றன. ஒரு பொது அளவுகோலில் கிடைத்த குறைந்த மதிப்பெண்கள் எங்களை ஆச்சரியப்படுத்திய பின்னர், ரீஸனிங் செய்திகளை நீக்கும் பொதுவான சூழல் பணி அமைவை மதிப்பீட்டு இயக்கி பயன்படுத்தியதைக் கண்டறிவது இது முதல்முறை அல்ல.
செயல்திறனை உச்சப்படுத்த முயலும் API உருவாக்குநராக நீங்கள் இருந்தால், எங்கள் சொந்தத் தயாரிப்புகளில் பயன்படுத்தும் பின்வரும் அமைப்புகளையே பயன்படுத்துமாறு பரிந்துரைக்கிறோம்:
- எங்கள் பழைய சாட் கம்ப்ளீஷன்ஸ் API-க்குப் பதிலாக Responses API-ஐப் பயன்படுத்துங்கள்
- ரீஸனிங்கைத் தக்கவையுங்கள்
- சுருக்குதலைப் பயன்படுத்துங்கள்
மேலும், மாடல்களை ஒப்பிடுகிறீர்கள் என்றால், மேலே உள்ள அமைப்புகளைப் பயன்படுத்தும் மதிப்பீடுகளைச் சார்ந்திருக்குமாறு பரிந்துரைக்கிறோம். அவையே ChatGPT மற்றும் Codex-இன் நடைமுறைப் பயன்பாட்டுடன் மிகச் சிறப்பாகப் பொருந்துகின்றன.
AGI மதிப்பீட்டில் பல ஆண்டுகளாக ARC மேற்கொண்ட புதுமையான பணிக்கும், இதை நாங்கள் இன்னும் நெருக்கமாக ஆராயத் தூண்டிய அதன் பகுப்பாய்வுக்கும் நன்றி தெரிவிக்கிறோம்.
அதிநவீன மாடல்களுடன் உங்கள் திறனைச் சோதிக்க விரும்பினால், arcprize.org/tasks(புதிய சாளரத்தில் திறக்கும்) தளத்தில் உள்ள பொதுவான விளையாட்டுகளை நீங்களே முயன்று பாருங்கள்.


