ARC-AGI-3 मानदंड की पहेलियां हल करने का प्रयास करते GPT‑5.6 Sol का तेज़ किया गया वीडियो. बाईं ओर आधिकारिक हार्नेस और दाईं ओर हमारा रिस्पॉन्सेज़ API हार्नेस है, जो रीज़निंग बनाए रखता और कम्पैक्शन चालू करता है. इस खेल(एक नई विंडो में खुलेगा) की अग्रणी सूची में कोई भी अत्याधुनिक मॉडल पहले स्तर से आगे का कोई स्तर हल नहीं करता. हमारे हार्नेस से GPT‑5.6 Sol सभी छह स्तर हल करता है.
जब हमने पहली बार ARC-AGI-3(एक नई विंडो में खुलेगा) मानदंड पर GPT‑5.6 Sol के कम स्कोर देखे, तो हम हैरान रह गए.
GPT‑5.6 Sol ने गणित की लंबे समय से अनसुलझी समस्याएं हल की हैं, जैसे चक्र द्वि-आवरण अनुमान(एक नई विंडो में खुलेगा), और पोकेमॉन फ़ायररेड जैसे खेलों को भी मात दी है. लेकिन द्वि-आयामी पहेली खेलों के मानदंड ARC-AGI-3 पर GPT‑5.6 Sol ने केवल 7.8% स्कोर किया, जबकि GPT‑5.5 बमुश्किल खेल पाया और उसका स्कोर महज़ 0.4% रहा.
क्या द्वि-आयामी पहेली खेल हमारे मॉडलों के लिए असामान्य रूप से कठिन थे? या वजह कुछ और थी?
मानदंड शायद ही कभी AI मॉडलों को अलग-थलग मापते हैं. वे API सेटिंग, हार्नेस की बनावट और निर्देश देने से जुड़े कम दिखाई देने वाले विकल्पों को भी मापते हैं. ARC-AGI-3 के मामले में हमने पाया कि ChatGPT और Codex में इस्तेमाल होने वाली दो API सेटिंग—रीज़निंग बनाए रखना और कम्पैक्शन—चालू करने से सार्वजनिक कार्य-समूह पर स्कोर तीन गुना हो गया और आउटपुट टोकन छह गुना घट गए.
आधिकारिक हार्नेस के साथ, GPT‑5.6 Sol ने ARC-AGI-3 के सार्वजनिक सेट पर 13.3% स्कोर किया. रीज़निंग बनाए रखने और कम्पैक्शन के साथ उसने 38.3% स्कोर किया. स्कोर सापेक्ष मानवीय कार्रवाई दक्षता (RHAE(एक नई विंडो में खुलेगा))—यानी मॉडल के प्रदर्शन की मानवीय आधार-स्तर से तुलना करने वाला माप—दर्शाते हैं. आधिकारिक गेमप्ले लॉग(एक नई विंडो में खुलेगा) के आधार पर हमारा अनुमान है कि औसत मानव परीक्षक का स्कोर 48% था. मॉडलों को यह नहीं बताया जाता कि उन्हें कैसे स्कोर दिया जाएगा और वे खेल के दौरान अपना स्कोर नहीं देख सकते—कार्रवाइयों के जवाब में केवल हर फ़्रेम और मौजूदा स्तर का पाठ्य रूप मिलता है.
ARC-AGI-3 एक ऐसा मानदंड है जिसे यह मापने के लिए बनाया गया है कि AI एजेंट कितनी अच्छी तरह सीखते और रीज़निंग करते हैं. एजेंट अपरिचित द्वि-आयामी खेलों को आज़माते हैं और स्पष्ट निर्देशों के बिना उनके काम करने का तरीका समझते हैं. आप arcprize.org/tasks(एक नई विंडो में खुलेगा) पर 25 प्रदर्शन खेल खेल सकते हैं.
ARC-AGI-3 में जानबूझकर एक सामान्य हार्नेस इस्तेमाल होता है, जिसमें कोई टूल या विशेष सुविधा नहीं है. ARC का तर्क था कि सरल हार्नेस से मॉडल की कमियां अधिक स्पष्ट दिखती हैं और मॉडलों की तुलना अधिक निष्पक्ष होती है. इसके विपरीत, व्यावसायिक डेवलपर हर मॉडल की सुविधाओं और खास व्यवहार के अनुसार हार्नेस को अनुकूलित करते हैं.
खेलों में GPT‑5.6 Sol ने केवल दृश्य-आधारित हार्नेस से पोकेमॉन फ़ायररेड को हराया है, जिसका प्रसारण GPT_Plays_Pokemon(एक नई विंडो में खुलेगा) ने किया था. Codex के कंप्यूटर उपयोग से स्ले द स्पायर को हराया है, जिसका प्रसारण EpochAI(एक नई विंडो में खुलेगा) ने किया था. इसने बाबा इज़ यू के शुरुआती चरण भी पूरे किए हैं, जैसा प्योत्र मिगदाउ & प्योत्र ग्राबोव्स्की(एक नई विंडो में खुलेगा) ने साझा किया. ARC-AGI-3 में ऐसा क्या अलग था?

ईथन मोलिक दिखाते हैं(एक नई विंडो में खुलेगा) कि Codex में GPT‑5.6 Sol, स्ले द स्पायर 2 की एक क्रमरहित दैनिक चुनौती को हरा रहा है. यह खेल GPT‑5.6 Sol की ज्ञान-सीमा के बाद जारी हुआ था.
GPT‑5.5 की कमियों पर ARC के विश्लेषण(एक नई विंडो में खुलेगा) से प्रेरित होकर हमने GPT‑5.6 Sol के कुछ प्रयासों की जांच की. ARC की तरह हमें भी लगा कि मॉडल बहुत समझदार नहीं दिख रहा था. वह हर कार्रवाई पर बहुत देर सोचता था और आगे बढ़ने में जूझता था.
लेकिन गहराई से देखने पर हमने पाया कि मॉडल की अधिकतर उलझन उसकी अपनी अंतर्निहित कमी नहीं, बल्कि हार्नेस की सेटिंग्स का परिणाम थी.
सबसे पहले हमने देखा कि खेल की हर कार्रवाई के बाद पूरी निजी रीज़निंग हटा दी जाती थी. इसका अर्थ था कि हर कार्रवाई के साथ GPT‑5.6 Sol को खेल फिर से समझना पड़ता था, क्योंकि उसे अपनी पिछली सोच याद नहीं रहती थी. मॉडल पिछली चालों का रिकॉर्ड और उनके साथ लिखी संक्षिप्त टिप्पणियां तो देख सकता था, लेकिन उन तक पहुंचाने वाली योजनाएं, सूझ या विचार नहीं देख सकता था.
दूसरा, हमने देखा कि हार्नेस में खिसकती हुई कटौती विंडो इस्तेमाल होती थी, जिससे इतिहास बढ़ने पर पुरानी कार्रवाइयां दिखनी बंद हो जाती थीं. इसलिए GPT‑5.6 Sol न केवल अपनी पिछली सोच याद नहीं रख पाता था, बल्कि उसकी पिछली कार्रवाइयों की स्मृति भी मिटती जाती थी.
हार्नेस की ये दोनों विशेषताएं—रीज़निंग हटाना और खिसकती हुई कटौती—मिलकर समझाती हैं कि GPT‑5.6 Sol समय के साथ सीखने में क्यों जूझ रहा था.
हमारे मॉडलों को जवाब या टूल कॉल देने से पहले निजी रीज़निंग संदेशों के माध्यम से सोचने का प्रशिक्षण दिया जाता है. इन निजी सोच वाले संदेशों को बातचीत के इतिहास के हिस्से के रूप में बनाए रखा जाता है. बातचीत बहुत लंबी हो जाए तो हम उसका सार बनाकर आगे बढ़ते हैं.
हमारे मॉडलों को इसी तरह प्रशिक्षित किया जाता है और ChatGPT व Codex में भी इसी तरह लागू किया जाता है. अपनी उत्पादन व्यवस्था से बेहतर तालमेल के लिए हमने अपनी रिस्पॉन्सेज़ API(एक नई विंडो में खुलेगा) से ARC-AGI-3 हार्नेस लागू किया. हमारी API से कॉन्टेक्स्ट संभालना आसान है. GPT‑5.6 के लिए पिछली प्रतिक्रिया की ID देने पर टूल कॉल और संवाद-चक्रों के बीच रीज़निंग अपने आप बनी रहती है.
रीज़निंग बनाए रखने पर हमें दो बड़े बदलाव दिखे. पहला, GPT‑5.6 Sol ने हर कार्रवाई से पहले सोचने में कम समय लगाया, क्योंकि अब उसे हर बार खेल को नए सिरे से समझने की ज़रूरत नहीं थी. दूसरा, पिछली सोच याद रख पाने पर GPT‑5.6 Sol समय के साथ सीखने और सुसंगत रणनीतियां अपनाने में कहीं बेहतर रहा.
अगला सुधार खिसकती हुई कटौती की जगह कम्पैक्शन(एक नई विंडो में खुलेगा) लगाने से आया, जो रिस्पॉन्सेज़ API की एक और सेटिंग है.
ARC-AGI-3 हार्नेस कॉन्टेक्स्ट की सीमाओं को खिसकती हुई कटौती से संभालता है. बातचीत का कॉन्टेक्स्ट 175,000 वर्णों से अधिक होने पर सबसे पुराने संदेश हटा दिए जाते हैं.
खिसकती हुई कटौती की दो कमियां हैं. पहला, मॉडल अपनी शुरुआती टिप्पणियां और कार्रवाइयां भूल जाता है. दूसरा, वह कार्य का अधिकतर समय अपेक्षाकृत भरी हुई कॉन्टेक्स्ट विंडो के साथ काम करता है, जिससे प्रदर्शन थोड़ा घट सकता है.
ARC-AGI-3 पर कम्पैक्शन चालू करने के बाद GPT‑5.6 Sol लंबे प्रयासों के दौरान हर खेल के बारे में सीखी बातें बेहतर ढंग से सहेज पाया और कम आउटपुट टोकन में अधिक स्कोर हासिल किया.
रीज़निंग बनाए रखने और कम्पैक्शन चालू करने का प्रभाव दिखाने के लिए यह ऐनिमेशन बताता है कि हर हार्नेस के साथ ARC-AGI-3 की कई पहेलियां हल करते समय GPT‑5.6 Sol की 175K कॉन्टेक्स्ट विंडो कैसे इस्तेमाल होती है.
बीच के दो स्तंभ दिखाते हैं कि हर हार्नेस मॉडल की कॉन्टेक्स्ट विंडो को अलग तरह से कैसे इस्तेमाल करता है. अपने अतीत की बेहतर स्मृति होने से GPT‑5.6 Sol हर कार्रवाई पर कम सोचता है और बहुत तेज़ी से आगे बढ़ता है. ध्यान दें: हमारे कार्यान्वयन में वर्णों के बजाय 175,000 टोकन की सीमा है, लेकिन अंततः दोनों लगभग समान हैं, क्योंकि अधिकांश पाठ कार्रवाई ग्रिड का है, जिसे हमारा टोकनाइज़र 1:1 अनुपात में टोकन में बांटता है.
रीज़निंग बनाए रखने और कम्पैक्शन से मिलकर GPT‑5.6 Sol (मैक्स) लगभग तीन गुना स्कोर हासिल करता है और छह गुना कम आउटपुट टोकन इस्तेमाल करता है.
हमें आशा है कि ये प्रयोग याद दिलाएंगे कि मूल्यांकन शायद ही कभी मॉडलों को अलग-थलग मापते हैं. वे API सेटिंग, हार्नेस की बनावट और निर्देश देने से जुड़े कम दिखाई देने वाले विकल्पों के समूह को भी मापते हैं. यह पहली बार नहीं है जब किसी सार्वजनिक मानदंड पर कम स्कोर ने हमें चौंकाया और बाद में पता चला कि मूल्यांकन संचालक ऐसे सामान्य हार्नेस का उपयोग कर रहा था जो रीज़निंग संदेश हटा देता था.
अगर आप प्रदर्शन को अधिकतम करने की कोशिश कर रहे API डेवलपर हैं, तो हम वही सेटिंग्स इस्तेमाल करने की सलाह देते हैं जिन्हें हम अपने उत्पादों में लागू करते हैं:
- हमारी पुरानी चैट कम्प्लीशन्स API के बजाय रिस्पॉन्सेज़ API इस्तेमाल करें
- रीज़निंग बनाए रखें
- कम्पैक्शन इस्तेमाल करें
अगर आप मॉडलों की तुलना कर रहे हैं, तो हम ऐसे मूल्यांकनों पर भरोसा करने की सलाह देते हैं जो ऊपर दी गई सेटिंग्स इस्तेमाल करते हैं, क्योंकि वे ChatGPT और Codex में वास्तविक उपयोग से सबसे अच्छी तरह मेल खाते हैं.
AGI मूल्यांकन पर वर्षों से किए गए रचनात्मक कार्य और हमें यहां गहराई से देखने की प्रेरणा देने वाले विश्लेषण के लिए हम ARC के आभारी हैं.
अगर आप अत्याधुनिक मॉडलों के सामने अपनी क्षमता आज़माना चाहते हैं, तो arcprize.org/tasks(एक नई विंडो में खुलेगा) पर सार्वजनिक खेल खुद खेलें.


