मुख्य मजकूराकडे जा
OpenAI

२९ जुलै, २०२६

रिसर्चप्रकाशन

दोन सेटिंग्स सक्षम केल्याने ARC-AGI-3 बेंचमार्कवर आमचे स्कोअर कसे तिप्पट झाले

लोड होत आहे...

ARC-AGI-3 बेंचमार्कमधील पझल्स सोडवण्याचा GPT‑5.6 Sol चा वेगवान केलेला व्हिडिओ. (डावीकडे) अधिकृत हार्नेस आहे, तर (उजवीकडे) रीझनिंग कायम ठेवणारा आणि कॉम्पॅक्शन सुरू करणारा आमचा रिस्पॉन्सेस API हार्नेस आहे. या गेमच्या(नवीन विंडोमध्ये उघडेल) क्रमवारीत कोणतेही अत्याधुनिक मॉडेल पहिल्या पातळीपुढील एकही पातळी सोडवत नाही. आमच्या हार्नेससह GPT‑5.6 Sol सर्व सहा पातळ्या सोडवतो.

GPT‑5.6 Sol चा ARC-AGI-3(नवीन विंडोमध्ये उघडेल) बेंचमार्कवरील कमी स्कोअर प्रथम पाहिला, तेव्हा आम्ही गोंधळात पडलो.

GPT‑5.6 Sol ने गणितातील सायकल डबल कव्हर अनुमानासारखे(नवीन विंडोमध्ये उघडेल) दीर्घकाळ अनुत्तरित असलेले प्रश्न सोडवले आहेत आणि Pokémon FireRed सारखे गेम जिंकले आहेत. पण 2D पझल गेम्सचा बेंचमार्क असलेल्या ARC-AGI-3 वर GPT‑5.6 Sol ला केवळ 7.8% स्कोअर मिळाला, तर GPT‑5.5 ला हे गेम जवळपास खेळताही आले नाहीत आणि त्याला जेमतेम 0.4% स्कोअर मिळाला.

आमच्या मॉडेल्ससाठी 2D पझल गेम्स नेहमीपेक्षा जास्त कठीण होते का? की आणखी काहीतरी वेगळेच घडत होते?

बेंचमार्क क्वचितच AI मॉडेलचे स्वतंत्रपणे मापन करतात. ते API सेटिंग्ज, हार्नेसची रचना आणि प्रॉम्प्टिंग पद्धतीशी संबंधित कमी दृश्यमान निवडींचेही मापन करतात. ARC-AGI-3 च्या बाबतीत, ChatGPT आणि Codex मध्ये आम्ही वापरत असलेली—रीझनिंग आणि कॉम्पॅक्शन कायम ठेवणे—ही दोन API सेटिंग्ज सुरू केल्यावर सार्वजनिक कार्यसंचावरील स्कोअर तिप्पट झाले आणि आउटपुट टोकन सहापटीने कमी झाल्याचे आम्हाला आढळले.

अधिकृत हार्नेससह, GPT‑5.6 Sol ने ARC-AGI-3 च्या पब्लिक सेटवर 13.3% स्कोअर मिळवला. रीझनिंग कायम ठेवल्यावर आणि कॉम्पॅक्शन वापरल्यावर त्याने 38.3% स्कोअर मिळवले. स्कोअरद्वारे सापेक्ष मानवी कृती कार्यक्षमता (RHAE(नवीन विंडोमध्ये उघडेल))म्हणजे मानवी बेसलाईनशी मॉडेलच्या कामगिरीची तुलना करणारे मापनमोजले जाते. अधिकृत गेमप्ले लॉग्सवरून(नवीन विंडोमध्ये उघडेल), आमच्या अंदाजानुसार मानवी परीक्षकांनी सरासरी 48% स्कोअर मिळवला. मॉडेलना स्कोअर कसा दिला जाईल हे सांगितले जात नाही आणि खेळताना त्यांना आपले स्कोअर दिसत नाहीतप्रत्येक कृतीनंतर फक्त त्या दृश्याचे मजकूररूप आणि ते कोणत्या पातळीवर आहेत ही माहिती मिळते.

ARC-AGI-3

AI एजंट किती चांगल्या प्रकारे शिकतात आणि रीझनिंग करतात हे मोजण्यासाठी ARC-AGI-3 हा बेंचमार्क तयार केला आहे. एजंट अपरिचित 2D गेम्सचा शोध घेतात आणि स्पष्ट सूचना नसतानाही ते कसे चालतात याचा अंदाज लावतात. तुम्ही arcprize.org/tasks(नवीन विंडोमध्ये उघडेल) वर 25 डेमो गेम्स खेळू शकता.

ARC-AGI-3 मध्ये टूल्स किंवा विशेष वैशिष्ट्ये नसलेला, मुद्दाम सर्वसाधारण ठेवलेला हार्नेस वापरला जातो. साध्या हार्नेसमुळे मॉडेलच्या उणिवा अधिक स्पष्ट दिसतात आणि मॉडेलची तुलना अधिक न्याय्य होते, असे ARC चे रीझनिंग होते. याउलट, व्यावसायिक डेव्हलपर प्रत्येक मॉडेलची वैशिष्ट्ये आणि वैशिष्ट्यपूर्ण वर्तन लक्षात घेऊन हार्नेस अधिक परिणामकारक बनवतात.

गेमिंगमध्ये, GPT‑5.6 Sol ने केवळ दृश्यावर आधारित हार्नेस वापरून Pokémon FireRed जिंकला आहे (GPT_Plays_Pokemon(नवीन विंडोमध्ये उघडेल) यांनी थेट प्रक्षेपित केल्याप्रमाणे), Codex द्वारे संगणक वापरून Slay the Spire जिंकला आहे (EpochAI(नवीन विंडोमध्ये उघडेल) यांनी थेट प्रक्षेपित केल्याप्रमाणे) आणि Baba Is You चे सुरुवातीचे टप्पे पूर्ण केले आहेत (Piotr Migdał & Piotr Grabowski(नवीन विंडोमध्ये उघडेल) यांनी शेअर केल्याप्रमाणे). मग ARC-AGI-3 मध्ये इतके वेगळे काय होते?

Codex मधील GPT-5.6 Sol ने, Slay the Spire 2 मधील रँडम दैनंदिन आव्हान पूर्ण केले.

GPT‑5.6 Sol च्या ज्ञानाची अंतिम मर्यादा निश्चित झाल्यानंतर प्रकाशित झालेल्या Slay the Spire 2 या गेममधील रँडम दैनंदिन आव्हानाला Codex मधील GPT‑5.6 Sol कसा हरवतो, हे Ethan Mollick दाखवतात(नवीन विंडोमध्ये उघडेल).

GPT‑5.5 च्या उणिवांवरील ARC च्या विश्लेषणातून(नवीन विंडोमध्ये उघडेल) प्रेरणा घेऊन आम्ही GPT‑5.6 Sol चे काही प्रयत्न तपासले. ARC प्रमाणेच, आम्हालाही मॉडेल फारसे हुशार वाटले नाही. ते प्रत्येक कृतीवर बराच वेळ घालवत होते आणि पुढे जाण्यासाठी झगडत होते.

पण अधिक खोलवर तपासल्यावर आम्हाला आढळले की मॉडेलचा बराचसा गोंधळ हा त्याचा अंगभूत दोष नसून हार्नेसमधील सेटिंग्जमुळे निर्माण झाला होता.

सर्वप्रथम, आमच्या लक्षात आले की गेममधील प्रत्येक कृतीनंतर, सर्व खाजगी रीझनिंग बाजूला सारला जात होता. याचा अर्थ असा होता की प्रत्येक कृतीसोबत, GPT‑5.6 Sol ला आपला पूर्वीचा विचार आठवू न शकल्यामुळे, गेम नव्याने समजून घेण्यास सांगितले जात होते. मॉडेलला पूर्वीच्या चालींची नोंद आणि त्यासोबतच्या संक्षिप्त नोंदी अजूनही दिसत होत्या, परंतु त्या चालींपर्यंत पोहोचवणाऱ्या योजना, सखोल माहिती किंवा विचार त्याला दिसू शकत नव्हते.

दुसरे म्हणजे, आम्ही पाहिले की त्या हार्नेसमध्ये एक रोलिंग ट्रंकेशन विंडो वापरली होती, ज्यामुळे इतिहास जसजसा वाढत गेला तसतसे जुन्या कृती अदृश्य होत गेल्या. त्यामुळे GPT‑5.6 Sol केवळ आपले पूर्वीचे विचारच आठवू शकत नव्हते असे नाही, तर ते आपल्या पूर्वीच्या कृतींची स्मृतीदेखील गमावत होते.

रीझनिंग वगळणे आणि रोलिंग ट्रंकेशन ही हार्नेसची दोन्ही वैशिष्ट्ये एकत्रितपणे GPT‑5.6 Sol ला कालांतराने शिकताना अडचण का येत होती, हे स्पष्ट करतात.

एजंट जेव्हा आपण काय केले आहे हे लक्षात ठेवतात, तेव्हा ते सर्वोत्तम कामगिरी करतात

आमचे मॉडेल्स, प्रतिसाद देण्यापूर्वी किंवा टूल कॉल्स करण्यापूर्वी, खाजगी रीझनिंग संदेशांसह विचार करण्यासाठी प्रशिक्षित केले जातात. हे खाजगी विचारांचे संदेश संभाषणाच्या इतिहासाचा भाग म्हणून सेव्ह केले जातात. जर संभाषण खूप लांबले, तर आम्ही त्याचा सारांश तयार करून ते पुढे चालू ठेवतो.

दीर्घकाळ चालणाऱ्या कार्यात मॉडेलचे रीझनिंग, टूल कॉल्स, संभाषणाचा इतिहास आणि कॉन्टेक्स्ट कॉम्पॅक्शन एकत्र कसे कार्य करतात हे दाखवणारा आकृतीबंध.

आमच्या मॉडेलना याच पद्धतीने प्रशिक्षण दिले जाते आणि ChatGPT व Codex मध्येही ती याच पद्धतीने उपयोजित केली जातात. आमच्या प्रत्यक्ष उत्पादन व्यवस्थेशी अधिक चांगले जुळण्यासाठी आम्ही आमच्या रिस्पॉन्सेस API(नवीन विंडोमध्ये उघडेल) च्या मदतीने ARC-AGI-3 हार्नेस कार्यान्वित केला. आमचा API कॉन्टेक्स्टचे व्यवस्थापन सोपे करतो: GPT‑5.6 साठी मागील प्रतिसादाचा ID दिल्यास टूल कॉल्स आणि संवादाच्या फेऱ्यांदरम्यान रीझनिंग आपोआप कायम राहते.

रीझनिंग कायम ठेवल्यावर आम्हाला दोन मोठे बदल दिसले. प्रथम, GPT‑5.6 Sol ने प्रत्येक कृतीपूर्वी विचार करण्यात कमी वेळ घालवला, कारण प्रत्येक फेरीत त्याला गेम पुन्हा सुरुवातीपासून समजून घ्यावा लागत नव्हता. दुसरे म्हणजे, मागील विचार आठवत असल्याने GPT‑5.6 Sol कालांतराने शिकण्यात आणि सुसंगत रणनीती वापरण्यात अधिक सक्षम झाला.

यानंतरची सुधारणा रोलिंग ट्रंकेशनऐवजी रिस्पॉन्सेस API मधील आणखी एक सेटिंग असलेले कॉम्पॅक्शन(नवीन विंडोमध्ये उघडेल) वापरल्याने झाली.

ARC-AGI-3 हार्नेस रोलिंग ट्रंकेशन वापरून कॉन्टेक्स्टच्या मर्यादा हाताळतो. संभाषणाचा कॉन्टेक्स्ट 1,75,000 वर्णांपेक्षा मोठा झाल्यावर सर्वांत जुने संदेश वगळले जातात.

रोलिंग ट्रंकेशनचे दोन तोटे आहेत. प्रथम, मॉडेल आधीची निरीक्षणे आणि कृती विसरते. दुसरे म्हणजे, कार्यांचा बराचसा भाग ते अधिक भरलेल्या कॉन्टेक्स्ट विंडोसह पूर्ण करते, ज्यामुळे कामगिरी किंचित खालावू शकते.

ARC-AGI-3 वर कॉम्पॅक्शन सुरू केल्यावर GPT‑5.6 Sol ला दीर्घकाळ चालणाऱ्या प्रयत्नांदरम्यान प्रत्येक गेमबद्दल शिकलेली माहिती अधिक चांगल्या प्रकारे जपता आली आणि कमी आउटपुट टोकन वापरून अधिक स्कोअर मिळवता आला.

रीझनिंग कायम ठेवणे आणि कॉम्पॅक्शन सुरू करणे यांचा परिणाम दाखवण्यासाठी, प्रत्येक हार्नेससह ARC-AGI-3 पझल्सची मालिका सोडवताना GPT‑5.6 Sol ची 175K कॉन्टेक्स्ट विंडो दाखवणारे हे ॲनिमेशन पहा.

मधले दोन कॉलम दर्शवतात की प्रत्येक हार्नेसद्वारे मॉडेल कॉन्टेक्स्ट विंडोचा वापर कसा वेगळ्या प्रकारे केला जातो. आपल्या भूतकाळाची उत्तम स्मृती असल्यामुळे, GPT‑5.6 Sol प्रत्येक कृतीसाठी कमी विचार करते आणि खूप वेगाने पुढे जाते. टीप: आमच्या अंमलबजावणीमध्ये वर्णांऐवजी 1,75,000 टोकन्सची मर्यादा वापरली आहे, परंतु हे बरेचसे सारखेच ठरते, कारण बहुतांश मजकूर हा ॲक्शन ग्रिड्स असतो, जे आमच्या टोकनायझरद्वारे 1:1 प्रमाणात टोकनाइझ केले जातात.

रीझनिंग आणि कॉम्पॅक्शन कायम ठेवणे यांमुळे GPT‑5.6 Sol (Max) सुमारे तिप्पट स्कोअर मिळवू शकतो आणि त्यासाठी सहापट कमी आउटपुट टोकन वापरतो.

निष्कर्ष आणि शिफारशी

हे प्रयोग याची आठवण करून देतील अशी आम्हाला आशा आहे की मूल्यमापनांमध्ये क्वचितच मॉडेलचे स्वतंत्रपणे मापन होते. त्यांत API सेटिंग्ज, हार्नेसची रचना आणि प्रॉम्प्टिंग पद्धतीशी संबंधित कमी दृश्यमान निवडींच्या संचाचेही मापन होते. सार्वजनिक बेंचमार्कवरील कमी स्कोअरने आम्हाला आश्चर्य वाटण्याची आणि त्यानंतर मूल्यमापन चालवणारी प्रणाली रीझनिंग संदेश वगळणारा सर्वसाधारण हार्नेस वापरत असल्याचे आढळण्याची ही पहिलीच वेळ नाही.

तुम्ही कामगिरी कमाल पातळीवर नेण्याचा प्रयत्न करणारे API डेव्हलपर असाल, तर आमच्या स्वतःच्या उत्पादनांमध्ये वापरलेली पुढील सेटिंग्ज वापरण्याची आम्ही शिफारस करतो:

  • आमच्या जुन्या चॅट कम्प्लीशन्स API ऐवजी आमचे रिस्पॉन्सेस API वापरा
  • रीझनिंग कायम ठेवा
  • कॉम्पॅक्शन वापरा

तसेच, तुम्ही मॉडेलची तुलना करत असाल, तर वरील सेटिंग्ज वापरणाऱ्या मूल्यमापनांवर अवलंबून राहण्याची आम्ही शिफारस करतो. ही सेटिंग्ज ChatGPT आणि Codex मधील प्रत्यक्ष वापराशी सर्वोत्तम प्रकारे जुळतात.

AGI मूल्यमापनावर अनेक वर्षे सर्जनशील काम केल्याबद्दल आणि आम्हाला येथे अधिक बारकाईने पाहण्याची प्रेरणा देणाऱ्या विश्लेषणाबद्दल आम्ही ARC चे आभारी आहोत.

अत्याधुनिक मॉडेलसमोर स्वतःचे कौशल्य आजमावायचे असल्यास, arcprize.org/tasks(नवीन विंडोमध्ये उघडेल) वरील पब्लिक गेम्स स्वतः खेळून पहा.

लेखक

Ilan Bigio आणि Ted Sanders