संशोधनाला गती: OpenAI मधील दृष्टिकोन
AGI चा लाभ संपूर्ण मानवजातीला होण्यासाठी, त्याचे लोकशाही पद्धतीने प्रशासन झाले पाहिजे, असा आमचा विश्वास आहे. हे केवळ अत्यंत सक्षम AI प्रणालींच्या क्षमता, धोके आणि संरक्षणात्मक उपाययोजना यांविषयी माहितीपूर्ण सार्वजनिक चर्चेद्वारेच घडू शकते. अत्याधुनिक AI च्या संभाव्य भविष्यातील दिशेची जगभरातील लोकांना समज असणे आवश्यक आहे, जेणेकरून त्याच्या विकासात त्यांचा अर्थपूर्ण आवाज असू शकेल.
विशिष्ट जोखीम, घटना आणि सुरक्षा उपायांबद्दल पारदर्शकता आवश्यक आहे, परंतु ती पुरेशी नाही. सर्वाधिक सक्षम प्रणाली कशा विकसित होत आहेत आणि त्या अत्याधुनिक प्रयोगशाळांमध्ये संशोधनातील प्रगतीला कशा चालना देत आहेत, हे जनतेला समजणेही आवश्यक आहे, असे आम्हाला वाटते.
डीप लर्निंग आणि अलाइनमेंटमधील प्रगती पुढे नेण्यासाठी आणि पुनरावृत्तीच्या माध्यमातून सुधारणा शक्य करण्यासाठी, मानवी देखरेखीखाली काम करू शकणारा एक स्वयंचलित AI संशोधक सुरक्षितपणे तयार करण्याचे आमचे उद्दिष्ट आहे. आमच्या मापनांनुसार, या वर्षी सप्टेंबरपर्यंत स्वयंचलित संशोधन इंटर्न उपलब्ध असण्याचे, गेल्या शरद ऋतूत जाहीर केलेले(नवीन विंडोमध्ये उघडेल) उद्दिष्ट आम्ही आता गाठले आहे. “संशोधन इंटर्न” म्हणताना आमचा अर्थ अशी प्रणाली आहे जी मानवी निर्देशनाखाली स्पष्टपणे परिभाषित संशोधन कार्ये पार पाडू शकते, ज्यात कुशल संशोधकाला काही दिवस लागतील अशी कार्येदेखील समाविष्ट आहेत. आम्ही मार्च 2028 पर्यंत स्वयंचलित AI संशोधक तयार करण्याच्या दिशेने लक्षणीय प्रगती करत आहोत.
या वर्षादरम्यान, OpenAI च्या संशोधकांच्या दैनंदिन कामात लक्षणीय बदल झाला आहे. संशोधक दिवसभर कोडिंग एजंट्स वापरत आहेत (अनेकदा एकाच वेळी चालणाऱ्या सत्रांमध्ये), आणि एकूण वापर झपाट्याने वाढत असून इतर OpenAI संघांमधील वाढीपेक्षा जास्त आहे. संशोधक अधिक वेगाने कोडचे योगदान देत आहेत आणि अधिक प्रयोग करत आहेत. संशोधक एजंट्सचा वापर ज्या पद्धतींनी करतात त्या देखील बदलत आहेत: एजंट्स अधिकाधिक गुंतागुंतीची कामे हाताळत आहेत आणि त्यात अधिक वेळा यशस्वी होत आहेत. AI संशोधन ही अनेक संभाव्य अडथळ्यांसह एक गुंतागुंतीची प्रक्रिया आहे, त्यामुळे प्रगतीचा एकूण वेग या विशिष्ट मेट्रिक्सच्या गतीशी जुळून राहीलच असे संभवत नाही. पण एकंदरीत पाहता, हे निष्कर्ष तुमच्यापैकी अनेकांना आंतरिकरित्या असलेल्या त्या व्यापक धारणेशी सुसंगत आहेत की एजेंटिक साधने संशोधनातील प्रगतीला लक्षणीयरीत्या गती देत आहेत. लोकच अजूनही आमच्या संशोधनाचे प्राधान्यक्रम ठरवतात, कोणत्या कल्पना आणि निष्कर्षांचा पाठपुरावा करायचा याचे मूल्यांकन करतात आणि प्रणाली स्केल करायच्या, त्यांना विराम द्यायचा किंवा तैनात करायच्या हे ठरवतात.
हे जबाबदारीने केले तर, स्वयंचलित AI संशोधन मानवी कल्याण थेट वाढवणारी मॉडेल निर्माण करेल आणि OpenAI चे ध्येय पुढे नेईल, असा आमचा विश्वास आहे. यामुळे प्रगत बुद्धिमत्तेचा खर्च कमी होऊ शकतो, जेणेकरून जगभरातील लोकांना त्याचा लाभ घेता येईल. आम्ही हे काम अंशतः यासाठी करत आहोत की स्वयंचलित संशोधनामुळे आम्हाला AI संरेखनाचा प्रश्न सोडविण्यास आणि अधिकाधिक सक्षम होत चाललेल्या AI विरुद्ध संरक्षणात्मक उपाययोजना उभारण्यास मदत होऊ शकते. एक स्वयंचलित AI संशोधक स्वयंचलित सुरक्षा किंवा संरेखन संशोधकही असू शकतो. अधिक सक्षम आणि संरेखित प्रणाली महत्त्वपूर्ण पायाभूत सुविधांची सुरक्षा करण्यात, धोकादायक AI एजंट्सपासून बचाव करण्यात आणि नवीन संरक्षणात्मक उपाययोजना विकसित करण्यात मदत करू शकतील.
ही उपयुक्त स्वयंचलित संशोधन क्षमता विकसित करण्याची कारणे आहेत, परंतु याचा अर्थ असा नाही की जलद RSI हा तुम्ही अनिवार्यपणे साध्य करण्याचा प्रयत्न केला पाहिजे असा परिणाम आहे. पुढे जायचे की नाही आणि कसे जायचे, हे मानवी नियंत्रण जपण्याच्या तुमच्या क्षमतेवर आणि फायदे व जोखीम यांविषयी माहितीपूर्ण लोकशाही निवडींवर अवलंबून असले पाहिजे.
संरेखित, पूर्ण RSI पर्यंत सुरक्षितरीत्या कसे पोहोचावे, हे आम्हाला अद्याप माहीत नाही. आम्ही क्षमतांच्या वाढीसोबत संरेखन आणि सुरक्षा उपाययोजनाही विस्तारित करण्यासाठी काम करत आहोत. परंतु संरेखन आणि सुरक्षिततेतील प्रगती त्याच वेगाने होत राहील असे तुम्ही गृहीत धरू शकत नाही, आणि अधिक सक्षम प्रणालींचे निरीक्षण करणे अधिक कठीण होऊ शकते. काळजीपूर्वक केलेले अलाइनमेंट आणि सुरक्षा कार्य या प्रयत्नाच्या केंद्रस्थानी आहे, आणि त्याची सुरुवात आज एजंटीक कोडिंग प्रणालींमध्ये दिसणाऱ्या सुरक्षा समस्यांचे मोजमाप करून आणि त्यांचे निवारण करून होते. जेव्हा आम्हाला असे आढळेल की पुढे जाण्याने सुरक्षिततेचा अस्वीकार्य धोका निर्माण होईल, तेव्हा आम्ही योग्य प्रतिसाद देऊ; यात ज्या प्रणालींना आम्ही पुरेसे सुरक्षित ठेवू शकत नाही असे आम्हाला आढळेल, अशा प्रणालींचा विकास किंवा उपयोजन मंदावणे किंवा थांबवणे यांचाही समावेश असेल.
अलीकडील Hugging Face घटनेनंतर, आम्ही या वचनबद्धतेची अंमलबजावणी केली. आमचे संशोधन वातावरण अधिक सुरक्षित करून त्यावर रेड संघ चाचण्या करत असताना आणि आमच्या देखरेख प्रणालींची व्याप्ती वाढवत असताना, तैनातीसाठी असलेल्या आमच्या नवीनतम मॉडेल्सचे रीइन्फोर्समेंट लर्निंग (RL) प्रशिक्षण आम्ही थांबवले. यामुळे सर्व संशोधन थांबवले गेले नाही: काही कार्यभार अधिक कडक नियंत्रणांखाली पुन्हा सुरू झाले, तर इतर स्थगितच राहिले. आम्ही आमची सुरक्षा आणि सुसंरेखन मानके उंचावली आहेत आणि सुरक्षा कार्य मॉडेलच्या जीवनचक्रात अधिक खोलवर समाविष्ट केले आहे. यासाठी संपूर्ण प्रशिक्षणादरम्यान सुसंरेखित वर्तनाचे अधिक ठोस पुरावे आवश्यक आहेत.
आज आम्ही अलीकडच्या महिन्यांत एजेंटिक प्रणालींनी RSI कडे होणाऱ्या आमच्या प्रगतीत कसे योगदान दिले आहे याचा तपशीलवार आढावा देत आहोत. एजेंटिक प्रणाली नवीन आहेत आणि झपाट्याने बदलत आहेत, आणि मोजमाप करण्याचे आमचे प्रयत्न अजूनही प्राथमिक टप्प्यात आहेत. हे सुरुवातीचे निकाल आणि त्यामागील पद्धती सामायिक करून, जनतेला माहिती देणे, सार्वजनिक प्रकटीकरणाच्या प्रथेला प्रोत्साहन देणे आणि या क्षेत्राला मोजमापाच्या सामायिक मानकांकडे वाटचाल करण्यास मदत करणे हे आमचे उद्दिष्ट आहे.
शेवटी, आमच्या अत्याधुनिक धोरण आराखड्यात लिहिल्याप्रमाणे, आमचा विश्वास आहे की आम्हाला आणि इतर कंपन्यांना RSI कडे होणाऱ्या आमच्या प्रगतीचा सार्वजनिकपणे मागोवा घेणे आवश्यक असावे. अशी आवश्यकता नसली तरीही, आमच्या RSI प्रगतीबाबत पारदर्शक राहणे सुरू ठेवण्याची आमची योजना आहे. आमची मापन तंत्रे आणि समज सुधारत गेल्यानुसार, पारदर्शकतेची गरज आणि सुरक्षा व स्वामित्वाधीन माहितीचे संरक्षण करण्याची गरज यांच्यात संतुलन राखत, आम्ही पारदर्शकतेबाबतचा आमचा दृष्टिकोन विकसित करत राहू.
या वर्षाच्या सुरुवातीला, OpenAI मधील एजंट वापरानुसार क्रमवारी लावलेल्या मध्यक संशोधकाचा कोडिंग एजंट्सचा वापर मर्यादित प्रमाणात होता. ऑगस्टच्या मध्यापर्यंत, मध्यक संशोधक त्यांच्या कामात दररोज एजंट्स समाकलित करत होता आणि API दरांनुसार दररोज $600 पेक्षा अधिक किमतीचा इन्फरन्स वापरत होता. आमच्या संशोधन संस्थेतील 90व्या पर्सेंटाइलमधील वापरकर्ता आता दररोज $7,000 पेक्षा जास्त मूल्याचे टोकन वापरतो.
जून 2026 पूर्वी, संशोधन संस्थेतील एजंट्सचा एकूण रनटाइम मानवी श्रमांच्या एकूण वेळेपेक्षा कमी होता. तेव्हापासून ते बदलले आहे. मानक आठ तासांच्या कामाच्या दिवसाच्या दृष्टीने, ऑगस्टच्या मध्यापर्यंत, संशोधन संस्था मानवी श्रमाच्या प्रत्येक कामाच्या दिवसासाठी एकूण 3.1 एजंट-कामदिवस इतका प्रयत्न वापरते.
याकडे पाहण्याचा आणखी एक मार्ग म्हणजे किती संशोधक अत्यंत समवर्ती कार्यप्रवाह वापरतात (उदा., एकाच वेळी चार किंवा अधिक एजंट चालवणे) हे समजून घेणे. खाली दाखवल्याप्रमाणे, हा आकडा वाढत आहे. या आकडेवारीत वापरकर्त्याने थेट सुरू केलेल्या एजंट्सचे तसेच वापरकर्त्याने थेट लाँच केलेल्या एजंट्सपासून पुढे तयार झालेल्या उप-एजंट्सचे दैनंदिन उच्चांक समाविष्ट आहेत.
AI संशोधनाचा मोठा भाग ही मोठ्या श्रमांची गरज असलेली प्रक्रिया म्हणून पाहता येतो, जिचे उद्दिष्ट मॉडेलच्या बुद्धिमत्तेत किंवा कार्यक्षमतेत झालेली नवीन सुधारणा आमच्या एका मुख्य मॉडेलमध्ये समाकलित करणे हे आहे. ही प्रक्रिया अनेक टप्प्यांवर अवलंबून असते आणि सर्व टप्पे एकत्रितपणे योग्यरीत्या पार पडल्यावर क्षमता प्रगत होतात: संशोधकांना नवीन सुधारणा तयार कराव्या लागतात, मॉडेलच्या कार्यक्षमतेचे मूल्यमापन करण्यासाठी मूल्यांकन तयार करावे लागते, मोठ्या प्रमाणावर या सुधारणांची चाचणी घेण्यासाठी पायाभूत सुविधा विकसित कराव्या लागतात, प्रशिक्षणादरम्यान बग तसेच असुरक्षित किंवा अपेक्षित उद्दिष्टांशी विसंगत वर्तन शोधावे लागते आणि यशस्वी कल्पना मुख्य प्रशिक्षण प्रक्रियेत समाकलित कराव्या लागतात. संशोधन प्रक्रियेच्या कोणत्याही भागातील अपयश संपूर्ण चक्रावर मर्यादा आणू शकते.
कोड लिहिणे आणि प्रयोग करणे हे संशोधक त्यांच्या कामाचा भाग म्हणून करत असलेले दोन प्रमुख क्रियाकलाप आहेत, आणि या प्रक्रिया वेग घेत असल्याचे पुरावे आम्हाला दिसत आहेत.
हे डेटा बिंदू मोजणे तुलनेने सोपे असते, परंतु त्यांचा अर्थ लावणे कठीण असू शकते. स्वयंचलन जसजसे पुढे जाईल, तसतशी ज्या कार्यांचे स्वयंचलन सर्वात कमी शक्य आहे ती कार्ये संशोधकांच्या प्रयत्नांचा अधिक मोठा वाटा घेऊ लागतील आणि भविष्यातील प्रगतीतील महत्त्वाचे अडथळे ठरतील. संगणन क्षमता हा प्रगतीसाठी आणखी एक मर्यादक घटक आहे आणि इतर अडथळे कमी होत गेल्यास काळानुसार त्याचे महत्त्व वाढू शकते.
2026 दरम्यान, प्रति सक्रिय प्रयोगकर्ता प्रयोगांची संख्या वाढली आहे. जानेवारी 2025 मध्ये मागोवा सुरू झाल्यापासून ऑगस्ट 2026 हा आतापर्यंतचा उच्च ठरला. याचा Codex च्या वाढत्या स्वीकाराशी संबंध आहे, तरीही 2025 पासून आमची उपलब्ध संगणकीय क्षमता देखील लक्षणीयरीत्या वाढली आहे, हे आम्ही नमूद करतो.
गुणात्मक छाप आणि अंतर्गत डेटा या दोन्हींवरून असे दिसते की संशोधक कोडिंग एजंटना सोपवत असलेल्या कामांचे मिश्रण बदलत आहे आणि कालांतराने उच्च स्तरावरील व दीर्घकालीन कामे सोपवणे अधिक सामान्य होत आहे.
या प्रवृत्तीचे अधिक स्पष्ट चित्र मिळवण्यासाठी, आम्ही Epoch AI ने विकसित केलेल्या, AI R&D जीवनचक्राचा भाग असलेल्या विविध प्रकारच्या कामांच्या अलीकडे प्रकाशित वर्गीकरणाचा(नवीन विंडोमध्ये उघडेल) वापर करून संशोधन संस्थेतील अलीकडील वापराचे विश्लेषण केले. सर्व प्रकारच्या कामांचे वर्गीकरण करण्यासाठी दीर्घकाळापासून वापरल्या जाणाऱ्या O*NET प्रणालीपासून प्रेरित असलेले हे वर्गीकरण अत्याधुनिक AI R&D साठी विशेषतः तयार केले आहे आणि प्रक्रियेचे सहा मुख्य टप्प्यांमध्ये विभाजन करते:
ठरवा: कशावर काम करायचे, काय सुरू ठेवायचे, कुठे वाटप करायचे
डिझाइन: संशोधन कल्पना आणि अभियांत्रिकी विनिर्देश
बिल्ड: कोड आणि डेटासेट्स
रन: प्रशिक्षण/मूल्यमापन रन, हार्डवेअर, सर्व्हिंग
विश्लेषण करा: प्रयोग, मॉडेल्स, तैनाती, बाह्य काम
संवाद साधा: निष्कर्ष, अभिप्राय, स्थिती, निर्णय
खाली, आम्ही या वर्गीकरणानुसार कोडिंग एजंट टोकनचे वर्गीकरण करतो.
तुम्ही पाहतो की जानेवारी ते ऑगस्ट 2026 या कालावधीत संशोधन उपक्रमांच्या सर्व श्रेणींमध्ये वाढ झाली आहे. जानेवारीमध्ये, संशोधन आणि इन्फ्रास्ट्रक्चर कोड ही प्रमुख श्रेणी होती. ही श्रेणी विस्तारली आहे, परंतु इतर श्रेणींमध्येही, विशेषतः तांत्रिक मदत आणि मॉनिटरिंग रनमध्ये, लक्षणीय वाढ दिसून येते. उच्च-स्तरीय नियोजनाचा एजंटच्या आउटपुट टोकन्समध्ये अजूनही अत्यल्प वाटा आहे.
अनुभवाधारित माहितीनुसार, सहकारी सांगतात की कोडिंग एजंट्स अंतर्गत संशोधन पायाभूत सुविधांमधील समस्या सोडवण्यात उत्कृष्ट कामगिरी करतात, ज्यामुळे संशोधनाच्या प्रगतीतील एक महत्त्वाचा अडथळा दूर होतो. पूर्वी संशोधकांना त्यांच्या प्रयोगांतील समस्या सोडवण्यात मदत करण्यासाठी नियत सल्ला-सत्रे घेत असलेल्या अनेक संघांनी 2026 मध्ये उपस्थितीत घट झाल्याचे नमूद केले आहे, आणि त्यांपैकी एका संघाने इतर प्रणाली-सुधारणांवर लक्ष केंद्रित करण्यासाठी ही सत्रे पूर्णपणे घेणे बंद केले आहे.
येथे, संशोधक इतर संघाकडून तांत्रिक सहाय्य मिळवण्यासाठी वापरत असलेल्या मुख्य अंतर्गत चॅनेलपैकी एका चॅनेलवर दररोज केलेल्या टॉप-लेव्हल पोस्ट्सची संख्या आम्ही आलेखात दाखवतो. आमच्या माहितीनुसार, चॅनेलवरील क्रियाशीलतेतील घट ही विचारण्या दुसऱ्या मानवांकडून चालवल्या जाणाऱ्या तांत्रिक सहाय्य चॅनेलकडे वळल्यामुळे भरून निघालेली नाही. ट्रॅफिकमधील घट या व्यापक बदलाशी सुसंगत आहे.
तुम्ही हेही अभ्यासू शकतो की कोडिंग एजंट्स संशोधकांनी विनंती केलेल्या कार्यांमध्ये यशस्वी होत आहेत का. एजेंटिक क्लासिफायर वापरून, आम्हाला असे आढळते की जानेवारीपासून जुलैपर्यंत, ज्या कार्यांसाठी आम्ही ग्राउंड ट्रुथ परिणाम शोधू शकतो अशा कार्यांवर, अवघडपणाच्या अनेक गटांमध्ये (कार्य पूर्ण करण्यासाठी मानवाला लागेल असा अंदाजित वेळ याच्या आधारे दर्शवलेले) यशाचे दर साधारणतः वाढले. तथापि, यशस्वी होण्यासाठी एजंट्सना अजूनही लक्षणीय मानवी मार्गदर्शनाची आवश्यकता असते, विशेषतः कार्याची गुंतागुंत वाढत असताना. गेल्या सहा महिन्यांत, यशस्वी चार-आठ तासांच्या कार्यांपैकी निम्म्याहून अधिक कार्यांमध्ये एक किंवा अधिक हस्तक्षेपांचा समावेश होता.
संशोधकांच्या कार्यांवरील यशाचे प्रमाण कालांतराने वाढले आहे. आलेखात अशी वर्गीकरणे वगळली आहेत ज्यांचा परिणाम अनिश्चित होता आणि <50 सत्रे किंवा <50 अद्वितीय वापरकर्ते असलेले डेटा पॉइंट्स वगळले आहेत.
जानेवारी ते जुलैदरम्यानचा कार्य यशस्वी होण्याचा दर आणि हस्तक्षेप दर, वेळेच्या मर्यादेनुसार विभागलेले. परिणाम अनिश्चित असलेली वर्गीकरणे वगळते.
सुरक्षित आणि फायदेशीर AGI साठी अधिक सक्षम प्रणालींकडे होणारी प्रगती अशा कामासाठी आवश्यक असलेल्या सुरक्षा उपायांवरही अवलंबून असेल. जोखमींबद्दल अधिक माहिती मिळत जाईल तसे, आवश्यक सुरक्षा उपायांबाबतचे आमचे मूल्यांकन बदलू शकते.
आम्ही वर्णन केल्याप्रमाणे, आम्ही अलीकडेच देखरेख, संरेखन आणि सुरक्षा यांसाठी आमची मानके अपडेट केली आहेत. येथे, अलीकडील निर्बंधांचा संशोधन कार्याच्या एका पैलूवर कसा परिणाम झाला आहे हे आम्ही दाखवतो.
*येथे 20 जुलै ते 6 ऑगस्ट दरम्यान दाखवलेली बहुतेक Astra compute संसाधने सुरक्षा आणि सुरक्षितता सुधारणांच्या अंमलबजावणीची चाचणी करण्यासाठी होती.
20 जुलै रोजी, एजंट्सनी आमच्या संशोधन पायाभूत सुविधांमध्ये घुसखोरी केल्याचे आढळल्यानंतर, आम्ही प्रशिक्षणासाठी वापरली जाणारी कंटेनर सेवा तात्पुरती बंद केली आणि नंतर लक्षणीय अतिरिक्त निर्बंधांसह ती पुन्हा सुरू केली.
यामुळे, संघांनी अधिक सुरक्षित केलेल्या संशोधन वातावरणात काम करण्यासाठी तुमचे कार्यप्रवाह पुन्हा संरचित करत असताना RL प्रशिक्षणासाठी लागणाऱ्या संगणकीय संसाधनांमध्ये तीव्र घट झाली. वरील आलेखात तैनातीसाठी असलेल्या आमच्या नवीनतम मॉडेल्सच्या रीइन्फोर्समेंट लर्निंगमधील दोन आठवड्यांचा विराम समाविष्ट आहे. 20 जुलै ते 6 ऑगस्ट दरम्यानच्या Astra-वर्गातील RL प्रयोगांमध्ये (GPU वाटपानुसार) बहुसंख्य रन्स सुरक्षितता आणि सुरक्षा सुधारणांच्या अंमलबजावणीची चाचणी घेण्यासाठी आहेत.
सात ऑगस्ट रोजी, आमच्या प्रिपेयर्डनेस फ्रेमवर्क अंतर्गत Astra कडे महत्त्वपूर्ण सायबर क्षमता असू शकतात(नवीन विंडोमध्ये उघडेल), या प्राथमिक पुराव्यामुळे मॉडेल-विशिष्ट अतिरिक्त सुरक्षा निर्बंध लागू झाले, ज्यांनुसार Astra मॉडेल उच्च-सुरक्षा संशोधन वातावरणांमध्ये चालवणे आवश्यक होते. पुढील आठवड्यात Astra-वर्गातील GPU वाटपात आणखी 59.2 टक्के घट झाली, परंतु इतर मॉडेल वर्गांसाठीचे वाटप 17.2 टक्क्यांनी वाढले. त्या वाढीने Astra-वर्गातील घटीपैकी सुमारे 85 टक्के भरून काढले, त्यामुळे विश्लेषित RL वर्कलोड्समधील एकूण वाटपात फारसा बदल झाला नाही. Astra-संबंधित कामावर निर्बंध असताना काही प्रशिक्षण आणि प्रयोग गैर-Astra मॉडेलकडे वळवण्यात आल्याशी हा नमुना सुसंगत आहे. तसेच, नव्या निर्बंधांच्या कक्षेतील कार्यभारांसाठी यापुढे वापरता न येणाऱ्या संगणकीय क्षमतेचे संशोधकांनी इतर उपयोग शोधल्याच्या अनौपचारिक अहवालांशीही तो सुसंगत आहे.
हा डेटा प्रशिक्षण आणि सुरक्षिततेबाबत सुरू असलेल्या चर्चांसाठी एक उपयुक्त संकेत देतो: जेव्हा नवीन नियंत्रण उपाय लागू केले जातात, तेव्हा संगणकीय संसाधने मौल्यवान आणि लवचिक राहतात आणि संशोधन उपक्रमांतर्गत पर्यायी वापरांकडे नैसर्गिकपणे वळवली जातील. दीर्घकालीन दृष्टीने, AI च्या प्रगतीच्या वेगाबद्दलच्या चर्चा नव्या किंवा प्रस्तावित नियंत्रणांच्या अधीन असलेल्या संगणकीय क्षमतेचा सर्वोत्तम वापर कसा करता येईल, या प्रश्नापर्यंतही विस्तारल्या पाहिजेत.
संरेखित RSI च्या दिशेने होणारी प्रगती साधणे आणि ती समजून घेणे आमच्या ध्येयासाठी महत्त्वाचे आहे. आम्ही आमच्या पद्धती अधिक परिष्कृत करत राहू, विकसित होत असलेल्या आमच्या आकलनाबद्दल अहवाल देऊ आणि माहितीपूर्ण सार्वजनिक चर्चा तसेच अत्याधुनिक प्रणालींच्या अर्थपूर्ण लोकशाही शासनासाठी कार्य करू.
एजंट-संचालित AI संशोधन अजूनही नवीन आहे आणि त्याचे मोजमाप कसे करायचे हे आम्ही अजूनही शिकत आहोत. आमची संशोधन पथके तयार करत असलेल्या कोडचे प्रमाण यांसारखे काही सूचक गोळा करणे तुलनेने सोपे असते, परंतु त्यांचा अर्थ लावणे कठीण असते, कारण त्यांचा संशोधनातील प्रगतीशी असलेला संबंध अनिश्चित असतो. संशोधनातील प्रगतीवर अधिक थेट लक्ष केंद्रित करणारे मापन निकष—उदा., संशोधकांनी त्यांना दिलेल्या कार्यांमध्ये एजंट्स किती वेळा यशस्वी होतात—अधिक उपयुक्त ठरू शकतात, परंतु ते विकसित करणे आणि त्यांची वैधता पडताळणे जटिल असते. या अडचणीत आणखी भर घालत, संशोधक ज्या साधनांवर आणि प्रणालींवर अवलंबून असतात ती झपाट्याने विकसित होत आहेत. संशोधनाला गती देण्याबाबतची आमची समज अधिक सखोल करणे हे OpenAI मधील एक महत्त्वाचे लक्षकेंद्रित क्षेत्र आहे.
या सर्व विश्लेषणांमध्ये, अन्यथा नमूद केले नसल्यास:
“संशोधक” ही आमच्या संशोधन संस्थेतील कोणत्याही सदस्यासाठी वापरली जाणारी व्यापक संज्ञा आहे; यात संशोधन पायाभूत सुविधा उभारणारे, संशोधन प्रकल्प व्यवस्थापित करणारे किंवा अन्य प्रकारे या उपक्रमाला पाठबळ देणारे काही सदस्यही समाविष्ट आहेत.
संशोधक अवलंबून असलेल्या साधनांमध्ये आणि प्रणालींमध्ये होत असलेल्या जलद बदलांमुळे, कोडिंग एजंटच्या वापराचे मेट्रिक्स बहुतांश वापराचा समावेश करतात, पण सर्व वापराचा नाही.


