हमारा मानना है कि AGI से पूरी मानवता को फ़ायदा पहुँचाने के लिए, इसे ऐसे गवर्न किया जाना चाहिए जिसमें लोगों की भागीदारी हो. यह तभी हो सकता है जब बहुत सक्षम AI सिस्टम्स की क्षमताओं, रिस्क्स और सेफ़गार्ड्स पर लोगों के बीच सही जानकारी के साथ खुली चर्चा हो. हर जगह लोगों को यह समझना ज़रूरी है कि फ़्रंटियर AI आगे किस दिशा में जा सकता है, ताकि इसके डेवलपमेंट में उनकी भी अहम भूमिका हो सके.
खास जोखिमों, इंसिडेंट्स और सेफ़गार्ड्स के बारे में साफ़ जानकारी देना ज़रूरी है, लेकिन सिर्फ़ इतना काफ़ी नहीं है. हमारा मानना है कि लोगों को यह भी समझना चाहिए कि फ़्रंटियर लैब्स के अंदर सबसे काबिल सिस्टम्स कैसे डेवलप हो रहे हैं और वे रिसर्च की प्रोग्रेस को कैसे तेज़ कर रहे हैं.
हमारा लक्ष्य सुरक्षित तरीके से ऐसा ऑटोमेटेड AI रिसर्चर बनाना है, जो इंसानों की देखरेख में काम करके डीप लर्निंग और अलाइनमेंट में प्रोग्रेस को आगे बढ़ा सके और लगातार सुधारों को मुमकिन बना सके. हमारी मेज़रमेंट्स के मुताबिक, हमने अब वह लक्ष्य हासिल कर लिया है जिसकी घोषणा(एक नई विंडो में खुलेगा) पिछले साल के आखिर में की गई थी: इस साल सितंबर तक एक ऑटोमेटेड रिसर्च इंटर्न बनाना. "रिसर्च इंटर्न" से हमारा मतलब ऐसे सिस्टम से है, जो इंसानों के डायरेक्शन में साफ़ तौर पर तय रिसर्च के टास्क्स कर सके. इसमें ऐसे टास्क्स भी शामिल हैं जिन्हें पूरा करने में किसी स्किल्ड रिसर्चर को कुछ दिन लग सकते हैं. हम मार्च 2028 तक एक ऑटोमेटेड AI रिसर्चर बनाने की दिशा में तेज़ी से आगे बढ़ रहे हैं.
इस साल के दौरान OpenAI रिसर्चर्स के रोज़ के काम करने के तरीके में काफ़ी बदलाव आया है. रिसर्चर्स पूरे दिन कोडिंग एजेंट्स का इस्तेमाल कर रहे हैं, अक्सर एक साथ कई सेशन्स में. कुल इस्तेमाल तेज़ी से बढ़ रहा है और इसकी बढ़ोतरी OpenAI की दूसरी टीमों से ज़्यादा है. रिसर्चर्स पहले से ज़्यादा तेज़ी से कोड में बदलाव कर रहे हैं और ज़्यादा एक्सपेरिमेंट्स चला रहे हैं. रिसर्चर्स एजेंट्स का इस्तेमाल कैसे करते हैं, यह भी बदल रहा है: एजेंट्स लगातार ज़्यादा कॉम्प्लेक्स टास्क्स हैंडल कर रहे हैं और उन्हें सफलतापूर्वक पूरा करने की दर भी बढ़ रही है. AI रिसर्च एक कॉम्प्लेक्स प्रोसेस है जिसमें कई संभावित बॉटलनेक्स हो सकते हैं. इसलिए कुल प्रोग्रेस की रफ़्तार शायद इन खास मेट्रिक्स जितनी तेज़ न रहे. लेकिन कुल मिलाकर, ये नतीजे उस सोच से मेल खाते हैं जो हममें से कई लोगों की OpenAI के अंदर बनी है कि एजेंटिक टूल्स रिसर्च की प्रोग्रेस को काफ़ी तेज़ कर रहे हैं. हमारी रिसर्च प्रायोरिटीज़ अब भी इंसान ही तय करते हैं. वे ही फ़ैसला करते हैं कि किन आइडिया और रिज़ल्ट्स पर आगे काम करना है और सिस्टम्स को स्केल करना, रोकना, या डिप्लॉय करना है या नहीं.
हमारा मानना है कि अगर ऑटोमेटेड AI रिसर्च को ज़िम्मेदारी के साथ किया जाए, तो इससे ऐसे मॉडल्स बन सकते हैं जो सीधे लोगों की ज़िंदगी बेहतर करें और OpenAI के मिशन को आगे बढ़ाएँ. इससे एडवांस्ड इंटेलिजेंस की लागत कम हो सकती है, ताकि दुनिया भर के लोग इसका फ़ायदा उठा सकें. हम इस काम को आगे बढ़ाने की एक वजह यह भी है कि ऑटोमेटेड रिसर्च, अलाइनमेंट की समस्याएँ हल करने और लगातार ज़्यादा काबिल होते AI से बचाव के तरीके बनाने में हमारी मदद कर सकती है. एक ऑटोमेटेड AI रिसर्चर, ऑटोमेटेड सेफ़्टी या अलाइनमेंट रिसर्चर भी हो सकता है. ज़्यादा सक्षम और अलाइन्ड सिस्टम्स, क्रिटिकल इन्फ़्रास्ट्रक्चर को सुरक्षित रखने, ख़तरनाक AI एजेंट्स से बचाव करने और सुरक्षा के नए तरीक़े डेवलप करने में मदद कर सकते हैं.
ये उपयोगी स्वचालित अनुसंधान क्षमताएँ विकसित करने के कारण हैं, लेकिन इनका यह अर्थ नहीं है कि तीव्र RSI अनिवार्य रूप से ऐसा परिणाम है जिसे हमें हासिल करने का लक्ष्य रखना चाहिए. आगे बढ़ना है या नहीं और कैसे बढ़ना है, यह मानव नियंत्रण बनाए रखने की हमारी क्षमता तथा लाभों और जोखिमों के बारे में सूचित लोकतांत्रिक विकल्पों पर निर्भर होना चाहिए.
हमें अभी यह नहीं पता कि पूरी तरह अलाइन किए गए, फ़ुल RSI तक सुरक्षित तरीके से कैसे पहुँचा जाए. हम क्षमताओं के बढ़ने के साथ अलाइनमेंट और सेफ़्टी से जुड़े उपायों को भी बड़े स्तर पर बढ़ाने पर काम कर रहे हैं. लेकिन हम यह मानकर नहीं चल सकते कि अलाइनमेंट और सेफ़्टी में प्रोग्रेस उसी रफ़्तार से होती रहेगी. ज़्यादा सक्षम सिस्टम्स को मॉनिटर करना भी मुश्किल हो सकता है. इस कोशिश के केंद्र में अलाइनमेंट और सेफ़्टी पर सावधानी से किया गया काम है. इसकी शुरुआत उन सेफ़्टी समस्याओं को मेज़र करने और कम करने से होती है, जो आज हमें एजेंटिक कोडिंग सिस्टम्स में दिखाई देती हैं. जब भी हमें लगेगा कि आगे बढ़ने से ऐसा सेफ़्टी रिस्क पैदा होगा जिसे स्वीकार नहीं किया जा सकता, हम उसके मुताबिक कदम उठाएँगे. इसमें ऐसे सिस्टम्स के डेवलपमेंट या डिप्लॉयमेंट को धीमा करना या रोकना भी शामिल है, जिन्हें हम ठीक से सुरक्षित नहीं रख सकते.
हाल के Hugging Face इंसिडेंट के बाद हमने इस कमिटमेंट पर अमल किया. हमने डिप्लॉयमेंट के लिए बनाए जा रहे अपने लेटेस्ट मॉडल्स की रीइंफ़ोर्समेंट लर्निंग (RL) ट्रेनिंग को कुछ समय के लिए रोक दिया, जबकि हमने अपने रिसर्च एनवायरनमेंट्स की सिक्योरिटी और मज़बूत की, उनकी रेड-टीमिंग की और अपने मॉनिटरिंग सिस्टम्स का कवरेज बढ़ाया. इससे सारी रिसर्च नहीं रुकी: कुछ वर्कलोड्स ज़्यादा मज़बूत कंट्रोल्स के साथ फिर शुरू हुए, जबकि कुछ रुके रहे. हमने अपने सेफ़्टी और अलाइनमेंट स्टैंडर्ड्स बढ़ाए हैं और सेफ़्टी के काम को मॉडल लाइफ़साइकल में और गहराई तक शामिल किया है. अब पूरी ट्रेनिंग के दौरान अलाइन्ड बिहेवियर के ज़्यादा मज़बूत एविडेंस की ज़रूरत होती है.
आज हम यह काफ़ी डिटेल में दिखा रहे हैं कि हाल के महीनों में एजेंटिक सिस्टम्स ने RSI की दिशा में हमारी प्रोग्रेस में कैसे मदद की है. एजेंटिक सिस्टम्स नए हैं और तेज़ी से बदल रहे हैं, और इन्हें मेज़र करने की हमारी कोशिशें अभी शुरुआती दौर में हैं. इन शुरुआती रिज़ल्ट्स और इनके पीछे इस्तेमाल किए गए तरीकों को शेयर करके, हमारा मकसद लोगों को जानकारी देना, जानकारी को लोगों के सामने लाने को बढ़ावा देना और पूरे फ़ील्ड को मेज़रमेंट के कॉमन स्टैंडर्ड्स की ओर ले जाने में मदद करना है.
आखिर में, जैसा कि हमने अपने फ़्रंटियर पॉलिसी ब्लूप्रिंट में लिखा था, हमारा मानना है कि हमें और दूसरी कंपनियों को RSI की दिशा में अपनी प्रोग्रेस को खुले तौर पर ट्रैक करना ज़रूरी होना चाहिए. ऐसी कोई ज़रूरत न होने पर भी, हमारी योजना है कि हम RSI की दिशा में अपनी प्रोग्रेस के बारे में साफ़ जानकारी देते रहेंगे. जैसे-जैसे हमारी मेज़रमेंट तकनीकें और समझ बेहतर होंगी, हम जानकारी शेयर करने के अपने तरीके को भी बेहतर करते रहेंगे. साथ ही सिक्योरिटी और कंपनी की निजी जानकारी को सुरक्षित रखने की ज़रूरत का भी ध्यान रखेंगे.
इस साल की शुरुआत में, एजेंट इस्तेमाल के हिसाब से बीच में आने वाला OpenAI रिसर्चर कोडिंग एजेंट्स का सिर्फ़ सीमित इस्तेमाल कर रहा था. अगस्त के बीच तक, मीडियन रिसर्चर हर दिन अपने काम में एजेंट्स को शामिल कर रहा था और API की प्राइसिंग के हिसाब से रोज़ $600 से ज़्यादा का इन्फ़रेंस इस्तेमाल कर रहा था. हमारी रिसर्च ऑर्गेनाइज़ेशन में 90वें परसेंटाइल वाले यूज़र अब रोज़ $7,000 से ज़्यादा के टोकन्स इस्तेमाल करते हैं.
जून 2026 से पहले, पूरी रिसर्च ऑर्गेनाइज़ेशन में एजेंट्स का कुल रनटाइम अब भी इंसानों के कुल काम के समय से कम था. हालाँकि अब यह बदल गया है. हर दिन स्टैंडर्ड 8 घंटे के काम के हिसाब से, अगस्त के बीच तक रिसर्च ऑर्गेनाइज़ेशन हर एक इंसानी वर्कडे के सामने कुल 3.1 एजेंट-वर्कडे का काम ले रही थी.
इसे देखने का एक और तरीका यह समझना है कि कितने रिसर्चर्स बहुत ज़्यादा कनकरेंट वर्कफ़्लोज़ इस्तेमाल करते हैं, जैसे एक साथ 4 या उससे ज़्यादा एजेंट्स चलाना. जैसा कि नीचे दिखाया गया है, यह संख्या बढ़ रही है. इन आँकड़ों में उन एजेंट्स के हर दिन के पीक भी शामिल हैं जिन्हें यूज़र ने सीधे शुरू किया, और उनसे आगे बनाए गए सबएजेंट्स के पीक भी.
AI रिसर्च का बड़ा हिस्सा ऐसे प्रोसेस के तौर पर देखा जा सकता है जिसमें काफ़ी मेहनत लगती है और लक्ष्य होता है मॉडल इंटेलिजेंस या परफ़ॉर्मेंस में किसी नए सुधार को हमारे किसी कोर मॉडल में शामिल करना. यह प्रोसेस कई स्टेप्स पर निर्भर करता है, और क्षमताएँ तभी आगे बढ़ती हैं जब सभी स्टेप्स सही तरह से साथ काम करें. रिसर्चर्स को नए सुधार डिज़ाइन करने होते हैं, मॉडल परफ़ॉर्मेंस जाँचने के लिए इवैल्यूएशन्स लिखने होते हैं, इन सुधारों को बड़े पैमाने पर टेस्ट करने के लिए इंफ़्रास्ट्रक्चर बनाना होता है, ट्रेनिंग के दौरान बग्स के साथ अनसेफ़ या मिसअलाइन्ड बिहेवियर पकड़ना होता है, और काम करने वाले आइडियाज़ को कोर ट्रेनिंग रन में शामिल करना होता है. रिसर्च प्रोसेस के किसी भी हिस्से में गड़बड़ी पूरे लूप की रफ़्तार रोक सकती है.
कोड लिखना और प्रयोग चलाना दो प्रमुख गतिविधियाँ हैं जो शोधकर्ता अपने काम के हिस्से के रूप में करते हैं, और हमें ऐसे प्रमाण मिलते हैं कि ये प्रक्रियाएँ तेज़ हो रही हैं.
इन डेटा पॉइंट्स को मेज़र करना काफ़ी आसान है, लेकिन इनका मतलब समझना मुश्किल हो सकता है. जैसे-जैसे ऑटोमेशन बढ़ेगा, जिन टास्क्स को ऑटोमेट करना सबसे मुश्किल है वे रिसर्चर्स के काम का बड़ा हिस्सा लेने लगेंगे और आगे की प्रोग्रेस के रास्ते सबसे बड़े बॉटलनेक्स बनेंगे. कंप्यूट भी प्रोग्रेस को लिमिट करने वाला एक अहम फ़ैक्टर है, और जैसे-जैसे दूसरे बॉटलनेक्स कम होंगे, समय के साथ इसकी अहमियत और बढ़ सकती है.
2026 के दौरान हर ऐक्टिव एक्सपेरिमेंटर के एक्सपेरिमेंट्स की संख्या बढ़ी है. जनवरी 2025 में ट्रैकिंग शुरू होने के बाद अगस्त 2026 अब तक का सबसे ऊँचा स्तर रहा. इसका संबंध Codex के बढ़ते इस्तेमाल से दिखता है, हालाँकि 2025 के बाद से हमारे उपलब्ध कंप्यूट में भी काफ़ी बढ़ोतरी हुई है.
अनुभवों और इंटरनल डेटा दोनों से पता चलता है कि रिसर्चर्स कोडिंग एजेंट्स को जिस तरह के टास्क्स देते हैं, उनका मिक्स बदल रहा है. समय के साथ ज़्यादा हाई-लेवल और लंबे समय वाले टास्क्स एजेंट्स को देना आम होता जा रहा है.
इस ट्रेंड को और साफ़ समझने के लिए, हमने रिसर्च ऑर्गेनाइज़ेशन के हाल के यूसेज का एनालिसिस Epoch AI की हाल ही में पब्लिश की गई टैक्सोनॉमी(एक नई विंडो में खुलेगा) के आधार पर किया. यह टैक्सोनॉमी AI R&D लाइफ़साइकल में शामिल अलग-अलग तरह के काम को कैटेगराइज़ करती है. यह टैक्सोनॉमी लंबे समय से इस्तेमाल हो रहे O*NET सिस्टम से इंस्पायर्ड है, जो अलग-अलग तरह के काम को क्लासिफ़ाई करता है. इसे खास तौर पर फ़्रंटियर AI R&D के लिए तैयार किया गया है और यह प्रोसेस को छह मुख्य फ़ेज़ में बाँटती है:
फ़ैसला लें: किस पर काम करना है, क्या जारी रखना है, कहाँ रिसोर्सेज़ देने हैं
डिज़ाइन बनाएँ: रिसर्च के आइडिया और इंजीनियरिंग स्पेक्स
बिल्ड करें: कोड और डेटासेट
चलाएँ: ट्रेनिंग/इवैल रन्स, हार्डवेयर, सर्विंग
एनालाइज़ करें: एक्सपेरिमेंट्स, मॉडल्स, डिप्लॉयमेंट, बाहरी काम
शेयर करें: फ़ाइंडिंग्स, फ़ीडबैक, स्टेटस, फ़ैसले
नीचे, हम कोडिंग एजेंट टोकन्स को इस टैक्सोनॉमी के हिसाब से क्लासिफ़ाई करते हैं.
हम देखते हैं कि जनवरी से अगस्त 2026 के बीच रिसर्च ऐक्टिविटीज़ की सभी कैटेगरीज़ बढ़ी हैं. जनवरी में सबसे बड़ी कैटेगरी रिसर्च और इंफ़्रास्ट्रक्चर कोड थी. यह कैटेगरी बढ़ी है, लेकिन दूसरी कैटेगरीज़ में भी अच्छी बढ़ोतरी दिखती है, खास तौर पर टेक्निकल मदद और मॉनिटरिंग रन्स में. हाई-लेवल प्लानिंग अब भी एजेंट आउटपुट टोकन्स का बहुत छोटा हिस्सा है.
अनुभव के तौर पर मिली जानकारी के मुताबिक, टीम के लोग बताते हैं कि कोडिंग एजेंट्स इंटरनल रिसर्च इंफ़्रास्ट्रक्चर की समस्याएँ दूर करने में बहुत अच्छे हैं, जिससे रिसर्च प्रोग्रेस का एक अहम बॉटलनेक कम होता है. कई टीमें, पहले रिसर्चर्स की एक्सपेरिमेंट ट्रबलशूटिंग में मदद करने के लिए रेगुलर हेल्प सेशन्स चलाती थीं. 2026 में इन सेशन्स की अटेंडेंस कम हुई है. एक टीम ने ये सेशन्स पूरी तरह बंद कर दिए हैं, ताकि वह सिस्टम के दूसरे सुधारों पर फ़ोकस कर सके.
यहाँ हम उन मुख्य इंटरनल चैनल्स में से एक पर रोज़ होने वाली टॉप-लेवल पोस्ट्स की संख्या दिखाते हैं, जहाँ रिसर्चर्स दूसरी टीमों से टेक्निकल सपोर्ट माँगते हैं. हमारी जानकारी के मुताबिक, इस चैनल पर कम हुई ऐक्टिविटी की भरपाई किसी दूसरे इंसानों द्वारा चलाए जा रहे टेक्निकल सपोर्ट चैनल पर क्वेरीज़ शिफ़्ट होने से नहीं हुई है. ट्रैफ़िक में यह गिरावट इस बड़े बदलाव के साथ अलाइन करती है.
हम यह भी देख सकते हैं कि रिसर्चर्स जो टास्क्स देते हैं, उन्हें कोडिंग एजेंट्स कितने अच्छे से पूरा कर रहे हैं. एजेंटिक क्लासिफ़ायर का इस्तेमाल करके हमने पाया कि जनवरी से जुलाई के बीच जिन टास्क्स के वैलिडेट किए गए नतीजे हमारे पास थे, कठिनाई के अलग-अलग स्तर पर उनकी सक्सेस रेट बेहतर हुई. यहाँ कठिनाई का अंदाज़ा इस आधार पर लगाया गया कि वही टास्क पूरा करने में किसी इंसान को कितना समय लगेगा. हालाँकि, सफल होने के लिए एजेंट्स को अब भी काफ़ी इंसानी मदद की ज़रूरत होती है, खास तौर पर जब कोई टास्क ज़्यादा कॉम्प्लेक्स हो जाता है. पिछले 6 महीनों में, सफल रहे 4-8 घंटे वाले आधे से ज़्यादा टास्क्स में एक या उससे ज़्यादा बार इंसानी मदद की ज़रूरत पड़ी.
समय के साथ रिसर्चर्स के टास्क में सक्सेस रेट बेहतर हुई है. ग्राफ़ में वे क्लासिफ़िकेशन्स शामिल नहीं हैं जहाँ नतीजे को लेकर कुछ तय नहीं था. 50 से कम सेशन्स या 50 से कम अलग-अलग यूज़र्स वाले पॉइंट्स भी शामिल नहीं हैं.
जनवरी से जुलाई तक टास्क की सफलता और इंटरवेंशन दर, टाइम होराइज़न के अनुसार विभाजित. उन वर्गीकरणों को बाहर रखता है जहाँ परिणाम अनिश्चित था.
सेफ़ और फ़ायदेमंद AGI के लिए ज़्यादा सक्षम सिस्टम्स बनाने की दिशा में प्रोग्रेस, इस काम के लिए ज़रूरी सेफ़गार्ड्स पर भी निर्भर करेगी. रिस्क्स के बारे में ज़्यादा जानने के साथ, ज़रूरी सेफ़गार्ड्स को लेकर हमारा असेसमेंट बदल सकता है.
जैसा कि हमने बताया है, हमने हाल ही में मॉनिटरिंग, अलाइनमेंट और सिक्योरिटी के अपने स्टैंडर्ड्स अपडेट किए हैं. यहाँ हम दिखा रहे हैं कि हाल की पाबंदियों ने रिसर्च ऐक्टिविटी के एक हिस्से पर क्या असर डाला है.
*20 जुलाई से 6 अगस्त के बीच यहाँ दिखाया गया ज़्यादातर Astra कंप्यूट, सेफ़्टी और सिक्योरिटी में किए गए सुधारों के इम्प्लीमेंटेशन को टेस्ट करने के लिए था.
20 जुलाई को, यह पता चलने के बाद कि एजेंट्स ने हमारे रिसर्च इन्फ़्रास्ट्रक्चर में सेंध लगाई थी, हमने ट्रेनिंग के लिए इस्तेमाल होने वाली कंटेनर सर्विस को कुछ समय के लिए बंद कर दिया. बाद में इसे कई नई पाबंदियों के साथ फिर से शुरू किया गया.
इससे RL ट्रेनिंग कंप्यूट में तेज़ गिरावट आई, जबकि टीम्स ने ज़्यादा सुरक्षित बनाए गए रिसर्च एनवायरनमेंट में काम करने के लिए अपने वर्कफ़्लोज़ को दोबारा कॉन्फ़िगर किया. ऊपर दिए गए प्लॉट में हमारे लेटेस्ट मॉडल्स पर रीइंफ़ोर्समेंट लर्निंग को दो हफ़्ते रोकने का समय भी शामिल है. ये मॉडल्स डिप्लॉयमेंट के लिए तैयार किए जा रहे थे. 20 जुलाई से 6 अगस्त के बीच Astra-क्लास RL एक्सपेरिमेंट्स में ज़्यादातर रन (GPU एलोकेशन के हिसाब से) सेफ़्टी और सिक्योरिटी में किए गए सुधारों के इम्प्लीमेंटेशन को टेस्ट करने के लिए थे.
7 अगस्त को शुरुआती एविडेंस से संकेत मिला कि हमारे प्रिपेयर्डनेस फ़्रेमवर्क के तहत Astra में क्रिटिकल साइबर क्षमताएँ हो सकती हैं(एक नई विंडो में खुलेगा). इसके बाद मॉडल के लिए नई सिक्योरिटी पाबंदियाँ लगाई गईं, जिनके तहत Astra मॉडल को ज़्यादा सिक्योर रिसर्च एनवायरनमेंट्स में चलाना ज़रूरी हो गया. अगले हफ़्ते Astra-क्लास GPU एलोकेशन में 59.2 प्रतिशत की और गिरावट आई, लेकिन दूसरे मॉडल क्लासेज़ के लिए एलोकेशन 17.2 प्रतिशत बढ़ गया. इस बढ़ोतरी ने Astra-क्लास की गिरावट के लगभग 85 प्रतिशत हिस्से की भरपाई कर दी. इससे एनालाइज़ किए गए RL वर्कलोड्स में कुल एलोकेशन लगभग पहले जैसा ही रहा. यह पैटर्न दिखाता है कि Astra से जुड़े काम पर पाबंदियाँ होने के दौरान कुछ ट्रेनिंग और एक्सपेरिमेंटेशन को नॉन-Astra मॉडल्स पर शिफ़्ट किया गया. यह उन रिपोर्ट्स से भी मेल खाता है जिनमें रिसर्चर्स ने बताया कि नई रुकावटों के दायरे वाले वर्कलोड्स में इस्तेमाल न हो सकने वाले कंप्यूट के लिए उन्होंने दूसरे इस्तेमाल ढूँढे.
यह डेटा ट्रेनिंग और सेफ़्टी पर चल रही चर्चाओं के लिए एक काम का संकेत देता है: जब नए कंट्रोल्स लागू होते हैं, तब भी कंप्यूट की वैल्यू और फ़्लेक्सिबिलिटी बनी रहती है और रिसर्च के अंदर इसका इस्तेमाल स्वाभाविक रूप से दूसरे कामों में होने लगता है. लंबे समय में, AI की प्रोग्रेस की रफ़्तार पर होने वाली चर्चा में यह सवाल भी शामिल होना चाहिए कि नए या प्रस्तावित कंट्रोल्स के दायरे में आने वाले कंप्यूट का सबसे अच्छा इस्तेमाल कैसे किया जा सकता है.
अलाइन्ड RSI की दिशा में आगे बढ़ना और इस प्रोग्रेस को समझना हमारी मिशन के लिए ज़रूरी है. हम अपने तरीकों को और बेहतर करते रहेंगे, समय के साथ बदलती अपनी समझ शेयर करते रहेंगे और फ़्रंटियर सिस्टम्स पर जानकारी के आधार पर सार्वजनिक चर्चा और असरदार डेमोक्रेटिक गवर्नेंस की दिशा में काम करते रहेंगे.
एजेंट्स की मदद से होने वाली AI रिसर्च अभी नई है और हम अभी भी सीख रहे हैं कि इसे कैसे मापा जाए. कुछ चीज़ों का डेटा जुटाना काफ़ी आसान है, जैसे हमारी रिसर्च टीमें कितना कोड बनाती हैं. लेकिन उनका मतलब समझना मुश्किल है, क्योंकि यह साफ़ नहीं है कि उनका रिसर्च की प्रोग्रेस से कितना सीधा संबंध है. जो मेट्रिक्स रिसर्च की प्रोग्रेस को ज़्यादा सीधे मापते हैं, वे ज़्यादा काम के हो सकते हैं—जैसे, रिसर्चर्स के दिए टास्क एजेंट्स कितनी बार अच्छे से पूरा करते हैं—लेकिन ऐसे मेट्रिक्स बनाना और यह जाँचना कि वे सही काम कर रहे हैं, मुश्किल है. यह काम इसलिए भी मुश्किल है क्योंकि रिसर्चर्स जिन टूल्स और सिस्टम्स पर निर्भर हैं, वे तेज़ी से बदल रहे हैं. रिसर्च की रफ़्तार कैसे बढ़ रही है, इसे और बेहतर समझना पूरे OpenAI में एक बड़ा फ़ोकस एरिया है.
इन सभी एनालिसिस में, जहाँ अलग से कुछ न कहा गया हो:
"रिसर्चर" एक आम शब्द है, जिसमें हमारे रिसर्च ऑर्गेनाइज़ेशन का कोई भी सदस्य शामिल हो सकता है. इसमें रिसर्च इंफ़्रास्ट्रक्चर बनाने वाले, रिसर्च प्रोजेक्ट्स संभालने वाले और दूसरे तरीकों से ऑर्गेनाइज़ेशन को सपोर्ट करने वाले लोग भी शामिल हैं.
कोडिंग एजेंट के उपयोग के मेट्रिक्स, शोधकर्ताओं द्वारा उपयोग किए जाने वाले टूल और सिस्टम के तेज़ी से विकसित होने को देखते हुए, अधिकांश उपयोग को कवर करते हैं, लेकिन सभी को नहीं.


