आयरनक्लैड के साथ कंप्यूटर उपयोग को बेहतर बनाना
अनुबंध संबंधी शोध में सहयोग कैसे हमें जटिल पेशेवर काम के लिए एआई एजेंट का प्रशिक्षण और मूल्यांकन करने में मदद कर रहा है.
जब हमने GPT‑6 एस्ट्रा पेश किया, तो हमने दिखाया कि दस्तावेज़ तैयार करने से लेकर वेबसाइटों के परीक्षण तक, पेशेवर काम के लिए कंप्यूटर इस्तेमाल करने में हमारे मॉडल कितनी प्रगति कर चुके हैं. हमारा अगला लक्ष्य एजेंट को विशेष सॉफ़्टवेयर के उपयोग में अधिक सक्षम और कुशल बनाना है, ताकि वे जटिल व्यावसायिक समस्याएँ हल कर सकें. हम यह तलाश रहे हैं कि मॉडल को किसी कंपनी के व्यावसायिक नियम समझने, कई चरणों वाले कार्यप्रवाह पूरे करने और यह जाँचने के लिए कैसे प्रशिक्षित किया जाए कि उनका काम मूल आवश्यकताओं को पूरा करता है.
इस शोध को तेज़ी से आगे बढ़ाने के लिए हम कुछ चुनिंदा सॉफ़्टवेयर कंपनियों के साथ सीधे साझेदारी कर रहे हैं, जो इन कार्यप्रवाहों को सबसे अच्छी तरह समझती हैं. हम मिलकर चुनौतीपूर्ण और महत्वपूर्ण कार्यों की पहचान कर रहे हैं और उन्हें अपने मॉडल के प्रशिक्षण व मूल्यांकन के लिए शोध समस्याओं में बदल रहे हैं. इससे अंततः हमारे मॉडल वास्तविक व्यावसायिक उपयोग में अधिक सक्षम और उपयोगी बनेंगे.
हमारा पहला साझेदार आयरनक्लैड है, जो एआई-आधारित अनुबंध प्रबंधन में अग्रणी है. आयरनक्लैड की टीम के साथ निकट सहयोग से हमने ऐसे कार्य विकसित किए हैं जिनमें एजेंट को समझौते, स्वीकृति प्रक्रियाएँ और दोबारा इस्तेमाल की जा सकने वाली कानूनी शर्तें निर्धारित करनी होती हैं. हमने इन जटिल कार्यप्रवाहों में प्रगति भी दिखाई है. सफलता के मानदंड तय करने और ग्राहकों की वास्तविक ज़रूरतों को अत्याधुनिक मॉडल के विकास में सीधे शामिल करने में आयरनक्लैड की विशेषज्ञता की अहम भूमिका रही है. हम इस साझेदारी के लिए आभारी हैं और अपनी साझा उपलब्धियाँ बताने को लेकर उत्साहित हैं.
GPT‑6 एस्ट्रा हमारा पहला अत्याधुनिक मॉडल है जिसे आयरनक्लैड के कार्यों पर प्रशिक्षित किया गया है. हमारे शोध मूल्यांकन में इसका औसत स्कोर GPT‑5.6 सोल से 32% अधिक था, जबकि हर प्रयास में लगने वाला अनुमानित समय 48% कम था.1
मान लीजिए, कानूनी संचालन की एक टीम सॉफ़्टवेयर खरीदने की प्रक्रिया तैयार कर रही है. एक तय राशि से अधिक की खरीद के लिए वित्त विभाग की स्वीकृति ज़रूरी हो सकती है, कुछ अनुरोधों की समीक्षा सुरक्षा विभाग को करनी पड़ सकती है और गैर-मानक शर्तों की समीक्षा कानूनी विभाग को करनी पड़ सकती है. प्रक्रिया तैयार करने वाले व्यक्ति को इस छोटी-सी सूची के आधार पर अनुरोध फ़ॉर्म, दस्तावेज़ों के प्रारूप, स्वीकृति के नियम और अंतिम समझौते का रिकॉर्ड तैयार करना होता है.
यही काम करने वाले एआई एजेंट को सॉफ़्टवेयर में आगे बढ़ते हुए इन आवश्यकताओं का ध्यान रखना होता है. उदाहरण के लिए, उसे तय सीमा से अधिक खर्च पर वित्त विभाग की स्वीकृति का नियम निर्धारित करना होगा और जाँचना होगा कि सीमा से ऊपर और नीचे के अनुरोध सही प्रक्रिया का पालन करते हैं. हर चरण को अलग-अलग सही करना काफ़ी नहीं है: तैयार प्रक्रिया को उन सभी परिस्थितियों में काम करना चाहिए जिनके लिए उसे बनाया गया है.
आयरनक्लैड के कर्मचारियों और OpenAI में आयरनक्लैड इस्तेमाल करने वाले लोगों ने हमारे शोधकर्ताओं को कानूनी, वाणिज्यिक और खरीद संबंधी काम में 11 कार्यों की पहचान करने में मदद की. इनमें गोपनीयता समझौते तैयार करना, खरीद की स्वीकृति प्रक्रियाएँ बनाना और दोबारा इस्तेमाल किए जा सकने वाले कानूनी खंड को अनुरोधकर्ता के चुने हुए क्षेत्राधिकार के अनुरूप अद्यतन करना जैसे कार्य शामिल थे. हमारा अनुमान है कि किसी अनुभवी उपयोगकर्ता को हर कार्य पूरा करने में औसतन लगभग 30 से 40 मिनट लगेंगे.
हमने हर कार्य की जटिलता के अनुसार 8 से 50 मानदंडों पर उसका मूल्यांकन किया. इससे हमें पता चला कि मॉडल ने कौन-से हिस्से सही किए और कहाँ कमी रह गई. आयरनक्लैड ने अपने उत्पाद के होस्ट किए गए सॉफ़्टवेयर परिवेश भी उपलब्ध कराए, जहाँ मॉडल इन कार्यों का अभ्यास कर सकते थे. हमारे शोधकर्ताओं ने आम कार्यप्रवाहों का प्रतिनिधित्व करने वाले कृत्रिम प्रशिक्षण कार्य2 विकसित किए और अभ्यास व प्रतिक्रिया से मॉडल को बेहतर बनाने के लिए रीइंफ़ोर्समेंट लर्निंग का उपयोग किया. काम को जानने वाले लोगों के साथ चुने गए कार्य, विस्तृत मानदंड और मॉडल के अभ्यास के लिए परिवेश—ये तीनों मिलकर सुनिश्चित करते हैं कि हम उन वास्तविक कार्यों में सुधार कर रहे हैं जो हमारे ग्राहकों के लिए सबसे महत्वपूर्ण हैं.
हमने एस्ट्रा के लिए मैक्स रीज़निंग और GPT‑5.6 सोल के लिए हाई रीज़निंग का उपयोग करके दोनों की तुलना की. इन्हीं सेटिंग पर दोनों मॉडल ने अपने सर्वोच्च स्कोर हासिल किए थे. 11 शोध कार्यों में एस्ट्रा का औसत स्कोर 55.0% था, जबकि GPT‑5.6 सोल का 41.6% था. हर प्रयास में लगने वाला अनुमानित औसत समय सोल के 37.0 मिनट से घटकर एस्ट्रा के लिए 19.2 मिनट रह गया.3 एस्ट्रा के विकास में इस्तेमाल किए गए एक आंतरिक मॉडल ने इन कार्यों में और भी बेहतर, 63.7% स्कोर हासिल किया. हमारा लक्ष्य भविष्य के मॉडल में ये अतिरिक्त सुधार भी लाना है.
मापदंड | GPT‑5.6 सोल | GPT‑6 एस्ट्रा |
मूल्यांकन मानदंडों पर औसत स्कोर | 41.6% | 55.0% |
हर प्रयास में लगने वाला अनुमानित औसत समय | 37.0 मिनट | 19.2 मिनट |
अनुकरण में एस्ट्रा ने हर प्रयास में कम समय लेते हुए कार्य की अधिक आवश्यकताएँ पूरी कीं. नीचे दी गई दो वीडियो क्लिप दिखाती हैं कि दोनों मॉडल ने एक ही शोध कार्य को कैसे पूरा किया. एस्ट्रा (पहली क्लिप) ने अनुमानित 20 मिनट में कार्य के लगभग 94% मानदंड पूरे किए; GPT‑5.6 सोल (दूसरी क्लिप) ने अनुमानित 32 मिनट में लगभग 85% मानदंड पूरे किए.
GPT‑6 एस्ट्रा ने अनुमानित 20 मिनट में कार्य के लगभग 94% मानदंड पूरे किए.
GPT‑5.6 सोल ने अनुमानित 32 मिनट में कार्य के लगभग 85% मानदंड पूरे किए.
इस काम में आयरनक्लैड की भूमिका एक ऐसी चुनौती को सामने लाती है, जिसे उसके ग्राहक अच्छी तरह जानते हैं: अनुबंध प्रक्रिया को अपवादों को संभालने के साथ-साथ उन नियमों को भी बनाए रखना होता है जिन पर व्यवसाय निर्भर करता है. अगर कोई एजेंट कार्य के बीच में इनमें से किसी नियम का ध्यान रखना भूल जाए, तो सॉफ़्टवेयर कंपनी पूरे भरोसे से उसे सीमित काम ही सौंप सकती है. इससे स्पष्ट होता है कि अनुबंध संबंधी जटिल कार्यों में एजेंट के बेहतर होने के बावजूद मानवीय निगरानी क्यों ज़रूरी है और एक संपूर्ण अनुबंध मंच की अहमियत क्यों बनी हुई है. हमारे शोधकर्ताओं के साथ काम करके आयरनक्लैड इन समस्याओं को आधारभूत मॉडल के विकास का हिस्सा बना सकता है, जहाँ हम मिलकर उनका अध्ययन कर सकते हैं.
मॉडल की क्षमताएँ बढ़ने के साथ आयरनक्लैड के पास अपने और अधिक उत्पादों में उनका उपयोग करने का अवसर है. कानूनी और व्यावसायिक टीमों के लिए इसका मतलब यह हो सकता है कि एआई अनुबंध संबंधी जटिल काम का बड़ा हिस्सा संभाले, जबकि वे नियंत्रण बरकरार रहें जिन पर ये टीमें भरोसा करती हैं.
हम कुछ चुनिंदा सॉफ़्टवेयर कंपनियों को हमारी शोध और इंजीनियरिंग टीमों के साथ सीधे काम करने के लिए आमंत्रित कर रहे हैं. यह सहयोग उन महत्वपूर्ण पेशेवर कार्यों पर होगा जिन्हें आज के एजेंट अब भी भरोसेमंद ढंग से पूरा नहीं कर पाते. अगर आपकी टीम के पास ऐसा कोई कार्य है, तो हम उसका एक ठोस उदाहरण देखना चाहेंगे: आप एजेंट से क्या करवाना चाहते हैं, वह कहाँ विफल होता है इसका प्रमाण, और सफल परिणाम को आप किस आधार पर परखेंगे. साझेदारों को ऐसे लोग भी उपलब्ध कराने में सक्षम होना चाहिए जो काम को गहराई से समझते हों. साथ ही, परीक्षण के लिए एक सुरक्षित परिवेश और ऐसा डेटा चाहिए जिसका शोध में सुरक्षित उपयोग किया जा सके. इससे हमें विफलता की जाँच शुरू करने और यह मापने का आधार मिलता है कि मॉडल में सुधार हो रहा है या नहीं.
अगर आपकी टीम इन शर्तों को पूरा करती है, तो शोध में सहयोग की संभावनाएँ तलाशने के लिए आवेदन करें.
लेखक
पादटिप्पणियाँ
- 1
- 2
हमने एसईसी के एडगर डेटाबेस में सार्वजनिक रूप से उपलब्ध अनुबंधों से व्यक्तिगत जानकारी हटाने के लिए बनाए गए फ़िल्टर लागू किए. इसके बाद उन अनुबंधों से अनुकरण-आधारित कार्य बनाए. हमने प्रशिक्षण या मूल्यांकन के लिए OpenAI के ग्राहकों का डेटा, OpenAI के आंतरिक अनुबंध या आयरनक्लैड के ग्राहकों का गैर-सार्वजनिक डेटा या अनुबंध इस्तेमाल नहीं किए.
- 3


