Ironclad सोबत कॉम्प्यूटरच्या वापराची क्षमता वाढवणे
करारविषयक संशोधनातील सहकार्यामुळे गुंतागुंतीच्या व्यावसायिक कामांसाठी AI एजंटचे प्रशिक्षण आणि मूल्यमापन करण्यास आम्हाला कशी मदत होत आहे.
आम्ही GPT‑6 Astra सादर केले, तेव्हा दस्तऐवज तयार करण्यापासून वेबसाइटची चाचणी घेण्यापर्यंतच्या व्यावसायिक कामांसाठी कॉम्प्यूटर वापरण्यात आमच्या मॉडेल्सने किती प्रगती केली आहे, हे दाखवले. विशिष्ट सॉफ्टवेअर वापरून व्यवसायातील गुंतागुंतीच्या समस्या सोडवण्यात एजंटना अधिक सक्षम आणि कार्यक्षम बनवणे हे आमचे पुढील ध्येय आहे. कंपनीचे व्यवसायविषयक नियम समजून घेणे, अनेक टप्प्यांचे कार्यप्रवाह पार पाडणे आणि केलेले काम मूळ आवश्यकता पूर्ण करते का हे पडताळणे, यासाठी मॉडेलना प्रशिक्षण कसे देता येईल याचा आम्ही अभ्यास करत आहोत.
या संशोधनाला गती देण्यासाठी, या कार्यप्रवाहांची उत्तम जाण असलेल्या मोजक्या सॉफ्टवेअर कंपन्यांसोबत आम्ही थेट भागीदारी करत आहोत. आम्ही एकत्रितपणे आव्हानात्मक आणि व्यवसायासाठी विशेष महत्त्वाची कामे ओळखत आहोत. आमच्या मॉडेलच्या प्रशिक्षणासाठी आणि मूल्यमापनासाठी त्यांचे रूपांतर संशोधनातील समस्यांमध्ये करत आहोत, म्हणजे प्रत्यक्ष व्यावसायिक वापरात आमची मॉडेल अधिक सक्षम आणि उपयुक्त ठरतील.
आमचे पहिले भागीदार Ironclad आहेत. AI च्या मदतीने करारविषयक कामे करण्यात ही कंपनी आघाडीवर आहे. Ironclad च्या टीमसोबत जवळून काम करत आम्ही अशी टास्क्स तयार केली आहेत, ज्यांत एजंटना करार, मंजुऱ्या आणि पुन्हा वापरता येणाऱ्या कायदेशीर अटी यांची मांडणी करावी लागते. या गुंतागुंतीच्या कार्यप्रवाहांमध्ये आम्ही प्रगतीही दाखवली आहे. यशाचे निकष ठरवण्यात आणि ग्राहकांच्या प्रत्यक्ष गरजा अत्याधुनिक मॉडेलच्या विकासात थेट समाविष्ट करण्यात Ironclad चे कौशल्य मोलाचे ठरले आहे. या भागीदारीबद्दल आम्ही त्यांचे आभारी आहोत आणि आम्ही एकत्रितपणे काय साध्य केले आहे, हे सांगण्यास उत्सुक आहोत.
GPT‑6 Astra हे Ironclad मधील टास्क्सवर प्रशिक्षित केलेले आमचे पहिले अत्याधुनिक मॉडेल आहे. आमच्या संशोधन मूल्यमापनात त्याचे सरासरी गुण GPT‑5.6 Sol पेक्षा 32% जास्त होते, तर प्रत्येक प्रयत्नासाठी लागणारा अंदाजित वेळ 48% कमी होता.1
कायदेविषयक कामकाज पाहणारी एखादी टीम सॉफ्टवेअर खरेदीची प्रक्रिया तयार करत आहे, असे समजा. विशिष्ट रकमेपेक्षा जास्त किमतीच्या खरेदीला वित्त विभागाची मंजुरी आवश्यक असू शकते, काही विनंत्यांची सुरक्षा विभागाकडून तपासणी व्हावी लागू शकते आणि नेहमीपेक्षा वेगळ्या अटींची कायदा विभागाकडून तपासणी आवश्यक असू शकते. प्रक्रिया तयार करणाऱ्या व्यक्तीला या छोट्याशा यादीवरून माहिती गोळा करण्याचा फॉर्म, दस्तऐवजांचे नमुने, मंजुरीचे नियम आणि अंतिम कराराची नोंद तयार करावी लागते.
हेच काम करणाऱ्या AI एजंटला सॉफ्टवेअरमध्ये काम करताना या आवश्यकता सतत लक्षात ठेवाव्या लागतात. उदाहरणार्थ, ठरवलेल्या खर्चमर्यादेपेक्षा जास्त रकमेच्या खरेदीसाठी वित्त विभागाची मंजुरी आवश्यक असल्याचे कॉन्फिगरेशन त्याने केले पाहिजे आणि त्या मर्यादेवरील व मर्यादेखालील विनंत्या योग्य मार्गाने पुढे जातात का हे तपासले पाहिजे. प्रत्येक टप्पा स्वतंत्रपणे पार पाडणे पुरेसे नाही: ज्या विविध परिस्थिती हाताळण्यासाठी प्रक्रिया तयार केली आहे, त्या सर्वांत ती योग्य चालली पाहिजे.
Ironclad चे कर्मचारी आणि OpenAI मध्ये Ironclad वापरणाऱ्या व्यक्तींनी आमच्या संशोधकांना कायदेविषयक, व्यावसायिक आणि खरेदीविषयक कामांमधील 11 टास्क्स निवडण्यास मदत केली. यांत गोपनीयता करारांची मांडणी करणे, खरेदीसाठी मंजुरी प्रक्रिया तयार करणे आणि विनंती करणाऱ्या व्यक्तीने निवडलेल्या अधिकारक्षेत्रानुसार पुन्हा वापरता येणारे कायदेशीर कलम अपडेट करणे अशा टास्क्सचा समावेश होता. आमच्या अंदाजानुसार, अनुभवी वापरकर्त्याला प्रत्येक टास्क पूर्ण करण्यासाठी सरासरी सुमारे 30 ते 40 मिनिटे लागतील.
प्रत्येक टास्कच्या गुंतागुंतीनुसार आम्ही 8 ते 50 निकषांच्या आधारे त्याचे मूल्यमापन केले. यामुळे मॉडेलने कोणते भाग योग्यरीत्या पूर्ण केले आणि ते कुठे कमी पडले, हे आम्हाला समजले. Ironclad ने त्यांच्या उत्पादनाची सर्व्हरवर होस्ट केलेली सॉफ्टवेअर पर्यावरणेही पुरवली, जिथे मॉडेल्सना या टास्क्सचा सराव करता आला. आमच्या संशोधकांनी प्रातिनिधिक कार्यप्रवाहांवर आधारित कृत्रिम प्रशिक्षण कार्ये2 तयार केली आणि सराव व अभिप्रायातून मॉडेलमध्ये सुधारणा होण्यासाठी रीइन्फोर्समेंट लर्निंग वापरले. कामाची जाण असलेल्या व्यक्तींसोबत निवडलेली टास्क्स, तपशीलवार निकष आणि मॉडेलना सरावासाठी उपलब्ध पर्यावरण—या एकत्रित दृष्टिकोनामुळे आमच्या ग्राहकांसाठी सर्वाधिक महत्त्वाच्या असलेल्या प्रत्यक्ष टास्क्समध्ये सुधारणा होत असल्याची खात्री होते.
आम्ही Astra साठी Max रीझनिंग आणि Sol साठी उच्च रीझनिंग वापरून Astra व GPT‑5.6 Sol यांची तुलना केली. या सेटिंग्जवर दोन्ही मॉडेलना आपापले सर्वाधिक गुण मिळाले होते. संशोधनातील 11 टास्क्समध्ये Astra चे सरासरी गुण 55.0% होते, तर GPT‑5.6 Sol चे 41.6% होते. प्रत्येक प्रयत्नासाठी लागणारा अंदाजित सरासरी वेळ Sol च्या 37.0 मिनिटांवरून Astra साठी 19.2 मिनिटांपर्यंत कमी झाला.3 Astra च्या विकासात वापरलेल्या एका अंतर्गत मॉडेलने या टास्क्समध्ये आणखी चांगली, 63.7% गुणांची कामगिरी केली. ही वाढीव क्षमताही भविष्यातील मॉडेलमध्ये आणण्याचे आमचे ध्येय आहे.
मापन निकष | GPT‑5.6 Sol | GPT‑6 Astra |
मूल्यमापन निकषांनुसार सरासरी गुण | 41.6% | 55.0% |
प्रत्येक प्रयत्नासाठी अंदाजित सरासरी वेळ | 37.0 मिनिटे | 19.2 मिनिटे |
Astra ने प्रत्येक प्रयत्नात कमी सिम्युलेटेड वेळ घेऊन टास्कच्या अधिक अटी पूर्ण केल्या. दोन्ही मॉडेलनी संशोधनातील एकच टास्क कसे हाताळले, हे खालील दोन व्हिडिओ क्लिप्समध्ये दिसते. Astra ने (पहिल्या क्लिपमध्ये) अंदाजे 20 मिनिटांत टास्कचे सुमारे 94% निकष पूर्ण केले; GPT‑5.6 Sol ने (दुसऱ्या क्लिपमध्ये) अंदाजे 32 मिनिटांत सुमारे 85% निकष पूर्ण केले.
GPT‑6 Astra ने अंदाजे 20 मिनिटांत टास्कचे सुमारे 94% निकष पूर्ण केले.
GPT‑5.6 Sol ने अंदाजे 32 मिनिटांत कार्याचे सुमारे 85% निकष पूर्ण केले.
या कामातील Ironclad ची भूमिका त्यांच्या ग्राहकांना चांगल्या परिचयाच्या असलेल्या एका आव्हानाशी निगडित आहे: व्यवसाय ज्या नियमांवर अवलंबून असतो, ते जपत करार प्रक्रियेत अपवादात्मक परिस्थिती हाताळता आली पाहिजे. एखादे टास्क पूर्ण करताना एजंटला यापैकी एखाद्या नियमाचा विसर पडला, तर सॉफ्टवेअर कंपनी त्याच्यावर विश्वास ठेवून कोणती कामे सोपवू शकते, यावर मर्यादा येतात. करारांशी संबंधित गुंतागुंतीची कामे करण्यात एजंट अधिक सक्षम होत असले, तरी मानवी देखरेख अजूनही महत्त्वाची का आहे आणि करारांसाठी सर्वसमावेशक प्लॅटफॉर्म आवश्यक का आहे, हे यातून स्पष्ट होते. आमच्या संशोधकांसोबत काम केल्यामुळे Ironclad ला या समस्या त्या मॉडेलच्या विकास प्रक्रियेत मांडता येतात आणि आम्हाला त्यांचा एकत्रित अभ्यास करता येतो.
मॉडेल अधिक सक्षम होत असताना, Ironclad ला स्वतःच्या अधिक उत्पादनांमध्ये त्यांचा वापर करण्याची संधी आहे. यामुळे कायदा आणि व्यवसायविषयक टीम्ससाठी करारांशी संबंधित गुंतागुंतीच्या कामांचा अधिक भार AI उचलू शकेल आणि त्याच वेळी या टीम्स ज्यावर अवलंबून असतात त्या नियंत्रण व्यवस्थाही कायम राहू शकतील.
आजचे एजंट अजूनही ज्यांवर विश्वासार्हपणे काम करू शकत नाहीत अशा महत्त्वाच्या व्यावसायिक कामांवर आमच्या संशोधन आणि इंजिनिअरिंग टीम्ससोबत थेट काम करण्यासाठी आम्ही मोजक्या सॉफ्टवेअर कंपन्यांना आमंत्रित करत आहोत. तुमच्या टीमकडे असे एखादे काम असल्यास, आम्हाला त्याचे ठोस उदाहरण पाहायला आवडेल: तुम्ही एजंटला काय करायला सांगत आहात, तो कुठे अपयशी ठरतो याचा पुरावा आणि यशस्वी परिणाम तुम्ही कसा ठरवाल. भागीदारांना कामाची सखोल जाण असलेल्या व्यक्ती, चाचणीसाठी सुरक्षित वातावरण आणि संशोधनासाठी सुरक्षितपणे वापरता येईल असा डेटा उपलब्ध करून देता आला पाहिजे. यातून अपयशाची कारणे तपासण्यासाठी आणि मॉडेलमध्ये सुधारणा होत आहे का हे मोजण्यासाठी आम्हाला सुरुवात कुठून करायची याची माहिती मिळते.
तुमची टीम या अटी पूर्ण करत असल्यास, संशोधनात सहकार्याच्या शक्यता तपासण्यासाठी अर्ज करा.
लेखक
तळटिपा
- 1
- 2
SEC च्या EDGAR डेटाबेसमध्ये सार्वजनिकरीत्या उपलब्ध असलेल्या करारांमधील वैयक्तिक माहिती काढून टाकण्यासाठी तयार केलेले फिल्टर निकष लागू केल्यानंतर आम्ही त्या करारांवरून सिम्युलेटेड टास्क्स तयार केली. आम्ही प्रशिक्षण किंवा मूल्यमापनासाठी OpenAI च्या ग्राहकांचा डेटा, OpenAI चे अंतर्गत करार किंवा Ironclad च्या ग्राहकांचा सार्वजनिक नसलेला डेटा अथवा करार वापरले नाहीत.
- 3


