આયર્નક્લેડ સાથે કમ્પ્યુટર ઉપયોગને આગળ વધારવો
કરાર ક્ષેત્રે સંશોધન સહયોગ અમને જટિલ વ્યાવસાયિક કામ માટે એઆઈ એજન્ટોની તાલીમ અને મૂલ્યાંકનમાં કેવી રીતે મદદ કરી રહ્યો છે.
અમે GPT‑6 Astra રજૂ કર્યું ત્યારે બતાવ્યું હતું કે દસ્તાવેજો તૈયાર કરવાથી લઈને વેબસાઇટ્સનું પરીક્ષણ કરવા સુધીનાં વ્યાવસાયિક કામ માટે કમ્પ્યુટર વાપરવામાં અમારાં મોડલ કેટલાં આગળ વધ્યાં છે. અમારું આગામી લક્ષ્ય જટિલ વ્યવસાયિક સમસ્યાઓ ઉકેલવા માટે વિશિષ્ટ સોફ્ટવેર વાપરવામાં એજન્ટોને વધુ સક્ષમ અને કાર્યક્ષમ બનાવવાનું છે. કંપનીના વ્યવસાયિક નિયમો સમજવા, અનેક પગલાંવાળી કાર્યપ્રક્રિયાઓ અમલમાં મૂકવા અને પોતાનું કામ મૂળ જરૂરિયાતો પૂરી કરે છે કે નહીં તે ચકાસવા મોડલને કેવી રીતે તાલીમ આપી શકાય તે અમે શોધી રહ્યા છીએ.
આ સંશોધનને વેગ આપવા અમે આ કાર્યપ્રક્રિયાઓની શ્રેષ્ઠ સમજ ધરાવતી મર્યાદિત સંખ્યામાં સોફ્ટવેર કંપનીઓ સાથે સીધી ભાગીદારી કરી રહ્યા છીએ. અમે સાથે મળીને પડકારજનક અને અત્યંત મૂલ્યવાન કાર્યો ઓળખી રહ્યા છીએ અને અમારા મોડલની તાલીમ તથા મૂલ્યાંકન માટે તેમને સંશોધનના પ્રશ્નોમાં ફેરવી રહ્યા છીએ. અંતે, તેનાથી અમારા મોડલ વાસ્તવિક વ્યવસાયિક ઉપયોગમાં વધુ સક્ષમ અને ઉપયોગી બનશે.
અમારા પ્રથમ ભાગીદાર આયર્નક્લેડ છે, જે એઆઈ આધારિત કરાર વ્યવસ્થાપનમાં અગ્રણી છે. આયર્નક્લેડની ટીમ સાથે મળીને અમે એવાં કાર્યો વિકસાવ્યાં છે જેમાં એજન્ટોએ કરારો, મંજૂરીઓ અને ફરી વાપરી શકાય તેવી કાનૂની શરતો ગોઠવવાની હોય છે. આ જટિલ કાર્યપ્રક્રિયાઓમાં અમે પ્રગતિ પણ દર્શાવી છે. સફળતા કોને કહેવાય તે નક્કી કરવામાં અને ગ્રાહકોની વાસ્તવિક જરૂરિયાતોને સીધી અત્યાધુનિક મોડલની વિકાસ પ્રક્રિયામાં સામેલ કરવામાં આયર્નક્લેડની કુશળતાએ ચાવીરૂપ ભૂમિકા ભજવી છે. તેમની ભાગીદારી બદલ અમે આભારી છીએ અને અમે સાથે મળીને જે સિદ્ધ કર્યું છે તે જણાવવા ઉત્સુક છીએ.
GPT‑6 Astra આયર્નક્લેડનાં કાર્યો પર તાલીમ પામેલું અમારું પ્રથમ અત્યાધુનિક મોડલ છે. અમારા સંશોધન મૂલ્યાંકનમાં તેનો સરેરાશ ગુણાંક GPT‑5.6 Sol કરતાં 32% વધુ હતો, જ્યારે દરેક પ્રયાસ દીઠ અંદાજિત સમય 48% ઓછો હતો.1
ધારો કે કાનૂની કામગીરી સંભાળતી કોઈ ટીમ સોફ્ટવેર ખરીદવા માટે પ્રક્રિયા ગોઠવી રહી છે. ચોક્કસ રકમથી વધુની ખરીદી માટે નાણાં વિભાગની મંજૂરી, અમુક વિનંતીઓ માટે સુરક્ષા વિભાગની સમીક્ષા અને બિનપ્રમાણભૂત શરતો માટે કાનૂની વિભાગની સમીક્ષા જરૂરી હોઈ શકે છે. પ્રક્રિયા ગોઠવનાર વ્યક્તિએ આ ટૂંકી યાદીના આધારે વિગતો એકત્ર કરવા માટેનું ફોર્મ, દસ્તાવેજોના નમૂના, મંજૂરીના નિયમો અને અંતિમ કરારનો રેકોર્ડ તૈયાર કરવાનો હોય છે.
આ જ કામ કરતા એઆઈ એજન્ટે સોફ્ટવેરમાં આગળ વધતી વખતે આ જરૂરિયાતો ધ્યાનમાં રાખવી પડે છે. ઉદાહરણ તરીકે, તેણે ખર્ચની મર્યાદાથી વધુ રકમ માટે નાણાં વિભાગની મંજૂરી જરૂરી બનાવવી પડે અને આ મર્યાદાથી વધુ તથા ઓછી રકમની વિનંતીઓ યોગ્ય પ્રક્રિયામાંથી પસાર થાય છે કે નહીં તે ચકાસવું પડે. દરેક પગલું સાચી રીતે કરવું એટલું જ પૂરતું નથી: તૈયાર થયેલી પ્રક્રિયા જે પરિસ્થિતિઓ સંભાળવા માટે રચાઈ હોય તે બધી પરિસ્થિતિઓમાં યોગ્ય રીતે કામ કરવી જોઈએ.
આયર્નક્લેડના કર્મચારીઓ અને OpenAIમાં આયર્નક્લેડ વાપરતા લોકોએ અમારા સંશોધકોને કાનૂની, વાણિજ્યિક અને ખરીદી સંબંધી કામમાંથી 11 કાર્યો ઓળખવામાં મદદ કરી. તેમાં ગોપનીયતા કરારો તૈયાર કરવા, ખરીદીની મંજૂરી માટે પ્રક્રિયાઓ બનાવવી અને ફરી વાપરી શકાય તેવી કાનૂની કલમને વિનંતી કરનાર પસંદ કરે તે અધિકારક્ષેત્ર અનુસાર સુધારવા જેવાં કાર્યો સામેલ હતાં. અમારા અંદાજ મુજબ અનુભવી વપરાશકર્તાને આ કામ માટે કાર્ય દીઠ સરેરાશ લગભગ 30થી 40 મિનિટ લાગે.
અમે દરેક કાર્યની જટિલતા અનુસાર 8થી 50 માપદંડોના આધારે તેનું મૂલ્યાંકન કર્યું. તેનાથી અમને જોવા મળ્યું કે મોડલે કયા ભાગો યોગ્ય રીતે કર્યા અને ક્યાં તે ઊણું ઊતર્યું. આયર્નક્લેડે તેની પ્રોડક્ટ માટે સર્વર પર સંચાલિત સોફ્ટવેર વાતાવરણ પણ પૂરાં પાડ્યાં, જ્યાં મોડલ આ કાર્યોનો અભ્યાસ કરી શકે. અમારા સંશોધકોએ પ્રતિનિધિ કાર્યપ્રક્રિયાઓ પર આધારિત કૃત્રિમ તાલીમ કાર્યો2 વિકસાવ્યાં અને અભ્યાસ તથા પ્રતિસાદ દ્વારા મોડલને સુધારવામાં મદદ કરવા રીઇન્ફોર્સમેન્ટ લર્નિંગનો ઉપયોગ કર્યો. કામ જાણતા લોકો સાથે મળીને પસંદ કરેલાં કાર્યો, વિગતવાર માપદંડો અને મોડલ માટે અભ્યાસનું સ્થળ—આ સંયોજન સુનિશ્ચિત કરે છે કે અમે અમારા ગ્રાહકો માટે સૌથી મહત્ત્વનાં વાસ્તવિક કાર્યોમાં સુધારો કરી રહ્યા છીએ.
અમે એસ્ટ્રા માટે Max রিজনিং અને સોલ માટે હાઇ রিজনিংનો ઉપયોગ કરીને એસ્ટ્રા અને GPT‑5.6 Solની સરખામણી કરી. આ સેટિંગ્સ પર દરેક મોડલને તેનો સર્વોચ્ચ ગુણાંક મળ્યો હતો. સંશોધનનાં 11 કાર્યોમાં એસ્ટ્રાનો સરેરાશ ગુણાંક 55.0% હતો, જ્યારે GPT‑5.6 Solનો 41.6% હતો. દરેક પ્રયાસ દીઠ અંદાજિત સરેરાશ સમય સોલ માટે 37.0 મિનિટથી ઘટીને એસ્ટ્રા માટે 19.2 મિનિટ થયો.3 એસ્ટ્રાના વિકાસમાં વપરાયેલા એક આંતરિક મોડલે આ કાર્યોમાં તેનાથી પણ વધુ સારો, 63.7% ગુણાંક મેળવ્યો. અમે આ વધારાના સુધારા ભવિષ્યનાં મોડલમાં લાવવાનું લક્ષ્ય ધરાવીએ છીએ.
માપદંડ | GPT‑5.6 Sol | GPT‑6 Astra |
મૂલ્યાંકન માપદંડો મુજબ સરેરાશ ગુણાંક | 41.6% | 55.0% |
દરેક પ્રયાસ દીઠ અંદાજિત સરેરાશ સમય | 37.0 મિનિટ | 19.2 મિનિટ |
અનુકરણમાં એસ્ટ્રાએ દરેક પ્રયાસ દીઠ ઓછા સમયમાં કાર્યની વધુ જરૂરિયાતો પૂરી કરી. નીચેની બે ટૂંકી વિડિયો ક્લિપ દર્શાવે છે કે મોડલે સંશોધનનું એક જ કાર્ય કેવી રીતે કર્યું. એસ્ટ્રાએ (પ્રથમ ક્લિપ) અંદાજિત 20 મિનિટમાં કાર્યના લગભગ 94% માપદંડો પૂરા કર્યા; GPT‑5.6 Solએ (બીજી ક્લિપ) અંદાજિત 32 મિનિટમાં લગભગ 85% માપદંડો પૂરા કર્યા.
GPT‑6 Astraએ અંદાજિત 20 મિનિટમાં કાર્યના લગભગ 94% માપદંડો પૂરા કર્યા.
GPT‑5.6 Solએ અંદાજિત 32 મિનિટમાં કાર્યના લગભગ 85% માપદંડો પૂરા કર્યા.
આ કાર્યમાં આયર્નક્લેડની ભૂમિકા એવા પડકારને ઉજાગર કરે છે જેનાથી તેના ગ્રાહકો સારી રીતે પરિચિત છે: કરાર પ્રક્રિયાએ અપવાદરૂપ પરિસ્થિતિઓ સંભાળવાની સાથે વ્યવસાય જે નિયમો પર આધાર રાખે છે તે પણ જાળવવા જરૂરી છે. જો એજન્ટ કોઈ કાર્ય દરમિયાન આમાંથી કોઈ નિયમ ભૂલી જાય, તો સોફ્ટવેર કંપની તેને વિશ્વાસપૂર્વક કયાં કામ સોંપી શકે તેની મર્યાદા બંધાય છે. આ દર્શાવે છે કે એજન્ટો કરારનાં જટિલ કાર્યોમાં વધુ સક્ષમ બનતા જાય તેમ છતાં માનવીય દેખરેખ કેમ મહત્ત્વની છે અને કરાર વ્યવસ્થાપન માટે સંપૂર્ણ મંચ કેમ જરૂરી રહે છે. અમારા સંશોધકો સાથે કામ કરવાથી આયર્નક્લેડ આ સમસ્યાઓને પાયાના મોડલની વિકાસ પ્રક્રિયામાં સામેલ કરી શકે છે, જ્યાં અમે સાથે મળીને તેનો અભ્યાસ કરી શકીએ છીએ.
મોડલ વધુ સક્ષમ બનતાં આયર્નક્લેડને પોતાની વધુ પ્રોડક્ટ્સમાં તેનો ઉપયોગ કરવાની તક મળે છે. કાનૂની અને વ્યવસાયિક ટીમો માટે તેનો અર્થ એ હોઈ શકે કે એઆઈ કરારની જટિલ પ્રક્રિયામાં વધુ કામ સંભાળે અને સાથે આ ટીમો જે નિયંત્રણો પર આધાર રાખે છે તે જાળવી રાખે.
આજના એજન્ટો હજી વિશ્વસનીય રીતે પૂર્ણ કરી શકતા નથી એવાં મહત્ત્વનાં વ્યાવસાયિક કાર્યો પર અમારી સંશોધન અને ઇજનેરી ટીમો સાથે સીધું કામ કરવા અમે મર્યાદિત સંખ્યામાં સોફ્ટવેર કંપનીઓને આમંત્રિત કરી રહ્યા છીએ. જો તમારી ટીમ પાસે આવું કોઈ કાર્ય હોય, તો અમે તેનું નક્કર ઉદાહરણ જોવા માગીએ છીએ: તમે એજન્ટને શું કરવા કહો છો, તે ક્યાં નિષ્ફળ જાય છે તેના પુરાવા અને સફળ પરિણામનું મૂલ્યાંકન તમે કેવી રીતે કરશો. ભાગીદારો કામની ઊંડી સમજ ધરાવતા લોકો, પરીક્ષણ માટે સુરક્ષિત વાતાવરણ અને સંશોધન માટે સુરક્ષિત રીતે વાપરી શકાય એવો ડેટા પણ પૂરો પાડી શકે તે જરૂરી છે. આ અમને નિષ્ફળતાની તપાસ કરવા અને મોડલમાં સુધારો થાય છે કે નહીં તે માપવા માટે પ્રારંભિક આધાર આપે છે.
જો તમારી ટીમ આ માટે યોગ્ય હોય, તો સંશોધનમાં સહયોગની શક્યતાઓ શોધવા અરજી કરો.
લેખક
પાદટીપો
- 1
- 2
- 3


