Ironclad-നൊപ്പം കമ്പ്യൂട്ടർ ഉപയോഗം മെച്ചപ്പെടുത്തുന്നു
സങ്കീർണ്ണമായ തൊഴിൽപരമായ ജോലികളിൽ എഐ ഏജന്റുകളെ പരിശീലിപ്പിക്കാനും വിലയിരുത്താനും കരാർ മേഖലയിലെ ഗവേഷണ സഹകരണം ഞങ്ങളെ എങ്ങനെ സഹായിക്കുന്നു.
ഞങ്ങൾ GPT‑6 Astra അവതരിപ്പിച്ചപ്പോൾ, രേഖകൾ തയ്യാറാക്കുന്നതുമുതൽ വെബ്സൈറ്റുകൾ പരിശോധിക്കുന്നതുവരെ തൊഴിൽപരമായ ജോലികൾക്കായി കമ്പ്യൂട്ടറുകൾ ഉപയോഗിക്കുന്നതിൽ ഞങ്ങളുടെ മോഡലുകൾ എത്രത്തോളം മുന്നേറിയെന്ന് കാണിച്ചുതന്നു. സങ്കീർണ്ണമായ വ്യവസായ പ്രശ്നങ്ങൾ പരിഹരിക്കാൻ പ്രത്യേക സോഫ്റ്റ്വെയറുകൾ ഉപയോഗിക്കുന്നതിൽ ഏജന്റുകളെ കൂടുതൽ കഴിവുറ്റതും കാര്യക്ഷമവുമാക്കുകയാണ് ഞങ്ങളുടെ അടുത്ത ലക്ഷ്യം. ഒരു കമ്പനിയുടെ പ്രവർത്തനനിയമങ്ങൾ മനസ്സിലാക്കാനും ഒന്നിലധികം ഘട്ടങ്ങളുള്ള വർക്ക്ഫ്ലോകൾ നടപ്പാക്കാനും സ്വന്തം ജോലി ആദ്യം നൽകിയ ആവശ്യകതകൾ നിറവേറ്റുന്നുണ്ടെന്ന് ഉറപ്പാക്കാനും മോഡലുകളെ എങ്ങനെ പരിശീലിപ്പിക്കാമെന്ന് ഞങ്ങൾ അന്വേഷിക്കുന്നു.
ഈ ഗവേഷണം വേഗത്തിലാക്കാൻ, ഈ വർക്ക്ഫ്ലോകൾ ഏറ്റവും നന്നായി മനസ്സിലാക്കുന്ന ഏതാനും സോഫ്റ്റ്വെയർ കമ്പനികളുമായി ഞങ്ങൾ നേരിട്ട് സഹകരിക്കുന്നു. വെല്ലുവിളി നിറഞ്ഞതും ഏറെ മൂല്യമുള്ളതുമായ ടാസ്ക്കുകൾ ഞങ്ങൾ ഒരുമിച്ച് കണ്ടെത്തി മോഡലുകളെ പരിശീലിപ്പിക്കാനും വിലയിരുത്താനുമുള്ള ഗവേഷണപ്രശ്നങ്ങളാക്കി മാറ്റുന്നു. ഇതിലൂടെ പ്രായോഗിക വ്യവസായ ആവശ്യങ്ങളിൽ ഞങ്ങളുടെ മോഡലുകൾ കൂടുതൽ കഴിവുറ്റതും പ്രയോജനകരവുമാകുന്നു.
എഐ അധിഷ്ഠിത കരാർ നിർവഹണത്തിലെ മുൻനിര സ്ഥാപനമായ Ironclad ആണ് ഞങ്ങളുടെ ആദ്യ പങ്കാളി. Ironclad സംഘവുമായി ചേർന്ന്, ഉടമ്പടികൾ, അംഗീകാരങ്ങൾ, ആവർത്തിച്ച് ഉപയോഗിക്കാവുന്ന നിയമവ്യവസ്ഥകൾ എന്നിവ ഏജന്റുകൾ സജ്ജീകരിക്കേണ്ട ടാസ്ക്കുകൾ ഞങ്ങൾ വികസിപ്പിച്ചു. ഈ സങ്കീർണ്ണ പ്രവർത്തനക്രമങ്ങളിൽ പുരോഗതിയും തെളിയിച്ചു. വിജയത്തിന്റെ മാനദണ്ഡങ്ങൾ നിർവചിക്കുന്നതിലും യഥാർഥ ഉപഭോക്തൃ ആവശ്യങ്ങൾ അത്യാധുനിക മോഡൽ വികസനത്തിലേക്ക് നേരിട്ട് കൊണ്ടുവരുന്നതിലും Ironclad-ന്റെ വൈദഗ്ധ്യം നിർണായകമായി. അവരുടെ പങ്കാളിത്തത്തിന് ഞങ്ങൾ നന്ദിയുള്ളവരാണ്. ഒരുമിച്ച് കൈവരിച്ച നേട്ടങ്ങൾ പങ്കിടുന്നതിൽ ഞങ്ങൾക്ക് ആവേശമുണ്ട്.
Ironclad ടാസ്ക്കുകളിൽ പരിശീലിപ്പിച്ച ഞങ്ങളുടെ ആദ്യ അത്യാധുനിക മോഡലാണ് GPT‑6 Astra. ഞങ്ങളുടെ ഗവേഷണ മൂല്യനിർണയത്തിൽ അതിന്റെ ശരാശരി സ്കോർ GPT‑5.6 Sol-ന്റേതിനേക്കാൾ 32% കൂടുതലായിരുന്നു. ഓരോ ശ്രമത്തിനും കണക്കാക്കിയ സമയം 48% കുറവുമായിരുന്നു.1
സോഫ്റ്റ്വെയർ വാങ്ങുന്നതിനുള്ള ഒരു പ്രക്രിയ സജ്ജീകരിക്കുന്ന നിയമകാര്യ സംഘത്തെ പരിഗണിക്കാം. ഒരു നിശ്ചിത തുകയ്ക്കു മുകളിലുള്ള വാങ്ങലുകൾക്ക് ധനകാര്യ വിഭാഗത്തിന്റെ അംഗീകാരം വേണ്ടിവരാം. ചില അപേക്ഷകൾ സുരക്ഷാ വിഭാഗവും പതിവിൽനിന്നു വ്യത്യസ്തമായ വ്യവസ്ഥകൾ നിയമ വിഭാഗവും പരിശോധിക്കേണ്ടിവരാം. പ്രക്രിയ സജ്ജീകരിക്കുന്ന വ്യക്തി ഈ ചെറിയ പട്ടികയെ ഒരു അപേക്ഷാഫോം, രേഖാമാതൃകകൾ, അംഗീകാരനിയമങ്ങൾ, അന്തിമ ഉടമ്പടിയുടെ രേഖ എന്നിവയാക്കി മാറ്റണം.
ഇതേ ജോലി ചെയ്യുന്ന എഐ ഏജന്റ് സോഫ്റ്റ്വെയറിലൂടെ മുന്നോട്ടുപോകുമ്പോൾ ഈ ആവശ്യകതകൾ മറക്കാതെ സൂക്ഷിക്കണം. ഉദാഹരണത്തിന്, ചെലവുപരിധി കടന്നാൽ ധനകാര്യ അംഗീകാരം വേണമെന്ന് സജ്ജീകരിക്കണം. പരിധിക്ക് മുകളിലും താഴെയുമുള്ള അപേക്ഷകൾ ശരിയായ വഴികളിലൂടെ പോകുന്നുണ്ടെന്നും പരിശോധിക്കണം. ഓരോ ഘട്ടവും ശരിയാക്കിയാൽ മാത്രം പോരാ: പൂർത്തിയായ പ്രക്രിയ അത് കൈകാര്യം ചെയ്യാനായി രൂപകൽപ്പന ചെയ്ത എല്ലാ സാഹചര്യങ്ങളിലും പ്രവർത്തിക്കണം.
നിയമം, വാണിജ്യം, സംഭരണം എന്നീ മേഖലകളിലെ 11 ടാസ്ക്കുകൾ കണ്ടെത്താൻ Ironclad ജീവനക്കാരും OpenAI-യിൽ Ironclad ഉപയോഗിക്കുന്നവരും ഞങ്ങളുടെ ഗവേഷകരെ സഹായിച്ചു. വിവരങ്ങൾ വെളിപ്പെടുത്താതിരിക്കാനുള്ള ഉടമ്പടികൾ തയ്യാറാക്കുക, സംഭരണത്തിനുള്ള അംഗീകാരപ്രക്രിയകൾ സൃഷ്ടിക്കുക, അപേക്ഷകൻ തിരഞ്ഞെടുക്കുന്ന അധികാരപരിധിക്ക് അനുസൃതമായി ആവർത്തിച്ച് ഉപയോഗിക്കാവുന്ന നിയമവ്യവസ്ഥ പുതുക്കുക തുടങ്ങിയ ടാസ്ക്കുകൾ ഇതിൽ ഉൾപ്പെട്ടു. പരിചയസമ്പന്നനായ ഒരു ഉപയോക്താവിന് ഓരോ ടാസ്ക്കിനും ശരാശരി 30 മുതൽ 40 മിനിറ്റ് വരെ വേണ്ടിവരുമെന്നാണ് ഞങ്ങളുടെ കണക്ക്.
സങ്കീർണ്ണതയനുസരിച്ച് 8 മുതൽ 50 വരെ മാനദണ്ഡങ്ങൾ ഉപയോഗിച്ച് ഓരോ ടാസ്ക്കും ഞങ്ങൾ വിലയിരുത്തി. ഏതൊക്കെ ഭാഗങ്ങളിൽ മോഡൽ വിജയിച്ചെന്നും എവിടെയാണ് വീഴ്ച വന്നതെന്നും മനസ്സിലാക്കാൻ ഇത് സഹായിച്ചു. മോഡലുകൾക്ക് ഈ ടാസ്ക്കുകൾ പരിശീലിക്കാൻ സ്വന്തം ഉൽപ്പന്നത്തിന്റെ ഹോസ്റ്റ് ചെയ്ത സോഫ്റ്റ്വെയർ പരിതസ്ഥിതികളും Ironclad നൽകി. സാധാരണ വർക്ക്ഫ്ലോകളെ ആധാരമാക്കി ഞങ്ങളുടെ ഗവേഷകർ കൃത്രിമ പരിശീലന ടാസ്ക്കുകൾ2 വികസിപ്പിച്ചു. പരിശീലനത്തിലൂടെയും പ്രതികരണങ്ങളിലൂടെയും മോഡലുകൾ മെച്ചപ്പെടാൻ റീഇൻഫോഴ്സ്മെന്റ് ലേണിംഗ് ഉപയോഗിച്ചു. ജോലി അറിയുന്നവരുമായി ചേർന്ന് തിരഞ്ഞെടുത്ത ടാസ്ക്കുകൾ, വിശദമായ മാനദണ്ഡങ്ങൾ, മോഡലുകൾക്ക് പരിശീലിക്കാനുള്ള ഇടം—ഇവയുടെ സംയോജനം ഞങ്ങളുടെ ഉപഭോക്താക്കൾക്ക് ഏറ്റവും പ്രധാനപ്പെട്ട യഥാർഥ ടാസ്ക്കുകളിലാണ് ഞങ്ങൾ പുരോഗതി കൈവരിക്കുന്നതെന്ന് ഉറപ്പാക്കുന്നു.
Astra-യ്ക്ക് Max റീസണിംഗും GPT‑5.6 Sol-ന് ഉയർന്നത് എന്ന റീസണിംഗ് ക്രമീകരണവും ഉപയോഗിച്ചാണ് ഞങ്ങൾ അവയെ താരതമ്യം ചെയ്തത്. ഓരോ മോഡലും ഏറ്റവും ഉയർന്ന സ്കോർ നേടിയ ക്രമീകരണങ്ങളാണിവ. 11 ഗവേഷണ ടാസ്ക്കുകളിൽ Astra-യുടെ ശരാശരി സ്കോർ 55.0% ആയിരുന്നു; GPT‑5.6 Sol-ന്റേത് 41.6%-വും. ഓരോ ശ്രമത്തിനും കണക്കാക്കിയ ശരാശരി സമയം Sol-ന്റെ 37.0 മിനിറ്റിൽനിന്ന് Astra-യുടെ 19.2 മിനിറ്റായി കുറഞ്ഞു.3 Astra-യുടെ വികസനത്തിൽ ഉപയോഗിച്ച ഒരു ആഭ്യന്തര മോഡൽ ഈ ടാസ്ക്കുകളിൽ ഇതിലും മികച്ച 63.7% നേടി. ഈ അധിക നേട്ടങ്ങൾ ഭാവി മോഡലുകളിലും ലഭ്യമാക്കാനാണ് ഞങ്ങളുടെ ലക്ഷ്യം.
അളവുകോൽ | GPT‑5.6 Sol | GPT‑6 Astra |
മൂല്യനിർണയ മാനദണ്ഡങ്ങളിലെ ശരാശരി സ്കോർ | 41.6% | 55.0% |
ഓരോ ശ്രമത്തിനും കണക്കാക്കിയ ശരാശരി സമയം | 37.0 മിനിറ്റ് | 19.2 മിനിറ്റ് |
ഓരോ ശ്രമത്തിനും അനുകരണത്തിൽ കുറഞ്ഞ സമയം എടുത്തുകൊണ്ട് Astra ടാസ്ക്കിന്റെ കൂടുതൽ ആവശ്യകതകൾ നിറവേറ്റി. ഒരേ ഗവേഷണ ടാസ്ക്ക് മോഡലുകൾ എങ്ങനെ കൈകാര്യം ചെയ്തുവെന്ന് താഴെയുള്ള രണ്ട് ഹ്രസ്വദൃശ്യങ്ങൾ കാണിക്കുന്നു. Astra (ആദ്യത്തേത്) ഏകദേശം 20 മിനിറ്റിൽ ടാസ്ക്കിന്റെ മാനദണ്ഡങ്ങളിൽ ഏതാണ്ട് 94% നിറവേറ്റി; GPT‑5.6 Sol (രണ്ടാമത്തേത്) ഏകദേശം 32 മിനിറ്റിൽ ഏതാണ്ട് 85%-വും. ഇവ കണക്കാക്കിയ സമയങ്ങളാണ്.
GPT‑6 Astra ഏകദേശം 20 മിനിറ്റിൽ ടാസ്ക്കിന്റെ മാനദണ്ഡങ്ങളിൽ ഏതാണ്ട് 94% നിറവേറ്റിയതായി കണക്കാക്കുന്നു.
GPT‑5.6 Sol ഏകദേശം 32 മിനിറ്റിൽ ടാസ്ക്കിന്റെ മാനദണ്ഡങ്ങളിൽ ഏതാണ്ട് 85% നിറവേറ്റിയതായി കണക്കാക്കുന്നു.
ഈ പ്രവർത്തനത്തിലെ Ironclad-ന്റെ പങ്ക് അവരുടെ ഉപഭോക്താക്കൾക്ക് നന്നായി അറിയാവുന്ന ഒരു വെല്ലുവിളിയെയാണ് പ്രതിഫലിപ്പിക്കുന്നത്: ഒരു ബിസിനസ്സ് ആശ്രയിക്കുന്ന നിയമങ്ങൾ കൃത്യമായി പാലിച്ചുകൊണ്ടുതന്നെ, കരാർ നടപടിക്രമങ്ങളിലെ പ്രത്യേക സാഹചര്യങ്ങൾ കൈകാര്യം ചെയ്യാൻ സാധിക്കണം. ഒരു ടാസ്ക്കിനിടയിൽ ഒരു ഏജന്റിന് ഈ നിയമങ്ങളിൽ ഏതെങ്കിലും ഒന്നിനെക്കുറിച്ചുള്ള ധാരണ നഷ്ടപ്പെട്ടാൽ, ആ ഏജന്റിനെ വിശ്വസിച്ച് ഏൽപ്പിക്കാൻ കഴിയുന്ന കാര്യങ്ങൾക്ക് ഒരു സോഫ്റ്റ്വെയർ കമ്പനിക്ക് പരിമിതികൾ വരുന്നു. സങ്കീർണ്ണമായ കരാർ ജോലികൾ കൈകാര്യം ചെയ്യുന്നതിൽ ഏജന്റുകൾ കൂടുതൽ മികവ് പുലർത്തുമ്പോഴും മനുഷ്യരുടെ മേൽനോട്ടം എന്തുകൊണ്ട് ഇപ്പോഴും പ്രധാനമായിരിക്കുന്നുവെന്നും, ഒരു സമ്പൂർണ്ണ കോൺട്രാക്റ്റിംഗ് പ്ലാറ്റ്ഫോം എന്തുകൊണ്ട് അത്യന്താപേക്ഷിതമായി തുടരുന്നുവെന്നും ഇത് വ്യക്തമാക്കുന്നു. ഞങ്ങളുടെ ഗവേഷകരുമായി ചേർന്ന് പ്രവർത്തിക്കുന്നത് വഴി, ഇത്തരം പ്രശ്നങ്ങളെ അടിസ്ഥാന മോഡലിന്റെ വികസന ഘട്ടത്തിലേക്ക് കൊണ്ടുവരാനും, അവ ഒരുമിച്ച് പഠിക്കാനും Ironclad-ന് അവസരം ലഭിക്കുന്നു.
മോഡലുകൾ കൂടുതൽ കാര്യക്ഷമമാകുന്തോറും, അവയെ സ്വന്തം ഉൽപ്പന്നങ്ങളിൽ കൂടുതൽ വ്യാപകമായി പ്രയോജനപ്പെടുത്താൻ Ironclad-ന് അവസരമുണ്ട്. നിയമ, വാണിജ്യ വിഭാഗങ്ങളെ സംബന്ധിച്ചിടത്തോളം, അവർ ആശ്രയിക്കുന്ന നിയന്ത്രണങ്ങൾ നിലനിർത്തിക്കൊണ്ട് സങ്കീർണ്ണമായ കരാർ ജോലികളിലെ കൂടുതൽ അധ്വാനം എഐ ഏറ്റെടുക്കുന്നതിനെയാണ് ഇത് അർത്ഥമാക്കുന്നത്.
ഇന്നത്തെ ഏജന്റുകൾക്ക് ഇപ്പോഴും വിശ്വസനീയമായി പൂർത്തിയാക്കാനാകാത്ത പ്രധാനപ്പെട്ട തൊഴിൽപരമായ ജോലികളിൽ ഞങ്ങളുടെ ഗവേഷണ, എൻജിനീയറിംഗ് സംഘങ്ങളുമായി നേരിട്ട് പ്രവർത്തിക്കാൻ ഏതാനും സോഫ്റ്റ്വെയർ കമ്പനികളെ ഞങ്ങൾ ക്ഷണിക്കുന്നു. നിങ്ങളുടെ സംഘത്തിന് അത്തരമൊരു ജോലിയുണ്ടെങ്കിൽ, വ്യക്തമായ ഒരുദാഹരണം കാണാൻ ഞങ്ങൾ ആഗ്രഹിക്കുന്നു: ഏജന്റിനോട് എന്താണ് ചെയ്യാൻ ആവശ്യപ്പെടുന്നത്, എവിടെയാണ് അത് പരാജയപ്പെടുന്നതെന്നതിന്റെ തെളിവ്, വിജയകരമായ ഫലം എങ്ങനെ വിലയിരുത്തും എന്നിവ. ജോലി ആഴത്തിൽ അറിയുന്ന ആളുകൾ, പരീക്ഷണത്തിനുള്ള സുരക്ഷിതമായ അന്തരീക്ഷം, ഗവേഷണത്തിന് സുരക്ഷിതമായി ഉപയോഗിക്കാവുന്ന ഡാറ്റ എന്നിവയും പങ്കാളികൾക്ക് ലഭ്യമാക്കാനാകണം. പരാജയത്തിന്റെ കാരണം അന്വേഷിക്കാനും മോഡൽ മെച്ചപ്പെടുന്നുണ്ടോ എന്ന് അളക്കാനുമുള്ള തുടക്കം ഇതിലൂടെ ഞങ്ങൾക്ക് ലഭിക്കുന്നു.
നിങ്ങളുടെ സംഘം ഈ വിവരണത്തിന് യോജിക്കുന്നെങ്കിൽ, ഗവേഷണ സഹകരണത്തിന്റെ സാധ്യത തേടി അപേക്ഷിക്കൂ.
രചയിതാവ്
അടിക്കുറിപ്പുകൾ
- 1
ഈ ഫലങ്ങൾ Ironclad-ന്റെ എല്ലാ വർക്ക്ഫ്ലോകളെയും അല്ല, മറിച്ച് ഈ 11 ഗവേഷണ ടാസ്ക്കുകളെ മാത്രമാണ് ഉൾക്കൊള്ളുന്നത്. ഇതിൽ കാണിച്ചിരിക്കുന്ന സമയങ്ങൾ മോഡലിന്റെ കണക്കുകൂട്ടിയ പ്രോസസ്സിംഗ്, ജനറേഷൻ വേഗതകളെ അടിസ്ഥാനമാക്കിയുള്ള അനുമാനങ്ങൾ മാത്രമാണ്; ഉപഭോക്താക്കൾക്ക് യഥാർത്ഥത്തിൽ ലഭിച്ച സമയലാഭം അളന്നുതിട്ടപ്പെടുത്തിയതല്ല.
- 2
എസ്ഇസിയുടെ EDGAR ഡാറ്റാബേസിൽ പൊതുവായി ലഭ്യമായ കരാറുകളിൽനിന്ന് വ്യക്തിഗത വിവരങ്ങൾ നീക്കാനുള്ള ഫിൽട്ടറുകൾ പ്രയോഗിച്ച ശേഷമാണ് ഞങ്ങൾ അനുകരണ ടാസ്ക്കുകൾ സൃഷ്ടിച്ചത്. പരിശീലനത്തിനോ മൂല്യനിർണയത്തിനോ OpenAI ഉപഭോക്താക്കളുടെ ഡാറ്റയോ OpenAI-യുടെ ആഭ്യന്തര കരാറുകളോ പൊതുവിൽ ലഭ്യമല്ലാത്ത Ironclad ഉപഭോക്തൃ ഡാറ്റയോ കരാറുകളോ ഞങ്ങൾ ഉപയോഗിച്ചിട്ടില്ല.
- 3


