Progrese în utilizarea calculatoarelor alături de Ironclad
Cum ne ajută o colaborare de cercetare în domeniul contractării să antrenăm și să evaluăm agenți IA pentru activități profesionale complexe.
Când am prezentat GPT‑6 Astra, am demonstrat cât de mult au progresat modelele noastre în utilizarea calculatoarelor pentru activități profesionale, de la pregătirea documentelor la testarea site-urilor web. Următorul nostru obiectiv este să facem agenții mai capabili și mai eficienți în utilizarea programelor specializate pentru rezolvarea unor probleme complexe de afaceri. Explorăm modalități de a antrena modelele să înțeleagă regulile de afaceri ale unei companii, să execute fluxuri de lucru în mai mulți pași și să verifice dacă rezultatul muncii lor îndeplinește cerințele inițiale.
Pentru a accelera această cercetare, colaborăm direct cu un număr restrâns de companii software care înțeleg cel mai bine aceste fluxuri de lucru. Împreună, identificăm sarcini dificile, cu valoare ridicată, și le transformăm în probleme de cercetare pentru antrenarea și evaluarea modelelor noastre, astfel încât acestea să devină mai capabile și mai utile în aplicații practice de afaceri.
Primul nostru partener este Ironclad, un lider în contractarea asistată de IA. Lucrând îndeaproape cu echipa Ironclad, am dezvoltat sarcini care le cer agenților să configureze acorduri, aprobări și clauze juridice reutilizabile și am demonstrat progrese în aceste fluxuri de lucru complexe. Expertiza Ironclad a fost esențială pentru definirea criteriilor de reușită și pentru integrarea nevoilor reale ale clienților direct în dezvoltarea modelelor de vârf. Suntem recunoscători pentru acest parteneriat și bucuroși să prezentăm ceea ce am realizat împreună.
GPT‑6 Astra este primul nostru model de vârf antrenat pe sarcini Ironclad. În evaluarea din cadrul cercetării noastre, scorul său mediu a fost cu 32% mai mare decât cel al GPT‑5.6 Sol, iar timpul estimat pe încercare a fost cu 48% mai mic.1
Să luăm exemplul unei echipe de operațiuni juridice care pune la punct un proces de achiziție de software. Este posibil ca departamentul financiar să trebuiască să aprobe achizițiile peste o anumită sumă, departamentul de securitate să verifice anumite cereri, iar cel juridic să analizeze clauzele nestandard. Persoana care configurează procesul trebuie să transforme această listă scurtă într-un formular de cerere, șabloane de documente, reguli de aprobare și o înregistrare a acordului final.
Un agent IA care face aceeași muncă trebuie să țină cont de aceste cerințe pe măsură ce navighează în aplicație. De exemplu, trebuie să configureze aprobarea de către departamentul financiar pentru cheltuielile care depășesc pragul stabilit și să verifice dacă cererile peste și sub acest prag urmează traseele corecte. Nu este suficient ca fiecare pas să fie corect: procesul final trebuie să funcționeze în toate situațiile pentru care a fost conceput.
Angajații Ironclad și persoanele care folosesc Ironclad la OpenAI i-au ajutat pe cercetătorii noștri să identifice 11 sarcini din activitățile juridice, comerciale și de achiziții. Printre acestea s-au numărat configurarea acordurilor de confidențialitate, crearea proceselor de aprobare a achizițiilor și actualizarea unei clauze juridice reutilizabile pentru a reflecta jurisdicția selectată de solicitant. Estimăm că unui utilizator cu experiență i-ar lua, în medie, aproximativ 30–40 de minute pentru fiecare sarcină.
Am evaluat fiecare sarcină pe baza a 8 până la 50 de criterii, în funcție de complexitatea ei. Astfel, am putut vedea ce părți a rezolvat corect un model și unde nu a îndeplinit cerințele. Ironclad a pus la dispoziție și medii software găzduite ale produsului său, în care modelele puteau exersa aceste sarcini. Cercetătorii noștri au dezvoltat sarcini sintetice de antrenare2 pornind de la fluxuri de lucru reprezentative și au folosit învățarea prin consolidare pentru a ajuta modelele să se îmbunătățească prin exercițiu și feedback. Această combinație — sarcini selectate împreună cu oameni care cunosc activitatea, criterii detaliate și un mediu în care modelele pot exersa — asigură progrese în sarcinile practice care contează cel mai mult pentru clienții noștri.
Am comparat Astra cu GPT‑5.6 Sol folosind setarea Max pentru raţionament la Astra și setarea Ridicată la Sol, setările la care fiecare model a obținut cel mai bun scor. La cele 11 sarcini de cercetare, scorul mediu al Astra a fost de 55,0%, față de 41,6% pentru GPT‑5.6 Sol, iar timpul mediu estimat pe încercare a scăzut de la 37,0 minute pentru Sol la 19,2 minute pentru Astra.3 Un model intern folosit în dezvoltarea Astra a obținut un scor și mai bun, de 63,7%, la aceste sarcini, iar obiectivul nostru este să aducem aceste îmbunătățiri suplimentare în modelele viitoare.
Indicator | GPT‑5.6 Sol | GPT‑6 Astra |
Scor mediu conform grilei de evaluare | 41,6% | 55,0% |
Timp mediu estimat pe încercare | 37,0 minute | 19,2 minute |
Astra a îndeplinit mai multe dintre cerințele sarcinilor, cu un timp simulat mai scurt pe încercare. Cele două clipuri de mai jos arată cum au abordat modelele aceeași sarcină de cercetare. Astra (primul clip) a îndeplinit aproximativ 94% dintre criteriile sarcinii într-un timp estimat de 20 de minute; GPT‑5.6 Sol (al doilea clip) a îndeplinit aproximativ 85% într-un timp estimat de 32 de minute.
GPT‑6 Astra a îndeplinit aproximativ 94% dintre criteriile sarcinii într-un timp estimat de 20 de minute.
GPT‑5.6 Sol a îndeplinit aproximativ 85% dintre criteriile sarcinii într-un timp estimat de 32 de minute.
Rolul Ironclad în acest demers reflectă o provocare pe care clienții săi o cunosc bine: un proces de contractare trebuie să gestioneze excepțiile, respectând totodată regulile de care depinde o companie. Dacă un agent pierde din vedere una dintre aceste reguli pe parcursul unei sarcini, o companie software îi poate încredința cu încredere mai puține activități. Acest lucru arată de ce supravegherea umană rămâne importantă pe măsură ce agenții devin mai buni la sarcini complexe de contractare și de ce o platformă completă de contractare rămâne esențială. Colaborarea cu cercetătorii noștri îi permite companiei Ironclad să aducă aceste probleme în procesul de dezvoltare a modelului de bază, unde le putem studia împreună.
Pe măsură ce modelele devin mai capabile, Ironclad are ocazia să le folosească în mai multe dintre propriile produse. Pentru echipele juridice și de afaceri, acest lucru ar putea însemna că IA preia o parte mai mare din munca necesară în procesele complexe de contractare, păstrând mecanismele de control pe care se bazează aceste echipe.
Invităm un număr restrâns de companii software să lucreze direct cu echipele noastre de cercetare și inginerie la sarcini profesionale importante pe care agenții actuali încă nu le pot îndeplini în mod fiabil. Dacă echipa voastră are o astfel de sarcină, am dori să vedem un exemplu concret: ce îi cereți agentului să facă, dovezi care arată unde eșuează și cum ați evalua un rezultat reușit. Partenerii ar trebui, de asemenea, să poată pune la dispoziție specialiști care cunosc în profunzime activitatea, un mediu securizat de testare și date care pot fi folosite în siguranță pentru cercetare. Astfel, avem un punct de plecare pentru a investiga eșecul și a măsura dacă modelul se îmbunătățește.
Dacă echipa voastră corespunde acestei descrieri, înscrieți-vă pentru a explora o colaborare în cercetare.
Autor
Note de subsol
- 1
- 2
Am creat sarcini simulate pe baza unor contracte disponibile public în baza de date EDGAR a SEC, după aplicarea unor filtre concepute pentru a elimina informațiile personale. Pentru antrenare sau evaluare, nu am folosit date ale clienților OpenAI, contracte interne ale OpenAI ori date sau contracte nepublice ale clienților Ironclad.
- 3


