Avancem en l'ús d'ordinadors amb Ironclad
Com una col·laboració de recerca en contractació ens ajuda a entrenar i avaluar agents d'IA en tasques professionals complexes.
Quan vam presentar GPT‑6 Astra, vam demostrar fins on han arribat els nostres models en l'ús d'ordinadors per a tasques professionals, des de preparar documents fins a provar llocs web. El nostre proper objectiu és fer que els agents siguin més capaços i eficients a l'hora d'utilitzar programari especialitzat per resoldre problemes empresarials complexos. Estem explorant com entrenar els models perquè entenguin les regles de negoci d'una empresa, executin fluxos de treball de diversos passos i verifiquin que la seva feina compleix els requisits originals.
Per accelerar aquesta recerca, col·laborem directament amb un nombre reduït d'empreses de programari que coneixen aquests fluxos de treball millor que ningú. Plegats, identifiquem tasques exigents i de gran valor i les convertim en problemes de recerca per entrenar i avaluar els nostres models, amb l'objectiu final de fer-los més capaços i útils en aplicacions empresarials reals.
La primera empresa amb qui col·laborem és Ironclad, líder en contractació amb IA. En estreta col·laboració amb l'equip d'Ironclad, hem desenvolupat tasques que requereixen que els agents configurin acords, aprovacions i condicions jurídiques reutilitzables, i hem demostrat avenços en aquests fluxos de treball complexos. L'experiència d'Ironclad ha estat clau per definir què és un resultat satisfactori i incorporar les necessitats reals dels clients directament al desenvolupament de models d'avantguarda. Agraïm la seva col·laboració i ens fa il·lusió compartir el que hem aconseguit plegats.
GPT‑6 Astra és el nostre primer model d'avantguarda entrenat amb tasques d'Ironclad. En la nostra avaluació de recerca, va obtenir una puntuació mitjana un 32 % superior a la de GPT‑5.6 Sol, amb un temps estimat per intent un 48 % inferior.1
Pensem en un equip d'operacions jurídiques que està configurant un procés de compra de programari. Pot ser que el departament financer hagi d'aprovar les compres per sobre d'un import determinat, que el de seguretat hagi de revisar certes sol·licituds i que el jurídic hagi de revisar les condicions no estàndard. La persona que configura el procés ha de convertir aquesta breu llista en un formulari de sol·licitud, plantilles de documents, regles d'aprovació i un registre de l'acord final.
Un agent d'IA que faci la mateixa feina ha de tenir presents aquests requisits mentre navega pel programari. Per exemple, ha de configurar l'aprovació del departament financer quan se superi el llindar de despesa i comprovar que les sol·licituds que queden per sobre i per sota d'aquest llindar segueixen els circuits adequats. No n'hi ha prou de fer bé cada pas: un cop configurat, el procés ha de funcionar en totes les situacions per a les quals s'ha dissenyat.
Empleats d'Ironclad i persones que utilitzen Ironclad a OpenAI van ajudar els nostres investigadors a identificar 11 tasques en els àmbits jurídic, comercial i de compres. Entre aquestes tasques hi havia configurar acords de confidencialitat, crear processos d'aprovació de compres i actualitzar una clàusula jurídica reutilitzable perquè s'ajustés a la jurisdicció seleccionada pel sol·licitant. Estimem que un usuari experimentat trigaria, de mitjana, entre 30 i 40 minuts per tasca a fer aquesta feina.
Vam avaluar cada tasca segons entre 8 i 50 criteris, en funció de la seva complexitat. Això ens va permetre veure quines parts resolia bé cada model i en quines no arribava al nivell esperat. Ironclad també va proporcionar entorns allotjats del seu producte on els models podien practicar aquestes tasques. Els nostres investigadors van desenvolupar tasques sintètiques d'entrenament2 basades en fluxos de treball representatius i van utilitzar l'aprenentatge per reforç per ajudar els models a millorar mitjançant la pràctica i la retroacció. Aquesta combinació —tasques seleccionades amb persones que coneixen la feina, criteris detallats i un entorn on els models poden practicar— garanteix que avancem en les tasques reals més importants per als nostres clients.
Vam comparar Astra i GPT‑5.6 Sol amb l'opció de raonament Max per a Astra i Alta per a Sol, les configuracions amb què cada model va obtenir la puntuació més alta. En el conjunt de les 11 tasques de recerca, la puntuació mitjana d'Astra va ser del 55,0 %, en comparació amb el 41,6 % de GPT‑5.6 Sol, mentre que el temps mitjà estimat per intent va baixar dels 37,0 minuts de Sol als 19,2 minuts d'Astra.3 Un model intern utilitzat en el desenvolupament d'Astra va assolir un resultat encara millor, del 63,7 %, en aquestes tasques, i tenim l'objectiu d'incorporar aquestes millores addicionals als futurs models.
Mètrica | GPT‑5.6 Sol | GPT‑6 Astra |
Puntuació mitjana segons la rúbrica | 41,6 % | 55,0 % |
Temps mitjà estimat per intent | 37,0 minuts | 19,2 minuts |
Astra va complir més requisits de les tasques amb menys temps simulat per intent. Els dos vídeos següents mostren com els models van abordar la mateixa tasca de recerca. Astra (el primer) va complir prop del 94 % dels criteris de la tasca en un temps estimat de 20 minuts; GPT‑5.6 Sol (el segon) en va complir prop del 85 % en un temps estimat de 32 minuts.
GPT‑6 Astra va complir prop del 94 % dels criteris de la tasca en un temps estimat de 20 minuts.
GPT‑5.6 Sol va complir prop del 85 % dels criteris de la tasca en un temps estimat de 32 minuts.
El paper d'Ironclad en aquest treball reflecteix un repte que els seus clients coneixen bé: un procés de contractació ha de gestionar excepcions sense deixar de respectar les regles de les quals depèn l'empresa. Si un agent deixa de tenir present alguna d'aquestes regles a mitja tasca, això limita les feines que una empresa de programari li pot confiar. Això posa de manifest per què la supervisió humana continua sent important a mesura que els agents milloren en tasques de contractació complexes, i per què continua sent essencial disposar d'una plataforma de contractació integral. Col·laborar amb els nostres investigadors permet a Ironclad incorporar aquests problemes al desenvolupament del model subjacent, on els podem estudiar plegats.
A mesura que els models esdevenen més capaços, Ironclad té l'oportunitat d'utilitzar-los en més productes propis. Per als equips jurídics i de negoci, això podria significar que la IA assumís una part més gran de la feina que comporta la contractació complexa, sense renunciar als controls en què es basen aquests equips.
Convidem un nombre reduït d'empreses de programari a treballar directament amb els nostres equips de recerca i enginyeria en tasques professionals importants que els agents actuals encara no poden completar de manera fiable. Si el teu equip té una tasca d'aquest tipus, ens agradaria veure'n un exemple concret: què demaneu a l'agent, proves dels punts en què falla i com valoraríeu si el resultat és satisfactori. Les empreses col·laboradores també han de poder aportar persones que coneguin a fons la feina, un entorn segur per fer proves i dades que es puguin utilitzar de manera segura per a la recerca. Això ens dona un punt de partida per investigar l'error i mesurar si el model millora.
Si el teu equip encaixa amb aquesta descripció, presenta una sol·licitud per explorar una col·laboració de recerca.
Autor
Notes a peu de pàgina
- 1
- 2
Vam crear tasques simulades a partir de contractes disponibles públicament a la base de dades EDGAR de la SEC, després d'aplicar-hi filtres dissenyats per eliminar la informació personal. No vam utilitzar dades de clients d'OpenAI, contractes interns d'OpenAI ni dades o contractes no públics de clients d'Ironclad per a l'entrenament o l'avaluació.
- 3


