Impulsar el uso de computadoras con Ironclad
Cómo una colaboración de investigación en gestión de contratos nos ayuda a entrenar y evaluar agentes de IA en tareas profesionales complejas.
Cuando presentamos GPT‑6 Astra, demostramos cuánto han avanzado nuestros modelos en el uso de computadoras para el trabajo profesional, desde preparar documentos hasta probar sitios web. Nuestro próximo objetivo es lograr que los agentes sean más capaces y eficientes al usar software especializado para resolver problemas empresariales complejos. Estamos explorando cómo entrenar modelos para que comprendan las reglas de negocio de una empresa, ejecuten flujos de trabajo de varios pasos y verifiquen que su trabajo cumpla con los requisitos originales.
Para acelerar esta investigación, estamos colaborando directamente con un número reducido de empresas de software que conocen estos flujos de trabajo mejor que nadie. Juntos, estamos identificando tareas desafiantes y de gran valor y convirtiéndolas en problemas de investigación para entrenar y evaluar nuestros modelos, con el fin de hacerlos más capaces y útiles en aplicaciones empresariales del mundo real.
Nuestra primera empresa colaboradora es Ironclad, líder en gestión de contratos con IA. En estrecha colaboración con el equipo de Ironclad, desarrollamos tareas que requieren que los agentes configuren acuerdos, aprobaciones y términos legales reutilizables, y demostramos avances en estos flujos de trabajo complejos. La experiencia de Ironclad ha sido fundamental para definir qué constituye un resultado satisfactorio e incorporar las necesidades reales de los clientes directamente al desarrollo de modelos de vanguardia. Agradecemos su colaboración y nos entusiasma compartir lo que hemos logrado juntos.
GPT‑6 Astra es nuestro primer modelo de vanguardia entrenado con tareas de Ironclad. En nuestra evaluación de investigación, su puntuación promedio fue un 32 % superior a la de GPT‑5.6 Sol, mientras que el tiempo estimado por intento fue un 48 % menor.1
Imagina un equipo de operaciones legales que está preparando un proceso para comprar software. Es posible que Finanzas deba aprobar las compras que superen cierto monto, que Seguridad deba revisar determinadas solicitudes y que el equipo Legal deba revisar los términos no estándar. La persona que configura el proceso tiene que convertir esa breve lista en un formulario de solicitud, plantillas de documentos, reglas de aprobación y un registro del acuerdo final.
Un agente de IA que haga el mismo trabajo tiene que mantener presentes esos requisitos mientras navega por el software. Por ejemplo, debe configurar la aprobación de Finanzas cuando se supere el umbral de gasto y comprobar que las solicitudes por encima y por debajo de ese umbral sigan las rutas correctas. No basta con ejecutar bien cada paso: el proceso terminado debe funcionar en todas las situaciones para las que fue diseñado.
Empleados de Ironclad y personas que usan Ironclad en OpenAI ayudaron a nuestros investigadores a identificar 11 tareas de las áreas legal, comercial y de compras. Entre ellas se incluyeron tareas como configurar acuerdos de confidencialidad, crear procesos de aprobación de compras y actualizar una cláusula legal reutilizable para que refleje la jurisdicción que seleccione el solicitante. Estimamos que este trabajo le llevaría a un usuario experimentado entre 30 y 40 minutos por tarea, en promedio.
Evaluamos cada tarea según entre 8 y 50 criterios, dependiendo de su complejidad. Esto nos permitió ver qué partes resolvía correctamente un modelo y en cuáles no cumplía con lo esperado. Ironclad también proporcionó entornos alojados de su software en los que los modelos podían practicar estas tareas. Nuestros investigadores desarrollaron tareas de entrenamiento sintéticas2 basadas en flujos de trabajo representativos y utilizaron aprendizaje por refuerzo para ayudar a los modelos a mejorar mediante la práctica y la retroalimentación. Esta combinación —tareas seleccionadas con personas que conocen el trabajo, criterios detallados y un entorno donde los modelos pueden practicar— garantiza que estamos mejorando en las tareas del mundo real que más importan a nuestros clientes.
Comparamos Astra y GPT‑5.6 Sol utilizando el nivel de razonamiento Max para Astra y el nivel de razonamiento Alto para Sol, las opciones con las que cada modelo obtuvo su puntuación más alta. En las 11 tareas de investigación, la puntuación promedio de Astra fue del 55,0 %, frente al 41,6 % de GPT‑5.6 Sol, mientras que el tiempo promedio estimado por intento bajó de 37,0 minutos para Sol a 19,2 minutos para Astra.3 Un modelo interno utilizado en el desarrollo de Astra logró una puntuación aún mayor, del 63,7 %, en estas tareas, y nuestro objetivo es incorporar estas mejoras adicionales a futuros modelos.
Métrica | GPT‑5.6 Sol | GPT‑6 Astra |
Puntuación promedio según la rúbrica | 41,6 % | 55,0 % |
Tiempo promedio estimado por intento | 37,0 minutos | 19,2 minutos |
Astra cumplió más requisitos de las tareas con menos tiempo simulado por intento. Los dos videos a continuación muestran cómo los modelos abordaron la misma tarea de investigación. Astra (primero) cumplió cerca del 94 % de los criterios de la tarea en un tiempo estimado de 20 minutos; GPT‑5.6 Sol (segundo) cumplió cerca del 85 % en un tiempo estimado de 32 minutos.
GPT‑6 Astra cumplió cerca del 94 % de los criterios de la tarea en un tiempo estimado de 20 minutos.
GPT‑5.6 Sol cumplió cerca del 85 % de los criterios de la tarea en un tiempo estimado de 32 minutos.
El papel de Ironclad en este trabajo refleja un desafío que sus clientes conocen bien: un proceso de gestión de contratos debe manejar excepciones sin dejar de cumplir las reglas de las que depende una empresa. Si un agente pierde de vista alguna de esas reglas a mitad de una tarea, eso limita lo que una empresa de software puede pedirle que haga con confianza. Esto pone de relieve por qué la supervisión humana sigue siendo importante a medida que los agentes mejoran en tareas complejas de gestión de contratos, y por qué una plataforma integral para esta gestión sigue siendo esencial. Trabajar con nuestros investigadores le permite a Ironclad incorporar estos problemas al desarrollo del modelo subyacente, donde podemos estudiarlos juntos.
A medida que los modelos adquieren más capacidades, Ironclad tiene la oportunidad de utilizarlos en más de sus propios productos. Para los equipos legales y comerciales, eso podría significar que la IA asuma una mayor parte del trabajo que implica la gestión de contratos complejos, sin dejar de mantener los controles en los que se apoyan esos equipos.
Estamos invitando a un número reducido de empresas de software a trabajar directamente con nuestros equipos de investigación e ingeniería en tareas profesionales importantes que los agentes actuales aún no pueden completar de forma confiable. Si tu equipo tiene una tarea así, nos gustaría ver un ejemplo concreto: qué le pides al agente que haga, pruebas de dónde falla y cómo evaluarías si el resultado es satisfactorio. Las empresas colaboradoras también deben poder aportar personas que conozcan a fondo el trabajo, un entorno seguro para las pruebas y datos que puedan utilizarse de forma segura para la investigación. Esto nos da un punto de partida para investigar la falla y medir si el modelo mejora.
Si tu equipo cumple con estas condiciones, envía una solicitud para explorar una colaboración de investigación.
Autor
Notas al pie
- 1
- 2
Creamos tareas simuladas a partir de contratos disponibles públicamente en la base de datos EDGAR de la SEC, tras aplicar filtros diseñados para eliminar información personal. No utilizamos datos de clientes de OpenAI, contratos internos de OpenAI ni datos o contratos no públicos de clientes de Ironclad para el entrenamiento o la evaluación.
- 3


