Ir al contenido principal
OpenAI

6 de octubre de 2026

Publicación

Avances en el uso de ordenadores con Ironclad

Cómo una colaboración de investigación en gestión contractual nos ayuda a entrenar y evaluar agentes de IA en tareas profesionales complejas.

Cargando…

Cuando presentamos GPT‑6 Astra, demostramos cuánto han avanzado nuestros modelos en el uso de ordenadores para el trabajo profesional, desde preparar documentos hasta probar sitios web. Nuestro próximo objetivo es lograr que los agentes sean más capaces y eficientes al utilizar software especializado para resolver problemas empresariales complejos. Estamos explorando cómo entrenar modelos para que comprendan las reglas de negocio de una empresa, ejecuten flujos de trabajo de varios pasos y verifiquen que su trabajo cumple los requisitos originales.

Para acelerar esta investigación, colaboramos directamente con un pequeño número de empresas de software que conocen estos flujos de trabajo mejor que nadie. Juntos, identificamos tareas difíciles y de gran valor y las convertimos en problemas de investigación para entrenar y evaluar nuestros modelos. El objetivo final es que sean más capaces y útiles en aplicaciones empresariales reales.

Nuestro primer socio es Ironclad, una empresa líder en gestión contractual con IA. En estrecha colaboración con el equipo de Ironclad, hemos desarrollado tareas que requieren que los agentes configuren contratos, aprobaciones y condiciones jurídicas reutilizables, y hemos demostrado avances en estos flujos de trabajo complejos. La experiencia de Ironclad ha sido fundamental para definir qué constituye un resultado satisfactorio e incorporar directamente las necesidades reales de los clientes al desarrollo de modelos de vanguardia. Agradecemos su colaboración y nos ilusiona compartir lo que hemos logrado juntos.

GPT‑6 Astra es nuestro primer modelo de vanguardia entrenado con tareas de Ironclad. En nuestra evaluación de investigación, su puntuación media fue un 32 % superior a la de GPT‑5.6 Sol, mientras que el tiempo estimado por intento fue un 48 % menor.1

Convertir los flujos de gestión contractual en tareas de entrenamiento

Imagina un equipo de operaciones jurídicas que está configurando un proceso de compra de software. Es posible que Finanzas deba aprobar las compras que superen cierto importe, que Seguridad deba revisar determinadas solicitudes y que el departamento jurídico deba revisar las condiciones no estándar. La persona que configura el proceso debe convertir esa breve lista en un formulario de solicitud, plantillas de documentos, reglas de aprobación y un registro del contrato definitivo.

Un agente de IA que haga el mismo trabajo debe tener presentes esos requisitos mientras navega por el software. Por ejemplo, debe configurar la aprobación de Finanzas cuando se supere el umbral de gasto y comprobar que las solicitudes por encima y por debajo de ese umbral sigan los circuitos correctos. No basta con hacer bien cada paso por separado: una vez configurado, el proceso debe funcionar en todas las situaciones para las que se diseñó.

Los empleados de Ironclad y las personas que utilizan Ironclad en OpenAI ayudaron a nuestros investigadores a identificar 11 tareas de las áreas jurídica, comercial y de compras. Entre ellas se incluían tareas como configurar acuerdos de confidencialidad, crear procesos de aprobación de compras y actualizar una cláusula jurídica reutilizable para que se ajuste a la jurisdicción que seleccione el solicitante. Estimamos que un usuario experimentado tardaría, de media, entre 30 y 40 minutos en realizar cada tarea.

Evaluamos cada tarea según entre 8 y 50 criterios, en función de su complejidad. Esto nos permitió ver qué partes resolvía bien un modelo y en cuáles se quedaba corto. Ironclad también proporcionó entornos alojados de su producto en los que los modelos podían practicar estas tareas. Nuestros investigadores desarrollaron tareas de entrenamiento sintéticas2 basadas en flujos de trabajo representativos y utilizaron el aprendizaje por refuerzo para ayudar a los modelos a mejorar mediante la práctica y la retroalimentación. Esta combinación —tareas seleccionadas con personas que conocen el trabajo, criterios detallados y un entorno donde los modelos pueden practicar— garantiza que avancemos en las tareas reales más importantes para nuestros clientes.

Los resultados de Astra

Comparamos Astra y GPT‑5.6 Sol con el ajuste de razonamiento Max para Astra y Alta para Sol, las configuraciones con las que cada modelo obtuvo su mayor puntuación. En las 11 tareas de investigación, la puntuación media de Astra fue del 55,0 %, frente al 41,6 % de GPT‑5.6 Sol, mientras que el tiempo medio estimado por intento pasó de 37,0 minutos con Sol a 19,2 minutos con Astra.3 Un modelo interno utilizado en el desarrollo de Astra obtuvo un resultado aún mejor, del 63,7 %, en estas tareas, y nuestro objetivo es incorporar estas mejoras adicionales a futuros modelos.

Métrica

GPT‑5.6 Sol
Razonamiento (Alta)

GPT‑6 Astra
Razonamiento (Max)

Puntuación media según la rúbrica

41,6 %

55,0 %

Tiempo medio estimado por intento

37,0 minutos

19,2 minutos

Astra cumplió más requisitos de las tareas con un menor tiempo simulado por intento. Los dos vídeos que aparecen a continuación muestran cómo abordaron los modelos la misma tarea de investigación. Astra (el primero) cumplió aproximadamente el 94 % de los criterios de la tarea en un tiempo estimado de 20 minutos; GPT‑5.6 Sol (el segundo) cumplió aproximadamente el 85 % en un tiempo estimado de 32 minutos.

GPT‑6 Astra cumplió aproximadamente el 94 % de los criterios de la tarea en un tiempo estimado de 20 minutos.

GPT‑5.6 Sol cumplió aproximadamente el 85 % de los criterios de la tarea en un tiempo estimado de 32 minutos.

Qué significa esta colaboración para Ironclad

El papel de Ironclad en este trabajo refleja un reto que sus clientes conocen bien: un proceso de gestión contractual debe contemplar las excepciones sin dejar de respetar las reglas que rigen la actividad de una empresa. Si un agente pierde de vista alguna de esas reglas a mitad de una tarea, se reduce el alcance de lo que una empresa de software puede encargarle con confianza. Esto pone de relieve por qué la supervisión humana sigue siendo importante a medida que los agentes mejoran en las tareas complejas de gestión contractual, y por qué una plataforma integral de gestión contractual sigue siendo esencial. La colaboración con nuestros investigadores permite a Ironclad incorporar estos problemas al desarrollo del modelo subyacente, donde podemos estudiarlos juntos.

A medida que aumentan las capacidades de los modelos, Ironclad tiene la oportunidad de utilizarlos en más productos propios. Para los equipos jurídicos y de negocio, esto podría significar que la IA asumiera una mayor parte del trabajo que requiere la gestión de contratos complejos, sin prescindir de los controles en los que se apoyan estos equipos.

“Para que la IA sea realmente útil en los aspectos complejos de la gestión contractual, debe ir más allá de completar acciones aisladas. Los agentes deben comprender todo el ciclo de vida de los contratos, incluida la conexión entre los flujos de trabajo empresariales, sin dejar de respetar los controles en los que se apoyan los equipos. Nuestra colaboración con OpenAI incorpora estos retos del mundo real al proceso de investigación y ayuda a impulsar el avance de la tecnología.”
—Sunita Verma, directora de Tecnología de Ironclad

Colabora con nosotros para impulsar la IA en el trabajo profesional complejo

Estamos invitando a un pequeño número de empresas de software a trabajar directamente con nuestros equipos de investigación e ingeniería en tareas profesionales importantes que los agentes actuales aún no pueden completar de forma fiable. Si tu equipo tiene una tarea de este tipo, nos gustaría conocer un ejemplo concreto: qué le pides al agente, pruebas de dónde falla y cómo determinarías si el resultado es satisfactorio. Las empresas colaboradoras también deben poder aportar personas que conozcan el trabajo en profundidad, un entorno seguro para las pruebas y datos que puedan utilizarse de forma segura en la investigación. Esto nos da un punto de partida para investigar el fallo y medir si el modelo mejora.

Autor

OpenAI

Notas al pie

  1. 1

    Estos resultados abarcan las 11 tareas de investigación, no todos los flujos de trabajo de Ironclad. Los tiempos son estimaciones simuladas a partir de supuestos sobre las velocidades de procesamiento y generación del modelo, no mediciones del ahorro de tiempo de los clientes.

  2. 2

    Creamos tareas simuladas a partir de contratos disponibles públicamente en la base de datos EDGAR de la SEC, tras aplicar filtros diseñados para eliminar información personal. No utilizamos datos de clientes de OpenAI, contratos internos de OpenAI ni datos o contratos no públicos de clientes de Ironclad para el entrenamiento o la evaluación.

  3. 3

    Consulta la nota anterior sobre la evaluación de investigación.