Faire progresser l’utilisation de l’ordinateur avec Ironclad
Comment une collaboration de recherche en gestion contractuelle nous aide à entraîner et à évaluer des agents d’IA sur des tâches professionnelles complexes.
Lorsque nous avons présenté GPT‑6 Astra, nous avons démontré les progrès de nos modèles dans l’utilisation de l’ordinateur pour le travail professionnel, de la préparation de documents aux tests de sites web. Notre prochain objectif est de rendre les agents plus performants et plus efficaces dans l’utilisation de logiciels spécialisés pour résoudre des problèmes métier complexes. Nous explorons les moyens d’entraîner les modèles à comprendre les règles métier d’une entreprise, à exécuter des processus en plusieurs étapes et à vérifier que leur travail répond aux exigences initiales.
Pour accélérer ces recherches, nous collaborons directement avec un petit nombre d’éditeurs de logiciels qui connaissent parfaitement ces processus. Ensemble, nous identifions des tâches complexes à forte valeur ajoutée et les transformons en problèmes de recherche pour entraîner et évaluer nos modèles, afin de les rendre plus performants et plus utiles dans des applications métier concrètes.
Notre premier partenaire est Ironclad, un leader de la gestion contractuelle par l’IA. En étroite collaboration avec l’équipe d’Ironclad, nous avons développé des tâches qui demandent aux agents de configurer des accords, des approbations et des dispositions juridiques réutilisables, et démontré des progrès sur ces processus complexes. L’expertise d’Ironclad a été déterminante pour définir les critères de réussite et intégrer directement les besoins réels des clients au développement des modèles de pointe. Nous remercions Ironclad pour ce partenariat et sommes ravis de partager ce que nous avons accompli ensemble.
GPT‑6 Astra est notre premier modèle de pointe entraîné sur des tâches Ironclad. Dans notre évaluation de recherche, son score moyen était supérieur de 32 % à celui de GPT‑5.6 Sol, tandis que le temps estimé par tentative était inférieur de 48 %.1
Prenons l’exemple d’une équipe chargée des opérations juridiques qui met en place un processus d’achat de logiciels. Le service financier peut devoir approuver les achats au-delà d’un certain montant, le service de sécurité examiner certaines demandes et le service juridique vérifier les dispositions non standard. La personne qui met en place ce processus doit transformer cette courte liste en un formulaire de demande, des modèles de documents, des règles d’approbation et un enregistrement de l’accord final.
Un agent d’IA effectuant le même travail doit garder ces exigences à l’esprit à mesure qu’il navigue dans le logiciel. Par exemple, il doit configurer l’approbation du service financier au-delà du seuil de dépenses et vérifier que les demandes situées au-dessus et en dessous de ce seuil suivent les bons circuits. Réussir chaque étape ne suffit pas : le processus final doit fonctionner dans toutes les situations pour lesquelles il a été conçu.
Des employés d’Ironclad et des personnes utilisant Ironclad chez OpenAI ont aidé nos chercheurs à identifier 11 tâches couvrant les activités juridiques, commerciales et d’achat. Il s’agissait notamment de mettre en place des accords de confidentialité, de créer des processus d’approbation des achats et de mettre à jour une clause juridique réutilisable pour l’adapter à la juridiction choisie par le demandeur. Nous estimons que ce travail prendrait en moyenne 30 à 40 minutes par tâche à un utilisateur expérimenté.
Nous avons évalué chaque tâche selon 8 à 50 critères, en fonction de sa complexité. Cela nous a permis de voir les aspects qu’un modèle maîtrisait et ceux sur lesquels il présentait des lacunes. Ironclad a également fourni des environnements hébergés de son logiciel, dans lesquels les modèles pouvaient s’exercer à ces tâches. Nos chercheurs ont développé des tâches d’entraînement synthétiques2 autour de processus représentatifs et utilisé l’apprentissage par renforcement pour aider les modèles à progresser grâce à la pratique et aux retours reçus. Cette combinaison — des tâches sélectionnées avec des personnes qui connaissent le travail, des critères détaillés et un environnement où les modèles peuvent s’exercer — garantit que nous progressons sur les tâches concrètes les plus importantes pour nos clients.
Nous avons comparé Astra et GPT‑5.6 Sol en utilisant le niveau de raisonnement Max pour Astra et Élevé pour Sol, les réglages avec lesquels chaque modèle obtenait ses meilleurs scores. Sur les 11 tâches de recherche, le score moyen d’Astra était de 55,0 %, contre 41,6 % pour GPT‑5.6 Sol, tandis que le temps moyen estimé par tentative est passé de 37,0 minutes pour Sol à 19,2 minutes pour Astra.3 Un modèle interne utilisé dans le développement d’Astra a obtenu un score encore meilleur de 63,7 % sur ces tâches, et nous souhaitons intégrer ces progrès supplémentaires aux futurs modèles.
Indicateur | GPT‑5.6 Sol | GPT‑6 Astra |
Score moyen selon la grille d’évaluation | 41,6 % | 55,0 % |
Temps moyen estimé par tentative | 37,0 minutes | 19,2 minutes |
Astra a satisfait davantage d’exigences des tâches, avec un temps simulé par tentative plus court. Les deux vidéos ci-dessous montrent comment les modèles ont traité la même tâche de recherche. Astra (première vidéo) a satisfait environ 94 % des critères de la tâche en un temps estimé à 20 minutes ; GPT‑5.6 Sol (seconde vidéo) en a satisfait environ 85 % en un temps estimé à 32 minutes.
GPT‑6 Astra a satisfait environ 94 % des critères de la tâche en un temps estimé à 20 minutes.
GPT‑5.6 Sol a satisfait environ 85 % des critères de la tâche en un temps estimé à 32 minutes.
Le rôle d’Ironclad dans ces travaux reflète un défi que ses clients connaissent bien : un processus contractuel doit gérer les exceptions tout en préservant les règles sur lesquelles repose l’activité de l’entreprise. Si un agent perd de vue l’une de ces règles au cours d’une tâche, cela limite ce qu’un éditeur de logiciels peut lui demander de faire en toute confiance. Cela souligne pourquoi la supervision humaine reste importante à mesure que les agents s’améliorent sur les tâches contractuelles complexes, et pourquoi une plateforme complète de gestion contractuelle demeure essentielle. La collaboration avec nos chercheurs permet à Ironclad d’intégrer ces problématiques au développement du modèle sous-jacent, afin que nous puissions les étudier ensemble.
À mesure que les modèles deviennent plus performants, Ironclad peut les utiliser dans un plus grand nombre de ses propres produits. Pour les équipes juridiques et opérationnelles, cela pourrait signifier que l’IA prend en charge une plus grande part du travail lié aux processus contractuels complexes, tout en préservant les contrôles sur lesquels ces équipes s’appuient.
Nous invitons un petit nombre d’éditeurs de logiciels à travailler directement avec nos équipes de recherche et d’ingénierie sur des tâches professionnelles importantes que les agents actuels ne parviennent pas encore à accomplir de manière fiable. Si votre équipe rencontre ce type de tâche, nous aimerions en voir un exemple concret : ce que vous demandez à l’agent de faire, des éléments montrant où il échoue et les critères selon lesquels vous jugeriez le résultat satisfaisant. Les partenaires doivent aussi pouvoir mobiliser des personnes qui connaissent parfaitement ce travail, un environnement de test sécurisé et des données utilisables sans risque pour la recherche. Cela nous donne un point de départ pour étudier l’échec et mesurer les progrès du modèle.
Si votre équipe correspond à ce profil, postulez pour explorer une collaboration de recherche.
Auteur
Notes de bas de page
- 1
- 2
Nous avons créé des tâches simulées à partir de contrats accessibles au public dans la base de données EDGAR de la SEC, après avoir appliqué des filtres conçus pour supprimer les informations personnelles. Nous n’avons utilisé ni données de clients d’OpenAI, ni contrats internes d’OpenAI, ni données ou contrats non publics de clients d’Ironclad pour l’entraînement ou l’évaluation.
- 3


