Faire progresser l’utilisation d’ordinateurs avec Ironclad
Comment une collaboration de recherche en gestion contractuelle nous aide à entraîner et à évaluer des agents d’IA sur des tâches professionnelles complexes.
Lors du lancement de GPT‑6 Astra, nous avons montré les progrès de nos modèles dans l’utilisation d’ordinateurs pour le travail professionnel, de la préparation de documents aux tests de sites Web. Notre prochain objectif est de rendre les agents plus performants et efficaces dans l’utilisation de logiciels spécialisés pour résoudre des problèmes d’affaires complexes. Nous explorons comment entraîner les modèles à comprendre les règles d’affaires d’une entreprise, à exécuter des flux de travail en plusieurs étapes et à vérifier que leur travail respecte les exigences initiales.
Pour accélérer cette recherche, nous collaborons directement avec un petit nombre d’entreprises de logiciels qui connaissent le mieux ces flux de travail. Ensemble, nous repérons des tâches exigeantes à forte valeur ajoutée et les transformons en problèmes de recherche pour entraîner et évaluer nos modèles, afin de les rendre plus performants et utiles dans des applications concrètes en entreprise.
Notre premier partenaire est Ironclad, un chef de file de la gestion contractuelle par l’IA. En étroite collaboration avec l’équipe d’Ironclad, nous avons élaboré des tâches qui exigent des agents qu’ils configurent des ententes, des approbations et des dispositions juridiques réutilisables, et avons démontré des progrès dans ces flux de travail complexes. L’expertise d’Ironclad a été déterminante pour définir les critères de réussite et intégrer directement les besoins réels de la clientèle au développement de modèles de pointe. Nous sommes reconnaissants de ce partenariat et avons hâte de vous présenter ce que nous avons accompli ensemble.
GPT‑6 Astra est notre premier modèle de pointe entraîné sur des tâches Ironclad. Dans notre évaluation de recherche, son score moyen était supérieur de 32 % à celui de GPT‑5.6 Sol, tandis que le temps estimé par tentative était inférieur de 48 %.1
Prenons une équipe des opérations juridiques qui met en place un processus d’achat de logiciels. Les finances peuvent devoir approuver les achats dépassant un certain montant, la sécurité peut devoir examiner certaines demandes, et le service juridique peut devoir examiner les dispositions non standard. La personne qui met en place le processus doit transformer cette courte liste en formulaire de demande, en modèles de documents, en règles d’approbation et en dossier de l’entente finale.
Un agent d’IA qui effectue le même travail doit garder ces exigences à l’esprit tout au long de sa navigation dans le logiciel. Par exemple, il doit configurer l’approbation des finances au-delà du seuil de dépenses et vérifier que les demandes au-dessus et en dessous de ce seuil suivent les bons parcours. Réussir chaque étape ne suffit pas : le processus final doit fonctionner dans toutes les situations pour lesquelles il a été conçu.
Le personnel d’Ironclad et les personnes qui utilisent Ironclad chez OpenAI ont aidé nos équipes de recherche à définir 11 tâches dans les domaines juridique, commercial et de l’approvisionnement. Ces tâches comprenaient la mise en place d’ententes de confidentialité, la création de processus d’approbation des achats et la mise à jour d’une clause juridique réutilisable pour tenir compte du territoire de compétence choisi par la personne à l’origine de la demande. Nous estimons que ce travail prendrait en moyenne de 30 à 40 minutes par tâche à une personne expérimentée.
Nous avons évalué chaque tâche selon 8 à 50 critères, en fonction de sa complexité. Cela nous a permis de voir quelles parties un modèle réussissait et où il présentait des lacunes. Ironclad a aussi fourni des environnements hébergés de son logiciel dans lesquels les modèles pouvaient s’exercer à ces tâches. Nos équipes de recherche ont élaboré des tâches d’entraînement synthétiques2 autour de flux de travail représentatifs et ont utilisé l’apprentissage par renforcement pour aider les modèles à s’améliorer grâce à la pratique et à la rétroaction. Cette combinaison — des tâches choisies avec des personnes qui connaissent le travail, des critères détaillés et un espace où les modèles peuvent s’exercer — nous permet de progresser dans les tâches concrètes les plus importantes pour notre clientèle.
Nous avons comparé Astra et GPT‑5.6 Sol en utilisant le niveau de raisonnement Max pour Astra et Élevé pour Sol, les réglages avec lesquels chaque modèle a obtenu son meilleur score. Sur les 11 tâches de recherche, le score moyen d’Astra était de 55,0 %, contre 41,6 % pour GPT‑5.6 Sol, tandis que le temps moyen estimé par tentative est passé de 37,0 minutes pour Sol à 19,2 minutes pour Astra.3 Un modèle interne utilisé dans le développement d’Astra a obtenu un score encore meilleur de 63,7 % sur ces tâches, et nous visons à intégrer ces gains supplémentaires aux futurs modèles.
Mesure | GPT‑5.6 Sol | GPT‑6 Astra |
Score moyen selon la grille d’évaluation | 41,6 % | 55,0 % |
Temps moyen estimé par tentative | 37,0 minutes | 19,2 minutes |
Astra a satisfait à davantage d’exigences des tâches, avec un temps simulé par tentative plus court. Les deux vidéos ci-dessous montrent comment les modèles ont traité la même tâche de recherche. Astra (en premier) a satisfait à environ 94 % des critères de la tâche en un temps estimé à 20 minutes; GPT‑5.6 Sol (en second) a satisfait à environ 85 % des critères en un temps estimé à 32 minutes.
GPT‑6 Astra a satisfait à environ 94 % des critères de la tâche en un temps estimé à 20 minutes.
GPT‑5.6 Sol a satisfait à environ 85 % des critères de la tâche en un temps estimé à 32 minutes.
Le rôle d’Ironclad dans ces travaux reflète un défi que sa clientèle connaît bien : un processus de gestion contractuelle doit traiter les exceptions tout en préservant les règles dont dépend l’entreprise. Si un agent perd de vue l’une de ces règles en cours de tâche, cela limite ce qu’une entreprise de logiciels peut lui confier en toute confiance. Cela souligne pourquoi la supervision humaine reste importante à mesure que les agents s’améliorent dans les tâches contractuelles complexes, et pourquoi une plateforme complète de gestion contractuelle demeure essentielle. La collaboration avec nos équipes de recherche permet à Ironclad d’intégrer ces problèmes au développement du modèle sous-jacent, afin que nous puissions les étudier ensemble.
À mesure que les modèles gagnent en capacité, Ironclad peut les utiliser dans un plus grand nombre de ses propres produits. Pour les équipes juridiques et commerciales, cela pourrait signifier que l’IA prend en charge une plus grande part du travail lié à la gestion contractuelle complexe, tout en préservant les contrôles sur lesquels ces équipes s’appuient.
Nous invitons un petit nombre d’entreprises de logiciels à travailler directement avec nos équipes de recherche et d’ingénierie sur des tâches professionnelles importantes que les agents actuels ne peuvent pas encore accomplir de façon fiable. Si votre équipe a une telle tâche, nous aimerions en voir un exemple concret : ce que vous demandez à l’agent de faire, des preuves de ses échecs et la façon dont vous jugeriez la réussite du résultat. Les partenaires doivent aussi pouvoir mobiliser des personnes qui connaissent le travail en profondeur, fournir un environnement de test sécurisé et des données utilisables en toute sécurité pour la recherche. Cela nous donne un point de départ pour étudier l’échec et mesurer les progrès du modèle.
Si cela décrit votre équipe, soumettez votre candidature pour explorer une collaboration de recherche.
Auteur
Notes de bas de page
- 1
- 2
Nous avons créé des tâches simulées à partir de contrats accessibles au public dans la base de données EDGAR de la SEC, après avoir appliqué des filtres conçus pour retirer les renseignements personnels. Nous n’avons utilisé ni les données de la clientèle d’OpenAI, ni les contrats internes d’OpenAI, ni les données ou contrats non publics de la clientèle d’Ironclad pour l’entraînement ou l’évaluation.
- 3


