Passer au contenu principal
OpenAI

6 octobre 2026

Publication

Faire progresser l’utilisation d’ordinateurs avec Ironclad

Comment une collaboration de recherche en gestion contractuelle nous aide à entraîner et à évaluer des agents d’IA sur des tâches professionnelles complexes.

Chargement…

Lors du lancement de GPT‑6 Astra, nous avons montré les progrès de nos modèles dans l’utilisation d’ordinateurs pour le travail professionnel, de la préparation de documents aux tests de sites Web. Notre prochain objectif est de rendre les agents plus performants et efficaces dans l’utilisation de logiciels spécialisés pour résoudre des problèmes d’affaires complexes. Nous explorons comment entraîner les modèles à comprendre les règles d’affaires d’une entreprise, à exécuter des flux de travail en plusieurs étapes et à vérifier que leur travail respecte les exigences initiales.

Pour accélérer cette recherche, nous collaborons directement avec un petit nombre d’entreprises de logiciels qui connaissent le mieux ces flux de travail. Ensemble, nous repérons des tâches exigeantes à forte valeur ajoutée et les transformons en problèmes de recherche pour entraîner et évaluer nos modèles, afin de les rendre plus performants et utiles dans des applications concrètes en entreprise.

Notre premier partenaire est Ironclad, un chef de file de la gestion contractuelle par l’IA. En étroite collaboration avec l’équipe d’Ironclad, nous avons élaboré des tâches qui exigent des agents qu’ils configurent des ententes, des approbations et des dispositions juridiques réutilisables, et avons démontré des progrès dans ces flux de travail complexes. L’expertise d’Ironclad a été déterminante pour définir les critères de réussite et intégrer directement les besoins réels de la clientèle au développement de modèles de pointe. Nous sommes reconnaissants de ce partenariat et avons hâte de vous présenter ce que nous avons accompli ensemble.

GPT‑6 Astra est notre premier modèle de pointe entraîné sur des tâches Ironclad. Dans notre évaluation de recherche, son score moyen était supérieur de 32 % à celui de GPT‑5.6 Sol, tandis que le temps estimé par tentative était inférieur de 48 %.1

Transformer les flux de travail contractuels en tâches d’entraînement

Prenons une équipe des opérations juridiques qui met en place un processus d’achat de logiciels. Les finances peuvent devoir approuver les achats dépassant un certain montant, la sécurité peut devoir examiner certaines demandes, et le service juridique peut devoir examiner les dispositions non standard. La personne qui met en place le processus doit transformer cette courte liste en formulaire de demande, en modèles de documents, en règles d’approbation et en dossier de l’entente finale.

Un agent d’IA qui effectue le même travail doit garder ces exigences à l’esprit tout au long de sa navigation dans le logiciel. Par exemple, il doit configurer l’approbation des finances au-delà du seuil de dépenses et vérifier que les demandes au-dessus et en dessous de ce seuil suivent les bons parcours. Réussir chaque étape ne suffit pas : le processus final doit fonctionner dans toutes les situations pour lesquelles il a été conçu.

Le personnel d’Ironclad et les personnes qui utilisent Ironclad chez OpenAI ont aidé nos équipes de recherche à définir 11 tâches dans les domaines juridique, commercial et de l’approvisionnement. Ces tâches comprenaient la mise en place d’ententes de confidentialité, la création de processus d’approbation des achats et la mise à jour d’une clause juridique réutilisable pour tenir compte du territoire de compétence choisi par la personne à l’origine de la demande. Nous estimons que ce travail prendrait en moyenne de 30 à 40 minutes par tâche à une personne expérimentée.

Nous avons évalué chaque tâche selon 8 à 50 critères, en fonction de sa complexité. Cela nous a permis de voir quelles parties un modèle réussissait et où il présentait des lacunes. Ironclad a aussi fourni des environnements hébergés de son logiciel dans lesquels les modèles pouvaient s’exercer à ces tâches. Nos équipes de recherche ont élaboré des tâches d’entraînement synthétiques2 autour de flux de travail représentatifs et ont utilisé l’apprentissage par renforcement pour aider les modèles à s’améliorer grâce à la pratique et à la rétroaction. Cette combinaison — des tâches choisies avec des personnes qui connaissent le travail, des critères détaillés et un espace où les modèles peuvent s’exercer — nous permet de progresser dans les tâches concrètes les plus importantes pour notre clientèle.

Les résultats d’Astra

Nous avons comparé Astra et GPT‑5.6 Sol en utilisant le niveau de raisonnement Max pour Astra et Élevé pour Sol, les réglages avec lesquels chaque modèle a obtenu son meilleur score. Sur les 11 tâches de recherche, le score moyen d’Astra était de 55,0 %, contre 41,6 % pour GPT‑5.6 Sol, tandis que le temps moyen estimé par tentative est passé de 37,0 minutes pour Sol à 19,2 minutes pour Astra.3 Un modèle interne utilisé dans le développement d’Astra a obtenu un score encore meilleur de 63,7 % sur ces tâches, et nous visons à intégrer ces gains supplémentaires aux futurs modèles.

Mesure

GPT‑5.6 Sol
Niveau de raisonnement Élevé

GPT‑6 Astra
Niveau de raisonnement Max

Score moyen selon la grille d’évaluation

41,6 %

55,0 %

Temps moyen estimé par tentative

37,0 minutes

19,2 minutes

Astra a satisfait à davantage d’exigences des tâches, avec un temps simulé par tentative plus court. Les deux vidéos ci-dessous montrent comment les modèles ont traité la même tâche de recherche. Astra (en premier) a satisfait à environ 94 % des critères de la tâche en un temps estimé à 20 minutes; GPT‑5.6 Sol (en second) a satisfait à environ 85 % des critères en un temps estimé à 32 minutes.

GPT‑6 Astra a satisfait à environ 94 % des critères de la tâche en un temps estimé à 20 minutes.

GPT‑5.6 Sol a satisfait à environ 85 % des critères de la tâche en un temps estimé à 32 minutes.

Ce que cette collaboration signifie pour Ironclad

Le rôle d’Ironclad dans ces travaux reflète un défi que sa clientèle connaît bien : un processus de gestion contractuelle doit traiter les exceptions tout en préservant les règles dont dépend l’entreprise. Si un agent perd de vue l’une de ces règles en cours de tâche, cela limite ce qu’une entreprise de logiciels peut lui confier en toute confiance. Cela souligne pourquoi la supervision humaine reste importante à mesure que les agents s’améliorent dans les tâches contractuelles complexes, et pourquoi une plateforme complète de gestion contractuelle demeure essentielle. La collaboration avec nos équipes de recherche permet à Ironclad d’intégrer ces problèmes au développement du modèle sous-jacent, afin que nous puissions les étudier ensemble.

À mesure que les modèles gagnent en capacité, Ironclad peut les utiliser dans un plus grand nombre de ses propres produits. Pour les équipes juridiques et commerciales, cela pourrait signifier que l’IA prend en charge une plus grande part du travail lié à la gestion contractuelle complexe, tout en préservant les contrôles sur lesquels ces équipes s’appuient.

“Pour être vraiment utile dans les aspects complexes de la gestion contractuelle, l’IA doit faire plus qu’exécuter des actions individuelles. Les agents doivent comprendre tout le cycle de vie des contrats, notamment la façon dont les flux de travail de l’entreprise s’articulent, tout en préservant les contrôles sur lesquels les équipes s’appuient. Notre collaboration avec OpenAI intègre ces défis concrets au processus de recherche et contribue à faire progresser la technologie.”
— Sunita Verma, directrice de la technologie, Ironclad

Collaborez avec nous pour faire progresser l’IA dans les tâches professionnelles complexes

Nous invitons un petit nombre d’entreprises de logiciels à travailler directement avec nos équipes de recherche et d’ingénierie sur des tâches professionnelles importantes que les agents actuels ne peuvent pas encore accomplir de façon fiable. Si votre équipe a une telle tâche, nous aimerions en voir un exemple concret : ce que vous demandez à l’agent de faire, des preuves de ses échecs et la façon dont vous jugeriez la réussite du résultat. Les partenaires doivent aussi pouvoir mobiliser des personnes qui connaissent le travail en profondeur, fournir un environnement de test sécurisé et des données utilisables en toute sécurité pour la recherche. Cela nous donne un point de départ pour étudier l’échec et mesurer les progrès du modèle.

Auteur

OpenAI

Notes de bas de page

  1. 1

    Ces résultats portent sur les 11 tâches de recherche, et non sur l’ensemble des flux de travail d’Ironclad. Les durées sont des estimations simulées fondées sur des hypothèses de vitesse de traitement et de génération des modèles, et non des gains de temps mesurés chez la clientèle.

  2. 2

    Nous avons créé des tâches simulées à partir de contrats accessibles au public dans la base de données EDGAR de la SEC, après avoir appliqué des filtres conçus pour retirer les renseignements personnels. Nous n’avons utilisé ni les données de la clientèle d’OpenAI, ni les contrats internes d’OpenAI, ni les données ou contrats non publics de la clientèle d’Ironclad pour l’entraînement ou l’évaluation.

  3. 3

    Consultez la note ci-dessus sur l’évaluation de recherche.