Migliorare l’uso del computer con Ironclad
Come una collaborazione di ricerca nella gestione contrattuale ci aiuta ad addestrare e valutare agenti IA su attività professionali complesse.
Quando abbiamo presentato GPT‑6 Astra, abbiamo mostrato i progressi dei nostri modelli nell’uso del computer per attività professionali, dalla preparazione di documenti al test di siti web. Il nostro prossimo obiettivo è rendere gli agenti più capaci ed efficienti nell’uso di software specializzati per risolvere problemi aziendali complessi. Stiamo studiando come addestrare i modelli a comprendere le regole aziendali, eseguire flussi di lavoro articolati in più passaggi e verificare che il loro lavoro soddisfi i requisiti iniziali.
Per accelerare questa ricerca, collaboriamo direttamente con un numero limitato di aziende di software che conoscono a fondo questi flussi di lavoro. Insieme, stiamo individuando compiti impegnativi e di grande valore e li stiamo trasformando in problemi di ricerca per addestrare e valutare i nostri modelli, con l’obiettivo di renderli più capaci e utili nelle applicazioni aziendali reali.
Il nostro primo partner è Ironclad, leader nella gestione contrattuale basata sull’IA. Lavorando a stretto contatto con il team di Ironclad, abbiamo sviluppato compiti che richiedono agli agenti di configurare accordi, approvazioni e clausole legali riutilizzabili, e abbiamo dimostrato progressi in questi flussi di lavoro complessi. L’esperienza di Ironclad è stata fondamentale per definire i criteri di successo e portare le esigenze reali dei clienti direttamente nello sviluppo dei modelli di frontiera. Siamo grati per questa collaborazione e felici di condividere ciò che abbiamo realizzato insieme.
GPT‑6 Astra è il nostro primo modello di frontiera addestrato su compiti di Ironclad. Nella nostra valutazione di ricerca, il suo punteggio medio è stato del 32% superiore a quello di GPT‑5.6 Sol, mentre il tempo stimato per tentativo è stato del 48% inferiore.1
Consideriamo un team che si occupa delle operazioni legali e sta configurando un processo per l’acquisto di software. Il reparto finanziario potrebbe dover approvare gli acquisti oltre un certo importo, quello della sicurezza esaminare determinate richieste e quello legale verificare le condizioni non standard. Chi configura il processo deve trasformare questo breve elenco in un modulo di raccolta delle richieste, modelli di documento, regole di approvazione e una registrazione dell’accordo finale.
Un agente IA che svolge lo stesso lavoro deve tenere presenti questi requisiti mentre opera nel software. Ad esempio, deve configurare l’approvazione del reparto finanziario per gli importi superiori alla soglia di spesa e verificare che le richieste al di sopra e al di sotto di tale soglia seguano i percorsi corretti. Eseguire correttamente i singoli passaggi non basta: il processo completo deve funzionare in tutte le situazioni per cui è stato progettato.
I dipendenti di Ironclad e le persone che usano Ironclad in OpenAI hanno aiutato i nostri ricercatori a individuare 11 compiti in ambito legale, commerciale e degli acquisti. Tra questi figuravano la configurazione di accordi di riservatezza, la creazione di processi di approvazione degli acquisti e l’aggiornamento di una clausola legale riutilizzabile in base alla giurisdizione selezionata dal richiedente. Stimiamo che un utente esperto impiegherebbe in media circa 30–40 minuti per compito.
Abbiamo valutato ogni compito rispetto a un numero di criteri compreso tra 8 e 50, a seconda della sua complessità. Questo ci ha permesso di capire quali parti il modello svolgesse correttamente e dove invece non fosse all’altezza. Ironclad ha inoltre messo a disposizione ambienti software ospitati del proprio prodotto, in cui i modelli potevano esercitarsi su questi compiti. I nostri ricercatori hanno sviluppato compiti di addestramento sintetici2 basati su flussi di lavoro rappresentativi e hanno utilizzato l’apprendimento per rinforzo per aiutare i modelli a migliorare attraverso la pratica e il feedback. Questa combinazione di compiti selezionati insieme a chi conosce il lavoro, criteri dettagliati e un ambiente in cui i modelli possono esercitarsi garantisce che i miglioramenti riguardino le attività reali più importanti per i nostri clienti.
Abbiamo confrontato Astra e GPT‑5.6 Sol usando il livello di ragionamento Max per Astra e Alto per Sol, le impostazioni con cui ciascun modello ha ottenuto il punteggio più elevato. Sugli 11 compiti di ricerca, il punteggio medio di Astra è stato del 55,0%, contro il 41,6% di GPT‑5.6 Sol, mentre il tempo medio stimato per tentativo è sceso dai 37,0 minuti di Sol ai 19,2 minuti di Astra.3 Un modello interno utilizzato nello sviluppo di Astra ha ottenuto un risultato ancora migliore, pari al 63,7%, su questi compiti, e puntiamo a trasferire questi ulteriori progressi ai modelli futuri.
Metrica | GPT‑5.6 Sol | GPT‑6 Astra |
Punteggio medio sulla griglia di valutazione | 41,6% | 55,0% |
Tempo medio stimato per tentativo | 37,0 minuti | 19,2 minuti |
Astra ha soddisfatto più requisiti dei compiti con un tempo simulato inferiore per tentativo. I due video qui sotto mostrano come i modelli hanno affrontato lo stesso compito di ricerca. Astra (il primo) ha soddisfatto circa il 94% dei criteri del compito in un tempo stimato di 20 minuti; GPT‑5.6 Sol (il secondo) ne ha soddisfatto circa l’85% in un tempo stimato di 32 minuti.
GPT‑6 Astra ha soddisfatto circa il 94% dei criteri del compito in un tempo stimato di 20 minuti.
GPT‑5.6 Sol ha soddisfatto circa l’85% dei criteri del compito in un tempo stimato di 32 minuti.
Il ruolo di Ironclad in questo lavoro riflette una sfida che i suoi clienti conoscono bene: un processo di gestione contrattuale deve gestire le eccezioni senza compromettere le regole su cui si basa un’azienda. Se un agente perde di vista una di queste regole a metà di un compito, si riduce la gamma di attività che un’azienda di software può affidargli con fiducia. Questo evidenzia perché la supervisione umana resta importante anche quando gli agenti migliorano nei compiti complessi di gestione contrattuale, e perché una piattaforma completa per la gestione dei contratti rimane essenziale. Collaborare con i nostri ricercatori permette a Ironclad di portare questi problemi nel processo di sviluppo del modello sottostante, dove possiamo studiarli insieme.
Man mano che i modelli diventano più capaci, Ironclad ha l’opportunità di integrarli in un numero maggiore dei propri prodotti. Per i team legali e aziendali, questo potrebbe significare affidare all’IA una parte maggiore del lavoro richiesto dalla gestione di contratti complessi, mantenendo i controlli su cui fanno affidamento.
Stiamo invitando un numero limitato di aziende di software a collaborare direttamente con i nostri team di ricerca e ingegneria su compiti professionali importanti che gli agenti attuali non riescono ancora a completare in modo affidabile. Se il tuo team ha un compito di questo tipo, vorremmo vedere un esempio concreto: cosa chiedete all’agente, prove dei punti in cui fallisce e quali criteri usereste per valutare un risultato positivo. I partner devono anche poter mettere a disposizione persone con una conoscenza approfondita del lavoro, un ambiente sicuro per i test e dati utilizzabili in sicurezza per la ricerca. Questo ci offre un punto di partenza per indagare le cause dell’insuccesso e misurare gli eventuali miglioramenti del modello.
Se il tuo team ha queste caratteristiche, candidati per valutare una collaborazione di ricerca.
Autore
Note
- 1
- 2
Abbiamo creato compiti simulati a partire da contratti disponibili pubblicamente nel database EDGAR della SEC, dopo aver applicato filtri progettati per rimuovere le informazioni personali. Per l’addestramento e la valutazione non abbiamo utilizzato dati dei clienti di OpenAI, contratti interni di OpenAI, né dati o contratti non pubblici dei clienti di Ironclad.
- 3


