Saltar para o conteúdo principal
OpenAI

6 de outubro de 2026

Publicação

Melhorar a utilização de computadores com a Ironclad

Como uma colaboração de investigação em gestão contratual nos ajuda a treinar e avaliar agentes de IA em tarefas profissionais complexas.

A carregar…

Quando apresentámos o GPT‑6 Astra, demonstrámos o quanto os nossos modelos evoluíram na utilização de computadores para trabalho profissional, desde a preparação de documentos até ao teste de sites. O nosso próximo objetivo é tornar os agentes mais capazes e eficientes na utilização de software especializado para resolver problemas empresariais complexos. Estamos a explorar formas de treinar os modelos para compreenderem as regras de negócio de uma empresa, executarem fluxos de trabalho com várias etapas e verificarem se o seu trabalho cumpre os requisitos originais.

Para acelerar esta investigação, estamos a estabelecer parcerias diretas com um pequeno número de empresas de software que conhecem estes fluxos de trabalho melhor do que ninguém. Em conjunto, estamos a identificar tarefas exigentes e de elevado valor e a transformá-las em problemas de investigação para treinar e avaliar os nossos modelos. O objetivo final é torná-los mais capazes e úteis em aplicações empresariais reais.

O nosso primeiro parceiro é a Ironclad, líder em gestão contratual com IA. Em estreita colaboração com a equipa da Ironclad, desenvolvemos tarefas que exigem que os agentes configurem contratos, aprovações e condições jurídicas reutilizáveis, e demonstrámos progressos nestes fluxos de trabalho complexos. A experiência da Ironclad tem sido fundamental para definir o que constitui um resultado bem-sucedido e trazer as necessidades reais dos clientes diretamente para o desenvolvimento de modelos de fronteira. Agradecemos esta parceria e temos o prazer de partilhar o que alcançámos em conjunto.

O GPT‑6 Astra é o nosso primeiro modelo de fronteira treinado com tarefas da Ironclad. Na nossa avaliação de investigação, a sua pontuação média foi 32% superior à do GPT‑5.6 Sol, enquanto o tempo estimado por tentativa foi 48% inferior.1

Transformar fluxos de trabalho de gestão contratual em tarefas de treino

Imagine uma equipa de operações jurídicas a configurar um processo de compra de software. A equipa financeira poderá ter de aprovar compras acima de um determinado valor, a equipa de segurança poderá ter de analisar certos pedidos e a equipa jurídica poderá ter de rever condições não padronizadas. A pessoa que configura o processo tem de transformar essa pequena lista num formulário de pedido, modelos de documentos, regras de aprovação e um registo do contrato final.

Um agente de IA que faça o mesmo trabalho tem de ter esses requisitos presentes à medida que navega no software. Por exemplo, tem de configurar a aprovação pela equipa financeira acima do limite de despesa e verificar se os pedidos acima e abaixo desse limite seguem os percursos corretos. Não basta executar corretamente cada etapa: o processo final tem de funcionar nas diferentes situações para as quais foi concebido.

Colaboradores da Ironclad e pessoas que utilizam a Ironclad na OpenAI ajudaram os nossos investigadores a identificar 11 tarefas nas áreas jurídica, comercial e de compras. Estas incluíam tarefas como configurar acordos de confidencialidade, criar processos de aprovação de compras e atualizar uma cláusula jurídica reutilizável para refletir a jurisdição selecionada por quem faz o pedido. Estimamos que um utilizador experiente demoraria, em média, cerca de 30 a 40 minutos por tarefa a realizar este trabalho.

Avaliámos cada tarefa segundo 8 a 50 critérios, consoante a sua complexidade. Isto permitiu-nos perceber que partes o modelo executou corretamente e onde ficou aquém do esperado. A Ironclad disponibilizou também ambientes alojados do seu produto, nos quais os modelos podiam praticar estas tarefas. Os nossos investigadores desenvolveram tarefas de treino sintéticas2 com base em fluxos de trabalho representativos e utilizaram a aprendizagem por reforço para ajudar os modelos a melhorar através da prática e do feedback. Esta combinação — tarefas selecionadas com pessoas que conhecem o trabalho, critérios detalhados e um ambiente onde os modelos podem praticar — garante que estamos a melhorar o desempenho nas tarefas reais mais importantes para os nossos clientes.

O desempenho do Astra

Comparámos o Astra e o GPT‑5.6 Sol com o nível de raciocínio Max no Astra e Elevado no Sol, as definições com que cada modelo obteve a pontuação mais alta. Nas 11 tarefas de investigação, a pontuação média do Astra foi de 55,0%, face a 41,6% do GPT‑5.6 Sol, enquanto o tempo médio estimado por tentativa passou de 37,0 minutos no Sol para 19,2 minutos no Astra.3 Um modelo interno utilizado no desenvolvimento do Astra alcançou um resultado ainda melhor, de 63,7%, nestas tarefas, e pretendemos incorporar estes ganhos adicionais em modelos futuros.

Métrica

GPT‑5.6 Sol
Raciocínio Elevado

GPT‑6 Astra
Raciocínio Max

Pontuação média na grelha de avaliação

41,6%

55,0%

Tempo médio estimado por tentativa

37,0 minutos

19,2 minutos

O Astra cumpriu mais requisitos das tarefas com menos tempo simulado por tentativa. Os dois vídeos abaixo mostram como os modelos executaram a mesma tarefa de investigação. O Astra (primeiro vídeo) cumpriu cerca de 94% dos critérios da tarefa num tempo estimado de 20 minutos; o GPT‑5.6 Sol (segundo vídeo) cumpriu cerca de 85% num tempo estimado de 32 minutos.

O GPT‑6 Astra cumpriu cerca de 94% dos critérios da tarefa num tempo estimado de 20 minutos.

O GPT‑5.6 Sol cumpriu cerca de 85% dos critérios da tarefa num tempo estimado de 32 minutos.

O que esta colaboração significa para a Ironclad

O papel da Ironclad neste trabalho reflete um desafio que os seus clientes conhecem bem: um processo de gestão contratual tem de lidar com exceções sem deixar de respeitar as regras de que uma empresa depende. Se um agente deixar de ter em conta uma dessas regras a meio de uma tarefa, isso limita o que uma empresa de software lhe pode pedir com confiança. Isto mostra por que razão a supervisão humana continua a ser importante à medida que os agentes melhoram em tarefas complexas de gestão contratual e por que razão uma plataforma completa de gestão contratual continua a ser essencial. Ao trabalhar com os nossos investigadores, a Ironclad pode trazer estes problemas para o desenvolvimento do modelo subjacente, onde os podemos estudar em conjunto.

À medida que os modelos se tornam mais capazes, a Ironclad tem a oportunidade de os utilizar em mais produtos seus. Para as equipas jurídicas e de negócio, isto poderá significar que a IA assume uma maior parte do trabalho envolvido na gestão de contratos complexos, mantendo os mecanismos de controlo de que essas equipas dependem.

“Para que a IA seja verdadeiramente útil em áreas complexas da gestão contratual, tem de fazer mais do que executar ações isoladas. Os agentes precisam de compreender todo o ciclo de vida dos contratos, incluindo a forma como os fluxos de trabalho da empresa se interligam, mantendo os mecanismos de controlo de que as equipas dependem. A nossa colaboração com a OpenAI traz estes desafios reais para o processo de investigação e ajuda a fazer avançar a tecnologia.”
—Sunita Verma, diretora de tecnologia da Ironclad

Trabalhe connosco para desenvolver a IA para tarefas profissionais complexas

Estamos a convidar um pequeno número de empresas de software para trabalhar diretamente com as nossas equipas de investigação e engenharia em tarefas profissionais importantes que os agentes atuais ainda não conseguem concluir de forma fiável. Se a sua equipa tiver uma tarefa deste tipo, gostaríamos de ver um exemplo concreto: o que está a pedir ao agente, provas de onde falha e como avaliaria um resultado bem-sucedido. Os parceiros devem também poder disponibilizar pessoas que conheçam o trabalho a fundo, um ambiente seguro para testes e dados que possam ser utilizados em segurança para investigação. Isto dá-nos um ponto de partida para investigar a falha e avaliar se o modelo melhora.

Se a sua equipa corresponde a este perfil, candidate-se para explorar uma colaboração de investigação.

Autor

OpenAI

Notas de rodapé

  1. 1

    Estes resultados abrangem as 11 tarefas de investigação, não todos os fluxos de trabalho da Ironclad. Os tempos são estimativas simuladas com base em pressupostos sobre as velocidades de processamento e geração dos modelos, não medições do tempo poupado pelos clientes.

  2. 2

    Criámos tarefas simuladas a partir de contratos disponíveis publicamente na base de dados EDGAR da SEC, depois de aplicar filtros concebidos para remover informações pessoais. Não utilizámos dados de clientes da OpenAI, contratos internos da OpenAI nem dados ou contratos não públicos de clientes da Ironclad para treino ou avaliação.

  3. 3

    Consulte a nota de rodapé acima sobre a avaliação de investigação.