Pular para o conteúdo principal
OpenAI

6 de outubro de 2026

Publicação

Avançando no uso de computadores com a Ironclad

Como uma colaboração em pesquisa na gestão de contratos nos ajuda a treinar e avaliar agentes de IA em atividades profissionais complexas.

Carregando…

Quando apresentamos o GPT‑6 Astra, demonstramos o quanto nossos modelos avançaram no uso de computadores para atividades profissionais, desde a preparação de documentos até o teste de sites. Nosso próximo objetivo é tornar os agentes mais capazes e eficientes no uso de softwares especializados para resolver problemas de negócios complexos. Estamos explorando como treinar modelos para entender as regras de negócio de uma empresa, executar fluxos de trabalho com várias etapas e verificar se o trabalho realizado atende aos requisitos originais.

Para acelerar essa pesquisa, estamos firmando parcerias diretas com um pequeno número de empresas de software que conhecem esses fluxos de trabalho melhor do que ninguém. Juntos, estamos identificando tarefas desafiadoras e de alto valor e transformando-as em problemas de pesquisa para treinar e avaliar nossos modelos, tornando-os mais capazes e úteis em aplicações reais de negócios.

Nossa primeira parceira é a Ironclad, líder em gestão de contratos com IA. Trabalhando em estreita colaboração com a equipe da Ironclad, desenvolvemos tarefas que exigem que os agentes configurem contratos, aprovações e cláusulas jurídicas reutilizáveis, e demonstramos avanços nesses fluxos de trabalho complexos. A experiência da Ironclad tem sido fundamental para definir o que constitui um bom resultado e trazer as necessidades reais dos clientes diretamente para o desenvolvimento de modelos de fronteira. Agradecemos pela parceria e estamos animados para compartilhar o que conquistamos juntos.

O GPT‑6 Astra é nosso primeiro modelo de fronteira treinado em tarefas da Ironclad. Na avaliação da nossa pesquisa, sua pontuação média foi 32% maior que a do GPT‑5.6 Sol, enquanto o tempo estimado por tentativa foi 48% menor.1

Transformando fluxos de gestão de contratos em tarefas de treinamento

Imagine uma equipe de operações jurídicas estruturando um processo de compra de software. O Financeiro pode precisar aprovar compras acima de determinado valor, a Segurança pode precisar analisar certas solicitações e o Jurídico pode precisar revisar cláusulas fora do padrão. A pessoa que estrutura o processo precisa transformar essa lista curta em um formulário de solicitação, modelos de documentos, regras de aprovação e um registro do contrato final.

Um agente de IA que faz o mesmo trabalho precisa manter esses requisitos em vista enquanto navega pelo software. Por exemplo, ele deve configurar a aprovação do Financeiro para gastos acima do limite e verificar se as solicitações acima e abaixo desse valor seguem os caminhos corretos. Não basta acertar as etapas isoladamente: o processo concluído precisa funcionar em todas as situações para as quais foi projetado.

Funcionários da Ironclad e pessoas que usam a Ironclad na OpenAI ajudaram nossos pesquisadores a identificar 11 tarefas nas áreas jurídica, comercial e de compras. Entre elas estavam configurar acordos de confidencialidade, criar processos de aprovação de compras e atualizar uma cláusula jurídica reutilizável para que ela corresponda à jurisdição selecionada pelo solicitante. Estimamos que um usuário experiente levaria, em média, de 30 a 40 minutos por tarefa para realizar esse trabalho.

Avaliamos cada tarefa com base em 8 a 50 critérios, dependendo de sua complexidade. Isso nos permitiu ver quais partes o modelo acertou e onde deixou a desejar. A Ironclad também disponibilizou ambientes hospedados de seu produto para que os modelos pudessem praticar essas tarefas. Nossos pesquisadores desenvolveram tarefas sintéticas de treinamento2 com base em fluxos de trabalho representativos e usaram aprendizado por reforço para ajudar os modelos a melhorar por meio de prática e feedback. Essa combinação — tarefas selecionadas com pessoas que conhecem o trabalho, critérios detalhados e um ambiente para os modelos praticarem — garante que estamos melhorando nas tarefas reais mais importantes para nossos clientes.

O desempenho do Astra

Comparamos o Astra e o GPT‑5.6 Sol usando o nível de raciocínio Max para o Astra e Alto para o Sol, as configurações em que cada modelo obteve a maior pontuação. Nas 11 tarefas da pesquisa, a pontuação média do Astra foi de 55,0%, contra 41,6% do GPT‑5.6 Sol, enquanto o tempo médio estimado por tentativa caiu de 37,0 minutos para o Sol para 19,2 minutos para o Astra.3 Um modelo interno usado no desenvolvimento do Astra alcançou um resultado ainda melhor, de 63,7% nessas tarefas, e nosso objetivo é levar esses ganhos adicionais aos modelos futuros.

Métrica

GPT‑5.6 Sol
Raciocínio Alto

GPT‑6 Astra
Raciocínio Max

Pontuação média nos critérios de avaliação

41,6%

55,0%

Tempo médio estimado por tentativa

37,0 minutos

19,2 minutos

O Astra atendeu a mais requisitos das tarefas com menos tempo simulado por tentativa. Os dois vídeos abaixo mostram como os modelos lidaram com a mesma tarefa da pesquisa. O Astra (primeiro vídeo) atendeu a cerca de 94% dos critérios da tarefa em um tempo estimado de 20 minutos; o GPT‑5.6 Sol (segundo) atendeu a cerca de 85% em um tempo estimado de 32 minutos.

O GPT‑6 Astra atendeu a cerca de 94% dos critérios da tarefa em um tempo estimado de 20 minutos.

O GPT‑5.6 Sol atendeu a cerca de 85% dos critérios da tarefa em um tempo estimado de 32 minutos.

O que essa colaboração significa para a Ironclad

O papel da Ironclad neste trabalho reflete um desafio que seus clientes conhecem bem: um processo de gestão de contratos precisa lidar com exceções sem abrir mão das regras das quais a empresa depende. Se um agente perde de vista uma dessas regras no meio de uma tarefa, isso limita o que uma empresa de software pode pedir que ele faça com confiança. Isso reforça por que a supervisão humana continua importante à medida que os agentes melhoram em tarefas complexas de gestão de contratos, e por que uma plataforma completa para essa gestão continua essencial. Trabalhar com nossos pesquisadores permite que a Ironclad traga esses problemas para o desenvolvimento do modelo subjacente, onde podemos estudá-los juntos.

À medida que os modelos se tornam mais capazes, a Ironclad tem a oportunidade de usá-los em mais produtos próprios. Para as equipes jurídicas e de negócios, isso pode significar que a IA assumirá uma parcela maior do trabalho envolvido na gestão de contratos complexos, preservando os controles dos quais essas equipes dependem.

“Para que a IA seja realmente útil nas áreas complexas da gestão de contratos, ela precisa fazer mais do que executar ações isoladas. Os agentes precisam entender todo o ciclo de vida dos contratos, inclusive como os fluxos de trabalho da empresa se conectam, preservando os controles dos quais as equipes dependem. Nossa colaboração com a OpenAI traz esses desafios reais para o processo de pesquisa e ajuda a fazer a tecnologia avançar.”
—Sunita Verma, diretora de tecnologia da Ironclad

Trabalhe conosco para avançar a IA em atividades profissionais complexas

Estamos convidando um pequeno número de empresas de software para trabalhar diretamente com nossas equipes de pesquisa e engenharia em tarefas profissionais importantes que os agentes atuais ainda não conseguem concluir de forma confiável. Se sua equipe tem uma tarefa assim, gostaríamos de conhecer um exemplo concreto: o que vocês pedem ao agente, evidências de onde ele falha e como avaliariam um resultado bem-sucedido. Os parceiros também devem poder disponibilizar pessoas que conheçam o trabalho a fundo, um ambiente seguro para testes e dados que possam ser usados com segurança na pesquisa. Isso nos dá um ponto de partida para investigar a falha e medir se o modelo melhora.

Autor

OpenAI

Notas de rodapé

  1. 1

    Esses resultados abrangem as 11 tarefas da pesquisa, não todos os fluxos de trabalho da Ironclad. Os tempos são estimativas simuladas com base em velocidades presumidas de processamento e geração dos modelos, não medições da economia de tempo dos clientes.

  2. 2

    Criamos tarefas simuladas a partir de contratos disponíveis publicamente no banco de dados EDGAR da SEC, após aplicar filtros desenvolvidos para remover informações pessoais. Não usamos dados de clientes da OpenAI, contratos internos da OpenAI nem dados ou contratos não públicos de clientes da Ironclad para treinamento ou avaliação.

  3. 3

    Veja a nota de rodapé acima sobre a avaliação da pesquisa.