Pular para o conteúdo principal
OpenAI

6 de setembro de 2026

PesquisaPublicaçãoSegurança

Aceleração da pesquisa: uma visão de dentro da OpenAI

Carregando…

Acreditamos que, para beneficiar toda a humanidade, a AGI precisa de governança democrática. Isso exige um debate público informado sobre capacidades, riscos e salvaguardas de sistemas de IA altamente capazes. As pessoas precisam entender a provável trajetória da IA de ponta para ter voz efetiva em seu desenvolvimento.

A transparência sobre riscos, incidentes e salvaguardas específicos é necessária, mas não suficiente. O público também precisa entender como os sistemas mais capazes evoluem e impulsionam a pesquisa nos laboratórios de fronteira.

Buscamos criar com segurança um pesquisador automatizado de IA que, sob supervisão humana, avance o aprendizado profundo e o alinhamento, permitindo melhorias iterativas. Segundo nossas medições, atingimos a meta, anunciada⁠(abre em uma nova janela) no outono passado do hemisfério norte, de ter um estagiário automatizado de pesquisa até setembro deste ano. Por "estagiário de pesquisa", entendemos um sistema que executa tarefas bem definidas sob orientação humana, inclusive as que tomariam dias de um pesquisador qualificado. Avançamos significativamente rumo a um pesquisador automatizado de IA até março de 2028.

Neste ano, o trabalho diário dos pesquisadores da OpenAI mudou substancialmente. Eles usam agentes de programação ao longo do dia, muitas vezes em sessões simultâneas. O uso total cresce rapidamente, mais que em outras equipes da OpenAI. Pesquisadores contribuem com código mais rápido e realizam mais experimentos. O uso também muda: agentes assumem tarefas mais complexas e têm sucesso com mais frequência. A pesquisa em IA é complexa e tem muitos gargalos potenciais. Assim, seu avanço geral provavelmente não acompanhará essas métricas específicas. Ainda assim, os achados condizem com a impressão interna de que ferramentas com agentes de IA aceleram significativamente a pesquisa. Pessoas ainda definem prioridades, escolhem quais ideias e resultados explorar e decidem se devem ampliar, pausar ou implantar sistemas.

Acreditamos que a pesquisa automatizada em IA, feita com responsabilidade, produzirá modelos que melhorem o bem-estar humano e promovam a missão da OpenAI. Ela pode baratear a inteligência avançada, beneficiando pessoas no mundo todo. Seguimos esse caminho em parte porque a pesquisa automatizada pode ajudar a resolver o alinhamento e criar defesas contra IAs cada vez mais capazes. Um pesquisador automatizado de IA também pode pesquisar segurança ou alinhamento. Sistemas mais capazes e alinhados podem proteger infraestrutura crítica, combater agentes de IA perigosos e desenvolver novas proteções.

São razões para desenvolver capacidades úteis de pesquisa automatizada, mas não para necessariamente buscar RSI rápida. Avançar ou não, e como, depende de preservar o controle humano e de escolhas democráticas informadas sobre benefícios e riscos.

Ainda não sabemos como chegar com segurança à RSI plena e alinhada. Trabalhamos para ampliar as medidas de alinhamento e segurança junto com as capacidades. Mas não podemos presumir que esses avanços acompanharão as capacidades, e sistemas mais capazes podem ser mais difíceis de monitorar. O trabalho cuidadoso de alinhamento e segurança é central, começando por medir e mitigar os problemas atuais dos sistemas de programação agêntica. Se avançar representar risco inaceitável, agiremos de forma adequada, inclusive desacelerando ou interrompendo o desenvolvimento ou a implantação de sistemas que não possamos proteger suficientemente.

Após o incidente recente no Hugging Face, colocamos esse compromisso em prática⁠: pausamos o treinamento por aprendizado por reforço (RL) dos modelos mais recentes destinados à implantação, reforçamos e submetemos a testes adversariais os ambientes de pesquisa e ampliamos o monitoramento. Isso não parou toda a pesquisa: algumas cargas de trabalho voltaram sob controles mais rigorosos; outras seguiram pausadas. Elevamos os padrões de segurança e alinhamento e integramos mais esse trabalho ao ciclo de vida dos modelos, exigindo evidências mais fortes de alinhamento em todo o treinamento.

Hoje, detalhamos como sistemas com agentes de IA contribuíram para nosso avanço rumo à RSI nos últimos meses. Sistemas com agentes de IA são novos e mudam rápido; nossas medições ainda são preliminares. Ao divulgar resultados e métodos iniciais, buscamos informar o público, incentivar a divulgação pública e promover padrões compartilhados de medição.

Como escrevemos em nosso plano de políticas para IA de fronteira⁠, acreditamos que nós e outras empresas deveríamos ser obrigados a acompanhar publicamente o avanço rumo à RSI. Mesmo sem essa exigência, pretendemos manter a transparência sobre nosso avanço em RSI. Nossa abordagem de transparência evoluirá com nossas medições e compreensão, sem deixar de proteger a segurança e as informações proprietárias.

1. Agentes de programação transformam o dia a dia dos pesquisadores da OpenAI

No início do ano, o pesquisador na mediana de uso de agentes na OpenAI usava agentes de programação apenas modestamente. Em meados de agosto, ele já os integrava diariamente ao trabalho, usando mais de US$ 600 por dia em inferência, a preços de API. O usuário no percentil 90 da área de pesquisa já consome mais de US$ 7.000 em tokens por dia.

Antes de junho de 2026, o tempo total de execução de agentes na área de pesquisa ainda era inferior ao total de trabalho humano. Isso mudou. Considerando jornadas de 8 horas, em meados de agosto a área de pesquisa usava, no total, 3,1 dias de trabalho de agentes por dia de trabalho humano.

Outra perspectiva é quantos pesquisadores usam fluxos com alta simultaneidade, como executar 4 ou mais agentes ao mesmo tempo. Como mostramos abaixo, esse número cresce. Os números incluem picos diários de agentes iniciados diretamente pelo usuário e de subagentes criados a partir deles.

2. Pesquisadores escrevem mais código e realizam mais experimentos

Boa parte da pesquisa em IA exige muito trabalho para integrar melhorias de inteligência ou desempenho a um de nossos modelos principais. O avanço depende do sucesso conjunto de várias etapas: projetar melhorias, criar avaliações de desempenho e infraestrutura para testes em escala, detectar bugs e comportamentos inseguros ou desalinhados no treinamento e integrar boas ideias ao treinamento principal. Uma falha em qualquer etapa pode limitar todo o ciclo.

Escrever código e realizar experimentos são atividades centrais dos pesquisadores, e há evidências de que estão acelerando.

Esses dados são relativamente fáceis de medir, mas difíceis de interpretar. Com a automação, tarefas menos automatizáveis ocuparão mais do esforço dos pesquisadores e serão gargalos importantes para avanços futuros. Os recursos computacionais também limitam o avanço e podem ganhar importância conforme outros gargalos diminuem.

Em 2026, aumentaram os experimentos por pesquisador ativo em experimentação. Agosto atingiu o recorde desde janeiro de 2025, início das medições. Isso se correlaciona com a adoção do Codex, mas os recursos computacionais disponíveis também cresceram muito desde 2025.

3. O trabalho delegado a agentes está mudando

Impressões qualitativas e dados internos indicam mudanças nas tarefas delegadas a agentes de programação: tarefas de nível mais alto e maior duração se tornam mais comuns.

Para entender a tendência, analisamos o uso recente na área de pesquisa com uma taxonomia recém-publicada⁠(abre em uma nova janela) pela Epoch AI sobre os tipos de trabalho no ciclo de P&D em IA. Inspirada no sistema O*NET de classificação de trabalho, a taxonomia é voltada à P&D de IA de ponta e divide o processo em seis fases:

  1. Decidir: no que trabalhar, o que continuar, onde alocar recursos

  2. Projetar: ideias de pesquisa e especificações de engenharia

  3. Construir: código e conjuntos de dados

  4. Executar: treinamento/avaliação, hardware, serviço de modelos

  5. Analisar: experimentos, modelos, implantação, trabalho externo

  6. Comunicar: descobertas, feedback, status, decisões

Abaixo, classificamos tokens de agentes de programação por essa taxonomia.

Todas as categorias cresceram entre janeiro e agosto de 2026. Em janeiro, predominava o código de pesquisa e infraestrutura. Essa categoria cresceu, assim como outras, sobretudo suporte técnico e monitoramento de execuções. O planejamento de alto nível ainda representa uma fração mínima dos tokens de saída dos agentes.

Colegas relatam informalmente que agentes de programação se destacam ao resolver problemas da infraestrutura interna de pesquisa, um gargalo importante. Várias equipes que ofereciam plantões para ajudar com problemas em experimentos notaram queda na procura em 2026. Uma delas encerrou os plantões para focar em outras melhorias no sistema.

Aqui, mostramos publicações iniciais diárias em um dos principais canais internos onde pesquisadores buscam suporte técnico de outras equipes. Até onde sabemos, a queda na atividade não foi compensada pela migração de dúvidas para outro canal de suporte humano. A queda no movimento condiz com essa mudança mais ampla.

Também podemos avaliar se os agentes de programação têm sucesso nas tarefas solicitadas. Com um classificador com agentes de IA, vimos que, de janeiro a julho, as taxas de sucesso geralmente subiram em várias faixas de dificuldade, estimadas pelo tempo humano necessário, nas tarefas com resultado verificável. Ainda assim, os agentes precisam de orientação humana significativa para ter sucesso, sobretudo em tarefas mais complexas. Nos últimos 6 meses, mais da metade das tarefas bem-sucedidas de 4–8 horas exigiu uma ou mais intervenções.

As taxas de sucesso em tarefas de pesquisadores aumentaram ao longo do tempo. O gráfico exclui classificações com resultado incerto e pontos com <50 sessões ou <50 usuários únicos.

Taxas de sucesso nas tarefas e de intervenção de janeiro a julho, por horizonte temporal. Exclui classificações com resultado incerto.

4. Ajustando o ritmo de desenvolvimento de modelos

O avanço rumo a sistemas mais capazes para uma AGI segura e benéfica também dependerá das salvaguardas necessárias para esse trabalho. Nossa avaliação das salvaguardas necessárias pode mudar à medida que aprendemos mais sobre os riscos.

Como já descrevemos,⁠ atualizamos recentemente nossos padrões de monitoramento, alinhamento e segurança. Aqui, mostramos como restrições recentes afetaram um aspecto da atividade de pesquisa.

*A maior parte dos recursos computacionais do Astra mostrados aqui entre 20 de julho e 6 de agosto foi destinada a testar a implementação de melhorias de segurança e proteção.

Em 20 de julho, após descobrirmos que agentes haviam comprometido nossa infraestrutura de pesquisa, desligamos temporariamente o serviço de contêineres usado no treinamento e o restauramos com restrições adicionais significativas.

Isso levou a uma queda acentuada nos recursos computacionais de treinamento por RL enquanto as equipes reconfiguravam seus fluxos de trabalho para operar no ambiente de pesquisa com segurança reforçada. O gráfico acima inclui a pausa de duas semanas no aprendizado por reforço dos nossos modelos mais recentes destinados à implantação. Nos experimentos de RL da classe Astra entre 20 de julho e 6 de agosto, a maioria das execuções, em termos de alocação de GPUs, destinou-se a testar a implementação de melhorias de segurança e proteção.

Em 7 de agosto, evidências preliminares de que o Astra pode ter capacidades cibernéticas críticas⁠ segundo nosso Preparedness Framework⁠(abre em uma nova janela) levaram a restrições adicionais de segurança específicas para o modelo, exigindo sua execução em ambientes de pesquisa mais seguros. Na semana seguinte, a alocação de GPUs para a classe Astra caiu mais 59,2%, mas a alocação para outras classes de modelos subiu 17,2%. Esse aumento compensou cerca de 85% da queda na classe Astra, deixando a alocação total para as cargas de trabalho de RL analisadas praticamente inalterada. Esse padrão é compatível com a transferência de parte do treinamento e da experimentação para modelos não Astra enquanto o trabalho com o Astra estava restrito. Também condiz com relatos informais de pesquisadores que encontraram outros usos para os recursos computacionais que já não podiam ser aproveitados nas cargas de trabalho sujeitas às novas restrições.

Esses dados trazem um sinal útil para as discussões sobre treinamento e segurança: quando novos controles são introduzidos, os recursos computacionais continuam valiosos e flexíveis e naturalmente são direcionados a usos alternativos dentro da pesquisa. No longo prazo, as discussões sobre o ritmo de avanço da IA também devem abordar como aproveitar melhor os recursos computacionais sujeitos a controles novos ou propostos.

5. O caminho pela frente

Avançar rumo à RSI alinhada e compreender esse avanço é importante para nossa missão. Continuaremos a aperfeiçoar nossos métodos, relatar como nossa compreensão evolui e trabalhar por um debate público informado e uma governança democrática efetiva dos sistemas de fronteira.

Apêndice: métodos usados nesta publicação

A pesquisa em IA impulsionada por agentes ainda é nova, e estamos aprendendo a medi-la. Alguns indicadores, como a quantidade de código gerada por nossas equipes de pesquisa, são relativamente fáceis de coletar, mas difíceis de interpretar, pois sua relação com o avanço da pesquisa é incerta. Métricas mais diretamente ligadas ao avanço da pesquisa, como a frequência com que agentes têm sucesso nas tarefas delegadas por pesquisadores, podem ser mais úteis, mas são complexas de desenvolver e validar. Para aumentar a dificuldade, as ferramentas e os sistemas usados pelos pesquisadores evoluem rapidamente. Aprofundar nossa compreensão da aceleração da pesquisa é uma prioridade importante em toda a OpenAI.

Em todas estas análises, salvo indicação em contrário:

  • "Pesquisador" é um termo amplo para qualquer integrante da nossa área de pesquisa, incluindo quem desenvolve infraestrutura, gerencia projetos de pesquisa ou apoia esse trabalho de outras formas.

  • As métricas de uso de agentes de programação cobrem a maior parte do uso, mas não todo ele, dada a rápida evolução das ferramentas e dos sistemas usados pelos pesquisadores.