Pular para o conteúdo principal
OpenAI

21 de julho de 2026

Segurança

OpenAI e Hugging Face se unem para tratar incidente de segurança durante avaliação de modelo

Carregando…

Na semana passada, a Hugging Face divulgou um novo tipo de incidente de segurança(abre em uma nova janela) após detectar e conter um agente de IA que comprometeu sua infraestrutura, algo que esperamos se tornar mais comum com a proliferação de modelos com capacidades cibernéticas cada vez maiores. Após a investigação, agora sabemos que este incidente específico foi provocado por uma combinação de modelos da OpenAI — incluindo o GPT‑5.6 Sol e um modelo de pré-lançamento ainda mais capaz, todos com recusas cibernéticas reduzidas para fins de avaliação — durante testes internos em um benchmark(abre em uma nova janela) de capacidades cibernéticas.

Consideramos este incidente um incidente cibernético sem precedentes, envolvendo capacidades cibernéticas de ponta, e estamos respondendo à altura. Estamos compartilhando descobertas preliminares neste momento para ajudar defensores a entender o que aconteceu e a calibrar sua visão sobre o que os modelos já são capazes de fazer. Continuaremos conduzindo uma investigação completa junto com a Hugging Face e compartilharemos mais detalhes sobre as vulnerabilidades, o incidente e as descobertas quando nossa investigação for concluída.

O que aconteceu durante este incidente

Este incidente ocorreu durante uma avaliação interna que orienta modelos a buscar exploração avançada usando caminhos de ataque complexos, com o objetivo de quantificar suas capacidades cibernéticas. Estimamos as capacidades cibernéticas máximas executando essa avaliação sem os classificadores de produção usados para impedir que modelos busquem atividades cibernéticas de alto risco. Nossos benchmarks são executados em um ambiente altamente isolado, com acesso à rede limitado à capacidade de instalar pacotes por meio de um software de terceiros hospedado internamente que atua como proxy e cache para registros de pacotes.

Os modelos identificaram e encadearam vulnerabilidades entre o ambiente de pesquisa da OpenAI e a infraestrutura de produção da Hugging Face para obter soluções de teste diretamente do banco de dados de produção da Hugging Face. Todas as evidências sugerem que os modelos estavam hiperfocados em encontrar uma solução para o ExploitGym, chegando a extremos para atingir uma meta de teste bastante estreita.

Enquanto operavam em nosso ambiente de testes em sandbox, nossos modelos gastaram uma quantidade substancial de computação de inferência tentando encontrar uma forma de obter acesso aberto à Internet para resolver o problema da avaliação. Para obter acesso, os modelos identificaram e exploraram uma vulnerabilidade zero-day (que agora divulgamos de forma responsável ao fornecedor) no proxy de cache do registro de pacotes. Com esse acesso, nossos modelos realizaram uma série de ações de escalonamento de privilégios e movimentação lateral em nosso ambiente de testes de pesquisa até chegarem a um node com acesso à Internet.

Depois de obter acesso à Internet, os modelos inferiram que a Hugging Face potencialmente hospedava modelos, conjuntos de dados e soluções para o ExploitGym. Sabendo disso, o modelo procurou e encontrou com sucesso formas de acessar informações secretas que poderia usar para trapacear na avaliação. Em um exemplo, o modelo encadeou vários vetores de ataque, incluindo o uso de credenciais roubadas e vulnerabilidades zero-day para encontrar um caminho de execução remota de código nos servidores da Hugging Face. A equipe de segurança da OpenAI descobriu internamente essa atividade anômala.

A equipe de segurança e os agentes da Hugging Face detectaram e interromperam a atividade em sua infraestrutura e já haviam iniciado a contenção e a reconstrução forense com seus próprios modelos de código aberto quando nossas equipes se conectaram. Estamos trabalhando ativamente com eles para continuar investigando o incidente. Agradecemos a colaboração rápida e próxima da Hugging Face na investigação e na correção.

Medidas que estamos tomando agora

  1. Como parte da investigação, estamos implementando controles rígidos na configuração da infraestrutura, às custas da velocidade da pesquisa, enquanto as vulnerabilidades são corrigidas. Estamos mantendo nosso Comitê de Segurança e Proteção informado regularmente sobre esses controles e seu impacto.
  2. Estamos trabalhando com a Hugging Face para investigar o incidente de forma forense.
  3. Divulgamos de forma responsável a vulnerabilidade zero-day identificada no software de terceiros hospedado internamente e estamos trabalhando com eles na correção.
  4. Incluímos a Hugging Face no programa de acesso confiável e estamos apoiando suas equipes no uso rápido das capacidades de nossos modelos para melhorar suas defesas.
  5. Estamos aprimorando e adicionando proteções mais fortes para treinamentos e avaliações futuros. Nesta semana, publicamos um blog sobre como melhorar a segurança e o alinhamento em uma era de modelos de horizonte longo. Essas salvaguardas de implantação não foram habilitadas intencionalmente durante esta avaliação porque o objetivo era testar vulnerabilidades cibernéticas. Este incidente aponta para a necessidade de fortalecer ainda mais o alinhamento do nosso modelo, as proteções cibernéticas durante avaliações e o monitoramento em testes internos.

Nossa abordagem para avaliar capacidades cibernéticas avançadas

Como compartilhamos recentemente, a IA está acelerando a descoberta e a exploração de vulnerabilidades. A principal lição deste incidente é que a segurança e a proteção de modelos precisam acompanhar o ritmo das capacidades que avançam rapidamente. Estamos fortalecendo as práticas de contenção, monitoramento, controle de acesso e avaliação usadas durante o desenvolvimento de modelos.

A avaliação do UK AISI mostra que modelos como o GPT‑5.6 Sol são cada vez mais capazes de sustentar operações cibernéticas complexas e em várias etapas por longos horizontes temporais. Este incidente indica que essas capacidades teóricas de fato se aplicam em ambientes reais.

Gráfico do UK AI Security Institute comparando modelos recentes com pesos abertos e modelos de fronteira em ambientes cibernéticos de horizonte longo.

O incidente também deixa claro que modelos avançados podem descobrir e explorar novos caminhos de ataque em sistemas reais sem acesso ao código-fonte. Ele destaca que capacidades cibernéticas avançadas precisam ser desenvolvidas junto com salvaguardas mais fortes e ferramentas defensivas.

Acreditamos que modelos com capacidades cibernéticas avançadas precisam ajudar equipes de segurança a encontrar fraquezas antes dos invasores, entender como vulnerabilidades podem ser encadeadas e corrigi-las na velocidade das máquinas. Estamos usando essas capacidades para continuar fortalecendo as proteções em torno da configuração da infraestrutura e dos ambientes de avaliação de modelos; compartilharemos nossas descobertas e melhores práticas à medida que aprendermos. Incentivamos outros defensores a solicitar acesso confiável e experimentar esses modelos agora para transformar essas capacidades em melhor prevenção, detecção mais rápida e resposta a incidentes mais eficaz.

“Somos gratos pela colaboração com a OpenAI neste e em outros temas. Este incidente, possivelmente o primeiro do tipo, comprova algo em que acreditamos há muito tempo: a segurança da IA não será resolvida por uma única empresa trabalhando em segredo. Ela será resolvida de forma aberta, colaborativa, com amplo acesso à IA para todos os defensores, em todos os lugares.”
—Clem Delangue, cofundador e CEO, Hugging Face

Autoria

OpenAI