Pular para o conteúdo principal
OpenAI

21 de julho de 2026

Segurança

OpenAI e Hugging Face se unem para tratar incidente de segurança durante avaliação de modelo

Carregando…

Estamos conduzindo uma análise minuciosa com consultores externos e sob a supervisão do Comitê de Segurança e Proteção. Quando a análise for concluída, publicaremos nas próximas semanas um relatório técnico sobre o que aprendemos.

Atualização de 28 de julho de 2026:

  • Nenhum dos modelos previstos para lançamentos futuros esteve envolvido na exploração da Hugging Face. O modelo em pré-lançamento mencionado no nosso post do blog é um protótipo de pesquisa exclusivamente interno e nunca foi destinado ao lançamento público. Após o incidente, desativamos e criptografamos o modelo e restringimos o acesso a ele para fins de pesquisa.
  • O ambiente de avaliação do ExploitGym não oferecia aos modelos acesso direto à internet. Para obter acesso à internet, os modelos identificaram e exploraram uma vulnerabilidade de dia zero até então desconhecida no Artifactory(abre em uma nova janela), um proxy de cache para registros de pacotes. Relatamos essa vulnerabilidade ao fornecedor, junto com outras vulnerabilidades do Artifactory identificadas pelos nossos modelos durante a análise. 
  • Continuamos colaborando com a Hugging Face, inclusive contribuindo para sua análise post-mortem(abre em uma nova janela), enquanto nossa própria análise prossegue. Também incluímos a Hugging Face no nosso programa Trusted Access for Cyber. 
  • Com base na análise feita até o momento, não identificamos nenhuma outra atividade com o mesmo nível de gravidade ou escala do que divulgamos em relação à Hugging Face, caso que envolveu um comprometimento em nível de plataforma.
  • Durante nossa análise contínua da invasão da Hugging Face e de outras atividades dos nossos modelos, identificamos um pequeno número de casos em que os modelos encontraram e usaram credenciais expostas publicamente, em nível de conta, em outros serviços disponíveis ao público. Isso inclui quatro contas em quatro serviços no contexto do incidente da Hugging Face, além de algumas contas acessadas durante outras avaliações. Uma dessas quatro contas foi usada como retransmissor de saída e rota intermediária, e outra foi usada para armazenar dados. Os modelos acessaram as duas contas restantes somente para leitura, e elas não foram usadas para viabilizar o comprometimento da Hugging Face. Continuaremos notificando diretamente os responsáveis pelos serviços e não encontramos evidências de impacto mais amplo sobre esses provedores ou outras contas em seus serviços.
  • Os modelos também usaram diversos serviços disponíveis ao público, incluindo sites de compartilhamento de trechos de código, serviços de captura de solicitações, serviços de captura de tela e outras ferramentas da web. Nesses casos, não houve comprometimento em nível de plataforma ou de conta. 
  • Levamos a sério nossa responsabilidade de identificar e nos preparar para os riscos de sistemas de IA cada vez mais capazes. Quando concluirmos a análise, vamos examiná-la em conjunto com o Comitê de Segurança e Proteção e o Grupo Consultivo de Segurança, no âmbito do nosso Preparedness Framework.

Na semana passada, a Hugging Face divulgou um novo tipo de incidente de segurança(abre em uma nova janela) após detectar e conter um agente de IA que comprometeu sua infraestrutura, algo que esperamos se tornar mais comum com a proliferação de modelos com capacidades cibernéticas cada vez maiores. Após a investigação, agora sabemos que este incidente específico foi provocado por uma combinação de modelos da OpenAI — incluindo o GPT‑5.6 Sol e um modelo de pré-lançamento ainda mais capaz, todos com recusas cibernéticas reduzidas para fins de avaliação — durante testes internos em um benchmark(abre em uma nova janela) de capacidades cibernéticas.

Consideramos este incidente um incidente cibernético sem precedentes, envolvendo capacidades cibernéticas de ponta, e estamos respondendo à altura. Estamos compartilhando descobertas preliminares neste momento para ajudar defensores a entender o que aconteceu e a calibrar sua visão sobre o que os modelos já são capazes de fazer. Continuaremos conduzindo uma investigação completa junto com a Hugging Face e compartilharemos mais detalhes sobre as vulnerabilidades, o incidente e as descobertas quando nossa investigação for concluída.

O que aconteceu durante este incidente

Este incidente ocorreu durante uma avaliação interna que orienta modelos a buscar exploração avançada usando caminhos de ataque complexos, com o objetivo de quantificar suas capacidades cibernéticas. Estimamos as capacidades cibernéticas máximas executando essa avaliação sem os classificadores de produção usados para impedir que modelos busquem atividades cibernéticas de alto risco. Nossos benchmarks são executados em um ambiente altamente isolado, com acesso à rede limitado à capacidade de instalar pacotes por meio de um software de terceiros hospedado internamente que atua como proxy e cache para registros de pacotes.

Os modelos identificaram e encadearam vulnerabilidades entre o ambiente de pesquisa da OpenAI e a infraestrutura de produção da Hugging Face para obter soluções de teste diretamente do banco de dados de produção da Hugging Face. Todas as evidências sugerem que os modelos estavam hiperfocados em encontrar uma solução para o ExploitGym, chegando a extremos para atingir uma meta de teste bastante estreita.

Enquanto operavam em nosso ambiente de testes em sandbox, nossos modelos gastaram uma quantidade substancial de computação de inferência tentando encontrar uma forma de obter acesso aberto à Internet para resolver o problema da avaliação. Para obter acesso, os modelos identificaram e exploraram uma vulnerabilidade zero-day (que agora divulgamos de forma responsável ao fornecedor) no proxy de cache do registro de pacotes. Com esse acesso, nossos modelos realizaram uma série de ações de escalonamento de privilégios e movimentação lateral em nosso ambiente de testes de pesquisa até chegarem a um node com acesso à Internet.

Depois de obter acesso à Internet, os modelos inferiram que a Hugging Face potencialmente hospedava modelos, conjuntos de dados e soluções para o ExploitGym. Sabendo disso, o modelo procurou e encontrou com sucesso formas de acessar informações secretas que poderia usar para trapacear na avaliação. Em um exemplo, o modelo encadeou vários vetores de ataque, incluindo o uso de credenciais roubadas e vulnerabilidades zero-day para encontrar um caminho de execução remota de código nos servidores da Hugging Face. A equipe de segurança da OpenAI descobriu internamente essa atividade anômala.

A equipe de segurança e os agentes da Hugging Face detectaram e interromperam a atividade em sua infraestrutura e já haviam iniciado a contenção e a reconstrução forense com seus próprios modelos de código aberto quando nossas equipes se conectaram. Estamos trabalhando ativamente com eles para continuar investigando o incidente. Agradecemos a colaboração rápida e próxima da Hugging Face na investigação e na correção.

Medidas que estamos tomando agora

  1. Como parte da investigação, estamos implementando controles rígidos na configuração da infraestrutura, às custas da velocidade da pesquisa, enquanto as vulnerabilidades são corrigidas. Estamos mantendo nosso Comitê de Segurança e Proteção informado regularmente sobre esses controles e seu impacto.
  2. Estamos trabalhando com a Hugging Face para investigar o incidente de forma forense.
  3. Divulgamos de forma responsável a vulnerabilidade zero-day identificada no software de terceiros hospedado internamente e estamos trabalhando com eles na correção.
  4. Incluímos a Hugging Face no programa de acesso confiável e estamos apoiando suas equipes no uso rápido das capacidades de nossos modelos para melhorar suas defesas.
  5. Estamos aprimorando e adicionando proteções mais fortes para treinamentos e avaliações futuros. Nesta semana, publicamos um blog sobre como melhorar a segurança e o alinhamento em uma era de modelos de horizonte longo. Essas salvaguardas de implantação não foram habilitadas intencionalmente durante esta avaliação porque o objetivo era testar vulnerabilidades cibernéticas. Este incidente aponta para a necessidade de fortalecer ainda mais o alinhamento do nosso modelo, as proteções cibernéticas durante avaliações e o monitoramento em testes internos.

Nossa abordagem para avaliar capacidades cibernéticas avançadas

Como compartilhamos recentemente, a IA está acelerando a descoberta e a exploração de vulnerabilidades. A principal lição deste incidente é que a segurança e a proteção de modelos precisam acompanhar o ritmo das capacidades que avançam rapidamente. Estamos fortalecendo as práticas de contenção, monitoramento, controle de acesso e avaliação usadas durante o desenvolvimento de modelos.

A avaliação do UK AISI mostra que modelos como o GPT‑5.6 Sol são cada vez mais capazes de sustentar operações cibernéticas complexas e em várias etapas por longos horizontes temporais. Este incidente indica que essas capacidades teóricas de fato se aplicam em ambientes reais.

Gráfico do UK AI Security Institute comparando modelos recentes com pesos abertos e modelos de fronteira em ambientes cibernéticos de horizonte longo.

O incidente também deixa claro que modelos avançados podem descobrir e explorar novos caminhos de ataque em sistemas reais sem acesso ao código-fonte. Ele destaca que capacidades cibernéticas avançadas precisam ser desenvolvidas junto com salvaguardas mais fortes e ferramentas defensivas.

Acreditamos que modelos com capacidades cibernéticas avançadas precisam ajudar equipes de segurança a encontrar fraquezas antes dos invasores, entender como vulnerabilidades podem ser encadeadas e corrigi-las na velocidade das máquinas. Estamos usando essas capacidades para continuar fortalecendo as proteções em torno da configuração da infraestrutura e dos ambientes de avaliação de modelos; compartilharemos nossas descobertas e melhores práticas à medida que aprendermos. Incentivamos outros defensores a solicitar acesso confiável e experimentar esses modelos agora para transformar essas capacidades em melhor prevenção, detecção mais rápida e resposta a incidentes mais eficaz.

“Agradecemos a colaboração com a OpenAI neste e em outros temas. Este incidente, possivelmente o primeiro desse tipo, comprova algo em que acreditamos há muito tempo: a segurança da IA não será resolvida por uma única empresa trabalhando em segredo. Ela será alcançada de forma aberta e colaborativa, com amplo acesso à IA para todos os profissionais de defesa, em qualquer lugar.”
—Clem Delangue, cofundador e CEO, Hugging Face

Autoria

OpenAI