Pular para o conteúdo principal
OpenAI

30 de setembro de 2026

Segurança

Interrompendo uma campanha coordenada de destilação de modelos

Carregando…

Recentemente, identificamos e interrompemos uma campanha coordenada para extrair raciocínio protegido dos nossos modelos. A primeira atividade observada ocorreu na primeira semana de julho. Essa atividade é compatível com a destilação adversarial: o uso sistemático e não autorizado das saídas ou do raciocínio de um modelo para ajudar a treinar, reproduzir ou aprimorar outro modelo. O raciocínio protegido é o registro interno de como o modelo executa uma tarefa; sua extração pode revelar informações omitidas da resposta final e ajudar terceiros a reproduzir as capacidades do modelo.

Os operadores não quebraram nossa criptografia, não comprometeram nenhum banco de dados nem obtiveram acesso direto a conversas armazenadas de usuários. Em vez disso, manipularam as interações com os modelos para que o raciocínio protegido pudesse ser reproduzido em formatos visíveis a quem fazia a solicitação, de maneira coordenada e em escala, violando nossos termos de serviço. Essa manipulação não é uma vulnerabilidade exclusiva dos modelos da OpenAI. Compartilhamos informações sobre ela com parceiros do setor por meio do Frontier Model Forum para fortalecer as defesas coletivas contra a destilação adversarial.

Antes desta publicação, investigamos o alcance e o impacto potencial, implementamos nossas próprias medidas de mitigação e trocamos informações e avaliações com pesquisadores e parceiros do setor para garantir a implementação de proteções contra esse tipo de ataque. O trabalho de mitigação e investigação continua. Acreditamos que compartilhar agora o que aprendemos ajudará o ecossistema como um todo a fortalecer suas defesas.

O que observamos

Observamos operadores tentando extrair raciocínio protegido de maneiras inéditas, inclusive copiando o raciocínio criptografado de uma conversa e pedindo a um modelo em outra conversa que descriptografasse e transcrevesse o conteúdo do raciocínio oculto.

Pesquisadores independentes de segurança⁠(abre em uma nova janela) também nos alertaram, por meio de divulgação responsável, sobre vulnerabilidades relacionadas que envolviam diferentes modelos e a compactação de conversas. Investigamos suas descobertas e confirmamos que os caminhos de ataque identificados eram reais. O trabalho desses pesquisadores nos ajudou a compreender a categoria mais ampla de ataques e a acelerar as medidas de mitigação.

A atividade começou em 1º de julho, inicialmente em baixo volume, até observarmos picos nos dias 24 e 25 de julho, com 16.000 solicitações1 de mais de 4.000 usuários que empregavam um padrão de extração relevante para a investigação. Uma investigação mais aprofundada identificou atividades com padrões de prompts relacionados em um grupo de mais de 15.000 usuários. Interrompemos completamente essas atividades até 28 de julho.

A atividade evoluiu ao longo do tempo, reforçando que a destilação adversarial é um desafio de segurança mais amplo, que exige defesas adaptativas e em camadas.

Nossa avaliação sobre a autoria

Não está claro se todos os operadores que observamos no período em questão estavam ligados a um único responsável. No entanto, atribuímos um núcleo central dessa atividade a indivíduos associados à Moonshot AI, desenvolvedora do Kimi.

Por que isso importa

A destilação adversarial apresenta riscos tanto à segurança dos sistemas quanto à segurança nacional. O raciocínio extraído poderia ser usado para treinar outro modelo sem preservar as salvaguardas aplicadas às saídas do modelo original apresentadas aos usuários. Em escala, a destilação também pode acelerar a transferência de capacidades avançadas sem exigir o mesmo investimento em segurança. Essas preocupações se intensificam à medida que os modelos adquirem capacidades em áreas de uso dual.

Esse risco não é exclusivo da OpenAI. Como mencionado acima, técnicas semelhantes podem afetar outros sistemas avançados de IA, tornando esse um desafio de segurança compartilhado que exige coordenação entre os participantes do setor.

Como respondemos

Mitigamos essa campanha recente de destilação combinando medidas contra contas infratoras, controles técnicos e coordenação com parceiros. Banimos ou restringimos contas fraudulentas, reforçamos os controles de cadastro e infraestrutura e ampliamos o monitoramento de redes relacionadas.

Também reforçamos as proteções do raciocínio oculto entre usuários, espaços de trabalho, organizações e famílias de modelos. Fechamos um caminho que permitia a alguém que já tivesse o raciocínio criptografado de outro usuário reenviá-lo e recuperar seu conteúdo. Também adicionamos verificações para detectar e reter saídas transmitidas em streaming que pudessem expor o raciocínio. Quando atividades relacionadas passaram a ocorrer por meio de serviços de terceiros, trabalhamos com esses provedores para identificar as contas envolvidas e interromper suas atividades.

Por fim, compartilhamos descobertas relevantes por meio do Frontier Model Forum e dos canais governamentais apropriados de compartilhamento de informações, para que outros desenvolvedores de modelos de fronteira e parceiros do setor público pudessem buscar atividades semelhantes e fortalecer suas próprias defesas. Sistemas que permitem o uso de artefatos de raciocínio portáteis ou que podem ser reenviados podem enfrentar riscos relacionados.

Próximos passos

Esperamos que as tentativas de destilação adversarial se tornem mais sofisticadas à medida que os modelos de fronteira melhorem e os responsáveis busquem formas mais baratas de imitar suas capacidades. A defesa contra essa atividade exige controles em camadas e adaptação contínua.

Esse trabalho ainda não terminou. As implantações hospedadas por parceiros precisam das mesmas proteções que os serviços próprios, e os ataques por meio das saídas de ferramentas exigem proteções que examinem mais do que apenas o texto normalmente visível. Continuamos aprimorando as defesas das ferramentas, a cobertura dos classificadores e as recusas dos modelos, além de estender os controles pertinentes aos parceiros de nuvem.

Nossa resposta continuará focada em três áreas: proteções técnicas mais fortes contra a extração, melhor detecção e aplicação de medidas contra campanhas coordenadas e maior compartilhamento de informações sobre ameaças entre o setor e o governo.

Autor

OpenAI

Notas de rodapé

  1. 1

    Esses números representam tentativas de extração, não necessariamente bem-sucedidas.