Saltar para o conteúdo principal
OpenAI

30 de setembro de 2026

Garantia

Interromper uma campanha coordenada de destilação de modelos

A carregar…

Recentemente, identificámos e interrompemos uma campanha coordenada destinada a extrair raciocínio protegido dos nossos modelos. A primeira atividade observada remonta à primeira semana de julho. Esta atividade é consistente com a destilação adversarial: a utilização sistemática e não autorizada dos resultados ou do raciocínio de um modelo para ajudar a treinar, reproduzir ou melhorar outro modelo. O raciocínio protegido é o registo interno que o modelo usa para resolver uma tarefa. A sua extração pode revelar informações omitidas da resposta final e ajudar terceiros a reproduzir as capacidades do modelo.

Os operadores não quebraram a nossa encriptação, não comprometeram nenhuma base de dados nem obtiveram acesso direto a conversas de utilizadores armazenadas. Em vez disso, manipularam as interações com os modelos para que o raciocínio protegido pudesse ser reproduzido em formatos visíveis para quem fazia o pedido, de forma coordenada e em grande escala, violando os nossos termos de serviço. Esta manipulação não explora uma vulnerabilidade exclusiva dos modelos da OpenAI. Partilhámos informações sobre ela com parceiros do setor através do Frontier Model Forum, para reforçar as defesas coletivas contra a destilação adversarial.

Antes desta publicação, investigámos o alcance e o potencial impacto, implementámos as nossas próprias medidas de mitigação, partilhámos informações com investigadores e parceiros do setor e recolhemos os seus contributos para garantir a existência de proteções contra este tipo de ataque. Continuamos a desenvolver trabalho adicional de mitigação e investigação. Acreditamos que partilhar agora o que aprendemos ajudará o ecossistema no seu conjunto a reforçar as suas defesas.

O que observámos

Observámos operadores a tentar extrair raciocínio protegido de formas novas, nomeadamente copiando raciocínio encriptado de uma conversa e pedindo a um modelo noutra conversa que desencriptasse e transcrevesse o conteúdo desse raciocínio oculto.

Investigadores de segurança independentes⁠(abre numa nova janela) também nos alertaram, através de divulgação responsável, para vulnerabilidades relacionadas que envolviam diferentes modelos e a compactação de conversas. Investigámos as suas conclusões e confirmámos que os vetores de ataque identificados eram reais. O seu trabalho ajudou-nos a compreender a categoria mais ampla de ataques em causa e a acelerar as medidas de mitigação.

A atividade começou a 1 de julho, inicialmente com um volume reduzido, até observarmos picos nos dias 24 e 25 de julho: 16 000 pedidos1 de mais de 4000 utilizadores, que seguiam um padrão de extração relevante para a investigação. O aprofundamento da investigação identificou atividade com padrões de prompts relacionados num grupo de mais de 15 000 utilizadores. Até 28 de julho, tínhamos interrompido por completo essa atividade.

A atividade evoluiu ao longo do tempo, reforçando a ideia de que a destilação adversarial é um desafio de segurança mais amplo, que exige defesas em várias camadas e capazes de se adaptar.

A nossa avaliação da autoria

Não é claro se todos os operadores que observámos durante o período em causa estavam ligados a uma única entidade. No entanto, atribuímos um núcleo central da atividade a indivíduos associados à Moonshot AI, a empresa que desenvolve o Kimi.

Porque é que isto é importante

A destilação adversarial apresenta riscos para a segurança dos sistemas e para a segurança nacional. O raciocínio extraído pode ser usado para treinar outro modelo sem preservar as salvaguardas aplicadas aos resultados que o modelo original apresenta aos utilizadores. Em grande escala, a destilação também pode acelerar a transferência de capacidades avançadas sem exigir o mesmo investimento em segurança. Estas preocupações intensificam-se à medida que os modelos adquirem capacidades em domínios de dupla utilização.

Este risco não é exclusivo da OpenAI. Como referido acima, técnicas semelhantes podem afetar outros sistemas avançados de IA, tornando este um desafio de segurança comum que exige coordenação em todo o setor.

Como respondemos

Mitigámos esta recente campanha de destilação através de uma combinação de medidas contra contas infratoras, controlos técnicos e coordenação com parceiros. Banimos ou restringimos contas fraudulentas, reforçámos os controlos de registo e de infraestrutura e alargámos a monitorização de redes relacionadas.

Reforçámos também as proteções do raciocínio oculto entre utilizadores, espaços de trabalho, organizações e famílias de modelos. Eliminámos uma via que permitia a alguém que já tivesse na sua posse o raciocínio encriptado de outro utilizador voltar a submetê-lo e recuperar o seu conteúdo. Acrescentámos também verificações para detetar e reter resultados transmitidos em streaming que pudessem expor raciocínio. Quando a atividade relacionada passou a recorrer a serviços de terceiros, trabalhámos com esses fornecedores para identificar as contas envolvidas e interromper a sua atividade.

Por fim, partilhámos conclusões relevantes através do Frontier Model Forum e dos canais governamentais adequados de partilha de informação, para que outras entidades que desenvolvem modelos de fronteira e parceiros do setor público pudessem procurar atividade semelhante e reforçar as suas próprias defesas. Os sistemas que permitem transferir ou voltar a submeter artefactos de raciocínio podem enfrentar riscos semelhantes.

Próximos passos

Prevemos que as tentativas de destilação adversarial se tornem mais sofisticadas à medida que os modelos de fronteira melhoram e que os responsáveis por estas atividades procuram formas mais baratas de imitar as suas capacidades. A defesa contra esta atividade exige controlos em várias camadas e uma adaptação contínua.

Este trabalho ainda não terminou. As implementações alojadas por parceiros precisam das mesmas proteções que os nossos próprios serviços, e os ataques através de resultados de ferramentas exigem proteções que analisem mais do que o texto visível comum. Continuamos a melhorar as defesas das ferramentas, a cobertura dos classificadores e as recusas dos modelos, bem como a alargar os controlos relevantes aos parceiros de serviços na nuvem.

A nossa resposta continuará a centrar-se em três áreas: proteções técnicas mais fortes contra a extração, melhor deteção e medidas contra campanhas coordenadas, e uma partilha mais aprofundada de informações sobre ameaças entre o setor e as entidades governamentais.

Autor

OpenAI

Notas de rodapé

  1. 1

    Estes números referem-se a tentativas de extração, não necessariamente bem-sucedidas.