O incidente da Hugging Face e outros impactos de modelos desalinhados sobre terceiros
À medida que os sistemas de IA se tornam mais capazes e autônomos, comportamentos desalinhados podem se traduzir em ações com consequências no mundo real, incluindo incidentes de cibersegurança e outros resultados que os desenvolvedores talvez não tenham previsto. Portanto, entender como esses comportamentos surgem, como se agravam e como detectá-los e responder a eles é uma parte cada vez mais importante da criação e implantação segura de sistemas avançados de IA.
Inicialmente, entendemos o incidente da Hugging Face sobretudo como um problema de segurança, pois envolveu o comprometimento de uma plataforma. Até o momento, essa continua sendo a atividade mais grave desse tipo que identificamos em nossos modelos, e foi causada principalmente por um modelo de pesquisa altamente capaz e restrito ao uso interno. Desde então, entendemos que essa invasão foi motivada pelo uso, por parte dos modelos, de estratégias desalinhadas para resolver tarefas difíceis, conforme documentado no relatório técnico da Hugging Face. Incidentes de cibersegurança são uma manifestação desse risco; o desalinhamento também pode levar a outros comportamentos inesperados ou preocupantes que não se enquadram nas categorias tradicionais de segurança, como nossos modelos publicarem em sites de terceiros — algo que chamamos de "spam de agentes". E precisamos enfrentar os dois.
Continuamos analisando atividades mais amplas, priorizando os incidentes mais graves e ampliando a análise para atividades desalinhadas de menor gravidade, incluindo spam de agentes.
Esta página reúne nossos relatórios e atualizações sobre o incidente da Hugging Face, pesquisas relacionadas e apresentações públicas, outras atividades que identificamos, o que aprendemos sobre o papel do desalinhamento de modelos e as medidas que estamos adotando para fortalecer nossos sistemas. Atualizaremos esta página conforme nossas investigações avançarem.
Links rápidos
Atividades que afetam terceiros
Para compreender melhor o alcance desses comportamentos inesperados, estamos realizando uma ampla análise das atividades de nossos modelos na internet durante o treinamento e a avaliação. Como parte de nossa análise, estamos identificando e notificando terceiros de forma contínua, começando pelos casos em que:
Nossos modelos podem ter contornado os controles de segurança de terceiros ou prejudicado a disponibilidade de um serviço online; ou
Casos de desalinhamento afetaram negativamente sites ou serviços de terceiros.
Com base em nossa análise até o momento, notificamos dezenas de terceiros usando os critérios acima. Nossa análise de atividades anteriores continua em andamento e exigirá tempo e recursos significativos. Notificaremos outros terceiros à medida que esse trabalho avançar.
A seguir, publicamos resumos anonimizados para descrever os tipos de atividades desalinhadas que observamos. Atualizaremos essas descrições à medida que notificarmos outros terceiros e ampliarmos nosso entendimento. Também compartilharemos atualizações relevantes sobre o andamento da análise. Em geral, omitiremos nomes e outros dados de identificação quando necessário para proteger as partes afetadas, embora as partes informadas possam optar por divulgar publicamente as informações que fornecermos a elas.
Resumos das atividades observadas
Até o momento, nosso processo de análise e notificação identificou as seguintes categorias de atividade:
Contorno de controles de acesso: agentes acessam informações ou recursos que normalmente exigem verificação de identidade, permissão específica, assinatura ou conta. Por exemplo, o agente usou outro endereço da web, alterou detalhes de uma solicitação ou utilizou uma sessão autenticada que lhe concedia mais acesso do que o esperado.
Uso de credenciais expostas: agentes encontraram dados de login ou chaves de acesso disponibilizados publicamente e os usaram para acessar um serviço.
Injeção de consultas ou comandos: agentes inseriram texto em um site ou serviço que foi interpretado pelo serviço como uma instrução, e não como uma entrada comum. Isso poderia levar o serviço a executar uma consulta ao banco de dados, um código de aplicação ou um comando em seu servidor.
Acesso a componentes internos do ambiente de execução: agentes leram arquivos contendo a implementação de um serviço ou interagiram com um sistema de segundo plano destinado ao uso interno. Nesses casos, o agente alcançou partes do serviço que estavam fora do acesso previsto para ele.
Spam de agentes: agentes publicam informações em sites de terceiros que podem alterar o conteúdo desses sites e exigir correções, como o uso de páginas wiki públicas como murais de mensagens compartilhados.