Rumo a casos de segurança para o treinamento de IA de ponta
Acreditamos que estamos entrando em uma nova era na qual uma documentação estruturada de segurança deve ser exigida antes de dar continuidade a qualquer execução de treinamento por aprendizado por reforço de modelos de fronteira. Idealmente, essa documentação atingiria o patamar de "casos de segurança": argumentações abrangentes, estruturadas e baseadas em evidências sobre riscos, usadas em outros setores nos quais a segurança é crítica. Tratamos os casos de segurança como um ideal que orienta nosso trabalho, reconhecendo os desafios de torná-los tão rigorosos para modelos de IA quanto para a aviação ou a energia nuclear, dada a complexidade que surge a cada novo nível de capacidade da IA. Estamos trabalhando em uma estrutura para formalizar essas práticas.
A seguir, apresentamos algumas diretrizes iniciais que, em nossa visão, devem integrar esses casos de segurança para o treinamento de IA de ponta. Essas boas práticas refletem o que aprendemos até agora, e esperamos que evoluam à medida que continuamos aprimorando os processos internos para um desenvolvimento cuidadoso. Estamos compartilhando essas práticas agora para dar transparência à nossa visão atual e convidar a comunidade a contribuir com comentários. Vale ressaltar que este documento se concentra no treinamento por aprendizado por reforço de modelos de fronteira; implantações internas e externas exigem considerar um conjunto muito mais amplo de propriedades de alinhamento.
Os casos de segurança devem abranger três aspectos da estrutura técnica: treinamento de alinhamento, contenção e monitoramento. Essas salvaguardas ajudam a garantir que o modelo não tente realizar ações desalinhadas e que, mesmo se tentasse, fosse difícil romper a contenção e o monitoramento detectasse a tentativa antes que ela causasse danos.
Alinhamento do modelo: A primeira linha de defesa deve ser treinar os modelos para que sejam alinhados, ou seja, para que ajam de forma confiável conforme nossas intenções. Isso pode incluir:
Ambientes de treinamento e atribuição de notas: Reduzir os riscos de os modelos desenvolverem comportamentos desalinhados, impedindo o reforço positivo da exploração de falhas no sistema de recompensas durante o treinamento. Isso pode incluir:
Revisões automatizadas de conjuntos de dados: Usar agentes para encontrar e corrigir ambientes de RL com falhas que possam permitir que trajetórias desalinhadas recebam recompensas altas pela exploração de vulnerabilidades, em vez do comportamento pretendido, reduzindo as oportunidades de reforçar o desalinhamento durante o treinamento.
Revisões manuais de conjuntos de dados: Complementar o red teaming automatizado com revisão manual e verificações de qualidade dos conjuntos de dados para identificar tarefas defeituosas que possam reforçar inadvertidamente comportamentos desalinhados.
Ajuste dos avaliadores: Ajustar os avaliadores para penalizar tentativas do modelo de explorar falhas ou burlar ambientes de RL durante o treinamento.
Análise de execuções anteriores: Aplicar classificadores aos registros de experimentos anteriores para garantir que os avaliadores funcionem conforme o esperado.
Medição do alinhamento: Realizar avaliações que acompanhem as propensões do modelo ao desalinhamento para medir a eficácia do treinamento de alinhamento. Isso pode incluir:
Avaliações offline de alinhamento: Realizar avaliações de alinhamento durante execuções de treinamento de modelos de fronteira para verificar se o treinamento funciona conforme o esperado e investigar qualquer regressão significativa.
Testes retrospectivos: Testar as avaliações de alinhamento em incidentes anteriores para confirmar que detectam modelos que apresentaram desalinhamento e não estão sendo ajustadas excessivamente a incidentes específicos.
Acompanhamento da manipulação de avaliações: Acompanhar a consciência de avaliação ou o metagaming (quando os modelos reconhecem que estão sendo testados) que possam induzir uma mudança de comportamento, com limiares específicos para bloqueio (por exemplo, ativar monitores de consciência de avaliação e de metagaming nas avaliações de alinhamento).
Testes de estresse para o pior cenário: Induzir o pior comportamento inadequado possível e verificar se ao menos uma avaliação o detectaria.
Impedir o treinamento com base na cadeia de pensamento: Não permitir que avaliadores automatizados vejam a cadeia de pensamento no aprendizado por reforço, para evitar que os modelos evoluam de modo a evadir os monitores da cadeia de pensamento.
Contenção: Garantir que o isolamento em sandbox e a segurança sejam robustos o suficiente para impedir ações prejudiciais caso um modelo se torne desalinhado. Isso pode incluir:
Múltiplas camadas de segurança da infraestrutura: Investir fortemente no reforço da segurança tanto do sandbox em que o modelo é executado quanto da infraestrutura de pesquisa que o hospeda, para garantir uma camada extra de proteção caso o modelo escape do sandbox.
Red teaming da contenção: Aprimorar a segurança do sandbox, da infraestrutura de pesquisa e do perímetro por meio de ciclos de red teaming nesses sistemas, usando checkpoints de execuções de treinamento de modelos de fronteira, sujeitos a uma análise de segurança, para encontrar e corrigir eventuais lacunas. Também realizar testes de red teaming em todos os serviços com os quais o modelo possa interagir durante o treinamento (por exemplo, cache de internet).
Comunicação entre amostras: Limitar a comunicação de alta largura de banda entre amostras a vias aprovadas, como ferramentas multiagente, e fechar canais laterais da infraestrutura que tenham alta largura de banda e sejam facilmente descobertos por agentes.
Transcrições imutáveis: Salvar as transcrições dos agentes de forma imutável por um período razoável (por exemplo, em contas de armazenamento de gravação única), em todo treinamento por RL, avaliação e implantação interna, para permitir investigações confiáveis de incidentes e impedir edições inadvertidas.
Monitoramento: Caso os modelos comecem a realizar ações desalinhadas, dispor de um sistema de monitoramento em tempo real para detectar qualquer possível desalinhamento e resolver rapidamente problemas prioritários antes que ocorra um incidente grave. Isso pode incluir:
Garantia de monitorabilidade: Garantir que os modelos continuem passíveis de monitoramento, conforme medido por avaliações de monitorabilidade e de evasão dos monitores com limiares claros, para detectar comportamentos preocupantes precocemente.
Alta revocação para problemas conhecidos: Garantir que o sistema de monitoramento tenha alta revocação para incidentes passados em uma avaliação com dados reservados.
Atualização das avaliações dos monitores: Criar exemplos de avaliação representativos de riscos inéditos para novas execuções, para que as medidas de revocação e precisão dos monitores não fiquem desatualizadas.
Resposta rápida: Implementar alertas prioritários que resultem em ação dentro de um SLA definido, seja acionando uma pessoa de plantão ou pausando automaticamente a execução afetada, antes que o modelo cause danos (por exemplo, acionar o plantão de segurança e o responsável pela execução em incidentes durante o dia e pausar automaticamente as execuções à noite quando os alertas não tiverem confirmação de recebimento).
Além das recomendações sobre salvaguardas técnicas, temos trabalhado em boas práticas operacionais para casos de segurança de execuções de treinamento de IA de ponta. Essas práticas podem incluir:
Pareceres divergentes (análises pré-mortem): Após a elaboração de um caso de segurança, um integrante de outra equipe deve redigir um parecer divergente para identificar possíveis lacunas e apresentar uma avaliação ponderada dos riscos. A equipe de treinamento deve então responder aos pontos levantados, ajudando a fortalecer o caso de segurança.
Aprovações: O caso de segurança deve ser revisado por membros da alta liderança, cada um com poder de vetar a execução, para garantir múltiplas instâncias de verificação interna (por exemplo, líder ou vice-presidente da área de pesquisa, responsável pela segurança e cientista-chefe).
Responsabilização: O líder sênior responsável por uma execução de treinamento (por exemplo, líder ou vice-presidente da área de pesquisa) deve responder pelo caso de segurança e por qualquer resposta a incidentes, inclusive nas avaliações de desempenho, para que as equipes de treinamento também tenham incentivos para promover a segurança e o alinhamento.
Pausas: Caso sejam encontrados problemas que invalidem um caso de segurança (por exemplo, um novo problema de segurança), garantir a existência de procedimentos operacionais, controles técnicos e SLAs para pausar todas as execuções abrangidas.
Transparência interna: Os casos de segurança devem ser disponibilizados aos grupos de supervisão interna (por exemplo, o Comitê de Segurança e Proteção).
Auditorias: Os auditores devem ter acesso suficiente para verificar se as afirmações do caso de segurança são válidas e bem fundamentadas e apontar eventuais lacunas.
Escalonamento: Deve haver um processo claro para encaminhar questões de desalinhamento às instâncias responsáveis, com uma tabela de níveis de gravidade definidos e um plantão de desalinhamento que possa acionar executivos (por exemplo, o CEO) quando uma execução atingir determinado nível de gravidade.
Controles técnicos: Deve ser difícil para humanos e agentes iniciar execuções que não cumpram os requisitos. Recursos de segurança, como monitoramento e pausa automática, devem bloquear a operação em caso de falha (por exemplo, não deve ser possível iniciar execuções sem o monitoramento adequado ativado nem desativar o monitor a partir do treinamento por RL, da avaliação ou de uma implantação interna).
Capacidade de reversão: Deve ser fácil identificar todos os usos subsequentes de um modelo desalinhado no processo de treinamento (por exemplo, geração de dados ou atribuição de notas), para permitir que os efeitos de saídas desalinhadas sejam desfeitos, se necessário.
Levantamento completo dos riscos residuais: Os casos de segurança devem listar, da forma mais abrangente possível, os riscos residuais não cobertos pelas medidas de mitigação já implementadas, para permitir decisões informadas sobre a aceitação de riscos.
Essas são nossas recomendações atuais, que estão sendo implementadas na OpenAI. Esperamos que nossas práticas continuem evoluindo nas próximas semanas.
Também temos desenvolvido boas práticas para investigar incidentes graves de desalinhamento de IA. Os laboratórios devem buscar aprender o máximo possível com cada incidente, de forma semelhante às práticas de investigação(abre em uma nova janela) de outros setores de alto risco, para prevenir ocorrências futuras. Alguns exemplos de ações nesse sentido podem incluir:
Transparência interna: Como uma investigação pode levar bastante tempo para ser concluída, devem ser apresentadas atualizações internas periódicas sobre as investigações de incidentes (por exemplo, atualizações diárias sobre investigações em andamento). Os funcionários devem dispor de meios definidos para obter acesso ampliado, incluindo transcrições brutas e geração de amostras de modelos desalinhados, quando isso for seguro e relevante para seu trabalho.
Causa raiz do desalinhamento: Os pesquisadores devem investigar as causas nas dinâmicas de treinamento (por exemplo, por meio de ablações direcionadas ou experimentos de reamostragem) para entender como os comportamentos desalinhados foram introduzidos, aprofundar a compreensão científica do desalinhamento e preveni-lo melhor no futuro.
Análise pós-incidente: Deve ser realizada uma análise operacional e cultural pós-incidente para entender todas as causas que contribuíram para a ocorrência, como os motivos pelos quais problemas foram introduzidos e não foram detectados nem encaminhados às instâncias responsáveis antes do incidente.
Detecção: Devemos desenvolver métodos de teste de alinhamento capazes de identificar a propensão a causar o incidente, sem otimização iterativa direta com base em informações derivadas dele (por exemplo, transcrições ou resumos do incidente). Avaliações derivadas de incidentes devem ser criadas como "testes de regressão", para garantir que modelos futuros não apresentem propensão ao desalinhamento em incidentes muito semelhantes.
Divulgação pública: Os resultados das investigações, as análises pós-incidente e as mudanças operacionais devem ser compartilhados com o público após a conclusão da investigação. Terceiros afetados devem ser notificados o mais rápido possível.


