Saltar para o conteúdo principal
OpenAI

28 de setembro de 2026

Segurança

Rumo a dossiês de segurança para o treino de IA de fronteira

A carregar…

Acreditamos que estamos a entrar numa nova era em que se deve exigir documentação de segurança estruturada antes de prosseguir com qualquer execução de treino de modelos de fronteira por aprendizagem por reforço. Idealmente, essa documentação deveria atingir o nível dos «dossiês de segurança»: argumentações abrangentes, estruturadas e fundamentadas em evidências sobre o risco, utilizadas noutros setores em que a segurança é crítica. Encaramos os dossiês de segurança como um objetivo orientador para o qual estamos a trabalhar, reconhecendo os desafios de os tornar tão rigorosos para os modelos de IA como para a aviação ou a energia nuclear, dada a complexidade que emerge a cada novo patamar de capacidade da IA. Estamos a trabalhar num enquadramento para formalizar estas práticas.

Apresentamos abaixo algumas diretrizes iniciais que, na nossa opinião, devem integrar estes dossiês de segurança para o treino de IA de fronteira. Estas boas práticas refletem o que aprendemos até agora e esperamos que evoluam à medida que continuamos a aperfeiçoar os processos internos para um desenvolvimento cuidadoso. Partilhamo-las agora para dar transparência à nossa posição atual e convidar a comunidade a dar o seu contributo. Note-se que este documento se centra no treino de modelos de fronteira por aprendizagem por reforço; a implementação interna e externa exige considerar um conjunto muito mais amplo de propriedades de alinhamento.

1. Salvaguardas técnicas

Os dossiês de segurança devem abranger três aspetos da arquitetura técnica: treino de alinhamento, contenção e monitorização. Estas salvaguardas ajudam a garantir que o modelo não tenta realizar ações desalinhadas e que, mesmo que o tente, será difícil escapar à contenção e a monitorização detetará a tentativa antes de ocorrerem danos.

  • Alinhamento do modelo: A primeira linha de defesa deve ser treinar os modelos para estarem alinhados, ou seja, para agirem de forma fiável conforme pretendemos. Isto pode incluir:

    • Ambientes de treino e classificação: Reduzir o risco de os modelos desenvolverem comportamentos desalinhados, impedindo o reforço positivo da manipulação do sistema de recompensas durante o treino. Isto pode incluir:

      • Revisões automatizadas dos conjuntos de dados: Utilizar agentes para identificar e corrigir ambientes de aprendizagem por reforço com falhas que permitam atribuir recompensas elevadas a trajetórias desalinhadas por explorarem vulnerabilidades, em vez de seguirem o comportamento pretendido, reduzindo as oportunidades de reforçar o desalinhamento durante o treino.

      • Revisões manuais dos conjuntos de dados: Complementar o red teaming automatizado com revisão manual e verificações de qualidade dos conjuntos de dados, para identificar tarefas com falhas que possam reforçar inadvertidamente comportamentos desalinhados.

      • Ajuste dos classificadores: Ajustar os classificadores para penalizar tentativas do modelo de explorar vulnerabilidades ou manipular os ambientes de aprendizagem por reforço durante o treino.

      • Análise de execuções anteriores: Aplicar classificadores aos registos de execução de experiências anteriores para garantir que os classificadores funcionam como previsto.

    • Medição do alinhamento: Realizar avaliações que acompanhem a propensão do modelo para o desalinhamento, a fim de medir a eficácia do treino de alinhamento. Isto pode incluir:

      • Avaliações de alinhamento offline: Realizar avaliações de alinhamento durante as execuções de treino de modelos de fronteira para verificar se o treino funciona como previsto e investigar quaisquer regressões significativas.

      • Testes retrospetivos: Testar as avaliações de alinhamento com base em incidentes anteriores para confirmar que detetam modelos anteriormente desalinhados e não estão a ser sobreajustadas a incidentes específicos.

      • Acompanhamento da manipulação das avaliações: Acompanhar a consciência de avaliação ou o metajogo (quando os modelos reconhecem que estão a ser testados) que possam induzir alterações de comportamento, com limiares de bloqueio específicos (por exemplo, ativando mecanismos de monitorização da consciência de avaliação e do metajogo nas avaliações de alinhamento).

      • Testes de esforço no pior cenário: Suscitar os piores comportamentos indesejados possíveis e verificar se pelo menos uma avaliação os detetaria.

    • Impedir o treino com base na cadeia de pensamento: Não permitir que os classificadores automatizados tenham acesso à cadeia de pensamento durante a aprendizagem por reforço, para evitar que os modelos evoluam de forma a contornar os mecanismos de monitorização da cadeia de pensamento.

  • Contenção: Garantir que o isolamento em ambientes restritos e a segurança são suficientemente robustos para impedir ações prejudiciais, caso um modelo se torne desalinhado. Isto pode incluir:

    • Várias camadas de segurança da infraestrutura: Investir fortemente no reforço da segurança tanto do ambiente isolado em que o modelo é executado como da infraestrutura de investigação que o aloja, para garantir uma camada adicional de proteção caso o modelo escape desse ambiente.

    • Red teaming da contenção: Melhorar a segurança do ambiente isolado, da infraestrutura de investigação e do perímetro através de red teaming iterativo destes sistemas, utilizando pontos de controlo de execuções de treino de modelos de fronteira, sujeitos a uma análise de segurança, para identificar e colmatar eventuais lacunas. Submeter também a testes de red teaming todos os serviços com que o modelo possa interagir durante o treino (por exemplo, a cache da Internet).

    • Comunicação entre amostras: Restringir a comunicação de elevada largura de banda entre amostras a vias aprovadas, como ferramentas multiagente, e fechar canais laterais da infraestrutura que tenham elevada largura de banda e sejam fáceis de descobrir pelos agentes.

    • Transcrições imutáveis: Guardar as transcrições dos agentes de forma imutável durante um período razoável (por exemplo, em contas de armazenamento de escrita única), em todo o treino por aprendizagem por reforço, avaliação e implementação interna, para permitir uma investigação fiável de incidentes e evitar alterações inadvertidas.

  • Monitorização: Dispor de um sistema de monitorização em tempo real que, caso os modelos comecem a realizar ações desalinhadas, detete qualquer possível desalinhamento e permita resolver rapidamente os problemas prioritários antes de ocorrer um incidente grave. Isto pode incluir:

    • Garantir a capacidade de monitorização: Garantir que continua a ser possível monitorizar os modelos, medindo essa capacidade e as tentativas de evasão aos mecanismos de monitorização através de avaliações com limiares claros, para detetar precocemente comportamentos preocupantes.

    • Elevada sensibilidade a problemas conhecidos: Garantir que o sistema de monitorização apresenta elevada sensibilidade na deteção de incidentes passados, numa avaliação com dados reservados para esse fim.

    • Atualização das avaliações dos sistemas de monitorização: Criar exemplos de avaliação representativos de riscos inteiramente novos para novas execuções de treino, para que as medidas de sensibilidade e precisão dos sistemas de monitorização não fiquem desatualizadas.

    • Resposta rápida: Implementar alertas prioritários que desencadeiem uma ação dentro de um SLA definido, quer alertando uma pessoa de prevenção, quer suspendendo automaticamente a execução de treino afetada, antes de o modelo causar danos (por exemplo, alertar o responsável de segurança de prevenção e o responsável pela execução em caso de incidentes durante o dia, e suspender automaticamente as execuções perante alertas sem confirmação de receção à noite).

2. Diretrizes operacionais

Além das recomendações sobre salvaguardas técnicas, temos trabalhado em boas práticas operacionais para os dossiês de segurança de execuções de treino de IA de fronteira. Estas podem incluir:

  • Pareceres divergentes (análises pré-mortem): Após a elaboração de um dossiê de segurança, um membro de outra equipa deve redigir um parecer divergente para identificar possíveis lacunas e apresentar uma apreciação ponderada do risco. A equipa de treino deve depois dar resposta a esse parecer, contribuindo para reforçar o dossiê de segurança.

  • Aprovações: O dossiê de segurança deve ser revisto por membros da direção de topo, cada um com poder de veto sobre a execução de treino, para garantir vários níveis de controlo interno (por exemplo, o responsável ou vice-presidente da área de investigação, o responsável pela segurança e o diretor científico).

  • Responsabilização: O dirigente responsável por uma execução de treino (por exemplo, o responsável ou vice-presidente da área de investigação) deve responder pelo dossiê de segurança e por qualquer resposta a incidentes, inclusive nas avaliações de desempenho, para que as equipas de treino também tenham incentivos para promover a segurança e o alinhamento.

  • Suspensão: Se forem detetados problemas que invalidem um dossiê de segurança (por exemplo, um novo problema de segurança), deve garantir-se a existência de procedimentos operacionais, controlos técnicos e acordos de nível de serviço (SLA) para suspender todas as execuções de treino abrangidas.

  • Transparência interna: Os dossiês de segurança devem ser disponibilizados aos grupos internos de supervisão (por exemplo, o Comité de Segurança e Proteção).

  • Auditorias: Os auditores devem dispor de acesso suficiente para verificar se as alegações do dossiê de segurança são válidas e sólidas, e para assinalar eventuais lacunas.

  • Encaminhamento para níveis superiores: Deve existir um processo claro para encaminhar situações de desalinhamento para níveis superiores, com uma tabela de níveis de gravidade definidos e um responsável de prevenção para o desalinhamento que possa alertar a direção executiva (por exemplo, o CEO) quando uma execução de treino atingir um determinado nível de gravidade.

  • Controlos técnicos: Deve ser difícil para pessoas e agentes iniciar execuções de treino que não cumpram os requisitos. As funcionalidades de segurança, como a monitorização e a suspensão automática, devem bloquear a operação em caso de falha (por exemplo, não deve ser possível iniciar execuções de treino sem a monitorização adequada ativa, nem desativar o sistema de monitorização a partir de um treino por aprendizagem por reforço, de uma avaliação ou de uma implementação interna).

  • Capacidade de reversão: Deve ser fácil identificar todas as utilizações subsequentes de um modelo desalinhado no processo de treino (por exemplo, geração de dados ou classificação), para permitir anular o efeito dos resultados desalinhados, se necessário.

  • Inventário completo dos riscos residuais: Os dossiês de segurança devem enumerar, de forma tão exaustiva quanto possível, os riscos residuais não abrangidos pelas medidas de mitigação já implementadas, para permitir decisões informadas sobre a aceitação do risco.

Estas são as nossas recomendações atuais, que estão a ser implementadas na OpenAI. Esperamos que as nossas práticas continuem a evoluir nas próximas semanas.

3. Investigação de incidentes de desalinhamento

Também temos desenvolvido boas práticas para investigar incidentes graves de desalinhamento de IA. Os laboratórios devem procurar aprender o máximo possível com cada incidente (à semelhança das práticas de investigação⁠(abre numa nova janela) de outros setores de alto risco), para evitar que situações semelhantes ocorram no futuro. Alguns exemplos de medidas podem incluir:

  • Transparência interna: Como uma investigação pode demorar bastante tempo a concluir, devem ser apresentadas atualizações internas periódicas sobre as investigações de incidentes (por exemplo, atualizações diárias sobre investigações em curso). Os colaboradores devem dispor de vias definidas para obter mais acesso, incluindo a transcrições integrais e à amostragem de modelos desalinhados, se tal for seguro e relevante para o seu trabalho.

  • Causa raiz do desalinhamento: Os investigadores devem identificar as causas raiz nas dinâmicas de treino (por exemplo, através de ablações direcionadas ou experiências de reamostragem), para compreender como surgiram os comportamentos desalinhados, aprofundar o conhecimento científico sobre o desalinhamento e preveni-lo melhor no futuro.

  • Análise pós-incidente: Deve realizar-se uma análise pós-incidente das dimensões operacional e cultural, para compreender todas as causas que contribuíram para o incidente, incluindo os motivos pelos quais os problemas surgiram e não foram detetados nem encaminhados para níveis superiores antes do incidente.

  • Deteção: Devemos desenvolver métodos de teste de alinhamento capazes de detetar a propensão para causar o incidente, sem os otimizar iterativamente com base direta em informações extraídas do incidente (por exemplo, transcrições ou resumos do incidente). Devem criar-se avaliações a partir dos incidentes como «testes de regressão», para garantir que os modelos futuros não revelam propensão para o desalinhamento em incidentes muito semelhantes.

  • Divulgação pública: Os resultados das investigações, as análises pós-incidente e as alterações operacionais devem ser partilhados com o público após a conclusão da investigação. Os terceiros afetados devem ser notificados o mais rapidamente possível.

Autor

OpenAI