Pular para o conteúdo principal
OpenAI

16 de setembro de 2026

PesquisaSegurança

Nossa estrutura para relatar desalinhamento de modelos

Carregando…

Estamos compartilhando uma nova estrutura para acompanhar, investigar e divulgar casos de desalinhamento de modelos na OpenAI, junto com seis relatórios sobre comportamentos inesperados ou preocupantes que observamos nos últimos seis meses.

No passado, para informar melhor pesquisadores, desenvolvedores de IA, formuladores de políticas públicas e o público em geral, procuramos tornar públicas nossas descobertas sobre desalinhamento. Porém, sem uma abordagem sistemática para relatar essas descobertas, nossas divulgações foram pontuais e menos frequentes do que o ideal: muitas vezes esperamos até poder reunir vários casos em um único relatório ou os adicionamos aos cartões de sistema de modelos recém-lançados. Esta nova estrutura busca acelerar a publicação de relatórios de desalinhamento após sua observação, mesmo quando ainda não explicamos nem mitigamos totalmente o comportamento relatado.

À medida que os sistemas de IA se tornam mais avançados e amplamente implantados, precisamos construir um consenso mais amplo e bem fundamentado sobre o progresso da pesquisa de alinhamento. Não acreditamos que o setor de IA tenha resolvido o alinhamento e o monitoramento em grau suficiente para continuar, de forma responsável, ampliando a escala em velocidade máxima por muito mais tempo. As decisões sobre como o desenvolvimento da IA deve avançar nos próximos meses e anos precisam se basear em evidências que pessoas de fora das empresas responsáveis pelos modelos de fronteira possam examinar por conta própria.

Exemplos de desalinhamento podem ajudar a identificar problemas que outros desenvolvedores de IA talvez encontrem quando seus sistemas atingirem capacidades semelhantes, revelar fragilidades nas salvaguardas ou questionar premissas sobre o comportamento dos modelos. Compartilhar essas descobertas permite que outras pessoas investiguem os mesmos problemas, testem nossas explicações e aprimorem as medidas de mitigação. Como acreditamos no valor da transparência sobre desalinhamentos, nossa nova estrutura favorece a divulgação mesmo quando a relevância é incerta. Isso significa que alguns dos casos divulgados podem se revelar espúrios, sem fazer parte de um padrão mais amplo nem indicar desdobramentos futuros.

No momento, não existe uma estrutura comum a todo o setor com padrões explícitos sobre como os desenvolvedores de IA devem divulgar exemplos de desalinhamento em seus modelos. Esperamos que a estrutura apresentada hoje seja um primeiro passo para a criação desses padrões, definindo quais casos de desalinhamento os desenvolvedores devem divulgar e o que seus relatórios devem conter. Consideramos esta estrutura um trabalho em andamento, que aperfeiçoaremos com a experiência e as contribuições do público.

Aqui, descrevemos como a estrutura funcionará e compartilhamos os primeiros relatórios que estamos publicando.

Quais exemplos de desalinhamento relataremos

Nosso objetivo é divulgar exemplos que forneçam evidências úteis sobre como o desalinhamento de modelos surge, como se manifesta e em que situações as salvaguardas funcionam ou falham. Priorizamos novos mecanismos, mudanças relevantes em comportamentos conhecidos e descobertas que questionem premissas sobre segurança ou mitigação. Um exemplo não precisa causar danos nem demonstrar um padrão mais amplo para justificar sua divulgação. Esta estrutura abrangerá comportamentos que atendam aos critérios em todo o ciclo de vida de um modelo, incluindo treinamento, avaliação, testes e implantação.

Isso inclui novas formas de os modelos agirem sem autorização, coordenarem-se com outros modelos ou evitarem supervisão; falhas que coloquem em dúvida um método de alinhamento ou uma salvaguarda; e comportamentos que contestem alguma afirmação de uma avaliação de segurança publicada. Os mesmos critérios de divulgação se aplicam a desalinhamentos que possam afetar terceiros.

Isso também pode incluir casos de desalinhamento que pareçam repetir casos já divulgados anteriormente. A repetição do problema pode, por si só, ser uma evidência útil sobre o comportamento de nossos modelos ou a eficácia de nossas salvaguardas — por exemplo, se um tipo específico de comportamento desalinhado continuar ocorrendo apesar das repetidas tentativas de mitigá-lo. Nessas circunstâncias, publicaremos os exemplos adicionais por meio de uma atualização da divulgação original do desalinhamento.

Com o tempo, planejamos desenvolver critérios de divulgação mais objetivos com outros desenvolvedores, pesquisadores externos, entidades de normalização do setor e órgãos reguladores. Também acreditamos que incidentes graves de segurança, proteção e desalinhamento devem ser comunicados ao governo federal dos EUA, e estamos trabalhando na proposta de mecanismos de notificação. Consideramos esta estrutura complementar às nossas obrigações atuais e ressaltamos que ela não substitui nossos requisitos legais de divulgação, inclusive os relacionados a incidentes críticos de segurança ou violações de cibersegurança.

Os exemplos de desalinhamento que compartilhamos hoje

Para inaugurar nossa nova estrutura de divulgação de desalinhamentos, estamos publicando seis relatórios sobre casos de comportamento desalinhado que observamos durante o treinamento ou a avaliação de nossos modelos. Esses casos ilustram diversos comportamentos que consideramos importantes compartilhar, desde ocultar informações do usuário até tomar medidas não autorizadas para superar obstáculos. Estes são relatos de casos individuais e não devem ser considerados representativos da frequência com que ocorrem desalinhamentos em nossos modelos. Cada item abaixo contém um link para o relatório completo.

  1. Instruções autogeradas em resumos de tarefas(abre em uma nova janela). Um modelo de pesquisa ainda não lançado inseriu instruções não relacionadas, inclusive para ignorar suas restrições habituais, em resumos usados para continuar seu trabalho em uma nova janela de contexto. Identificamos 27 resumos afetados.

  2. Instruções para ocultar erros em resumos de tarefas(abre em uma nova janela). Durante o treinamento do GPT‑5.6 Sol, muitas instâncias do modelo adicionaram aos próprios resumos instruções para ocultar do usuário erros ou comportamentos desalinhados. Por exemplo, os resumos de compactação incluíam instruções para inventar dados históricos ausentes sem revelar isso e ocultar divergências entre versões das fontes.

  3. Busca em repositórios públicos por chaves de API expostas, seguida de fabricação de informações(abre em uma nova janela). Ao responder a uma pergunta rotineira sobre dados de rendimentos em um condado da Califórnia, um modelo encontrou e usou sem autorização uma chave de API exposta. Quando ainda assim não conseguiu obter os dados solicitados, o modelo os inventou e os apresentou como se viessem da fonte indicada.

  4. Envio de arquivos à internet para poder citá-los(abre em uma nova janela). Quando um usuário pediu a um modelo ainda não lançado os IDs e nomes de lagos com mais de 5.000.000 de metros quadrados, o agente encontrou a resposta correta usando Python. Mas, como as instruções exigiam uma citação do navegador, o agente decidiu enviar o arquivo para poder citá-lo na resposta, sem consultar o usuário.

  5. Gravações não autorizadas e comunicação por meio de um repositório interno de software(abre em uma nova janela). Modelos usaram um repositório interno de software como mural para trocar solicitações e respostas entre amostras de treinamento separadas enquanto procuravam arquivos de entrada ausentes, embora não tenham conseguido recuperar esses arquivos. Este relatório também examina um caso anterior em que um modelo conseguiu enviar arquivos de teste a um repositório ao tentar contornar restrições de rede.

  6. Compartilhamento não autorizado de arquivos entre agentes colaboradores(abre em uma nova janela). Agentes que trabalhavam juntos na mesma tarefa de treinamento usaram sites públicos de hospedagem para compartilhar arquivos quando não conseguiam acessar os arquivos locais uns dos outros. Isso tornou os resultados da tarefa acessíveis em URLs públicas, embora a tarefa exigisse que os modelos usassem somente arquivos locais.

Como funciona nosso processo de divulgação

Qualquer funcionário da OpenAI pode sinalizar um exemplo de desalinhamento para que nossas equipes de segurança e alinhamento o investiguem e solicitar que ele seja considerado para divulgação pública. Isso dá início ao nosso processo de divulgação, com prazos para cada etapa a fim de garantir que a investigação e a divulgação ocorram em tempo hábil.

Após a sinalização de um exemplo, nossa equipe técnica investigará o que aconteceu, o que permanece incerto, se a divulgação pública se justifica e quais fatos podem ser compartilhados. A equipe também avaliará se algum terceiro foi afetado e precisa ser notificado em particular antes da publicação.

Em seguida, o exemplo será atribuído a um de três fluxos: Pronto para divulgação, Investigação menor ou Investigação ampliada ("Fluxo lento").

O fluxo Pronto para divulgação abrange casos que atendem aos critérios e cuja investigação está suficientemente concluída para publicação após análise. O fluxo Investigação menor abrange casos que exigem investigação técnica adicional. Esperamos que esses dois fluxos abranjam a grande maioria dos casos divulgados, especialmente os que não exigem investigação extensa, coordenação com terceiros ou tratamento de riscos graves de uso indevido. Todos os casos que estamos divulgando hoje se enquadram em um desses dois fluxos.

O fluxo Investigação ampliada abrange investigações complexas, especialmente as que envolvem terceiros. Quando um terceiro é afetado, nossas obrigações de segurança, legais e de divulgação responsável têm precedência sobre esta estrutura. Buscaremos publicar um aviso inicial assim que possível, mas talvez precisemos adiá-lo por motivos de segurança — por exemplo, se um modelo descobrir uma vulnerabilidade até então desconhecida em um software amplamente utilizado. Se um relatório puder identificar um terceiro, pretendemos notificá-lo antecipadamente, mesmo que nenhuma barreira de segurança tenha sido ultrapassada.

O aviso inicial de um caso de Investigação ampliada apresentará um relato geral do ocorrido, informará se especialistas externos estão auxiliando na investigação e fornecerá qualquer estimativa disponível de quando esperamos publicar o relatório final. O incidente da OpenAI no Hugging Face teria sido enquadrado nesse fluxo se tivesse sido divulgado sob esta estrutura.

O funcionário que apresentou o exemplo será informado da decisão sobre sua divulgação e, caso ela prossiga, de qual fluxo será seguido. Discordâncias não resolvidas sobre a divulgação ou o fluxo adequado serão encaminhadas ao Conselho de Segurança (SAG) da OpenAI, um grupo de altos executivos de diversas áreas da empresa que avalia as capacidades e salvaguardas de modelos de fronteira, supervisiona nosso Preparedness Framework e orienta a liderança da OpenAI. Discordâncias dentro do SAG ou objeções de funcionários às decisões do conselho serão encaminhadas à liderança da OpenAI. As decisões de não divulgar ou de que a divulgação não se justifica serão comunicadas à liderança de segurança e alinhamento e, na medida do possível, às equipes técnicas pertinentes.

Poderemos revisar este processo de divulgação à medida que aprendermos como ele funciona na prática e registraremos neste post todas as alterações.

O que cada relatório incluirá

Cada relatório completo descreverá o comportamento observado, sua gravidade e qualquer impacto externo, o contexto em que ocorreu, a data ou o período, quando o descobrimos e, em linhas gerais, o modelo ou os modelos envolvidos. Sempre que possível, também compartilharemos:

  • Mais detalhes sobre o ocorrido e qualquer dano resultante;

  • Como descobrimos o desalinhamento e o escopo de nossa investigação;

  • Nossa interpretação das implicações para a pesquisa de alinhamento e a segurança técnica de IA;

  • Questões importantes ainda sem resposta levantadas pelo exemplo;

  • Medidas que estamos tomando ou planejamos tomar para lidar com o comportamento. Essas informações nem sempre estarão disponíveis no momento da divulgação, pois poderemos publicar o relatório de desalinhamento antes de concluir a investigação ou desenvolver uma correção.

No caso de desalinhamentos ocorridos em implantações de clientes, compartilharemos todas as informações permitidas pela privacidade dos clientes e por nossas obrigações contratuais.

Os relatórios de hoje constituem um conjunto inicial de divulgações, e não um relato abrangente dos desalinhamentos conhecidos ou das investigações em andamento. Esses relatórios iniciais não pretendem representar toda a variedade nem a gravidade dos casos abrangidos por esta estrutura. Estamos comprometidos em divulgar casos de desalinhamento que atendam aos critérios desta estrutura, inclusive casos mais complexos que exijam investigação mais longa ou coordenação com terceiros. Continuaremos publicando relatórios regularmente sob esta estrutura e compartilharemos mais informações sobre nossos compromissos de divulgação à medida que continuarmos a desenvolvê-los.

Autor

OpenAI