Saltar para o conteúdo principal
OpenAI

22 de setembro de 2026

Segurança

Prioridades e princípios para avaliações eficazes por terceiros

A carregar…

Os laboratórios de IA de fronteira têm uma enorme responsabilidade na formação, avaliação e implementação segura de modelos. As avaliações por terceiros são essenciais para equilibrar essa responsabilidade, ampliar as oportunidades de contributo para a segurança da IA, manter o mundo informado e responsabilizar os laboratórios com base em alegações de segurança claras e sustentadas de forma independente.

No âmbito dos nossos esforços para acompanhar o avanço da fronteira, a OpenAI está empenhada em apoiar avaliações independentes com amplo acesso às fases de formação, avaliação e implementação. Esse acesso deve permitir aos avaliadores questionar os nossos pressupostos, identificar riscos que nos possam ter escapado e chegar às suas próprias conclusões sobre a eficácia das nossas salvaguardas.

Há muito que colaboramos com avaliadores externos em várias fases do processo de desenvolvimento e implementação dos modelos. Também integrámos avaliações por terceiros nas práticas do nosso Preparedness Framework e apoiámos organizações e legislação que defendem um processo mais rigoroso e responsável. Ao longo destas colaborações, proporcionámos um acesso aprofundado, incluindo informação sobre as nossas salvaguardas técnicas, acesso à cadeia de pensamento visível e níveis sem precedentes de acesso confidencial a dados e a implementações internas, para resposta a incidentes e red teaming de monitorização. As prioridades e os princípios aqui apresentados centram-se na nossa colaboração com organizações independentes dos setores privado e sem fins lucrativos em avaliações técnicas de segurança. Complementam o nosso trabalho com governos em matéria de testes e avaliação, no qual funções e responsabilidades distintas podem exigir abordagens diferentes.

Para serem eficazes, estas avaliações exigem mecanismos sólidos de independência, rigor científico, práticas de segurança robustas e responsabilidades claras. Os laboratórios têm a responsabilidade de permitir um escrutínio significativo, protegendo simultaneamente a informação sensível. Os laboratórios e os avaliadores independentes partilham a responsabilidade de assegurar que o processo é bem executado e devem trabalhar com normas internacionais comuns para práticas de proteção e segurança. Apresentamos abaixo quatro áreas prioritárias para uma avaliação mais aprofundada, acompanhadas de princípios para um trabalho rigoroso, seguro e independente.

Áreas prioritárias de avaliação

As avaliações por terceiros são mais úteis quando abordam questões específicas e importantes: as provas sustentam a justificação e as alegações de segurança de um laboratório? As avaliações testam adequadamente os riscos que se destinam a medir? As salvaguardas funcionam em condições realistas?

As avaliações aqui descritas destinam-se a assumir formas diferentes consoante as questões de segurança analisadas. Prevemos apoiar várias avaliações em paralelo e durante períodos distintos, algumas com uma duração de semanas e outras de vários meses. Embora as avaliações por terceiros também possam integrar o trabalho anterior à implementação e influenciar decisões de implementação, o trabalho aqui descrito é, em geral, de mais longo prazo e independente de qualquer lançamento, centrando-se na análise aprofundada de alegações de segurança específicas ao longo do tempo.

Nas nossas áreas prioritárias e princípios, fazemos referência a alegações e justificações de segurança. Entendemos estes termos da seguinte forma:

Alegação de segurança: uma afirmação específica sobre as capacidades, o comportamento ou as salvaguardas de um modelo ou sistema, relevante para a sua segurança e que pode ser avaliada com base em provas. Uma alegação deve identificar os riscos e as condições que aborda, bem como os pressupostos e as limitações relevantes.

Justificação de segurança: um argumento estruturado e sustentado por provas que explica por que motivo os riscos de um modelo ou sistema são adequadamente geridos para uma atividade específica, como a formação, a avaliação ou a implementação. Uma justificação de segurança associa cada alegação de segurança às provas que a sustentam e explicita os pressupostos, as incertezas e os riscos remanescentes que podem afetar as suas conclusões.

Propomos quatro áreas prioritárias para uma avaliação mais aprofundada, acompanhadas de princípios para um trabalho rigoroso, seguro e independente.

  1. Avaliação independente de justificações de segurança, abrangendo a formação, a avaliação e as implementações interna e externa.

    A avaliação de justificações de segurança exige conhecimentos especializados em alinhamento, métodos de controlo como a monitorização, cibersegurança, utilização indevida no domínio biológico e químico e red teaming. As justificações de segurança incluem alegações relativas à formação, avaliações de capacidades e salvaguardas, que podem ser avaliadas no todo ou em partes (ver as prioridades 2 e 3 abaixo). Será provavelmente necessário que vários avaliadores analisem diferentes partes das justificações, recorrendo aos respetivos conhecimentos especializados. Em conjunto, as suas avaliações devem responder a questões como:

    1. As provas das justificações de segurança relativas à formação, avaliação e implementação estão devidamente fundamentadas? As condições da justificação de segurança foram cumpridas durante a formação, a avaliação e a implementação?

    2. As nossas justificações de segurança abrangem os riscos mais urgentes identificados durante uma avaliação? As alegações de segurança sustentam a justificação de segurança global? Existem lacunas ou aspetos a melhorar?

    3. São utilizados métodos eficazes para identificar e reduzir incentivos na formação que possam recompensar o engano, o reward hacking, ações destrutivas ou a evasão a restrições?

  2. Avaliação de salvaguardas críticas nas implementações internas e externas

    O nosso conjunto de salvaguardas está em constante evolução para acompanhar a evolução das capacidades e do panorama envolvente. As nossas salvaguardas abrangem a formação e as implementações interna e externa. Incluem atualmente salvaguardas ao nível do modelo, de aplicação das regras e de segurança, bem como monitores de desalinhamento, abrangendo uma grande variedade de riscos, como a perda de controlo e a utilização indevida nos domínios cibernético, biológico e químico. As parcerias técnicas podem identificar desde já fragilidades nas salvaguardas, melhorando simultaneamente os métodos de avaliação e acelerando o desenvolvimento de normas. Assim, criam uma base técnica mais sólida para futuras políticas públicas destinadas a acompanhar o avanço da fronteira, sobretudo nas implementações internas, cujas normas de proteção e segurança ainda são incipientes.

    As avaliações independentes devem analisar a eficácia destas salvaguardas e identificar as suas possíveis insuficiências, por exemplo:

    1. Com acesso de «caixa cinzenta», as salvaguardas resistem a testes adversariais (jailbreaks) e protegem suficientemente contra o aumento de capacidades em domínios de alto risco (por exemplo, cibernético e biológico)? Os nossos testes adversariais e o red teaming abrangem os riscos mais importantes?

    2. Em testes autorizados e realizados em condições operacionais realistas, como interagem os agentes com defesas cibernéticas, como controlos de acesso, ambientes isolados e sistemas de deteção e resposta? Que defesas impedem, detetam ou contêm ações nocivas e onde falham?

    3. Os nossos monitores de desalinhamento têm lacunas críticas que possam levar à perda de controlo ou a um desalinhamento grave, tanto nas implementações internas como externas? À medida que as capacidades dos modelos melhoram, quão fiável é a monitorização da cadeia de pensamento como fonte de provas de segurança ou alinhamento?

    4. Existe monitorização adequada em todas as formações, avaliações e implementações relevantes, de uma forma que não possa ser facilmente desativada?

    5. As salvaguardas implementadas são proporcionais às capacidades?

  3. Avaliação das capacidades que abranja as categorias de risco do Preparedness Framework (riscos químicos e biológicos, cibersegurança e autoaperfeiçoamento da IA) e avaliações do alinhamento relativas a riscos de desalinhamento

    O nosso Preparedness Framework exige avaliações das principais áreas de risco de fronteira. À medida que os limiares são ultrapassados e as avaliações ficam saturadas, é importante atualizar sistematicamente e assegurar a cobertura e a qualidade das avaliações de capacidades nas áreas de risco do Preparedness Framework, bem como das avaliações de alinhamento destinadas a analisar riscos de desalinhamento grave.

    Entre as questões relevantes incluem-se:

    1. As avaliações dos riscos do Preparedness Framework abrangem adequadamente a definição dos respetivos limiares de risco? Os limiares destas avaliações estão corretamente definidos?

    2. As avaliações são atualizadas quando os modelos obtêm sistematicamente as pontuações máximas e os novos testes medem de forma significativa capacidades mais avançadas?

    3. As nossas avaliações de alinhamento abrangem adequadamente os riscos de desalinhamento grave e que comportamentos ou condições importantes poderão não detetar?

  4. Investigação independente de incidentes críticos de desalinhamento

    A investigação independente pode ser valiosa numa ampla variedade de incidentes críticos de segurança da IA. Aqui, centramo-nos no desalinhamento dos modelos, incluindo modelos que atuam sem autorização ou evitam a supervisão, situações que podem revelar fragilidades nos métodos de alinhamento e nas salvaguardas mesmo sem utilização indevida intencional.

    Em determinadas circunstâncias, como no incidente da OpenAI no Hugging Face, pode ser útil recorrer a um terceiro independente para realizar investigações independentes de incidentes de desalinhamento. É essencial que os terceiros envolvidos na investigação de incidentes disponham dos conhecimentos necessários, incluindo, quando aplicável, competências em perícia cibernética e alinhamento, análise em grande escala da cadeia de pensamento e pessoal e recursos suficientes para conduzir a investigação atempadamente. A resposta a incidentes pode envolver o acesso a dados internos sensíveis e a dados de terceiros, pelo que alguns detalhes poderão ser demasiado sensíveis para publicação ou acesso. As conclusões de investigações independentes também podem contribuir para a justificação de segurança de um modelo, fornecendo provas para avaliar alegações sobre o seu alinhamento e a eficácia das medidas tomadas para corrigir desalinhamentos anteriormente observados.

    No contexto de incidentes de desalinhamento, damos prioridade a avaliações independentes sobre:

    1. Que comportamentos do modelo ou problemas de desalinhamento ocorreram durante o incidente e quais foram os principais fatores que contribuíram para tal?

    2. As salvaguardas e medidas corretivas reduziriam eficazmente o risco de incidentes semelhantes no futuro?

Princípios para avaliações eficazes

  • Alegações para avaliação com um âmbito claro e acordadas por todas as partes: as avaliações devem começar por um âmbito acordado por todas as partes, seguido de alegações de segurança claramente definidas e pré-registadas antes do início das atividades de avaliação. Os terceiros e os laboratórios devem esclarecer se se trata de alegações que a empresa avaliada pretende submeter a avaliação ou de alegações que o avaliador externo pretende avaliar de forma independente e perante as quais o laboratório aceita ser avaliado. Há vários motivos para excluir certas alegações do âmbito, incluindo a impossibilidade de terceiros acederem aos dados, a falta de conhecimentos especializados do avaliador ou limitações de tempo razoáveis quando a avaliação é urgente. Os laboratórios e os avaliadores devem criar um processo para analisar riscos significativos identificados fora do âmbito original, incluindo determinar se justificam uma investigação adicional. As conclusões devem indicar claramente o que foi e não foi avaliado face ao âmbito acordado por todas as partes.

  • Acesso proporcional: sempre que possível, os avaliadores devem dispor de acesso proporcional para avaliar as alegações acordadas, dentro dos limites impostos por restrições jurídicas, de segurança e de propriedade intelectual. Quando o acesso direto for impraticável ou impossível, os avaliadores podem colaborar com um representante designado da empresa ou explorar mecanismos de acesso indireto ou que preservem a privacidade, de modo a proteger a informação subjacente.

  • Metodologia e normas transparentes: os avaliadores devem explicar os seus métodos, critérios de avaliação e incertezas, recorrendo a normas estabelecidas quando existam. Quando ainda não existirem normas, devem justificar claramente os critérios utilizados. Os relatórios devem distinguir as constatações diretas da interpretação, explicar a incerteza e indicar claramente que conclusões são sustentadas pelas provas.

  • Conhecimentos especializados e independência: os avaliadores devem demonstrar conhecimentos técnicos relevantes e identificar, divulgar e resolver conflitos de interesses organizacionais e individuais, incluindo incentivos financeiros, relações com os programadores e participação anterior no trabalho avaliado. As salvaguardas devem ser concebidas para impedir que pressões comerciais e acordos de remuneração influenciem as conclusões, podendo incluir o impedimento de participação ou períodos adequados de exclusão.

  • Segurança e confidencialidade: os avaliadores devem demonstrar práticas de segurança da informação e garantias de confidencialidade juridicamente vinculativas que abranjam o seu pessoal e sejam proporcionais à sensibilidade dos sistemas e da informação a que acedem. Estas garantias devem abranger a propriedade intelectual, a informação sensível e os registos da avaliação. Quando os avaliadores não puderem cumprir os requisitos de segurança nos seus próprios ambientes, ou quando os dados em causa forem particularmente sensíveis, poderá ser adequado facultar o acesso em dispositivos ou instalações geridos pela empresa.

  • Conclusões acionáveis e tempo para correção: as avaliações devem identificar lacunas específicas e fornecer detalhes suficientes para que os laboratórios as possam corrigir. Quando adequado, os laboratórios devem dispor de um prazo razoável para corrigir os problemas antes da publicação. Quando pertinente, os relatórios devem também apresentar ensinamentos para programadores, responsáveis pela implementação e defensores de agentes, com recomendações práticas para a sua aplicação.

  • Práticas de publicação responsáveis: os relatórios de avaliação devem assentar em provas e ser partilhados tão abertamente quanto possível, protegendo simultaneamente informação sensível e confidencial. Quando a divulgação pública integral não for possível, a comunicação confidencial às entidades de supervisão competentes, como órgãos de governação ou conselhos de administração, pode promover a responsabilização. Devem existir garantias e políticas de redação assentes em princípios, bem como expectativas claras quanto ao retorno de informação e à correção de inexatidões, para preservar o equilíbrio entre independência e confidencialidade. Os avaliadores devem manter a independência editorial, assegurando simultaneamente a confidencialidade e a proteção da propriedade intelectual. Os avaliadores devem adotar políticas de redação claras que permitam aos laboratórios solicitar a ocultação de informação sensível, podendo os avaliadores assinalar onde foram feitas ocultações substanciais e o respetivo impacto no relatório de avaliação.

O caminho a seguir

Estamos empenhados em apoiar avaliadores independentes e estabelecer normas internacionais partilhadas mais claras — tanto através de legislação futura como de instituições privadas de governação — para avaliações eficazes por terceiros. Embora o ecossistema de avaliação independente ainda esteja a crescer, contribuiremos para esse crescimento, apoiando e colaborando com uma comunidade diversificada de avaliadores independentes, com conhecimentos profundos sobre questões de segurança de fronteira. Nenhum terceiro pode ou deve abranger exaustivamente as questões urgentes de segurança de fronteira. Avançaremos de forma deliberada e intencional para aumentar a nossa capacidade e permitir que o crescente ecossistema de terceiros se alinhe em torno das melhores práticas e princípios. Estamos a dialogar com vários terceiros sobre propostas alinhadas com as áreas prioritárias acima indicadas.