Prioridades e princípios para avaliações eficazes por terceiros
Os laboratórios de IA de ponta têm uma enorme responsabilidade de treinar, avaliar e implantar modelos com segurança. As avaliações realizadas por terceiros são essenciais para equilibrar essa responsabilidade, ampliar as oportunidades de contribuição para a segurança da IA, manter o mundo informado e responsabilizar os laboratórios por alegações de segurança claras e respaldadas de forma independente.
Como parte de nossos esforços para acompanhar o avanço da fronteira, a OpenAI tem o compromisso de apoiar avaliações independentes com amplo acesso às etapas de treinamento, avaliação e implantação. Esse acesso deve permitir que os avaliadores questionem nossas premissas, identifiquem riscos que talvez não tenhamos percebido e cheguem às próprias conclusões sobre a eficácia de nossas salvaguardas.
Há muito tempo trabalhamos com avaliadores externos em várias etapas do processo de desenvolvimento e implantação de modelos. Também incorporamos avaliações de terceiros às práticas de nosso Preparedness Framework e apoiamos organizações e leis que defendem um processo mais rigoroso e responsável. Ao longo dessas colaborações, oferecemos formas amplas de acesso, incluindo informações sobre nossas salvaguardas técnicas, acesso à cadeia de pensamento visível e níveis inéditos de acesso a dados confidenciais e a implantações internas para resposta a incidentes e red teaming de monitores. As prioridades e os princípios apresentados aqui se concentram em nosso trabalho com organizações independentes dos setores privado e sem fins lucrativos que realizam avaliações técnicas de segurança. Eles complementam nosso trabalho com governos em testes e avaliações, nos quais funções e responsabilidades distintas podem exigir abordagens diferentes.
Para que essas avaliações sejam eficazes, são necessários mecanismos sólidos de independência, rigor científico, práticas robustas de segurança e responsabilidades claras. Os laboratórios têm a responsabilidade de viabilizar um exame minucioso e relevante, sem deixar de proteger informações sensíveis. Laboratórios e avaliadores independentes compartilham a responsabilidade de fazer isso corretamente e devem trabalhar com padrões internacionais compartilhados para práticas de proteção e segurança. A seguir, propomos quatro áreas prioritárias para avaliações mais aprofundadas, além de princípios para um trabalho rigoroso, seguro e independente.
As avaliações realizadas por terceiros são mais úteis quando abordam questões específicas e relevantes: as evidências sustentam o caso e as alegações de segurança de um laboratório? As avaliações testam adequadamente os riscos que pretendem medir? As salvaguardas funcionam em condições realistas?
As avaliações descritas aqui devem assumir formas diferentes conforme as questões de segurança examinadas. Esperamos apoiar várias avaliações em paralelo e ao longo de períodos distintos, algumas com duração de semanas e outras de vários meses. Embora as avaliações de terceiros também possam fazer parte do trabalho anterior à implantação e orientar decisões de implantação, o trabalho descrito aqui geralmente é de longo prazo e independe de lançamentos, concentrando-se no exame aprofundado de alegações de segurança específicas ao longo do tempo.
Em nossas áreas prioritárias e princípios, fazemos referência a alegações e casos de segurança. É isto que queremos dizer com esses termos:
Alegação de segurança: uma afirmação específica sobre as capacidades, o comportamento ou as salvaguardas de um modelo ou sistema que seja relevante para sua segurança e possa ser avaliada com base em evidências. Uma alegação deve identificar os riscos e as condições que aborda, além das premissas e limitações relevantes.
Caso de segurança: um argumento estruturado, respaldado por evidências, que explica por que os riscos de um modelo ou sistema são gerenciados adequadamente para uma atividade específica, como treinamento, avaliação ou implantação. Um caso de segurança vincula as alegações de segurança individuais às evidências que as sustentam e explicita as premissas, incertezas e riscos remanescentes que podem afetar suas conclusões.
Propomos quatro áreas prioritárias para avaliações mais aprofundadas, além de princípios para um trabalho rigoroso, seguro e independente.
Avaliação independente de casos de segurança, abrangendo treinamento, avaliação e implantações internas e externas.
A avaliação de casos de segurança exige conhecimento especializado em alinhamento, métodos de controle como monitoramento, segurança cibernética, uso indevido nos domínios biológico e químico e red teaming. Os casos de segurança são compostos por alegações que abrangem treinamento, avaliações de capacidades e salvaguardas, que podem ser examinadas em conjunto ou separadamente (consulte as prioridades 2 e 3 abaixo). Provavelmente, vários avaliadores precisarão examinar diferentes partes dos casos, recorrendo a seus respectivos conhecimentos especializados. Em conjunto, suas avaliações devem responder a perguntas como:
As evidências dos casos de segurança relativos a treinamento, avaliação e implantações são fundamentadas? As condições do caso de segurança foram cumpridas durante o treinamento, a avaliação e a implantação?
Nossos casos de segurança abrangem os riscos mais urgentes identificados durante uma avaliação? As alegações de segurança sustentam o caso de segurança como um todo? Há lacunas ou áreas que precisam ser aprimoradas?
São usados métodos eficazes para identificar e reduzir, no treinamento, incentivos que possam recompensar dissimulação, reward hacking, ações destrutivas ou o contorno de restrições?
Avaliação de salvaguardas críticas em implantações internas e externas
Nosso conjunto de salvaguardas evolui continuamente para acompanhar as mudanças nas capacidades e no cenário. Nossas salvaguardas abrangem o treinamento e as implantações internas e externas. Atualmente, elas incluem salvaguardas no nível do modelo, salvaguardas de aplicação de políticas e salvaguardas de segurança, além de monitores de desalinhamento, abrangendo uma grande variedade de riscos, como perda de controle e uso indevido nos domínios cibernético, biológico e químico. Parcerias técnicas podem identificar agora os pontos fracos das salvaguardas e, ao mesmo tempo, aprimorar os métodos de avaliação e acelerar o desenvolvimento de padrões, oferecendo uma base técnica mais sólida para futuras políticas públicas acompanharem o avanço da fronteira — sobretudo nas implantações internas, em que os padrões de proteção e segurança ainda são incipientes.
As avaliações independentes devem examinar a eficácia dessas salvaguardas e onde elas podem ser insuficientes, por exemplo:
Com acesso do tipo "caixa-cinza", as salvaguardas resistem a testes adversariais (jailbreaks) e protegem suficientemente contra o aumento de capacidades em domínios de alto risco, como os domínios cibernético e biológico? Nossos testes adversariais e nosso red teaming abrangem os riscos mais importantes?
Em testes autorizados sob condições operacionais realistas, como os agentes interagem com defesas cibernéticas, como controles de acesso, ambientes isolados e sistemas de detecção e resposta? Quais defesas impedem, detectam ou contêm ações prejudiciais e em que situações elas falham?
Nossos monitores de desalinhamento apresentam alguma lacuna crítica que possa causar perda de controle ou desalinhamento grave em implantações internas ou externas? À medida que as capacidades dos modelos melhoram, qual é a confiabilidade do monitoramento da cadeia de pensamento como fonte de evidências de segurança ou alinhamento?
Há monitoramento adequado em todos os treinamentos, avaliações e implantações relevantes, implementado de modo que não possa ser facilmente desativado?
As salvaguardas implementadas são proporcionais às capacidades?
Avaliação de capacidades que abranja as categorias de risco do Preparedness Framework (riscos químicos e biológicos, segurança cibernética e autoaperfeiçoamento da IA) e avaliações de alinhamento relativas a riscos de desalinhamento
Nosso Preparedness Framework exige avaliações das principais áreas de risco de fronteira. À medida que os limites são ultrapassados e as avaliações se saturam, é importante atualizá-las continuamente e garantir a abrangência e a qualidade tanto das avaliações de capacidades nas áreas de risco do Preparedness Framework quanto das avaliações de alinhamento que buscam examinar riscos graves de desalinhamento.
Entre as questões relevantes estão:
As avaliações dos riscos do Preparedness Framework abrangem adequadamente a definição dos limites de risco do framework? Os limites dessas avaliações foram definidos corretamente?
As avaliações são atualizadas quando os modelos atingem de forma consistente as pontuações máximas? Os novos testes medem de forma significativa capacidades mais avançadas?
Nossas avaliações de alinhamento abrangem adequadamente os riscos graves de desalinhamento? Quais comportamentos ou condições importantes podem deixar de detectar?
Investigação independente de incidentes críticos de desalinhamento
Investigações independentes podem ser valiosas em diversos incidentes críticos de segurança da IA. Aqui, nosso foco é o desalinhamento de modelos, incluindo modelos que agem sem autorização ou evitam a supervisão, situações que podem revelar fragilidades nos métodos de alinhamento e nas salvaguardas mesmo sem uso indevido intencional.
Em determinadas circunstâncias, como no incidente da OpenAI no Hugging Face, pode ser útil envolver um terceiro independente para realizar investigações independentes de incidentes de desalinhamento. É essencial que os terceiros envolvidos na investigação de incidentes tenham o conhecimento necessário para conduzi-la, incluindo, quando aplicável, perícia forense cibernética, conhecimento especializado em alinhamento, análise em larga escala da cadeia de pensamento e pessoal e recursos disponíveis para realizar a investigação em tempo hábil. A resposta a incidentes pode envolver o acesso a dados internos confidenciais e a dados de terceiros. Por isso, alguns detalhes podem ser sensíveis demais para publicação ou acesso. As constatações de investigações independentes também podem contribuir para o caso de segurança de um modelo, fornecendo evidências para avaliar alegações sobre seu alinhamento e a eficácia das medidas adotadas para corrigir desalinhamentos observados anteriormente.
No contexto de incidentes de desalinhamento, priorizamos avaliações independentes sobre:
Que comportamentos do modelo ou problemas de desalinhamento ocorreram durante o incidente e quais foram os principais fatores contribuintes?
As salvaguardas e medidas corretivas reduziriam efetivamente o risco de incidentes semelhantes no futuro?
Alegações para avaliação com escopo claro e definidas de comum acordo: as avaliações devem começar por um escopo acordado entre as partes, seguido de alegações de segurança claramente definidas e registradas antes do início das atividades de avaliação. Terceiros e laboratórios devem esclarecer se essas são alegações que a empresa avaliada deseja submeter à avaliação ou alegações que o avaliador externo pretende examinar de forma independente e que o laboratório concorda em ter avaliadas. Há muitos motivos para que certas alegações fiquem fora do escopo, como a impossibilidade de terceiros acessarem dados, a falta de conhecimento especializado do avaliador ou restrições de prazo razoáveis quando a avaliação é urgente. Laboratórios e avaliadores devem estabelecer um processo para considerar riscos significativos identificados fora do escopo original, inclusive para decidir se é necessária uma investigação adicional. As conclusões devem deixar claro o que foi e o que não foi avaliado em relação ao escopo definido de comum acordo.
Acesso proporcional: sempre que possível, os avaliadores devem ter acesso proporcional para examinar as alegações acordadas, respeitando as restrições jurídicas, de segurança e de propriedade intelectual. Quando o acesso direto for inviável ou impossível, os avaliadores podem trabalhar com um representante designado da empresa ou explorar mecanismos de acesso indireto ou que preservem a privacidade para proteger as informações subjacentes.
Metodologia e padrões transparentes: os avaliadores devem explicar seus métodos, critérios de avaliação e incertezas, recorrendo a padrões estabelecidos quando disponíveis. Quando ainda não houver padrões, eles devem justificar claramente os critérios utilizados. Os relatórios devem distinguir constatações diretas de interpretações, explicar as incertezas e deixar claro quais conclusões são respaldadas pelas evidências.
Conhecimento especializado e independência: os avaliadores devem demonstrar conhecimento técnico relevante e identificar, divulgar e tratar conflitos de interesse organizacionais e individuais, incluindo incentivos financeiros, relações com desenvolvedores e participação anterior no trabalho avaliado. As salvaguardas devem ser concebidas para impedir que pressões comerciais e acordos de remuneração influenciem as constatações e podem incluir o afastamento do avaliador ou períodos adequados de impedimento.
Segurança e confidencialidade: os avaliadores devem demonstrar práticas de segurança da informação e proteções de confidencialidade juridicamente exigíveis que abranjam sua equipe e sejam proporcionais à sensibilidade dos sistemas e das informações acessadas. Essas proteções devem abranger a propriedade intelectual, as informações confidenciais e os registros das avaliações. Quando os avaliadores não puderem atender aos requisitos de segurança em seus próprios ambientes, ou quando os dados acessados forem especialmente confidenciais, pode ser adequado conceder acesso em dispositivos ou instalações administrados pela empresa.
Constatações práticas e prazo para correção: as avaliações devem identificar lacunas específicas e fornecer detalhes suficientes para que os laboratórios possam corrigi-las. Quando apropriado, os laboratórios devem dispor de um prazo razoável para corrigir os problemas antes da publicação. Quando relevante, os relatórios também devem explicar as lições para desenvolvedores, responsáveis pela implantação e defensores de agentes, com recomendações práticas de implementação.
Práticas responsáveis de publicação: os relatórios de avaliação devem se basear em evidências e ser compartilhados da forma mais aberta possível, sem deixar de proteger informações sensíveis e confidenciais. Quando a divulgação pública integral não for possível, o envio de relatórios confidenciais aos órgãos de supervisão apropriados, como órgãos de governança ou conselhos de administração, pode promover a prestação de contas. Devem existir políticas e proteções criteriosas para supressão de informações, além de expectativas claras sobre comentários e correções de imprecisões, a fim de preservar o equilíbrio entre independência e confidencialidade. Os avaliadores devem manter a independência editorial e, ao mesmo tempo, assegurar as proteções de confidencialidade e propriedade intelectual. Os avaliadores devem adotar políticas claras que permitam aos laboratórios solicitar a supressão de informações sensíveis, mas que também permitam indicar onde houve supressões substanciais e qual foi o impacto delas no relatório de avaliação.
Temos o compromisso de apoiar avaliadores independentes e estabelecer padrões internacionais compartilhados e mais claros — tanto por meio de futuras leis quanto de instituições privadas de governança — para avaliações eficazes realizadas por terceiros. Embora o ecossistema de avaliação independente ainda esteja crescendo, ajudaremos a desenvolvê-lo apoiando e trabalhando com uma comunidade diversificada de avaliadores independentes que tenham profundo conhecimento sobre questões de segurança de fronteira. Nenhum terceiro pode ou deve abranger sozinho e de forma completa as questões urgentes de segurança de fronteira. Avançaremos de forma deliberada e intencional para ampliar nossa capacidade e permitir que o crescente ecossistema de terceiros se alinhe às melhores práticas e aos melhores princípios. Estamos conversando com vários terceiros sobre propostas alinhadas às áreas prioritárias acima.


