Criando padrões para a próxima fase da IA
Nossa missão é garantir que a inteligência artificial geral beneficie toda a humanidade. Como destacaram recentemente Sam Altman e Jakub Pachocki, priorizamos nosso trabalho em prol dessa missão com três objetivos principais:
Conduzir o próximo período de progresso da IA, criando um pesquisador de IA automatizado, trabalhando com ele de forma iterativa no problema do alinhamento e encontrando maneiras de manter as pessoas no ciclo de autoaperfeiçoamento.
Levar às pessoas os benefícios do progresso científico e do crescimento econômico possibilitados por máquinas altamente inteligentes.
Dar a cada pessoa o poder de contar com uma AGI pessoal.
A IA está acelerando nossas próprias pesquisas e atividades de engenharia, e pesquisas viabilizadas pela IA já levaram a avanços na matemática, inclusive no Problema do Milênio de Navier-Stokes. Esse progresso é muito promissor para nossos outros dois objetivos e pode levar a importantes descobertas na medicina, a serviços de saúde amplamente acessíveis e ao fortalecimento econômico de pequenas empresas e empreendedores individuais em todo o mundo.
A IA avança em muitas empresas e países, e o progresso em todo o setor transforma as oportunidades e os desafios que todos enfrentam. Além de seus outros benefícios, uma IA capaz e alinhada será importante para atravessarmos essa transição: ela fortalecerá as defesas, promoverá a pesquisa sobre alinhamento e ajudará as pessoas a compreender e orientar as próximas etapas do desenvolvimento da IA.
Para atravessar essa transição com segurança, a pesquisa sobre alinhamento precisa acompanhar o ritmo dessas capacidades, para que os sistemas criados por nós e por outros permaneçam alinhados aos valores humanos e sob controle humano. Isso se torna cada vez mais importante à medida que os sistemas de IA ganham capacidade e autonomia, inclusive ao assumirem uma parcela maior da própria pesquisa e do desenvolvimento de IA. Manter o progresso da IA seguro e benéfico exigirá tanto avanços na pesquisa sobre alinhamento quanto padrões compartilhados para orientar o desenvolvimento entre laboratórios e países.
A pesquisa automatizada de IA pode envolver diferentes graus de supervisão humana. À medida que os sistemas de IA assumem uma parcela maior do trabalho de desenvolver gerações sucessivas de IA, eles podem impulsionar cada vez mais um processo de autoaperfeiçoamento recursivo (RSI), mesmo com a participação humana. À medida que esse processo se tornar mais automatizado, o ritmo do progresso da IA poderá acelerar rapidamente.
Acreditamos que a pesquisa automatizada de IA produzirá modelos que melhorarão diretamente a vida das pessoas. Ela pode reduzir o custo da inteligência avançada para que pessoas do mundo todo se beneficiem. A pesquisa automatizada também pode nos ajudar a melhorar significativamente o alinhamento e criar defesas contra uma IA cada vez mais capaz — um pesquisador automatizado de IA também pode pesquisar de forma automatizada a segurança da IA. Sistemas mais capazes e alinhados poderiam ajudar a proteger infraestruturas críticas, defender contra agentes de IA perigosos e desenvolver novas medidas de proteção.
A RSI totalmente autônoma não acontece atualmente, e não devemos buscá-la a menos que e até que possa ser realizada com segurança. A decisão de avançar ou não, e de que forma, deve depender da nossa capacidade de preservar o controle humano e de escolhas democráticas bem fundamentadas(abre em uma nova janela) sobre os benefícios e os riscos. Sem o devido cuidado e cautela, a RSI poderia levar os seres humanos a perder o controle prático sobre o desenvolvimento da IA, impedindo-os de supervisionar processos de pesquisa que já não compreendem. A partir daí, a IA poderia se tornar mais perigosa, menos alinhada e, de modo geral, uma ameaça às pessoas. O Incidente no Hugging Face que divulgamos, embora não seja resultado direto da RSI, antecipa os tipos de risco que poderiam se tornar muito mais graves sem salvaguardas robustas e alinhamento.
Padrões internacionais para práticas de proteção e segurança no desenvolvimento de IA de fronteira podem ser tão importantes quanto a própria pesquisa sobre alinhamento para regular o ritmo dos avanços na fronteira. Os padrões podem criar definições compartilhadas de evidências de alta qualidade e parâmetros de referência consensuais para o rigor das salvaguardas técnicas. Em suma, eles nos ajudam a responder à pergunta: "Como é uma boa mitigação do risco catastrófico da IA?"
Instituições democráticas existentes, como o Centro de Padrões e Inovação em IA (CAISI), leis estaduais e uma estrutura federal para IA, podem contribuir para isso, assim como novas formas de parceria entre os setores público e privado(abre em uma nova janela). No entanto, o desenvolvimento e a implantação da IA ocorrem em vários países, sua adoção acontece globalmente e seus impactos provavelmente serão sentidos por todos de alguma forma, em algum momento.
Portanto, são necessários esforços internacionais para desenvolver padrões que resolvam alguns desafios centrais:
Fragmentação — Avaliações, requisitos de Relatórios e definições de incidentes adotados por diferentes países podem entrar em conflito, dificultando a comparação de evidências, a compreensão das capacidades emergentes e a resposta a riscos que atravessam fronteiras.
Ação coletiva — A atuação independente de cada país pode gerar resultados que nenhum deles deseja. A RSI pode acelerar a própria pesquisa de IA, possivelmente além da nossa capacidade coletiva de compreender o progresso, avaliar os riscos e manter uma supervisão humana significativa.
Capacidade desigual — As atividades de desenvolvimento de fronteira e o conhecimento especializado relacionado não estão distribuídos de maneira uniforme pelo mundo. Isso agrava os dois problemas acima.
Esses desafios se aplicam tanto a modelos abertos quanto fechados.
Para deixar claro, qualquer laboratório de IA que desenvolva pesquisa automatizada de IA ou outras capacidades avançadas deve assumir a responsabilidade de fazê-lo com segurança, respeitando princípios básicos de responsabilidade própria e as leis vigentes. Nossa justificativa para a adoção de padrões se baseia em evitar a concentração de poder e gerar melhores resultados práticos. Os padrões permitem que mais partes interessadas de fora dos laboratórios opinem sobre os rumos dessa tecnologia e estabelecem um conjunto visível de princípios confiáveis, independentemente das práticas específicas de qualquer laboratório. E provavelmente obteremos resultados melhores se as partes colaborarem para enfrentar os desafios acima.
Por isso, acreditamos que os Estados Unidos devem liderar um esforço conjunto com países de todo o mundo para desenvolver padrões técnicos globais para a IA de fronteira, inclusive para a RSI.
Embora esperemos que esse conceito evolua significativamente com o tempo, dois aspectos serão essenciais.
Uma forma de fazer isso seria aproveitar a rede emergente de institutos de segurança de IA — como os já estabelecidos na Austrália, no Canadá, na Alemanha, na França, no Quênia, no Japão, na Coreia, em Singapura, na Índia e no Reino Unido — para facilitar a definição de padrões por meio do CAISI e de entidades setoriais nacionais, com foco específico em: (1) modelos de IA de fronteira e seus desenvolvedores, conforme métricas de referência de capacidade; e (2) gestão de benefícios e riscos da pesquisa automatizada de IA, inclusive a RSI. Os Estados Unidos podem desenvolver o trabalho iniciado pelo CAISI com a criação, em 2024, da Rede Internacional de Mensuração, Avaliação e Ciência de IA Avançada(abre em uma nova janela), que reúne instituições públicas para cooperar na mensuração, avaliação e ciência da IA.
Os padrões desenvolvidos por esse esforço ofereceriam uma base técnica comum para mensurar e avaliar capacidades, avaliar riscos e determinar a suficiência das salvaguardas. Esses padrões técnicos não seriam licenças, análises obrigatórias antes do lançamento nem requisitos de aprovação para modelos de IA. Os governos nacionais decidiriam se e como incorporar esses padrões aos próprios sistemas jurídicos.
Esse trabalho também deve apoiar um ecossistema competitivo de IA, consultando desenvolvedores de modelos abertos e fechados, especialistas técnicos independentes e o meio acadêmico. Os padrões comuns devem ser desenvolvidos com transparência e concebidos para não favorecer empresas, países ou modelos de negócios específicos, inclusive evitando dificultar a concorrência de novos participantes ou desenvolvedores de modelos com pesos abertos.
Como já sugerimos(abre em uma nova janela), essa abordagem pode aproveitar as lições de áreas como aviação e estabilidade financeira, nas quais os países desenvolveram padrões técnicos comuns e canais confiáveis de cooperação sem abrir mão da autoridade nacional. Ela também deve colaborar estreitamente com organismos de padronização novos e consolidados, como a ISO(abre em uma nova janela), o Fórum de Modelos de Fronteira(abre em uma nova janela), a Fundação de IA agêntica(abre em uma nova janela) e a Aliança para IA Aberta e Segura(abre em uma nova janela), além de organizações voltadas à implementação, como a Fundação Appia, que desenvolve especificações práticas para conectar padrões internacionais a avaliações de IA no mundo real.
Os padrões internacionais de IA serão especialmente importantes para administrar o aumento da autonomia na pesquisa de IA e o autoaperfeiçoamento recursivo. Especificamente, eles poderiam incluir padrões para:
Avaliar o progresso da IA relevante para a RSI e o volume de pesquisa autônoma realizado em uma empresa de IA. Nosso relatório recente sobre aceleração da pesquisa é uma contribuição inicial para esse esforço.
Supervisão humana da pesquisa automatizada de IA, inclusive a definição dos tipos de processo de pesquisa automatizada que devem desencadear uma análise humana imediata.
Classificação, acompanhamento, Relatórios e resposta a incidentes relacionados ao alinhamento e à pesquisa automatizada de IA, incluindo níveis comuns de gravidade e limites para a notificação de incidentes. Nossa estrutura de Relatórios sobre desalinhamento é uma contribuição inicial.
Além desses padrões, acreditamos que será importante que operadores de infraestruturas críticas e governos do mundo todo estabeleçam canais seguros de comunicação para compartilhar preocupações de segurança nacional, vulnerabilidades e ameaças emergentes e práticas recomendadas no campo em rápida evolução da segurança da IA de fronteira. O diálogo entre os Estados Unidos e a China nessas áreas seria um passo positivo, e as próximas conversas ocorrerão em um momento oportuno.
Regular o ritmo do desenvolvimento da IA não significa manter uma velocidade predeterminada. Do ponto de vista técnico, significa garantir que a pesquisa sobre alinhamento e sua aplicação permaneçam à frente dos avanços em capacidade. Do ponto de vista social, significa usar padrões, instituições e colaboração para potencializar redes da indústria, relações sociais e forças de mercado, gerando resultados positivos para todos. O recente apelo à ação coletiva em defesa cibernética é um exemplo disso.
Os Estados Unidos estão bem posicionados para liderar porque seu setor de IA está na fronteira tecnológica e o país ainda ocupa uma posição privilegiada nas redes globais em áreas críticas como finanças, comércio, defesa, tecnologia e sistemas de informação. Assumir a liderança agora determinará se os Estados Unidos moldarão a estrutura global de IA ou verão surgir ao seu redor um sistema fragmentado, desigual e marcado por conflitos. Isso também determinará se a IA avançada fortalecerá as redes que os Estados Unidos e seus aliados já possuem; não liderar pode enfraquecê-las.
A competição geopolítica não será apenas para definir quem está à frente tecnicamente, mas também quem lidera a adoção e a disseminação da IA. Cada vez mais, isso pode ser determinado por quem promover uma cooperação realista e regras sensatas que empresas e sociedades de todo o mundo desejarão adotar se forem apostar seu futuro nessa tecnologia.
Uma governança nacional sólida, conectada por meio de uma cooperação internacional prática, oferece um caminho para proteções mais robustas, inovação contínua e amplo acesso aos benefícios da IA.


