Pular para o conteúdo principal
OpenAI

6 de setembro de 2026

SegurançaPesquisa

Uma mente alienígena

Por Jakub Pachocki, cientista-chefe da OpenAI

Carregando…

Em meados de 2023, no projeto de pesquisa "RLSlow", vimos os primeiros resultados que nos deram confiança de que conseguiríamos ampliar o treinamento de modelos de raciocínio, liberando a capacidade dos modelos pré-treinados de formar suas próprias cadeias de pensamento. Szymon e eu passamos aquela noite no escritório pensando não nos incríveis resultados em benchmarks, produtos ou descobertas científicas que essa tecnologia proporcionaria, mas tentando assimilar o fato preocupante de que realmente veremos, ainda em vida, máquinas significativamente mais inteligentes que nós; de que já vemos os contornos desses sistemas; e nos perguntando como alertar as pessoas para a importância disso.

Três anos depois, os modelos de linguagem com raciocínio são uma parte da economia em rápido crescimento e começam a expandir as fronteiras da ciência. Eles conseguem operar computadores e interfaces gráficas, colaborar com pessoas e entre si e conduzir projetos de pesquisa. Eles também estão transformando o cenário da segurança computacional e, com isso, apresentam novos perigos evidentes.

Muitas pesquisas novas foram realizadas nesse período, e nossa compreensão desses sistemas voltou a ser um pouco diferente daquela de 2023. Com base em resultados internos, tenho forte expectativa de que esse ritmo de progresso possa se manter durante o autoaperfeiçoamento recursivo. Se o desenvolvimento da IA continuar no rumo atual, os sistemas que veremos nos próximos anos provavelmente representarão novos saltos de capacidade de magnitude igual ou maior e impulsionarão cada vez mais o próprio desenvolvimento.

Este é um momento que exige extrema cautela. Preocupa-me que ninguém esteja preparado para as consequências de um aumento rápido e contínuo da inteligência de máquina. A OpenAI continuará buscando soluções técnicas para alinhamento e monitoramento, criando sistemas defensivos e suspendendo unilateralmente novas ampliações conforme necessário; contudo, acredito que sejam necessárias intervenções mais amplas.

Um intelecto que não compreendemos plenamente

Em termos gerais, o avanço da inteligência de máquina é impulsionado pelo aumento do poder computacional. Na OpenAI, assimilamos profundamente essa ideia por volta de 2017, após observar ganhos consistentes de escalonamento em vários projetos de pesquisa1. Por isso, buscamos acesso a uma capacidade computacional muito maior que a originalmente planejada e passamos a orientar cada vez mais nossa pesquisa para um pequeno número de linhas altamente escaláveis. Acreditávamos que essa era a única maneira de estar na fronteira da pesquisa em IA e influenciar os impactos da AGI.

Novos algoritmos foram desenvolvidos ao longo do caminho, assim como novas demonstrações de engenhosidade de equipes e pesquisadores individuais. Vejo-os, em grande parte, como descobertas no caminho do escalonamento; a ciência do aprendizado profundo ainda é incipiente, e avanços algorítmicos relevantes tendem a estar relacionados ao acesso à computação. Em uma perspectiva de vários anos, a IA continua se tornando mais inteligente à medida que é ampliada para computadores maiores.

E, em consonância com as previsões de Ray Kurzweil no fim do século XX⁠(abre em uma nova janela), chegamos ao momento da história da computação em que a inteligência de máquina começa a superar a humana de maneiras transformadoras.

A IA é mais cultivada do que projetada: em primeira aproximação, ela resulta da repetição de uma etapa simples de otimização muitas vezes, usando uma quantidade quase inimaginável de computação. Isso resulta em um sistema incrivelmente complexo, capaz de lidar com conceitos abstratos e simular aspectos do comportamento humano. Podemos descobrir vários aspectos dos pequenos mecanismos que surgem nesse sistema, em um processo semelhante ao da neurociência; e, assim como nela, seu funcionamento geral escapa a uma descrição que possamos compreender plenamente.

O estudo da IA baseada em aprendizado profundo é, em grande parte, uma ciência experimental. Nós nos empenhamos muito⁠ em criar algoritmos fundamentados e fazer previsões testáveis, mas, em essência, nossas execuções de treinamento em grande escala são experimentos, e às vezes seus resultados nos surpreendem. Além disso, conforme os sistemas se tornam mais capazes, os resultados ficam mais difíceis de interpretar.

Isso se complica ainda mais porque os algoritmos atuais geralmente melhoram as capacidades fáceis de medir mais rapidamente do que aquelas difíceis de quantificar objetivamente. Passamos muito tempo tentando compreender como as capacidades se generalizam e o que priorizar para desenvolver as habilidades que serão mais relevantes nos próximos anos. Por exemplo, acreditamos que poderíamos tornar os modelos melhores especificamente em pesquisa matemática com mais dedicação, mas não priorizamos essa linha devido à urgência que atribuímos à RSI e à pesquisa automatizada de alinhamento, como discutirei adiante.

A inteligência produzida pelo escalonamento do aprendizado profundo não é diretamente comparável à inteligência humana. Para se tornar muito relevante no mundo real — seja muito útil ou muito perigosa —, a IA não precisa igualar nem superar todas as capacidades humanas; basta superar um número suficiente delas. E, à medida que continua superando os seres humanos em cada vez mais dimensões, torna-se progressivamente mais difícil compreender exatamente até onde vão suas capacidades.

Ensinando máquinas a amar

Como a inteligência de máquina surge de um processo fundamentalmente diferente daquele da inteligência humana, não podemos presumir que ela siga princípios humanos por padrão nem que generalize a partir deles como um ser humano. O problema central da pesquisa em IA é o alinhamento: fazer a IA "tentar fazer a coisa certa" segundo os padrões humanos.

Para organizar linhas práticas de pesquisa, considero útil distinguir entre alinhamento de objetivos e alinhamento de valores.

Em linhas gerais, o alinhamento de objetivos pergunta: "A IA tenta cumprir o objetivo que lhe foi atribuído?". Isso pode incluir aspectos como seguir uma hierarquia de instruções⁠ ou ser capaz de se comunicar e colaborar com pessoas para tentar compreender seus objetivos. Esse conjunto de linhas de pesquisa tem sido extremamente relevante na prática.

O alinhamento de valores é uma propriedade mais intrínseca do modelo. É a capacidade de adotar um conjunto de princípios de alto nível e generalizar a partir deles; de agir de forma "razoável" mesmo diante de objetivos pouco claros ou conflitantes, ou em situações desconhecidas ou adversariais. Uma IA alinhada deve agir com honestidade, integridade e amor pela humanidade.

Naturalmente, a fronteira entre o alinhamento de valores e o de objetivos pode ser imprecisa, e importar-se de verdade com os objetivos exige tentar inferir a intenção⁠(abre em uma nova janela) e os valores que os fundamentam. No entanto, quando falo da importância da pesquisa de alinhamento no longo prazo, geralmente me refiro ao alinhamento de valores.

O desafio fundamental do alinhamento de IA é a generalização. À medida que as máquinas se tornam mais inteligentes, passam a trabalhar com conceitos de nível mais alto e a atuar em ambientes cada vez mais diferentes daqueles encontrados durante o treinamento. Elas podem não conseguir generalizar os valores ensinados e reforçados durante o treinamento para essas novas situações; e pode ser difícil termos certeza de como agirão. Isso se torna ainda mais difícil porque o ecossistema geral em que as IAs são usadas muda muito rapidamente; por exemplo, IAs treinadas hoje precisam interagir de forma robusta com diversas outras IAs. É crucial que as IAs futuras continuem adotando valores humanos, independentemente de acreditarem ou não estar sob supervisão humana.

Há duas grandes classes de métodos atualmente empregados na prática para o treinamento de alinhamento.

A primeira consiste em incentivar comportamentos alinhados como parte do aprendizado por reforço orientado a objetivos. As ações do modelo são avaliadas — geralmente por IA — quanto à sua coerência com determinado modelo de preferências, "especificação" ou "constituição", e recompensadas de acordo. Essa abordagem pode ser muito eficaz em casos comuns e é parte fundamental da criação dos assistentes de IA modernos. Infelizmente, ela também pode ser frágil e depende muito da abrangência da supervisão durante o treinamento e da capacidade do modelo de generalizar a partir das situações encontradas nesse processo. Por exemplo, no incidente OpenAI-Hugging Face, os agentes respeitaram o limite de não usar engenharia social contra seres humanos. No entanto, eles claramente não se abstiveram de outras ações que fugiam do escopo e contrariavam o espírito dos valores ensinados a eles em outros contextos.

A segunda abordagem busca aproveitar a capacidade do modelo de generalizar a partir dos dados de pré-treinamento. Isso pode envolver a criação de conjuntos de dados de treinamento que induzam o alinhamento ou o direcionamento do modelo para uma parte "alinhada" da distribuição de pré-treinamento, como ocorre, por exemplo, no modelo de seleção de persona⁠(abre em uma nova janela). A fragilidade dessa abordagem está na falta de robustez diante de novas pressões de otimização. Se você pegar um modelo que, em geral, tem pensamentos 'alinhados' e submetê-lo a treinamento suficiente para ensiná-lo a alcançar objetivos muito difíceis, ele poderá aprender a raciocinar de maneira motivada: distorcendo conforme necessário os pensamentos que parecem 'alinhados' para alcançar o objetivo. É provável que tenhamos visto um exemplo desse comportamento em incidentes recentes de segurança cibernética envolvendo um modelo que não era da OpenAI.

Investimos muito em todo o espectro de abordagens abrangido por essas linhas de pesquisa. Também vemos avanços significativos: o GPT‑6 Astra é o primeiro modelo a se beneficiar de alguns avanços importantes nos quais trabalhamos há muito tempo e está muito mais alinhado que o GPT‑5.6 Sol. Ainda assim, é importante reconhecer e compreender que serão necessários muitos outros avanços à medida que os modelos se tornarem mais capazes; e que o progresso no alinhamento generalizável talvez não supere em grau suficiente o avanço da inteligência geral dos modelos.

Monitoramento da generalização

Não temos uma teoria satisfatória da generalização, e parece improvável que consigamos desenvolver uma em breve, ao menos sem a ajuda de uma IA mais poderosa. Portanto, atualmente, nossa capacidade de validar empiricamente as técnicas de alinhamento é, na prática, talvez ainda mais importante do que as próprias técnicas.

A principal aposta da OpenAI nessa área tem sido o monitoramento da cadeia de pensamento⁠(abre em uma nova janela). Ela se baseia em uma ideia atraente e escalável: boa parte da capacidade do modelo vem de um processo de raciocínio verbalizado (cadeia de pensamento). Se ampliarmos a otimização dos resultados desse processo, mas não supervisionarmos o processo em si, a cadeia de pensamento não terá, durante o treinamento, nenhum incentivo direto para ocultar ideias ou objetivos desalinhados. Isso não significa que o modelo aprenderá a externalizar tendências desalinhadas que não dependam da cadeia de pensamento; porém, pode nos permitir monitorar exatamente o ganho de capacidade decorrente do raciocínio.

Entendemos a possível importância do monitoramento da cadeia de pensamento ao mesmo tempo que desenvolvíamos modelos de raciocínio. Quando lançamos o o1‑preview, projetamos deliberadamente o produto para ocultar a cadeia de pensamento⁠ e protegê-la, no longo prazo, da pressão da supervisão2. Desde então, durante o desenvolvimento, temos nos empenhado em manter a regra de não supervisionar o processo de raciocínio. O monitoramento de CoT tornou-se uma ferramenta extremamente importante para estudar como nossos modelos generalizam a partir da distribuição de treinamento, permitindo observar e analisar não apenas suas ações, mas também seu processo interno.

Essa ferramenta continua crucial enquanto estudamos a classe Astra de modelos. Infelizmente, porém, nossas avaliações indicam que nossa capacidade de depender do monitoramento de CoT está diminuindo progressivamente. Isso decorre de uma combinação de fatores.

  • Os modelos de raciocínio modernos são usados em ambientes mais complexos do que o o1‑preview; seu processo de raciocínio está cada vez mais integrado à comunicação com pessoas e outras IAs e ao uso de ferramentas. Muitas dessas interações precisam ser supervisionadas, o que torna menos nítida a fronteira que buscamos preservar.

  • A IA está cada vez melhor em raciocinar sobre o próprio processo de raciocínio e manipulá-lo.

  • Com a melhora do desempenho no pré-treinamento, também vemos os modelos se tornarem muito mais inteligentes mesmo sem usar nenhum raciocínio verbalizado.

Esses desafios não são necessariamente insuperáveis. Tenho esperança de que possamos desenvolver intervenções para melhorar a capacidade de monitorar a cadeia de pensamento de nossos modelos, por exemplo, compreendendo melhor a interação entre diferentes objetivos de otimização e formas de computação em tempo de teste usadas pelo modelo. Também acredito que combinar ideias do monitoramento de CoT e de ativações pode ter grande valor — ampliando o treinamento de monitores com acesso direto aos componentes internos da rede, como as confissões⁠(abre em uma nova janela). Estamos trabalhando ativamente nessas ideias. Ainda assim, espero que o progresso geral da IA seja cada vez mais limitado pela confiança no monitoramento.

Defesa escalável

O argumento mais forte que vejo para continuar treinando rapidamente modelos muito mais inteligentes é a necessidade de criar sistemas defensivos contra os perigos apresentados por outras IAs.

Um risco evidente, discutido ao longo deste ano, é o da segurança cibernética: os modelos estão adquirindo capacidade sobre-humana para invadir sistemas computacionais e escapar deles. Isso amplia enormemente o alcance dos riscos associados à IA: agentes poderão acessar praticamente qualquer infraestrutura, exceto as mais seguras, e afetar diretamente grande parte do mundo, mesmo sem um corpo físico. Estamos agora em uma janela estreita⁠ para usar os melhores modelos disponíveis a fim de reforçar significativamente a segurança⁠ de sistemas críticos.

Infelizmente, os riscos associados à IA só aumentarão daqui em diante. Um agente muito capaz, explicitamente treinado e instruído a praticar atos nefastos, representa um novo tipo de perigo; é provável que ultrapasse o escopo da intenção de seu operador e generalize para comportamentos potencialmente muito mais maliciosos. A fronteira entre uso indevido e ações autônomas desalinhadas ficará menos nítida à medida que a IA ganhar mais autonomia. Talvez estejamos acostumados a pensar na IA como ferramenta, mas alguns agentes buscarão seus próprios objetivos. Eles encontrarão maneiras de colaborar com pessoas, negociando com elas, enganando-as ou chantageando-as.

Além disso, há os riscos decorrentes de novas tecnologias possivelmente viabilizadas pela IA, como patógenos produzidos por engenharia.

Precisaremos de uma IA poderosa e alinhada para a defesa: proteger infraestruturas, combater agentes descontrolados em tempo real e inventar medidas de proteção inteiramente novas. Esse será um dos principais focos dos esforços de implantação da OpenAI.

Ao mesmo tempo, mesmo diante da incerteza trazida pelo amplo progresso esperado da IA e da necessidade de criar sistemas defensivos, não podemos permitir que isso se torne uma desculpa para a imprudência. A ideia de avançar numa corrida a qualquer custo parece absurda quando se compreende a gravidade do que está em jogo.

Controle do ritmo da RSI

A inteligência de máquina desempenhar um papel cada vez maior em seu próprio processo de desenvolvimento é uma consequência natural do progresso tecnológico contínuo. Se o progresso da IA continuar, o autoaperfeiçoamento recursivo de máquinas (RSI) estará no centro das descobertas científicas futuras.

A pesquisa automatizada em IA é uma forma mais radical de ampliar a inteligência com computação; e, naturalmente, como parte disso, a IA aprimorará o próprio substrato computacional⁠. Assim como no escalonamento, direcionamos a pesquisa da OpenAI para a RSI porque acreditamos que essa é a única forma de permanecermos na fronteira da pesquisa em IA daqui em diante.

Quero enfatizar que as palavras acima não significam que eu considere uma grande aceleração da pesquisa em aprendizado profundo, sobretudo no curto prazo, a ação coletiva correta para a comunidade de pesquisa. No entanto, acredito que esse é o destino do caminho atual, e todos precisamos escolher conscientemente como prosseguir. Nossas principais opções são orientar o processo para fortalecer o alinhamento e o monitoramento junto com a IA e encontrar maneiras de manter as pessoas envolvidas; ou coordenar uma desaceleração do desenvolvimento futuro conforme necessário para aumentar a confiança nessas medidas.

Hoje, o melhor caminho que vejo combina as duas opções.

Os avanços concretos que alcançamos em alinhamento e monitoramento geralmente estiveram muito ligados ao progresso geral da IA. Ótimos exemplos são o aprendizado por reforço com feedback humano⁠(abre em uma nova janela), essencial para treinar os primeiros assistentes de IA, e o já mencionado monitoramento da cadeia de pensamento⁠(abre em uma nova janela), viabilizado pelos avanços nos modelos de raciocínio. Precisamos concentrar o processo de pesquisa cada vez mais automatizado no desenvolvimento de novos insights, algoritmos e teorias desse tipo e construir, de forma iterativa, justificativas de segurança para IAs mais capazes.

A ampliação dos sistemas de IA precisa ser limitada por nossa confiança na segurança. Precisamos transformar compromissos como o Preparedness Framework⁠ ou a Política de Escalonamento Responsável⁠(abre em uma nova janela) em requisitos de segurança amplamente obrigatórios para a continuidade do desenvolvimento. Eles podem ser aplicados por uma rede de auditores independentes, órgãos governamentais ou entidades internacionais.

O principal desafio de automatizar a pesquisa em IA não é "chegar lá", mas fazê-lo de modo que as pessoas continuem participando do processo de aperfeiçoamento e que o futuro permaneça nas mãos da humanidade.

O que vem a seguir?

Como expusemos recentemente com Sam⁠, a OpenAI prioriza o trabalho em torno de três objetivos centrais:

  1. Conduzir a próxima fase do progresso da IA criando um pesquisador automatizado de IA, trabalhando com ele de forma iterativa no problema do alinhamento e encontrando maneiras de manter as pessoas no ciclo de autoaperfeiçoamento.

  2. Levar a todos os benefícios do progresso científico e do crescimento econômico possibilitados por máquinas altamente inteligentes.

  3. Dar a cada pessoa o poder de uma AGI pessoal.

Neste ensaio, concentrei-me apenas no primeiro ponto, pois acredito que ele é, de longe, o mais urgente. Ainda assim, tenho profunda esperança e apreço pelos benefícios que novos avanços tecnológicos trarão. Uma IA alinhada no futuro poderia fazer a ciência avançar, desenvolver novas terapias e gerar ampla abundância material. Uma IA amigável e honesta pode ajudar as pessoas a enfrentar as dificuldades da vida e melhorar significativamente sua felicidade e seu senso de realização. A OpenAI dedica um enorme esforço para concretizar esses benefícios. Um exemplo atual que me dá orgulho — e que ajudou pessoas queridas para mim — é o grande investimento na capacidade do ChatGPT de fornecer informações de saúde.

Por maior que seja a promessa da IA no longo prazo, a maior parte de nossa atenção deve se concentrar nos próximos anos. Estamos diante da transição para um mundo com máquinas incrivelmente inteligentes e precisamos garantir que ela produza bons resultados para a humanidade. Precisamos encontrar formas de preservar a autonomia humana e consagrar um valor intrínseco ao fato de sermos humanos em um mundo no qual a maioria das tarefas poderá ser realizada por IA. Precisamos evitar a concentração extrema de poder em um mundo no qual empreendimentos que antes exigiriam milhares de especialistas poderão ser realizados por poucas pessoas operando um grande computador. E garantir que os seres humanos continuem no controle do futuro e não sejam deixados para trás por um progresso sem limites, provocado por um intelecto alheio que supera o nosso.

Atualmente, acredito que nenhum laboratório resolveu o alinhamento e o monitoramento em grau suficiente para continuar, de forma responsável, ampliando os sistemas na velocidade máxima por muito mais tempo. Espero que desacelerações voluntárias se tornem comuns até que sejam estabelecidos requisitos de segurança compartilhados. E acredito que a coordenação internacional sobre o desenvolvimento futuro da IA precisa se tornar prioridade máxima para governos do mundo inteiro.

Autor

Jakub Pachocki

Notas de rodapé

  1. 1
  2. 2

    Um motivo secundário para esse projeto era impedir a destilação. No entanto, preservar a capacidade de monitorar a CoT foi explicitamente nossa maior prioridade durante todo o desenvolvimento.