Em meados de 2023, no âmbito do projeto de investigação «RLSlow», vimos os primeiros resultados que nos deram confiança de que conseguiríamos aumentar a escala do treino dos modelos de raciocínio, permitindo aos modelos pré-treinados formar as suas próprias cadeias de pensamento. O Szymon e eu passámos essa noite no escritório, não a pensar nos incríveis resultados de referência, produtos ou descobertas científicas que esta tecnologia proporcionaria, mas a tentar assimilar o facto inquietante de que, durante as nossas vidas, veremos máquinas significativamente mais inteligentes do que nós próprios e de que já conseguimos vislumbrar a forma destes sistemas; perguntávamo-nos como alertar as pessoas para a importância disto.
Três anos depois, os modelos de linguagem com raciocínio são uma parte da economia em rápido crescimento e começam a alargar as fronteiras da ciência. Conseguem operar computadores e interfaces gráficas, colaborar com pessoas e entre si, e realizar projetos de investigação. Estão também a transformar o panorama da segurança informática e, nesse processo, criam novos perigos evidentes.
Durante este período, realizou-se muita investigação nova, e a nossa compreensão destes sistemas voltou a ser um pouco diferente da que tínhamos em 2023. Com base nos resultados internos, tenho fortes expetativas de que este ritmo de progresso possa manter-se até ao autoaperfeiçoamento recursivo. Se o desenvolvimento da IA prosseguir no rumo atual, é provável que os sistemas dos próximos anos representem novos saltos de capacidade de magnitude igual ou superior e impulsionem cada vez mais o seu próprio desenvolvimento.
Este é um momento que exige extrema cautela. Preocupa-me que ninguém esteja preparado para as consequências de um aumento rápido e contínuo da inteligência das máquinas. A OpenAI continuará a procurar soluções técnicas para o alinhamento e a monitorização, a criar sistemas defensivos e a suspender unilateralmente novos aumentos de escala quando necessário; contudo, creio que são necessárias intervenções mais abrangentes.
Em termos gerais, o progresso da inteligência das máquinas é impulsionado pelo aumento da capacidade computacional. Na OpenAI, interiorizámos profundamente esta realidade por volta de 2017, depois de observarmos benefícios consistentes do aumento de escala em vários projetos de investigação1. Consequentemente, procurámos obter acesso a muito mais capacidade computacional do que planeáramos inicialmente e orientámos cada vez mais a investigação para um pequeno número de linhas altamente escaláveis. Acreditávamos que essa era a única forma de permanecermos na fronteira da investigação em IA e influenciarmos os efeitos da AGI.
Ao longo do percurso, foram desenvolvidos novos algoritmos e surgiram novos feitos de engenho de equipas e investigadores individuais. Vejo-os, em grande medida, como descobertas feitas ao longo do caminho do aumento de escala; a ciência da aprendizagem profunda ainda está numa fase inicial, e os progressos algorítmicos significativos tendem a estar associados ao acesso a capacidade computacional. Se adotarmos uma perspetiva de vários anos, vemos que a IA continua a tornar-se mais inteligente à medida que aumenta de escala para computadores maiores.
E, em consonância com as previsões de Ray Kurzweil do final do século XX(abre numa nova janela), encontramo-nos agora no momento da história da computação em que a inteligência das máquinas começa a superar a humana de formas transformadoras.
A IA é mais cultivada do que concebida: é, em primeira instância, o produto da repetição de uma etapa simples de otimização muitas vezes, recorrendo a uma quantidade de computação difícil de imaginar. Daí resulta um sistema incrivelmente complexo, capaz de trabalhar com conceitos abstratos e simular facetas do comportamento humano. Podemos descobrir vários aspetos dos pequenos mecanismos que emergem neste sistema, num processo semelhante ao da neurociência; e, tal como acontece na neurociência, o seu funcionamento global escapa a uma descrição que consigamos compreender plenamente.
O estudo da IA baseada em aprendizagem profunda é, em grande medida, uma ciência experimental. Investimos muito esforço na criação de algoritmos fundamentados e na elaboração de previsões testáveis, mas, no essencial, os nossos treinos em larga escala são experiências, e os seus resultados por vezes surpreendem-nos. Além disso, à medida que os sistemas ganham capacidades, os resultados tornam-se mais difíceis de interpretar.
A situação complica-se porque os algoritmos atuais tendem a melhorar mais depressa as capacidades fáceis de medir do que aquelas que são difíceis de quantificar objetivamente. Dedicamos muito tempo a tentar compreender como as capacidades generalizam e o que priorizar para desenvolver as competências que serão mais relevantes nos próximos anos. Por exemplo, acreditamos que, com mais atenção, poderíamos melhorar os modelos especificamente na investigação matemática, mas não damos prioridade a esta linha devido à urgência que atribuímos ao RSI e à investigação automatizada sobre alinhamento, como explicarei adiante.
A inteligência produzida pelo aumento de escala da aprendizagem profunda não é diretamente comparável à inteligência humana. Para ter grande relevância no mundo real — sendo muito útil ou muito perigosa —, a IA não precisa de igualar ou superar todas as capacidades humanas; basta superar um número suficiente delas. E, à medida que continua a superar os seres humanos em cada vez mais dimensões, torna-se progressivamente mais difícil compreender exatamente até onde chegam as suas capacidades.
Como a inteligência das máquinas resulta de um processo fundamentalmente diferente do da inteligência humana, não podemos presumir que, por defeito, segue princípios humanos ou que generaliza a partir deles como um ser humano. O principal problema da investigação em IA é o alinhamento: fazer com que a IA «tente fazer o que está certo» segundo os padrões humanos.
Para organizar as linhas de investigação prática, considero útil distinguir entre alinhamento de objetivos e alinhamento de valores.
Em termos gerais, o alinhamento de objetivos pergunta: «A IA tenta atingir o objetivo que lhe foi definido?» Pode incluir aspetos como o cumprimento de uma hierarquia de instruções ou a capacidade de comunicar e colaborar com pessoas, procurando compreender os seus objetivos. Este conjunto de linhas de investigação tem sido extremamente relevante na prática.
O alinhamento de valores é uma propriedade mais intrínseca do modelo. É a capacidade de adotar um conjunto de princípios gerais e de generalizar a partir deles; de agir de forma «razoável», mesmo quando recebe objetivos pouco claros ou contraditórios, ou é colocado em situações desconhecidas ou adversas. Uma IA alinhada deve agir com honestidade, integridade e amor pela humanidade.
Naturalmente, a fronteira entre o alinhamento de valores e o de objetivos pode ser pouco nítida, e importar-se verdadeiramente com os objetivos exige tentar inferir a intenção(abre numa nova janela) e os valores que lhes estão subjacentes. Contudo, quando falo da importância a longo prazo da investigação sobre alinhamento, refiro-me geralmente ao alinhamento de valores.
O desafio fundamental do alinhamento da IA é a generalização. À medida que as máquinas se tornam mais inteligentes, passam a trabalhar com conceitos de nível superior e são colocadas em ambientes cada vez mais diferentes daqueles que encontraram durante o treino. Podem não conseguir generalizar os valores ensinados e reforçados durante o treino para essas novas situações, e pode ser difícil termos a certeza de como irão agir. Isto torna-se ainda mais difícil porque o ecossistema geral em que as IAs são utilizadas está a mudar muito depressa; por exemplo, as IAs treinadas hoje têm de conseguir interagir de forma robusta com várias outras IAs. Fundamentalmente, precisamos que as IAs do futuro continuem a respeitar os valores humanos, independentemente de acreditarem ou não que estão sob supervisão humana.
Existem duas grandes classes de métodos atualmente utilizados na prática para o treino de alinhamento.
A primeira consiste em incentivar comportamentos alinhados no âmbito da aprendizagem por reforço orientada para objetivos. As ações do modelo são avaliadas — geralmente por IA — quanto à sua conformidade com um determinado modelo de preferências, «especificação» ou «constituição», e recompensadas em conformidade. Esta abordagem pode ser muito eficaz no caso comum e é uma parte essencial do processo de criação dos assistentes de IA modernos. Infelizmente, também pode ser frágil e depende fortemente da abrangência da supervisão durante o treino e da capacidade do modelo de generalizar a partir das situações que encontrou nesse treino. Por exemplo, no incidente OpenAI-Hugging Face, os agentes respeitaram o limite de não recorrer à engenharia social contra seres humanos. No entanto, claramente não se abstiveram de outras ações fora do âmbito definido e contrárias ao espírito dos valores que lhes tinham sido ensinados noutros contextos.
A segunda abordagem procura tirar partido da capacidade do modelo de generalizar a partir dos dados de pré-treino. Pode envolver a criação de conjuntos de dados de treino que induzam o alinhamento ou a concentração do modelo numa parte «alinhada» da distribuição de pré-treino, como acontece, por exemplo, no modelo de seleção de personalidade(abre numa nova janela). A fragilidade desta abordagem reside na falta de robustez perante pressões de otimização adicionais. Se pegarmos num modelo que tem pensamentos geralmente «alinhados» e o submetermos a treino suficiente para aprender a atingir objetivos muito difíceis, ele pode aprender a raciocinar de forma motivada: distorcendo, conforme necessário, os pensamentos que parecem "alinhados" para atingir o objetivo. É provável que tenhamos observado um exemplo deste comportamento em incidentes recentes de cibersegurança que envolveram um modelo não pertencente à OpenAI.
Investimos fortemente em todo o leque de abordagens abrangido por estas linhas de investigação. Também observamos progressos significativos: o GPT‑6 Astra é o primeiro modelo a beneficiar de alguns avanços importantes em que trabalhamos há muito tempo e está consideravelmente mais alinhado do que o GPT‑5.6 Sol. Ainda assim, é importante reconhecer e compreender que serão necessários muitos mais progressos à medida que os modelos ganham capacidades, e que o avanço do alinhamento generalizável poderá não superar suficientemente o progresso da inteligência geral dos modelos.
Não dispomos de uma teoria satisfatória da generalização e parece improvável que consigamos desenvolver uma em breve, pelo menos sem a ajuda de uma IA mais poderosa. Por conseguinte, atualmente, a nossa capacidade de validar empiricamente as técnicas de alinhamento é, na prática, talvez ainda mais importante do que as próprias técnicas.
A principal aposta da OpenAI nesta área tem sido a monitorização da cadeia de pensamento(abre numa nova janela). Baseia-se numa ideia apelativa e escalável: grande parte da capacidade do modelo provém de um processo de raciocínio verbalizado (a cadeia de pensamento). Se aumentarmos a escala da otimização dos resultados desse processo, mas não supervisionarmos o processo em si, a cadeia de pensamento não terá qualquer incentivo direto durante o treino para ocultar ideias ou objetivos desalinhados. Isto não significa que o modelo vá aprender a exteriorizar tendências desalinhadas que não dependam da cadeia de pensamento; contudo, pode permitir-nos monitorizar precisamente o aumento de capacidade resultante do raciocínio.
Compreendemos a potencial importância da monitorização da cadeia de pensamento quando desenvolvemos os modelos de raciocínio. Quando lançámos o o1‑preview, concebemos deliberadamente o produto para ocultar a cadeia de pensamento, protegendo-a a longo prazo da pressão da supervisão2. Desde então, durante o desenvolvimento, procurámos manter a regra de não supervisionar o processo de raciocínio. A monitorização da CoT tornou-se uma ferramenta extremamente importante para estudarmos como os nossos modelos generalizam a partir da sua distribuição de treino, permitindo-nos observar e analisar não só as suas ações, mas também o seu processo interno.
Esta ferramenta continua a ser essencial enquanto estudamos a classe de modelos Astra. Infelizmente, porém, as nossas avaliações indicam que a possibilidade de confiarmos na monitorização de CoT está a diminuir progressivamente. Isto resulta de uma combinação de fatores.
Os modelos de raciocínio modernos são utilizados em ambientes mais complexos do que o o1‑preview; o seu processo de raciocínio mistura-se cada vez mais com a comunicação com pessoas e outras IAs, bem como com a utilização de ferramentas. Muitas dessas interações têm de ser supervisionadas, o que esbate a fronteira que procuramos preservar.
A IA está a tornar-se mais capaz de raciocinar sobre o seu próprio processo de raciocínio e de o manipular.
Com a melhoria do desempenho no pré-treino, também vemos os modelos tornarem-se muito mais inteligentes, mesmo sem recorrerem a qualquer raciocínio verbalizado.
Estes desafios não são necessariamente insuperáveis. Tenho esperança de que possamos desenvolver intervenções que melhorem a capacidade de monitorizar a cadeia de pensamento dos nossos modelos, por exemplo, compreendendo melhor a interação entre os diferentes objetivos de otimização e as formas de computação em tempo de teste utilizadas pelo modelo. Também acredito que pode ser muito valioso combinar ideias da monitorização de CoT e das ativações, ampliando o treino de monitores com acesso direto ao interior da rede, como as confissões(abre numa nova janela). Estamos a explorar ativamente estas ideias. Ainda assim, prevejo que o progresso geral da IA seja cada vez mais limitado pela confiança na monitorização.
O argumento mais forte que encontro para continuarmos a treinar rapidamente modelos muito mais inteligentes é a necessidade de criar sistemas defensivos contra os perigos colocados por outras IAs.
Um risco evidente, debatido ao longo deste ano, diz respeito à cibersegurança: os modelos estão a adquirir capacidades sobre-humanas para entrar e sair de sistemas informáticos. Isto amplia enormemente o alcance dos riscos associados à IA: os agentes conseguirão aceder a quase todas as infraestruturas, exceto às mais seguras, e afetar diretamente grande parte do mundo, mesmo sem um corpo físico. Estamos atualmente numa estreita janela de oportunidade para utilizar os melhores modelos disponíveis a fim de reforçar significativamente a segurança dos sistemas críticos.
Infelizmente, os riscos associados à IA continuarão a aumentar. Um agente muito capaz, explicitamente treinado e instruído para praticar atos maliciosos, representa um novo tipo de perigo; é provável que ultrapasse o âmbito da intenção do seu operador, generalizando para comportamentos potencialmente muito mais maliciosos. A fronteira entre a utilização indevida e as ações autónomas desalinhadas tornar-se-á menos nítida à medida que a IA ganhar maior autonomia. Podemos estar habituados a pensar na IA como uma ferramenta, mas alguns agentes procurarão atingir os seus próprios objetivos. Encontrarão formas de colaborar com pessoas, negociando com elas, enganando-as ou chantageando-as.
Além disso, existem os riscos decorrentes de novas tecnologias que a IA poderá viabilizar, como agentes patogénicos concebidos artificialmente.
Precisaremos de uma IA poderosa e alinhada para a defesa: proteger infraestruturas, combater agentes descontrolados em tempo real e inventar medidas de proteção inteiramente novas. Este será um dos principais focos dos esforços de implementação da OpenAI.
Ao mesmo tempo, apesar da incerteza decorrente do amplo progresso previsto para a IA e da necessidade de criar sistemas defensivos, não podemos permitir que isso sirva de pretexto para a imprudência. A ideia de avançar a qualquer custo parece absurda quando se compreende verdadeiramente a gravidade do que está em jogo.
O papel cada vez maior da inteligência das máquinas no seu próprio processo de desenvolvimento é uma consequência natural do progresso tecnológico sustentado. Se o progresso da IA continuar, o autoaperfeiçoamento recursivo das máquinas (RSI) estará no centro das futuras descobertas científicas.
A investigação automatizada em IA é uma forma mais radical de ampliar a inteligência através da computação; como parte desse processo, a IA irá, naturalmente, melhorar o próprio substrato computacional. Tal como acontece com o aumento de escala, orientamos a investigação da OpenAI para o RSI, pois acreditamos que esta é a única forma de permanecermos na fronteira da investigação em IA no futuro.
Quero sublinhar que o que afirmei acima não significa que considere que acelerar muito a investigação em aprendizagem profunda, sobretudo a curto prazo, seja a decisão coletiva certa para a comunidade científica. No entanto, creio que é este o destino do percurso atual, e todos temos de escolher conscientemente como prosseguir. As principais opções ao nosso dispor são orientar o processo para reforçar o alinhamento e a monitorização em paralelo com a IA e encontrar formas de manter as pessoas envolvidas; ou coordenarmo-nos para abrandar o desenvolvimento futuro, conforme necessário, até confiarmos nestas medidas.
Atualmente, a melhor via que vejo combina ambas as opções.
Os progressos concretos que alcançámos no alinhamento e na monitorização têm estado, em geral, profundamente ligados ao progresso da IA. Bons exemplos são a aprendizagem por reforço com feedback humano(abre numa nova janela), que foi essencial para treinar os primeiros assistentes de IA, e a já referida monitorização da cadeia de pensamento(abre numa nova janela), possibilitada pelos avanços nos modelos de raciocínio. Temos de orientar o processo de investigação cada vez mais automatizado para o desenvolvimento de novos conhecimentos, algoritmos e teorias deste tipo, construindo de forma iterativa garantias de segurança para IAs mais capazes.
O aumento de escala dos sistemas de IA tem de ser limitado pela nossa confiança na sua segurança. Temos de transformar compromissos como o Preparedness Framework ou a Política de Aumento de Escala Responsável(abre numa nova janela) em requisitos de segurança amplamente obrigatórios para a continuação do desenvolvimento. Estes requisitos podem ser aplicados por uma rede de auditores independentes, organismos governamentais ou entidades internacionais.
O principal desafio da automatização da investigação em IA não é «chegar lá», mas fazê-lo mantendo as pessoas envolvidas no processo contínuo de melhoria e deixando o futuro nas mãos da humanidade.
Como explicámos recentemente com o Sam, a OpenAI dá prioridade ao trabalho orientado por três objetivos fundamentais:
Conduzir a próxima fase do progresso da IA, criando um investigador de IA automatizado, trabalhando com ele de forma iterativa no problema do alinhamento e encontrando formas de manter as pessoas no ciclo de autoaperfeiçoamento.
Proporcionar os benefícios do progresso científico e do crescimento económico possibilitados por máquinas muito inteligentes.
Dar a cada pessoa uma AGI pessoal.
Neste ensaio, concentrei-me apenas no primeiro ponto, por considerar que é, de longe, o mais urgente. Ainda assim, tenho uma profunda esperança e apreço pelos benefícios que o futuro progresso tecnológico trará. Uma IA futura e alinhada poderá fazer avançar a ciência, desenvolver novas terapias e gerar abundância material generalizada. Uma IA afável e honesta pode ajudar as pessoas a enfrentar as dificuldades da vida e melhorar significativamente a sua felicidade e realização pessoal. A OpenAI dedica um enorme esforço à concretização destes benefícios. Um exemplo atual de que me orgulho — e que tem sido útil para as pessoas que me são próximas — é o forte investimento na capacidade do ChatGPT de fornecer informações de saúde.
Por maior que seja a promessa da IA a longo prazo, a maior parte da nossa atenção deve concentrar-se nos próximos anos. Estamos perante a transição para um mundo com máquinas incrivelmente inteligentes e temos de garantir que essa transição corre bem para a humanidade. Temos de encontrar formas de preservar a autonomia humana e consagrar o valor intrínseco de ser humano num mundo em que a IA poderá executar a maioria das tarefas. Temos de evitar uma concentração extrema de poder num mundo em que projetos que antes exigiriam milhares de especialistas poderão ser concretizados por poucas pessoas a operar um grande computador. E garantir que os seres humanos mantêm o controlo do futuro e não são deixados para trás por um progresso desenfreado, impulsionado por um intelecto alienígena superior ao nosso.
Atualmente, creio que nenhum laboratório resolveu o alinhamento e a monitorização a um nível que permita continuar responsavelmente a aumentar a escala à velocidade máxima por muito mais tempo. Prevejo e espero que os abrandamentos voluntários se tornem comuns até serem estabelecidos requisitos de segurança partilhados. E acredito que a coordenação internacional do futuro desenvolvimento da IA deve tornar-se uma prioridade máxima para os governos de todo o mundo.
Autor
Notas de rodapé
- 1
Isto incluiu ampliar a escala da autoaprendizagem por jogo(abre numa nova janela), da robótica(abre numa nova janela) e, em retrospetiva, sobretudo de redes recorrentes para modelar a linguagem(abre numa nova janela), um trabalho precursor da linha de investigação do GPT.
- 2


