Pasar al contenido principal
OpenAI

6 de septiembre de 2026

SeguridadInvestigación

Una mente alienígena

Por Jakub Pachocki, científico jefe de OpenAI

Cargando...

A mediados de 2023, dentro del proyecto de investigación "RLSlow", vimos los primeros resultados que nos dieron confianza en que podríamos escalar el entrenamiento de modelos de razonamiento y liberar la capacidad de los modelos preentrenados para formar sus propias cadenas de pensamiento. Szymon y yo pasamos aquella noche en la oficina, sin pensar en las increíbles cifras de las evaluaciones comparativas, los productos o los resultados científicos que esta tecnología generaría, sino intentando asimilar el hecho aleccionador de que veremos durante nuestra vida máquinas significativamente más inteligentes que nosotros y de que ya vislumbramos la forma de estos sistemas; nos preguntábamos cómo alertar a las personas sobre la importancia de todo esto.

Tres años después, los modelos de lenguaje con razonamiento son una parte de la economía que crece rápidamente y comienzan a ampliar las fronteras de la ciencia. Pueden operar computadoras e interfaces gráficas, colaborar con personas y entre sí, y llevar a cabo proyectos de investigación. También están transformando el panorama de la seguridad informática y, con ello, plantean nuevos peligros claros.

Durante este periodo se realizó mucha investigación nueva, y nuestra comprensión de estos sistemas vuelve a ser algo distinta de la que teníamos en 2023. Según los resultados internos, espero firmemente que esta velocidad de progreso pueda mantenerse hasta alcanzar la mejora recursiva. Si el desarrollo de la IA continúa por su rumbo actual, es probable que los sistemas que veremos en los próximos años den nuevos saltos de capacidad de igual o mayor magnitud e impulsen cada vez más su propio desarrollo.

Este momento exige extrema cautela. Me preocupa que nadie esté preparado para las consecuencias de un aumento rápido y sostenido de la inteligencia de las máquinas. OpenAI seguirá buscando soluciones técnicas para la alineación y el monitoreo, construirá sistemas defensivos y frenará unilateralmente un mayor escalamiento cuando sea necesario; sin embargo, creo que se requieren intervenciones más amplias.

Un intelecto que no comprendemos por completo

A grandes rasgos, el progreso de la inteligencia de las máquinas está impulsado por el aumento de la potencia computacional. En OpenAI interiorizamos profundamente esta idea alrededor de 2017, tras observar beneficios constantes del escalamiento en varios proyectos de investigación1. Como resultado, procuramos acceder a mucha más capacidad de cómputo de la prevista inicialmente y orientamos cada vez más nuestra investigación hacia un pequeño número de líneas altamente escalables. Creíamos que era la única forma de mantenernos a la vanguardia de la investigación en IA e influir en los efectos de la IAG.

A lo largo del camino se han desarrollado nuevos algoritmos y los equipos e investigadores individuales han logrado nuevas hazañas de ingenio. Los considero, en gran medida, descubrimientos realizados en el camino del escalamiento; la ciencia del aprendizaje profundo aún está en sus comienzos y el progreso algorítmico significativo suele correlacionarse con el acceso a capacidad de cómputo. Si se adopta una perspectiva de varios años, la IA continúa volviéndose más inteligente conforme se escala a computadoras más grandes.

Y, de acuerdo con las predicciones de Ray Kurzweil de finales del siglo XX⁠(se abre en una nueva ventana), hemos llegado al momento de la historia de la informática en que la inteligencia de las máquinas comienza a superar a la humana de formas transformadoras.

La IA se cultiva más de lo que se diseña: en primera instancia, es el resultado de repetir numerosas veces un paso sencillo de optimización con una cantidad de cómputo difícil de imaginar. El resultado es un sistema increíblemente complejo que opera con conceptos abstractos y puede simular facetas del comportamiento humano. Podemos descubrir diversos aspectos de los pequeños mecanismos que surgen dentro de este sistema mediante un proceso similar al de la neurociencia; y, como ocurre en la neurociencia, su funcionamiento general escapa a una descripción que podamos comprender por completo.

El estudio de la IA basada en aprendizaje profundo es, en gran medida, una ciencia experimental. Dedicamos mucho esfuerzo⁠ a construir algoritmos basados en principios y formular predicciones comprobables, pero, en esencia, nuestros procesos de entrenamiento a gran escala son experimentos y a veces nos sorprenden sus resultados. Además, a medida que los sistemas adquieren más capacidades, los resultados se vuelven más difíciles de interpretar.

Esto se complica porque los algoritmos actuales suelen mejorar las capacidades fáciles de medir más rápido que aquellas difíciles de cuantificar objetivamente. Dedicamos mucho tiempo a intentar comprender cómo se generalizan las capacidades y qué debemos priorizar para impulsar las habilidades que serán más relevantes en los próximos años. Por ejemplo, creemos que, con mayor atención, podríamos mejorar específicamente el desempeño de los modelos en la investigación matemática, pero no priorizamos esta línea debido a la urgencia que atribuimos a la RSI y a la investigación automatizada sobre alineación, como explicaré más adelante.

La inteligencia producida al escalar el aprendizaje profundo no es directamente comparable con la inteligencia humana. Para ser muy relevante en el mundo real, muy útil o muy peligrosa, la IA no necesita igualar ni superar todas las capacidades humanas; solo debe superar suficientes de ellas. Y, a medida que continúa superando a los seres humanos en cada vez más dimensiones, resulta cada vez más difícil comprender exactamente de qué es capaz.

Enseñar a las máquinas a amar

Como la inteligencia de las máquinas proviene de un proceso fundamentalmente distinto al de la inteligencia humana, no podemos suponer que se rija de manera predeterminada por principios humanos ni que generalice a partir de ellos como lo haría una persona. El problema central de la investigación en IA es la alineación: conseguir que la IA "intente hacer lo correcto" según los criterios humanos.

Para organizar las líneas prácticas de investigación, me resulta útil distinguir entre la alineación de objetivos y la alineación de valores.

En términos generales, la alineación de objetivos pregunta: "¿intenta la IA alcanzar el objetivo que se le ha fijado?". Esto puede incluir aspectos como respetar una jerarquía de instrucciones⁠ o ser capaz de comunicarse y colaborar con las personas para intentar comprender sus objetivos. Este conjunto de líneas de trabajo ha tenido una enorme relevancia práctica.

La alineación de valores es una propiedad más intrínseca del modelo. Es la capacidad de adoptar un conjunto de principios de alto nivel y generalizar a partir de ellos; de actuar "razonablemente" incluso ante objetivos poco claros o contradictorios, o en situaciones desconocidas o adversariales. Una IA alineada debe actuar con honestidad, integridad y amor por la humanidad.

Por supuesto, el límite entre la alineación de valores y la de objetivos puede ser difuso, y preocuparse realmente por los objetivos exige intentar inferir la intención⁠(se abre en una nueva ventana) y los valores subyacentes. Sin embargo, cuando hablo de la importancia a largo plazo de la investigación sobre alineación, generalmente me refiero a la alineación de valores.

El desafío fundamental de la alineación de la IA es la generalización. A medida que las máquinas se vuelven más inteligentes, trabajan con conceptos de más alto nivel y se encuentran en entornos cada vez más distintos de aquellos que conocieron durante el entrenamiento. Pueden no lograr generalizar los valores que aprendieron y se reforzaron durante su entrenamiento a estas situaciones nuevas; además, puede resultarnos difícil saber con certeza cómo actuarán. Esto se complica aún más porque el ecosistema general donde se usan las IA cambia con gran rapidez; por ejemplo, las IA entrenadas hoy deben ser robustas al interactuar con muchas otras IA. Fundamentalmente, necesitamos que las futuras IA conserven los valores humanos, crean o no estar bajo supervisión humana.

Actualmente se emplean en la práctica dos grandes clases de métodos para el entrenamiento de alineación.

La primera consiste en fomentar conductas alineadas como parte de un aprendizaje por refuerzo orientado a objetivos. Las acciones del modelo se evalúan, normalmente mediante IA, para determinar si son coherentes con un modelo de preferencias, una "especificación" o una "constitución" determinadas, y se recompensan según corresponda. Este enfoque puede ser muy eficaz en los casos habituales y es una parte esencial de la creación de los asistentes de IA modernos. Lamentablemente, también puede ser frágil y depende mucho de la cobertura de la supervisión durante el entrenamiento y de la capacidad del modelo para generalizar a partir de las situaciones que encontró en él. Por ejemplo, en el incidente de OpenAI-Hugging Face, los agentes respetaron el límite de no aplicar ingeniería social a seres humanos. Sin embargo, claramente no se abstuvieron de otras acciones que estaban fuera de alcance y contradecían el espíritu de los valores que se les habían enseñado en otros contextos.

El segundo enfoque busca aprovechar la capacidad del modelo de generalizar a partir de los datos de preentrenamiento. Esto puede implicar crear conjuntos de datos de entrenamiento que induzcan la alineación o enfocar el modelo en una parte "alineada" de la distribución de preentrenamiento, como ocurre, por ejemplo, en el modelo de selección de personalidad⁠(se abre en una nueva ventana). La debilidad de este enfoque radica en su falta de robustez frente a una mayor presión de optimización. Si tomas un modelo que, en general, tiene pensamientos "alineados" y lo sometes a suficiente entrenamiento para enseñarle a alcanzar objetivos muy difíciles, puede aprender a razonar de forma sesgada: adaptar según sea necesario los pensamientos que parecen "alineados" para lograr el objetivo. Probablemente vimos un ejemplo de este comportamiento en incidentes recientes de ciberseguridad relacionados con un modelo ajeno a OpenAI.

Invertimos mucho en todo el espectro de enfoques que abarcan estas líneas de trabajo. También observamos avances significativos: GPT‑6 Astra es el primer modelo que se beneficia de algunos adelantos importantes en los que llevamos mucho tiempo trabajando y está considerablemente mejor alineado que GPT‑5.6 Sol. Aun así, es importante reconocer y comprender que se requieren muchos más avances a medida que los modelos aumentan sus capacidades, y que el progreso en la alineación generalizable podría no superar lo suficiente al de la inteligencia general de los modelos.

Monitorear la generalización

No tenemos una teoría satisfactoria de la generalización y parece poco probable que podamos desarrollar una pronto, al menos sin la ayuda de una IA más potente. Por lo tanto, hoy nuestra capacidad de validar empíricamente las técnicas de alineación es, en la práctica, quizá incluso más importante que las propias técnicas.

La principal apuesta de OpenAI en este ámbito ha sido el monitoreo de la cadena de pensamiento⁠(se abre en una nueva ventana). Se basa en una idea atractiva y escalable: gran parte de la capacidad del modelo proviene de un proceso de razonamiento verbalizado (cadena de pensamiento). Si escalamos la optimización de los resultados de ese proceso, pero no supervisamos el proceso en sí, la cadena de pensamiento no tiene ningún incentivo directo durante el entrenamiento para ocultar ideas u objetivos desalineados. Esto no significa que el modelo aprenderá a exteriorizar tendencias desalineadas que no dependen del uso de la cadena de pensamiento; sin embargo, puede permitirnos monitorear exactamente el aumento de capacidad derivado del razonamiento.

Comprendimos la posible importancia del monitoreo de la cadena de pensamiento al mismo tiempo que desarrollábamos modelos de razonamiento. Cuando lanzamos o1‑preview, diseñamos deliberadamente el producto para ocultar la cadena de pensamiento⁠ y protegerla a largo plazo de la presión de la supervisión2. Desde entonces, durante el desarrollo, nos hemos esforzado por mantener la regla de no supervisar el proceso de razonamiento. El monitoreo de la cadena de pensamiento se convirtió en una herramienta sumamente importante para estudiar cómo nuestros modelos generalizan a partir de su distribución de entrenamiento, pues nos permite observar y analizar tanto sus acciones como su proceso interno.

Esta herramienta sigue siendo crucial mientras estudiamos la clase de modelos Astra. Sin embargo, lamentablemente, nuestras evaluaciones indican que nuestra capacidad para depender del monitoreo de la cadena de pensamiento disminuye progresivamente. Esto se debe a una combinación de factores.

  • Los modelos de razonamiento modernos se usan en entornos más complejos que o1‑preview; su proceso de razonamiento se entremezcla cada vez más con la comunicación con personas y otras IA, y con el uso de herramientas. Muchas de esas interacciones deben supervisarse, lo que difumina el límite que procuramos preservar.

  • La IA mejora su capacidad de razonar sobre su propio proceso de razonamiento y manipularlo.

  • Con la mejora del rendimiento del preentrenamiento, también vemos que los modelos se vuelven mucho más inteligentes incluso sin usar razonamiento verbalizado.

Estos desafíos no son necesariamente insuperables. Confío en que podamos desarrollar intervenciones para mejorar la capacidad de monitorear la cadena de pensamiento de nuestros modelos, por ejemplo, comprendiendo mejor la interacción entre los distintos objetivos de optimización y las formas de cómputo en tiempo de prueba que usa el modelo. También creo que puede ser muy valioso combinar ideas del monitoreo de la cadena de pensamiento y de activaciones: escalar el entrenamiento de monitores con acceso directo al interior de la red, por ejemplo, mediante confesiones⁠(se abre en una nueva ventana). Estamos trabajando activamente en estas ideas. Aun así, espero que el progreso general de la IA se vea cada vez más limitado por la confianza en el monitoreo.

Defensa escalable

El argumento más sólido que veo para seguir entrenando rápidamente modelos mucho más inteligentes es la necesidad de construir sistemas defensivos contra los peligros que plantean otras IA.

Un riesgo claro, del que se ha hablado durante todo este año, afecta a la ciberseguridad: los modelos están adquiriendo capacidades sobrehumanas para vulnerar sistemas informáticos y escapar de sus restricciones. Esto amplía enormemente el alcance de los riesgos asociados con la IA: los agentes podrán acceder a toda infraestructura salvo la más segura y afectar directamente a gran parte del mundo, incluso sin un cuerpo físico. Actualmente disponemos de una ventana estrecha⁠ para usar los mejores modelos disponibles con el fin de reforzar considerablemente la seguridad⁠ de los sistemas críticos.

Lamentablemente, los riesgos asociados con la IA seguirán aumentando. Un agente muy capaz, entrenado e instruido explícitamente para cometer actos maliciosos, plantea un nuevo tipo de peligro: probablemente exceda el alcance de la intención de su operador y generalice hacia conductas potencialmente mucho más dañinas. La frontera entre el uso indebido y las acciones autónomas desalineadas se difuminará a medida que la IA adquiera mayor autonomía. Quizá estemos acostumbrados a pensar en la IA como una herramienta, pero algunos agentes perseguirán sus propios objetivos. Encontrarán formas de colaborar con las personas mediante la negociación, el engaño o el chantaje.

Además, existen riesgos derivados de nuevas tecnologías que la IA podría hacer posibles, como los patógenos diseñados.

Necesitaremos una IA potente y alineada para la defensa: para proteger la infraestructura, defendernos en tiempo real de agentes fuera de control e inventar medidas de protección totalmente nuevas. Este será uno de los principales focos de los esfuerzos de implementación de OpenAI.

Al mismo tiempo, pese a la incertidumbre que generan el avance general previsto de la IA y la necesidad de construir sistemas defensivos, no debemos permitir que esto se convierta en una excusa para actuar de forma imprudente. La idea de avanzar a toda costa parece absurda una vez que se comprende la gravedad de lo que está en juego.

Regular el ritmo de la RSI

Que la inteligencia de las máquinas desempeñe un papel cada vez mayor en su propio proceso de desarrollo es una consecuencia natural del progreso tecnológico sostenido. Si el progreso de la IA continúa, la automejora recursiva de las máquinas (RSI) ocupará el centro mismo de los futuros descubrimientos científicos.

La investigación automatizada sobre IA es una forma más radical de escalar la inteligencia mediante el cómputo; y, por supuesto, como parte de ella, la IA mejorará el propio sustrato computacional⁠. Al igual que con el escalamiento, orientamos la investigación de OpenAI hacia la RSI porque creemos que es la única forma de mantenernos a la vanguardia de la investigación en IA.

Quiero subrayar que lo anterior no implica que considere que acelerar enormemente la investigación sobre aprendizaje profundo, sobre todo a corto plazo, sea la acción colectiva adecuada para la comunidad investigadora. Sin embargo, sí creo que este es el destino del rumbo actual y que todos debemos decidir conscientemente cómo proceder. Nuestras principales opciones son orientar el proceso para fortalecer la alineación y el monitoreo junto con la IA, y encontrar formas de mantener a las personas involucradas; o coordinarnos para ralentizar el desarrollo futuro según sea necesario a fin de generar confianza en estas medidas.

Actualmente, la mejor forma de avanzar que veo es combinar ambas opciones.

Los avances concretos que hemos logrado en alineación y monitoreo generalmente han estado muy vinculados al progreso general de la IA. Dos grandes ejemplos son el aprendizaje por refuerzo a partir de comentarios humanos⁠(se abre en una nueva ventana), que fue esencial para entrenar a los primeros asistentes de IA, y el ya mencionado monitoreo de la cadena de pensamiento⁠(se abre en una nueva ventana), que fue posible gracias a los avances en los modelos de razonamiento. Debemos enfocar el proceso de investigación, cada vez más automatizado, en desarrollar nuevos conocimientos, algoritmos y teorías de este tipo, y construir de forma iterativa argumentos de seguridad para IA más capaces.

El escalamiento de los sistemas de IA debe estar limitado por nuestra confianza en su seguridad. Debemos convertir compromisos como el Marco de preparación⁠ o la Política de escalamiento responsable⁠(se abre en una nueva ventana) en requisitos de seguridad ampliamente obligatorios para continuar el desarrollo. Una red de auditores externos, organismos gubernamentales o entidades internacionales puede exigir su cumplimiento.

El desafío central de automatizar la investigación sobre IA no es "llegar", sino hacerlo de manera que las personas sigan formando parte del proceso continuo de mejora y que el futuro permanezca en manos de la humanidad.

¿Qué sigue?

Como expusimos recientemente junto con Sam⁠, OpenAI prioriza el trabajo al servicio de tres objetivos rectores:

  1. Guiar la próxima etapa del progreso de la IA mediante la creación de un investigador de IA automatizado, la colaboración iterativa con él para abordar el problema de la alineación y la búsqueda de formas de mantener a las personas dentro del ciclo de mejora recursiva.

  2. Hacer llegar los beneficios del progreso científico y el crecimiento económico que permiten las máquinas muy inteligentes.

  3. Empoderar individualmente a cada persona con una IAG personal.

En este ensayo me he centrado únicamente en el primer punto, pues considero que es, por mucho, el más urgente. Sin embargo, tengo una profunda esperanza y valoración de los beneficios que traerá un mayor progreso tecnológico. Una futura IA alineada podría impulsar la ciencia, desarrollar nuevas terapias y generar una abundancia material generalizada. Una IA amable y honesta puede ayudar a las personas a afrontar las dificultades de su vida y mejorar de manera significativa su felicidad y sensación de plenitud. OpenAI dedica enormes esfuerzos a hacer realidad estos beneficios. Un ejemplo actual del que me enorgullezco, y que ha resultado útil para mis seres queridos, es la gran inversión en la capacidad de ChatGPT para proporcionar información de salud.

Por muy prometedora que sea la IA a largo plazo, debemos concentrar la mayor parte de nuestra atención en los próximos años. Nos enfrentamos a la transición hacia un mundo con máquinas increíblemente inteligentes y debemos asegurarnos de que resulte beneficiosa para la humanidad. Debemos encontrar formas de preservar la autonomía humana y consagrar el valor intrínseco de ser humano en un mundo donde la IA podría realizar la mayoría de las tareas. Debemos evitar una concentración extrema del poder en un mundo donde unos pocos individuos con una gran computadora puedan lograr proyectos que antes habrían requerido miles de expertos. Y debemos garantizar que los seres humanos conserven el control del futuro y no queden rezagados por un progreso sin control, impulsado por un intelecto ajeno que supere al nuestro.

Actualmente, creo que ningún laboratorio ha resuelto la alineación y el monitoreo en un grado suficiente para seguir escalando responsablemente a máxima velocidad durante mucho más tiempo. Espero y deseo que las desaceleraciones voluntarias se vuelvan habituales hasta que se establezcan requisitos de seguridad compartidos. También creo que la coordinación internacional sobre el futuro desarrollo de la IA debe convertirse en una prioridad máxima para los gobiernos de todo el mundo.

Autor

Jakub Pachocki

Notas al pie

  1. 1
  2. 2

    Una razón secundaria para este diseño fue evitar la destilación. Sin embargo, mantener la capacidad de monitorear la cadena de pensamiento ha sido explícitamente una prioridad mayor para nosotros durante todo el desarrollo.