Prioridades y principios para realizar evaluaciones externas eficaces
Los laboratorios de IA de vanguardia tienen una enorme responsabilidad al entrenar, evaluar y desplegar modelos de forma segura. Las evaluaciones externas son esenciales para equilibrar esa responsabilidad, ampliar las oportunidades de contribuir a la seguridad de la IA, mantener informada a la sociedad y exigir a los laboratorios que respondan de afirmaciones de seguridad claras y respaldadas de forma independiente.
Como parte de nuestros esfuerzos por marcar el ritmo de la vanguardia, OpenAI se compromete a apoyar evaluaciones independientes con un amplio acceso durante el entrenamiento, la evaluación y el despliegue. Ese acceso debe permitir a los evaluadores cuestionar nuestros supuestos, detectar riesgos que quizá hayamos pasado por alto y extraer sus propias conclusiones sobre la eficacia de nuestras salvaguardas.
Llevamos mucho tiempo colaborando con evaluadores externos en distintas fases del desarrollo y despliegue de los modelos. También hemos incorporado evaluaciones externas a nuestras prácticas del Marco de preparación y apoyado a organizaciones y leyes que promueven un proceso más riguroso y sujeto a rendición de cuentas. Durante estas colaboraciones, hemos ofrecido amplias formas de acceso, incluida información sobre nuestras salvaguardas técnicas, acceso a la cadena de pensamiento visible y niveles sin precedentes de acceso a datos confidenciales y despliegues internos para responder a incidentes y realizar red teaming de los monitores. Las prioridades y los principios aquí expuestos se centran en nuestra colaboración con organizaciones independientes de los sectores privado y sin ánimo de lucro para realizar evaluaciones técnicas de seguridad. Complementan nuestro trabajo con los gobiernos en materia de pruebas y evaluación, donde las diferencias de funciones y responsabilidades pueden exigir enfoques distintos.
Para que estas evaluaciones sean eficaces, se necesitan mecanismos sólidos de independencia, rigor científico, prácticas de seguridad robustas y responsabilidades claras. Los laboratorios tienen la responsabilidad de facilitar un escrutinio sustancial y proteger al mismo tiempo la información sensible. Los laboratorios y los evaluadores independientes comparten la responsabilidad de hacerlo bien y deben trabajar conforme a normas internacionales compartidas sobre prácticas de seguridad y protección. A continuación, proponemos cuatro áreas prioritarias para realizar evaluaciones más exhaustivas, junto con principios para un trabajo riguroso, seguro e independiente.
Las evaluaciones externas resultan más útiles cuando abordan preguntas concretas y relevantes: ¿respaldan las pruebas el caso y las afirmaciones de seguridad de un laboratorio? ¿Las evaluaciones ponen a prueba adecuadamente los riesgos que pretenden medir? ¿Funcionan las salvaguardas en condiciones realistas?
Las evaluaciones aquí descritas adoptarán formas distintas según las cuestiones de seguridad que se examinen. Prevemos apoyar varias evaluaciones en paralelo y durante periodos diferentes: algunas durarán semanas y otras, varios meses. Aunque las evaluaciones externas también pueden formar parte del trabajo previo al despliegue e influir en las decisiones de despliegue, el trabajo aquí descrito suele ser a más largo plazo e independiente de los lanzamientos, pues se centra en examinar en profundidad determinadas afirmaciones de seguridad a lo largo del tiempo.
En nuestras áreas prioritarias y principios, hacemos referencia a afirmaciones y casos de seguridad. Estos términos significan lo siguiente:
Afirmación de seguridad: afirmación específica sobre las capacidades, el comportamiento o las salvaguardas de un modelo o sistema que afecta a su seguridad y puede contrastarse con pruebas. Una afirmación debe identificar los riesgos y las condiciones que aborda, junto con los supuestos y las limitaciones pertinentes.
Caso de seguridad: argumento estructurado y respaldado por pruebas que explica por qué los riesgos de un modelo o sistema se gestionan adecuadamente para una actividad concreta, como el entrenamiento, la evaluación o el despliegue. Un caso de seguridad vincula cada afirmación de seguridad con las pruebas que la respaldan y hace explícitos los supuestos, las incertidumbres y los riesgos restantes que podrían afectar a sus conclusiones.
Proponemos cuatro áreas prioritarias para realizar evaluaciones más exhaustivas, junto con principios para un trabajo riguroso, seguro e independiente.
Evaluación independiente de casos de seguridad durante el entrenamiento, la evaluación y los despliegues internos y externos.
La evaluación de casos de seguridad requiere conocimientos especializados en alineación, métodos de control como la monitorización, ciberseguridad, uso indebido biológico y químico y red teaming. Los casos de seguridad constan de afirmaciones sobre aspectos como el entrenamiento, las evaluaciones de capacidades y las salvaguardas, que pueden evaluarse en conjunto o por separado (consulta las prioridades 2 y 3 más adelante). Es probable que varios evaluadores deban examinar distintas partes de los casos, cada uno desde su ámbito de especialización. En conjunto, sus evaluaciones deben responder a preguntas como estas:
¿Están fundamentadas las pruebas de los casos de seguridad relativos al entrenamiento, la evaluación y los despliegues? ¿Se respetaron las condiciones del caso de seguridad durante el entrenamiento, la evaluación y el despliegue?
¿Abarcan nuestros casos de seguridad los riesgos más urgentes detectados durante una evaluación? ¿Respaldan las afirmaciones de seguridad el caso de seguridad general? ¿Hay deficiencias o aspectos que puedan mejorarse?
¿Se utilizan métodos eficaces para identificar y reducir los incentivos del entrenamiento que podrían recompensar el engaño, el reward hacking, las acciones destructivas o la elusión de restricciones?
Evaluación de salvaguardas críticas en despliegues internos y externos
Nuestro conjunto de salvaguardas evoluciona constantemente para adaptarse a los cambios en las capacidades y el panorama. Nuestras salvaguardas abarcan el entrenamiento y los despliegues internos y externos. Actualmente incluyen salvaguardas a nivel del modelo, salvaguardas de cumplimiento y salvaguardas de seguridad, además de monitores de desalineación, y abarcan una gran variedad de riesgos, como la pérdida de control y el uso indebido en los ámbitos cibernético, biológico y químico. Las colaboraciones técnicas pueden detectar ahora deficiencias en las salvaguardas, a la vez que mejoran los métodos de evaluación y aceleran el desarrollo de normas. Así ofrecen una base técnica más sólida para futuras políticas públicas destinadas a marcar el ritmo de la vanguardia, sobre todo en los despliegues internos, donde las normas de seguridad y protección aún son incipientes.
Las evaluaciones independientes deben examinar la eficacia de estas salvaguardas y sus posibles deficiencias, por ejemplo:
Con acceso de «caja gris», ¿resisten las salvaguardas las pruebas adversarias (jailbreaks) y protegen lo suficiente frente al aumento de capacidades en ámbitos de alto riesgo, como la ciberseguridad y la biología? ¿Abarcan nuestras pruebas adversarias y nuestro red teaming los riesgos más importantes?
En pruebas autorizadas y realizadas en condiciones operativas realistas, ¿cómo interactúan los agentes con las defensas cibernéticas, como los controles de acceso, el aislamiento en entornos seguros y los sistemas de detección y respuesta? ¿Qué defensas previenen, detectan o contienen las acciones dañinas y dónde fallan?
¿Tienen nuestros monitores de desalineación deficiencias críticas que puedan provocar una pérdida de control o una desalineación grave en los despliegues internos o externos? A medida que mejoran las capacidades de los modelos, ¿qué fiabilidad ofrece la monitorización de la cadena de pensamiento como fuente de pruebas sobre seguridad o alineación?
¿Se aplica una monitorización adecuada en todos los entrenamientos, evaluaciones y despliegues pertinentes, de forma que no pueda desactivarse fácilmente?
¿Se aplican salvaguardas proporcionales a las capacidades?
Evaluación de capacidades que abarque las categorías de riesgo de Preparación (riesgos químicos y biológicos, ciberseguridad y automejora de la IA) y evaluaciones de alineación para los riesgos de desalineación
Nuestro Marco de preparación exige evaluaciones de las principales áreas de riesgo de frontera. A medida que se superan los umbrales y las evaluaciones alcanzan su límite, es importante actualizarlas sistemáticamente y garantizar la cobertura y calidad tanto de las evaluaciones de capacidades en áreas de riesgo de Preparación como de las evaluaciones de alineación destinadas a valorar riesgos graves de desalineación.
Entre las preguntas pertinentes se incluyen:
¿Las evaluaciones de riesgos de Preparación abarcan adecuadamente la definición de sus umbrales de riesgo? ¿Están correctamente definidos los umbrales de estas evaluaciones?
¿Se actualizan las evaluaciones cuando los modelos obtienen sistemáticamente las puntuaciones más altas y miden las nuevas pruebas capacidades más avanzadas de forma significativa?
¿Abarcan adecuadamente nuestras evaluaciones de alineación los riesgos graves de desalineación y qué comportamientos o condiciones importantes podrían pasar por alto?
Investigación independiente de incidentes críticos de desalineación
La investigación independiente puede resultar valiosa en diversos incidentes críticos de seguridad de la IA. Aquí nos centramos en la desalineación de los modelos, incluidos los casos en que actúan sin autorización o eluden la supervisión, pues pueden revelar deficiencias en los métodos de alineación y las salvaguardas incluso sin un uso indebido intencionado.
En determinadas circunstancias, como ocurrió con el incidente de OpenAI en Hugging Face, puede ser útil recurrir a un tercero independiente para realizar investigaciones independientes de incidentes de desalineación. Es fundamental que los terceros que participen en la investigación de incidentes dispongan de los conocimientos necesarios, incluidos, cuando corresponda, conocimientos de análisis forense cibernético y alineación, capacidad para analizar cadenas de pensamiento a gran escala y personal y recursos suficientes para investigar con rapidez. La respuesta a incidentes puede exigir acceso a datos internos sensibles y datos de terceros, por lo que algunos detalles pueden ser demasiado sensibles para publicarlos o facilitar el acceso a ellos. Los hallazgos de investigaciones independientes también pueden fundamentar el caso de seguridad de un modelo al aportar pruebas para evaluar las afirmaciones sobre su alineación y la eficacia de las medidas adoptadas para corregir desalineaciones observadas anteriormente.
En el contexto de los incidentes de desalineación, damos prioridad a evaluaciones independientes sobre estas cuestiones:
¿Qué comportamientos del modelo o problemas de desalineación se produjeron durante el incidente y cuáles fueron los principales factores que contribuyeron a ellos?
¿Las salvaguardas y las medidas correctoras mitigarían eficazmente incidentes similares en el futuro?
Alcance claro y acuerdo mutuo sobre las afirmaciones que se evaluarán: las evaluaciones deben comenzar con un alcance acordado por ambas partes, seguido de afirmaciones de seguridad claramente definidas y registradas antes de iniciar las actividades de evaluación. Los terceros y los laboratorios deben aclarar si se trata de afirmaciones que la empresa evaluada desea presentar para su evaluación o de afirmaciones que el evaluador externo pretende analizar de forma independiente y que el laboratorio acepta someter a evaluación. Hay muchos motivos por los que algunas afirmaciones pueden quedar fuera del alcance, como la imposibilidad de que terceros accedan a los datos, la falta de conocimientos especializados del evaluador o unas restricciones de tiempo razonables cuando la evaluación es urgente. Los laboratorios y los evaluadores deben establecer un proceso para analizar los riesgos importantes detectados fuera del alcance original, incluida la necesidad de investigarlos más a fondo. Las conclusiones deben dejar claro qué se evaluó y qué no en relación con el alcance acordado por ambas partes.
Acceso proporcional: siempre que sea posible y dentro de las restricciones legales, de seguridad y de propiedad intelectual, los evaluadores deben disponer de un acceso proporcional para evaluar las afirmaciones acordadas. Cuando el acceso directo no sea práctico o posible, los evaluadores pueden colaborar con un representante designado de la empresa o estudiar mecanismos de acceso indirecto o que preserven la privacidad para proteger la información subyacente.
Metodología y normas transparentes: los evaluadores deben explicar sus métodos, criterios de evaluación e incertidumbres, basándose en normas consolidadas cuando existan. Cuando aún no existan normas, deben justificar claramente los criterios utilizados. Los informes deben distinguir los hallazgos directos de la interpretación, explicar la incertidumbre y aclarar qué conclusiones respaldan las pruebas.
Conocimientos especializados e independencia: los evaluadores deben demostrar que poseen los conocimientos técnicos pertinentes e identificar, comunicar y abordar los conflictos de intereses personales y organizativos, incluidos los incentivos económicos, las relaciones con desarrolladores y su participación previa en el trabajo evaluado. Las salvaguardas deben diseñarse para evitar que las presiones comerciales y los acuerdos de remuneración influyan en los hallazgos, y pueden incluir la recusación o periodos de exclusión adecuados.
Seguridad y confidencialidad: los evaluadores deben demostrar que aplican prácticas de seguridad de la información y protecciones de confidencialidad exigibles a su personal, proporcionales a la sensibilidad de los sistemas y la información a los que accedan. Estas protecciones deben abarcar la propiedad intelectual, la información sensible y los registros de evaluación. Cuando los evaluadores no puedan cumplir los requisitos de seguridad en sus propios entornos, o los datos consultados sean especialmente sensibles, puede ser conveniente acceder desde dispositivos o instalaciones gestionados por la empresa.
Hallazgos prácticos y plazo de subsanación: las evaluaciones deben identificar deficiencias concretas y aportar suficiente información para que los laboratorios puedan subsanarlas. Cuando proceda, los laboratorios deben disponer de un plazo razonable para corregir los problemas antes de la publicación. Cuando corresponda, los informes también deben explicar las lecciones para desarrolladores, responsables del despliegue y defensores de agentes, con recomendaciones prácticas para su aplicación.
Prácticas de publicación responsables: los informes de evaluación deben basarse en pruebas y compartirse con la mayor transparencia posible, protegiendo al mismo tiempo la información sensible y confidencial. Cuando no sea posible divulgar públicamente toda la información, la rendición de cuentas puede reforzarse mediante informes confidenciales dirigidos a los órganos de supervisión pertinentes, como órganos de gobierno o consejos de administración. Deben existir protecciones y políticas de supresión fundamentadas en principios, así como expectativas claras sobre los comentarios y la corrección de inexactitudes, para mantener el equilibrio entre independencia y confidencialidad. Los evaluadores deben mantener su independencia editorial y garantizar a la vez las protecciones de confidencialidad y propiedad intelectual. Los evaluadores deben adoptar políticas de supresión claras que permitan a los laboratorios solicitar que se omita información sensible, mientras que los evaluadores pueden indicar dónde se han realizado supresiones sustanciales y cómo afectan a su informe.
Nos comprometemos a apoyar a los evaluadores independientes y establecer normas internacionales compartidas más claras —tanto mediante futuras leyes como a través de instituciones privadas de gobernanza— para realizar evaluaciones externas eficaces. Aunque el ecosistema de evaluación independiente aún está creciendo, contribuiremos a su desarrollo apoyando y colaborando con una comunidad diversa de evaluadores independientes con amplios conocimientos sobre cuestiones de seguridad de vanguardia. Ningún tercero puede ni debe abarcar por sí solo todas las cuestiones urgentes de seguridad de vanguardia. Avanzaremos de forma deliberada y meditada para aumentar nuestra capacidad y permitir que el creciente ecosistema de terceros se coordine en torno a las mejores prácticas y principios. Estamos conversando con varios terceros sobre propuestas que se ajustan a las áreas prioritarias anteriores.


