Prioridades y principios para evaluaciones eficaces de terceros
Los laboratorios de IA de vanguardia tienen una enorme responsabilidad: entrenar, evaluar y desplegar modelos de manera segura. Las evaluaciones de terceros son fundamentales para equilibrar esa responsabilidad, ampliar las oportunidades de contribuir a la seguridad de la IA, mantener informado al mundo y exigir que los laboratorios respondan por afirmaciones de seguridad claras y respaldadas de forma independiente.
Como parte de nuestros esfuerzos por avanzar de forma segura en la vanguardia, OpenAI se compromete a apoyar evaluaciones independientes con amplios niveles de acceso durante el entrenamiento, la evaluación y el despliegue. Ese acceso debe permitir que los evaluadores cuestionen nuestros supuestos, identifiquen riesgos que quizá hayamos pasado por alto y lleguen a sus propias conclusiones sobre la eficacia de nuestras salvaguardas.
Desde hace tiempo colaboramos con evaluadores externos en distintas etapas del proceso de desarrollo y despliegue de modelos. También hemos incorporado evaluaciones de terceros en nuestras prácticas del Marco de preparación y hemos apoyado a organizaciones y leyes que promueven un proceso más riguroso y sujeto a rendición de cuentas. Durante estas colaboraciones, hemos brindado amplias modalidades de acceso, incluida información sobre nuestras salvaguardas técnicas, acceso a la cadena de pensamiento visible y niveles sin precedentes de acceso a datos confidenciales y despliegues internos para responder a incidentes y realizar red teaming de los sistemas de monitoreo. Las prioridades y los principios que compartimos aquí se centran en nuestra colaboración con organizaciones independientes de los sectores privado y sin fines de lucro que realizan evaluaciones técnicas de seguridad. Complementan nuestro trabajo con gobiernos en materia de pruebas y evaluaciones, donde las diferentes funciones y responsabilidades pueden requerir enfoques distintos.
Para que estas evaluaciones sean eficaces, se necesitan mecanismos sólidos de independencia, rigor científico, prácticas robustas de seguridad y responsabilidades claras. Los laboratorios tienen la responsabilidad de permitir un análisis significativo y, a la vez, proteger la información sensible. Los laboratorios y evaluadores independientes comparten la responsabilidad de hacer bien este trabajo y deben operar con estándares internacionales compartidos para las prácticas de seguridad y protección. A continuación, proponemos cuatro áreas prioritarias para una evaluación más profunda, junto con principios para realizar un trabajo riguroso, seguro e independiente.
Las evaluaciones de terceros son más útiles cuando abordan preguntas específicas y relevantes: ¿la evidencia respalda el caso y las afirmaciones de seguridad de un laboratorio? ¿Las evaluaciones ponen a prueba adecuadamente los riesgos que pretenden medir? ¿Las salvaguardas funcionan en condiciones realistas?
Las evaluaciones descritas aquí pueden adoptar distintas formas según las cuestiones de seguridad que se examinen. Esperamos apoyar varias evaluaciones en paralelo y durante distintos periodos: algunas durarán semanas y otras, varios meses. Aunque las evaluaciones de terceros también pueden formar parte del trabajo previo al despliegue y fundamentar decisiones al respecto, el trabajo descrito aquí suele ser de más largo plazo e independiente de los lanzamientos: se centra en examinar a fondo determinadas afirmaciones de seguridad a lo largo del tiempo.
En nuestras áreas prioritarias y principios, hacemos referencia a afirmaciones y casos de seguridad. Estos términos significan lo siguiente:
Afirmación de seguridad: afirmación específica sobre las capacidades, el comportamiento o las salvaguardas de un modelo o sistema que incide en su seguridad y puede contrastarse con evidencia. Una afirmación debe identificar los riesgos y las condiciones que aborda, junto con los supuestos y las limitaciones pertinentes.
Caso de seguridad: argumento estructurado y respaldado por evidencia que explica por qué los riesgos de un modelo o sistema se gestionan adecuadamente para una actividad específica, como el entrenamiento, la evaluación o el despliegue. Un caso de seguridad vincula cada afirmación de seguridad con la evidencia que la respalda y explicita los supuestos, las incertidumbres y los riesgos restantes que podrían afectar sus conclusiones.
Proponemos cuatro áreas prioritarias para una evaluación más profunda, junto con principios para realizar un trabajo riguroso, seguro e independiente.
Evaluación independiente de casos de seguridad que abarcan el entrenamiento, la evaluación y los despliegues internos y externos.
Evaluar casos de seguridad requiere conocimientos especializados en alineación, métodos de control como el monitoreo, ciberseguridad, uso indebido de recursos biológicos y químicos, y red teaming. Los casos de seguridad constan de afirmaciones sobre aspectos como el entrenamiento, las evaluaciones de capacidades y las salvaguardas, que pueden evaluarse en conjunto o por partes (consulta las prioridades 2 y 3 a continuación). Es probable que varios evaluadores deban examinar distintas partes de los casos, aprovechando sus respectivos conocimientos especializados. En conjunto, sus evaluaciones deben responder preguntas como las siguientes:
¿Está fundamentada la evidencia de los casos de seguridad para el entrenamiento, la evaluación y los despliegues? ¿Se cumplieron las condiciones del caso de seguridad durante el entrenamiento, la evaluación y el despliegue?
¿Nuestros casos de seguridad abarcan los riesgos más urgentes identificados durante una evaluación? ¿Las afirmaciones de seguridad respaldan el caso de seguridad general? ¿Existen deficiencias o aspectos que puedan mejorarse?
¿Se utilizan métodos eficaces para identificar y reducir incentivos del entrenamiento que podrían recompensar el engaño, el reward hacking, las acciones destructivas o la evasión de restricciones?
Evaluación de salvaguardas críticas en despliegues internos y externos
Nuestro conjunto de salvaguardas evoluciona constantemente para adaptarse a los cambios en las capacidades y el panorama. Nuestras salvaguardas abarcan el entrenamiento y los despliegues internos y externos. Actualmente incluyen salvaguardas a nivel del modelo, de aplicación de normas y de seguridad, además de monitores de desalineación. En conjunto, abarcan una gran variedad de riesgos, como la pérdida de control y el uso indebido en los ámbitos cibernético, biológico y químico. Las alianzas técnicas pueden identificar ahora las debilidades de las salvaguardas, a la vez que mejoran los métodos de evaluación y aceleran el desarrollo de estándares. Así proporcionan una base técnica más sólida para futuras políticas públicas que permitan avanzar de forma segura en la vanguardia, especialmente en los despliegues internos, donde los estándares de seguridad y protección aún son incipientes.
Las evaluaciones independientes deben examinar qué tan bien funcionan estas salvaguardas y dónde podrían ser insuficientes, por ejemplo:
Con acceso de “caja gris”, ¿las salvaguardas resisten las pruebas adversarias (jailbreaks) y protegen suficientemente contra el aumento de capacidades en ámbitos de alto riesgo, como el cibernético y el biológico? ¿Nuestras pruebas adversarias y nuestro red teaming abarcan los riesgos más importantes?
En pruebas autorizadas bajo condiciones operativas realistas, ¿cómo interactúan los agentes con defensas cibernéticas como los controles de acceso, el aislamiento en entornos de pruebas y los sistemas de detección y respuesta? ¿Qué defensas previenen, detectan o contienen las acciones perjudiciales y dónde fallan?
¿Nuestros monitores de desalineación presentan deficiencias críticas que podrían provocar pérdida de control o una desalineación grave tanto en despliegues internos como externos? A medida que mejoran las capacidades de los modelos, ¿qué tan confiable es el monitoreo de la cadena de pensamiento como fuente de evidencia sobre seguridad o alineación?
¿Se implementa un monitoreo adecuado en todo el entrenamiento, las evaluaciones y los despliegues pertinentes, de modo que no pueda desactivarse fácilmente?
¿Las salvaguardas implementadas son proporcionales a las capacidades?
Evaluación de capacidades que abarcan las categorías de riesgo de Preparación (riesgos químicos y biológicos, ciberseguridad y automejora de la IA) y evaluaciones de alineación para riesgos de desalineación
Nuestro Marco de preparación exige evaluaciones de las principales áreas de riesgo de frontera. A medida que se superan los umbrales y las evaluaciones se saturan, es importante actualizar constantemente y garantizar la cobertura y calidad de las evaluaciones de capacidades en áreas de riesgo de Preparación, así como de las evaluaciones de alineación que buscan medir riesgos graves de desalineación.
Entre las preguntas pertinentes se incluyen:
¿Las evaluaciones de riesgos de Preparación abarcan adecuadamente la definición del umbral de riesgo de Preparación? ¿Los umbrales de estas evaluaciones están establecidos correctamente?
¿Las evaluaciones se actualizan cuando los modelos obtienen sistemáticamente las puntuaciones más altas? ¿Las nuevas pruebas miden de forma significativa capacidades más avanzadas?
¿Nuestras evaluaciones de alineación abarcan adecuadamente los riesgos graves de desalineación y qué comportamientos o condiciones importantes podrían pasar por alto?
Investigación independiente de incidentes críticos de desalineación
La investigación independiente puede ser valiosa para diversos incidentes críticos de seguridad de la IA. Aquí nos centramos en la desalineación de modelos, incluidos los casos en que actúan sin autorización o evaden la supervisión, lo que puede revelar debilidades en los métodos de alineación y las salvaguardas incluso sin un uso indebido intencional.
En determinadas circunstancias, como ocurrió con el incidente de OpenAI en Hugging Face, puede ser útil recurrir a un tercero independiente para realizar investigaciones independientes de incidentes de desalineación. Es fundamental que los terceros involucrados en investigar incidentes cuenten con los conocimientos necesarios, incluidos, cuando corresponda, conocimientos de informática forense, alineación y análisis a gran escala de cadenas de pensamiento, además del personal y los recursos para realizar la investigación oportunamente. La respuesta a incidentes puede implicar el acceso a datos internos sensibles y datos de terceros; por ello, algunos detalles pueden ser demasiado sensibles para publicarse o consultarse. Los hallazgos de investigaciones independientes también pueden fundamentar el caso de seguridad de un modelo al aportar evidencia para evaluar afirmaciones sobre su alineación y la eficacia de las medidas adoptadas para corregir desalineaciones observadas anteriormente.
En el contexto de incidentes de desalineación, priorizamos las evaluaciones independientes sobre lo siguiente:
¿Qué comportamientos del modelo o problemas de desalineación ocurrieron durante el incidente y cuáles fueron los principales factores contribuyentes?
¿Las salvaguardas y las medidas correctivas mitigarían eficazmente incidentes similares en el futuro?
Afirmaciones con un alcance claro y acordadas mutuamente para su evaluación: las evaluaciones deben comenzar con un alcance acordado mutuamente, seguido de afirmaciones de seguridad claramente definidas que se registren antes de iniciar las actividades de evaluación. Los terceros y los laboratorios deben aclarar si se trata de afirmaciones que la empresa evaluada desea presentar para su evaluación o de afirmaciones que el evaluador externo busca evaluar de forma independiente y respecto de las cuales el laboratorio acepta ser evaluado. Hay muchas razones por las que algunas afirmaciones pueden quedar fuera del alcance, como la imposibilidad de que terceros accedan a los datos, la falta de conocimientos especializados del evaluador o las limitaciones razonables de tiempo cuando una evaluación es urgente. Los laboratorios y evaluadores deben establecer un proceso para considerar los riesgos significativos identificados fuera del alcance original, incluido determinar si ameritan una investigación adicional. Las conclusiones deben aclarar qué se evaluó y qué no en relación con el alcance acordado mutuamente.
Acceso proporcional: cuando sea posible dentro de las restricciones legales, de seguridad y de propiedad intelectual, los evaluadores deben tener un acceso proporcional para evaluar las afirmaciones acordadas. Cuando el acceso directo no sea práctico o posible, los evaluadores pueden trabajar con un representante designado de la empresa o explorar mecanismos de acceso indirecto o que preserven la privacidad para proteger la información subyacente.
Metodología y estándares transparentes: los evaluadores deben explicar sus métodos, criterios de evaluación e incertidumbres, basándose en estándares establecidos cuando estén disponibles. Cuando aún no existan estándares, deben justificar claramente los criterios que utilicen. Los informes deben distinguir los hallazgos directos de las interpretaciones, explicar la incertidumbre y aclarar qué conclusiones respalda la evidencia.
Conocimientos especializados e independencia: los evaluadores deben demostrar conocimientos técnicos pertinentes e identificar, divulgar y abordar los conflictos de intereses institucionales e individuales, incluidos los incentivos financieros, las relaciones con desarrolladores y la participación previa en el trabajo evaluado. Las salvaguardas deben diseñarse para evitar que las presiones comerciales y los acuerdos de remuneración influyan en los hallazgos, y pueden incluir la recusación o periodos de exclusión adecuados.
Seguridad y confidencialidad: los evaluadores deben demostrar prácticas de seguridad de la información y aplicar protecciones de confidencialidad exigibles a su personal, proporcionales a la sensibilidad de los sistemas y la información a los que accedan. Estas protecciones deben abarcar la propiedad intelectual, la información sensible y los registros de las evaluaciones. Cuando los evaluadores no puedan cumplir los requisitos de seguridad en sus propios entornos, o los datos a los que accedan sean especialmente sensibles, puede ser adecuado permitir el acceso mediante dispositivos o instalaciones gestionados por la empresa.
Hallazgos aplicables y tiempo para corregir problemas: las evaluaciones deben identificar deficiencias específicas y brindar suficiente información para que los laboratorios las aborden. Cuando corresponda, los laboratorios deben disponer de un plazo razonable para corregir los problemas antes de la publicación. Cuando sea pertinente, los informes también deben explicar las lecciones para desarrolladores, implementadores y defensores de agentes, e incluir recomendaciones prácticas para su aplicación.
Prácticas de publicación responsables: los informes de evaluación deben basarse en evidencia y compartirse con la mayor transparencia posible, protegiendo a la vez la información sensible y confidencial. Cuando no sea posible una divulgación pública completa, la presentación de informes confidenciales ante los organismos de supervisión pertinentes, como órganos de gobernanza o juntas directivas de empresas, puede favorecer la rendición de cuentas. Deben existir políticas y protecciones de supresión basadas en principios, así como expectativas claras sobre la retroalimentación y la corrección de imprecisiones, para preservar el equilibrio entre independencia y confidencialidad. Los evaluadores deben conservar su independencia editorial y, a la vez, garantizar las protecciones de confidencialidad y propiedad intelectual. Los evaluadores deben adoptar políticas claras que permitan a los laboratorios solicitar la supresión de información sensible, mientras que ellos pueden indicar dónde se realizaron supresiones sustanciales y cómo afectaron su informe de evaluación.
Nos comprometemos a apoyar a los evaluadores independientes y a establecer estándares internacionales compartidos y más claros —mediante futuras leyes e instituciones privadas de gobernanza— para realizar evaluaciones eficaces por parte de terceros. Aunque el ecosistema de evaluación independiente aún está creciendo, contribuiremos a su desarrollo apoyando y colaborando con una comunidad diversa de evaluadores independientes que tengan amplios conocimientos sobre cuestiones de seguridad de vanguardia. Ningún tercero puede ni debe abarcar de manera integral las cuestiones urgentes de seguridad de vanguardia. Avanzaremos de forma deliberada y decidida para ampliar nuestra capacidad y permitir que el creciente ecosistema de terceros adopte las mejores prácticas y principios. Estamos conversando con varios terceros sobre propuestas que se ajustan a las áreas prioritarias anteriores.


