Приоритеты и принципы эффективной сторонней оценки
На лабораториях передового ИИ лежит огромная ответственность за безопасное обучение, оценку и развертывание моделей. Сторонняя оценка крайне важна для выполнения этой обязанности: она расширяет возможности участия в обеспечении безопасности ИИ, информирует общество и требует от лабораторий отчетности по четким и независимо подтвержденным утверждениям о безопасности.
В рамках работы по управлению темпами развития передового ИИ, OpenAI стремится поддерживать независимую оценку, предоставляя широкий доступ на этапах обучения, оценки и развертывания. Такой доступ должен позволить экспертам оспаривать наши допущения, выявлять упущенные нами риски и самостоятельно делать выводы об эффективности наших мер защиты.
Мы давно сотрудничаем со сторонними экспертами на различных этапах разработки и развертывания моделей. Мы также включили стороннюю оценку в практики нашей Программы готовности и поддерживали организации и законодательные инициативы, выступающие за более строгий и подотчетный процесс. В ходе такого взаимодействия мы предоставляли широкий доступ, включая сведения о технических мерах защиты, доступ к видимой цепочке рассуждений (CoT), а также беспрецедентный доступ к конфиденциальным данным и внутреннему развертыванию для реагирования на инциденты и red teaming систем мониторинга. Представленные здесь приоритеты и принципы касаются нашего взаимодействия с независимыми оценочными организациями частного и некоммерческого секторов по вопросам технической оценки безопасности. Они дополняют нашу работу с государственными органами в области тестирования и оценки, где различия в ролях и обязанностях могут требовать иных подходов.
Для эффективности такой оценки необходимы надежные механизмы независимости, научная строгость, эффективные практики безопасности и четкое распределение обязанностей. Лаборатории обязаны обеспечивать возможность содержательной проверки, одновременно защищая чувствительную информацию. Лаборатории и независимые эксперты разделяют ответственность за надлежащее выполнение этой работы и должны руководствоваться едиными международными стандартами практик безопасности и защиты. Ниже мы предлагаем четыре приоритетных направления для углубленной оценки, а также принципы строгой, безопасной и независимой работы.
Сторонняя оценка наиболее полезна, когда отвечает на конкретные и значимые вопросы: подтверждают ли фактические данные обоснование безопасности и утверждения о безопасности лаборатории? Достаточно ли хорошо оценочные процедуры проверяют риски, для измерения которых они предназначены? Работают ли меры защиты в реалистичных условиях?
Описанные здесь оценки могут проводиться в разных формах в зависимости от рассматриваемых вопросов безопасности. Мы планируем параллельно поддерживать несколько оценок разной продолжительности: одни будут занимать несколько недель, другие — несколько месяцев. Хотя сторонняя оценка также может проводиться до развертывания и влиять на решения о нем, описанная здесь работа обычно носит более долгосрочный характер и не привязана к запуску: она предполагает углубленное изучение конкретных утверждений о безопасности на протяжении определенного времени.
При описании приоритетных направлений и принципов мы используем понятия утверждений о безопасности и обоснований безопасности. Под этими понятиями мы подразумеваем следующее:
Утверждение о безопасности: конкретное утверждение о возможностях, поведении или мерах защиты модели либо системы, которое касается ее безопасности и может быть проверено на основе фактических данных. В утверждении следует указывать рассматриваемые риски и условия, а также соответствующие допущения и ограничения.
Обоснование безопасности: подкрепленная фактическими данными структурированная аргументация, объясняющая, почему риски модели или системы надлежащим образом контролируются при выполнении определенной задачи, например обучении, оценке или развертывании. Обоснование безопасности связывает отдельные утверждения о безопасности с подтверждающими их данными и явно указывает допущения, неопределенности и сохраняющиеся риски, способные повлиять на выводы.
Мы предлагаем четыре приоритетных направления для углубленной оценки, а также принципы строгой, безопасной и независимой работы.
Независимая оценка обоснований безопасности, охватывающая обучение, оценку, внутреннее и внешнее развертывание.
Для оценки обоснований безопасности необходимы специальные знания в области согласования, методов контроля, таких как мониторинг, кибербезопасности, рисков злоупотребления ИИ в биологической и химической областях, а также red teaming. Обоснования безопасности состоят из утверждений, касающихся в том числе обучения, оценки возможностей и мер защиты. Их можно оценивать как в совокупности, так и по отдельности (см. приоритеты 2 и 3 ниже). Вероятно, разные части обоснований потребуется рассматривать нескольким экспертам с учетом их специализации. В совокупности их оценки должны отвечать на следующие вопросы:
Подтверждаются ли доказательствами обоснования безопасности обучения, оценки и развертывания? Соблюдались ли условия обоснования безопасности при обучении, оценке и развертывании?
Охватывают ли наши обоснования безопасности наиболее неотложные риски, выявленные в ходе оценки? Подтверждают ли утверждения о безопасности общее обоснование безопасности? Есть ли пробелы или возможности для улучшения?
Используются ли эффективные методы выявления и снижения стимулов при обучении, способных поощрять обман, манипуляцию системой вознаграждений, разрушительные действия или обход ограничений?
Оценка критически важных мер защиты при внутреннем и внешнем развертывании
Наш комплекс мер защиты постоянно развивается с учетом меняющихся возможностей и условий. Наши меры защиты охватывают обучение, внутреннее и внешнее развертывание. Сейчас они включают меры защиты на уровне модели, механизмы обеспечения соблюдения правил и меры безопасности, а также средства мониторинга рассогласования. Они охватывают широкий спектр рисков, включая потерю контроля и злоупотребления в сфере кибербезопасности, биологии и химии. Техническое партнерство позволяет уже сейчас выявлять слабые места в мерах защиты, одновременно совершенствуя методы оценки и ускоряя разработку стандартов. Это создает более надежную техническую основу для будущей государственной политики, направленной на управление темпами развития передового ИИ, особенно в области внутреннего развертывания, где стандарты безопасности и защиты пока только формируются.
Независимая оценка должна определять, насколько хорошо работают эти меры защиты и в чем они могут быть недостаточны, например:
При доступе по принципу «серого ящика» устойчивы ли меры защиты к состязательному тестированию (джейлбрейкам) и достаточно ли они защищают от повышения возможностей в областях высокого риска, например в сфере кибербезопасности и биологии? Охватывают ли наше состязательное тестирование и red teaming наиболее значимые риски?
Как агенты взаимодействуют с механизмами киберзащиты, такими как контроль доступа, изолированные среды и системы обнаружения и реагирования, при санкционированном тестировании в реалистичных условиях эксплуатации? Какие средства защиты предотвращают, обнаруживают или сдерживают вредоносные действия и в каких случаях они не справляются?
Есть ли в наших средствах мониторинга рассогласования критические пробелы, способные привести к потере контроля или серьезному рассогласованию при внутреннем либо внешнем развертывании? Насколько надежен мониторинг цепочки рассуждений (CoT) как источник данных о безопасности или согласовании по мере расширения возможностей моделей?
Внедрен ли надлежащий мониторинг во всех соответствующих процессах обучения, оценки и развертывания таким образом, чтобы его нельзя было легко отключить?
Соответствуют ли реализованные меры защиты уровню возможностей?
Анализ проверок возможностей ИИ в категориях рисков готовности (химические и биологические угрозы, кибербезопасность, самосовершенствование ИИ), а также оценок безопасности на предмет выхода системы из-под контроля
Наша Программа готовности требует проводить оценку ключевых областей пограничных рисков. По мере того как пороговые значения преодолеваются, а текущие проверки достигает предела чувствительности (насыщаются), важно регулярно обновлять их. Это необходимо для обеспечения качества и полноты как тестов, оценивающих опасные возможности ИИ в зонах риска готовности, так и проверок на контролируемость, направленных на выявление критических рисков непредсказуемого поведения.
К числу соответствующих вопросов относятся:
В достаточной ли мере процедуры оценки рисков Программы готовности охватывают определение порогового значения соответствующего риска? Правильно ли установлены пороговые значения для этих оценок?
Обновляются ли оценочные процедуры, когда модели стабильно получают максимальные баллы, и позволяют ли новые тесты содержательно измерять более продвинутые возможности?
Обеспечивают ли наши проверки на согласование достаточный охват критических рисков выхода ИИ из-под контроля, и какие важные сценарии поведения или условия они могут упускать?
Независимое расследование критических инцидентов рассогласования
Независимое расследование может быть полезно при различных критических инцидентах, связанных с безопасностью ИИ. Здесь мы рассматриваем рассогласование моделей, в том числе их несанкционированные действия или уклонение от надзора. Такие случаи могут выявить недостатки методов согласования и мер защиты даже при отсутствии намеренного злоупотребления.
В отдельных обстоятельствах, как в случае инцидента OpenAI с Hugging Face, может быть полезно привлечь независимую стороннюю организацию для проведения независимого расследования инцидента рассогласования. Крайне важно, чтобы сторонние организации, участвующие в расследовании инцидента, обладали необходимыми компетенциями. В зависимости от ситуации к ним относятся знания в области компьютерной криминалистики и согласования, опыт масштабного анализа цепочек рассуждений (CoT), а также наличие персонала и ресурсов для своевременного проведения расследования. Реагирование на инцидент может предполагать доступ к чувствительным внутренним данным и данным сторонних организаций, поэтому публикация некоторых подробностей или доступ к ним могут быть ограничены. Результаты независимых расследований также могут использоваться в обосновании безопасности модели, предоставляя данные для проверки утверждений о ее согласовании и эффективности мер по устранению ранее выявленных сбоев.
При инцидентах рассогласования мы уделяем первоочередное внимание независимой оценке следующих вопросов:
Какое поведение модели или какие проблемы рассогласования наблюдались во время инцидента и каковы основные способствовавшие им факторы?
Смогут ли меры защиты и устранения последствий эффективно снизить риск подобных инцидентов в будущем?
Четко очерченная область оценки и взаимно согласованные утверждения: оценку следует начинать с взаимного согласования ее области, после чего необходимо четко определить и предварительно зарегистрировать утверждения о безопасности до начала оценочных мероприятий. Сторонним организациям и лабораториям следует уточнить, выдвигает ли оцениваемая компания эти утверждения для проверки либо сторонний эксперт намерен оценить их независимо, а лаборатория согласна пройти оценку на их соответствие. Некоторые утверждения могут не входить в область оценки по многим причинам, включая невозможность предоставить сторонним организациям доступ к данным, недостаточную компетентность эксперта или обоснованные ограничения по времени при срочной оценке. Лабораториям и экспертам следует установить порядок рассмотрения значительных рисков, выявленных за пределами исходной области оценки, в том числе определять необходимость дальнейшего расследования. В выводах должно быть ясно указано, что оценивалось, а что нет в рамках взаимно согласованной области.
Соразмерный доступ: по возможности экспертам следует предоставлять соразмерный доступ для оценки согласованных утверждений с учетом правовых требований, требований безопасности и ограничений в области интеллектуальной собственности. Если прямой доступ непрактичен или невозможен, эксперты могут работать с назначенным представителем компании либо использовать механизмы непрямого доступа или доступа с сохранением конфиденциальности для защиты исходной информации.
Прозрачность методологии и стандартов: экспертам следует разъяснять свои методы, критерии оценки и имеющиеся неопределенности, опираясь по возможности на установленные стандарты. Если стандартов пока нет, следует четко обосновывать применяемые критерии. В отчетах следует отделять непосредственные результаты от их интерпретации, объяснять неопределенность и четко указывать, какие выводы подтверждаются фактическими данными.
Компетентность и независимость: эксперты должны подтверждать наличие соответствующей технической компетенции, а также выявлять, раскрывать и урегулировать организационные и личные конфликты интересов, включая финансовые стимулы, отношения с разработчиками и предыдущее участие в оцениваемой работе. Меры защиты должны исключать влияние коммерческого давления и условий вознаграждения на результаты. Они могут предусматривать самоотвод или надлежащие периоды отстранения.
Безопасность и конфиденциальность: эксперты должны продемонстрировать соблюдение правил информационной безопасности и обеспечить юридически обязательную защиту конфиденциальности, распространяющуюся на их персонал и соразмерную чувствительности систем и доступной информации. Такая защита должна распространяться на интеллектуальную собственность, конфиденциальную информацию и материалы оценки. Если эксперты не могут выполнить требования безопасности в собственной среде или получают доступ к особо конфиденциальным данным, целесообразно организовать работу на устройствах либо в помещениях под управлением компании.
Практически применимые результаты и срок устранения недостатков: оценка должна выявлять конкретные пробелы и предоставлять лабораториям достаточно сведений для их устранения. Когда это уместно, лабораториям следует предоставлять разумный срок для устранения проблем до публикации. При необходимости в отчетах также следует разъяснять выводы для разработчиков, организаций, развертывающих агентов, и специалистов по защите, сопровождая их практическими рекомендациями по реализации.
Ответственный подход к публикации: отчёты об оценке должны основываться на фактических данных и публиковаться максимально открыто, при этом обеспечивая защиту чувствительной и конфиденциальной информации. Если полное публичное раскрытие невозможно, конфиденциальное предоставление отчётов соответствующим надзорным органам, например органам управления или советам директоров компаний, может способствовать подотчётности. Для сохранения баланса между независимостью и конфиденциальностью должны быть предусмотрены обоснованные меры и правила сокрытия чувствительной информации, а также чёткий порядок предоставления обратной связи и исправления неточностей. Эксперты должны сохранять редакционную независимость, обеспечивая при этом конфиденциальность и защиту интеллектуальной собственности. Следует установить чёткие правила сокрытия информации, позволяющие лабораториям запрашивать удаление чувствительных сведений из отчётов. При этом эксперты могут указывать, где были сделаны существенные изъятия и как они повлияли на отчёт об оценке.
Мы намерены поддерживать независимых экспертов и содействовать созданию более четких единых международных стандартов эффективной сторонней оценки — как посредством будущих законов, так и через частные институты управления. Экосистема независимой оценки продолжает развиваться, и мы будем содействовать этому, поддерживая разноплановое сообщество независимых экспертов с глубокими знаниями по различным вопросам безопасности передовых технологий. Ни одна сторонняя организация не может и не должна всесторонне охватывать все неотложные вопросы безопасности передовых технологий. Мы будем планомерно и целенаправленно расширять свои возможности и помогать растущей экосистеме сторонних организаций согласовывать передовые методы и принципы. Мы обсуждаем с несколькими сторонними организациями предложения, соответствующие указанным выше приоритетным направлениям.


