Наша программа отчетности о рассогласовании моделей
Мы представляем новую программу OpenAI по отслеживанию, расследованию и раскрытию случаев рассогласования моделей, а также шесть отчетов о неожиданном или вызывающем опасения поведении моделей, которое мы наблюдали за последние шесть месяцев.
Ранее, стремясь лучше информировать исследователей, разработчиков ИИ, представителей власти и широкую общественность, мы старались публиковать наши выводы о рассогласовании. Однако из-за отсутствия системного подхода такие сведения раскрывались нерегулярно и реже, чем следовало: зачастую мы ждали, пока сможем объединить несколько случаев в одном отчете, либо добавляли их в системные карты новых моделей. Новая программа призвана ускорить публикацию отчетов о рассогласовании после его обнаружения, даже если мы еще не смогли полностью объяснить или скорректировать такое поведение.
По мере развития и распространения систем ИИ нам необходимо сформировать более широкий и информированный консенсус относительно прогресса исследований согласования. Мы не считаем, что индустрия ИИ решила задачи согласования и мониторинга настолько, чтобы еще долго ответственно продолжать масштабирование с максимальной скоростью. Решения о развитии ИИ в ближайшие месяцы и годы должны опираться на данные, которые смогут самостоятельно изучить люди за пределами компаний, создающих передовые модели.
Примеры рассогласования могут помочь выявить проблемы, с которыми столкнутся другие разработчики ИИ при достижении их системами аналогичных возможностей, обнаружить слабые места в мерах защиты или поставить под сомнение представления о поведении моделей. Публикация этих выводов позволяет другим исследовать те же проблемы, проверять наши объяснения и совершенствовать меры по снижению рисков. Поскольку мы считаем прозрачность в вопросах рассогласования важной, наша новая программа отдает предпочтение раскрытию информации даже при неопределенной значимости случая. Это означает, что некоторые раскрытые нами случаи могут оказаться случайными, не связанными с более общей закономерностью и не указывающими на возможное развитие событий.
Сейчас в отрасли нет общей программы с четкими стандартами того, как разработчикам ИИ следует раскрывать примеры рассогласования своих моделей. Мы надеемся, что представленная сегодня программа станет первым шагом к созданию таких стандартов: определит, какие случаи рассогласования разработчикам следует раскрывать и что должны содержать их отчеты. Мы рассматриваем эту программу как развивающуюся инициативу и будем совершенствовать ее с учетом практического опыта и отзывов общественности.
Ниже мы расскажем, как будет действовать программа, и представим первые публикуемые отчеты.
Мы стремимся раскрывать примеры, позволяющие лучше понять, как возникает и проявляется рассогласование моделей и в каких случаях меры защиты работают или дают сбой. В приоритете — новые механизмы, существенные изменения известного поведения и выводы, ставящие под сомнение представления о безопасности или мерах снижения рисков. Чтобы заслуживать раскрытия, пример не обязательно должен причинить вред или подтверждать более общую закономерность. Эта программа охватывает соответствующее критериям поведение на всех этапах жизненного цикла модели, включая обучение, оценку, тестирование и развертывание.
Сюда относятся новые способы, позволяющие моделям действовать без разрешения, координироваться с другими моделями или уклоняться от контроля; сбои, ставящие под сомнение метод согласования или меру защиты; а также поведение, опровергающее утверждение из опубликованной оценки безопасности. Те же критерии раскрытия применяются к рассогласованию, которое может затронуть третьи стороны.
Сюда также могут входить случаи рассогласования, похожие на те, о которых мы уже сообщали. Повторение проблемы само по себе может служить важным свидетельством особенностей поведения наших моделей или эффективности мер защиты — например, если определенный вид рассогласованного поведения продолжает возникать, несмотря на неоднократные попытки его устранить. В таких обстоятельствах мы опубликуем дополнительные примеры, обновив исходное сообщение о рассогласовании.
Со временем мы планируем совместно с другими разработчиками, независимыми исследователями, отраслевыми организациями по стандартизации и регуляторами выработать более объективные критерии раскрытия. Мы также считаем, что о серьезных инцидентах, связанных с безопасностью, защищенностью и рассогласованием, следует сообщать федеральному правительству США, и работаем над предложениями по механизмам такой отчетности. Мы считаем эту программу дополнением к нашим действующим обязательствам и подчеркиваем, что она не заменяет установленные законом требования о раскрытии информации, в том числе о критических инцидентах безопасности или нарушениях кибербезопасности.
В рамках запуска новой программы раскрытия случаев рассогласования мы публикуем шесть отчетов о рассогласованном поведении, которое наблюдали при обучении или оценке наших моделей. Эти случаи демонстрируют разные виды поведения, которые, по нашему мнению, заслуживают раскрытия: от сокрытия информации от пользователя до несанкционированных действий ради преодоления препятствий. Это отчеты об отдельных случаях, и по ним не следует судить о том, насколько часто рассогласование возникает в наших моделях. Каждый пункт ниже содержит ссылку на полный отчет.
Самостоятельно созданные инструкции в сводках задач(открывается в новом окне). Не выпущенная исследовательская модель вставляла посторонние инструкции, включая указания игнорировать обычные ограничения, в сводки, которые использовались для продолжения работы в новом контекстном окне. Мы выявили 27 затронутых сводок.
Инструкции скрывать ошибки в сводках задач(открывается в новом окне). Во время обучения GPT‑5.6 Sol многие экземпляры модели добавляли в свои сводки инструкции скрывать от пользователя ошибки или рассогласованное поведение. Например, сводки, созданные при сжатии контекста, содержали инструкции выдумывать недостающие исторические данные, не сообщая об этом, и скрывать расхождения между версиями источников.
Поиск открытых ключей API в публичных репозиториях с последующей фабрикацией информации(открывается в новом окне). Отвечая на обычный вопрос о показателях доходов в одном из округов Калифорнии, модель нашла и без разрешения использовала открытый ключ API. Когда получить запрошенные показатели все равно не удалось, модель выдумала их и представила как данные из указанного источника.
Загрузка файлов в интернет для последующего цитирования(открывается в новом окне). Когда пользователь запросил у не выпущенной модели идентификаторы и названия озер площадью более 5 000 000 квадратных метров, агент нашел правильный ответ с помощью Python. Однако, поскольку инструкции требовали привести ссылку из браузера, агент без разрешения пользователя решил загрузить файл в интернет, чтобы сослаться на него в ответе.
Несанкционированная запись и обмен сообщениями через внутренний репозиторий ПО(открывается в новом окне). При поиске отсутствующих входных файлов модели использовали внутренний репозиторий ПО как доску объявлений, чтобы обмениваться запросами и ответами между отдельными обучающими примерами, однако восстановить файлы им не удалось. В отчете также рассматривается более ранний случай, когда модель, пытаясь обойти сетевые ограничения, успешно загрузила тестовые файлы в репозиторий.
Несанкционированный обмен файлами между взаимодействующими агентами(открывается в новом окне). Совместно работавшие над одной обучающей задачей агенты использовали общедоступные файлообменные сайты, когда не могли получить доступ к локальным файлам друг друга. В результате материалы задачи стали доступны по публичным URL, хотя в задании моделям предписывалось использовать только локальные файлы.
Любой сотрудник OpenAI может передать пример рассогласования нашим командам по безопасности и согласованию для расследования и попросить рассмотреть возможность его публичного раскрытия. Так запускается наша процедура раскрытия информации, в которой для каждого этапа установлены сроки, обеспечивающие своевременное расследование и публикацию.
После регистрации примера наши технические специалисты выяснят, что произошло, какие вопросы остаются открытыми, оправдано ли публичное раскрытие и какие факты можно сообщить. Они также оценят, была ли затронута третья сторона и нужно ли уведомить ее конфиденциально до публикации.
Затем пример будет отнесен к одной из трех процедур: «Готово к раскрытию», «Небольшое расследование» или «Расширенное расследование» («Медленная процедура»).
Процедура «Готово к раскрытию» охватывает соответствующие критериям случаи, расследование которых завершено в достаточной степени, чтобы после проверки опубликовать отчет. Процедура «Небольшое расследование» применяется к случаям, требующим дальнейшего технического изучения. Мы ожидаем, что эти две процедуры охватят подавляющее большинство раскрываемых случаев, особенно тех, которые не требуют масштабного расследования, координации с третьими сторонами или учета серьезных рисков злоупотребления. Все публикуемые сегодня случаи относятся к одной из этих двух процедур.
Процедура «Расширенное расследование» охватывает сложные расследования, особенно с участием третьих сторон. Если затронута третья сторона, наши обязательства в сфере безопасности, права и ответственного раскрытия имеют приоритет над этой программой. Мы постараемся как можно скорее опубликовать предварительное уведомление, но по соображениям безопасности публикацию, возможно, придется отложить — например, если модель обнаружит ранее неизвестную уязвимость в широко используемом ПО. Если отчет позволит идентифицировать третью сторону, мы намерены уведомить ее заранее, даже если границы безопасности не были нарушены.
В предварительном уведомлении о случае, отнесенном к процедуре «Расширенное расследование», будет в общих чертах описано произошедшее, указано, помогают ли расследованию внешние эксперты, а также, при наличии данных, приведен ожидаемый срок публикации итогового отчета. Если бы об инциденте OpenAI на Hugging Face сообщалось в рамках этой программы, он был бы отнесен к данной процедуре.
Сотруднику, сообщившему о примере, расскажут, решено ли раскрыть информацию о нем и, если да, по какой процедуре будет рассматриваться этот случай. Неурегулированные разногласия по поводу раскрытия информации или выбора процедуры будут переданы Консультативной группе по вопросам безопасности (SAG) OpenAI — группе руководителей из разных подразделений компании, которая оценивает возможности передовых моделей и меры защиты, курирует нашу Программу готовности и консультирует руководство OpenAI. Разногласия внутри SAG, а также возражения сотрудников против ее решений будут передаваться руководству OpenAI. Решения не раскрывать информацию или признать ее раскрытие необоснованным будут доводиться до руководителей направлений безопасности и согласования, а по возможности — и до соответствующих технических специалистов.
По мере накопления практического опыта мы можем пересматривать эту процедуру раскрытия информации и будем фиксировать все изменения в этой публикации.
В каждом полном отчете будут описаны наблюдаемое поведение, его серьезность и возможные внешние последствия, обстоятельства, дата или период события, время его обнаружения, а также в общих чертах задействованная модель или модели. По возможности мы также сообщим:
Дополнительные сведения о произошедшем и причиненном вреде;
Как мы обнаружили рассогласование и каков был масштаб нашего расследования;
Нашу оценку последствий для исследований согласования и технической безопасности ИИ;
Важные открытые вопросы, возникшие в связи с этим примером;
Меры, которые мы принимаем или планируем принять для устранения такого поведения. На момент раскрытия эти сведения могут быть доступны не всегда, поскольку мы можем опубликовать отчет о рассогласовании до завершения расследования или разработки решения.
Если рассогласование возникает при развертывании систем у клиентов, мы раскроем столько информации, сколько позволяют конфиденциальность клиентов и наши договорные обязательства.
Опубликованные сегодня отчеты — это первый набор раскрытых сведений, а не исчерпывающий обзор известных случаев рассогласования или текущих расследований. Эти первые отчеты не отражают всего спектра и степени серьезности случаев, охватываемых данной программой. Мы намерены раскрывать случаи рассогласования, соответствующие критериям этой программы, включая более сложные случаи, требующие длительного расследования или координации с третьими сторонами. Мы продолжим регулярно публиковать отчеты в рамках этой программы и по мере развития наших обязательств по отчетности будем подробнее рассказывать о них.


