Обзор безопасности: GPT‑6 Astra
Загрузка…
Сегодня мы выпускаем GPT‑6 Astra — самую мощную модель из всех, которые мы когда-либо широко внедряли. Astra — наша первая модель, достигшая критического уровня возможностей в области кибербезопасности по Программе готовности.
Вот что важнее всего знать о безопасности этого продукта:
- GPT‑6 Astra сделала значительный шаг вперед в области кибервозможностей и достигла установленного нами критического порога. Это означает, что при наличии подходящих инструментов и доступа GPT‑6 Astra способна находить ранее неизвестные уязвимости и разрабатывать новые способы их эксплуатации во многих хорошо защищенных системах без участия человека на каждом этапе. Поэтому мы существенно усилили защиту от вредоносных действий модели в киберпространстве, независимо от того, вызваны ли они злоупотреблением или несогласованным поведением. Мы также приняли меры для защиты внутренних процессов разработки и развертывания Astra и аналогичных моделей, включая более строгую изоляцию, шифрование контрольных точек, всеобщий мониторинг полных траекторий, в том числе цепочек рассуждений (CoT), и процесс оценки согласованности, без прохождения которого внутреннее использование блокируется.
- GPT‑6 Astra значительно устойчивее своих предшественников. Благодаря новым методам обучения безопасности, повышающим устойчивость, GPT‑6 Astra значительно лучше противостоит джейлбрейкам, чем GPT‑5.6 Sol, в том числе на более длинных траекториях. Это подтверждают офлайн-тесты и наша программа тщательного внутреннего и внешнего тестирования на джейлбрейки с последующим устранением обнаруженных проблем. Для пользователей, отмеченных как потенциально высокорисковые, мы дополнительно обучили модель более консервативно определять границу отказа и охватывать более широкий спектр рисков двойного назначения. С помощью регрессионного тестирования мы проверяем устойчивость Astra к джейлбрейкам, обнаруженным на предыдущих этапах тестирования. Кроме того, для проверки улучшений мы провели новые раунды автоматизированного red teaming с применением наших новейших внутренних атакующих систем.
- GPT‑6 Astra лучше согласована, чем GPT‑5.6 Sol. Astra представляет собой значительный шаг вперед в согласовании моделей: улучшения охватывают все этапы — от состава данных предварительного обучения до выставления оценок при обучении с подкреплением. Мы публикуем результаты нового комплекса оценок согласованности(открывается в новом окне). Они показывают, что GPT‑6 Astra лучше соблюдает требования безопасности и остается в пределах предоставленных полномочий. При моделировании более чем на 54 000 внутренних задач Codex(открывается в новом окне) Astra также получила примерно вдвое меньше отметок о более серьезном несогласованном поведении, чем Sol.
- Мы широко внедряем систему мониторинга несогласованного поведения. Мы считаем согласование моделей главным средством предотвращения потенциально несогласованного поведения наших моделей. При этом мониторинг дает широкое представление о поведении передовых моделей и помогает выявлять возможности для дальнейшего улучшения согласованности и безопасности. Кроме того, мониторинг служит дополнительным уровнем защиты от выявленного несогласованного поведения. Поэтому, несмотря на значительные вычислительные затраты, мы также добавили мониторинг рассогласования для всех операций инференса с использованием инструментов при внешнем развертывании Astra. Эта система аналогична нашей внутренней инфраструктуре.
- Возможности мониторинга GPT‑6 Astra снизились по сравнению с GPT‑5.6 Sol. Мы тщательно исследовали возможности мониторинга(открывается в новом окне) и управляемость(открывается в новом окне) GPT‑6 Astra. Мы обнаружили, что GPT‑6 Astra лучше, чем GPT‑5.6 Sol, управляет собственной цепочкой рассуждений и реже включает в нее компрометирующую информацию. В состязательных условиях, когда мы побуждаем модель уклоняться от наших средств мониторинга, она может оставаться незамеченной при намеренном занижении возможностей в ходе оценивания и иногда обходить наши внутренние средства мониторинга, когда ее просят выполнить определенные задачи по саботажу(открывается в новом окне). Мы не обнаружили признаков стеганографических рассуждений в CoT — например, сокрытия рассуждений в обычном и на первый взгляд не связанном с ними тексте. Это указывает на то, что риск уклонения может быть в основном ограничен задачами, требующими менее сложных рассуждений.
- Эти результаты показывают, что в состязательных условиях модели класса Astra способны обходить наши средства мониторинга CoT. Пока эти выводы в основном основаны на состязательных оценках, то есть на ситуациях, когда мы поручаем модели уклоняться от мониторинга. При этом совокупные оценки согласованности показывают, что в целом Astra реже нарушает ограничения безопасности, чем GPT‑5.6 Sol.
- Тем не менее мы серьезно относимся к этой тенденции и продолжаем изучать полученные результаты и их последствия для возможности мониторинга моделей по мере роста их возможностей. OpenAI работает над сохранением и применением мониторинга цепочек рассуждений, а сохранение возможности мониторинга CoT является одной из ключевых целей исследовательской программы. В то же время эти результаты подчеркивают важность разработки методов аудита согласованности, не ограничивающихся анализом цепочки рассуждений модели.
- GPT‑6 Astra действует более ответственно при работе в интернете и профессиональных средах: она значительно устойчивее GPT‑5.6 Sol к инъекциям промптов. Мы также протестировали поведение модели в реалистичных сценариях работы в интернете и профессиональной работы за компьютером. По сравнению с GPT‑5.6 Sol модель значительно реже совершает несогласованные и потенциально разрушительные действия, например несанкционированные транзакции, потерю данных, получение избыточного доступа или обход средств контроля. Она также безопаснее обрабатывает вредоносные запросы в агентных сценариях, например просьбы помочь спланировать насильственное нападение или совершить мошенничество.
- GPT‑6 Astra значительно безопаснее в сценариях повышенного риска. GPT‑6 Astra безопаснее, чем GPT‑5.6 Sol, отвечает на сложные запросы из реальной эксплуатации и состязательного red teaming с участием людей. Astra демонстрирует улучшение по Парето: она безопаснее обрабатывает опасные запросы и реже без необходимости отказывает в безвредных запросах. Эти улучшения распространяются и на особо опасные сценарии, где риск причинения вреда возникает из общего контекста, а не из явно сформулированного запроса. Кроме того, Astra последовательнее применяет соответствующие возрасту ограничения безопасности для пользователей младше 18 лет.
Подробнее см. в полной системной карточке(открывается в новом окне).


