Переход к основному контенту
OpenAI
Загрузка…

Сегодня мы выпускаем GPT‑6 Astra — самую мощную модель из всех, которые мы когда-либо широко внедряли. Astra — наша первая модель, достигшая критического уровня возможностей в области кибербезопасности по Программе готовности.

Вот что важнее всего знать о безопасности этого продукта:

  1. GPT‑6 Astra сделала значительный шаг вперед в области кибервозможностей и достигла установленного нами критического порога. Это означает, что при наличии подходящих инструментов и доступа GPT‑6 Astra способна находить ранее неизвестные уязвимости и разрабатывать новые способы их эксплуатации во многих хорошо защищенных системах без участия человека на каждом этапе. Поэтому мы существенно усилили защиту от вредоносных действий модели в киберпространстве, независимо от того, вызваны ли они злоупотреблением или несогласованным поведением. Мы также приняли меры для защиты внутренних процессов разработки и развертывания Astra и аналогичных моделей, включая более строгую изоляцию, шифрование контрольных точек, всеобщий мониторинг полных траекторий, в том числе цепочек рассуждений (CoT), и процесс оценки согласованности, без прохождения которого внутреннее использование блокируется.
  2. GPT‑6 Astra значительно устойчивее своих предшественников. Благодаря новым методам обучения безопасности, повышающим устойчивость, GPT‑6 Astra значительно лучше противостоит джейлбрейкам, чем GPT‑5.6 Sol, в том числе на более длинных траекториях. Это подтверждают офлайн-тесты и наша программа тщательного внутреннего и внешнего тестирования на джейлбрейки с последующим устранением обнаруженных проблем. Для пользователей, отмеченных как потенциально высокорисковые, мы дополнительно обучили модель более консервативно определять границу отказа и охватывать более широкий спектр рисков двойного назначения. С помощью регрессионного тестирования мы проверяем устойчивость Astra к джейлбрейкам, обнаруженным на предыдущих этапах тестирования. Кроме того, для проверки улучшений мы провели новые раунды автоматизированного red teaming с применением наших новейших внутренних атакующих систем.
  3. GPT‑6 Astra лучше согласована, чем GPT‑5.6 Sol. Astra представляет собой значительный шаг вперед в согласовании моделей: улучшения охватывают все этапы — от состава данных предварительного обучения до выставления оценок при обучении с подкреплением. Мы публикуем результаты нового комплекса оценок согласованности(открывается в новом окне). Они показывают, что GPT‑6 Astra лучше соблюдает требования безопасности и остается в пределах предоставленных полномочий. При моделировании более чем на 54 000 внутренних задач Codex(открывается в новом окне) Astra также получила примерно вдвое меньше отметок о более серьезном несогласованном поведении, чем Sol.
  4. Мы широко внедряем систему мониторинга несогласованного поведения. Мы считаем согласование моделей главным средством предотвращения потенциально несогласованного поведения наших моделей. При этом мониторинг дает широкое представление о поведении передовых моделей и помогает выявлять возможности для дальнейшего улучшения согласованности и безопасности. Кроме того, мониторинг служит дополнительным уровнем защиты от выявленного несогласованного поведения. Поэтому, несмотря на значительные вычислительные затраты, мы также добавили мониторинг рассогласования для всех операций инференса с использованием инструментов при внешнем развертывании Astra. Эта система аналогична нашей внутренней инфраструктуре.
  5. Возможности мониторинга GPT‑6 Astra снизились по сравнению с GPT‑5.6 Sol. Мы тщательно исследовали возможности мониторинга(открывается в новом окне) и управляемость(открывается в новом окне) GPT‑6 Astra. Мы обнаружили, что GPT‑6 Astra лучше, чем GPT‑5.6 Sol, управляет собственной цепочкой рассуждений и реже включает в нее компрометирующую информацию. В состязательных условиях, когда мы побуждаем модель уклоняться от наших средств мониторинга, она может оставаться незамеченной при намеренном занижении возможностей в ходе оценивания и иногда обходить наши внутренние средства мониторинга, когда ее просят выполнить определенные задачи по саботажу(открывается в новом окне). Мы не обнаружили признаков стеганографических рассуждений в CoT — например, сокрытия рассуждений в обычном и на первый взгляд не связанном с ними тексте. Это указывает на то, что риск уклонения может быть в основном ограничен задачами, требующими менее сложных рассуждений.
    • Эти результаты показывают, что в состязательных условиях модели класса Astra способны обходить наши средства мониторинга CoT. Пока эти выводы в основном основаны на состязательных оценках, то есть на ситуациях, когда мы поручаем модели уклоняться от мониторинга. При этом совокупные оценки согласованности показывают, что в целом Astra реже нарушает ограничения безопасности, чем GPT‑5.6 Sol.
    • Тем не менее мы серьезно относимся к этой тенденции и продолжаем изучать полученные результаты и их последствия для возможности мониторинга моделей по мере роста их возможностей. OpenAI работает над сохранением и применением мониторинга цепочек рассуждений, а сохранение возможности мониторинга CoT является одной из ключевых целей исследовательской программы. В то же время эти результаты подчеркивают важность разработки методов аудита согласованности, не ограничивающихся анализом цепочки рассуждений модели.
  6. GPT‑6 Astra действует более ответственно при работе в интернете и профессиональных средах: она значительно устойчивее GPT‑5.6 Sol к инъекциям промптов. Мы также протестировали поведение модели в реалистичных сценариях работы в интернете и профессиональной работы за компьютером. По сравнению с GPT‑5.6 Sol модель значительно реже совершает несогласованные и потенциально разрушительные действия, например несанкционированные транзакции, потерю данных, получение избыточного доступа или обход средств контроля. Она также безопаснее обрабатывает вредоносные запросы в агентных сценариях, например просьбы помочь спланировать насильственное нападение или совершить мошенничество.
  7. GPT‑6 Astra значительно безопаснее в сценариях повышенного риска. GPT‑6 Astra безопаснее, чем GPT‑5.6 Sol, отвечает на сложные запросы из реальной эксплуатации и состязательного red teaming с участием людей. Astra демонстрирует улучшение по Парето: она безопаснее обрабатывает опасные запросы и реже без необходимости отказывает в безвредных запросах. Эти улучшения распространяются и на особо опасные сценарии, где риск причинения вреда возникает из общего контекста, а не из явно сформулированного запроса. Кроме того, Astra последовательнее применяет соответствующие возрасту ограничения безопасности для пользователей младше 18 лет.