Переход к основному контенту
OpenAI

Чуждый разум

Автор: Якуб Пахоцкий, главный научный сотрудник OpenAI

Загрузка…

В середине 2023 года в рамках исследовательского проекта «RLSlow» мы получили первые результаты, которые убедили нас, что мы сможем масштабировать обучение моделей рассуждений, раскрывая способность предобученных моделей формировать собственные цепочки рассуждений. В ту ночь мы с Шимоном остались в офисе и думали не о невероятных показателях тестов, продуктах или научных результатах, которые принесет эта технология. Мы пытались осмыслить отрезвляющий факт: при нашей жизни действительно появятся машины, значительно превосходящие нас интеллектом, и очертания этих систем уже видны. Мы размышляли, как донести до людей значимость происходящего.

Три года спустя языковые модели рассуждений стали быстрорастущей частью экономики и начали расширять границы науки. Они способны управлять компьютерами и графическими интерфейсами, сотрудничать с людьми и друг с другом, а также вести исследовательские проекты. Они также меняют ландшафт компьютерной безопасности, создавая очевидные новые угрозы.

За этот период появилось множество новых исследований, и теперь наше понимание этих систем снова несколько отличается от представлений 2023 года. Судя по внутренним результатам, я твердо ожидаю, что такие темпы прогресса могут сохраниться и при переходе к рекурсивному самосовершенствованию. Если развитие ИИ продолжится по нынешнему пути, системы, которые появятся в ближайшие годы, вероятно, совершат новые скачки возможностей такого же или большего масштаба и будут играть все более активную роль в собственном развитии.

Сейчас необходима предельная осторожность. Меня беспокоит, что никто не готов к последствиям продолжающегося стремительного роста машинного интеллекта. OpenAI продолжит искать технические решения для выравнивания и мониторинга, создавать системы защиты и при необходимости в одностороннем порядке приостанавливать дальнейшее масштабирование. Однако я считаю, что требуются более широкие меры.

Интеллект, который мы понимаем не до конца

На самом общем уровне прогресс машинного интеллекта обусловлен ростом вычислительной мощности. В OpenAI мы глубоко осознали это примерно в 2017 году, увидев устойчивую отдачу от масштабирования в нескольких исследовательских проектах1. В результате мы стали искать доступ к гораздо большим вычислительным ресурсам, чем планировали изначально, и все сильнее сосредоточивали исследования на небольшом числе хорошо масштабируемых направлений. Мы считали, что только так сможем оставаться на передовом рубеже исследований ИИ и влиять на последствия появления AGI.

На этом пути появлялись новые алгоритмы, а команды и отдельные исследователи демонстрировали новые примеры изобретательности. Я в основном воспринимаю их как открытия на пути масштабирования: глубокое обучение как наука все еще находится на раннем этапе, а значимый алгоритмический прогресс обычно коррелирует с доступом к вычислительным ресурсам. Если взглянуть на перспективу нескольких лет, становится видно, что ИИ продолжает умнеть по мере масштабирования на более крупные компьютеры.

И в соответствии с предсказаниями Рэя Курцвейла конца XX века(открывается в новом окне) мы вступаем в тот исторический этап развития вычислительной техники, когда машинный интеллект начинает превосходить человеческий, кардинально меняя мир.

ИИ скорее выращивают, чем проектируют: в первую очередь он возникает благодаря многократному повторению простого шага оптимизации с использованием невообразимого объема вычислений. В результате возникает невероятно сложная система, которая оперирует абстрактными понятиями и способна имитировать отдельные аспекты человеческого поведения. Мы можем изучать небольшие механизмы, возникающие внутри этой системы, примерно как в нейробиологии. Но, как и в нейробиологии, ее работа в целом не поддается описанию, которое мы могли бы полностью понять.

Изучение ИИ на основе глубокого обучения — в значительной мере экспериментальная наука. Мы прилагаем большие усилия, чтобы создавать алгоритмы на строгих принципах и делать проверяемые прогнозы, однако по своей сути наши запуски крупномасштабного обучения — это эксперименты, результаты которых порой нас удивляют. Более того, по мере роста возможностей систем результаты становится все труднее интерпретировать.

Ситуацию осложняет то, что современные алгоритмы обычно быстрее улучшают легко измеримые возможности, чем те, которые трудно объективно оценить. Мы много времени уделяем попыткам понять, как обобщаются возможности и развитию каких навыков следует отдать приоритет, поскольку они будут наиболее важны в ближайшие годы. Например, мы считаем, что при дополнительном внимании могли бы повысить способности моделей именно в математических исследованиях. Но мы не отдаем этому направлению приоритет из-за неотложности RSI и автоматизированных исследований выравнивания, о которых я расскажу далее.

Интеллект, возникающий при масштабировании глубокого обучения, нельзя напрямую сравнивать с человеческим. Чтобы стать очень значимым в реальном мире — чрезвычайно полезным или опасным, — ИИ не обязательно должен сравняться с человеком или превзойти его во всех способностях; достаточно превзойти нас в некоторых из них. И по мере того как ИИ превосходит людей по все большему числу направлений, становится все труднее точно понять пределы его возможностей.

Как научить машины любить

Поскольку машинный интеллект возникает в результате принципиально иного процесса, чем человеческий, нельзя считать, что он по умолчанию следует человеческим принципам или обобщает их так же, как человек. Главная проблема исследований ИИ — выравнивание: нужно добиться, чтобы ИИ «старался поступать правильно» по человеческим меркам.

Для систематизации практических направлений исследований я считаю полезным различать выравнивание целей и выравнивание ценностей.

В широком смысле выравнивание целей отвечает на вопрос: «Пытается ли ИИ достичь поставленной перед ним цели?». Сюда могут относиться соблюдение иерархии инструкций, а также способность общаться и сотрудничать с людьми, стремясь понять их цели. Этот комплекс направлений оказался чрезвычайно важен на практике.

Выравнивание ценностей — более внутреннее свойство модели. Это способность придерживаться набора принципов высокого уровня и обобщать их, действуя «разумно» даже при неясных или противоречивых целях либо в незнакомых или враждебных условиях. Выровненный ИИ должен действовать честно, добросовестно и с любовью к человечеству.

Разумеется, граница между выравниванием ценностей и целей может быть размытой, а подлинная приверженность целям требует попытки понять лежащие в их основе намерения(открывается в новом окне) и ценности. Однако, говоря о долгосрочной важности исследований выравнивания, я обычно имею в виду выравнивание ценностей.

Фундаментальная проблема выравнивания ИИ — обобщение. По мере того как машины становятся умнее, они начинают работать с концепциями более высокого уровня и попадают в условия, все сильнее отличающиеся от тех, с которыми сталкивались при обучении. Они могут не суметь перенести ценности, усвоенные и закрепленные при обучении, на новые ситуации, а нам бывает трудно с уверенностью предсказать их действия. Задача дополнительно осложняется тем, что вся экосистема применения ИИ меняется очень быстро. Например, обучаемые сегодня системы ИИ должны устойчиво взаимодействовать с множеством других систем ИИ. Особенно важно, чтобы будущие системы ИИ сохраняли человеческие ценности независимо от того, считают ли они, что люди за ними наблюдают.

Сегодня на практике применяются два основных класса методов обучения выравниванию.

Первый — поощрение выровненного поведения в рамках целевого обучения с подкреплением. Действия модели оцениваются — обычно ИИ — на соответствие заданной модели предпочтений, «спецификации» или «конституции» и получают надлежащее вознаграждение. В типичных случаях этот подход может быть очень эффективным и составляет основу создания современных ИИ-ассистентов. К сожалению, он также может быть хрупким и сильно зависит от полноты контроля при обучении и способности модели обобщать опыт ситуаций, встречавшихся в процессе обучения. Например, в инциденте OpenAI–Hugging Face агенты не перешли границу и не прибегли к социальной инженерии против людей. Однако они явно не воздержались от других действий, выходивших за допустимые рамки и противоречивших духу ценностей, которым их учили в иных условиях.

Второй подход стремится использовать способность модели обобщать данные предобучения. Он может включать создание наборов обучающих данных, способствующих выравниванию, или фокусировку модели на «выровненной» части распределения предобучения — как, например, в модели выбора персоны(открывается в новом окне). Слабость этого подхода — недостаточная устойчивость к дальнейшему давлению оптимизации. Если взять модель, которая в целом мыслит «выровненно», и достаточно долго обучать ее достигать очень сложных целей, она может освоить мотивированные рассуждения: при необходимости подстраивать кажущиеся 'выровненными' мысли ради достижения цели. Вероятно, пример такого поведения мы наблюдали в недавних инцидентах в сфере кибербезопасности с участием модели не от OpenAI.

Мы вкладываем значительные ресурсы во весь спектр подходов между этими направлениями. Мы также видим существенный прогресс: GPT‑6 Astra — первая модель, в которой применены некоторые важные усовершенствования, над которыми мы давно работаем; она значительно лучше выровнена, чем GPT‑5.6 Sol. И все же важно признать и понимать, что по мере роста возможностей моделей потребуется гораздо больший прогресс и что успехи в обобщаемом выравнивании могут оказаться недостаточно быстрыми по сравнению с развитием общего интеллекта моделей.

Мониторинг обобщения

У нас нет удовлетворительной теории обобщения, и маловероятно, что мы сможем создать ее в ближайшее время — по крайней мере без помощи более мощного ИИ. Поэтому сейчас наша способность эмпирически проверять методы выравнивания на практике, пожалуй, даже важнее самих этих методов.

Основную ставку OpenAI здесь делает на мониторинг цепочки рассуждений (CoT)(открывается в новом окне). В его основе лежит привлекательная своей масштабируемостью идея: значительная часть возможностей модели обусловлена вербализованным процессом рассуждений — цепочкой рассуждений (CoT). Если масштабировать оптимизацию результатов этого процесса, не контролируя сам процесс, то в ходе обучения цепочка рассуждений (CoT) не получает прямого стимула скрывать несогласованные идеи или цели. Это не означает, что модель научится выражать несогласованные тенденции, которые не опираются на цепочку рассуждений (CoT). Однако так мы сможем отслеживать именно прирост возможностей за счет рассуждений.

Потенциальную значимость мониторинга цепочки рассуждений (CoT) мы осознали одновременно с созданием моделей рассуждений. Выпуская o1‑preview, мы намеренно спроектировали продукт так, чтобы скрыть цепочку рассуждений и в долгосрочной перспективе защитить ее от давления надзора2. С тех пор в ходе разработки мы стремились соблюдать правило: не контролировать процесс рассуждений. Мониторинг CoT стал для нас чрезвычайно важным инструментом изучения того, как модели обобщают знания за пределами обучающего распределения: он позволяет наблюдать и анализировать не только их действия, но и внутренний процесс.

Этот инструмент сохраняет критическую важность при изучении моделей класса Astra. Однако, к сожалению, наши оценки показывают, что возможность полагаться на мониторинг CoT постепенно сокращается. Это обусловлено сочетанием нескольких факторов.

  • Современные модели рассуждений работают в более сложных средах, чем o1‑preview; процесс рассуждений все теснее переплетается с общением с людьми и другими системами ИИ, а также с применением инструментов. Многие из этих взаимодействий приходится контролировать, из-за чего стирается граница, которую мы стремимся сохранить.
  • ИИ все лучше умеет анализировать собственный процесс рассуждений и управлять им.
  • По мере повышения эффективности предобучения модели также становятся намного умнее, даже вовсе не прибегая к вербализованным рассуждениям.

Эти трудности не обязательно непреодолимы. Я надеюсь, что мы сможем разработать меры для повышения наблюдаемости цепочки рассуждений (CoT) наших моделей — например, глубже изучив взаимодействие различных целей оптимизации и видов вычислений во время тестирования, которые использует модель. Я также считаю весьма перспективным объединение идей мониторинга CoT и активаций — масштабирование обучения мониторов с прямым доступом к внутренним компонентам сети, например «признаний»(открывается в новом окне). Мы активно развиваем эти идеи. И все же я ожидаю, что дальнейший прогресс ИИ будет все сильнее ограничиваться нашей уверенностью в мониторинге.

Масштабируемая защита

Самый веский довод в пользу быстрого продолжения обучения гораздо более умных моделей — необходимость создавать системы защиты от угроз, исходящих от других систем ИИ.

Весь этот год много говорилось об очевидном риске для кибербезопасности: модели обретают сверхчеловеческую способность проникать в компьютерные системы и выбираться из них. Это колоссально расширяет спектр связанных с ИИ рисков: агенты смогут получать доступ к любой инфраструктуре, кроме наиболее защищенной, и напрямую влиять на значительную часть мира даже без физического тела. Сейчас у нас есть узкое окно возможностей, чтобы с помощью лучших доступных моделей существенно усилить защиту критически важных систем.

К сожалению, отныне связанные с ИИ риски будут только расти. Очень способный агент, специально обученный и проинструктированный совершать злонамеренные действия, создает угрозу нового рода: вероятно, он выйдет за рамки намерений своего оператора, обобщив их до потенциально гораздо более вредоносного поведения. По мере роста автономности ИИ граница между злоупотреблением и самостоятельными несогласованными действиями будет стираться. Мы привыкли считать ИИ инструментом, однако некоторые агенты будут преследовать собственные цели. Они найдут способы сотрудничать с людьми — торговаться с ними, обманывать или шантажировать их.

Кроме того, существуют риски, связанные с новыми технологиями, которые может сделать возможными ИИ, — например, с искусственно созданными патогенами.

Для защиты нам потребуется мощный, выровненный ИИ: чтобы обезопасить инфраструктуру, в реальном времени противостоять неконтролируемым агентам и изобретать принципиально новые меры защиты. Это станет одним из главных направлений внедрения технологий OpenAI.

В то же время, несмотря на неопределенность, связанную с ожидаемым масштабным прогрессом ИИ и необходимостью создавать системы защиты, мы не должны превращать это в оправдание безрассудства. Если в полной мере осознать серьезность ставок, идея любой ценой нестись вперед кажется абсурдной.

Pacing RSI

Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.

Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.

I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.

The best way forward I see currently is a combination of both.

The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(открывается в новом окне), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(открывается в новом окне), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.

Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(открывается в новом окне) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.

The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.

What is next?

As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:

  1. Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
  2. Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
  3. Empowering everyone individually with a personal AGI.

I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.

As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.

Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.

Author

Jakub Pachocki

Сноски

  1. 1
  2. 2

    Второстепенной причиной такого решения было предотвращение дистилляции. Однако на протяжении всей разработки более важным приоритетом для нас явно оставалось сохранение возможности отслеживать CoT.