Стандарты для следующего этапа развития ИИ
Наша миссия — сделать так, чтобы общий искусственный интеллект приносил пользу всему человечеству. Как недавно отметили Сэм Альтман и Якуб Пахоцкий, в работе над этой миссией мы выделяем три основные цели:
Успешно пройти следующий этап развития ИИ: создать автоматизированного ИИ-исследователя, с его помощью последовательно решать проблему согласования и искать способы сохранить участие людей в цикле самосовершенствования.
Сделать доступными преимущества научного прогресса и экономического роста, которые обеспечивают высокоинтеллектуальные машины.
Предоставить каждому человеку персональный AGI.
ИИ ускоряет наши исследования и инженерные разработки, а исследования с применением ИИ уже привели к достижениям в математике, в том числе в решении проблемы тысячелетия Навье — Стокса. Этот прогресс открывает большие перспективы и для двух других наших целей: он может привести к важным открытиям в медицине, сделать здравоохранение общедоступным и расширить экономические возможности малых предприятий и индивидуальных предпринимателей по всему миру.
ИИ развивается во многих компаниях и странах, и общий прогресс в этой области меняет возможности и задачи, с которыми сталкивается каждый. Помимо прочих преимуществ, функциональный и согласованный ИИ поможет нам пройти этот переходный этап: укрепить защиту, продвинуть исследования в области согласования, а также помочь людям понять и направлять следующие этапы развития ИИ.
Чтобы безопасно пройти этот переходный этап, исследования в области согласования должны не отставать от развития возможностей ИИ. Тогда создаваемые нами и другими организациями системы останутся согласованными с человеческими ценностями и подконтрольными людям. Это становится всё важнее по мере того, как системы ИИ приобретают больше возможностей и автономности, в том числе берут на себя всё большую часть исследований и разработок в области самого ИИ. Чтобы дальнейшее развитие ИИ оставалось безопасным и полезным, необходимы как новые достижения в исследованиях согласования, так и общие стандарты, направляющие разработки в разных лабораториях и странах.
Автоматизированные исследования ИИ могут проходить с разной степенью контроля со стороны человека. По мере того как системы ИИ берут на себя всё больше работы по созданию следующих поколений ИИ, они могут всё активнее обеспечивать процесс рекурсивного самосовершенствования (RSI), даже при сохранении участия людей. По мере автоматизации этого процесса темпы развития ИИ могут резко возрасти.
Мы считаем, что автоматизированные исследования ИИ позволят создать модели, которые будут напрямую улучшать жизнь людей. Они могут снизить стоимость передового интеллекта, чтобы его преимуществами могли пользоваться люди по всему миру. Автоматизированные исследования также могут помочь нам существенно улучшить согласование и создать защиту от всё более функционального ИИ: автоматизированный ИИ-исследователь может одновременно заниматься исследованиями в области безопасности ИИ. Более функциональные и согласованные системы могут помочь защитить критическую инфраструктуру, противостоять опасным ИИ-агентам и разработать новые меры защиты.
Сегодня полностью автономного RSI не существует, и нам не следует стремиться к нему, пока не появится возможность обеспечить его безопасность. Решения о том, следует ли и каким образом двигаться дальше, должны зависеть от нашей способности сохранять контроль человека и от осознанного демократического выбора(открывается в новом окне) с учётом преимуществ и рисков. Без должной осмотрительности и осторожности RSI может привести к тому, что люди утратят фактический контроль над развитием ИИ и не смогут контролировать исследовательские процессы, которых больше не понимают. В результате ИИ может стать более опасным, менее согласованным и в целом представлять угрозу для людей. Хотя раскрытый нами инцидент с Hugging Face не был прямым следствием RSI, он показывает, насколько серьёзнее могут стать подобные риски без надёжных мер защиты и согласования.
Международные стандарты безопасности при разработке передового ИИ могут быть не менее важны для управления темпами развития передовых технологий, чем сами исследования в области согласования. Стандарты позволяют выработать общие определения качественных доказательств и согласовать базовые требования к строгости технических мер защиты. Иными словами, они помогают ответить на вопрос: «Как должен выглядеть эффективный подход к снижению катастрофического риска, связанного с ИИ?»
В этом могут помочь существующие демократические институты, такие как Центр стандартов и инноваций в области ИИ (CAISI), законы штатов и федеральная система регулирования ИИ, а также новые формы государственно-частного партнёрства(открывается в новом окне). Однако разработка и внедрение ИИ идут во многих странах, технология распространяется по всему миру, и её последствия, вероятно, рано или поздно в той или иной форме ощутит каждый.
Поэтому для решения ряда ключевых задач необходимы международные усилия по разработке стандартов:
Фрагментация — принятые разными странами методы оценки, требования к отчётности и определения инцидентов могут противоречить друг другу. Это затруднит сопоставление доказательств, понимание новых возможностей и реагирование на трансграничные риски.
Совместные действия — если каждая страна действует самостоятельно, результат может оказаться нежелательным для всех. RSI способен ускорить сами исследования ИИ — возможно, настолько, что наша общая способность понимать прогресс, оценивать риски и сохранять действенный контроль человека не будет за ним поспевать.
Неравномерное распределение возможностей — разработки передового уровня и соответствующие экспертные знания распределены по миру неравномерно. Это усугубляет обе описанные выше проблемы.
Эти проблемы относятся как к открытым, так и к закрытым моделям.
Подчеркнём: любая лаборатория ИИ, которая занимается автоматизированными исследованиями ИИ или другими передовыми технологиями, обязана отвечать за их безопасное развитие в соответствии с основными принципами личной ответственности и действующим законодательством. Наши доводы в пользу стандартов основаны на стремлении избежать концентрации власти и добиться лучших практических результатов. Стандарты позволят более широкому кругу заинтересованных сторон за пределами лабораторий участвовать в определении пути развития этой технологии. Они также сформируют прозрачный набор принципов, на который можно будет опираться независимо от методов работы конкретной лаборатории. Кроме того, сотрудничество сторон в решении перечисленных выше задач, скорее всего, позволит добиться лучших результатов.
Именно поэтому мы считаем, что Соединённые Штаты должны возглавить совместную работу со странами мира по разработке глобальных технических стандартов для передового ИИ, включая RSI.
Мы ожидаем, что со временем эта концепция значительно изменится, однако два аспекта останутся принципиально важными.
Один из способов добиться этого — задействовать формирующуюся сеть институтов безопасности ИИ, включая уже созданные в Австралии, Канаде, Германии, Франции, Кении, Японии, Корее, Сингапуре, Индии и Великобритании. Через CAISI и национальные отраслевые организации эта сеть могла бы содействовать разработке стандартов, уделяя особое внимание: (1) моделям и разработчикам передового ИИ, оцениваемым по показателям возможностей; (2) управлению преимуществами и рисками автоматизированных исследований ИИ, включая RSI. Соединённые Штаты могут развить инициативу CAISI, создавшего в 2024 году Международную сеть измерений, оценки и научных исследований передового ИИ(открывается в новом окне), которая объединила государственные учреждения для сотрудничества в этих областях.
Разработанные в рамках этой инициативы стандарты сформируют общую техническую основу для измерения и оценки возможностей, анализа рисков и определения достаточности мер защиты. Эти технические стандарты не будут лицензиями, обязательной проверкой перед выпуском или требованиями об одобрении моделей ИИ. Национальные правительства будут самостоятельно решать, включать ли эти стандарты в свои правовые системы и каким образом.
Эта работа также должна способствовать развитию конкурентной экосистемы ИИ за счёт консультаций с разработчиками открытых и закрытых моделей, независимыми техническими экспертами и научным сообществом. Общие стандарты должны разрабатываться прозрачно и не создавать преимуществ для отдельных компаний, стран или бизнес-моделей, в том числе за счёт усложнения конкуренции для новых участников или разработчиков моделей с открытыми весами.
Как мы уже предлагали(открывается в новом окне), при таком подходе можно опереться на опыт авиации и обеспечения финансовой стабильности, где страны выработали общие технические стандарты и надёжные каналы сотрудничества, не отказываясь от национального суверенитета. Необходимо также тесно сотрудничать с действующими и новыми организациями по стандартизации, такими как ISO(открывается в новом окне), Форум передовых моделей(открывается в новом окне), Фонд агентного ИИ(открывается в новом окне) и Альянс открытого и безопасного ИИ(открывается в новом окне), а также с организациями, ориентированными на практическое внедрение, например Фондом Appia. Он разрабатывает практические спецификации, связывающие международные стандарты с реальными оценками ИИ.
Международные стандарты ИИ будут особенно важны для управления растущей автономностью исследований ИИ и рекурсивным самосовершенствованием. В частности, они могут включать стандарты для следующих направлений:
Оценка прогресса ИИ, имеющего отношение к RSI, и объёма автономных исследований, проводимых в компании, работающей над ИИ. Наш недавний отчёт об ускорении исследований — первый вклад в эту работу.
Контроль человека над автоматизированными исследованиями ИИ, включая определение видов таких исследовательских процессов, которые должны немедленно передаваться на проверку человеку.
Классификация, отслеживание, регистрация и устранение инцидентов, связанных с согласованием и автоматизированными исследованиями ИИ, включая общие уровни серьёзности инцидентов и пороговые критерии для их регистрации. Наша система отчётности о несогласованности — первый вклад в эту работу.
Помимо этих стандартов, мы считаем важным, чтобы операторы критической инфраструктуры и правительства по всему миру создали защищённые каналы связи для обмена сведениями об угрозах национальной безопасности, новых уязвимостях и угрозах, а также передовыми методами в быстро развивающейся области безопасности передового ИИ. Диалог между Соединёнными Штатами и Китаем в этих областях стал бы позитивным шагом, а предстоящие переговоры проходят как нельзя кстати.
Управление темпами развития ИИ не означает поддержание заранее заданной скорости. С технической точки зрения важно, чтобы исследования в области согласования и внедрение их результатов опережали развитие возможностей ИИ. С общественной точки зрения необходимо с помощью стандартов, институтов и сотрудничества задействовать отраслевые связи, общественные отношения и рыночные силы для достижения взаимовыгодных результатов. Недавний призыв к совместным действиям в сфере киберзащиты — пример такого подхода.
Соединённые Штаты имеют все возможности стать лидером, поскольку их индустрия ИИ находится на переднем крае технологий, а сама страна по-прежнему занимает привилегированное положение в глобальных сетях в таких критически важных сферах, как финансы, торговля, оборона, технологии и информационные системы. От лидерства сегодня зависит, будут ли Соединённые Штаты формировать глобальную систему регулирования ИИ или окажутся в окружении укоренившейся фрагментарной, неравномерной и конфликтной системы. От этого также зависит, укрепит ли передовой ИИ уже существующие связи Соединённых Штатов и их союзников; отказ от лидерства может их ослабить.
Геополитическая конкуренция будет определяться не только техническим превосходством, но и темпами внедрения и распространения ИИ. Всё чаще решающее значение здесь может иметь то, кто обеспечивает практическое сотрудничество и устанавливает разумные правила, необходимые компаниям и обществам во всём мире, если они готовы связать своё будущее с этой технологией.
Эффективное национальное управление в сочетании с практическим международным сотрудничеством открывает путь к более надёжным мерам защиты, непрерывным инновациям и широкому доступу к преимуществам ИИ.


