Наши подходы к спецификации модели
Развитие возможностей и повсеместное внедрение систем ИИ требуют создания четких общедоступных рамок их поведения.
В OpenAI мы убеждены: ИИ должен быть справедливым, безопасным и общедоступным, чтобы как можно больше людей могли использовать его для решения сложных задач, создания новых возможностей и прогресса в медицине, науке, образовании, работе и повседневной жизни. Мы верим, что демократизация доступа к ИИ — это лучший путь вперед: нам нужен не ИИ, выгоды и контроль над которым сосредоточены в руках немногих, а технология, которую больше людей смогут использовать, понимать и помогать формировать.
Это одна из основных причин существования спецификации модели OpenAI. Спецификация модели(открывается в новом окне) — это наша формализованная система, определяющая поведение моделей. В ней описано, как, по нашим представлениям, модели должны следовать инструкциям, разрешать конфликты, уважать свободу пользователей и безопасно вести себя при обработке невероятно широкого спектра запросов, с которыми к ним ежедневно обращаются. В более широком смысле это наша попытка чётко сформулировать желаемое поведение моделей — не только в рамках процесса обучения, но и в виде документа, который могут прочитать, изучить и обсудить пользователи, разработчики, исследователи, представители органов власти и широкая общественность.
Спецификация модели не является утверждением, что наши модели уже сегодня ведут себя идеально. Во многом она носит описательный характер, но также служит ориентиром для будущего развития Мы используем её, чтобы четко обозначить желаемое поведение, обучать модели в соответствии с ним, оценивать их и со временем вносить улучшения.
В этом материале мы делимся предысторией, которой нет в самой спецификации: философией и механикой проекта — как он устроен, почему мы выбрали именно такую структуру, а также как мы пишем, внедряем и развиваем её.
Спецификация модели — одна из составляющих более широкого подхода OpenAI к обеспечению безопасности и подотчётности ИИ. В то время как Программа готовности посвящена рискам, связанным с возможностями передовых ИИ-систем, и мерам защиты, необходимым по мере роста этих рисков, спецификация модели отвечает на другой, но дополняющий этот подход вопрос: как наши модели должны вести себя в самых разных ситуациях. Если смотреть ещё шире, устойчивость общества в условиях развития ИИ призвана решить более широкую общественную задачу: помочь обществу воспользоваться преимуществами передового ИИ, одновременно смягчая потрясения и возникающие риски по мере внедрения всё более способных систем. В совокупности эти инициативы призваны помочь сделать переход к AGI постепенным, итеративным, понятным и прозрачным для общества: дать людям и институтам время на адаптацию, одновременно создавая меры защиты и механизмы подотчётности и помогая обществу лучше понять эти технологии, чтобы мощный ИИ соответствовал интересам людей.
Публичная прозрачность в вопросах поведения моделей критически важна как для справедливости, так и для безопасности. Для справедливости — потому что людям нужно понимать, как и почему ИИ взаимодействует с ними именно так, а также иметь возможность выявлять и обсуждать возникающие проблемы предвзятости. Для безопасности — потому что по мере роста возможностей ИИ у общества и организаций должны быть четкие ожидания относительно его поведения, понимание заложенных в него компромиссов и того, как эти решения можно улучшить. Такая прозрачность также способствует устойчивости, давая широкому кругу людей конкретный предмет для изучения, критики и совершенствования.
С момента выхода первой версии в 2024 году спецификация модели значительно изменилась: мы узнаём больше о предпочтениях и потребностях пользователей, расширяем её охват и адаптируем её к растущим возможностям ИИ, а также учитываем отзывы общественности о поведении моделей и самой спецификации. Следуя принципу итеративного внедрения, мы развиваем спецификацию модели как документ, объединяющий основополагающие ценности и чёткие, понятные правила, а также предусматривающий процесс изменения отдельных положений с учётом опыта реального применения и обратной связи. Мы также инвестируем в механизмы общественной обратной связи, такие как коллективное согласование, чтобы человечество сохраняло контроль над тем, как используется ИИ и как формируется его поведение.
Для внутреннего использования спецификация служит ориентиром желаемого поведения и единой базой для обучения, оценки и управления. Для внешнего мира она создает открытую точку отсчета, которую люди могут использовать, чтобы понять наш подход, подвергнуть его критике и помочь нам стать лучше.
Спецификация модели состоит из нескольких различных видов рекомендаций для модели. Это сделано намеренно. Различные аспекты поведения модели требуют разных подходов, и полезный общедоступный документ должен быть чем-то большим, чем просто списком правил.
Спецификация модели OpenAI начинается с общего замысла: четкого объяснения того, что мы пытаемся оптимизировать на уровне системы и почему.
Данная преамбула определяет три стратегические цели нашей работы:
- Итеративно внедрять модели, которые расширяют возможности разработчиков и пользователей.
- Не допускать, чтобы наши модели причиняли серьезный вред пользователям или окружающим.
- Сохранять право OpenAI на ведение деятельности.
Далее в ней объясняется, как мы планируем балансировать эти цели на практике, делая компромиссы достаточно конкретными, чтобы они могли служить опорой для последующих, более детальных принципов.
Важно отметить, что эта преамбула не является прямой инструкцией для модели. Приносить пользу человечеству — это цель OpenAI, а не цель, которую наши модели должны преследовать автономно. Вместо этого мы хотим, чтобы модели следовали цепочке подчинения, которая включает спецификацию модели и применимые инструкции от OpenAI, разработчиков и пользователей — даже если кто-то может быть не согласен с результатом в конкретном случае.
Мы считаем этот баланс оптимальным, поскольку ценим самостоятельность человека и свободу мысли. Если бы мы обучали модели решать, каким инструкциям следовать, исходя из нашего собственного представления о том, что полезно для общества, OpenAI оказалась бы в положении арбитра в вопросах морали на очень широком уровне. Тем не менее, преамбула всё равно важна. Если возникает неоднозначность в том, как применять спецификацию модели, преамбула должна помочь её устранить.
Спецификация модели также содержит публичные обязательства, которые выходят за рамки непосредственно измеримого поведения модели и охватывают цели обучения и ограничения на развертывание. Например, наши принципы, задающие «красные линии»(открывается в новом окне), включают обязательство никогда не использовать в собственных продуктах, таких как ChatGPT, системные сообщения для намеренного нарушения объективности(открывается в новом окне) или связанных с ней принципов. А раздел «Никаких других целей»(открывается в новом окне) закрепляет наше намерение оптимизировать ответы модели в интересах пользователя, а не ради выручки или увеличения времени, которое пользователь проводит на сайте без пользы для себя.
В основе спецификации модели лежит цепочка подчинения (the Chain of Command): структура, определяющая, какие инструкции должны применяться в конкретной ситуации. В ней также рассматривается, как модель должна обрабатывать недостаточно конкретизированные инструкции, особенно в агентных сценариях, где от нее ожидается, что она будет самостоятельно дополнять недостающие детали, тщательно контролируя последствия в реальном мире.
Основная идея, лежащая в основе определения того, какие инструкции следует применять, проста. Инструкции могут поступать из разных источников, включая OpenAI, разработчиков и пользователей. Эти инструкции могут конфликтовать. Цепочка подчинения объясняет, как модель должна разрешать эти конфликты.
Каждому правилу спецификации модели и каждой инструкции присваивается определённый уровень в иерархии(открывается в новом окне). При возникновении конфликтов модели предписано отдавать приоритет букве и духу инструкций, стоящих выше в иерархии. Если пользователь просит помочь изготовить бомбу, модель должна в первую очередь соблюдать строгие ограничения безопасности(открывается в новом окне). Если пользователь просит отпустить в его адрес жёсткие шутки, модель, как правило, должна выполнить эту просьбу, несмотря на правило, запрещающее оскорбления(открывается в новом окне), которое находится ниже в иерархии спецификации модели.
Такая структура позволяет нам определить относительно небольшой набор неоспоримых правил наряду с обширным перечнем настроек по умолчанию. Так мы стараемся максимально расширить свободу пользователей и контроль со стороны разработчиков при соблюдении требований безопасности.
- Жёсткие правила — это явно установленные ограничения, которые пользователи и разработчики не могут переопределить (в терминологии спецификации модели это инструкции корневого или системного уровня). Они в основном носят запретительный характер, требуя от моделей избегать поведения, которое может способствовать возникновению катастрофических рисков или причинению прямого физического вреда, нарушать законы или подрывать цепочку подчинения. Мы ожидаем, что ИИ станет основополагающей для общества технологией, сопоставимой с базовой интернет-инфраструктурой. Поэтому мы вводим правила, способные ограничить интеллектуальную свободу, только если считаем их необходимыми для широкого круга разработчиков и пользователей, которые будут взаимодействовать с ИИ. В спецификации модели раздел «Не выходите за установленные рамки»(открывается в новом окне) содержит жёсткие правила, связанные с конкретными рисками для безопасности в реальном мире, а раздел «Принципы для пользователей младше 18 лет»(открывается в новом окне) предусматривает дополнительные меры защиты для несовершеннолетних.
- Настройки по умолчанию — это исходные установки, которые можно переопределить: вариант поведения, который ассистент считает наиболее уместным, если предпочтения пользователя или разработчика не указаны. Мы используем настройки по умолчанию, чтобы при масштабном использовании поведение оставалось предсказуемым и управляемым, а людям не приходилось каждый раз задавать специальный набор инструкций, чтобы понимать, как поведёт себя модель. Благодаря настройкам по умолчанию поведением можно управлять: пользователи и разработчики могут явно задавать тон, глубину, формат и даже точку зрения в пределах ограничений безопасности. Настройки по умолчанию уровня рекомендаций (например, тон или стиль) могут меняться под влиянием неявных указаний, а настройки пользовательского уровня (например, правдивость и объективность) служат опорой для доверия и предсказуемости и могут быть переопределены только явными инструкциями. Они не должны незаметно меняться в зависимости от «атмосферы» диалога; если пользователю нужна иная фактическая позиция, явное указание на это делает такой переход прозрачным и понятным. Эти настройки по умолчанию отражены в разделах «Вместе ищите истину»(открывается в новом окне), «Выполняйте работу как можно лучше»(открывается в новом окне) и «Используйте подходящий стиль»(открывается в новом окне). В них закреплены нормы честности и объективности, недопустимость поддакивания, а также такие нормы взаимодействия, как прямота и уместные в конкретном контексте доброжелательность и профессионализм.
Помимо самой иерархии, спецификация модели использует средства интерпретации, которые помогают моделям (и людям) последовательно применять её в неоднозначных случаях. Эти средства включают:
- Критерии принятия решений, которые помогают модели последовательно принимать решения в неоднозначных ситуациях, не сводя их к единому механическому правилу. Например, в рекомендациях спецификации модели по контролю побочных эффектов(открывается в новом окне) перечислены такие соображения, как сведение к минимуму необратимых действий, соразмерность действий поставленной цели, снижение риска неприятных неожиданностей и предпочтение обратимых подходов. Их следует соотносить с другими целями, например с необходимостью выполнить задачу быстро и эффективно.
- Конкретные примеры, которые показывают, как принцип следует применять на практике. Это короткие примеры в формате «промпт—ответ», которые обычно включают как ответ, соответствующий требованиям, так и ответ, не соответствующий требованиям, часто для сложного промпта, близкого к важной границе принятия решения. Цель не в том, чтобы имитировать полноценный реалистичный разговор. Это нужно, чтобы четко показать ключевое различие и сделать это так, чтобы одновременно продемонстрировать желаемый стиль ответа.
Мы сохраняем число примеров относительно небольшим и сосредотачиваемся на наиболее информативных из них. Более широкие наборы тестов (evaluation suites) помогают охватить оставшееся многообразие частных случаев.
Пример из раздела спецификации «Предполагайте добрые намерения»(открывается в новом окне), иллюстрирующий принципы интеллектуальной свободы и безоценочного отношения.
Спецификация — это интерфейс, а не реализация. Она описывает нужное нам поведение, а не все детали того, как мы его обеспечиваем. Мы стараемся не привязывать это к деталям реализации, таким как внутренние форматы токенов или точная схема обучения для конкретного поведения, поскольку эти детали могут меняться, даже если желаемое поведение остается прежним. Основная аудитория спецификации модели — не сама модель, а люди: она призвана помочь сотрудникам OpenAI, пользователям, разработчикам, исследователям и лицам, определяющим политику, понимать, обсуждать и определять предполагаемое поведение ИИ.
Спецификация также описывает модель, а не весь продукт. Её дополняют наши правила использования, в которых описаны наши ожидания относительно того, как следует использовать API и ChatGPT. Система, с которой взаимодействуют пользователи, не ограничивается моделью: важны также функции продукта, такие как пользовательские инструкции и память, мониторинг, контроль соблюдения правил и другие уровни системы. Безопасность — это гораздо больше, чем поведение модели, и мы выступаем за многоуровневую защиту.
Наконец, спецификация не является исчерпывающим описанием всего стека обучения или каждого внутреннего нюанса политики. Цель не в том, чтобы фиксировать каждую деталь. Мы стремимся делать наиболее важные решения относительно поведения модели понятными и полностью соответствующими нашим принципам.
Есть несколько причин включать в спецификацию столько деталей, а не предполагать, что читатель — или модель — сможет самостоятельно вывести всё из нескольких общих целей.
Во-первых, спецификация модели — это инструмент обеспечения прозрачности и подотчётности. Она призвана стимулировать содержательную обратную связь от общественности. Чёткий общедоступный ориентир помогает понять, является ли то или иное поведение ошибкой или задуманной особенностью. Он служит устойчивой точкой отсчёта для критического анализа и конкретной обратной связи. Именно поэтому мы опубликовали спецификацию модели как открытый проект(открывается в новом окне) и продолжаем публично её дорабатывать. Со времени первого выпуска мы внесли множество изменений на основе мнений общественности, собранных разными способами: через формы обратной связи, публичную критику и целенаправленные инициативы по сбору мнений с помощью демократических процедур.
Во-вторых, спецификация модели — это инструмент координации внутри OpenAI. Он предоставляет людям, работающим в сферах исследований, разработки продуктов, безопасности, политики, юридических вопросов, коммуникаций и других функций, общий словарь для обсуждения поведения модели и механизм для внесения и рассмотрения изменений.
В-третьих, чётко сформулированные правила позволяют компенсировать практические ограничения интеллектуальных возможностей моделей и контекста, доступного им во время работы, и сделать поведение более предсказуемым. Хотя со временем эта проблема становится менее актуальной, некоторые правила призваны компенсировать ограниченные интеллектуальные возможности моделей, из-за которых они не всегда могут надёжно определить правильное поведение исходя из принципов более высокого уровня. Например, правило «Отвечайте ясно и прямо»(открывается в новом окне) рекомендовало более ранним моделям показывать ход решения сложных задач с вычислениями до того, как дать ответ. Сегодня наши модели естественным образом осваивают это поведение в процессе обучения с подкреплением.
Другие правила учитывают ограниченность контекста во время работы: ассистент может полагаться только на то, что наблюдаемо в текущем взаимодействии, и редко знает полную ситуацию пользователя, его намерения, последующее использование результата или то, какие защитные механизмы существуют за пределами модели. В таких случаях, даже если модели могли бы вычислить правильное поведение после долгих «раздумий», конкретика повышает эффективность и предсказуемость — она сжимает множество оценочных суждений в руководство, которое снижает вариативность ответов на похожие запросы и делает поведение более понятным как для пользователей, так и для исследователей.
Наконец, спецификация модели призвана служить полным перечнем общих политик, относящихся к оценке и измерению. Если вы хотите оценить, ведет ли себя модель так, как задумано, полезно иметь общедоступный список основных категорий поведения, которые вас интересуют.
Можно предположить, что достаточно способная модель должна быть в состоянии вывести правильное поведение из краткого списка целей, таких как «быть полезной и безопасной». В этом есть доля правды. В этом есть доля правды: в областях с объективными критериями успеха, таких как математика, интеллект часто может заменить детальные правила.
Но в целом поведение моделей не похоже на решение простой математической задачи; модели часто работают в более сложных областях, где нет единственно правильного ответа, с которым все могли бы согласиться. То, что значит для модели быть «полезной и безопасной», чрезвычайно зависит от контекста и является результатом принятия решений, неизбежно нагруженных ценностными суждениями. Одного интеллекта недостаточно, чтобы понять, на какие компромиссы идти, когда речь идет об этике и ценностях. Поэтому даже с ростом интеллекта моделей нам по-прежнему необходимо учиться формулировать и направлять их ценностные суждения — определять, что именно означает «этично» в каждой конкретной ситуации. Большинство причин для существования спецификации модели остаются актуальными даже при значительном росте возможностей ИИ: нам по-прежнему нужен открытый ориентир для координации, способ оценки соответствия поведения нашим намерениям и механизм пересмотра правил по мере накопления опыта. Если единственным правилом будет «будь полезной и безопасной», у людей не останется механизмов для обсуждения, например, границ того, какой контент модель должна отклонять, и все эти решения будут отданы на откуп самой модели.
Во всяком случае, по мере того как модели становятся более способными, более агентными и всё шире внедряются, цена неоднозначности возрастает. Это делает четкие рамки поведения еще более важными, а не менее важными.
Уместной аналогией здесь является различие между написанной конституцией и прецедентным правом. Хотя конституция может содержать как общие принципы, так и конкретные нормы, она не может предусмотреть все возможные случаи, которые могут возникнуть и потребовать обращения к ней за руководством. Системам управления в реальном мире также необходимы механизмы толкования, уточнения и четко сформулированные решения для разрешения неоднозначных или непредвиденных проблем. Опубликованные правила помогают различным сторонам координировать свои действия даже при наличии разногласий и ограничивают произвол, требуя, чтобы любые изменения были явными. Спецификация модели призвана играть все эти роли: декларации принципов, открытого фреймворка поведения и процесса изменения правил со временем.
При этом мы не считаем, что все значимые аспекты поведения модели всегда можно будет свести к явным правилам. По мере того как системы становятся более автономными, надежность и доверие будут всё больше зависеть от более широкого набора навыков и установок: умения ясно сообщать о неопределенности, соблюдения границ автономии, предотвращения неприятных неожиданностей, отслеживания намерений с течением времени и качественных рассуждений о человеческих ценностях в контексте.
При составлении спецификации модели мы ищем баланс между описанием текущего поведения ИИ (со всеми его «шероховатостями») и образом идеального будущего. Как правило, мы ориентируемся на горизонт в 0–3 месяца. Таким образом, спецификация часто идет на шаг впереди реальных возможностей модели в тех областях, которые находятся в активной разработке.
Это отражает роль спецификации модели как описания предполагаемого поведения. Это должно задавать нам последовательное направление, при этом оставаясь привязанным к тому, что мы уже делаем, или к тому, для чего у нас есть конкретные краткосрочные планы по внедрению.
Спецификация модели разрабатывается в рамках открытого внутреннего процесса. Любой сотрудник OpenAI может прокомментировать её или предложить изменения, а окончательные обновления утверждаются широким кругом кросс-функциональных заинтересованных сторон. На практике десятки людей напрямую участвовали в подготовке текста, а еще больше людей из подразделений, занимающихся исследованиями, разработкой, продуктом, безопасностью, политикой, юридическими вопросами, коммуникациями, международными вопросами и другими функциями, вносят свой вклад. Мы также учимся на публичных релизах и отзывах, которые помогают проверить эти решения на прочность в условиях реального внедрения.
Это важно, потому что поведение модели — и его последствия в реальном мире — невероятно сложны. Ни один человек не способен удержать в голове весь набор паттернов поведения, нюансы процесса обучения и долгосрочные эффекты. Однако благодаря участию множества кросс-функциональных контрибьюторов и рецензентов мы повышаем качество документа и уверенность в нем.
Одним из приятных сюрпризов стало то, что достичь настоящего консенсуса часто действительно возможно — особенно когда мы заставляем себя четко сформулировать компромиссы, чтобы разногласия приобрели конкретную форму.
Спецификация модели не пишется в вакууме. Значительная часть того, что в неё входит, представляет собой краткое изложение более широкой работы в области поведения, безопасности и политики. Во многом работа над спецификацией модели — это по сути перевод: взять существующий материал и сделать его более простым, последовательным, структурированным и доступным, не теряя исходного замысла.
Наши рабочие модели пока не в полной мере соответствуют спецификации модели по нескольким причинам:
- Обучение модели может отставать от обновлений спецификации модели. Документ описывает целевое поведение, на которое мы ориентируемся в работе, поэтому он может опережать то, чему обучена наша последняя модель.
- В процессе обучения может случайно закрепиться поведение, противоречащее спецификации. Мы прилагаем все усилия, чтобы этого избежать, а если такое случается — относимся к этому как к серьезному багу и работаем над тем, чтобы привести поведение модели или саму спецификацию в соответствие друг с другом.
- Обучение никогда не может полностью охватить пространство всех возможных вариантов поведения. Реальное использование включает в себя бесконечное количество контекстов и пограничных случаев, которые проявляются только при масштабном развертывании; ни один процесс обучения не может предусмотреть всё.
- Модель может обобщать не так, как мы рассчитывали. Во время обучения модель может выдавать «правильные» результаты не по тем причинам, которые мы предполагали, что впоследствии способно привести к непредусмотренному поведению в новых ситуациях, отличающихся от тех, которые встречались при обучении. Такие методы, как совещательное согласование, помогают, но не решают проблему полностью.
В более широком смысле тот факт, что спецификация охватывает масштабный спектр желаемых паттернов поведения, не означает существования единого метода обучения им всем. Различные аспекты поведения — следование инструкциям, границы безопасности, характер, калиброванное выражение неопределенности и другие — часто требуют различных методов и имеют свои специфические сценарии сбоев. Спецификация модели помогает лучше понять и критически оценить предполагаемое поведение, но её качественная реализация остается одновременно искусством и активной областью исследований.
Вместе с этой публикацией мы выпускаем оценку спецификации модели (Model Spec Evals)(открывается в новом окне): набор сценарных тестов, призванный охватить как можно больше положений спецификации с помощью небольшого числа репрезентативных примеров. Это помогает отслеживать расхождения между поведением моделей и спецификацией модели, а также проверять, интерпретируют ли модели спецификацию так, как мы задумали. Эти тесты — лишь часть более широкой стратегии оценки, которая также включает более узконаправленные проверки конкретных аспектов безопасности, правдивости и поддакивания, характера и стиля, а также возможностей моделей.
Диаграмма соответствия моделей OpenAI отдельным разделам спецификации модели в динамике. Подробнее об оценках и о том, как мы их интерпретируем, читайте в сопутствующей публикации в блоге(открывается в новом окне). Вкратце: мы считаем, что эти результаты свидетельствуют о реальном улучшении согласованности поведения моделей с нашими принципами по широкому спектру аспектов, хотя на них также немного повлияло то, что более старые модели оценивались по более новым правилам.
На практике большинство обновлений cпецификации обусловлено регулярным поступлением данных из следующих источников:
- Публичные вопросы и обратная связь. Неясности, пограничные случаи или сбои — как в формулировках самой спецификации, так и в поведении наших моделей.
- Внутренние вопросы. Паттерны, которые мы замечаем в ходе разработки и тестирования, включая двусмысленности, где разные (но разумные) интерпретации приводят к разному поведению.
- Обновления политик поведения и безопасности. Когда ограничения или обязательства более высокого уровня меняются, спецификация должна ясно отражать эту новую структуру.
- Новые возможности и продукты. По мере того как модели становятся способны на новые виды поведения и мы выпускаем новые продукты, мы хотим, чтобы содержание и охват спецификации модели развивались вместе с ними — например, за счёт добавления правил для мультимодальных взаимодействий(открывается в новом окне), автономных агентов(открывается в новом окне) и пользователей младше 18 лет(открывается в новом окне).
Несколько принципов разработки определяют то, как мы пишем и пересматриваем спецификацию модели.
- Ясность и точность. «Будьте честны» — важный принцип, но сам по себе он не даёт готовой процедуры принятия решений. Спецификация модели должна прояснять разногласия, а не скрывать их за обтекаемыми формулировками. Когда это возможно на практике, мы должны прямо указывать на потенциальные конфликты между правилами и давать рекомендации или примеры по их разрешению. Например, в разделе «Не лгите»(открывается в новом окне) отмечен возможный конфликт с правилом «Проявляйте доброжелательность»(открывается в новом окне): ассистенту следует соблюдать нормы вежливости, но не прибегать к «лжи во спасение», которая может превратиться в поддакивание(открывается в новом окне) и навредить интересам пользователя.
- Содержательность правил. Читатель должен иметь возможность взять реалистичный запрос и дать ответ, который другой человек однозначно признает соответствующим или не соответствующим правилам (даже если на периферии остаются спорные моменты).
- Примеры с максимальным соотношением «сигнал/шум». Хорошие примеры часто играют ключевую роль в подготовке высококачественного обновления технических требований. Примеры должны помогать добраться до самой сути трудностей, связанных с определением поведения модели, выводя сложные конфликты на поверхность и занимая четкую позицию относительно того, как их разрешать. Во-вторых, они должны стремиться служить образцами желаемого тона и стиля, которые бывает трудно передать в письменной форме.
- Устойчивость. Мы стараемся избегать примеров с излишней двусмысленностью или сложностью, чтобы основной конфликт и предполагаемое разрешение были ясны.
- Последовательность и понятная структура. Мы стремимся к тому, чтобы правила спецификации модели полностью согласовывались друг с другом и с предполагаемым нами поведением модели, а общая структура документа была понятной и доступной.
Спецификация модели не утверждает, что мы можем записать всё, что имеет значение, или что модели всегда будут попадать в цель. Это утверждение того, что целевое поведение достаточно важно, чтобы быть ясным, применимым на практике и открытым для изменений.
Развитие спецификации определяют три критерия успеха:
- Понятность. Люди как внутри, так и вне OpenAI могут сформировать точные ожидания от поведения ИИ и сослаться на конкретный текст, если это поведение их удивляет.
- Применимость. Спецификацию можно использовать для разработки тестов, анализа инцидентов и принятия последовательных продуктовых решений, а не только для декларации ценностей.
- Возможность пересмотра. Спецификация может эволюционировать по мере накопления опыта, не превращаясь при этом в нестабильную, постоянно ускользающую цель.
Мы ожидаем, что по мере развития моделей и продуктов Спецификация будет расширяться и уточняться синхронно с новыми возможностями и контекстами их использования. Цель состоит в том, чтобы поведенческая спецификация оставалась согласованной, проверяемой и соответствующей нашей миссии — обеспечить, чтобы AGI приносил пользу всему человечеству.


