Как разрабатываются ChatGPT и наши базовые модели
Узнайте больше о том, как мы разрабатываем наши модели и применяем их в таких продуктах, как ChatGPT
Базовые модели OpenAI, в том числе модели, обеспечивающие работу ChatGPT, разрабатываются с использованием трех основных источников информации: (1) информация, которая находится в открытом доступе в интернете, (2) информация, которую мы получаем от третьих лиц в рамках партнерских соглашений, и (3) информация, которую предоставляют или генерируют наши пользователи или инструкторы.
В этой статье представлен обзор общедоступной информации, которую мы используем для разработки данных моделей, а также рассказывается о том, как мы собираем и используем эту информацию в соответствии с законами о конфиденциальности. Чтобы понять, как мы собираем и используем информацию, полученную от пользователей наших услуг, в том числе как отказаться от использования диалогов в ChatGPT для обучения наших моделей, просьба ознакомиться с нашей Политикой конфиденциальности и этой статьей.
ChatGPT — это услуга, основанная на искусственном интеллекте, к которой Вы можете получить доступ через интернет. ChatGPT можно использовать в различных целях: например, с его помощью можно упорядочивать или обобщать информацию, переводить тексты, анализировать или создавать изображения, вдохновляться на творчество и генерировать идеи, а также выполнять повседневные задачи. ChatGPT был разработан таким образом, чтобы понимать и отвечать на вопросы и инструкции пользователя. Для этого он анализирует большой объем существующей информации, например, тексты, изображения, аудио или видео, и обучается в результате взаимодействия с информацией. Например, модель изучает то, как слова обычно используются в определенном контексте вместе с другими словами, а затем использует полученные знания для предсказания следующего наиболее вероятного слова, которое может появиться в ответ на запрос пользователя, и каждого последующего слова после этого. Эти модели также могут научиться генерировать другие формы информации, например изображения, изучая то, как пиксели, из которых составлены изображения в обучающих данных, связаны друг с другом и с описывающими их подписями.
Например, в процессе тренировки модели (называемого «обучением») мы можем попросить модель попытаться завершить предложение: «Вместо того чтобы повернуть налево, она повернула ___». До обучения модель отвечает случайными словами, но по мере чтения и обучения на основе многих строк текста она лучше понимает этот тип предложения и может более точно предсказать следующее слово. Затем этот процесс повторяется в очень большом количестве предложений.
Поскольку в этом предложении есть много возможных слов, которые могут быть следующими (например, вместо того чтобы повернуть налево, она повернула «направо», «кругом» или «назад»), в том, как модель может ответить, существует элемент случайности, и во многих случаях наши модели будут отвечать на один и тот же вопрос по-разному.
Модели машинного обучения состоят из длинных рядов чисел, называемых «весовыми коэффициентами» или «параметрами», и кода, который интерпретирует и выполняет эти числа. Модели не содержат и не хранят копии информации, на которой они обучаются. Вместо этого, по мере обучения модели, некоторые из составляющих ее чисел немного изменяются, чтобы отразить то, чему она обучилась. В приведенном выше примере модель анализировала информацию, которая помогла ей перейти от предсказания случайных неправильных слов к предсказанию более точных слов, но все, что на самом деле произошло в самой модели, — это незначительное изменение чисел. Модель не сохраняла и не копировала предложения, изображения или аудиозаписи, которые она анализировала.
Как было упомянуто выше, ChatGPT и другие наши услуги разрабатываются с использованием: (1) информации, которая находится в открытом доступе в интернете, (2) информации, которую мы получаем от третьих лиц в рамках партнерских соглашений, и (3) информации, которую предоставляют или генерируют наши пользователи или инструкторы. Эта статья посвящена первой группе: информации, которая находится в открытом доступе в интернете.
Для этой подборки мы используем только общедоступную информацию, которая находится в свободном и открытом доступе в интернете — например, мы не ищем информацию, которая по нашим сведениям находится в платном доступе или в «темном интернете». Мы применяем фильтры и удаляем информацию, которую мы не хотим, чтобы наши модели изучали или выводили, например разжигание ненависти, контент для взрослых, сайты, которые в основном собирают личную информацию, и спам. Затем мы используем эту информацию для обучения наших моделей.
Большое количество данных в интернете связано с людьми, поэтому наша учебная информация иногда случайно включает в себя личную информацию. Мы не занимаемся активным поиском личной информации для обучения наших моделей.
Мы используем учебную информацию только для обучения наших моделей интеллектуальным навыкам, таким как способность предсказывать, аргументировать и решать проблемы. Мы не используем и не будем использовать личную информацию в учебной информации для составления профилей людей, для связи с ними, для рекламы, для попыток продать им что-либо или для продажи самой информации.
Наши модели могут учиться на личной информации, чтобы понять, как такие элементы, как имена и адреса, вписываются в язык и предложения, или узнать о знаменитых людях и общественных деятелях. Благодаря этому наши модели лучше справляются с задачей предоставления подходящих ответов.
Мы также принимаем меры по сокращению обработки личной информации при обучении наших моделей. Например, мы убираем сайты, собирающие большие объемы личной информации, и обучаем наши модели отклонять запросы на получение частной или конфиденциальной информации о людях.
Мы используем учебную информацию на законных основаниях. Наши базовые модели имеют множество применений, обеспечивающих значительные преимущества, и уже помогают людям создавать контент, улучшать обслуживание клиентов, разрабатывать программное обеспечение, адаптировать образование, поддерживать научные исследования и многое другое. Эти преимущества невозможно реализовать без большого количества информации для обучения моделей. Кроме того, использование нами учебной информации не предполагает негативного воздействия на людей, а основные источники этой учебной информации уже находятся в открытом доступе. В связи с этим мы осуществляем сбор и использование личной информации, включенной в учебную информацию, на основании законных интересов в соответствии с законами о конфиденциальности, такими как Общий регламент ЕС по защите персональных данных (GDPR), что более подробно описано в нашей Политике конфиденциальности. Мы также провели оценку воздействия на защиту данных, чтобы убедиться, в том что мы собираем и используем эту информацию законно и ответственно.
Мы отвечаем на запросы о возражениях и об аналогичных правах. В результате изучения языка ответы ChatGPT иногда могут содержать личную информацию о людях, чья личная информация многократно появляется в открытом доступе в интернете (например, о публичных личностях). Люди, находящиеся в определенных юрисдикциях, могут возражать против обработки их личной информации нашими моделями или присылать другие запросы, связанные с правами субъекта данных, посредством нашего Портала конфиденциальности(открывается в новом окне). Также Вы можете воспользоваться этими правами, обратившись по адресу dsar@openai.com.
Обратите внимание, что в соответствии с законодательством о защите персональных данных некоторые права могут не быть абсолютными. Мы можем отклонить запрос, если у нас имеются для этого законные основания. Тем не менее, мы стремимся к приоритизации защиты личной информации и соблюдаем все применимые законы о конфиденциальности. Если Вы считаете, что мы не отреагировали на проблему должным образом, Вы имеете право подать жалобу в местный надзорный орган.
Для получения дополнительной информации о действиях OpenAI в отношении личной информации, которую мы собираем от Вас или о Вас, когда Вы пользуетесь нашим веб-сайтом, приложениями и услугами, пожалуйста, ознакомьтесь с нашей Политикой конфиденциальности.