Переход к основному контенту
OpenAI

17 июля 2026 г.

Компания

Система оценки в эпоху ИИ

Загрузка…

Вопрос, который я слышу от финансовых директоров повсюду, прост: как получить больше отдачи от наших расходов на ИИ?

Годами рынок измерял успех программного обеспечения через метрики внедрения: количество купленных лицензий, число активных пользователей, продление подписок. Но понимание ценности ИИ требует более сильного показателя — объема выполненной работы.

Базовый экономический вопрос, стоящий перед CFO и руководителями бизнеса: растет ли ценность работы, которую выполняет ИИ, быстрее, чем затраты на ее производство?

Чтобы ответить на него, нужно смотреть глубже, чем на такие метрики, как стоимость токена. У менее дорогой модели токены могут быть дешевле, но для отличного результата может понадобиться больше попыток, больше времени или больше контроля со стороны человека. У более мощной модели токены могут стоить дороже, но она выполнит ту же задачу за один проход. Важна полная стоимость успешного результата в сравнении с ценностью, которую этот результат создает.

Итоговую систему оценки для эпохи ИИ можно представить как «полезный интеллект на один доллар». Эта метрика отвечает на четыре ключевых вопроса:

  1. Выполняет ли ИИ действительно важную работу?
  2. Сколько стоит каждая успешно выполненная задача?
  3. Могут ли люди полагаться на результат?
  4. Приносит ли каждый доллар, вложенный в ИИ, больше ценности по мере роста использования?

1. Какой объем полезной работы выполняется?

Начните с самой работы.

Сколько проблем клиентов ИИ помог решить? Сколько изменений в коде он помог выпустить? Сколько договоров он проверил? Сколько времени он вернул людям? Сколько решений стали лучше благодаря тому, что нужный контекст был доступен в нужный момент?

Токены создают ценность, когда превращаются в работу, которой люди могут пользоваться. По мере того как модели становятся всё более продвинутыми, они могут брать на себя более длинные и сложные задачи: сохранять контекст, рассуждать в несколько шагов, работать с разными инструментами и адаптироваться в процессе.

Лучше всего начать с одного рабочего процесса. Определите, что значит «сделано», и измеряйте этот результат в системе, где выполняется работа.

Для команды поддержки «сделано» может означать решенную проблему клиента. Для инженерной команды — изменение в коде, прошедшее тесты. Для юридической команды — договор, проверенный точно и вовремя.

Возьмем финансовую команду, которая готовится к проверке прогноза. Большая часть работы происходит до принятия финального решения: найти последний прогноз, перенести данные в Excel или Sheets, выявить изменения, сверить вкладки, пересобрать слайды и проверить, что все идеально сходится.

ChatGPT Работа может взять на себя значительную часть этого процесса, оставив команде больше времени на главные вопросы: Что изменилось? Почему? Что нам делать дальше?

Так выглядит полезный интеллект на доллар на практике. Выполняется больший объем работы и за меньшее время, пока сотрудники тратят ресурсы на то, где необходимы их экспертная оценка, критическое мышление и креативность.

2. Во сколько на самом деле обходится успешное выполнение задачи?

Следующий вопрос — сколько стоит выполнить эту работу хорошо.

Задачи ИИ очень различаются. Быстрый ответ может требовать мало вычислений. Рабочий процесс в разработке, исследованиях или финансах может включать более глубокие рассуждения, использование инструментов и множество действий. Такие более сложные задачи могут требовать больше вычислений, но и создавать гораздо больше ценности.

На уровне модели стоимость успешной задачи зависит от цены, объема использованных вычислений и вероятности получить правильный результат. Для бизнеса полная стоимость также включает время сотрудников, проверку человеком, повторные попытки и переделки.

Расчет прост:

  • Сложите полную стоимость выполнения работы.
  • Посчитайте задачи, которые соответствовали требуемой планке качества.
  • Разделите полную стоимость на число успешных задач.

Именно поэтому самая низкая цена токена не всегда дает самую низкую стоимость результата. Передовая модель может дать лучшую ценность даже для типового запроса, если с первого раза выдает правильный ответ и сокращает повторные попытки, задержки, проверку и общий объем вычислений.

Семейство моделей с несколькими уровнями дает клиентам больше способов оптимизировать это уравнение. GPT‑5.6, который мы выпустили на прошлой неделе, имеет три уровня: Sol — наш флагман; Terra — сбалансированное соотношение производительности и стоимости; Luna — самая быстрая и доступная модель.

Эти уровни дают полезные отправные точки. В конечном счете правильную модель должна определять экономика всей задачи. Клиент может использовать Luna для быстрого массового процесса, Terra — для работы, требующей большей глубины, а Sol — когда более сильные рассуждения дают лучший результат с меньшим числом попыток.

Мы обучили GPT‑5.6 извлекать больше полезной работы из каждого токена. В бенчмарке Artificial Analysis Coding Agent Index GPT‑5.6 Sol с максимальным уровнем рассуждения установила новый мировой рекорд, использовав на 54% меньше выходных токенов, чем другая ведущая модель. На диаграмме ниже показано это сравнение.

DeepSWE v1.1: многоэтапные инженерные задачи; GPT‑5.6 Sol достигает нового высокого значения в 72,7 %, выше показателя Claude Fable 5 в 69,9 %, при расчетной стоимости API на 36,2 % ниже.

Для всего семейства GPT‑5.6 цель одна: больше успешной работы на каждый доллар. Более высокая эффективность удешевляет существующие задачи. Более широкие возможности открывают совершенно новые виды работы.

Каждое новое поколение моделей должно улучшать обе стороны этого уравнения. Клиенты должны выполнять более ценную работу, а стоимость выполнения каждой задачи при этом должна продолжать снижаться.

3. Как часто ИИ выполняет работу правильно?

Третья метрика — надежность.

Внедрение ИИ в компании обычно проходит по этапам. Сначала ИИ помогает составлять черновики. Затем ищет контекст и строит логические связи между инструментами и данными. Со временем он начинает совершать действия, обрабатывать исключения и полностью закрывать рабочие процессы, пока человек обеспечивает контроль и финальную оценку там, где это необходимо.

Каждый шаг создает больше ценности и предъявляет к системе более высокие требования.

Надежность имеет прямую экономическую ценность. Когда результаты точны, хорошо подкреплены источниками, последовательны и корректно передаются на более высокий уровень, люди тратят меньше времени на проверку, исправления и повторение работы. Успешные задачи обходятся дешевле, а организации увереннее применяют ИИ в более важных рабочих процессах.

Команды могут измерять это на практике, отслеживая три типа исходов:

  • Готово к использованию: результат сразу соответствовал планке качества.
  • Нужны исправления: результат потребовал еще одной попытки или правок человеком.
  • Нужна эскалация: человеку пришлось вмешаться и завершить работу.

Эти показатели рассказывают более полную историю, чем одна лишь точность модели. Они показывают, действительно ли ИИ сокращает объем работы, необходимой для завершения проекта.

Надежность также требует четких границ. Прежде чем ИИ перейдет от черновиков к действиям, организациям следует определить:

  • К каким данным система может получать доступ.
  • Какие системы она может использовать или изменять.
  • В каких случаях человеку необходимо проверить или утвердить действие.

Безопасность, защита, конфиденциальность и контроль создают основу для более глубокого использования. Люди должны понимать, как ведет себя система, как обрабатываются их данные и как регулируются ее действия.

ChatGPT Work опирается на фундамент безопасности, соблюдения нормативных требований и управления рабочей областью ChatGPT Enterprise. Это позволяет организациям давать ИИ больше контекста и доступ к более ценным рабочим процессам при сохранении надлежащего контроля.

Возможности побуждают попробовать, а надежность — сделать ИИ частью повседневной работы.

4. Покупает ли каждый доллар на ИИ больше работы по мере роста использования?

Последний вопрос — улучшается ли экономика при масштабировании.

Компании могут измерять это, наблюдая за одним и тем же рабочим процессом во времени. Отслеживайте, сколько задач соответствовало планке качества, общую стоимость их выполнения и стоимость успешной задачи. Если объем выполненной работы растет быстрее общей стоимости, а качество сохраняется или улучшается, каждый доллар на ИИ создает больше ценности.

В центре этого уравнения находятся вычисления.

Вычисления обеспечивают исследования и каждую задачу, которую выполняет ИИ. Они влияют на качество продукта, скорость, надежность, доступность и стоимость. Вычисления для обучения создают будущие возможности. Вычисления для инференса дают полезную работу уже сегодня. И то и другое должно превращаться в лучшие результаты для клиентов.

Лучшие модели, более эффективный инференс, специализированное оборудование, более высокая загрузка, умная маршрутизация и более сильный продуктовый дизайн повышают отдачу от вычислений. Каждое новое поколение инфраструктуры помогает обучать более продвинутые модели. Затем лучшие алгоритмы, оборудование и программное обеспечение помогают эффективнее обслуживать эти модели.

Для клиентов эти улучшения выражаются в понятных вещах: лучшие ответы, более быстрые результаты, меньше исправлений, более надежные продукты и более низкая стоимость нужной им работы.

Этот эффект накапливается. Лучшая инфраструктура ускоряет исследования. Исследования создают более способные и эффективные модели. Лучшие модели улучшают продукты. Лучшие продукты стимулируют внедрение, обучение и выручку. Этот рост поддерживает дальнейшие инвестиции в следующее поколение исследований, вычислений, развертывания и безопасности.

OpenAI объединяет эти элементы на единой платформе общего интеллекта. Люди используют ее через ChatGPT и ChatGPT Work. Разработчики создают решения с ее помощью через Codex и API. Предприятия внедряют ее в системы, где выполняется работа.

Когда улучшается один уровень, выигрывать могут каждый продукт и каждый клиент.

Система оценки в эпоху ИИ

В совокупности эти четыре метрики показывают, улучшается ли полезный интеллект на доллар.

Объём полезной работы показывает, что производит ИИ. Стоимость успешной задачи показывает, что нужно для достижения результата. Надежность показывает, какой частью работы люди могут уверенно пользоваться. Ценность в масштабе показывает, выполняют ли каждый доллар и каждая единица вычислений со временем больше работы.

Наша цель — создавать ИИ, который помогает людям выполнять более значимую работу, принимать лучшие решения и уделять больше времени тем задачам, которые требуют исключительно человеческого разума, оценки и креативности.

Наша задача — улучшать это уравнение с каждым поколением: более способные модели, более быстрые и надежные результаты и более низкие затраты на работу, которая нужна клиентам.

Так ИИ со временем становится полезнее для большего числа людей и организаций.