Перейти до основного вмісту
OpenAI

17 липня 2026 р.

Компанія

Система оцінювання для епохи ШІ

Завантаження…

Питання, яке я чую від фінансових директорів усюди, просте: як отримати більше цінності від наших витрат на ШІ?

Роками ринок вимірював успіх програмного забезпечення через упровадження: придбані місця, активні користувачі, поновлені ліцензії. Щоб зрозуміти цінність ШІ, потрібен вагоміший показник: виконана робота.

Головне економічне питання для фінансових директорів та інших бізнес-лідерів полягає в тому, чи зростає цінність роботи, яку виконує ШІ, швидше за вартість її виконання.

Щоб відповісти на це питання, потрібно дивитися глибше, ніж на такий показник, як вартість за токен. Дешевша модель може мати дешевші токени, але для якісного результату може знадобитися більше спроб, більше часу або більше перевірки людиною. Потужніша модель може мати дорожчі токени, але виконати те саме завдання за одну спробу. Важлива повна вартість отримання успішного результату, зіставлена з цінністю, яку цей результат створює.

Ключовим показником оцінки для епохи ШІ можна вважати «Корисний інтелект на долар». Цей показник відповідає на чотири ключові питання:

  1. Чи виконує ШІ справді важливу роботу?
  2. Скільки коштує кожне успішне завдання?
  3. Чи можуть люди покладатися на результат?
  4. Чи створює кожен долар, витрачений на ШІ, більше цінності зі зростанням використання?

1. Скільки корисної роботи виконується?

Почніть із самої роботи.

Скільки звернень клієнтів ШІ допоміг вирішити? Скільки змін у коді він допоміг випустити? Скільки договорів він перевірив? Скільки часу він заощадив людям? Скільки рішень стали кращими завдяки тому, що потрібний контекст був доступний у потрібний момент?

Токени створюють цінність, коли перетворюються на результати роботи, які люди можуть використати. У міру того як моделі стають потужнішими, вони можуть братися за довші й складніші завдання: зберігати контекст, міркувати в кілька кроків, працювати з різними інструментами й адаптуватися в процесі.

Найкраще почати з одного робочого процесу. Визначте, що означає «виконано», і вимірюйте цей результат у системі, де відбувається робота.

Для команди підтримки «виконано» може означати вирішену проблему клієнта. Для інженерної команди це може бути зміна в коді, яка проходить тести. Для юридичної команди це може бути договір, перевірений точно й вчасно.

Уявімо фінансову команду, яка готується до перегляду прогнозу. Значна частина роботи відбувається ще до ухвалення фінального рішення: знайти останній прогноз, перенести дані в Excel або Sheets, визначити зміни, звірити вкладки, оновити слайди й перевірити, що все сходиться ідеально.

ChatGPT Робота може взяти на себе значну частину цього процесу, даючи команді більше часу зосередитися на справді важливих питаннях: що змінилося? Чому? Що робити далі?

Ось як «корисний інтелект на долар» виглядає на практиці. Більше роботи виконується швидше, а люди більше часу витрачають на застосування судження, творчості й експертизи.

2. Скільки насправді коштує успішне завдання?

Наступне питання — скільки коштує якісно виконати цю роботу.

Завдання ШІ дуже різняться. Швидка відповідь може потребувати небагато обчислень. Робочий процес у сфері кодування, досліджень або фінансів може вимагати глибшого міркування, використання інструментів і багатьох дій. Такі складніші завдання можуть потребувати більше обчислень, але й створювати значно більшу цінність.

На рівні моделі вартість успішного завдання залежить від ціни, обсягу використаних обчислень і ймовірності досягти правильного результату. Для бізнесу повна вартість також включає час працівників, перевірку людиною, повторні спроби та виправлення.

Розрахунок простий:

  • Додайте повну вартість виконання роботи.
  • Порахуйте завдання, які досягли потрібного рівня якості.
  • Поділіть повну вартість на кількість успішних завдань.

Саме тому найнижча ціна за токен не завжди дає найнижчу вартість результату. Передова модель може забезпечити найкращу цінність навіть для рутинного запиту, якщо дає правильну відповідь з першої спроби, зменшуючи кількість повторних спроб, затримку, обсяг перевірки й загальні обчислення.

Багаторівневе сімейство моделей дає клієнтам більше способів оптимізувати це рівняння. GPT‑5.6, яку ми випустили минулого тижня, має три рівні: Sol — наш флагман; Terra поєднує продуктивність і вартість; Luna — наша найшвидша й найдоступніша модель.

Ці рівні дають корисні відправні точки. Зрештою, вибір відповідної моделі має залежати від сукупних витрат і цінності всього завдання. Клієнт може використовувати Luna для швидкого масового робочого процесу, Terra — для роботи, що потребує більшої глибини, або Sol — коли потужніше міркування дає найкращий результат із меншою кількістю спроб.

Ми навчали GPT‑5.6 так, щоб отримувати більше корисної роботи з кожного токена. В індексі Artificial Analysis Coding Agent Index GPT‑5.6 Sol із максимальним рівнем міркування встановила новий найкращий результат, використавши на 54% менше вихідних токенів, ніж інша провідна модель. Наведена нижче діаграма ілюструє це порівняння.

DeepSWE v1.1: завдання з розробки з тривалим горизонтом; GPT‑5.6 Sol досягає нового високого рівня — 72,7%, перевищуючи показник Claude Fable 5 у 69,9%, при орієнтовній вартості API, що на 36,2% нижча.

Для всього сімейства GPT‑5.6 мета однакова: більше успішної роботи на кожен долар. Вища ефективність робить наявні завдання доступнішими за ціною. Ширші можливості відкривають шлях до зовсім нових видів роботи.

Кожне нове покоління моделей має покращувати обидві сторони цього рівняння. Клієнти мають отримувати змогу виконувати більше цінної роботи, тоді як вартість виконання кожного завдання й надалі знижується.

3. Як часто ШІ виконує роботу правильно?

Третій показник — надійність.

Упровадження ШІ зазвичай поглиблюється поетапно. Спершу ШІ допомагає створювати чернетки. Потім він знаходить контекст і міркує на основі інструментів і даних. З часом він починає виконувати дії, опрацьовувати виняткові ситуації й завершувати робочі процеси, а люди долучаються там, де потрібні їхнє судження й контроль.

Кожен крок створює більше цінності й висуває до системи вищі вимоги.

Надійність має пряму економічну цінність. Коли результати точні, спираються на надійні джерела, послідовні й належно передаються на розгляд, люди витрачають менше часу на перевірку, виправлення та повторне виконання роботи. Успішні завдання коштують менше, а організації впевненіше застосовують ШІ у важливіших робочих процесах.

Команди можуть конкретизувати це, відстежуючи три результати:

  • Готово до використання: результат у наданому вигляді відповідав рівню якості.
  • Потребує виправлення: результат вимагав ще однієї спроби або редагування людиною.
  • Потребує передавання людині: людині потрібно було втрутитися й завершити роботу.

Ці показники розповідають повнішу історію, ніж сама лише точність моделі. Вони показують, чи справді ШІ зменшує обсяг роботи, потрібної для завершення проєкту.

Надійність також потребує чітких меж. Перш ніж ШІ перейде від створення чернеток до виконання дій, організації мають визначити:

  • До яких даних система може мати доступ.
  • Які системи вона може використовувати або змінювати.
  • Коли людина має перевірити або схвалити дію.

Безпека, захист, конфіденційність і контроль створюють основу для глибшого використання. Люди мають розуміти, як поводиться система, як обробляються їхні дані та як регулюються її дії.

ChatGPT Робота спирається на фундамент безпеки, конфіденційності, відповідності вимогам і керування робочим простором у ChatGPT Enterprise. Це дає організаціям змогу надавати ШІ більше контексту й доступ до цінніших робочих процесів, зберігаючи належний нагляд.

Саме можливості переконують спробувати ШІ вперше. Надійність робить ШІ невіддільною частиною робочих процесів.

4. Чи дає кожен долар на ШІ змогу виконувати більше роботи зі зростанням використання?

Останнє питання — чи поліпшується економіка зі зростанням масштабу.

Компанії можуть вимірювати це, відстежуючи той самий робочий процес із часом. Відстежуйте, скільки завдань досягли потрібного рівня якості, загальну вартість їх виконання та вартість одного успішного завдання. Якщо обсяг виконаної роботи зростає швидше за загальну вартість, а якість зберігається або покращується, кожен долар на ШІ створює більше цінності.

Обчислення лежать в основі цього рівняння.

Обчислення забезпечують проведення досліджень й кожне завдання, яке виконує ШІ. Вони впливають на якість продукту, швидкість, надійність, доступність і вартість. Обчислення для навчання створюють майбутні можливості. Обчислення для інференсу забезпечують виконання корисної роботи вже сьогодні. І те, й інше має перетворюватися на кращі результати для клієнтів.

Кращі моделі, ефективніший інференс, спеціалізоване обладнання, вищий рівень використання, розумніша маршрутизація та досконаліший продуктовий дизайн — усе це покращує віддачу від обчислень. Кожне покоління інфраструктури допомагає навчати потужніші моделі. Кращі алгоритми, апаратне й програмне забезпечення потім допомагають обслуговувати ці моделі ефективніше.

Клієнти відчувають ці покращення на практиці: кращі відповіді, швидші результати, менше виправлень, надійніші продукти й нижча вартість потрібної їм роботи.

Переваги накопичуються. Краща інфраструктура прискорює дослідження. Дослідження створюють потужніші й ефективніші моделі. Кращі моделі покращують продукти. Кращі продукти стимулюють упровадження, навчання й дохід. Це зростання підтримує подальші інвестиції в наступне покоління досліджень, обчислень, розгортання й безпеки.

OpenAI об’єднує ці елементи на єдиній платформі інтелекту. Люди користуються нею через ChatGPT і ChatGPT Робота. Розробники створюють рішення на її основі через Codex і API. Підприємства розгортають її в системах, де виконується робота.

Коли вдосконалюється один рівень, виграти може кожен продукт і кожен клієнт.

Система оцінювання для епохи ШІ

Разом ці чотири показники показують, чи покращується корисний інтелект на долар.

Корисна робота показує, що створює ШІ. Вартість успішного завдання показує, що потрібно, щоб досягти результату. Надійність показує, яку частину виконаної роботи люди можуть упевнено використовувати. Цінність у масштабі показує, чи кожен долар і кожна одиниця обчислень із часом виконують більше роботи.

Мета — ШІ, який допомагає людям виконувати більш змістовну роботу, ухвалювати кращі рішення й більше часу приділяти тим частинам своєї роботи, що потребують суто людського судження та творчості.

Наше завдання — покращувати це рівняння з кожним поколінням: потужніші моделі, швидші й надійніші результати та нижчі витрати на роботу, яку потрібно виконати клієнтам.

Саме так ШІ з часом стає кориснішим для більшої кількості людей та організацій.

Автор

Sarah Friar