Перейти до основного вмісту
OpenAI

GPT-6.1Sol

Інтелект, близький до Astra, уп’ятеро дешевше — для стабільно передових результатів

Представляємо GPT‑6.1 Sol — оновлення GPT‑6 Sol із винятково високими результатами в агентному програмуванні, а також у роботі з комп’ютером і професійних завданнях. Завдяки оновленню Sol наближається до GPT‑6 Astra у складних завданнях за вп’ятеро нижчими стандартними цінами на вхідні й вихідні токени. Це дає розробникам більше можливостей створювати й запускати потужних агентів у межах того самого бюджету.

GPT‑6.1 Sol пропонує результати, близькі до Astra, за ціною Sol. Сьогодні це модель із найкращим співвідношенням результативності та вартості. Кешовані вхідні дані коштують лише 0,10 дол. за мільйон токенів — на 95% дешевше за стандартну ціну вхідних даних. Це здешевлює роботу агентів, яким потрібно повторно використовувати контекст у подальших запитах.

GPT‑6 Astra загалом залишається нашою найпотужнішою передовою моделлю. GPT‑6.1 Sol пропонує новий баланс можливостей і вартості — для важливої роботи, яку користувачі хочуть виконувати частіше, і для клієнтів API, що створюють і запускають застосунки у великих масштабах.

Три картки моделей: GPT-6 Astra — наша найрозумніша модель для найкращих результатів: 10 дол. за вхідні дані, 50 дол. за вихідні та 1 дол. за кешовані вхідні; GPT-6.1 Sol — інтелект, близький до Astra, за вп'ятеро нижчою ціною: 2 дол. за вхідні дані, 10 дол. за вихідні та 0,10 дол. за кешовані вхідні; GPT-6 Luna — швидке й ефективне виконання повсякденної роботи у великих масштабах: 0,10 дол. за вхідні дані, 0,50 дол. за вихідні та 0,01 дол. за кешовані вхідні.

Потужніша Sol для різних завдань

GPT‑6.1 Sol значно перевершує GPT‑6 Sol у складній професійній роботі: від написання й налагодження коду до розуміння документів і виконання багатоетапних бізнес-процесів. У кількох із цих тестів вона наближається до результатів GPT‑6 Astra за суттєво нижчої вартості.

Програмування

У DeepSWE v1.1, що оцінює виконання складних завдань із розробки ПЗ в реальних кодових базах, GPT‑6.1 Sol досягає рівня GPT‑6 Astra за приблизно вп’ятеро нижчої вартості. Водночас вона перевершує найкращий результат GPT‑6 Sol на 6,4 відсоткового пункту за нижчого рівня зусиль на міркування й меншої вартості.

У тесті DeepSWE 1.1⁠⁠(відкривається у новому вікні) ШІ-агенти розв’язують оригінальні завдання з розробки програмного забезпечення, що потребують тривалої багатокрокової роботи.

Професійна робота

На тесті GDP.pdf, який вимірює, наскільки точно моделі відповідають на професійні запитання на основі складних PDF-документів, зокрема таблиць, графіків, діаграм і дрібного шрифту, GPT‑6.1 Sol набирає вищий результат, ніж Opus 5.5 із резервними варіантами (fallbacks), коштуючи менш ніж половину вартості за завдання за всіх перевірених налаштувань рівня міркування. Вона також наближається до найкращої в галузі продуктивності GPT‑6 Astra приблизно за п'яту частину вартості за завдання.

У тесті GDP.pdf⁠(відкривається у новому вікні) моделі мають відповідати на реальні запити щодо складних PDF-документів, які використовуються в роботі фахівців із фінансів, охорони здоров’я, права та ще семи професійних галузей.

У AutomationBench, що перевіряє, чи правильно агенти виконують багатоетапні бізнес-процеси, GPT‑6.1 Sol випереджає Opus 5.5 на 2,2 відсоткового пункту за середнього рівня зусиль на міркування та приблизно втричі нижчої вартості. Цей результат також на 4,8 відсоткового пункту вищий, ніж у GPT‑6 Sol за того самого налаштування.

In AutomationBench 1.0.6⁠⁠(відкривається у новому вікні), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Робота з комп’ютером

GPT‑6.1 Sol також демонструє значний прогрес у завданнях, що потребують взаємодії з комп’ютерними застосунками. На офлайн-наборі OSWorld 2.0, що оцінює агентів у складних робочих процесах на комп’ютері, GPT‑6.1 Sol перевершує GPT‑6 Sol на сім відсоткових пунктів за максимального рівня зусиль на міркування та більш ніж удвічі нижчої вартості. За максимального рівня зусиль на міркування вона відстає від Astra лише на 2,1 відсоткового пункту, а вартість завдання приблизно в сім разів нижча.

In OSWorld 2.0⁠⁠(відкривається у новому вікні), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Наукові дослідження

На тесті Terminal-Bench Science 0.1, який оцінює наукові робочі процеси, зокрема аналіз даних, симуляції та доведення теорем, GPT‑6.1 Sol більш ніж удвічі перевищує результат GPT‑6 Sol за максимального рівня зусиль на міркування, коштуючи менш ніж половину вартості за завдання. За максимальних зусиль GPT‑6.1 Sol коштує в середньому 5,47 дол. за завдання, порівняно з 23,21 дол. для Opus 5.5 і 23,80 дол. для Astra, — тобто забезпечує суттєві наукові можливості за понад 75 % нижчої вартості, ніж будь-яка з цих двох моделей.

GPT‑6 Astra й далі має найвищий результат серед перевірених моделей — 68,1%, тож саме її варто використовувати для найскладніших науково-дослідних завдань.

У тесті Terminal-Bench Science 0.1⁠(відкривається у новому вікні) агенти виконують науково-дослідні завдання за допомогою коду та інструментів термінала, зокрема аналізують дані, запускають симуляції та підбирають параметри моделей.

Фактична точність

GPT‑6.1 Sol також підвищує фактологічну точність у складних промптах. За найвищого рівня зусиль на міркування (xhigh) коефіцієнт фактологічних помилок становить 4,1%, знизившись із 4,5% для GPT‑6 Sol і наближаючись до показника Astra в 4,0% за того самого налаштування, водночас коштуючи приблизно на 83% менше за завдання, ніж Astra.

Цей тест вимірює частку відповідей із принаймні однією фактичною помилкою на знеособлених розмовах, у яких користувачі позначили помилку попередньої моделі. Ці навмисно складні промпти не є репрезентативними для типового використання.

Ми оцінюємо фактичну точність на знеособлених розмовах у ChatGPT, у яких користувачі позначили фактичну помилку попередньої моделі. Ці розмови, що провокують помилки, не відображають типового використання, за якого фактичні помилки трапляються рідше.

Безпечне впровадження GPT‑6.1 Sol

У наших тестах на узгодженість поведінки GPT‑6.1 Sol демонструє значні покращення порівняно з GPT‑6 Sol, наближаючись до GPT‑6 Astra.

GPT‑6.1 Sol прозоріше повідомляє про власні обмеження й надійніше дотримується наміру користувача та вимог безпеки. У складних оцінюваннях вона демонструє нижчу частку збоїв, ніж GPT‑6 Sol, щодо прозорості про несправні інструменти пошуку, дотримання явних обмежень та уникнення несанкціонованих результатів під час агентних завдань. Ми не зафіксували жодних спроб обійти автоматизовану систему перевірки безпеки — результат, ідентичний GPT‑6 Astra та GPT‑6 Sol.

Наведені нижче тести навмисно перевіряють складні ситуації й не вимірюють частоту збоїв за типового використання.

Ціни й доступність

Відсьогодні GPT‑6.1 Sol доступна всім користувачам Plus, Pro, Business, Enterprise та Edu в ChatGPT Робота й Codex. У режимі «Чат» ці моделі поки недоступні. Розробники також можуть використовувати її через OpenAI API як gpt-6.1-sol. Стандартні ціни в API: 2 дол. за мільйон вхідних токенів, 0,10 дол. за мільйон кешованих вхідних токенів і 10 дол. за мільйон вихідних токенів.

Водночас ми запускаємо GPT‑6 Astra Ultrafast — найшвидшу у світі передову модель, яка працює до 8 разів швидше за GPT‑6 Astra, а також GPT‑6.1 Sol Ultrafast. Ці моделі доступні як в API, так і в ChatGPT Робота і Codex користувачам нашого нового, найвищого за обсягом використання тарифу Pro за 500 дол./міс. Завдяки GPT‑6.1 Sol Ultrafast розробники можуть отримати інтелект, близький до рівня Astra, зі швидкістю до 8 разів вищою, приблизно за ту саму суму витрат на API, яку раніше вимагала GPT‑6 Astra.

Автор

OpenAI

Оцінювання GPT проводили в нашому дослідницькому середовищі або через наш API. Результати можуть дещо відрізнятися від відповідей у загальнодоступному ChatGPT через відмінності в системних промптах, доступних інструментах, рівнях зусиль на міркування тощо. Оцінки моделей конкурентів узято з відкритих звітів.