Представляємо GPT‑6 Sol і Luna
Більше способів залучити передовий інтелект до щоденної роботи.
На початку цього місяця ми представили GPT‑6 Astra — найінтелектуальнішу й найбезпечнішу (aligned) модель у світі. Хоча найвимогливіші й найважливіші проєкти й надалі потребують усієї глибини можливостей Astra, робота відбувається в різних масштабах, ритмах і з різними бюджетами.
Тому ми розширюємо всесвіт GPT‑6 моделями GPT‑6 Sol і GPT‑6 Luna. GPT‑6 Astra започаткувала нове покоління інтелекту — ці моделі допомагають поширити переваги цього інтелекту, просуваючи передовий рубіж ефективності витрат. Ми навчали GPT‑6 Sol і Luna за методами, подібними до тих, що застосовувалися для GPT‑6 Astra, перенісши досягнення, які забезпечують найкращу в галузі продуктивність Astra в професійній роботі, фактологічній точності, програмуванні, роботі з комп'ютером і безпечності (alignment), у швидші й доступніші моделі.
Моделі GPT‑6 лідирують уздовж усієї кривої «вартість — інтелект», поєднуючи виняткові можливості на кожному рівні з інфраструктурою, що ефективно доставляє їх у масштабі. Удосконалення в кешуванні та інференсі дають нам змогу обслуговувати ці моделі за нижчою вартістю, і ми передаємо цю економію безпосередньо користувачам і клієнтам, знижуючи ціни на API для Sol і Luna на 50% порівняно з їхніми акційними цінами для GPT‑5.6. Разом ці вдосконалення роблять передовий ШІ практичним для більшої кількості повсякденних завдань і застосунків у масштабі.
Модель | Вхідні дані | Вихідні дані | Зниження ціни |
GPT‑6 Sol | $4 → $2 | $20 → $10 | На 50% дешевше |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | На 50% дешевше |
Ціни вказано за 1 мільйон токенів.
GPT‑6 Astra залишається нашою найкращою моделлю за всіма показниками. Вибирайте її, якщо прагнете найкращих результатів без компромісів.
GPT‑6 Sol і Luna підвищують рівень інтелекту та економічність уже знайомих вам моделей у тих можливостях, які найкорисніші для виконання складної роботи.
GPT‑6 Sol здатна виконувати складні робочі завдання, водночас даючи більше простору для ітерацій завдяки вищим лімітам використання та нижчій вартості. Вона забезпечує вищий рівень інтелекту й кращі результати, ніж моделі конкурентів зі схожою ціною.
У AutomationBench — тесті бізнес-процесів у різних застосунках — GPT‑6 Sol із дуже високим рівнем зусиль (max) перевершує Claude Opus 5 із максимальним рівнем, витрачаючи на завдання лише 9% від вартості Opus 5. За високого рівня зусиль GPT‑6 Luna перевершує попередницю на 5,4 відсоткового пункту, а вартість завдання знижується на 58%.
У AutomationBench 1.0.6(відкривається у новому вікні) агентів ШІ тестують у наскрізних робочих процесах із використанням 47 інструментів у продажах, маркетингу, операційній діяльності, підтримці, фінансах і роботі з персоналом. Показник Claude Fable 5.1 занижує її фактичну вартість, оскільки не враховує вартість переходів на резервну Opus 5, які відбулися приблизно у 40% завдань.
GPT‑6 Sol також перевершує Claude Fable 5.1 за значно нижчої вартості й навіть випереджає GPT‑6 Astra з низьким рівнем зусиль (low).
Модель (і рівень зусиль) | Оцінка | Вартість завдання |
|---|---|---|
GPT‑6 Sol (дуже високий) | 33,2% | $0,27 |
GPT‑6 Astra (низький) | 30,3% | У 3,9 раза дорожче за GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | В 11,1 раза дорожче за GPT‑6 Sol |
Claude Fable 5.1 із резервним Opus 5 (Max) | 31,4% | У >8,9 раза дорожче за GPT‑6 Sol (вартість резервної моделі не вказано) |
У тесті Agents’ Last Exam, який оцінює роботу агентів у складних професійних робочих процесах, GPT‑6 Sol за максимальних зусиль (max) набирає 56,4%, що перевищує найвищий результат Claude Opus 5 в цьому оцінюванні, і водночас коштує на 60% менше в розрахунку на одне завдання.
У Agents’ Last Exam V1(відкривається у новому вікні) агентів ШІ оцінюють на довготривалих, економічно цінних завданнях у 55 підгалузях, які охоплюють більшість основних напрямів професійної роботи за комп’ютером.
Корисність відповіді залежить від точності фактів, і ми продовжуємо підвищувати фактологічну надійність. У нашому внутрішньому оцінюванні фактологічної точності, що ґрунтується на деідентифікованих реальних розмовах, у яких користувачі позначили помилки наших моделей, GPT‑6 Sol помиляється приблизно вдвічі рідше за попередницю й наближається до надійності Astra за значно нижчої вартості. GPT‑6 Luna також демонструє значне покращення: на вищих рівнях зусиль вона досягає показників GPT‑5.6 Sol приблизно за соту частину її вартості.
Тут ми оцінюємо фактологічну точність на деідентифікованих розмовах у ChatGPT, де користувачі позначили фактичну помилку попередньої моделі. Ці розмови, що провокують помилки, не відображають типового використання, за якого фактичні помилки трапляються рідше. Оцінки не скориговано з урахуванням довжини, однак наші перевірки різних рівнів докладності майже не виявили залежності від довжини відповіді.
Цього року агенти для програмування почали виконувати завдання безпрецедентної складності, масштабу й тривалості. Внутрішнє використання в OpenAI зросло експоненційно. За цінами API щоденна вартість використаних токенів перевищила $600 для медіанного дослідника та $7 000 для дослідників у 90-му перцентилі («Прискорення досліджень: погляд зсередини OpenAI»). Оскільки агенти для програмування беруться за довші й складніші завдання, вартість тривалого використання набуває дедалі більшого значення. GPT‑6 Sol і Luna поєднують високі результати в програмуванні з нижчими цінами API, даючи розробникам більше простору для ітерацій, а командам — упевненість ставити перед Codex амбітніші завдання.
У FrontierCode, що оцінює, чи створюють агенти для програмування готові до злиття зміни в реальних кодових базах, GPT‑6 Sol значно перевершує GPT‑5.6 Sol і досягає рівня Claude Fable 5.1 із дуже високим рівнем зусиль за набагато нижчої вартості.
У FrontierCode 1.1 Main(відкривається у новому вікні) агенти ШІ пишуть код, який оцінюють не лише за правильністю, а й за «готовністю до злиття»: наприклад, за якістю тестів, дотриманням меж завдання, стилем коду та стандартами кодової бази.
У тесті DeepSWE v1.1, який перевіряє продуктивність у складних інженерних завданнях у реальних кодових базах, GPT‑6 Sol за максимальних зусиль (max) набирає 68,8%, що лише на 1,1 відсоткового пункту нижче за найвищий результат Claude Fable 5 в цьому оцінюванні — 69,9% за рівня зусиль xhigh, — і водночас коштує приблизно на 80% менше в розрахунку на одне завдання.
GPT‑6 Luna з максимальним рівнем зусиль (max) набирає 66,6%, що можна порівняти з Claude Opus 5 і Fable 5 із середнім рівнем зусиль (medium). У цих порівняннях вартість завдання для Luna на 93% нижча, ніж для Opus 5, і на 96% нижча, ніж для Fable 5.
У DeepSWE 1.1(відкривається у новому вікні) агенти ШІ розв’язують оригінальні довготривалі завдання з розробки програмного забезпечення.
Хоча GPT‑6 Astra залишається найкращою у світі моделлю для роботи з комп'ютером, GPT‑6 Sol і Luna пропонують ефективніше співвідношення вартості й продуктивності порівняно зі своїми попередниками. На тесті OSWorld 2.0 offline GPT‑6 Sol за рівня зусиль xhigh досягає результату, подібного до Claude Opus 5 за середнього рівня зусиль (medium), — 60,5% проти 60,3%, — і водночас коштує приблизно на 80% менше в розрахунку на одне завдання. GPT‑6 Luna (max) здатна перевершити GPT‑5.6 Sol (medium), витрачаючи лише десяту частину її вартості.
У OSWorld 2.0(відкривається у новому вікні) агенти ШІ намагаються виконати довготривалі сценарії роботи з комп’ютером, що охоплюють повсякденні й професійні завдання. Ми наводимо часткову оцінку для офлайн-набору з випуску v2026.08.08.
Ми також перенесли вдосконалений стиль спілкування GPT‑6 Astra до Sol і Luna. На нашу думку, це буде особливо помітно в технічних розмовах і обговореннях програмування. Очікуйте більшої ясності, менше жаргону й дивних зворотів, менше малокорисних подробиць і загалом трохи коротших відповідей без втрати змісту.
Хоча стиль суб’єктивний, тут ми віддаємо перевагу відповіді GPT‑6 Sol. Вона не так швидко робить висновки, витрачає менше часу на повторення деталей, які можуть бути очевидними для автора запиту (наприклад, що сайт має чотири сторінки), рідше вживає нечіткі формулювання (наприклад, «відчуття бенто», «перебудова… навколо цієї системи»), відвертіше повідомляє, що було й не було перевірено, і не наводить без потреби подробиць реалізації, як-от запит до інструмента для зображень.
Крім зниження цін на токени, ми допомагаємо розробникам рішень на базі GPT‑6 більше заощаджувати на контексті, який повторно використовують їхні застосунки. Ми вдосконалили кешування запиту для GPT‑6, щоб за замовчуванням підвищити частоту влучань у кеш. Це допомагає агентам повторно використовувати більше контексту, швидше відповідати й отримувати знижку 90% на читання кешованих вхідних токенів.
Розробники також отримали більше способів вимірювати й оптимізувати ефективність кешування:
Моніторинг і діагностика. Панель кешування запиту(відкривається у новому вікні) показує, який обсяг вхідних даних кешується та як цей показник змінюється з часом. Інструмент діагностики(відкривається у новому вікні) допомагає з’ясувати причини втрачених можливостей кешування й те, що потрібно виправити.
Змінюйте рівень зусиль для міркування й доступність інструментів, не порушуючи кеш. Підвищуйте рівень зусиль для міркування(відкривається у новому вікні) у складних завданнях або знижуйте його для простіших подальших запитів, а також вмикайте чи вимикайте інструменти(відкривається у новому вікні) відповідно до змін у потребах агента. Тепер обидва елементи керування зберігають попередній контекст для повторного використання кешу.
Оптимізуйте вибір префіксів для кешування. Явні точки розриву дають розробникам змогу визначати, де закінчуються кешовані префікси запитів. Це дає розробникам більше контролю над повторним використанням кешу й може підвищити продуктивність.
За даними GitHub, протягом останніх кількох місяців ці вдосконалення більш ніж на 50% скоротили частку токенів запитів, що потребували нової обробки, у мільярдах звернень до моделей OpenAI, допомагаючи Copilot відповідати швидше.
GPT‑6 Sol і Luna розвивають напрацювання з узгодження, уперше представлені в Astra — нашій найбільш узгодженій моделі на сьогодні. У наших оцінюваннях узгодження Sol і Luna перевершують відповідні моделі GPT‑5.6, зокрема рідше роблять оманливі заяви про свою роботу з кодом.
Наведені нижче оцінювання навмисно перевіряють складні ситуації й не вимірюють частоту збоїв за типового використання. Повні результати наведено в картці системи(відкривається у новому вікні).
Відсьогодні GPT‑6 Sol і GPT‑6 Luna доступні в ChatGPT Робота та Codex усім користувачам планів Plus, Pro, Business, Enterprise і Edu. Користувачі планів Free і Go можуть використовувати GPT‑6 Luna в настільному застосунку. Ці моделі поки що недоступні в режимі Чат. В API OpenAI вони доступні як gpt-6-sol і gpt-6-luna.
Щоб сервіс залишався стабільним для всіх, ми плануємо впроваджувати ці моделі в ChatGPT поступово протягом дня. Якщо ви не бачите нових моделей у ChatGPT Робота або Codex, спробуйте ще раз пізніше.
Оцінювання GPT проводилися в нашому дослідницькому середовищі або через API, тому через відмінності в системних запитах, доступних інструментах тощо результати можуть дещо відрізнятися від робочої версії ChatGPT. Оцінки моделей конкурентів узято із загальнодоступних звітів. Коли оцінки Claude Fable 5.1 були недоступні, ми наводили показники Claude Fable 5.


