Перейти до основного вмісту
OpenAI

Представляємо GPT‑6 Sol і Luna

Більше способів залучити передовий інтелект до щоденної роботи.

Завантаження…

На початку цього місяця ми представили GPT‑6 Astra — найінтелектуальнішу й найбезпечнішу (aligned) модель у світі. Хоча найвимогливіші й найважливіші проєкти й надалі потребують усієї глибини можливостей Astra, робота відбувається в різних масштабах, ритмах і з різними бюджетами.

Тому ми розширюємо всесвіт GPT‑6 моделями GPT‑6 Sol і GPT‑6 Luna. GPT‑6 Astra започаткувала нове покоління інтелекту — ці моделі допомагають поширити переваги цього інтелекту, просуваючи передовий рубіж ефективності витрат. Ми навчали GPT‑6 Sol і Luna за методами, подібними до тих, що застосовувалися для GPT‑6 Astra, перенісши досягнення, які забезпечують найкращу в галузі продуктивність Astra в професійній роботі, фактологічній точності, програмуванні, роботі з комп'ютером і безпечності (alignment), у швидші й доступніші моделі.

Моделі GPT‑6 лідирують уздовж усієї кривої «вартість — інтелект», поєднуючи виняткові можливості на кожному рівні з інфраструктурою, що ефективно доставляє їх у масштабі. Удосконалення в кешуванні та інференсі дають нам змогу обслуговувати ці моделі за нижчою вартістю, і ми передаємо цю економію безпосередньо користувачам і клієнтам, знижуючи ціни на API для Sol і Luna на 50% порівняно з їхніми акційними цінами для GPT‑5.6. Разом ці вдосконалення роблять передовий ШІ практичним для більшої кількості повсякденних завдань і застосунків у масштабі.

Ціни на API GPT‑6

Модель

Вхідні дані

Вихідні дані

Зниження ціни

GPT‑6 Sol
порівняно з GPT‑5.6 Sol

$4 → $2

$20 → $10

На 50% дешевше

GPT‑6 Luna
порівняно з GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

На 50% дешевше

Ціни вказано за 1 мільйон токенів.

GPT‑6 Astra залишається нашою найкращою моделлю за всіма показниками. Вибирайте її, якщо прагнете найкращих результатів без компромісів.

Новий рівень у всій родині моделей

GPT‑6 Sol і Luna підвищують рівень інтелекту та економічність уже знайомих вам моделей у тих можливостях, які найкорисніші для виконання складної роботи.

Професійна робота

GPT‑6 Sol здатна виконувати складні робочі завдання, водночас даючи більше простору для ітерацій завдяки вищим лімітам використання та нижчій вартості. Вона забезпечує вищий рівень інтелекту й кращі результати, ніж моделі конкурентів зі схожою ціною.

У AutomationBench — тесті бізнес-процесів у різних застосунках — GPT‑6 Sol із дуже високим рівнем зусиль (max) перевершує Claude Opus 5 із максимальним рівнем, витрачаючи на завдання лише 9% від вартості Opus 5. За високого рівня зусиль GPT‑6 Luna перевершує попередницю на 5,4 відсоткового пункту, а вартість завдання знижується на 58%.

У AutomationBench 1.0.6⁠(відкривається у новому вікні) агентів ШІ тестують у наскрізних робочих процесах із використанням 47 інструментів у продажах, маркетингу, операційній діяльності, підтримці, фінансах і роботі з персоналом. Показник Claude Fable 5.1 занижує її фактичну вартість, оскільки не враховує вартість переходів на резервну Opus 5, які відбулися приблизно у 40% завдань.

GPT‑6 Sol також перевершує Claude Fable 5.1 за значно нижчої вартості й навіть випереджає GPT‑6 Astra з низьким рівнем зусиль (low).

Модель (і рівень зусиль)

Оцінка

Вартість завдання

GPT‑6 Sol (дуже високий)

33,2%

$0,27

GPT‑6 Astra (низький)

30,3%

У 3,9 раза дорожче за GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

В 11,1 раза дорожче за GPT‑6 Sol

Claude Fable 5.1 із резервним Opus 5 (Max)

31,4%

У >8,9 раза дорожче за GPT‑6 Sol

(вартість резервної моделі не вказано)

У тесті Agents’ Last Exam, який оцінює роботу агентів у складних професійних робочих процесах, GPT‑6 Sol за максимальних зусиль (max) набирає 56,4%, що перевищує найвищий результат Claude Opus 5 в цьому оцінюванні, і водночас коштує на 60% менше в розрахунку на одне завдання.

У Agents’ Last Exam V1⁠(відкривається у новому вікні) агентів ШІ оцінюють на довготривалих, економічно цінних завданнях у 55 підгалузях, які охоплюють більшість основних напрямів професійної роботи за комп’ютером.

Фактологічна точність

Корисність відповіді залежить від точності фактів, і ми продовжуємо підвищувати фактологічну надійність. У нашому внутрішньому оцінюванні фактологічної точності, що ґрунтується на деідентифікованих реальних розмовах, у яких користувачі позначили помилки наших моделей, GPT‑6 Sol помиляється приблизно вдвічі рідше за попередницю й наближається до надійності Astra за значно нижчої вартості. GPT‑6 Luna також демонструє значне покращення: на вищих рівнях зусиль вона досягає показників GPT‑5.6 Sol приблизно за соту частину її вартості.

Тут ми оцінюємо фактологічну точність на деідентифікованих розмовах у ChatGPT, де користувачі позначили фактичну помилку попередньої моделі. Ці розмови, що провокують помилки, не відображають типового використання, за якого фактичні помилки трапляються рідше. Оцінки не скориговано з урахуванням довжини, однак наші перевірки різних рівнів докладності майже не виявили залежності від довжини відповіді.

Програмування

Цього року агенти для програмування почали виконувати завдання безпрецедентної складності, масштабу й тривалості. Внутрішнє використання в OpenAI зросло експоненційно. За цінами API щоденна вартість використаних токенів перевищила $600 для медіанного дослідника та $7 000 для дослідників у 90-му перцентилі («Прискорення досліджень: погляд зсередини OpenAI»⁠). Оскільки агенти для програмування беруться за довші й складніші завдання, вартість тривалого використання набуває дедалі більшого значення. GPT‑6 Sol і Luna поєднують високі результати в програмуванні з нижчими цінами API, даючи розробникам більше простору для ітерацій, а командам — упевненість ставити перед Codex амбітніші завдання.

У FrontierCode, що оцінює, чи створюють агенти для програмування готові до злиття зміни в реальних кодових базах, GPT‑6 Sol значно перевершує GPT‑5.6 Sol і досягає рівня Claude Fable 5.1 із дуже високим рівнем зусиль за набагато нижчої вартості.

У FrontierCode 1.1 Main⁠(відкривається у новому вікні) агенти ШІ пишуть код, який оцінюють не лише за правильністю, а й за «готовністю до злиття»: наприклад, за якістю тестів, дотриманням меж завдання, стилем коду та стандартами кодової бази.

У тесті DeepSWE v1.1, який перевіряє продуктивність у складних інженерних завданнях у реальних кодових базах, GPT‑6 Sol за максимальних зусиль (max) набирає 68,8%, що лише на 1,1 відсоткового пункту нижче за найвищий результат Claude Fable 5 в цьому оцінюванні — 69,9% за рівня зусиль xhigh, — і водночас коштує приблизно на 80% менше в розрахунку на одне завдання.

GPT‑6 Luna з максимальним рівнем зусиль (max) набирає 66,6%, що можна порівняти з Claude Opus 5 і Fable 5 із середнім рівнем зусиль (medium). У цих порівняннях вартість завдання для Luna на 93% нижча, ніж для Opus 5, і на 96% нижча, ніж для Fable 5.

У DeepSWE 1.1⁠(відкривається у новому вікні) агенти ШІ розв’язують оригінальні довготривалі завдання з розробки програмного забезпечення.

Робота з комп’ютером

Хоча GPT‑6 Astra залишається найкращою у світі моделлю для роботи з комп'ютером, GPT‑6 Sol і Luna пропонують ефективніше співвідношення вартості й продуктивності порівняно зі своїми попередниками. На тесті OSWorld 2.0 offline GPT‑6 Sol за рівня зусиль xhigh досягає результату, подібного до Claude Opus 5 за середнього рівня зусиль (medium), — 60,5% проти 60,3%, — і водночас коштує приблизно на 80% менше в розрахунку на одне завдання. GPT‑6 Luna (max) здатна перевершити GPT‑5.6 Sol (medium), витрачаючи лише десяту частину її вартості.

У OSWorld 2.0⁠(відкривається у новому вікні) агенти ШІ намагаються виконати довготривалі сценарії роботи з комп’ютером, що охоплюють повсякденні й професійні завдання. Ми наводимо часткову оцінку для офлайн-набору з випуску v2026.08.08.

Стиль співпраці

Ми також перенесли вдосконалений стиль спілкування GPT‑6 Astra до Sol і Luna. На нашу думку, це буде особливо помітно в технічних розмовах і обговореннях програмування. Очікуйте більшої ясності, менше жаргону й дивних зворотів, менше малокорисних подробиць і загалом трохи коротших відповідей без втрати змісту.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Хоча стиль суб’єктивний, тут ми віддаємо перевагу відповіді GPT‑6 Sol. Вона не так швидко робить висновки, витрачає менше часу на повторення деталей, які можуть бути очевидними для автора запиту (наприклад, що сайт має чотири сторінки), рідше вживає нечіткі формулювання (наприклад, «відчуття бенто», «перебудова… навколо цієї системи»), відвертіше повідомляє, що було й не було перевірено, і не наводить без потреби подробиць реалізації, як-от запит до інструмента для зображень.

Удосконалення кешування для агентів і довгих розмов

Крім зниження цін на токени, ми допомагаємо розробникам рішень на базі GPT‑6 більше заощаджувати на контексті, який повторно використовують їхні застосунки. Ми вдосконалили кешування запиту для GPT‑6, щоб за замовчуванням підвищити частоту влучань у кеш. Це допомагає агентам повторно використовувати більше контексту, швидше відповідати й отримувати знижку 90% на читання кешованих вхідних токенів.

Розробники також отримали більше способів вимірювати й оптимізувати ефективність кешування:

За даними GitHub, протягом останніх кількох місяців ці вдосконалення більш ніж на 50% скоротили частку токенів запитів, що потребували нової обробки, у мільярдах звернень до моделей OpenAI, допомагаючи Copilot відповідати швидше.

Подальше вдосконалення узгодження

GPT‑6 Sol і Luna розвивають напрацювання з узгодження, уперше представлені в Astra — нашій найбільш узгодженій моделі на сьогодні. У наших оцінюваннях узгодження Sol і Luna перевершують відповідні моделі GPT‑5.6, зокрема рідше роблять оманливі заяви про свою роботу з кодом.

Наведені нижче оцінювання навмисно перевіряють складні ситуації й не вимірюють частоту збоїв за типового використання. Повні результати наведено в картці системи⁠(відкривається у новому вікні).

Доступність

Відсьогодні GPT‑6 Sol і GPT‑6 Luna доступні в ChatGPT Робота та Codex усім користувачам планів Plus, Pro, Business, Enterprise і Edu. Користувачі планів Free і Go можуть використовувати GPT‑6 Luna в настільному застосунку. Ці моделі поки що недоступні в режимі Чат. В API OpenAI вони доступні як gpt-6-sol і gpt-6-luna.

Щоб сервіс залишався стабільним для всіх, ми плануємо впроваджувати ці моделі в ChatGPT поступово протягом дня. Якщо ви не бачите нових моделей у ChatGPT Робота або Codex, спробуйте ще раз пізніше.


Оцінювання GPT проводилися в нашому дослідницькому середовищі або через API, тому через відмінності в системних запитах, доступних інструментах тощо результати можуть дещо відрізнятися від робочої версії ChatGPT. Оцінки моделей конкурентів узято із загальнодоступних звітів. Коли оцінки Claude Fable 5.1 були недоступні, ми наводили показники Claude Fable 5.

Автор

OpenAI