Переход к основному контенту
OpenAI

Представляем GPT‑6 Sol и Luna

Ещё больше способов применять передовой интеллект в повседневной работе.

Загрузка…

В начале этого месяца мы представили GPT‑6 Astra — самую интеллектуальную и согласованную модель в мире. Самые сложные и важные проекты по-прежнему требуют всей глубины возможностей Astra, но задачи различаются по масштабу, темпу и бюджету.

Поэтому мы расширяем семейство GPT‑6 моделями GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra открыла новое поколение интеллекта, а эти модели помогают сделать его преимущества доступнее, делая передовые возможности ИИ более экономически эффективными и доступными. Мы обучали GPT‑6 Sol и Luna методами, схожими с применёнными для GPT‑6 Astra, и перенесли достижения, обеспечившие передовые результаты Astra в профессиональной работе, фактологической точности, программировании, управлении компьютером и согласованности, в более быстрые и доступные модели.

Модели GPT‑6 лидируют по всему диапазону соотношения стоимости и интеллекта, сочетая исключительные возможности на каждом уровне с инфраструктурой для эффективного масштабирования. Улучшения кэширования и инференса позволили снизить стоимость обслуживания этих моделей, и мы напрямую передаём эту экономию пользователям и клиентам: цены API для Sol и Luna снижены на 50% относительно акционных цен GPT‑5.6. В совокупности эти улучшения делают передовой ИИ практичным решением для большего числа повседневных задач и масштабных приложений.

Цены на API GPT‑6

Модель

Ввод

Вывод

Снижение цены

GPT‑6 Sol
в сравнении с GPT‑5.6 Sol

$4 → $2

$20 → $10

На 50% дешевле

GPT‑6 Luna
в сравнении с GPT‑5.6 Luna

$0,20 → $0,10

$1,20 → $0,50

На 50% дешевле

Цены указаны за 1 миллион токенов.

GPT‑6 Astra остаётся нашей лучшей моделью по всем параметрам. Выбирайте её, если вам нужны наилучшие результаты без компромиссов.

Новый уровень для всего семейства моделей

GPT‑6 Sol и Luna повышают интеллект и экономическую эффективность уже знакомых вам моделей в областях, наиболее важных для решения сложных рабочих задач.

Профессиональная работа

GPT‑6 Sol справляется со сложными рабочими задачами, а повышенные лимиты и меньшая стоимость дают больше возможностей для итераций. При этом модель обладает более широкими интеллектуальными возможностями и показывает лучшие результаты, чем сопоставимые по цене модели конкурентов.

В AutomationBench — тесте бизнес-процессов в различных приложениях — GPT‑6 Sol с «очень высоким» уровнем усилий превосходит Claude Opus 5 с «максимальными» усилиями, а стоимость задачи составляет лишь 9% от стоимости Opus 5. При «высоком» уровне усилий GPT‑6 Luna превосходит предшественницу на 5,4 процентного пункта, а стоимость задачи снижается на 58%.

В тесте AutomationBench 1.0.6⁠(открывается в новом окне) агенты ИИ проверяются на сквозных рабочих процессах с использованием 47 инструментов в продажах, маркетинге, операционной деятельности, поддержке, финансах и управлении персоналом. Показатель Claude Fable 5.1 занижает фактическую стоимость, поскольку не учитывает расходы на переход к Opus 5, происходивший примерно в 40% задач.

GPT‑6 Sol также превосходит Claude Fable 5.1 при гораздо меньшей стоимости и даже опережает GPT‑6 Astra с «низким» уровнем усилий.

Модель (и уровень усилий)

Результат

Стоимость задачи

GPT‑6 Sol (очень высокий)

33,2%

$0,27

GPT‑6 Astra (низкий)

30,3%

В 3,9 раза дороже GPT‑6 Sol

Claude Opus 5 (максимальный)

26,9%

В 11,1 раза дороже GPT‑6 Sol

Claude Fable 5.1 с переходом на Opus 5 (максимальный)

31,4%

Более чем в 8,9 раза дороже GPT‑6 Sol

(стоимость перехода не указана)

В тесте Agents’ Last Exam, оценивающем агентов в сложных профессиональных процессах, GPT‑6 Sol с «максимальным» уровнем усилий набирает 56,4% — больше максимального результата Claude Opus 5 в этом тесте, — при этом стоимость задачи ниже на 60%.

В тесте Agents’ Last Exam V1⁠(открывается в новом окне) агенты ИИ оцениваются на долгосрочных, экономически значимых задачах из 55 отраслевых сегментов, охватывающих большинство основных направлений профессиональной работы за компьютером.

Фактологическая точность

Полезность ответа зависит от точности фактов, и мы продолжаем повышать фактологическую надёжность. В нашей внутренней оценке фактологической точности, основанной на обезличенных реальных диалогах, где пользователи отмечали ошибки наших моделей, GPT‑6 Sol допускает примерно вдвое меньше ошибок, чем её предшественница. Её надёжность приближается к уровню Astra при гораздо меньшей стоимости. GPT‑6 Luna также значительно улучшилась: при повышенных уровнях усилий она сравнивается с GPT‑5.6 Sol при стоимости примерно в сто раз ниже.

Здесь мы оцениваем фактологическую точность на обезличенных диалогах ChatGPT, в которых пользователи отмечали фактическую ошибку предыдущей модели. Такие провоцирующие ошибки диалоги не отражают типичное использование, где фактические ошибки встречаются реже. Результаты не нормализованы по длине, однако наши проверки разных уровней подробности почти не выявили зависимости от длины ответа.

Программирование

В этом году агенты для программирования начали решать задачи беспрецедентной сложности, масштаба и продолжительности. Внутреннее использование в OpenAI растёт экспоненциально. Если оценивать по ценам API, медианный исследователь ежедневно использует токены более чем на 600 долларов США, а исследователи в 90-м процентиле — более чем на 7000 долларов США («Ускорение исследований: взгляд изнутри OpenAI»⁠). По мере того как агенты для программирования берутся за более длительные и сложные задачи, стоимость постоянного использования приобретает всё большее значение. GPT‑6 Sol и Luna сочетают высокие результаты в программировании с более низкими ценами API, давая разработчикам больше возможностей для итераций, а командам — уверенность ставить перед Codex более амбициозные задачи.

В FrontierCode, где оценивается готовность изменений от агентов для программирования к слиянию с реальными кодовыми базами, GPT‑6 Sol значительно превосходит GPT‑5.6 Sol и сравнивается с Claude Fable 5.1 при «очень высоком» уровне усилий и гораздо меньшей стоимости.

В тесте FrontierCode 1.1 Main⁠(открывается в новом окне) агенты ИИ пишут код, который оценивается не только по корректности, но и по «готовности к слиянию»: например, по качеству тестов, соблюдению границ задачи, стилю кода и стандартам кодовой базы.

В тесте DeepSWE v1.1, оценивающем выполнение сложных задач программной инженерии в реальных кодовых базах, GPT‑6 Sol с «максимальным» уровнем усилий набирает 68,8% — лишь на 1,1 процентного пункта меньше лучшего результата Claude Fable 5 в этом тесте: 69,9% при «очень высоком» уровне. При этом стоимость задачи примерно на 80% ниже.

GPT‑6 Luna с «максимальным» уровнем усилий набирает 66,6% — результат сопоставим с Claude Opus 5 и Fable 5 при «среднем» уровне усилий. В этих сравнениях стоимость задачи для Luna на 93% ниже, чем для Opus 5, и на 96% ниже, чем для Fable 5.

В тесте DeepSWE 1.1⁠(открывается в новом окне) агенты ИИ решают оригинальные долгосрочные задачи программной инженерии.

Управление компьютером

GPT‑6 Astra остаётся лучшей в мире моделью для управления компьютером, а GPT‑6 Sol и Luna обеспечивают более экономичные результаты, чем их предшественницы. В офлайн-тесте OSWorld 2.0 GPT‑6 Sol с «очень высоким» уровнем усилий показывает результат, сопоставимый с Claude Opus 5 при «среднем» уровне усилий: 60,5% против 60,3%. При этом стоимость задачи примерно на 80% ниже. GPT‑6 Luna (максимальный) превосходит GPT‑5.6 Sol (средний) при стоимости в десять раз ниже.

В тесте OSWorld 2.0⁠(открывается в новом окне) агенты ИИ выполняют долгосрочные сценарии управления компьютером, охватывающие повседневные и профессиональные задачи. Мы приводим частичную оценку на офлайн-наборе из выпуска v2026.08.08.

Стиль взаимодействия

Мы также перенесли улучшенный стиль общения GPT‑6 Astra в Sol и Luna. Полагаем, это будет особенно заметно в технических беседах и обсуждениях программирования. Ответы станут яснее и немного короче без потери смысла, в них будет меньше жаргона, странных оборотов и малополезных деталей.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Хотя стиль субъективен, здесь мы предпочитаем ответ GPT‑6 Sol. Модель не спешит с выводами, меньше повторяет детали, которые могут быть очевидны автору вопроса (например, что на сайте четыре страницы), реже использует расплывчатые формулировки (например, «ощущение бенто», «перестраивая… вокруг этой системы»), яснее сообщает, что именно проверяла и не проверяла, и не раскрывает без необходимости детали реализации, такие как промпт для инструмента генерации изображений.

Улучшенное кэширование для агентов и долгих диалогов

Помимо снижения цен на токены, мы помогаем разработчикам решений на базе GPT‑6 больше экономить на контексте, который повторно используется в их приложениях. Мы улучшили кэширование промптов для GPT‑6, по умолчанию повысив долю попаданий в кэш. Благодаря этому агенты могут повторно использовать больше контекста, быстрее отвечать и получать скидку 90% на чтение кэшированных входных токенов.

У разработчиков также появилось больше способов измерять и оптимизировать эффективность кэширования:

По данным GitHub, за последние несколько месяцев эти улучшения более чем на 50% сократили долю токенов промптов, требующих новой обработки, в миллиардах запросов к моделям OpenAI, благодаря чему Copilot отвечает быстрее.

Продолжаем повышать согласованность

GPT‑6 Sol и Luna развивают подходы к согласованности, впервые реализованные в Astra — нашей наиболее согласованной модели на сегодняшний день. В наших оценках согласованности Sol и Luna превосходят соответствующие модели GPT‑5.6, в том числе реже делают вводящие в заблуждение заявления о выполненной ими работе с кодом.

Приведённые ниже оценки намеренно проверяют сложные ситуации и не измеряют частоту сбоев при типичном использовании. Полные результаты приведены в системной карточке⁠(открывается в новом окне).

Доступность

С сегодняшнего дня GPT‑6 Sol и GPT‑6 Luna доступны в ChatGPT Работа и Codex всем пользователям планов Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут получить доступ к GPT‑6 Luna в приложении для компьютера. В Чате эти модели пока недоступны. В API OpenAI они доступны как gpt-6-sol и gpt-6-luna.

Чтобы обеспечить стабильность сервиса для всех, мы планируем постепенно развёртывать эти модели в ChatGPT в течение дня. Если новые модели ещё не появились в ChatGPT Работа или Codex, повторите попытку позже.


Оценки GPT проводились в нашей исследовательской среде или через API, поэтому из-за различий в системных промптах, доступных инструментах и других факторах результаты могут немного отличаться от результатов ChatGPT в реальной эксплуатации. Оценки моделей конкурентов взяты из общедоступных отчётов. Если результаты Claude Fable 5.1 отсутствовали, приводились результаты Claude Fable 5.

Автор

OpenAI