Представляем GPT‑6 Sol и Luna
Ещё больше способов применять передовой интеллект в повседневной работе.
В начале этого месяца мы представили GPT‑6 Astra — самую интеллектуальную и согласованную модель в мире. Самые сложные и важные проекты по-прежнему требуют всей глубины возможностей Astra, но задачи различаются по масштабу, темпу и бюджету.
Поэтому мы расширяем семейство GPT‑6 моделями GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra открыла новое поколение интеллекта, а эти модели помогают сделать его преимущества доступнее, делая передовые возможности ИИ более экономически эффективными и доступными. Мы обучали GPT‑6 Sol и Luna методами, схожими с применёнными для GPT‑6 Astra, и перенесли достижения, обеспечившие передовые результаты Astra в профессиональной работе, фактологической точности, программировании, управлении компьютером и согласованности, в более быстрые и доступные модели.
Модели GPT‑6 лидируют по всему диапазону соотношения стоимости и интеллекта, сочетая исключительные возможности на каждом уровне с инфраструктурой для эффективного масштабирования. Улучшения кэширования и инференса позволили снизить стоимость обслуживания этих моделей, и мы напрямую передаём эту экономию пользователям и клиентам: цены API для Sol и Luna снижены на 50% относительно акционных цен GPT‑5.6. В совокупности эти улучшения делают передовой ИИ практичным решением для большего числа повседневных задач и масштабных приложений.
Модель | Ввод | Вывод | Снижение цены |
GPT‑6 Sol | $4 → $2 | $20 → $10 | На 50% дешевле |
GPT‑6 Luna | $0,20 → $0,10 | $1,20 → $0,50 | На 50% дешевле |
Цены указаны за 1 миллион токенов.
GPT‑6 Astra остаётся нашей лучшей моделью по всем параметрам. Выбирайте её, если вам нужны наилучшие результаты без компромиссов.
GPT‑6 Sol и Luna повышают интеллект и экономическую эффективность уже знакомых вам моделей в областях, наиболее важных для решения сложных рабочих задач.
GPT‑6 Sol справляется со сложными рабочими задачами, а повышенные лимиты и меньшая стоимость дают больше возможностей для итераций. При этом модель обладает более широкими интеллектуальными возможностями и показывает лучшие результаты, чем сопоставимые по цене модели конкурентов.
В AutomationBench — тесте бизнес-процессов в различных приложениях — GPT‑6 Sol с «очень высоким» уровнем усилий превосходит Claude Opus 5 с «максимальными» усилиями, а стоимость задачи составляет лишь 9% от стоимости Opus 5. При «высоком» уровне усилий GPT‑6 Luna превосходит предшественницу на 5,4 процентного пункта, а стоимость задачи снижается на 58%.
В тесте AutomationBench 1.0.6(открывается в новом окне) агенты ИИ проверяются на сквозных рабочих процессах с использованием 47 инструментов в продажах, маркетинге, операционной деятельности, поддержке, финансах и управлении персоналом. Показатель Claude Fable 5.1 занижает фактическую стоимость, поскольку не учитывает расходы на переход к Opus 5, происходивший примерно в 40% задач.
GPT‑6 Sol также превосходит Claude Fable 5.1 при гораздо меньшей стоимости и даже опережает GPT‑6 Astra с «низким» уровнем усилий.
Модель (и уровень усилий) | Результат | Стоимость задачи |
|---|---|---|
GPT‑6 Sol (очень высокий) | 33,2% | $0,27 |
GPT‑6 Astra (низкий) | 30,3% | В 3,9 раза дороже GPT‑6 Sol |
Claude Opus 5 (максимальный) | 26,9% | В 11,1 раза дороже GPT‑6 Sol |
Claude Fable 5.1 с переходом на Opus 5 (максимальный) | 31,4% | Более чем в 8,9 раза дороже GPT‑6 Sol (стоимость перехода не указана) |
В тесте Agents’ Last Exam, оценивающем агентов в сложных профессиональных процессах, GPT‑6 Sol с «максимальным» уровнем усилий набирает 56,4% — больше максимального результата Claude Opus 5 в этом тесте, — при этом стоимость задачи ниже на 60%.
В тесте Agents’ Last Exam V1(открывается в новом окне) агенты ИИ оцениваются на долгосрочных, экономически значимых задачах из 55 отраслевых сегментов, охватывающих большинство основных направлений профессиональной работы за компьютером.
Полезность ответа зависит от точности фактов, и мы продолжаем повышать фактологическую надёжность. В нашей внутренней оценке фактологической точности, основанной на обезличенных реальных диалогах, где пользователи отмечали ошибки наших моделей, GPT‑6 Sol допускает примерно вдвое меньше ошибок, чем её предшественница. Её надёжность приближается к уровню Astra при гораздо меньшей стоимости. GPT‑6 Luna также значительно улучшилась: при повышенных уровнях усилий она сравнивается с GPT‑5.6 Sol при стоимости примерно в сто раз ниже.
Здесь мы оцениваем фактологическую точность на обезличенных диалогах ChatGPT, в которых пользователи отмечали фактическую ошибку предыдущей модели. Такие провоцирующие ошибки диалоги не отражают типичное использование, где фактические ошибки встречаются реже. Результаты не нормализованы по длине, однако наши проверки разных уровней подробности почти не выявили зависимости от длины ответа.
В этом году агенты для программирования начали решать задачи беспрецедентной сложности, масштаба и продолжительности. Внутреннее использование в OpenAI растёт экспоненциально. Если оценивать по ценам API, медианный исследователь ежедневно использует токены более чем на 600 долларов США, а исследователи в 90-м процентиле — более чем на 7000 долларов США («Ускорение исследований: взгляд изнутри OpenAI»). По мере того как агенты для программирования берутся за более длительные и сложные задачи, стоимость постоянного использования приобретает всё большее значение. GPT‑6 Sol и Luna сочетают высокие результаты в программировании с более низкими ценами API, давая разработчикам больше возможностей для итераций, а командам — уверенность ставить перед Codex более амбициозные задачи.
В FrontierCode, где оценивается готовность изменений от агентов для программирования к слиянию с реальными кодовыми базами, GPT‑6 Sol значительно превосходит GPT‑5.6 Sol и сравнивается с Claude Fable 5.1 при «очень высоком» уровне усилий и гораздо меньшей стоимости.
В тесте FrontierCode 1.1 Main(открывается в новом окне) агенты ИИ пишут код, который оценивается не только по корректности, но и по «готовности к слиянию»: например, по качеству тестов, соблюдению границ задачи, стилю кода и стандартам кодовой базы.
В тесте DeepSWE v1.1, оценивающем выполнение сложных задач программной инженерии в реальных кодовых базах, GPT‑6 Sol с «максимальным» уровнем усилий набирает 68,8% — лишь на 1,1 процентного пункта меньше лучшего результата Claude Fable 5 в этом тесте: 69,9% при «очень высоком» уровне. При этом стоимость задачи примерно на 80% ниже.
GPT‑6 Luna с «максимальным» уровнем усилий набирает 66,6% — результат сопоставим с Claude Opus 5 и Fable 5 при «среднем» уровне усилий. В этих сравнениях стоимость задачи для Luna на 93% ниже, чем для Opus 5, и на 96% ниже, чем для Fable 5.
В тесте DeepSWE 1.1(открывается в новом окне) агенты ИИ решают оригинальные долгосрочные задачи программной инженерии.
GPT‑6 Astra остаётся лучшей в мире моделью для управления компьютером, а GPT‑6 Sol и Luna обеспечивают более экономичные результаты, чем их предшественницы. В офлайн-тесте OSWorld 2.0 GPT‑6 Sol с «очень высоким» уровнем усилий показывает результат, сопоставимый с Claude Opus 5 при «среднем» уровне усилий: 60,5% против 60,3%. При этом стоимость задачи примерно на 80% ниже. GPT‑6 Luna (максимальный) превосходит GPT‑5.6 Sol (средний) при стоимости в десять раз ниже.
В тесте OSWorld 2.0(открывается в новом окне) агенты ИИ выполняют долгосрочные сценарии управления компьютером, охватывающие повседневные и профессиональные задачи. Мы приводим частичную оценку на офлайн-наборе из выпуска v2026.08.08.
Мы также перенесли улучшенный стиль общения GPT‑6 Astra в Sol и Luna. Полагаем, это будет особенно заметно в технических беседах и обсуждениях программирования. Ответы станут яснее и немного короче без потери смысла, в них будет меньше жаргона, странных оборотов и малополезных деталей.
Хотя стиль субъективен, здесь мы предпочитаем ответ GPT‑6 Sol. Модель не спешит с выводами, меньше повторяет детали, которые могут быть очевидны автору вопроса (например, что на сайте четыре страницы), реже использует расплывчатые формулировки (например, «ощущение бенто», «перестраивая… вокруг этой системы»), яснее сообщает, что именно проверяла и не проверяла, и не раскрывает без необходимости детали реализации, такие как промпт для инструмента генерации изображений.
Помимо снижения цен на токены, мы помогаем разработчикам решений на базе GPT‑6 больше экономить на контексте, который повторно используется в их приложениях. Мы улучшили кэширование промптов для GPT‑6, по умолчанию повысив долю попаданий в кэш. Благодаря этому агенты могут повторно использовать больше контекста, быстрее отвечать и получать скидку 90% на чтение кэшированных входных токенов.
У разработчиков также появилось больше способов измерять и оптимизировать эффективность кэширования:
Мониторинг и диагностика. Панель кэширования промптов(открывается в новом окне) показывает объём кэшируемых входных данных и его изменение со временем. Инструмент диагностики(открывается в новом окне) помогает понять, какие возможности кэширования упущены и что нужно исправить.
Изменение интенсивности рассуждений и доступности инструментов без сброса кэша. Повышайте уровень интенсивности рассуждений(открывается в новом окне) при сложных задачах или снижайте его для простых уточнений, а также включайте и отключайте инструменты(открывается в новом окне) по мере изменения потребностей агента. Теперь обе настройки сохраняют предыдущий контекст для повторного использования кэша.
Оптимизация кэшируемых префиксов. Явные точки разрыва позволяют разработчикам выбирать, где заканчиваются кэшируемые префиксы промптов. Это даёт разработчикам больше контроля над повторным использованием кэша и может повысить производительность.
По данным GitHub, за последние несколько месяцев эти улучшения более чем на 50% сократили долю токенов промптов, требующих новой обработки, в миллиардах запросов к моделям OpenAI, благодаря чему Copilot отвечает быстрее.
GPT‑6 Sol и Luna развивают подходы к согласованности, впервые реализованные в Astra — нашей наиболее согласованной модели на сегодняшний день. В наших оценках согласованности Sol и Luna превосходят соответствующие модели GPT‑5.6, в том числе реже делают вводящие в заблуждение заявления о выполненной ими работе с кодом.
Приведённые ниже оценки намеренно проверяют сложные ситуации и не измеряют частоту сбоев при типичном использовании. Полные результаты приведены в системной карточке(открывается в новом окне).
С сегодняшнего дня GPT‑6 Sol и GPT‑6 Luna доступны в ChatGPT Работа и Codex всем пользователям планов Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут получить доступ к GPT‑6 Luna в приложении для компьютера. В Чате эти модели пока недоступны. В API OpenAI они доступны как gpt-6-sol и gpt-6-luna.
Чтобы обеспечить стабильность сервиса для всех, мы планируем постепенно развёртывать эти модели в ChatGPT в течение дня. Если новые модели ещё не появились в ChatGPT Работа или Codex, повторите попытку позже.
Оценки GPT проводились в нашей исследовательской среде или через API, поэтому из-за различий в системных промптах, доступных инструментах и других факторах результаты могут немного отличаться от результатов ChatGPT в реальной эксплуатации. Оценки моделей конкурентов взяты из общедоступных отчётов. Если результаты Claude Fable 5.1 отсутствовали, приводились результаты Claude Fable 5.


