GPT-6.1Sol
Интеллект почти на уровне Astra по цене в пять раз ниже — для стабильной работы на передовом уровне
Представляем GPT‑6.1 Sol — обновление GPT‑6 Sol с исключительно высокими результатами в агентном программировании, управлении компьютером и профессиональных задачах. Новая модель приближает Sol к GPT‑6 Astra в сложных задачах, при этом стандартные цены на входные и выходные токены в пять раз ниже, чем у Astra. Это дает разработчикам больше возможностей создавать и запускать мощных агентов в рамках того же бюджета.
GPT‑6.1 Sol предлагает результаты, близкие к Astra, по ценам Sol — это самая выгодная на сегодня модель для такого уровня возможностей. Кэшированные входные данные стоят всего 0,10 $ за миллион токенов — на 95% ниже стандартной цены входных данных. Это делает модель доступнее для агентных задач, в которых нужно повторно использовать контекст в нескольких запросах.
GPT‑6 Astra остается нашей самой мощной передовой моделью по совокупности возможностей. GPT‑6.1 Sol предлагает новый баланс возможностей и стоимости — как для важных задач, которые пользователи хотят выполнять чаще, так и для клиентов API, создающих и запускающих приложения в больших масштабах.

GPT‑6.1 Sol значительно превосходит GPT‑6 Sol в сложной профессиональной работе: от написания и отладки кода до понимания документов и выполнения многоэтапных бизнес-процессов. В ряде этих тестов модель приближается к результатам GPT‑6 Astra при существенно меньших затратах.
В DeepSWE v1.1, который оценивает решение сложных задач разработки ПО в реальных кодовых базах, GPT‑6.1 Sol достигает уровня GPT‑6 Astra при затратах примерно в пять раз ниже. При этом модель превосходит лучший результат GPT‑6 Sol на 6,4 процентного пункта при меньших усилиях на рассуждения и меньших затратах.
В тесте DeepSWE 1.1(открывается в новом окне) ИИ-агенты решают оригинальные задачи по разработке программного обеспечения, требующие длительной работы.
Тест GDP.pdf измеряет точность ответов моделей на профессиональные вопросы по сложным PDF-документам, включая таблицы, графики, схемы и мелкий шрифт. В нем GPT‑6.1 Sol превосходит Opus 5.5 с резервными моделями при стоимости задачи более чем вдвое ниже на всех проверенных уровнях усилий на рассуждения. Модель также приближается к передовым результатам GPT‑6 Astra при стоимости задачи примерно в пять раз ниже.
В тесте GDP.pdf(открывается в новом окне) модели должны отвечать на реальные запросы по сложным PDF-документам, используемым в работе специалистами в области финансов, здравоохранения, права и семи других профессиональных сфер.
В AutomationBench, который проверяет, правильно ли агенты выполняют многоэтапные бизнес-процессы, GPT‑6.1 Sol при среднем уровне усилий на рассуждения превосходит Opus 5.5 на 2,2 процентного пункта при затратах примерно втрое ниже. Этот результат также на 4,8 процентного пункта выше, чем у GPT‑6 Sol при той же настройке.
In AutomationBench 1.0.6(открывается в новом окне), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol также демонстрирует значительный прогресс в задачах, требующих взаимодействия с компьютерными приложениями. На офлайн-наборе OSWorld 2.0, который оценивает агентов в сложных сценариях управления компьютером, GPT‑6.1 Sol превосходит GPT‑6 Sol на семь процентных пунктов при максимальных усилиях на рассуждения и затратах более чем вдвое ниже. При максимальных усилиях на рассуждения модель отстает от Astra всего на 2,1 процентного пункта, а стоимость задачи примерно в семь раз ниже.
In OSWorld 2.0(открывается в новом окне), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
В Terminal-Bench Science 0.1, который оценивает научные рабочие процессы, включая анализ данных, моделирование и доказательство теорем, GPT‑6.1 Sol более чем вдвое превосходит результат GPT‑6 Sol при максимальных усилиях на рассуждения и стоимости задачи более чем вдвое ниже. При максимальном уровне усилий средняя стоимость задачи для GPT‑6.1 Sol составляет 5,47 $ против 23,21 $ для Opus 5.5 и 23,80 $ для Astra. Таким образом, модель предлагает широкие возможности для научной работы при затратах более чем на 75% ниже, чем у обеих моделей.
GPT‑6 Astra по-прежнему показывает самый высокий результат среди протестированных моделей — 68,1%. Именно ее следует использовать для самых сложных научно-исследовательских задач.
В тесте Terminal-Bench Science 0.1(открывается в новом окне) агенты выполняют научно-исследовательские задачи с помощью кода и инструментов терминала: анализируют данные, запускают симуляции и подбирают параметры моделей.
GPT‑6.1 Sol также повышает фактическую точность ответов на сложные запросы. При очень высоком уровне усилий на рассуждения частота фактических ошибок составляет 4,1% против 4,5% у GPT‑6 Sol, приближаясь к 4,0% у Astra при той же настройке. При этом стоимость задачи примерно на 83% ниже, чем у Astra.
Этот тест измеряет долю ответов хотя бы с одной фактической ошибкой на обезличенных диалогах, в которых пользователи указали на ошибку более ранней модели. Эти намеренно сложные запросы не отражают обычное использование.
Мы оцениваем фактическую точность на обезличенных диалогах ChatGPT, в которых пользователи указали на фактическую ошибку предыдущей модели. Эти диалоги, провоцирующие ошибки, не отражают обычное использование, при котором фактические ошибки встречаются реже.
В наших тестах на соответствие человеческим намерениям и ценностям GPT‑6.1 Sol показывает значительные улучшения по сравнению с GPT‑6 Sol, приближаясь к GPT‑6 Astra.
GPT‑6.1 Sol более открыто сообщает о своих ограничениях и надежнее соблюдает намерения пользователя и ограничения безопасности. В сложных тестах модель реже, чем GPT‑6 Sol, допускает сбои: скрывает неисправность инструментов поиска, нарушает явные ограничения или совершает несанкционированные действия при выполнении агентных задач. Мы не обнаружили попыток обойти автоматическую систему проверки безопасности, как и в случае GPT‑6 Astra и GPT‑6 Sol.
Приведенные ниже тесты намеренно проверяют сложные ситуации и не измеряют частоту сбоев при обычном использовании.
С сегодняшнего дня GPT‑6.1 Sol доступна всем пользователям Plus, Pro, Business, Enterprise и Edu в ChatGPT Работа и Codex. В режиме «Чат» эти модели пока недоступны. Разработчики также могут обращаться к модели через API OpenAI под именем gpt-6.1-sol. Стандартные цены в API: 2 $ за миллион входных токенов, 0,10 $ за миллион кэшированных входных токенов и 10 $ за миллион выходных токенов.
Одновременно мы запускаем GPT‑6 Astra Ultrafast — самую быструю передовую модель в мире, до 8 раз быстрее GPT‑6 Astra, — а также GPT‑6.1 Sol Ultrafast. Они доступны через API, а также в ChatGPT Работа и Codex пользователям нашего нового уровня Pro с самыми высокими лимитами за 500 $ в месяц. С GPT‑6.1 Sol Ultrafast разработчики получают интеллект почти на уровне Astra и скорость до 8 раз выше, тратя на API примерно столько же, сколько раньше на GPT‑6 Astra.
Автор
Тестирование GPT проводилось в нашей исследовательской среде или через наш API. Полученные ответы могут немного отличаться от ответов в общедоступной версии ChatGPT из-за различий в системных промптах, доступных инструментах, уровнях усилий и т. д. Результаты тестирования моделей конкурентов взяты из открытых отчетов.

