OpenAI

GPT-6 Astra: A new generation of intelligence

Новое поколение искусственного интеллекта

Обновление от 22.09.2026 г.: мы расширяем семейство GPT‑6, добавляя GPT‑6 Sol и GPT‑6 Luna. Подробнее.

Представляем GPT‑6 Astra — самую интеллектуальную и согласованную модель в мире.

GPT‑6 Astra объединяет многолетние исследования и масштабные инвестиции в области предварительного обучения, обучения с подкреплением и согласования. Astra демонстрирует передовые результаты в управлении компьютером, веб-навигации, программной инженерии, кибербезопасности, науке и профессиональных задачах. Astra достигает практически предельного результата на FrontierMath Tier 4 — 98%, уже помогая решать давние нерешенные задачи⁠ в математике. Astra также достигает предельного результата в ARC-AGI-3 — 99,9%, а в ExploitBench — 100%. Astra также задаёт новый уровень возможностей в управлении компьютером и браузером, выполняя самые сложные профессиональные задачи с непревзойдёнными скоростью, точностью и качеством решений. 

Сегодня начинается развертывание GPT‑6 Astra для ограниченного числа организаций, а в ближайшие дни модель станет доступна всем пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API, Microsoft Azure и AWS Bedrock.

«В ARC-AGI-3 Astra превзошла наш базовый показатель эффективности действий человека на 96% уровней, фактически достигнув паритета с человеком в этом бенчмарке. Это не только лучшая модель из всех, которые мы когда-либо тестировали, но и существенный качественный скачок в производительности передовых ИИ-систем — как в способности ориентироваться в новых средах и решать задачи в них, так и в эффективности обучения».
Грег Камрадт, ARC Prize Foundation

Astra — наша модель с самым высоким уровнем согласования. Она значительно лучше понимает намерения пользователя, а её поведение стало более согласованным, поэтому вы можете увереннее поручать ей задачи и больше полагаться на её суждения. В качестве одного из способов проверки этого мы разработали новую оценку с учетом инцидента с Hugging Face, которая проверяет, выйдет ли модель, столкнувшаяся со сложной или невыполнимой задачей, за пределы предусмотренных рамок. По сравнению с GPT‑5.6 Sol, которая без защитных механизмов, используемых в рабочей среде, в 48% случаев выходила за пределы разрешенной области действий, GPT‑6 Astra — в 0% случаев.

Лучшая в мире модель для работы с компьютером

GPT‑6 Astra задает новую планку скорости, точности и безопасности при работе с компьютером. Она может взять на себя рутинные задачи, такие как заполнение онлайн-форм, обновление записей о клиентах в CRM-системе и организация вашего календаря. Она может проводить исследования в интернете и готовить сводки в вашей электронной почте или редакторе документов. Она может анализировать научные данные, создавать графики, разрабатывать веб-сайт и проводить проверки качества фронтенда, чтобы убедиться, что все функции на этом сайте работают. Она может помочь вам автономно устанавливать и тестировать программное обеспечение, а также устранять неполадки, которые вы видите на экране. Эти улучшения также нашли отражение в наших результатах оценки, соответствующих передовому уровню.

Эти улучшения также значительно повышают эффективность при выполнении реальных задач, связанных с работой со знаниями. В симуляциях задержек на OSWorld 2.0 Astra показывает более высокий результат в управлении компьютером, затрачивая примерно на 47% меньше времени на задачу, чем GPT‑5.6 Sol: 72,6% при примерно 40 минутах на задачу против 65,7% при примерно 75 минутах.3

Возможности GPT‑6 Astra по работе с компьютером можно увидеть в результатах работы в различных областях, включая разработку игр, электротехнику и повседневную интеллектуальную работу:

Наряду с Astra мы также обновляем обвязку Codex, чтобы значительно повысить скорость управления компьютером. В сочетании с эффективностью Astra это обеспечивает выполнение задач в 1,9 раза быстрее по сравнению с текущими возможностями GPT‑5.6 Sol в бенчмарке Mind2Web. Повышение скорости работы модели означает, что она может брать на себя многие отнимающие время повседневные задачи и выполнять их быстрее, чем вы.4

«В день запуска мы интегрируем GPT‑6 Astra в обвязку Devin, где модель демонстрирует передовые результаты на нашем внутреннем тестовом бенчмарке. Превосходные возможности управления компьютером, написания текстов и понимания кодовой базы сразу улучшили тестирование: за видеозаписями стало заметно проще следить, а отчёты стали понятнее и лаконичнее»
Сайлас Альберти, старший вице-президент по исследованиям, Cognition

Качественный скачок в профессиональной деятельности

GPT‑6 Astra сочетает достижения в управлении компьютером со специализированным обучением для профессиональной среды, помогая решать сложные рабочие задачи. Модель сочетает интеллект, необходимый для решения сложных задач, со способностью выполнять многоэтапные сценарии и создавать профессионально оформленные документы, электронные таблицы и презентации.

GPT‑6 Astra — наша лучшая модель для работы с существующими шаблонами и создания слайдов с продуманной компоновкой, кратко передающих ключевые моменты в рамках структурированной подачи материала. Создает понятные, четко структурированные документы, презентации, электронные таблицы и аналитические материалы, которые соответствуют вашим шаблонам, стилю письма и визуальному стилю. Astra также обучена включать в результаты только необходимый контекст, а не повторять информацию, не нужную для текущей работы. Благодаря этому она может создавать более пригодные для немедленного использования материалы, соответствующие контексту и стандартам вашего бизнеса.

GPT‑6 Astra также демонстрирует более развитое визуальное чутьё при создании сайтов, игр, приложений и рендеров. С помощью ChatGPT Сайты⁠(открывается в новом окне) Astra может создавать, размещать и делиться сайтами, веб-приложениями и играми непосредственно из промпта.

«Astra дает нам значительное преимущество как с точки зрения возможностей, так и эффективности. Она успешно выполняет наши самые сложные творческие рабочие задачи, используя при этом до 20% меньше токенов, чем другие протестированные нами модели. Что самое важное, для наших клиентов это означает более высокое качество результатов».
Алекс Машрабов, CEO и сооснователь Higgsfield AI

Когда инструкции допускают неоднозначное толкование, GPT‑6 Astra лучше, чем предыдущие модели, принимает правильное решение. Astra использует контекст, чтобы самостоятельно восполнять типичные пробелы в информации, и задаёт конкретные вопросы, когда ответ может повлиять на результат. В Codex Astra может асинхронно задавать вопросы, продолжая работу, которая не зависит от вашего ответа. Если вы не ответите, Astra при необходимости продолжит работу, исходя из разумных предположений, но дождётся вашего ответа, если речь идёт о решениях с существенными последствиями.

Приведённые ниже примеры показывают, как Astra помогает с повседневными задачами, в которых недостающая информация может существенно изменить ответ.

Astra также лучше удерживает контекст по мере развития задачи. Более ранние модели иногда воспринимали корректирующие сообщения как новую цель, теряя из виду исходный запрос или прежние ограничения. Astra учитывает новые требования, меняет направление по запросу и отвечает на попутные вопросы, не теряя фокуса на общей задаче.

«Astra значительно превосходит GPT‑5.6 Sol по качеству выполнения сложных юридических задач. В ходе нашего раннего тестирования Astra выделилась тем, что подходила к юридической работе так, как это делает взыскательный юрист: отличала документы от официальных записей, выявляла неподкрепленные предположения и превращала пробелы в конкретные позиции для подготовки текста».
Нико Групен, руководитель прикладных исследований, Harvey

Кодирование

GPT‑6 Astra — лучшая модель для разработки программного обеспечения на сегодняшний день.

1 из 2
«GPT‑6 Astra демонстрирует передовые результаты на наших внутренних бенчмарках по программированию и показывает явный шаг вперёд в оценках торговой интуиции по сравнению с GPT‑5.6 Sol. При использовании для агентного программирования GPT‑6 Astra общается так, что разработчикам проще следить за ходом работы, и создаёт код, которому требуется меньше итераций для достижения качества, пригодного для эксплуатации».
Джон Крепецци, команда AI Assistants, Jane Street

С Astra мы представляем новый способ, с помощью которого Codex может сохранять и извлекать контекст, когда контекстное окно заполняется. Исторически модели использовали сжатие контекста, чтобы подводить итог проделанной работе во время длительных сеансов, например при отладке сложных проблем или выполнении масштабного рефакторинга. При каждом сжатии контекста могут быть опущены сведения о том, почему исправление не сработало или как ведет себя компонент. В Codex Astra может хранить заметки между контекстными окнами, сохраняя накопленные сведения без необходимости снова и снова сжимать их в единую сводку. Предыдущие контекстные окна по-прежнему доступны для поиска, поэтому Astra может находить требования или результаты тестов из предыдущих сообщений и выходных данных инструментов — даже если эта информация не была зафиксирована в заметках Astra. Вы можете включить эту экспериментальную функцию в вашем файле config.toml для Codex,⁠(открывается в новом окне) и в ближайшие недели эта функция будет включена для Astra по умолчанию.

Продвигаем научные открытия

«История такова: конец одной эпохи, начало другой».
Грег Бернхэм, EpochAI

GPT‑6 Astra — значительный шаг вперёд в научных открытиях, математике и здравоохранении. Сегодня мы делимся ещё двумя результатами о промежутках между простыми числами.9, 10

Astra также устанавливает новые рекорды в целом ряде оценочных тестов по математике и естественным наукам.

Astra может помочь с практической работой, лежащей в основе научных открытий. Сочетая научные рассуждения с управлением компьютером, Astra может напрямую работать в специализированном ПО, анализировать данные и изучать результаты, помогая исследователям оценивать фактические данные и решать, что исследовать дальше.

Кибербезопасность

Как мы отмечали в нашем материале о безопасности⁠, Astra демонстрирует значительный прогресс в решении задач кибербезопасности и достигает критического порога, определенного нашей Программой готовности. Ее способность выявлять и разрабатывать эксплойты нулевого дня может помочь специалистам по защите находить и устранять уязвимости, но также создает необходимость в более надежных мерах безопасности. Чтобы понять, насколько широки эти возможности, мы протестировали Astra с помощью внутренних экспертных оценок и оценок сторонних экспертов.

Сначала мы протестировали модель без защитных механизмов, применяемых в рабочей среде, на ExploitBench и ExploitGym — бенчмарках, которые оценивают, способны ли модели превращать известные уязвимости ПО в работоспособные эксплойты. В ExploitBench Astra набрала максимальные 100% против 78,5% у GPT‑5.6 Sol, нашей предыдущей передовой ИИ-системы с возможностями в области кибербезопасности. На бенчмарке ExploitGym Astra достигла показателя успешности 42,4% по сравнению с 30,3% у GPT‑5.6 Sol, при этом используя существенно меньше выходных токенов.13

Учитывая опасения, что ознакомление с историческими уязвимостями программного обеспечения могло повлиять на результаты бенчмарков, мы также оценили Astra на двух новых бенчмарках. Во-первых, мы разработали внутреннюю оценку «ExploitBench (июнь–август 2026 г.)» для тестирования разработки эксплойтов с использованием уязвимостей за предыдущие три месяца.14 Astra показала значительно более высокие показатели выполнения произвольного кода по сравнению с GPT‑5.6 Sol на этом наборе данных, при этом используя гораздо меньше выходных токенов. В ходе оценки Astra даже обнаружила и использовала две ранее неизвестные уязвимости нулевого дня. Мы раскрываем информацию об обеих уязвимостях сопровождающим соответствующих проектов.

Мы также протестировали Astra на SRE-Bench15 — бенчмарке, который оценивает, способны ли модели выполнять реверс-инжиниринг бинарных файлов программного обеспечения, чтобы понять основную логику ПО без доступа к исходному коду. Astra решила 88,0% задач с первой попытки и 99,2% — не более чем за четыре попытки, тогда как GPT‑5.6 Sol — 55,9% и 68,7% соответственно.

Помимо бенчмарков, экспертные оценки показали, что Astra при запуске без защитных механизмов, используемых в рабочей среде, могла использовать ранее неизвестные уязвимости для выполнения произвольного кода в защищённых браузерах и создавать эксплойты для повышения привилегий в защищённых операционных системах.

Как мы обсуждали в материале «Окно возможностей для защитников», передовые возможности в области кибербезопасности помогают защитникам быстрее находить уязвимости, но вместе с тем упрощают их эксплуатацию, поэтому защитникам особенно важно адаптироваться. В версии Astra, которая выходит сегодня, специалисты по защите могут использовать ее для выполнения таких задач, как анализ кода на безопасность и внесение исправлений.

Однако Astra откажется выполнять более сложные задачи в области кибербезопасности, такие как создание PoC-эксплойтов для уязвимостей. В рамках OpenAI Daybreak⁠ мы планируем расширить доступ и внедрить менее ограничительные защитные меры в ближайшие недели. Это позволит реализовать больше защитных сценариев, включая проверку уязвимостей и PoC, анализ вредоносного ПО и разработку средств обнаружения.

Мы также усилили защиту от потенциальных злоупотреблений в киберсфере, опираясь на комплекс защитных мер GPT‑5.6 Sol. К ним относятся повышенная устойчивость модели, позволяющая лучше противостоять потенциальным джейлбрейкам, и больше контекста для наших систем мониторинга. Мы продолжили тщательное внутреннее и внешнее тестирование, включая автоматизированные оценки с участием наших внутренних моделей для red teaming, выступающих в роли атакующих. Более подробные сведения о наших мерах киберзащиты и тестировании доступны в обзоре безопасности⁠ Astra и системной карточке⁠(открывается в новом окне).

Ответственное согласование и развертывание GPT‑6 Astra

Astra — наша модель с самым высоким уровнем согласования. Astra отличается особой внимательностью, соблюдает границы поставленных задач и общается прозрачно. Эта работа — новейший результат нашей долгосрочной исследовательской программы, направленной на обучение моделей, которые остаются согласованными с намерениями человека от начала до конца.

В средах с повышенным риском Astra действует с осторожностью, соразмерной этому риску. В ходе оценки задач по управлению компьютером, специально подобранных так, чтобы спровоцировать нежелательное поведение, Astra успешнее избегала непреднамеренных последствий. Работа с дополнительными мерами безопасности, предлагаемыми по умолчанию, обеспечила ещё более высокую производительность.

Astra приводит к меньшему числу несогласованных исходов, чем любая другая протестированная передовая ИИ-система. Для корректного сравнения мы использовали универсальную обвязку агента для управления компьютером (на основе встроенных инструментов управления компьютером, доступных как в OpenAI Responses API⁠(открывается в новом окне), так и в Anthropic Messages API⁠(открывается в новом окне)) и без дополнительных средств защиты, которые обычно развертываются для пользователей Codex и ChatGPT Работа (автоматическая проверка, политика подтверждения).

Astra также с большей вероятностью будет действовать в рамках ограничений, заданных пользователем и подразумеваемых её средой. В ходе внутренней оценки Astra ни разу не пыталась обойти отказ автоматической проверки Codex. Это оставалось верным даже тогда, когда Auto-review намеренно настраивали так, чтобы её можно было обойти, и иначе выполнить задачу было невозможно. Такое соблюдение ограничений среды согласуется с результатами нашей оценки невыполнимых киберзадач, которыми мы поделились во введении к этой публикации, а также с другими выводами, задокументированными в нашей системной карточке⁠(открывается в новом окне).

Кроме того, Astra задаёт новые стандарты в области прозрачной коммуникации с пользователями. По результатам одной из оценок Astra в три раза реже, чем GPT‑5.6 Sol, делает недостоверные заявления о своих возможностях и доступных ей действиях.

В нашей оценке галлюцинаций, связанных со способностями, Astra демонстрирует существенное улучшение по сравнению с GPT‑5.6 Sol, делая меньше вводящих в заблуждение заявлений о своих возможностях.

Наши оценки показали, что письменные рассуждения Astra сложнее отслеживать, чем у GPT‑5.6 Sol, согласно тестам, в которых модель прямо просили обходить мониторинг. Мы объясняем это более высоким уровнем контроля Astra над письменными рассуждениями на более простых задачах и способностью решать проблемы с меньшим количеством письменных шагов. Astra, похоже, по-прежнему испытывает трудности с сокрытием рассуждений, необходимых для сложных задач, но мы серьезно относимся к этому снижению. Повышение наблюдаемости остается приоритетным направлением исследований, а сопроводительная системная карточка⁠(открывается в новом окне) подробно описывает наши выводы и текущую работу.

В основе нашего подхода к развертыванию моделей лежит обучение, направленное на согласование их поведения. В качестве дополнительного уровня защиты мы также создаем системные защитные механизмы, такие как автоматическая проверка⁠(открывается в новом окне) в Codex и мониторинг рассуждений и действий агентов, которые помогают выявлять и сдерживать небезопасное поведение. Как описано в нашем материале о безопасности⁠, мы также внедряем в рабочей среде мониторинг несогласованного поведения моделей класса Astra, чтобы отслеживать такое поведение и помогать сдерживать его наиболее серьезные проявления. Эти меры защиты сходны с мониторингом, который мы применяем при развертывании моделей для внутреннего использования. Они включают систему классификаторов, которые проверяют рассуждения и действия модели на признаки несанкционированного поведения и автоматически останавливают потенциально несанкционированные действия.

Учитывая значительное расширение возможностей Astra в области кибербезопасности, мы проявляем особую осторожность, чтобы это развертывание было безопасным и защищенным. Дополнительные проверки безопасности иногда могут замедлять, приостанавливать или останавливать правомерную работу, включая защитную деятельность в области кибербезопасности. Если выполнение задачи в ChatGPT или Codex приостановлено, вам может быть предложено проверить действие перед продолжением. В API задача остановится. Эти проверки иногда могут мешать выполнению правомерных рабочих задач, и мы продолжаем дорабатывать эту систему, чтобы уменьшить количество ненужных прерываний. Мониторинг несогласованности не может заменить согласованность: наша цель — создавать модели, которые надежно остаются в пределах предоставленных им полномочий, чтобы этим мерам защиты не приходилось вмешиваться.

Доступность

Сегодня начинается развертывание GPT‑6 Astra для ограниченного числа организаций, а в ближайшие дни модель станет доступна всем пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API, Microsoft Azure и AWS Bedrock. Использование Astra включено в существующие лимиты подписки — пользователи и компании также смогут приобретать кредиты для дополнительного использования. Пользователи планов Pro, Business и Enterprise также получат доступ к GPT‑6 Astra Pro. Администраторы Enterprise могут включить Astra для своей рабочей области; при запуске доступ по умолчанию отключен.

Astra поддерживает нулевое хранение данных (ZDR) для соответствующих требованиям клиентов API, и, как мы сообщали в прошлом месяце, мы тестируем Конфиденциальная обработка данных в целях безопасности (Private Safety Processing), чтобы усилить мониторинг безопасности, сохраняя конфиденциальность данных клиентов.

Для разработчиков модель GPT‑6 Astra будет доступна в OpenAI API под именем gpt-6-astra, а также через Microsoft Azure и Amazon Bedrock.

Стандартная стоимость OpenAI API составляет 10 долларов США за миллион входных токенов и 50 долларов США за миллион выходных токенов. К операциям чтения и записи кэша применяются отдельные тарифы. Быстрый режим доступен для GPT‑6 Astra в API и обеспечивает скорость до 2 раз выше, чем при стандартной обработке, по цене в 2 раза выше стандартной.

Использование компьютера

Использование компьютера

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Последний экзамен агентов

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, офлайн-набор, частичный балл)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (без инструментов)

92,7%

76,9 %

-

87,3%17

-

-

Профессиональный

Профессиональный

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Задачи дизайна (внутренние)

50,0%

47,4%

-

35,8%

-

-

Внутренние задачи науки о данных

40,9%

30,5%

-

34,7%

-

-

Индекс интеллекта Artificial Analysis v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Кодирование

ПрограммированиеGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended (оценка)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Main (оценка)53,3% 847,5%50,9%53,5%53,4%43,6%
Внутренние задачи миграции базы данных63,9%42,7%57,8%50,3%--
Artificial Analysis Coding Agent Index v1.467,065,1-67,268,161,2

Академический

Академический

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21,4%

30,0%

-

FrontierMath Tier 4 (v2)

97,6%

83.0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6 %

93,7%

92,6 %

93,7%

95,3%

Последний экзамен человечества (с инструментами)

57,2%

-

65,0%

63,8%

63,6%

-

Наука и здоровье

Наука и здоровьеGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (внутренний)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (с поправкой на длину)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

Кибербезопасность

КибербезопасностьGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70%-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (июнь–август 2026)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Согласование

Согласование

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Внутренний бенчмарк безопасности управления компьютером (чем ниже, тем лучше)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Внутренний бенчмарк безопасности управления компьютером с AutoReview (чем ниже, тем лучше)

1,8%

4,3%

-

-

-

-

Внутренний бенчмарк обхода (чем ниже, тем лучше)

0,00%

0,29%

-

-

-

-

Ловушка ExploitGym (чем ниже, тем лучше)

0,0%

48,2%

-

-

-

-

Невозможный ExploitGym

100,0 %

-

-

-

-

-

Внутренний бенчмарк галлюцинаций (чем ниже, тем лучше)

4,2%

12,2%

-

-

-

-

Расширенный контекст

Расширенный контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256 тыс.–512 тыс.

100,0 %

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512 тыс.–1 млн

96,3 %

73,8%

-

-

-

-

Абстрактное рассуждение

Абстрактное рассуждениеGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9% 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Для каждой оценки указан максимальный результат среди всех уровней усилий. Оценки GPT проводились в нашей исследовательской среде или через API, поэтому результаты могут немного отличаться от рабочей версии ChatGPT из-за различий в системных промптах, доступных инструментах и т. д.

Сноски

  1. 1

    На ARC-AGI-3 GPT-6 Astra запускали с использованием нашей обвязки Responses API⁠, которая изменяет две настройки, чтобы лучше соответствовать производительности в реальных условиях. Изменения не нацелены специально на ARC-AGI-3.

  2. 2

    GPT-5.6 Sol обозначает версию, доступную в нашем API, ChatGPT Codex и ChatGPT Работа. Версия в ChatGPT Чат немного отличается.⁠

  3. 3

    OSWorld V2-Offline — это подмножество исходного OSWorld V2, работающее без доступа к интернету. Результат модели Claude в OSWorld-V2 Offline был воспроизведён авторами в официальной таблице лидеров⁠(открывается в новом окне). В OSWorld 2.0 для оценки Claude используются официальные настройки, а не измененные задания и измененная система оценивания из системной карточки Fable 5.1.

  4. 4

    Время модели — это указанное время, затраченное на соответствующие демонстрационные запуски. Показанные фрагменты являются отредактированными выдержками.

  5. 5

    В BenchCAD результаты Claude отражают 3 изменения, внесенные в оценочный тест и подробно описанные в системной карточке Fable 5.1⁠(открывается в новом окне).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(открывается в новом окне).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus⁠(открывается в новом окне).” Труды 10-й международной конференции по цифровым библиотекам для музыковедения, с. 49–57. ACM, 2023 г.

  8. 8

    В FrontierCode GPT-6 Astra запускали с сообщением разработчика, похожим на раздел сообщения разработчика модели в Codex⁠(открывается в новом окне): «Не создавай лишние тестовые файлы. Создавай новый тестовый файл только тогда, когда этого требуют правила репозитория или когда ни один существующий файл не подходит. Избегай несвязанной очистки и ненужной сложности. Используй подходящие существующие утилиты. Ознакомься с соответствующими инструкциями репозитория и изучи соседний код, тесты, документацию и CI. Следуй принятым соглашениям. Цель — чистый код, готовый к слиянию». Промпт не был оптимизирован для оценки.

  9. 9

    Первый касается того, насколько близко друг к другу могут располагаться простые числа, как бы далеко вы ни продвигались по числовой прямой. В течение более чем десяти лет лучший известный результат устанавливал, что существует бесконечно много пар простых чисел, расстояние между которыми не превышает 246. Юлия Штадльманн⁠(открывается в новом окне) недавно улучшила эту оценку до 240. Astra помогла установить более сильную верхнюю границу — 186, показав, что бесконечно много пар встречается на таком расстоянии или ближе. Малые промежутки между простыми числами: доказательство⁠(открывается в новом окне) и подтверждающие исследования⁠(открывается в новом окне).

  10. 10

    Второй результат касается необычно больших промежутков между простыми числами. Astra улучшила член в оценке этих промежутков, который оставался неизменным более 80 лет. Мы публикуем доказательства, сокращённую цепочку рассуждений (CoT) и материалы для проверки по обоим результатам. Большие промежутки между простыми числами: доказательство⁠(открывается в новом окне) и вспомогательное исследование⁠(открывается в новом окне).

  11. 11

    Мы независимо оценили все модели Claude по предусмотренной процедуре HealthBench Professional, используя GPT‑5.4 для оценивания и неусечённые баллы с поправкой на длину. Для Fable 5.1 мы использовали Opus 5 в качестве резервного варианта при отказах провайдера.

  12. 12

    Claude Fable 5 и 5.1 не включены в LifeSciBench Gold v1, GeneBench Pro v13 и MedChemBench, поскольку отказываются отвечать на большинство вопросов в этих оценочных тестах.

  13. 13

    В ExploitGym мы протестировали Astra и Sol без 6-часового ограничения по времени, чтобы лучше оценить полный спектр их кибервозможностей. Они достаточно быстры, поэтому это почти не сказывается.

  14. 14

    ExploitBench (июнь–август 2026 года) содержит 20 уязвимостей V8 высокой степени серьёзности в 13 стабильных выпусках Chrome. Бенчмарк проверяет, могут ли агенты добиться выполнения произвольного кода в V8 и официальных выпусках Chrome для Linux, эксплуатируя каждую указанную уязвимость. Некоторые включённые уязвимости могут не допускать выполнения произвольного кода в рамках ограничений оценки, поэтому показатель успешности 100% может быть недостижим. Примечание: результат GPT-5.6 Sol в 5,5% обусловлен ограничением бенчмарка в 300 ходов. При реальном использовании модели на уровне Max такого ограничения нет. При аналогичных настройках модель достигла результата 11,5%, когда реже сталкивалась с ограничениями.

  15. 15
  16. 16

    При тестировании сторонних моделей мы используем более простую исследовательскую конфигурацию. У Codex более сложная конфигурация рабочей среды, поэтому показатели ошибок базовой модели могут отличаться. Защитные механизмы на стороне провайдера и реализации инструментов управления компьютером также различаются. Пользователи не сталкиваются в Codex со сценарием без подтверждения, поскольку это внутренняя исследовательская конфигурация.

  17. 17

    Для ScreenSpot-Pro и ExploitGym приводимые нами оценки Fable получены от Mythos, который представляет собой Fable с меньшим числом защитных механизмов.