OpenAI

GPT-6 Astra: A new generation of intelligence

Ново поколение ниво на интелект

Представяме GPT‑6 Astra – най-интелигентният и най-добре съобразеният с човешките ценности модел в света.

GPT‑6 Astra обединява години изследователска работа и значителни инвестиции в предварителното обучение, обучението с утвърждение и съгласуването с човешките ценности. Astra е водещ модел в света при използването на компютър, сърфирането в интернет, софтуерното инженерство, киберсигурността, науката и професионалната работа. Astra достига насищане в ниво 4 на FrontierMath с резултат от 98%, като вече е помогнал за решаването на отдавна нерешени проблеми в математиката. Astra също достига насищане в ARC-AGI-3 с резултат от 99,9% и в ExploitBench с резултат от 100%. Освен това поставя нов авангарден стандарт при използването на компютър и браузър, като изпълнява най-взискателната професионална работа с несравними бързина, точност и преценка. 

GPT‑6 Astra започва да се предоставя от днес на ограничен брой организации, а през следващите дни ще стане достъпен за всички потребители на ChatGPT Plus, Pro, Business и Enterprise, както и чрез OpenAI API, Microsoft Azure и AWS Bedrock.

„В ARC-AGI-3 Astra надмина нашето базово ниво за ефективност на човешките действия при 96% от нивата, като на практика достигна равнопоставеност с хората в бенчмарка. Това не само е най-добрият модел, който някога сме тествали, но представлява и съществен скок в представянето на авангардните модели – не само по отношение на способността му да се ориентира в нови среди и да решава задачи в тях, но и по отношение на ефективността, с която се научава да го прави.“
Грег Камрад, ARC Prize Foundation

Astra е най-добре съгласуваният ни модел, със значителни подобрения в разбирането на намерението на потребителя и поведението на модела – можете да делегирате задачи на Astra с по-голяма увереност в преценката му. Като един от начините, по които тестваме това, създадохме нова оценка, вдъхновена от инцидента с Hugging Face, която проверява дали модел, изправен пред трудна или невъзможна задача, ще надхвърли определения му обхват. В сравнение с GPT‑5.6 Sol, който без защитни механизми за продукционна среда излизаше извън разрешения обхват в 48% от случаите, GPT‑6 Astra прави това в 0% от случаите.

Най-добрият модел в света за използване на компютър

GPT‑6 Astra поставя нов стандарт по отношение на скоростта, точността и безопасността при използването на компютър. Той може да поема досадни задачи като попълване на онлайн формуляри, актуализиране на клиентски записи в CRM и организиране на календара Ви. Той може да извършва онлайн проучвания и да изготвя обобщения във Вашия имейл или редактор на документи. Той може да анализира научни данни, да генерира графики, да създава уебсайтове и да извършва проверки на качеството на фронтенда, за да гарантира, че всички функции на сайта работят. Той може да Ви помогне самостоятелно да инсталирате и тествате софтуер, както и да отстранявате проблеми, които виждате на екрана. Тези подобрения се отразяват и в резултатите от нашите оценки, които са сред най-съвременните в областта.

Тези подобрения водят и до значително повишаване на ефективността при реални задачи, свързани с работа със знания. При симулации на латентността в OSWorld 2.0 Astra постига по-висока производителност при използване на компютър за приблизително 47% по-малко време на задача в сравнение с GPT‑5.6 Sol, с резултат 72,6% при приблизително 40 минути на задача, в сравнение с 65,7% при приблизително 75 минути.3

Възможностите на GPT‑6 Astra за използване на компютър се проявяват в резултатите в различни области, включително разработване на игри, електротехника и ежедневна интелектуална работа:

Alongside Astra, we are also updating the Codex harness to significantly improve the speed of computer use. Combined with Astra’s efficiency, this translates to a 1.9x faster task completion compared to the current GPT‑5.6 Sol experience, on the Mind2Web benchmark. The model’s improvements on speed mean it can take on many time-consuming life tasks for you, faster than you can.4

„Интегрираме GPT‑6 Astra в рамката на Devin в деня на пускането, където моделът постига водещи резултати при нашия вътрешен тестов бенчмарк. Отличните му способности за използване на компютър, писане и разбиране на кодови бази подобриха тестването още при първото използване: видеоклиповете са значително по-лесни за проследяване, а отчетите са по-ясни и по-кратки.“
Сайлъс Алберти, старши вицепрезидент „Научни изследвания“, Cognition

Значителна промяна в професионалната работа

GPT‑6 Astra съчетава усъвършенствани възможности за работа с компютър с целево обучение за професионална среда, за да помага при решаването на сложни работни задачи. Моделът съчетава нивото на интелект, необходимо за решаването на сложни проблеми, със способността да изпълнява многоетапни работни процеси и да създава изпипани документи, електронни таблици и презентации.

GPT‑6 Astra е най-добрият ни модел за спазване на съществуващи шаблони и създаване на добре оформени слайдове, които предават сбито ключовите точки чрез структурирано изложение. То създава ясни, добре структурирани документи, презентации, електронни таблици и анализи, които следват Вашите шаблони и съответстват на стила Ви на писане и на визуалния Ви стил. Моделът Astra също така е обучен така да включва в изходните резултати само релевантния контекст, вместо да повтаря информация, която не е необходима за текущата задача. Всичко това означава, че той може да създава повече готови за непосредствено използване материали, които съответстват на Вашия бизнес контекст и стандарти

GPT‑6 Astra също така прилага по-добра визуална преценка при създаването на уебсайтове, игри, приложения и визуализации. Със Sites(отваря се в нов прозорец) в ChatGPT Astra може да създава, хоства и споделя уебсайтове, уеб приложения и игри директно от подкана.

„Astra ни дава значително предимство както по отношение на възможностите, така и на ефективността. Той успешно изпълнява най-сложните ни творчески работни процеси, като използва с до 20% по-малко токени от другите модели, които сме тествали. Най-важното е, че за нашите клиенти това означава по-качествени резултати.“
Алекс Машрабов, главен изпълнителен директор и съосновател, Higgsfield AI

Когато инструкциите оставят място за интерпретация, GPT‑6 Astra се справя по-добре от предишните модели при вземането на правилното решение. Моделът използва контекста, за да попълва обичайни пропуски, и задава конкретни въпроси, когато отговорът може да промени резултата. В Codex може да задава въпроси асинхронно, като същевременно продължава работата, която не зависи от Вашия отговор. Ако не отговорите, той продължава с разумни предположения, когато е уместно, но изчаква Вашите указания при решения със съществени последици.

Примерите по-долу показват как Astra сътрудничи при ежедневни задачи, при които липсващата информация може съществено да промени отговора.

Astra също се справя по-добре с това да запазва ориентация, докато задачата се развива. При по-ранните модели понякога съобщенията за насочване се възприемаха като нова цел, в резултат на което моделът губеше от поглед първоначалната заявка или по-ранните ограничения. Astra включва новите изисквания, променя посоката на действие при поискване и отговаря на странични въпроси, без да изоставя основната задача.

„Astra представлява значително подобрение в качеството спрямо GPT‑5.6 Sol при сложни правни задачи. При първоначалните ни тестове Astra се открои с това, че подхожда към юридическата работа по начина, по който би го направил опитен и проницателен адвокат: разграничава документите от установените записи, извежда на преден план откроява необоснованите предположения и превръща липсващата информация в конкретни позиции при изготвянето на документи.”
Нико Групен, ръководител „Приложни изследвания“, Harvey

Програмиране

GPT‑6 Astra е най-добрият модел за софтуерно инженерство до момента.

1 от 2
„GPT‑6 Astra демонстрира водещи резултати на нашите вътрешни бенчмаркове за кодиране и показва ясно подобрение при оценките на интуицията за търговия в сравнение с GPT‑5.6 Sol. Когато се използва за агентно кодиране, GPT‑6 Astra комуникира по начин, който е по-лесен за проследяване от разработчиците, и създава код, който изисква по-малко итерации, за да достигне продукционно качество.“
Джон Крепеци, „AI асистенти“, Jane Street

С Astra въвеждаме нов начин Codex да запазва и извлича контекст, когато контекстният прозорец се запълни. Досега моделите са използвали сбиване, за да обобщават извършената работа по време на дълги сесии, например при отстраняване на сложни проблеми или при работа по мащабни рефакторирания. При всяко сбиване могат да бъдат пропуснати подробности за причините, поради които дадена корекция не е работила, или за поведението на даден компонент. В Codex Astra може да съхранява бележки между отделните контекстни прозорци, като запазва натрупаните подробности, без многократно да ги компресира в едно обобщение. По-ранните контекстни прозорци остават достъпни за търсене, така че Astra може да намира изисквания или резултати от тестове от предишни съобщения и изходни данни от инструменти – дори ако тази информация не е била включена в бележките му. Можете да активирате тази експериментална функция във Вашия Codex config.toml,(отваря се в нов прозорец) а през следващите седмици тя ще стане настройка по подразбиране за Astra.

Ускоряване на научните открития

„Историята е следната: краят на една епоха и началото на друга.“
Грег Бърнам, EpochAI

GPT‑6 Astra is a major advance for scientific discovery, mathematics, and health. Today, we’re sharing two further results on the gaps between prime numbers.9, 10

Astra also sets new records across a suite of math and science evaluations.

Astra може да помага с практическата работа, която стои зад научните открития. Като съчетава научното структурирано анализиране с използването на компютър, моделът може да работи директно със специализиран софтуер, за да изследва данни и да анализира резултати, като помага на изследователите да оценяват доказателствата и да решават какво да проучат след това.

Киберсигурност

As we discussed in our safety update, Astra is a significant jump in cyber capabilities and meets the Critical threshold in cybersecurity under our Preparedness Framework. Its ability to identify and develop zero-day exploits can help defenders find and patch weaknesses, but it also creates a need for stronger safeguards. To understand how far these capabilities extend, we ran Astra on internal and third-party expert evaluations.

We first tested the model without production safeguards on ExploitBench and ExploitGym, which evaluate whether models can turn known software vulnerabilities into working exploits. On ExploitBench, Astra achieved a perfect score of 100%, compared with 78.5% for GPT‑5.6 Sol, our previous frontier cyber-capable model. On ExploitGym, Astra reached a 42.4% success rate, compared with 30.3% for GPT‑5.6 Sol, while using substantially fewer output tokens.13

Given concerns that exposure to historical software vulnerabilities may have affected benchmark results, we also evaluated Astra on two novel benchmarks. For one, we built an internal “ExploitBench (June–August 2026)” evaluation to test exploit development using vulnerabilities from the previous three months.14 Astra achieved substantially higher arbitrary code-execution rates than GPT‑5.6 Sol on this dataset while using far fewer output tokens. During the evaluation, Astra even discovered and used two previously unknown zero-day vulnerabilities. We are disclosing both vulnerabilities to their maintainers.

We also tested Astra on SRE-Bench15, a benchmark that measures whether models can reverse engineer software binaries to understand its core logic without access to raw source code. Astra solved 88.0% of tasks in a single attempt and 99.2% within four attempts, compared with 55.9% and 68.7% for GPT‑5.6 Sol, respectively.

Beyond benchmarks, expert-led assessments found that Astra, when run without production safeguards, could use previously unknown vulnerabilities to achieve arbitrary code execution in hardened browsers and create privilege-escalation exploits for hardened operating-systems.

As we discussed in The Defender’s Window, frontier cyber capabilities can help defenders find weaknesses faster, but they also make those weaknesses easier to exploit, raising the urgency for defenders to adapt. With the version of Astra launching today, defenders can use it to complete tasks such as secure code review and patching.

However, Astra will refuse to comply with more advanced cybersecurity tasks such as creating proof-of-concept exploits for vulnerabilities. Through OpenAI Daybreak, we plan to expand access and roll out less restrictive safeguards in the coming weeks. This will enable more defensive workflows, including vulnerability and proof-of-concept validation, malware analysis, and detection engineering.

We have also strengthened our protections against potential cyber misuse, building upon our safeguards stack for GPT‑5.6 Sol. These include stronger model robustness to better withstand potential jailbreaks and more context for our monitoring systems. We have continued rigorous internal and external testing, including automated evaluations with our internal red-teaming attackers. More details about our cyber safeguards and testing are available in the Astra safety overview and system card(отваря се в нов прозорец)..

Отговорно съгласуване и внедряване на GPT‑6 Astra

Astra е най-добре съгласуваният ни модел. Astra се отличава със способността си да проявява предпазливост, да спазва рамките на задачата и да комуникира прозрачно. Тази разработка е най-новият резултат от дългогодишната ни изследователска програма, насочена към обучението на модели, които остават съобразени с човешките намерения от началото до края.

В чувствителни среди Astra действа с предпазливост, съответстваща на риска. При оценяване на задачи за използване на компютър, подбрани по начин, целящ да провокира неправомерно поведение, Astra постигна по-голям успех в избягването на непредвидени последици. Изпълнението с допълнителните мерки за сигурност, предлагани по подразбиране, доведе до още по-добри резултати.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(отваря се в нов прозорец) and Anthropic Messages API(отваря се в нов прозорец)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Моделът Astra също така е по-склонен да работи в рамките на ограниченията, зададени от потребителя и подразбиращи се от средата му. При вътрешна оценка Astra нито веднъж не прави опит да заобиколи отказ на Codex Auto-review. Това остава в сила дори когато Auto-review е бил умишлено конфигуриран така, че да може да бъде заобиколен, а задачата е била невъзможна за изпълнение по друг начин. Това съобразяване с ограниченията на средата е в съответствие с резултатите от оценяването ни на невъзможни киберзадачи, които споделихме във въведението към тази публикация, както и с други констатации, документирани в карта на системата(отваря се в нов прозорец).

Astra additionally sets new marks in transparent user communication. In one evaluation, Astra is three times less likely than GPT‑5.6 Sol to make inaccurate representations about its capabilities and affordances.

В нашата оценка за халюцинации относно способностите Astra показва значително подобрение спрямо GPT‑5.6 Sol, като прави по-малко подвеждащи твърдения за своите способности.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(отваря се в нов прозорец) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(отваря се в нов прозорец) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Наличност

GPT‑6 Astra is rolling out today to a limited set of organizations and over the coming days will become available to all ChatGPT Plus, Pro, Business, and Enterprise users, as well as through the OpenAI API, Microsoft Azure, and AWS Bedrock. Astra usage is included within the existing subscription allowances—users and businesses will also be able to purchase credits for additional usage. Users on the Pro, Business, and Enterprise plans will also get access to GPT‑6 Astra Pro. Enterprise administrators can enable Astra for their workspace; access is off by default at launch.

Astra supports Zero Data Retention for eligible API customers, and as we shared last month, we're testing Private Safety Processing to strengthen safety monitoring while preserving customer privacy.

For developers, GPT‑6 Astra will be available in the OpenAI API as gpt-6-astra and through Microsoft Azure and Amazon Bedrock.

OpenAI API Standard pricing is $10 per million input tokens and $50 per million output tokens. Separate rates apply to cache reads and writes. Fast mode is available for GPT‑6 Astra in the API and delivers up to 2x the speed of Standard processing at 2x the Standard price.

Използване на компютър

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Наука и здравеопазване

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Киберсигурност

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Съгласуваност

Съгласуваност

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Вътрешен бенчмарк за безопасност при използване на компютър (по-ниската стойност е по-добра)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Вътрешен бенчмарк за безопасност при използване на компютър, с Auto-review (по-ниската стойност е по-добра)

1,8%

4,3%

-

-

-

-

Вътрешен бенчмарк за заобикаляне (по-ниската стойност е по-добра)

0,00%

0,29%

-

-

-

-

Honeypot в ExploitGym (по-ниската стойност е по-добра)

0,0%

48,2%

-

-

-

-

Impossible ExploitGym

100,0%

-

-

-

-

-

Вътрешен бенчмарк за халюцинации (по-ниската стойност е по-добра)

4,2%

12,2%

-

-

-

-

Дълъг контекст

Дълъг контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Абстрактно разсъждаване

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Резултатите от оценките са максимални при всяко ниво на усилие. Оценките на GPT са проведени в нашата изследователска среда или чрез нашия API, което може да доведе до малко по-различен резултат в сравнение с ChatGPT в продукционна среда поради различия в системните подкани, наличните инструменти и др.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(отваря се в нов прозорец). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(отваря се в нов прозорец).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(отваря се в нов прозорец).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(отваря се в нов прозорец).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(отваря се в нов прозорец): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(отваря се в нов прозорец) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(отваря се в нов прозорец) and supporting research(отваря се в нов прозорец).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(отваря се в нов прозорец) and supporting research(отваря се в нов прозорец).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.