OpenAI

GPT-6 Astra: A new generation of intelligence

Нова генерација интелигенције

Представљамо GPT‑6 Astra, најинтелигентнији и најусклађенији модел на свету.

GPT‑6 Astra обједињује године истраживања и велика улагања у предобуку, подстицајно учење и усклађивање. Astra је на нивоу најсавременијих достигнућа у коришћењу рачунара, прегледању мреже, софтверском инжењерству, сајбер-безбедности, науци и професионалном раду. Astra достиже засићење на FrontierMath нивоу 4 са резултатом од 98%, након што је већ помогла у решавању дугогодишњих отворених проблема у математици. Astra такође достиже засићење на ARC-AGI-3 са резултатом од 99,9% и на ExploitBench-у са резултатом од 100%. Такође помера границе у коришћењу рачунара и прегледача, обављајући најзахтевнији професионални рад ненадмашном брзином, прецизношћу и расуђивањем. 

GPT‑6 Astra се од данас постепено уводи за ограничен број организација, а током наредних дана постаће доступан свим корисницима пакета ChatGPT Plus, Pro, Business и Enterprise, као и путем OpenAI API-ја, Microsoft Azure-а и AWS Bedrock-а.

„На ARC-AGI-3, Astra је надмашила наш полазни ниво ефикасности људских радњи на 96% нивоа, практично достигавши људски ниво на овом бенчмарк тесту. Не само да је ово најбољи модел који смо икада тестирали, већ представља и значајан квалитативни искорак у учинку граничних модела – не само у способности да се сналази у новим окружењима и решава их, већ и у томе колико ефикасно учи да то чини.“
Грег Камрадт, Фондација ARC Prize

Astra је наш најусклађенији модел, са значајним побољшањима у разумевању намере корисника и понашања модела – можете јој поверити задатке са већим поверењем у њену процену. Као један од начина на који ово тестирамо, развили смо нову евалуацију засновану на сазнањима из инцидента са платформом Hugging Face, која процењује да ли ће модел суочен са тешким или немогућим задатком изаћи изван свог предвиђеног опсега. У поређењу са GPT‑5.6 Sol, који је без заштитних мера у продукционом окружењу у 48% случајева прелазио преко одобреног циља, GPT‑6 Astra је то учинио у 0% случајева.

Најбољи модел на свету за коришћење рачунара

GPT‑6 Astra представља нову границу у брзини, прецизности и безбедности коришћења рачунара. Може да обавља заморне задатке као што су попуњавање онлајн образаца, ажурирање евиденције о клијентима у CRM-у и организовање вашег календара. Може да обавља истраживања на мрежи и саставља сажетке у вашој е-пошти или у уређивачу докумената. Може да анализира научне податке, генерише графиконе, креира веб-сајт и покреће QA провере frontend-а да би се проверило да ли све функције на том сајту раде. Може да вам помогне да самостално инсталирате и тестирате софтвер, као и да решавате проблеме које видите на екрану. Ова побољшања се такође одражавају у нашим најбољим резултатима евалуације до сада.

Ова побољшања такође доводе до значајних повећања ефикасности у стварним задацима интелектуалног рада. У симулацијама кашњења на OSWorld 2.0, Astra постиже боље перформансе при коришћењу рачунара за око 47% мање времена по задатку него GPT‑5.6 Sol, са резултатом од 72,6% за отприлике 40 минута по задатку, у поређењу са 65,7% за отприлике 75 минута.3

Могућности GPT‑6 Astra за коришћење рачунара могу се видети у резултатима у различитим областима, укључујући развој игара, електротехничко инжењерство и свакодневни рад заснован на знању:

Поред Astra, ажурирамо и Codex окружење како бисмо значајно побољшали брзину коришћења рачунара. У комбинацији са ефикасношћу модела Astra, то омогућава 1,9 пута брже довршавање задатака у поређењу са тренутним искуством са GPT‑5.6 Sol на мерилу Mind2Web. Побољшања брзине модела значе да може да преузме многе дуготрајне свакодневне задатке за вас, брже него што бисте ви могли.

„Интегришемо GPT‑6 Astra у Девиново окружење на дан лансирања, где постиже најсавременије перформансе на нашем интерном бенчмарк тесту. Његово одлично коришћење рачунара, писање и разумевање базе кода унапредили су тестирање без додатног подешавања: видео-снимци су приметно лакши за праћење, а извештаји јаснији и сажетији”
Сајлас Алберти, SVP за истраживање, Cognition

Суштински преображај стручног рада

GPT‑6 Astra обједињује напретке у коришћењу рачунара са циљаном обуком за професионална окружења, како би помогао у решавању сложених радних задатака. Комбинује интелигенцију потребну за сложене проблеме са способношћу обављања вишекорачних радних токова и израде углађених докумената, табела и презентација.

GPT‑6 Astra је наш најбољи модел за придржавање постојећих шаблона и креирање добро распоређених слајдова који сажето преносе кључне поенте кроз структурисан наратив. Креира јасне, добро структуриране документе, презентације, табеле и анализе који прате ваше шаблоне и усклађени су са вашим стилом писања и визуелним стилом. Астра је такође обучена да у излазне резултате укључује само контекст који је релевантан, уместо да понавља информације које нису неопходне за тренутни задатак. Све то значи да може да генерише артефакте који су непосредније употребљиви и усклађени са вашим пословним контекстом и стандардима.

GPT‑6 Astra такође уноси боље визуелно расуђивање у веб-сајтове, игре, апликације и рендере које креира. Помоћу Сајтова(отвара се у новом прозору) у услузи ChatGPT, Astra може директно помоћу инструкције да креира, хостује и дели веб-сајтове, веб-апликације и игре.

„Астра нам пружа значајну предност у погледу капацитета и ефикасности. Успешно извршава наше најсложеније креативне токове рада, при чему користи до 20% мање токена од других модела које смо тестирали. Што је најважније, за наше клијенте то значи квалитетније резултате.”
Алекс Машрабов, генерални директор и суоснивач компаније Higgsfield AI

Када упутства остављају простор за тумачење, GPT‑6 Astra је бољи од претходних модела у доношењу исправне одлуке. Користи контекст да попуни уобичајене празнине и поставља усмерена питања када би одговор могао да промени исход. У Codex-у може асинхроно да поставља питања док наставља рад који не зависи од вашег одговора. Ако не одговорите, наставља на основу разумних претпоставки када је то прикладно, али чека ваш унос када су у питању одлуке са значајним последицама.

Примери у наставку показују како Astra сарађује на свакодневним задацима где недостатак информација може значајно променити одговор.

Astra такође боље одржава оријентацију како се задатак развија. Ранији модели су понекад усмеравајуће поруке третирали као нови циљ, губећи из вида првобитни захтев или ранија ограничења. Astra интегрише нове захтеве, мења смер када се то од ње затражи и одговара на споредна питања, не испуштајући из вида шири задатак.

„Astra представља значајно побољшање квалитета у односу на GPT‑5.6 Sol у сложеним правним задацима. У нашим раним тестирањима, Astra се истакла тиме што је правном раду приступала онако како то чини проницљив адвокат: разликује документе од утврђених евиденција, износи на видело непоткрепљене претпоставке и претвара празнине у конкретна полазишта за састављање нацрта.”
Нико Групен, руководилац примењених истраживања, Harvey

Кодирање

GPT‑6 Astra је до сада најбољи модел за софтверско инжењерство.

1 од 2
„GPT‑6 Astra пружа врхунске перформансе на нашим интерним бенчмарк испитивањима за програмирање и показује јасан напредак у проценама интуиције за трговање у поређењу са GPT‑5.6 Sol. Када се користи за програмирање од стране агента, GPT‑6 Astra комуницира на начин који програмери лакше прате и ствара кôд који захтева мање итерација да би достигао квалитет спреман за продукцију.
Џон Крепеци, AI асистенти, Jane Street

Уз Astra представљамо нови начин да Codex сачува и преузме контекст када се прозор контекста попуни. Модели су до сада користили компакцију да би резимирали рад током дугих сесија, на пример при отклањању сложених проблема или спровођењу великих рефакторисања. При свакој компакцији могу да изостану детаљи о томе зашто исправка није успела или како се компонента понаша. У Codex-у, Astra може да чува белешке у више прозора контекста, задржавајући прикупљене детаље без њиховог поновљеног сажимања у један резиме. Ранији прозори контекста остају претраживи, па Astra може да пронађе захтеве или резултате тестирања из претходних порука и излаза алата – чак и ако те информације нису забележене у њеним белешкама. Ову експерименталну функцију можете да омогућите у датотеци config.toml за Codex,(отвара се у новом прозору) а у наредним недељама постаће подразумевана опција за Astra.

Унапређивање научних открића

„Прича је: крај једне ере, почетак друге.“
Грег Бернхам, EpochAI

GPT‑6 Astra представља значајан напредак за научна открића, математику и здравље. Данас представљамо још два резултата о размацима између простих бројева [WITH LINK]. Astra такође поставља нове рекорде у скупу научних евалуација:

Astra може да помогне у практичном раду који стоји иза научних открића. Комбиновањем научног резоновања и коришћења рачунара, може непосредно да ради у специјализованом софтверу како би прегледала податке и истраживала резултате, помажући истраживачима да процене доказе и одлуче шта даље да истражују.

Сајбер безбедност

Astra представља значајан искорак у способностима у сајбер безбедности. Та способност да идентификује и развија експлоите нултог дана може помоћи браниоцима да закрпе рањивости, али такође ствара потребу за снажнијим заштитним мерама. Да бисмо разумели домет ових могућности, користили смо интерне и независне стручне процене.

Најпре смо тестирали Astra на мерилима ExploitBench и ExploitGym, која мере да ли модели могу да остваре извршавање произвољног кода у рањивим базама кода.

С обзиром на могућу забринутост да је изложеност историјским софтверским рањивостима можда утицала на резултате мерила, Astra-у смо такође оценили на два нова мерила. Као један пример, изградили смо интерну евалуацију „ExploitBench (јун–август 2026)” за тестирање развоја експлоата коришћењем рањивости из претходна три месеца. 2 Astra је на овом скупу података постигла знатно високе стопе произвољног извршавања кода него GPT‑5.6 Sol, уз далеко мање излазних токена. Током евалуације, Astra је открила и употребила две претходно непознате технике за излазак из Chrome V8 heap sandbox-а. Пријављујемо обе рањивости њиховим одржаваоцима.

Такође смо тестирали Astra-у на бенчмарку SRE-Bench, који процењује да ли модели могу да примене реверзни инжењеринг на бинарни софтвер како би разумели његову основну логику. Аутори бенчмарка су направили софтвер од нуле и задржали његов изворни кôд приватним. Astra је решила 88,0% задатака у једном покушају и 99,2% у највише четири покушаја, у поређењу са 55,9%, односно 68,7%, за GPT‑5.6 Sol.

Поред benchmark тестова, процене које су водили стручњаци показале су да је Astra могла да користи раније непознате рањивости како би постигла извршавање произвољног кода у ојачаним прегледачима и креирала експлоите за ескалацију привилегија за ојачане оперативне системе. Сагледани заједно, ови резултати навели су нас да закључимо да је Astra достигла критични праг у сајбер безбедности према нашем Оквиру спремности.

Као што смо говорили у Прозору браниоца, граничне сајбер могућности могу помоћи браниоцима да брже пронађу слабости, али такође олакшавају њихово искоришћавање, што повећава хитност прилагођавања бранилаца.

За верзију Astra која се данас објављује, подржавамо важне одбрамбене задатке као што су безбедносни преглед кода, примена закрпа и моделовање претњи. Међутим, Astra ће подразумевано одбити да извршава напредне задатке из области сајбер-безбедности, као што је откривање експлоита. Преко програма OpenAI Daybreak, уводимо мање рестриктиван приступ алфа групи поузданих стручњака за одбрану у сајбер-безбедности у програму OpenAI Daybreak. Ово проширује приступ одбрамбеним токовима рада, укључујући тријажу и валидацију рањивости, анализу малвера, инжењеринг детекције и валидацију закрпа. Планирамо да додатно проширимо приступ путем Daybreak Blue.

Такође смо ојачали заштиту од потенцијалне злоупотребе у сајбер простору, надовезујући се на наш скуп заштитних мера за GPT‑5.6 Sol. То обухвата снажнију обуку за отпорност модела како би се боље одупирали потенцијалним начинима заобилажења безбедносних мера, као и више контекста за наше системе за надзор. Наставили смо са ригорозним интерним и спољним тестирањем, укључујући аутоматизована тестирања са нашим интерним нападачима из црвена команда. Више детаља о нашим заштитним мерама у сајбер-простору и тестирању доступно је у системској картици Astra и на нашем блогу.

Одговорно усклађивање и примена модела GPT‑6 Astra

Astra је наш најусклађенији модел. Astra се истиче пажљивим поступањем, поштовањем граница задатка и транспарентном комуникацијом. Овај рад је најновији производ нашег дугогодишњег истраживачког програма усмереног на обуку модела који остају усклађени са људском намером од почетка до краја.

У осетљивим окружењима, Astra поступа опрезно, сразмерно ризику. У евалуацији задатака коришћења рачунара који су адверсаријално одабрани да изазову нежељено понашање, Astra је била успешнија у избегавању непредвиђених последица. Покретање са додатним безбедносним мерама које се подразумевано нуде резултирало је још бољим перформансама.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(отвара се у новом прозору) and Anthropic Messages API(отвара се у новом прозору)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra ће такође вероватније функционисати у оквиру граница које је поставио корисник и које подразумева њено окружење. У интерној евалуацији Astra ниједном није покушала да заобиђе одбијање аутоматске провере у Codex-у. То је важило чак и када је функција Auto-review намерно била подешена тако да се може заобићи, а задатак иначе није било могуће довршити. Овакво поштовање ограничења окружења у складу је са резултатима наше евалуације немогућих сајбер задатака, коју смо поделили у уводу ове објаве, као и са другим налазима документованим у нашој системској картици(отвара се у новом прозору).

Astra такође показује значајно смањење обмањујућег понашања. Људима који делегирају посао потребно је јасно разумевање могућности модела и искрено извештавање о његовом напретку. Ово мери један аспект искрености; смањење намерног обмањивања остаје шири фокус нашег рада на усклађивању.

У нашој евалуацији халуцинација у вези са способностима, Astra показује значајно побољшање у односу на GPT‑5.6 Sol, при чему износи мање обмањујућих тврдњи о својим способностима.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(отвара се у новом прозору) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(отвара се у новом прозору) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Доступност

GPT‑6 Astra се од данас постепено уводи за предузећа и кориснике нашег Програма поузданог приступа, а широка доступност за особе које су претплаћене на ChatGPT Plus, Pro, Business и Enterprise уследиће током наредних неколико дана. Коришћење услуге Astra укључено је у постојећи лимит коришћења у Pro плановима од 100 УСД и 200 УСД, као и у Business плану од 100 УСД, без додатних ограничења стопе или других ограничења. Особе са претплатом на Plus од 20 УСД и корисници стандардног Business плана могу да приступе GPT‑6 Astra уз нижа ограничења, уз могућност куповине кредита за додатни приступ. Администратори Enterprise-а могу да омогуће Astra за свој радни простор; приступ је подразумевано искључен при покретању.

Корисници планова Pro Lite, Pro, Business и Enterprise могу да користе и GPT‑6 Astra у ћаскању. Astra подржава незадржавање података за клијенте API-ја који испуњавају услове, а као што смо навели прошлог месеца, тестирамо приватну обраду за безбедност како бисмо ојачали праћење безбедности уз очување приватности клијената.

За програмере, GPT‑6 Astra је доступан у API-ју OpenAI као gpt-6-astra, као и у AWS Bedrock-у. Стандардна цена API-ја OpenAI износи 10 УСД по милиону улазних токена и 50 УСД по милиону излазних токена. За читања из кеша и уписе у кеш примењују се засебне цене. Брзи режим је доступан за GPT‑6 Astra у API-ју и пружа до 2,5 пута већу брзину од Стандардне обраде по двострукој Стандардној цени.

Коришћење рачунара

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Наука и здравље

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Сајбер безбедност

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Усклађеност

Усклађеност

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Интерно безбедносно бенчмарк испитавање за коришћење рачунара (ниже је боље)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Интерно безбедносни бенчмарк испитивање за коришћење рачунара, са AutoReview (што ниже, то боље)

1,8%

4,3%

-

-

-

-

Интерно бенчмарк испитивање заобилажења (ниже је боље)

0,00%

0,29%

-

-

-

-

Замка у ExploitGym-у (мање је боље)

0,0%

48,2%

-

-

-

-

Немогући ExploitGym

100,0%

-

-

-

-

-

Интерно бенчмарк испитивање халуцинација (ниже је боље)

4,2%

12,2%

-

-

-

-

Дуги контекст

Дуги контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8 игала 256K–512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8 игала 512K–1M

96,3%

73,8%

-

-

-

-

Апстрактно резоновање

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Резултати процене су максимални при било ком нивоу напора. GPT процене су спроведене у нашем истраживачком окружењу или путем нашег API-ја, што може да доведе до незнатно другачијег излаза у односу на продукциони ChatGPT због разлика у системским инструкцијама, доступним алаткама итд.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(отвара се у новом прозору). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(отвара се у новом прозору).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(отвара се у новом прозору).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(отвара се у новом прозору).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(отвара се у новом прозору): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(отвара се у новом прозору) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(отвара се у новом прозору) and supporting research(отвара се у новом прозору).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(отвара се у новом прозору) and supporting research(отвара се у новом прозору).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.