OpenAI

GPT-6 Astra: A new generation of intelligence

Нова генерација интелигенције

Ажурирано 22. 9. 2026: Проширујемо нашу породицу GPT‑6 моделима GPT‑6 Sol и GPT‑6 Luna. Сазнајте више.

Представљамо GPT‑6 Astra, најинтелигентнији и најусклађенији модел на свету.

GPT‑6 Astra обједињује године истраживања и велика улагања у предобуку, подстицајно учење и усклађивање. Astra је на нивоу најсавременијих достигнућа у коришћењу рачунара, прегледању мреже, софтверском инжењерству, сајбер-безбедности, науци и професионалном раду. Astra достиже засићење на FrontierMath нивоу 4 са резултатом од 98%, након што је већ помогла у решавању дугогодишњих отворених проблема⁠ у математици. Astra такође достиже засићење на ARC-AGI-3 са резултатом од 99,9% и на ExploitBench-у са резултатом од 100%. Такође помера границе у коришћењу рачунара и прегледача, обављајући најзахтевнији професионални рад ненадмашном брзином, прецизношћу и расуђивањем. 

GPT‑6 Astra се од данас постепено уводи за ограничен број организација, а током наредних дана постаће доступан свим корисницима пакета ChatGPT Plus, Pro, Business и Enterprise, као и путем OpenAI API-ја, Microsoft Azure-а и AWS Bedrock-а.

„На ARC-AGI-3, Astra је надмашила наш полазни ниво ефикасности људских радњи на 96% нивоа, практично достигавши људски ниво на овом бенчмарк тесту. Не само да је ово најбољи модел који смо икада тестирали, већ представља и значајан квалитативни искорак у учинку граничних модела – не само у способности да се сналази у новим окружењима и решава их, већ и у томе колико ефикасно учи да то чини.“
Грег Камрадт, Фондација ARC Prize

Astra је наш најусклађенији модел, са значајним побољшањима у разумевању намере корисника и понашања модела – можете јој поверити задатке са већим поверењем у њену процену. Као један од начина на који ово тестирамо, развили смо нову евалуацију засновану на сазнањима из инцидента са платформом Hugging Face, која процењује да ли ће модел суочен са тешким или немогућим задатком изаћи изван свог предвиђеног опсега. У поређењу са GPT‑5.6 Sol, који је без заштитних мера у продукционом окружењу у 48% случајева прелазио преко одобреног циља, GPT‑6 Astra је то учинио у 0% случајева.

Најбољи модел на свету за коришћење рачунара

GPT‑6 Astra представља нову границу у брзини, прецизности и безбедности коришћења рачунара. Може да обавља заморне задатке као што су попуњавање онлајн образаца, ажурирање евиденције о клијентима у CRM-у и организовање вашег календара. Може да обавља истраживања на мрежи и саставља сажетке у вашој е-пошти или у уређивачу докумената. Може да анализира научне податке, генерише графиконе, креира веб-сајт и покреће QA провере frontend-а да би се проверило да ли све функције на том сајту раде. Може да вам помогне да самостално инсталирате и тестирате софтвер, као и да решавате проблеме које видите на екрану. Ова побољшања се такође одражавају у нашим најбољим резултатима евалуације до сада.

Ова побољшања такође доводе до значајних повећања ефикасности у стварним задацима интелектуалног рада. У симулацијама кашњења на OSWorld 2.0, Astra постиже боље перформансе при коришћењу рачунара за око 47% мање времена по задатку него GPT‑5.6 Sol, са резултатом од 72,6% за отприлике 40 минута по задатку, у поређењу са 65,7% за отприлике 75 минута.3

Могућности GPT‑6 Astra за коришћење рачунара могу се видети у резултатима у различитим областима, укључујући развој игара, електротехничко инжењерство и свакодневни рад заснован на знању:

Поред Astra, ажурирамо и Codex окружење како бисмо значајно побољшали брзину коришћења рачунара. У комбинацији са ефикасношћу модела Astra, то омогућава 1,9 пута брже довршавање задатака у поређењу са тренутним искуством са GPT‑5.6 Sol на мерилу Mind2Web. Побољшања брзине модела значе да може да преузме многе временски захтевне свакодневне задатке за вас, брже него што бисте ви могли.4

„Интегришемо GPT‑6 Astra у Девиново окружење на дан лансирања, где постиже најсавременије перформансе на нашем интерном бенчмарк тесту. Његово одлично коришћење рачунара, писање и разумевање базе кода унапредили су тестирање без додатног подешавања: видео-снимци су приметно лакши за праћење, а извештаји јаснији и сажетији”
Сајлас Алберти, SVP за истраживање, Cognition

Суштински преображај стручног рада

GPT‑6 Astra обједињује напретке у коришћењу рачунара са циљаном обуком за професионална окружења, како би помогао у решавању сложених радних задатака. Комбинује интелигенцију потребну за сложене проблеме са способношћу обављања вишекорачних радних токова и израде углађених докумената, табела и презентација.

GPT‑6 Astra је наш најбољи модел за придржавање постојећих шаблона и креирање добро распоређених слајдова који сажето преносе кључне поенте кроз структурисан наратив. Креира јасне, добро структуриране документе, презентације, табеле и анализе који прате ваше шаблоне и усклађени су са вашим стилом писања и визуелним стилом. Астра је такође обучена да у излазне резултате укључује само контекст који је релевантан, уместо да понавља информације које нису неопходне за тренутни задатак. Све то значи да може да генерише артефакте који су непосредније употребљиви и усклађени са вашим пословним контекстом и стандардима.

GPT‑6 Astra такође уноси боље визуелно расуђивање у веб-сајтове, игре, апликације и рендере које креира. Помоћу Сајтова⁠(отвара се у новом прозору) у услузи ChatGPT, Astra може директно помоћу инструкције да креира, хостује и дели веб-сајтове, веб-апликације и игре.

„Астра нам пружа значајну предност у погледу капацитета и ефикасности. Успешно извршава наше најсложеније креативне токове рада, при чему користи до 20% мање токена од других модела које смо тестирали. Што је најважније, за наше клијенте то значи квалитетније резултате.”
Алекс Машрабов, генерални директор и суоснивач компаније Higgsfield AI

Када упутства остављају простор за тумачење, GPT‑6 Astra је бољи од претходних модела у доношењу исправне одлуке. Користи контекст да попуни уобичајене празнине и поставља усмерена питања када би одговор могао да промени исход. У Codex-у може асинхроно да поставља питања док наставља рад који не зависи од вашег одговора. Ако не одговорите, наставља на основу разумних претпоставки када је то прикладно, али чека ваш унос када су у питању одлуке са значајним последицама.

Примери у наставку показују како Astra сарађује на свакодневним задацима где недостатак информација може значајно променити одговор.

Astra такође боље одржава оријентацију како се задатак развија. Ранији модели су понекад усмеравајуће поруке третирали као нови циљ, губећи из вида првобитни захтев или ранија ограничења. Astra интегрише нове захтеве, мења смер када се то од ње затражи и одговара на споредна питања, не испуштајући из вида шири задатак.

„Astra представља значајно побољшање квалитета у односу на GPT‑5.6 Sol у сложеним правним задацима. У нашим раним тестирањима, Astra се истакла тиме што је правном раду приступала онако како то чини проницљив адвокат: разликује документе од утврђених евиденција, износи на видело непоткрепљене претпоставке и претвара празнине у конкретна полазишта за састављање нацрта.”
Нико Групен, руководилац примењених истраживања, Harvey

Кодирање

GPT‑6 Astra је до сада најбољи модел за софтверско инжењерство.

1 од 2
„GPT‑6 Astra пружа врхунске перформансе на нашим интерним бенчмарк испитивањима за програмирање и показује јасан напредак у проценама интуиције за трговање у поређењу са GPT‑5.6 Sol. Када се користи за програмирање од стране агента, GPT‑6 Astra комуницира на начин који програмери лакше прате и ствара кôд који захтева мање итерација да би достигао квалитет спреман за продукцију.
Џон Крепеци, AI асистенти, Jane Street

Уз Astra представљамо нови начин да Codex сачува и преузме контекст када се прозор контекста попуни. Модели су до сада користили компакцију да би резимирали рад током дугих сесија, на пример при отклањању сложених проблема или спровођењу великих рефакторисања. При свакој компакцији могу да изостану детаљи о томе зашто исправка није успела или како се компонента понаша. У Codex-у, Astra може да чува белешке у више прозора контекста, задржавајући прикупљене детаље без њиховог поновљеног сажимања у један резиме. Ранији прозори контекста остају претраживи, па Astra може да пронађе захтеве или резултате тестирања из претходних порука и излаза алата – чак и ако те информације нису забележене у њеним белешкама. Ову експерименталну функцију можете да омогућите у датотеци config.toml за Codex,⁠(отвара се у новом прозору) а у наредним недељама постаће подразумевана опција за Astra.

Унапређивање научних открића

„Прича је: крај једне ере, почетак друге.“
Грег Бернхам, EpochAI

GPT‑6 Astra представља значајан напредак за научна открића, математику и здравље. Данас представљамо још два резултата о размацима између простих бројева.9 и 10

Astra такође поставља нове рекорде у скупу математичких и научних евалуација.

Astra може да помогне у практичном раду који стоји иза научних открића. Комбиновањем научног резоновања и коришћења рачунара, може непосредно да ради у специјализованом софтверу како би прегледала податке и истраживала резултате, помажући истраживачима да процене доказе и одлуче шта даље да истражују.

Сајбер безбедност

Као што смо говорили у свом ажурирању о безбедности⁠, Astra представља значајан искорак у сајбер способностима и достиже критични праг у сајбер безбедности према нашем Оквиру спремности. Та способност да идентификује и развија експлоите нултог дана може помоћи браниоцима да пронађу и закрпе рањивости, али такође ствара потребу за снажнијим заштитним мерама. Да бисмо разумели домет ових могућности, тестирали смо Astra у оквиру интерних процена и стручних процена трећих страна.

Најпре смо тестирали модел без продукционих заштитних мера на мерилима ExploitBench и ExploitGym, која процењују да ли модели могу да претворе познате софтверске рањивости у функционалне експлоите. На ExploitBench-у, Astra је остварила савршен резултат од 100%, у поређењу са 78,5% за GPT‑5.6 Sol, наш претходни гранични модел са способностима у сајбер-безбедности. На ExploitGym-у, Astra је достигла стопу успешности од 42,4%, у поређењу са 30,3% за GPT‑5.6 Sol, уз коришћење знатно мањег броја излазних токена.13

С обзиром на могућу забринутост да је изложеност историјским софтверским рањивостима можда утицала на резултате бенчмарк тестирања, Astra-у смо такође оценили на два нова бенчмарк теста. Као један пример, изградили смо интерну евалуацију „ExploitBench (јун–август 2026)” за тестирање развоја експлоата коришћењем рањивости из претходна три месеца.14 Astra је постигла знатно веће стопе произвољног извршавања кода него GPT‑5.6 Sol на овом скупу података, уз коришћење далеко мањег броја излазних токена. Током евалуације, Astra је чак открила и употребила две претходно непознате рањивости нултог дана. Пријављујемо обе рањивости њиховим одржаваоцима.

Такође смо тестирали Astra-у на бенчмарку SRE-Bench15, који процењује да ли модели могу да примене реверзни инжењеринг на бинарне датотеке софтвера како би разумели његову основну логику без приступа необрађеном изворном коду. Astra је решила 88,0% задатака у једном покушају и 99,2% у највише четири покушаја, у поређењу са 55,9%, односно 68,7%, за GPT‑5.6 Sol.

Поред benchmark тестова, процене које су водили стручњаци показале су да је Astra, када се покреће без продукционих заштитних мера, могла да искористи раније непознате рањивости за извршавање произвољног кода у ојачаним прегледачима и да креира експлоите за ескалацију привилегија на ојачаним оперативним системима.

Као што смо говорили у Прозору браниоца, граничне сајбер могућности могу помоћи браниоцима да брже пронађу слабости, али такође олакшавају њихово искоришћавање, што повећава хитност прилагођавања бранилаца. Уз верзију Astra која се данас објављује, браниоци могу да је користе за обављање задатака као што су безбедносни преглед кода и примена закрпа.

Међутим, Astra ће одбити да извршава напредније задатке из области сајбер-безбедности, као што је креирање експлоата за доказ концепта рањивости. Преко OpenAI Daybreak⁠, планирамо да у наредним недељама проширимо приступ и уведемо мање рестриктивне заштитне мере. Ово ће омогућити више одбрамбених токова рада, укључујући валидацију рањивости и доказа концепта, анализу малвера и инжењеринг детекције.

Такође смо ојачали заштиту од потенцијалне злоупотребе у сајбер простору, надовезујући се на наш скуп заштитних мера за GPT‑5.6 Sol. То обухвата већу отпорност модела како би се боље одупирали потенцијалним заобилажењима безбедносних мера, као и више контекста за наше системе за надзор. Наставили смо са ригорозним интерним и спољним тестирањем, укључујући аутоматизоване евалуације са нашим интерним нападачима из црвене команде. Више детаља о нашим заштитним мерама у сајбер-простору и тестирању доступно је у прегледу безбедности⁠ и системској картици⁠(отвара се у новом прозору) модела Astra.

Одговорно усклађивање и примена модела GPT‑6 Astra

Astra је наш најусклађенији модел. Astra се истиче пажљивим поступањем, поштовањем граница задатка и транспарентном комуникацијом. Овај рад је најновији производ нашег дугогодишњег истраживачког програма усмереног на обуку модела који остају усклађени са људском намером од почетка до краја.

У осетљивим окружењима, Astra поступа опрезно, сразмерно ризику. У евалуацији задатака коришћења рачунара који су адверсаријално одабрани да изазову нежељено понашање, Astra је била успешнија у избегавању непредвиђених последица. Покретање са додатним безбедносним мерама које се подразумевано нуде резултирало је још бољим перформансама.

Astra изазива мање неусклађених исхода него било који други тестирани гранични модел. Ради правичног поређења, користили смо генеричко окружење за агента који користи рачунар (засновано на изворним алатима за коришћење рачунара доступним и у OpenAI Responses API⁠(отвара се у новом прозору) и у Anthropic Messages API⁠(отвара се у новом прозору)) и без додатних заштитних мера које се обично примењују за кориснике услуга Codex и ChatGPT Посао (аутоматски преглед, политика потврђивања).

Astra ће такође вероватније функционисати у оквиру граница које је поставио корисник и које подразумева њено окружење. У интерној евалуацији Astra ниједном није покушала да заобиђе одбијање аутоматске провере у Codex-у. То је важило чак и када је функција Auto-review намерно била подешена тако да се може заобићи, а задатак иначе није било могуће довршити. Овакво поштовање ограничења окружења у складу је са резултатима наше евалуације немогућих сајбер задатака, коју смо поделили у уводу ове објаве, као и са другим налазима документованим у нашој системској картици⁠(отвара се у новом прозору).

Астра уједно поставља нова мерила у транспарентној комуникацији са корисницима. У једној евалуацији, три пута је мање вероватно да ће Astra него GPT‑5.6 Sol да нетачно представи своје способности и могућности.

У нашој евалуацији халуцинација у вези са способностима, Astra показује значајно побољшање у односу на GPT‑5.6 Sol, при чему износи мање обмањујућих тврдњи о својим способностима.

Наше евалуације су показале да је Astra-ино писано резоновање теже надзирати него резоновање модела GPT‑5.6 Sol, на основу тестова у којима је изричито затражено да избегне надзор. То приписујемо већој контроли коју Astra има над писаним резоновањем у једноставнијим задацима и способности да решава проблеме са мање писаних корака. Чини се да Astra и даље има потешкоћа да прикрије резоновање потребно за сложене задатке, али пад схватамо озбиљно. Унапређење могућности праћења и даље је истраживачки приоритет, а пратећа системска картица⁠(отвара се у новом прозору) детаљно описује наше налазе и текући рад.

Обука за усклађивање је кључна за наш приступ примени. Као додатни слој одбране, развијамо и системске заштитне мере као што су Codex Auto-review⁠(отвара се у новом прозору) и надзор резоновања и радњи агената, како бисмо лакше открили и обуздали небезбедно понашање. Као што је описано у нашем ажурирању о безбедности⁠, за моделе класе Astra у продукцији примењујемо и надзор неусклађености како бисмо имали увид у неусклађеност и помогли у обуздавању њених најтежих случајева. Ове заштитне мере личе на наш надзор интерних примена и обухватају систем класификатора који проверавају резоновање и радње модела ради откривања неовлашћеног понашања и аутоматски заустављају потенцијално неовлашћене активности.

С обзиром на значајно повећање могућности модела Astra у области сајбер-безбедности, посебно водимо рачуна о томе да ово увођење буде безбедно и заштићено. Додатне безбедносне провере понекад могу успорити, паузирати или зауставити легитиман рад, укључујући одбрамбену сајбер безбедност. Ако је задатак паузиран у ChatGPT‑у или Codex-у, од вас може бити затражено да прегледате радњу пре него што наставите. У API-ју ће се задатак зауставити. Ове провере понекад могу да ометају легитиман рад, а ми настављамо да унапређујемо овај систем како бисмо смањили непотребне прекиде. Надзор неусклађености не може да замени усклађеност: наш циљ је да изградимо моделе који поуздано остају у оквиру опсега за који су овлашћени, тако да ове заштитне мере не морају да интервенишу.

Доступност

GPT‑6 Astra се од данас постепено уводи за ограничен број организација, а током наредних дана постаће доступан свим корисницима пакета ChatGPT Plus, Pro, Business и Enterprise, као и путем OpenAI API-ја, Microsoft Azure-а и AWS Bedrock-а. Коришћење услуге Astra укључено је у постојећа ограничења претплате – корисници и предузећа ће такође моћи да купе кредите за додатно коришћење. Корисници планова Pro, Business и Enterprise такође ће добити приступ GPT‑6 Astra Pro. Администратори Enterprise-а могу да омогуће Astra за свој радни простор; приступ је подразумевано искључен при покретању.

Astra подржава незадржавање података за API клијенте који испуњавају услове, а као што смо навели прошлог месеца, тестирамо приватну обраду ради безбедности како бисмо ојачали праћење безбедности уз очување приватности клијената.

За програмере, GPT‑6 Astra ће бити доступан у API-ју OpenAI као gpt-6-astra и путем Microsoft Azure-а и Amazon Bedrock-а.

Стандардна цена API-ја OpenAI износи 10 УСД по милиону улазних токена и 50 УСД по милиону излазних токена. За читања из кеша и уписе у кеш примењују се засебне цене. Брзи режим је доступан за GPT‑6 Astra у API-ју и пружа до 2 пута већу брзину од Стандардне обраде по цени двоструко већој од цене Стандардне обраде.

Коришћење рачунара

Коришћење рачунара

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, офлајн скуп, делимичан резултат)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (без алата)

92,7%

76,9%

-

87,3%17

-

-

Професионални

Професионални

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4%

18,1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Интерни задаци дизајна

50,0%

47,4%

-

35,8%

-

-

Интерни задаци науке о подацима

40,9%

30,5%

-

34,7%

-

-

Индекс интелигенције Artificial Analysis v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Кодирање

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Академски рад

Академски рад

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21,4%

30,0%

-

FrontierMath ниво 4 (v2)

97,6%

83,0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6%

93,7%

92,6%

93,7%

95,3%

Последњи испит човечанства (са алатима)

57,2%

-

65,0%

63,8%

63,6%

-

Наука и здравље

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Сајбер безбедност

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Усклађеност

Усклађеност

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Интерно безбедносно бенчмарк испитавање за коришћење рачунара (ниже је боље)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Интерно безбедносни бенчмарк испитивање за коришћење рачунара, са AutoReview (што ниже, то боље)

1,8%

4,3%

-

-

-

-

Интерно бенчмарк испитивање заобилажења (ниже је боље)

0,00%

0,29%

-

-

-

-

Замка у ExploitGym-у (мање је боље)

0,0%

48,2%

-

-

-

-

Немогући ExploitGym

100,0%

-

-

-

-

-

Интерно бенчмарк испитивање халуцинација (ниже је боље)

4,2%

12,2%

-

-

-

-

Дуги контекст

Дуги контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8 игала 256K–512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8 игала 512K–1M

96,3%

73,8%

-

-

-

-

Апстрактно резоновање

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Резултати процене су максимални при било ком нивоу напора. GPT процене су спроведене у нашем истраживачком окружењу или путем нашег API-ја, што може да доведе до незнатно другачијег излаза у односу на продукциони ChatGPT због разлика у системским инструкцијама, доступним алаткама итд.

ФУСНОТЕ

  1. 1

    На тесту ARC-AGI-3, GPT-6 Astra је покренут помоћу нашег окружења за Responses API⁠, које мења два подешавања како би боље одражавало перформансе у стварном свету. Промене нису посебно усмерене на ARC-AGI-3.

  2. 2

    GPT-5.6 Sol се односи на верзију доступну у нашем API-ју, ChatGPT Codex и ChatGPT Посао. Верзија у режиму Ћаскање у услузи ChatGPT мало се разликује.⁠

  3. 3

    OSWorld V2-Offline је подскуп оригиналног OSWorld V2 који ради без приступа интернету. Перформансе модела Claude на OSWorld-V2 Offline репродуковали су аутори на званичној ранг-листи⁠(отвара се у новом прозору). У оквиру OSWorld 2.0, резултати за Claude користе званична подешавања, а не измењене задатке и измењено оцењивање из системске картице Fable 5.1.

  4. 4

    Времена модела су пријављена протекла времена за одговарајућа демонстрациона покретања. Приказани клипови су монтирани исечци.

  5. 5

    На BenchCAD-у, Claude-ови резултати одражавају три измене евалуације, детаљно описане у Системској картици Fable 5.1⁠(отвара се у новом прозору).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(отвара се у новом прозору).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus⁠(отвара се у новом прозору).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    На FrontierCode-у, GPT-6 Astra је покренут са поруком за програмере сличном одељку његове поруке за програмере у Codex-у⁠(отвара се у новом прозору): „Избегавајте креирање превеликог броја тестних датотека. Направите нову тестну датотеку само када то захтевају конвенције депоа или када ниједна постојећа датотека није погодно место за њу. Избегавајте неповезано сређивање и непотребну сложеност. Поново користите одговарајуће постојеће услужне алате. Прочитајте релевантна упутства за депо и прегледајте оближњи код, тестове, документацију и CI. Придржавајте се устаљених конвенција. Циљ је чист код који се може спојити.” Инструкција није оптимизована за процену.

  9. 9

    Прво се односи на то колико близу једни другима могу да се појављују прости бројеви, без обзира на то колико далеко дуж бројевне праве одете. Више од једне деценије, најбољи познати резултат је утврдио да постоји бесконачно много парова простих бројева који су међусобно удаљени највише 246. Џулија Штадлман⁠(отвара се у новом прозору) недавно је побољшала ту границу на 240. Астра је помогла да се утврди оштрија граница од 186, показујући да се бесконачно много парова јавља у оквиру овог мањег растојања. Мали размаци између простих бројева: Доказ⁠(отвара се у новом прозору) и пратећа истраживања⁠(отвара се у новом прозору).

  10. 10

    Други резултат односи се на неуобичајено велике размаке између простих бројева. Астра је побољшала један члан у оцени тих размака, који је остао непромењен више од 80 година. Делимо доказе, скраћени начин резоновања и материјале за верификацију за оба резултата. Велики размаци између простих бројева: доказ⁠(отвара се у новом прозору) и пратећа истраживања⁠(отвара се у новом прозору).

  11. 11

    Независно смо проценили све Claude моделе пратећи предвиђену процедуру HealthBench Professional, користећи GPT‑5.4 оцењивање и оцене прилагођене дужини, без одсецања. За Fable 5.1 користили смо Opus 5 као резервни механизам за одбијање пружалаца.

  12. 12

    Claude Fable 5 и 5.1 нису укључени у LifeSciBench Gold v1, GeneBench Pro v13 и MedChemBench јер одбијају већину питања у овим евалуацијама.

  13. 13

    На ExploitGym-у смо тестирали Astra и Sol без временског ограничења од 6 сати, како бисмо боље проценили њихове пуне сајбер способности. Довољно су брзи да то има мали утицај.

  14. 14

    ExploitBench (јун–август 2026) садржи 20 V8 рањивости високе озбиљности у 13 стабилних издања Chrome-а. Референтни тест проверава да ли агенти могу да постигну извршавање произвољног кода у V8 и званичним издањима Chrome-а за Linux искоришћавањем сваке наведене рањивости. Неке укључене рањивости можда не дозвољавају извршавање произвољног кода под ограничењима евалуације, па стопа успешности од 100% можда није достижна. Напомена: резултат од 5,5% модела GPT-5.6 Sol последица је ограничења од 300 корака у референтном тесту, што није ограничење које стварни корисници који користе Max не би имали. Модел је при сличним подешавањима постигао резултат од 11,5% када је наилазио на мањи број ограничења.

  15. 15
  16. 16

    Када тестирамо моделе трећих страна, користимо једноставније истраживачко подешавање. Codex има сложенију продукциону конфигурацију, што може довести до различитих стопа грешака сировог модела. Заштитне мере на страни пружаоца услуга и имплементације рачунарских алата и даље се разликују. Корисници се не сусрећу са сценаријем без потврде у Codex-у, јер је то интерна истраживачка конфигурација.

  17. 17

    За ScreenSpot-Pro и ExploitGym, резултати за Fable које наводимо потичу из Mythos-а, који је Fable са мање заштитних мера.