OpenAI

GPT-6 Astra: A new generation of intelligence

Нова генерација на интелигенција

Ажурирано на 22.09.2026 г.: Ја прошируваме нашата фамилија GPT‑6 со GPT‑6 Sol и GPT‑6 Luna. Дознајте повеќе.

Го претставуваме GPT‑6 Astra, најинтелигентниот и најусогласениот модел во светот.

GPT‑6 Astra ги обединува долгогодишните истражувања и големите вложувања во претходното обучување, зајакнувањето на учењето и усогласувањето. Astra постигнува најсовремени резултати во користење компјутер, прелистување, софтверско инженерство, сајбер-безбедност, наука и професионална работа. Astra постигнува заситување на FrontierMath ниво 4 со резултат од 98 %, откако веќе помогна да се решат долгогодишни отворени проблеми⁠ во математиката. Astra постигнува заситување и на ARC-AGI-3 со резултат од 99,9 % и на ExploitBench со резултат од 100 %. Исто така, поставува нова граница во користењето компјутер и прелистувач, справувајќи се со најсложената професионална работа со ненадмината брзина, точност и расудување. 

GPT‑6 Astra се воведува денес за ограничен број организации, а во наредните денови ќе стане достапен за сите корисници на ChatGPT Plus, Pro, Business и Enterprise, како и преку OpenAI API, Microsoft Azure и AWS Bedrock.

„На ARC-AGI-3, Astra го надмина нашето референтно ниво за ефикасност на човечките дејства на 96 % од нивоата, со што практично го достигна човечкото ниво на тестот. Не само што ова е најдобриот модел што некогаш сме го тестирале, туку претставува и значаен исчекор во перформансите на граничните модели - не само во способноста да се движи низ и да решава нови средини, туку и во тоа колку ефикасно учи да го прави тоа.“
Грег Камрад, Фондација ARC Prize

Astra е нашиот најусогласен модел, со значителни подобрувања во разбирањето на намерата на корисниците и однесувањето на моделот - можете да делегирате задачи со поголема доверба во проценката на Astra. Како еден од начините на кои го тестираме - ова, изградивме нова евалуација, поттикната од инцидентот со Hugging Face, која оценува дали модел што се соочува со тешка или невозможна задача ќе излезе надвор од својот предвиден опсег. Во споредба со GPT‑5.6 Sol, кој без заштитни мерки во продукциска средина излегол надвор од одобрената цел во 48 % од случаите, GPT‑6 Astra го направил тоа во 0 % од случаите.

Најдобриот модел во светот за користење компјутер

GPT‑6 Astra означува нова граница во брзината, точноста и безбедноста при користење компјутер. Тоа може да се погрижи за здодевни задачи како пополнување онлајн-обрасци, ажурирање на записи за клиенти во CRM и организирање на вашиот календар. Може да спроведува истражување на интернет и да составува резимеа во вашата е-пошта или во вашиот уредувач на документи. Може да анализира научни податоци, да генерира графикони, да создаде веб-страница и да извршува проверки за обезбедување квалитет на фронтендот за да се увери дека работат сите функции на таа страница. Може да ви помогне со автономно инсталирање и тестирање софтвер, како и со решавање проблеми што ги гледате на екранот. Овие подобрувања се одразуваат и во нашите најсовремени резултати од евалуацијата.

Овие подобрувања, исто така, резултираат со значителни подобрувања на ефикасноста во реални задачи за работа со знаење. Во симулации на доцнење на OSWorld 2.0, Astra постигнува подобри перформанси при користење компјутер за околу 47 % помалку време по задача во споредба со GPT‑5.6 Sol, со резултат од 72,6 % за приближно 40 минути по задача, во споредба со 65,7 % за приближно 75 минути.3

Способностите на GPT‑6 Astra за користење компјутер можат да се видат во резултатите во различни домени, вклучувајќи развој на игри, електротехника и секојдневна интелектуална работа:

Покрај Astra, ја ажурираме и рамката Codex за значително да ја подобриме брзината на користење компјутер. Во комбинација со ефикасноста на Astra, ова овозможува завршување на задачите 1,9 пати побрзо во споредба со тековното искуство со GPT‑5.6 Sol на реперот Mind2Web. Подобрувањата во брзината на моделот значат дека тој може да преземе многу задачи од секојдневниот живот што ви одземаат многу време, побрзо отколку што можете вие.4

„Го интегрираме GPT‑6 Astra во рамката на Devin на денот на лансирањето, каде што постигнува врвни перформанси на нашето внатрешно мерило за тестирање. Неговото одлично користење на компјутер, пишување и разбирање на кодната база го подобрија тестирањето веднаш, без дополнително прилагодување: видеата се забележително полесни за следење, а извештаите се појасни и поконцизни“
Силас Алберти, виш потпретседател за истражување, когниција

Суштинска промена во професионалната работа

GPT‑6 Astra ги комбинира напредокот во користењето компјутер со насочена обука за професионални средини, за да помогне во справувањето со сложени работни задачи. Комбинира интелигенција потребна за сложени проблеми со способноста за извршување работни текови во повеќе чекори и креирање професионално уредени документи, електронски табели и презентации.

GPT‑6 Astra е нашиот најдобар модел за следење постојни шаблони и создавање добро распоредени слајдови што концизно ги пренесуваат клучните точки преку структуриран наратив. Создава јасни, добро структурирани документи, презентации, табеларни пресметки и анализи што ги следат вашите шаблони и се совпаѓаат со вашиот стил на пишување и визуелен стил. Astra е исто така обучена конкретно да го вклучува во излезните резултати само релевантниот контекст, наместо да повторува информации што се непотребни за тековната задача. Сето ова значи дека може да генерира артефакти што се попогодни за непосредна употреба и што одговараат на вашиот деловен контекст и стандарди.

GPT‑6 Astra исто така применува подобра визуелна проценка при креирањето веб-страници, игри, апликации и визуелизации. Со Sites⁠(се отвора во нов прозорец) во ChatGPT, Astra може да креира, хостира и споделува веб-страници, веб-апликации и игри директно од промпт.

„Astra ни дава значителна предност и во способностите и во ефикасноста. Успешно ги извршува нашите најсложени креативни работни текови, притоа користејќи до 20 % помалку токени од другите модели што сме ги тестирале. Најважно од сè, за нашите клиенти тоа значи поквалитетни резултати.“
Алекс Машрабов, главен извршен директор и соосновач, Higgsfield AI

Кога инструкциите оставаат простор за толкување, GPT‑6 Astra е подобар од претходните модели во донесувањето на правилната одлука. Го користи контекстот за да ги пополни вообичаените празнини и поставува насочени прашања кога одговорот би можел да го промени исходот. Во Codex, може асинхроно да поставува прашања додека продолжува да работи на задачи што не зависат од вашиот одговор. Ако не одговорите, продолжува со разумни претпоставки онаму каде што е соодветно, но го чека вашето мислење за одлуки со значителни последици.

Примерите подолу прикажуваат како Astra соработува при секојдневни задачи каде што недостигот на информации може значително да го промени одговорот.

Astra, исто така, подобро ја задржува ориентацијата како што се развива задачата. Претходните модели понекогаш ги третираа пораките за насочување како нова цел, губејќи го од вид првичното барање или претходните ограничувања. Astra вклучува нови барања, ја менува насоката кога тоа ќе се побара и одговара на споредни прашања без да ја занемари пошироката задача.

„Astra претставува значително подобрување на квалитетот во однос на GPT‑5.6 Sol кај сложени правни задачи. Во нашето почетно тестирање, Astra се издвои со тоа што ѝ пристапува на правната работа како што би ѝ пристапил прониклив адвокат: ги разликува документите од утврдените записи, открива непоткрепени претпоставки и ги претвора празнините во конкретни позиции за составување.“
Нико Групен, Раководител на применето истражување, Harvey

Coding

GPT‑6 Astra е најдобриот модел за софтверско инженерство досега.

1 од 2
„GPT‑6 Astra обезбедува врвни перформанси на нашите внатрешни репери за кодирање и покажува јасен исчекор во евалуациите на интуицијата за тргување во споредба со GPT‑5.6 Sol. Кога се користи за кодирање со агент, GPT‑6 Astra комуницира на начин што програмерите полесно го следат и генерира код што бара помалку итерации за да достигне квалитет за продукција.“
Џон Крепеци, асистенти со вештачка интелигенција, Jane Street

Со Astra воведуваме нов начин Codex да зачувува и повторно да пронаоѓа контекст кога ќе се пополни прозорецот за контекст. Историски гледано, моделите користеле компакција за да ја reziмираат работата во текот на долги сесии, на пример при отстранување грешки од сложени проблеми или при справување со големи реструктурирања. При секоја компакција може да се изостават детали за тоа зошто не успеала некоја поправка или како функционира некоја компонента. Во Codex, Astra може да води белешки во повеќе прозорци за контекст, зачувувајќи ги насобраните детали без постојано да ги компресира во едно резиме. Претходните прозорци за контекст и понатаму можат да се пребаруваат, па Astra може да најде барања или резултати од тестови од претходни пораки и излези од алатки - дури и ако тие информации не биле опфатени во нејзините белешки. Можеш да ја овозможиш оваа експериментална функција во твојата config.toml-датотека за Codex,⁠(се отвора во нов прозорец) и ќе стане стандардно за Astra во наредните недели.

Унапредување на научните откритија

„Приказната е: крај на една ера, почеток на друга.“
Грег Барнам, EpochAI

GPT‑6 Astra претставува значаен напредок за научните откритија, математиката и здравството. Денес споделуваме уште два резултата за растојанијата меѓу простите броеви.9 и 10

Astra исто така поставува нови рекорди во низа математички и научни евалуации.

Astra може да помогне со практичната работа што стои зад научните откритија. Со комбинирање на научно расудување и користење компјутер, може директно да работи во специјализиран софтвер за да ги прегледува податоците и да ги истражува резултатите, помагајќи им на истражувачите да ги проценат доказите и да одлучат што следно да истражуваат.

Сајбербезбедност

Како што разговаравме во нашето ажурирање за безбедноста⁠, Astra претставува значителен исчекор во сајбер-способностите и го достигнува критичниот праг во сајбер-безбедноста според нашата Рамка за подготвеност. Неговата способност да идентификува и развива zero-day експлоити може да им помогне на бранителите да ги пронајдат и закрпат слабостите, но истовремено креира и потреба од посилни заштитни мерки. За да разбереме до каде се протегаат овие способности, ја тестиравме Astra преку интерни експертски евалуации и експертски евалуации од трети лица.

Прво го тестиравме моделот без заштитни мерки за продукциска употреба на ExploitBench и ExploitGym, кои оценуваат дали моделите можат да претворат познати софтверски ранливости во функционални експлоити. На ExploitBench, Astra постигна совршен резултат од 100 %, во споредба со 78,5 % за GPT‑5.6 Sol, нашиот претходен граничен модел со сајбер-способности. На ExploitGym, Astra постигна стапка на успешност од 42,4 %, во споредба со 30,3 % за GPT‑5.6 Sol, притоа користејќи значително помалку излезни токени.13

Со оглед на загриженоста дека изложеноста на историски софтверски ранливости можеби влијаела врз резултатите од реперите, ја евалуиравме Astra и на два нови репери. Како прво, изградивме интерна евалуација „ExploitBench (јуни–август 2026)“ за тестирање на развојот на експлоити користејќи ранливости од претходните три месеци.14 Astra постигна значително повисоки стапки на извршување на произволен код од GPT‑5.6 Sol на овој збир на податоци, притоа користејќи многу помалку излезни токени. За време на евалуацијата, Astra дури откри и искористи две претходно непознати ранливости од нултиот ден. Ги објавивме двете ранливости на нивните одржувачи.

Го тестиравме и Astra на SRE-Bench15, репер што мери дали моделите можат преку обратно инженерство да анализираат бинарни датотеки на софтверот за да ја разберат неговата основна логика без пристап до изворниот код. Astra реши 88,0 % од задачите со еден обид и 99,2 % со најмногу четири обиди, во споредба со 55,9 % и 68,7 % за GPT‑5.6 Sol, соодветно.

Покрај реперите, проценките предводени од експерти утврдија дека Astra, кога се извршува без заштитни мерки во продукциска средина, може да искористи претходно непознати ранливости за да постигне произволно извршување на код во зајакнати прелистувачи и да создаде експлоити за ескалација на привилегии во зајакнати оперативни системи.

Како што разговаравме во Прозорецот на бранителот, граничните сајбер-способности можат да им помогнат на бранителите побрзо да пронаоѓаат слабости, но исто така го олеснуваат искористувањето на тие слабости, зголемувајќи ја итноста за бранителите да се приспособат. Со верзијата на Astra што се лансира денес, бранителите можат да ја користат за извршување задачи како што се безбедносна ревизија на код и примена на закрпи.

Меѓутоа, Astra ќе одбие да извршува понапредни задачи од областа на сајбер-безбедноста, како што е креирање експлоити за ранливости како доказ за концепт. Преку OpenAI Daybreak⁠, планираме да го прошириме пристапот и да воведеме помалку ограничувачки заштитни мерки во наредните недели. Ова ќе овозможи повеќе одбранбени работни текови, вклучувајќи валидација на ранливости и доказ за концепт, анализа на малициозен софтвер и инженерство за детекција.

Исто така, ги зајакнавме нашите заштити од потенцијална сајбер-злоупотреба, надоврзувајќи се на нашиот слој на заштитни мерки за GPT‑5.6 Sol. Тие вклучуваат поголема отпорност на моделот за подобро да издржи потенцијални пробивања и повеќе контекст за нашите системи за следење. Продолживме со ригорозно внатрешно и надворешно тестирање, вклучително и автоматизирани евалуации со нашите внатрешни напаѓачи за тестирање на отпорноста. Повеќе детали за нашите мерки за сајбер-заштита и тестирање се достапни во прегледот на безбедноста⁠ на Astra и во системската картичка⁠(се отвора во нов прозорец)..

Одговорно усогласување и воведување на GPT‑6 Astra

Astra е нашиот најусогласен модел. Astra се истакнува во внимателното постапување, почитувањето на границите на задачите и транспарентната комуникација. Оваа работа е најновиот резултат од нашата долгогодишна истражувачка програма, насочена кон обучување модели што остануваат усогласени со човечката намера од почеток до крај.

Во чувствителни средини, Astra постапува внимателно, соодветно на ризикот. Во евалуација на задачи за користење компјутер, намерно избрани за да предизвикаат несоодветно однесување, Astra покажа поголем успех во избегнувањето на ненамерни последици. Извршувањето со дополнителните безбедносни мерки што се нудат по подразбирање резултираше со уште подобри перформанси.

Astra предизвикува помалку неусогласени исходи од кој било друг тестиран граничен модел. За праведна споредба, користевме генеричка рамка за агенти кои користат компјутер (заснована на изворните алатки за користење компјутер достапни и во OpenAI Responses API⁠(се отвора во нов прозорец) и во Anthropic Messages API⁠(се отвора во нов прозорец)) и без дополнителни заштити што вообичаено се применуваат за корисниците на Codex и ChatGPT Work (автоматски преглед, политика за потврдување).

Исто така, поголема е веројатноста Astra да дејствува во рамките на ограничувањата поставени од корисникот и оние што произлегуваат од нејзиното опкружување. Во внатрешна евалуација, Astra никогаш не се обиде да заобиколи одбивање од автоматскиот преглед на Codex. Ова важеше дури и кога функцијата Auto-review беше намерно конфигурирана да може да се заобиколи, а задачата беше невозможно да се заврши на друг начин. Ова почитување на ограничувањата на околината е во согласност со резултатите од нашата евалуација на невозможни сајбер-задачи, што ги споделивме во воведот на оваа објава, како и со други наоди документирани во нашата системска картичка⁠(се отвора во нов прозорец).

Astra дополнително поставува нови стандарди во транспарентната комуникација со корисниците. Во една евалуација, Astra има трипати помала веројатност од GPT‑5.6 Sol да изнесува неточни тврдења за своите способности и можности.

Во нашата евалуација на халуцинации поврзани со способностите, Astra покажува значително подобрување во однос на GPT‑5.6 Sol, изнесувајќи помалку заблудувачки тврдења за своите способности.

Нашите евалуации покажаа дека пишаното расудување на Astra е потешко за следење од она на GPT‑5.6 на Sol, врз основа на тестови во кои експлицитно било побарано од него да го избегне надзорот. Ова го припишуваме на поголемата контрола на Astra врз пишаното расудување при поедноставни задачи и на нејзината способност да решава проблеми со помалку пишани чекори. Се чини дека Astra сè уште се мачи да го прикрие расудувањето потребно за сложени задачи, но сериозно го сфаќаме намалувањето. Подобрувањето на можноста за следење останува истражувачки приоритет, а придружната системска картичка⁠(се отвора во нов прозорец) ги содржи деталите за нашите наоди и тековна работа.

Обуката за усогласување е суштинска за нашиот пристап кон воведувањето. Како дополнителен слој на одбрана, градиме и системски заштитни мерки, како што се Codex Автоматско прегледување⁠(се отвора во нов прозорец) и следење на расудувањето и дејствата на агентите, за да помогнеме во откривањето и ограничувањето на небезбедното однесување. Како што е опишано во нашето безбедносно ажурирање⁠, воведуваме и следење на неусогласеноста во продукција за модели од класата Astra, со цел да имаме увид во неусогласеноста и да помогнеме во ограничувањето на нејзините најтешки случаи. Овие заштитни мерки наликуваат на нашето следење при внатрешни воведувања и вклучуваат систем од класификатори што ги проверуваат расудувањето и дејствата на моделот за неовластено однесување и автоматски запираат потенцијално неовластена активност.

Со оглед на значителното зголемување на способностите за сајбер-безбедност на Astra, особено внимаваме ова воведување да биде безбедно и сигурно. Дополнителните безбедносни проверки понекогаш можат да ја забават, привремено да ја прекинат или да ја запрат легитимната работа, вклучително и одбранбената сајбер-безбедност. Ако задачата е паузирана во ChatGPT или Codex, може да ви биде побарано да го прегледате дејството пред да продолжите. Во API, задачата ќе запре. Овие проверки понекогаш може да ја прекинат легитимната работа, а ние продолжуваме да го усовршуваме овој систем за да ги намалиме непотребните прекини. Следењето на неусогласеноста не може да го замени усогласувањето: нашата цел е да изградиме модели што сигурно остануваат во рамките на нивниот овластен опсег, за овие заштитни мерки да не мора да интервенираат.

Достапност

GPT‑6 Astra се воведува денес за ограничен број организации, а во наредните денови ќе стане достапен за сите корисници на ChatGPT Plus, Pro, Business и Enterprise, како и преку OpenAI API, Microsoft Azure и AWS Bedrock. Користењето на Astra е вклучено во постојните ограничувања на претплатата - корисниците и бизнисите ќе можат да купуваат и кредити за дополнително користење. Корисниците на плановите Pro, Business и Enterprise ќе добијат и пристап до GPT‑6 Astra Pro. Администраторите на Enterprise може да овозможат Astra за својот работен простор; пристапот е стандардно исклучен при лансирањето.

Astra поддржува нула задржување на податоци за API-клиентите кои ги исполнуваат условите и, како што споделивме минатиот месец, тестираме Приватна безбедносна обработка за да го зајакнеме следењето на безбедноста, притоа зачувувајќи ја приватноста на клиентите.

За програмери на софтвер, GPT‑6 Astra ќе биде достапен во OpenAI API како gpt-6-astra и преку Microsoft Azure и Amazon Bedrock.

Стандардната цена за OpenAI API е $10 за милион влезни токени и $50 за милион излезни токени. За читањето од кеш-меморијата и запишувањето во кеш-меморијата се применуваат посебни цени. „Брз режим“ е достапен за GPT‑6 Astra во API и обезбедува до двојно поголема брзина од стандардната обработка, по цена двојно повисока од стандардната.

Користење компјутер

Користење компјутерGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (августовско издание, делумен резултат)---66,1 %70,6 %-
OSWorld 2.0 (издание од август, офлајн подгрупа, делумен резултат)------
ScreenSpot Pro92,6 %76,8 %----
BrowseComp92,1 %90,4 %-87,4 %90,8 %-

Професионално

Професионално

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3 %

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8 %

-

OpenScore гудачки квартети (1 - OMR-NED)

0,84

0,19

-

-

-

-

Задачи за дизајн (внатрешни)

50,0 %

47,4 %

-

35,8 %

-

-

Внатрешни задачи за наука за податоци

40,9 %

30,5 %

-

34,7 %

-

-

Индекс на интелигенција на Artificial Analysis v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Coding

КодирањеGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %44,5 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %69,9 %73,7 %73,8 %
FrontierCode 1.1 Проширен (резултат)64,5 % 860,6 %63,6 %64,9 %63,6 %56,3 %
FrontierCode 1.1 Главен (резултат)53,3 % 847,5 %50,9 %53,5 %53,4 %43,6 %
Задачи за миграција на внатрешната база на податоци63,9 %42,7 %57,8 %50,3 %--
Индекс на агенти за кодирање на Artificial Analysis v1.467,065,1-67,268,161,2

Академско

Академско

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Наука 0,1

64,6 %

22,4 %

52,6 %

21,4%

30,0 %

-

FrontierMath Ниво 4 (v2)

97,6 %

83,0 %

87,8 %

90,2 %

73,2 %

-

GPQA Diamond

96,0 %

94.6%

93,7 %

92,6 %

93,7 %

95,3 %

Последниот испит на човештвото (со алатки)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Наука и здравје

Наука и ChatGPT здравјеGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1 %32,3 %----
MedChemBench (Интерно)49,3 %47,4 %----
LifeSciBench60,3 %59,9 %----
HealthBench Professional (прилагодено според должината)63,4 %60,5 %58,1 % 1160,9 % 1156,4 % 1152,1 %

Сајбербезбедност

Сајбер-безбедностGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0 %78,5 %--70 %-
ExploitGym42,4 % 1330,3 % 1330,4 % 1728,4 %1722,0 %-
ExploitBench (јуни-авг. 2026)39,0 %5,5 %----
SRE-Bench88,0 %55,9 %--12,5 %-
SEC-Bench Pro85,4 %79,1 %----

Усогласеност

Усогласеност

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Интерен репер за безбедност при користење компјутер (помалку е подобро)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Внатрешен репер за безбедност при користење компјутер, со AutoReview (понизок е подобар)

1,8 %

4,3 %

-

-

-

-

Внатрешен репер за заобиколување (понизок е подобар)

0,00 %

0,29 %

-

-

-

-

ExploitGym honeypot (помалку е подобро)

0,0 %

48,2 %

-

-

-

-

Невозможен ExploitGym

100,0%

-

-

-

-

-

Интерен репер за халуцинации (понизок е подобар)

4,2 %

12,2 %

-

-

-

-

Долг контекст

Долг контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-игли 256 илјади – 512 илјади

100,0%

91,5 %

-

-

-

-

OpenAI MRCR v2 8 игли 512 илјади - 1 милион

96,3%

73,8 %

-

-

-

-

Апстрактно расудување

Апстрактно расудувањеGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8 %--30,2 %-
ARC-AGI-295,0 %92,5 %90,0 %89,2 %90,4 %-
ARC-AGI-198,5 %97,5 %97,5 %98,5 %97,5 %-

Оценките од евалуацијата се максимални при каков било напор. Евалуациите на GPT беа извршени во нашата истражувачка средина или преку нашето API, што може да даде малку поинаков резултат од производната верзија на ChatGPT поради разликите во системските промптови, достапните алатки итн.

Фусноти

  1. 1

    На ARC-AGI-3, GPT-6 Astra беше извршен со нашата рамка за Responses API⁠, која менува две поставки за подобро да одговара на перформансите во реалниот свет. Промените не се насочени конкретно кон ARC-AGI-3.

  2. 2

    GPT-5.6 Sol се однесува на верзијата достапна во нашиот API, ChatGPT Codex и ChatGPT Work. Верзијата во режимот ChatGPT Chat е малку поинаква.⁠

  3. 3

    OSWorld V2-Offline е подгрупа на оригиналниот OSWorld V2 што работи без пристап до интернет. Перформансите на моделот Claude на OSWorld-V2 Offline беа репродуцирани од авторите на официјалната табела со резултати⁠(се отвора во нов прозорец). На OSWorld 2.0, резултатите за Claude ги користат официјалните поставки, а не изменетите задачи и изменетото оценување од системската картичка Fable 5.1.

  4. 4

    Времињата на моделите се пријавените изминати времиња за соодветните демонстрациски извршувања. Прикажаните видеоклипови се монтирани извадоци.

  5. 5

    На BenchCAD, оценките на Claude одразуваат 3 измени во евалуацијата, детално опишани во системската картичка Fable 5.1⁠(се отвора во нов прозорец).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon и Noah A. Smith. „LEGATO: Голем генерализиран пристап од крај до крај за печатен OMR⁠(се отвора во нов прозорец).“ arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower и Peter Jonas. „Корпусот на гудачки квартети на OpenScore⁠(се отвора во нов прозорец).“ Зборник на трудови од 10-та Меѓународна конференција за дигитални библиотеки за музикологија, стр. 49–57. ACM, 2023.

  8. 8

    На FrontierCode, GPT-6 Astra беше извршен со порака за програмер слична на дел од неговата порака за програмер во Codex⁠(се отвора во нов прозорец): "Избегнувај креирање прекумерен број тест-датотеки. Креирај нова тест-датотека само кога тоа го бараат конвенциите на репозиториумот или кога ниедна постојна датотека не е соодветно место. Избегнувај неповрзано средување и непотребна сложеност. Повторно искористи ги соодветните постојни помошни алатки. Прочитај ги релевантните упатства за репозиториумот и прегледај го блискиот код, тестовите, документацијата и CI. Следи ги утврдените конвенции. Целта е чист код што може да се спои." Промптот не беше оптимизиран за евалуацијата.

  9. 9

    Првото се однесува на тоа колку блиску еден до друг можат да се појават простите броеви, без оглед на тоа колку далеку одите по бројната права. Повеќе од една деценија, најдобриот познат резултат утврдуваше дека постојат бесконечно многу парови прости броеви чија разлика е најмногу 246. Јулија Штадлман⁠(се отвора во нов прозорец) неодамна ја подобри таа граница на 240. Astra помогна да се утврди построга граница од 186, покажувајќи дека бесконечно многу парови се појавуваат во рамките на ова помало растојание. Мали празнини меѓу простите броеви: доказ⁠(се отвора во нов прозорец) и истражување што го поткрепува⁠(се отвора во нов прозорец).

  10. 10

    Второто се однесува на невообичаено големи празнини меѓу простите броеви. Астра подобри еден член во оценката на овие празнини, кој останал непроменет повеќе од 80 години. Ги споделуваме доказите, скратениот синџир на размислување и материјалите за проверка за двата резултата. Големи празнини меѓу простите броеви: Доказ⁠(се отвора во нов прозорец) и придружно истражување⁠(се отвора во нов прозорец).

  11. 11

    Независно ги оценивме сите модели на Claude следејќи ја предвидената постапка за HealthBench Professional, користејќи GPT‑5.4 оценување и резултати приспособени според должината, без отсекување. За Fable 5.1, го користевме Opus 5 како резервен механизам при одбивања од провајдерот.

  12. Claude Fable 5 и 5.1 не се вклучени во LifeSciBench Gold v1, GeneBench Pro v13 и MedChemBench бидејќи ги одбиваат повеќето прашања во овие евалуации.

  13. 13

    На ExploitGym, ги тестиравме Astra и Sol без временското ограничување од 6 часа, за подобро да ги процениме нивните целосни сајбер-способности. Тие се доволно брзи, така што тоа има мало влијание.

  14. 14

    ExploitBench (јуни–август 2026) содржи 20 V8 ранливости со висока сериозност во 13 стабилни изданија на Chrome. Реперот тестира дали агентите можат да постигнат извршување на произволен код во V8 и официјалните изданија на Chrome за Linux преку искористување на секоја наведена ранливост. Некои од вклучените ранливости можеби не дозволуваат извршување на произволен код во рамките на ограничувањата на евалуацијата, па затоа можеби не е достижна стапка на успешност од 100 %. Забелешка: резултатот од 5,5 % на GPT-5.6 Sol е последица од ограничувањето од 300 потези во реперот, ограничување што реалните корисници на Max не би го имале. Моделот при слични поставки постигна резултат од 11,5 % при соочување со помалку ограничувања.

  15. 15
  16. 16

    Кога тестираме на модели од трети лица, користиме поедноставена истражувачка поставеност. Codex има посложена продукциска конфигурација, што може да резултира со различни стапки на грешки на основниот модел. Заштитните мерки на страната на давателот и имплементациите на компјутерските алатки сè уште се разликуваат. Корисниците не се соочуваат со сценариото без потврда во Codex, бидејќи тоа е внатрешна истражувачка конфигурација.

  17. 17

    За ScreenSpot-Pro и ExploitGym, оценките на Fable што ги наведуваме доаѓаат од Mythos, што е Fable со помалку заштитни мерки.