OpenAI

GPT-6 Astra: A new generation of intelligence

Ново поколение ниво на интелект

Актуализация от 22 септември 2026 г.: разширяваме нашето семейство GPT‑6 с GPT‑6 Sol и GPT‑6 Luna. Научете повече.

Представяме GPT‑6 Astra – най-интелигентният и най-добре съобразеният с човешките ценности модел в света.

GPT‑6 Astra обединява години изследователска работа и значителни инвестиции в предварителното обучение, обучението с утвърждение и съгласуването с човешките ценности. Astra е водещ модел в света при използването на компютър, сърфирането в интернет, софтуерното инженерство, киберсигурността, науката и професионалната работа. Astra достига насищане в ниво 4 на FrontierMath с резултат от 98%, като вече е помогнал за решаването на отдавна нерешени проблеми⁠ в математиката. Astra също достига насищане в ARC-AGI-3 с резултат от 99,9% и в ExploitBench с резултат от 100%. Освен това поставя нов авангарден стандарт при използването на компютър и браузър, като изпълнява най-взискателната професионална работа с несравними бързина, точност и преценка. 

GPT‑6 Astra започва да се предоставя от днес на ограничен брой организации, а през следващите дни ще стане достъпен за всички потребители на ChatGPT Plus, Pro, Business и Enterprise, както и чрез OpenAI API, Microsoft Azure и AWS Bedrock.

„В ARC-AGI-3 Astra надмина нашето базово ниво за ефективност на човешките действия при 96% от нивата, като на практика достигна равнопоставеност с хората в бенчмарка. Това не само е най-добрият модел, който някога сме тествали, но представлява и съществен скок в представянето на авангардните модели – не само по отношение на способността му да се ориентира в нови среди и да решава задачи в тях, но и по отношение на ефективността, с която се научава да го прави.“
Грег Камрад, ARC Prize Foundation

Astra е най-добре съгласуваният ни модел, със значителни подобрения в разбирането на намерението на потребителя и поведението на модела – можете да делегирате задачи на Astra с по-голяма увереност в преценката му. Като един от начините, по които тестваме това, създадохме нова оценка, вдъхновена от инцидента с Hugging Face, която проверява дали модел, изправен пред трудна или невъзможна задача, ще надхвърли определения му обхват. В сравнение с GPT‑5.6 Sol, който без защитни механизми за продукционна среда излизаше извън разрешения обхват в 48% от случаите, GPT‑6 Astra прави това в 0% от случаите.

Най-добрият модел в света за използване на компютър

GPT‑6 Astra поставя нов стандарт по отношение на скоростта, точността и безопасността при използването на компютър. Той може да поема досадни задачи като попълване на онлайн формуляри, актуализиране на клиентски записи в CRM и организиране на календара Ви. Той може да извършва онлайн проучвания и да изготвя обобщения във Вашия имейл или редактор на документи. Той може да анализира научни данни, да генерира графики, да създава уебсайтове и да извършва проверки на качеството на фронтенда, за да гарантира, че всички функции на сайта работят. Той може да Ви помогне самостоятелно да инсталирате и тествате софтуер, както и да отстранявате проблеми, които виждате на екрана. Тези подобрения се отразяват и в резултатите от нашите оценки, които са сред най-съвременните в областта.

Тези подобрения водят и до значително повишаване на ефективността при реални задачи, свързани с работа със знания. При симулации на латентността в OSWorld 2.0 Astra постига по-висока производителност при използване на компютър за приблизително 47% по-малко време на задача в сравнение с GPT‑5.6 Sol, с резултат 72,6% при приблизително 40 минути на задача, в сравнение с 65,7% при приблизително 75 минути.3

Възможностите на GPT‑6 Astra за използване на компютър се проявяват в резултатите в различни области, включително разработване на игри, електротехника и ежедневна интелектуална работа:

Наред с Astra актуализираме и рамката Codex, за да подобрим значително скоростта при използване на компютър. В съчетание с ефективността на Astra това води до 1,9 пъти по-бързо изпълнение на задачи в сравнение с текущия опит с GPT‑5.6 Sol при бенчмарка Mind2Web. Подобренията в скоростта на модела означават, че той може да поема много времеемки задачи от ежедневието вместо Вас и да ги изпълнява по-бързо, отколкото бихте могли сами.4

„Интегрираме GPT‑6 Astra в рамката на Devin в деня на пускането, където моделът постига водещи резултати при нашия вътрешен тестов бенчмарк. Отличните му способности за използване на компютър, писане и разбиране на кодови бази подобриха тестването още при първото използване: видеоклиповете са значително по-лесни за проследяване, а отчетите са по-ясни и по-кратки.“
Сайлъс Алберти, старши вицепрезидент „Научни изследвания“, Cognition

Значителна промяна в професионалната работа

GPT‑6 Astra съчетава усъвършенствани възможности за работа с компютър с целево обучение за професионална среда, за да помага при решаването на сложни работни задачи. Моделът съчетава нивото на интелект, необходимо за решаването на сложни проблеми, със способността да изпълнява многоетапни работни процеси и да създава изпипани документи, електронни таблици и презентации.

GPT‑6 Astra е най-добрият ни модел за спазване на съществуващи шаблони и създаване на добре оформени слайдове, които предават сбито ключовите точки чрез структурирано изложение. То създава ясни, добре структурирани документи, презентации, електронни таблици и анализи, които следват Вашите шаблони и съответстват на стила Ви на писане и на визуалния Ви стил. Моделът Astra също така е обучен така да включва в изходните резултати само релевантния контекст, вместо да повтаря информация, която не е необходима за текущата задача. Всичко това означава, че той може да създава повече готови за непосредствено използване материали, които съответстват на Вашия бизнес контекст и стандарти

GPT‑6 Astra също така прилага по-добра визуална преценка при създаването на уебсайтове, игри, приложения и визуализации. Със Sites⁠(отваря се в нов прозорец) в ChatGPT Astra може да създава, хоства и споделя уебсайтове, уеб приложения и игри директно от подкана.

„Astra ни дава значително предимство както по отношение на възможностите, така и на ефективността. Той успешно изпълнява най-сложните ни творчески работни процеси, като използва с до 20% по-малко токени от другите модели, които сме тествали. Най-важното е, че за нашите клиенти това означава по-качествени резултати.“
Алекс Машрабов, главен изпълнителен директор и съосновател, Higgsfield AI

Когато инструкциите оставят място за интерпретация, GPT‑6 Astra се справя по-добре от предишните модели при вземането на правилното решение. Моделът използва контекста, за да попълва обичайни пропуски, и задава конкретни въпроси, когато отговорът може да промени резултата. В Codex може да задава въпроси асинхронно, като същевременно продължава работата, която не зависи от Вашия отговор. Ако не отговорите, той продължава с разумни предположения, когато е уместно, но изчаква Вашите указания при решения със съществени последици.

Примерите по-долу показват как Astra сътрудничи при ежедневни задачи, при които липсващата информация може съществено да промени отговора.

Astra също се справя по-добре с това да запазва ориентация, докато задачата се развива. При по-ранните модели понякога съобщенията за насочване се възприемаха като нова цел, в резултат на което моделът губеше от поглед първоначалната заявка или по-ранните ограничения. Astra включва новите изисквания, променя посоката на действие при поискване и отговаря на странични въпроси, без да изоставя основната задача.

„Astra представлява значително подобрение в качеството спрямо GPT‑5.6 Sol при сложни правни задачи. При първоначалните ни тестове Astra се открои с това, че подхожда към юридическата работа по начина, по който би го направил опитен и проницателен адвокат: разграничава документите от установените записи, извежда на преден план откроява необоснованите предположения и превръща липсващата информация в конкретни позиции при изготвянето на документи.”
Нико Групен, ръководител „Приложни изследвания“, Harvey

Програмиране

GPT‑6 Astra е най-добрият модел за софтуерно инженерство до момента.

1 от 2
„GPT‑6 Astra демонстрира водещи резултати на нашите вътрешни бенчмаркове за кодиране и показва ясно подобрение при оценките на интуицията за търговия в сравнение с GPT‑5.6 Sol. Когато се използва за агентно кодиране, GPT‑6 Astra комуникира по начин, който е по-лесен за проследяване от разработчиците, и създава код, който изисква по-малко итерации, за да достигне продукционно качество.“
Джон Крепеци, „AI асистенти“, Jane Street

С Astra въвеждаме нов начин Codex да запазва и извлича контекст, когато контекстният прозорец се запълни. Досега моделите са използвали сбиване, за да обобщават извършената работа по време на дълги сесии, например при отстраняване на сложни проблеми или при работа по мащабни рефакторирания. При всяко сбиване могат да бъдат пропуснати подробности за причините, поради които дадена корекция не е работила, или за поведението на даден компонент. В Codex Astra може да съхранява бележки между отделните контекстни прозорци, като запазва натрупаните подробности, без многократно да ги компресира в едно обобщение. По-ранните контекстни прозорци остават достъпни за търсене, така че Astra може да намира изисквания или резултати от тестове от предишни съобщения и изходни данни от инструменти – дори ако тази информация не е била включена в бележките му. Можете да активирате тази експериментална функция във Вашия Codex config.toml,⁠(отваря се в нов прозорец) а през следващите седмици тя ще стане настройка по подразбиране за Astra.

Ускоряване на научните открития

„Историята е следната: краят на една епоха и началото на друга.“
Грег Бърнам, EpochAI

GPT‑6 Astra представлява значителен напредък в научните открития, математиката и здравеопазването. Днес споделяме още два резултата относно интервалите между простите числа.9, 10

Astra също така поставя нови рекорди в цял набор от оценки в областта на математиката и науката.

Astra може да помага с практическата работа, която стои зад научните открития. Като съчетава научното структурирано анализиране с използването на компютър, моделът може да работи директно със специализиран софтуер, за да изследва данни и да анализира резултати, като помага на изследователите да оценяват доказателствата и да решават какво да проучат след това.

Киберсигурност

Както обсъдихме в нашата актуализация относно безопасността⁠, Astra представлява качествен скок в способностите за киберсигурност и достига критичния праг в киберсигурността съгласно нашата Рамка за готовност. Способността на модела да идентифицира и разработва експлойти от типа „нулев ден“ може да помогне на защитниците да откриват и отстраняват уязвимости, но същевременно създава необходимост от по-строги предпазни мерки. За да разберем докъде се простират тези способности, подложихме Astra на вътрешни експертни оценки и оценки от трети страни.

Първо тествахме модела без предпазни мерки за продукционна среда с ExploitBench и ExploitGym, които оценяват дали моделите могат да превръщат известни софтуерни уязвимости в работещи експлойти. В ExploitBench Astra постигна максимален резултат от 100% в сравнение със 78,5% за GPT‑5.6 Sol, нашия предишен авангарден модел с възможности в областта на киберсигурността. В ExploitGym Astra постигна 42,4% успеваемост в сравнение с 30,3% за GPT‑5.6 Sol, като използва значително по-малко изходни токени.13

Предвид опасенията, че излагането на исторически софтуерни уязвимости може да е повлияло на резултатите от бенчмарковете, оценихме Astra и по два нови бенчмарка. За единия създадохме вътрешна оценка „ExploitBench (юни–август 2026 г.)“, за да тестваме разработването на експлойти с помощта на уязвимости от предходните три месеца.14 Astra постигна значително по-висок процент на успешно изпълнение на произволен код от GPT‑5.6 Sol при този набор от данни, като същевременно използва значително по-малко изходни токени. По време на оценката Astra дори откри и използва две неизвестни досега уязвимости от тип „нулев ден“. Уведомяваме поддържащите екипи на съответните продукти и за двете уязвимости.

Тествахме Astra и със SRE-Bench15, бенчмарк, който измерва дали моделите могат да извършват обратно инженерство на двоичен софтуер, за да разберат основната му логика без достъп до необработения изходен код. Astra реши 88,0% от задачите с един опит и 99,2% в рамките на четири опита в сравнение съответно с 55,9% и 68,7% за GPT‑5.6 Sol.

Освен при бенчмарковете, оценки, проведени от експерти, установиха, че Astra, когато работи без мерки за защита в продукционна среда, може да използва неизвестни досега уязвимости за изпълнение на произволен код в защитени браузъри и за създаване на експлойти за повишаване на привилегиите в защитени операционни системи.

Както обсъдихме в публикацията „Прозорецът на защитника“, авангардните способности в областта на киберсигурността могат да помогнат на защитниците да откриват уязвимостите по-бързо, но също така улесняват експлоатирането на тези уязвимости, което прави още по-неотложно адаптирането на защитниците. С версията на Astra, която стартира днес, защитниците могат да я използват за изпълнение на задачи като преглед на кода за сигурност и прилагане на корекции.

Astra обаче ще отказва да изпълнява по-усъвършенствани задачи в областта на киберсигурността, като например създаване на експлойти с доказателствена цел за уязвимости. Чрез OpenAI Daybreak⁠ планираме да разширим достъпа и да въведем по-малко ограничаващи предпазни механизми. Това ще даде възможност за повече защитни работни процеси, включително валидиране на уязвимости и доказателства за концепция, анализ на зловреден софтуер и разработване на механизми за откриване.

Също така засилихме защитите си срещу потенциална злоупотреба в областта на киберсигурността, като надградихме набора от предпазни мерки за GPT‑5.6 Sol. Те включват по-голяма устойчивост на модела, за да издържа по-добре на потенциални джейлбрейк атаки, както и повече контекст за системите ни за мониторинг. Продължихме строгото вътрешно и външно тестване, включително автоматизирани оценки с нашите вътрешния ни червен отбор атакуващи. Повече подробности за нашите предпазни мерки в областта на киберсигурността и тестването са налични в прегледа на безопасността⁠ и картата на системата⁠(отваря се в нов прозорец) на Astra.

Отговорно съгласуване и внедряване на GPT‑6 Astra

Astra е най-добре съгласуваният ни модел. Astra се отличава със способността си да проявява предпазливост, да спазва рамките на задачата и да комуникира прозрачно. Тази разработка е най-новият резултат от дългогодишната ни изследователска програма, насочена към обучението на модели, които остават съобразени с човешките намерения от началото до края.

В чувствителни среди Astra действа с предпазливост, съответстваща на риска. При оценяване на задачи за използване на компютър, подбрани по начин, целящ да провокира неправомерно поведение, Astra постигна по-голям успех в избягването на непредвидени последици. Изпълнението с допълнителните мерки за сигурност, предлагани по подразбиране, доведе до още по-добри резултати.

Astra води до по-малко резултати, несъответстващи на намеренията, от всички други тествани авангардни модели. За справедливо сравнение използвахме обща рамка за използващ компютър агент (базирана на вградените инструменти за използване на компютър, налични както в OpenAI Responses API⁠(отваря се в нов прозорец), така и в Anthropic Messages API⁠(отваря се в нов прозорец)) и без допълнителни защити, които обикновено се внедряват за потребителите на Codex и ChatGPT Work (Auto-review, политика за потвърждение).

Моделът Astra също така е по-склонен да работи в рамките на ограниченията, зададени от потребителя и подразбиращи се от средата му. При вътрешна оценка Astra нито веднъж не прави опит да заобиколи отказ на Codex Auto-review. Това остава в сила дори когато Auto-review е бил умишлено конфигуриран така, че да може да бъде заобиколен, а задачата е била невъзможна за изпълнение по друг начин. Това съобразяване с ограниченията на средата е в съответствие с резултатите от оценяването ни на невъзможни киберзадачи, които споделихме във въведението към тази публикация, както и с други констатации, документирани в карта на системата⁠(отваря се в нов прозорец).

Astra поставя нови рекорди и по отношение на прозрачната комуникация с потребителите. При една от оценките вероятността Astra да представи неточно своите възможности и функции е три пъти по-малка в сравнение с GPT‑5.6 Sol.

В нашата оценка за халюцинации относно способностите Astra показва значително подобрение спрямо GPT‑5.6 Sol, като прави по-малко подвеждащи твърдения за своите способности.

Резултатите от оценяването ни показаха, че писмените разсъждения на Astra са по-трудни за наблюдение от тези на GPT‑5.6 Sol, въз основа на тестове, при които моделът изрично е инструктиран да избегне наблюдението. Отдаваме това на по-големия контрол на Astra върху писменото структурирано анализиране при по-прости задачи и на способността ѝ да решава проблеми с по-малко писмени стъпки. Изглежда, че Astra все още изпитва затруднения да прикрива структурираното анализиране, необходимо за сложни задачи, но приемаме този спад сериозно. Подобряването на наблюдаемостта остава приоритет на научните изследвания, а придружаващата карта на системата⁠(отваря се в нов прозорец) описва подробно нашите констатации и текущата ни работа.

Обучението за съгласуване е в основата на нашия подход към внедряването. Като допълнителен слой на защита изграждаме и системни предпазни мерки като Codex Auto-review⁠(отваря се в нов прозорец) и наблюдение на структурирано анализиране и действията на агентите, за да подпомогнем откриването и ограничаването на опасно поведение. Както е описано в нашата актуализация относно безопасността⁠, внедряваме и наблюдение за несъгласуваност в производствена среда за модели от класа на Astra, за да имаме видимост върху несъгласуваността и да подпомагаме ограничаването на най-тежките му прояви. Тези защитни мерки наподобяват наблюдението при вътрешните ни внедрявания и включват система от класификатори, които проверяват структурираното анализиране и действията на модела за неразрешено поведение и автоматично спират потенциално неразрешена дейност.

Предвид значителното подобряване на способностите на Astra в областта на киберсигурността, полагаме значителни усилия това внедряване да бъде безопасно и сигурно. Допълнителните проверки за безопасност понякога могат да забавят, поставят на пауза или спрат легитимна работа, включително работа по защитна киберсигурност. Ако дадена задача бъде поставена на пауза в ChatGPT или Codex, може да бъдете помолени да прегледате действието, преди да продължите. В API задачата ще бъде спряна. Тези проверки понякога могат да прекъснат легитимна работа, като продължаваме да усъвършенстваме тази система, за да намалим ненужните прекъсвания. Наблюдението за несъгласуваност не може да замени съгласуването: целта ни е да създаваме модели, които надеждно остават в разрешения си обхват, за да не се налага тези защитни механизми да се намесват.

Наличност

GPT‑6 Astra започва да се предоставя от днес на ограничен брой организации, а през следващите дни ще стане достъпен за всички потребители на ChatGPT Plus, Pro, Business и Enterprise, както и чрез OpenAI API, Microsoft Azure и AWS Bedrock. Използването на Astra е включено в рамките на съществуващите лимити на абонаментите – потребителите и организациите ще могат да закупуват и кредити за допълнително използване. Потребителите на плановете Pro, Business и Enterprise ще получат достъп и до GPT‑6 Astra Pro. Администраторите на Enterprise могат да активират Astra за своето работно пространство; при стартирането достъпът е изключен по подразбиране.

Astra поддържа нулево задържане на данни за отговарящите на условията клиенти на API, а както споделихме миналия месец, тестваме Поверителната обработка за безопасност, за да подобрим наблюдението на безопасността, като същевременно запазваме поверителността на клиентите.

За разработчиците GPT‑6 Astra ще бъде достъпен в OpenAI API като gpt-6-astra, както и чрез Microsoft Azure и Amazon Bedrock.

Стандартната цени за OpenAI API е 10$ за един милион входни токена и 50$ за един милион изходни токена. За четене и запис в кеша се прилагат отделни тарифи. В API е наличен бърз режим за GPT‑6 Astra, който осигурява до 2 пъти по-висока скорост от стандартната обработка на два пъти по-висока цена от стандартната.

Използване на компютър

Използване на компютър

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Последният изпит за агента

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, офлайн набор, частичен резултат)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (без инструменти)

92,7%

76,9%

-

87,3%17

-

-

Професионално

Професионално

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4%

18,1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Вътрешни задачи за проектиране

50,0%

47,4%

-

35,8%

-

-

Вътрешни задачи за наука за данни

40,9%

30,5%

-

34,7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Програмиране

„Програмиране“„GPT‑6 Astra“„GPT‑5.6 Sol“„Claude Fable 5.1“„Claude Fable 5“„Claude Opus 5“„Gemini 3.8 Flash“
„Terminal-Bench 4.0“„579%“„373%“„558%“„445%“„526%“„191%“
„DeepSWE v1.1"„741%"„727%"„674%"„699%"„737%"„738%"
„FrontierCode 1.1 Extended (резултат)“„645% 8“„606%“„636%“„649%“„636%“„563%“
„FrontierCode 1.1 Основен (резултат)“„533% 8“„475%“„509%“„535%“„534%“„436%“
„Задачи за миграция на вътрешна база данни“„639%“„427%“„578%“„503%“„-“„-“
„Artificial Analysis Coding Agent Index v1.4“„670“„651“„-“„672“„681“„612“

Академично

Академично

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21,4%

30,0%

-

FrontierMath ниво 4 (v2)

97,6%

83,0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94.6%

93,7%

92,6%

93,7%

95,3%

Humanity's Last Exam (с инструменти)

57,2%

-

65,0%

63,8%

63,6%

-

Наука и здравеопазване

„Наука и здраве“„GPT‑6 Astra“„GPT‑5.6 Sol“„Claude Fable 5.1“„Claude Fable 5“„Claude Opus 5“„Gemini 3.8 Flash“
„GeneBench Pro“„371%“„323%“„-“„-“„-“„-“
„MedChemBench (вътрешен)“„493%“„474%“„-“„-“„-“„-“
„LifeSciBench“„603%“„599%“„-“„-“„-“„-“
„HealthBench Professional (с корекция според дължината)“„634%“„605%“„581% 11“„609% 11“„564% 11“„521%“

Киберсигурност

„Киберсигурност“„GPT‑6 Astra“„GPT‑5.6 Sol“„Claude Fable 5.1“„Claude Fable 5“„Claude Opus 5“„Gemini 3.8 Flash“
„ExploitBench“„1000%“„785%“„-“„-“„70%“„-“
„ExploitGym“„42.4% 13“„30.3% 13“„304% 17“„284%17“„220%“„-“
„ExploitBench (юни–август 2026 г.)“„390%“„55%“„-“„-“„-“„-“
„SRE-Bench“„880%“„559%“„-“„-“„125%“„-“
„SEC-Bench Pro“„854%“„791%“„-“„-“„-“„-“

Съгласуваност

Съгласуваност

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Вътрешен бенчмарк за безопасност при използване на компютър (по-ниската стойност е по-добра)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Вътрешен бенчмарк за безопасност при използване на компютър, с Auto-review (по-ниската стойност е по-добра)

1,8%

4,3%

-

-

-

-

Вътрешен бенчмарк за заобикаляне (по-ниската стойност е по-добра)

0,00%

0,29%

-

-

-

-

Honeypot в ExploitGym (по-ниската стойност е по-добра)

0,0%

48,2%

-

-

-

-

Impossible ExploitGym

100,0%

-

-

-

-

-

Вътрешен бенчмарк за халюцинации (по-ниската стойност е по-добра)

4,2%

12,2%

-

-

-

-

Дълъг контекст

Дълъг контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Абстрактно разсъждаване

„Абстрактно структурирано анализиране“„GPT‑6 Astra“„GPT‑5.6 Sol“„Claude Fable 5.1“„Claude Fable 5“„Claude Opus 5“„Gemini 3.8 Flash“
„ARC-AGI-3“„999% 1“„7.8%“„-“„-“„302%“„-“
„ARC-AGI-2“„950%“„925%“„900%“„892%“„904%“„-“
„ARC-AGI-1“„985%“„975%“„975%“„985%“„975%“„-“

Резултатите от оценките са максимални при всяко ниво на усилие. Оценките на GPT са проведени в нашата изследователска среда или чрез нашия API, което може да доведе до малко по-различен резултат в сравнение с ChatGPT в продукционна среда поради различия в системните подкани, наличните инструменти и др.

БЕЛЕЖКИ ПОД ЛИНИЯ

  1. 1

    При ARC-AGI-3 GPT-6 Astra беше изпълнен с нашата рамка за Responses API⁠, която променя две настройки, за да отрази по-добре производителността в реални условия. Промените не са насочени конкретно към ARC-AGI-3.

  2. 2

    GPT-5.6 Sol се отнася до версията, налична в нашия API, ChatGPT Codex и ChatGPT Work. Версията в Chat в ChatGPT е малко по-различна.⁠

  3. 3

    OSWorld V2-Offline е подмножество на оригиналния OSWorld V2, което работи без достъп до интернет. Резултатите на модела Claude в OSWorld-V2 Offline са възпроизведени от авторите в официалната класация⁠(отваря се в нов прозорец). В OSWorld 2.0 резултатите за Claude използват официалните настройки, а не модифицираните задачи и модифицираното оценяване от картата на системата на Fable 5.1.

  4. 4

    Времената на моделите са отчетените изминали времена за съответните демонстрационни изпълнения. Показаните видеоклипове са редактирани откъси.

  5. 5

    В BenchCAD резултатите на Claude отразяват 3 промени в оценката, описани подробно в картата на системата на Fable 5.1⁠(отваря се в нов прозорец).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(отваря се в нов прозорец).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus⁠(отваря се в нов прозорец).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, стр. 49–57. ACM, 2023.

  8. 8

    При FrontierCode GPT-6 Astra беше изпълнен със съобщение на разработчика, подобно на раздел от неговото съобщение за разработчика в Codex⁠(отваря се в нов прозорец): „Избягвайте създаването на прекалено много тестови файлове. Създавайте нов тестов файл само когато това се изисква от конвенциите на хранилището или когато няма подходящ съществуващ файл. Избягвайте несвързано почистване и ненужна сложност. Използвайте повторно подходящи съществуващи помощни програми. Прочетете съответните инструкции за хранилището и прегледайте близкия код, тестовете, документацията и CI. Спазвайте утвърдените конвенции. Целта е кодът да бъде чист и подходящ за сливане." Подканата не е била оптимизирана за оценката.

  9. 9

    Първата се отнася до това колко близо едно до друго могат да се срещат простите числа, независимо колко далеч по числовата ос. Повече от десетилетие най-добрият известен резултат установяваше, че съществуват безкрайно много двойки последователни прости числа, с интервал от най-много 246 помежду им. Джулия Щадълман⁠(отваря се в нов прозорец) наскоро подобри тази граница до 240. Astra помогна да бъде установена по-добра горна граница от 186, показвайки, че има безкрайно много двойки, разположени на това по-малко разстояние. Кратки интервали между прости числа: доказателство⁠(отваря се в нов прозорец) и допълнителни изследвания⁠(отваря се в нов прозорец).

  10. 10

    Втората се отнася до необичайно големите интервали между прости числа. Astra подобри един член в границата за тези интервали, който не беше променян повече от 80 години. Споделяме доказателствата, съкратената версия на логическото мислене и материалите за проверка и на двата резултата. Големи интервали между прости числа: доказателство⁠(отваря се в нов прозорец) и допълнителни изследвания⁠(отваря се в нов прозорец).

  11. 11

    Извършихме независима оценка на всички модели Claude съгласно предвидената процедура за HealthBench Professional, като бяха използвани неотрязани резултати от GPT‑5.4, коригирани спрямо дължината и нормирани по скала За Fable 5.1 използвахме Opus 5 като резервен вариант при откази от страна на доставчика.

  12. 12

    Claude Fable 5 и 5.1 не са включени в LifeSciBench Gold v1, GeneBench Pro v13 и MedChemBench, тъй като отказват да отговорят на по-голямата част от въпросите в тези оценки.

  13. 13

    В ExploitGym тествахме Astra и Sol без 6-часовото времево ограничение, за да оценим по-добре пълните им кибервъзможности. Те са достатъчно бързи, така че това оказва малко влияние.

  14. 14

    ExploitBench (юни–август 2026 г.) съдържа 20 уязвимости във V8 с висока степен на сериозност в рамките на 13 стабилни версии на Chrome. Сравнителния тест проверява дали агентите могат да постигнат изпълнение на произволен код във V8 и в официалните версии на Chrome за Linux, като експлоатират всяка посочена уязвимост. Някои от включените уязвимости може да не позволяват изпълнение на произволен код в рамките на ограниченията на оценката, поради което може да не е възможна 100% успеваемост. Забележка: резултатът от 5,5% на GPT-5.6 Sol е следствие от ограничението от 300 хода в сравнителния тест, което не представлява ограничение, с което биха се сблъскали реалните клиенти, използващи Max. Моделът при сходни настройки постигна резултат от 11,5%, когато се сблъскваше с по-малко ограничения.

  15. 15
  16. 16

    Когато тестваме модели на трети страни, използваме по-опростена изследователска настройка. Codex има по-сложна конфигурация за продукционна среда, която може да доведе до различни нива на грешки на базовия модел. Предпазните механизми от страна на доставчика и реализациите на инструментите за използване на компютър също се различават. Потребителите не срещат сценария без потвърждение в Codex, тъй като това е вътрешна изследователска конфигурация.

  17. 17

    За ScreenSpot-Pro и ExploitGym резултатите на Fable, които отчитаме, са от Mythos – версия на Fable с по-малко предпазни механизми.