Нова генерација на интелигенција
Го претставуваме GPT‑6 Astra, најинтелигентниот и најусогласениот модел во светот.
GPT‑6 Astra ги обединува долгогодишните истражувања и големите вложувања во претходното обучување, зајакнувањето на учењето и усогласувањето. Astra постигнува најсовремени резултати во користење компјутер, прелистување, софтверско инженерство, сајбер-безбедност, наука и професионална работа. Astra постигнува заситување на FrontierMath ниво 4 со резултат од 98 %, откако веќе помогна да се решат долгогодишни отворени проблеми во математиката. Astra постигнува заситување и на ARC-AGI-3 со резултат од 99,9 % и на ExploitBench со резултат од 100 %. Исто така, поставува нова граница во користењето компјутер и прелистувач, справувајќи се со најсложената професионална работа со ненадмината брзина, точност и расудување.
GPT‑6 Astra се воведува денес за ограничен број организации, а во наредните денови ќе стане достапен за сите корисници на ChatGPT Plus, Pro, Business и Enterprise, како и преку OpenAI API, Microsoft Azure и AWS Bedrock.
Astra е нашиот најусогласен модел, со значителни подобрувања во разбирањето на намерата на корисниците и однесувањето на моделот - можете да делегирате задачи со поголема доверба во проценката на Astra. Како еден од начините на кои го тестираме - ова, изградивме нова евалуација, поттикната од инцидентот со Hugging Face, која оценува дали модел што се соочува со тешка или невозможна задача ќе излезе надвор од својот предвиден опсег. Во споредба со GPT‑5.6 Sol, кој без заштитни мерки во продукциска средина излегол надвор од одобрената цел во 48 % од случаите, GPT‑6 Astra го направил тоа во 0 % од случаите.
Најдобриот модел во светот за користење компјутер
GPT‑6 Astra означува нова граница во брзината, точноста и безбедноста при користење компјутер. Тоа може да се погрижи за здодевни задачи како пополнување онлајн-обрасци, ажурирање на записи за клиенти во CRM и организирање на вашиот календар. Може да спроведува истражување на интернет и да составува резимеа во вашата е-пошта или во вашиот уредувач на документи. Може да анализира научни податоци, да генерира графикони, да создаде веб-страница и да извршува проверки за обезбедување квалитет на фронтендот за да се увери дека работат сите функции на таа страница. Може да ви помогне со автономно инсталирање и тестирање софтвер, како и со решавање проблеми што ги гледате на екранот. Овие подобрувања се одразуваат и во нашите најсовремени резултати од евалуацијата.
Овие подобрувања, исто така, резултираат со значителни подобрувања на ефикасноста во реални задачи за работа со знаење. Во симулации на доцнење на OSWorld 2.0, Astra постигнува подобри перформанси при користење компјутер за околу 47 % помалку време по задача во споредба со GPT‑5.6 Sol, со резултат од 72,6 % за приближно 40 минути по задача, во споредба со 65,7 % за приближно 75 минути.3
Способностите на GPT‑6 Astra за користење компјутер можат да се видат во резултатите во различни домени, вклучувајќи развој на игри, електротехника и секојдневна интелектуална работа:
Покрај Astra, ја ажурираме и рамката Codex за значително да ја подобриме брзината на користење компјутер. Во комбинација со ефикасноста на Astra, ова овозможува завршување на задачите 1,9 пати побрзо во споредба со тековното искуство со GPT‑5.6 Sol на реперот Mind2Web. Подобрувањата на моделот во брзината значат дека тој може да преземе многу задачи од секојдневниот живот што ви одземаат многу време, побрзо отколку што можете вие.
Суштинска промена во професионалната работа
GPT‑6 Astra ги комбинира напредокот во користењето компјутер со насочена обука за професионални средини, за да помогне во справувањето со сложени работни задачи. Комбинира интелигенција потребна за сложени проблеми со способноста за извршување работни текови во повеќе чекори и креирање професионално уредени документи, електронски табели и презентации.
GPT‑6 Astra е нашиот најдобар модел за следење постојни шаблони и создавање добро распоредени слајдови што концизно ги пренесуваат клучните точки преку структуриран наратив. Создава јасни, добро структурирани документи, презентации, табеларни пресметки и анализи што ги следат вашите шаблони и се совпаѓаат со вашиот стил на пишување и визуелен стил. Astra е исто така обучена конкретно да го вклучува во излезните резултати само релевантниот контекст, наместо да повторува информации што се непотребни за тековната задача. Сето ова значи дека може да генерира артефакти што се попогодни за непосредна употреба и што одговараат на вашиот деловен контекст и стандарди.
GPT‑6 Astra исто така применува подобра визуелна проценка при креирањето веб-страници, игри, апликации и визуелизации. Со Sites(се отвора во нов прозорец) во ChatGPT, Astra може да креира, хостира и споделува веб-страници, веб-апликации и игри директно од промпт.
Кога инструкциите оставаат простор за толкување, GPT‑6 Astra е подобар од претходните модели во донесувањето на правилната одлука. Го користи контекстот за да ги пополни вообичаените празнини и поставува насочени прашања кога одговорот би можел да го промени исходот. Во Codex, може асинхроно да поставува прашања додека продолжува да работи на задачи што не зависат од вашиот одговор. Ако не одговорите, продолжува со разумни претпоставки онаму каде што е соодветно, но го чека вашето мислење за одлуки со значителни последици.
Примерите подолу прикажуваат како Astra соработува при секојдневни задачи каде што недостигот на информации може значително да го промени одговорот.
Astra, исто така, подобро ја задржува ориентацијата како што се развива задачата. Претходните модели понекогаш ги третираа пораките за насочување како нова цел, губејќи го од вид првичното барање или претходните ограничувања. Astra вклучува нови барања, ја менува насоката кога тоа ќе се побара и одговара на споредни прашања без да ја занемари пошироката задача.
Coding
GPT‑6 Astra е најдобриот модел за софтверско инженерство досега.
„GPT‑6 Astra обезбедува врвни перформанси на нашите внатрешни репери за кодирање и покажува јасен исчекор во евалуациите на интуицијата за тргување во споредба со GPT‑5.6 Sol. Кога се користи за кодирање со агент, GPT‑6 Astra комуницира на начин што програмерите полесно го следат и генерира код што бара помалку итерации за да достигне квалитет за продукција.“
„Ја тестиравме Astra со низок, среден и висок напор на една од нашите евалуации од првата генерација и таа се покажа значително подобра од GPT 5.6 Sol. Поголемиот напор овозможува повеќе повторувања при нова изработка, повеќе проверка преку тестирање во прелистувач и поголема наклонетост кон извршување код наместо применување закрпа. Разбирањето на тоа како моделот го троши својот напор е начинот на кој им овозможуваме на милиони креатори побрз и посигурен пат од идеја до функционална апликација.“
Со Astra воведуваме нов начин Codex да зачувува и повторно да пронаоѓа контекст кога ќе се пополни прозорецот за контекст. Историски гледано, моделите користеле компакција за да ја reziмираат работата во текот на долги сесии, на пример при отстранување грешки од сложени проблеми или при справување со големи реструктурирања. При секоја компакција може да се изостават детали за тоа зошто не успеала некоја поправка или како функционира некоја компонента. Во Codex, Astra може да води белешки во повеќе прозорци за контекст, зачувувајќи ги насобраните детали без постојано да ги компресира во едно резиме. Претходните прозорци за контекст и понатаму можат да се пребаруваат, па Astra може да најде барања или резултати од тестови од претходни пораки и излези од алатки - дури и ако тие информации не биле опфатени во нејзините белешки. Можеш да ја овозможиш оваа експериментална функција во твојата config.toml-датотека за Codex,(се отвора во нов прозорец) и ќе стане стандардно за Astra во наредните недели.
Унапредување на научните откритија
GPT‑6 Astra претставува значаен напредок за научните откритија, математиката и здравството. Денес споделуваме уште два резултата за растојанијата меѓу простите броеви [WITH LINK]. Astra исто така поставува нови рекорди во низа научни евалуации:
Astra може да помогне со практичната работа што стои зад научните откритија. Со комбинирање на научно расудување и користење компјутер, може директно да работи во специјализиран софтвер за да ги прегледува податоците и да ги истражува резултатите, помагајќи им на истражувачите да ги проценат доказите и да одлучат што следно да истражуваат.
Сајбербезбедност
Astra претставува значителен исчекор во способностите за сајбер-безбедност. Неговата способност да идентификува и развива zero-day експлоити може да им помогне на бранителите да ги закрпат слабостите, но истовремено создава и потреба од посилни заштитни мерки. За да разбереме до каде се протегаат овие способности, користевме интерни експертски евалуации и експертски евалуации од трети лица.
Прво ја тестиравме Astra на ExploitBench и ExploitGym, кои мерат дали моделите можат да постигнат извршување на произволен код во ранливи кодни бази.
Со оглед на можните загрижености дека изложеноста на историски софтверски ранливости можеби влијаела врз резултатите од реперите, ја евалуиравме Astra и на два нови репери. Како прво, изградивме интерна евалуација „ExploitBench (јуни–август 2026)“ за тестирање на развојот на експлоити користејќи ранливости од претходните три месеци. 2 Astra постигна значително повисоки стапки на произволно извршување на код од GPT‑5.6 Sol на овој збир на податоци, притоа користејќи многу помалку излезни токени. За време на евалуацијата, Astra откри и искористи две претходно непознати техники за излегување од изолираната средина на купот на Chrome V8. Ги објавивме двете ранливости на нивните одржувачи.
Го тестиравме и Astra на SRE-Bench, репер што мери дали моделите можат преку обратно инженерство да го анализираат бинарниот софтвер за да ја разберат неговата основна логика. Авторите на реперот го создадоа софтверот од нула и го чуваа изворниот код во тајност. Astra реши 88,0 % од задачите со еден обид и 99,2 % со најмногу четири обиди, во споредба со 55,9 % и 68,7 % за GPT‑5.6 Sol, соодветно.
Покрај реперите, проценките предводени од експерти утврдија дека Astra може да искористи претходно непознати ранливости за да постигне извршување на произволен код во зајакнати прелистувачи и да создава експлоити за ескалација на привилегии за зајакнати оперативни системи. Кога ќе се земат предвид заедно, овие резултати нè наведоа да одлучиме дека Astra го достигнала критичниот праг во сајбер-безбедноста според нашата Рамка за подготвеност.
Како што разговаравме во Прозорецот на бранителот, граничните сајбер-способности можат да им помогнат на бранителите побрзо да пронаоѓаат слабости, но исто така го олеснуваат искористувањето на тие слабости, зголемувајќи ја итноста за бранителите да се приспособат.
За верзијата на Astra што се лансира денес, поддржуваме важни одбранбени задачи, како што се безбедносна ревизија на код, примена на закрпи и моделирање закани. Меѓутоа, стандардно, Astra ќе одбие да извршува напредни задачи од областа на сајбер-безбедноста, како што е откривање експлоити. Преку OpenAI Daybreak, воведуваме воведуваме помалку ограничен пристап за алфа-група доверливи бранители на сајбер-безбедноста во програмата OpenAI Daybreak. Ова го проширува пристапот до одбранбени работни текови, вклучувајќи тријажа и валидација на ранливости, анализа на малициозен софтвер, инженерство за детекција и валидација на закрпи. Планираме дополнително да го прошириме пристапот преку Daybreak Blue.
Исто така, ги зајакнавме нашите заштити од потенцијална сајбер-злоупотреба, надоврзувајќи се на нашиот слој на заштитни мерки за GPT‑5.6 Sol. Тие вклучуваат посилна обука за отпорноста на моделот за подобро да издржи потенцијални пробивања и повеќе контекст за нашите системи за следење. Продолживме со ригорозно внатрешно и надворешно тестирање, вклучително и автоматизирани тестови со нашите внатрешни напаѓачи за тестирање на отпорноста. Повеќе детали за нашите сајбер заштитни мерки и тестирање се достапни во системската картичка за Astra и на нашиот блог.
Одговорно усогласување и воведување на GPT‑6 Astra
Astra е нашиот најусогласен модел. Astra се истакнува во внимателното постапување, почитувањето на границите на задачите и транспарентната комуникација. Оваа работа е најновиот резултат од нашата долгогодишна истражувачка програма, насочена кон обучување модели што остануваат усогласени со човечката намера од почеток до крај.
Во чувствителни средини, Astra постапува внимателно, соодветно на ризикот. Во евалуација на задачи за користење компјутер, намерно избрани за да предизвикаат несоодветно однесување, Astra покажа поголем успех во избегнувањето на ненамерни последици. Извршувањето со дополнителните безбедносни мерки што се нудат по подразбирање резултираше со уште подобри перформанси.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(се отвора во нов прозорец) and Anthropic Messages API(се отвора во нов прозорец)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Исто така, поголема е веројатноста Astra да дејствува во рамките на ограничувањата поставени од корисникот и оние што произлегуваат од нејзиното опкружување. Во внатрешна евалуација, Astra никогаш не се обиде да заобиколи одбивање од автоматскиот преглед на Codex. Ова важеше дури и кога функцијата Auto-review беше намерно конфигурирана да може да се заобиколи, а задачата беше невозможно да се заврши на друг начин. Ова почитување на ограничувањата на околината е во согласност со резултатите од нашата евалуација на невозможни сајбер-задачи, што ги споделивме во воведот на оваа објава, како и со други наоди документирани во нашата системска картичка(се отвора во нов прозорец).
Astra исто така покажува значително намалување на измамничкото однесување. На луѓето што делегираат работа им треба јасно разбирање на способностите на моделот и искрено известување за неговиот напредок. Ова мери еден аспект на искреноста; намалувањето на намерната измама останува поширок фокус на нашата работа на усогласување.
Во нашата евалуација на халуцинации поврзани со способностите, Astra покажува значително подобрување во однос на GPT‑5.6 Sol, изнесувајќи помалку заблудувачки тврдења за своите способности.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(се отвора во нов прозорец) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(се отвора во нов прозорец) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Достапност
GPT‑6 Astra се воведува денес за претпријатија и клиенти во нашата Програма за доверлив пристап, а во следните неколку дена ќе стане широко достапен за луѓето што се претплатени на ChatGPT Plus, Pro, Business и Enterprise. Користењето на Astra е вклучено во постојното ограничување за користење во плановите Pro од 100 американски долари и 200 американски долари и во планот Business од 100 американски долари, без дополнителни ограничувања на брзината или ограничувања. Луѓето со претплата Plus од 20 американски долари и клиентите на стандардниот план Business можат да пристапат до GPT‑6 Astra со пониски ограничувања, со можност да купат кредити за дополнителен пристап. Администраторите на Enterprise може да овозможат Astra за својот работен простор; пристапот е стандардно исклучен при лансирањето.
Корисниците на Pro Lite, Pro, Business и Enterprise можат да користат и GPT‑6 Astra во Разговор. Astra поддржува нула задржување на податоци за API-клиентите кои ги исполнуваат условите и, како што споделивме минатиот месец, тестираме Приватна безбедносна обработка за да го зајакнеме следењето на безбедноста, притоа зачувувајќи ја приватноста на клиентите.
За развивачи на софтвер, GPT‑6 Astra е достапен во OpenAI API како gpt-6-astra и е достапен во AWS Bedrock. Стандардната цена за OpenAI API е $10 за милион влезни токени и $50 за милион излезни токени. За читањето од кеш-меморијата и запишувањето во кеш-меморијата се применуваат посебни цени. „Брз режим“ е достапен за GPT‑6 Astra во API и обезбедува до 2,5 пати поголема брзина од стандардната обработка, по двојно повисока од стандардната цена.
Користење компјутер
| Користење компјутер | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| OSWorld 2.0 (августовско издание, делумен резултат) | - | - | - | 66,1 % | 70,6 % | - |
| OSWorld 2.0 (издание од август, офлајн подгрупа, делумен резултат) | - | - | - | - | - | - |
| ScreenSpot Pro | 92,6 % | 76,8 % | - | - | - | - |
| BrowseComp | 92,1 % | 90,4 % | - | 87,4 % | 90,8 % | - |
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Наука и здравје
| Наука и здравје | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| GeneBench Pro | 37,1 % | 32,3 % | - | - | - | - |
| MedChemBench (интерно) | 49,7 % | 47,4 % | - | - | - | - |
| LifeSci Bench | 60,8% | 59,9 % | - | - | - | - |
| HealthBench Professional (прилагодено според должината) | 63,4 % | 60,5 % | 62,1 % | 60,9 % | 59,8 % | 48,7 % |
Сајбербезбедност
| Сајбербезбедност | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| CVE-Bench | - | 94,1 % | - | - | - | - |
| Предизвици за Capture-the-Flag | - | 96,7% | - | - | - | - |
| SEC-Bench Pro | 85.4% | 79,1 % | - | - | - | - |
| CyberGym | - | 84,5 % | - | - | - | - |
| ExploitBench | 100,0% | 78,5 % | - | - | 70,0 % | - |
| ExploitGym (2 часа) | - | 33,7 %? | - | - | 171 | - |
| ExploitGym (6 часа) | - | 33,7 %? | - | - | 191 | - |
Усогласеност
Усогласеност | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Интерен репер за безбедност при користење компјутер (помалку е подобро) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Внатрешен репер за безбедност при користење компјутер, со AutoReview (понизок е подобар) | 1,8 % | 4,3 % | - | - | - | - |
Внатрешен репер за заобиколување (понизок е подобар) | 0,00 % | 0,29 % | - | - | - | - |
ExploitGym honeypot (помалку е подобро) | 0,0 % | 48,2 % | - | - | - | - |
Невозможен ExploitGym | 100,0% | - | - | - | - | - |
Интерен репер за халуцинации (понизок е подобар) | 4,2 % | 12,2 % | - | - | - | - |
Долг контекст
Долг контекст | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-игли 256 илјади – 512 илјади | 100,0% | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8 игли 512 илјади - 1 милион | 96,3% | 73,8 % | - | - | - | - |
Апстрактно расудување
| Апстрактно расудување | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| ARC-AGI-3 | 99,9 % | 7,8 % | - | - | 30,2 % | - |
| ARC-AGI-2 | 95,0 % | 92,5 % | 90,0% | 89,2 % | 90,4 % | 84,6 % |
| ARC-AGI-1 | 98,5 % | 97,5 % | 97,5 % | 98,5 % | 97,5 % | 95,5 % |
Оценките од евалуацијата се максимални при каков било напор. Евалуациите на GPT беа извршени во нашата истражувачка средина или преку нашето API, што може да даде малку поинаков резултат од производната верзија на ChatGPT поради разликите во системските промптови, достапните алатки итн.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(се отвора во нов прозорец). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(се отвора во нов прозорец).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(се отвора во нов прозорец).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(се отвора во нов прозорец).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(се отвора во нов прозорец): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(се отвора во нов прозорец) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(се отвора во нов прозорец) and supporting research(се отвора во нов прозорец).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(се отвора во нов прозорец) and supporting research(се отвора во нов прозорец).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(се отвора во нов прозорец).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
