Ný kynslóð greindar
Við kynnum GPT‑6 Astra, gáfaðasta og best samstillta líkan heims.
GPT‑6 Astra sameinar margra ára rannsóknir og stórar fjárfestingar í forþjálfun, styrkingarnámi og samræmingu. Astra er framúrskarandi í tölvunotkun, vöfrun, hugbúnaðarverkfræði, netöryggi, vísindum og faglegri vinnu. Astra nær nánast hámarki á FrontierMath Tier 4 með 98% einkunn, eftir að hafa þegar hjálpað til við að leysa lengi óleyst vandamál í stærðfræði. Astra nær einnig 99,9% árangri í ARC-AGI-3 og 100% árangri í ExploitBench. Það setur einnig nýtt háþróað í notkun tölva og vafra og annast krefjandi fagleg störf með óviðjafnanlegum hraða, nákvæmni og dómgreind.
GPT‑6 Astra verður í boði í dag fyrir takmarkaðan hóp stofnana og verður á næstu dögum aðgengilegt öllum notendum ChatGPT Plus, Pro, Business og Enterprise, sem og í gegnum OpenAI API, Microsoft Azure og AWS Bedrock.
Astra er samræmdasta líkan okkar, með verulegum umbótum í skilningi á ásetningi notanda og hegðun líkans – þú getur falið Astra verkefni með meira trausti á dómgreind þess. Sem eina leið til að prófa þetta þróuðum við nýtt mat með hliðsjón af Hugging Face-atvikinu sem metur hvort líkan sem stendur frammi fyrir erfiðu eða ómögulegu verkefni fari út fyrir fyrirhugað verksvið sitt. Samanborið við GPT‑5.6 Sol, sem án rekstrarvarna fór út fyrir heimilað markmið í 48% tilvika, gerði GPT‑6 Astra það í 0% tilvika.
Besta líkan heimsins fyrir tölvunotkun
GPT‑6 Astra markar háþróað í hraða, nákvæmni og öryggi tölvunotkunar. Það getur séð um tímafrek verkefni eins og að fylla út eyðublöð á netinu, uppfæra viðskiptavinaskrár í CRM-kerfi og skipuleggja dagatalið þitt. Það getur stundað rannsóknir á netinu og útbúið drög að samantektum í tölvupósti þínum eða í skjalavinnsluforritinu þínu. Það getur greint vísindaleg gögn, búið til myndrit, búið til vefsvæði og keyrt QA-prófanir á framenda til að ganga úr skugga um að allir eiginleikar vefsins virki. Það getur hjálpað þér að setja upp og prófa hugbúnað sjálfstætt og leysa úr vandamálum sem þú sérð á skjánum. Þessar endurbætur endurspeglast einnig í matsniðurstöðum okkar sem eru í fremstu röð.
Þessar umbætur leiða einnig til verulegrar aukningar á skilvirkni í raunverulegum verkefnum í þekkingarvinnu. Í hermunum á biðtíma í OSWorld 2.0 nær Astra betri frammistöðu í tölvunotkun á um 47% styttri tíma á hvert verkefni en GPT‑5.6 Sol, sem skoraði 72,6% eftir um það bil 40 mínútur á hvert verkefni, samanborið við 65,7% eftir um það bil 75 mínútur.3
Tölvunotkunarhæfni GPT‑6 Astra má sjá í afurðum á ýmsum sviðum, þar á meðal í leikjaþróun, rafmagnsverkfræði og daglegri þekkingarvinnu:
Samhliða Astra uppfærum við einnig Codex-kerfið til að bæta verulega hraðann við tölvunotkun. Í samspili við skilvirkni Astra þýðir þetta 1,9 sinnum hraðari verklok samanborið við núverandi upplifun af GPT‑5.6 Sol í Mind2Web-matsviðmiðinu. Hraðaaukning líkansins þýðir að það getur sinnt mörgum tímafrekum verkefnum í daglegu lífi fyrir þig, hraðar en þú getur.
Straumhvörf í faglegum störfum
GPT‑6 Astra sameinar framfarir í tölvunotkun með markvissri þjálfun fyrir faglegt starfsumhverfi til að auðvelda úrlausn flókinna vinnuverkefna. Það sameinar greind sem þarf til að leysa flókin vandamál með getu til að framkvæma verkflæði í mörgum skrefum og útbúa fáguð skjöl, töflureikna og kynningar.
GPT‑6 Astra er besta líkanið okkar til að fylgja fyrirliggjandi sniðmátum og búa til vel uppsettar glærur sem koma lykilatriðum hnitmiðað á framfæri með skipulagðri frásögn. Það býr til skýr og vel uppbyggð skjöl, kynningar, töflureikna og greiningar sem fylgja sniðmátunum þínum og samræmast ritstíl þínum og sjónrænum stíl. Astra er einnig þjálfuð til að draga aðeins það samhengi sem skiptir máli inn í úttakið, í stað þess að endurtaka upplýsingar sem eru óþarfar fyrir verkefnið sem unnið er að. Allt þetta þýðir að það getur skilað afurðum sem eru tilbúnari til notkunar strax og passa við viðskiptasamhengi þitt og staðla.
GPT‑6 Astra veitir einnig betra sjónrænt mat við gerð vefsíðna, leikja, forrita og myndgerða. Með Sites(opnast í nýjum glugga) í ChatGPT getur Astra búið til, hýst og deilt vefsíðum, veföppum og leikjum beint út frá kvaðningu.
Þegar fyrirmæli gefa svigrúm til túlkunar er GPT‑6 Astra betra en fyrri líkön í að taka rétta ákvörðun. Það nýtir samhengi til að fylla í algengar eyður og spyr markvissra spurninga þegar svarið gæti haft áhrif á niðurstöðuna. Í Codex getur það spurt ósamstillt á meðan það heldur áfram vinnu sem er ekki háð svari þínu. Ef þú svarar ekki heldur það áfram út frá skynsamlegum forsendum eftir því sem við á, en bíður eftir svari frá þér þegar taka þarf ákvarðanir sem hafa verulegar afleiðingar.
Dæmin hér að neðan sýna hvernig Astra vinnur með þér að hversdagslegum verkefnum þar sem upplýsingar sem vantar geta breytt svarinu verulega.
Astra er einnig betri í að halda áttum eftir því sem verkefnið þróast. Fyrri líkön litu stundum á stýringarskilaboð sem nýtt markmið og misstu sjónar á upphaflegri beiðni eða fyrri skorðum. Astra tekur inn nýjar kröfur, breytir um stefnu þegar óskað er eftir því og svarar aukaspurningum án þess að missa sjónar á heildarverkefninu.
Kóðun
GPT‑6 Astra er besta líkanið fyrir hugbúnaðarverkfræði hingað til.
„GPT‑6 Astra nær framúrskarandi árangri í innri viðmiðunarprófum okkar fyrir kóðun og sýnir greinilegt framfaraskref í mati á innsæi í viðskiptum samanborið við GPT‑5.6 Sol. Þegar GPT‑6 Astra er notað fyrir fulltrúakóðun tjáir það sig með hætti sem auðveldara er fyrir forritara að fylgja og skilar kóða sem krefst færri ítrana til að ná framleiðslugæðum.“
„Við prófuðum Astra með lágu, miðlungs og miklu átaki í einu af fyrstu kynslóðar matsprófum okkar, og það stóð sig töluvert betur en GPT 5.6 Sol. Meira átak skilar fleiri endurtekningum á nýrri smíð, meiri sannprófun með vafraprófunum og meiri áherslu á keyrslu kóða frekar en apply-patch. Með því að skilja hvernig líkan nýtir átak sitt getum við veitt milljónum forritara hraðari og áreiðanlegri leið frá hugmynd að virku appi.“
Með Astra kynnum við nýja leið fyrir Codex til að varðveita og endurheimta samhengi þegar samhengisglugginn fyllist. Hingað til hafa líkön notað þjöppun til að draga saman vinnu í löngum lotum, til dæmis við villuleit að flóknum vandamálum eða við umfangsmiklar endurskipulagningar. Við hverja þjöppun geta glatast upplýsingar um hvers vegna lagfæring mistókst eða hvernig íhlutur hegðar sér. Í Codex getur Astra geymt minnispunkta milli samhengisglugga og varðveitt uppsafnaðar upplýsingar án þess að þjappa þeim ítrekað saman í eina samantekt. Fyrri samhengisgluggar eru áfram leitarhæfir, þannig að Astra getur fundið kröfur eða prófunarniðurstöður úr fyrri skilaboðum og verkfæraúttaki — jafnvel þótt þær upplýsingar hafi ekki verið skráðar í athugasemdir þess. Þú getur virkjað þennan tilraunaeiginleika í Codex config.toml-skránni þinni,(opnast í nýjum glugga) og það verður sjálfgefið fyrir Astra á næstu vikum.
Að efla vísindalegar uppgötvanir
GPT‑6 Astra er stórt framfaraskref fyrir vísindalegar uppgötvanir, stærðfræði og heilbrigðismál. Í dag deilum við tveimur frekari niðurstöðum um bilin milli frumtalna [WITH LINK]. Astra setur einnig ný met í safni vísindamatsprófa:
Astra getur aðstoðað við hagnýtu vinnuna sem liggur að baki vísindalegum uppgötvunum. Með því að sameina vísindalega rökhugsun og tölvunotkun getur það unnið beint í sérhæfðum hugbúnaði til að skoða gögn og kanna niðurstöður og þannig hjálpað rannsakendum að meta sönnunargögnin og ákveða hvað skuli rannsaka næst.
Netöryggi
Astra markar grundvallarbreytingu í netöryggisgetu. Geta þess til að bera kennsl á og þróa núlldaga-nýtingar getur hjálpað varnaraðilum að lagfæra veikleika, en hún skapar einnig þörf fyrir öflugri öryggisráðstafanir. Til að átta okkur á því hversu víðtæk þessi geta er notuðum við sérfræðimat innanhúss og frá þriðju aðilum.
Við prófuðum Astra fyrst á ExploitBench og ExploitGym, sem mæla hvort líkön geti náð fram keyrslu handahófskennds kóða í viðkvæmum kóðagrunnum.
Í ljósi mögulegra áhyggja af því að útsetning fyrir sögulegum hugbúnaðarveikleikum kunni að hafa haft áhrif á niðurstöður viðmiðunarprófa, mátum við Astra einnig á tveimur nýjum viðmiðunarprófum. Í fyrsta lagi settum við upp innra „ExploitBench (júní–ágúst 2026)“ mat til að prófa þróun misnotkunaraðferða með því að nota öryggisveikleika frá þremur mánuðunum á undan. 2 Astra náði mun hærra hlutfalli í keyrslu handahófskennds kóða en GPT‑5.6 Sol á þessu gagnasafni og notaði til þess mun færri úttakstóka. Meðan á matinu stóð uppgötvaði Astra og notaði tvær áður óþekktar aðferðir til að komast út úr V8-hrúgusandkassanum. Við erum að tilkynna báða öryggisveikleikana til viðhaldsaðila þeirra.
Við prófuðum Astra einnig á SRE-Bench, viðmiðunarprófi sem mælir hvort líkön geti baksmíðað tvíundarhugbúnað til að skilja kjarnarökfræði hans. Höfundar viðmiðunarprófsins smíðuðu hugbúnaðinn frá grunni og héldu frumkóða hans lokuðum. Astra leysti 88,0% verkefna í einni tilraun og 99,2% innan fjögurra tilrauna, samanborið við 55,9% og 68,7% fyrir GPT‑5.6 Sol, í sömu röð.
Fyrir utan viðmiðunarprófanir leiddu matsúttektir undir stjórn sérfræðinga í ljós að Astra gæti nýtt áður óþekkta veikleika til að ná fram keyrslu handahófskennds kóða í hertum vöfrum og búið til nýtingarkóða til réttindahækkunar fyrir hert stýrikerfi. Samanlagt lágu þessar niðurstöður til grundvallar ákvörðun okkar um að Astra hafi náð mikilvægum viðmiðunarmörkum í netöryggi samkvæmt undirbúningsramma okkar.
Eins og við ræddum í The Defender’s Window geta háþróaðar netvarnargetur hjálpað varnaraðilum að finna veikleika hraðar, en þær gera einnig auðveldara að nýta sér þessa veikleika, sem gerir það enn brýnna að varnaraðilar aðlagi sig.
Í útgáfu Astra sem kemur út í dag styðjum við mikilvægar varnaraðgerðir, svo sem öryggisrýni kóða, innleiðingu öryggisuppfærslna og ógnalíkanagerð. Hins vegar mun Astra sjálfgefið neita að framkvæma háþróuð netöryggisverkefni, svo sem leit að nýtingarleiðum fyrir veikleika. Í gegnum OpenAI Daybreak erum við að innleiða erum við að innleiða aðgang með færri takmörkunum fyrir alfahóp traustra varnaraðila á sviði netöryggis í OpenAI Daybreak-áætluninni. Þetta eykur aðgengi að varnarverkflæðum, þar á meðal forgangsröðun og staðfestingu veikleika, greiningu spilliforrita, greiningarverkfræði og staðfestingu plástra. Við áætlum að auka aðgengi enn frekar í gegnum Daybreak Blue.
Við höfum einnig styrkt varnir okkar gegn mögulegri misnotkun á netinu með því að byggja á varnarkerfi okkar fyrir GPT‑5.6 Sol. Þetta felur í sér öflugri þjálfun í viðnámsþoli líkana til að standast betur mögulegar tilraunir til að eiga við stýrikerfi og meira samhengi fyrir eftirlitskerfi okkar. Við höfum haldið áfram ströngum innri og ytri prófunum, þar á meðal sjálfvirkum prófunum með innri árásaraðilum í rauðteymi. Nánari upplýsingar um netvarnir okkar og prófanir eru í kerfiskorti Astra og á blogginu okkar.
Samræming og ábyrg innleiðing GPT‑6 Astra
Astra er samræmdasta líkan okkar. Astra skarar fram úr í að sýna aðgát, virða mörk verkefna og eiga gagnsæ samskipti. Þessi vinna er nýjasta afurð langvarandi rannsóknaráætlunar okkar sem beinist að því að þjálfa líkön sem eru áfram í samræmi við mannlegan ásetning frá upphafi til enda.
Í viðkvæmu umhverfi fer Astra að með varúð sem er í samræmi við þá áhættu sem um ræðir. Í mati á verkefnum í tölvunotkun, sem voru valin með andstæðingsmiðuðum hætti til að kalla fram óæskilega hegðun, náði Astra meiri árangri í að forðast ófyrirséðar afleiðingar. Keyrsla með viðbótaröryggisráðstöfunum sem eru sjálfgefnar skilaði enn betri afköstum.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(opnast í nýjum glugga) and Anthropic Messages API(opnast í nýjum glugga)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra er einnig líklegri til að starfa innan þeirra marka sem notandinn setur og sem umhverfi hennar gefur til kynna. Í innra mati reyndi Astra aldrei að komast fram hjá höfnun í sjálfvirkri yfirferð Codex. Þetta gilti jafnvel þegar sjálfvirk yfirferð hafði vísvitandi verið stillt þannig að hægt væri að sniðganga hana og ómögulegt var að ljúka verkefninu með öðrum hætti. Þessi virðing fyrir takmörkunum umhverfisins samræmist niðurstöðum úr mati okkar á ómögulegum netöryggisverkefnum, sem við deildum í inngangi þessarar færslu og öðrum niðurstöðum sem skjalfestar eru í kerfiskortinu(opnast í nýjum glugga).
Astra sýnir einnig verulega minnkun á blekkingarhegðun. Fólk sem úthlutar verkefnum þarf að hafa skýran skilning á getu líkans og fá heiðarlega upplýsingagjöf um framfarir þess. Þetta mælir einn þátt heiðarleika; að draga úr vísvitandi blekkingum er áfram víðtækari áhersla í vinnu okkar að samræmingu.
Í mati okkar á ofskynjunum um getu sýnir Astra verulegar framfarir miðað við GPT‑5.6 Sol og setur fram færri villandi fullyrðingar um eigin getu.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(opnast í nýjum glugga) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(opnast í nýjum glugga) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Aðgengi
GPT‑6 Astra verður í boði í dag fyrir fyrirtæki og viðskiptavini í Trusted Access Program okkar, og verður almennt aðgengilegt á næstu dögum fyrir fólk sem er áskrifandi að ChatGPT Plus, Pro, Business og Enterprise. Notkun Astra er innifalin í núverandi notkunarheimildum í 100 USD og 200 USD Pro-áætlunum og 100 USD Business-áætluninni, án frekari hraðatakmarkana eða takmarkana. Fólk með 20 USD Plus-áskrift og viðskiptavinir á hefðbundinni Business-áætlun geta fengið aðgang að GPT‑6 Astra með lægri mörkum, með möguleika á að kaupa inneignir fyrir viðbótaraðgang. Enterprise-stjórnendur geta virkjað Astra fyrir vinnusvæði sitt; aðgangur er sjálfgefið óvirkur við útgáfu.
Notendur Pro Lite, Pro, Business og Enterprise geta einnig notað GPT‑6 Astra í Spjall. Astra styður Engin gögn varðveitt fyrir gjaldgenga API-viðskiptavini, og eins og við sögðum frá í síðasta mánuði erum við að prófa einkarekna öryggisvinnslu til að styrkja öryggiseftirlit um leið og friðhelgi viðskiptavina er varðveitt.
Fyrir forritara er GPT‑6 Astra fáanlegt í OpenAI API sem gpt-6-astra og í AWS Bedrock. Staðlað verð fyrir OpenAI API er 10 USD fyrir hverja milljón inntakstóka og 50 USD fyrir hverja milljón úttakstóka. Sérstakir taxtar gilda fyrir lestur úr skyndiminni og skrif í skyndiminni. Hraðstilling er í boði fyrir GPT‑6 Astra í API-inu og skilar allt að 2,5 sinnum meiri hraða en við staðlaða vinnslu á tvöföldu staðalverði.
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Samræmi
Samræmi | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Innra öryggisviðmiðunarpróf fyrir tölvunotkun (lægra er betra) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Innra öryggisviðmið fyrir tölvunotkun, með AutoReview (lægra er betra) | 1,8% | 4,3% | - | - | - | - |
Innra sniðgönguviðmið (lægra er betra) | 0,00% | 0,29% | - | - | - | - |
ExploitGym-gildra (lægra er betra) | 0,0% | 48,2% | - | - | - | - |
Impossible ExploitGym | 100,0% | - | - | - | - | - |
Innra ofskynjunarviðmiðunarpróf (lægra er betra) | 4,2% | 12,2% | - | - | - | - |
Langt samhengi
Langt samhengi | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256 þús.-512 þús. | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512 þús.-1 mil | 96,3% | 73,8% | - | - | - | - |
Abstrakt hugsun
| Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Matsstig eru hámarksgildi við hvaða átak sem er. Mat á GPT var framkvæmt í rannsóknarumhverfi okkar eða í gegnum API okkar, sem getur í sumum tilfellum skilað örlítið frábrugðnu úttaki miðað við framleiðsluútgáfu ChatGPT vegna mismunar á kerfiskvaðningum, tiltækum verkfærum o.s.frv.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(opnast í nýjum glugga). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(opnast í nýjum glugga).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(opnast í nýjum glugga).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(opnast í nýjum glugga).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(opnast í nýjum glugga): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(opnast í nýjum glugga) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(opnast í nýjum glugga) and supporting research(opnast í nýjum glugga).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(opnast í nýjum glugga) and supporting research(opnast í nýjum glugga).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(opnast í nýjum glugga).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
