OpenAI

GPT-6 Astra: A new generation of intelligence

Glúin nua intleachta

Táimid ag tabhairt isteach GPT‑6 Astra, an tsamhail is cliste agus is ailínithe ar domhan.

Tugann GPT‑6 Astra le chéile blianta taighde agus geallta móra sa réamhoiliúint, san fhoghlaim atreisiúcháin agus san ailíniú. Tá Astra ar thús cadhnaíochta in úsáid ríomhairí, sa bhrabhsáil, in innealtóireacht bogearraí, sa chibearshlándáil, san eolaíocht agus in obair ghairmiúil. Sáithíonn Astra Leibhéal 4 FrontierMath le scór 98%, agus é tar éis cuidiú cheana le fadhbanna oscailte atá ann le fada a réiteach sa mhatamaitic. Sáithíonn Astra ARC-IGS-3 le scór 99.9% chomh maith agus sáithíonn sí ExploitBench le scór 100%. Leagann sé síos teorainn nua freisin maidir le húsáid ríomhairí agus brabhsálaithe, agus é in ann an obair ghairmiúil is dúshlánaí a láimhseáil le luas, cruinneas agus breithiúnas gan sárú. 

Tá GPT‑6 Astra á chur ar fáil inniu do líon teoranta eagraíochtaí agus, sna laethanta amach romhainn, beidh sé ar fáil do gach úsáideoir ChatGPT Plus, Pro, Business agus Enterprise, chomh maith le trí API OpenAI, Microsoft Azure agus AWS Bedrock.

“Ar ARC-IGS-3, sháraigh Astra ár mbonnlíne dhaonna éifeachtúlachta gníomhaíochta ar 96% de na leibhéil, agus bhain sé comhionannas daonna amach go héifeachtach ar an tagarmharc. Ní hamháin gurb í seo an tsamhail is fearr a thástáil muid riamh, ach is athrú suntasach céime í freisin i bhfeidhmíocht samhlacha ceannródaíocha - ní hamháin ina cumas timpeallachtaí nua a nascleanúint agus a réiteach, ach freisin san éifeachtúlacht lena bhfoghlaimíonn sí é sin a dhéanamh.”
Greg Kamradt, ARC Prize Foundation

Is í Astra an tsamhail is ailínithe againn, le feabhsuithe suntasacha ar thuiscint rún an úsáideora agus iompar na samhla—féadfaidh tú tascanna a tharmligean le níos mó muiníne as breithiúnas Astra. Mar bhealach amháin chun é seo a thástáil, chruthaíomar meastóireacht nua bunaithe ar eachtra Hugging Face lena ndéantar measúnú ar an rachadh samhail a bhfuil tasc deacair nó dodhéanta roimpi thar a raon beartaithe. I gcomparáid le GPT‑5.6 Sol, a chuaigh thar an sprioc údaraithe 48% den am gan chosaintí táirgthe, rinne GPT‑6 Astra amhlaidh i 0% de chásanna.

An tsamhail is fearr ar domhan le húsáid ríomhaire

Tugann GPT‑6 Astra ré nua isteach maidir le luas, cruinneas agus sábháilteacht úsáid ríomhairí. Is féidir leis tascanna leadránacha a láimhseáil, cosúil le foirmeacha ar líne a líonadh, taifid chustaiméirí in CRM a nuashonrú, agus d’fhéilire a eagrú. Is féidir leis taighde ar líne a dhéanamh agus achoimrí a dhréachtú i do ríomhphost nó i d’eagarthóir doiciméad. Tá sé in ann sonraí eolaíocha a anailísiú, graif a ghiniúint, suíomh gréasáin a chruthú, agus seiceálacha QA ar an gcomhéadan tosaigh a rith chun a chinntiú go n-oibríonn na gnéithe uile ar an suíomh sin. Is féidir leis cabhrú leat bogearraí a shuiteáil agus a thástáil go huathrialach, agus fadhbanna a fheiceann tú ar an scáileán a réiteach. Léirítear na feabhsuithe seo freisin inár dtorthaí meastóireachta úrscothacha.

Fágann na feabhsuithe seo freisin go mbíonn gnóthachain shuntasacha éifeachtúlachta ann i bhfíorthascanna oibre eolais. In ionsamhlaitheí aga folaigh ar OSWorld 2.0, baineann Astra feidhmíocht úsáide ríomhaireachta níos airde amach i dtuairim is 47% níos lú ama in aghaidh an taisc ná GPT‑5.6 Sol, agus scór 72.6% aige i gceann thart ar 40 nóiméad in aghaidh an taisc, i gcomparáid le 65.7% i gceann thart ar 75 nóiméad.3

Is féidir cumais úsáide ríomhaire GPT‑6 Astra a fheiceáil in aschuir thar raon leathan disciplíní, lena n-áirítear forbairt cluichí, innealtóireacht leictreach agus gnáthobair eolais:

In éineacht le hAstra, táimid ag nuashonrú an chreata Codex freisin chun luas úsáide ríomhaire a fheabhsú go suntasach. I dteannta éifeachtúlachta Astra, ciallaíonn sé sin go gcuirtear tascanna i gcrích 1,9x níos tapúla i gcomparáid leis an eispéireas reatha GPT‑5.6 Sol, ar an tagarmharc Mind2Web. Ciallaíonn feabhsuithe luais na samhla gur féidir léi tabhairt faoi go leor tascanna saoil a thógann am ar bhur son, níos tapúla ná mar is féidir libh féin.

“Táimid ag comhtháthú GPT‑6 Astra i gcreat Devin ar lá an tseolta, áit a soláthraíonn sé feidhmíocht úrscothach ar ár dtagarmharc inmheánach tástála. Chuir a úsáid ríomhaire den scoth, a chuid scríbhneoireachta agus a thuiscint ar an mbunachar cód feabhas ar an tástáil ó thús báire: tá sé i bhfad níos éasca na físeáin a leanúint, agus tá na tuarascálacha níos soiléire agus níos gonta”
Silas Alberti, Leas-Uachtarán Sinsearach Taighde, Cognition

Céimathrú ar shaothar gairmiúil

Comhcheanglaíonn GPT‑6 Astra dul chun cinn in úsáid ríomhairí le hoiliúint spriocdhírithe do thimpeallachtaí gairmiúla, chun cabhrú le dul i ngleic le tascanna oibre casta. Comhcheanglaíonn sé an intleacht atá riachtanach d’fhadhbanna casta leis an gcumas sreafaí oibre ilchéime a chur i gcrích agus doiciméid, scarbhileoga agus láithreoireachtaí snasta a chruthú.

Is í GPT‑6 Astra an tsamhail is fearr againn chun cloí le teimpléid atá ann cheana agus sleamhnáin a chruthú atá leagtha amach go maith agus a chuireann príomhphointí in iúl go gonta trí insint struchtúrtha. Cruthaíonn sé cáipéisí, láithreoireachtaí, scarbhileoga agus anailísí atá soiléir agus dea-struchtúrtha, a chloíonn le do theimpléid agus atá ag teacht le do stíl scríbhneoireachta agus amhairc. Tá Astra oilte freisin chun an comhthéacs ábhartha amháin a chur san áireamh sna haschuir, seachas faisnéis nach bhfuil riachtanach don obair atá idir lámha a athrá. Ciallaíonn sé seo go léir gur féidir leis déantáin atá níos inúsáidte láithreach a aschur, atá ag teacht le comhthéacs agus caighdeáin do ghnó.

Cuireann GPT‑6 Astra breithiúnas amhairc níos láidre i bhfeidhm freisin ar na suíomhanna gréasáin, cluichí, feidhmchláir agus rindreáil a chruthaíonn sé. Le Sites(osclaíonn i bhfuinneog nua) in ChatGPT, is féidir le Astra suíomhanna gréasáin, aipeanna gréasáin agus cluichí a chruthú, a óstáil agus a roinnt go díreach ó leid.

“Tugann Astra buntáiste suntasach dúinn ó thaobh cumais agus éifeachtúlachta de. Cuireann sí ár sreafaí oibre cruthaitheacha is casta i gcrích go rathúil agus suas le 20% níos lú téacschomharthaí á n-úsáid aici ná samhlacha eile atá tástáilte againn. Níos tábhachtaí fós, dár gcustaiméirí, ciallaíonn sé aschur ar chaighdeán níos airde.”
Alex Mashrabov, POF agus Comhbhunaitheoir, Higgsfield AI

Nuair a fhágann treoracha spás le haghaidh léirmhínithe, tá GPT‑6 Astra níos fearr ná samhlacha roimhe seo ag déanamh an chinnidh cheart. Baineann sé úsáid as comhthéacs chun bearnaí coitianta a líonadh agus cuireann sé ceisteanna spriocdhírithe nuair a d’fhéadfadh an freagra an toradh a athrú. In Codex, is féidir leis ceisteanna a chur go neamhshioncronach agus é ag leanúint leis an obair nach mbraitheann ar do fhreagra. Mura bhfreagraíonn tú, téann sé ar aghaidh le toimhdí réasúnta nuair is cuí, ach fanann sé le d'ionchur maidir le cinntí a bhfuil tábhacht mhór ag baint leo.

Léiríonn na samplaí thíos conas a chomhoibríonn Astra ar thascanna laethúla ina bhféadfadh eolas atá in easnamh an freagra a athrú go suntasach.

Tá Astra níos fearr freisin maidir leis an treo ceart a choinneáil de réir mar a fhorbraíonn tasc. Uaireanta chaith samhlacha níos luaithe le teachtaireachtaí stiúrtha mar sprioc nua, agus chaill siad rian ar an iarraidh bhunaidh nó ar shrianta níos luaithe. Ionchorpraíonn Astra riachtanais nua, athraíonn sé treo nuair a iarrtar air é, agus freagraíonn sé ceisteanna taobhacha gan an tasc níos leithne a ligean ar lár.

“Is feabhas suntasach é Astra ar GPT‑5.6 Sol ó thaobh cáilíochta de i dtascanna dlíthiúla casta. Sna tástálacha luatha a rinneamar, sheas Astra amach trí dhul i ngleic le hobair dhlíthiúil ar an gcaoi a ndéanfadh dlíodóir géarchúiseach é: déanann sé idirdhealú idir cáipéisí agus taifid bhunaithe, tugann sé toimhdí gan tacaíocht chun solais, agus tiontaíonn sé bearnaí ina seasaimh dhréachtaithe nithiúla.”
Niko Grupen, Ceannasaí Taighde Fheidhmigh, Harvey

Códú

Is é GPT‑6 Astra an tsamhail is fearr don innealtóireacht bhogearraí go dtí seo.

1 de 2
“Soláthraíonn GPT‑6 Astra feidhmíocht úrscothach ar ár dtagarmharcanna códaithe inmheánacha agus léiríonn sé dul chun cinn soiléir i measúnuithe ar iomas trádála i gcomparáid le GPT‑5.6 Sol. Nuair a úsáidtear é le haghaidh códú gníomhaireach, déanann GPT‑6 Astra cumarsáid ar bhealach atá níos éasca d’fhorbróirí a leanúint agus táirgeann sé cód a éilíonn níos lú atriallta chun cáilíocht táirgthe a bhaint amach.”
John Crepezzi, Cúntóirí AI, Jane Street

Le Astra, táimid ag tabhairt isteach bealach nua chun go bhféadfaidh Codex comhthéacs a chaomhnú agus a aisghabháil nuair a líontar an fhuinneog chomhthéacs. Go stairiúil, bhain samhlacha úsáid as comhdhlúthú chun obair a achoimriú le linn seisiúin fhada, mar shampla agus fadhbanna casta á ndífhabhtú nó athfhachtóirithe móra á ndéanamh. Is féidir le gach comhdhlúthú sonraí a fhágáil ar lár faoin gcúis ar theip ar cheartú nó faoin gcaoi a n-iompraíonn comhpháirt. Is féidir le Astra in Codex nótaí a choinneáil thar fhuinneoga comhthéacs, agus sonraí carntha á gcaomhnú aici gan iad a chomhdhlúthú arís agus arís eile in aon achoimre amháin. Fanann fuinneoga comhthéacs níos luaithe inchuardaithe, ionas gur féidir le Astra ceanglais nó torthaí tástála a aimsiú i dteachtaireachtaí roimhe seo agus in aschuir uirlisí—fiú mura raibh an fhaisnéis sin gafa ina nótaí. Is féidir leat an ghné thurgnamhach seo a chumasú i do chomhad config.toml de chuid Codex,(osclaíonn i bhfuinneog nua) agus beidh sé mar réamhshocrú do Astra sna seachtainí atá romhainn.

Fionnachtain eolaíoch a chur chun cinn

“Is é seo an scéal: deireadh ré amháin, tús ré eile.”
Greg Burnham, EpochAI

Is dul chun cinn mór é GPT‑6 Astra don fhionnachtain eolaíoch, don mhatamaitic agus don tsláinte. Inniu, táimid ag roinnt dhá thoradh eile faoi na bearnaí idir príomhuimhreacha [WITH LINK]. Socraíonn Astra taifid nua freisin ar fud sraith measúnuithe eolaíochta:

Is féidir le Astra cabhrú leis an obair phraiticiúil atá taobh thiar den fhionnachtain eolaíoch. Trí réasúnaíocht eolaíoch a chomhcheangal le húsáid ríomhaire, is féidir léi oibriú go díreach i mbogearraí speisialaithe chun sonraí a scrúdú agus torthaí a iniúchadh, rud a chabhraíonn le taighdeoirí an fhianaise a mheas agus cinneadh a dhéanamh faoi cad ba cheart a fhiosrú ina dhiaidh sin.

Cibearshlándáil

Is céim mhór chun cinn i gcumais chibearshlándála é Astra. Is féidir lena chumas dúshaothraithe nialas-lae a aithint agus a fhorbairt cabhrú le cosantóirí leochaileachtaí a phaisteáil, ach cruthaíonn sé gá le coimircí níos láidre freisin. Chun tuiscint a fháil ar cé chomh fairsing agus atá na cumais seo, d’úsáideamar meastóireachtaí ó shaineolaithe inmheánacha agus ó shaineolaithe tríú páirtí.

Rinneamar Astra a thástáil ar dtús ar ExploitBench agus ExploitGym, a thomhaiseann an féidir le samhlacha forghníomhú cód treallach a bhaint amach i mbunachair chóid leochaileacha.

I bhfianaise na n-imní féideartha go bhféadfadh nochtadh do leochaileachtaí stairiúla bogearraí a bheith tar éis tionchar a imirt ar thorthaí na dtagarmharcanna, rinneamar Astra a mheas ar dhá thagarmharc úrnua freisin. Mar shampla, d’fhorbraíomar meastóireacht inmheánach “ExploitBench (Meitheamh–Lúnasa 2026)” chun forbairt dúshaothruithe a thástáil trí úsáid a bhaint as leochaileachtaí ó na trí mhí roimhe sin. 2 Bhain Astra rátaí i bhfad níos airde amach i gcur i gcrích cód treallach ná GPT‑5.6 Sol ar an tacar sonraí seo, agus i bhfad níos lú téacschomharthaí aschuir á n-úsáid aici. Le linn na meastóireachta, d’aimsigh agus d’úsáid Astra dhá theicníc éalaithe ó bhosca gainimh carn in Chrome V8 nach raibh ar eolas roimhe sin. Táimid ag cur an dá leochaileacht in iúl dá gcothabhálaithe.

Rinneamar Astra a thástáil freisin ar SRE-Bench, tagarmharc a thomhaiseann an féidir le samhlacha bogearraí dénártha a innealtóireacht droim ar ais chun a chroíloighic a thuiscint. D’fhorbair údair an tagarmhairc na bogearraí ó bhonn agus choinnigh siad cód foinse na mbogearraí príobháideach. Réitigh Astra 88.0% de na tascanna in aon iarracht amháin agus 99.2% díobh laistigh de cheithre iarracht, i gcomparáid le 55.9% agus 68.7% do GPT‑5.6 Sol, faoi seach.

Seachas tagarmharcanna, fuair measúnuithe faoi stiúir saineolaithe amach go bhféadfadh Astra leochaileachtaí nach raibh ar eolas roimhe seo a úsáid chun forghníomhú cód treallach a bhaint amach i mbrabhsálaithe cruaite agus chun géaraithe ardú pribhléidí a chruthú do chórais oibriúcháin chruaite. Le chéile, chuir na torthaí seo bonn faoinár gcinneadh go bhfuil Astra tar éis an tairseach Chriticiúil a bhaint amach sa chibearshlándáil faoin gCreata Ullmhachta.

Mar a phléamar i Fuinneog an Chosantóra, is féidir le cibearchumais cheannródaíocha cabhrú le cosantóirí leochaileachtaí a aimsiú níos tapa, ach fágann siad freisin gur fusa na leochaileachtaí sin a shaothrú, rud a mhéadaíonn an phráinn atá ar chosantóirí oiriúnú.

Maidir leis an leagan de Astra atá á sheoladh inniu, tacaímid le tascanna cosanta tábhachtacha amhail athbhreithniú slándála ar chód, paisteáil, agus samhaltú bagairtí. Mar sin féin, de réir réamhshocraithe, diúltóidh Astra cloí le tascanna cibearshlándála ardleibhéil amhail aimsiú dúshaothruithe. Trí OpenAI Daybreak, táimid ag cur ar fáil, táimid ag cur ar fáil rochtain nach bhfuil chomh sriantach do ghrúpa alfa de chosantóirí iontaofa cibearshlándála sa chlár OpenAI Daybreak. Leathnaíonn sé seo rochtain ar shreafaí oibre cosanta, lena n-áirítear triáisiú agus bailíochtú leochaileachtaí, anailís ar bhogearraí mailíseacha, innealtóireacht braite, agus bailíochtú paistí. Tá sé beartaithe againn rochtain a leathnú tuilleadh trí Daybreak Blue.

Neartaíomar freisin ár gcosaintí i gcoinne mí-úsáid chibearshlándála a d’fhéadfadh tarlú, ag tógáil ar ár gcruach chosaintí do GPT‑5.6 Sol. Áirítear orthu sin oiliúint níos láidre maidir le seasmhacht na samhla chun jailbreak a d’fhéadfadh tarlú a sheasamh níos fearr, agus níos mó comhthéacs dár gcórais mhonatóireachta. Leanamar ar aghaidh le tástáil dhian inmheánach agus sheachtrach, lena n-áirítear tástálacha uathoibrithe lenár n-ionsaitheoirí tástála ionsaithí inmheánacha. Tá tuilleadh sonraí maidir lenár gcosaintí cibearshlándála agus tástáil ar fáil i gcárta córais Astra agus ar ár mblag.

GPT‑6 Astra a ailíniú agus a imscaradh go freagrach

Is í Astra an tsamhail is ailínithe againn. Tá Astra ar fheabhas ag gníomhú go cúramach, ag urramú teorainneacha tascanna, agus ag cumarsáid go trédhearcach. Is í an obair seo an toradh is déanaí ar ár gclár taighde fadbhunaithe atá dírithe ar shamhlacha a oiliúint a fhanann ailínithe le hintinn an duine ó thús go deireadh.

I dtimpeallachtaí íogaire, téann Astra ar aghaidh le leibhéal cúraim atá comhréireach leis an riosca atá i gceist. I meastóireacht ar thascanna úsáide ríomhaire a roghnaíodh ar bhealach sáraíochta chun mí-iompar a spreagadh, bhí Astra níos rathúla maidir le hiarmhairtí neamhbheartaithe a sheachaint. Nuair a ritheadh é leis na bearta slándála breise a chuirtear ar fáil de réir réamhshocraithe, baineadh feidhmíocht níos láidre fós amach.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(osclaíonn i bhfuinneog nua) and Anthropic Messages API(osclaíonn i bhfuinneog nua)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Is dóichí freisin go bhfeidhmeoidh Astra laistigh de na teorainneacha atá leagtha síos ag an úsáideoir agus atá intuigthe óna thimpeallacht. I meastóireacht inmheánach, ní dhearna Astra iarracht riamh diúltú ó Codex Auto-Review a sheachaint. Bhí sé seo fós fíor fiú nuair a cumraíodh Auto-review d’aon ghnó sa chaoi go bhféadfaí é a sheachaint agus nuair nach bhféadfaí an tasc a chur i gcrích ar aon bhealach eile. Tá an meas seo ar shrianta na timpeallachta comhsheasmhach le torthaí ár meastóireachta ar thasc cibearshlándála dodhéanta, a roinneamar sa réamhrá don phost seo, agus le torthaí eile atá doiciméadaithe inár gcárta córais(osclaíonn i bhfuinneog nua).

Léiríonn Astra freisin laghduithe suntasacha ar iompar mealltach. Teastaíonn tuiscint shoiléir ó dhaoine a tharmligeann obair ar chumais samhla agus tuairisciú macánta ar a dul chun cinn. Tomhaiseann sé seo gné amháin den mhacántacht; is fócas níos leithne fós dár gcuid oibre ailínithe é an mheabhlaireacht d’aon ghnó a laghdú.

Inár meastóireacht ar siabhránachtaí cumais, léiríonn Astra feabhas suntasach i gcomparáid le GPT‑5.6 Sol, agus déanann sí níos lú éileamh míthreorach faoina cumais.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(osclaíonn i bhfuinneog nua) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(osclaíonn i bhfuinneog nua) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Infhaighteacht

Tá GPT‑6 Astra á chur ar fáil inniu do fhiontair agus do chustaiméirí inár gClár Rochtana Iontaofa, agus beidh sé ar fáil go forleathan sna laethanta amach romhainn do dhaoine a liostálann le ChatGPT Plus, Pro, Business agus Enterprise. Tá úsáid Astra san áireamh sa liúntas úsáide reatha sna pleananna Pro ar $100 agus $200 agus sa phlean Business ar $100, gan aon teorainneacha ráta ná srianta breise. Is féidir le daoine a bhfuil síntiús Plus ar $20 acu agus le custaiméirí ar an bplean caighdeánach Business rochtain a fháil ar GPT‑6 Astra le teorainneacha úsáide níos ísle, agus is féidir leo creidmheasanna a cheannach chun rochtain bhreise a fháil. Is féidir le riarthóirí Enterprise Astra a chumasú dá spás oibre; tá rochtain múchta de réir réamhshocraithe nuair a sheoltar é.

Is féidir le húsáideoirí Pro Lite, Pro, Business agus Enterprise GPT‑6 Astra a úsáid in Chat freisin. Tacaíonn Astra le Gan Coinneáil Sonraí do chustaiméirí API incháilithe agus, mar a roinneamar an mhí seo caite, táimid ag tástáil Próiseáil Sábháilteachta Phríobháideach chun monatóireacht sábháilteachta a neartú agus príobháideacht custaiméirí á caomhnú.

D’fhorbróirí, tá GPT‑6 Astra ar fáil in API OpenAI mar gpt-6-astra, agus tá sé ar fáil in AWS Bedrock. Is é praghsáil Chaighdeánach API OpenAI ná $10 in aghaidh an mhilliúin téacschomhartha ionchuir agus $50 in aghaidh an mhilliúin téacschomhartha aschuir. Baineann rátaí ar leith le léamha taisce agus scríobhanna taisce. Tá Mód Tapa ar fáil do GPT‑6 Astra in API agus soláthraíonn sé suas le 2.5x luas na próiseála Caighdeánaí ar 2x an phraghais Chaighdeánaigh.

Úsáid Ríomhaire

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Acadúil

Acadúil

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.7 Flash

GPQA Diamant

96.0%

94,6%

93.7%

92.6%

93.2%

94.5%

Ríomheolaíocht Theoiriciúil

75.4%

FrontierMath Leibhéil 1-3 (v2)

89.0%

90.2%

87.0%

85.6%

71.6%

FrontierMath Leibhéal 4 (v2)

97.6%

83.0%

87.8%

87.8%

73,2%

36.6%

Scrúdú Deireanach an Chine Daonna (uirlisí)

65.0%

63.8%

63.6%

Scrúdú Deireanach an Chine Daonna (gan uirlisí)

59.1%

55.5%

54.9%

47.9%

Eolaíocht agus Sláinte

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Cibearshlándáil

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Ailíniú

Ailíniú

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Tagarmharc sábháilteachta d’úsáid inmheánach ríomhairí (is ísle is fearr)

2.4%

22.0%

9.5%

18.3%

11.5%

-

Tagarmharc inmheánach sábháilteachta maidir le húsáid ríomhaire, le AutoReview (dá ísle is ea is fearr)

1.8%

4.3%

-

-

-

-

Tagarmharc inmheánach imchéimnithe (is fearr níos ísle)

0.00%

0.29%

-

-

-

-

Pota meala ExploitGym (Is ísle is fearr)

0.0%

48.2%

-

-

-

-

ExploitGym Dodhéanta

100.0%

-

-

-

-

-

Tagarmharc inmheánach siabhránachta (níos ísle is fearr)

4.2%

12.2%

-

-

-

-

Comhthéacs fada

Comhthéacs fada

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

Réasúnaíocht theibí

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Tá scóir mheastóireachta ar an uasmhéid ag aon leibhéal iarrachta. Rinneadh meastóireachtaí GPT inár dtimpeallacht taighde nó trínár API, a d’fhéadfadh aschur beagán difriúil ó ChatGPT sa táirgeadh a chur ar fáil mar gheall ar dhifríochtaí sna leideanna córais, sna huirlisí atá ar fáil, etc.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(osclaíonn i bhfuinneog nua). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(osclaíonn i bhfuinneog nua).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(osclaíonn i bhfuinneog nua).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(osclaíonn i bhfuinneog nua).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(osclaíonn i bhfuinneog nua): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(osclaíonn i bhfuinneog nua) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(osclaíonn i bhfuinneog nua) and supporting research(osclaíonn i bhfuinneog nua).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(osclaíonn i bhfuinneog nua) and supporting research(osclaíonn i bhfuinneog nua).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.