Ný kynslóð greindar
Uppfært 22. september 2026: Við erum að stækka GPT‑6‑línuna okkar með GPT‑6 Sol og GPT‑6 Luna. Kynntu þér málið nánar.
Við kynnum GPT‑6 Astra, gáfaðasta og best samstillta líkan heims.
GPT‑6 Astra sameinar margra ára rannsóknir og stórar fjárfestingar í forþjálfun, styrkingarnámi og samræmingu. Astra er framúrskarandi í tölvunotkun, vöfrun, hugbúnaðarverkfræði, netöryggi, vísindum og faglegri vinnu. Astra nær nánast hámarki á FrontierMath Tier 4 með 98% einkunn, eftir að hafa þegar hjálpað til við að leysa lengi óleyst vandamál í stærðfræði. Astra nær einnig 99,9% árangri í ARC-AGI-3 og 100% árangri í ExploitBench. Það setur einnig nýtt háþróað í notkun tölva og vafra og annast krefjandi fagleg störf með óviðjafnanlegum hraða, nákvæmni og dómgreind.
GPT‑6 Astra verður í boði í dag fyrir takmarkaðan hóp stofnana og verður á næstu dögum aðgengilegt öllum notendum ChatGPT Plus, Pro, Business og Enterprise, sem og í gegnum OpenAI API, Microsoft Azure og AWS Bedrock.
Astra er samræmdasta líkan okkar, með verulegum umbótum í skilningi á ásetningi notanda og hegðun líkans – þú getur falið Astra verkefni með meira trausti á dómgreind þess. Sem eina leið til að prófa þetta þróuðum við nýtt mat með hliðsjón af Hugging Face-atvikinu sem metur hvort líkan sem stendur frammi fyrir erfiðu eða ómögulegu verkefni fari út fyrir fyrirhugað verksvið sitt. Samanborið við GPT‑5.6 Sol, sem án rekstrarvarna fór út fyrir heimilað markmið í 48% tilvika, gerði GPT‑6 Astra það í 0% tilvika.
Besta líkan heimsins fyrir tölvunotkun
GPT‑6 Astra markar háþróað í hraða, nákvæmni og öryggi tölvunotkunar. Það getur séð um tímafrek verkefni eins og að fylla út eyðublöð á netinu, uppfæra viðskiptavinaskrár í CRM-kerfi og skipuleggja dagatalið þitt. Það getur stundað rannsóknir á netinu og útbúið drög að samantektum í tölvupósti þínum eða í skjalavinnsluforritinu þínu. Það getur greint vísindaleg gögn, búið til myndrit, búið til vefsvæði og keyrt QA-prófanir á framenda til að ganga úr skugga um að allir eiginleikar vefsins virki. Það getur hjálpað þér að setja upp og prófa hugbúnað sjálfstætt og leysa úr vandamálum sem þú sérð á skjánum. Þessar endurbætur endurspeglast einnig í matsniðurstöðum okkar sem eru í fremstu röð.
Þessar umbætur leiða einnig til verulegrar aukningar á skilvirkni í raunverulegum verkefnum í þekkingarvinnu. Í hermunum á biðtíma í OSWorld 2.0 nær Astra betri frammistöðu í tölvunotkun á um 47% styttri tíma á hvert verkefni en GPT‑5.6 Sol, sem skoraði 72,6% eftir um það bil 40 mínútur á hvert verkefni, samanborið við 65,7% eftir um það bil 75 mínútur.3
Tölvunotkunarhæfni GPT‑6 Astra má sjá í afurðum á ýmsum sviðum, þar á meðal í leikjaþróun, rafmagnsverkfræði og daglegri þekkingarvinnu:
Samhliða Astra uppfærum við einnig Codex-kerfið til að bæta verulega hraðann við tölvunotkun. Í samspili við skilvirkni Astra þýðir þetta 1,9 sinnum hraðari verklok samanborið við núverandi upplifun af GPT‑5.6 Sol í Mind2Web-matsviðmiðinu. Hraðaaukning líkansins þýðir að það getur sinnt mörgum tímafrekum verkefnum í daglegu lífi fyrir þig, hraðar en þú getur.4
Straumhvörf í faglegum störfum
GPT‑6 Astra sameinar framfarir í tölvunotkun með markvissri þjálfun fyrir faglegt starfsumhverfi til að auðvelda úrlausn flókinna vinnuverkefna. Það sameinar greind sem þarf til að leysa flókin vandamál með getu til að framkvæma verkflæði í mörgum skrefum og útbúa fáguð skjöl, töflureikna og kynningar.
GPT‑6 Astra er besta líkanið okkar til að fylgja fyrirliggjandi sniðmátum og búa til vel uppsettar glærur sem koma lykilatriðum hnitmiðað á framfæri með skipulagðri frásögn. Það býr til skýr og vel uppbyggð skjöl, kynningar, töflureikna og greiningar sem fylgja sniðmátunum þínum og samræmast ritstíl þínum og sjónrænum stíl. Astra er einnig þjálfuð til að draga aðeins það samhengi sem skiptir máli inn í úttakið, í stað þess að endurtaka upplýsingar sem eru óþarfar fyrir verkefnið sem unnið er að. Allt þetta þýðir að það getur skilað afurðum sem eru tilbúnari til notkunar strax og passa við viðskiptasamhengi þitt og staðla.
GPT‑6 Astra veitir einnig betra sjónrænt mat við gerð vefsíðna, leikja, forrita og myndgerða. Með Sites(opnast í nýjum glugga) í ChatGPT getur Astra búið til, hýst og deilt vefsíðum, veföppum og leikjum beint út frá kvaðningu.
Þegar fyrirmæli gefa svigrúm til túlkunar er GPT‑6 Astra betra en fyrri líkön í að taka rétta ákvörðun. Það nýtir samhengi til að fylla í algengar eyður og spyr markvissra spurninga þegar svarið gæti haft áhrif á niðurstöðuna. Í Codex getur það spurt ósamstillt á meðan það heldur áfram vinnu sem er ekki háð svari þínu. Ef þú svarar ekki heldur það áfram út frá skynsamlegum forsendum eftir því sem við á, en bíður eftir svari frá þér þegar taka þarf ákvarðanir sem hafa verulegar afleiðingar.
Dæmin hér að neðan sýna hvernig Astra vinnur með þér að hversdagslegum verkefnum þar sem upplýsingar sem vantar geta breytt svarinu verulega.
Astra er einnig betri í að halda áttum eftir því sem verkefnið þróast. Fyrri líkön litu stundum á stýringarskilaboð sem nýtt markmið og misstu sjónar á upphaflegri beiðni eða fyrri skorðum. Astra tekur inn nýjar kröfur, breytir um stefnu þegar óskað er eftir því og svarar aukaspurningum án þess að missa sjónar á heildarverkefninu.
Kóðun
GPT‑6 Astra er besta líkanið fyrir hugbúnaðarverkfræði hingað til.
„GPT‑6 Astra nær framúrskarandi árangri í innri viðmiðunarprófum okkar fyrir kóðun og sýnir greinilegt framfaraskref í mati á innsæi í viðskiptum samanborið við GPT‑5.6 Sol. Þegar GPT‑6 Astra er notað fyrir fulltrúakóðun tjáir það sig með hætti sem auðveldara er fyrir forritara að fylgja og skilar kóða sem krefst færri ítrana til að ná framleiðslugæðum.“
„Við prófuðum Astra með lágu, miðlungs og miklu átaki í einu af fyrstu kynslóðar matsprófum okkar, og það stóð sig töluvert betur en GPT 5.6 Sol. Meira átak skilar fleiri endurtekningum á nýrri smíð, meiri sannprófun með vafraprófunum og meiri áherslu á keyrslu kóða frekar en apply-patch. Með því að skilja hvernig líkan nýtir átak sitt getum við veitt milljónum forritara hraðari og áreiðanlegri leið frá hugmynd að virku appi.“
Með Astra kynnum við nýja leið fyrir Codex til að varðveita og endurheimta samhengi þegar samhengisglugginn fyllist. Hingað til hafa líkön notað þjöppun til að draga saman vinnu í löngum lotum, til dæmis við villuleit að flóknum vandamálum eða við umfangsmiklar endurskipulagningar. Við hverja þjöppun geta glatast upplýsingar um hvers vegna lagfæring mistókst eða hvernig íhlutur hegðar sér. Í Codex getur Astra geymt minnispunkta milli samhengisglugga og varðveitt uppsafnaðar upplýsingar án þess að þjappa þeim ítrekað saman í eina samantekt. Fyrri samhengisgluggar eru áfram leitarhæfir, þannig að Astra getur fundið kröfur eða prófunarniðurstöður úr fyrri skilaboðum og verkfæraúttaki — jafnvel þótt þær upplýsingar hafi ekki verið skráðar í athugasemdir þess. Þú getur virkjað þennan tilraunaeiginleika í Codex config.toml-skránni þinni,(opnast í nýjum glugga) og það verður sjálfgefið fyrir Astra á næstu vikum.
Að efla vísindalegar uppgötvanir
Astra getur aðstoðað við hagnýtu vinnuna sem liggur að baki vísindalegum uppgötvunum. Með því að sameina vísindalega rökhugsun og tölvunotkun getur það unnið beint í sérhæfðum hugbúnaði til að skoða gögn og kanna niðurstöður og þannig hjálpað rannsakendum að meta sönnunargögnin og ákveða hvað skuli rannsaka næst.
Netöryggi
Eins og við ræddum í öryggisuppfærslu okkar markar Astra verulegt stökk í netöryggisgetu og nær mikilvægum viðmiðunarmörkum í netöryggi samkvæmt undirbúningsramma okkar. Geta þess til að bera kennsl á og þróa núlldaganýtingar getur hjálpað varnaraðilum að finna og lagfæra veikleika, en hún skapar einnig þörf fyrir öflugri öryggisráðstafanir. Til að átta okkur á því hversu víðtæk þessi geta er létum við Astra gangast undir sérfræðimat innanhúss og frá þriðja aðila.
Við prófuðum fyrst líkanið án öryggisráðstafana fyrir framleiðslu á ExploitBench og ExploitGym, sem meta hvort líkön geti breytt þekktum hugbúnaðarveikleikum í virkar nýtingar. Á ExploitBench fékk Astra fullt hús stiga, 100%, samanborið við 78,5% hjá GPT‑5.6 Sol, fyrra líkan okkar með háþróaða netöryggisgetu. Á ExploitGym náði Astra 42,4% árangri, samanborið við 30,3% hjá GPT‑5.6 Sol, og notaði jafnframt mun færri tókar í úttaki.13
Í ljósi áhyggja af því að útsetning fyrir sögulegum hugbúnaðarveikleikum kunni að hafa haft áhrif á niðurstöður viðmiðunarprófa, mátum við Astra einnig á tveimur nýjum viðmiðunarprófum. Í fyrsta lagi settum við upp innra „ExploitBench (júní–ágúst 2026)“ mat til að prófa þróun misnotkunaraðferða með því að nota öryggisveikleika frá þremur mánuðunum á undan.14 Astra náði mun hærra hlutfalli af keyrslu handahófskennds kóða en GPT‑5.6 Sol á þessu gagnasafni og notar til þess mun færri úttakstóka. Meðan á matinu stóð uppgötvaði Astra meira að segja og notaði tvo áður óþekkta núlldagsveikleika. Við erum að tilkynna báða öryggisveikleikana til viðhaldsaðila þeirra.
Við prófuðum Astra einnig á SRE-Bench15, viðmiðunarprófi sem mælir hvort líkön geti baksmíðað tvíundarskrár hugbúnaðar til að skilja kjarnarökfræði hans án aðgangs að óunnum frumkóða. Astra leysti 88,0% verkefna í einni tilraun og 99,2% innan fjögurra tilrauna, samanborið við 55,9% og 68,7% fyrir GPT‑5.6 Sol, í sömu röð.
Fyrir utan viðmiðunarprófanir leiddi mat sérfræðinga í ljós að Astra, þegar það er keyrt án öryggisráðstafana fyrir framleiðsluumhverfi, gæti nýtt áður óþekkta veikleika til að ná fram keyrslu handahófskennds kóða í hertum vöfrum og búið til nýtingarkóða til réttindahækkunar fyrir hert stýrikerfi.
Eins og við ræddum í The Defender’s Window geta háþróaðar netvarnargetur hjálpað varnaraðilum að finna veikleika hraðar, en þær gera einnig auðveldara að nýta sér þessa veikleika, sem gerir það enn brýnna að varnaraðilar aðlagi sig. Með útgáfu Astra sem kemur út í dag geta varnaraðilar nýtt hana til að ljúka verkefnum á borð við öryggisyfirferð kóða og innleiðingu öryggisuppfærslna.
Hins vegar mun Astra neita að framkvæma enn háþróaðri netöryggisverkefni, svo sem að búa til nýtingarkóða sem sýnir fram á virkni veikleika. Í gegnum OpenAI Daybreak ætlum við að auka aðgang og innleiða öryggisráðstafanir með færri takmörkunum á næstu vikum. Þetta mun gera fleiri varnarverkflæði möguleg, þar á meðal staðfestingu veikleika og hugmyndasannana, greiningu spilliforrita og greiningarverkfræði.
Við höfum einnig styrkt varnir okkar gegn mögulegri misnotkun á netinu með því að byggja á varnarkerfi okkar fyrir GPT‑5.6 Sol. Þetta felur í sér aukinn viðnámsþrótt líkana til að standast betur mögulegar tilraunir til að komast fram hjá öryggistakmörkunum og meira samhengi fyrir eftirlitskerfi okkar. Við höfum haldið áfram ströngum innri og ytri prófunum, þar á meðal sjálfvirku mati með innri árásaraðilum í rauðteymi. Nánari upplýsingar um netvarnir okkar og prófanir eru í öryggisyfirliti Astra og kerfiskortinu(opnast í nýjum glugga)..
Samræming og ábyrg innleiðing GPT‑6 Astra
Astra er samræmdasta líkan okkar. Astra skarar fram úr í að sýna aðgát, virða mörk verkefna og eiga gagnsæ samskipti. Þessi vinna er nýjasta afurð langvarandi rannsóknaráætlunar okkar sem beinist að því að þjálfa líkön sem eru áfram í samræmi við mannlegan ásetning frá upphafi til enda.
Í viðkvæmu umhverfi fer Astra að með varúð sem er í samræmi við þá áhættu sem um ræðir. Í mati á verkefnum í tölvunotkun, sem voru valin með andstæðingsmiðuðum hætti til að kalla fram óæskilega hegðun, náði Astra meiri árangri í að forðast ófyrirséðar afleiðingar. Keyrsla með viðbótaröryggisráðstöfunum sem eru sjálfgefnar skilaði enn betri afköstum.
Astra veldur færri misstilltum niðurstöðum en nokkurt annað háþróað líkan sem var prófað. Til að samanburðurinn væri sanngjarn notuðum við almennt kerfi fyrir fulltrúa sem notar tölvu (byggt á innbyggðu tölvunotkunarverkfærunum sem eru í boði bæði í OpenAI Responses API(opnast í nýjum glugga) og Anthropic Messages API(opnast í nýjum glugga)) og án viðbótarvarna sem eru venjulega virkjaðar fyrir notendur Codex og ChatGPT Vinna (sjálfvirk yfirferð, staðfestingarstefna).
Astra er einnig líklegri til að starfa innan þeirra marka sem notandinn setur og sem umhverfi hennar gefur til kynna. Í innra mati reyndi Astra aldrei að komast fram hjá höfnun í sjálfvirkri yfirferð Codex. Þetta gilti jafnvel þegar sjálfvirk yfirferð hafði vísvitandi verið stillt þannig að hægt væri að sniðganga hana og ómögulegt var að ljúka verkefninu með öðrum hætti. Þessi virðing fyrir takmörkunum umhverfisins samræmist niðurstöðum úr mati okkar á ómögulegum netöryggisverkefnum, sem við deildum í inngangi þessarar færslu og öðrum niðurstöðum sem skjalfestar eru í kerfiskortinu(opnast í nýjum glugga).
Astra setur einnig ný met í gagnsæjum samskiptum við notendur. Í einu mati er Astra þrisvar sinnum ólíklegri en GPT‑5.6 Sol til að setja fram ónákvæmar fullyrðingar um getu sína og möguleika.
Í mati okkar á ofskynjunum um getu sýnir Astra verulegar framfarir miðað við GPT‑5.6 Sol og setur fram færri villandi fullyrðingar um eigin getu.
Mat okkar leiddi í ljós að erfiðara væri að fylgjast með skriflegri rökhugsun Astra en rökhugsun GPT‑5.6 Sols, byggt á prófunum sem báðu það beinlínis um að komast hjá eftirliti. Við rekjum þetta til meiri stjórnunar Astra á skriflegri rökhugsun í einfaldari verkefnum og getu þess til að leysa vandamál með færri skriflegum skrefum. Astra virðist enn eiga í erfiðleikum með að leyna þeirri rökhugsun sem þarf til flókinna verkefna, en við tökum þessa hnignun alvarlega. Að bæta eftirlitsgetu er áfram forgangsverkefni í rannsóknum og meðfylgjandi kerfiskort(opnast í nýjum glugga) greinir frá niðurstöðum okkar og áframhaldandi starfi.
Samræmingarþjálfun er lykilþáttur í nálgun okkar við dreifingu. Sem viðbótarlag varna byggjum við einnig upp kerfisvarnir á borð við Codex sjálfvirka yfirferð(opnast í nýjum glugga) og eftirlit með rök og aðgerðum umboðsmanna til að hjálpa til við að greina og hefta óörugga hegðun. Eins og lýst er í öryggisuppfærslu okkar innleiðum við einnig eftirlit með ósamræmi í rekstri fyrir líkön í flokki Astra til að fá innsýn í ósamræmi og hjálpa til við að hefta verstu tilvikin. Þessar varnir líkjast eftirliti okkar með innri innleiðingum og byggjast á flokkurum sem kanna rökhugsun og aðgerðir líkansins með tilliti til óheimillar hegðunar og stöðva sjálfkrafa hugsanlega óheimila virkni.
Í ljósi verulegrar aukningar á netöryggisgetu Astra gætum við sérstaklega að því að þessi innleiðing sé örugg og varin. Viðbótaröryggisathuganir geta stundum hægt á, gert hlé á eða stöðvað lögmæta vinnu, þar á meðal varnarstarf á sviði netöryggis. Ef gert er hlé á verkefni í ChatGPT eða Codex gætir þú verið beðinn um að yfirfara aðgerðina áður en haldið er áfram. Í forritaskilunum mun verkefnið stöðvast. Þessar athuganir geta stundum truflað lögmæta vinnu og við höldum áfram að þróa þetta kerfi til að draga úr óþarfa truflunum. Eftirlit með ósamræmi getur ekki komið í stað samræmingar: Markmið okkar er að byggja líkön sem halda sig áreiðanlega innan heimilaðs verksviðs síns þannig að þessar varnir þurfi ekki að grípa inn í.
Aðgengi
GPT‑6 Astra verður í boði í dag fyrir takmarkaðan hóp stofnana og verður á næstu dögum aðgengilegt öllum notendum ChatGPT Plus, Pro, Business og Enterprise, sem og í gegnum OpenAI API, Microsoft Azure og AWS Bedrock. Notkun Astra er innifalin í núverandi notkunarheimildum áskriftanna – notendur og fyrirtæki geta einnig keypt inneignir fyrir viðbótarnotkun. Notendur Pro-, Business- og Enterprise-áætlana fá einnig aðgang að GPT‑6 Astra Pro. Enterprise-stjórnendur geta virkjað Astra fyrir vinnusvæði sitt; aðgangur er sjálfgefið óvirkur við útgáfu.
Astra styður Engin gögn varðveitt fyrir gjaldgenga API-viðskiptavini, og eins og við sögðum frá í síðasta mánuði erum við að prófa einkarekna öryggisvinnslu til að styrkja öryggiseftirlit um leið og friðhelgi viðskiptavina er varðveitt.
Fyrir forritara verður GPT‑6 Astra aðgengilegt í OpenAI API sem gpt-6-astra og í gegnum Microsoft Azure og Amazon Bedrock.
Staðlað verð fyrir OpenAI API er 10 USD fyrir hverja milljón inntakstóka og 50 USD fyrir hverja milljón úttakstóka. Sérstakir taxtar gilda fyrir lestur úr skyndiminni og skrif í skyndiminni. Hraðstilling er í boði fyrir GPT‑6 Astra í API-inu og skilar allt að tvöföldum hraða staðlaðrar vinnslu á tvöföldu staðalverði.
Faglegur
Faglegur | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore-strengjakvartettar (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Innri hönnunarverkefni | 50,0% | 47,4% | - | 35,8% | - | - |
Innri gagnavísindaverkefni | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Kóðun
| Forritun | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended (stig) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (einkunn) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Verkefni við innri gagnagrunnsflutning | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akademískt
Akademískt | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath stig 4 (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (með verkfærum) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Samræmi
Samræmi | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Innra öryggisviðmiðunarpróf fyrir tölvunotkun (lægra er betra) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Innra öryggisviðmið fyrir tölvunotkun, með AutoReview (lægra er betra) | 1,8% | 4,3% | - | - | - | - |
Innra sniðgönguviðmið (lægra er betra) | 0,00% | 0,29% | - | - | - | - |
ExploitGym-gildra (lægra er betra) | 0,0% | 48,2% | - | - | - | - |
Impossible ExploitGym | 100,0% | - | - | - | - | - |
Innra ofskynjunarviðmiðunarpróf (lægra er betra) | 4,2% | 12,2% | - | - | - | - |
Langt samhengi
Langt samhengi | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256 þús.-512 þús. | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512 þús.-1 mil | 96,3% | 73,8% | - | - | - | - |
Abstrakt hugsun
| Óhlutbundin rök | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGG-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
Matsstig eru hámarksgildi við hvaða átak sem er. Mat á GPT var framkvæmt í rannsóknarumhverfi okkar eða í gegnum API okkar, sem getur í sumum tilfellum skilað örlítið frábrugðnu úttaki miðað við framleiðsluútgáfu ChatGPT vegna mismunar á kerfiskvaðningum, tiltækum verkfærum o.s.frv.
NEÐANMÁLSGREINAR
- 1
Á ARC-AGI-3 var GPT-6 Astra keyrt með Responses API-kerfi okkar, sem breytir tveimur stillingum til að endurspegla betur frammistöðu í raunheimum. Breytingarnar beinast ekki sérstaklega að ARC-AGI-3.
- 2
GPT-5.6 Sol vísar til útgáfunnar sem er í boði í API-inu okkar, ChatGPT Codex og ChatGPT Vinna. Útgáfan í Spjalli í ChatGPT er örlítið frábrugðin.
- 3
OSWorld V2-Offline er hlutmengi af upprunalegu OSWorld V2 sem virkar án nettengingar. Frammistaða Claude-líkansins á OSWorld-V2 Offline var endurgerð af höfundunum á opinberu stigatöflunni(opnast í nýjum glugga). Stig Claude á OSWorld 2.0 byggjast á opinberum stillingum, en ekki á breyttum verkefnum og breyttri einkunnagjöf úr kerfiskorti Fable 5.1.
- 4
- 5
Á BenchCAD endurspegla stig Claude þrjár breytingar á matinu, sem gerð er grein fyrir í kerfiskorti Fable 5.1(opnast í nýjum glugga).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon og Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(opnast í nýjum glugga)“. arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower og Peter Jonas. „The OpenScore String Quartet Corpus(opnast í nýjum glugga)“. Proceedings of the 10th International Conference on Digital Libraries for Musicology, síður. 49–57. ACM, 2023.
- 8
Á FrontierCode var GPT-6 Astra keyrt með forritaraskilaboðum sem líktust hluta af forritaraskilaboðum þess í Codex(opnast í nýjum glugga): "Forðastu að búa til of margar prófunarskrár. Búðu aðeins til nýja prófunarskrá þegar venjur geymslunnar krefjast þess eða engin núverandi skrá hentar sem staðsetning. Forðastu ótengda tiltekt og óþarfa flækjustig. Endurnýttu hentug hjálparforrit sem þegar eru til. Lestu viðeigandi leiðbeiningar geymslunnar og skoðaðu nærliggjandi kóða, prófanir, skjölun og CI. Fylgdu viðteknum venjum. Markmiðið er hreinn kóði sem auðvelt er að sameina." Kvaðningin var ekki fínstillt fyrir matið.
- 9
Hið fyrsta snýst um hversu þétt frumtölur geta komið fyrir, sama hversu langt er farið eftir talnalínunni. Í meira en áratug var besta þekkta niðurstaðan sú að til væru óendanlega mörg pör frumtalna þar sem munurinn á þeim er í mesta lagi 246. Julia Stadlmann(opnast í nýjum glugga) bætti nýlega efri mörkin í 240. Astra hjálpaði til við að staðfesta sterkara efra mark, 186, sem sýnir að óendanlega mörg pör koma fyrir innan þessarar minni fjarlægðar. Stutt bil milli frumtalna: Sönnun(opnast í nýjum glugga) og rannsóknir til stuðnings(opnast í nýjum glugga).
- 10
Hið síðara varðar óvenju stór bil milli frumtalna. Astra bætti lið í marki fyrir þessi bil, sem hafði haldist óbreytt í meira en 80 ár. Við deilum sönnununum, styttri hugsanakeðju og sannprófunargögnum fyrir báðar niðurstöðurnar. Stór bil milli frumtalna: sönnun(opnast í nýjum glugga) og rannsóknir til stuðnings(opnast í nýjum glugga).
- 11
- 12
- 13
- 14
ExploitBench (júní–ágúst 2026) inniheldur 20 V8-veikleika með hátt alvarleikastig í 13 stöðugum Chrome-útgáfum. Viðmiðunarprófið kannar hvort fulltrúar geti náð fram keyrslu handahófskennds kóða í V8 og opinberum Chrome-útgáfum fyrir Linux með því að nýta hvern tilgreindan veikleika. Sumir af veikleikunum sem fylgja með leyfa hugsanlega ekki framkvæmd handahófskennds kóða miðað við takmarkanir matsins, þannig að 100% árangurshlutfall er ekki endilega náanlegt. Athugaðu: Skor GPT-5.6 Sol upp á 5,5% stafar af takmörkun við 300 umferðir í viðmiðunarprófinu, en raunverulegir viðskiptavinir sem nota max búa ekki við slíka takmörkun. Líkanið með svipuðum stillingum náði 11,5% skori þegar það rakst á færri takmarkanir.
- 15
Jeremy Spence o.fl. „The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(opnast í nýjum glugga)“. arXiv:2608.11469v1, 2026.
- 16
Þegar við prófum líkön frá þriðju aðilum notum við einfaldara rannsóknarfyrirkomulag. Codex er með flóknari uppsetningu í framleiðsluumhverfi sem getur leitt til mismunandi villutíðni í hráum líkönum. Öryggisráðstafanir þjónustuveitenda og útfærslur á tölvuverkfærum eru enn ólíkar. Notendur upplifa ekki aðstæður þar sem ekki er beðið um staðfestingu í Codex, þar sem þetta er innri rannsóknaruppsetning.
- 17
