Kizazi kipya cha Kiwango cha ufikiri
Sasisho la Septemba 22, 2026: Tunapanua familia yetu ya GPT‑6 kwa kutumia GPT‑6 Sol na GPT‑6 Luna. Pata maelezo zaidi.
Tunawaletea GPT‑6 Astra, muundo wenye akili zaidi na unaolingana zaidi duniani.
GPT‑6 Astra inaunganisha miaka ya utafiti na uwekezaji mkubwa katika mafunzo ya awali, mafunzo ya uimarishaji na ulinganishaji. Astra ni ya hali ya juu katika matumizi ya kompyuta, kuvinjari mtandaoni, uhandisi wa programu, usalama wa mtandao, sayansi na kazi za kitaalamu. Astra inafikia ukomo wa FrontierMath Tier 4 kwa alama ya asilimia 98, ikiwa tayari imesaidia kutatua matatizo ya muda mrefu ambayo hayajatatuliwa katika hisabati. Astra pia imefikia kiwango cha juu zaidi kwenye ARC-AGI-3 kwa alama ya asilimia 99.9 na kwenye ExploitBench kwa alama ya asilimia 100. Pia inaweka mpaka mpya katika matumizi ya kompyuta na kivinjari, ikishughulikia kazi za kitaalamu zenye mahitaji makubwa zaidi kwa kasi, usahihi na uamuzi usio na kifani.
GPT‑6 Astra inatolewa leo hatua kwa hatua kwa idadi ndogo ya mashirika na, katika siku zijazo, itapatikana kwa watumiaji wote wa ChatGPT Plus, Pro, Business na Enterprise, pamoja na kupitia OpenAI API, Microsoft Azure na AWS Bedrock.
Astra ni muundo wetu uliolinganishwa zaidi, wenye maboresho makubwa katika kuelewa dhamira ya mtumiaji na tabia ya muundo—unaweza kukabidhi kazi kwa kujiamini zaidi katika uamuzi wa Astra. Kama njia moja ya kupima hili, tulitengeneza tathmini mpya iliyoongozwa na tukio la Hugging Face, inayotathmini ikiwa muundo unaokabiliwa na kazi ngumu au isiyowezekana utavuka upeo wake uliokusudiwa. Ikilinganishwa na GPT‑5.6 Sol, ambayo bila ya hatua za ulinzi katika uzalishaji ilivuka lengo lililoidhinishwa katika asilimia 48 ya matukio, GPT‑6 Astra ilifanya hivyo katika asilimia 0 ya matukio.
Muundo bora zaidi duniani wa kutumia kompyuta
GPT‑6 Astra inaashiria mpaka mpya katika kasi, usahihi na usalama wa matumizi ya kompyuta. Inaweza kushughulikia kazi za kuchosha kama kujaza fomu za mtandaoni, kusasisha rekodi za wateja katika CRM, na kupanga kalenda yako. Inaweza kufanya utafiti mtandaoni na kuandaa mihtasari ya awali katika barua pepe yako au katika kihariri chako cha hati. Inaweza kuchanganua data za kisayansi, kuzalisha michoro, kuunda tovuti, na kuendesha ukaguzi wa QA wa sehemu ya mbele ili kuhakikisha kwamba vipengele vyote kwenye tovuti hiyo vinafanya kazi. Inaweza kukusaidia kusakinisha na kujaribu programu kiotomatiki, na kutatua matatizo unayoyaona kwenye skrini. Maboresho haya pia yanaonekana katika matokeo yetu ya tathmini ya kisasa zaidi.
Maboresho haya pia husababisha ongezeko kubwa la ufanisi katika kazi halisi za maarifa. Katika uigaji wa muda wa kusubiri kwenye OSWorld 2.0, Astra inafikia utendaji wa juu zaidi wa matumizi ya kompyuta kwa kutumia muda mfupi kwa takribani asilimia 47 kwa kila jukumu kuliko GPT‑5.6 Sol, ikiwa na alama ya asilimia 72.6 kwa takriban dakika 40 kwa kila kazi, ikilinganishwa na asilimia 65.7 kwa takriban dakika 75.3
Uwezo wa GPT‑6 Astra wa kutumia kompyuta unaweza kuonekana katika matokeo kwenye nyanja mbalimbali, zikiwemo ukuzaji wa michezo, uhandisi wa umeme, na kazi za kila siku zinazohitaji maarifa:
Pamoja na Astra, pia tunasasisha mazingira ya uendeshaji ya Codex ili kuboresha kwa kiasi kikubwa kasi ya matumizi ya kompyuta. Yakiunganishwa na ufanisi wa Astra, maboresho haya hufanya kazi zikamilike kwa kasi ya 1.9x ikilinganishwa na matumizi ya sasa ya GPT‑5.6 Sol, kwenye kipimo cha Mind2Web. Maboresho ya kasi ya muundo huu yanamaanisha kuwa unaweza kushughulikia kazi nyingi za maisha zinazochukua muda, kwa ajili yako, kwa kasi zaidi kuliko unavyoweza.4
Mabadiliko makubwa katika kazi za kitaalamu
GPT‑6 Astra inaunganisha maendeleo katika matumizi ya kompyuta na mafunzo yanayolengwa kwa mazingira ya kitaalamu, ili kusaidia kushughulikia majukumu changamano ya kazi. Inachanganya Kiwango cha ufikiri kinachohitajika kwa matatizo changamano na uwezo wa kutekeleza taratibu za kazi za hatua nyingi na kuunda hati, lahajedwali, na mawasilisho yaliyo nadhifu.
GPT‑6 Astra ni muundo wetu bora zaidi wa kufuata violezo vilivyopo na kuunda mawasilisho yaliyo na mpangilio mzuri na yanayoeleza kwa ufupi hoja kuu kwa simulizi iliyopangiliwa. Huunda hati zilizo wazi na zilizopangiliwa vyema, mawasilisho, lahajedwali na uchanganuzi unaofuata violezo vyako na unaoendana na mtindo wako wa uandishi na wa kimuonekano. Astra pia imefunzwa mahususi kujumuisha kwenye matokeo muktadha muhimu pekee, badala ya kurudia taarifa zisizo za lazima kwa kazi husika. Haya yote yanamaanisha kuwa inaweza kutoa matokeo yanayoweza kutumika mara moja zaidi, yanayolingana na muktadha na viwango vya biashara yako.
GPT‑6 Astra pia huleta uamuzi bora zaidi wa kimwonekano kwenye tovuti, michezo, programu na michakato inayounda. Kwa kutumia Sites(fungua katika dirisha jipya) katika ChatGPT, Astra inaweza kuunda, kupangisha na kushiriki tovuti, programu za wavuti na michezo moja kwa moja kutoka kwenye dokeza.
Maagizo yanapoacha nafasi ya tafsiri tofauti, GPT‑6 Astra ni bora kuliko miundo ya awali katika kufanya uamuzi sahihi. Hutumia muktadha kujaza mapengo ya kawaida na huuliza maswali mahususi pale ambapo jibu linaweza kubadilisha matokeo. Katika Codex, inaweza kuuliza maswali kwa njia isiyohitaji kusubiri huku ikiendelea kufanyia kazi mambo ambayo hayategemei jibu lako. Usipojibu, huendelea kwa kutumia makisio ya busara inapofaa, lakini husubiri mchango wako kuhusu maamuzi muhimu yenye athari kubwa.
Mifano iliyo hapa chini inaonyesha jinsi Astra inavyoshirikiana katika kazi za kila siku ambapo taarifa zinazokosekana zinaweza kubadilisha jibu kwa kiasi kikubwa.
Astra pia ni bora zaidi katika kudumisha mwelekeo kadri kazi inavyobadilika. Miundo ya awali wakati mwingine ilichukulia jumbe elekezi kama lengo jipya, na kupoteza mwelekeo wa ombi la awali au vikwazo vya awali. Astra hujumuisha mahitaji mapya, hubadilisha mwelekeo inapoombwa, na hujibu maswali ya pembeni bila kuiacha kazi pana.
Uandishi wa msimbo
GPT‑6 Astra ndiyo muundo bora zaidi kwa uhandisi wa programu hadi sasa.
“GPT‑6 Astra hutoa utendaji wa kiwango cha juu zaidi kwenye vigezo vyetu vya ndani vya uandishi wa msimbo na inaonyesha hatua wazi ya mbele katika tathmini za umaizi wa biashara ikilinganishwa na GPT‑5.6 Sol. Inapotumiwa kwa usimbaji wa kiwakala, GPT‑6 Astra huwasiliana kwa njia iliyo rahisi zaidi kwa wasanidi programu kufuatilia na huzalisha msimbo unaohitaji marudio machache ili kufikia ubora wa uzalishaji.”
“Tulijaribu Astra katika viwango vya juhudi vya chini, wastani na juu kwenye mojawapo ya tathmini zetu za kizazi cha kwanza, na ilifanya vyema zaidi kwa kiwango kikubwa kuliko GPT 5.6 Sol. Juhudi ya juu huleta marudio zaidi kwenye toleo jipya, uthibitishaji zaidi kupitia majaribio ya kivinjari, na mwelekeo wa kutekeleza msimbo badala ya apply-patch. Kuelewa jinsi muundo unavyotumia juhudi zake ndiko kunakotuwezesha kuwapa mamilioni ya waundaji njia ya haraka zaidi na ya kuaminika zaidi kutoka wazo hadi programu inayofanya kazi.”
Kwa Astra, tunaanzisha njia mpya ya Codex kuhifadhi na kurejesha muktadha wakati dirisha la muktadha linapojaa. Kihistoria, miundo imetumia ukandamizaji wa mutadha kufanya muhtasari wa kazi wakati wa vikao virefu, kama vile wakati wa kutatua matatizo changamano au kushughulikia marekebisho makubwa. Kila ukandamizaji wa mutadha unaweza kuacha nje maelezo kuhusu kwa nini marekebisho yalishindwa au jinsi kijenzi kinavyofanya kazi. Katika Codex, Astra inaweza kuhifadhi madokezo kwenye dirisha la muktadha mbalimbali, ikihifadhi maelezo yaliyokusanywa bila kuyakandamiza mara kwa mara kuwa muhtasari mmoja. Madirisha ya muktadha ya awali yanaendelea kutafutika, kwa hivyo Astra inaweza kupata mahitaji au matokeo ya majaribio kutoka kwa ujumbe wa awali na matokeo ya zana—hata kama taarifa hiyo haikuhifadhiwa katika madokezo yake. Unaweza kuwezesha kipengele hiki cha majaribio katika config.toml yako ya Codex,(fungua katika dirisha jipya) na itakuwa chaguomsingi kwa Astra katika wiki zijazo.
Kuendeleza uvumbuzi wa kisayansi
Astra inaweza kusaidia katika kazi za kiutendaji zinazowezesha ugunduzi wa kisayansi. Kwa kuunganisha uwazaji wa kisayansi na matumizi ya kompyuta, inaweza kufanya kazi moja kwa moja katika programu maalumu ili kukagua data na kuchunguza matokeo, ikiwasaidia watafiti kutathmini ushahidi na kuamua nini cha kuchunguza baadaye.
Usalama wa Mtandao
Kama tulivyojadili katika sasisho letu la usalama, Astra ni hatua kubwa katika uwezo wa usalama wa mtandao na inafikia kizingiti Hatari Sana katika usalama wa mtandao chini ya Mfumo wetu wa Maandalizi. Uwezo wake wa kutambua na kuunda mbinu za kutumia udhaifu wa siku-sifuri unaweza kuwasaidia watetezi kupata na kuziba udhaifu, lakini pia unasababisha haja ya hatua madhubuti zaidi za ulinzi. Ili kuelewa upeo wa uwezo huu, tuliendesha Astra kwenye tathmini za wataalamu wa ndani na wa wahusika wengine.
Kwanza tuliijaribu muundo bila ulinzi wa uzalishaji kwenye ExploitBench na ExploitGym, ambazo hutathmini ikiwa miundo inaweza kugeuza udhaifu unaojulikana wa programu kuwa mbinu za kutumia udhaifu zinazofanya kazi. Kwenye ExploitBench, Astra ilipata alama kamili za asilimia 100, ikilinganishwa na asilimia 78.5 kwa GPT‑5.6 Sol, muundo wetu wa awali wenye uwezo wa usalama wa mtandao wa mpaka. Kwenye ExploitGym, Astra ilifikia kiwango cha mafanikio cha asilimia 42.4, ikilinganishwa na asilimia 30.3 kwa GPT‑5.6 Sol, huku ikitumia tokeni chache sana za matokeo.13
Kutokana na wasiwasi kwamba kufichuliwa kwa udhaifu wa kihistoria wa programu huenda kumeathiri matokeo ya vipimo vya utendaji, pia tuliitathmini Astra kwenye vipimo viwili vipya. Kwanza, tuliunda tathmini ya ndani ya “ExploitBench (Juni–Agosti 2026)” ili kujaribu uundaji wa mbinu za matumizi kwa kutumia udhaifu kutoka miezi mitatu iliyotangulia.14 Astra ilifikia viwango vya juu zaidi vya utekelezaji wa msimbo kiholela kuliko GPT‑5.6 Sol kwenye data hii huku ikitumia tokeni chache sana za matokeo. Wakati wa tathmini, Astra hata iligundua na kutumia kasoro mbili za kiusalama za zero-day zilizokuwa hazijulikani hapo awali. Tunawataarifu watunzaji husika kuhusu dosari zote mbili za kiusalama.
Pia tuliijaribu Astra kwenye SRE-Bench15, kipimo linganishi kinachopima iwapo miundo inaweza kufanya uhandisi geuzi wa binari za programu ili kuelewa mantiki ya muundo wa msingi bila ufikiaji wa msimbo ghafi wa chanzo. Astra ilitatua asilimia 88.0 ya kazi kwa jaribio moja na asilimia 99.2 ndani ya majaribio manne, ikilinganishwa na asilimia 55.9 na asilimia 68.7 kwa GPT‑5.6 Sol, mtawalia.
Zaidi ya vipimo vya ulinganishi, tathmini zilizoongozwa na wataalamu zilibaini kuwa Astra, ilipotekelezwa bila hatua za usalama za mazingira ya uzalishaji, ingeweza kutumia udhaifu ambao haukujulikana awali kufanikisha utekelezaji wa msimbo kiholela katika vivinjari vilivyoimarishwa kiusalama na kuunda mbinu za unyonyaji wa kuongeza mapendeleo kwa mifumo endeshi iliyoimarishwa kiusalama.
Kama tulivyojadili katika Defender’s Window, uwezo unaoongoza wa usalama wa mtandao unaweza kuwasaidia watetezi kutambua udhaifu kwa haraka zaidi, lakini pia hurahisisha udhaifu huo kutumiwa vibaya, na hivyo kuongeza uharaka wa watetezi katika kujirekebisha. Kwa toleo la Astra linalozinduliwa leo, watetezi wanaweza kulitumia kukamilisha majukumu kama vile ukaguzi salama wa msimbo na kuweka viraka.
Hata hivyo, Astra itakataa kutekeleza majukumu ya hali ya juu zaidi ya usalama wa mtandao kama vile kuunda mbinu za matumizi za uthibitisho wa dhana kwa udhaifu. Kupitia OpenAI Daybreak, tunapanga kupanua ufikiaji na kuanza kutoa hatua za ulinzi zisizo na vikwazo vingi katika wiki zijazo. Hii itawezesha taratibu zaidi za kazi za ulinzi, ikiwemo uthibitishaji wa udhaifu na uthibitishaji wa uthibitisho wa dhana, uchambuzi wa programu hasidi, na uhandisi wa utambuzi.
Pia tumeimarisha ulinzi wetu dhidi ya matumizi mabaya ya mtandaoni yanayoweza kutokea, tukiendeleza mfumo wetu wa ulinzi wa GPT‑5.6 Sol. Haya yanajumuisha uthabiti mkubwa zaidi wa muundo ili kustahimili vyema jailbreak zinazoweza kutokea na muktadha zaidi kwa mifumo yetu ya ufuatiliaji. Tumeendelea na majaribio makali ya ndani na nje, yakiwemo tathmini za kiotomatiki kwa kutumia washambuliaji wetu wa ndani wa jaribio la kubaini udhaifu wa mfumo. Maelezo zaidi kuhusu ulinzi wetu wa mtandao na majaribio yanapatikana katika muhtasari wa usalama wa Astra na kadi ya mfumo(fungua katika dirisha jipya)..
Kuoanisha na kusambaza GPT‑6 Astra kwa uwajibikaji
Astra ni muundo wetu unaoendana zaidi. Astra hufaulu sana katika kutenda kwa uangalifu, kuheshimu mipaka ya kazi, na kuwasiliana kwa uwazi. Kazi hii ndiyo matokeo ya hivi karibuni ya mpango wetu wa utafiti wa muda mrefu unaolenga kufunza miundo iendelee kuendana na nia ya binadamu kutoka mwanzo hadi mwisho.
Katika mazingira nyeti, Astra huchukua hatua kwa uangalifu unaolingana na kiwango cha hatari husika. Katika tathmini ya majukumu ya matumizi ya kompyuta yaliyochaguliwa kwa njia ya kiadui ili kuibua tabia mbaya, Astra ilifanikiwa zaidi kuepuka matokeo yasiyotarajiwa. Kuendesha kwa kutumia hatua za ziada za usalama zinazotolewa kwa chaguo-msingi kulileta utendaji bora hata zaidi.
Astra husababisha matokeo machache yasiyolingana kuliko miundo mingine yoyote inayoongoza iliyojaribiwa. Kwa ulinganisho wa haki, tulitumia mazingira ya uendeshaji ya jumla ya wakala anayetumia kompyuta (yanayotegemea zana asili za matumizi ya kompyuta zinazopatikana katika OpenAI Responses API(fungua katika dirisha jipya) na Anthropic Messages API(fungua katika dirisha jipya)) na bila ulinzi wa ziada ambao kwa kawaida hutolewa kwa watumiaji wa Codex na ChatGPT Work (ukaguzi wa kiotomatiki, sera ya uthibitishaji).
Pia kuna uwezekano mkubwa zaidi kwamba Astra itafanya kazi ndani ya mipaka iliyowekwa na mtumiaji na inayodokezwa na mazingira yake. Katika tathmini ya ndani, Astra haikuwahi kujaribu kukwepa kukataliwa na Ukaguzi wa Kiotomatiki wa Codex. Hili lilibaki hivyo hata wakati Ukaguzi wa Kiotomatiki ulisanidiwa kimakusudi ili uweze kukwepwa na kazi haikuwezekana kukamilishwa vinginevyo. Heshima hii kwa vikwazo vya mazingira inaambatana na matokeo ya tathmini yetu ya kazi za mtandao zisizowezekana tuliyoshiriki katika utangulizi wa chapisho hili na matokeo mengine yaliyoandikwa katika kasi ya mfumo(fungua katika dirisha jipya).
Aidha, Astra inaweka viwango vipya katika mawasiliano yenye uwazi na watumiaji. Katika tathmini moja, Astra ina uwezekano mdogo mara tatu kuliko GPT‑5.6 Sol kutoa maelezo yasiyo sahihi kuhusu uwezo wake na namna inavyoweza kutumiwa.
Katika tathmini yetu ya madai ya kubuni kuhusu uwezo, Astra inaonyesha uboreshaji mkubwa ikilinganishwa na GPT‑5.6 Sol, ikitoa madai machache ya kupotosha kuhusu uwezo wake.
Tathmini zetu ziligundua kuwa uwazaji wa Astra ulioandikwa ni mgumu zaidi kufuatilia kuliko GPT‑5.6 Ya Sol, kulingana na majaribio yaliyoiomba waziwazi kukwepa ufuatiliaji. Tunahusisha hili na udhibiti mkubwa zaidi wa Astra juu ya uwazaji ulioandikwa katika kazi rahisi zaidi na uwezo wake wa kutatua matatizo kwa hatua chache zaidi zilizoandikwa. Astra bado inaonekana kutatizika kuficha uwazaji unaohitajika kwa shughuli ngumu, lakini tunachukulia upungufu huo kwa uzito. Kuboresha uwezo wa kufuatilia bado ni kipaumbele cha utafiti, na kadi ya mfumo(fungua katika dirisha jipya) inayofuatana inaeleza kwa kina matokeo yetu na kazi inayoendelea.
Mafunzo ya upatanishaji ni msingi wa mbinu yetu ya upelekaji. Kama safu ya ziada ya ulinzi, pia tunaunda ulinzi wa mfumo kama vile Codex Ukaguzi otomatiki(fungua katika dirisha jipya) na ufuatiliaji wa uwazaji na vitendo vya mawakala ili kusaidia kugundua na kudhibiti tabia isiyo salama. Kama ilivyoelezwa katika sasisho letu la usalama, pia tunatekeleza ufuatiliaji wa kutolingana katika uzalishaji kwa miundo ya kiwango cha Astra ili kuwa na mwonekano wa kutolingana na kusaidia kudhibiti hali zake mbaya zaidi. Ulinzi huu unafanana na ufuatiliaji wetu wa upelekaji wa ndani na unahusisha mfumo wa viainishaji vinavyokagua uwazaji na vitendo vya muundo ili kutambua tabia isiyoidhinishwa na kusitisha kiotomatiki shughuli inayoweza kuwa isiyoidhinishwa.
Kutokana na ongezeko kubwa la uwezo wa Astra katika usalama wa mtandao, tunachukua tahadhari ya pekee ili kuhakikisha utekelezaji huu ni salama na wenye ulinzi. Ukaguzi wa ziada wa usalama wakati mwingine unaweza kupunguza kasi, kusitisha kwa muda au kukomesha kazi halali, ikiwemo kazi ya kulinda usalama wa mtandaoni. Ikiwa kazi itasitishwa katika ChatGPT au Codex, unaweza kuombwa ukague hatua hiyo kabla ya kuendelea. Katika API, kazi itasimama. Ukaguzi huu wakati mwingine unaweza kukatiza kazi halali, na tunaendelea kuboresha mfumo huu hatua kwa hatua ili kupunguza ukatizaji usio wa lazima. Ufuatiliaji wa kutolingana hauwezi kuchukua nafasi ya ulinganifu: lengo letu ni kuunda miundo inayobaki kwa uhakika ndani ya upeo wake ulioidhinishwa, ili ulinzi huu usihitaji kuingilia kati.
Upatikanaji
GPT‑6 Astra inatolewa leo hatua kwa hatua kwa idadi ndogo ya mashirika, na katika siku zijazo itapatikana kwa watumiaji wote wa ChatGPT Plus, Pro, Business na Enterprise, pamoja na kupitia OpenAI API, Microsoft Azure na AWS Bedrock. Matumizi ya Astra yanajumuishwa ndani ya mgao uliopo wa usajili—watumiaji na biashara pia wataweza kununua salio kwa matumizi ya ziada. Watumiaji walio kwenye mipango ya Pro, Business na Enterprise pia watapata ufikiaji wa GPT‑6 Astra Pro. Wasimamizi wa Enterprise wanaweza kuwasha Astra kwa ajili ya eneokazi lao; ufikiaji umezimwa kwa chaguomsingi wakati wa uzinduzi.
Astra inaunga mkono Hakuna Kuhifadhi Data kwa wateja wa API wanaostahiki, na kama tulivyoshiriki mwezi uliopita, tunajaribu Uchakataji wa Usalama kwa Faragha ili kuimarisha ufuatiliaji wa usalama huku tukihifadhi faragha ya wateja.
Kwa wasanidi programu, GPT‑6 Astra itapatikana katika OpenAI API kama gpt-6-astrana kupitia Microsoft Azure na Amazon Bedrock.
Bei ya Kawaida ya OpenAI API ni $10 kwa tokeni milioni moja za ingizo na $50 kwa tokeni milioni moja za matokeo. Viwango tofauti hutumika kwa usomaji na uandishi wa kashe. Hali ya haraka inapatikana kwa GPT‑6 Astra katika API na hutoa hadi mara 2 ya kasi ya uchakataji wa Kawaida kwa bei iliyo mara 2 ya bei ya Kawaida.
Matumizi ya kompyuta
Mtaalamu
Mtaalamu | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
Kwateti za Nyuzi za OpenScore (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Kazi za Usanifu (za Ndani) | 50.0% | 47.4% | - | 35.8% | - | - |
Kazi za Ndani za Sayansi ya Data | 40.9% | 30.5% | - | 34.7% | - | - |
Kielezo cha Uchambuzi wa Kiwango cha ufikiri v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Uandishi wa msimbo
| Uandishi wa msimbo | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (alama) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Kuu (alama) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Kazi za Uhamishaji wa Hifadhidata ya Ndani | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Fahirisi ya Ajenti wa Usimbaji ya Artificial Analysis v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Kitaaluma
Kitaaluma | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Kiwango 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Mtihani wa Mwisho wa Ubinadamu (kwa zana) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Sayansi na Afya
Ulinganifu
Ulinganifu | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Kipimo linganishi cha usalama wa matumizi ya ndani ya kompyuta (chini ni bora) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
Kigezo cha ndani cha usalama wa matumizi ya kompyuta, na AutoReview (chini ni bora) | 1.8% | 4.3% | - | - | - | - |
Kipimo cha ndani cha ukwepaji (chini ni bora) | 0.00% | 0.29% | - | - | - | - |
Honeypot ya ExploitGym (chini ni bora) | 0.0% | 48.2% | - | - | - | - |
ExploitGym Isiyowezekana | 100.0% | - | - | - | - | - |
Kipimo cha ndani cha udanganyifu (chini ni bora) | 4.2% | 12.2% | - | - | - | - |
Muktadha mrefu
Muktadha mrefu | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
Uwazaji wa dhana
| Uwazaji wa kidhahania | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Alama za tathmini huwa za juu kabisa kwa juhudi yoyote. Tathmini za GPT ziliendeshwa katika mazingira yetu ya utafiti au kupitia API yetu, ambayo inaweza kutoa matokeo tofauti kidogo kutoka kwa ChatGPT ya uzalishaji kutokana na tofauti katika madokezo ya mfumo, zana zinazopatikana, n.k.
MAELEZO YA CHINI
- 1
Kwenye ARC-AGI-3, GPT-6 Astra iliendeshwa kwa kutumia mazingira yetu ya uendeshaji ya API ya majibu, ambayo hubadilisha mipangilio miwili ili kuendana vyema na utendaji wa ulimwengu halisi. Mabadiliko hayo hayalengi ARC-AGI-3 mahususi.
- 2
GPT-5.6 Sol inamaanisha toleo linalopatikana katika API yetu, ChatGPT Codex, na ChatGPT Work. Toleo katika ChatGPT Chat ni tofauti kidogo.
- 3
OSWorld V2-Offline ni seti ndogo ya OSWorld V2 asili inayofanya kazi bila ufikiaji wa intaneti. Utendaji wa muundo cha Claude kwenye OSWorld-V2 Offline ulirudiwa na waandishi kwenye ubao rasmi wa wanaoongoza(fungua katika dirisha jipya). Kwenye OSWorld 2.0, alama za Claude zinatumia mipangilio rasmi, wala si kazi zilizorekebishwa na ukadiriaji uliorekebishwa kutoka kwenye kasi ya mfumo ya Fable 5.1.
- 4
- 5
Kwenye BenchCAD, alama za Claude zinaonyesha marekebisho 3 ya tathmini, yaliyoelezwa kwa kina katika Kadi ya Mfumo ya Fable 5.1(fungua katika dirisha jipya).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, na Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(fungua katika dirisha jipya).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, na Peter Jonas. “Mkusanyiko wa Kwateti za Nyuzi za OpenScore(fungua katika dirisha jipya).” Machapisho ya Mkutano wa 10 wa Kimataifa kuhusu Maktaba za Kidijitali kwa ajili ya Muzikolojia, uk. 49–57. ACM, 2023.
- 8
Katika FrontierCode, GPT-6 Astra ilitumika pamoja na ujumbe wa msanidi programu unaofanana na sehemu ya ujumbe wake wa msanidi programu katika Codex(fungua katika dirisha jipya): "Epuka kuunda faili za majaribio kupita kiasi. Unda faili mpya ya majaribio tu inapohitajika kwa mujibu wa kanuni za uhifadhi au wakati hakuna faili iliyopo inayofaa kutumika. Epuka usafishaji usiohusiana na utata usio wa lazima. Tumia upya zana saidizi zilizopo zinazofaa. Soma maagizo husika ya uhifadhi na ukague msimbo, majaribio, nyaraka, na CI vilivyo karibu. Fuata kanuni zilizowekwa. Lengo ni msimbo safi unaoweza kuunganishwa." Dokezo halikuboreshwa kwa ajili ya tathmini.
- 9
La kwanza linahusu jinsi nambari tasa zinavyoweza kutokea zikiwa zimekaribiana kiasi gani, hata ukienda mbali kiasi gani kwenye mstari wa nambari. Kwa zaidi ya muongo mmoja, matokeo bora zaidi yaliyofahamika yalithibitisha kwamba kuna jozi zisizo na kikomo za nambari tasa ambazo zimetengana kwa si zaidi ya 246. Julia Stadlmann(fungua katika dirisha jipya) hivi karibuni aliboresha kikomo hicho hadi 240. Astra alisaidia kuthibitisha kikomo madhubuti zaidi cha 186, akionyesha kuwa jozi zisizo na kikomo hutokea ndani ya umbali huu mdogo zaidi. Mapengo mafupi kati ya nambari tasa: Uthibitisho(fungua katika dirisha jipya) na utafiti unaounga mkono(fungua katika dirisha jipya).
- 10
Ya pili inahusu mapengo makubwa isivyo kawaida kati ya nambari tasa. Astra iliboresha kipengele katika kikomo cha mapengo haya, kipengele ambacho kilikuwa hakijabadilika kwa zaidi ya miaka 80. Tunashiriki uthibitisho na msururu wa mawazo uliofupishwa pamoja na nyenzo za uthibitishaji za matokeo yote mawili. Mapengo makubwa kati ya nambari tasa: Uthibitisho(fungua katika dirisha jipya) na utafiti unaounga mkono(fungua katika dirisha jipya).
- 11
- 12
- 13
- 14
ExploitBench (Juni–Agosti 2026) ina udhaifu 20 wa V8 wa kiwango cha juu katika matoleo 13 thabiti ya Chrome. Kipimo cha ulinganishi hupima iwapo mawakala wanaweza kufanikisha utekelezaji wa msimbo wa kiholela katika V8 na matoleo rasmi ya Chrome kwa Linux kwa kutumia vibaya kila udhaifu uliobainishwa. Baadhi ya udhaifu uliojumuishwa huenda usiruhusu utekelezaji wa msimbo wa kiholela chini ya vikwazo vya tathmini, kwa hivyo kiwango cha mafanikio cha asilimia 100 huenda kisiweze kufikiwa. Kumbuka: alama ya asilimia 5.5 ya GPT-5.6 Sol inatokana na kikomo cha zamu 300 katika kipimo cha ulinganishi, ambacho si kikomo ambacho wateja halisi wanaotumia max wangekuwa nacho. Muundo katika mipangilio inayofanana ilipata alama ya asilimia 11.5 ilipokumbana na vikomo vichache zaidi.
- 15
Jeremy Spence et al. “Changamoto Inayofuata kwa Usalama wa Mtandao wa Kiwakala: Kipimo Linganishi cha Uhandisi wa Kinyume Kilicho Halisi na Kisicho na Uchafuzi(fungua katika dirisha jipya).” arXiv:2608.11469v1, 2026.
- 16
Tunapofanya majaribio katika miundo ya wahusika wengine, tunatumia mpangilio rahisi zaidi wa utafiti. Codex ina usanidi changamani zaidi wa uzalishaji, ambao unaweza kusababisha viwango tofauti vya hitilafu za muundo ghafi. Kinga za upande wa mtoa huduma na utekelezaji wa zana za kompyuta bado hutofautiana. Watumiaji hawapati hali ya kutokuwa na uthibitisho katika Codex, kwa kuwa ni usanidi wa ndani wa utafiti.
- 17
