OpenAI

GPT-6 Astra: A new generation of intelligence

Një brez i ri inteligjence

Përditësuar më 22 shtator 2026: Po zgjerojmë familjen tonë GPT‑6 me GPT‑6 Sol dhe GPT‑6 Luna. Mëso më shumë.

Po prezantojmë GPT‑6 Astra, modelin më inteligjent dhe më të harmonizuar në botë.

GPT‑6 Astra bashkon vite kërkimesh dhe investimesh të mëdha në paratrajnim, trajnim përforcues dhe harmonizim. Astra është i nivelit më të lartë në përdorimin e kompjuterit, shfletimin në internet, inxhinierinë softuerike, sigurinë kibernetike, shkencë dhe punë profesionale. Astra arrin ngopjen në nivelin 4 të FrontierMath me një rezultat prej 98%, pasi ka ndihmuar tashmë në zgjidhjen e problemeve të hapura prej kohësh⁠ në matematikë. Astra arrin gjithashtu ngopjen në ARC-AGI-3 me një rezultat prej 99,9% dhe në ExploitBench me një rezultat prej 100%. Gjithashtu, vendos një avangardë të re në përdorimin e kompjuterit dhe shfletuesit, duke trajtuar punët profesionale më kërkuese me shpejtësi, saktësi dhe gjykim të pakrahasueshëm. 

GPT‑6 Astra po ofrohet sot për një numër të kufizuar organizatash dhe gjatë ditëve në vijim do të bëhet i disponueshëm për të gjithë përdoruesit e ChatGPT Plus, Pro, Business dhe Enterprise, si edhe përmes API-së së OpenAI, Microsoft Azure dhe AWS Bedrock.

“Në ARC-AGI-3, Astra tejkaloi bazën tonë të efikasitetit të veprimeve njerëzore në 96% të niveleve, duke arritur në mënyrë efektive barazinë njerëzore në këtë standard. Jo vetëm që ky është modeli më i mirë që kemi testuar ndonjëherë, por ai përfaqëson gjithashtu një ndryshim domethënës në performancën e modeleve avangardë - jo vetëm në aftësinë e tij për të naviguar në mjedise të reja dhe për t'i zgjidhur ato, por edhe në efikasitetin me të cilin mëson ta bëjë këtë.”
Greg Kamradt, Fondacioni ARC Prize

Astra është modeli ynë më i harmonizuar, me përmirësime të konsiderueshme në kuptimin e qëllimit të përdoruesit dhe sjelljes së modelit—mund t'i delegosh detyrat me besim më të madh në gjykimin e Astra-s. Si një mënyrë për ta testuar këtë, krijuam një vlerësim të ri të bazuar në incidentin e Hugging Face, që vlerëson nëse një model që përballet me një detyrë të vështirë ose të pamundur do të dalë përtej fushës së tij të synuar. Krahasuar me GPT‑5.6 Sol, i cili, pa masat mbrojtëse të prodhimit, doli përtej objektivit të autorizuar në 48% të rasteve, GPT‑6 Astra e bëri këtë në 0% të rasteve.

Modeli më i mirë në botë për përdorimin e kompjuterit

GPT‑6 Astra shënon një avangardë të re në shpejtësinë, saktësinë dhe sigurinë e përdorimit të kompjuterit. Mund të merret me detyra të lodhshme, si plotësimi i formularëve online, përditësimi i të dhënave të klientëve në një CRM dhe organizimi i kalendarit tënd. Mund të kryejë kërkime në internet dhe të hartojë përmbledhje në emailin tënd ose në redaktuesin tënd të dokumenteve. Ai mund të analizojë të dhëna shkencore, të gjenerojë grafikë, të krijojë një faqe interneti dhe të kryejë kontrolle QA të frontend-it për t’u siguruar që të gjitha funksionalitetet në atë sajt funksionojnë. Mund të të ndihmojë të instalosh dhe testosh softuer në mënyrë autonome, si dhe të zgjidhësh problemet që sheh në ekran. Këto përmirësime pasqyrohen gjithashtu në rezultatet tona të vlerësimit të nivelit më të avancuar.

Këto përmirësime gjithashtu sjellin rritje të konsiderueshme të efikasitetit në detyrat reale të punës së bazuar në njohuri. Në simulimet e vonesës në OSWorld 2.0, Astra arrin performancë më të lartë në përdorimin e kompjuterit, duke përdorur rreth 47% më pak kohë për detyrë se GPT‑5.6 Sol, duke arritur 72,6% në rreth 40 minuta për detyrë, krahasuar me 65,7% në rreth 75 minuta.3

Aftësitë e GPT‑6 Astra për përdorimin e kompjuterit mund të shihen në rezultate në fusha të ndryshme, duke përfshirë zhvillimin e lojërave, inxhinierinë elektrike dhe punën e përditshme që mbështetet në njohuri:

Krahas Astrës, po përditësojmë gjithashtu strukturën e Codex për të përmirësuar ndjeshëm shpejtësinë e përdorimit të kompjuterit. E kombinuar me efikasitetin e Astrës, kjo sjell përfundimin e detyrave 1,9 herë më të shpejtë krahasuar me përvojën aktuale të GPT‑5.6 Sol, në testin krahasues Mind2Web. Përmirësimet e modelit në shpejtësi nënkuptojnë se ai mund të kryejë për ty shumë detyra të përditshme që kërkojnë kohë, më shpejt se sa mund t'i kryesh ti.4

“Po integrojmë GPT‑6 Astra në strukturën e Devin-it në ditën e lançimit, ku ofron performancë të nivelit më të lartë në standardin tonë të brendshëm të testimit. Aftësitë e tij të shkëlqyera në përdorimin e kompjuterit, në shkrim dhe në kuptimin e bazës së kodit e përmirësuan testimin që në fillim: videot janë dukshëm më të lehta për t’u ndjekur, ndërsa raportet janë më të qarta dhe më koncize”
Silas Alberti, Zëvendëspresident i lartë për kërkimin, Cognition

Një ndryshim i madh cilësor në punën profesionale

GPT‑6 Astra kombinon përparimet në përdorimin e kompjuterit me trajnim të synuar për mjedise profesionale, për të ndihmuar në përballimin e detyrave komplekse të punës. Ai bashkon inteligjencën e nevojshme për probleme komplekse me aftësinë për të kryer flukse pune me shumë hapa dhe për të prodhuar dokumente, fletëllogaritëse dhe prezantime të përpunuara mirë.

GPT‑6 Astra është modeli ynë më i mirë për t'iu përmbajtur shablloneve ekzistuese dhe për të krijuar slajde të strukturuara mirë që përcjellin në mënyrë të përmbledhur pikat kryesore përmes një narrative të strukturuar. Krijon dokumente, prezantime, fletëllogaritëse dhe analiza të qarta e të mirëstrukturuara, që ndjekin shabllonet e tua dhe përputhen me stilin tënd të shkrimit dhe atë vizual. Astra është trajnuar gjithashtu që të përfshijë në mënyrë specifike në rezultatet e saj vetëm kontekstin që ka rëndësi, në vend që të përsërisë informacion të panevojshëm për detyrën në fjalë. E gjithë kjo do të thotë se mund të gjenerojë artefakte më të gatshme për përdorim të menjëhershëm, që përputhen me kontekstin dhe standardet e biznesit tënd.

GPT‑6 Astra sjell gjithashtu gjykim vizual më të fortë në faqet e internetit, lojërat, aplikacionet dhe paraqitjet që krijon. Me Sites⁠(hapet në një dritare të re) në ChatGPT, Astra mund të krijojë, të hostojë dhe të ndajë faqe interneti, aplikacione uebi dhe lojëra drejtpërdrejt nga një kërkesë.

“Astra na jep një avantazh të rëndësishëm si në aftësi, ashtu edhe në efikasitet. Ajo ekzekuton me sukses flukset tona më komplekse të punës krijuese, duke përdorur deri në 20% më pak tokena sesa modelet e tjera që kemi testuar. Më e rëndësishmja, për klientët tanë, kjo nënkupton rezultate me cilësi më të lartë.”
Alex Mashrabov, drejtor ekzekutiv dhe bashkëthemelues, Higgsfield AI

Kur udhëzimet lënë vend për interpretim, GPT‑6 Astra është më i mirë se modelet e mëparshme në marrjen e vendimit të duhur. Përdor kontekstin për të plotësuar boshllëqet e zakonshme dhe bën pyetje të përqendruara kur përgjigjja mund të ndryshojë rezultatin. Në Codex, ai mund të bëjë pyetje në mënyrë asinkrone ndërsa vazhdon punën që nuk varet nga përgjigjja jote. Nëse nuk përgjigjesh, ai vazhdon me supozime të arsyeshme aty ku është e përshtatshme, por pret kontributin tënd për vendimet me pasoja.

Shembujt më poshtë tregojnë se si Astra bashkëpunon në detyra të përditshme ku informacioni që mungon mund ta ndryshojë ndjeshëm përgjigjen.

Astra është gjithashtu më e aftë për të ruajtur orientimin ndërsa detyra evoluon. Modelet e mëparshme ndonjëherë i trajtonin mesazhet orientuese si një qëllim të ri, duke humbur gjurmët e kërkesës fillestare ose kufizimeve të mëparshme. Astra përfshin kërkesa të reja, ndryshon drejtim kur i kërkohet dhe u përgjigjet pyetjeve anësore pa e lënë pas detyrën më të gjerë.

“Astra është një përmirësim i ndjeshëm i cilësisë krahasuar me GPT‑5.6 Sol në detyra komplekse ligjore. Në testimet tona fillestare, Astra u dallua duke iu qasur punës ligjore ashtu siç do ta bënte një avokat i mprehtë: dallon dokumentet nga regjistrat e konsoliduar, nxjerr në pah supozimet e pambështetura dhe i shndërron boshllëqet në pozicione konkrete hartimi.
Niko Grupen, drejtues i kërkimeve të aplikuara, Harvey

Kodimi

GPT‑6 Astra është modeli më i mirë për inxhinieri softuerike deri më sot.

1 nga 2
“GPT‑6 Astra ofron performancë të nivelit më të lartë në standardet tona të brendshme të kodimit dhe tregon një hap të qartë përpara në vlerësimet e intuitës për tregtim, krahasuar me GPT‑5.6 Sol. Kur përdoret për kodim agjentik, GPT‑6 Astra komunikon në një mënyrë që zhvilluesit mund ta ndjekin më lehtë dhe prodhon kod që kërkon më pak përsëritje për të arritur cilësinë e prodhimit.”
John Crepezzi, Asistentët me IA, Jane Street

Me Astra, po prezantojmë një mënyrë të re që Codex të ruajë dhe të rikuperojë kontekstin kur dritarja e kontekstit mbushet. Historikisht, modelet kanë përdorur kompaktimin për të përmbledhur punën gjatë sesioneve të gjata, si kur diagnostikojnë probleme komplekse ose trajtojnë rifaktorime të mëdha. Çdo kompaktim mund të lërë jashtë detaje se pse një rregullim dështoi ose si sillet një komponent. Në Codex, Astra mund të mbajë shënime nëpër dritare konteksti, duke ruajtur detajet e grumbulluara pa i ngjeshur vazhdimisht në një përmbledhje të vetme. Dritaret e mëparshme të kontekstit mbeten të kërkueshme, kështu që Astra mund të gjejë kërkesat ose rezultatet e testimit nga mesazhet e mëparshme dhe rezultatet e mjeteve—edhe nëse ai informacion nuk është përfshirë në shënimet e tij. Mund ta aktivizosh këtë veçori eksperimentale në config.toml të Codex,⁠(hapet në një dritare të re) dhe do të bëhet parazgjedhja për Astra në javët e ardhshme.

Përparimi i zbulimit shkencor

“Historia është: fundi i një epoke, fillimi i një tjetre.”
Greg Burnham, EpochAI

GPT‑6 Astra është një përparim i madh për zbulimin shkencor, matematikën dhe shëndetësinë. Sot po ndajmë dy rezultate të tjera mbi boshllëqet ndërmjet numrave të thjeshtë.9 dhe 10

Astra vendos gjithashtu rekorde të reja në një sërë vlerësimesh të matematikës dhe shkencës.

Astra mund të ndihmojë me punën praktike që qëndron pas zbulimit shkencor. Duke kombinuar arsyetimin shkencor me përdorimin e kompjuterit, ajo mund të punojë drejtpërdrejt në softuer të specializuar për të shqyrtuar të dhënat dhe për të eksploruar rezultatet, duke i ndihmuar studiuesit të vlerësojnë provat dhe të vendosin se çfarë të hetojnë më pas.

Siguria kibernetike

Siç diskutuam në përditësimin tonë për sigurinë⁠, Astra shënon një hap të rëndësishëm përpara në aftësitë kibernetike dhe arrin pragun kritik në sigurinë kibernetike sipas Preparedness Framework tonë. Aftësia e tij për të identifikuar dhe zhvilluar shfrytëzime zero-day mund t’i ndihmojë mbrojtësit të gjejnë dhe rregullojnë cenueshmëritë, por gjithashtu krijon nevojën për masa mbrojtëse më të forta. Për të kuptuar se deri ku shtrihen këto aftësi, e testuam Astra-n përmes vlerësimeve nga ekspertë të brendshëm dhe të palëve të treta.

Fillimisht e testuam modelin pa masa mbrojtëse të prodhimit në ExploitBench dhe ExploitGym, të cilët vlerësojnë nëse modelet mund t’i shndërrojnë cenueshmëritë e njohura të softuerit në shfrytëzime funksionale. Në ExploitBench, Astra arriti rezultatin e përsosur prej 100%, krahasuar me rezultatin prej 78,5% të arritur nga GPT‑5.6 Sol, modeli ynë i mëparshëm avangardë me aftësi kibernetike. Në ExploitGym, Astra arriti një normë suksesi prej 42,4%, krahasuar me 30,3% për GPT‑5.6 Sol, duke përdorur ndjeshëm më pak tokenë në dalje.13

Duke pasur parasysh shqetësimet se ekspozimi ndaj cenueshmërive historike të softuerit mund të ketë ndikuar në rezultatet e testeve krahasuese, ne e vlerësuam gjithashtu Astra-n në dy teste krahasuese të reja. Së pari, ndërtuam një vlerësim të brendshëm “ExploitBench (qershor–gusht 2026)” për të testuar zhvillimin e shfrytëzimeve duke përdorur cenueshmëri nga tre muajt e mëparshëm.14 Astra arriti shkallë ndjeshëm më të larta të ekzekutimit arbitrar të kodit se GPT‑5.6 Sol në këtë grup të dhënash, duke përdorur shumë më pak tokenë në dalje. Gjatë vlerësimit, Astra madje zbuloi dhe përdori dy cenueshmëri zero-day të panjohura më parë. Po ua bëjmë të ditura të dyja cenueshmëritë mirëmbajtësve të tyre.

Ne testuam gjithashtu Astra në SRE-Bench15, një test krahasues që mat nëse modelet mund të kryejnë inxhinieri të kundërt të binarëve të softuerit për të kuptuar logjikën e tyre thelbësore pa pasur akses në kodin burimor të papërpunuar. Astra zgjidhi 88,0% të detyrave në një përpjekje të vetme dhe 99,2% brenda katër përpjekjeve, krahasuar përkatësisht me 55,9% dhe 68,7% për GPT‑5.6 Sol.

Përtej testeve krahasuese, vlerësimet e drejtuara nga ekspertë zbuluan se Astra, kur ekzekutohej pa mekanizmat mbrojtës të prodhimit, mund të përdorte cenueshmëri të panjohura më parë për të arritur ekzekutim arbitrar kodi në shfletues të përforcuar dhe për të krijuar shfrytëzime për përshkallëzim privilegjesh në sisteme operative të përforcuara.

Siç diskutuam në Dritarja e mbrojtësit, aftësitë kibernetike avangardë mund t’i ndihmojnë mbrojtësit t’i gjejnë cenueshmëritë më shpejt, por gjithashtu i bëjnë ato cenueshmëri më të lehta për t’u shfrytëzuar, duke rritur urgjencën që mbrojtësit të përshtaten. Me versionin e Astra-s që lançohet sot, mbrojtësit mund ta përdorin për të kryer detyra si rishikimi i kodit për siguri dhe aplikimi i arnimeve.

Megjithatë, Astra do të refuzojë të kryejë detyra më të avancuara të sigurisë kibernetike, si krijimi i shfrytëzimeve si provë koncepti për cenueshmëritë. Përmes OpenAI Daybreak⁠, planifikojmë të zgjerojmë aksesin dhe të ofrojmë gradualisht masa mbrojtëse më pak kufizuese në javët e ardhshme. Kjo do të mundësojë më shumë rrjedha pune mbrojtëse, përfshirë validimin e cenueshmërive dhe të provave të konceptit, analizën e softuerëve keqdashës dhe inxhinierinë e zbulimit.

Kemi forcuar gjithashtu mbrojtjet tona kundër keqpërdorimit të mundshëm kibernetik, duke u mbështetur në grupin tonë të masave mbrojtëse për GPT‑5.6 Sol. Këto përfshijnë qëndrueshmëri më të madhe të modelit për t’u përballur më mirë me heqjet e mundshme të kufizimeve mbrojtëse dhe më shumë kontekst për sistemet tona të monitorimit. Kemi vazhduar vlerësimet rigoroze të brendshme dhe të jashtme, përfshirë vlerësimet e automatizuara me sulmuesit tanë të brendshëm për simulim sulmesh. Më shumë hollësi rreth masave tona mbrojtëse kibernetike dhe testimit gjenden në përmbledhjen e sigurisë së Astra⁠ dhe në kartë sistemi⁠(hapet në një dritare të re)..

Përafrimi dhe vendosja e përgjegjshme e GPT‑6 Astra

Astra është modeli ynë më i harmonizuar. Astra shquhet për kujdesin që tregon, respektimin e kufijve të detyrës dhe komunikimin transparent. Kjo punë është produkti më i fundit i programit tonë afatgjatë të kërkimit, të përqendruar në trajnimin e modeleve që mbeten në përputhje me qëllimin njerëzor nga fillimi deri në fund.

Në mjedise të ndjeshme, Astra vepron me kujdes në përpjesëtim me nivelin e rrezikut. Në një vlerësim të detyrave të përdorimit të kompjuterit, të përzgjedhura në mënyrë kundërshtuese për të nxitur sjellje të papërshtatshme, Astra ishte më e suksesshme në shmangien e pasojave të paqëllimshme. Funksionimi me masa shtesë sigurie të ofruara si parazgjedhje dha performancë edhe më të lartë.

Astra shkakton më pak rezultate të mospërputhura se çdo model tjetër avangardë i testuar. Për një krahasim të drejtë, përdorëm një strukturë të përgjithshme për agjentë kompjuterpërdorues (bazuar në mjetet native të përdorimit të kompjuterit, të disponueshme si në API-në OpenAI Responses⁠(hapet në një dritare të re) ashtu edhe në API-në Anthropic Messages⁠(hapet në një dritare të re)) dhe pa masa mbrojtëse shtesë që zakonisht zbatohen për përdoruesit e Codex dhe ChatGPT Punë (rishikim automatik, politikë konfirmimi).

Astra ka gjithashtu më shumë gjasa të veprojë brenda kufijve të vendosur nga përdoruesi dhe të nënkuptuar nga mjedisi i saj. Në një vlerësim të brendshëm, Astra nuk u përpoq asnjëherë të anashkalonte një refuzim nga Rishikimi automatik i Codex. Kjo mbeti e vlefshme edhe kur Rishikimi automatik ishte konfiguruar qëllimisht në mënyrë që të mund të anashkalohej dhe detyra ishte e pamundur të përfundohej ndryshe. Ky respekt për kufizimet e mjedisit përputhet me rezultatet e vlerësimit tonë për një detyrë kibernetike të pamundur, të cilat i ndamë në hyrjen e këtij postimi, si dhe me gjetje të tjera të dokumentuara në kartë sistemi⁠(hapet në një dritare të re).

Astra gjithashtu vendos standarde të reja në komunikimin transparent me përdoruesit. Në një vlerësim, Astra ka 3 herë më pak gjasa se GPT‑5.6 Sol të bëjë paraqitje të pasakta për aftësitë e saj dhe mundësitë që ofron.

Në vlerësimin tonë të halucinacioneve të aftësive, Astra tregon një përmirësim të konsiderueshëm krahasuar me GPT‑5.6 Sol, duke bërë më pak pretendime mashtruese për aftësitë e saj.

Vlerësimet tona zbuluan se arsyetimi i shkruar i Astra-s është më i vështirë për t’u monitoruar sesa ai i GPT‑5.6 i Sol-it, bazuar në teste që i kërkonin shprehimisht t’i shmangej monitorimit. Këtë ia atribuojmë kontrollit më të madh të Astra-s mbi arsyetimin e shkruar në detyra më të thjeshta dhe aftësisë për të zgjidhur probleme me më pak hapa të shkruar. Astra ende duket se ka vështirësi të fshehë arsyetimin e nevojshëm për detyra komplekse, por ne e marrim seriozisht këtë rënie. Përmirësimi i monitorueshmërisë mbetet një përparësi kërkimore dhe karta shoqëruese e sistemit⁠(hapet në një dritare të re) paraqet në detaje gjetjet tona dhe punën në vazhdim.

Trajnimi për përputhje është thelbësor për qasjen tonë ndaj vendosjes në përdorim. Si një shtresë shtesë mbrojtjeje, ne ndërtojmë gjithashtu masa mbrojtëse të sistemit, si Codex shqyrtimi automatik⁠(hapet në një dritare të re) dhe monitorojmë arsyetim dhe veprimet e agjentëve për të ndihmuar në zbulimin dhe frenimin e sjelljes së pasigurt. Siç përshkruhet në përditësimin tonë të sigurisë⁠, po zbatojmë gjithashtu në prodhim monitorimin e mospërputhjes për modelet e klasës Astra, për të pasur dukshmëri mbi mospërputhjen dhe për të ndihmuar në frenimin e rasteve të saj më të rënda. Këto masa mbrojtëse ngjajnë me monitorimin tonë për vëniet e brendshme në përdorim dhe përfshijnë një sistem klasifikuesish që kontrollojnë arsyetimin dhe veprimet e modelit për sjellje të paautorizuar dhe ndalojnë automatikisht veprimtarinë potencialisht të paautorizuar.

Duke marrë parasysh rritjen e konsiderueshme të aftësive të sigurisë kibernetike të Astra-s, po tregohemi veçanërisht të kujdesshëm për ta bërë këtë implementim të sigurt dhe të mbrojtur. Kontrollet shtesë të sigurisë ndonjëherë mund të ngadalësojnë, ndërpresin përkohësisht ose ndalojnë punën legjitime, duke përfshirë sigurinë kibernetike mbrojtëse. Nëse një detyrë pezullohet në ChatGPT ose Codex, mund të të kërkohet ta shqyrtosh veprimin para se të vazhdosh. Në API, detyra do të ndalet. Këto kontrolle ndonjëherë mund të ndërpresin punën legjitime, dhe ne po vazhdojmë ta përmirësojmë këtë sistem për të reduktuar ndërprerjet e panevojshme. Monitorimi i mosharmonizimit nuk mund ta zëvendësojë harmonizimin: synimi ynë është të ndërtojmë modele që qëndrojnë në mënyrë të besueshme brenda fushës së tyre të autorizuar, që këto masa mbrojtëse të mos kenë nevojë të ndërhyjnë.

Disponueshmëria

GPT‑6 Astra po shpërndahet sot për një grup të kufizuar organizatash dhe gjatë ditëve në vijim do të bëhet i disponueshëm për të gjithë përdoruesit e ChatGPT Plus, Pro, Business dhe Enterprise, si dhe përmes OpenAI API, Microsoft Azure dhe AWS Bedrock. Përdorimi i Astra përfshihet në kufijtë ekzistues të abonimit—përdoruesit dhe bizneset do të mund të blejnë gjithashtu kredite për përdorim shtesë. Përdoruesit e planeve Pro, Business dhe Enterprise do të kenë gjithashtu qasje në GPT‑6 Astra Pro. Administratorët e Enterprise mund të aktivizojnë Astra për hapësirën e tyre të punës; qasja është e çaktivizuar si parazgjedhje në momentin e lançimit.

Astra mbështet pa mbajtje të dhënash për klientët e kualifikuar të API-së dhe, siç njoftuam muajin e kaluar, po testojmë Përpunimin privat të sigurisë për të forcuar monitorimin e sigurisë duke ruajtur privatësinë e klientëve.

Për zhvilluesit, GPT‑6 Astra do të jetë i disponueshëm në API-në e OpenAI si gpt-6-astra dhe përmes Microsoft Azure dhe Amazon Bedrock.

Çmimi Standard i API-së së OpenAI është $10 për milion tokenë hyrës dhe $50 për milion tokenë dalës. Tarifa të veçanta zbatohen për leximet dhe shkrimet në cache. Modaliteti i shpejtë është i disponueshëm për GPT‑6 Astra në API dhe ofron shpejtësi deri në 2 herë më të lartë se ajo e përpunimit Standard, me 2 herë çmimin e Standard.

Përdorimi i kompjuterit

Përdorimi i kompjuterit

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Provimi i fundit i agjentëve

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, grup i të dhënave jashtë linje, rezultat i pjesshëm)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (pa mjete)

92,7%

76,9%

-

87,3%17

-

-

Profesional

Profesional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4%

18,1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

Kuartete harqesh të OpenScore (1 - OMR-NED)

0,84

0,19

-

-

-

-

Detyra të brendshme të dizajnit

50.0%

47,4%

-

35,8%

-

-

Detyra të brendshme të shkencës së të dhënave

40,9%

30,5%

-

34,7%

-

-

Indeksi i inteligjencës së analizës artificiale v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Kodimi

KodimGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended (rezultati)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Main (rezultati)53,3% 847,5%50,9%53,5%53,4%43,6%
Detyrat e brendshme të migrimit të bazës së të dhënave63,9%42,7%57,8%50,3%--
Indeksi i agjentit të kodimit i Artificial Analysis v1.467,065,1-67,268,161,2

Akademik

Akademik

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21.4%

30,0%

-

FrontierMath Niveli 4 (v2)

97,6%

83.0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (me mjete)

57.2%

-

65,0%

63,8%

63,6%

-

Shkenca dhe shëndeti

Shkenca dhe ChatGPT HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (I brendshëm)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (me rregullim sipas gjatësisë)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

Siguria kibernetike

Siguria kibernetikeGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70%-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (qershor-gusht 2026)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Përshtatja

Përshtatja

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Vlerësim krahasues i brendshëm i sigurisë së përdorimit të kompjuterit (sa më i ulët, aq më mirë)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Standard i brendshëm matës i sigurisë së përdorimit të kompjuterit, me AutoReview (sa më i ulët, aq më mirë)

1,8%

4,3%

-

-

-

-

Vlera krahasuese e brendshme e anashkalimit (më e ulët është më mirë)

0,00%

0,29%

-

-

-

-

Kurthi kibernetik i ExploitGym (më i ulët është më mirë)

0,0%

48,2%

-

-

-

-

ExploitGym i pamundur

100,0%

-

-

-

-

-

Vlerësimi i brendshëm krahasues i halucinacionit (sa më i ulët, aq më mirë)

4,2%

12,2%

-

-

-

-

Kontekst i gjatë

Kontekst i gjatë

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73,8%

-

-

-

-

Arsyetim abstrakt

Arsyetim abstraktGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9% 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Rezultatet e vlerësimit janë në nivelin maksimal për çdo nivel përpjekjeje. Vlerësimet e GPT u kryen në mjedisin tonë kërkimor ose përmes API-së sonë, gjë që mund të japë rezultate paksa të ndryshme nga ChatGPT në prodhim për shkak të dallimeve në promptet e sistemit, mjetet e disponueshme etj.

Shënime në fund

  1. 1

    Në ARC-AGI-3, GPT-6 Astra u ekzekutua me strukturën tonë të Responses API-së⁠, e cila ndryshon dy cilësime për t'iu përshtatur më mirë performancës në botën reale. Ndryshimet nuk synojnë posaçërisht ARC-AGI-3.

  2. 2

    GPT-5.6 Sol i referohet versionit të disponueshëm në API-në tonë, ChatGPT Codex dhe ChatGPT Punë. Versioni në ChatGPT Bisedë është paksa i ndryshëm.⁠

  3. 3

    OSWorld V2-Offline është një nënbashkësi e OSWorld V2 origjinal që funksionon pa qasje në internet. Performanca e modelit Claude në OSWorld-V2 Offline u riprodhua nga autorët në renditjen zyrtare⁠(hapet në një dritare të re). Në OSWorld 2.0, rezultatet për Claude përdorin cilësimet zyrtare dhe jo detyrat e modifikuara dhe vlerësimin e modifikuar nga kartë sistemi Fable 5.1.

  4. 4

    Kohët e model janë kohët e kaluara të raportuara për ekzekutimet përkatëse të demonstrimeve. Klipet e shfaqura janë fragmente të redaktuara.

  5. 5

    Në BenchCAD, rezultatet e Claude pasqyrojnë 3 modifikime të vlerësimit, të detajuara në kartë sistemi Fable 5.1⁠(hapet në një dritare të re).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, dhe Noah A. Smith. “LEGATO: Qasje e përgjithësueshme në shkallë të gjerë, skaj më skaj, për OMR për partitura të shtypura⁠(hapet në një dritare të re).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower dhe Peter Jonas. “Korpusi i kuarteteve harqesh të OpenScore⁠(hapet në një dritare të re).” Punimet e Konferencës së 10-të Ndërkombëtare mbi Bibliotekat Digjitale për Muzikologji, fq. 49–57. ACM, 2023.

  8. 8

    Në FrontierCode, GPT-6 Astra u ekzekutua me një mesazh zhvilluesi  të ngjashëm me një seksion të mesazhit të tij të zhvilluesit në Codex⁠(hapet në një dritare të re): "Shmang krijimin e një numri të tepërt skedarësh testimi. Krijo një skedar të ri testimi vetëm kur kërkohet nga konventat e depos ose kur asnjë skedar ekzistues nuk është i përshtatshëm. Shmang pastrimet e palidhura dhe kompleksitetin e panevojshëm. Ripërdor mjetet ndihmëse ekzistuese të përshtatshme. Lexo udhëzimet përkatëse të depos dhe inspekto kodin, testet, dokumentacionin dhe CI-në aty pranë. Ndiq konventat e vendosura. Qëllimi është kod i pastër dhe i bashkueshëm." Kërkesa nuk u optimizua për vlerësimin.

  9. 9

    E para ka të bëjë me sa afër njëri-tjetrit mund të shfaqen numrat e thjeshtë, pavarësisht se sa larg shkon përgjatë boshtit numerik. Për më shumë se një dekadë, rezultati më i mirë i njohur vërtetonte se ekzistojnë pafundësisht shumë çifte numrash të thjeshtë me diferencë jo më të madhe se 246. Julia Stadlmann⁠(hapet në një dritare të re) së fundmi e përmirësoi atë kufi në 240. Astra ndihmoi në vendosjen e një kufiri më të fortë prej 186, duke treguar se pafundësisht shumë çifte ndodhen brenda kësaj distance më të vogël. Boshllëqe të vogla midis numrave të thjeshtë: Prova⁠(hapet në një dritare të re) dhe kërkimi mbështetës⁠(hapet në një dritare të re).

  10. 10

    E dyta ka të bëjë me boshllëqe jashtëzakonisht të mëdha midis numrave të thjeshtë. Astra përmirësoi një term në një kufi për këto boshllëqe, i cili kishte mbetur i pandryshuar për më shumë se 80 vjet. Po ndajmë provat, versionin e shkurtuar të zinxhirit të mendimit dhe materialet e verifikimit për të dy rezultatet. Boshllëqe të mëdha midis numrave të thjeshtë: Vërtetimi⁠(hapet në një dritare të re) dhe hulumtimi mbështetës⁠(hapet në një dritare të re).

  11. 11

    Ne vlerësuam në mënyrë të pavarur të gjitha modelet Claude duke ndjekur procedurën e synuar të HealthBench Professional, duke përdorur GPT‑5.4 vlerësim dhe rezultate të pakufizuara, të përshtatura sipas gjatësisë. Për Fable 5.1, përdorëm Opus 5 si alternativë rezervë për refuzimet nga ofruesi.

  12. 12

    Claude Fable 5 dhe 5.1 nuk përfshihen në LifeSciBench Gold v1, GeneBench Pro v13 dhe MedChemBench, pasi refuzojnë shumicën e pyetjeve në këto vlerësime.

  13. 13

    Në ExploitGym, testuam Astra dhe Sol pa kufirin kohor prej 6 orësh, për të vlerësuar më mirë aftësitë e tyre të plota kibernetike. Janë aq të shpejtë sa kjo ka pak ndikim.

  14. 14

    ExploitBench (qershor–gusht 2026) përmban 20 cenueshmëri V8 me ashpërsi të lartë në 13 versione të qëndrueshme të Chrome. Testi krahasues verifikon nëse agjentët mund të arrijnë ekzekutim arbitrar të kodit në V8 dhe në versionet zyrtare të Chrome për Linux duke shfrytëzuar çdo cenueshmëri të specifikuar. Disa cenueshmëri të përfshira mund të mos lejojnë ekzekutimin arbitrar të kodit nën kufizimet e vlerësimit, prandaj një shkallë suksesi prej 100% mund të mos jetë e arritshme. Shënim: rezultati 5,5% i GPT-5.6 Sol është një artefakt i kufirit prej 300 raundesh në testin krahasues, kufi që klientët realë që përdorin Max nuk do ta kishin. Modeli me cilësime të ngjashme arriti një rezultat prej 11,5% kur përballej me më pak kufizime.

  15. 15
  16. 16

    Kur testojmë në modele të palëve të treta, përdorim një konfigurim më të thjeshtë kërkimor. Codex ka një konfigurim prodhimi më kompleks, i cili mund të rezultojë në norma të ndryshme gabimesh të modelit të papërpunuar. Masat mbrojtëse nga ana e ofruesit dhe zbatimet e mjeteve kompjuterike ende ndryshojnë. Përdoruesit nuk e përjetojnë skenarin pa konfirmim në Codex, pasi ky është një konfigurim i brendshëm kërkimor.

  17. 17

    Për ScreenSpot-Pro dhe ExploitGym, rezultatet e Fable që raportojmë vijnë nga Mythos, që është Fable me më pak masa mbrojtëse.