OpenAI

GPT-6 Astra: A new generation of intelligence

Generasi anyar pilihan kecerdasan

Kita ngenalaké GPT‑6 Astra, model sing paling cerdas lan paling selaras ing donya.

GPT‑6 Astra nggabungaké riset suwene pirang-pirang taun lan taruhan gedhé ing latihan awalan, sinau penguatan, lan penyelarasan. Astra iku paling mutakhir ing babagan penggunaan komputer, browsing, rekayasa piranti lunak, keamanan siber, sains, lan pakaryan profesional. Astra nggayuh wates maksimal ing FrontierMath Tingkat 4 kanthi skor 98%, sawisé wis mbantu ngrampungaké masalah terbuka sing wis suwé durung bisa dirampungaké ing matematika. Astra uga nyampurnakake ARC-AGI-3 kanthi skor 99,9% lan ExploitBench kanthi skor 100%. Uga netepake tataran tercanggih anyar ing penggunaan komputer lan browser, nangani pakaryan profesional sing paling nuntut kanthi kacepetan, akurasi, lan pertimbangan sing ora ana tandhingane. 

GPT‑6 Astra lagi diluncurake kanthi bertahap dina iki kanggo sawetara organisasi sing winates lan sajrone sawetara dina sabanjure bakal kasedhiya kanggo kabeh pengguna ChatGPT Plus, Pro, Business, lan Enterprise, uga liwat OpenAI API, Microsoft Azure, lan AWS Bedrock.

“Ing ARC-AGI-3, Astra ngluwihi patokan efisiensi tumindak manungsa kita ing 96% tataran, saéngga kanthi efektif nggayuh kesetaraan karo manungsa ing tolok ukur kasebut. Iki ora mung model paling apik sing tau diuji, nanging uga nuduhaké lompatan signifikan ing kinerja model tercanggih - ora mung ing kemampuané kanggo navigasi lan ngrampungaké lingkungan anyar, nanging uga ing sepira efisiené model iki sinau nindakake.”
Greg Kamradt, ARC Prize Foundation

Astra minangka model kita sing paling selaras, kanthi dandan gedhe ing pangerten babagan maksud pengguna lan prilaku model—tugas bisa dipasrahake kanthi luwih yakin marang pertimbangan Astra. Minangka salah siji cara kanggo nguji iki, kita nggawe evaluasi anyar sing adhedhasar insiden Hugging Face kanggo ngevaluasi apa model sing ngadhepi tugas angel utawa mokal bakal ngluwihi cakupan sing dikarepake. Dibandhingake karo GPT‑5.6 Sol, sing tanpa pangreksa produksi ngluwihi target sing diwenangake ing 48% kasus, GPT‑6 Astra nindakake iki ing 0% kasus.

Model penggunaan komputer paling apik ing donya

GPT‑6 Astra nandhani tercanggih ing kacepetan, akurasi, lan keamanan penggunaan komputer. Iki bisa ngrampungake tugas-tugas sing mboseni, kayata ngisi formulir online, nganyari cathetan pelanggan ing CRM, lan ngatur kalender njenengan. Iki bisa nindakake panaliten online lan nyusun draf ringkesan ing email utawa ing editor dokumen njenengan. Iki bisa nganalisis data ilmiah, ngasilake grafik, nggawe situs web, lan nglakokake pamriksan QA frontend kanggo mesthekake kabeh fitur ing situs kasebut bisa mlaku. Iki bisa mbantu njenengan nginstal lan nguji piranti lunak kanthi mandiri, lan ngatasi masalah sing njenengan deleng ing layar. Pangapikan-pangapikan iki uga kacetha ing asil evaluasi paling mutakhir kita.

Pangapikan iki uga ngasilaké paningkatan efisiensi sing signifikan ing tugas pakaryan adhedhasar kawruh nyata. Ing simulasi latensi ing OSWorld 2.0, Astra nggayuh kinerja penggunaan komputer sing luwih dhuwur kanthi wektu saben tugas kira-kira 47% luwih sithik tinimbang GPT‑5.6 Sol, kanthi skor 72,6% ing udakara 40 menit saben tugas, dibandhingaké karo 65,7% ing udakara 75 menit.3

Kapabilitas penggunaan komputer GPT‑6 Astra bisa dideleng ing asil ing manéka bidang, kalebu pangembangan game, teknik elektro, lan pagawéan kawruh saben dina:

Saliyane Astra, kita uga nganyari harness Codex kanggo ningkatake kacepetan penggunaan komputer kanthi signifikan. Digabungake karo efisiensi Astra, iki ndadekake panyelesaian tugas 1.9x luwih cepet dibandhingake pengalaman GPT‑5.6 Sol saiki, ing tolok ukur Mind2Web. Pangapikan kacepetan model kasebut ateges model iki bisa nangani akeh tugas urip sing mbutuhake wektu kanggo njenengan, luwih cepet tinimbang njenengan bisa nindakake dhewe.

“Kita ngintegrasikaké GPT‑6 Astra menyang harness Devin ing dina peluncuran, lan ing kono model iki nyedhiyakake kinerja paling maju ing tolok ukur pengujian internal kita. Kaprigelané sing apik banget kanggo migunakaké komputer, nulis, lan mangertèni basis kode langsung ningkataké pangujian tanpa perlu setelan tambahan: video katon luwih gampang ditututi, lan laporan luwih cetha lan luwih ringkes”
Silas Alberti, SVP Riset, Cognition

Owah-owahan gedhe ing pakaryan profesional

GPT‑6 Astra nggabungaké kemajuan ing penggunaan komputer karo pelatihan sing ditargetake kanggo lingkungan profesional, kanggo mbantu nangani tugas kerja sing kompleks. Model iki nggabungaké pilihan kecerdasan sing dibutuhake kanggo masalah kompleks karo kemampuan kanggo nindakake alur kerja multilangkah lan ngasilaké dokumen, spreadsheet, lan presentasi sing rapi.

GPT‑6 Astra minangka model paling apik kanggo netepi templat sing wis ana lan ngasilake slide sing tata letake apik lan kanthi cekak ngandharake poin-poin utama liwat narasi sing terstruktur. Iki nggawe dokumen, presentasi, spreadsheet, lan analisis sing cetha lan katata kanthi apik, manut cithakan njenengan lan cocog karo gaya penulisan lan visual njenengan. Astra uga dilatih khusus supaya mung nglebokake konteks sing relevan menyang output, tinimbang mbaleni informasi sing ora perlu kanggo tugas sing lagi digarap. Kabeh iki tegese bisa ngasilake artefak sing luwih langsung bisa digunakake lan cocog karo konteks bisnis lan standar njenengan.

GPT‑6 Astra uga nggawa pertimbangan visual sing luwih kuwat menyang situs web, game, aplikasi, lan rendering sing digawe. Kanthi Sites(mbukak ing jendhela anyar) ing ChatGPT, Astra bisa nggawe, ng-host, lan nuduhake situs web, aplikasi web, lan game langsung saka prompt.

“Astra menehi kita kaunggulan sing signifikan ing babagan kemampuan lan efisiensi. Astra kasil nglakokake alur kerja kreatif kita sing paling kompleks nalika nggunakake nganti 20% token luwih sithik tinimbang model liyane sing wis kita uji. Sing paling penting, tumrap pelanggan kita, iki tegese output sing luwih dhuwur.”
Alex Mashrabov, Salah siji pangadeg lan CEO, Higgsfield AI

Nalika instruksi menehi ruang kanggo interpretasi, GPT‑6 Astra luwih apik tinimbang model sadurungé nalika njupuk keputusan sing tepat. Iki nggunakake konteks kanggo ngisi kekosongan rutin lan ngajokake pitakonan sing terarah nalika jawabané bisa ngganti asilé. Ing Codex, GPT‑6 Astra bisa takon kanthi asinkron nalika terus nggarap tugas sing ora gumantung marang wangsulan njenengan. Yen njenengan ora mangsuli, sistem bakal nerusake kanthi asumsi sing wajar yen perlu, nanging bakal ngenteni masukan saka njenengan kanggo keputusan sing penting lan duwé akibat gedhé.

Tuladha ing ngisor iki nuduhaké carané Astra makarya bebarengan ing tugas saben dina, ing ngendi informasi sing ora ana bisa kanthi nyata ngowahi wangsulan.

Astra uga luwih apik kanggo tetep mangerteni arah nalika tugas berkembang. Modhel-modhel sadurungé kadhangkala nganggep pesen pangarah minangka tujuan anyar, nganti kelangan jejak panyuwunan asli utawa watesan sadurungé. Astra nggabungake kabutuhan anyar, ngganti arah nalika dijaluk, lan mangsuli pitakon sampingan tanpa nglirwakake tugas sing luwih amba.

“Astra minangka paningkatan kualitas sing signifikan dibandhingake karo GPT‑5.6 Sol ing tugas hukum sing kompleks. Ing pangujian wiwitan, Astra katon menonjol amarga nyedhaki pakaryan hukum kaya sing ditindakake pengacara sing tliti: mbedakake dokumen saka cathetan sing wis ditetepake, ngatonake asumsi sing ora didhukung, lan ngowahi celah dadi posisi panyusunan draf sing konkrit.
Niko Grupen, Kepala Riset Terapan, Harvey

Ngoding

GPT‑6 Astra minangka model paling apik kanggo rekayasa piranti lunak nganti saiki.

1 saka 2
“GPT‑6 Astra nyedhiyakake kinerja paling canggih ing tolok ukur pangodean internal kita lan nuduhake kemajuan sing jelas ing evaluasi intuisi dagang dibandhingake karo GPT‑5.6 Sol. Nalika digunakake kanggo pangodean agentik, GPT‑6 Astra komunikasi kanthi cara sing luwih gampang diikuti para pangembang lan ngasilake kode sing mbutuhake iterasi luwih sithik kanggo nggayuh kualitas siap produksi.”
John Crepezzi, Asisten AI, Jane Street

Kanthi Astra, kita ngenalake cara anyar supaya Codex bisa njaga lan njupuk maneh konteks nalika jendhela konteks kebak. Sacara historis, model nggunakake kompaksi kanggo ngringkes pakaryan sajrone sesi sing dawa, kayata nalika debug masalah sing rumit utawa nangani refaktor gedhe. Saben proses kompaksi bisa ora nyakup rincian babagan sebabe perbaikan gagal utawa kepiye sawijining komponen tumindak. Ing Codex, Astra bisa nyimpen cathetan ing antarane jendhela konteks, saengga rincian sing wis nglumpuk tetep kajaga tanpa bola-bali dikompres dadi siji ringkesan. Jendhela konteks sadurungé tetep bisa digolèki, mula Astra bisa nemokake persyaratan utawa asil uji saka pesen sadurungé lan output piranti—sanajan informasi kuwi ora kacathet ing cathetané. Bisa ngaktifaken fitur eksperimen iki ing config.toml Codex,(mbukak ing jendhela anyar) lan bakal dadi gawan kanggo Astra sajrone sawetara minggu sing bakal teka.

Majokake panemuan ilmiah

“Critanipun inggih punika: pungkasanipun satunggaling jaman, wiwitanipun jaman sanès.”
Greg Burnham, EpochAI

GPT‑6 Astra minangka kemajuan gedhe kanggo panemuan ilmiah, matématika, lan kesehatan. Dina iki, kita nuduhake rong asil tambahan babagan jarak antarane wilangan prima [WITH LINK]. Astra uga nyetak rekor anyar ing pirang-pirang evaluasi sains:

Astra saged mbiyantu pakaryan praktis ingkang nyengkuyung panemon ilmiah. Kanthi nggabungaké nalar ilmiah lan penggunaan komputer, Astra bisa makarya langsung ing piranti lunak khusus kanggo mriksa data lan njajaki asil, mbantu para panaliti ngevaluasi bukti lan mutusaké apa sing bakal ditliti sabanjuré.

Keamanan siber

Astra minangka lompatan gedhe ing kapabilitas keamanan siber. Kemampuane kanggo ngenali lan ngembangake eksploit zero-day bisa mbantu para pembela nambal kerentanan, nanging uga nuwuhake kabutuhan kanggo pangayoman sing luwih kuwat. Kanggo mangertèni nganti sepira adoh kabisan iki, kita nggunakake evaluasi internal lan evaluasi saka ahli pihak katelu.

Kita luwih dhisik nguji Astra ing ExploitBench lan ExploitGym, sing ngukur apa model bisa nggayuh eksekusi kode arbitrer ing basis kode sing rentan.

Amarga ana keprihatinan manawa paparan marang kerentanan piranti lunak historis bisa mengaruhi asil tolok ukur, kita uga ngevaluasi Astra ing rong tolok ukur anyar. Salah siji, kita nggawe evaluasi internal “ExploitBench (Juni–Agustus 2026)” kanggo nguji pangembangan eksploit nggunakake kerentanan saka telung sasi sadurunge. 2 Astra nggayuh tingkat eksekusi kode arbitrer sing luwih dhuwur tinimbang GPT‑5.6 Sol ing set data iki kanthi token output sing luwih sithik. Sajrone evaluasi, Astra nemokake lan nggunakake rong teknik uwal saka sandbox heap Chrome V8 sing sadurunge durung dingerteni. Kita lagi nglaporake kaloro kerentanan kasebut marang para pangopèn.

Kita uga nguji Astra ing SRE-Bench, sawijining tolok ukur sing ngukur apa model bisa ngrekayasa balik piranti lunak binar kanggo mangerteni logika intiné. Para penulis tolok ukur kasebut mbangun piranti lunak kasebut saka awal lan njaga kode sumberé tetep ora dibukak kanggo umum. Astra kasil ngrampungake 88,0% tugas sajrone siji upaya lan 99,2% sajrone patang upaya, dibandhingake karo 55,9% lan 68,7% kanggo GPT‑5.6 Sol.

Saliyane tolok ukur, pambiji sing dipimpin para ahli nemokake manawa Astra bisa nggunakake kerentanan sing sadurunge durung dingerteni kanggo nggayuh eksekusi kode sembarang ing browser sing wis diperkuat lan nggawe eksploitasi eskalasi hak akses kanggo sistem operasi sing wis diperkuat. Saka kabeh asil kasebut, kita mutusake yen Astra wis nggayuh ambang Kritis ing keamanan siber miturut Kerangka Kesiapan kita.

Kaya sing wis dirembug ing The Defender’s Window, kapabilitas siber tercanggih bisa mbantu para pambela nemokake kelemahan kanthi luwih cepet, nanging uga ndadekake kelemahan kasebut luwih gampang dieksploitasi, saengga nambah urgensi supaya para pambela bisa adaptasi.

Kanggo versi Astra sing diluncurake dina iki, kita ndhukung tugas-tugas pertahanan sing wigati, kayata tinjauan keamanan kode, patching, lan pemodelan ancaman. Nanging, kanthi gawan, Astra bakal nolak nindakake tugas keamanan siber tingkat lanjut kayata panemuan eksploit. Liwat OpenAI Daybreak, kita lagi ngluncurake kita lagi ngluncurake akses sing ora pati mbatesi kanggo klompok alfa para pembela keamanan siber sing dipercaya ing program OpenAI Daybreak. Iki nggedhekake akses menyang alur kerja defensif, kalebu triase lan validasi kerentanan, analisis malware, rekayasa deteksi, lan validasi patch. Kita ngrencanakake nggedhekake akses luwih akeh liwat Daybreak Blue.

Kita uga nguwatake pengamanan marang potensi penyalahgunaan siber, adhedhasar tumpukan pengamanan kanggo GPT‑5.6 Sol. Iki kalebu pelatihan ketangguhan model sing luwih kuwat supaya luwih tahan marang potensi jailbreak lan konteks sing luwih akeh kanggo sistem pemantauan kita. Kita terus nindakake pangujian internal lan eksternal kanthi ketat, kalebu pangujian otomatis karo penyerang red teaming internal kita. Rincian luwih lengkap babagan pengaman siber lan pangujian kita kasedhiya ing kertu sistem Astra lan blog kita.

Nyelarasake lan ngetrapake GPT‑6 Astra kanthi tanggung jawab

Astra minangka model kita sing paling selaras. Astra unggul ing babagan tumindak kanthi ati-ati, ngajeni wates-wates tugas, lan komunikasi kanthi transparan. Karya iki minangka asil paling anyar saka program riset jangka panjang kita sing fokus nglatih model supaya tetep selaras karo karsa manungsa saka wiwitan nganti rampung.

Ing lingkungan sing sensitif, Astra tumindak kanthi ngati-ati selaras karo tingkat risikone. Sajrone evaluasi tugas penggunaan komputer sing dipilih kanthi pendekatan adversarial kanggo nyebabake prilaku nyimpang, Astra luwih kasil ngindhari konsekuensi sing ora disengaja. Dijalanké nganggo langkah-langkah keamanan tambahan sing disedhiyakake minangka gawan ngasilaké kinerja sing luwih kuwat maneh.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(mbukak ing jendhela anyar) and Anthropic Messages API(mbukak ing jendhela anyar)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra uga luwih cenderung tumindak ana ing sajroning watesan sing ditetepake dening pengguna lan sing disiratake dening lingkungane. Ing evaluasi internal, Astra ora tau nyoba ngliwati penolakan Codex Auto-Review. Iki tetep bener sanajan Auto-review kanthi sengaja diatur supaya bisa diendhani lan tugas kasebut ora mungkin dirampungaké kanthi cara liya. Penghormatan marang watesan lingkungan iki selaras karo asil evaluasi tugas siber mokal sing kita bagikake ing pembuka tulisan iki lan temuan liyane sing didokumentasikake ing kertu sistem(mbukak ing jendhela anyar) kita.

Astra uga nuduhake pangurangan sing signifikan ing prilaku ngapusi. Wong sing masrahake pakaryan mbutuhake pangerten sing cetha babagan kapabilitas sawijining model lan pelaporan sing jujur babagan kemajuane. Iki ngukur siji aspek saka kajujuran; nyuda penipuan sing disengaja tetep dadi fokus sing luwih jembar ing karya panyelarasan kita.

Ing evaluasi halusinasi kapabilitas, Astra nuduhake paningkatan sing signifikan tinimbang GPT‑5.6 Sol, kanthi nggawe klaim mblusukake sing luwih sithik babagan kapabilitase.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(mbukak ing jendhela anyar) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(mbukak ing jendhela anyar) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Kasedhiyan

GPT‑6 Astra lagi diluncurake kanthi bertahap dina iki kanggo perusahaan lan pelanggan ing Program Akses Tepercaya, lan kasedhiyan sing luwih amba kanggo wong sing langganan ChatGPT Plus, Pro, Business, lan Enterprise bakal kasedhiya sajrone sawetara dina sabanjure. . Penggunaan Astra kalebu ing jatah panggunaan sing wis ana ing paket Pro $100 lan $200 lan paket Business $100, tanpa watesan laju utawa watesan tambahan. Wong sing duwe langganan Plus $20 lan pelanggan ing paket Business standar bisa ngakses GPT‑6 Astra kanthi watesan sing luwih murah, kanthi pilihan kanggo tuku kredit kanggo akses tambahan. Administrator Enterprise bisa ngaktifake Astra kanggo papan kerja; akses dipatèni kanthi gawan nalika diluncurake.

Pengguna Pro Lite, Pro, Business, lan Enterprise uga bisa nggunakake GPT‑6 Astra ing Ngobrol. Astra ndhukung retensi data nol kanggo pelanggan API sing layak, lan kaya sing wis dituduhake wulan kepungkur, kita lagi nguji Pangolahan Keamanan Privat kanggo nguwatake pemantauan keamanan nalika tetep njaga privasi pelanggan.

Kanggo pangembang, GPT‑6 Astra kasedhiya ing OpenAI API minangka gpt-6-astra, lan kasedhiya ing AWS Bedrock. Rega Standar OpenAI API yaiku $10 saben sejuta token input lan $50 saben sejuta token output. Tarif kapisah ditrapake kanggo operasi maca lan nulis cache. Mode Cepet kasedhiya kanggo GPT‑6 Astra ing API lan nyedhiyakake kacepetan nganti 2.5x kacepetan pamrosesan Standar kanthi rega 2x rega Standar.

Panggunaan Komputer

Panggunaan KomputerGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (rilis Agustus, skor parsial)---66,1%70,6%-
OSWorld 2.0 (rilis Agustus, subset offline, skor parsial)------
ScreenSpot Pro92,6%76,8%----
BrowseComp92,1%90,4%-87,4%90,8%-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Ngoding

NgodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
Indèks Agen Koding Artificial Analysis v1.1-80 Skor indeks-77,2 Skor indeks--
Indeks Agen Coding Artificial Analysis v1.4------
Expert-SWE (Internal, Dianyari)-83,1%----
DeepSWE v1.174,1%70,8%67,4%69,9%68,8%65,3%
Terminal-Bench 2.186,7%88,8%91,4%83,1%89,1%85,8%
Unicorn Voyager Frontend-38,3%----
FrontierCode 1.1 Utama (skor)--50,9%51,6%53,4%43,6%
Terminal-Bench 4.057,7%37,3%55,8%42,0%52,3%-
BenchCAD88.7%70,6%43,7%37,6%36,6%-
BenchCAD (alat Python)95,9%83,3%84,3%67,5%82,1%-

Akademik

AkademikGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
GPQA Diamond96,0%94,6%93,7%92,6%93,2%94,5%
Èlmu Komputer Téoritis-75,4%----
FrontierMath Tingkat 1-3 (v2)-89.0%90,2%87,0%85,6%71,6%
FrontierMath Tingkat 4 (v2)97,6%83,0%87,8%87,8%73,2%36,6%
Ujian Pungkasané Umat Manungsa (piranti)--65,0%63,8%63,6%-
Ujian Pungkasané Umat Manungsa (tanpa piranti)--59,1%55,5%54,9%47,9%

Sains lan Kesehatan

Sains lan KesehatanGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
GeneBench Pro37.1%32,3%----
MedChemBench (Internal)49,7%47,4%----
LifeSci Bench60,8%59,9%----
HealthBench Profesional (dilarasake miturut dawa)63.4%60,5%62,1%60,9%59,8%48,7%

Keamanan siber

Keamanan siberGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
CVE-Bench-94,1%----
Tantangan Capture-the-Flags-96,7%----
SEC-Bench Pro85,4%79,1%----
CyberGym-84.5%----
ExploitBench100,0%78,5%--70,0%-
ExploitGym (2 jam)-33,7%?--171-
ExploitGym (6 jam)-33,7%?--191-

Panyelarasan

Panyelarasan

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Tolok ukur keamanan penggunaan komputer internal (luwih endhek luwih apik)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Pathokan keamanan panggunaan komputer internal, nganggo AutoReview (Sing luwih cilik luwih apik)

1,8%

4,3%

-

-

-

-

Pathokan pangliwatan internal (luwih cilik luwih apik)

0,00%

0,29%

-

-

-

-

Honeypot ExploitGym (Sing luwih cilik luwih apik)

0,0%

48,2%

-

-

-

-

ExploitGym Mokal

100,0%

-

-

-

-

-

Tolok ukur halusinasi internal (luwih endhek luwih apik)

4,2%

12,2%

-

-

-

-

Konteks dawa

Konteks dawa

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Panalaran abstrak

Panalaran abstrakGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
ARC-AGI-399,9%7,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%84,6%
ARC-AGI-198,5%97,5%97,5%98,5%97,5%95,5%

Skor evaluasi minangka skor maksimal ing upaya apa wae. Evaluasi GPT ditindakake ing lingkungan riset kita utawa liwat API kita, sing bisa menehi output sing rada beda tinimbang ChatGPT produksi amarga bedane ing prompt sistem, piranti sing kasedhiya, lan sapanunggalane.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(mbukak ing jendhela anyar). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(mbukak ing jendhela anyar).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(mbukak ing jendhela anyar).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(mbukak ing jendhela anyar).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(mbukak ing jendhela anyar): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(mbukak ing jendhela anyar) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(mbukak ing jendhela anyar) and supporting research(mbukak ing jendhela anyar).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(mbukak ing jendhela anyar) and supporting research(mbukak ing jendhela anyar).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.