OpenAI

GPT-6 Astra: A new generation of intelligence

Generasi baharu kecerdasan

Kami memperkenalkan GPT‑6 Astra, model paling pintar dan paling selaras di dunia.

GPT‑6 Astra menggabungkan penyelidikan bertahun-tahun dan pertaruhan besar dalam latihan awal, pembelajaran pengukuhan dan penjajaran. Astra mencapai tahap terkini dalam penggunaan komputer, penyemakan imbas, kejuruteraan perisian, keselamatan siber, sains dan kerja profesional. Astra menguasai sepenuhnya FrontierMath Peringkat 4 dengan skor 98%, setelah sebelum ini membantu menyelesaikan masalah terbuka yang telah lama wujud dalam matematik. Astra juga mencapai skor 99.9% pada ARC-AGI-3 dan skor 100% pada ExploitBench. Ia juga menetapkan perbatasan baharu dalam penggunaan komputer dan pelayar, mengendalikan kerja profesional yang paling mencabar dengan kelajuan, ketepatan dan pertimbangan yang tiada tandingan. 

GPT‑6 Astra dilancarkan secara berperingkat hari ini kepada sebilangan kecil organisasi dan akan tersedia kepada semua pengguna ChatGPT Plus, Pro, Business dan Enterprise dalam beberapa hari akan datang, serta melalui API OpenAI, Microsoft Azure dan AWS Bedrock.

“Pada ARC-AGI-3, Astra mengatasi garis dasar kecekapan tindakan manusia kami pada 96% daripada tahap, secara berkesan mencapai kesetaraan dengan manusia pada penanda aras tersebut. Bukan sahaja ini model terbaik yang pernah kami uji, malah ini menandakan anjakan yang ketara dari segi prestasi model perbatasan - bukan sahaja dari segi keupayaan untuk menavigasi dan menyelesaikan masalah dalam persekitaran baharu, tetapi juga dari segi kecekapan model itu mempelajari cara berbuat demikian.”
Greg Kamradt, ARC Prize Foundation

Astra ialah model kami yang paling sejajar dengan peningkatan ketara dalam memahami niat pengguna dan tingkah laku model—tugas boleh diserahkan dengan keyakinan yang lebih tinggi terhadap pertimbangan Astra. Sebagai salah satu cara kami menguji perkara ini, kami membangunkan penilaian baharu berdasarkan insiden Hugging Face untuk menilai sama ada model yang menghadapi tugasan sukar atau mustahil akan melangkaui skop yang dimaksudkan. Berbanding GPT‑5.6 Sol yang tanpa langkah perlindungan pengeluaran melangkaui sasaran yang dibenarkan dalam 48% kes, GPT‑6 Astra berbuat demikian dalam 0% kes.

Model penggunaan komputer terbaik di dunia

GPT‑6 Astra menandakan teknologi termaju baharu dalam kelajuan, ketepatan dan keselamatan penggunaan komputer. Ia boleh mengurus tugas-tugas yang membosankan seperti mengisi borang dalam talian, mengemas kini rekod pelanggan dalam CRM, dan mengatur kalendar anda. Ia boleh menjalankan penyelidikan dalam talian dan mendraf ringkasan dalam e-mel anda atau dalam editor dokumen anda. Ia boleh menganalisis data saintifik, menjana plot, mencipta laman web, dan menjalankan semakan QA frontend untuk memastikan semua ciri di laman tersebut berfungsi. Ia boleh membantu anda memasang dan menguji perisian secara autonomi, serta menyelesaikan masalah yang anda lihat pada skrin. Penambahbaikan ini juga dicerminkan dalam keputusan penilaian terkini kami.

Penambahbaikan ini juga menghasilkan peningkatan kecekapan yang ketara dalam tugas kerja pengetahuan dunia sebenar. Dalam simulasi kependaman pada OSWorld 2.0, Astra mencapai prestasi penggunaan komputer yang lebih tinggi dalam masa kira-kira 47% lebih singkat bagi setiap tugas berbanding GPT‑5.6 Sol dengan skor 72.6% dalam kira-kira 40 minit bagi setiap tugasan, berbanding 65.7% dalam kira-kira 75 minit.3

Keupayaan GPT‑6 Astra untuk menggunakan komputer dapat dilihat dalam output merentas pelbagai domain, termasuk pembangunan permainan, kejuruteraan elektrik dan kerja berasaskan pengetahuan harian:

Seiring dengan Astra, kami juga sedang mengemas kini harnes Codex untuk meningkatkan kelajuan penggunaan komputer dengan ketara. Digabungkan dengan kecekapan Astra, ini menghasilkan penyelesaian tugas 1.9x lebih pantas berbanding pengalaman GPT‑5.6 Sol semasa, pada penanda aras Mind2Web. Peningkatan kelajuan model bermakna ia boleh melaksanakan banyak tugas kehidupan yang memakan masa untuk anda, lebih pantas daripada yang anda boleh lakukan.

“Kami sedang menyepadukan GPT‑6 Astra ke dalam harnes Devin pada hari pelancaran yang memberikan prestasi terkini pada penanda aras pengujian dalaman kami. Keupayaannya yang cemerlang dalam menggunakan komputer, menulis dan memahami pangkalan kod telah menambah baik pengujian sebaik sahaja digunakan: video nyata lebih mudah diikuti dan laporan lebih jelas serta lebih ringkas”
Silas Alberti, Naib Presiden Kanan Penyelidikan, Cognition

Perubahan besar dalam kerja profesional

GPT‑6 Astra menggabungkan kemajuan dalam penggunaan komputer dengan latihan yang disasarkan untuk persekitaran profesional bagi bantu menangani tugasan kerja yang kompleks. Ia menggabungkan kecerdasan yang diperlukan untuk masalah kompleks dengan keupayaan untuk melaksanakan aliran kerja berbilang langkah serta menghasilkan dokumen, hamparan dan pembentangan yang kemas.

GPT‑6 Astra ialah model terbaik kami untuk mematuhi templat sedia ada dan menghasilkan slaid yang tersusun rapi serta menyampaikan perkara utama dengan padat melalui naratif yang berstruktur. Ia menghasilkan dokumen, pembentangan, hamparan dan analisis yang jelas serta tersusun rapi, mengikut templat anda dan sepadan dengan gaya penulisan dan visual anda. Astra juga dilatih secara khusus untuk memasukkan hanya konteks yang relevan ke dalam output, dan bukannya mengulangi maklumat yang tidak diperlukan untuk tugasan yang sedang dilakukan. Semua ini bermakna ia boleh menghasilkan artifak yang boleh terus digunakan serta sepadan dengan konteks dan piawaian perniagaan anda.

GPT‑6 Astra juga memberikan pertimbangan visual yang lebih kukuh kepada tapak web, permainan, aplikasi dan pemaparan yang dibinanya. Dengan Laman(dibuka dalam tetingkap baru) dalam ChatGPT, Astra boleh mencipta, mengehos dan berkongsi laman web, aplikasi web dan permainan secara langsung daripada prom.

“Astra memberi kami kelebihan yang ketara dari segi keupayaan dan kecekapan. Ia berjaya melaksanakan alur kerja kreatif kami yang paling kompleks serta menggunakan sehingga 20% lebih sedikit token berbanding model lain yang telah kami uji. Yang paling penting, bagi pelanggan kami, ini bermakna output yang berkualiti lebih tinggi”.
Alex Mashrabov, CEO dan Pengasas Bersama, Higgsfield AI

Apabila arahan membuka ruang untuk tafsiran, GPT‑6 Astra lebih baik daripada model terdahulu dalam membuat keputusan yang tepat. Ia menggunakan konteks untuk melengkapkan kekurangan maklumat yang lazim dan mengemukakan soalan khusus apabila jawapannya boleh mengubah hasil. Dalam Codex, ia boleh mengemukakan soalan secara tak segerak sambil meneruskan kerja yang tidak bergantung pada balasan anda. Jika anda tidak membalas, ia akan meneruskan dengan andaian yang munasabah apabila sesuai, tetapi akan menunggu input anda untuk keputusan yang penting.

Contoh di bawah menunjukkan cara Astra bekerjasama dalam tugasan harian apabila maklumat yang hilang boleh mengubah jawapan dengan ketara.

Astra juga lebih baik dalam mengekalkan hala tuju semasa tugas berkembang. Model terdahulu kadangkala menganggap mesej pengarahan sebagai matlamat baharu, sehingga terlepas pandang permintaan asal atau kekangan terdahulu. Astra mengambil kira keperluan baharu, menukar haluan apabila diminta, dan menjawab soalan sampingan tanpa mengabaikan tugas yang lebih luas.

“Astra merupakan peningkatan kualiti yang ketara berbanding GPT‑5.6 Sol merentas tugasan undang-undang yang kompleks. Dalam ujian awal kami, Astra menonjol kerana menangani kerja perundangan sebagaimana seorang peguam yang teliti: ia membezakan dokumen daripada rekod yang telah mantap, mengetengahkan andaian yang tidak disokong, dan menukar lompong kepada pendirian penggubalan yang konkrit”.
Niko Grupen, Ketua Penyelidikan Gunaan, Harvey

Pengekodan

GPT‑6 Astra ialah model terbaik untuk kejuruteraan perisian setakat ini.

1 daripada 2
“GPT‑6 Astra memberikan prestasi tercanggih pada penanda aras pengekodan dalaman kami dan menunjukkan kemajuan yang jelas dalam penilaian intuisi perdagangan berbanding GPT‑5.6 Sol. Apabila digunakan untuk pengekodan agentik, GPT‑6 Astra berkomunikasi dengan cara yang lebih mudah diikuti oleh pembangun dan menghasilkan kod yang memerlukan kurang iterasi untuk mencapai kualiti pengeluaran.”
John Crepezzi, AI Assistants, Jane Street

Dengan Astra, kami memperkenalkan cara baharu untuk Codex mengekalkan dan mendapatkan semula konteks apabila tetingkap konteks penuh. Mengikut sejarah, model telah menggunakan pemadatan untuk meringkaskan kerja semasa sesi yang panjang, seperti ketika menyahpepijat masalah kompleks atau menangani pemfaktoran semula berskala besar. Setiap pemadatan boleh mengabaikan butiran tentang sebab pembetulan gagal atau cara komponen berfungsi. Dalam Codex, Astra boleh menyimpan nota merentas tetingkap konteks, mengekalkan butiran terkumpul tanpa memampatkannya berulang kali menjadi satu ringkasan. Tetingkap konteks terdahulu kekal boleh dicari, jadi Astra boleh mencari keperluan atau keputusan ujian daripada mesej terdahulu dan output alat—walaupun maklumat itu tidak direkodkan dalam notanya. Anda boleh mendayakan ciri percubaan ini dalam config.toml Codex anda,(dibuka dalam tetingkap baru) dan ia akan menjadi tetapan lalai untuk Astra dalam beberapa minggu akan datang.

Memajukan penemuan saintifik

“Ceritanya begini: berakhirnya satu era, bermulanya era yang lain”.
Greg Burnham, EpochAI

GPT‑6 Astra ialah kemajuan besar dalam penemuan saintifik, matematik, dan kesihatan. Hari ini, kami berkongsi dua lagi hasil tentang jurang antara nombor perdana [WITH LINK]. Astra juga mencatat rekod baharu merentas rangkaian penilaian sains:

Astra boleh membantu dalam kerja praktikal di sebalik penemuan saintifik. Dengan menggabungkan penaakulan saintifik dengan penggunaan komputer, ia boleh berfungsi secara langsung dalam perisian khusus untuk memeriksa data dan meneroka hasil, membantu penyelidik menilai bukti dan memutuskan perkara yang perlu disiasat seterusnya.

Keselamatan siber

Astra ialah satu perubahan besar dalam keupayaan keselamatan siber. Keupayaannya untuk mengenal pasti dan membangunkan eksploit zero-day boleh membantu pihak pertahanan menampal kelemahan, tetapi ia juga mewujudkan keperluan untuk langkah perlindungan yang lebih kukuh. Untuk memahami sejauh mana keupayaan ini meluas, kami menggunakan penilaian pakar dalaman dan pihak ketiga.

Kami mula-mula menguji Astra pada ExploitBench dan ExploitGym, yang mengukur sama ada model boleh mencapai pelaksanaan kod arbitrari dalam pangkalan kod rentan.

Memandangkan kebimbangan yang mungkin timbul bahawa pendedahan kepada kerentanan perisian terdahulu mungkin telah menjejaskan keputusan penanda aras, kami turut menilai Astra pada dua penanda aras baharu. Sebagai contoh, kami membina penilaian dalaman “ExploitBench (Jun–Ogos 2026)” untuk menguji pembangunan eksploitasi menggunakan kerentanan daripada tiga bulan sebelumnya. 2 Astra mencapai kadar pelaksanaan kod arbitrari yang jauh lebih tinggi berbanding GPT‑5.6 Sol pada set data ini serta menggunakan token output yang jauh lebih sedikit. Semasa penilaian, Astra menemui dan menggunakan dua teknik yang sebelum ini tidak diketahui untuk melepasi kotak pasir timbunan V8 Chrome. Kami sedang mendedahkan kedua-dua kerentanan tersebut kepada penyelenggara masing-masing.

Kami turut menguji Astra pada SRE-Bench, penanda aras yang mengukur sama ada model boleh melakukan kejuruteraan balikan terhadap perisian binari untuk memahami logik terasnya. Penulis penanda aras tersebut membangunkan perisian itu dari awal dan merahsiakan kod sumbernya. Astra menyelesaikan 88.0% tugas dalam satu percubaan dan 99.2% dalam empat percubaan, berbanding masing-masing 55.9% dan 68.7% bagi GPT‑5.6 Sol.

Selain penanda aras, penilaian yang diketuai pakar mendapati bahawa Astra boleh menggunakan kerentanan yang tidak diketahui sebelum ini untuk mencapai pelaksanaan kod arbitrari dalam pelayar yang diperkukuh dan mencipta eksploit peningkatan keistimewaan untuk sistem pengendalian yang diperkukuh. Secara keseluruhan, hasil ini memaklumkan keputusan kami bahawa Astra telah mencapai ambang Kritikal dalam keselamatan siber di bawah Rangka Kerja Kesediaan kami.

Seperti yang kami bincangkan dalam The Defender’s Window, keupayaan siber termaju boleh membantu pembela mengenal pasti kelemahan dengan lebih pantas, tetapi juga menjadikan kelemahan tersebut lebih mudah dieksploitasi, sekali gus menjadikan keperluan pembela untuk menyesuaikan diri semakin mendesak.

Untuk versi Astra yang dilancarkan hari ini, kami menyokong tugas pertahanan penting seperti semakan keselamatan kod, penampalan dan pemodelan ancaman. Walau bagaimanapun, secara lalai, Astra akan enggan mematuhi tugasan keselamatan siber lanjutan seperti penemuan eksploit. Melalui OpenAI Daybreak, kami sedang melancarkan, kami sedang melancarkan akses yang kurang ketat kepada kumpulan alfa pembela keselamatan siber yang dipercayai dalam program OpenAI Daybreak. Ini meluaskan akses kepada aliran kerja keselamatan defensif, termasuk penapisan dan pengesahan kerentanan, analisis perisian hasad, kejuruteraan pengesanan dan pengesahan tampalan. Kami merancang untuk memperluas lagi akses melalui Daybreak Blue.

Kami juga telah memperkukuh perlindungan kami terhadap potensi penyalahgunaan siber, dengan membina berdasarkan susunan perlindungan kami untuk GPT‑5.6 Sol. Ini termasuk latihan keteguhan model yang dipertingkatkan untuk lebih menahan potensi pecah sekat dan lebih banyak konteks untuk sistem pemantauan kami. Kami meneruskan pengujian dalaman dan luaran yang ketat, termasuk ujian automatik dengan proses penyerang dalaman kami. Butiran lanjut tentang perlindungan siber dan pengujian kami tersedia dalam kad sistem Astra dan blog kami.

Menyelaraskan dan menggunakan GPT‑6 Astra secara bertanggungjawab

Astra ialah model kami yang paling sejajar. Astra cemerlang dalam bertindak dengan cermat, menghormati batasan tugas dan berkomunikasi secara telus. Usaha ini ialah hasil terkini daripada program penyelidikan jangka panjang kami yang menumpukan pada melatih model agar kekal sejajar dengan niat manusia dari awal hingga akhir.

Dalam persekitaran sensitif, Astra bertindak dengan berhati-hati pada tahap yang sepadan dengan risiko yang terlibat. Dalam penilaian tugasan penggunaan komputer yang dipilih secara adversarial untuk mencetuskan tingkah laku tidak wajar, Astra lebih berjaya dalam mengelakkan akibat yang tidak disengajakan. Berjalan dengan langkah keselamatan tambahan yang ditawarkan secara lalai menghasilkan prestasi yang lebih kukuh lagi.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(dibuka dalam tetingkap baru) and Anthropic Messages API(dibuka dalam tetingkap baru)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra juga lebih cenderung untuk beroperasi dalam batasan yang ditetapkan oleh pengguna dan batasan tersirat persekitaran. Dalam penilaian dalaman, Astra tidak pernah cuba memintas penolakan Semakan Automatik Codex. Hal ini tetap benar walaupun Semakan automatik sengaja dikonfigurasikan supaya boleh dipintas dan tugas tersebut mustahil untuk diselesaikan dengan cara lain. Tindakan menghormati sekatan persekitaran ini selaras dengan keputusan penilaian tugasan siber mustahil kami yang dikongsi dalam pengenalan siaran ini serta penemuan lain yang didokumenkan dalam kad sistem(dibuka dalam tetingkap baru) kami.

Astra juga menunjukkan pengurangan yang ketara dalam tingkah laku memperdaya. Orang yang mendelegasikan kerja memerlukan pemahaman yang jelas tentang keupayaan model dan pelaporan yang jujur tentang kemajuannya. Ini mengukur satu aspek kejujuran; mengurangkan penipuan yang disengajakan masih menjadi fokus yang lebih luas dalam kerja penyelarasan kami.

Dalam penilaian halusinasi keupayaan kami, Astra menunjukkan peningkatan yang ketara berbanding GPT‑5.6 Sol, dengan membuat lebih sedikit dakwaan yang mengelirukan tentang keupayaannya.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(dibuka dalam tetingkap baru) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(dibuka dalam tetingkap baru) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Ketersediaan

GPT‑6 Astra dilancarkan secara berperingkat hari ini kepada perusahaan dan pelanggan dalam Program Akses Dipercayai kami, dengan ketersediaan meluas untuk individu yang melanggan ChatGPT Plus, Pro, Business dan Enterprise dalam beberapa hari akan datang. . Penggunaan Astra disertakan dalam peruntukan penggunaan sedia ada bagi pelan Pro $100 dan $200 serta pelan Business $100, tanpa had kadar atau sekatan tambahan. Individu dengan langganan Plus $20 dan pelanggan pelan Business standard boleh mengakses GPT‑6 Astra dengan had yang lebih rendah, dengan pilihan untuk membeli kredit bagi akses tambahan. Pentadbir Enterprise boleh mendayakan Astra untuk ruang kerja mereka; akses dinyahdayakan secara lalai semasa pelancaran.

Pengguna Pro Lite, Pro, Business dan Enterprise juga boleh menggunakan GPT‑6 Astra dalam Sembang. Astra menyokong Pengekalan Data Sifar bagi pelanggan API yang layak, dan seperti yang kami kongsikan bulan lalu, kami sedang menguji Private Safety Processing untuk memperkukuh pemantauan keselamatan serta mengekalkan privasi pelanggan.

Untuk pembangun, GPT‑6 Astra tersedia dalam OpenAI API sebagai gpt-6-astra dan tersedia dalam AWS Bedrock. Harga Standard OpenAI API ialah $10 bagi setiap sejuta token input dan $50 bagi setiap sejuta token output. Kadar berasingan dikenakan untuk bacaan dan penulisan cache. Mod pantas tersedia untuk GPT‑6 Astra dalam API dan menawarkan kelajuan sehingga 2.5x berbanding pemprosesan Standard pada harga 2x kadar Standard.

Penggunaan Komputer

Penggunaan KomputerGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (keluaran Ogos, skor separa)---66.1%70.6%-
OSWorld 2.0 (keluaran Ogos, subset luar talian, skor separa)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Pengekodan

PengekodanGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
Indeks Ejen Pengekodan Analisis Buatan v1.1-80 Skor indeks-77.2 Skor indeks--
Indeks Ejen Pengekodan Analisis Buatan v1.4------
Expert-SWE (Dalaman, Dikemas Kini)-83.1%----
DeepSWE v1.174.1%70.8%67.4%69.9%68.8%65.3%
Terminal-Bench 2.186.7%88.8%91.4%83.1%89.1%85.8%
Unicorn Voyager Frontend-38.3%----
FrontierCode 1.1 Utama (skor)--50.9%51.6%53.4%43.6%
Terminal-Bench 4.057.7%37.3%55.8%42.0%52.3%-
BenchCAD88.7%70.6%43.7%37.6%36.6%-
BenchCAD (alat python)95.9%83.3%84.3%67.5%82.1%-

Akademik

AkademikGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
GPQA Diamond96.0%94.6%93.7%92.6%93.2%94.5%
Sains Komputer Teori-75.4%----
FrontierMath Peringkat 1–3 (v2)-89.0%90.2%87.0%85.6%71.6%
FrontierMath Peringkat 4 (v2)97.6%83.0%87.8%87.8%73.2%36.6%
Peperiksaan Terakhir Kemanusiaan (alat)--65.0%63.8%63.6%-
Peperiksaan Terakhir Manusia (tiada alat)--59.1%55.5%54.9%47.9%

Sains dan Kesihatan

Sains dan KesihatanGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Dalaman)49.7%47.4%----
LifeSciBench60.8%59.9%----
HealthBench Profesional (dilaraskan mengikut panjang)63.4%60.5%62.1%60.9%59.8%48.7%

Keselamatan siber

Keselamatan siberGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
CVE-Bench-94.1%----
Cabaran Capture the Flags-96.7%----
SEC-Bench Pro85.4%79.1%----
CyberGym-84.5%----
ExploitBench100.0%78.5%--70.0%-
ExploitGym (2 jam)-33.7%?--171-
ExploitGym (6 jam)-33.7%?--191-

Penjajaran

Penjajaran

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Penanda aras keselamatan penggunaan komputer dalaman (lebih rendah adalah lebih baik)

2.4%

22.0%

9.5%

18.3%

11.5%

-

Penanda aras keselamatan penggunaan komputer dalaman, dengan AutoReview (lebih rendah lebih baik)

1.8%

4.3%

-

-

-

-

Penanda aras pemintasan dalaman (lebih rendah lebih baik)

0.00%

0.29%

-

-

-

-

Honeypot ExploitGym (lebih rendah lebih baik)

0.0%

48.2%

-

-

-

-

ExploitGym Mustahil

100.0%

-

-

-

-

-

Penanda aras halusinasi dalaman (lebih rendah lebih baik)

4.2%

12.2%

-

-

-

-

Konteks panjang

Konteks panjang

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

Penaakulan abstrak

Penaakulan abstrakGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
ARC-AGI-399.9%7.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%84.6%
ARC-AGI-198.5%97.5%97.5%98.5%97.5%95.5%

Skor penilaian adalah maksimum pada sebarang tahap usaha. Penilaian GPT dijalankan dalam persekitaran penyelidikan kami atau melalui API kami, yang mungkin menghasilkan output yang agak berbeza daripada ChatGPT pengeluaran disebabkan oleh perbezaan dalam prom sistem, alat yang tersedia dan sebagainya.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(dibuka dalam tetingkap baru). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(dibuka dalam tetingkap baru).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(dibuka dalam tetingkap baru).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(dibuka dalam tetingkap baru).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(dibuka dalam tetingkap baru): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(dibuka dalam tetingkap baru) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(dibuka dalam tetingkap baru) and supporting research(dibuka dalam tetingkap baru).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(dibuka dalam tetingkap baru) and supporting research(dibuka dalam tetingkap baru).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.