OpenAI

GPT-6 Astra: A new generation of intelligence

Generasi kecerdasan baru

Pembaruan pada 22 September 2026: Kami memperluas keluarga GPT‑6 kami dengan GPT‑6 Sol dan GPT‑6 Luna. Pelajari selengkapnya.

Kami memperkenalkan GPT‑6 Astra, model paling cerdas dan selaras di dunia.

GPT‑6 Astra memadukan penelitian selama bertahun-tahun dan investasi besar dalam pra-pelatihan, reinforcement learning, dan penyelarasan. Astra memiliki performa mutakhir dalam penggunaan komputer, penjelajahan web, rekayasa perangkat lunak, keamanan siber, sains, dan pekerjaan profesional. Astra mencapai saturasi pada FrontierMath jenjang 4 dengan skor 98%, setelah sebelumnya membantu memecahkan masalah terbuka yang telah lama ada⁠ dalam matematika. Astra juga mencapai batas maksimum pada ARC-AGI-3 dengan skor 99,9% dan pada ExploitBench dengan skor 100%. Astra juga menetapkan batasan baru dalam penggunaan komputer dan browser, menangani pekerjaan profesional yang paling menuntut dengan kecepatan, akurasi, dan pertimbangan yang tak tertandingi. 

GPT‑6 Astra mulai diluncurkan hari ini untuk sejumlah organisasi terbatas dan dalam beberapa hari mendatang akan tersedia bagi semua pengguna ChatGPT Plus, Pro, Business, dan Enterprise, serta melalui API OpenAI, Microsoft Azure, dan AWS Bedrock.

“Di ARC-AGI-3, Astra melampaui tolok ukur efisiensi tindakan manusia kami pada 96% level, yang secara efektif mencapai kesetaraan dengan manusia pada tolok ukur tersebut. Ini bukan hanya model terbaik yang pernah kami uji, tetapi juga menandai perubahan signifikan terkait performa model terdepan—bukan hanya dalam kemampuannya menavigasi dan menyelesaikan lingkungan baru, tetapi juga dalam seberapa efisien model ini belajar melakukannya.”
Greg Kamradt, ARC Prize Foundation

Astra adalah model kami yang paling selaras, dengan peningkatan signifikan dalam memahami maksud pengguna dan perilaku model—Anda dapat mendelegasikan tugas dengan lebih yakin akan penilaian Astra. Sebagai salah satu cara kami menguji hal ini, kami membuat evaluasi baru yang didasarkan pada insiden Hugging Face untuk menilai apakah model yang menghadapi tugas sulit atau mustahil akan melampaui cakupan yang dimaksudkan. Dibandingkan dengan GPT‑5.6 Sol, yang tanpa pengamanan produksi melampaui target yang diizinkan dalam 48% kasus, GPT‑6 Astra melakukannya dalam 0% kasus.

Model penggunaan komputer terbaik di dunia

GPT‑6 Astra menetapkan standar baru dalam kecepatan, akurasi, dan keamanan penggunaan komputer. Model ini dapat menangani tugas-tugas yang membosankan seperti mengisi formulir online, memperbarui catatan pelanggan dalam sistem CRM, dan mengatur kalender Anda. Model ini dapat melakukan riset online dan menyusun draf ringkasan di email Anda atau di editor dokumen Anda. Model ini dapat menganalisis data ilmiah, membuat plot, membuat situs web, dan menjalankan pemeriksaan QA frontend untuk memastikan semua fitur di situs tersebut berfungsi. Model ini dapat membantu Anda menginstal dan menguji perangkat lunak secara mandiri, serta memecahkan masalah yang Anda lihat di layar. Peningkatan ini juga tercermin dalam hasil evaluasi mutakhir kami.

Peningkatan ini juga menghasilkan peningkatan efisiensi yang signifikan pada tugas pekerjaan berbasis pengetahuan yang nyata. Dalam simulasi latensi di OSWorld 2.0, Astra mencapai performa penggunaan komputer yang lebih tinggi dalam waktu sekitar 47% lebih singkat per tugas dibandingkan GPT‑5.6 Sol, dengan skor 72,6% dalam waktu sekitar 40 menit per tugas, dibandingkan dengan 65,7% dalam waktu sekitar 75 menit.3

Kemampuan GPT‑6 Astra dalam menggunakan komputer dapat dilihat pada output di berbagai domain, termasuk pengembangan game, teknik elektro, dan pekerjaan berbasis pengetahuan sehari-hari:

Selain Astra, kami juga memperbarui harness Codex untuk meningkatkan kecepatan penggunaan komputer secara signifikan. Dikombinasikan dengan efisiensi Astra, hal ini menghasilkan penyelesaian tugas 1,9x lebih cepat dibandingkan pengalaman GPT‑5.6 Sol saat ini pada tolok ukur Mind2Web. Peningkatan kecepatan model ini berarti model dapat menangani banyak tugas sehari-hari yang memakan waktu untuk Anda, lebih cepat daripada yang dapat Anda lakukan sendiri.4

“Kami mengintegrasikan GPT‑6 Astra ke dalam harness Devin pada hari peluncuran, dan model ini memberikan performa tercanggih pada tolok ukur pengujian internal kami. Kemampuannya yang sangat baik dalam menggunakan komputer, menulis, dan memahami basis kode meningkatkan pengujian sejak awal: video menjadi jauh lebih mudah diikuti, dan laporan menjadi lebih jelas serta lebih ringkas”
Silas Alberti, SVP Riset di Cognition

Lompatan besar dalam pekerjaan profesional

GPT‑6 Astra memadukan kemajuan dalam penggunaan komputer dengan pelatihan yang ditargetkan untuk lingkungan profesional, guna membantu menangani tugas kerja yang kompleks. Model ini menggabungkan kecerdasan yang diperlukan untuk masalah kompleks dengan kemampuan untuk menjalankan alur kerja multilangkah serta menghasilkan dokumen, spreadsheet, dan presentasi yang rapi.

GPT‑6 Astra adalah model terbaik kami untuk mematuhi template yang sudah ada dan menghasilkan slide dengan tata letak yang baik serta menyampaikan poin-poin utama secara ringkas melalui narasi yang terstruktur. Model ini membuat dokumen, presentasi, spreadsheet, dan analisis yang jelas dan terstruktur dengan baik, mengikuti template Anda serta sesuai dengan gaya penulisan dan visual Anda. Astra juga dilatih secara khusus untuk hanya memasukkan konteks yang relevan ke dalam output, alih-alih mengulang informasi yang tidak diperlukan untuk tugas yang sedang dikerjakan. Semua ini berarti bahwa model ini dapat menghasilkan artefak yang lebih siap digunakan secara langsung dan sesuai dengan konteks serta standar bisnis Anda.

GPT‑6 Astra juga menghadirkan penilaian visual yang lebih kuat pada situs web, permainan, aplikasi, dan render yang dibuatnya. Dengan Sites⁠(terbuka di jendela baru) di ChatGPT, Astra dapat membuat, menghosting, dan membagikan situs web, aplikasi web, dan game langsung dari prompt.

“Astra memberi kami keunggulan signifikan dalam hal kemampuan dan efisiensi. Astra berhasil menjalankan alur kerja kreatif kami yang paling kompleks sekaligus menggunakan hingga 20% lebih sedikit token daripada model lain yang telah kami uji. Yang terpenting, bagi pelanggan kami, hal ini berarti output dengan kualitas lebih tinggi.”
Alex Mashrabov, CEO dan Mitra Pendiri Higgsfield AI

Ketika instruksi membuka ruang untuk penafsiran, GPT‑6 Astra lebih baik daripada model sebelumnya dalam mengambil keputusan yang tepat. Model ini menggunakan konteks untuk melengkapi kekosongan rutin dan mengajukan pertanyaan terarah saat jawabannya dapat mengubah hasil akhir. Di Codex, model ini dapat mengajukan pertanyaan secara asinkron sambil melanjutkan pekerjaan yang tidak bergantung pada balasan Anda. Jika Anda tidak merespons, model ini akan melanjutkan dengan asumsi yang masuk akal jika sesuai, tetapi menunggu masukan Anda untuk keputusan yang berdampak penting.

Contoh di bawah ini menunjukkan bagaimana Astra berkolaborasi dalam tugas sehari-hari, di mana informasi yang tidak tersedia dapat mengubah jawaban secara signifikan.

Astra juga lebih mampu menjaga arah pengerjaan seiring berkembangnya tugas. Model-model sebelumnya terkadang menganggap pesan yang mengarahkan pengerjaan sebagai tujuan baru, sehingga kehilangan fokus pada permintaan awal atau batasan sebelumnya. Astra dapat mengikuti persyaratan baru, mengubah arah saat diminta, dan menjawab pertanyaan tambahan tanpa kehilangan fokus pada tugas utama.

“Astra merupakan peningkatan kualitas yang signifikan dibandingkan GPT‑5.6 Sol dalam berbagai tugas hukum yang kompleks. Dalam pengujian awal kami, Astra menonjol karena menyikapi pekerjaan hukum seperti pengacara yang cermat: membedakan dokumen dari catatan yang sudah ada, mengungkap asumsi yang tidak didukung bukti, dan mengubah hal-hal yang belum lengkap menjadi keputusan konkret dalam penyusunan dokumen.”
Niko Grupen, Kepala Riset Terapan, Harvey

Pengodean

GPT‑6 Astra adalah model terbaik untuk rekayasa perangkat lunak hingga saat ini.

1 dari 2
“GPT‑6 Astra memberikan performa mutakhir pada tolok ukur pengodean internal kami dan menunjukkan kemajuan yang jelas dalam evaluasi intuisi perdagangan dibandingkan dengan GPT‑5.6 Sol. Saat digunakan untuk pengodean agentik, GPT‑6 Astra berkomunikasi dengan cara yang lebih mudah diikuti oleh pengembang dan menghasilkan kode yang memerlukan lebih sedikit iterasi untuk mencapai kualitas produksi.”
John Crepezzi, Asisten AI, Jane Street

Dengan Astra, kami memperkenalkan cara baru bagi Codex untuk mempertahankan dan mengambil kembali konteks saat jendela konteks penuh. Secara historis, model telah menggunakan pemadatan untuk merangkum pekerjaan selama sesi panjang, seperti saat men-debug masalah kompleks atau menangani refaktor besar. Setiap pemadatan dapat menghilangkan detail tentang alasan perbaikan gagal atau cara suatu komponen berperilaku. Di Codex, Astra dapat menyimpan catatan di seluruh jendela konteks, mempertahankan detail yang terakumulasi tanpa berulang kali memadatkannya menjadi satu ringkasan. Jendela konteks sebelumnya tetap dapat dicari, sehingga Astra dapat menemukan persyaratan atau hasil pengujian dari pesan sebelumnya dan output alat—bahkan jika informasi tersebut tidak dicatat dalam catatannya. Anda dapat mengaktifkan fitur eksperimental ini di config.toml Codex Anda,⁠(terbuka di jendela baru) dan ini akan menjadi pengaturan default untuk Astra dalam beberapa minggu mendatang.

Memajukan penemuan ilmiah

“Ceritanya: berakhirnya satu era, dimulainya era lain.”
Greg Burnham, EpochAI

GPT‑6 Astra adalah kemajuan besar bagi penemuan ilmiah, matematika, dan kesehatan. Hari ini, kami membagikan dua hasil lanjutan tentang jarak antara bilangan prima.9, 10

Astra juga mencetak rekor baru di seluruh rangkaian evaluasi matematika dan sains.

Astra dapat membantu menangani pekerjaan praktis yang mendukung penemuan ilmiah. Dengan menggabungkan penalaran ilmiah dengan penggunaan komputer, Astra dapat bekerja langsung dalam perangkat lunak khusus untuk memeriksa data dan mengeksplorasi hasil, sehingga membantu para peneliti menilai bukti dan memutuskan apa yang akan diselidiki selanjutnya.

Keamanan siber

Seperti yang kami bahas dalam pembaruan keamanan⁠ kami, Astra merupakan lompatan besar dalam kapabilitas siber dan memenuhi ambang batas Kritis dalam keamanan siber berdasarkan Kerangka Kerja Kesiapan kami. Kemampuannya untuk mengidentifikasi dan mengembangkan eksploitasi zero-day dapat membantu para pembela HAM menemukan dan menambal kelemahan, namun hal ini juga menciptakan kebutuhan akan perlindungan yang lebih kuat. Untuk memahami sejauh mana kemampuan Astra, kami mengujinya melalui evaluasi internal dan evaluasi oleh pakar pihak ketiga.

Kami pertama kali menguji model tanpa pengamanan produksi pada ExploitBench dan ExploitGym, yang menilai apakah model dapat mengubah kerentanan perangkat lunak yang diketahui menjadi eksploit yang berfungsi. Pada ExploitBench, Astra meraih skor sempurna 100%, dibandingkan dengan 78,5% untuk GPT‑5.6 Sol, model terdepan kami sebelumnya yang memiliki kemampuan siber, Di ExploitGym, Astra mencapai tingkat keberhasilan 42,4%, dibandingkan dengan 30,3% untuk GPT‑5.6 Sol, sekaligus menggunakan token keluaran yang jauh lebih sedikit.13

Mengingat adanya kekhawatiran bahwa paparan terhadap kerentanan perangkat lunak historis mungkin telah memengaruhi hasil tolok ukur, kami juga mengevaluasi Astra pada dua tolok ukur baru. Salah satunya, kami membangun evaluasi internal “ExploitBench (Juni–Agustus 2026)” untuk menguji pengembangan eksploit menggunakan kerentanan dari tiga bulan sebelumnya.14 Astra mencapai tingkat eksekusi kode arbitrer yang jauh lebih tinggi daripada GPT‑5.6 Sol pada set data ini dengan jauh lebih sedikit token keluaran. Selama evaluasi, Astra bahkan menemukan dan menggunakan dua kerentanan zero-day yang sebelumnya tidak diketahui. Kami mengungkapkan kedua kerentanan tersebut kepada pemelihara masing-masing.

Kami juga menguji Astra pada SRE-Bench15, sebuah tolok ukur yang mengukur apakah model dapat merekayasa balik biner perangkat lunak untuk memahami logika intinya tanpa akses ke kode sumber mentah. Astra menyelesaikan 88,0% tugas dalam satu percobaan dan 99,2% dalam maksimal empat percobaan, dibandingkan dengan masing-masing 55,9% dan 68,7% untuk GPT‑5.6 Sol.

Di luar tolok ukur, penilaian yang dipimpin pakar mendapati bahwa Astra, ketika dijalankan tanpa pengamanan produksi, dapat menggunakan kerentanan yang sebelumnya tidak diketahui untuk mencapai eksekusi kode arbitrer di browser yang diperkuat dan membuat eksploit eskalasi hak istimewa untuk sistem operasi yang diperkuat.

Seperti yang kami bahas dalam The Defender’s Window, kemampuan siber terdepan dapat membantu para pembela menemukan kelemahan lebih cepat, tetapi juga membuat kelemahan tersebut lebih mudah dieksploitasi, sehingga meningkatkan urgensi bagi para pembela untuk beradaptasi. Dengan versi Astra yang diluncurkan hari ini, pembela dapat menggunakannya untuk menyelesaikan tugas-tugas seperti peninjauan keamanan kode dan penerapan patch.

Namun, Astra akan menolak menjalankan tugas keamanan siber yang lebih canggih seperti membuat eksploit bukti konsep untuk kerentanan. Melalui OpenAI Daybreak⁠, kami berencana untuk memperluas akses dan meluncurkan perlindungan yang tidak terlalu ketat dalam beberapa minggu mendatang. Ini akan memungkinkan lebih banyak alur kerja keamanan defensif, termasuk validasi kerentanan dan bukti konsep, analisis malware, dan rekayasa deteksi.

Kami juga telah memperkuat perlindungan kami terhadap potensi penyalahgunaan siber, dengan melanjutkan pengembangan rangkaian perlindungan kami untuk GPT‑5.6 Sol. Hal ini mencakup ketahanan model yang lebih kuat agar lebih mampu menghadapi potensi jailbreak serta konteks yang lebih banyak untuk sistem pemantauan kami. Kami telah melanjutkan pengujian internal dan eksternal yang ketat, termasuk evaluasi otomatis dengan penyerang red teaming internal kami. Detail lebih lanjut tentang perlindungan siber dan pengujian kami tersedia dalam ikhtisar keselamatan⁠ Astra dan kartu sistem⁠(terbuka di jendela baru)..

Menyelaraskan dan menerapkan GPT‑6 Astra secara bertanggung jawab

Astra adalah model kami yang paling selaras. Astra unggul dalam menerapkan kehati-hatian, menghormati batasan tugas, dan berkomunikasi secara transparan. Pekerjaan ini merupakan hasil terbaru dari program riset jangka panjang kami yang berfokus pada pelatihan model agar tetap selaras dengan maksud manusia dari awal hingga akhir.

Di lingkungan yang sensitif, Astra bertindak dengan kehati-hatian yang sepadan dengan tingkat risikonya. Dalam evaluasi terhadap tugas penggunaan komputer yang dipilih secara adversarial untuk memancing perilaku yang tidak semestinya, Astra lebih berhasil menghindari konsekuensi yang tidak diinginkan. Saat dijalankan dengan langkah-langkah keamanan tambahan yang disediakan secara bawaan, model ini menghasilkan performa yang bahkan lebih baik.

Astra menghasilkan lebih sedikit hasil yang tidak selaras daripada model terdepan lain mana pun yang diuji. Untuk perbandingan yang adil, kami menggunakan harness agen berbasis komputer umum (berdasarkan alat penggunaan komputer bawaan yang tersedia baik di API Repons OpenAI⁠(terbuka di jendela baru) maupun API Pesan Anthropic⁠(terbuka di jendela baru)) dan tanpa perlindungan tambahan yang biasanya diterapkan untuk pengguna Codex dan ChatGPT Work (peninjauan otomatis, kebijakan konfirmasi).

Astra juga lebih cenderung beroperasi dalam batasan yang ditetapkan oleh pengguna dan yang tersirat dari lingkungannya. Dalam evaluasi internal, Astra tidak pernah mencoba mengakali penolakan Peninjauan Otomatis Codex. Hal ini tetap berlaku bahkan ketika Peninjauan Otomatis sengaja dikonfigurasi agar dapat dielakkan dan tugas tersebut tidak mungkin diselesaikan dengan cara lain. Penghormatan terhadap pembatasan lingkungan ini selaras dengan hasil evaluasi tugas siber yang mustahil kami bagikan dalam pengantar postingan ini serta temuan lain yang didokumentasikan dalam kartu sistem⁠(terbuka di jendela baru) kami.

Astra juga menetapkan tolok ukur baru dalam komunikasi pengguna yang transparan. Dalam satu evaluasi, Astra tiga kali lebih kecil kemungkinannya dibandingkan GPT‑5.6 Sol untuk membuat pernyataan yang tidak akurat tentang kapabilitas dan fungsi yang dapat dilakukannya.

Dalam evaluasi halusinasi kapabilitas kami, Astra menunjukkan peningkatan substansial dibandingkan GPT‑5.6 Sol, dengan membuat lebih sedikit klaim menyesatkan tentang kapabilitasnya.

Evaluasi kami mendapati bahwa penalaran tertulis Astra lebih sulit dipantau daripada GPT‑5.6 Sol, berdasarkan pengujian yang secara eksplisit memintanya untuk menghindari pemantauan. Kami mengaitkan hal ini dengan kendali Astra yang lebih besar atas penalaran tertulis pada tugas yang lebih sederhana serta kemampuannya menyelesaikan masalah dengan lebih sedikit langkah tertulis. Astra masih tampak kesulitan menyembunyikan penalaran yang diperlukan untuk tugas kompleks, tetapi kami menanggapi penurunan ini dengan serius. Meningkatkan keterpantauan tetap menjadi prioritas penelitian, dan kartu sistem⁠(terbuka di jendela baru) yang menyertainya merinci temuan serta pekerjaan kami yang sedang berlangsung.

Pelatihan penyelarasan merupakan inti dari pendekatan kami terkait penerapan. Sebagai lapisan pertahanan tambahan, kami juga membangun perlindungan sistem seperti Peninjauan Otomatis⁠(terbuka di jendela baru) Codex serta pemantauan penalaran dan tindakan agen untuk membantu mendeteksi dan membatasi perilaku tidak aman. Seperti yang dijelaskan dalam pembaruan keamanan⁠ kami, kami juga menerapkan pemantauan ketidakselarasan dalam produksi untuk model sekelas Astra agar memiliki visibilitas terhadap ketidakselarasan dan membantu membatasi kasus terburuknya. Pengamanan ini menyerupai pemantauan kami untuk penerapan internal dan melibatkan sistem pengklasifikasi yang memeriksa penalaran serta tindakan model untuk menemukan perilaku tanpa izin dan secara otomatis menghentikan aktivitas yang berpotensi tanpa izin.

Mengingat peningkatan signifikan dalam kapabilitas keamanan siber Astra, kami sangat berhati-hati untuk memastikan penerapan ini aman dan terlindungi. Pemeriksaan keamanan tambahan terkadang dapat memperlambat, menjeda, atau menghentikan pekerjaan yang sah, termasuk keamanan siber defensif. Jika sebuah tugas dijeda di ChatGPT atau Codex, Anda mungkin diminta meninjau tindakan tersebut sebelum melanjutkan. Di API, tugas akan berhenti. Pemeriksaan ini terkadang dapat mengganggu pekerjaan yang sah, dan kami terus menyempurnakan sistem ini untuk mengurangi gangguan yang tidak perlu. Pemantauan ketidakselarasan tidak dapat menggantikan keselarasan: tujuan kami adalah membangun model yang secara andal tetap berada dalam cakupan yang diizinkan, sehingga perlindungan ini tidak perlu melakukan intervensi.

"Ketersediaan"

GPT‑6 Astra mulai diluncurkan hari ini untuk sejumlah organisasi terbatas dan dalam beberapa hari mendatang akan tersedia bagi semua pengguna ChatGPT Plus, Pro, Business, dan Enterprise, serta melalui API OpenAI, Microsoft Azure, dan AWS Bedrock. Penggunaan Astra termasuk dalam kuota langganan yang ada—pengguna dan bisnis juga akan dapat membeli kredit untuk penggunaan tambahan. Pengguna paket Pro, Business, dan Enterprise juga akan mendapatkan akses ke GPT‑6 Astra Pro. Administrator Enterprise dapat mengaktifkan Astra untuk workspace mereka; akses dinonaktifkan secara default saat peluncuran.

Astra mendukung Retensi Data Nol bagi pelanggan API yang memenuhi syarat, dan seperti yang kami sampaikan bulan lalu, kami sedang menguji Pemrosesan Keamanan Privat untuk memperkuat pemantauan keamanan dengan tetap menjaga privasi pelanggan.

Untuk pengembang, GPT‑6 Astra akan tersedia di API OpenAI sebagai gpt-6-astra dan melalui Microsoft Azure serta Amazon Bedrock.

Harga OpenAI API Standar adalah $10 per satu juta token masukan dan $50 per satu juta token keluaran. Tarif terpisah berlaku untuk pembacaan dan penulisan cache. Mode Cepat tersedia untuk GPT‑6 Astra di API dan menawarkan kecepatan hingga 2x lipat dari pemrosesan Standar dengan harga 2x lipat harga Standar.

Penggunaan Komputer

Penggunaan Komputer

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, set offline, skor parsial)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (tanpa alat)

92,7%

76,9%

-

87,3%17

-

-

Profesional

Profesional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4%

18,1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Tugas Desain Internal

50,0%

47,4%

-

35,8%

-

-

Tugas Ilmu Data Internal

40,9%

30,5%

-

34,7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Pengodean

PengodeanGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended (skor)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Utama (skor)53,3% 847,5%50,9%53,5%53,4%43,6%
Tugas Migrasi Basis Data Internal63,9%42,7%57,8%50,3%--
Artificial Analysis Coding Agent Index v1.467,065,1-67,268,161,2

Akademik

Akademik

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21,4%

30,0%

-

FrontierMath Tingkat 4 (v2)

97,6%

83,0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6%

93,7%

92,6%

93,7%

95,3%

Humanity's Last Exam (dengan alat)

57,2%

-

65,0%

63,8%

63,6%

-

Sains dan Kesehatan

Sains dan KesehatanGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (Internal)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (disesuaikan berdasarkan panjang)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

Keamanan siber

Keamanan siberGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70%-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (Juni-Agu 2026)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Penyelarasan

Penyelarasan

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Tolok ukur keamanan penggunaan komputer internal (semakin rendah semakin baik)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Tolok ukur keamanan penggunaan komputer internal, dengan Peninjauan Otomatis (semakin rendah semakin baik)

1,8%

4,3%

-

-

-

-

Tolok ukur pengelakan internal (semakin rendah semakin baik)

0.00%

0,29%

-

-

-

-

Honeypot ExploitGym (semakin rendah semakin baik)

0,0%

48,2%

-

-

-

-

ExploitGym yang mustahil

100,0%

-

-

-

-

-

Tolok ukur halusinasi internal (semakin rendah semakin baik)

4,2%

12,2%

-

-

-

-

Konteks Panjang

Konteks Panjang

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Penalaran abstrak

Penalaran abstrakGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9% 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Skor evaluasi merupakan nilai maksimum pada tingkat upaya apa pun. Evaluasi GPT dijalankan dalam lingkungan riset kami atau melalui API kami, yang mungkin memberikan keluaran yang sedikit berbeda dari ChatGPT produksi karena perbedaan dalam prompt sistem, alat yang tersedia, dan sebagainya.

CATATAN KAKI

  1. 1

    Pada ARC-AGI-3, GPT-6 Astra dijalankan dengan harness API Respons kami⁠, yang mengubah dua pengaturan agar lebih sesuai dengan performa dunia nyata. Perubahan tersebut tidak secara khusus menargetkan ARC-AGI-3.

  2. 2

    GPT-5.6 Sol merujuk pada versi yang tersedia di API kami, ChatGPT Codex, dan ChatGPT Work. Versi di ChatGPT Chat sedikit berbeda.⁠

  3. 3

    OSWorld V2-Offline adalah subset dari OSWorld V2 asli yang dapat berfungsi tanpa akses internet. Performa model Claude pada OSWorld-V2 Offline direproduksi oleh para penulis di papan peringkat resmi⁠(terbuka di jendela baru). Pada OSWorld 2.0, skor untuk Claude menggunakan pengaturan resmi, bukan tugas yang dimodifikasi dan penilaian yang dimodifikasi dari kartu sistem Fable 5.1.

  4. 4

    Waktu model adalah waktu yang telah berlalu yang dilaporkan untuk proses demonstrasi terkait. Klip yang ditampilkan merupakan cuplikan yang telah diedit.

  5. 5

    Pada BenchCAD, skor Claude mencerminkan 3 modifikasi pada evaluasi, yang dirinci dalam Kartu Sistem Fable 5.1⁠(terbuka di jendela baru).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, dan Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(terbuka di jendela baru).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, dan Peter Jonas. “The OpenScore String Quartet Corpus⁠(terbuka di jendela baru).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    Di FrontierCode, GPT-6 Astra dijalankan dengan pesan pengembang yang serupa dengan bagian dari pesan pengembangnya di Codex⁠(terbuka di jendela baru): "Hindari membuat terlalu banyak file pengujian. Buat file pengujian baru hanya jika diwajibkan oleh konvensi repositori atau jika tidak ada file yang sudah ada yang sesuai untuk digunakan. Hindari pembersihan yang tidak terkait dan kompleksitas yang tidak perlu. Gunakan kembali utilitas yang sudah ada dan sesuai. Baca instruksi repositori yang relevan dan periksa kode, pengujian, dokumentasi, serta CI di sekitarnya. Ikuti konvensi yang telah ditetapkan. Tujuannya adalah kode yang bersih dan dapat digabungkan." Prompt tidak dioptimalkan untuk eval.

  9. 9

    Yang pertama berkaitan dengan seberapa dekat bilangan prima dapat muncul, sejauh apa pun Anda bergerak di sepanjang garis bilangan. Selama lebih dari satu dekade, hasil terbaik yang diketahui menunjukkan bahwa terdapat tak terhingga banyaknya pasangan bilangan prima yang berjarak paling jauh 246. Julia Stadlmann⁠(terbuka di jendela baru) baru-baru ini memperbaiki batas tersebut menjadi 240. Astra membantu menetapkan batas yang lebih kuat, yaitu 186, dengan menunjukkan bahwa terdapat tak terhingga banyaknya pasangan yang berjarak tidak lebih dari nilai yang lebih kecil ini. Jarak antarbilangan prima pendek: Bukti⁠(terbuka di jendela baru) dan penelitian pendukung⁠(terbuka di jendela baru).

  10. 10

    Yang kedua berkaitan dengan jarak yang luar biasa besar antara bilangan prima. Astra memperbaiki sebuah suku dalam batas untuk jarak-jarak ini yang tetap tidak berubah selama lebih dari 80 tahun. Kami membagikan pembuktian serta rantai pemikiran yang diringkas dan materi verifikasi untuk kedua hasil tersebut. Jarak antarbilangan prima besar: Bukti⁠(terbuka di jendela baru) dan penelitian pendukung⁠(terbuka di jendela baru).

  11. 11

    Kami mengevaluasi secara independen semua model Claude dengan mengikuti prosedur HealthBench Professional yang dimaksud, menggunakan GPT‑5.4 skor penilaian dan skor yang disesuaikan panjangnya, tanpa pembatasan. Untuk Fable 5.1, kami menggunakan fallback Opus 5 untuk penolakan dari penyedia.

  12. 12

    Claude Fable 5 dan 5.1 tidak disertakan dalam LifeSciBench Gold v1, GeneBench Pro v13, dan MedChemBench karena keduanya menolak sebagian besar pertanyaan dalam evaluasi ini.

  13. 13

    Di ExploitGym, kami menguji Astra dan Sol tanpa batas waktu 6 jam untuk menilai kemampuan siber penuh mereka dengan lebih baik. Mereka cukup cepat sehingga dampaknya kecil.

  14. 14

    ExploitBench (Juni–Agustus 2026) mencakup 20 kerentanan V8 berkeparahan tinggi di seluruh 13 rilis stabil Chrome. Tolok ukur ini menguji apakah agen dapat mencapai eksekusi kode arbitrer di V8 dan rilis resmi Chrome untuk Linux dengan mengeksploitasi setiap kerentanan yang ditentukan. Beberapa kerentanan yang disertakan mungkin tidak memungkinkan eksekusi kode arbitrer dalam batasan evaluasi tersebut, sehingga tingkat keberhasilan 100% mungkin tidak dapat dicapai. Catatan: skor 5.5% GPT-5.6 Sol merupakan artefak dari batas 300 giliran dalam tolok ukur, yang bukan merupakan batas yang akan dihadapi pelanggan nyata yang menggunakan max. Model dengan pengaturan serupa mencapai skor 11,5% ketika menemui lebih sedikit batasan.

  15. 15
  16. 16

    Saat kami menguji di berbagai model pihak ketiga, kami menggunakan pengaturan riset yang lebih sederhana. Codex memiliki konfigurasi produksi yang lebih kompleks, yang dapat menghasilkan tingkat kesalahan model mentah yang berbeda. Pengamanan di sisi penyedia dan implementasi alat komputer masih berbeda. Pengguna tidak mengalami skenario tanpa konfirmasi di Codex, karena ini merupakan konfigurasi riset internal.

  17. 17

    Untuk ScreenSpot-Pro dan ExploitGym, skor Fable yang kami laporkan berasal dari Mythos, yaitu Fable dengan lebih sedikit pengamanan.