Generasi anyar pilihan kecerdasan
Pembaruan tanggal 22 September 2026: Kita lagi ngembangake kulawarga GPT‑6 kanthi GPT‑6 Sol lan GPT‑6 Luna. Sinau luwih lengkap.
Kita ngenalaké GPT‑6 Astra, model sing paling cerdas lan paling selaras ing donya.
GPT‑6 Astra nggabungaké riset suwene pirang-pirang taun lan taruhan gedhé ing latihan awalan, sinau penguatan, lan penyelarasan. Astra iku paling mutakhir ing babagan penggunaan komputer, browsing, rekayasa piranti lunak, keamanan siber, sains, lan pakaryan profesional. Astra nggayuh wates maksimal ing FrontierMath Tingkat 4 kanthi skor 98%, sawisé wis mbantu ngrampungaké masalah terbuka sing wis suwé durung bisa dirampungaké ing matematika. Astra uga nyampurnakake ARC-AGI-3 kanthi skor 99,9% lan ExploitBench kanthi skor 100%. Uga netepake tataran tercanggih anyar ing penggunaan komputer lan browser, nangani pakaryan profesional sing paling nuntut kanthi kacepetan, akurasi, lan pertimbangan sing ora ana tandhingane.
GPT‑6 Astra lagi diluncurake kanthi bertahap dina iki kanggo sawetara organisasi sing winates lan sajrone sawetara dina sabanjure bakal kasedhiya kanggo kabeh pengguna ChatGPT Plus, Pro, Business, lan Enterprise, uga liwat OpenAI API, Microsoft Azure, lan AWS Bedrock.
Astra minangka model kita sing paling selaras, kanthi dandan gedhe ing pangerten babagan maksud pengguna lan prilaku model—tugas bisa dipasrahake kanthi luwih yakin marang pertimbangan Astra. Minangka salah siji cara kanggo nguji iki, kita nggawe evaluasi anyar sing adhedhasar insiden Hugging Face kanggo ngevaluasi apa model sing ngadhepi tugas angel utawa mokal bakal ngluwihi cakupan sing dikarepake. Dibandhingake karo GPT‑5.6 Sol, sing tanpa pangreksa produksi ngluwihi target sing diwenangake ing 48% kasus, GPT‑6 Astra nindakake iki ing 0% kasus.
Model penggunaan komputer paling apik ing donya
GPT‑6 Astra nandhani tercanggih ing kacepetan, akurasi, lan keamanan penggunaan komputer. Iki bisa ngrampungake tugas-tugas sing mboseni, kayata ngisi formulir online, nganyari cathetan pelanggan ing CRM, lan ngatur kalender njenengan. Iki bisa nindakake panaliten online lan nyusun draf ringkesan ing email utawa ing editor dokumen njenengan. Iki bisa nganalisis data ilmiah, ngasilake grafik, nggawe situs web, lan nglakokake pamriksan QA frontend kanggo mesthekake kabeh fitur ing situs kasebut bisa mlaku. Iki bisa mbantu njenengan nginstal lan nguji piranti lunak kanthi mandiri, lan ngatasi masalah sing njenengan deleng ing layar. Pangapikan-pangapikan iki uga kacetha ing asil evaluasi paling mutakhir kita.
Pangapikan iki uga ngasilaké paningkatan efisiensi sing signifikan ing tugas pakaryan adhedhasar kawruh nyata. Ing simulasi latensi ing OSWorld 2.0, Astra nggayuh kinerja penggunaan komputer sing luwih dhuwur kanthi wektu saben tugas kira-kira 47% luwih sithik tinimbang GPT‑5.6 Sol, kanthi skor 72,6% ing udakara 40 menit saben tugas, dibandhingaké karo 65,7% ing udakara 75 menit.3
Kapabilitas penggunaan komputer GPT‑6 Astra bisa dideleng ing asil ing manéka bidang, kalebu pangembangan game, teknik elektro, lan pagawéan kawruh saben dina:
Saliyane Astra, kita uga nganyari harness Codex kanggo ningkatake kacepetan penggunaan komputer kanthi signifikan. Digabungake karo efisiensi Astra, iki ndadekake panyelesaian tugas 1.9x luwih cepet dibandhingake pengalaman GPT‑5.6 Sol saiki, ing tolok ukur Mind2Web. Pangapikan kacepetan model kasebut ateges model iki bisa nangani akeh tugas urip sing mbutuhake wektu kanggo njenengan, luwih cepet tinimbang njenengan bisa nindakake dhewe.4
Owah-owahan gedhe ing pakaryan profesional
GPT‑6 Astra nggabungaké kemajuan ing penggunaan komputer karo pelatihan sing ditargetake kanggo lingkungan profesional, kanggo mbantu nangani tugas kerja sing kompleks. Model iki nggabungaké pilihan kecerdasan sing dibutuhake kanggo masalah kompleks karo kemampuan kanggo nindakake alur kerja multilangkah lan ngasilaké dokumen, spreadsheet, lan presentasi sing rapi.
GPT‑6 Astra minangka model paling apik kanggo netepi templat sing wis ana lan ngasilake slide sing tata letake apik lan kanthi cekak ngandharake poin-poin utama liwat narasi sing terstruktur. Iki nggawe dokumen, presentasi, spreadsheet, lan analisis sing cetha lan katata kanthi apik, manut cithakan njenengan lan cocog karo gaya penulisan lan visual njenengan. Astra uga dilatih khusus supaya mung nglebokake konteks sing relevan menyang output, tinimbang mbaleni informasi sing ora perlu kanggo tugas sing lagi digarap. Kabeh iki tegese bisa ngasilake artefak sing luwih langsung bisa digunakake lan cocog karo konteks bisnis lan standar njenengan.
GPT‑6 Astra uga nggawa pertimbangan visual sing luwih kuwat menyang situs web, game, aplikasi, lan rendering sing digawe. Kanthi Sites(mbukak ing jendhela anyar) ing ChatGPT, Astra bisa nggawe, ng-host, lan nuduhake situs web, aplikasi web, lan game langsung saka prompt.
Nalika instruksi menehi ruang kanggo interpretasi, GPT‑6 Astra luwih apik tinimbang model sadurungé nalika njupuk keputusan sing tepat. Iki nggunakake konteks kanggo ngisi kekosongan rutin lan ngajokake pitakonan sing terarah nalika jawabané bisa ngganti asilé. Ing Codex, GPT‑6 Astra bisa takon kanthi asinkron nalika terus nggarap tugas sing ora gumantung marang wangsulan njenengan. Yen njenengan ora mangsuli, sistem bakal nerusake kanthi asumsi sing wajar yen perlu, nanging bakal ngenteni masukan saka njenengan kanggo keputusan sing penting lan duwé akibat gedhé.
Tuladha ing ngisor iki nuduhaké carané Astra makarya bebarengan ing tugas saben dina, ing ngendi informasi sing ora ana bisa kanthi nyata ngowahi wangsulan.
Astra uga luwih apik kanggo tetep mangerteni arah nalika tugas berkembang. Modhel-modhel sadurungé kadhangkala nganggep pesen pangarah minangka tujuan anyar, nganti kelangan jejak panyuwunan asli utawa watesan sadurungé. Astra nggabungake kabutuhan anyar, ngganti arah nalika dijaluk, lan mangsuli pitakon sampingan tanpa nglirwakake tugas sing luwih amba.
Ngoding
GPT‑6 Astra minangka model paling apik kanggo rekayasa piranti lunak nganti saiki.
“GPT‑6 Astra nyedhiyakake kinerja paling canggih ing tolok ukur pangodean internal kita lan nuduhake kemajuan sing jelas ing evaluasi intuisi dagang dibandhingake karo GPT‑5.6 Sol. Nalika digunakake kanggo pangodean agentik, GPT‑6 Astra komunikasi kanthi cara sing luwih gampang diikuti para pangembang lan ngasilake kode sing mbutuhake iterasi luwih sithik kanggo nggayuh kualitas siap produksi.”
“Kita nguji Astra ing tingkat effort kurang, Kecepatan Standar, lan dhuwur ing salah siji eval generasi kapisan, lan asilé luwih unggul kanthi signifikan tinimbang GPT 5.6 Sol. Effort sing luwih dhuwur menehi luwih akeh iterasi ing build anyar, luwih akeh verifikasi liwat pangujian browser, lan luwih cenderung menyang eksekusi kode tinimbang apply-patch. Pangerten babagan cara model ngokokaké effort-é minangka cara kita menehi jutaan pangembang dalan sing luwih cepet lan luwih andal saka gagasan menyang aplikasi sing bisa digunakaké.”
Kanthi Astra, kita ngenalake cara anyar supaya Codex bisa njaga lan njupuk maneh konteks nalika jendhela konteks kebak. Sacara historis, model nggunakake kompaksi kanggo ngringkes pakaryan sajrone sesi sing dawa, kayata nalika debug masalah sing rumit utawa nangani refaktor gedhe. Saben proses kompaksi bisa ora nyakup rincian babagan sebabe perbaikan gagal utawa kepiye sawijining komponen tumindak. Ing Codex, Astra bisa nyimpen cathetan ing antarane jendhela konteks, saengga rincian sing wis nglumpuk tetep kajaga tanpa bola-bali dikompres dadi siji ringkesan. Jendhela konteks sadurungé tetep bisa digolèki, mula Astra bisa nemokake persyaratan utawa asil uji saka pesen sadurungé lan output piranti—sanajan informasi kuwi ora kacathet ing cathetané. Bisa ngaktifaken fitur eksperimen iki ing config.toml Codex,(mbukak ing jendhela anyar) lan bakal dadi gawan kanggo Astra sajrone sawetara minggu sing bakal teka.
Majokake panemuan ilmiah
Astra saged mbiyantu pakaryan praktis ingkang nyengkuyung panemon ilmiah. Kanthi nggabungaké nalar ilmiah lan penggunaan komputer, Astra bisa makarya langsung ing piranti lunak khusus kanggo mriksa data lan njajaki asil, mbantu para panaliti ngevaluasi bukti lan mutusaké apa sing bakal ditliti sabanjuré.
Keamanan siber
Kaya sing wis dirembug ing pembaruan keamanan kita, Astra minangka lompatan gedhe ing kapabilitas siber lan nyukupi ambang Kritis ing keamanan siber miturut Kerangka Kerja Kesiapan kita. Kemampuane kanggo ngenali lan ngembangake eksploit zero-day bisa mbantu para pembela nemokake lan nambal kerentanan, nanging uga nuwuhake kabutuhan kanggo pengayoman sing luwih kuwat. Kanggo mangertèni nganti sepira adoh kabisan iki, kita nguji Astra nganggo evaluasi internal lan evaluasi saka ahli pihak katelu.
Kita luwih dhisik nguji model tanpa pengamanan produksi ing ExploitBench lan ExploitGym, sing ngevaluasi apa model bisa ngowahi kerentanan piranti lunak sing wis dikenal dadi eksploit sing bisa digunakake. Ing ExploitBench, Astra nggayuh skor sampurna 100%, dibandhingake karo 78,5% sing digayuh GPT‑5.6 Sol, model kita sadurunge sing nduweni kapabilitas keamanan siber tercanggih. Ing ExploitGym, Astra nggayuh tingkat kasil 42,4%, dibandhingaké karo 30,3% kanggo GPT‑5.6 Sol, nalika nggunakake token output sing luwih sithik banget.13
Amarga ana keprihatinan manawa paparan marang kerentanan piranti lunak historis bisa mengaruhi asil tolok ukur, kita uga ngevaluasi Astra ing rong tolok ukur anyar. Salah siji, kita nggawe evaluasi internal “ExploitBench (Juni–Agustus 2026)” kanggo nguji pangembangan eksploit nggunakake kerentanan saka telung sasi sadurunge.14 Astra nggayuh tingkat eksekusi kode arbitrer sing luwih dhuwur tinimbang GPT‑5.6 Sol ing set data iki nalika nggunakake token output sing luwih sithik. Sajrone evaluasi, Astra malah nemokake lan nggunakake rong kerentanan zero-day sing sadurunge durung dingerteni. Kita lagi nglaporake kaloro kerentanan kasebut marang para pangopèn.
Kita uga nguji Astra ing SRE-Bench15, sawijining tolok ukur sing ngukur apa model bisa ngrekayasa balik binar piranti lunak kanggo mangerteni logika intiné tanpa akses menyang kode sumber mentah. Astra kasil ngrampungake 88,0% tugas sajrone siji upaya lan 99,2% sajrone patang upaya, dibandhingake karo 55,9% lan 68,7% kanggo GPT‑5.6 Sol.
Saliyane tolok ukur, pambiji sing dipimpin ahli nemokake manawa Astra, nalika dijalanké tanpa pangayoman produksi, bisa nggunakake kerentanan sing durung dimangerteni kanggo nglakokake kode sembarang ing browser sing wis dikuwatake lan nggawe eksploitasi eskalasi hak istimewa kanggo sistem operasi sing wis dikuwatake.
Kaya sing wis dirembug ing The Defender’s Window, kapabilitas siber tercanggih bisa mbantu para pambela nemokake kelemahan kanthi luwih cepet, nanging uga ndadekake kelemahan kasebut luwih gampang dieksploitasi, saengga nambah urgensi supaya para pambela bisa adaptasi. Kanthi versi Astra sing diluncurake dina iki, para pembela bisa nggunakake kanggo ngrampungake tugas kayata tinjauan kode sing aman lan patching.
Nanging, Astra bakal nolak nindakake tugas keamanan siber sing luwih canggih kayata nggawe bukti konsep eksploitasi kanggo kerentanan. Liwat OpenAI Daybreak, kita ngrencanakake nggedhekake akses lan ngluncurake pangayoman sing ora pati mbatesi sajrone minggu-minggu sing bakal teka. Iki bakal ngaktifake luwih akeh alur kerja defensif, kalebu validasi kerentanan lan bukti konsep, analisis malware, lan rekayasa deteksi.
Kita uga nguwatake pengamanan marang potensi penyalahgunaan siber, adhedhasar tumpukan pengamanan kanggo GPT‑5.6 Sol. Iki kalebu ketangguhan model sing luwih kuwat supaya luwih tahan marang potensi jailbreak lan konteks sing luwih akeh kanggo sistem pemantauan kita. Kita terus nindakake pangujian internal lan eksternal kanthi ketat, kalebu evaluasi otomatis karo penyerang red teaming internal kita. Rincian luwih lengkap babagan pengamanan siber lan pangujian kita kasedhiya ing Astra ringkesan keamanan lan kertu sistem(mbukak ing jendhela anyar)..
Nyelarasake lan ngetrapake GPT‑6 Astra kanthi tanggung jawab
Astra minangka model kita sing paling selaras. Astra unggul ing babagan tumindak kanthi ati-ati, ngajeni wates-wates tugas, lan komunikasi kanthi transparan. Karya iki minangka asil paling anyar saka program riset jangka panjang kita sing fokus nglatih model supaya tetep selaras karo karsa manungsa saka wiwitan nganti rampung.
Ing lingkungan sing sensitif, Astra tumindak kanthi ngati-ati selaras karo tingkat risikone. Sajrone evaluasi tugas penggunaan komputer sing dipilih kanthi pendekatan adversarial kanggo nyebabake prilaku nyimpang, Astra luwih kasil ngindhari konsekuensi sing ora disengaja. Dijalanké nganggo langkah-langkah keamanan tambahan sing disedhiyakake minangka gawan ngasilaké kinerja sing luwih kuwat maneh.
Astra nyebabake luwih sithik asil sing ora selaras tinimbang model tercanggih liyane sing diuji. Kanggo perbandhingan sing adil, kita nggunakake harness agen panganggo komputer umum (adhedhasar piranti penggunaan komputer bawaan sing kasedhiya ing loro-loroné OpenAI Responses API(mbukak ing jendhela anyar) lan Anthropic Messages API(mbukak ing jendhela anyar)) lan tanpa pangayoman tambahan sing biasane ditrapake kanggo pengguna Codex lan ChatGPT Kerja (tinjauan otomatis, kabijakan konfirmasi).
Astra uga luwih cenderung tumindak ana ing sajroning watesan sing ditetepake dening pengguna lan sing disiratake dening lingkungane. Ing evaluasi internal, Astra ora tau nyoba ngliwati penolakan Codex Auto-Review. Iki tetep bener sanajan Auto-review kanthi sengaja diatur supaya bisa diendhani lan tugas kasebut ora mungkin dirampungaké kanthi cara liya. Penghormatan marang watesan lingkungan iki selaras karo asil evaluasi tugas siber mokal sing kita bagikake ing pembuka tulisan iki lan temuan liyane sing didokumentasikake ing kertu sistem(mbukak ing jendhela anyar) kita.
Astra uga netepake pathokan anyar ing komunikasi pengguna sing transparan. Ing sawijining evaluasi, Astra telung kaping luwih arang tinimbang GPT‑5.6 Sol menehi gambaran sing ora akurat babagan kapabilitas lan kemungkinan penggunaane.
Ing evaluasi halusinasi kapabilitas, Astra nuduhake paningkatan sing signifikan tinimbang GPT‑5.6 Sol, kanthi nggawe klaim mblusukake sing luwih sithik babagan kapabilitase.
Evaluasi kita nemokake manawa nalar tinulis Astra luwih angel dipantau tinimbang GPT‑5.6 duwèké Sol, adhedhasar tes sing kanthi eksplisit njaluk supaya ngindhari pangawasan. Kita ngubungake iki karo kontrol Astra sing luwih gedhe marang nalar tinulis ing tugas sing luwih prasaja lan kemampuan kanggo ngrampungake masalah kanthi luwih sithik langkah tinulis. Astra isih katon angel ndhelikake nalar sing dibutuhake kanggo tugas rumit, nanging kita nganggep penurunan iki kanthi serius. Ningkatake kemampuan pemantauan tetep dadi prioritas riset, lan kertu sistem(mbukak ing jendhela anyar) sing ngancani njlentrehake temuan lan pakaryan kita sing lagi ditindakake.
Pelatihan penyelarasan minangka inti saka pendekatan kita kanggo penerapan. Minangka lapisan pertahanan tambahan, kita uga mbangun pengayoman sistem kayata Codex Auto-review(mbukak ing jendhela anyar) lan pemantauan nalar lan tumindak agen kanggo mbantu ndeteksi lan nanggulangi prilaku sing ora aman. Kaya sing dijlentrehake ing nganyari keamanan, kita uga nerapake pemantauan ketidakselarasan ing produksi kanggo model kelas Astra supaya nduweni visibilitas tumrap ketidakselarasan lan mbantu nanggulangi kedadeyan sing paling parah. Pengayoman iki padha karo pemantauan penerapan internal kita lan nyakup sistem penggolong sing mriksa nalar lan tumindak model kanggo ndeteksi prilaku tanpa wewenang, banjur kanthi otomatis mungkasi kegiyatan sing bisa uga tanpa wewenang.
Amarga kapabilitas keamanan siber Astra saya mundhak kanthi signifikan, kita ngati-ati banget kanggo mesthekaké penerapan iki aman lan terlindhungi. Pamariksaan keamanan tambahan kadhangkala bisa nyebabake pakaryan sing sah dadi luwih alon, mandheg sauntara, utawa mandheg, kalebu keamanan siber defensif. Yen tugas diendhegake sauntara ing ChatGPT utawa Codex, njenengan bisa dijaluk mriksa tumindak kasebut sadurunge nerusake. Ing API, tugas bakal mandheg. Pangecèkan iki kadhangkala bisa ngganggu pakaryan sing sah, lan kita terus nyempurnakake sistem iki kanggo nyuda gangguan sing ora perlu. Pemantauan ketidakselarasan ora bisa ngganteni penyelarasan: tujuan kita yaiku mbangun model sing kanthi andal tetep ana ing cakupan wewenange, supaya pangayoman iki ora perlu campur tangan.
Kasedhiyan
GPT‑6 Astra lagi diluncurake kanthi bertahap dina iki kanggo sawetara organisasi sing winates lan sajrone sawetara dina sabanjure bakal kasedhiya kanggo kabeh pengguna ChatGPT Plus, Pro, Business, lan Enterprise, uga liwat OpenAI API, Microsoft Azure, lan AWS Bedrock. Penggunaan Astra kalebu ing jatah langganan sing wis ana—pengguna lan bisnis uga bakal bisa tuku kredit kanggo penggunaan tambahan. Pengguna ing paket Pro, Business, lan Enterprise uga bakal entuk akses menyang GPT‑6 Astra Pro. Administrator Enterprise bisa ngaktifake Astra kanggo papan kerja; akses dipatèni kanthi gawan nalika diluncurake.
Astra ndhukung retensi data nol kanggo pelanggan API sing layak, lan kaya sing wis dituduhake wulan kepungkur, kita lagi nguji Pengolahan Keamanan Privat kanggo nguwatake pemantauan keamanan nalika tetep njaga privasi pelanggan.
Kanggo pengembang, GPT‑6 Astra bakal kasedhiya ing OpenAI API minangka gpt-6-astra lan liwat Microsoft Azure lan Amazon Bedrock.
Rega Standar OpenAI API yaiku $10 saben sejuta token input lan $50 saben sejuta token output. Tarif kapisah ditrapake kanggo operasi maca lan nulis cache. Mode cepet kasedhiya kanggo GPT‑6 Astra ing API lan nyedhiyakake kacepetan nganti 2x kecepetan pemrosesan Standar kanthi rega 2x rega Standar.
Panggunaan Komputer
| Panggunaan Komputer | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| OSWorld 2.0 (rilis Agustus, skor parsial) | - | - | - | 66,1% | 70,6% | - |
| OSWorld 2.0 (rilis Agustus, subset offline, skor parsial) | - | - | - | - | - | - |
| ScreenSpot Pro | 92,6% | 76,8% | - | - | - | - |
| BrowseComp | 92,1% | 90,4% | - | 87,4% | 90,8% | - |
Profesional
Profesional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore Kuartet Gesek (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Tugas Perancangan (Internal) | 50,0% | 47,4% | - | 35,8% | - | - |
Tugas Ilmu Data Internal | 40,9% | 30,5% | - | 34,7% | - | - |
Indèks Pilihan Kecerdasan Analisis Buatan v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Ngoding
| Ngoding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| a"DeepSWE v1.1" | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Dijembarake (skor) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Utama (skor) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Tugas Migrasi Basis Data Internal | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Indeks Agen Ngoding Analisis Buatan v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akademik
| Akademik | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,2% | 94,5% |
| Èlmu Komputer Téoritis | - | 75,4% | - | - | - | - |
| FrontierMath Tingkat 1-3 (v2) | - | 89.0% | 90,2% | 87,0% | 85,6% | 71,6% |
| FrontierMath Tingkat 4 (v2) | 97,6% | 83,0% | 87,8% | 87,8% | 73,2% | 36,6% |
| Ujian Pungkasané Umat Manungsa (piranti) | - | - | 65,0% | 63,8% | 63,6% | - |
| Ujian Pungkasané Umat Manungsa (tanpa piranti) | - | - | 59,1% | 55,5% | 54,9% | 47,9% |
Sains lan Kesehatan
Panyelarasan
Panyelarasan | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Tolok ukur keamanan penggunaan komputer internal (luwih endhek luwih apik) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Pathokan keamanan panggunaan komputer internal, nganggo AutoReview (Sing luwih cilik luwih apik) | 1,8% | 4,3% | - | - | - | - |
Pathokan pangliwatan internal (luwih cilik luwih apik) | 0,00% | 0,29% | - | - | - | - |
Honeypot ExploitGym (Sing luwih cilik luwih apik) | 0,0% | 48,2% | - | - | - | - |
ExploitGym Mokal | 100,0% | - | - | - | - | - |
Tolok ukur halusinasi internal (luwih endhek luwih apik) | 4,2% | 12,2% | - | - | - | - |
Konteks dawa
Konteks dawa | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Panalaran abstrak
| Nalar abstrak | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
Skor evaluasi minangka skor maksimal ing upaya apa wae. Evaluasi GPT ditindakake ing lingkungan riset kita utawa liwat API kita, sing bisa menehi output sing rada beda tinimbang ChatGPT produksi amarga bedane ing prompt sistem, piranti sing kasedhiya, lan sapanunggalane.
CATHETAN SIKIL
- 1
Ing ARC-AGI-3, GPT-6 Astra dijalanké nganggo harness API respons kita, sing ngowahi rong setelan supaya luwih cocog karo kinerja donya nyata. Owah-owahan kasebut ora khusus nargetake ARC-AGI-3.
- 2
GPT-5.6 Sol nuduhake versi sing kasedhiya ing API kita, ChatGPT Codex, lan ChatGPT Kerja. Versi ing ChatGPT Ngobrol rada beda.
- 3
OSWorld V2-Offline yaiku saperangan bagean saka OSWorld V2 asli sing bisa digunakaké tanpa akses internet. Kinerja model Claude ing OSWorld-V2 Offline direproduksi déning para penulis ing papan peringkat resmi(mbukak ing jendhela anyar). Ing OSWorld 2.0, skor kanggo Claude nggunakake setelan resmi, dudu tugas sing diowahi lan penilaian sing diowahi saka Kertu Sistem Fable 5.1.
- 4
- 5
Ing BenchCAD, skor Claude nggambarake 3 modifikasi tumrap evaluasi kasebut, sing dirinci ing Kertu Sistem Fable 5.1(mbukak ing jendhela anyar).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, lan Noah A. Smith. “LEGATO: Pendekatan Skala Gedhé Sakak wiwitan nganti pungkasan sing Bisa Digeneralisasi kanggo OMR Typeset(mbukak ing jendhela anyar).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, lan Peter Jonas. “Korpus Kuartet Gesek OpenScore(mbukak ing jendhela anyar).” Prosiding Konferensi Internasional kaping 10 babagan Perpustakaan Digital kanggo Musikologi, kc. 49–57. ACM, 2023.
- 8
Ing FrontierCode, GPT-6 Astra dijalankake kanthi pesen pangembang sing padha karo bagean pesen pangembangé ing Codex(mbukak ing jendhela anyar): "Aja nggawe file tes sing kakehan. Gawe file tes anyar mung yen diwajibake dening konvensi gudang kode utawa yen ora ana file sing wis ana sing cocog kanggo dadi papané. Aja nindakake pambersihan sing ora ana gandhengane lan aja nambah kerumitan sing ora perlu. Gunakake maneh utilitas sing wis ana lan cocog. Wacanen pandhuan gudang kode sing relevan lan priksa kode, tes, dokumentasi, lan CI ing sacedhake. Tindakake konvensi sing wis ditetepake. Tujuané yaiku kode sing resik lan bisa digabungaké." Prompt kasebut ora dioptimalake kanggo eval.
- 9
Sing kapisan gegayutan karo sepira cedhaké bilangan prima bisa dumadi, ora preduli sepira adohé ing sadawane garis bilangan. Sajrone luwih saka dasawarsa, asil paling apik sing dikenal mbuktekaké manawa ana tanpa wates pasangan wilangan prima sing bedané ora luwih saka 246. Julia Stadlmann(mbukak ing jendhela anyar) bubar iki ningkataké wates kasebut dadi 240. Astra mbantu netepaké wates sing luwih ketat yaiku 186, sing nuduhaké yèn ana pasangan tanpa wates sing kedadeyan sajroning jarak sing luwih cilik iki. Sela cendhak antarane wilangan prima: Bukti(mbukak ing jendhela anyar) lan panaliten panyengkuyung(mbukak ing jendhela anyar).
- 10
Sing kapindho gegayutan karo jarak sing ora lumrah gedhé antarane bilangan prima. Astra ningkataké sawijining suku ing watesan tumrap longkangan-longkangan kasebut sing wis tetep ora owah luwih saka 80 taun. Kita nuduhake bukti-bukti lan ranté pikiran sing dicekak sarta materi verifikasi kanggo kaloro asil kasebut. Longkangan gedhé antarané wilangan prima: Bukti(mbukak ing jendhela anyar) lan panaliten panyengkuyung(mbukak ing jendhela anyar).
- 11
- 12
- 13
- 14
ExploitBench (Juni–Agustus 2026) ngemot 20 kerentanan V8 kanthi tingkat keruwetan sing dipikir nemen ing 13 rilis Chrome stabil. Tolok ukur iki nguji apa agen bisa nggayuh eksekusi kode arbitrer ing V8 lan rilis resmi Chrome kanggo Linux kanthi ngeksploitasi saben kerentanan sing ditemtokake. Sawetara kerentanan sing kalebu bisa uga ora ngidini eksekusi kode arbitrer miturut watesan evaluasi, mula tingkat kasil 100% bisa uga ora bisa digayuh. Cathetan: skor 5,5% saka GPT-5.6 Sol minangka artefak saka watesan 300 puteran ing patokan, sing dudu watesan sing diduweni pelanggan nyata sing nggunakake dipikir maksimal. Model kasebut ing setelan sing padha nggayuh skor 11,5% nalika nemoni wates sing luwih sithik.
- 15
Jeremy Spence dkk. “Tantangan Sabanjuré kanggo Keamanan Siber Agentik: Pathokan Rekayasa Balik sing Realistis lan Bebas Kontaminasi(mbukak ing jendhela anyar).” arXiv:2608.11469v1, 2026.
- 16
Nalika nguji ing macem-macem model pihak katelu, kita nggunakake persiyapan riset sing luwih prasaja. Codex nduwèni konfigurasi produksi sing luwih kompleks, sing bisa nyebabaké tingkat kasalahan model mentah sing beda. Pangayoman ing sisih panyedhiya lan implementasi piranti komputer isih béda. Pengguna ora ngalami skenario tanpa konfirmasi ing Codex, amarga iku minangka konfigurasi riset internal.
- 17
