GPT-6.1Sol
Kecerdasan nyedhaki Astra kanthi rega sapralima kanggo kinerja tercanggih sing tetep ajeg
Kita ngenalake GPT‑6.1 Sol, versi anyar GPT‑6 Sol kanthi kinerja unggul banget kanggo pemrograman dening agen, uga panggunaan komputer lan pakaryan profesional. Versi iki ndadekake Sol saya cedhak karo GPT‑6 Astra kanggo tugas abot, kanthi rega token input lan output mung sapralima saka rega standar Astra. Pangembang dadi luwih leluasa mbangun lan nglakokake agen sing mumpuni kanthi anggaran sing padha.
GPT‑6.1 Sol menehi kinerja sing nyedhaki Astra kanthi rega Sol, dadi model paling irit dibandhingake karo kinerjane sing kasedhiya saiki. Input ing cache mung regane $0,10 saben sayuta token—diskon 95% saka rega input standar—saengga luwih terjangkau kanggo beban kerja agen sing perlu nggunakake maneh konteks ing panjalukan bola-bali.
GPT‑6 Astra tetep dadi model tercanggih kita sing paling mumpuni sakabèhé. GPT‑6.1 Sol nawakake imbangan anyar antarane kemampuan lan biaya kanggo pakaryan penting sing pengin luwih kerep ditindakake pangguna, uga kanggo pelanggan API sing mbangun lan nglakokake aplikasi ing skala gedhe.

GPT‑6.1 Sol menehi peningkatan gedhe saka GPT‑6 Sol kanggo maneka pakaryan profesional sing rumit, wiwit nulis lan ndandani kode nganti mangerteni dokumen lan nglakokake alur kerja bisnis kanthi pirang-pirang langkah. Ing sawetara evaluasi iki, kinerjane nyedhaki GPT‑6 Astra kanthi biaya sing luwih murah banget.
Ing DeepSWE v1.1, sing ngevaluasi tugas rekayasa piranti lunak rumit ing basis kode nyata, GPT‑6.1 Sol bisa madhani GPT‑6 Astra kanthi biaya kira-kira sapralima. Skore uga ngluwihi skor paling apik GPT‑6 Sol nganti 6,4 poin persentase, kanthi upaya nalar lan biaya sing luwih endhek.
Ing DeepSWE 1.1(mbukak ing jendhela anyar), agen AI ngrampungake tugas rekayasa piranti lunak orisinal sing mbutuhake proses jangka dawa.
Ing GDP.pdf, sing ngukur akurasi model nalika mangsuli pitakon profesional nganggo dokumen PDF rumit, kalebu tabel, grafik, diagram, lan rincian ing tulisan cilik, GPT‑6.1 Sol nggayuh skor luwih dhuwur tinimbang Opus 5.5 kanthi model cadangan. Biaya saben tugase kurang saka separone ing kabeh setelan nalar sing diuji. Kinerjane uga nyedhaki kinerja paling mutakhir GPT‑6 Astra kanthi biaya saben tugas kira-kira sapralima.
Ing GDP.pdf(mbukak ing jendhela anyar), model kudu mangsuli prompt saka kahanan nyata ngenani PDF kompleks sing dijupuk saka alur kerja profesional ing bidang keuangan, layanan kesehatan, hukum, lan pitung bidang profesional liyane.
Ing AutomationBench, sing ngukur apa agen ngrampungake alur kerja bisnis kanthi pirang-pirang langkah kanthi bener, GPT‑6.1 Sol nggayuh skor 2,2 poin persentase luwih dhuwur tinimbang Opus 5.5 ing upaya nalar Kecepatan Standar, kanthi biaya kira-kira sapratelone. Skor kasebut uga mundhak 4,8 poin persentase saka GPT‑6 Sol ing setelan sing padha.
In AutomationBench 1.0.6(mbukak ing jendhela anyar), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol uga nuduhake kemajuan gedhe kanggo tugas sing mbutuhake interaksi karo aplikasi komputer. Ing set offline OSWorld 2.0, sing ngevaluasi agen ing alur kerja panggunaan komputer sing abot, GPT‑6.1 Sol ngluwihi GPT‑6 Sol nganti pitung poin persentase ing upaya nalar maksimal, kanthi biaya kurang saka separone. Skore mung kacecer 2,1 poin persentase saka Astra ing upaya nalar maksimal, kanthi biaya saben tugas kira-kira saprapitu.
In OSWorld 2.0(mbukak ing jendhela anyar), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Ing Terminal-Bench Science 0.1, sing ngevaluasi alur kerja ilmiah kalebu analisis data, simulasi, lan pambuktian teorema, skor GPT‑6.1 Sol luwih saka kaping pindhone skor GPT‑6 Sol ing upaya nalar maksimal, kanthi biaya saben tugas kurang saka separone. Ing upaya maksimal, biaya rata-rata GPT‑6.1 Sol yaiku $5,47 saben tugas, dibandhingake karo $23,21 kanggo Opus 5.5 lan $23,80 kanggo Astra. Iki menehi kemampuan ilmiah sing mumpuni kanthi biaya luwih saka 75% luwih murah tinimbang saben model kasebut.
GPT‑6 Astra isih nggayuh skor paling dhuwur ing antarane model sing diuji, yaiku 68,1%, lan becike digunakake kanggo tugas riset ilmiah sing paling angel.
Ing Terminal-Bench Science 0.1(mbukak ing jendhela anyar), agen ngrampungake alur kerja riset ilmiah nganggo kode lan piranti terminal, kalebu nganalisis data, nglakokake simulasi, lan nyocogake model karo data.
GPT‑6.1 Sol uga ningkatake akurasi fakta kanggo prompt sing angel. Ing upaya nalar dipikir nemen banget, tingkat kaluputan faktane 4,1%, mudhun saka 4,5% ing GPT‑6 Sol lan saya cedhak karo Astra sing 4,0% ing setelan padha. Dene biaya saben tugase kira-kira 83% luwih murah tinimbang Astra.
Evaluasi iki ngukur bagean wangsulan sing ngemot paling ora siji kaluputan fakta ing pacelathon sing wis dibusak informasi identitase, nalika pangguna menehi tandha kaluputan model sadurunge. Prompt sing sengaja digawe angel iki ora makili panggunaan lumrah.
Kita ngevaluasi akurasi fakta ing pacelathon ChatGPT sing wis dibusak informasi identitase, nalika pangguna wis menehi tandha kaluputan fakta saka model sadurunge. Pacelathon sing micu kaluputan iki ora makili panggunaan lumrah, sing luwih arang ngalami kaluputan fakta.
GPT‑6.1 Sol nuduhake peningkatan gedhe saka GPT‑6 Sol ing evaluasi keselarasan kita, saengga saya cedhak karo GPT‑6 Astra.
GPT‑6.1 Sol luwih blaka ngenani watesan kemampuane lan luwih bisa diandelake kanggo manut karepe pangguna lan watesan keamanan. Ing evaluasi sing angel, tingkat kegagalane luwih endhek tinimbang GPT‑6 Sol nalika kudu blaka ngenani piranti telusur sing rusak, manut watesan sing kasebut kanthi terang, lan ngindhari asil tanpa idin sajrone tugas agen. Kita ora nemokake upaya kanggo ngliwati pamriksa keamanan otomatis, padha karo GPT‑6 Astra lan GPT‑6 Sol.
Evaluasi ing ngisor iki sengaja nguji kahanan sing angel lan ora ngukur tingkat kegagalan ing panggunaan lumrah.
Wiwit dina iki, GPT‑6.1 Sol kasedhiya kanggo kabeh pangguna Plus, Pro, Business, Enterprise, lan Edu ing ChatGPT Work lan Codex. Model-model iki durung kasedhiya ing Ngobrol. Pangembang uga bisa ngakses liwat API OpenAI minangka gpt-6.1-sol. Rega API standare yaiku $2 saben sayuta token input, $0,10 saben sayuta token input ing cache, lan $10 saben sayuta token output.
Bebarengan karo iki, kita ngluncurake GPT‑6 Astra Ultrafast, model tercanggih paling cepet ing donya kanthi kecepatan nganti 8x tinimbang GPT‑6 Astra, uga GPT‑6.1 Sol Ultrafast. Model-model iki kasedhiya ing API, uga ing ChatGPT Work lan Codex kanggo pangguna tingkatan Pro anyar kita kanthi kuota panggunaan paling gedhe, regane $500/sasi. Kanthi GPT‑6.1 Sol Ultrafast, pangembang bisa entuk kecerdasan sing nyedhaki Astra kanthi kecepatan nganti 8×, lan biaya API kira-kira padha karo biaya GPT‑6 Astra sadurunge.
Penulis
Evaluasi GPT ditindakake ing lingkungan riset kita utawa liwat API kita. Asile bisa rada beda karo ChatGPT sing digunakake umum amarga bedane prompt sistem, piranti sing kasedhiya, tingkat upaya, lan sapiturute. Evaluasi model pesaing dijupuk saka laporan sing kasedhiya kanggo umum.

