GPT-6.1Sol
Kecerdasan hampir setara Astra pada satu perlima harganya untuk prestasi perbatasan yang berterusan
Kami memperkenalkan GPT‑6.1 Sol, naik taraf kepada GPT‑6 Sol dengan prestasi yang amat cemerlang dalam pengekodan agentic, serta penggunaan komputer dan kerja profesional. Model ini merapatkan jurang antara Sol dengan GPT‑6 Astra dalam tugas mencabar, pada satu perlima harga token input dan output standard Astra, memberikan pembangun lebih ruang untuk membina dan menjalankan ejen berkeupayaan tinggi dengan belanjawan yang sama.
GPT‑6.1 Sol menawarkan prestasi hampir setara Astra pada harga Sol, menjadikannya model paling cekap kos untuk tahap prestasinya yang tersedia hari ini. Input dicache berharga hanya $0.10 bagi setiap juta token—diskaun 95% daripada harga input standard—menjadikannya lebih berpatutan untuk beban kerja agentic yang perlu menggunakan semula konteks dalam permintaan berulang.
GPT‑6 Astra kekal sebagai model perbatasan kami yang paling berkeupayaan secara keseluruhan. GPT‑6.1 Sol menawarkan keseimbangan baharu antara keupayaan dengan kos untuk kerja penting yang ingin dilakukan pengguna dengan lebih kerap, serta untuk pelanggan API yang membina dan menjalankan aplikasi pada skala besar.

GPT‑6.1 Sol membawa peningkatan ketara berbanding GPT‑6 Sol dalam kerja profesional yang kompleks, daripada menulis dan menyahpepijat kod hingga memahami dokumen dan melaksanakan aliran kerja perniagaan berbilang langkah. Dalam beberapa penilaian ini, prestasinya menghampiri GPT‑6 Astra pada kos yang jauh lebih rendah.
Dalam DeepSWE v1.1, yang menilai tugas kejuruteraan perisian kompleks dalam pangkalan kod sebenar, GPT‑6.1 Sol menyamai GPT‑6 Astra pada kira-kira satu perlima kosnya, sambil mengatasi skor terbaik GPT‑6 Sol sebanyak 6.4 mata peratusan pada tahap usaha penaakulan dan kos yang lebih rendah.
Dalam DeepSWE 1.1(dibuka dalam tetingkap baru), ejen AI menyelesaikan tugasan kejuruteraan perisian asli yang memerlukan proses kerja yang panjang.
Dalam GDP.pdf, yang mengukur ketepatan model menjawab soalan profesional menggunakan dokumen PDF kompleks, termasuk jadual, carta, rajah dan butiran cetakan halus, GPT‑6.1 Sol mencatatkan skor lebih tinggi daripada Opus 5.5 dengan model sandaran, pada kurang separuh kos setiap tugas merentas tetapan penaakulan yang diuji. Model ini juga menghampiri prestasi canggih GPT‑6 Astra pada kira-kira satu perlima kos setiap tugas.
Dalam GDP.pdf(dibuka dalam tetingkap baru), model mesti menjawab prom dunia sebenar tentang PDF kompleks yang diambil daripada aliran kerja profesional dalam bidang kewangan, penjagaan kesihatan, perundangan dan tujuh bidang profesional lain.
Dalam AutomationBench, yang mengukur sama ada ejen menyelesaikan aliran kerja perniagaan berbilang langkah dengan betul, GPT‑6.1 Sol mencatatkan skor 2.2 mata peratusan lebih tinggi daripada Opus 5.5 pada tahap usaha penaakulan sederhana, dengan kira-kira satu pertiga kosnya. Skor itu juga meningkat 4.8 mata peratusan berbanding GPT‑6 Sol pada tetapan yang sama.
In AutomationBench 1.0.6(dibuka dalam tetingkap baru), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol turut mencatatkan kemajuan ketara dalam tugas yang memerlukan interaksi dengan aplikasi komputer. Dalam set luar talian OSWorld 2.0, yang menilai ejen pada aliran kerja penggunaan komputer yang mencabar, GPT‑6.1 Sol mengatasi GPT‑6 Sol sebanyak tujuh mata peratusan pada tahap usaha penaakulan maksimum dengan kurang separuh kosnya. Skornya hanya 2.1 mata peratusan di bawah Astra pada tahap usaha penaakulan maksimum, dengan kira-kira satu pertujuh kos setiap tugas.
In OSWorld 2.0(dibuka dalam tetingkap baru), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Dalam Terminal-Bench Science 0.1, yang menilai aliran kerja saintifik termasuk analisis data, simulasi dan pembuktian teorem, GPT‑6.1 Sol mencatatkan lebih dua kali ganda skor GPT‑6 Sol pada tahap usaha penaakulan maksimum dengan kurang separuh kos setiap tugas. Pada tahap usaha maksimum, kos purata GPT‑6.1 Sol ialah $5.47 setiap tugas, berbanding $23.21 untuk Opus 5.5 dan $23.80 untuk Astra, memberikan keupayaan saintifik yang tinggi pada kos lebih 75% lebih rendah daripada kedua-dua model tersebut.
GPT‑6 Astra masih mencapai skor tertinggi antara model yang diuji, iaitu 68.1%, dan wajar digunakan untuk tugas penyelidikan saintifik yang paling sukar.
Dalam Terminal-Bench Science 0.1(dibuka dalam tetingkap baru), ejen melengkapkan aliran kerja penyelidikan saintifik menggunakan kod dan alat terminal, termasuk menganalisis data, menjalankan simulasi dan memadankan model.
GPT‑6.1 Sol turut meningkatkan ketepatan fakta bagi prom yang sukar. Pada tahap usaha penaakulan sangat tinggi, kadar kesilapan faktanya ialah 4.1%, turun daripada 4.5% untuk GPT‑6 Sol dan lebih hampir kepada 4.0% bagi Astra pada tetapan yang sama, dengan kos setiap tugas kira-kira 83% lebih rendah daripada Astra.
Penilaian ini mengukur bahagian jawapan yang mengandungi sekurang-kurangnya satu kesilapan fakta dalam perbualan yang telah dibuang maklumat pengenalannya, apabila pengguna melaporkan kesilapan model terdahulu. Prom yang sengaja dibuat sukar ini tidak mewakili penggunaan biasa.
Kami menilai ketepatan fakta berdasarkan perbualan ChatGPT yang telah dibuang maklumat pengenalannya, apabila pengguna melaporkan kesilapan fakta daripada model terdahulu. Perbualan yang mencetuskan kesilapan ini tidak mewakili penggunaan biasa, yang lebih jarang menghasilkan kesilapan fakta.
GPT‑6.1 Sol menunjukkan peningkatan ketara berbanding GPT‑6 Sol dalam penilaian penjajaran kami, menjadikannya lebih hampir kepada GPT‑6 Astra.
GPT‑6.1 Sol lebih telus tentang batasannya dan lebih boleh diharap untuk menghormati niat pengguna serta mematuhi kekangan keselamatan. Dalam penilaian yang mencabar, kadar kegagalannya lebih rendah daripada GPT‑6 Sol dari segi ketelusan tentang alat carian yang rosak, pematuhan sekatan yang dinyatakan secara jelas dan pengelakan hasil tanpa kebenaran semasa menjalankan tugas agentic. Kami tidak melihat sebarang cubaan memintas penyemak keselamatan automatik, sama seperti GPT‑6 Astra dan GPT‑6 Sol.
Penilaian di bawah sengaja menguji situasi yang mencabar dan tidak mengukur kadar kegagalan dalam penggunaan biasa.
GPT‑6.1 Sol tersedia mulai hari ini kepada semua pengguna Plus, Pro, Business, Enterprise dan Edu dalam ChatGPT Kerja dan Codex. Model-model ini belum tersedia dalam Sembang. Pembangun juga boleh mengaksesnya melalui API OpenAI sebagai gpt-6.1-sol. Harga API standardnya ialah $2 bagi setiap juta token input, $0.10 bagi setiap juta token input dicache dan $10 bagi setiap juta token output.
Pada masa yang sama, kami melancarkan GPT‑6 Astra Ultrafast, model perbatasan terpantas di dunia dengan kelajuan sehingga 8x lebih pantas daripada GPT‑6 Astra, serta GPT‑6.1 Sol Ultrafast. Model-model ini tersedia melalui API serta dalam ChatGPT Kerja dan Codex kepada pengguna peringkat Pro baharu kami, yang menawarkan had penggunaan tertinggi pada harga $500/bulan. Dengan GPT‑6.1 Sol Ultrafast, pembangun boleh mendapatkan kecerdasan hampir setara Astra pada kelajuan sehingga 8×, dengan perbelanjaan API yang hampir sama seperti GPT‑6 Astra sebelum ini.
Penulis
Penilaian GPT dijalankan dalam persekitaran penyelidikan kami atau melalui API kami, yang mungkin menghasilkan output yang sedikit berbeza daripada ChatGPT yang tersedia kepada pengguna disebabkan perbezaan prom sistem, alat yang tersedia, tahap usaha dan sebagainya. Penilaian model pesaing diambil daripada laporan yang tersedia kepada umum.

