GPT-6.1Sol
Near-Astra intelligence for a fifth of the price
Kami memperkenalkan GPT‑6.1 Sol, versi peningkatan dari GPT‑6 Sol dengan performa yang sangat unggul dalam pengodean agentik, penggunaan komputer, dan pekerjaan profesional. Model ini membawa kemampuan Sol lebih dekat ke GPT‑6 Astra untuk tugas-tugas berat, dengan harga token input dan output sebesar seperlima harga standar Astra. Dengan begitu, developer memiliki lebih banyak keleluasaan untuk membangun dan menjalankan agen yang andal dengan anggaran yang sama.
GPT‑6.1 Sol menghadirkan performa mendekati Astra dengan harga Sol, menjadikannya model dengan biaya paling efisien untuk performanya yang tersedia saat ini. Input dalam cache hanya berbiaya $0,10 per juta token—diskon 95% dari harga input standar—sehingga lebih terjangkau untuk beban kerja agentik yang perlu menggunakan kembali konteks pada permintaan berulang.
GPT‑6 Astra tetap menjadi model terdepan kami yang paling andal secara keseluruhan. GPT‑6.1 Sol menawarkan keseimbangan baru antara kemampuan dan biaya untuk pekerjaan penting yang ingin lebih sering dilakukan pengguna, serta bagi pelanggan API yang membangun dan menjalankan aplikasi dalam skala besar.

GPT‑6.1 Sol menghadirkan peningkatan besar dibandingkan GPT‑6 Sol dalam berbagai pekerjaan profesional yang kompleks, mulai dari menulis dan men-debug kode hingga memahami dokumen dan menjalankan alur kerja bisnis bertahap. Dalam beberapa evaluasi ini, performanya mendekati GPT‑6 Astra dengan biaya yang jauh lebih rendah.
Pada DeepSWE v1.1, yang mengevaluasi tugas rekayasa perangkat lunak kompleks dalam basis kode nyata, GPT‑6.1 Sol menyamai GPT‑6 Astra dengan biaya sekitar seperlimanya, sekaligus melampaui skor terbaik GPT‑6 Sol sebesar 6,4 poin persentase dengan upaya penalaran dan biaya yang lebih rendah.
Dalam DeepSWE 1.1(terbuka di jendela baru), agen AI menyelesaikan tugas rekayasa perangkat lunak orisinal yang memerlukan rangkaian langkah panjang.
Pada GDP.pdf, yang mengukur akurasi model dalam menjawab pertanyaan profesional menggunakan dokumen PDF kompleks, termasuk tabel, grafik, diagram, dan detail dalam cetakan kecil, GPT‑6.1 Sol meraih skor lebih tinggi daripada Opus 5.5 dengan model cadangan. Biaya per tugasnya kurang dari separuh pada seluruh pengaturan penalaran yang diuji. Performanya juga mendekati performa terbaik GPT‑6 Astra dengan biaya per tugas sekitar seperlimanya.
Dalam GDP.pdf(terbuka di jendela baru), model harus menjawab prompt dari situasi nyata tentang PDF kompleks yang diambil dari alur kerja profesional di bidang keuangan, layanan kesehatan, hukum, dan tujuh bidang profesional lainnya.
Pada AutomationBench, yang mengukur apakah agen menyelesaikan alur kerja bisnis bertahap dengan benar, GPT‑6.1 Sol meraih skor 2,2 poin persentase di atas Opus 5.5 pada upaya penalaran sedang, dengan biaya sekitar sepertiganya. Skor tersebut juga meningkat 4,8 poin persentase dari GPT‑6 Sol pada pengaturan yang sama.
In AutomationBench 1.0.6(terbuka di jendela baru), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol juga menunjukkan kemajuan besar pada tugas yang memerlukan interaksi dengan aplikasi komputer. Pada set luring OSWorld 2.0, yang mengevaluasi agen dalam alur kerja penggunaan komputer yang menantang, GPT‑6.1 Sol mengungguli GPT‑6 Sol sebesar tujuh poin persentase pada upaya penalaran maksimum dengan biaya kurang dari separuhnya. Skornya hanya terpaut 2,1 poin persentase dari Astra pada upaya penalaran maksimum dengan biaya per tugas sekitar sepertujuhnya.
In OSWorld 2.0(terbuka di jendela baru), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Pada Terminal-Bench Science 0.1, yang mengevaluasi alur kerja ilmiah termasuk analisis data, simulasi, dan pembuktian teorema, GPT‑6.1 Sol meraih skor lebih dari dua kali lipat GPT‑6 Sol pada upaya penalaran maksimum dengan biaya per tugas kurang dari separuhnya. Pada upaya maksimum, biaya rata-rata GPT‑6.1 Sol adalah $5,47 per tugas, dibandingkan dengan $23,21 untuk Opus 5.5 dan $23,80 untuk Astra. Ini menghadirkan kemampuan ilmiah yang kuat dengan biaya lebih dari 75% lebih rendah dibandingkan kedua model tersebut.
GPT‑6 Astra masih meraih skor tertinggi di antara model yang diuji, yaitu 68,1%, dan sebaiknya digunakan untuk tugas riset ilmiah yang paling sulit.
Dalam Terminal-Bench Science 0.1(terbuka di jendela baru), agen menyelesaikan alur kerja penelitian ilmiah menggunakan kode dan alat terminal, termasuk menganalisis data, menjalankan simulasi, dan mencocokkan model.
GPT‑6.1 Sol juga meningkatkan akurasi faktual pada prompt yang sulit. Pada upaya penalaran ekstra tinggi, tingkat kesalahan faktualnya adalah 4,1%, turun dari 4,5% pada GPT‑6 Sol dan mendekati 4,0% pada Astra dengan pengaturan yang sama, sementara biaya per tugasnya sekitar 83% lebih rendah daripada Astra.
Evaluasi ini mengukur proporsi jawaban yang mengandung setidaknya satu kesalahan faktual dalam percakapan yang informasi identitasnya telah dihapus, tempat pengguna menandai kesalahan model sebelumnya. Prompt yang sengaja dibuat sulit ini tidak mewakili penggunaan umum.
Kami mengevaluasi akurasi faktual pada percakapan ChatGPT yang informasi identitasnya telah dihapus, tempat pengguna menandai kesalahan faktual dari model sebelumnya. Percakapan yang memicu kesalahan ini tidak mewakili penggunaan umum, yang lebih jarang mengalami kesalahan faktual.
GPT‑6.1 Sol menunjukkan peningkatan besar dibandingkan GPT‑6 Sol dalam evaluasi keselarasan kami, sehingga hasilnya makin mendekati GPT‑6 Astra.
GPT‑6.1 Sol lebih transparan mengenai keterbatasannya dan lebih dapat diandalkan dalam mematuhi maksud pengguna serta batasan keselamatan. Dalam evaluasi yang menantang, tingkat kegagalannya lebih rendah daripada GPT‑6 Sol dalam hal transparansi tentang alat pencarian yang bermasalah, kepatuhan terhadap pembatasan eksplisit, dan pencegahan hasil tanpa izin selama tugas agentik. Kami tidak menemukan upaya mengakali peninjau keselamatan otomatis, sama seperti GPT‑6 Astra dan GPT‑6 Sol.
Evaluasi di bawah ini sengaja menguji situasi yang menantang dan tidak mengukur tingkat kegagalan dalam penggunaan umum.
GPT‑6.1 Sol tersedia mulai hari ini untuk semua pengguna Plus, Pro, Business, Enterprise, dan Edu di ChatGPT Work dan Codex. Model-model ini belum tersedia di Chat. Developer juga dapat mengaksesnya melalui API OpenAI sebagai gpt-6.1-sol. Harga API standarnya adalah $2 per juta token input, $0,10 per juta token input dalam cache, dan $10 per juta token output.
Bersamaan dengan itu, kami meluncurkan GPT‑6 Astra Ultrafast, model terdepan tercepat di dunia dengan kecepatan hingga 8x lebih tinggi daripada GPT‑6 Astra, serta GPT‑6.1 Sol Ultrafast. Model-model ini tersedia melalui API serta di ChatGPT Work dan Codex bagi pengguna paket Pro baru kami dengan kuota penggunaan tertinggi, seharga $500/bulan. Dengan GPT‑6.1 Sol Ultrafast, developer bisa mendapatkan kecerdasan mendekati Astra dengan kecepatan hingga 8× lipat, dengan pengeluaran API yang kurang lebih sama seperti GPT‑6 Astra sebelumnya.
Penulis
Evaluasi GPT dilakukan di lingkungan riset kami atau melalui API kami. Output yang dihasilkan mungkin sedikit berbeda dari ChatGPT versi produksi karena perbedaan prompt sistem, alat yang tersedia, tingkat upaya, dan sebagainya. Evaluasi model pesaing diambil dari laporan yang tersedia untuk publik.

