Memperkenalkan GPT‑6 Sol dan Luna
Lebih banyak cara untuk menghadirkan kecerdasan terdepan ke pekerjaan Anda sehari-hari.
Awal bulan ini, kami memperkenalkan GPT‑6 Astra, model paling cerdas dan selaras di dunia. Meski proyek yang paling berat dan penting tetap membutuhkan kedalaman penuh Astra, pekerjaan hadir dalam berbagai skala, ritme, dan anggaran.
Itulah sebabnya kami memperluas ekosistem GPT‑6 dengan GPT‑6 Sol dan GPT‑6 Luna. GPT‑6 Astra memperkenalkan generasi baru kecerdasan—model-model ini membantu memperluas manfaat kecerdasan tersebut dengan mendorong batas terdepan efisiensi biaya. Kami melatih GPT‑6 Sol dan Luna menggunakan metode serupa dengan GPT‑6 Astra, menghadirkan kemajuan di balik performa mutakhir Astra dalam pekerjaan profesional, faktualitas, pemrograman, penggunaan komputer, dan penyelarasan ke model yang lebih cepat dan terjangkau.
Model-model GPT‑6 memimpin di seluruh kurva biaya–kecerdasan, memadukan kemampuan luar biasa di setiap tingkat dengan infrastruktur yang menghadirkannya secara efisien dalam skala besar. Peningkatan pada caching dan inferensi memungkinkan kami menyediakan model-model ini dengan biaya lebih rendah. Penghematan itu kami teruskan langsung kepada pengguna dan pelanggan dengan menurunkan harga API Sol dan Luna sebesar 50% dibandingkan harga promosi GPT‑5.6. Secara keseluruhan, peningkatan ini membuat AI canggih praktis digunakan untuk lebih banyak tugas dan aplikasi sehari-hari dalam skala besar.
Model | Input | Output | Penurunan harga |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% lebih murah |
GPT‑6 Luna | $0,20 → $0,10 | $1,20 → $0,50 | 50% lebih murah |
Harga berlaku per 1 juta token.
GPT‑6 Astra tetap menjadi model terbaik kami secara keseluruhan. Pilih model ini jika Anda menginginkan hasil terbaik dan pengalaman tanpa kompromi.
GPT‑6 Sol dan Luna menghadirkan peningkatan kecerdasan dan efisiensi biaya pada model yang telah Anda kenal dan gunakan, khususnya untuk kemampuan yang paling berguna dalam menyelesaikan pekerjaan kompleks.
GPT‑6 Sol mampu menangani tugas kerja yang sulit sekaligus memberi Anda lebih banyak ruang untuk melakukan iterasi berkat batas penggunaan yang lebih tinggi dan biaya lebih rendah. Model ini menawarkan kecerdasan dan hasil yang lebih baik daripada model pesaing dengan harga serupa.
Pada AutomationBench, pengujian alur kerja bisnis lintas aplikasi, GPT‑6 Sol dengan upaya ekstra tinggi mengungguli Claude Opus 5 dengan upaya maksimum, dengan biaya per tugas hanya 9% dari biaya Opus 5. Dengan upaya tinggi, GPT‑6 Luna meningkat 5,4 poin persentase dari pendahulunya, dengan biaya per tugas 58% lebih rendah.
Dalam AutomationBench 1.0.6(terbuka di jendela baru), agen AI diuji pada alur kerja menyeluruh menggunakan 47 alat di bidang penjualan, pemasaran, operasi, dukungan, keuangan, dan SDM. Titik data Claude Fable 5.1 menunjukkan biaya yang lebih rendah daripada biaya sebenarnya karena tidak mencakup biaya penggunaan cadangan Opus 5, yang terjadi pada sekitar 40% tugas.
GPT‑6 Sol juga melampaui Claude Fable 5.1 dengan biaya jauh lebih rendah, bahkan mengungguli GPT‑6 Astra dengan upaya rendah.
Model (dan upaya) | Skor | Biaya per tugas |
|---|---|---|
GPT‑6 Sol (ekstra tinggi) | 33,2% | $0,27 |
GPT‑6 Astra (rendah) | 30,3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (maksimum) | 26,9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 dengan cadangan Opus 5 (maksimum) | 31,4% | >8,9x GPT‑6 Sol (biaya cadangan tidak dilaporkan) |
Pada Agents’ Last Exam, yang mengevaluasi agen dalam alur kerja profesional yang kompleks, GPT‑6 Sol dengan upaya maksimum meraih skor 56,4%, lebih tinggi daripada skor tertinggi Claude Opus 5 dalam evaluasi tersebut, dengan biaya per tugas 60% lebih rendah.
Dalam Agents’ Last Exam V1(terbuka di jendela baru), agen AI dievaluasi pada tugas berjangka panjang dan bernilai ekonomi di 55 subindustri, yang mencakup sebagian besar bidang utama pekerjaan profesional berbasis komputer.
Kegunaan suatu jawaban bergantung pada ketepatan faktanya, dan kami terus meningkatkan keandalan faktual. Dalam evaluasi faktualitas internal kami, yang didasarkan pada percakapan dunia nyata yang telah dihapus identitasnya dan berisi kesalahan model yang ditandai pengguna, GPT‑6 Sol membuat sekitar separuh jumlah kesalahan pendahulunya. Keandalannya mendekati tingkat Astra dengan biaya jauh lebih rendah. GPT‑6 Luna juga meningkat secara signifikan; pada tingkat upaya yang lebih tinggi, performanya menyamai GPT‑5.6 Sol dengan biaya sekitar seperseratusnya.
Di sini kami mengevaluasi faktualitas pada percakapan ChatGPT yang telah dihapus identitasnya, ketika pengguna menandai kesalahan faktual dari model sebelumnya. Percakapan yang memicu kesalahan ini tidak mencerminkan penggunaan umum, ketika kesalahan faktual lebih jarang terjadi. Skor tidak dikontrol berdasarkan panjang jawaban; namun, pengujian berbagai tingkat verbositas kami menunjukkan bahwa panjang jawaban hampir tidak berpengaruh.
Tahun ini, agen pemrograman mulai menangani tugas dengan kompleksitas, cakupan, dan durasi yang belum pernah dicapai sebelumnya. Di OpenAI, penggunaan internal kami tumbuh secara eksponensial. Jika dinilai berdasarkan harga API, penggunaan token harian telah melampaui $600 untuk peneliti median dan $7.000 untuk peneliti pada persentil ke-90 (Percepatan riset: Melihat dari dalam OpenAI). Seiring agen pemrograman menangani tugas yang lebih panjang dan berat, biaya penggunaan berkelanjutan menjadi makin penting. GPT‑6 Sol dan Luna memadukan performa pemrograman yang kuat dengan harga API lebih rendah, memberi developer lebih banyak ruang untuk melakukan iterasi dan meyakinkan tim untuk lebih ambisius dalam menentukan tugas yang ditangani Codex.
Pada FrontierCode, yang mengevaluasi apakah agen pemrograman menghasilkan perubahan yang siap digabungkan ke basis kode nyata, GPT‑6 Sol meningkat secara signifikan dibandingkan GPT‑5.6 Sol dan mampu menyamai Claude Fable 5.1 dengan upaya ekstra tinggi, tetapi dengan biaya jauh lebih rendah.
Dalam FrontierCode 1.1 Main(terbuka di jendela baru), agen AI menulis kode yang dinilai bukan hanya berdasarkan ketepatan, tetapi juga “kelayakan untuk digabungkan”: misalnya kualitas pengujian, disiplin cakupan, gaya kode, dan kepatuhan terhadap standar basis kode.
Pada DeepSWE v1.1, yang menguji performa dalam tugas rekayasa perangkat lunak kompleks pada basis kode nyata, GPT‑6 Sol dengan upaya maksimum meraih skor 68,8%, hanya terpaut 1,1 poin persentase dari skor tertinggi Claude Fable 5 dalam evaluasi tersebut—69,9% dengan upaya ekstra tinggi—dengan biaya per tugas sekitar 80% lebih rendah.
GPT‑6 Luna dengan upaya maksimum meraih skor 66,6%, sebanding dengan Claude Opus 5 dan Fable 5 dengan upaya sedang. Dalam perbandingan ini, biaya Luna per tugas 93% lebih rendah daripada Opus 5 dan 96% lebih rendah daripada Fable 5.
Dalam DeepSWE 1.1(terbuka di jendela baru), agen AI menyelesaikan tugas rekayasa perangkat lunak orisinal berjangka panjang.
Meski GPT‑6 Astra tetap menjadi model terbaik di dunia untuk penggunaan komputer, GPT‑6 Sol dan Luna menawarkan performa yang lebih hemat biaya daripada pendahulunya. Pada OSWorld 2.0 offline, GPT‑6 Sol dengan upaya ekstra tinggi meraih skor serupa dengan Claude Opus 5 dengan upaya sedang—60,5% dibandingkan 60,3%—dengan biaya per tugas sekitar 80% lebih rendah. GPT‑6 Luna (maksimum) mampu mengungguli GPT‑5.6 Sol (sedang) dengan biaya sepersepuluhnya.
Dalam OSWorld 2.0(terbuka di jendela baru), agen AI mencoba alur kerja penggunaan komputer berjangka panjang yang mencakup tugas sehari-hari dan profesional. Kami melaporkan imbalan parsial pada set offline dari rilis v2026.08.08.
Kami juga menghadirkan gaya komunikasi GPT‑6 Astra yang lebih baik ke Sol dan Luna, yang menurut kami akan sangat terasa dalam percakapan teknis dan pemrograman. Jawaban akan terasa lebih jelas, dengan lebih sedikit jargon, frasa yang janggal, dan detail yang kurang bernilai. Secara keseluruhan, jawaban juga sedikit lebih ringkas tanpa kehilangan substansi.
Meski gaya bersifat subjektif, kami lebih menyukai jawaban GPT‑6 Sol di sini. Model ini tidak terlalu cepat menarik kesimpulan, tidak banyak mengulang detail yang mungkin sudah jelas bagi penanya (misalnya bahwa situs web tersebut memiliki empat halaman), menggunakan lebih sedikit bahasa yang samar (misalnya “nuansa bento”, “membentuk ulang… di sekitar sistem tersebut”), lebih terbuka tentang hal yang sudah dan belum diperiksanya, serta tidak membagikan detail implementasi yang tidak perlu, seperti prompt alat gambarnya.
Selain menurunkan harga token, kami membantu developer yang mengembangkan aplikasi dengan GPT‑6 untuk lebih menghemat biaya konteks yang digunakan kembali oleh aplikasi mereka. Kami telah meningkatkan penyimpanan prompt untuk GPT‑6 agar secara default menghasilkan tingkat cache hit yang lebih tinggi, sehingga agen dapat menggunakan kembali lebih banyak konteks, merespons lebih cepat, dan memperoleh diskon 90% untuk pembacaan token input dari cache.
Developer juga memiliki lebih banyak cara untuk mengukur dan mengoptimalkan performa caching:
Pantau dan diagnosis. Dasbor Penyimpanan Prompt(terbuka di jendela baru) menunjukkan jumlah input yang disimpan dalam cache dan perubahannya dari waktu ke waktu. Alat diagnostik(terbuka di jendela baru) membantu menjelaskan peluang caching yang terlewat dan hal yang perlu diperbaiki.
Sesuaikan tingkat penalaran dan ketersediaan alat tanpa merusak cache. Naikkan tingkat penalaran(terbuka di jendela baru) untuk tugas yang lebih sulit atau turunkan untuk tindak lanjut yang lebih sederhana, serta aktifkan atau nonaktifkan alat(terbuka di jendela baru) seiring perubahan kebutuhan agen Anda. Kedua kontrol tersebut kini mempertahankan konteks sebelumnya agar dapat digunakan kembali dari cache.
Optimalkan prefiks yang disimpan dalam cache. Titik pemisah eksplisit memungkinkan developer memilih tempat berakhirnya prefiks prompt yang disimpan dalam cache. Dengan demikian, developer memiliki kendali lebih besar atas penggunaan kembali cache dan dapat meningkatkan performa.
GitHub melaporkan bahwa selama beberapa bulan terakhir, peningkatan ini telah mengurangi proporsi token prompt yang memerlukan pemrosesan baru hingga lebih dari 50% pada miliaran permintaan ke model OpenAI, sehingga membantu Copilot merespons lebih cepat.
GPT‑6 Sol dan Luna dikembangkan berdasarkan upaya penyelarasan yang diperkenalkan bersama Astra, model kami yang paling selaras hingga saat ini. Dalam evaluasi penyelarasan kami, Sol dan Luna sama-sama menunjukkan peningkatan dibandingkan versi GPT‑5.6 masing-masing, termasuk tingkat klaim menyesatkan yang lebih rendah mengenai pekerjaan pemrograman mereka.
Evaluasi berikut sengaja menguji situasi yang menantang dan tidak mengukur tingkat kegagalan dalam penggunaan umum. Lihat kartu sistem(terbuka di jendela baru) untuk hasil lengkap.
Mulai hari ini, GPT‑6 Sol dan GPT‑6 Luna tersedia di ChatGPT Work dan Codex untuk semua pengguna Plus, Pro, Business, Enterprise, dan Edu. Pengguna Free dan Go dapat mengakses GPT‑6 Luna di aplikasi desktop. Model-model ini belum tersedia di Chat. Di API OpenAI, keduanya tersedia sebagai gpt-6-sol dan gpt-6-luna.
Untuk menjaga layanan tetap stabil bagi semua orang, kami berencana meluncurkan model-model ini di ChatGPT secara bertahap sepanjang hari. Jika model baru belum muncul di ChatGPT Work atau Codex, silakan coba lagi nanti.
Evaluasi GPT dilakukan di lingkungan riset kami atau melalui API kami, yang mungkin menghasilkan output yang sedikit berbeda dari ChatGPT versi produksi akibat perbedaan prompt sistem, alat yang tersedia, dan sebagainya. Evaluasi model pesaing diambil dari laporan yang tersedia untuk umum. Skor Claude Fable 5 digunakan ketika skor Claude Fable 5.1 tidak tersedia.


