Langsung ke konten utama
OpenAI

Memperkenalkan GPT‑6 Sol dan Luna

Lebih banyak cara untuk menghadirkan kecerdasan terdepan ke pekerjaan Anda sehari-hari.

Memuat…

Awal bulan ini, kami memperkenalkan GPT‑6 Astra, model paling cerdas dan selaras di dunia. Meski proyek yang paling berat dan penting tetap membutuhkan kedalaman penuh Astra, pekerjaan hadir dalam berbagai skala, ritme, dan anggaran.

Itulah sebabnya kami memperluas ekosistem GPT‑6 dengan GPT‑6 Sol dan GPT‑6 Luna. GPT‑6 Astra memperkenalkan generasi baru kecerdasan—model-model ini membantu memperluas manfaat kecerdasan tersebut dengan mendorong batas terdepan efisiensi biaya. Kami melatih GPT‑6 Sol dan Luna menggunakan metode serupa dengan GPT‑6 Astra, menghadirkan kemajuan di balik performa mutakhir Astra dalam pekerjaan profesional, faktualitas, pemrograman, penggunaan komputer, dan penyelarasan ke model yang lebih cepat dan terjangkau.

Model-model GPT‑6 memimpin di seluruh kurva biaya–kecerdasan, memadukan kemampuan luar biasa di setiap tingkat dengan infrastruktur yang menghadirkannya secara efisien dalam skala besar. Peningkatan pada caching dan inferensi memungkinkan kami menyediakan model-model ini dengan biaya lebih rendah. Penghematan itu kami teruskan langsung kepada pengguna dan pelanggan dengan menurunkan harga API Sol dan Luna sebesar 50% dibandingkan harga promosi GPT‑5.6. Secara keseluruhan, peningkatan ini membuat AI canggih praktis digunakan untuk lebih banyak tugas dan aplikasi sehari-hari dalam skala besar.

Harga API GPT‑6

Model

Input

Output

Penurunan harga

GPT‑6 Sol
vs. GPT‑5.6 Sol

$4 → $2

$20 → $10

50% lebih murah

GPT‑6 Luna
vs. GPT‑5.6 Luna

$0,20 → $0,10

$1,20 → $0,50

50% lebih murah

Harga berlaku per 1 juta token.

GPT‑6 Astra tetap menjadi model terbaik kami secara keseluruhan. Pilih model ini jika Anda menginginkan hasil terbaik dan pengalaman tanpa kompromi.

Peningkatan di seluruh keluarga model

GPT‑6 Sol dan Luna menghadirkan peningkatan kecerdasan dan efisiensi biaya pada model yang telah Anda kenal dan gunakan, khususnya untuk kemampuan yang paling berguna dalam menyelesaikan pekerjaan kompleks.

Pekerjaan profesional

GPT‑6 Sol mampu menangani tugas kerja yang sulit sekaligus memberi Anda lebih banyak ruang untuk melakukan iterasi berkat batas penggunaan yang lebih tinggi dan biaya lebih rendah. Model ini menawarkan kecerdasan dan hasil yang lebih baik daripada model pesaing dengan harga serupa.

Pada AutomationBench, pengujian alur kerja bisnis lintas aplikasi, GPT‑6 Sol dengan upaya ekstra tinggi mengungguli Claude Opus 5 dengan upaya maksimum, dengan biaya per tugas hanya 9% dari biaya Opus 5. Dengan upaya tinggi, GPT‑6 Luna meningkat 5,4 poin persentase dari pendahulunya, dengan biaya per tugas 58% lebih rendah.

Dalam AutomationBench 1.0.6⁠(terbuka di jendela baru), agen AI diuji pada alur kerja menyeluruh menggunakan 47 alat di bidang penjualan, pemasaran, operasi, dukungan, keuangan, dan SDM. Titik data Claude Fable 5.1 menunjukkan biaya yang lebih rendah daripada biaya sebenarnya karena tidak mencakup biaya penggunaan cadangan Opus 5, yang terjadi pada sekitar 40% tugas.

GPT‑6 Sol juga melampaui Claude Fable 5.1 dengan biaya jauh lebih rendah, bahkan mengungguli GPT‑6 Astra dengan upaya rendah.

Model (dan upaya)

Skor

Biaya per tugas

GPT‑6 Sol (ekstra tinggi)

33,2%

$0,27

GPT‑6 Astra (rendah)

30,3%

3.9x GPT‑6 Sol

Claude Opus 5 (maksimum)

26,9%

11.1x GPT‑6 Sol

Claude Fable 5.1 dengan cadangan Opus 5 (maksimum)

31,4%

>8,9x GPT‑6 Sol

(biaya cadangan tidak dilaporkan)

Pada Agents’ Last Exam, yang mengevaluasi agen dalam alur kerja profesional yang kompleks, GPT‑6 Sol dengan upaya maksimum meraih skor 56,4%, lebih tinggi daripada skor tertinggi Claude Opus 5 dalam evaluasi tersebut, dengan biaya per tugas 60% lebih rendah.

Dalam Agents’ Last Exam V1⁠(terbuka di jendela baru), agen AI dievaluasi pada tugas berjangka panjang dan bernilai ekonomi di 55 subindustri, yang mencakup sebagian besar bidang utama pekerjaan profesional berbasis komputer.

Faktualitas

Kegunaan suatu jawaban bergantung pada ketepatan faktanya, dan kami terus meningkatkan keandalan faktual. Dalam evaluasi faktualitas internal kami, yang didasarkan pada percakapan dunia nyata yang telah dihapus identitasnya dan berisi kesalahan model yang ditandai pengguna, GPT‑6 Sol membuat sekitar separuh jumlah kesalahan pendahulunya. Keandalannya mendekati tingkat Astra dengan biaya jauh lebih rendah. GPT‑6 Luna juga meningkat secara signifikan; pada tingkat upaya yang lebih tinggi, performanya menyamai GPT‑5.6 Sol dengan biaya sekitar seperseratusnya.

Di sini kami mengevaluasi faktualitas pada percakapan ChatGPT yang telah dihapus identitasnya, ketika pengguna menandai kesalahan faktual dari model sebelumnya. Percakapan yang memicu kesalahan ini tidak mencerminkan penggunaan umum, ketika kesalahan faktual lebih jarang terjadi. Skor tidak dikontrol berdasarkan panjang jawaban; namun, pengujian berbagai tingkat verbositas kami menunjukkan bahwa panjang jawaban hampir tidak berpengaruh.

Pemrograman

Tahun ini, agen pemrograman mulai menangani tugas dengan kompleksitas, cakupan, dan durasi yang belum pernah dicapai sebelumnya. Di OpenAI, penggunaan internal kami tumbuh secara eksponensial. Jika dinilai berdasarkan harga API, penggunaan token harian telah melampaui $600 untuk peneliti median dan $7.000 untuk peneliti pada persentil ke-90 (Percepatan riset: Melihat dari dalam OpenAI⁠). Seiring agen pemrograman menangani tugas yang lebih panjang dan berat, biaya penggunaan berkelanjutan menjadi makin penting. GPT‑6 Sol dan Luna memadukan performa pemrograman yang kuat dengan harga API lebih rendah, memberi developer lebih banyak ruang untuk melakukan iterasi dan meyakinkan tim untuk lebih ambisius dalam menentukan tugas yang ditangani Codex.

Pada FrontierCode, yang mengevaluasi apakah agen pemrograman menghasilkan perubahan yang siap digabungkan ke basis kode nyata, GPT‑6 Sol meningkat secara signifikan dibandingkan GPT‑5.6 Sol dan mampu menyamai Claude Fable 5.1 dengan upaya ekstra tinggi, tetapi dengan biaya jauh lebih rendah.

Dalam FrontierCode 1.1 Main⁠(terbuka di jendela baru), agen AI menulis kode yang dinilai bukan hanya berdasarkan ketepatan, tetapi juga “kelayakan untuk digabungkan”: misalnya kualitas pengujian, disiplin cakupan, gaya kode, dan kepatuhan terhadap standar basis kode.

Pada DeepSWE v1.1, yang menguji performa dalam tugas rekayasa perangkat lunak kompleks pada basis kode nyata, GPT‑6 Sol dengan upaya maksimum meraih skor 68,8%, hanya terpaut 1,1 poin persentase dari skor tertinggi Claude Fable 5 dalam evaluasi tersebut—69,9% dengan upaya ekstra tinggi—dengan biaya per tugas sekitar 80% lebih rendah.

GPT‑6 Luna dengan upaya maksimum meraih skor 66,6%, sebanding dengan Claude Opus 5 dan Fable 5 dengan upaya sedang. Dalam perbandingan ini, biaya Luna per tugas 93% lebih rendah daripada Opus 5 dan 96% lebih rendah daripada Fable 5.

Dalam DeepSWE 1.1⁠(terbuka di jendela baru), agen AI menyelesaikan tugas rekayasa perangkat lunak orisinal berjangka panjang.

Penggunaan komputer

Meski GPT‑6 Astra tetap menjadi model terbaik di dunia untuk penggunaan komputer, GPT‑6 Sol dan Luna menawarkan performa yang lebih hemat biaya daripada pendahulunya. Pada OSWorld 2.0 offline, GPT‑6 Sol dengan upaya ekstra tinggi meraih skor serupa dengan Claude Opus 5 dengan upaya sedang—60,5% dibandingkan 60,3%—dengan biaya per tugas sekitar 80% lebih rendah. GPT‑6 Luna (maksimum) mampu mengungguli GPT‑5.6 Sol (sedang) dengan biaya sepersepuluhnya.

Dalam OSWorld 2.0⁠(terbuka di jendela baru), agen AI mencoba alur kerja penggunaan komputer berjangka panjang yang mencakup tugas sehari-hari dan profesional. Kami melaporkan imbalan parsial pada set offline dari rilis v2026.08.08.

Gaya kolaborasi

Kami juga menghadirkan gaya komunikasi GPT‑6 Astra yang lebih baik ke Sol dan Luna, yang menurut kami akan sangat terasa dalam percakapan teknis dan pemrograman. Jawaban akan terasa lebih jelas, dengan lebih sedikit jargon, frasa yang janggal, dan detail yang kurang bernilai. Secara keseluruhan, jawaban juga sedikit lebih ringkas tanpa kehilangan substansi.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Meski gaya bersifat subjektif, kami lebih menyukai jawaban GPT‑6 Sol di sini. Model ini tidak terlalu cepat menarik kesimpulan, tidak banyak mengulang detail yang mungkin sudah jelas bagi penanya (misalnya bahwa situs web tersebut memiliki empat halaman), menggunakan lebih sedikit bahasa yang samar (misalnya “nuansa bento”, “membentuk ulang… di sekitar sistem tersebut”), lebih terbuka tentang hal yang sudah dan belum diperiksanya, serta tidak membagikan detail implementasi yang tidak perlu, seperti prompt alat gambarnya.

Meningkatkan caching untuk agen dan percakapan panjang

Selain menurunkan harga token, kami membantu developer yang mengembangkan aplikasi dengan GPT‑6 untuk lebih menghemat biaya konteks yang digunakan kembali oleh aplikasi mereka. Kami telah meningkatkan penyimpanan prompt untuk GPT‑6 agar secara default menghasilkan tingkat cache hit yang lebih tinggi, sehingga agen dapat menggunakan kembali lebih banyak konteks, merespons lebih cepat, dan memperoleh diskon 90% untuk pembacaan token input dari cache.

Developer juga memiliki lebih banyak cara untuk mengukur dan mengoptimalkan performa caching:

GitHub melaporkan bahwa selama beberapa bulan terakhir, peningkatan ini telah mengurangi proporsi token prompt yang memerlukan pemrosesan baru hingga lebih dari 50% pada miliaran permintaan ke model OpenAI, sehingga membantu Copilot merespons lebih cepat.

Terus meningkatkan penyelarasan

GPT‑6 Sol dan Luna dikembangkan berdasarkan upaya penyelarasan yang diperkenalkan bersama Astra, model kami yang paling selaras hingga saat ini. Dalam evaluasi penyelarasan kami, Sol dan Luna sama-sama menunjukkan peningkatan dibandingkan versi GPT‑5.6 masing-masing, termasuk tingkat klaim menyesatkan yang lebih rendah mengenai pekerjaan pemrograman mereka.

Evaluasi berikut sengaja menguji situasi yang menantang dan tidak mengukur tingkat kegagalan dalam penggunaan umum. Lihat kartu sistem⁠(terbuka di jendela baru) untuk hasil lengkap.

Ketersediaan

Mulai hari ini, GPT‑6 Sol dan GPT‑6 Luna tersedia di ChatGPT Work dan Codex untuk semua pengguna Plus, Pro, Business, Enterprise, dan Edu. Pengguna Free dan Go dapat mengakses GPT‑6 Luna di aplikasi desktop. Model-model ini belum tersedia di Chat. Di API OpenAI, keduanya tersedia sebagai gpt-6-sol dan gpt-6-luna.

Untuk menjaga layanan tetap stabil bagi semua orang, kami berencana meluncurkan model-model ini di ChatGPT secara bertahap sepanjang hari. Jika model baru belum muncul di ChatGPT Work atau Codex, silakan coba lagi nanti.


Evaluasi GPT dilakukan di lingkungan riset kami atau melalui API kami, yang mungkin menghasilkan output yang sedikit berbeda dari ChatGPT versi produksi akibat perbedaan prompt sistem, alat yang tersedia, dan sebagainya. Evaluasi model pesaing diambil dari laporan yang tersedia untuk umum. Skor Claude Fable 5 digunakan ketika skor Claude Fable 5.1 tidak tersedia.

Penulis

OpenAI