Langkau ke kandungan utama
OpenAI

Memperkenalkan GPT‑6 Sol dan Luna

Lebih banyak cara untuk membawa kecerdasan termaju ke dalam kerja harian anda.

Memuat…

Awal bulan ini, kami memperkenalkan GPT‑6 Astra, model paling pintar dan paling sejajar di dunia. Walaupun projek yang paling mencabar dan penting masih memerlukan keupayaan penuh Astra, kerja dilaksanakan pada skala, rentak dan belanjawan yang berbeza.

Itulah sebabnya kami memperluas dunia GPT‑6 dengan GPT‑6 Sol dan GPT‑6 Luna. GPT‑6 Astra memperkenalkan kecerdasan generasi baharu—model-model ini bantu meluaskan manfaat kecerdasan tersebut dengan memajukan teknologi termaju dengan jimat kos. Kami melatih GPT‑6 Sol dan Luna menggunakan kaedah yang serupa dengan GPT‑6 Astra, lalu membawa kemajuan yang mendasari prestasi tercanggih Astra dalam kerja profesional, ketepatan fakta, pengekodan, penggunaan komputer dan penjajaran kepada model yang lebih pantas serta mampu milik.

Model GPT‑6 menerajui keseluruhan keluk kecerdasan–kos, menggabungkan keupayaan luar biasa pada setiap tahap dengan infrastruktur yang menyediakannya secara cekap pada skala besar. Penambahbaikan pada cache dan inferens membolehkan kami menyediakan model-model ini pada kos lebih rendah. Kami menyalurkan penjimatan itu terus kepada pengguna dan pelanggan dengan mengurangkan harga API Sol dan Luna sebanyak 50% berbanding harga promosi GPT‑5.6. Secara keseluruhan, penambahbaikan ini menjadikan AI lanjutan praktikal untuk lebih banyak tugas dan aplikasi harian pada skala besar.

Harga API GPT‑6

Model

Input

Output

Pengurangan harga

GPT‑6 Sol
berbanding GPT‑5.6 Sol

$4 → $2

$20 → $10

50% lebih murah

GPT‑6 Luna
berbanding GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% lebih murah

Harga adalah bagi setiap 1 juta token.

GPT‑6 Astra kekal sebagai model terbaik kami secara menyeluruh. Pilih model ini apabila anda mahukan hasil terbaik tanpa sebarang kompromi.

Peningkatan menyeluruh untuk keluarga model

GPT‑6 Sol dan Luna meningkatkan kecerdasan serta kecekapan kos model yang sudah anda kenali dan gunakan, khususnya untuk keupayaan yang paling berguna dalam menyelesaikan kerja rumit.

Kerja profesional

GPT‑6 Sol mampu menangani tugas kerja yang sukar sambil memberi anda lebih ruang untuk membuat lelaran melalui had penggunaan lebih tinggi dan kos lebih rendah, di samping menawarkan kecerdasan serta hasil lebih baik berbanding model pesaing dengan harga setara.

Dalam AutomationBench, ujian aliran kerja perniagaan merentas aplikasi, GPT‑6 Sol pada usaha amat tinggi mengatasi usaha Claude Opus 5 pada usaha maks dengan hanya 9% daripada kos Opus 5 bagi setiap tugas. Pada tahap usaha yang tinggi, GPT‑6 Luna mengatasi model terdahulunya sebanyak 5.4 mata peratusan dengan kos setiap tugasan 58% lebih rendah.

Dalam AutomationBench 1.0.6⁠(dibuka dalam tetingkap baru), ejen AI diuji pada aliran kerja menyeluruh menggunakan 47 alat merentas jualan, pemasaran, operasi, sokongan, kewangan dan sumber manusia. Titik data untuk Claude Fable 5.1 merendahkan kos sebenarnya kerana tidak memasukkan kos penggunaan sandaran Opus 5, yang berlaku dalam kira-kira 40% tugas.

GPT‑6 Sol turut mengatasi Claude Fable 5.1 pada kos yang jauh lebih rendah, malah menewaskan GPT‑6 Astra dengan usaha rendah.

Model (dan usaha)

Skor

Kos setiap tugas

GPT‑6 Sol (amat tinggi)

33.2%

$0.27

GPT‑6 Astra (rendah)

30.3%

3.9x GPT‑6 Sol

Claude Opus 5 (maks)

26.9%

11.1x GPT‑6 Sol

Claude Fable 5.1 dengan sandaran Opus 5 (maks)

31.4%

>8.9x GPT‑6 Sol

(kos sandaran tidak dilaporkan)

Dalam Agents’ Last Exam, yang menilai ejen dalam aliran kerja profesional yang rumit, GPT‑6 Sol dengan usaha maks meraih 56.4%, melebihi skor tertinggi Claude Opus 5 dalam penilaian tersebut pada kos setiap tugas yang 60% lebih rendah.

Dalam Agents’ Last Exam V1⁠(dibuka dalam tetingkap baru), ejen AI dinilai melalui tugas jangka panjang yang bernilai dari segi ekonomi, merangkumi 55 subindustri dan kebanyakan bidang utama kerja profesional yang dilakukan menggunakan komputer.

Ketepatan fakta

Kegunaan sesuatu jawapan bergantung pada ketepatan fakta, dan kami terus mencapai kemajuan dalam meningkatkan kebolehpercayaan fakta. Dalam penilaian ketepatan fakta dalaman kami, yang berdasarkan perbualan dunia sebenar yang dinyahpengenalan apabila pengguna melaporkan kesilapan yang dilakukan oleh model kami, GPT‑6 Sol melakukan kira-kira separuh daripada jumlah kesilapan model terdahulunya, menghampiri tahap kebolehpercayaan Astra dengan kos yang jauh lebih rendah. GPT‑6 Luna juga menunjukkan peningkatan yang ketara; pada tahap usaha yang lebih tinggi, prestasinya menyamai GPT‑5.6 Sol dengan kos kira-kira satu per seratus daripada kosnya.

Di sini, kami menilai ketepatan fakta berdasarkan perbualan ChatGPT tanpa identiti apabila pengguna telah menandakan ralat fakta daripada model terdahulu. Perbualan yang mencetuskan ralat ini tidak menggambarkan penggunaan biasa, apabila ralat fakta lebih jarang berlaku. Skor tidak dikawal mengikut panjang; namun, ujian pelbagai tahap kepanjangan kami menunjukkan hampir tiada kebergantungan pada panjang jawapan.

Pengekodan

Tahun ini, ejen pengekodan mula menangani tugas yang lebih rumit, lebih luas dan lebih panjang berbanding sebelum ini. Di OpenAI, penggunaan dalaman kami telah meningkat secara eksponen. Berdasarkan harga API, penggunaan token harian telah melebihi $600 bagi penyelidik median dan $7,000 bagi penyelidik pada persentil ke-90 (Pemacuan penyelidikan: Tinjauan dari dalam OpenAI⁠). Apabila ejen pengekodan menangani tugas yang lebih panjang dan mencabar, kos penggunaan berterusan menjadi semakin penting. GPT‑6 Sol dan Luna menggabungkan prestasi pengekodan yang kukuh dengan harga API lebih rendah, memberi pembangun lebih ruang untuk membuat lelaran dan keyakinan kepada pasukan untuk menetapkan tugas yang lebih bercita-cita tinggi kepada Codex.

Dalam FrontierCode, yang menilai sama ada ejen pengekodan menghasilkan perubahan yang sedia digabungkan ke dalam pangkalan kod sebenar, GPT‑6 Sol menunjukkan peningkatan ketara berbanding GPT‑5.6 Sol dan mampu menyamai Claude Fable 5.1 amat tinggi pada kos yang jauh lebih rendah.

Dalam FrontierCode 1.1 Main⁠(dibuka dalam tetingkap baru), ejen AI menulis kod yang dinilai bukan sahaja dari segi ketepatan, tetapi juga “kebolehgabungan”: contohnya, kualiti ujian, disiplin skop, gaya kod dan pematuhan kepada piawaian pangkalan kod.

Dalam DeepSWE v1.1, yang menguji prestasi pada tugas kejuruteraan perisian rumit dalam pangkalan kod sebenar, usaha GPT‑6 Sol pada usaha maks meraih 68.8%, hanya 1.1 mata peratusan di bawah skor tertinggi Claude Fable 5 dalam penilaian tersebut—usaha 69.9% pada usaha amat tinggi—pada kos setiap tugas kira-kira 80% lebih rendah.

GPT‑6 Luna dengan usaha maks meraih 66.6%, setanding dengan Claude Opus 5 dan Fable 5 dengan usaha sederhana. Dalam perbandingan ini, kos Luna bagi setiap tugas adalah 93% lebih rendah daripada Opus 5 dan 96% lebih rendah daripada Fable 5.

Dalam DeepSWE 1.1⁠(dibuka dalam tetingkap baru), ejen AI menyelesaikan tugas kejuruteraan perisian asli yang memerlukan tempoh panjang.

Penggunaan komputer

Walaupun GPT‑6 Astra kekal sebagai model terbaik di dunia untuk penggunaan komputer, GPT‑6 Sol dan Luna menawarkan prestasi yang lebih menjimatkan kos berbanding model terdahulu. Dalam OSWorld 2.0 luar talian, usaha GPT‑6 Sol pada usaha amat tinggi mencapai skor yang serupa dengan Claude Opus 5 dengan usaha sederhana—60.5% berbanding 60.3%—pada kos setiap tugas kira-kira 80% lebih rendah. GPT‑6 Luna (maks) mampu mengatasi GPT‑5.6 Sol (sederhana) pada satu persepuluh daripada kosnya.

Dalam OSWorld 2.0⁠(dibuka dalam tetingkap baru), ejen AI mencuba aliran kerja penggunaan komputer jangka panjang yang merangkumi tugas harian dan profesional. Kami melaporkan ganjaran separa bagi set luar talian daripada keluaran v2026.08.08.

Gaya kerjasama

Kami turut membawa gaya komunikasi GPT‑6 Astra yang dipertingkat kepada Sol dan Luna, yang kami jangka akan ketara khususnya dalam perbualan teknikal dan pengekodan. Jangkakan penjelasan yang lebih jelas, kurang jargon, lagi kurang ungkapan yang janggal, lagi kurang butiran yang kurang bernilai dan jawapan yang secara keseluruhannya lebih pendek sedikit tanpa mengurangkan kandungan penting.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Walaupun gaya bersifat subjektif, kami lebih menyukai jawapan GPT‑6 Sol di sini. Model ini tidak terlalu cepat membuat kesimpulan, kurang mengulangi butiran yang mungkin sudah jelas kepada penanya (contohnya, laman web itu mempunyai empat halaman), kurang menggunakan bahasa kabur (contohnya, “gaya bento”, “membentuk semula… berasaskan sistem itu”), lebih telus tentang perkara yang telah dan belum diperiksa, serta tidak berkongsi butiran pelaksanaan yang tidak perlu seperti prom alat imejnya.

Meningkatkan cache untuk ejen dan perbualan panjang

Di samping harga token yang lebih rendah, kami membantu pembangun yang membina aplikasi menggunakan GPT‑6 menjimatkan lebih banyak kos bagi konteks yang digunakan semula oleh aplikasi mereka. Kami telah menambah baik cache prom untuk GPT‑6 agar kadar padanan cache lebih tinggi secara lalai, yang membantu ejen menggunakan semula lebih banyak konteks, memberikan respons lebih pantas dan menikmati diskaun 90% untuk pembacaan token input yang disimpan dalam cache.

Pembangun juga mempunyai lebih banyak cara untuk mengukur dan mengoptimumkan prestasi cache mereka:

GitHub melaporkan bahawa sejak beberapa bulan lalu, penambahbaikan ini telah mengurangkan bahagian token prom yang memerlukan pemprosesan baharu sebanyak lebih 50% merentas berbilion-bilion permintaan kepada model OpenAI, sekali gus membantu Copilot memberikan respons lebih pantas.

Terus meningkatkan penjajaran

GPT‑6 Sol dan Luna meneruskan usaha penjajaran yang diperkenalkan bersama Astra, model kami yang paling sejajar setakat ini. Dalam penilaian penjajaran kami, Sol dan Luna masing-masing menunjukkan peningkatan berbanding model GPT‑5.6 yang setara, termasuk kadar dakwaan mengelirukan yang lebih rendah tentang kerja pengekodan mereka.

Penilaian di bawah sengaja menguji situasi mencabar dan tidak mengukur kadar kegagalan dalam penggunaan biasa. Lihat kad sistem⁠(dibuka dalam tetingkap baru) untuk hasil penuh.

Ketersediaan

GPT‑6 Sol dan GPT‑6 Luna tersedia dalam ChatGPT Work dan Codex mulai hari ini untuk semua pengguna Plus, Pro, Business, Enterprise dan Edu. Pengguna Free dan Go boleh mengakses GPT‑6 Luna dalam aplikasi desktop. Model-model ini belum tersedia dalam Sembang. Dalam API OpenAI, model-model ini tersedia sebagai gpt-6-sol dan gpt-6-luna.

Untuk memastikan perkhidmatan kekal stabil bagi semua pengguna, kami merancang untuk melancarkan model-model ini secara beransur-ansur dalam ChatGPT sepanjang hari. Jika anda belum melihat model baharu dalam ChatGPT Work atau Codex, sila cuba lagi kemudian.


Penilaian GPT dilakukan dalam persekitaran penyelidikan kami atau melalui API kami, yang mungkin memberikan output yang sedikit berbeza daripada ChatGPT produksi disebabkan perbezaan pada prom sistem, alat yang tersedia dan sebagainya. Penilaian model pesaing diambil daripada laporan yang tersedia kepada umum. Skor Claude Fable 5 dilaporkan apabila skor Claude Fable 5.1 tidak tersedia.

Penulis

OpenAI