Memperkenalkan GPT‑6 Sol dan Luna
Lebih banyak cara untuk membawa kecerdasan termaju ke dalam kerja harian anda.
Awal bulan ini, kami memperkenalkan GPT‑6 Astra, model paling pintar dan paling sejajar di dunia. Walaupun projek yang paling mencabar dan penting masih memerlukan keupayaan penuh Astra, kerja dilaksanakan pada skala, rentak dan belanjawan yang berbeza.
Itulah sebabnya kami memperluas dunia GPT‑6 dengan GPT‑6 Sol dan GPT‑6 Luna. GPT‑6 Astra memperkenalkan kecerdasan generasi baharu—model-model ini bantu meluaskan manfaat kecerdasan tersebut dengan memajukan teknologi termaju dengan jimat kos. Kami melatih GPT‑6 Sol dan Luna menggunakan kaedah yang serupa dengan GPT‑6 Astra, lalu membawa kemajuan yang mendasari prestasi tercanggih Astra dalam kerja profesional, ketepatan fakta, pengekodan, penggunaan komputer dan penjajaran kepada model yang lebih pantas serta mampu milik.
Model GPT‑6 menerajui keseluruhan keluk kecerdasan–kos, menggabungkan keupayaan luar biasa pada setiap tahap dengan infrastruktur yang menyediakannya secara cekap pada skala besar. Penambahbaikan pada cache dan inferens membolehkan kami menyediakan model-model ini pada kos lebih rendah. Kami menyalurkan penjimatan itu terus kepada pengguna dan pelanggan dengan mengurangkan harga API Sol dan Luna sebanyak 50% berbanding harga promosi GPT‑5.6. Secara keseluruhan, penambahbaikan ini menjadikan AI lanjutan praktikal untuk lebih banyak tugas dan aplikasi harian pada skala besar.
Model | Input | Output | Pengurangan harga |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% lebih murah |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% lebih murah |
Harga adalah bagi setiap 1 juta token.
GPT‑6 Astra kekal sebagai model terbaik kami secara menyeluruh. Pilih model ini apabila anda mahukan hasil terbaik tanpa sebarang kompromi.
GPT‑6 Sol dan Luna meningkatkan kecerdasan serta kecekapan kos model yang sudah anda kenali dan gunakan, khususnya untuk keupayaan yang paling berguna dalam menyelesaikan kerja rumit.
GPT‑6 Sol mampu menangani tugas kerja yang sukar sambil memberi anda lebih ruang untuk membuat lelaran melalui had penggunaan lebih tinggi dan kos lebih rendah, di samping menawarkan kecerdasan serta hasil lebih baik berbanding model pesaing dengan harga setara.
Dalam AutomationBench, ujian aliran kerja perniagaan merentas aplikasi, GPT‑6 Sol pada usaha amat tinggi mengatasi usaha Claude Opus 5 pada usaha maks dengan hanya 9% daripada kos Opus 5 bagi setiap tugas. Pada tahap usaha yang tinggi, GPT‑6 Luna mengatasi model terdahulunya sebanyak 5.4 mata peratusan dengan kos setiap tugasan 58% lebih rendah.
Dalam AutomationBench 1.0.6(dibuka dalam tetingkap baru), ejen AI diuji pada aliran kerja menyeluruh menggunakan 47 alat merentas jualan, pemasaran, operasi, sokongan, kewangan dan sumber manusia. Titik data untuk Claude Fable 5.1 merendahkan kos sebenarnya kerana tidak memasukkan kos penggunaan sandaran Opus 5, yang berlaku dalam kira-kira 40% tugas.
GPT‑6 Sol turut mengatasi Claude Fable 5.1 pada kos yang jauh lebih rendah, malah menewaskan GPT‑6 Astra dengan usaha rendah.
Model (dan usaha) | Skor | Kos setiap tugas |
|---|---|---|
GPT‑6 Sol (amat tinggi) | 33.2% | $0.27 |
GPT‑6 Astra (rendah) | 30.3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (maks) | 26.9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 dengan sandaran Opus 5 (maks) | 31.4% | >8.9x GPT‑6 Sol (kos sandaran tidak dilaporkan) |
Dalam Agents’ Last Exam, yang menilai ejen dalam aliran kerja profesional yang rumit, GPT‑6 Sol dengan usaha maks meraih 56.4%, melebihi skor tertinggi Claude Opus 5 dalam penilaian tersebut pada kos setiap tugas yang 60% lebih rendah.
Dalam Agents’ Last Exam V1(dibuka dalam tetingkap baru), ejen AI dinilai melalui tugas jangka panjang yang bernilai dari segi ekonomi, merangkumi 55 subindustri dan kebanyakan bidang utama kerja profesional yang dilakukan menggunakan komputer.
Kegunaan sesuatu jawapan bergantung pada ketepatan fakta, dan kami terus mencapai kemajuan dalam meningkatkan kebolehpercayaan fakta. Dalam penilaian ketepatan fakta dalaman kami, yang berdasarkan perbualan dunia sebenar yang dinyahpengenalan apabila pengguna melaporkan kesilapan yang dilakukan oleh model kami, GPT‑6 Sol melakukan kira-kira separuh daripada jumlah kesilapan model terdahulunya, menghampiri tahap kebolehpercayaan Astra dengan kos yang jauh lebih rendah. GPT‑6 Luna juga menunjukkan peningkatan yang ketara; pada tahap usaha yang lebih tinggi, prestasinya menyamai GPT‑5.6 Sol dengan kos kira-kira satu per seratus daripada kosnya.
Di sini, kami menilai ketepatan fakta berdasarkan perbualan ChatGPT tanpa identiti apabila pengguna telah menandakan ralat fakta daripada model terdahulu. Perbualan yang mencetuskan ralat ini tidak menggambarkan penggunaan biasa, apabila ralat fakta lebih jarang berlaku. Skor tidak dikawal mengikut panjang; namun, ujian pelbagai tahap kepanjangan kami menunjukkan hampir tiada kebergantungan pada panjang jawapan.
Tahun ini, ejen pengekodan mula menangani tugas yang lebih rumit, lebih luas dan lebih panjang berbanding sebelum ini. Di OpenAI, penggunaan dalaman kami telah meningkat secara eksponen. Berdasarkan harga API, penggunaan token harian telah melebihi $600 bagi penyelidik median dan $7,000 bagi penyelidik pada persentil ke-90 (Pemacuan penyelidikan: Tinjauan dari dalam OpenAI). Apabila ejen pengekodan menangani tugas yang lebih panjang dan mencabar, kos penggunaan berterusan menjadi semakin penting. GPT‑6 Sol dan Luna menggabungkan prestasi pengekodan yang kukuh dengan harga API lebih rendah, memberi pembangun lebih ruang untuk membuat lelaran dan keyakinan kepada pasukan untuk menetapkan tugas yang lebih bercita-cita tinggi kepada Codex.
Dalam FrontierCode, yang menilai sama ada ejen pengekodan menghasilkan perubahan yang sedia digabungkan ke dalam pangkalan kod sebenar, GPT‑6 Sol menunjukkan peningkatan ketara berbanding GPT‑5.6 Sol dan mampu menyamai Claude Fable 5.1 amat tinggi pada kos yang jauh lebih rendah.
Dalam FrontierCode 1.1 Main(dibuka dalam tetingkap baru), ejen AI menulis kod yang dinilai bukan sahaja dari segi ketepatan, tetapi juga “kebolehgabungan”: contohnya, kualiti ujian, disiplin skop, gaya kod dan pematuhan kepada piawaian pangkalan kod.
Dalam DeepSWE v1.1, yang menguji prestasi pada tugas kejuruteraan perisian rumit dalam pangkalan kod sebenar, usaha GPT‑6 Sol pada usaha maks meraih 68.8%, hanya 1.1 mata peratusan di bawah skor tertinggi Claude Fable 5 dalam penilaian tersebut—usaha 69.9% pada usaha amat tinggi—pada kos setiap tugas kira-kira 80% lebih rendah.
GPT‑6 Luna dengan usaha maks meraih 66.6%, setanding dengan Claude Opus 5 dan Fable 5 dengan usaha sederhana. Dalam perbandingan ini, kos Luna bagi setiap tugas adalah 93% lebih rendah daripada Opus 5 dan 96% lebih rendah daripada Fable 5.
Dalam DeepSWE 1.1(dibuka dalam tetingkap baru), ejen AI menyelesaikan tugas kejuruteraan perisian asli yang memerlukan tempoh panjang.
Walaupun GPT‑6 Astra kekal sebagai model terbaik di dunia untuk penggunaan komputer, GPT‑6 Sol dan Luna menawarkan prestasi yang lebih menjimatkan kos berbanding model terdahulu. Dalam OSWorld 2.0 luar talian, usaha GPT‑6 Sol pada usaha amat tinggi mencapai skor yang serupa dengan Claude Opus 5 dengan usaha sederhana—60.5% berbanding 60.3%—pada kos setiap tugas kira-kira 80% lebih rendah. GPT‑6 Luna (maks) mampu mengatasi GPT‑5.6 Sol (sederhana) pada satu persepuluh daripada kosnya.
Dalam OSWorld 2.0(dibuka dalam tetingkap baru), ejen AI mencuba aliran kerja penggunaan komputer jangka panjang yang merangkumi tugas harian dan profesional. Kami melaporkan ganjaran separa bagi set luar talian daripada keluaran v2026.08.08.
Kami turut membawa gaya komunikasi GPT‑6 Astra yang dipertingkat kepada Sol dan Luna, yang kami jangka akan ketara khususnya dalam perbualan teknikal dan pengekodan. Jangkakan penjelasan yang lebih jelas, kurang jargon, lagi kurang ungkapan yang janggal, lagi kurang butiran yang kurang bernilai dan jawapan yang secara keseluruhannya lebih pendek sedikit tanpa mengurangkan kandungan penting.
Walaupun gaya bersifat subjektif, kami lebih menyukai jawapan GPT‑6 Sol di sini. Model ini tidak terlalu cepat membuat kesimpulan, kurang mengulangi butiran yang mungkin sudah jelas kepada penanya (contohnya, laman web itu mempunyai empat halaman), kurang menggunakan bahasa kabur (contohnya, “gaya bento”, “membentuk semula… berasaskan sistem itu”), lebih telus tentang perkara yang telah dan belum diperiksa, serta tidak berkongsi butiran pelaksanaan yang tidak perlu seperti prom alat imejnya.
Di samping harga token yang lebih rendah, kami membantu pembangun yang membina aplikasi menggunakan GPT‑6 menjimatkan lebih banyak kos bagi konteks yang digunakan semula oleh aplikasi mereka. Kami telah menambah baik cache prom untuk GPT‑6 agar kadar padanan cache lebih tinggi secara lalai, yang membantu ejen menggunakan semula lebih banyak konteks, memberikan respons lebih pantas dan menikmati diskaun 90% untuk pembacaan token input yang disimpan dalam cache.
Pembangun juga mempunyai lebih banyak cara untuk mengukur dan mengoptimumkan prestasi cache mereka:
Pantau dan diagnosis. Papan Pemuka Cache Prom(dibuka dalam tetingkap baru) menunjukkan jumlah input yang disimpan dalam cache dan perubahan jumlah tersebut dari semasa ke semasa. Alat diagnostik(dibuka dalam tetingkap baru) bantu menjelaskan peluang yang terlepas untuk disimpan dalam cache dan perkara yang perlu dibetulkan.
Laraskan usaha penaakulan dan ketersediaan alat tanpa menjejaskan cache. Tingkatkan usaha penaakulan(dibuka dalam tetingkap baru) untuk tugas lebih sukar atau kurangkannya bagi soalan susulan yang lebih mudah, serta dayakan atau nyahdayakan alat(dibuka dalam tetingkap baru) mengikut perubahan keperluan ejen anda. Kedua-dua kawalan kini mengekalkan konteks terdahulu untuk digunakan semula dalam cache.
Optimumkan awalan yang disimpan dalam cache. Titik pemisah eksplisit membolehkan pembangun memilih tempat awalan prom yang disimpan dalam cache berakhir. Ini memberi pembangun lebih kawalan terhadap penggunaan semula cache dan dapat meningkatkan prestasi.
GitHub melaporkan bahawa sejak beberapa bulan lalu, penambahbaikan ini telah mengurangkan bahagian token prom yang memerlukan pemprosesan baharu sebanyak lebih 50% merentas berbilion-bilion permintaan kepada model OpenAI, sekali gus membantu Copilot memberikan respons lebih pantas.
GPT‑6 Sol dan Luna meneruskan usaha penjajaran yang diperkenalkan bersama Astra, model kami yang paling sejajar setakat ini. Dalam penilaian penjajaran kami, Sol dan Luna masing-masing menunjukkan peningkatan berbanding model GPT‑5.6 yang setara, termasuk kadar dakwaan mengelirukan yang lebih rendah tentang kerja pengekodan mereka.
Penilaian di bawah sengaja menguji situasi mencabar dan tidak mengukur kadar kegagalan dalam penggunaan biasa. Lihat kad sistem(dibuka dalam tetingkap baru) untuk hasil penuh.
GPT‑6 Sol dan GPT‑6 Luna tersedia dalam ChatGPT Work dan Codex mulai hari ini untuk semua pengguna Plus, Pro, Business, Enterprise dan Edu. Pengguna Free dan Go boleh mengakses GPT‑6 Luna dalam aplikasi desktop. Model-model ini belum tersedia dalam Sembang. Dalam API OpenAI, model-model ini tersedia sebagai gpt-6-sol dan gpt-6-luna.
Untuk memastikan perkhidmatan kekal stabil bagi semua pengguna, kami merancang untuk melancarkan model-model ini secara beransur-ansur dalam ChatGPT sepanjang hari. Jika anda belum melihat model baharu dalam ChatGPT Work atau Codex, sila cuba lagi kemudian.
Penilaian GPT dilakukan dalam persekitaran penyelidikan kami atau melalui API kami, yang mungkin memberikan output yang sedikit berbeza daripada ChatGPT produksi disebabkan perbezaan pada prom sistem, alat yang tersedia dan sebagainya. Penilaian model pesaing diambil daripada laporan yang tersedia kepada umum. Skor Claude Fable 5 dilaporkan apabila skor Claude Fable 5.1 tidak tersedia.


