GPT‑6 Sol ve Luna'yı tanıtıyoruz
En üst seviye akıl yürütmeyi günlük çalışmalarınıza taşımanın daha fazla yolu.
Bu ayın başlarında, dünyanın en akıllı ve en uyumlu modeli olan GPT‑6 Astra'yı tanıttık. En zorlu ve önemli projeler hâlâ Astra'nın tüm kapasitesini gerektirse de çalışmalar farklı ölçeklerde, tempolarda ve bütçelerle yürütülüyor.
Bu nedenle GPT‑6 evrenini GPT‑6 Sol ve GPT‑6 Luna ile genişletiyoruz. GPT‑6 Astra yeni nesil bir akıl yürütme düzeyi sundu; bu modeller ise maliyet verimliliğinde sınırları ileri taşıyarak bu gelişmenin faydalarını daha geniş kitlelere ulaştırıyor. GPT‑6 Sol ve Luna'yı GPT‑6 Astra'ya benzer yöntemlerle eğittik. Böylece Astra'nın profesyonel çalışma, olgusal doğruluk, kodlama, bilgisayar kullanımı ve uyum alanlarındaki en ileri performansını mümkün kılan yenilikleri daha hızlı ve uygun maliyetli modellere taşıdık.
GPT‑6 modelleri, her düzeyde olağanüstü yetenekleri bunları büyük ölçekte verimli biçimde sunan altyapıyla birleştirerek maliyet-akıl yürütme eğrisine öncülük ediyor. Önbelleğe alma ve çıkarım alanlarındaki iyileştirmeler, bu modelleri daha düşük maliyetle sunmamızı sağlıyor. Bu tasarrufu, Sol ve Luna'nın API fiyatlarını GPT‑5.6 için uygulanan tanıtım fiyatlarına kıyasla %50 düşürerek doğrudan kullanıcılarımıza ve müşterilerimize yansıtıyoruz. Bu iyileştirmeler birlikte, gelişmiş yapay zekâyı daha fazla günlük görev ve büyük ölçekli uygulama için kullanılabilir hâle getiriyor.
Model | Girdi | Çıktı | Fiyat indirimi |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | %50 daha ucuz |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | %50 daha ucuz |
Fiyatlar 1 milyon token başınadır.
GPT‑6 Astra her açıdan en iyi modelimiz olmayı sürdürüyor. En iyi sonuçları ve ödünsüz bir deneyimi istediğinizde Astra'yı seçin.
GPT‑6 Sol ve Luna, karmaşık işleri tamamlamak için en yararlı yetenekler genelinde tanıdığınız ve kullandığınız modellere daha yüksek akıl yürütme düzeyi ve maliyet verimliliği getiriyor.
GPT‑6 Sol, zorlu iş görevlerini üstlenirken daha yüksek kullanım limitleri ve daha düşük maliyet sayesinde yineleme için daha fazla alan sunuyor. Ayrıca benzer fiyatlı rakip modellere kıyasla daha yüksek akıl yürütme düzeyi ve daha iyi sonuçlar sağlıyor.
Uygulamalar arasındaki iş akışlarını test eden AutomationBench'te çok yüksek efor kullanan GPT‑6 Sol, görev başına Opus 5 maliyetinin yalnızca %9'una karşılık gelen maliyetle Max efor kullanan Claude Opus 5'i geride bırakıyor. Yüksek eforda GPT‑6 Luna, görev başına %58 daha düşük maliyetle selefine göre 5,4 yüzde puanlık iyileşme sağlıyor.
AI ajanları; AutomationBench 1.0.6(yeni bir pencerede açılır)'da satış, pazarlama, operasyon, destek, finans ve insan kaynakları alanlarındaki 47 aracı kullanarak uçtan uca iş akışlarında test edilir. Claude Fable 5.1'e ait veri noktası, görevlerin yaklaşık %40'ında gerçekleşen Opus 5'e geri dönüşlerin maliyetini içermediği için gerçek maliyeti olduğundan düşük gösterir.
GPT‑6 Sol, çok daha düşük maliyetle Claude Fable 5.1'i de geride bırakıyor, hatta düşük eforlu GPT‑6 Astra'dan daha iyi performans gösteriyor.
Model (ve efor) | Puan | Görev başına maliyet |
|---|---|---|
GPT‑6 Sol (çok yüksek) | %33,2 | 0,27 $ |
GPT‑6 Astra (düşük) | %30,3 | GPT‑6 Sol'un 3,9 katı |
Claude Opus 5 (Max) | %26,9 | GPT‑6 Sol'un 11,1 katı |
Opus 5'e geri dönüşlü Claude Fable 5.1 (Max) | %31,4 | GPT‑6 Sol'un >8,9 katı (geri dönüş maliyeti bildirilmedi) |
Ajanları karmaşık profesyonel iş akışlarında değerlendiren Agents’ Last Exam testinde Max eforlu GPT‑6 Sol, %56,4 puan alarak değerlendirmedeki en yüksek Claude Opus 5 puanını görev başına %60 daha düşük maliyetle aşıyor.
AI ajanları, Agents’ Last Exam V1(yeni bir pencerede açılır)'de bilgisayarda gerçekleştirilen başlıca profesyonel çalışma alanlarının çoğunu kapsayan 55 alt sektördeki uzun süreli ve ekonomik değer taşıyan görevlerle değerlendirilir.
Bir yanıtın yararlı olması, olguların doğru aktarılmasına bağlıdır. Olgusal güvenilirlik konusunda ilerlemeyi sürdürüyoruz. Kullanıcıların modellerimizin hatalarını bildirdiği, kimlik bilgileri kaldırılmış gerçek konuşmalara dayanan şirket içi olgusal doğruluk değerlendirmemizde GPT‑6 Sol, selefinin yaklaşık yarısı kadar hata yapıyor ve çok daha düşük maliyetle Astra düzeyinde güvenilirliğe yaklaşıyor. GPT‑6 Luna da önemli ölçüde gelişti; daha yüksek efor düzeylerinde GPT‑5.6 Sol ile yaklaşık yüzde biri kadar maliyetle aynı performansı gösteriyor.
Burada olgusal doğruluğu, kullanıcıların önceki bir modelin olgusal hatasını bildirdiği, kimlik bilgileri kaldırılmış ChatGPT konuşmaları üzerinden değerlendiriyoruz. Hata oluşmasına yol açan bu konuşmalar, olgusal hataların daha seyrek görüldüğü tipik kullanımı temsil etmez. Puanlar uzunluğa göre kontrol edilmemiştir; ancak ayrıntı düzeyi taramalarımız yanıt uzunluğuyla neredeyse hiçbir ilişki olmadığını göstermiştir.
Kodlama ajanları bu yıl, her zamankinden daha karmaşık, kapsamlı ve uzun süreli görevleri üstlenmeye başladı. OpenAI'daki şirket içi kullanımımız katlanarak arttı. API fiyatları üzerinden hesaplandığında günlük token kullanımı, ortanca araştırmacı için 600 doları, 90. yüzdelik dilimdeki araştırmacılar içinse 7.000 doları aştı (Araştırmayı hızlandırmak: OpenAI'dan bir bakış). Kodlama ajanları daha uzun ve zorlu görevler üstlendikçe sürekli kullanımın maliyeti daha önemli hâle geliyor. GPT‑6 Sol ve Luna, güçlü kodlama performansını daha düşük API fiyatlarıyla birleştirerek geliştiricilere yineleme için daha fazla alan, ekiplere ise Codex'ten daha iddialı işler isteme konusunda güven veriyor.
Kodlama ajanlarının gerçek kod tabanlarıyla birleştirilmeye hazır değişiklikler üretip üretmediğini değerlendiren FrontierCode'da GPT‑6 Sol, GPT‑5.6 Sol'a göre önemli ölçüde gelişiyor ve çok daha düşük maliyetle çok yüksek eforlu Claude Fable 5.1 ile aynı performansı gösterebiliyor.
AI ajanlarının yazdığı kodlar, FrontierCode 1.1 Main(yeni bir pencerede açılır)'de yalnızca doğruluk açısından değil, test kalitesi, kapsam disiplini, kod stili ve kod tabanı standartlarına uyum gibi ölçütleri içeren “birleştirilebilirlik” açısından da değerlendirilir.
Gerçek kod tabanlarındaki karmaşık yazılım mühendisliği görevlerinde performansı test eden DeepSWE v1.1'de Max eforlu GPT‑6 Sol %68,8 puan alıyor. Bu sonuç, değerlendirmedeki en yüksek Claude Fable 5 puanı olan çok yüksek efordaki %69,9'un yalnızca 1,1 yüzde puan gerisinde ve görev başına maliyet yaklaşık %80 daha düşük.
Max eforlu GPT‑6 Luna %66,6 puan alarak Orta eforlu Claude Opus 5 ve Fable 5 ile benzer performans gösteriyor. Bu karşılaştırmalarda Luna'nın görev başına maliyeti Opus 5'ten %93, Fable 5'ten ise %96 daha düşük.
AI ajanları, DeepSWE 1.1(yeni bir pencerede açılır)'de özgün ve uzun süreli yazılım mühendisliği görevlerini çözer.
GPT‑6 Astra bilgisayar kullanımında dünyanın en iyi modeli olmayı sürdürürken GPT‑6 Sol ve Luna, seleflerinden daha uygun maliyetli performans sunuyor. OSWorld 2.0 çevrimdışı testinde çok yüksek eforlu GPT‑6 Sol, görev başına yaklaşık %80 daha düşük maliyetle Orta eforlu Claude Opus 5'e benzer bir puan elde ediyor: %60,5'e karşı %60,3. GPT‑6 Luna (Max), maliyetinin onda biriyle GPT‑5.6 Sol'u (Orta) geride bırakabiliyor.
AI ajanları, OSWorld 2.0(yeni bir pencerede açılır)'da günlük ve profesyonel görevleri kapsayan uzun süreli bilgisayar kullanımı iş akışlarını gerçekleştirmeye çalışır. v2026.08.08 sürümündeki çevrimdışı küme için kısmi ödülü bildiriyoruz.
GPT‑6 Astra'nın geliştirilmiş iletişim tarzını Sol ve Luna'ya da taşıdık. Bunun özellikle teknik konuşmalarda ve kodlama konuşmalarında fark edileceğini düşünüyoruz. İçerikten ödün vermeden daha net ifadeler, daha az jargon, daha az tuhaf anlatım, daha az düşük değerli ayrıntı ve genel olarak biraz daha kısa yanıtlar bekleyebilirsiniz.
Üslup öznel olsa da burada GPT‑6 Sol'un yanıtını tercih ediyoruz. Bu yanıt aceleci çıkarımlarda bulunmaya daha az eğilim gösteriyor, soruyu soran kişinin bildiği varsayılabilecek ayrıntıları (ör. web sitesinin dört sayfası olması) yinelemeye daha az zaman ayırıyor, daha az belirsiz ifade (ör. “bento hissi”, “o sistem etrafında yeniden şekillendirme”) kullanıyor, neleri kontrol edip etmediğini daha açıkça belirtiyor ve görsel aracı promptu gibi uygulama ayrıntılarını gereksiz yere paylaşmıyor.
Daha düşük token fiyatlarının yanı sıra GPT‑6 üzerinde geliştirme yapanların, uygulamalarında yeniden kullandıkları bağlamdan daha fazla tasarruf etmesine yardımcı oluyoruz. GPT‑6 için prompt önbelleğe almayı geliştirerek varsayılan önbellek isabet oranlarını yükselttik. Böylece ajanlar daha fazla bağlamı yeniden kullanabiliyor, daha hızlı yanıt verebiliyor ve önbelleğe alınmış girdi tokenlarının okunmasında %90 indirimden yararlanabiliyor.
Geliştiriciler artık önbelleğe alma performanslarını ölçmek ve optimize etmek için daha fazla seçeneğe de sahip:
İzleyin ve tanılayın. Prompt Önbelleğe Alma Panosu(yeni bir pencerede açılır), girdinin ne kadarının önbelleğe alındığını ve bunun zaman içinde nasıl değiştiğini gösterir. Tanılama aracı(yeni bir pencerede açılır), kaçırılan önbelleğe alma fırsatlarını ve düzeltilmesi gereken noktaları açıklamaya yardımcı olur.
Önbelleği bozmadan akıl yürütme eforunu ve araç kullanılabilirliğini ayarlayın. Zor görevlerde akıl yürütme eforunu(yeni bir pencerede açılır) artırın, daha basit takip sorularında azaltın ve ajanınızın ihtiyaçları değiştikçe araçları etkinleştirin veya devre dışı bırakın(yeni bir pencerede açılır). Her iki denetim de artık daha önceki bağlamı önbellekte yeniden kullanılmak üzere koruyor.
Hangi ön eklerin önbelleğe alınacağını optimize edin. Açık kesme noktaları, geliştiricilerin önbelleğe alınan prompt ön eklerinin nerede biteceğini seçmesine olanak tanır. Bu, geliştiricilere önbelleğin yeniden kullanımı üzerinde daha fazla denetim sağlar ve performansı artırabilir.
GitHub, bu iyileştirmelerin son birkaç ayda OpenAI modellerine gönderilen milyarlarca istekte yeniden işlenmesi gereken prompt tokenlarının payını %50'den fazla azalttığını ve Copilot'ın daha hızlı yanıt vermesine yardımcı olduğunu bildiriyor.
GPT‑6 Sol ve Luna, bugüne kadarki en uyumlu modelimiz Astra ile sunduğumuz uyum çalışmalarını temel alıyor. Uyum değerlendirmelerimizde hem Sol hem de Luna, kodlama çalışmaları hakkında daha düşük oranda yanıltıcı iddialarda bulunmaları da dâhil olmak üzere GPT‑5.6 sürümlerine göre gelişme gösteriyor.
Aşağıdaki değerlendirmeler zorlu durumları kasıtlı olarak test eder ve tipik kullanımdaki başarısızlık oranlarını ölçmez. Sonuçların tamamı için sistem kartına(yeni bir pencerede açılır) bakın.
GPT‑6 Sol ve GPT‑6 Luna bugünden itibaren tüm Plus, Pro, Business, Enterprise ve Edu kullanıcıları için ChatGPT Çalışma ve Codex'te kullanılabilir. Free ve Go kullanıcıları, masaüstü uygulamasından GPT‑6 Luna'ya erişebilir. Bu modeller henüz Sohbet'te kullanılamıyor. OpenAI API'de gpt-6-sol ve gpt-6-luna adlarıyla kullanılabilirler.
Hizmeti herkes için istikrarlı tutmak amacıyla bu modelleri gün boyunca ChatGPT'de kademeli olarak kullanıma sunmayı planlıyoruz. Yeni modelleri ChatGPT Çalışma veya Codex'te görmüyorsanız lütfen daha sonra tekrar deneyin.
GPT değerlendirmeleri araştırma ortamımızda veya API'miz üzerinden gerçekleştirildi. Sistem promptları, kullanılabilir araçlar ve benzeri farklılıklar nedeniyle bunlar üretim ortamındaki ChatGPT'den biraz farklı çıktılar verebilir. Rakip modellere ilişkin değerlendirmeler kamuya açık raporlardan alınmıştır. Claude Fable 5.1 puanlarının bulunmadığı durumlarda Claude Fable 5 puanları kullanılmıştır.


