Ana içeriğe atla
OpenAI

GPT-6.1Sol

Kesintisiz en üst seviye performans için beşte bir fiyata Astra’ya yakın zekâ

GPT‑6 Sol’un geliştirilmiş sürümü GPT‑6.1 Sol ile tanışın: ajan tabanlı kodlamanın yanı sıra bilgisayar kullanımı ve profesyonel işlerde de son derece güçlü performans sunuyor. Zorlu görevlerde Sol’u GPT‑6 Astra’ya yaklaştırırken Astra’nın standart girdi ve çıktı token fiyatlarının beşte biriyle çalışıyor. Böylece geliştiriciler, aynı bütçeyle yetenekli ajanlar oluşturmak ve çalıştırmak için daha fazla esneklik kazanıyor.

GPT‑6.1 Sol, Sol fiyatlarıyla Astra’ya yakın performans sunarak bugün sunduğu performansa göre en uygun maliyetli model oluyor. Önbelleğe alınmış girdinin maliyeti, milyon token başına yalnızca 0,10 $; bu, standart girdi fiyatına göre %95 indirim demek. Böylece yinelenen isteklerde bağlamı yeniden kullanması gereken ajan tabanlı iş yükleri daha uygun maliyetli hâle geliyor.

GPT‑6 Astra, genel olarak en yetenekli en üst seviye modelimiz olmaya devam ediyor. GPT‑6.1 Sol, kullanıcıların daha sık yapmak istediği önemli işler ve büyük ölçekte uygulama geliştiren ve çalıştıran API müşterileri için yetenek ile maliyet arasında yeni bir denge sunuyor.

Üç model kartı: GPT-6 Astra, en iyi sonuçlar için en zeki modelimiz; girdi 10 $, çıktı 50 $, önbelleğe alınmış girdi 1 $. GPT-6.1 Sol, beşte bir fiyata Astra’ya yakın zekâ; girdi 2 $, çıktı 10 $, önbelleğe alınmış girdi 0,10 $. GPT-6 Luna, büyük ölçekte hızlı ve verimli günlük işler; girdi 0,10 $, çıktı 0,50 $, önbelleğe alınmış girdi 0,01 $.

Farklı görevlerde daha yetenekli bir Sol

GPT‑6.1 Sol, kod yazma ve hata ayıklamadan belgeleri anlamaya ve çok adımlı iş akışlarını yürütmeye kadar karmaşık profesyonel işlerde GPT‑6 Sol’a kıyasla önemli iyileştirmeler sunuyor. Bu değerlendirmelerin birçoğunda, çok daha düşük maliyetle GPT‑6 Astra’nın performansına yaklaşıyor.

Kodlama

Gerçek kod tabanlarındaki karmaşık yazılım mühendisliği görevlerini değerlendiren DeepSWE v1.1 testinde GPT‑6.1 Sol, yaklaşık beşte bir maliyetle GPT‑6 Astra ile aynı puanı alıyor. Üstelik daha düşük akıl yürütme çabası ve maliyetle GPT‑6 Sol’un en iyi puanını 6,4 yüzde puan aşıyor.

Yapay zekâ ajanları, DeepSWE 1.1⁠⁠(yeni bir pencerede açılır) değerlendirmesinde özgün ve uzun soluklu yazılım mühendisliği görevlerini yerine getirir.

Profesyonel işler

GDP.pdf, modellerin tablolar, grafikler, diyagramlar ve küçük puntolu ayrıntılar içeren karmaşık PDF belgelerini kullanarak mesleki soruları ne kadar doğru yanıtladığını ölçüyor. Bu testte GPT‑6.1 Sol, test edilen akıl yürütme ayarlarında yedek modellerle çalışan Opus 5.5’ten daha yüksek puan alırken görev başına maliyeti yarıdan az. Ayrıca görev başına yaklaşık beşte bir maliyetle GPT‑6 Astra’nın alanında lider performansına yaklaşıyor.

Modeller, GDP.pdf⁠(yeni bir pencerede açılır) değerlendirmesinde finans, sağlık, hukuk ve diğer yedi mesleki alandaki iş akışlarından alınan karmaşık PDF belgeleriyle ilgili gerçek hayattan istemleri yanıtlamalıdır.

Ajanların çok adımlı iş akışlarını doğru tamamlayıp tamamlamadığını ölçen AutomationBench testinde GPT‑6.1 Sol, orta akıl yürütme çabasında yaklaşık üçte bir maliyetle Opus 5.5’ten 2,2 yüzde puan daha yüksek puan alıyor. Bu puan, aynı ayardaki GPT‑6 Sol’un puanından da 4,8 yüzde puan daha yüksek.

In AutomationBench 1.0.6⁠⁠(yeni bir pencerede açılır), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Bilgisayar kullanımı

GPT‑6.1 Sol, bilgisayar uygulamalarıyla etkileşim gerektiren görevlerde de önemli ilerleme kaydediyor. Ajanları zorlu bilgisayar kullanımı iş akışlarında değerlendiren OSWorld 2.0 testinin çevrimdışı kümesinde GPT‑6.1 Sol, en yüksek akıl yürütme çabasında GPT‑6 Sol’u yedi yüzde puan geçerken maliyeti yarıdan az. En yüksek akıl yürütme çabasında, görev başına yaklaşık yedide bir maliyetle Astra’nın puanına 2,1 yüzde puan kadar yaklaşıyor.

In OSWorld 2.0⁠⁠(yeni bir pencerede açılır), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Bilimsel araştırma

Veri analizi, simülasyon ve teorem ispatı gibi bilimsel iş akışlarını değerlendiren Terminal-Bench Science 0.1 testinde GPT‑6.1 Sol, en yüksek akıl yürütme çabasında GPT‑6 Sol’un puanının iki katından fazlasına ulaşıyor. Görev başına maliyeti ise yarıdan az. En yüksek çaba düzeyinde GPT‑6.1 Sol’un görev başına ortalama maliyeti 5,47 $ iken Opus 5.5’in maliyeti 23,21 $, Astra’nınki ise 23,80 $. Böylece her iki modele kıyasla %75’in üzerinde daha düşük maliyetle güçlü bilimsel yetenekler sunuyor.

GPT‑6 Astra, %68,1 ile test edilen modeller arasında en yüksek puana sahip olmaya devam ediyor ve en zor bilimsel araştırma görevlerinde tercih edilmesi gerekiyor.

Ajanlar, Terminal-Bench Science 0.1⁠(yeni bir pencerede açılır) değerlendirmesinde kod ve terminal araçlarını kullanarak veri analizi, simülasyon çalıştırma ve model uydurma gibi adımlar içeren bilimsel araştırma iş akışlarını tamamlar.

Olgusal doğruluk

GPT‑6.1 Sol, zor istemlerde olgusal doğruluğu da artırıyor. Ekstra yüksek akıl yürütme çabasında olgusal hata oranı, GPT‑6 Sol’un %4,5’lik oranından %4,1’e düşüyor ve aynı ayarda Astra’nın %4,0’lık oranına yaklaşıyor. Üstelik görev başına maliyeti Astra’dan yaklaşık %83 daha düşük.

Bu değerlendirme, kullanıcıların önceki bir modelin hatasını bildirdiği, kimlik bilgileri kaldırılmış konuşmalarda en az bir olgusal hata içeren yanıtların oranını ölçüyor. Özellikle zor olacak şekilde seçilen bu istemler, tipik kullanımı temsil etmiyor.

Olgusal doğruluğu, kullanıcıların önceki bir modelin olgusal hatasını bildirdiği, kimlik bilgileri kaldırılmış ChatGPT konuşmaları üzerinden değerlendiriyoruz. Hataya yol açan bu konuşmalar, olgusal hataların daha nadir görüldüğü tipik kullanımı temsil etmez.

GPT‑6.1 Sol’u güvenle kullanıma sunmak

GPT‑6.1 Sol, hizalama değerlendirmelerimizde GPT‑6 Sol’a kıyasla önemli iyileşmeler göstererek GPT‑6 Astra’ya yaklaşıyor.

GPT‑6.1 Sol, sınırlamaları konusunda daha şeffaf; kullanıcı niyetine ve güvenlik kısıtlarına uyma konusunda da daha güvenilir. Zorlu değerlendirmelerde; çalışmayan arama araçları konusunda şeffaflık, açık kısıtlamalara uyma ve ajan tabanlı görevlerde izinsiz sonuçlardan kaçınma alanlarında GPT‑6 Sol’dan daha düşük hata oranları gösteriyor. GPT‑6 Astra ve GPT‑6 Sol’da olduğu gibi, otomatik bir güvenlik denetleyicisini atlatmaya yönelik herhangi bir girişim gözlemlemedik.

Aşağıdaki değerlendirmeler özellikle zorlu durumları test ediyor; tipik kullanımdaki hata oranlarını ölçmüyor.

Fiyatlandırma ve erişim

GPT‑6.1 Sol, bugünden itibaren tüm Plus, Pro, Business, Enterprise ve Edu kullanıcıları için ChatGPT Çalışma ve Codex’te kullanıma sunuluyor. Bu modeller henüz Sohbet’te kullanılamıyor. Geliştiriciler modele OpenAI API üzerinden gpt-6.1-sol adıyla da erişebilir. Standart API fiyatları, milyon girdi token’ı başına 2 $, milyon önbelleğe alınmış girdi token’ı başına 0,10 $ ve milyon çıktı token’ı başına 10 $.

Aynı zamanda, GPT‑6 Astra’nın 8 katına varan hızıyla dünyanın en hızlı en üst seviye modeli GPT‑6 Astra Ultrafast ve GPT‑6.1 Sol Ultrafast’ı da kullanıma sunuyoruz. Bu modeller API’de sunuluyor. Ayrıca aylık 500 $ karşılığında en yüksek kullanım limitlerini sunan yeni Pro abonelik seviyemizdeki kullanıcılar da modellere ChatGPT Çalışma ve Codex’te erişebiliyor. GPT‑6.1 Sol Ultrafast sayesinde geliştiriciler, daha önce GPT‑6 Astra için yaptıkları API harcamasının yaklaşık aynısıyla, 8 kata varan hızda Astra’ya yakın zekâ elde edebilir.

Yazar

OpenAI

GPT değerlendirmeleri araştırma ortamımızda veya API’miz üzerinden yapıldı. Sistem istemleri, kullanılabilir araçlar, akıl yürütme çabası gibi unsurlardaki farklılıklar nedeniyle bu ortamlardaki çıktılar, kullanıma sunulan ChatGPT’nin çıktılarından biraz farklı olabilir. Rakip modellerin değerlendirmeleri kamuya açık raporlardan alınmıştır.