OpenAI

9 Temmuz 2026

ÜrünSürüm

GPT‑5.6: Herkes için faydalı zeka

Daha az kaynakla daha fazlasını başarabilen; farklı ihtiyaçlara, bütçelere ve en zorlu işlere göre ölçeklenebilen seçenekler sunan en üst seviye modeller.

This post introduced GPT-5.6 in 2026.

Learn about OpenAI’s latest model:

Yükleniyor...

Sınırlı önizleme sürecimizin ardından GPT‑5.6 model ailesini bugün genel kullanıma sunuyoruz: yeni amiral modelimiz Sol, günlük işler için dengeli modelimiz Terra ve en uygun maliyetli modelimiz Luna.

GPT‑5.6 Sol; kodlama, bilgiye dayalı çalışmalar, siber güvenlik ve bilim alanlarında en iyi sonuçlara ulaşırken daha az token ve daha düşük tahmini maliyetle önceki ve rakip en üst seviye modelleri geride bırakarak zeka ve verimlilik için yeni bir standart belirliyor. Sonuç: Maliyet başına daha yüksek performans. Aynı bütçeyle daha fazla işi başarıyla tamamlayabilir veya benzer sonuçlara daha düşük toplam maliyetle ulaşabilirsiniz. GPT‑5.6, önünüzdeki işe göre ölçeklenir. Varsayılan olarak daha kısa sürede daha fazlasını yapar; zorlu işlerde performansı artırmak için iki seçenek sunar: "Max" daha uzun süre akıl yürütür, "Ultra" ise karmaşık görevleri daha hızlı tamamlamak için birden fazla ajanı paralel iş akışlarında koordine eder. Daha güçlü bilgisayar kullanımı ve gelişmiş tasarım değerlendirme becerileriyle GPT‑5.6 Sol, bugüne kadarki en rafine çalışma ortağımızdır; sonuçları inceleyebilir, iyileştirebilir ve kullanıma hazır hale getirebilir.

OpenAI’da misyonumuz, genel yapay zekanın tüm insanlığa fayda sağlamasını güvence altına almaktır. Bu, geliştirebildiğimiz en iyi zekayı oluşturmak ve ardından onu geniş ölçekte yararlı, güvenli ve erişilebilir hale getirmek anlamına gelir. Verimlilik hem araştırmalarımızın hem de bu misyonun merkezindedir: İlerlemeyi yalnızca bir modelin neler yapabildiğiyle değil, bir işi başarıyla tamamlamak için gereken zaman ve kaynaklarla da ölçeriz. Verimlilikteki her artış, daha güçlü zekayı daha fazla insana, daha sık ve sürdürülebilir bir maliyetle ulaştırmamıza yardımcı olur. Küçük modeller bu denklemin vazgeçilmez parçasıdır: Net tanımlı ve yüksek hacimli işlerde, görevin gerektirdiği kaliteyi daha düşük gecikme, daha yüksek işlem kapasitesi ve daha düşük maliyetle sunabilirler. Daha derin akıl yürütmenin gerektiği durumlarda ise büyük modeller kullanılmaya devam eder.

GPT‑5.6'yı her token'dan daha fazla faydalı iş çıkaracak şekilde eğittik. Artificial Analysis Kodlama Ajanı Endeksi'nde max akıl yürütme düzeyiyle Sol 80 puana ulaşıyor; böylece Fable'ın 2,8 puan üzerine çıkarken %54 daha az çıktı token'ı kullanıyor ve görev başına %57 daha az süre harcıyor. Bu avantaj, model ailesinin geneline yayılıyor: Terra, Fable'ı az farkla geride bırakıyor; Luna ise Opus 4.8'den daha iyi performans gösteriyor. Üstelik her biri bunu yaklaşık üçte bir sürede, yaklaşık yarı çıktı token'ı ile ve tahmini API maliyetinin yaklaşık beşte biriyle başarıyor.

Artificial Analysis Kodlama Ajan Endeksi: Uygulama geliştirme, terminal kullanımı ve gerçek kod tabanlarında kodlama ajanı performansını ölçen bağımsız endeks.

GPT‑5.6, bugüne kadarki en güçlü koruma tedbirlerimizle kullanıma sunuluyor. Bu tedbirler, meşru çalışmaları geniş ölçekte kısıtlamadan ısrarlı ve uyarlanabilen kötüye kullanım girişimlerine karşı dayanıklı olacak şekilde tasarlandı. Genel kullanıma sunmadan önce modelleri ve koruma tedbirlerini bugüne kadarki en kapsamlı değerlendirme sürecimizden geçirdik; insan uzmanlarla yürütülen red teaming çalışmalarını büyük ölçekli otomatik testlerle birleştirdik. Önizleme sürecinde, U.S. Center for AI Standards and Innovation (CAISI), UK AI Security Institute ve diğer güvenilir iş ortakları gibi uzman kuruluşlarla yakından çalıştık. Daha geniş kullanıma sunmadan önce savunmaları zorlu testlerden geçirdik ve koruma tedbirlerini güçlendirdik. Bu sistem; modelde yerleşik olan korumaları, gerçek zamanlı kontrolleri, izleme süreçlerini ve güven ve risk düzeyine göre ayarlanan erişim mekanizmalarını birlikte kullanır.

Modellerimiz, kendilerinden sonra gelecek modellerin geliştirilmesine giderek daha fazla katkı sağlıyor. Araştırmacılara; kod yazıp incelemekten deney yürütmeye, hataları teşhis etmekten elde edilen bulguları sonraki nesil modellere aktarmaya kadar geliştirme döngüsünün her aşamasında destek oluyorlar. 2026'nın başından bu yana araştırmacı başına haftalık başlatılan nitelikli deney sayısı yaklaşık %60 arttı. GPT‑5.6'nın kurum içi alfa sürecine girdiği dönemde buna ek olarak %25'lik bir artış daha görüldü. Bu çalışma biçimi artık OpenAI genelinde yaygınlaşmış durumda: teknik ve teknik olmayan ekiplerdeki çalışanların neredeyse tamamı Codex'i her hafta kullanıyor. GPT‑5.6'nın, dünyanın dört bir yanındaki araştırmacıların sınırları daha da ileri taşımasına yardımcı olmasını umuyoruz.

Varsayılan olarak verimli, gerektiğinde maksimum performans

GPT‑5.6 Sol, bugüne kadarki en akıllı modelimizdir. Ajan tabanlı çalışma, kodlama, bilimsel akıl yürütme ve genel yetenekleri kapsayan geniş bir model zeka ölçütü olan Artificial Analysis Zeka Endeksi'nde lider konumdadır. Aynı zamanda en güçlü kodlama modelimizdir. Karmaşık komut satırı iş akışlarını ve gerçek kod tabanlarında uzun soluklu mühendislik çalışmalarını test eden Terminal‑Bench 2.1 ve DeepSWE'de yeni en iyi sonuçlara ulaşmıştır.

GPT‑5.6; araçları koordine eden, ara sonuçları işleyen, ilerlemeyi izleyen ve iş ilerledikçe bir sonraki adımı seçen hafif programlar yazıp çalıştırabilir. Geliştiricilerin her adımı elle komut dosyasına dönüştürmesini veya her araç yanıtını yeniden modele göndermesini gerektirmek yerine, Responses API'deki Programatik Araç Çağırma büyük miktardaki ara veriyi filtreleyebilir, yalnızca önemli bilgileri tutabilir ve iş akışını süreç içinde uyarlayabilir. Böylece yoğun araç kullanımı gerektiren görevler daha az token, daha az model çağrısı ve daha az yönlendirmeyle ilerleyebilir.

Claude Fable 5, çalıştırmalar genelinde 525 veri noktasının 69'unda yanıt vermeyi reddetti. Bu veri noktalarında yedek model olarak Claude Opus 4.8'i kullanıyoruz. Veri setini yalnızca modelin yanıt vermeyi reddetmediği örneklerle sınırlasak bile GPT‑5.6 Sol, aynı maliyet düzeyinde genel olarak daha yüksek performans gösteriyor.

Hekimler de GPT‑5.6'nın yanıtlarını olumlu değerlendirdi. Sağlam bir karşılaştırma temeli oluşturmak için, ilgili uzmanlık alanlarından hekimlere sınırsız süre ve internet erişimi tanıyarak zorlu sağlık konulu konuşmaları yanıtlamalarını istedik. Ardından farklı hekimlerden, bu yanıtları ve GPT‑5.6'nın yanıtlarını beş ölçüte göre değerlendirmelerini istedik: doğruluk, iletişim kalitesi, eksiksizlik, talimatlara uyum ve sağlık kararlarına yardımcı olma. Karşılaştırmayı kolaylaştırmak için hekimler tüm yanıtları yan yana görebildi; ancak yanıtların hangi kaynaktan geldiği kendilerine gösterilmedi. Her yanıt kaynağı için, toplam 20.000 ölçüt değerlendirmesi üzerinden tüm ölçütlerde tam puan alan yanıtların oranını hesapladık. GPT‑5.6 Sol'un yanıtları, tüm ölçütlerde hekim yanıtlarından daha yüksek puan aldı. GPT‑5.6 Terra ve GPT‑5.6 Luna da buna oldukça yakın performans gösterdi.

Son olarak, en yeni modellerimiz için özellikle zorlayıcı olacak şekilde seçilen sağlık konuşmalarından oluşan bir değerlendirme setinde GPT‑5.6 Sol, GPT‑5.5'e kıyasla %50 daha az olgusal hata yaptı.

GPT‑5.6 Sol, bilimsel araştırma alanında da geniş kapsamlı kazanımlar sağlıyor. Yaşam bilimleri değerlendirmelerinde GPT‑5.6; gerçek dünya biyoloji, kimya ve yaşam bilimleri araştırma iş akışlarında GPT‑5.5'e kıyasla birden fazla ölçütte aynı anda iyileşme gösteriyor.

Araştırmacılar GPT‑5.6'yı yalnızca mevcut bilgileri anlamak için değil, yeni ve doğrulanabilir sonuçlar üretmek için de kullanıyor. Matematikçi Bartosz Naskręcki, üç yıldır üzerinde çalıştığı bir sınırı çürüten somut bir karşı örnek bulup doğrulamak için GPT‑5.6'yı kullandı; böylece uzun süredir açık olan bir araştırma sorusunu tek bir sabah içinde net bir sonuca ulaştırdı.

[Matematik videosu]

GPT‑5.6, bugüne kadarki en güçlü siber güvenlik modelimizdir. Ajanlardan gerçek dünyadaki güvenlik açıklarını çalışan istismar kodlarına dönüştürmelerini isteyen ExploitGym'de GPT‑5.6, GPT‑5.5'in en yüksek başarı oranını neredeyse ikiye katladı; iki saatlik sınır altında oran %15'ten %25'e çıktı. Karmaşık yazılımlarda kavram kanıtı üretimini test eden SEC-bench Pro'da GPT‑5.6, daha iyi gecikme süresiyle %71’e ulaştı; GPT‑5.5'in puanı %46 idi. Savunmasız koda erişimden keyfi kod çalıştırmaya kadar olan ilerlemeyi ölçen ExploitBench'te ise GPT‑5.6, benzer çıktı token bütçesiyle %74'e ulaştı; GPT‑5.5'in puanı %48 idi.

Daha fazla zaman ve bilgi işlem ayrıldığında daha iyi sonuç veren problemlerde GPT‑5.6, verimli varsayılan ayarının ötesine geçebilir. Max modu, zor kodlama, bilimsel, matematiksel ve analitik çalışmalarda modele araştırma yapmak, alternatifleri değerlendirmek, kontroller yürütmek ve yaklaşımını gözden geçirmek için daha fazla zaman tanır. Bu mod, öngörülebilir yanıt süresinden çok mümkün olan en iyi sonuca ulaşmanın önemli olduğu istekler için tasarlanmıştır ve bazı görevlerde yüksek akıl yürütme düzeyine kıyasla iki kattan fazla sürebilir.

Ultra modu, birden fazla ajanı paralel olarak koordine ederek daha da ileri gider: farklı yaklaşımları keşfeder, karmaşık işleri parçalara ayırır, ajanların birbirlerinin çıkarımlarını sınamasını sağlar ve bulguları daha güçlü bir sonuca dönüştürür. Daha fazla paralellikten yararlanan en zorlu problemler için tasarlanmıştır. Her araştırma hattının sırayla ilerlemesine gerek bırakmadan modelin kapasitesini artırır; daha düşük gecikme ve daha yüksek performans için ek token kullanır.

Tasarımda büyük bir sıçrama

GPT‑5.6, tasarım değerlendirme becerisinde belirgin bir ilerleme sunar. Daha güçlü bilgisayar kullanımı yetenekleri sayesinde yalnızca temel kodu veya içeriği üretmekle kalmaz; ortaya çıkan sonucu inceleyip iyileştirebilir. Böylece işi teslim etmeden önce görsel ve işlevsel sorunları yakalayabilir, son dokunuşları uygulayabilir. İlk test kullanıcıları, GPT‑5.6'nın ayrıntılı mockup'lara gerek duymadan üst düzey kreatif yönlendirmeleri özenli ve işlevsel arayüzlere dönüştürdüğünü; daha bilinçli estetik kararlar verdiğini ve yineleme sırasında ortaya çıkan deneyimi değerlendirebildiğini gördü. Sonuç olarak, sıradan varsayılanları düzeltmeye daha az zaman harcanır; daha tutarlı, işlevsel ve kullanıma hazır işler ortaya çıkar.

[Canva videosu]

GPT‑5.6'nın ön yüz yetenekleri, doğal dille verilen istekleri Codex ve ChatGPT içinde özenli, etkileşimli açıklamalara ve görselleştirmelere de dönüştürür.

Uçtan uca bilgi çalışmaları

GPT‑5.6, profesyonel görevlerde daha iyi sonuçlar sunar. Dokümanlarınızdaki dağınık bağlamı ve Slack, Notion, Microsoft 365 ve Google Drive gibi günlük iş akışlarınızdaki bilgileri alarak uzman düzeyinde, paylaşılabilir çıktılara dönüştürür.

GPT‑5.6’nın bilgi odaklı işlerdeki gücü, uzun soluklu profesyonel analiz, web'de gezinme, araç kullanımı ve bilgisayar kullanımı gibi alanları kapsayan değerlendirmelerde ortaya çıkıyor. GPT‑5.6 Sol, BrowseComp'ta %92,2 ve OSWorld 2.0'da %62,6 puanla yeni en iyi sonuçlara ulaşıyor, OSWorld'de Opus 4.8'i geride bırakırken %85 daha az çıktı token'ı kullanıyor. Maliyet başına performans kazanımları da GPT‑5.6 ailesinin geneline yayılıyor. Luna, tahmini API maliyetinin yarısından çok daha düşük bir maliyetle GPT‑5.5'in tepe performansına ulaşırken, Terra daha düşük maliyetle onu geride bırakıyor.

GPT‑5.6 Sol, sunumların, dokümanların ve elektronik tabloların kalitesini artırarak daha özenli ve daha doğru çıktılar üretir. Sıfırdan, özenle hazırlanmış ve tamamen düzenlenebilir sunumlar oluşturabilir; bir promptu ve kaynak materyali güçlü düzen, hiyerarşi ve tasarıma sahip tutarlı bir görsel anlatıya dönüştürebilir.

Bu iyileştirme özellikle şablonlar ve referans sunumlar izlenirken belirginleşir. GPT‑5.6, bir sunumun tasarım sistemini analiz ederek sayfa düzenleri, tipografi, aralıklar, renkler, tekrar eden içerik kalıpları ve slayt ana şablonuna gömülü kurallar gibi temel tasarım yapısının çıkarımını yapabilir. Bu örnekte, bir referans dosyaya göre sayıları güncellemesi istendiğinde GPT‑5.5 çıktısında ana slayttaki önemli bileşenler atlanıyor; GPT‑5.6 ise referans yapıya daha sadık kalıyor.

Referans dosyası
GPT-5.6 stil eşleştirmesi için girdi slaytı
GPT‑5.5 çıktısı
Stil eşleştirme için GPT-5.5 çıktı slaytı

GPT‑5.5, ana slayttaki önemli bileşenleri kaçırıyor

GPT‑5.6 çıktısı
Stil eşleştirme için GPT-5.6 çıktı slaytı

GPT‑5.6 ayrıca görsel açıdan daha rafine dokümanlar ve elektronik tablolar oluşturur. Karmaşık referans formatlarını daha doğru takip eder; bu da tekrarlanabilir bilgi yoğun işlerde önemlidir. Denklemleri ve finansal modelleri daha yüksek hassasiyetle işler; tipografi, aralık, hiyerarşi ve sayfa ya da çalışma sayfası düzeninden daha iyi yararlanır.

GPT‑5.6'yı test eden ilk müşteriler, çeşitli alanlardaki bilgi odaklı işlerin çıktılarında iyileşmeler gördü.

1 / 9
GPT‑5.6, canlı kullanıma uygun kalitede uygulamalar geliştirmeyi gerektiren uzun ve karmaşık iş akışlarında belirgin verimlilik sağlıyor. Lovable'da şu anda kullanılan modellerden biri olan GPT‑5.6, önceki modele kıyasla kullanıcılara yaklaşık %25 daha az adım ve %35-48 daha az araç çağrısıyla sonuç sağlıyor. Aynı zamanda proje başarı oranını artırıyor ve takılı kalan çalıştırmaları %15 azaltıyor. Fikir aşamasından, çalışan uygulama aşamasına geçmek isteyen herkes için bu anlamlı bir fark demek.
- Fabian Hedin, Lovable Kurucu Ortağı

Siber güvenlik ve bilim alanında çıtayı yükseltiyoruz

GPT‑5.6, bugüne kadarki en güçlü siber güvenlik modelimiz. Üstelik bu performansa çok daha az token kullanarak ulaşıyor. Savunmasız koda erişimden keyfi kod çalıştırmaya kadar olan ilerlemeyi ölçen ExploitBench2'te ise GPT‑5.6, %73,5 puan alıyor. GPT‑5.5'in puanı benzer çıktı-token bütçesiyle %47,9 idi. ExploitGym3'de, ajanlardan gerçek dünyadaki güvenlik açıklarını çalışan istismar kodlarına dönüştürmeleri isteniyor; GPT‑5.6, GPT‑5.5'in en yüksek başarı oranını neredeyse ikiye katladı; iki saatlik sınır altında oran %15,1'den %24,9'a çıktı. Karmaşık yazılımlarda pilot proje üretimini test eden SEC-Bench Pro'da GPT‑5.6, daha kısa gecikme süresiyle %71,2'ye ulaştı; GPT‑5.5'in puanı %45,8 idi. 1

GPT‑5.6; güvenli kod inceleme, yama geliştirme, tehdit modelleme ve blue teaming gibi kritik savunma görevlerini destekler. OpenAI Daybreak kapsamındaki Siber Ortam için Güvenilir Erişim programına uygun kişi ve kuruluşlar, yetkili ortamlarda doğrulanmış çalışmalar için daha hassas koruma tedbirleriyle modelin savunma becerilerinden daha kapsamlı şekilde yararlanabilir. Bu çalışmalar arasında güvenlik açıklarını önceliklendirme ve doğrulama, zararlı yazılım analizi, tespit mühendisliği ve yama doğrulaması yer alır.

Bireyler kimliklerini doğrulayabilir ve güvenilir erişim talep edebilir(yeni bir pencerede açılır), kuruluşlar ise ekipleri için başvuruda bulunabilir. Bireysel üyelerin, siber alanda en yetkin olan en üst seviye modellerimize erişimlerini sürdürmek için 1 Eylül'e kadar donanım destekli geçiş anahtarlarıyla Gelişmiş Hesap Güvenliği(yeni bir pencerede açılır) özelliğini etkinleştirmeleri gerekecek; bunu yapmayanlar varsayılan erişime dönecek. Halihazırda donanım destekli geçiş anahtarı olmayan kullanıcılar, iş ortağımız Yubico'dan avantajlı fiyatlandırma(yeni bir pencerede açılır) alabilir. Ayrıca, yüksek riskli kuruluşlara erişimi ve yüksek riskli yargı bölgelerindeki erişimi kısıtlamak için ek adımlar atıyoruz.

GPT‑5.6 Sol, bilimsel araştırma alanında da geniş kapsamlı kazanımlar sağlıyor. Yaşam bilimleri değerlendirmelerinde GPT‑5.6, gerçek dünya biyolojisi, yaşam bilimleri araştırma iş akışları ve kimya alanlarında GPT‑5.5'e kıyasla birden fazla ölçütte aynı anda iyileşme gösteriyor.

GPT‑5.6, OpenAI'da çalışmaları hızlandırıyor

GPT‑5.6, yapay zeka araştırmalarını hızlandırmak için bugüne kadar geliştirdiğimiz en güçlü modelimizdir. OpenAI araştırmacıları bu modeli geliştirme döngüsünün tamamında kullanıyor; hataların teşhis edilmesinden eğitim sistemlerinin optimize edilmesine, deneylerin yürütülmesinden sonuçların yorumlanmasına ve elde edilen öğrenimlerin sonraki modellere aktarılmasına kadar birçok aşamada modelden yararlanıyor. GPT‑5.6'nın kurum içi test döneminde bu hızlanmayı ve daha güçlü benimsemeyi şimdiden gördük: Aktif araştırmacı başına günlük ortalama çıktı token'ı, GPT‑5.5 için gözlenen en yüksek seviyenin iki katından fazlaydı.

Bu çalışma biçimi hızla standart haline geliyor. Son altı ayda, araştırma hesaplama kaynakları içinde kurum içi kodlama çıkarımlarına ayrılan pay 100 kat arttı; kurum içi ajan tabanlı token kullanımı ise yaklaşık 22 kat yükseldi. Bu benimseme metrikleri, tek başına araştırmadaki ilerlemeyi ölçmez. Ancak yapay zeka desteğinin, araştırma çalışmalarında ve satış, pazarlama, kullanıcı operasyonları, finans gibi diğer ekiplerde ne kadar hızlı yaygınlaştığını gösterir.

Bu yeteneği doğrudan ölçmek için gerçek yapay zeka araştırma görevlerine dayalı kurum içi bir değerlendirme seti geliştirdik. Bu görevler arasında araştırma sistemlerinde hata ayıklama, çekirdekleri ve eğitim reçetelerini optimize etme, makine öğrenimi deneyleri yürütme ve başka bir modeli iyileştirme yer alıyor.

Yetenekler arttıkça güvenliği de ölçeklendiriyoruz

Model yetenekleri arttıkça güvenlik altyapımızı da güçlendiriyoruz. Böylece gelişmiş zekanın geniş ölçekte faydalı kalmasını sağlarken en yüksek riskli kullanımları daha sıkı inceleyebiliyoruz. GPT‑5.6 için bugüne kadarki en güçlü güvenlik sistemimizi geliştirdik. Bu sistem, her modelin yeteneklerine göre ayarlandı ve şimdiye kadarkinden daha fazla işlem gücüyle desteklendi.

GPT‑5.6 modelleri, biyoloji ve siber güvenlik alanlarında önceki modellerimize göre daha yetenekli olsa da iki alanda da kritik eşiği aşmıyor. Siber güvenlik testlerimiz, GPT‑5.6'nın güvenliği sıkılaştırılmış hedeflere karşı uçtan uca otonom saldırıları güvenilir biçimde yürütmekten çok, güvenlik açıklarını tespit etme ve giderme konusunda daha güçlü olduğunu gösteriyor. Bu da savunma ekiplerine, zayıflıklar istismar edilmeden önce sistemleri güçlendirme fırsatı sunuyor. Biyoloji testlerimiz, GPT‑5.6'nın meşru araştırmaları destekleyebildiğini; ancak son derece tehlikeli yeni bir tehdidi oluşturmak, tasarlamak veya sentezlemek için gereken uçtan uca yeteneği sunmadığını gösteriyor.

Her iki alan da doğası gereği çift kullanımlıdır. Siber güvenlikte, bir saldırganın güvenlik açığını istismar etmesine yardımcı olabilecek yetenekler; başka bir savunma ekibinin aynı açığı bulmasına, yeniden üretmesine ve güvenilir bir düzeltme geliştirmesine de yardımcı olabilir. Bu nedenle aşırı engelleme, başlı başına bir güvenlik riski oluşturur. Bu durum, savunma ekiplerinin sistemleri test etmesini ve yamaları devreye almasını zorlaştırabilir. Kötü niyetli aktörler ise giderek daha yetenekli hale gelen açık kaynak modeller gibi başka modelleri ve yerleşik araçları kullanmaya devam edebilir. Etkili koruma tedbirleri, isteğin bağlamını ve olası sonuçlarını dikkate alır; meşru savunma çalışmalarına alan açarken ciddi zarar riski görülen durumlarda daha sıkı kontroller uygular.

GPT‑5.6'nın güvenlik tedbirleri, daha yüksek doğruluk ve yedeklilik sağlamak için katmanlı şekilde tasarlandı; yeni saldırılar ortaya çıktıkça hızla uyum sağlayacak biçimde geliştirildi. Modele kazandırılan korumalar; gerçek zamanlı kontroller, sürekli izleme ve hesap düzeyindeki yaptırım mekanizmalarıyla birlikte çalışır. Böylece belirli bir katman beklendiği gibi işlemediğinde bile sistemin güvenli kalmasına yardımcı olur. Birçok sistemde neyin engelleneceğine yalnızca sınıflandırıcı sinyalleri karar verir. Bu yaklaşım, zararı önlemek için güncellenmesi daha zor olan, daha düşük yetenekli modellere dayanır. Bizim yaklaşımımızda ise konuşmayı inceleyerek olası zarar riskini değerlendiren akıl yürütmeye dayalı bir izleme katmanı da bulunur. Bu tasarım, ciddi kötüye kullanımları engellerken savunma amaçlı çalışmalara alan açmayı hedefler. En hassas yetenekler ise Güvenilir Erişim üzerinden doğrulanmış kullanıcılara ayrılır. Bazı korumalar, model çalışırken akıl yürütme kullanır. Bu sayede güvenlikteki eksikleri, sınıflandırıcıları sıfırdan yeniden eğitmeden hızla kapatabiliriz.

Sistemi uyarlanabilir saldırılara karşı güçlendirmeye devam ederken daha temkinli bir yaklaşım izliyoruz. Önceki modellerle karşılaştırıldığında GPT‑5.6 Sol'un siber güvenlik tedbirleri, olası zararlı etkinlikleri yaklaşık 10 kat daha fazla engelliyor. Bu önlemler iyi niyetli kullanıcılar için zaman zaman ek adımlar yaratabildiğinden, ChatGPT ve Codex'te promptları daha düşük yetenekli modellerle kolayca yeniden deneme seçeneği sunuyoruz. Güçlü dayanıklılık standardımızı korurken güvenlik tedbirlerimizin iyi niyetli kullanıcılar üzerindeki etkisini azaltmaya devam edeceğiz. Bu yaklaşım, yinelemeli kullanıma sunma anlayışımızı yansıtıyor: temkinli başlamak ve gerçek dünya kullanımından öğrendiklerimizle sistemi geliştirmek.

Genel kullanıma sunmadan önce bugüne kadarki en kapsamlı güvenlik değerlendirmelerimizi yürüttük. Bu süreç kapsamlı red teaming çalışmalarını, kurum dışı uzmanlarla yapılan güçlü yetenek ve güvenlik tedbiri testlerini ve yaklaşık 700.000 NVIDIA A100 Tensor Core GPU eşdeğeri saat süren otomatik kara kutu red teaming çalışmalarını içeriyordu. Bu çalışmalar, lansman öncesinde olası zayıf noktaları sistematik şekilde incelememizi, jailbreak saldırılarını ortaya çıkarmamızı ve sistemi güçlendirmemizi sağladı.

Kusursuz güvenlik diye bir şey yok; giderek daha yetenekli hale gelen modelleri güvenli hale getirme çalışmalarımız devam ediyor. Yeni zayıflıklar ve mevcut güvenlik tedbirlerini aşan yeni jailbreak saldırıları keşfedilecek. Her yeni model nesli, saldırı ve kötüye kullanım için yeni yollar da ortaya çıkaracak. Bu gerçekliği göz önünde bulundurarak sistemlerimizi katmanlı güvenlik tedbirleri, sürekli izleme, hızlı düzeltme süreçleri ve savunma topluluğuyla iş birliği üzerine kuruyoruz. GPT‑5.6 için güvenlik(yeni bir pencerede açılır) ve biyoloji alanlarındaki mevcut hata ödül programlarımızı yeni bir hızlı düzeltme süreciyle ve bugüne kadarki en güçlü izleme çalışmamızla destekledik. Araştırmacılardan, izleme süreçlerinden ve gerçek dünyadaki kötüye kullanım örneklerinden elde edilen bulgular; yeni değerlendirmelere ve daha güçlü güvenlik tedbirlerine düzenli olarak yansıtılacak.

Güvenlik tedbirlerimiz hakkında daha fazla bilgi için güncellenmiş GPT‑5.6 sistem kartını(yeni bir pencerede açılır) inceleyebilirsiniz.

Kullanılabilirlik ve fiyatlandırma

GPT‑5.6, üç model katmanından oluşur: amiral modelimiz Sol; GPT‑5.5 ile rekabet eden performansı daha düşük maliyetle sunan Terra; en hızlı ve en uygun maliyetli modelimiz Luna. Sayı, model neslini belirtir. Sol, Terra ve Luna ise kendi takvimleriyle gelişebilen kalıcı yetenek kademeleridir.

GPT‑5.6 bugünden itibaren ChatGPT, Codex ve OpenAI API'de kullanılabilecek. Kullanıma sunma süreci şu anda dünya genelinde başladı; önümüzdeki 24 saat içinde kademeli olarak genişletilerek tam erişime ulaşacak.

  • Sohbet: Plus, Pro, Business ve Enterprise kullanıcıları, orta ve daha yüksek akıl yürütme düzeylerinde GPT‑5.6 Sol'a erişebilir. Pro ve Enterprise kullanıcıları, karmaşık görevlerde en yüksek kaliteli sonuçlar için GPT‑5.6 Sol Pro'yu da seçebilir.
  • ChatGPT Work ve Codex: Free ve Go kullanıcıları, GPT‑5.6 Terra'ya erişebilir. Plus, Pro, Business ve Enterprise kullanıcıları; GPT‑5.6 Sol, Terra ve Luna arasından seçim yapıp her model için akıl yürütme düzeyini belirleyebilir. Max, ChatGPT Work ve Codex'te GPT‑5.6 erişimi olan tüm kullanıcılar tarafından kullanılabilir ve ayarlardan etkinleştirilebilir. ChatGPT Work'te ultra; Pro ve Enterprise kullanıcılarına sunuluyor. Codex'te ise Plus ve üzeri planlarda kullanılabilir.
  • API: Geliştiriciler Sol, Terra ve Luna'ya OpenAI API üzerinden erişebilir. Responses API'deki Programatik Araç Çağırma özelliği, GPT‑5.6'nın araçları koordine eden ve ara sonuçları işleyen programları bellek içinde yazıp çalıştırmasını sağlar. Bu özellik Sıfır Veri Saklama (ZDR) ile uyumludur. İlk etapta beta olarak sunulan çok ajanlı özellik ise GPT‑5.6'nın eş zamanlı alt ajanlar çalıştırmasına ve bunların çalışmalarını tek bir istekte birleştirmesine olanak tanır.

232a — GPT‑5.6, üç model boyutu için 1 milyon token başına ücretlendirilir: Sol için girdi 5 $, çıktı 30 $; Terra için girdi 2,50 $, çıktı 15 $; Luna için girdi 1 $, çıktı 6 $'dır. GPT‑5.6 ayrıca daha öngörülebilir prompt önbelleğe alma sunar. Buna açıkça belirtilebilen iki önbellek kesme noktası(yeni bir pencerede açılır) ve en az 30 dakikalık önbellek süresi dahildir. GPT‑5.6 ve sonraki modellerde önbelleğe yazma işlemleri, modelin önbelleğe alınmamış girdi ücretinin 1,25 katı üzerinden ücretlendirilir. Önbellekten okumalarda ise önbelleğe alınmış girdiler için %90 indirim uygulanmaya devam eder.

7, 8

Profesyonel

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi;Gemini 3.5 Flash
Agents' Last Exam;%527;%504;%503;%469;%405;%452;%321;—
GDPval-AA v2;"17478 Elo";"1593 Elo";"15918 Elo";"14937 Elo";"17596 Elo";"16001 Elo";9623 Elo;"13488 Elo"
Yönetim Danışmanlığı Görevleri (Kurum İçi);%432;%372;%354;%313;%355;%316;%132;—
Big Finance Bench;%53;%51;%36;%49;—;%44;—;—
Artificial Analysis Zeka Endeksi v4.158.9 Endeksi puanı;55 Endeksi puanı;512 Endeks puanı;548 Endeks puanı;599 Endeks puanı;557 Endeks puanı;465 Endeks puanı;502 Endeks puanı

Kodlama

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos ÖnizlemesiClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Önizlemesi
Artificial Analysis Kodlama Ajan Endeksi v1.180 Endeks puanı;—;774 Endeks puanı;746 Endeks puanı;764 Endeks puanı;—;—;772 Endeks puanı;725 Endeks puanı;427 Endeks puanı
SWE-Bench Pro;%646;—;%634;%627;%594;%803;%778;%80;%692;%542
DeepSWE v1.1;%727;—;%696;%672;%67%;—;—;%697;%59;%118
Terminal-Bench 2.1;%888;%919;%874;%847;%856;%88;—;%831;%789;%707

Güvenlik

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5GPT‑5.4Claude Opus 4.8Claude Mythos 5Claude Mythos Preview
Healthbench Professional%605;%577;%557;%518;%481;%526;%66;%647

Bilgisayar kullanımı

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8;Gemini 3.1 Pro Önizlemesi
OSWorld 2.0;%626;—;%502;%456;%475;—;—;%548;—
BrowseComp;%904;%922;%875;%833;%844;%88;%879;%843;%859
BenchCAD;%706;—;%623;%631;%444;%384;%355;%273;—
BenchCAD (python aracı);%834;—;%782;%739;%558;%65;%61;%518;—

Siber güvenlik

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5;Claude Mythos Önizlemesi;Claude Opus 4.8
Capture-the-Flag (Bayrak Kapmaca) Yarışmaları;%967;—;%918;%852;%881;—;—;—
SEC-Bench Pro;%712;%743;%577;%489;%458;—;—;—
ExploitBench;%735;—;%529;%332;%479;%78;%742;%40
ExploitGym;%337;—;%232;%124;%151;—;—;—

Kendi kendini iyileştirme

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5
Kurum İçi Araştırma Hata Ayıklama Değerlendirmesi;%683;%678;%508;%50
KernelGen 1P;%611;%492;%224;%293
NanoGPT;%969;%145;%166;%265
PostTrainBench Lite;%503;%515;%296;%388
RSI Index;%579;%563;%419;%417

Çok modlu

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi
MMMU Pro (araçsız);%83;%807;%784;%812;—;—;%805
MMMU Pro (araçlı);%846;%82;%795;%832;—;—;—
gdp.pdf;%307;%247;%227;%26;%298;%225;%167

Akademik

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos Önizlemesi;Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi
GPQA Diamond;%946;%929;%923;%936;%941;%946;%926;%92;%943
FrontierMath Tier 1-3 (v2);%89;%849;%786;%853;—;—;%87;%80;%596
FrontierMath Tier 4 (v2);%83;%683;%585;%725;—;—;%878;%561;—

Araç kullanımı

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5;Claude Mythos Önizlemesi;Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi;Gemini 3.5 Flash
AutomationBench;%181;%152;%149;%129;—;—;%174;%155;—;%145
Toolathlon;%58;%531;%534;%556;%617;%611;%617;%599;%488;—

Uzun bağlam

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5;Claude Mythos Önizlemesi;Claude Opus 4.8
OpenAI MRCR v2 8-needle 256.000-512.000;%915;%896;%413;%815;—;—;—
OpenAI MRCR v2 8-needle 512.000-1 milyon;%738;%725;%413;%74;—;—;—
GraphWalks BFS 256.000 f1;%907;%769;%813;%737;%911;%857;%859
GraphWalks BFS 1 milyon f1;%771;%712;%512;%454;%794;%743;%681

Soyut akıl yürütme

DeğerlendirmeGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Opus 4.8Gemini 3.1 Pro Önizlemesi
ARC-AGI-3⁷;%778;%08;%018;%043;%15;%042

Yazar

OpenAI

Dipnotlar

  1. 1

    Siber yetenekler, koruma önlemleri azaltılarak değerlendirilir. Kullanıcılar, savunmaya yönelik siber güvenlik yeteneklerine daha geniş erişim için OpenAI Daybreak kapsamındaki Siber Ortam için Güvenilir Erişim programına katılabilir.

  2. 2

    Tüm modeller, 5 seed ve akıl yürütme sürekliliği kullanılarak ExploitBench API düzeneği ile değerlendirilmiştir.

  3. 3

    ExploitGym'i, genel kullanıma açık API'mizden daha hızlı yanıt üreten alfa API'miz üzerinde çalıştırdık ve ardından genel kullanıma açık API'mizle eşleşecek şekilde yeniden ölçeklendirdik. Gecikme sürelerini herkese açık API'miz için beklenen hızlara yeniden ölçeklendirdiğimizde, değerlendirme çalıştırmasında zaman sınırlarına doğru şekilde uyulmuş olmasına rağmen, bu durum bazı tahmini gecikme sürelerinin iki saatlik ve altı saatlik zaman sınırlarını aşmasına neden oluyor. Zamana duyarlı işler için daha yüksek hız istiyorsanız API'de öncelikli işlem⁠ ve Codex'te hızlı mod⁠ sunuyoruz.

  4. 4

    Modellerimizin canlı kullanım ortamındaki davranışlarını inceleyip offline simülasyon yaparak gecikme ve API maliyetini tahmin ediyoruz. Bu tahminler, araç çağrısı ayrıntılarını, örneklenen token'ları ve girdi token'larını dikkate alır. Gerçek dünyadaki sonuçlar önemli ölçüde değişebilir ve simülasyonumuzda yakalanmayan birçok etkene bağlıdır. Gecikmeyi yüksek API hızlarında, maliyeti ise standart API fiyatlandırması üzerinden simüle ediyoruz.

  5. 5

    Çıktı token'ları, gecikme süresi veya maliyet bilgileri bildirilmeyen modeller, yatay kesikli çizgiler olarak gösterilir.

  6. 6

    Çoklu ajanlarda gecikme süresi, kök ajandan türetilir; çıktı token'ı ve API maliyeti toplamları ise tüm token'ları kapsar. Ultra, 4 ajan ile çalıştırılır.

  7. 7

    Puanları, HealthBench Professional makalesinde açıklanan resmi puanlama yöntemiyle hesaplıyoruz. Bu nedenle sonuçlar, Anthropic sistem kartlarında bildirilen sonuçlarla karşılaştırılamaz.

  8. 8

    Opus 4.8 için ARC-AGI-3, max akıl yürütme düzeyinde değil, high akıl yürütme düzeyinde çalıştırıldı; çünkü yayınlanmış tek ARC-AGI-3 sonucu buydu.