This post introduced GPT-5.6 in 2026.
Sınırlı önizleme sürecimizin ardından GPT‑5.6 model ailesini bugün genel kullanıma sunuyoruz: yeni amiral modelimiz Sol, günlük işler için dengeli modelimiz Terra ve en uygun maliyetli modelimiz Luna.
GPT‑5.6 Sol; kodlama, bilgiye dayalı çalışmalar, siber güvenlik ve bilim alanlarında en iyi sonuçlara ulaşırken daha az token ve daha düşük tahmini maliyetle önceki ve rakip en üst seviye modelleri geride bırakarak zeka ve verimlilik için yeni bir standart belirliyor. Sonuç: Maliyet başına daha yüksek performans. Aynı bütçeyle daha fazla işi başarıyla tamamlayabilir veya benzer sonuçlara daha düşük toplam maliyetle ulaşabilirsiniz. GPT‑5.6, önünüzdeki işe göre ölçeklenir. Varsayılan olarak daha kısa sürede daha fazlasını yapar; zorlu işlerde performansı artırmak için iki seçenek sunar: "Max" daha uzun süre akıl yürütür, "Ultra" ise karmaşık görevleri daha hızlı tamamlamak için birden fazla ajanı paralel iş akışlarında koordine eder. Daha güçlü bilgisayar kullanımı ve gelişmiş tasarım değerlendirme becerileriyle GPT‑5.6 Sol, bugüne kadarki en rafine çalışma ortağımızdır; sonuçları inceleyebilir, iyileştirebilir ve kullanıma hazır hale getirebilir.
OpenAI’da misyonumuz, genel yapay zekanın tüm insanlığa fayda sağlamasını güvence altına almaktır. Bu, geliştirebildiğimiz en iyi zekayı oluşturmak ve ardından onu geniş ölçekte yararlı, güvenli ve erişilebilir hale getirmek anlamına gelir. Verimlilik hem araştırmalarımızın hem de bu misyonun merkezindedir: İlerlemeyi yalnızca bir modelin neler yapabildiğiyle değil, bir işi başarıyla tamamlamak için gereken zaman ve kaynaklarla da ölçeriz. Verimlilikteki her artış, daha güçlü zekayı daha fazla insana, daha sık ve sürdürülebilir bir maliyetle ulaştırmamıza yardımcı olur. Küçük modeller bu denklemin vazgeçilmez parçasıdır: Net tanımlı ve yüksek hacimli işlerde, görevin gerektirdiği kaliteyi daha düşük gecikme, daha yüksek işlem kapasitesi ve daha düşük maliyetle sunabilirler. Daha derin akıl yürütmenin gerektiği durumlarda ise büyük modeller kullanılmaya devam eder.
GPT‑5.6'yı her token'dan daha fazla faydalı iş çıkaracak şekilde eğittik. Artificial Analysis Kodlama Ajanı Endeksi'nde max akıl yürütme düzeyiyle Sol 80 puana ulaşıyor; böylece Fable'ın 2,8 puan üzerine çıkarken %54 daha az çıktı token'ı kullanıyor ve görev başına %57 daha az süre harcıyor. Bu avantaj, model ailesinin geneline yayılıyor: Terra, Fable'ı az farkla geride bırakıyor; Luna ise Opus 4.8'den daha iyi performans gösteriyor. Üstelik her biri bunu yaklaşık üçte bir sürede, yaklaşık yarı çıktı token'ı ile ve tahmini API maliyetinin yaklaşık beşte biriyle başarıyor.
Artificial Analysis Kodlama Ajan Endeksi: Uygulama geliştirme, terminal kullanımı ve gerçek kod tabanlarında kodlama ajanı performansını ölçen bağımsız endeks.
GPT‑5.6, bugüne kadarki en güçlü koruma tedbirlerimizle kullanıma sunuluyor. Bu tedbirler, meşru çalışmaları geniş ölçekte kısıtlamadan ısrarlı ve uyarlanabilen kötüye kullanım girişimlerine karşı dayanıklı olacak şekilde tasarlandı. Genel kullanıma sunmadan önce modelleri ve koruma tedbirlerini bugüne kadarki en kapsamlı değerlendirme sürecimizden geçirdik; insan uzmanlarla yürütülen red teaming çalışmalarını büyük ölçekli otomatik testlerle birleştirdik. Önizleme sürecinde, U.S. Center for AI Standards and Innovation (CAISI), UK AI Security Institute ve diğer güvenilir iş ortakları gibi uzman kuruluşlarla yakından çalıştık. Daha geniş kullanıma sunmadan önce savunmaları zorlu testlerden geçirdik ve koruma tedbirlerini güçlendirdik. Bu sistem; modelde yerleşik olan korumaları, gerçek zamanlı kontrolleri, izleme süreçlerini ve güven ve risk düzeyine göre ayarlanan erişim mekanizmalarını birlikte kullanır.
Modellerimiz, kendilerinden sonra gelecek modellerin geliştirilmesine giderek daha fazla katkı sağlıyor. Araştırmacılara; kod yazıp incelemekten deney yürütmeye, hataları teşhis etmekten elde edilen bulguları sonraki nesil modellere aktarmaya kadar geliştirme döngüsünün her aşamasında destek oluyorlar. 2026'nın başından bu yana araştırmacı başına haftalık başlatılan nitelikli deney sayısı yaklaşık %60 arttı. GPT‑5.6'nın kurum içi alfa sürecine girdiği dönemde buna ek olarak %25'lik bir artış daha görüldü. Bu çalışma biçimi artık OpenAI genelinde yaygınlaşmış durumda: teknik ve teknik olmayan ekiplerdeki çalışanların neredeyse tamamı Codex'i her hafta kullanıyor. GPT‑5.6'nın, dünyanın dört bir yanındaki araştırmacıların sınırları daha da ileri taşımasına yardımcı olmasını umuyoruz.
GPT‑5.6 Sol, bugüne kadarki en akıllı modelimizdir. Ajan tabanlı çalışma, kodlama, bilimsel akıl yürütme ve genel yetenekleri kapsayan geniş bir model zeka ölçütü olan Artificial Analysis Zeka Endeksi'nde lider konumdadır. Aynı zamanda en güçlü kodlama modelimizdir. Karmaşık komut satırı iş akışlarını ve gerçek kod tabanlarında uzun soluklu mühendislik çalışmalarını test eden Terminal‑Bench 2.1 ve DeepSWE'de yeni en iyi sonuçlara ulaşmıştır.
GPT‑5.6; araçları koordine eden, ara sonuçları işleyen, ilerlemeyi izleyen ve iş ilerledikçe bir sonraki adımı seçen hafif programlar yazıp çalıştırabilir. Geliştiricilerin her adımı elle komut dosyasına dönüştürmesini veya her araç yanıtını yeniden modele göndermesini gerektirmek yerine, Responses API'deki Programatik Araç Çağırma büyük miktardaki ara veriyi filtreleyebilir, yalnızca önemli bilgileri tutabilir ve iş akışını süreç içinde uyarlayabilir. Böylece yoğun araç kullanımı gerektiren görevler daha az token, daha az model çağrısı ve daha az yönlendirmeyle ilerleyebilir.
Claude Fable 5, çalıştırmalar genelinde 525 veri noktasının 69'unda yanıt vermeyi reddetti. Bu veri noktalarında yedek model olarak Claude Opus 4.8'i kullanıyoruz. Veri setini yalnızca modelin yanıt vermeyi reddetmediği örneklerle sınırlasak bile GPT‑5.6 Sol, aynı maliyet düzeyinde genel olarak daha yüksek performans gösteriyor.
Hekimler de GPT‑5.6'nın yanıtlarını olumlu değerlendirdi. Sağlam bir karşılaştırma temeli oluşturmak için, ilgili uzmanlık alanlarından hekimlere sınırsız süre ve internet erişimi tanıyarak zorlu sağlık konulu konuşmaları yanıtlamalarını istedik. Ardından farklı hekimlerden, bu yanıtları ve GPT‑5.6'nın yanıtlarını beş ölçüte göre değerlendirmelerini istedik: doğruluk, iletişim kalitesi, eksiksizlik, talimatlara uyum ve sağlık kararlarına yardımcı olma. Karşılaştırmayı kolaylaştırmak için hekimler tüm yanıtları yan yana görebildi; ancak yanıtların hangi kaynaktan geldiği kendilerine gösterilmedi. Her yanıt kaynağı için, toplam 20.000 ölçüt değerlendirmesi üzerinden tüm ölçütlerde tam puan alan yanıtların oranını hesapladık. GPT‑5.6 Sol'un yanıtları, tüm ölçütlerde hekim yanıtlarından daha yüksek puan aldı. GPT‑5.6 Terra ve GPT‑5.6 Luna da buna oldukça yakın performans gösterdi.
Son olarak, en yeni modellerimiz için özellikle zorlayıcı olacak şekilde seçilen sağlık konuşmalarından oluşan bir değerlendirme setinde GPT‑5.6 Sol, GPT‑5.5'e kıyasla %50 daha az olgusal hata yaptı.
GPT‑5.6 Sol, bilimsel araştırma alanında da geniş kapsamlı kazanımlar sağlıyor. Yaşam bilimleri değerlendirmelerinde GPT‑5.6; gerçek dünya biyoloji, kimya ve yaşam bilimleri araştırma iş akışlarında GPT‑5.5'e kıyasla birden fazla ölçütte aynı anda iyileşme gösteriyor.
Araştırmacılar GPT‑5.6'yı yalnızca mevcut bilgileri anlamak için değil, yeni ve doğrulanabilir sonuçlar üretmek için de kullanıyor. Matematikçi Bartosz Naskręcki, üç yıldır üzerinde çalıştığı bir sınırı çürüten somut bir karşı örnek bulup doğrulamak için GPT‑5.6'yı kullandı; böylece uzun süredir açık olan bir araştırma sorusunu tek bir sabah içinde net bir sonuca ulaştırdı.
[Matematik videosu]
GPT‑5.6, bugüne kadarki en güçlü siber güvenlik modelimizdir. Ajanlardan gerçek dünyadaki güvenlik açıklarını çalışan istismar kodlarına dönüştürmelerini isteyen ExploitGym'de GPT‑5.6, GPT‑5.5'in en yüksek başarı oranını neredeyse ikiye katladı; iki saatlik sınır altında oran %15'ten %25'e çıktı. Karmaşık yazılımlarda kavram kanıtı üretimini test eden SEC-bench Pro'da GPT‑5.6, daha iyi gecikme süresiyle %71’e ulaştı; GPT‑5.5'in puanı %46 idi. Savunmasız koda erişimden keyfi kod çalıştırmaya kadar olan ilerlemeyi ölçen ExploitBench'te ise GPT‑5.6, benzer çıktı token bütçesiyle %74'e ulaştı; GPT‑5.5'in puanı %48 idi.
Daha fazla zaman ve bilgi işlem ayrıldığında daha iyi sonuç veren problemlerde GPT‑5.6, verimli varsayılan ayarının ötesine geçebilir. Max modu, zor kodlama, bilimsel, matematiksel ve analitik çalışmalarda modele araştırma yapmak, alternatifleri değerlendirmek, kontroller yürütmek ve yaklaşımını gözden geçirmek için daha fazla zaman tanır. Bu mod, öngörülebilir yanıt süresinden çok mümkün olan en iyi sonuca ulaşmanın önemli olduğu istekler için tasarlanmıştır ve bazı görevlerde yüksek akıl yürütme düzeyine kıyasla iki kattan fazla sürebilir.
Ultra modu, birden fazla ajanı paralel olarak koordine ederek daha da ileri gider: farklı yaklaşımları keşfeder, karmaşık işleri parçalara ayırır, ajanların birbirlerinin çıkarımlarını sınamasını sağlar ve bulguları daha güçlü bir sonuca dönüştürür. Daha fazla paralellikten yararlanan en zorlu problemler için tasarlanmıştır. Her araştırma hattının sırayla ilerlemesine gerek bırakmadan modelin kapasitesini artırır; daha düşük gecikme ve daha yüksek performans için ek token kullanır.
GPT‑5.6, tasarım değerlendirme becerisinde belirgin bir ilerleme sunar. Daha güçlü bilgisayar kullanımı yetenekleri sayesinde yalnızca temel kodu veya içeriği üretmekle kalmaz; ortaya çıkan sonucu inceleyip iyileştirebilir. Böylece işi teslim etmeden önce görsel ve işlevsel sorunları yakalayabilir, son dokunuşları uygulayabilir. İlk test kullanıcıları, GPT‑5.6'nın ayrıntılı mockup'lara gerek duymadan üst düzey kreatif yönlendirmeleri özenli ve işlevsel arayüzlere dönüştürdüğünü; daha bilinçli estetik kararlar verdiğini ve yineleme sırasında ortaya çıkan deneyimi değerlendirebildiğini gördü. Sonuç olarak, sıradan varsayılanları düzeltmeye daha az zaman harcanır; daha tutarlı, işlevsel ve kullanıma hazır işler ortaya çıkar.
[Canva videosu]
GPT‑5.6'nın ön yüz yetenekleri, doğal dille verilen istekleri Codex ve ChatGPT içinde özenli, etkileşimli açıklamalara ve görselleştirmelere de dönüştürür.
GPT‑5.6, profesyonel görevlerde daha iyi sonuçlar sunar. Dokümanlarınızdaki dağınık bağlamı ve Slack, Notion, Microsoft 365 ve Google Drive gibi günlük iş akışlarınızdaki bilgileri alarak uzman düzeyinde, paylaşılabilir çıktılara dönüştürür.
GPT‑5.6’nın bilgi odaklı işlerdeki gücü, uzun soluklu profesyonel analiz, web'de gezinme, araç kullanımı ve bilgisayar kullanımı gibi alanları kapsayan değerlendirmelerde ortaya çıkıyor. GPT‑5.6 Sol, BrowseComp'ta %92,2 ve OSWorld 2.0'da %62,6 puanla yeni en iyi sonuçlara ulaşıyor, OSWorld'de Opus 4.8'i geride bırakırken %85 daha az çıktı token'ı kullanıyor. Maliyet başına performans kazanımları da GPT‑5.6 ailesinin geneline yayılıyor. Luna, tahmini API maliyetinin yarısından çok daha düşük bir maliyetle GPT‑5.5'in tepe performansına ulaşırken, Terra daha düşük maliyetle onu geride bırakıyor.
GPT‑5.6 Sol, sunumların, dokümanların ve elektronik tabloların kalitesini artırarak daha özenli ve daha doğru çıktılar üretir. Sıfırdan, özenle hazırlanmış ve tamamen düzenlenebilir sunumlar oluşturabilir; bir promptu ve kaynak materyali güçlü düzen, hiyerarşi ve tasarıma sahip tutarlı bir görsel anlatıya dönüştürebilir.
Bu iyileştirme özellikle şablonlar ve referans sunumlar izlenirken belirginleşir. GPT‑5.6, bir sunumun tasarım sistemini analiz ederek sayfa düzenleri, tipografi, aralıklar, renkler, tekrar eden içerik kalıpları ve slayt ana şablonuna gömülü kurallar gibi temel tasarım yapısının çıkarımını yapabilir. Bu örnekte, bir referans dosyaya göre sayıları güncellemesi istendiğinde GPT‑5.5 çıktısında ana slayttaki önemli bileşenler atlanıyor; GPT‑5.6 ise referans yapıya daha sadık kalıyor.
Referans dosyası

GPT‑5.5 çıktısı

GPT‑5.5, ana slayttaki önemli bileşenleri kaçırıyor
GPT‑5.6 çıktısı

GPT‑5.6 ayrıca görsel açıdan daha rafine dokümanlar ve elektronik tablolar oluşturur. Karmaşık referans formatlarını daha doğru takip eder; bu da tekrarlanabilir bilgi yoğun işlerde önemlidir. Denklemleri ve finansal modelleri daha yüksek hassasiyetle işler; tipografi, aralık, hiyerarşi ve sayfa ya da çalışma sayfası düzeninden daha iyi yararlanır.
GPT‑5.6'yı test eden ilk müşteriler, çeşitli alanlardaki bilgi odaklı işlerin çıktılarında iyileşmeler gördü.
GPT‑5.6, bugüne kadarki en güçlü siber güvenlik modelimiz. Üstelik bu performansa çok daha az token kullanarak ulaşıyor. Savunmasız koda erişimden keyfi kod çalıştırmaya kadar olan ilerlemeyi ölçen ExploitBench2'te ise GPT‑5.6, %73,5 puan alıyor. GPT‑5.5'in puanı benzer çıktı-token bütçesiyle %47,9 idi. ExploitGym3'de, ajanlardan gerçek dünyadaki güvenlik açıklarını çalışan istismar kodlarına dönüştürmeleri isteniyor; GPT‑5.6, GPT‑5.5'in en yüksek başarı oranını neredeyse ikiye katladı; iki saatlik sınır altında oran %15,1'den %24,9'a çıktı. Karmaşık yazılımlarda pilot proje üretimini test eden SEC-Bench Pro'da GPT‑5.6, daha kısa gecikme süresiyle %71,2'ye ulaştı; GPT‑5.5'in puanı %45,8 idi. 1
GPT‑5.6; güvenli kod inceleme, yama geliştirme, tehdit modelleme ve blue teaming gibi kritik savunma görevlerini destekler. OpenAI Daybreak kapsamındaki Siber Ortam için Güvenilir Erişim programına uygun kişi ve kuruluşlar, yetkili ortamlarda doğrulanmış çalışmalar için daha hassas koruma tedbirleriyle modelin savunma becerilerinden daha kapsamlı şekilde yararlanabilir. Bu çalışmalar arasında güvenlik açıklarını önceliklendirme ve doğrulama, zararlı yazılım analizi, tespit mühendisliği ve yama doğrulaması yer alır.
Bireyler kimliklerini doğrulayabilir ve güvenilir erişim talep edebilir(yeni bir pencerede açılır), kuruluşlar ise ekipleri için başvuruda bulunabilir. Bireysel üyelerin, siber alanda en yetkin olan en üst seviye modellerimize erişimlerini sürdürmek için 1 Eylül'e kadar donanım destekli geçiş anahtarlarıyla Gelişmiş Hesap Güvenliği(yeni bir pencerede açılır) özelliğini etkinleştirmeleri gerekecek; bunu yapmayanlar varsayılan erişime dönecek. Halihazırda donanım destekli geçiş anahtarı olmayan kullanıcılar, iş ortağımız Yubico'dan avantajlı fiyatlandırma(yeni bir pencerede açılır) alabilir. Ayrıca, yüksek riskli kuruluşlara erişimi ve yüksek riskli yargı bölgelerindeki erişimi kısıtlamak için ek adımlar atıyoruz.
GPT‑5.6 Sol, bilimsel araştırma alanında da geniş kapsamlı kazanımlar sağlıyor. Yaşam bilimleri değerlendirmelerinde GPT‑5.6, gerçek dünya biyolojisi, yaşam bilimleri araştırma iş akışları ve kimya alanlarında GPT‑5.5'e kıyasla birden fazla ölçütte aynı anda iyileşme gösteriyor.
GPT‑5.6, yapay zeka araştırmalarını hızlandırmak için bugüne kadar geliştirdiğimiz en güçlü modelimizdir. OpenAI araştırmacıları bu modeli geliştirme döngüsünün tamamında kullanıyor; hataların teşhis edilmesinden eğitim sistemlerinin optimize edilmesine, deneylerin yürütülmesinden sonuçların yorumlanmasına ve elde edilen öğrenimlerin sonraki modellere aktarılmasına kadar birçok aşamada modelden yararlanıyor. GPT‑5.6'nın kurum içi test döneminde bu hızlanmayı ve daha güçlü benimsemeyi şimdiden gördük: Aktif araştırmacı başına günlük ortalama çıktı token'ı, GPT‑5.5 için gözlenen en yüksek seviyenin iki katından fazlaydı.
Bu çalışma biçimi hızla standart haline geliyor. Son altı ayda, araştırma hesaplama kaynakları içinde kurum içi kodlama çıkarımlarına ayrılan pay 100 kat arttı; kurum içi ajan tabanlı token kullanımı ise yaklaşık 22 kat yükseldi. Bu benimseme metrikleri, tek başına araştırmadaki ilerlemeyi ölçmez. Ancak yapay zeka desteğinin, araştırma çalışmalarında ve satış, pazarlama, kullanıcı operasyonları, finans gibi diğer ekiplerde ne kadar hızlı yaygınlaştığını gösterir.
Bu yeteneği doğrudan ölçmek için gerçek yapay zeka araştırma görevlerine dayalı kurum içi bir değerlendirme seti geliştirdik. Bu görevler arasında araştırma sistemlerinde hata ayıklama, çekirdekleri ve eğitim reçetelerini optimize etme, makine öğrenimi deneyleri yürütme ve başka bir modeli iyileştirme yer alıyor.
Model yetenekleri arttıkça güvenlik altyapımızı da güçlendiriyoruz. Böylece gelişmiş zekanın geniş ölçekte faydalı kalmasını sağlarken en yüksek riskli kullanımları daha sıkı inceleyebiliyoruz. GPT‑5.6 için bugüne kadarki en güçlü güvenlik sistemimizi geliştirdik. Bu sistem, her modelin yeteneklerine göre ayarlandı ve şimdiye kadarkinden daha fazla işlem gücüyle desteklendi.
GPT‑5.6 modelleri, biyoloji ve siber güvenlik alanlarında önceki modellerimize göre daha yetenekli olsa da iki alanda da kritik eşiği aşmıyor. Siber güvenlik testlerimiz, GPT‑5.6'nın güvenliği sıkılaştırılmış hedeflere karşı uçtan uca otonom saldırıları güvenilir biçimde yürütmekten çok, güvenlik açıklarını tespit etme ve giderme konusunda daha güçlü olduğunu gösteriyor. Bu da savunma ekiplerine, zayıflıklar istismar edilmeden önce sistemleri güçlendirme fırsatı sunuyor. Biyoloji testlerimiz, GPT‑5.6'nın meşru araştırmaları destekleyebildiğini; ancak son derece tehlikeli yeni bir tehdidi oluşturmak, tasarlamak veya sentezlemek için gereken uçtan uca yeteneği sunmadığını gösteriyor.
Her iki alan da doğası gereği çift kullanımlıdır. Siber güvenlikte, bir saldırganın güvenlik açığını istismar etmesine yardımcı olabilecek yetenekler; başka bir savunma ekibinin aynı açığı bulmasına, yeniden üretmesine ve güvenilir bir düzeltme geliştirmesine de yardımcı olabilir. Bu nedenle aşırı engelleme, başlı başına bir güvenlik riski oluşturur. Bu durum, savunma ekiplerinin sistemleri test etmesini ve yamaları devreye almasını zorlaştırabilir. Kötü niyetli aktörler ise giderek daha yetenekli hale gelen açık kaynak modeller gibi başka modelleri ve yerleşik araçları kullanmaya devam edebilir. Etkili koruma tedbirleri, isteğin bağlamını ve olası sonuçlarını dikkate alır; meşru savunma çalışmalarına alan açarken ciddi zarar riski görülen durumlarda daha sıkı kontroller uygular.
GPT‑5.6'nın güvenlik tedbirleri, daha yüksek doğruluk ve yedeklilik sağlamak için katmanlı şekilde tasarlandı; yeni saldırılar ortaya çıktıkça hızla uyum sağlayacak biçimde geliştirildi. Modele kazandırılan korumalar; gerçek zamanlı kontroller, sürekli izleme ve hesap düzeyindeki yaptırım mekanizmalarıyla birlikte çalışır. Böylece belirli bir katman beklendiği gibi işlemediğinde bile sistemin güvenli kalmasına yardımcı olur. Birçok sistemde neyin engelleneceğine yalnızca sınıflandırıcı sinyalleri karar verir. Bu yaklaşım, zararı önlemek için güncellenmesi daha zor olan, daha düşük yetenekli modellere dayanır. Bizim yaklaşımımızda ise konuşmayı inceleyerek olası zarar riskini değerlendiren akıl yürütmeye dayalı bir izleme katmanı da bulunur. Bu tasarım, ciddi kötüye kullanımları engellerken savunma amaçlı çalışmalara alan açmayı hedefler. En hassas yetenekler ise Güvenilir Erişim üzerinden doğrulanmış kullanıcılara ayrılır. Bazı korumalar, model çalışırken akıl yürütme kullanır. Bu sayede güvenlikteki eksikleri, sınıflandırıcıları sıfırdan yeniden eğitmeden hızla kapatabiliriz.
Sistemi uyarlanabilir saldırılara karşı güçlendirmeye devam ederken daha temkinli bir yaklaşım izliyoruz. Önceki modellerle karşılaştırıldığında GPT‑5.6 Sol'un siber güvenlik tedbirleri, olası zararlı etkinlikleri yaklaşık 10 kat daha fazla engelliyor. Bu önlemler iyi niyetli kullanıcılar için zaman zaman ek adımlar yaratabildiğinden, ChatGPT ve Codex'te promptları daha düşük yetenekli modellerle kolayca yeniden deneme seçeneği sunuyoruz. Güçlü dayanıklılık standardımızı korurken güvenlik tedbirlerimizin iyi niyetli kullanıcılar üzerindeki etkisini azaltmaya devam edeceğiz. Bu yaklaşım, yinelemeli kullanıma sunma anlayışımızı yansıtıyor: temkinli başlamak ve gerçek dünya kullanımından öğrendiklerimizle sistemi geliştirmek.
Genel kullanıma sunmadan önce bugüne kadarki en kapsamlı güvenlik değerlendirmelerimizi yürüttük. Bu süreç kapsamlı red teaming çalışmalarını, kurum dışı uzmanlarla yapılan güçlü yetenek ve güvenlik tedbiri testlerini ve yaklaşık 700.000 NVIDIA A100 Tensor Core GPU eşdeğeri saat süren otomatik kara kutu red teaming çalışmalarını içeriyordu. Bu çalışmalar, lansman öncesinde olası zayıf noktaları sistematik şekilde incelememizi, jailbreak saldırılarını ortaya çıkarmamızı ve sistemi güçlendirmemizi sağladı.
Kusursuz güvenlik diye bir şey yok; giderek daha yetenekli hale gelen modelleri güvenli hale getirme çalışmalarımız devam ediyor. Yeni zayıflıklar ve mevcut güvenlik tedbirlerini aşan yeni jailbreak saldırıları keşfedilecek. Her yeni model nesli, saldırı ve kötüye kullanım için yeni yollar da ortaya çıkaracak. Bu gerçekliği göz önünde bulundurarak sistemlerimizi katmanlı güvenlik tedbirleri, sürekli izleme, hızlı düzeltme süreçleri ve savunma topluluğuyla iş birliği üzerine kuruyoruz. GPT‑5.6 için güvenlik(yeni bir pencerede açılır) ve biyoloji alanlarındaki mevcut hata ödül programlarımızı yeni bir hızlı düzeltme süreciyle ve bugüne kadarki en güçlü izleme çalışmamızla destekledik. Araştırmacılardan, izleme süreçlerinden ve gerçek dünyadaki kötüye kullanım örneklerinden elde edilen bulgular; yeni değerlendirmelere ve daha güçlü güvenlik tedbirlerine düzenli olarak yansıtılacak.
Güvenlik tedbirlerimiz hakkında daha fazla bilgi için güncellenmiş GPT‑5.6 sistem kartını(yeni bir pencerede açılır) inceleyebilirsiniz.
GPT‑5.6, üç model katmanından oluşur: amiral modelimiz Sol; GPT‑5.5 ile rekabet eden performansı daha düşük maliyetle sunan Terra; en hızlı ve en uygun maliyetli modelimiz Luna. Sayı, model neslini belirtir. Sol, Terra ve Luna ise kendi takvimleriyle gelişebilen kalıcı yetenek kademeleridir.
GPT‑5.6 bugünden itibaren ChatGPT, Codex ve OpenAI API'de kullanılabilecek. Kullanıma sunma süreci şu anda dünya genelinde başladı; önümüzdeki 24 saat içinde kademeli olarak genişletilerek tam erişime ulaşacak.
- Sohbet: Plus, Pro, Business ve Enterprise kullanıcıları, orta ve daha yüksek akıl yürütme düzeylerinde GPT‑5.6 Sol'a erişebilir. Pro ve Enterprise kullanıcıları, karmaşık görevlerde en yüksek kaliteli sonuçlar için GPT‑5.6 Sol Pro'yu da seçebilir.
- ChatGPT Work ve Codex: Free ve Go kullanıcıları, GPT‑5.6 Terra'ya erişebilir. Plus, Pro, Business ve Enterprise kullanıcıları; GPT‑5.6 Sol, Terra ve Luna arasından seçim yapıp her model için akıl yürütme düzeyini belirleyebilir.
Max, ChatGPT Work ve Codex'te GPT‑5.6 erişimi olan tüm kullanıcılar tarafından kullanılabilir ve ayarlardan etkinleştirilebilir. ChatGPT Work'teultra; Pro ve Enterprise kullanıcılarına sunuluyor. Codex'te ise Plus ve üzeri planlarda kullanılabilir. - API: Geliştiriciler Sol, Terra ve Luna'ya OpenAI API üzerinden erişebilir. Responses API'deki Programatik Araç Çağırma özelliği, GPT‑5.6'nın araçları koordine eden ve ara sonuçları işleyen programları bellek içinde yazıp çalıştırmasını sağlar. Bu özellik Sıfır Veri Saklama (ZDR) ile uyumludur. İlk etapta beta olarak sunulan çok ajanlı özellik ise GPT‑5.6'nın eş zamanlı alt ajanlar çalıştırmasına ve bunların çalışmalarını tek bir istekte birleştirmesine olanak tanır.
232a — GPT‑5.6, üç model boyutu için 1 milyon token başına ücretlendirilir: Sol için girdi 5 $, çıktı 30 $; Terra için girdi 2,50 $, çıktı 15 $; Luna için girdi 1 $, çıktı 6 $'dır. GPT‑5.6 ayrıca daha öngörülebilir prompt önbelleğe alma sunar. Buna açıkça belirtilebilen iki önbellek kesme noktası(yeni bir pencerede açılır) ve en az 30 dakikalık önbellek süresi dahildir. GPT‑5.6 ve sonraki modellerde önbelleğe yazma işlemleri, modelin önbelleğe alınmamış girdi ücretinin 1,25 katı üzerinden ücretlendirilir. Önbellekten okumalarda ise önbelleğe alınmış girdiler için %90 indirim uygulanmaya devam eder.
Profesyonel
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi;Gemini 3.5 Flash | ||
| Agents' Last Exam;%52 | 7;%50 | 4;%50 | 3;%46 | 9;%40 | 5;%45 | 2;%32 | 1;— |
| GDPval-AA v2;"1747 | 8 Elo";"1593 Elo";"1591 | 8 Elo";"1493 | 7 Elo";"1759 | 6 Elo";"1600 | 1 Elo";962 | 3 Elo;"1348 | 8 Elo" |
| Yönetim Danışmanlığı Görevleri (Kurum İçi);%43 | 2;%37 | 2;%35 | 4;%31 | 3;%35 | 5;%31 | 6;%13 | 2;— |
| Big Finance Bench;%53;%51;%36;%49;—;%44;—;— | |||||||
| Artificial Analysis Zeka Endeksi v4.1 | 58.9 Endeksi puanı;55 Endeksi puanı;51 | 2 Endeks puanı;54 | 8 Endeks puanı;59 | 9 Endeks puanı;55 | 7 Endeks puanı;46 | 5 Endeks puanı;50 | 2 Endeks puanı |
Kodlama
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Önizlemesi | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Önizlemesi |
| Artificial Analysis Kodlama Ajan Endeksi v1.1 | 80 Endeks puanı;—;77 | 4 Endeks puanı;74 | 6 Endeks puanı;76 | 4 Endeks puanı;—;—;77 | 2 Endeks puanı;72 | 5 Endeks puanı;42 | 7 Endeks puanı | |||
| SWE-Bench Pro;%64 | 6;—;%63 | 4;%62 | 7;%59 | 4;%80 | 3;%77 | 8;%80;%69 | 2;%54 | 2 | ||
| DeepSWE v1.1;%72 | 7;—;%69 | 6;%67 | 2;%67%;—;—;%69 | 7;%59;%11 | 8 | |||||
| Terminal-Bench 2.1;%88 | 8;%91 | 9;%87 | 4;%84 | 7;%85 | 6;%88;—;%83 | 1;%78 | 9;%70 | 7 |
Güvenlik
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | GPT‑5.4 | Claude Opus 4.8 | Claude Mythos 5 | Claude Mythos Preview |
| Healthbench Professional | %60 | 5;%57 | 7;%55 | 7;%51 | 8;%48 | 1;%52 | 6;%66;%64 | 7 |
Bilgisayar kullanımı
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi |
| OSWorld 2.0;%62 | 6;—;%50 | 2;%45 | 6;%47 | 5;—;—;%54 | 8;— | |||
| BrowseComp;%90 | 4;%92 | 2;%87 | 5;%83 | 3;%84 | 4;%88;%87 | 9;%84 | 3;%85 | 9 |
| BenchCAD;%70 | 6;—;%62 | 3;%63 | 1;%44 | 4;%38 | 4;%35 | 5;%27 | 3;— | |
| BenchCAD (python aracı);%83 | 4;—;%78 | 2;%73 | 9;%55 | 8;%65;%61;%51 | 8;— |
Siber güvenlik
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5;Claude Mythos Önizlemesi;Claude Opus 4.8 |
| Capture-the-Flag (Bayrak Kapmaca) Yarışmaları;%96 | 7;—;%91 | 8;%85 | 2;%88 | 1;—;—;— | ||
| SEC-Bench Pro;%71 | 2;%74 | 3;%57 | 7;%48 | 9;%45 | 8;—;—;— | |
| ExploitBench;%73 | 5;—;%52 | 9;%33 | 2;%47 | 9;%78;%74 | 2;%40 | |
| ExploitGym;%33 | 7;—;%23 | 2;%12 | 4;%15 | 1;—;—;— |
Kendi kendini iyileştirme
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 |
| Kurum İçi Araştırma Hata Ayıklama Değerlendirmesi;%68 | 3;%67 | 8;%50 | 8;%50 | |
| KernelGen 1P;%61 | 1;%49 | 2;%22 | 4;%29 | 3 |
| NanoGPT;%9 | 69;%14 | 5;%1 | 66;%2 | 65 |
| PostTrainBench Lite;%50 | 3;%51 | 5;%29 | 6;%38 | 8 |
| RSI Index;%57 | 9;%56 | 3;%41 | 9;%41 | 7 |
Çok modlu
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi | |
| MMMU Pro (araçsız);%83;%80 | 7;%78 | 4;%81 | 2;—;—;%80 | 5 | ||
| MMMU Pro (araçlı);%84 | 6;%82;%79 | 5;%83 | 2;—;—;— | |||
| gdp.pdf;%30 | 7;%24 | 7;%22 | 7;%26;%29 | 8;%22 | 5;%16 | 7 |
Akademik
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Önizlemesi;Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi | ||
| GPQA Diamond;%94 | 6;%92 | 9;%92 | 3;%93 | 6;%94 | 1;%94 | 6;%92 | 6;%92;%94 | 3 |
| FrontierMath Tier 1-3 (v2);%89;%84 | 9;%78 | 6;%85 | 3;—;—;%87;%80;%59 | 6 | ||||
| FrontierMath Tier 4 (v2);%83;%68 | 3;%58 | 5;%72 | 5;—;—;%87 | 8;%56 | 1;— |
Araç kullanımı
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5;Claude Mythos Önizlemesi;Claude Fable 5;Claude Opus 4.8;Gemini 3.1 Pro Önizlemesi;Gemini 3.5 Flash | |||
| AutomationBench;%18 | 1;%15 | 2;%14 | 9;%12 | 9;—;—;%17 | 4;%15 | 5;—;%14 | 5 | |
| Toolathlon;%58;%53 | 1;%53 | 4;%55 | 6;%61 | 7;%61 | 1;%61 | 7;%59 | 9;%48 | 8;— |
Uzun bağlam
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5;Claude Mythos Önizlemesi;Claude Opus 4.8 | ||
| OpenAI MRCR v2 8-needle 256.000-512.000;%91 | 5;%89 | 6;%41 | 3;%81 | 5;—;—;— | |||
| OpenAI MRCR v2 8-needle 512.000-1 milyon;%73 | 8;%72 | 5;%41 | 3;%74;—;—;— | ||||
| GraphWalks BFS 256.000 f1;%90 | 7;%76 | 9;%81 | 3;%73 | 7;%91 | 1;%85 | 7;%85 | 9 |
| GraphWalks BFS 1 milyon f1;%77 | 1;%71 | 2;%51 | 2;%45 | 4;%79 | 4;%74 | 3;%68 | 1 |
Soyut akıl yürütme
| Değerlendirme | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Opus 4.8 | Gemini 3.1 Pro Önizlemesi |
| ARC-AGI-3⁷;%7 | 78;%0 | 8;%0 | 18;%0 | 43;%1 | 5;%0 | 42 |
Yazar
Dipnotlar
- 1
Siber yetenekler, koruma önlemleri azaltılarak değerlendirilir. Kullanıcılar, savunmaya yönelik siber güvenlik yeteneklerine daha geniş erişim için OpenAI Daybreak kapsamındaki Siber Ortam için Güvenilir Erişim programına katılabilir.
- 2
- 3
ExploitGym'i, genel kullanıma açık API'mizden daha hızlı yanıt üreten alfa API'miz üzerinde çalıştırdık ve ardından genel kullanıma açık API'mizle eşleşecek şekilde yeniden ölçeklendirdik. Gecikme sürelerini herkese açık API'miz için beklenen hızlara yeniden ölçeklendirdiğimizde, değerlendirme çalıştırmasında zaman sınırlarına doğru şekilde uyulmuş olmasına rağmen, bu durum bazı tahmini gecikme sürelerinin iki saatlik ve altı saatlik zaman sınırlarını aşmasına neden oluyor. Zamana duyarlı işler için daha yüksek hız istiyorsanız API'de öncelikli işlem ve Codex'te hızlı mod sunuyoruz.
- 4
Modellerimizin canlı kullanım ortamındaki davranışlarını inceleyip offline simülasyon yaparak gecikme ve API maliyetini tahmin ediyoruz. Bu tahminler, araç çağrısı ayrıntılarını, örneklenen token'ları ve girdi token'larını dikkate alır. Gerçek dünyadaki sonuçlar önemli ölçüde değişebilir ve simülasyonumuzda yakalanmayan birçok etkene bağlıdır. Gecikmeyi yüksek API hızlarında, maliyeti ise standart API fiyatlandırması üzerinden simüle ediyoruz.
- 5
- 6
- 7
- 8


