Ana içeriğe atla
OpenAI

26 Haziran 2026

ÜrünSürüm

GPT‑5.6 Sol önizlemesi: yeni nesil bir model

Yükleniyor...

GPT‑5.6 serisinin sınırlı önizlemesini başlatıyoruz: amiral modelimiz Sol; günlük işler için dengeli bir model olan Terra; hızlı ve uygun maliyetli bir model olan Luna. Terra, 2 kat daha ucuz olurken GPT‑5.5 ile rekabetçi performans sunuyor; Luna ise en düşük maliyetimizle güçlü yetenek getiriyor.

GPT‑5.6 Sol, bugüne kadarki en dayanıklı güvenlik katmanımızla kullanıma sunuluyor. Daha yüksek riskli etkinlikler, hassas siber istekler ve tekrarlanan kötüye kullanım için korumaları güçlendirdik; zayıflıkları bulmak, sistemimizi stres testinden geçirmek ve gerçek dünya saldırılarına karşı sağlamlaştırmak için haftalar harcadık.

Geniş erişime inanıyoruz ve GPT‑5.6 Sol, Terra ve Luna’yı önümüzdeki haftalarda genel kullanıma sunmayı planlıyoruz. ABD hükümetiyle süren etkileşimimizin bir parçası olarak, bugünkü lansman öncesinde planlarımızın ve modellerin yeteneklerinin önizlemesini paylaştık. Onların talebi üzerine, daha geniş bir sürümden önce katılımları hükümetle paylaşılmış küçük bir güvenilir iş ortağı grubuyla sınırlı bir önizlemeyle başlıyoruz. Bu önizleme sırasında, daha geniş erişilebilirlik için çalışırken testlere devam edecek ve iş ortaklarıyla yakın koordinasyon içinde olacağız. Bu tür bir hükümet erişim sürecinin uzun vadede varsayılan hale gelmesi gerektiğine inanmıyoruz. Bu yaklaşım, en iyi araçları onlara ihtiyaç duyan kullanıcılardan, geliştiricilerden, işletmelerden, siber savunuculardan ve küresel iş ortaklarından uzak tutuyor. Bu kısa vadeli adımı atıyoruz çünkü bunun, önümüzdeki haftalarda daha geniş erişilebilirliğe giden en güçlü yol olduğuna inanıyoruz; bu sırada Yönetim ile birlikte siber Başkanlık Kararnamesi çerçevesini ve gelecekteki model sürümleri için tekrarlanabilir bir süreci geliştirmek üzere çalışıyoruz.

Yetenekler

GPT‑5.6 Sol bugüne kadarki en güçlü modelimiz. Model performansına dair bir önizleme sunmak için kodlama, biyoloji ve siber güvenlikte gelişmiş agentic yetenekleri vurgulayan bir dizi değerlendirme paylaşıyoruz; ek güvenlik ve hazırlık değerlendirmeleri ise sistem kartımızda(yeni bir pencerede açılır) mevcut. Modeli daha geniş ölçekte kullanıma sunduğumuzda genişletilmiş bir değerlendirme sonuçları paketini paylaşacağız.

GPT‑5.6 ile Sol’a derinlemesine akıl yürütmesi için en fazla zamanı vermek üzere yeni bir `max` akıl yürütme çabası sunuyoruz. Ayrıca karmaşık işleri hızlandırmak için alt ajanlardan yararlanarak tek bir ajanın yeteneklerinin ötesine geçen yeni bir `ultra` modu sunuyoruz.

Kodlama iş akışlarında GPT‑5.6 Sol, planlama, yineleme ve araç koordinasyonu gerektiren komut satırı iş akışlarını test eden Terminal‑Bench 2.1 üzerinde yeni bir son teknoloji düzeyi belirliyor.

GPT‑5.6 Sol, biyoloji iş akışlarında da geniş kapsamlı iyileşmeler gösteriyor. Uzun ufuklu genomik ve kantitatif biyoloji analizlerini değerlendiren GeneBench v1 üzerinde, daha az token kullanırken GPT‑5.5’ten daha güçlü sonuçlar elde ediyor.

GPT‑5.6 Sol, siber güvenlik için bugüne kadarki en yetenekli modelimiz. Güvenlik açığı araştırması ve exploit geliştirme dahil uzun ufuklu güvenlik görevlerinde performans-verimlilik sınırını ileri taşıyor. ExploitBench² üzerinde GPT‑5.6 Sol, çıkış tokenlarının yalnızca yaklaşık 1/3’ünü kullanarak Mythos Preview ile rekabet ediyor. UC Berkeley araştırmacılarının OpenAI ve diğer frontier laboratuvarlarıyla iş birliği içinde oluşturduğu bir benchmark olan ExploitGym(yeni bir pencerede açılır)3 üzerinde GPT‑5.6 Sol, Terra ve Luna modellerinin tümü, akıl yürütmeyi artırdıkça siber yeteneklerde güçlü iyileşmeler gösteriyor.

Daha güçlü koruma önlemleriyle daha güçlü siber yetenekler

GPT‑5.6 Sol, Terra ve Luna’yı bugüne kadarki en dayanıklı koruma önlemlerimizle ve her modelin yeteneklerine uygun yapılandırmalarla geliştirdik. Model daha yetenekli hale geldikçe, kod inceleme, güvenlik açığı araştırması, yama geliştirme, hata ayıklama, güvenlik eğitimi ve savunma testleri gibi meşru çalışmalara erişimi korurken koruma önlemlerini gerçek dünyadaki hasmane baskıya giderek daha fazla dayanacak şekilde tasarlıyoruz. Hedefimiz, bu yararlı kullanımları gereksiz yere sınırlamadan yasaklanmış saldırı amaçlı etkinliği daha zor, belirsiz ve tespit edilebilir hale getirmektir. Model ve koruma önlemlerine ilişkin değerlendirmemize dayanarak, yasaklanmış saldırı amaçlı kullanımı anlamlı biçimde sınırlarken meşru savunma çalışmaları için önemli fayda bekliyoruz.

GPT‑5.6 Sol, uçtan uca saldırıları güvenilir biçimde yürütmekten çok, insanların güvenlik açıklarını bulup düzeltmesine yardımcı olmada daha iyidir. Bu yetenekler gelişmeye devam ederken önceliğimiz, zayıflıkları bulmak, yamalar geliştirmek ve sistemleri daha geniş ölçekte güçlendirmek için bu araçları kullanabilecek savunuculara ulaşmalarını ve fayda sağlamalarını güvence altına almaktır.

GPT‑5.6 Sol, Preparedness Framework kapsamındaki Cyber Critical eşiğini aşmaz. Chromium ve Firefox’u içeren değerlendirmelerde, bir exploit’in yapı taşları olan hataları ve exploit primitive’lerini belirledi; ancak test edilen koşullar altında otonom olarak işlevsel bir tam zincir exploit üretmedi. Yine de benchmark eşikleri, bir modelin kullanılabileceği veya diğer araçlarla birleştirilebileceği her yolu yakalayamaz. Bu belirsizlik ve modelin yeteneklerindeki daha geniş sıçrama nedeniyle, modelin artan yeteneklerini daha güçlü koruma önlemleri ve aşamalı bir sürümle birlikte sunuyoruz. Koruma önlemlerimiz hakkında daha fazla ayrıntıyı GPT‑5.6 Preview sistem kartında(yeni bir pencerede açılır) paylaşıyoruz.

Katmanlı bir koruma önlemleri yapısı

Kararlı veya uyarlanabilen kötüye kullanıma karşı tek bir koruma önlemi yeterli değildir. GPT‑5.6 önizlemesi genelinde, kesin yapılandırmaları modellere göre değişen katmanlı koruma önlemleri kullanıyor ve bunları gerçek dünya saldırılarına karşı stres testine tabi tutuyoruz. Bunlar arasında modele eğitilmiş korumalar, üretim sırasında gerçek zamanlı kontroller, hesap düzeyi sinyaller, farklılaştırılmış erişim, izleme, yaptırım ve sürekli test yer alır.

GPT‑5.6, kullanıcılar niyetlerini gizlemeye veya modeli jailbreak etmeye çalıştığında da dahil olmak üzere yasaklanmış siber yardımı reddedecek şekilde eğitilmiştir. Bu model düzeyindeki koruma önlemleri, modelin neye yardımcı olup olmaması gerektiğine ilişkin ilk sınırı oluşturur.

Gerçek zamanlı siber ve biyoloji kötüye kullanım sınıflandırıcıları, çıktıyı üretilirken değerlendirerek başka bir katman sağlar. Daha yüksek riskli durumlarda, olası bir ihlal tespit ederlerse daha büyük bir akıl yürütme modeli konuşmayı ve bağlamını incelerken üretim duraklatılabilir. Çıktının izin verilmeyen nitelikte olduğu değerlendirilirse kullanıcıya ulaşmadan önce alıkonur.

İşaretlenen etkinlik, içerik saklama ve incelemeye ilişkin şartlarımız ve politikalarımızla uyumlu olarak ilgili konuşmalar ve risk sinyalleri genelinde hesap düzeyinde incelemeyi de tetikleyebilir. Tek bir konuşmanın ötesine bakmak, sistemlerimizin kalıcı kötü niyetli davranışı, benzer teknik kavramların çok farklı bağlamlarda görünebildiği meşru çift kullanımlı güvenlik çalışmalarından ayırt etmesine yardımcı olur.

Bu katmanlar birlikte, genel yaklaşımı tek başına herhangi bir koruma önleminden daha dayanıklı hale getirir. Model davranışı zararlı yanıt olasılığını azaltır; gerçek zamanlı sistemler üretim sırasında müdahale edebilir; hesap düzeyi inceleme daha geniş örüntüleri belirleyebilir; farklılaştırılmış erişim ise en hassas yetenekleri varsayılan olarak geniş ölçekte sunmadan önemli savunma çalışmalarını korur.

Özellikle önizleme sırasında kullanıcılar, bazı istekleri engelleyen veya reddeden koruma önlemleriyle karşılaşabilir. Diğer istekler, ek inceleme için üretim duraklatıldığından daha uzun sürebilir. Koruma önlemleri, özellikle savunma ve saldırı etkinliklerinin başlangıçta benzer görünebildiği çift kullanımlı alanlarda, zaman zaman meşru çalışmalara müdahale edebilir.

Önizlemenin test etmek üzere tasarlandığı konulardan biri de budur. Yalnızca koruma önlemlerinin kötüye kullanımı sınırlayıp sınırlamadığını değil, meşru kullanıcıların normal işlerini hâlâ güvenilir ve verimli biçimde tamamlayıp tamamlayamadığını da anlamak istiyoruz. Önizleme sırasında alınan geri bildirimler, gereksiz engellemeleri ve gecikmeleri azaltmamıza, koruma önlemlerinin bağlamı yorumlama biçimini iyileştirmemize ve daha geniş sürümden önce daha akıcı bir deneyim oluşturmamıza yardımcı olacak.

Ayrıca güvenliği ilerletirken kurumsal gizlilik gereksinimlerini desteklemek için kurumsal müşterilerle, gizliliği koruyan tespit, müşteri tarafından işletilen güvenlik kontrolleri ve bir müşterinin, kullanıcının ya da iş yükünün riskine göre kalibre edilmiş erişim dahil daha uzun vadeli yaklaşımlar üzerinde çalışıyoruz.

Otomatik red-teaming ile dayanıklılığı artırma

Saldırganlar taktiklerini uyarladığında da koruma önlemlerinin etkili kalması gerekir. Yalnızca sabit bir bilinen saldırı kümesinde çalışan bir koruma, sınırdaki bir model için yeterince dayanıklı değildir.

Bu nedenle, zayıflıkları bulmak ve koruma önlemlerini daha hızlı iyileştirmek için kendi modellerimizi kullanarak güvenliğe her zamankinden daha fazla zeka ve işlem gücü ayırıyoruz. Evrensel jailbreak’leri bulmaya yönelik otomatik red-teaming için 700.000’den fazla A100 eşdeğeri GPU saati ayırdık: Bunlar yalnızca dar bir ortamda değil, birçok prompt veya bağlamda işe yarayabilen saldırılardır. Bu daha zor ve daha genel saldırılara odaklanmak, koruma önlemlerini sabit bir bilinen hata kümesinin ötesinde test etmemizi sağladı. Ayrıca yalnızca insan testlerinin kapsayabileceğinden çok daha fazla saldırı örüntüsünü incelememize, hata örüntülerini daha erken belirlememize ve bir zayıflığı bulmaktan onu gidermeye kadar geçen yolu kısaltmamıza olanak tanır.

Otomatik red-teaming’e ek olarak, önizleme döneminde devam edecek kapsamlı insan uzman red-teaming çalışmaları yürütmek için üçüncü taraf test uzmanlarıyla çalıştık. İnsan red-teaming’i, sistemlerimizin öngöremeyebileceği şekillerde modeli kötüye kullanmaya çalışan yaratıcı uzmanlara karşı koruma önlemlerini test ederek otomatik çalışmayı tamamlar.

Hiçbir değerlendirme her ürün yapılandırmasını, çok adımlı saldırıyı veya gerçek dünya iş akışını temsil edemez. Bu nedenle, yeni keşfedilen jailbreak’leri yeniden üretmek, değerlendirmek, önceliklendirmek ve gidermek için hızlı yanıt sürecimizi sürdürüyor; ardından gelecekte benzer hatalara karşı test edebilmek için bunları devam eden değerlendirmelerimize ekliyoruz.

Erişilebilirlik ve fiyatlandırma

Önizleme süresince GPT‑5.6 modelleri başlangıçta API ve Codex üzerinden, seçili güvenilir iş ortakları ve kuruluşlara sunulacak. Yakında bunları ChatGPT, Codex ve API kullanan kişilere daha geniş ölçekte sunmayı planlıyoruz.

GPT‑5.6 ile tanıtılan bu yeni adlandırma sisteminde sayı bir modelin neslini belirtirken Sol, Terra ve Luna kendi ritimlerinde ilerleyebilen kalıcı yetenek katmanlarını belirtir. Aile, insanlara ve geliştiricilere zeka, hız ve maliyet genelinde daha net seçenekler sunar.

GPT‑5.6, üç model boyutunda 1 milyon token başına fiyatlandırılır: Sol 5 $ giriş / 30 $ çıkış; Terra 2,50 $ giriş / 15 $ çıkış; Luna ise 1 $ giriş / 6 $ çıkış. GPT‑5.6 ayrıca açık önbellek kesme noktaları desteği ve 30 dakikalık minimum önbellek ömrü dahil olmak üzere daha öngörülebilir prompt önbelleğe almayı sunar. GPT‑5.6 ve sonraki modellerde önbellek yazımları, modelin önbelleğe alınmamış giriş ücretinin 1,25 katı üzerinden faturalandırılırken önbellek okumaları %90 önbelleğe alınmış giriş indiriminden yararlanmaya devam eder.

Temmuz ayında GPT‑5.6 Sol’u Cerebras üzerinde saniyede 750 tokena varan hızlarla da kullanıma sunuyoruz; böylece sınır düzeyinde zekayı müşterilere eşi görülmemiş bir hızda ulaştırıyoruz. Kapasiteyi genişletirken erişim başlangıçta seçili müşterilerle sınırlı olacak.

Bu önizleme döneminden öğrenmeye devam etmekten ve GPT‑5.6 Sol, Terra ve Luna’yı yakında daha fazla kişiye sunmaktan heyecan duyuyoruz.


1. Modellerimizin üretim davranışına bakarak ve çevrimdışı simülasyon yaparak gecikmeyi ve API maliyetini tahmin ediyoruz. Bu tahminler araç çağrısı ayrıntılarını, örneklenen tokenları ve giriş tokenlarını hesaba katar. Gerçek dünya sonuçları önemli ölçüde değişebilir ve simülasyonumuzda yakalanmayan birçok faktöre bağlıdır. Gecikmeyi yüksek API hızlarında, maliyeti ise normal API fiyatlandırmasıyla simüle ediyoruz.

2. Tüm modeller, 5 seed ve akıl yürütme sürekliliğiyle ExploitBench API düzeneği kullanılarak değerlendirilir.

3. ExploitGym’i, herkese açık API’mizden daha hızlı yanıt üreten alfa API’mizde çalıştırdık ve ardından herkese açık API’mizle eşleşecek şekilde yeniden ölçekledik. Gecikmeleri herkese açık API’miz için beklenen hızlara yeniden ölçeklediğimizde bu, değerlendirme çalışmasında kurallara doğru şekilde uyulmuş olsa da bazı tahmini gecikmelerin 2 saatlik ve 6 saatlik süre sınırlarını aşmasına neden olur. Zamana duyarlı işler için daha yüksek hızlar elde etmek üzere API’de öncelikli işlemeyi ve Codex’te hızlı modu sunuyoruz.

4. Bildirilen çıkış tokenları, gecikmesi veya maliyeti olmayan modeller yatay noktalı çizgiler olarak gösterilir.

Yazar

OpenAI