Yeni nesil zeka
22 Eylül 2026 tarihli güncelleme: GPT‑6 ailemizi GPT‑6 Sol ve GPT‑6 Luna ile genişletiyoruz. Daha fazla bilgi edinin.
Dünyanın en zeki ve en uyumlu modeli olan GPT‑6 Astra ile tanışın.
GPT‑6 Astra, ön eğitim, pekiştirmeli öğrenme ve uyum alanlarında yıllar süren araştırmaları ve büyük yatırımları bir araya getiriyor. Astra; bilgisayar kullanımı, web'de gezinme, yazılım mühendisliği, siber güvenlik, bilim ve profesyonel çalışma alanlarında en yüksek performansı sunuyor. Astra, matematikte uzun süredir çözülemeyen açık problemlerin çözümüne şimdiden katkıda bulundu ve FrontierMath Tier 4'te %98 puanla ölçeğin üst sınırına ulaştı. Astra ayrıca ARC-AGI-3'te %99,9, ExploitBench'te ise %100 puan alarak her iki kıyaslama testinde de ölçeğin üst sınırına ulaştı. Bilgisayar ve tarayıcı kullanımında da yeni bir performans düzeyi belirleyen Astra, en zorlu profesyonel işlerin üstesinden benzersiz bir hız, doğruluk ve muhakemeyle geliyor.
GPT‑6 Astra bugün sınırlı sayıda kuruluş için kullanıma sunuluyor. Önümüzdeki günlerde tüm ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarının yanı sıra OpenAI API, Microsoft Azure ve AWS Bedrock üzerinden de kullanıma sunulacak.
Astra, kullanıcı niyetini anlama ve model davranışları konusunda önemli gelişmeler sunan, en uyumlu modelimizdir. Astra'nın muhakemesine daha fazla güvenerek görevlerinizi ona devredebilirsiniz. Bunu test etmek için Hugging Face olayından hareketle yeni bir değerlendirme geliştirdik. Bu değerlendirme, zor veya imkansız bir görevle karşılaşan modelin kendisine tanınan kapsamın dışına çıkıp çıkmadığını ölçüyor. Canlı ortam güvenlik önlemleri olmadan çalıştırılan GPT‑5.6 Sol, vakaların %48'inde yetkilendirilen hedefin dışına çıkarken GPT‑6 Astra hiçbir vakada kapsam dışına çıkmadı.
Dünyanın en iyi bilgisayar kullanım modeli
GPT‑6 Astra, bilgisayar kullanımında hız, doğruluk ve güvenlik açısından yeni bir standart belirliyor. Çevrimiçi form doldurma, CRM'deki müşteri kayıtlarını güncelleme ve takviminizi düzenleme gibi zahmetli işleri sizin yerinize yapabilir. Çevrimiçi araştırma yapabilir, e-postanızda veya belge düzenleyicinizde özetler hazırlayabilir. Bilimsel verileri analiz edebilir, grafikler oluşturabilir, web sitesi hazırlayabilir ve sitedeki tüm özelliklerin çalıştığından emin olmak için ön uç kalite kontrolleri gerçekleştirebilir. Yazılımları otonom olarak yükleyip test etmenize ve ekranda karşılaştığınız sorunları gidermenize yardımcı olabilir. Bu gelişmeler, en ileri düzey değerlendirme sonuçlarımıza da yansıyor.
Bu iyileştirmeler ayrıca gerçek bilgiye dayalı işlerde önemli verimlilik artışları sağlıyor. OSWorld 2.0 gecikme simülasyonlarında Astra, GPT‑5.6 Sol'a kıyasla görev başına yaklaşık %47 daha kısa sürede daha yüksek bilgisayar kullanımı performansı sergiliyor: Astra yaklaşık 40 dakikada %72,6, Sol ise yaklaşık 75 dakikada %65,7 puan alıyor.3
GPT‑6 Astra'nın bilgisayar kullanma yeteneklerinin sunduğu sonuçlar; oyun geliştirme, elektrik mühendisliği ve günlük bilgi temelli işler dahil olmak üzere farklı alanlarda görülebilir:
Astra'nın yanı sıra bilgisayar kullanımını önemli ölçüde hızlandırmak için Codex düzeneğini de güncelliyoruz. Bu güncelleme, Astra'nın verimliliğiyle birleştiğinde Mind2Web kıyaslamasındaki görevlerin mevcut GPT‑5.6 Sol deneyimine kıyasla 1,9 kat daha hızlı tamamlanmasını sağlıyor. Modeldeki hız artışı, zaman alan pek çok günlük işi sizin yapabileceğinizden daha hızlı biçimde üstlenebilmesini sağlıyor.4
Profesyonel çalışmalarda köklü bir değişim
GPT‑6 Astra, karmaşık profesyonel görevlerin üstesinden gelmeye yardımcı olmak için bilgisayar kullanımındaki gelişmeleri iş ortamlarına yönelik özel eğitimle bir araya getiriyor. Karmaşık problemler için gereken akıl yürütme düzeyini, çok adımlı iş akışlarını yürütme ve özenle hazırlanmış belgeler, elektronik tablolar ve sunumlar oluşturma yeteneğiyle birleştiriyor.
GPT‑6 Astra, mevcut şablonlara uyma ve ana noktaları yapılandırılmış bir anlatımla kısa ve anlaşılır biçimde aktaran, iyi düzenlenmiş slaytlar oluşturma konusunda en iyi modelimizdir. Şablonlarınıza, anlatımınıza ve görsel tarzınıza uygun, açık ve iyi yapılandırılmış belgeler, sunumlar, elektronik tablolar ve analizler oluşturur. Astra ayrıca, eldeki çalışmayla ilgisi olmayan bilgileri tekrarlamak yerine yalnızca gerekli bağlamı çıktılara yansıtacak şekilde eğitilmiştir. Böylece işletmenizin bağlamına ve standartlarına uygun, doğrudan kullanılabilecek çıktılar üretebilir.
GPT‑6 Astra, oluşturduğu web siteleri, oyunlar, uygulamalar ve render görüntülerinde daha güçlü bir görsel muhakeme de sergiliyor. ChatGPT'deki Sites(yeni bir pencerede açılır) ile Astra, tek bir promptla doğrudan web siteleri, web uygulamaları ve oyunlar oluşturabilir, bunları barındırabilir ve paylaşabilir.
Talimatların yoruma açık olduğu durumlarda GPT‑6 Astra, doğru kararı verme konusunda önceki modellerden daha başarılıdır. Rutin bilgi eksikliklerini bağlamdan yararlanarak tamamlar; yanıtın sonucu değiştirebileceği durumlarda ise amaca yönelik sorular sorar. Codex'te, yanıtınıza bağlı olmayan işlere devam ederken eş zamansız olarak soru sorabilir. Yanıt vermezseniz uygun durumlarda makul varsayımlarla ilerler ancak önemli kararlar için görüşünüzü bekler.
Aşağıdaki örnekler, eksik bilgilerin yanıtı önemli ölçüde değiştirebileceği günlük görevlerde Astra'nın nasıl iş birliği yaptığını gösterir.
Astra, görev ilerledikçe yönünü kaybetmeden ilerleme konusunda da daha başarılıdır. Önceki modeller bazen yönlendirme mesajlarını yeni bir hedef olarak değerlendirerek asıl isteği veya daha önce belirtilen kısıtlamaları gözden kaçırıyordu. Astra, yeni gereksinimleri dikkate alıyor, istendiğinde yön değiştiriyor ve genel görevi gözden kaçırmadan araya giren soruları yanıtlıyor.
Kodlama
GPT‑6 Astra, yazılım mühendisliğinde bugüne kadarki en iyi modeldir.
"GPT‑6 Astra, şirket içi kodlama kıyaslamalarımızda en ileri düzey performans sergiliyor ve GPT‑5.6 Sol'a kıyasla alım satım sezgisi değerlendirmelerinde belirgin bir ilerleme gösteriyor. Ajan tabanlı kodlamada GPT‑6 Astra, geliştiricilerin daha kolay takip edebileceği şekilde iletişim kuruyor ve canlı ortam kalitesine ulaşmak için daha az yineleme gerektiren kodlar oluşturuyor."
"Astra'yı ilk nesil değerlendirmelerimizden birinde düşük, orta ve yüksek akıl yürütme çabası düzeylerinde test ettik ve GPT‑5.6 Sol'u açık ara geride bıraktığını gördük. Daha yüksek çaba düzeyi; yeni bir derleme üzerinde daha fazla yineleme yapılmasını, tarayıcı testleriyle daha kapsamlı doğrulama gerçekleştirilmesini ve apply-patch yerine kod yürütmenin daha fazla tercih edilmesini sağlıyor. Bir modelin çabasını nasıl kullandığını anlamak, milyonlarca geliştiricinin fikirlerini daha hızlı ve güvenilir biçimde çalışan uygulamalara dönüştürmesini sağlamamıza yardımcı oluyor."
Astra ile birlikte, bağlam kapasitesi dolduğunda Codex'in bağlamı koruyup gerektiğinde geri getirmesini sağlayan yeni bir yöntem sunuyoruz. Modeller geçmişte, karmaşık sorunları giderme veya kapsamlı kod düzenlemeleri yapma gibi uzun süren oturumlarda çalışmaları özetlemek için bağlamı sıkıştırma yönteminden yararlanıyordu. Bağlam her sıkıştırıldığında, bir düzeltmenin neden işe yaramadığı veya bir bileşenin nasıl davrandığı gibi bazı ayrıntılar kaybolabilir. Codex'te Astra, biriken ayrıntıları tekrar tekrar tek bir özete sıkıştırmak zorunda kalmadan, bağlam kapasitesi yenilendiğinde bile notlarını koruyabilir. Önceki bağlam içerikleri aranabilir durumda kalır. Böylece Astra, ilgili bilgiler notlarında yer almasa bile önceki mesajlardaki ve araç çıktılarındaki gereklilikleri veya test sonuçlarını bulabilir. Bu deneysel özelliği Codex config.toml(yeni bir pencerede açılır) dosyanızdan etkinleştirebilirsiniz. Özellik önümüzdeki haftalarda Astra için varsayılan hale gelecek.
Bilimsel keşifleri ilerletme
Astra, bilimsel keşfin ardındaki pratik çalışmalara yardımcı olabilir. Bilimsel akıl yürütme ile bilgisayar kullanımını birleştiren Astra, verileri incelemek ve sonuçları araştırmak için uzmanlık yazılımlarında doğrudan çalışabilir. Böylece araştırmacıların kanıtları değerlendirmesine ve sonraki aşamada neyi araştıracaklarına karar vermesine yardımcı olur.
Siber güvenlik
Güvenlik güncellememizde ele aldığımız gibi Astra, siber yetenekler açısından önemli bir sıçrama gerçekleştiriyor ve Risklere Hazırlık Çerçevemiz kapsamında siber güvenlik alanındaki Kritik eşiğini karşılıyor. Astra'nın sıfır gün istismarlarını tespit edip geliştirebilmesi, savunma ekiplerinin güvenlik açıklarını bulup bunlara yama uygulamasına yardımcı olabilir ancak daha güçlü koruma önlemlerini de gerekli kılar. Bu yeteneklerin sınırlarını anlamak için Astra'yı şirket içi değerlendirmelere ve üçüncü taraf uzmanların değerlendirmelerine tabi tuttuk.
İlk olarak modeli, bilinen yazılım güvenlik açıklarından çalışan istismar kodları geliştirip geliştiremediğini ölçen ExploitBench ve ExploitGym'de, canlı ortam güvenlik önlemleri olmadan test ettik. ExploitBench'te Astra %100'lük kusursuz bir puan alırken, daha önce siber güvenlik alanındaki en üst seviye modelimiz olan GPT‑5.6 Sol %78,5 puan aldı. Astra, ExploitGym'de GPT‑5.6 Sol'un %30,3'lük sonucuna karşı %42,4 başarı oranına ulaştı ve bunu çok daha az çıktı token'ı kullanarak başardı.13
Geçmişteki yazılım güvenlik açıklarının model tarafından görülmüş olmasının kıyaslama testinin sonuçlarını etkilemiş olabileceğine yönelik endişeler nedeniyle Astra'yı iki yeni kıyaslamada daha test ettik. Bunlardan biri, önceki üç ayda ortaya çıkan güvenlik açıklarını kullanarak istismar geliştirme yeteneğini test etmek üzere hazırladığımız şirket içi "ExploitBench (Haziran–Ağustos 2026)" değerlendirmesiydi.14 Astra, bu veri kümesinde GPT‑5.6 Sol'a kıyasla çok daha az çıktı token'ı kullanarak çok daha yüksek keyfi kod yürütme oranlarına ulaştı. Değerlendirme sırasında Astra, daha önce bilinmeyen iki sıfır gün güvenlik açığı bile keşfedip kullandı. Her iki güvenlik açığını da ilgili bakım sorumlularına bildiriyoruz.
Astra'yı, modellerin ham kaynak koda erişmeden temel çalışma mantığını anlamak için yazılım ikili dosyalarını tersine mühendislikle inceleyip inceleyemediğini ölçen SRE-Bench15 kıyaslamasında da test ettik. Astra, görevlerin %88,0'ını tek denemede, %99,2'sini ise dört deneme içinde çözdü. GPT‑5.6 Sol için bu oranlar sırasıyla %55,9 ve %68,7 oldu.
Kıyaslama testlerinin dışında uzmanlar tarafından yürütülen incelemeler de Astra'nın, canlı ortam güvenlik önlemleri olmadan çalıştırıldığında güçlendirilmiş tarayıcılarda keyfi kod yürütmek için daha önce bilinmeyen güvenlik açıklarından yararlanabildiğini ve güçlendirilmiş işletim sistemleri için ayrıcalık yükseltme istismarları geliştirebildiğini gösterdi.
Savunma Ekipleri için Fırsat Penceresi'nde ele aldığımız gibi, en üst seviye siber yetenekler savunma ekiplerinin zayıf noktaları daha hızlı bulmasına yardımcı olabilir ancak bu noktalardan yararlanılmasını da kolaylaştırarak ekiplerin hızla uyum sağlamasını daha acil hale getirir. Astra'nın bugün kullanıma sunulan sürümüyle savunma ekipleri güvenli kod incelemesi ve yama uygulama gibi görevleri tamamlayabilir.
Ancak Astra, güvenlik açıkları için kavram kanıtı niteliğinde istismarlar oluşturma gibi daha ileri düzey siber güvenlik görevlerini yerine getirmeyi reddeder. OpenAI Daybreak aracılığıyla, önümüzdeki haftalarda erişimi genişletmeyi ve daha az kısıtlayıcı güvenlik önlemlerini kullanıma sunmayı planlıyoruz. Bu, güvenlik açıklarının ve kavram kanıtlarının doğrulanması, kötü amaçlı yazılım analizi ve tespit mühendisliği gibi daha fazla savunma amaçlı iş akışını mümkün kılacak.
GPT‑5.6 Sol için oluşturduğumuz koruma katmanını temel alarak olası siber kötüye kullanımlara karşı aldığımız önlemleri de güçlendirdik. Bu önlemler arasında olası jailbreak saldırılarına daha iyi direnebilmesi için model dayanıklılığının artırılması ve izleme sistemlerimize daha fazla bağlam sunulması yer alıyor. Şirket içi red teaming ekiplerimizin gerçekleştirdiği otomatik değerlendirmeler dahil olmak üzere kapsamlı şirket içi ve şirket dışı testleri sürdürdük. Siber güvenlik tedbirlerimiz ve testlerimiz hakkında daha fazla bilgiyi Astra güvenlik özetinde ve sistem kartında(yeni bir pencerede açılır) bulabilirsiniz.
GPT‑6 Astra'yı sorumlu şekilde uyumlu hale getirip devreye alma
Astra, en uyumlu modelimizdir. Özenli davranma, görev sınırlarına uyma ve şeffaf iletişim kurma konusunda öne çıkar. Bu çalışma, modelleri baştan sona insan niyetiyle uyumlu kalacak şekilde eğitmeye odaklanan uzun soluklu araştırma programımızın en yeni sonucudur.
Hassas ortamlarda Astra, risk düzeyine uygun bir özenle hareket eder. Astra, istenmeyen davranışları tetiklemek amacıyla karşıt örneklerden seçilen bilgisayar kullanımı görevlerinin değerlendirildiği bir testte, istenmeyen sonuçlardan kaçınma konusunda daha başarılı oldu. Varsayılan olarak sunulan ek güvenlik önlemleriyle çalıştırıldığında daha da etkili performans gösterdi.
Astra, test edilen diğer tüm en üst seviye modellere kıyasla daha az uyumsuz sonuca yol açıyor. Adil bir karşılaştırma için hem OpenAI Responses API(yeni bir pencerede açılır) hem de Anthropic Messages API(yeni bir pencerede açılır)'de bulunan yerel bilgisayar kullanımı araçlarına dayalı genel bir bilgisayar kullanma ajanı düzeneği kullandık. Değerlendirmeyi Codex ve ChatGPT Çalışma kullanıcıları için normalde devreye alınan ek korumalar otomatik inceleme, onay politikası) olmadan gerçekleştirdik.
Astra'nın, kullanıcı tarafından belirlenen ve içinde bulunduğu ortamın işaret ettiği sınırlar içinde çalışma olasılığı da daha yüksek. Şirket içi bir değerlendirmede Astra, Codex Auto-Review tarafından verilen bir ret kararını atlatmayı hiçbir zaman denemedi. Bu sonuç, Auto-Review kasıtlı olarak atlatılabilecek biçimde yapılandırıldığında ve görevi başka türlü tamamlamak imkansız olduğunda da değişmedi. Ortam kısıtlamalarına gösterilen bu özen, yazının girişinde paylaştığımız imkansız siber görev değerlendirmesinin sonuçlarıyla ve sistem kartımızda(yeni bir pencerede açılır) belgelenen diğer bulgularla tutarlıdır.
Astra ayrıca kullanıcılarla şeffaf iletişim kurma konusunda yeni standartlar belirliyor. Bir değerlendirmede Astra'nın yetenekleri ve sunduğu olanaklar hakkında gerçeğe aykırı ifadeler kullanma olasılığı, GPT‑5.6 Sol'a kıyasla üç kat daha düşük.
Yetenek halüsinasyonu değerlendirmemizde Astra, GPT‑5.6 Sol'a kıyasla önemli bir gelişme gösteriyor ve kendi yetenekleri hakkında daha az yanıltıcı iddiada bulunuyor.
Değerlendirmelerimiz, Astra'nın yazılı akıl yürütmesinin GPT‑5.6 Sol'unkine kıyasla izlenmesinin daha zor olduğunu gösterdi. Bu sonuç, modelden izlemeyi atlatmasının açıkça istendiği testlere dayanıyor. Bunu, Astra'nın daha basit görevlerde yazılı akıl yürütme süreci üzerinde daha fazla kontrol sahibi olmasına ve problemleri daha az sayıda yazılı adımla çözebilmesine bağlıyoruz. Astra karmaşık görevler için gereken akıl yürütmeyi gizlemekte hâlâ zorlanıyor gibi görünse de bu gerilemeyi ciddiye alıyoruz. İzlenebilirliği geliştirmek araştırma önceliğimiz olmaya devam ediyor. İlgili sistem kartında(yeni bir pencerede açılır) bulgularımız ve devam eden çalışmalarımız ayrıntılı biçimde açıklanıyor.
Uyum eğitimi, devreye alım yaklaşımımızın temelini oluşturur. Ek bir savunma katmanı olarak güvenli olmayan davranışları tespit edip kontrol altına almaya yardımcı olmak için Codex Auto-review(yeni bir pencerede açılır) gibi sistem güvenlik önlemleri oluşturuyor, ajanların akıl yürütme süreçlerini ve eylemlerini izliyoruz. Güvenlik güncellememizde açıklandığı üzere, uyumsuzluğu görünür hale getirmek ve en ciddi örneklerini kontrol altına almaya yardımcı olmak amacıyla Astra sınıfı modeller için uyumsuzluk izleme sistemini canlı ortamda da devreye alıyoruz. Bu önlemler şirket içi devreye alımlarda kullandığımız izleme sistemlerine benzer. Modelin akıl yürütmesini ve eylemlerini yetkisiz davranışlara karşı denetleyen, potansiyel olarak yetkisiz etkinlikleri otomatik biçimde durduran sınıflandırıcılardan oluşan bir sistem kullanırlar.
Astra'nın siber güvenlik yeteneklerindeki önemli artış nedeniyle bu devreye alımın emniyetli ve güvenli olması için özellikle dikkatli davranıyoruz. Ek güvenlik kontrolleri, savunma amaçlı siber güvenlik çalışmaları dahil olmak üzere meşru çalışmaları bazen yavaşlatabilir, duraklatabilir veya durdurabilir. ChatGPT veya Codex'te bir görev duraklatılırsa devam etmeden önce ilgili eylemi incelemeniz istenebilir. API'de ise görev durdurulur. Bu kontroller bazen meşru çalışmaları kesintiye uğratabilir. Gereksiz kesintileri azaltmak için sistemi geliştirmeye devam ediyoruz. Uyumsuzluk izleme, uyumun yerini alamaz. Amacımız, yetkilendirilen kapsam içinde güvenilir biçimde kalan modeller geliştirmek ve böylece bu korumaların müdahale etmesine gerek bırakmamaktır.
Kullanılabilirlik
GPT‑6 Astra bugün sınırlı sayıda kuruluş için kullanıma sunuluyor. Önümüzdeki günlerde tüm ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarının yanı sıra OpenAI API, Microsoft Azure ve AWS Bedrock üzerinden de kullanılabilecek. Astra kullanımı mevcut abonelik kotalarına dahildir. Kullanıcılar ve işletmeler ek kullanım için kredi de satın alabilecek. Pro, Business ve Enterprise planlarındaki kullanıcılar ayrıca GPT‑6 Astra Pro'ya erişebilecek. Enterprise yöneticileri Astra'yı çalışma alanlarında etkinleştirebilir. Kullanıma sunulduğunda erişim varsayılan olarak kapalı olacaktır.
Astra, gerekli koşulları karşılayan API müşterileri için Sıfır Veri Saklama özelliğini destekliyor. Geçen ay paylaştığımız üzere, müşteri gizliliğini korurken güvenlik izleme süreçlerini güçlendirmek amacıyla Özel Güvenlik İşleme özelliğini test ediyoruz.
Geliştiriciler GPT‑6 Astra'ya OpenAI API'de gpt-6-astra adıyla, Microsoft Azure ve Amazon Bedrock üzerinden erişebilecek.
OpenAI API Standard fiyatlandırması kapsamında bir milyon girdi token'ı için 10 $, bir milyon çıktı token'ı için 50 $ ücret alınır. Önbellekten okuma ve önbelleğe yazma işlemleri için farklı ücretler uygulanır. Hızlı mod, API'de GPT‑6 Astra için kullanılabilir ve Standard işlem ücretinin iki katı karşılığında iki kata varan hız sunar.
Profesyonel
Profesyonel | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | %41,4 | %18,1 | %31,4 | %17,4 | %26,9 | - |
BenchCAD | %95,9 | %83,3 | %84,3 5 | %67,5 5 | %82,1 5 | - |
BrowseComp | %91,5 | %90,4 | - | %87,4 | %90,8 | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Şirket İçi Tasarım Görevleri | %50,0 | %47,4 | - | %35,8 | - | - |
Şirket İçi Veri Bilimi Görevleri | %40,9 | %30,5 | - | %34,7 | - | - |
Artificial Analysis Zeka Endeksi v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Kodlama
| Kodlama | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | %57,9 | %37,3 | %55,8 | %44,5 | %52,6 | %19,1 |
| DeepSWE v1.1 | %74,1 | %72,7 | %67,4 | %69,9 | %73,7 | %73,8 |
| FrontierCode 1.1 Extended (puan) | %64,5 8 | %60,6 | %63,6 | %64,9 | %63,6 | %56,3 |
| FrontierCode 1.1 Main (puan) | %53,3 8 | %47,5 | %50,9 | %53,5 | %53,4 | %43,6 |
| Şirket İçi Veritabanı Geçişi Görevleri | %63,9 | %42,7 | %57,8 | %50,3 | - | - |
| Artificial Analysis Kodlama Ajanı Endeksi v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akademik
Akademik | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | %64,6 | %22,4 | %52,6 | %21,4 | %30,0 | - |
FrontierMath Tier 4 (v2) | %97,6 | %83,0 | %87,8 | %90,2 | %73,2 | - |
GPQA Diamond | %96,0 | %94,6 | %93,7 | %92,6 | %93,7 | %95,3 |
Humanity's Last Exam (w/ tools) | %57,2 | - | %65,0 | %63,8 | %63,6 | - |
Uyumlanma
Uyumlanma | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Şirket içi bilgisayar kullanımı güvenlik kıyaslaması (düşük değer daha iyidir) | %2,4 | %22,0 | %9,5 | %18,3 | %11,5 | - |
AutoReview kullanılan şirket içi bilgisayar kullanımı güvenlik kıyaslaması (düşük değer daha iyidir) | %1,8 | %4,3 | - | - | - | - |
Şirket içi atlatma kıyaslaması (düşük değer daha iyidir) | %0,00 | %0,29 | - | - | - | - |
ExploitGym bal küpü (düşük değer daha iyidir) | %0,0 | %48,2 | - | - | - | - |
ExploitGym - İmkansız Görevler | %100,0 | - | - | - | - | - |
Şirket içi halüsinasyon kıyaslaması (düşük değer daha iyidir) | %4,2 | %12,2 | - | - | - | - |
Uzun Bağlam
Uzun Bağlam | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256.000-512.000 | %100,0 | %91,5 | - | - | - | - |
OpenAI MRCR v2 8-needle 512.000-1 milyon | %96,3 | %73,8 | - | - | - | - |
Soyut akıl yürütme
| Soyut akıl yürütme | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | %99,9 1 | %7,8 | - | - | %30,2 | - |
| ARC-AGI-2 | %95,0 | %92,5 | %90,0 | %89,2 | %90,4 | - |
| ARC-AGI-1 | %98,5 | %97,5 | %97,5 | %98,5 | %97,5 | - |
Değerlendirme puanları, herhangi bir akıl yürütme çabasında elde edilen en yüksek değerlerdir. GPT değerlendirmeleri araştırma ortamımızda veya API'miz üzerinden gerçekleştirilmiştir. Sistem istemleri ve kullanılabilen araçlar gibi unsurlardaki farklılıklar nedeniyle bu değerlendirmelerin çıktıları, canlı ortamdaki ChatGPT'nin çıktılarından bir miktar farklı olabilir.
DİPNOTLAR
- 1
ARC-AGI-3'te GPT-6 Astra, gerçek dünyadaki performansı daha iyi yansıtmak için iki ayarı değiştiren Responses API düzeneğimizle çalıştırıldı. Bu değişiklikler özellikle ARC-AGI-3'ü hedeflemez.
- 2
GPT-5.6 Sol, API'mizde, ChatGPT Codex'te ve ChatGPT Çalışma'da sunulan sürümü ifade eder. ChatGPT Sohbet'teki sürüm biraz farklıdır.
- 3
OSWorld V2-Offline, özgün OSWorld V2'nin internet erişimi olmadan çalışan bir alt kümesidir. Claude'un OSWorld-V2 Offline performansı, yazarlar tarafından resmi liderlik tablosunda(yeni bir pencerede açılır) yeniden oluşturulmuştur. OSWorld 2.0'da Claude puanları için Fable 5.1 Sistem Kartı'ndaki değiştirilmiş görevler ve puanlama yerine resmi ayarlar kullanılmıştır.
- 4
- 5
BenchCAD'de Claude'un puanları, Fable 5.1 Sistem Kartı(yeni bir pencerede açılır)'nda ayrıntılı olarak açıklanan üç değerlendirmede değişikliğini yansıtır.
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon ve Noah A. Smith. "LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(yeni bir pencerede açılır)." arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower ve Peter Jonas. "The OpenScore String Quartet Corpus(yeni bir pencerede açılır)." Proceedings of the 10th International Conference on Digital Libraries for Musicology, s. 49–57. ACM, 2023.
- 8
FrontierCode'da GPT-6 Astra, Codex'teki geliştirici mesajının bir bölümüne(yeni bir pencerede açılır) benzer bir geliştirici mesajıyla çalıştırıldı: "Gereğinden fazla test dosyası oluşturmayın. Yalnızca depo kuralları gerektirdiğinde veya mevcut dosyaların hiçbiri uygun olmadığında yeni bir test dosyası oluşturun. İlgisiz temizlik işlemlerinden ve gereksiz karmaşıklıktan kaçının. Uygun mevcut yardımcı programları yeniden kullanın. İlgili depo talimatlarını okuyun ve yakındaki kodları, testleri, dokümantasyonu ve CI'ı inceleyin. Yerleşik kurallara uyun. Amaç, temiz ve birleştirilmeye hazır kod üretmektir." Prompt, değerlendirme için optimize edilmemiştir.
- 9
İlki, sayı doğrusunda ne kadar ilerlerseniz ilerleyin asal sayıların birbirine ne kadar yakın olabileceğiyle ilgilidir. On yılı aşkın süre boyunca bilinen en iyi sonuç, aralarındaki fark en fazla 246 olan sonsuz sayıda asal sayı çifti bulunduğunu gösteriyordu. Julia Stadlmann(yeni bir pencerede açılır) yakın zamanda bu sınırı 240'a indirdi. Astra, sınırın 186'ya indirilmesine yardımcı olarak sonsuz sayıda asal sayı çiftinin bu daha kısa aralıkta bulunabildiğini gösterdi. Kısa asal sayı aralıkları: Kanıt(yeni bir pencerede açılır) ve destekleyici araştırma(yeni bir pencerede açılır).
- 10
İkincisi, asal sayılar arasındaki olağan dışı büyüklükteki aralıklarla ilgilidir. Astra, bu aralıklara ilişkin bir sınırda 80 yılı aşkın süredir değişmeyen bir terimi iyileştirdi. Her iki sonuçla ilgili kanıtları, kısaltılmış düşünce zincirini ve doğrulama materyallerini paylaşıyoruz. Büyük asal sayı aralıkları: Kanıt(yeni bir pencerede açılır) ve destekleyici araştırma(yeni bir pencerede açılır).
- 11
Tüm Claude modellerini, amaçlanan HealthBench Professional prosedürünü izleyerek ve GPT‑5.4 ile notlandırılmış, uzunluğa göre düzeltilmiş ve kırpılmamış puanları kullanarak bağımsız olarak değerlendirdik. Fable 5.1 için sağlayıcının yanıt vermeyi reddettiği durumlarda yedek olarak Opus 5'i kullandık.
- 12
- 13
- 14
ExploitBench (Haziran-Ağustos 2026), 13 kararlı Chrome sürümünde yer alan önem düzeyi yüksek 20 V8 güvenlik açığını kapsar. Kıyaslama, ajanların belirtilen her güvenlik açığından yararlanarak V8'de ve Linux için resmi Chrome sürümlerinde keyfi kod yürütüp yürütemediğini test eder. Kapsamdaki bazı güvenlik açıkları, değerlendirme koşulları altında keyfi kod yürütülmesine olanak tanımayabilir. Bu nedenle %100 başarı oranına ulaşmak mümkün olmayabilir. Not: GPT-5.6 Sol'un %5,5'lik puanı, kıyaslama testindeki 300 turluk limitten kaynaklanıyor. Max ayarını kullanan müşteriler, gerçek kullanımda böyle bir limitle karşılaşmaz. Model, benzer ayarlarda daha az sınıra takıldığında %11,5'lik bir puan elde etti.
- 15
Jeremy Spence et al. "The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(yeni bir pencerede açılır)." arXiv:2608.11469v1, 2026.
- 16
Üçüncü taraf modelleri test ederken daha basit bir araştırma düzeneği kullanıyoruz. Codex'in canlı ortam yapılandırması daha karmaşıktır ve bu durum ham model hata oranlarının farklı olmasına yol açabilir. Sağlayıcı tarafındaki korumalar ve bilgisayar araçlarının uygulamaları da farklılık göstermektedir. Onay gerektirmeyen senaryo bir şirket içi araştırma yapılandırması olduğundan kullanıcılar Codex'te bu senaryoyla karşılaşmaz.
- 17
