Ana içeriğe atla
OpenAI

29 Temmuz 2026

AraştırmaYayın

İki ayarı etkinleştirmek ARC-AGI-3 puanımızı nasıl üçe katladı?

Yükleniyor...

GPT‑5.6 Sol'un ARC-AGI-3 değerlendirmesindeki bulmacaları çözmeye çalıştığı hızlandırılmış video. Solda resmî düzenek, sağda ise akıl yürütmeyi koruyup bağlam yoğunlaştırmayı etkinleştiren Responses API düzeneğimiz yer alıyor. Bu oyunun(yeni bir pencerede açılır) liderlik tablosunda hiçbir en üst seviye model ilk seviyenin ötesini çözemiyor. GPT‑5.6 Sol, düzeneğimizle altı seviyenin tamamını çözüyor.

GPT‑5.6 Sol'un ARC-AGI-3(yeni bir pencerede açılır) değerlendirmesindeki düşük puanlarını ilk gördüğümüzde şaşırdık.

GPT‑5.6 Sol, çevrimsel çift örtü varsayımı(yeni bir pencerede açılır) gibi matematiğin uzun süredir çözülemeyen açık problemlerini çözdü ve Pokémon FireRed gibi oyunları tamamladı. Ancak 2B bulmaca oyunlarından oluşan ARC-AGI-3 değerlendirmesinde GPT‑5.6 Sol yalnızca %7,8 puan aldı; GPT‑5.5 ise oyunları neredeyse hiç oynayamayarak sadece %0,4'te kaldı.

2B bulmaca oyunları modellerimiz için olağan dışı derecede zor muydu? Yoksa başka bir şey mi söz konusuydu?

Karşılaştırmalı değerlendirmeler, yapay zeka modellerini nadiren tek başına ölçer. API ayarları, düzenek tasarımı ve istem oluşturmayla ilgili daha az görünür tercihleri de ölçerler. ARC-AGI-3 örneğinde, ChatGPT ve Codex'te kullandığımız iki API ayarını—akıl yürütmenin korunmasını ve bağlam yoğunlaştırmayı—etkinleştirmenin herkese açık görev kümesindeki puanları üçe katlarken çıktı tokenı sayısını altıda bire indirdiğini gördük.

Resmî düzenekle GPT‑5.6 Sol, ARC-AGI-3'ün herkese açık kümesinde %13,3 puan aldı. Akıl yürütme korunup bağlam yoğunlaştırma kullanıldığında ise %38,3'e ulaştı. Puanlar, model performansını insan temel çizgisiyle karşılaştıran Göreli İnsan Eylemi Verimliliği (RHAE(yeni bir pencerede açılır))ölçütüyle hesaplanır. Resmî oyun kayıtlarına(yeni bir pencerede açılır) göre, insan test katılımcılarının ortalama %48 puan aldığını tahmin ediyoruz. Modellere nasıl puanlanacakları söylenmez ve süreç boyunca puanlarını göremezlereylemler yalnızca her karenin metinsel temsilini ve bulundukları seviyeyi döndürür.

ARC-AGI-3

ARC-AGI-3, yapay zeka ajanlarının ne kadar iyi öğrendiğini ve akıl yürüttüğünü ölçmek üzere tasarlanmış bir değerlendirmedir. Ajanlar, açık talimatlar olmadan yabancı 2B oyunları keşfeder ve nasıl çalıştıklarını çıkarır. arcprize.org/tasks(yeni bir pencerede açılır) adresindeki 25 demo oyunu oynayabilirsiniz.

ARC-AGI-3, araç veya özel özellik içermeyen, özellikle genel amaçlı bir düzenek kullanır. ARC'nin gerekçesi, basit bir düzeneğin model eksiklerini daha görünür kılması ve modellerin daha adil karşılaştırılmasını sağlamasıydı. Ticari geliştiriciler ise düzenekleri her modelin özelliklerine ve kendine özgü davranışlarına göre optimize eder.

GPT‑5.6 Sol oyun alanında yalnızca görsel girdiler kullanan bir düzenekle Pokémon FireRed'i (GPT_Plays_Pokemon(yeni bir pencerede açılır) yayınında), Codex'in bilgisayar kullanımıyla Slay the Spire'ı (EpochAI(yeni bir pencerede açılır) yayınında) ve Baba Is You'nun ilk aşamalarını (Piotr Migdał & Piotr Grabowski(yeni bir pencerede açılır) tarafından paylaşıldığı üzere) geçti. ARC-AGI-3'ü bu kadar farklı kılan neydi?

Codex'teki GPT-5.6 Sol, Slay the Spire 2'de rastgele oluşturulmuş günlük bir görevi tamamlıyor.

Ethan Mollick, GPT‑5.6 Sol'un Codex'te, modelin bilgi kesim tarihinden sonra yayımlanan Slay the Spire 2'de rastgele oluşturulmuş günlük bir görevi geçtiğini gösteriyor(yeni bir pencerede açılır).

ARC'nin GPT‑5.5'in eksiklerine ilişkin analizinden(yeni bir pencerede açılır) esinlenerek GPT‑5.6 Sol'un bazı denemelerini inceledik. ARC gibi biz de modelin pek parlak görünmediğini fark ettik. Her eylem üzerinde uzun süre düşünüyor ve ilerlemekte zorlanıyordu.

Ancak daha derine indiğimizde modeldeki kafa karışıklığının büyük ölçüde modelin kendisinden değil, düzenekteki ayarlardan kaynaklandığını keşfettik.

İlk olarak, her oyun eyleminden sonra tüm özel akıl yürütmenin silindiğini fark ettik. Bu nedenle GPT‑5.6 Sol'dan her eylemde oyunu yeniden çözmesi isteniyor, önceki düşüncelerini hatırlamasına izin verilmiyordu. Model geçmiş hamlelerin kaydını ve bunlara eşlik eden kısa notları hâlâ görebiliyordu; ancak bu hamlelere götüren planları, içgörüleri veya düşünceleri göremiyordu.

İkinci olarak, düzeneğin kayan bir kesme penceresi kullandığını ve geçmiş uzadıkça eski eylemlerin görünmez hâle geldiğini gördük. Dolayısıyla GPT‑5.6 Sol yalnızca geçmiş düşüncelerini hatırlayamamakla kalmıyor, geçmiş eylemlerine ilişkin belleğini de yitiriyordu.

Düzeneğin bu iki özelliği—akıl yürütmenin silinmesi ve kayan kesme—GPT‑5.6 Sol'un zaman içinde öğrenmekte neden zorlandığını açıklıyordu.

Ajanlar, yaptıklarını hatırladıklarında en iyi performansı gösterir

Modellerimiz, yanıt veya araç çağrısı üretmeden önce özel akıl yürütme mesajlarıyla düşünecek şekilde eğitilir. Bu özel düşünme mesajları, konuşma geçmişinin bir parçası olarak korunur. Konuşma çok uzarsa onu özetleyip devam ederiz.

Uzun süreli bir görev boyunca modelin akıl yürütmesinin, araç çağrılarının, konuşma geçmişinin ve bağlam yoğunlaştırmanın birlikte nasıl çalıştığını gösteren şema.

Modellerimiz bu şekilde eğitilir; ChatGPT ve Codex'te de bu şekilde kullanıma sunulur. Üretim ortamımızdaki kuruluma daha iyi uyum sağlaması için ARC-AGI-3 düzeneğini Responses API(yeni bir pencerede açılır) ile uyguladık. API'miz bağlam yönetimini kolaylaştırır: GPT‑5.6'da önceki yanıt kimliğinin iletilmesi, akıl yürütmeyi araç çağrıları ve konuşma sıraları boyunca otomatik olarak korur.

Akıl yürütme korunduğunda iki büyük değişiklik fark ettik. İlk olarak GPT‑5.6 Sol, her turda oyunu baştan yorumlamak zorunda kalmadığı için her eylemden önce düşünmeye daha az zaman ayırdı. İkinci olarak GPT‑5.6 Sol, geçmiş düşüncelerini hatırlayabildiğinde zaman içinde çok daha iyi öğreniyor ve tutarlı stratejiler uyguluyordu.

Bir sonraki iyileştirme, kayan kesmenin Responses API'deki başka bir ayar olan bağlam yoğunlaştırmayla(yeni bir pencerede açılır) değiştirilmesiyle sağlandı.

ARC-AGI-3 düzeneği, bağlam sınırlarını kayan kesmeyle yönetir. Konuşma bağlamı 175.000 karakteri aştığında en eski mesajlar silinir.

Kayan kesmenin iki sakıncası vardır. İlk olarak model, önceki gözlem ve eylemlerini kaybeder. İkinci olarak görevlerin büyük bölümünü daha dolu bir bağlam kapasitesiyle yürütür; bu da performansı bir miktar düşürebilir.

ARC-AGI-3'te bağlam yoğunlaştırmayı etkinleştirdiğimizde GPT‑5.6 Sol, uzun çalışmalar boyunca her oyun hakkında öğrendiklerini daha iyi korudu ve daha az çıktı tokenıyla daha yüksek puana ulaştı.

Akıl yürütmeyi korumanın ve bağlam yoğunlaştırmayı etkinleştirmenin etkisini göstermek için GPT‑5.6 Sol'un her bir düzenekle bir dizi ARC-AGI-3 bulmacasını çözerken kullandığı 175 bin tokenlık bağlam kapasitesini gösteren bir animasyon hazırladık.

Ortadaki iki sütun, modelin bağlam kapasitesinin her düzenek tarafından nasıl farklı kullanıldığını gösteriyor. GPT‑5.6 Sol, geçmişini daha iyi hatırladığında eylem başına daha az düşünüyor ve çok daha hızlı ilerliyor. Not: Uygulamamızda karakter yerine 175.000 token sınırı kullanılıyor. Ancak metnin büyük çoğunluğunu, tokenizer'ımızın 1:1 oranında tokenlara ayırdığı eylem ızgaraları oluşturduğundan sonuç oldukça benzer.

Akıl yürütmenin korunması ve bağlam yoğunlaştırma birlikte, GPT‑5.6 Sol'un (Max) yaklaşık üç kat puana altıda bir oranında çıktı tokenıyla ulaşmasını sağlıyor.

Sonuç ve öneriler

Bu deneylerin, değerlendirmelerin modelleri nadiren tek başına ölçtüğünü hatırlatmasını umuyoruz. Değerlendirmeler aynı zamanda API ayarları, düzenek tasarımı ve istem oluşturmayla ilgili daha az görünür bir dizi tercihi de ölçer. Herkese açık bir değerlendirmedeki düşük puanlara şaşırıp ardından değerlendirme yürütücüsünün akıl yürütme mesajlarını silen genel amaçlı bir düzenek kullandığını ilk kez görmüyoruz.

Performansı en üst düzeye çıkarmaya çalışan bir API geliştiricisiyseniz kendi ürünlerimizde kullandığımız ayarları kullanmanızı öneririz:

  • Eski Chat Completions API yerine Responses API'mizi kullanın
  • Akıl yürütmeyi koruyun
  • Bağlam yoğunlaştırmayı kullanın

Modelleri karşılaştırıyorsanız ChatGPT ve Codex'teki gerçek kullanımı en iyi yansıtan yukarıdaki ayarları kullanan değerlendirmelere güvenmenizi öneririz.

AGI (genel yapay zeka) değerlendirmesi üzerine yıllardır sürdürdükleri yaratıcı çalışmalar ve konuyu daha yakından incelememize ilham veren analizleri için ARC'ye minnettarız.

Kendi becerinizi en üst seviye modellere karşı sınamak isterseniz arcprize.org/tasks(yeni bir pencerede açılır) adresindeki herkese açık oyunları deneyin.

Yazar

Ilan Bigio, Ted Sanders