GPT‑5.6 en üst seviye zekâ ve verimliliği nasıl birleştiriyor?
GPT‑5.6 model ailesini, insanların modellerimizi kullandığı tüm görevlerde yetenek ve maliyeti dengelemek üzere tasarladık. En gelişmiş modelimiz GPT‑5.6 Sol, Max akıl yürütme düzeyinde Artificial Analysis Coding Agent Index'te Claude Fable 5'i yarıdan düşük maliyetle geride bırakıyor. Terra, zekâ performans testlerinde yarı fiyatına GPT‑5.5 kadar iyi performans gösterirken Luna, Sol'un maliyetinden %80 daha düşük fiyatlı, en hızlı ve en uygun maliyetli modelimizdir. Bu verimlilik düzeylerine ulaşmak için araştırma ve teknik ekiplerimiz teknoloji yığınımızın tüm ana katmanlarında önemli optimizasyonlar yaptı. Bu iyileştirmeler; modellerimizi, çıkarımı (çıktı üretmek için modelleri çalıştırma biçimimiz) ve hem Codex hem de ChatGPT Work tarafından kullanılan ajan tabanlı düzeneğimizi kapsıyor.
Son dört yılda modellerimizi 1 milyar aktif kullanıcıya ve 2 milyondan fazla işletmeye ulaştırırken zekânın faydalarını herkese sunabilmemizin temelinde verimlilik yer aldı. Misyonumuz, genel yapay zekanın tüm insanlığa fayda sağlamasını güvence altına almaktır. Bu yıllar boyunca, maliyet-zekâ eğrisinin her noktasında en yüksek performanslı modelleri sunmak amacıyla teknoloji yığınımız genelinde sürekli olarak daha kapsamlı optimizasyonların önünü açmaya çalıştık. Token başına şimdiye kadarki en yüksek zekâ verimliliğimize, token başına daha fazla iş başarmak üzere eğitilen GPT‑5.6 ile ulaştık. Eğitim sırasında hem görevin başarıyla tamamlanmasını hem de verimliliği optimize ederek modelin görev boyunca daha doğrudan bir yol izlemesini sağlıyoruz.
Bu yazıda modellerimizin ötesine geçerek teknoloji yığınının diğer iki ana bölümündeki gelişmelerle verimliliği nasıl gözettiğimizi paylaşıyoruz: 1) Aynı donanımdan daha fazla çıktı almak için yük dengeleme, spekülatif kod çözme, önbelleğe alma ve çekirdek optimizasyonu gibi süreçleri iyileştirdiğimiz çıkarım ve 2) bağlam şişmesini, araç kullanımını ve yinelenen işleri daha iyi yöneten ajan tabanlı düzeneğimiz. Ayrıca GPT‑5.6 Sol'un bu kazanımlardan bazılarını bağımsız olarak sağlamadaki rolünü de paylaşacağız. Tek başına her bir iyileştirme sınırlı görünebilse de bu kazanımlar birleşerek hem zekâ hem de verimlilik açısından en üst seviyeyi sunmamızı sağlıyor.
Model talebinin kapasiteden daha hızlı büyüdüğü ve işlem gücünün sınırlı olduğu bir dünyada verimlilik, her sistem tasarımının temelindedir. Bu durum, yanıt üretmek için eğitilmiş modelleri çalıştıran çıkarım teknoloji yığınımız açısından özellikle geçerlidir. Temel hedefimiz; kullanıcıların beklediği zekâ, gecikme süresi, kullanılabilirlik ve güvenilirlik düzeylerini korurken aynı donanımla daha fazla token sunmaktır.
Bunu başarmak için sistemin tamamını optimize etmek gerekir. Bir model tek başına son derece verimli olsa bile istekler kötü dağıtılırsa, donanım boşta kalırsa veya veri aktarımı hesaplamayı yavaşlatırsa modeli sunmak yine de maliyetli olabilir. Her katmandaki iyileştirmeler birbirini güçlendirir. Kazanımlar; yönlendirme (isteklerin nereye gönderildiği), zamanlama (isteklerin ne zaman gönderildiği), çekirdekler (GPU'larda çalışan yazılım), önbelleğe alma (kaydedilip yeniden kullanılan çalışma) ve model uygulaması (GPU kodunun sıralanışı) optimizasyonlarından gelir. Codex'teki GPT‑5.6 Sol, tüm bu optimizasyonlarda belirleyici bir rol oynadı.
İlk önemli örnek yük dengelemedir. İstekleri dünya genelinde coğrafya, kullanılabilir kapasite ve hızlandırıcı türü (modeli çalıştıran GPU veya özel çip türü) gibi etkenlere göre yönlendiriyoruz. Bir küme içinde işleri; yük, bağlam uzunluğu, önbellek kullanılabilirliği ve diğer istek özelliklerine göre model örneklerine dağıtıyoruz. Ardından her örnekteki işin hızlandırıcılar, modelin alt ağları ve işlem çekirdekleri arasında verimli biçimde bölünmesi gerekir. Codex'teki GPT‑5.6 Sol; üretim trafiğini analiz etmemize, daha önce gözden kaçan dengesizlik kaynaklarını belirlememize, yeni yönlendirme stratejilerini test etmemize ve bu sezgisel kuralları sürekli ayarlamamıza yardımcı oluyor. Yalnızca bu yük dengeleme iyileştirmeleri bile modellerimizi sunma maliyetini önemli ölçüde azalttı.
GPT‑5.6 Sol'u, modelin girdileri bir sonraki token tahminlerine dönüştüren hesaplaması olan ileri geçişini optimize etmek için de kullandık. Tek tek işlemler hızlı olsa bile gereğinden fazla bellek aktarımı, eşzamanlama ve verimsiz veri düzenleri GPU'ların boşta kalmasına neden olabilir. Bunu önlemek için GPT‑5.6 Sol, önceden hesaplanabilecek, atlanabilecek veya paralelleştirilebilecek işleri belirledi. GPT‑5.6 Sol, Codex ile üretim çekirdeklerimizi, yani modeli oluşturan matematiksel işlemleri yürüten temel kodu, bağımsız olarak yeniden yazıp optimize etti. Bu başarı kısmen, GPT‑5.6'yı OpenAI tarafından sürdürülen iki açık kaynaklı GPU programlama dili olan Triton(yeni bir pencerede açılır) ve Gluon(yeni bir pencerede açılır)'da çekirdek yazma ve iyileştirme konusunda etkili olacak şekilde eğitmemiz sayesinde mümkün oldu. Bu çalışmalar, GPT‑5.6 Sol'un daha kapsamlı çekirdek geliştirmeleriyle birleşerek uçtan uca sunum maliyetlerini %20 azalttı. GPT‑5.6 Sol tarafından yazılan çekirdeklerin doğruluğunu kontrol etmeye yardımcı olmak için açık kaynaklı FpSan(yeni bir pencerede açılır) (Kayan Nokta Doğrulayıcı) gibi doğrulama araçlarına da büyük yatırım yaptık.
Spekülatif kod çözme, hız ve verimliliği artırmanın bir başka yoludur. Bu teknikte, birincil modelle birlikte daha küçük bir taslak (veya “spekülatör”) model çalıştırılır ve bu model, birincil modelin paralel olarak doğrulaması için birkaç token önerir. Bu öneriler kabul edildiğinde sistem, birincil modelin tek bir geçişinden birden fazla çıktı tokenı üretebilir ve böylece maliyetli sıralı hesaplama miktarını azaltabilir. GPT‑5.6 Sol; mimarisi üzerinde yüzlerce deney tasarlayıp çalıştırarak, boyut, yapı ve özellik değişikliklerini test ederek kendi taslak modelini geliştirdi. GPT‑5.6 Sol ayrıca spekülatörün eğitim sürecini başlatıp izledi; donanım arızaları ve eğitim kararsızlığı dâhil sorunlar ortaya çıktığında bağımsız olarak müdahale etti. Bu iyileştirmeler token üretme verimliliğini %15'ten fazla artırdı.
Model, önbelleğe alınmamış girdi tokenlarını işlerken anahtar-değer (KV) önbelleğini yoğun hesaplama gerektiren tek bir geçişte oluşturur; çıktı üretirken de bu önbelleği tekrar tekrar okuyup genişletir. Gruplama, parçalama ve KV yönetimi gibi en uygun sunum yapılandırması; prompt ve çıktı uzunluğu, grup boyutu, önbellek isabet oranı, sorgu özellikleri ve daha birçok iş yükü etkenine büyük ölçüde bağlıdır. Ancak yapılandırma alanı daha önce sistematik biçimde ayarlanamayacak kadar genişti ve mühendisleri genel sezgisel kurallara güvenmek zorunda bırakıyordu. Codex'teki GPT‑5.6 Sol sayesinde üretim iş yüklerini analiz edebildik, aday yapılandırmalar üretip değerlendirebildik ve motor ile modelin her senaryo için yapılandırılma biçimini son derece ayrıntılı optimize edebildik. Bu, iş yüküne özel yeni bir optimizasyon düzeyini uygulanabilir kılarak aynı donanımdan daha fazla yararlı çıkarım elde edilmesini sağlıyor.
Çıkarım optimizasyonu, sürekli bir geri bildirim döngüsüdür. Üretim ortamındaki davranışları ölçüyor, en büyük eksikleri belirliyor, değişiklikleri uyguluyor ve bunların yalnızca tek bir performans testini değil, tüm sistemi iyileştirdiğini doğruluyoruz. GPT‑5.6 Sol ve Codex, bu döngünün her aşamasını hızlandırıyor. Böylece ekibimiz daha fazla fikri değerlendirebilir, değişen iş yüklerine daha hızlı yanıt verebilir ve kullanıcılar için daha düşük gecikme süresi, daha fazla kapasite ve daha düşük maliyet sunan bir çıkarım teknoloji yığını oluşturabilir.
ChatGPT Work ve Codex, karmaşık görevleri bir dizi model isteği ve araç çağrısıyla tamamlar. Codex, kullanıcının isteğinden nihai yanıta uzanan tek bir etkileşimde kaynak kodunu inceleyebilir, dağıtım geçmişinde arama yapabilir, olay raporlarını okuyabilir, bir dosyayı düzenleyebilir ve testler çalıştırabilir. Her adım bir istek gerektirebilir.
Bağlam hazırlamak, veri aktarmak, çıkarım yürütmek, araç çağırmak ve süreç başlatmak zaman ve işlem gücü gerektirir. Bir görev 30 model isteği gerektiriyorsa istek başına fazladan bir saniye bile birikir. Genel performansı artırmak, yalnızca modeli hızlandırmayı değil, sistem genelindeki yinelenen işleri azaltmayı gerektirir.
Tek bir kullanıcı etkileşimi, çok sayıda model ve araç yinelemesi içerebilir. Yinelenen bölgedeki her maliyet defalarca oluşabilir.
Bu çarpanlar; modellerimizi, araçlarımızı ve kullanıcının ortamını birbirine bağlayan Rust tabanlı bir orkestrasyon katmanı olan ajan tabanlı düzeneğimizi tasarlama biçimimize yön verdi. Şimdi bağlam şişmesini önlemenin, araçları yüklemenin ve çalışmaları yeniden kullanmanın her isteği nasıl daha verimli hâle getirdiğini ele alacağız.
Ajanlara daha fazla araç, beceri, eklenti ve konuşma geçmişi erişimi verildikçe bağlam kapasitesi kolayca büyüyebilir. Bu durum maliyeti artırır, modelin dikkatini dağıtır ve gereksiz akıl yürütmeye yol açar. Düzenek, entegrasyonların, özel MCP araçlarının, becerilerin ve eklentilerin yalnızca gerektiğinde görünmesini sağlayan ertelenmiş keşif yöntemiyle bu ek yükü azaltabilir. Düzenek ayrıca tek tek araçların ve MCP entegrasyonlarının bağlam kapasitesini beklenmedik biçimde tüketmesini önler. Model farklı bir sınır istemediği sürece araç çıktısı varsayılan olarak 10.000 token ile sınırlıdır.
Daha önce belirtildiği gibi bir ajan döngüsü, aynı talimatları, konuşma geçmişini, araç tanımlarını ve önceki sonuçları tek bir etkileşim içinde GPU'lara birden çok kez gönderebilir. Yinelenen bu girdileri işlemek maliyetlidir. Bu nedenle prompt önbelleğe alma, daha önce işlenmiş bir prompt ön ekiyle ilişkili hesaplamayı yeniden kullanır. Bu ön eki korumak için düzenek, modelin görebildiği tüm geçmişi yalnızca sonuna ekleme yapılabilecek şekilde işler: Yeni mesajlar, araç sonuçları ve ortam güncellemeleri önceki bağlama yerleştirilmek yerine sona eklenir. Araçlar da belirli ve tutarlı bir sırayla sunulur; onay politikaları gibi çalışma zamanı ayarlarıysa araç tanımlarına gömülmek yerine yürütme sırasında uygulanır. Bu tasarım tercihi, Codex ve ChatGPT Work'ün genel prompt önbelleği isabet oranlarının yüksek olmasına katkıda bulunur.
Artımlı aktarım, ağdan geçen veriyi; prompt önbelleğe alma ise modelin yeniden hesaplamaktan kaçınabileceği veriyi değiştirir. Genişlikler kavramsaldır ve ek sıkıştırma katmanı gösterilmemiştir.
GPT‑5.6 ile sağladığımız verimlilik kazanımları; araştırma, çıkarım ve ajan tabanlı düzeneğimizi kapsayan teknoloji yığını genelindeki iyileştirmelerin yıllar içinde birikmesiyle elde edildi. Bu iyileştirmelerin birçoğunun sağlanmasında GPT‑5.6'nın oynadığı rol, optimizasyonların giderek hızlanacağı konusunda bizi iyimser kılıyor. Teknoloji yığınımızdaki temel iyileştirmelerin yanı sıra çekirdek optimizasyonu gibi alanlarda daha kapsamlı optimizasyonlar yapmayı sürdüreceğiz. Arka planda devam eden bu iyileştirmeleri, daha geniş kitlelerin erişebileceği ve maliyet açısından daha verimli bir zekâ olarak kullanıcılarımıza ve müşterilerimize sunmayı sabırsızlıkla bekliyoruz.
Bu yazıya katkılarından dolayı Teknik Ekip üyeleri Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson ve Steve Coffey'ye özellikle teşekkür ederiz.


