Yapay zeka çağı için bir performans karnesi
CFO'lardan her yerde duyduğum soru basit: Yapay zeka harcamalarımızdan nasıl daha fazla değer elde ederiz?
Piyasa, yıllar boyunca yazılımın başarısını benimsenme (satın alınan lisanslar, aktif kullanıcılar, yenilenen lisanslar) üzerinden ölçtü. Yapay zekanın değerini anlamak için daha güçlü bir ölçüte ihtiyaç var: tamamlanan iş.
CFO'ların ve diğer iş liderlerinin karşısındaki temel ekonomik soru şu: Yapay zekanın tamamladığı işin değeri, bu işi üretmenin maliyetinden daha hızlı artıyor mu?
Bu soruya yanıt vermek için token başına maliyet gibi bir ölçütün ötesine bakmak gerekir. Daha düşük maliyetli bir modelin token'ları daha ucuz olabilir; ancak iyi sonuç almak daha fazla deneme, daha fazla zaman veya daha fazla insan incelemesi gerektirebilir. Daha yetkin bir modelin token'ları daha pahalı olabilir; ancak aynı görevi tek seferde tamamlayabilir. Asıl önemli olan, başarılı bir sonuç üretmenin toplam maliyetini, o sonucun yarattığı değerle karşılaştırmaktır.
Yapay zeka çağı için nihai karne, "Dolar başına faydalı zeka" olarak düşünülebilir. Bu ölçüt dört temel soruya yanıt verir:
- Yapay zeka gerçekten önemli işleri tamamlıyor mu?
- Başarıyla tamamlanan her görevin maliyeti nedir?
- İnsanlar sonuca güvenebilir mi?
- Kullanım arttıkça yapay zekaya harcanan her dolar daha fazla değer üretiyor mu?
İşin kendisinden başlayın.
Yapay zeka kaç müşteri sorununu çözmeye yardımcı oldu? Kaç kod değişikliğinin yayına alınmasına katkı sağladı? Kaç sözleşmeyi inceledi? İnsanlara ne kadar zaman kazandırdı? Doğru bağlam doğru anda mevcut olduğu için kaç karar daha iyi hale geldi?
Token'lar, insanların kullanabileceği işlere dönüştüğünde değer yaratır. Modeller daha yetkin hale geldikçe daha uzun ve karmaşık görevleri üstlenebilir: bağlamı koruyabilir, çok adımlı süreçlerde akıl yürütebilir, farklı araçlar arasında çalışabilir ve ilerledikçe uyum sağlayabilir.
Başlamak için en iyi yer tek bir iş akışıdır. "Tamamlandı"nın ne anlama geldiğini tanımlayın ve bu sonucu işin gerçekleştiği sistemde ölçün.
Bir destek ekibi için "tamamlandı", bir müşteri sorununun çözülmesi anlamına gelebilir. Bir mühendislik ekibi için testlerden geçen bir kod değişikliği olabilir. Bir hukuk ekibi için ise doğru ve zamanında incelenmiş bir sözleşme anlamına gelebilir.
Tahmin değerlendirmesine hazırlanan bir finans ekibini düşünün. Nihai karar aşamasına gelmeden önce ekipler işin büyük kısmını zaten tamamlamış olur: en güncel tahmini bulur, verileri Excel veya Google E-Tablolar'a aktarır, değişiklikleri belirler, çalışma sayfaları arasında mutabakat sağlar, slaytları yeniden hazırlar ve tüm çıktının baştan sona tutarlı olduğundan emin olur.
ChatGPT Work bu sürecin büyük bölümünü üstlenebilir. Böylece ekip, asıl önemli sorulara odaklanmak için daha fazla zaman kazanır: Ne değişti? Neden? Bundan sonra ne yapmalıyız?
Pratikte dolar başına faydalı zeka tam olarak budur. İnsanlar zamanlarının daha büyük bölümünü muhakeme, yaratıcılık ve uzmanlık gerektiren işlere ayırırken daha fazla iş daha hızlı tamamlanır.
Bir sonraki soru, bu işi iyi şekilde tamamlamanın neye mal olduğudur.
Yapay zeka görevleri birbirinden çok farklı olabilir. Hızlı bir yanıt çok az bilgi işlem kaynağı gerektirebilir. Buna karşılık kodlama, araştırma veya finans iş akışları daha derin akıl yürütme, araç kullanımı ve birçok işlem adımı içerebilir. Bu daha karmaşık görevler daha fazla bilgi işlem kaynağı gerektirebilir; ancak çok daha fazla değer de yaratabilir.
Model düzeyinde, başarılı görev başına maliyet; fiyata, kullanılan bilgi işlem kaynağı miktarına ve doğru sonuca ulaşma olasılığına bağlıdır. Bir işletme için toplam maliyete çalışan zamanı, insan incelemesi, yeniden denemeler ve yeniden çalışma da dahildir.
Hesaplama basittir:
- İşi tamamlamanın toplam maliyetini hesaplayın.
- Gerekli kalite eşiğini karşılayan görevleri sayın.
- Toplam maliyeti başarılı görev sayısına bölün.
Bu yüzden token başına en düşük fiyat, her zaman sonuç başına en düşük maliyet anlamına gelmez. En üst seviye model, rutin bir istekte bile en iyi değeri sunabilir; doğru yanıtı tek denemede üreterek yeniden denemeleri, gecikmeyi, inceleme ihtiyacını ve toplam hesaplama maliyetini azaltabilir.
Kademeli bir model ailesi, müşterilere bu denklemi optimize etmek için daha fazla seçenek sunar. Geçen hafta kullanıma sunduğumuz GPT‑5.6'nın üç kademesi vardır: Sol en gelişmiş modelimizdir; Terra performans ile maliyeti dengeler; Luna ise en hızlı ve en uygun maliyetli modelimizdir.
Bu kademeler yararlı başlangıç noktaları sunar. Nihai olarak doğru modeli, görevin toplam ekonomisi belirlemelidir. Bir müşteri hızlı ve yüksek hacimli bir iş akışı için Luna'yı, daha fazla derinlik gerektiren işler için Terra'yı veya daha güçlü akıl yürütmenin daha az denemeyle en iyi sonucu verdiği durumlarda Sol'u kullanabilir.
GPT‑5.6'yı her token'dan daha fazla faydalı iş çıkaracak şekilde eğittik. Artificial Analysis Kodlama Ajanı Endeksi'nde max akıl yürütme düzeyiyle GPT‑5.6 Sol, başka bir önde gelen modele kıyasla %54 daha az çıktı token'ı kullanırken yeni bir en iyi performans seviyesine ulaştı. Aşağıdaki grafikte bu karşılaştırma gösterilmektedir.
DeepSWE v1.1: Uzun soluklu mühendislik görevleri; GPT‑5.6 Sol, %72,7 ile yeni bir zirveye ulaşıyor; Claude Fable 5'in %69,9 olan sonucunu geride bırakırken tahmini API maliyetini %36,2 azaltıyor.
GPT‑5.6 ailesi genelinde hedef aynı: harcanan her dolar karşılığında daha fazla başarılı iş. Daha yüksek verimlilik, mevcut görevleri daha uygun maliyetli hale getirir. Daha güçlü yetenekler ise tamamen yeni iş türlerini mümkün kılar.
Her yeni model nesli, bu denklemin iki tarafını da iyileştirmelidir. Müşteriler daha değerli işleri tamamlayabilmeli; aynı zamanda her görevi tamamlama maliyeti düşmeye devam etmelidir.
Üçüncü ölçüt güvenilirliktir.
Yapay zeka benimsemesi genellikle aşamalar halinde derinleşir. Önce yapay zeka, taslak hazırlamaya yardımcı olur. Ardından bağlamı bulur, araçlar ve veriler arasında akıl yürütür. Zamanla aksiyon almaya, istisnaları yönetmeye ve iş akışlarını tamamlamaya başlar; gerektiğinde insan değerlendirmesi ve kontrolü devrede kalır.
Her adım daha fazla değer yaratır ve sistemden daha fazlasını bekler.
Güvenilirliğin doğrudan ekonomik değeri vardır. Sonuçlar doğru, iyi kaynaklandırılmış, tutarlı ve gerektiğinde doğru şekilde üst seviyeye taşınmışsa insanlar işi incelemeye, düzeltmeye ve tekrarlamaya daha az zaman harcar. Başarılı görevlerin maliyeti düşer ve kuruluşlar yapay zekayı daha önemli iş akışlarında kullanma güveni kazanır.
Ekipler üç sonucu takip ederek bunu somut hale getirebilir:
- Kullanıma hazır: Sonuç, teslim edildiği haliyle kalite eşiğini karşılar.
- Düzeltme gerekiyor: Sonuç için yeni bir deneme veya insan düzenlemesi gerekir.
- İnsan müdahalesi gerekiyor: İşi tamamlamak için bir kişinin devreye girmesi gerekir.
Bu ölçütler, yalnızca model doğruluğuna bakmaktan daha kapsamlı bir tablo sunar. Yapay zekanın bir projeyi tamamlamak için gereken işi gerçekten azaltıp azaltmadığını gösterir.
Güvenilirlik için net sınırlar da gerekir. Yapay zeka, taslak hazırlama aşamasından eyleme geçmeden önce kuruluşlar şunları tanımlamalıdır:
- Sistemin hangi verilere erişebileceği.
- Hangi sistemleri kullanabileceği veya değiştirebileceği.
- Bir kişinin ne zaman bir eylemi incelemesi veya onaylaması gerektiği.
Güvenlik, emniyet, gizlilik ve kontrol daha derin kullanımın temelini oluşturur. İnsanların sistemin nasıl davrandığını, verilerinin nasıl işlendiğini ve eylemlerinin nasıl yönetildiğini anlaması gerekir.
ChatGPT Work, ChatGPT Enterprise'ın güvenlik, gizlilik, uyumluluk ve çalışma alanı yönetimi temeli üzerine inşa edilmiştir. Bu sayede kuruluşlar, uygun gözetimi korurken yapay zekaya daha fazla bağlam ve daha değerli iş akışlarına erişim sağlayabilir.
Yetkinlik ilk kullanımı sağlar. Güvenilirlik ise yapay zekayı işlerin yapılma biçiminin bir parçası haline getirir.
Son soru, ölçek büyüdükçe ekonominin iyileşip iyileşmediğidir.
Şirketler bunu aynı iş akışını zaman içinde takip ederek ölçebilir. Kalite eşiğini kaç görevin karşıladığını, bu görevleri tamamlamanın toplam maliyetini ve başarılı görev başına maliyeti izleyin. Tamamlanan iş toplam maliyetten daha hızlı artıyor ve kalite korunuyor veya iyileşiyorsa, her yapay zeka doları daha fazla değer üretiyor demektir.
Bilgi işlem gücü bu denklemin merkezindedir.
Bilgi işlem gücü; araştırmaları ve yapay zekanın tamamladığı her görevi mümkün kılar. Ürün kalitesini, hızı, güvenilirliği, kullanılabilirliği ve maliyeti şekillendirir. Eğitim için kullanılan bilgi işlem gücü, gelecekteki yetkinlikleri geliştirir. Çıkarım için kullanılan bilgi işlem gücü ise bugün faydalı iş üretir. İkisi de müşteriler için daha iyi sonuçlara dönüşmelidir.
Daha iyi modeller, daha verimli çıkarım, amaca özel donanım, daha yüksek kullanım oranı, daha akıllı yönlendirme ve daha güçlü ürün tasarımı, hesaplama kaynağından elde edilen getiriyi artırır. Her altyapı nesli, daha yetkin modellerin eğitilmesine yardımcı olur. Daha iyi algoritmalar, donanım ve yazılım da bu modellerin daha verimli sunulmasını sağlar.
Müşteriler bu iyileştirmeleri somut biçimde deneyimler: daha iyi yanıtlar, daha hızlı sonuçlar, daha az düzeltme, daha güvenilir ürünler ve tamamlanması gereken işler için daha düşük maliyet.
Bu kazanımlar birbirini büyütür. Daha iyi altyapı, araştırmayı hızlandırır. Araştırma daha yetkin ve verimli modeller üretir. Daha iyi modeller, ürünleri iyileştirir. Daha iyi ürünler, benimsemeyi, öğrenmeyi ve geliri artırır. Bu büyüme de yeni nesil araştırma, hesaplama, dağıtım ve güvenlik çalışmalarına sürekli yatırım yapılmasını destekler.
OpenAI tüm bu parçaları ortak bir zeka platformunda bir araya getirir. İnsanlar bu platformu ChatGPT ve ChatGPT Work üzerinden kullanır. Geliştiriciler Codex ve API ile bunun üzerine ürünler geliştirir. Kurumsal işletmeler ise bu platformu işlerin gerçekleştiği sistemlere taşır.
Katmanlardan biri geliştiğinde, her ürün ve müşteri bundan fayda sağlayabilir.
Bu dört ölçüt birlikte, dolar başına faydalı zekanın gelişip gelişmediğini gösterir.
Faydalı iş, yapay zekanın ne ürettiğini gösterir. Başarıyla tamamlanan görev başına maliyet, sonuca ulaşmak için ne gerektiğini gösterir. Güvenilirlik, insanların üretilen işin ne kadarını güvenle kullanabildiğini gösterir. Ölçek arttıkça yaratılan değer ise her doların ve her hesaplama biriminin zaman içinde daha fazla iş çıkarıp çıkarmadığını gösterir.
Amaç; insanların daha anlamlı işler yapmasına, daha iyi kararlar almasına ve işlerinin belirgin şekilde insan muhakemesi ve yaratıcılık gerektiren bölümlerine daha fazla zaman ayırmasına yardımcı olan yapay zeka geliştirmektir.
Bizim görevimiz, her yeni nesilde bu denklemi iyileştirmektir: daha yetkin modeller, daha hızlı ve daha güvenilir sonuçlar, müşterilerin tamamlanmasını istediği işler için daha düşük maliyet.
Yapay zeka zamanla daha fazla insan ve kuruluş için bu şekilde daha faydalı hale gelir.


