Ironclad ile bilgisayar kullanımını geliştirmek
Sözleşme alanındaki bir araştırma iş birliği, yapay zekâ ajanlarını karmaşık profesyonel işlerde eğitmemize ve değerlendirmemize nasıl yardımcı oluyor?
GPT‑6 Astra’yı tanıtırken modellerimizin belge hazırlamaktan web sitelerini test etmeye kadar profesyonel işlerde bilgisayar kullanımı konusunda ne kadar ilerlediğini gösterdik. Sıradaki hedefimiz, ajanların karmaşık iş problemlerini çözmek için özel amaçlı yazılımları daha yetkin ve verimli biçimde kullanmasını sağlamak. Modelleri bir şirketin iş kurallarını anlayacak, çok adımlı iş akışlarını yürütecek ve yaptıkları işin başlangıçtaki gereksinimleri karşıladığını doğrulayacak şekilde nasıl eğitebileceğimizi araştırıyoruz.
Bu araştırmayı hızlandırmak için bu iş akışlarını en iyi bilen sınırlı sayıda yazılım şirketiyle doğrudan iş birliği yapıyoruz. Birlikte, zorlayıcı ve yüksek değer taşıyan görevleri belirleyip modellerimizi eğitmek ve değerlendirmek için araştırma problemlerine dönüştürüyoruz. Böylece modellerimizi gerçek iş uygulamalarında daha yetkin ve faydalı hâle getiriyoruz.
İlk iş ortağımız, yapay zekâ destekli sözleşme yönetiminin liderlerinden Ironclad. Ironclad ekibiyle yakın çalışarak ajanların sözleşmeleri, onayları ve yeniden kullanılabilir hukuki hükümleri yapılandırmasını gerektiren görevler geliştirdik ve bu karmaşık iş akışlarında ilerleme kaydettiğimizi gösterdik. Ironclad’ın uzmanlığı, başarının tanımlanmasında ve gerçek müşteri ihtiyaçlarının doğrudan en üst seviye model geliştirme sürecine taşınmasında kilit rol oynadı. İş birliği için kendilerine teşekkür ediyor, birlikte başardıklarımızı paylaşmaktan heyecan duyuyoruz.
GPT‑6 Astra, Ironclad görevleriyle eğitilen ilk en üst seviye modelimiz. Araştırma değerlendirmemizde ortalama puanı GPT‑5.6 Sol’unkinden %32 daha yüksek, deneme başına tahmini süresi ise %48 daha düşüktü.1
Yazılım satın almak için bir süreç oluşturan hukuk operasyonları ekibini düşünün. Finans ekibinin belirli bir tutarın üzerindeki satın alımları onaylaması, güvenlik ekibinin belirli talepleri ve hukuk ekibinin standart dışı hükümleri incelemesi gerekebilir. Süreci kuran kişinin bu kısa listeyi bir talep formuna, belge şablonlarına, onay kurallarına ve nihai sözleşme kaydına dönüştürmesi gerekir.
Aynı işi yapan bir yapay zekâ ajanı da yazılımda ilerlerken bu gereksinimleri göz önünde bulundurmalıdır. Örneğin, harcama eşiği aşıldığında finans onayı gerekecek şekilde yapılandırma yapmalı ve eşiğin üstündeki ve altındaki taleplerin doğru yolları izlediğini kontrol etmelidir. Adımları tek tek doğru tamamlamak yeterli değildir: Kurulan süreç, ele almak üzere tasarlandığı farklı durumlarda da çalışmalıdır.
Ironclad çalışanları ve OpenAI’da Ironclad kullanan kişiler, araştırmacılarımızın hukuk, ticaret ve satın alma alanlarında 11 görev belirlemesine yardımcı oldu. Bunlar arasında gizlilik sözleşmelerini yapılandırma, satın alma onay süreçleri oluşturma ve yeniden kullanılabilir bir hukuki maddeyi talep sahibinin seçtiği yargı alanına uygun şekilde güncelleme gibi görevler vardı. Deneyimli bir kullanıcının bu işleri tamamlamasının görev başına ortalama 30 ila 40 dakika süreceğini tahmin ediyoruz.
Her görevi, karmaşıklığına bağlı olarak 8 ila 50 kritere göre değerlendirdik. Bu sayede modelin hangi kısımları doğru yaptığını ve nerelerde yetersiz kaldığını görebildik. Ironclad ayrıca, modellerin bu görevlerde pratik yapabilmesi için ürününün barındırılan yazılım ortamlarını sağladı. Araştırmacılarımız, tipik iş akışlarını temel alan sentetik eğitim görevleri2 geliştirdi ve modellerin pratik ve geri bildirim yoluyla gelişmesine yardımcı olmak için pekiştirmeli öğrenmeden yararlandı. İşi bilen kişilerle seçilen görevler, ayrıntılı kriterler ve modellerin pratik yapabileceği bir ortamın bir araya gelmesi, müşterilerimiz için en önemli gerçek dünya görevlerinde ilerleme kaydetmemizi sağlıyor.
Astra ile GPT‑5.6 Sol’u, her modelin en yüksek puanı aldığı akıl yürütme ayarlarında karşılaştırdık: Astra için Max, Sol için Yüksek. 11 araştırma görevinde Astra’nın ortalama puanı %55,0, GPT‑5.6 Sol’unki ise %41,6 oldu. Deneme başına tahmini ortalama süre, Sol’da 37,0 dakikayken Astra’da 19,2 dakikaya düştü.3 Astra’nın geliştirilmesinde kullanılan şirket içi bir model, bu görevlerde %63,7 ile daha da yüksek bir puan elde etti. Bu ek kazanımları gelecekteki modellere taşımayı hedefliyoruz.
Metrik | GPT‑5.6 Sol | GPT‑6 Astra |
Ortalama değerlendirme puanı | %41,6 | %55,0 |
Deneme başına tahmini ortalama süre | 37,0 dakika | 19,2 dakika |
Astra, simülasyonda deneme başına daha az sürede daha fazla görev gereksinimini karşıladı. Aşağıdaki iki kısa video, modellerin aynı araştırma görevini nasıl yerine getirdiğini gösteriyor. İlk videodaki Astra, tahmini 20 dakikada görev kriterlerinin yaklaşık %94’ünü; ikinci videodaki GPT‑5.6 Sol ise tahmini 32 dakikada yaklaşık %85’ini karşıladı.
GPT‑6 Astra, tahmini 20 dakikada görev kriterlerinin yaklaşık %94’ünü karşıladı.
GPT‑5.6 Sol, tahmini 32 dakikada görev kriterlerinin yaklaşık %85’ini karşıladı.
Ironclad’ın bu çalışmadaki rolü, müşterilerinin iyi bildiği bir zorluğu yansıtıyor: Sözleşme süreçleri, işletmenin dayandığı kuralları korurken istisnaları da ele alabilmelidir. Bir ajan, görevin ortasında bu kurallardan birini gözden kaçırırsa yazılım şirketinin ona güvenle verebileceği görevler sınırlanır. Bu durum, ajanlar karmaşık sözleşme görevlerinde daha yetkin hâle gelse de insan gözetiminin neden hâlâ önemli olduğunu ve kapsamlı bir sözleşme platformunun neden vazgeçilmez olmaya devam ettiğini gösteriyor. Araştırmacılarımızla çalışmak, Ironclad’a bu sorunları temel modelin geliştirme sürecine taşıma ve birlikte inceleme olanağı sunuyor.
Modeller daha yetkin hâle geldikçe Ironclad, onları daha fazla ürününde kullanma fırsatı buluyor. Hukuk ve iş birimleri için bu, güvendikleri kontrol mekanizmaları korunurken karmaşık sözleşme süreçlerindeki iş yükünün daha büyük bir kısmını yapay zekânın üstlenmesi anlamına gelebilir.
Sınırlı sayıda yazılım şirketini, bugünün ajanlarının hâlâ güvenilir biçimde tamamlayamadığı önemli profesyonel görevler üzerinde araştırma ve mühendislik ekiplerimizle doğrudan çalışmaya davet ediyoruz. Ekibinizin böyle bir görevi varsa somut bir örnek görmek isteriz: Ajandan ne yapmasını istiyorsunuz, nerede başarısız olduğunu gösteren kanıtlar neler ve başarılı bir sonucu nasıl değerlendirirsiniz? İş ortaklarımız ayrıca, işi derinlemesine bilen uzmanlar, güvenli bir test ortamı ve araştırmada güvenle kullanılabilecek veriler sağlayabilmelidir. Bunlar, başarısızlığın nedenlerini araştırmak ve modelin gelişip gelişmediğini ölçmek için bize bir başlangıç noktası sunar.
Ekibiniz bu tanıma uyuyorsa, araştırma iş birliği olanaklarını değerlendirmek için başvurun.
Yazar
Dipnotlar
- 1
- 2
SEC’nin EDGAR veri tabanında kamuya açık olan sözleşmelere kişisel bilgileri kaldırmak üzere tasarlanmış filtreler uyguladıktan sonra bu sözleşmelerden simülasyon görevleri oluşturduk. Eğitim veya değerlendirme için OpenAI müşteri verilerini, OpenAI’ın şirket içi sözleşmelerini ya da Ironclad müşterilerinin kamuya açık olmayan verilerini veya sözleşmelerini kullanmadık.
- 3


