Yükleniyor...
Bugün, geniş çapta devreye aldığımız en yetenekli model olan GPT‑6 Astra'yı kullanıma sunuyoruz. Astra, Risklere Hazırlık Çerçevemiz kapsamında Kritik siber güvenlik yeteneği düzeyine ulaşan ilk modelimizdir.
Bu sürümün güvenliği hakkında bilinmesi gereken en önemli noktalar şunlardır:
- GPT‑6 Astra, siber yetenekler açısından önemli bir ilerleme kaydetmiş ve Kritik eşiğimizi karşılamıştır. Bu, GPT‑6 Astra'nın doğru araçlara ve erişime sahip olduğunda, her adımda bir insan tarafından yönlendirilmeden daha önce bilinmeyen güvenlik açıklarını bulabileceği ve iyi korunan pek çok sistemde bu açıklardan yararlanmanın yeni yollarını geliştirebileceği anlamına gelir. Bu nedenle, ister kötüye kullanımdan ister uyumsuzluktan kaynaklansın, modelin zararlı siber eylemlerde bulunması riskine karşı korumalarımızı önemli ölçüde güçlendirdik. Ayrıca daha sıkı yalıtım, kontrol noktalarının şifrelenmesi, düşünce zincirleri (CoT) dahil tüm işlem akışlarının sürekli izlenmesi ve şirket içi kullanımdan önce geçilmesi gereken bir uyum değerlendirmesi gibi önlemler alarak Astra ve benzer modellerin şirket içindeki geliştirme ve devreye alım süreçlerini güvence altına aldık.
- GPT‑6 Astra, önceki modellere kıyasla önemli ölçüde daha dayanıklıdır. Yeni dayanıklılık odaklı güvenlik eğitimi tekniklerinden yararlanan GPT‑6 Astra, uzun işlem akışlarında da jailbreak girişimlerine karşı GPT‑5.6 Sol'dan önemli ölçüde daha dayanıklıdır. Bunu çevrimdışı testlerden ve kapsamlı şirket içi ve harici jailbreak testi ve düzeltme programımızdan biliyoruz. Potansiyel olarak yüksek riskli olduğu belirlenen kullanıcılar için modele, ret sınırını daha ihtiyatlı olacak ve daha geniş bir yelpazedeki çift kullanımlı riskleri kapsayacak şekilde ayarlama yeteneği de kazandırdık. Astra'nın önceki test dönemlerinde belirlenen jailbreak girişimlerine karşı dayanıklı kalmasını sağlamak için regresyon testlerinden yararlanıyoruz. Ayrıca geliştirmelerimizi doğrulamak amacıyla en yeni şirket içi red teaming saldırganlarımızla yeni otomatik red teaming turları gerçekleştirdik.
- GPT‑6 Astra, GPT‑5.6 Sol'dan daha uyumludur. Astra, model uyumunda önemli bir ilerleme sağlıyor ve ön eğitim verilerimizin bileşiminden pekiştirmeli öğrenme sırasındaki puanlamamıza kadar uzanan uyum geliştirmeleri içeriyor. Yeni bir uyum değerlendirmeleri paketi(yeni bir pencerede açılır) sunuyor ve GPT‑6 Astra'nın güvenlik sınırlarına uyma ve kendisine tanınan kapsam içinde kalma konusunda daha başarılı olduğunu görüyoruz. 54.000'den fazla şirket içi Codex görevinin(yeni bir pencerede açılır) kullanıldığı bir simülasyonda Astra için yüksek önem dereceli uyumsuz davranışlara ilişkin uyarı sayısı, Sol'un yaklaşık yarısı kadardı.
- Uyumsuzluk izlemeyi geniş çapta devreye alıyoruz. Model uyumunu, modellerimizin olası uyumsuz davranışlarını önlemenin başlıca yolu olarak görüyoruz. Bununla birlikte izleme, en üst seviye modellerin davranışlarına ilişkin kapsamlı görünürlük sağlayarak uyum ve güvenliği daha da geliştirme fırsatlarını ortaya çıkarıyor. Ayrıca tespit edilen uyumsuz davranışlara karşı ek bir koruma katmanı görevi görüyor. Bu nedenlerle, önemli bir bilgi işlem maliyetine rağmen Astra'nın harici devreye alımında araç kullanan tüm çıkarım süreçlerine uyumsuzluk izleme özelliğini de ekledik. Bu sistem, şirket içi düzenimize paralel biçimde çalışıyor.
- GPT‑6 Astra’nın izlenebilirliği, GPT‑5.6 Sol'a kıyasla azalmıştır. GPT‑6 Astra'nın izlenebilirliği(yeni bir pencerede açılır) ve kontrol edilebilirliği(yeni bir pencerede açılır) hakkında kapsamlı araştırmalar yürüttük. GPT‑6 Astra'nın kendi CoT’sini kontrol etme konusunda GPT‑5.6 Sol'dan daha yetenekli olduğunu ve CoT'sinde aleyhine kanıt oluşturabilecek bilgilere yer verme olasılığının daha düşük olduğunu belirledik. Hasmane koşullarda (modeli, izleme sistemlerimizden kaçınmaya zorladığımız durumlarda), modelin değerlendirmelerde kasıtlı olarak düşük performans gösterirken tespit edilmeden kalabildiğini ve belirli sabotaj görevlerini(yeni bir pencerede açılır) yerine getirmesi istendiğinde bazen şirket içi izleme sistemlerimizden kaçabildiğini gördük. Steganografik CoT akıl yürütmesine, örneğin gizli akıl yürütmenin sıradan ve görünüşte ilgisiz metinlerin içine saklanmasına ilişkin bir kanıta rastlamadık. Bu da izleme sistemlerinden kaçma riskinin büyük ölçüde daha düşük düzeyde akıl yürütme gerektiren görevlerle sınırlı olabileceğini gösteriyor.
- Bu bulgular, Astra sınıfı modellerin hasmane koşullar altında CoT izleme sistemlerimizden kaçabileceğini gösteriyor. Şu anda bu bulgular büyük ölçüde hasmane değerlendirmelere (modele izlemelerden kaçınmasını söylediğimiz durumlara) dayanıyor. Genel uyum değerlendirmelerimiz ise Astra'nın güvenlik kısıtlamalarını ihlal etme olasılığının genel olarak GPT‑5.6 Sol'dan daha düşük olduğunu gösteriyor.
- Bununla birlikte bu eğilimi ciddiye alıyor ve modellerimiz daha yetenekli hale geldikçe söz konusu bulgularla bunların izlenebilirlik açısından sonuçlarını araştırmayı sürdürüyoruz. OpenAI, düşünce zincirlerinin izlenmesini korumak ve bundan yararlanmak için çalışmalar yürütmüştür. CoT izlenebilirliğini korumak, araştırma programımızın temel hedeflerinden biridir. Ancak bu sonuçlar, modelin düşünce zincirini incelemenin ötesine geçen uyum denetimi teknikleri geliştirmenin önemini de ortaya koyuyor.
- GPT‑6 Astra, internette gezinirken ve iş yeri ortamlarında daha sorumlu davranır: GPT‑6 Astra, istem enjeksiyonlarına karşı GPT‑5.6 Sol'dan önemli ölçüde daha dayanıklıdır. Modelin davranışını gerçekçi internet gezinme senaryolarında ve profesyonel bilgisayar ortamlarında da test ettik. Modelin GPT‑5.6 Sol'a kıyasla uyumsuz ve potansiyel olarak yıkıcı eylemlerde, örneğin yetkisiz işlemlerde bulunma, veri kaybına yol açma, gereğinden fazla erişim sağlama veya denetimleri atlatma olasılığının önemli ölçüde daha düşük olduğunu gördük. Şiddet içeren saldırıların planlanmasına yardım etme veya dolandırıcılık yapma gibi zararlı taleplerle ajan ortamlarında karşılaştığında da daha güvenli davranır.
- GPT‑6 Astra, daha yüksek riskli senaryolarda önemli ölçüde daha güvenlidir. GPT‑6 Astra, üretim ortamından ve insanların yürüttüğü hasmane red teaming çalışmalarından alınan zorlu isteklere GPT‑5.6 Sol'dan daha güvenli yanıt verir. Astra, güvenli olmayan istekleri güvenle tamamlama ve zararsız istekleri gereksiz yere reddetmekten kaçınma açısından Pareto iyileşmesi sağlar. Bu iyileştirmeler, zarar riskinin açık bir istekten değil daha geniş bağlamdan kaynaklandığı yüksek önem dereceli senaryoları da kapsar. Astra ayrıca 18 yaşından küçük kullanıcılar için yaşa uygun güvenlik sınırlarını daha tutarlı biçimde uygular.
Daha fazla bilgi için tam sistem kartına(yeni bir pencerede açılır) bakın.
Yazar
OpenAI


