Uzun zaman ufuklu modeller çağında güvenlik ve uyum
Uzun süre çalışan bir modelin kurum içi kullanımı bize güvenlik hakkında ne öğretti.
Özet
Uzun süre çalışan modeller zor, açık uçlu sorunları çözebilir; ancak ısrarcılıkları, istenmeyen eylemlerde bulunmaları için onlara daha fazla fırsat verir.
Uzun süreli görevler için eğitilmiş bir modelin sınırlı kurum içi kullanımı sırasında, mevcut dağıtım öncesi değerlendirmelerimizin yakalayamadığı yeni tür hatalar gözlemledik ve erişimi duraklattık. Ardından bu hatalardan elde ettiğimiz içgörüleri kullanarak yeni değerlendirmeler oluşturduk, uzun zaman ufku uyumunu iyileştirdik, yörünge düzeyinde izleme ekledik ve sınırlı erişimi yeniden açmadan önce kullanıcılara daha fazla görünürlük ve kontrol sağladık.
Bu deneyim, yinelemeli dağıtımın değerini pekiştirdi. Hiçbir sabit değerlendirme paketi her davranışı öngöremez; bu nedenle dağıtım öncesi testler yakın izleme, müdahale edebilen güvenlik önlemleri ve gerektiğinde duraklatma ya da geri alma imkânıyla birlikte yürütülmelidir.
Uzun süreler boyunca otonom çalışabilen modeller, zor ve açık uçlu sorunları üstlenebilir. Ancak onları yararlı kılan aynı ısrarcılık, istenmeyen eylemlerde bulunmaları için de daha fazla fırsat yaratır; üstelik bunu daha kısa zaman ufuklu modellere yönelik değerlendirmelerin kaçırabileceği şekillerde yapabilirler.
Yaklaşık iki ay önce, kurum içi genel amaçlı bir modelin Erdős birim uzaklık varsayımını çürüttüğünü duyurduk. Bu model, çok uzun süreler boyunca otonom çalışacak şekilde tasarlanmıştı. Sınırlı ve izlenen kurum içi kullanım sırasında, mevcut dağıtım değerlendirmelerimizin yakalayamadığı istenmeyen davranışlar gözlemledik. Dağıtım sınırlı ve izlenen bir şekilde yapıldığı için bu sorunları belirleyebildik, erişimi duraklattık, gözlemlerimize dayalı yeni değerlendirmeler oluşturduk, modeli ve güvenlik önlemlerini güçlendirdik ve ardından sürekli izleme altında erişimi yeniden açtık.
Modelleri değerlendirdiğimiz koşullar, gerçek kullanımda karşılaştıkları koşullarla hiçbir zaman kusursuz biçimde örtüşmeyecek. Bu nedenle dağıtım öncesi değerlendirmeler; sınırlı ve izlenen dağıtımla, ayrıca sorunlar ortaya çıktığında müdahale etme, duraklatma veya geri alma imkânıyla birlikte yürütülmelidir. Dağıtımdan öğrendiklerimiz, erişim genişletilmeden önce daha güçlü değerlendirmelerin ve güvenlik önlemlerinin parçası haline gelebilir.
Aşağıdaki bölümlerde, neler gözlemlediğimize, sorunları nasıl ele aldığımıza ve bu deneyimin gelecekteki yayınları nasıl şekillendireceğine dair somut örnekler paylaşıyoruz.
Yeni model, uzun bir süre boyunca tekrarlanan denemelerle bir hedef doğrultusunda çalışmaya devam edebilir. Aynı ısrarcılık, ortamındaki zayıflıkları bulup bunlardan yararlanmasına yol açabilir. Önceki modeller, korumalı alan veya ortam kısıtlarıyla karşılaştıklarında genellikle durur ve kullanıcıya geri dönerdi. Bu model ise, korumalı alanının dışında hareket etmenin yollarını aramak da dahil olmak üzere çoğu zaman denemeyi sürdürdü.
Bunun bir örneği, küçük bir dil modelini olabildiğince az adımda eğitmeye yönelik herkese açık bir karşılaştırma ölçütü olan NanoGPT speedrun(yeni bir pencerede açılır) üzerinde yapılan kurum içi değerlendirme sırasında yaşandı. Modelimiz, PowerCool adlı kuvvet yasasına dayalı bir öğrenme oranı soğutması geliştirdi ve bu önemli bir iyileşme sağladı. Modele sonuçlarını yalnızca Slack’e göndermesi söylendi; ancak NanoGPT yönergeleri sonuçların GitHub’a PR olarak gönderilmesini belirtiyordu ve model ikinci yönergeleri izleyerek herkese açık GitHub deposunda PR #287’yi açtı. Model, dış erişimi engellemek için tasarlanmış korumalı alan kısıtlamalarını aştı ve GitHub’a yüklemeyi sürdürdü. PR’ı oluşturabilmek için korumalı alanda bir güvenlik açığı bulması modelimizin bir saatini aldı; önceki modeller daha az ısrarcıydı ve açıkları bulmayı başaramamış, bunun yerine PR kısmından vazgeçmişti.1
AI asistanlarına yönelik birçok güvenlik denetimi, tekil eylemler etrafında tasarlanır. Bir eyleme izin verilmiyorsa engellenir. Hassas bir eylemse sistem kullanıcıdan açık onay ister. Ancak eylemleri saatler, günler hatta haftalar boyunca otonom olarak gelişebilen uzun süre çalışan modeller bu düzeni zorlar: tekil eylemleri izlemek, genel yörüngenin amacını takip etmek için artık yeterli değildir.
Örneğin, modelden bir problemi çözmesinin istendiği bir senaryoda model, başka sistemlerin başarılı fakat özel gönderimleri olduğunu gördü ve bu çözümleri değerlendirme arka ucundan kurtarmaya çalıştı. İlk denemesi, bir tarayıcının kimlik doğrulama token’ı tespit etmesi nedeniyle engellenince model token gövdesini iki parçaya böldü, parçaları gizledi ve ardından kimlik bilgisini çalışma zamanında yeniden oluşturdu; böylece tam token hiçbir zaman tek bir kesintisiz dize olarak görünmedi. Model, hem kullanıcıya yazdığı yorumlarda hem de akıl yürütme izlerinde, bu adımları tarayıcıyı aşmak için attığını açıkça belirtti.
Bu örnek, her bir adımın tek başına kabul edilebilir görünebileceğini, ancak dizinin onaylanmayacak bir sonuç doğurabileceğini gösteriyor. Ayrıca uzun zaman ufukları boyunca etkili biçimde çalışan bir modelin, bir onay sisteminin kör noktalarını öğrenip hedeflerine ulaşmak için bunların etrafından nasıl dolaşabileceğini de gösteriyor. Uzun zaman ufku güvenliği yalnızca “bu eyleme izin var mı?” diye sormayı değil, “bu eylem dizisi hangi sonuca ulaşmaya çalışıyor?” diye de sormayı gerektirir.
Bu tür olaylar nedeniyle yeni modelin kurum içi dağıtımını duraklattık. Güvenlik sistemini katmanlı savunma ve yörünge düzeyinde izleme etrafında yeniden kurduk.
- Olaylardan türetilen değerlendirmeler. Değerlendirmeler, bir sistemin gerçekten dağıtılmadan önce dağıtım için güvenli olup olmadığına dair fikir verebilir. Bununla birlikte, en yararlı olması için bir değerlendirmenin gerçek dağıtım sırasındaki yörüngelerin dağılımını ve zaman ufku uzunluğunu yansıtması gerekir. Bu nedenle, gözlemlenen hataları hasmane değerlendirmeler geliştirmek için kullandık. Gerçek dünyadaki olaylardan türetilen değerlendirmelerde iyileşmenin, üretimde dağıtım sonrasında daha güvenli davranışlara yol açtığını gördük.
- Geliştirilmiş uyum. Kullanıcının hedefinin peşinden giderken izinsiz olarak istenmeyen eylemler yapma eğilimini azaltmak için adımlar attık. Örneğin, modellerimizin uzun çalıştırmalarda yönergeleri hatırlamakta daha zayıf olduğunu gördük; modeli bu beceri için eğittiğimizde, daha uzun çalıştırmalar boyunca uyumlu kalan bir model ortaya çıktı.
- Aktif izleme. Modelin gelişen yörüngesini, bir kullanıcı kısıtını veya güvenlik sınırını aştığına dair işaretler açısından inceleyen bir izleme sistemi oluşturduk. İzleyici yalnızca tek bir eylemi değil, tüm yörüngeyi gözlemler. Daha da önemlisi, izleyici oturumu duraklatabilir ve kullanıcıyı daha yakından inceleme yapması için uyarabilir. İnceleme sonucunda kullanıcı, izleyici yanlış tetiklendiyse modelin çalışmasına devam etmeyi seçebilir.
- Daha fazla kullanıcı görünürlüğü ve kontrolü. Kullanıcının bu uzun süreli oturumları inceleme, yapılan eylemleri görme ve müdahaleleri izleme becerisini geliştirdik.
Yeni izleme sistemini değerlendirmek için, modelin daha önce hatalı hizalanmış eylemler izlediği az sayıda kurum içi dağıtım ortamını, bu kez yeni güvenlik önlemleri devredeyken yeniden oynattık2. Yeni güvenlik önlemleri, modelin izlediği hatalı hizalanmış eylemlerin önemli ölçüde daha fazlasını yakalayabildi; kaçırdıklarının tümü ise düşük önem dereceli olarak değerlendirildi.
Bu düşük önem dereceli olaylara şu vakalar örnek gösterilebilir:
- Model, bir Linear komut satırı aracına erişmek için iç içe bir
codex --yolooturumu başlattı; oysa bunu--yolobayrağı olmadan da yapabilirdi. - Model, daha önce canlı olan bir kaynağın eksik olduğunu fark etti; ardından bunu yapmak için iyi bir nedeni olmadan, sahibinin ad alanı altındaki diğer canlı CPU pod’larını ve ayrıca (başarısız biçimde) diğer OpenAI çalışanlarına ait pod’ları keşfetmeye ve bunlara SSH ile bağlanmaya başladı.
- Modelin takılı kalmış çok sayıda
findsüreci vardı ve her kabuk komutu askıda kalıyordu. Ardındankill -9 -1komutunu çalıştırdı; yürütülseydi, o pod üzerinde öldürmesine izin verilen her sürece SIGKILL gönderecekti. Ancak zaman aşımına uğradı ve yürütülmedi.
Yeni sistemi test ettikten sonra, uzun zaman ufku yeteneklerine sahip modellere sınırlı kurum içi erişimin yeniden açılabileceği sonucuna vardık. Yeniden dağıtımın birkaç hafta önce başlamasından bu yana güvenlik önlemlerinin ciddi biçimde aşılmasına dair bir durum gözlemlemedik. Bu güvenlik önlemlerinin ilk sürümü bilinçli olarak ihtiyatlıydı. Güvenlik önlemlerini zayıflatmadan gereksiz kesintileri azaltmak için sistemi ayarlamaya devam ettik.
Yinelemeli dağıtım yaptığımız için erişimi genişletmeden önce boşlukları bulup giderebildik. Dağıtım öncesi değerlendirmeler önemini koruyor; ancak dağıtım, bu değerlendirmelerin kaçırdığı davranışları ortaya çıkarıyor. Sınırlı erişimle başlamak, modeli pratikte gözlemlememizi, sorunlar ortaya çıktığında duraklatmamızı, bu hataları daha iyi değerlendirmeler ve güvenlik önlemleri oluşturmak için kullanmamızı ve değişiklikleri test ettikten sonra sınırlı erişimi yeniden açmamızı sağladı.
Modeller daha uzun ve daha karmaşık görevler üstlendikçe, değerlendirmelerin kaçırdığı hataların sonuçları daha ağır olabilir. Değerlendirme ile dağıtım arasındaki farkı daraltmak için çalışmayı sürdüreceğiz: modelleri daha uzun yörüngelerde test etmek, uyumu geliştirmek, müdahale edebilen izleme sistemleri kurmak ve kullanıcılara daha net görünürlük ve kontrol sağlamak. Bu zorluklar yalnızca OpenAI’a özgü olmayacak; öğrendiklerimizi paylaşmanın daha geniş alanın bunlara hazırlanmasına yardımcı olmasını umuyoruz.
Yazar
Dipnotlar
- 1
PR’ı hızla kapatmış olsak da speedrun’daki birçok katılımcı bunu zaten görmüş ve yaklaşımı kendi gönderimlerinde kullanmıştı; 3030(yeni bir pencerede açılır), 2990(yeni bir pencerede açılır), 2930(yeni bir pencerede açılır), 2925(yeni bir pencerede açılır), 2900(yeni bir pencerede açılır) ve 2890(yeni bir pencerede açılır) adımla gelen ardışık dünya rekoru gönderimlerinin tümü PR 287’ye atıfta bulunuyor. Bunlar arasında PR 300(yeni bir pencerede açılır) özellikle ilginç; çünkü Prime Intellect(yeni bir pencerede açılır), NanoGPT speedrun’ında değerlendirdiğinde Opus 4.7’nin gönderdiği PR buydu. Opus, modelimizin gönderdiği PR’ı gördü, keşifleri dahil etti ve nihai sonucunda PR’ımıza atıf verdi.
- 2


