En üst seviye yapay zekâ eğitimi için güvenlik gerekçelerine doğru
En üst seviye pekiştirmeli öğrenme eğitim çalışmalarından herhangi birine devam etmeden önce yapılandırılmış güvenlik belgelerinin zorunlu tutulması gereken yeni bir döneme girdiğimize inanıyoruz. İdeal olarak bu belgeler, güvenliğin kritik önem taşıdığı diğer sektörlerde kullanılan “güvenlik gerekçeleri” düzeyine ulaşmalıdır. Bunlar riske ilişkin kapsamlı, yapılandırılmış ve kanıta dayalı argümanlardır. Güvenlik gerekçelerini, çalışmalarımıza yön veren ve ulaşmaya çalıştığımız bir hedef olarak görüyoruz. Bununla birlikte, yapay zekânın yeteneklerindeki her yeni düzeyde ortaya çıkan karmaşıklık nedeniyle, bu gerekçeleri yapay zekâ modelleri için havacılık veya nükleer enerjideki kadar titiz biçimde oluşturmanın zorluklarını da kabul ediyoruz. Bu uygulamaları sistematik kurallara bağlayacak bir çerçeve üzerinde çalışıyoruz.
Aşağıda, en üst seviye yapay zekâ eğitiminin güvenlik gerekçelerinde yer alması gerektiğini düşündüğümüz bazı başlangıç ilkeleri bulunuyor. Bu iyi uygulamalar, bugüne kadar öğrendiklerimizi yansıtıyor. Dikkatli bir geliştirme süreci için kurum içi işleyişimizi iyileştirmeye devam ettikçe bunların da gelişmesini bekliyoruz. Mevcut yaklaşımımızı şeffaf biçimde ortaya koymak ve topluluğun geri bildirimlerini almak için bunları şimdiden paylaşıyoruz. Bu belgenin en üst seviye pekiştirmeli öğrenme eğitimine odaklandığını unutmayın; kurum içi ve dışı kullanıma sunma süreçlerinde çok daha geniş bir hizalama özellikleri kümesinin dikkate alınması gerekir.
Güvenlik gerekçeleri, teknik yapının üç boyutunu kapsamalıdır: hizalama eğitimi, yalıtım ve izleme. Bu önlemler, modelin hizalamadan sapan eylemlerde bulunmaya çalışmamasını; çalışsa bile yalıtımı aşmasının zor olmasını ve herhangi bir zarar oluşmadan izleme sistemi tarafından tespit edilmesini sağlamaya yardımcı olur.
Model hizalama: İlk savunma hattı, modelleri hizalanmış olacak şekilde, yani amaçladığımız biçimde güvenilir davranmaları için eğitmek olmalıdır. Bu, şunları içerebilir:
Eğitim ortamları ve puanlama: Eğitim sırasında ödül sistemini istismar eden davranışların olumlu pekiştirilmesini önleyerek modellerin hizalamadan sapan davranışlar geliştirme riskini azaltın. Bu, şunları içerebilir:
Otomatik veri kümesi incelemeleri: Hizalamadan sapan eylem dizilerinin, amaçlanan davranış yerine açıkları istismar ederek yüksek ödül almasına izin verebilecek hatalı pekiştirmeli öğrenme ortamlarını bulup düzeltmek için ajanlar kullanın. Böylece eğitim sırasında hizalama sapmasının pekiştirilmesi olasılığını azaltın.
Manuel veri kümesi incelemeleri: Hizalamadan sapan davranışları istemeden pekiştirebilecek kusurlu görevleri belirlemek için otomatik red teaming çalışmalarını, veri kümeleri üzerinde manuel incelemeler ve kalite kontrolleriyle destekleyin.
Puanlayıcıların ayarlanması: Puanlayıcıları, modelin eğitim sırasında pekiştirmeli öğrenme ortamlarını istismar etme veya manipüle etme girişimlerini cezalandıracak şekilde ayarlayın.
Önceki çalışmaların analizi: Puanlayıcıların amaçlandığı gibi çalıştığından emin olmak için önceki deneylerin işlem kayıtları üzerinde sınıflandırıcılar çalıştırın.
Hizalamanın ölçülmesi: Hizalama eğitiminin etkinliğini ölçmek için modelin hizalamadan sapma eğilimlerini takip eden değerlendirmeler yürütün. Bu, şunları içerebilir:
Çevrimdışı hizalama değerlendirmeleri: En üst seviye eğitim çalışmaları sırasında, eğitimin amaçlandığı gibi işleyip işlemediğini görmek için hizalama değerlendirmeleri yürütün ve önemli gerilemeleri araştırın.
Geriye dönük test: Hizalama değerlendirmelerini önceki olaylar üzerinde geriye dönük olarak test edin. Böylece değerlendirmelerin daha önce hizalamadan sapmış modelleri tespit ettiğini ve belirli olaylara aşırı uyum sağlamadığını doğrulayın.
Değerlendirmeleri manipüle etme girişimlerinin takibi: Davranış değişikliğine yol açabilecek değerlendirme farkındalığını veya meta oyun davranışlarını (modellerin test edildiklerini fark etmesini) belirli engelleme eşikleriyle takip edin. Örneğin, hizalama değerlendirmelerinde değerlendirme farkındalığını ve meta oyun davranışlarını izleyen sistemleri etkinleştirin.
En kötü senaryo stres testleri: En kötü senaryodaki uygunsuz davranışları ortaya çıkarın ve en az bir değerlendirmenin bunları tespit edebildiğini kontrol edin.
Düşünce zinciri üzerinden eğitimi önleme: Modellerin düşünce zinciri izleme sistemlerinden kaçacak şekilde gelişmesini önlemek için pekiştirmeli öğrenme sırasında otomatik puanlayıcıların düşünce zincirini görmesine izin vermeyin.
Yalıtım: Modelin hizalamadan sapması durumunda zararlı eylemleri önleyecek kadar güçlü bir korumalı alan ve güvenlik altyapısı sağlayın. Bu, şunları içerebilir:
Çok katmanlı altyapı güvenliği: Hem modelin çalıştığı korumalı alanı hem de bu alanı barındıran araştırma altyapısını güçlendirmeye önemli ölçüde yatırım yapın. Böylece korumalı alandan kaçış durumunda ek bir koruma katmanımız olmasını sağlayın.
Yalıtıma yönelik red teaming: Güvenlik analizine tabi olmak kaydıyla, en üst seviye eğitim çalışmalarının kontrol noktalarını kullanarak bu sistemler üzerinde tekrarlanan red teaming çalışmaları yürütün. Açıkları bulup kapatarak korumalı alanın, araştırma altyapısının ve ağ sınırlarının güvenliğini iyileştirin. Ayrıca, modelin eğitim sırasında etkileşime girebileceği tüm hizmetler (ör. internet önbelleği) üzerinde red teaming çalışmaları yürütün.
Örnekler arası iletişim: Örnekler arası yüksek bant genişlikli iletişimi, çok ajanlı araçlar gibi onaylanmış yollarla sınırlayın. Altyapıdaki, ajanların kolayca keşfedebildiği yüksek bant genişlikli yan kanalları kapatın.
Değiştirilemez etkileşim kayıtları: Güvenilir olay incelemeleri yapılabilmesi ve yanlışlıkla değişiklik yapılmasının önlenmesi için tüm pekiştirmeli öğrenme eğitimi, değerlendirme ve kurum içi kullanım süreçlerinde ajan etkileşim kayıtlarını makul bir süre boyunca değiştirilemez biçimde saklayın (ör. bir kez yazılabilen depolama hesaplarında).
İzleme: Modellerin hizalamadan sapan eylemlere başlaması durumunda, olası sapmaları tespit edecek ve ciddi bir olay yaşanmadan önce öncelikli sorunların hızla ele alınmasını sağlayacak canlı bir izleme sistemi bulundurun. Bu, şunları içerebilir:
İzlenebilirliği zorunlu kılma: Endişe verici davranışları erken tespit etmek için modellerin izlenebilir kalmasını sağlayın. Bunu, açık eşiklere sahip izlenebilirlik ve izlemeden kaçınma değerlendirmeleriyle ölçün.
Bilinen sorunlarda yüksek yakalama oranı: İzleme sisteminin, eğitimden ayrı tutulan bir değerlendirmede geçmiş olayları yüksek oranda yakalayabildiğinden emin olun.
İzleme sistemi değerlendirmelerinin güncelliği: İzleme sisteminin yakalama oranı ve kesinlik ölçümlerinin güncelliğini korumak için yeni eğitim çalışmalarında ortaya çıkan tamamen yeni riskleri temsil eden değerlendirme verileri oluşturun.
Hızlı müdahale: Model zarar vermeden önce, nöbetçi bir sorumluya acil bildirim göndererek veya etkilenen eğitim çalışmasını otomatik olarak duraklatarak, tanımlı bir SLA süresi içinde harekete geçilmesini sağlayan öncelikli uyarılar uygulayın. Örneğin, gündüz yaşanan olaylarda nöbetçi güvenlik sorumlusuna ve eğitim çalışmasının sahibine acil bildirim gönderin; gece ise alındığı onaylanmayan uyarılarda çalışmaları otomatik duraklatın.
Teknik güvenlik önlemlerine ilişkin önerilerin yanı sıra, en üst seviye yapay zekâ eğitim çalışmalarının güvenlik gerekçelerine yönelik operasyonel iyi uygulamalar üzerinde de çalışıyoruz. Bunlar şunları içerebilir:
Karşı görüşler (ön değerlendirmeler): Güvenlik gerekçesi hazırlandıktan sonra, başka bir ekipten bir kişi olası açıkları bulmak ve riske ilişkin ölçülü bir değerlendirme sunmak için bir karşı görüş yazmalıdır. Eğitim ekibi daha sonra bu görüşü ele alarak güvenlik gerekçesinin güçlenmesini sağlamalıdır.
Onaylar: Güvenlik gerekçesi, üst yönetim üyeleri tarafından incelenmelidir. Eğitim çalışmasının birden fazla iç denetimden geçmesini sağlamak için bu kişilerin her biri çalışmayı veto edebilmelidir (ör. araştırma birimi lideri / başkan yardımcısı, Güvenlik Başkanı ve Baş Bilim İnsanı).
Hesap verebilirlik: Bir eğitim çalışmasından sorumlu üst düzey yönetici (ör. araştırma birimi lideri / araştırmadan sorumlu başkan yardımcısı), performans değerlendirmeleri de dâhil olmak üzere, güvenlik gerekçesinden ve olası olaylara müdahaleden sorumlu tutulmalıdır. Böylece eğitim ekipleri de güvenliği ve hizalamayı geliştirmeye teşvik edilmelidir.
Duraklatma: Güvenlik gerekçesini geçersiz kılacak sorunlar (ör. yeni bir güvenlik sorunu) bulunursa, kapsam dâhilindeki tüm eğitim çalışmalarını duraklatmak için operasyon kılavuzlarının, teknik kontrollerin ve hizmet düzeyi anlaşmalarının (SLA) mevcut olması sağlanmalıdır.
Kurum içi şeffaflık: Güvenlik gerekçeleri, kurum içi gözetim gruplarının (ör. Güvenlik ve Koruma Komitesi) erişimine açılmalıdır.
Denetimler: Denetçilere, güvenlik gerekçesindeki iddiaların geçerli ve sağlam olduğunu doğrulayabilmeleri ve varsa eksiklikleri bildirebilmeleri için yeterli erişim sağlanmalıdır.
Üst makamlara bildirim: Hizalama sapmalarını üst makamlara bildirmek için açık bir süreç, sapmaların ciddiyet düzeylerini tanımlayan bir tablo ve eğitim çalışmasında belirli bir ciddiyet düzeyine ulaşıldığında yöneticilere (ör. CEO) acil bildirim gönderebilecek bir nöbetçi sorumlu bulunmalıdır.
Teknik kontroller: İnsanların ve ajanların kurallara aykırı eğitim çalışmaları başlatması zorlaştırılmalıdır. İzleme ve otomatik duraklatma gibi güvenlik özellikleri, arıza durumunda işleyişi engellemelidir (ör. uygun izleme etkinleştirilmeden eğitim çalışmalarının başlatılması veya izleme sisteminin pekiştirmeli öğrenme eğitimi, değerlendirme ya da kurum içi kullanım ortamından devre dışı bırakılması mümkün olmamalıdır).
Geri alma imkânı: Gerektiğinde hizalamadan sapmış çıktıların etkisini geri alabilmek için, hizalamadan sapmış bir modelin eğitim sürecinde daha sonra nerelerde kullanıldığını (ör. veri üretimi veya puanlama) eksiksiz biçimde belirlemek kolay olmalıdır.
Kalan risklerin eksiksiz belirlenmesi: Güvenlik gerekçeleri, risk kabulü kararlarının bilgiye dayalı olarak alınabilmesi için, mevcut risk azaltma önlemlerinin kapsamadığı tüm riskleri mümkün olduğunca kapsamlı biçimde listelemelidir.
Bunlar güncel önerilerimizi yansıtıyor ve OpenAI bünyesinde uygulamaya geçiriliyor. Uygulamalarımızın önümüzdeki haftalarda gelişmeye devam etmesini bekliyoruz.
Yapay zekâdaki ciddi hizalama sapması olaylarının incelenmesine yönelik iyi uygulamalar da geliştiriyoruz. Laboratuvarlar, bu tür olayların gelecekte tekrarlanmasını önlemek için her bir olaydan mümkün olduğunca çok ders çıkarmaya çalışmalıdır. Bu yaklaşım, hataların ağır sonuçlar doğurabildiği diğer sektörlerdeki inceleme uygulamalarına(yeni bir pencerede açılır) benzer. Bu kapsamda atılabilecek adımlara bazı örnekler:
Kurum içi şeffaflık: Bir incelemenin tamamlanması uzun sürebileceğinden, olay incelemeleri hakkında kurum içinde düzenli bilgilendirme yapılmalıdır (ör. devam eden incelemeler için günlük güncellemeler). Çalışanların, güvenli ve işleriyle ilgili olduğu sürece, ham etkileşim kayıtlarına erişmek ve hizalamadan sapmış modellerden örnek çıktılar almak da dâhil olmak üzere daha geniş erişim elde edebilmeleri için tanımlı yollar bulunmalıdır.
Hizalama sapmasının kök nedeni: Araştırmacılar, hizalamadan sapmış davranışların nasıl ortaya çıktığını anlamak için eğitim dinamiklerinde kök neden analizi yapmalıdır (ör. hedefli ablasyon veya yeniden örnekleme deneyleriyle). Böylece hizalama sapmasının bilimsel temeli daha iyi anlaşılabilir ve gelecekte daha etkili biçimde önlenebilir.
Olay sonrası değerlendirme: Sorunların neden ortaya çıktığı ve olay öncesinde neden tespit edilmediği ya da üst makamlara bildirilmediği gibi, olaya katkıda bulunan tüm nedenleri anlamak için operasyonel süreçleri ve kurum kültürünü kapsayan bir olay sonrası değerlendirme yapılmalıdır.
Tespit: Olaydan elde edilen bilgiler (ör. etkileşim kayıtları veya olay özetleri) üzerinde doğrudan yinelemeli optimizasyon yapmadan, olaya yol açma eğilimini keşfedebilen hizalama testi yöntemleri geliştirmeliyiz. Gelecekteki modellerin çok benzer olaylarda hizalamadan sapma eğilimi göstermediğinden emin olmak için olaylardan türetilen değerlendirmeler “regresyon testleri” olarak oluşturulmalıdır.
Kamuoyuna açıklamalar: İnceleme sonuçları, olay sonrası değerlendirmeler ve operasyonel değişiklikler, inceleme tamamlandıktan sonra kamuoyuyla paylaşılmalıdır. Etkilenen üçüncü taraflar mümkün olan en kısa sürede bilgilendirilmelidir.


