Etkili üçüncü taraf değerlendirmelerinde öncelik ve ilkeler
En üst seviye yapay zekâ laboratuvarları; modelleri güvenli biçimde eğitme, değerlendirme ve kullanıma sunma konusunda çok büyük bir sorumluluk taşır. Üçüncü taraf değerlendirmeleri; bu sorumluluğu dengelemek, yapay zekâ güvenliği konusundaki katkı olanaklarını genişletmek, dünyayı bilgilendirmek ve laboratuvarların açık, bağımsız olarak desteklenmiş güvenlik iddiaları karşısında hesap verebilir olmasını sağlamak açısından kritik önem taşır.
OpenAI, en üst seviyedeki gelişmelere ayak uydurma çabalarımız kapsamında eğitim, değerlendirme ve kullanıma sunma süreçlerinde kapsamlı erişim sağlanan bağımsız değerlendirmeleri desteklemeye kararlıdır. Bu erişim, değerlendiricilerin varsayımlarımızı sorgulamasına, gözden kaçırmış olabileceğimiz riskleri belirlemesine ve güvenlik önlemlerimizin etkinliği hakkında kendi sonuçlarına varmasına olanak tanımalıdır.
Model geliştirme ve kullanıma sunma sürecinin çeşitli aşamalarında uzun süredir üçüncü taraf değerlendiricilerle çalışıyoruz. Ayrıca üçüncü taraf değerlendirmelerini Risklere Hazırlık Çerçevesi uygulamalarımıza dâhil ettik ve daha titiz, hesap verebilir bir süreci savunan kuruluşları ve mevzuatı destekledik. Bu çalışmalar boyunca teknik güvenlik önlemlerimiz hakkında bilgiler, görünür düşünce zincirine erişim ve olay müdahalesi ile izleme sistemlerine yönelik red teaming için eşi görülmemiş düzeyde gizli veri ve kurum içi kullanıma erişim dâhil kapsamlı erişim biçimleri sunduk. Burada paylaşılan öncelik ve ilkeler, özel sektörde ve kâr amacı gütmeyen sektörde faaliyet gösteren bağımsız değerlendirme kuruluşlarıyla teknik güvenlik değerlendirmeleri üzerine çalışmalarımıza odaklanmaktadır. Bunlar, farklı rol ve sorumlulukların farklı yaklaşımlar gerektirebildiği test ve değerlendirme alanında hükûmetlerle yürüttüğümüz çalışmaları tamamlar.
Bu değerlendirmelerin etkili olması; güçlü bağımsızlık mekanizmaları, bilimsel titizlik, sağlam güvenlik uygulamaları ve açık sorumluluklar gerektirir. Laboratuvarlar, hassas bilgileri korurken anlamlı incelemelere olanak sağlama sorumluluğu taşır. Laboratuvarlar ile bağımsız değerlendiriciler bu süreci doğru yürütme sorumluluğunu paylaşır ve güvenlik uygulamalarına yönelik ortak uluslararası standartlarla çalışmalıdır. Aşağıda, titiz, güvenli ve bağımsız çalışmaya yönelik ilkelerin yanı sıra daha derinlemesine değerlendirme için dört öncelikli alan öneriyoruz.
Üçüncü taraf değerlendirmeleri, belirli ve önemli soruları ele aldıklarında en yararlı hâle gelir: Kanıtlar bir laboratuvarın güvenlik gerekçelendirmesini ve güvenlik iddialarını destekliyor mu? Değerlendirmeler, ölçmeyi amaçladıkları riskleri yeterli biçimde test ediyor mu? Güvenlik önlemleri gerçekçi koşullarda işe yarıyor mu?
Burada açıklanan değerlendirmelerin, incelenen güvenlik sorularına göre farklı biçimlerde yapılması amaçlanmaktadır. Bazıları haftalar, bazılarıysa birkaç ay sürecek şekilde, farklı dönemlerde birden fazla değerlendirmeyi paralel olarak desteklemeyi planlıyoruz. Üçüncü taraf değerlendirmeleri kullanıma sunma öncesi çalışmaların parçası olup ilgili kararları etkileyebilse de burada açıklanan çalışma genellikle daha uzun vadeli ve lansmandan bağımsızdır; belirli güvenlik iddialarının zaman içinde derinlemesine incelenmesine odaklanır.
Öncelikli alanlarımız ve ilkelerimiz boyunca güvenlik iddialarından ve güvenlik gerekçelendirmelerinden söz ediyoruz. Bu terimlerle kastettiğimiz şudur:
Güvenlik iddiası: Bir model veya sistemin güvenliğini ilgilendiren ve kanıtlarla değerlendirilebilen yetenekleri, davranışları ya da güvenlik önlemleri hakkında belirli bir sav. Bir iddia, ele aldığı riskleri ve koşulları, ilgili varsayım ve sınırlamalarla birlikte belirtmelidir.
Güvenlik gerekçelendirmesi: Bir model veya sistemin risklerinin eğitim, değerlendirme ya da kullanıma sunma gibi belirli bir faaliyet için neden yeterince yönetildiğini açıklayan, kanıtlarla desteklenmiş yapılandırılmış bir argüman. Güvenlik gerekçelendirmesi, her bir güvenlik iddiasını onu destekleyen kanıtlarla ilişkilendirir ve sonuçları etkileyebilecek varsayımları, belirsizlikleri ve kalan riskleri açıkça ortaya koyar.
Titiz, güvenli ve bağımsız çalışmaya yönelik ilkelerin yanı sıra daha derinlemesine değerlendirme için dört öncelikli alan öneriyoruz.
Eğitim, değerlendirme, kurum içi ve haricî kullanıma sunmayı kapsayan güvenlik gerekçelendirmelerinin bağımsız değerlendirmesi.
Güvenlik gerekçelendirmelerinin değerlendirilmesi; hizalama, izleme gibi kontrol yöntemleri, siber güvenlik, biyolojik ve kimyasal kötüye kullanım ile red teaming alanlarında uzmanlık gerektirir. Güvenlik gerekçelendirmeleri; eğitim, yetenek değerlendirmeleri ve güvenlik önlemleri gibi iddialardan oluşur ve bir bütün olarak ya da kısmen değerlendirilebilir (aşağıdaki 2. ve 3. önceliklere bakın). Muhtemelen birden fazla değerlendiricinin, kendi uzmanlıklarından yararlanarak gerekçelendirmelerin farklı bölümlerini incelemesi gerekecektir. Bu değerlendirmeler birlikte şu tür soruları yanıtlamalıdır:
Eğitim, değerlendirme ve kullanıma sunmaya ilişkin güvenlik gerekçelendirmelerinin kanıtları yeterince destekleniyor mu? Eğitim, değerlendirme ve kullanıma sunma sırasında güvenlik gerekçelendirmesinin koşullarına uyuldu mu?
Güvenlik gerekçelendirmelerimiz, değerlendirme sırasında belirlenen en acil riskleri kapsıyor mu? Güvenlik iddiaları genel güvenlik gerekçelendirmesini destekliyor mu? Eksikler veya iyileştirilebilecek alanlar var mı?
Eğitimde aldatmayı, ödül hacklemeyi, yıkıcı eylemleri veya kısıtlamaların aşılmasını ödüllendirebilecek teşvikleri belirlemek ve azaltmak için etkili yöntemler kullanılıyor mu?
Kurum içi ve haricî kullanıma sunma süreçlerindeki kritik güvenlik önlemlerinin değerlendirilmesi
Güvenlik önlemleri bütünümüz, değişen yeteneklere ve koşullara uyum sağlamak üzere sürekli gelişiyor. Güvenlik önlemlerimiz eğitim, kurum içi ve haricî kullanıma sunma süreçlerini kapsar. Bunlar hâlihazırda model düzeyinde güvenlik önlemlerini, yaptırım ve güvenlik önlemlerini ve hizalama bozukluğu izleyicilerini içerir; kontrol kaybı ile siber, biyolojik ve kimyasal alanlardaki kötüye kullanım gibi çok çeşitli riskleri kapsar. Teknik ortaklıklar, güvenlik önlemlerindeki mevcut zayıflıkları belirlerken değerlendirme yöntemlerini iyileştirebilir ve standart geliştirmeyi hızlandırabilir. Böylece, özellikle güvenlik standartlarının henüz gelişiminin başında olduğu kurum içi kullanımlar için, en üst seviyedeki gelişmelere ayak uyduracak gelecekteki kamu politikalarına daha sağlam bir teknik temel sağlar.
Bağımsız değerlendirmeler, bu güvenlik önlemlerinin ne kadar iyi çalıştığını ve nerelerde yetersiz kalabileceğini şu tür sorularla incelemelidir:
“Gri kutu” erişimi kullanıldığında güvenlik önlemleri, saldırgan testlere (jailbreak'lere) karşı dayanıklı mı ve yüksek riskli alanlarda (ör. siber, biyolojik) yetenek artışına karşı yeterli koruma sağlıyor mu? Saldırgan testlerimiz ve red teaming en önemli riskleri kapsıyor mu?
Gerçekçi çalışma koşullarındaki yetkili testlerde ajanlar; erişim kontrolleri, korumalı alanlar ve tespit ve müdahale sistemleri gibi siber savunmalarla nasıl etkileşime giriyor? Hangi savunmalar zararlı eylemleri önlüyor, tespit ediyor veya sınırlıyor; hangileri nerede yetersiz kalıyor?
Hizalama bozukluğu izleyicilerimizde, kurum içi ve haricî kullanımlarda kontrol kaybına veya ciddi hizalama bozukluğuna yol açabilecek kritik eksikler var mı? Model yetenekleri geliştikçe düşünce zinciri izleme, güvenlik veya hizalama açısından bir kanıt kaynağı olarak ne kadar güvenilir?
İlgili tüm eğitim, değerlendirme ve kullanıma sunma süreçlerinde kolayca devre dışı bırakılamayacak şekilde uygun izleme uygulanıyor mu?
Güvenlik önlemleri yeteneklerle orantılı biçimde uygulanıyor mu?
Risklere Hazırlık risk kategorilerini (Kimyasal ve Biyolojik Riskler, Siber Güvenlik, Yapay Zekânın Kendini Geliştirmesi) kapsayan yetenek değerlendirmeleri ile hizalama bozukluğu risklerine yönelik hizalama değerlendirmelerinin incelenmesi
Risklere Hazırlık Çerçevemiz, temel en üst seviye model riski alanlarının değerlendirilmesini gerektirir. Eşikler aşılıp değerlendirmeler doygunluğa ulaştıkça, Risklere Hazırlık kapsamındaki risk alanlarındaki yetenekleri ölçen değerlendirmeler ile ciddi hizalama bozukluğu risklerini ölçmeyi amaçlayan hizalama değerlendirmelerinin düzenli olarak yenilenmesi, kapsam ve kalitelerinin güvence altına alınması önemlidir.
İlgili sorular şunlardır:
Risklere Hazırlık risklerini ölçen değerlendirmeler, Risklere Hazırlık risk eşiği tanımını yeterince kapsıyor mu? Bu değerlendirmelerin eşikleri doğru belirlenmiş mi?
Modeller sürekli olarak en yüksek puanlara ulaştığında değerlendirmeler güncelleniyor mu ve yeni testler daha ileri yetenekleri anlamlı biçimde ölçüyor mu?
Hizalama değerlendirmelerimiz ciddi hizalama bozukluğu risklerini yeterince kapsıyor mu; hangi önemli davranış veya koşulları gözden kaçırabilir?
Kritik hizalama bozukluğu olaylarının bağımsız olarak incelenmesi
Bağımsız incelemeler, çeşitli kritik yapay zekâ güvenliği olaylarında değerli olabilir. Burada, modellerin yetkisiz hareket etmesi veya gözetimden kaçması dâhil model hizalama bozukluğuna odaklanıyoruz. Bunlar, kasıtlı kötüye kullanım olmasa bile hizalama yöntemleri ve güvenlik önlemlerindeki zayıflıkları ortaya çıkarabilir.
OpenAI Hugging Face olayında olduğu gibi belirli durumlarda, bağımsız hizalama bozukluğu olayı incelemeleri için bağımsız bir üçüncü tarafın sürece dâhil edilmesi faydalı olabilir. Olay incelemesine katılan üçüncü tarafların gerekli inceleme uzmanlığına sahip olması kritik önem taşır. Bu uzmanlık, uygun durumlarda siber adli bilişim, hizalama, geniş ölçekli düşünce zinciri analizi ile incelemeyi zamanında yürütecek personel ve kaynakları içerir. Olay müdahalesi, hassas kurum içi verilere ve üçüncü taraf verilerine erişim gerektirebilir; bu nedenle bazı ayrıntıların yayımlanması veya bunlara erişilmesi hassasiyet taşıyabilir. Bağımsız incelemelerin bulguları, modelin hizalanmasına ve daha önce gözlemlenen hizalama bozukluğunu gidermek için alınan önlemlerin etkinliğine ilişkin iddiaların değerlendirilmesini sağlayan kanıtlar sunarak modelin güvenlik gerekçelendirmesine de katkıda bulunabilir.
Hizalama bozukluğu olayları bağlamında şu konulardaki bağımsız değerlendirmelere öncelik veriyoruz:
Olay sırasında hangi model davranışları veya hizalama bozukluğu sorunları yaşandı ve bunlara katkıda bulunan başlıca etkenler nelerdi?
Güvenlik önlemleri ve düzeltici çalışmalar gelecekteki benzer olayları etkili biçimde azaltabilir mi?
Değerlendirme için kapsamı açıkça belirlenmiş ve karşılıklı mutabakata varılmış iddialar: Değerlendirmeler, karşılıklı mutabakata varılmış bir kapsamla başlamalı; ardından değerlendirme faaliyetleri başlamadan önce ön kaydı yapılan, açıkça tanımlanmış güvenlik iddiaları gelmelidir. Üçüncü taraflar ve laboratuvarlar, söz konusu iddiaların değerlendirilen şirketin değerlendirmeye sunmak istediği iddialar mı, yoksa üçüncü taraf değerlendiricinin bağımsız olarak değerlendirmeyi amaçladığı ve laboratuvarın bunlara göre değerlendirilmeyi kabul ettiği iddialar mı olduğunu netleştirmelidir. Üçüncü tarafların verilere erişmesinin mümkün olmaması, değerlendiricinin yeterli uzmanlığa sahip olmaması veya acil bir değerlendirmede makul süre kısıtlarının bulunması gibi pek çok nedenle bazı iddialar kapsam dışında kalabilir. Laboratuvarlar ve değerlendiriciler, ilk kapsamın dışında belirlenen önemli riskleri ele almak ve daha fazla inceleme gerekip gerekmediğine karar vermek için bir süreç oluşturmalıdır. Sonuçlarda, karşılıklı mutabakata varılan kapsam doğrultusunda nelerin değerlendirilip nelerin değerlendirilmediği açıkça belirtilmelidir.
Orantılı erişim: Değerlendiricilere, hukuki, güvenlik ve fikrî mülkiyet kısıtları çerçevesinde mümkün olduğu ölçüde, üzerinde mutabakata varılan iddiaları değerlendirmeye yetecek orantılı erişim sağlanmalıdır. Doğrudan erişimin pratik veya mümkün olmadığı durumlarda değerlendiriciler, şirketin görevlendirdiği bir temsilciyle çalışabilir ya da temel bilgileri korumak için dolaylı veya gizliliği koruyan erişim mekanizmalarını inceleyebilir.
Şeffaf yöntem ve standartlar: Değerlendiriciler, mevcut olduğu durumlarda yerleşik standartlardan yararlanarak yöntemlerini, değerlendirme ölçütlerini ve belirsizlikleri açıklamalıdır. Henüz standart bulunmayan durumlarda kullandıkları ölçütleri açıkça gerekçelendirmelidirler. Raporlar, doğrudan bulguları yorumlardan ayırmalı, belirsizlikleri açıklamalı ve kanıtların hangi sonuçları desteklediğini netleştirmelidir.
Uzmanlık ve bağımsızlık: Değerlendiriciler ilgili teknik uzmanlığa sahip olduklarını göstermeli; mali teşvikler, geliştiricilerle ilişkiler ve değerlendirilen çalışmaya daha önce katılmış olmak dâhil, kurumsal ve bireysel çıkar çatışmalarını belirlemeli, açıklamalı ve ele almalıdır. Güvenlik önlemleri, ticari baskıların ve ücret düzenlemelerinin bulguları etkilememesini sağlayacak şekilde tasarlanmalı; gerektiğinde görevden çekilme veya uygun bekleme süreleri içermelidir.
Güvenlik ve gizlilik: Değerlendiriciler, erişilen sistem ve bilgilerin hassasiyetiyle orantılı bilgi güvenliği uygulamalarına ve personellerini kapsayan, uygulanması yaptırımlarla güvence altına alınmış gizlilik korumalarına sahip olduklarını göstermelidir. Bu korumalar fikrî mülkiyeti, hassas bilgileri ve değerlendirme kayıtlarını kapsamalıdır. Değerlendiricilerin kendi ortamlarında güvenlik gerekliliklerini karşılayamadığı veya erişilen verilerin özellikle hassas olduğu durumlarda, şirket tarafından yönetilen cihazlarda ya da tesislerde erişim sağlanması uygun olabilir.
Eyleme dönüştürülebilir bulgular ve düzeltme süresi: Değerlendirmeler belirli eksikleri saptamalı ve laboratuvarların bunları giderebilmesi için yeterli ayrıntı sunmalıdır. Uygun olduğunda laboratuvarlara, yayımdan önce sorunları gidermeleri için makul bir süre tanınmalıdır. İlgili durumlarda raporlar, uygulamaya yönelik pratik önerilerle birlikte ajan geliştiricileri, kullanıma sunanlar ve savunma ekipleri için çıkarılan dersleri de açıklamalıdır.
Sorumlu yayım uygulamaları: Değerlendirme raporları kanıtlara dayanmalı; hassas ve gizli bilgiler korunurken mümkün olduğunca açık biçimde paylaşılmalıdır. Kamuya tam açıklamanın mümkün olmadığı durumlarda, uygun gözetim organlarına (örneğin yönetişim organlarına veya şirket yönetim kurullarına) gizli raporlama yapılması hesap verebilirliği destekleyebilir. Bağımsızlık ile gizlilik arasındaki dengeyi korumak için ilkelere dayalı karartma korumaları ve politikalarının yanı sıra geri bildirim ve yanlışlıkların düzeltilmesine ilişkin açık beklentiler bulunmalıdır. Değerlendiriciler, gizlilik ve fikrî mülkiyet korumalarının sürdürülmesini sağlarken editoryal bağımsızlıklarını da korumalıdır. Değerlendiriciler, laboratuvarların hassas bilgilerin karartılmasını talep etmesine olanak veren açık politikalar benimsemeli; önemli karartmaların yapıldığı yerleri ve bunların değerlendirme raporuna etkisini belirtebilmelidir.
Gelecekteki yasalar ve özel yönetişim kuruluşları aracılığıyla, etkili üçüncü taraf değerlendirmeleri için bağımsız değerlendiricileri desteklemeye ve daha açık, ortak uluslararası standartlar oluşturmaya kararlıyız. Bağımsız değerlendirme ekosistemi hâlâ gelişmekte olsa da en üst seviye güvenlik konularında derin uzmanlığa sahip, çeşitli bağımsız değerlendiriciler topluluğunu destekleyip onlarla çalışarak büyümesine katkıda bulunacağız. Tek bir üçüncü taraf, acil en üst seviye güvenlik konularının tümünü kapsamlı biçimde ele alamaz ve almamalıdır. Kapasitemizi geliştirmek ve büyüyen üçüncü taraf ekosisteminin en iyi uygulama ve ilkeler üzerinde uzlaşmasını sağlamak için planlı ve bilinçli biçimde ilerleyeceğiz. Yukarıdaki öncelikli alanlarla uyumlu teklifler hakkında birden fazla üçüncü tarafla görüşüyoruz.


