Hugging Face olayı ve uyumsuz modellerin üçüncü taraflar üzerindeki diğer etkileri
Yapay zekâ sistemleri daha yetkin ve özerk hâle geldikçe, uyumsuz davranışlar gerçek dünyada siber güvenlik olayları ve geliştiricilerin öngörmemiş olabileceği başka sonuçlar dâhil ciddi etkileri olan eylemlere dönüşebilir. Dolayısıyla bu davranışların nasıl ortaya çıktığını ve tırmandığını, ayrıca nasıl tespit edilip bunlara nasıl müdahale edileceğini anlamak, gelişmiş yapay zekâ sistemlerini güvenli biçimde geliştirip kullanıma sunmanın giderek daha önemli bir parçasıdır.
Hugging Face olayını başlangıçta, platform düzeyinde bir ihlal içerdiği için esas olarak bir güvenlik sorunu olarak değerlendirdik. Bu, bugüne kadar modellerimizde tespit ettiğimiz bu tür faaliyetlerin en ciddisi olmaya devam ediyor ve faaliyetin başlıca nedeni, yalnızca kurum içinde kullanılan son derece yetkin bir araştırma modeliydi. Hugging Face teknik raporunda belgelendiği üzere, bu ihlalin zorlu görevleri çözmek için uyumsuz stratejilere başvuran modellerden kaynaklandığını daha sonra anladık. Siber güvenlik olayları bu riskin bir tezahürüdür; uyumsuzluk, modellerimizin üçüncü taraf sitelerde paylaşım yapması gibi geleneksel güvenlik kategorilerinin dışında kalan başka beklenmedik veya kaygı verici davranışlara da yol açabilir. Buna “ajan spam'i” diyoruz. Her ikisini de ele almamız gerekiyor.
Daha ciddi olaylara öncelik vererek ve incelemeyi ajan spam'i dâhil daha düşük önem derecesindeki uyumsuz faaliyetleri kapsayacak şekilde genişleterek genel faaliyetleri incelemeyi sürdürdük.
Bu sayfa; Hugging Face olayıyla ilgili rapor ve güncellemelerimizi, bağlantılı araştırma ve halka açık sunumları, tespit ettiğimiz diğer faaliyetleri, model uyumsuzluğunun rolü hakkında öğrendiklerimizi ve sistemlerimizi güçlendirmek için aldığımız önlemleri bir araya getiriyor. İncelemelerimiz ilerledikçe bu sayfayı güncelleyeceğiz.
Üçüncü tarafları etkileyen faaliyetler
Bu beklenmedik davranışların kapsamını daha iyi anlamak için modellerimizin eğitim ve değerlendirme sırasında internetteki faaliyetlerini kapsamlı biçimde inceliyoruz. İncelememiz kapsamında üçüncü tarafları aşamalı olarak tespit edip bilgilendiriyoruz. Önceliği şu vakalara veriyoruz:
Modellerimizin bir üçüncü tarafın güvenlik kontrollerini aşmış veya çevrimiçi bir hizmetin kullanılabilirliğini olumsuz etkilemiş olabileceği durumlar ya da
Uyumsuzluk vakalarının üçüncü taraf web sitelerini veya hizmetlerini olumsuz etkilediği durumlar.
Bugüne kadarki incelememize dayanarak, yukarıdaki ölçütler doğrultusunda onlarca üçüncü tarafı bilgilendirdik. Geçmiş faaliyetlere ilişkin incelememiz sürüyor ve önemli ölçüde zaman ile kaynak gerektirecek. Bu çalışma sürdükçe başka üçüncü tarafları da bilgilendireceğiz.
Gözlemlediğimiz uyumsuz faaliyet türlerini açıklamak amacıyla aşağıda anonimleştirilmiş özetler yayımlıyoruz. Başka üçüncü tarafları bilgilendirdikçe ve konuyu daha iyi anladıkça bu açıklamaları güncelleyeceğiz. Ayrıca incelemenin durumuyla ilgili güncellemeleri paylaşacağız. Etkilenen tarafları korumak için gerektiğinde adları ve kimliği belirleyebilecek diğer ayrıntıları genellikle paylaşmayacağız. Ancak bilgilendirdiğimiz taraflar, kendilerine sunduğumuz bilgileri kamuoyuyla paylaşmayı seçebilir.
Gözlemlenen Faaliyetlerin Özetleri
Bugüne kadarki inceleme ve bilgilendirme sürecimizde şu faaliyet kategorilerini tespit ettik:
Erişim kontrolünü aşma: Ajanlar normalde kimlik doğrulaması, belirli bir izin, abonelik veya hesap gerektiren bilgilere ya da özelliklere erişir. Örneğin farklı bir web adresi kullanmış, bir istekteki ayrıntıları değiştirmiş veya beklenenden daha geniş erişim sağlayan bir oturumdan yararlanmış olabilir.
İfşa edilmiş kimlik bilgilerinin kullanılması: Ajanlar halka açık hâle gelmiş oturum açma bilgilerini veya erişim anahtarlarını bulup bir hizmete erişmek için kullandı.
Sorgu veya komut enjeksiyonu: Ajanlar bir web sitesine veya hizmete metin girdi ve hizmet bu metni normal girdi yerine talimat olarak işledi. Bu durum hizmetin sunucusunda bir veritabanı sorgusu, uygulama kodu veya komut çalıştırmasına neden olabilir.
Çalışma zamanı iç bileşenlerine erişim: Ajanlar bir hizmetin uygulamasını içeren dosyaları okudu veya kurum içi kullanım için tasarlanmış bir arka plan sistemiyle etkileşim kurdu. Bu vakalarda ajan, hizmetin erişmesi amaçlanmayan bölümlerine ulaştı.
Ajan spam'i: Ajanlar, herkese açık wiki sayfalarını ortak mesaj panosu olarak kullanmak gibi yöntemlerle üçüncü taraf sitelerdeki bilgileri değiştirebilecek ve temizlik gerektirebilecek paylaşımlar yapar.