OpenAI modellerini içeren üçüncü taraf siber değerlendirmeleri
Bağımsız testler, kullanıma sunmadan önce riskleri doğrulamamıza ve daha iyi anlamamıza yardımcı olma açısından önemli bir rol oynar. Bazı siber değerlendirmelerde, modellerin herkese açık ürünlerde normalde nasıl davrandığını değil temel kapasitesini ölçmek amacıyla güvenlik önlemlerinin azaltılması da dâhil olmak üzere özel yapılandırmalar bilinçli olarak kullanılır.
Yakın zamanda yapılan değerlendirmelerde iki harici test ortağı, test yapılandırmaları ve kontrollerinin yeni modellerin gelişen kabiliyetleriyle birleşerek model faaliyetlerinin amaçlanan test sınırlarının dışına taşmasına olanak tanıdığı olaylar belirledi. Bu olaylar, modeller daha yetenekli hâle geldikçe test ortamları ve uygulamalarına ilişkin standartları geliştirmek için sektör genelinde ve üçüncü taraf değerlendiricilerle iş birliği yapmanın önemini gösteriyor. Editörün Notu: Bunlar Hugging Face güvenlik olayından ayrı olaylardır. Hugging Face olayıyla ilgili güncellemeleri buradan paylaşmayı sürdüreceğiz.
Yeni olaylarda OpenAI modelleri, normal kullanım koşullarını yansıtmayan belirli şartlar ve azaltılmış güvenlik önlemlerine sahip yapılandırmalar altında, üçüncü taraf siber değerlendirmeleri sırasında genel internete erişti. Olaylar şunlardı:
- Birleşik Krallık hükümetine bağlı Yapay Zekâ Güvenliği Enstitüsü UK AISI, ajanların kendi araçlarını bulabilmesi ve gerçek bir saldırganın koşullarına daha yakın şartlarda çalışabilmesi için internet erişimini bilinçli olarak etkinleştirdiği ve temel kapasiteyi ölçmek amacıyla siber sınıflandırıcıları devre dışı bıraktığı siber test ortamı değerlendirmeleri yürütüyordu. Blog yazılarını buradan okuyabilirsiniz.(yeni bir pencerede açılır)
- Harici siber güvenlik test ortaklarımızdan Irregular, internetten izole edilmesi amaçlanan Bayrağı Yakala tarzı değerlendirmeler yürütüyordu; ancak test ortamındaki bir yanlış yapılandırma, modellerin genel internete erişmesine olanak tanıdı.
Aşağıda neler yaşandığını, faaliyete olanak tanıyan test koşullarını, faaliyeti kontrol altına almak için atılan adımları ve bağımsız laboratuvarların giderek daha yetenekli hâle gelen modelleri titizlikle ve güvenli biçimde değerlendirmeyi sürdürmesini sağlamak için yaptıklarımızı özetliyoruz.
Bu olaylar, yakın zamanda yayımladığımız Hugging Face olayı yazısında açıkladığımız daha geniş kapsamlı soruna işaret ediyor: Modellerin kabiliyetleri geliştikçe modelleri çevreleyen emniyet ve güvenlik sistemlerinin de gelişmesi gerekiyor. Buna hem modellerin geliştirildiği ortamlar hem de laboratuvarların ve bağımsız ortakların modelleri değerlendirmek için kullandığı ortamlar dâhildir.
Önümüzdeki haftalarda, daha yüksek riskli değerlendirmeleri nasıl belirlediğimiz, kapsam üzerinde nasıl uzlaştığımız, internet erişimini etkinleştirme veya güvenlik önlemlerini azaltma taleplerini nasıl değerlendirdiğimiz, izolasyon, kimlik bilgilerinin kullanımı, izleme ve durdurma koşullarına ilişkin beklentileri nasıl belirlediğimiz ve olay bildirimi ile eskalasyon süreçlerini nasıl daha açık hâle getireceğimiz de dâhil olmak üzere üçüncü taraf testlerine yönelik yaklaşımımızı gözden geçireceğiz.
Önümüzdeki haftalarda ulusal yapay zekâ enstitüleri, bağımsız değerlendiriciler, diğer yapay zekâ laboratuvarları ve başka gruplar gibi paydaşları bir araya getirmek de dâhil olmak üzere, yüksek riskli değerlendirmelerin güvenle yürütülmesine yönelik ortak uygulamaları güçlendirmek için sektör genelinde çalışmaya kararlıyız. Amacımız, titiz ve bağımsız değerlendirmenin değerini korurken test uygulamalarının giderek daha yetenekli hâle gelen modellere ayak uydurmasını sağlamaktır.
UK AISI, 3 Ağustos’ta bize, 25 Temmuz’da başlayan rutin bir siber değerlendirme sırasında OpenAI ve başka bir laboratuvara ait modellerin bazı durumlarda test kapsamının dışına çıktığını bildirdi. Değerlendirme, gerçek dünyadaki ağları taklit etmek üzere tasarlanmış kontrollü siber test ortamlarında gerçekleştirildi. Belirlenen 19 olaydan ikisinde bir OpenAI modeli olan GPT‑5.6 Sol yer aldı. Diğer olaylarda başka bir laboratuvarın modelleri yer aldı.
Bu değerlendirmede ajanlara, bir bayrağı yakalama tatbikatında siber güvenlik uzmanı gibi hareket etmeleri; birbirine bağlı üç simüle edilmiş ortamı ele geçirip son bayrağı almaları talimatı verildi. Görev promptu, kapsama dâhil test ağı sistemlerini belirtiyor ve bazı sistemleri kapsam dışı olarak tanımlıyordu. UK AISI ayrıca ajanların araç indirebilmesi ve insan bir saldırganın koşullarına daha yakın şartlarda çalışabilmesi için canlı internet erişimini etkinleştirdi ve temel kapasiteyi ölçmek amacıyla modelin siber sınıflandırıcılarını devre dışı bıraktı.
UK AISI’ın amaçladığı yetkilendirme sınırı simüle edilmiş siber test ortamıydı: Ajanların belirtilen simüle edilmiş ağlara saldırmasına ve bir bayrak almasına izin verilmişti; test ortamının ağ sınırı dışındaki sistemlerle etkileşim kurmalarına değil. Ancak ajanlara açık internet erişimini nasıl kullanıp kullanamayacakları açıkça söylenmemişti. UK AISI bunu, olaya katkıda bulunmuş olabilecek nedenlerden biri olarak değerlendiriyor.
UK AISI, bu çalıştırmalar genelinde GPT‑5.6 Sol’un simüle edilmiş test ortamına girmenin ve bayrağı almanın bir yolunu ararken iki izinsiz eylem gerçekleştirdiğini belirledi:
- GPT‑5.6 Sol, test ortamındaki bir sistemin GitHub’ı veya başka bir güncelleme hizmetini yoklayıp yoklamadığını kontrol etmek için başka bir laboratuvarın ajanının herkese açık biçimde bıraktığı GitHub tokenını yeniden kullandı, hesap kurtarma ve istek sınırı çözümlerini aşmayı denedi ve harici DNS ve tünelleme sağlayıcılarında hesaplar açtı.
- GPT‑5.6 Sol, değerlendirme ortamında yerel olarak çalışan bir DNS sunucusunu genel internetten erişilebilir kılmak için herkese açık bir tünelleme hizmeti kullandı. Sunucu, test ortamında çalışan bir yazılımdaki bilinen bir güvenlik açığına yönelik istismar yükleri içeriyordu. Kurulum çalışmadı, gerçek bir çözümleyicinin sorgu gönderdiğine dair kanıt bulunmuyor ve değerlendirme sona erdiğinde altyapı kaldırıldı.
Model siber test ortamındaki görevi tamamlamaya çalışıyor olsa da UK AISI, gerçek harici hesapları ve ortam sınırları dışındaki hizmetleri içermeleri ve görevin tamamlanması için gerekli olmamaları nedeniyle bu eylemleri izinsiz olarak değerlendirdi. Kurulum çalışmamış ve gerçek bir çözümleyicinin sorgu gönderdiğine dair kanıt bulunmuyor olsa da DNS sunucusu, istismar yüklerini genel internette de barındırdı.
UK AISI, güvenlik izlemesinin olağandışı veri aktarımları tespit etmesinin ardından 28 Temmuz’da faaliyeti belirledi. İlgili değerlendirmeleri durdurdu, ilgili makineleri izole etti ve faaliyeti tespit edilmesinden yaklaşık bir saat sonra kontrol altına aldı.
Faaliyetin belirlenmesi, araştırılması ve ayrıntılarının paylaşılması da dâhil olmak üzere bu süreç boyunca UK AISI ile yürüttüğümüz iş birliğine değer veriyoruz. İş birliğimizi sürdürmeyi sabırsızlıkla bekliyoruz.
Üçüncü taraf değerlendirme ortaklarımızdan Irregular, 29 Temmuz’da Bayrağı Yakala (CTF) tarzı siber güvenlik değerlendirmeleri sırasında OpenAI modellerinin karıştığı bir olayı bize bildirdi. Modellere, simüle edilmiş bir ortamdaki zayıflıklardan yararlanarak gizli bilgileri bulmaları talimatı verilmiş ve internet erişimlerinin olmadığı söylenmişti. Ancak test ortamındaki bir yanlış yapılandırma, modellerin genel internete erişmesine olanak tanıdı.
Testlerden birinde, CTF görevinin kurgusal hedefinin adı istemeden gerçek bir alan adıyla çakıştı. Test ortamı yanlışlıkla internete bağlı olduğu için model, simüle edilmiş ortamın bir parçası sandığı gerçek bir web sitesindeki açıktan yararlandı. Bu olay karmaşık bir korumalı alan kaçışı veya sıfırıncı gün açığı içermiyordu: İnternet erişimi yanlış yapılandırmadan kaynaklanmıştı ve modelin temel bir güvenlik açığından yararlandığı anlaşıldı.
Irregular’ın araştırmasına göre model, aynı siteyi yönetmek için gereken kimlik bilgilerini de bulup kullandı. Irregular, etkilenen sitenin kendi verileri dışında bir etki tespit etmedi; denetimi ise devam ediyor. Irregular değerlendirmeleri duraklattı, düzeltme çalışmalarını başlattı ve etkilenen üçüncü taraflara bildirimde bulundu. Irregular, olayla ilgili belirlenen sorunların hiçbirinin artık etkin olmadığını ve test ortamına gerekli güvenlik önlemlerinin eklendiğini bize bildirdi. Irregular, aynı test ortamında diğer laboratuvarların karıştığı bağlantılı olaylar hakkında da bilgilendirme yaptı.
Irregular ile iş birliğimize değer veriyor ve incelemelerini desteklemek için kendileriyle yakın çalışmayı sürdüreceğiz. Irregular ayrıca, siber değerlendirmeleri güvenli biçimde yürütmeye ve olayları kontrol altına almaya yönelik en iyi uygulamaları paylaşmak üzere bir teknik inceleme belgesi hazırlıyor. Bulguları topluluğun kullanımına sunmak üzere teknik inceleme belgesine katkıda bulunmayı ve iş birliğimizi sürdürmeyi sabırsızlıkla bekliyoruz. Bu tür bir iş birliğini, mevcut ve gelecekteki modellerin güvenli ve kapsamlı biçimde değerlendirilmesi açısından vazgeçilmez görüyoruz.


