Son birkaç haftada yaşanan iki gelişme, giderek daha yetenekli hâle gelen yapay zeka sistemleriyle bağlantılı risklerin arttığını ortaya koydu: OpenAI-Hugging Face olayı ve ayrıca yakında çıkacak modellerimizden Astra'nın, Risklere Hazırlık Çerçevemiz kapsamında Kritik siber güvenlik yeteneği eşiğine ulaşabileceğini gösteren ilk bulgular. Bu gelişmeler, şirket içi araştırmalarımızdaki hızlı ilerlemeyle birlikte, eğitimin tüm aşamalarında izleme, uyumlama ve sınırlama korumalarımızı güçlendirme çalışmalarımıza hız kazandırdı.
Modeller daha yetenekli hâle geldikçe bunları şirket içinde geliştirmenin ve test etmenin getirdiği riskler de artıyor. İzleme, uyumlama ve güvenlik standartlarımız bu risklerin önünde olmalı. Bu standartları karşılamak için gereken zamanı ayırmak istedik ve bu nedenle ölçek büyütme hızını geçici olarak düşürdük. Bu kapsamda, araştırma ortamlarımızı daha da sağlamlaştırıp kırmızı ekip testlerinden geçirirken ve izleme sistemlerimizin kapsamını genişletirken kullanıma sunulması planlanan en yeni modellerimizdeki pekiştirmeli öğrenme (RL) eğitimine iki hafta ara verdik. Planlanan en büyük en üst seviye RL çalışmamız hâlâ beklemede. Devam etmeden önce model davranışını değerlendirmek, korumalarımızı doğrulamak ve uyuma ilişkin daha fazla kanıt elde etmek için daha küçük ölçekli eğitimler ve değerlendirmeler yürütüyoruz.
Yapay zeka sistemlerinin amaçlandığı gibi davranmasını ve insan gözetimine yanıt vermesini sağlama çalışması olan uyumlama, uzun süredir araştırma programımızın merkezinde yer alıyor. Devam eden araştırma ve değerlendirmelerimizi temel alarak artık eğitimin tüm aşamalarında uyumlu davranışa ilişkin daha güçlü kanıtlar arıyoruz. Giderek daha yetenekli hâle gelen sistemlerin uyumunu korumak, tüm alanın ele alması gereken bir zorluk. Yaklaşan model ilerlemelerinden aldığımız sinyaller, mevcut Risklere Hazırlık Çerçevesini temel alan ve onun ötesine geçen daha kapsamlı bir yaklaşıma ihtiyacımız olduğunu açıkça gösteriyor.
Yaklaşımımızın nasıl değiştiği konusunda şeffaf olmanın önemli olduğunu düşünüyoruz. Aşağıda, araştırma süreçlerimizde ve altyapımızda hâlihazırda yaptığımız değişiklikleri ve devam eden çalışmaları açıklıyoruz.
Daha yetenekli modeller geliştirme yaklaşımımız, birbirini destekleyen üç korumaya dayanıyor:
- Endişe verici davranışları tespit edip bunlara müdahale etmemizi sağlayan izleme.
- Zararlı veya yetkisiz eylemlerin olasılığını azaltan uyumlama.
- Yapay zeka sistemlerinin erişebileceklerini veya etkileyebileceklerini sınırlayan güvenlik önlemleri.
Modellerin yakında, diğer modellere karşı savunma da dâhil olmak üzere güvenlik çalışmalarının çoğunu yürütmesini bekliyoruz. Böylece üç koruma da model yetenekleriyle birlikte ölçeklenebilecek. Bunu kritik önemde görüyoruz.
Bu korumaları araştırma ve kullanıma sunma süreçlerinin tamamında uyguluyor; her modelin yeteneklerine, çalışma ortamına ve risk düzeyine göre uyarlıyoruz.
En üst seviye modellerin siber güvenlik yetenekleri güçlendikçe onları eğittiğimiz ve değerlendirdiğimiz ortamların güvenlik standartlarını yükseltiyoruz. Bu standartların karşılanması önemli ölçüde mühendislik çalışması gerektirdi ve en üst seviye araştırmalarda yüksek maliyetlere ve gecikmelere yol açtı. OpenAI-Hugging Face olayının* hemen ardından, kod çalıştırabilen veya internete erişebilen araçları kullanabilen çalışmalar için araştırma kümelerindeki en üst seviye model çıkarımını duraklattık. Kod yürütmek için daha sınırlı ve güvenli bir yolu kısa sürede yeniden devreye aldık; ardından güvenle sürdürülüp sürdürülemeyeceğini belirlemek üzere her iş yükünü ayrı ayrı inceledik. Bazı araştırma iş yükleri bu yeni kontroller altında yeniden başlatılırken diğerleri ek değişiklikler gerektirdi.
Takip eden haftalarda, en üst seviye araştırma iş yükleri için daha güçlü güvenlik gereklilikleri belirledik ve bunları uygulamaya başladık. Örneğin:
- İş yükü yalıtımı: Artık model tarafından oluşturulan veya başka nedenlerle güvenilmeyen kodları çalıştıran iş yükleri için daha güçlü yalıtım («korumalı alanlar») zorunlu. Bu gereklilik, model çıktılarını işlerken güvenliği ihlal edilebilecek yazılımlar için de geçerli.
- Ağ yalıtımı: Yüksek riskli ve güvenilmeyen iş yüklerini internetten ayırmak için daha fazla kontrol uygulamaya aldık. Bu kontrolleri, tek bir iş yükünün veya destek hizmetinin güvenliğinin ihlal edilmesinin tek başına internete ya da diğer şirket içi ağlara yetkisiz erişim sağlamayacağı şekilde tasarladık.
- Sürekli güvenlik testi: Potansiyel olarak savunmasız ortak hizmetleri kaldırmak, sürekli tanımlı ayrıcalıkları azaltmak ve güvenlik ile güven sınırlarını iyileştirmek için ortamımızı yeniden yapılandırdık. Ayrıca güvenlik günlüklerini toplama ve izleme kapasitemizi geliştiriyoruz. Son olarak, bu sınırları simüle edilmiş saldırılara karşı sürekli test etmek üzere modellerimizi kullanan otomasyon sistemlerine yatırım yapıyoruz.
Bu kontroller birlikte çok katmanlı savunma sağlıyor ve araştırma ortamımızı saldırılara karşı korumaya yardımcı oluyor. Astra modellerinin kritik düzeyde siber yeteneğe sahip olabileceğini belirlediğimiz için bugün Astra veya siber modellerle ilgili iş yüklerinde en sıkı güvenlik korumalarını zorunlu tutuyoruz. Bu korumalar, siber alanla ilgili diğer tüm iş yükleri için de geçerli.
Bazı Astra eğitimleri ve değerlendirmeleri bu gereklilikleri karşılasa da önemli sayıda iş yükü, yeni güvenlik standardını karşılayacak biçimde tamamen taşınıp güçlendirilene kadar beklemede kalacak. Yeni ortamlara taşımada güvenlik ve uyumlama iş yüklerine öncelik veriyoruz.
İzleme, şirket içi kodlama ajanlarının izlenmesi ve uzun süreli oturumlar dâhil olmak üzere model geliştirme sürecimizin uzun zamandır önemli bir parçası. İzleme çalışmalarımız özellikle en üst seviye modellerin şirket içi kullanımlarına ve en üst seviye RL eğitim çalışmalarına odaklanıyordu. Bunlar, gelişmiş model yeteneklerini araçlara, hassas sistemlere ve şirket içi veya dışı ağlara erişimle birleştirebildiği için en yüksek riskli iş yükleri olarak görülüyordu. Bu izleme, araç kullanan tüm çıkarım ve eğitim çalışmalarına uygulanmıyordu. Yeni izleme düzenimizle birlikte yaklaşımımızı gözden geçirip genişlettik.
Bu yeni izleme düzeni çok aşamalı. Süreç, örneklenen her tokenda çalışan aktivasyon sınıflandırıcılarıyla (modelin iç faaliyetlerini inceleyen algılayıcılar) başlıyor ve olası endişeleri giderek daha gelişmiş ve yüksek işlem gücü kullanan otomatik araştırmacılara aktarıyor. Bu sistemler; araç eylemlerini, mevcut akıl yürütmeyi ve faaliyetlerin tamamını yetkisiz erişim, veri hırsızlığı, yıkıcı davranış ve korumaları aşma girişimleri açısından inceliyor. Endişe verici bir faaliyet izleme sistemimizce ortaya çıkarıldıktan sonraki 30 dakika içinde uyarı vermeyi hedefliyoruz. İzleme sistemi, kritik bir güvenlik sınırının muhtemelen ihlal edildiğini tespit ederse en yüksek öncelikli uyarıyı oluşturuyor. Mevcut uygulamamızda güvenlik, koruma ve araştırma ekiplerine çağrı gönderiliyor. Ekipler, işaretlemenin yanlış pozitif olduğunu 30 dakika içinde kesin olarak belirleyemezse faaliyeti duraklatmaları bekleniyor.
Bu izleme, Sol yetenek düzeyindeki veya üzerindeki modellerle araçlar kullanılarak yapılan tüm RL eğitimleri ve değerlendirmeleri için zorunlu. 7 Ağustos'ta Astra'nın kritik siber yeteneklere sahip olabileceğini belirledikten sonra, Astra'nın araçlarla yapılan tüm çıkarımları için (yalnızca RL eğitimleri ve değerlendirmeleri değil) ek bir izleme şartı getirdik.
Bu korumalar kayda değer işlem gücü gerektiriyor. Mevcut tahminlerimize göre izleme ek yükü, izlenen çıkarım için kullanılan işlem gücünün yaklaşık %20'si düzeyinde. Ancak maliyet, eğitim ve değerlendirme iş yükleri arasında önemli ölçüde değişiyor. Yakında yayımlanacak bir blog yazısında bu sistemle ilgili daha fazla ayrıntı paylaşacağız.
Uyumlama araştırmaları misyonumuzun merkezinde yer alıyor. Misyonumuz, genel yapay zekanın tüm insanlığa fayda sağlamasını güvence altına almak. Modeller siber saldırı yapabilme gibi gelişmiş yetenekler kazanıp daha karmaşık ortamlarda çalıştıkça ödül hackleme (amaçlanan sonuca ulaşmadan eğitimde yüksek ödül almanın yollarını bulma), aldatma veya yetkisiz erişim gibi uyumsuz davranışlar giderek daha ciddi riskler yaratacak.
En yetenekli modellerdeki RL çalışmaları için temel uyumlama tekniklerimizi artık eğitim sürecinin daha fazla aşamasında uyguluyoruz. Buna; görevler ve ortamlar genelinde güvensiz davranışları daha iyi tespit edip caydırmak için ödül modellerini geliştirmek, modelleri eylemleri, yetenekleri ve sınırlamaları konusunda daha dürüst olacak şekilde eğitmek ve ödüller, değerlendiriciler, araçlar veya gözetimdeki zayıflıklardan yararlanan davranışları azaltmak dâhil. Modeller dış sistemlerle veya kaynaklarla etkileşime girdiğinde zarara yol açabilecek davranışların eğitim kapsamını da genişletiyoruz.
Uyumlama araştırmalarına güçlü biçimde yatırım yapmayı, değerlendirme kapsamını genişletmeyi ve öğrendiklerimizden eğitim ile korumalara yön vermek için yararlanmayı sürdürüyoruz. Yakın gelecekte, model davranışı hakkında öğrendiklerimiz ve karşılaştığımız yeni zorluklar dâhil olmak üzere uyumlama araştırmalarımızla ilgili çok daha fazla bilgi paylaşmayı planlıyoruz.
Bu korumaları eğitim ve kullanıma sunma süreçlerinde bir araya getirmek, ayrıca gelecekteki modellerin yeteneklerini ve çalıştıkları ortamları daha iyi yansıtmak için Risklere Hazırlık Çerçevemizi geliştireceğiz. Bu yeteneklerle birlikte ölçeklenebilecek yöntemler geliştirmek; model destekli güvenliğe sürekli yatırım, daha etkili izleme ve uyumlama araştırmalarında ilerlemenin sürmesini gerektirecek. Yaklaşımımız geliştikçe dış kuruluşları sürece dâhil etmeyi ve öğrendiklerimizin daha fazlasını paylaşmayı amaçlıyoruz.
En üst seviye modellerin yetenekleri hızla gelişiyor. Onları anlama, uyumlama ve güvence altına alma kapasitemiz bu gelişimin önünde olmalı.
*Önümüzdeki haftalarda öğrendiklerimizi içeren teknik bir rapor yayımlayacağız.

