Ana içeriğe atla
OpenAI

30 Eylül 2026

Güvenlik

Koordineli bir model damıtma kampanyasını engellemek

Yükleniyor...

Yakın zamanda, modellerimizin koruma altındaki akıl yürütme içeriklerini ele geçirmeyi amaçlayan koordineli bir kampanyayı tespit edip engelledik. Gözlemlediğimiz ilk faaliyetler temmuzun ilk haftasında gerçekleşti. Bu faaliyet, kötü niyetli damıtmayla örtüşüyor: Bir modelin çıktılarının veya akıl yürütme içeriklerinin, başka bir modeli eğitmek, yeniden üretmek ya da geliştirmek için sistematik ve izinsiz olarak kullanılması. Koruma altındaki akıl yürütme içeriği, modelin bir görevi yerine getirirken izlediği sürecin dahili kaydıdır. Bu içeriğin ele geçirilmesi, nihai yanıtta paylaşılmayan bilgileri açığa çıkarabilir ve başkalarının modelin yeteneklerini yeniden üretmesine yardımcı olabilir.

Bu faaliyeti yürüten kişiler şifrelememizi kırmadı, herhangi bir veri tabanına sızmadı veya saklanan kullanıcı konuşmalarına doğrudan erişim sağlamadı. Bunun yerine, koruma altındaki akıl yürütme içeriklerini istekte bulunan kişinin görebileceği biçimlerde yeniden üretmek için model etkileşimlerini manipüle ettiler. Bunu, hizmet şartlarımızı ihlal ederek koordineli biçimde ve geniş ölçekte gerçekleştirdiler. Bu manipülasyon, yalnızca OpenAI modellerine özgü bir güvenlik açığı değil. Kötü niyetli damıtmaya karşı ortak savunmayı güçlendirmek amacıyla Frontier Model Forum aracılığıyla sektördeki iş ortaklarımızla bu konuda bilgi paylaştık.

Bu yazıyı yayımlamadan önce, faaliyetin kapsamını ve olası etkilerini araştırdık, kendi risk azaltma önlemlerimizi devreye aldık. Bu tür saldırılara karşı korumaların uygulanmasını sağlamak için araştırmacılar ve sektördeki iş ortaklarımızla bilgi paylaşıp onlardan geri bildirim aldık. Ek risk azaltma ve inceleme çalışmaları devam ediyor. Öğrendiklerimizi şimdi paylaşmanın, ekosistemin genelinde savunmanın güçlendirilmesine yardımcı olacağına inanıyoruz.

Neler gözlemledik?

Faaliyeti yürüten kişilerin, koruma altındaki akıl yürütme içeriklerini yeni yöntemlerle ele geçirmeye çalıştığını gördük. Bu yöntemler arasında, bir konuşmadaki şifrelenmiş akıl yürütme içeriğini kopyalayıp başka bir konuşmada bir modelden bu gizli içeriğin şifresini çözmesini ve içeriği metne dökmesini istemek de vardı.

Bağımsız güvenlik araştırmacıları⁠(yeni bir pencerede açılır) da sorumlu bildirim yoluyla, modeller arası etkileşimlerde ve konuşmalarda bağlam yoğunlaştırma sırasında ortaya çıkan ilgili güvenlik açıklarını dikkatimize sundu. Bulgularını araştırdık ve belirledikleri saldırı yollarının gerçekten kullanılabildiğini doğruladık. Çalışmaları, bu saldırı sınıfını daha geniş çerçevede anlamamıza ve risk azaltma çalışmalarını hızlandırmamıza yardımcı oldu.

Faaliyet 1 Temmuz'da başladı ve başlangıçta düşük hacimde seyretti. 24 ve 25 Temmuz'da ise 4.000'den fazla kullanıcının ilgili içeriği ele geçirme kalıbını kullanarak gönderdiği 16.000 istekle1 hacimde ani artışlar gözlemledik. İncelememizi derinleştirdiğimizde, 15.000'den fazla kullanıcıdan oluşan bir kümede bağlantılı prompt kalıplarının kullanıldığını tespit ettik ve 28 Temmuz'a kadar bu faaliyeti tamamen engelledik.

Faaliyetin zaman içinde değişmesi, kötü niyetli damıtmanın katmanlı ve uyarlanabilir savunma önlemleri gerektiren daha geniş kapsamlı bir güvenlik sorunu olduğunu bir kez daha gösterdi.

Faaliyetin arkasındaki kişilere ilişkin değerlendirmemiz

İlgili dönemde gözlemlediğimiz faaliyeti yürüten kişilerin tümünün tek bir aktöre bağlı olup olmadığı net değil. Ancak faaliyetin merkezindeki bir kümeyi, Kimi'nin geliştiricisi Moonshot AI ile bağlantılı kişilerle ilişkilendiriyoruz.

Bu neden önemli?

Kötü niyetli damıtma, güvenlik ve ulusal güvenlik açısından riskler taşıyor. Ele geçirilen akıl yürütme içerikleri, orijinal modelin kullanıcıya sunulan çıktılarına uygulanan güvenlik önlemleri korunmadan başka bir modeli eğitmek için kullanılabilir. Geniş ölçekte uygulandığında damıtma, güvenliğe aynı düzeyde yatırım yapılmasını gerektirmeden gelişmiş yeteneklerin aktarımını da hızlandırabilir. Modeller çift kullanımlı alanlarda yetenek kazandıkça bu kaygılar artıyor.

Bu risk yalnızca OpenAI'a özgü değil. Yukarıda belirtildiği gibi, benzer teknikler diğer gelişmiş yapay zeka sistemlerini de etkileyebilir. Bu da konuyu sektör genelinde koordinasyon gerektiren ortak bir güvenlik sorunu hâline getiriyor.

Nasıl karşılık verdik?

Hesaplara yönelik yaptırımlar, teknik kontroller ve iş ortaklarımızla koordinasyon yoluyla bu son damıtma kampanyasının etkisini azalttık. Sahtecilik amacıyla kullanılan hesapları yasakladık veya kısıtladık, kayıt ve altyapı kontrollerini güçlendirdik ve bağlantılı ağlara yönelik izlemeyi genişlettik.

Ayrıca kullanıcılar, çalışma alanları, kuruluşlar ve model aileleri genelinde gizli akıl yürütme içeriklerine yönelik korumaları güçlendirdik. Başka bir kullanıcının şifrelenmiş akıl yürütme içeriğini zaten elinde bulunduran bir kişinin, bu içeriği yeniden işleme sokarak şifresiz hâlini elde etmesine olanak tanıyan bir yolu kapattık. Ayrıca akıl yürütme içeriğini açığa çıkarabilecek akış hâlindeki çıktıları tespit edip bekletmek için kontroller ekledik. Bağlantılı faaliyetler üçüncü taraf hizmetlerine taşındığında, ilgili hesapları tespit edip faaliyetlerini durdurmak için bu hizmet sağlayıcılarla birlikte çalıştık.

Son olarak, ilgili bulguları Frontier Model Forum ve uygun resmî bilgi paylaşım kanalları aracılığıyla paylaştık. Böylece en üst seviye modeller geliştiren diğer kuruluşların ve kamu sektöründeki ortaklarımızın benzer faaliyetleri araştırabilmesini ve kendi savunmalarını güçlendirebilmesini amaçladık. Taşınabilir veya yeniden işleme sokulabilir akıl yürütme kayıtlarını destekleyen sistemler de benzer risklerle karşılaşabilir.

Bundan sonraki adımlar

En üst seviye modeller geliştikçe ve bu modellerin yeteneklerini taklit etmenin daha ucuz yolları arandıkça, kötü niyetli damıtma girişimlerinin daha karmaşık hâle gelmesini bekliyoruz. Bu faaliyetlere karşı savunma, katmanlı kontroller ve sürekli uyum gerektiriyor.

Bu çalışmalar henüz tamamlanmış değil. İş ortaklarının barındırdığı kurulumlar, doğrudan sunduğumuz hizmetlerle aynı korumalara ihtiyaç duyuyor. Araç çıktıları üzerinden yapılan saldırılar ise yalnızca görünür düz metni incelemekle yetinmeyen korumalar gerektiriyor. Araçlara yönelik savunmaları, sınıflandırıcıların kapsamını ve modellerin uygunsuz istekleri reddetme davranışlarını geliştirmeye, ayrıca ilgili kontrolleri bulut iş ortaklarımızın tamamında yaygınlaştırmaya devam ediyoruz.

Bu tehdide karşı çalışmalarımız üç alana odaklanmaya devam edecek: İçeriğin ele geçirilmesine karşı daha güçlü teknik korumalar, koordineli kampanyalara karşı daha iyi tespit ve yaptırım mekanizmaları, sektör ile kamu kurumları arasında daha kapsamlı tehdit bilgisi paylaşımı.

Yazar

OpenAI

Dipnotlar

  1. 1

    Bu rakamlar, mutlaka başarıya ulaşmış olanları değil, içeriği ele geçirme girişimlerini ifade eder.