Ana içeriğe atla
OpenAI

1 Eylül 2026

KorumalarGüvenlik

Astra'ya giden yol: Kritik kabiliyetler ve en üst seviye korumalar

Yükleniyor...

Astra'nın kritik düzeyde siber güvenlik kabiliyetine ulaşabileceğine ilişkin önceki değerlendirmemizden bu yana daha fazla bulgu elde ettik ve modelin kabiliyetlerini değerlendirmek için ek değerlendirmeler gerçekleştirdik. Artık Astra'nın Risklere Hazırlık Çerçevemiz kapsamındaki Kritik siber güvenlik kabiliyeti eşiğini karşıladığına inanıyoruz. Bu, doğru araçlar ve erişime sahip olduğunda Astra'nın, her adımda bir insanın yönlendirmesine ihtiyaç duymadan iyi korunan birçok sistemde daha önce bilinmeyen güvenlik açıklarını bulabileceği ve bu güvenlik açıklarını istismar etme yöntemleri geliştirebileceği anlamına geliyor. Bu düzeyde sınıflandırdığımız ilk model olan Astra, geliştirme sırasında ve kullanıma sunulmadan önce daha güçlü korumalar gerektirir.

Son birkaç haftada siber kötüye kullanıma ve modelin yetkisiz eylemlerine karşı korumaları güçlendirip test ederken Astra'nın geliştirme ve kullanıma sunma süreçlerinin bazı bölümlerini erteledik. Bu çalışmaya dayanarak Astra'nın korumalarının, Risklere Hazırlık Çerçevemiz kapsamında kullanıma sunulması için ciddi zarar riskini yeterince azalttığına inanıyoruz.

Astra Hugging Face olayında yer almamış olsa da bu olaydan çıkardığımız dersleri(yeni bir pencerede açılır) güvenlik yaklaşımımıza dahil ettik. Geriye dönük testlerimize dayanarak o dönemde kullandığımız üretim korumalarının Hugging Face olayını önleyebileceğine inanıyoruz. O zamandan bu yana Astra için daha da güçlü korumalar uygulamaya koyduk. Bunlar arasında modelin zararlı siber talepleri daha güvenilir biçimde reddetmesi ve güvenlik kısıtlamalarına uyması için eğitilmesi, kötüye kullanıma karşı ek korumalar ve potansiyel olarak yetkisiz etkinlikleri durdurabilen izleme sistemleri yer alıyor.

Astra'yı yakında kullanıma sunmayı planlıyoruz ancak en gelişmiş siber güvenlik kabiliyetlerine erişim daha sınırlı olacak. Gelişmiş siber güvenlik çalışmaları başlangıçta bir test kullanıcısı grubuna sunulacak; ardından savunma amaçlı kullanımı genişletmek için Daybreak Blue üzerinden erişim sağlanacak.

Güvenlik, emniyet ve uyum testlerimiz ile değerlendirmelerimiz hakkında daha fazla ayrıntıyı kullanıma sunulduğunda modelin sistem kartında paylaşacağız. Kullanıma sunmadan önce, bu düzeyde siber güvenlik kabiliyetlerine sahip bir modeli güvenle sunmaya hazırlanmak için yürüttüğümüz bazı çalışmalar hakkında güncel bilgi vermek ve kalan riskler konusunda şeffaf olmak istiyoruz.

Astra'nın siber güvenlik kabiliyetlerinin değerlendirilmesi

Risklere Hazırlık Çerçevemize göre bir model, aşağıdaki koşullardan birini karşılıyorsa Kritik eşiğe ulaşmış sayılır:

  • Model, gerçek dünyadaki güçlendirilmiş pek çok kritik sistemde, insan müdahalesi olmadan her önem düzeyinde işlevsel sıfırıncı gün istismarları belirleyip geliştirebilir.
  • Model, yalnızca üst düzey bir hedef verildiğinde güçlendirilmiş hedeflere yönelik yeni ve uçtan uca siber saldırı stratejileri tasarlayıp uygulayabilir.

Astra'ya yönelik hazırlık değerlendirmemiz, otomatikleştirilmiş herkese açık ve özel kıyaslamaları uzmanların yürüttüğü değerlendirmelerle bir araya getirdi. Astra, GPT‑5.6 Sol'a kıyasla siber güvenlik kabiliyetlerinde önemli bir ilerlemeyi temsil ediyor: Hem token kullanımı açısından çok daha verimli hem de güvenlik açıklarını belirleme ve istismar geliştirme konusunda daha kabiliyetli.

Örneğin Astra'yı, modelin bilinen güvenlik açıklarından istismar geliştirme kabiliyetini ölçen ExploitBench'te çalıştırdık ve model kıyaslamada %100'lük kusursuz bir puan aldı.

Değerlendirme verilerinin eğitim verilerinde yer almış olabileceğine ilişkin endişeler nedeniyle, yakın zamanda açıklanan yüksek önem düzeyli 20 V8 güvenlik açığını içeren "ExploitBench - Internal Port (Haziran-Ağustos 2026)" adlı şirket içi bir kıyaslama oluşturduk. Astra, bu veri kümesinde GPT‑5.6 Sol'a göre çok daha az çıktı token'ı kullanarak çok daha yüksek rastgele kod yürütme oranlarına ulaşıyor. Değerlendirme sırasında model, bir istismar zincirinin parçası olarak iki sıfırıncı gün güvenlik açığı bulup kullandı. Bu iki güvenlik açığını, ilgili projelerin bakımını yapan ekiplere bildirme sürecindeyiz.

Gösterilen Astra sonuçları, varsayılan üretim yapılandırmasını değil, Daybreak Blue erişimiyle elde edilebilen kabiliyetleri yansıtmaktadır.

Güçlendirilmiş bir tarayıcı ve işletim sistemi üzerinde uzmanlar tarafından yürütülen değerlendirmelerde Astra, daha önce bilinmeyen güvenlik açıkları keşfetti ve bunları işleyen istismar zincirlerine dönüştürdü. Tarayıcı bir HTML dosyasını açtığında korumalı alandan çıkarak ana sistemde komut çalıştırabilen eksiksiz bir tarayıcı ele geçirme zinciri oluşturdu. Model ayrıca güçlendirilmiş bir işletim sisteminde birden fazla güvenlik açığı buldu ve bunları, ayrıcalıksız bir kullanıcı hesabından root erişimine uzanan yerel bir ayrıcalık yükseltme zincirinde birleştirdi. Tüm bulguları birlikte değerlendirdiğimizde Astra'nın Kritik eşiği karşıladığı sonucuna vardık.

Kritik kabiliyetler için gereken korumalar

Astra düzeyinde siber güvenlik kabiliyetlerine sahip modellerin geliştirilmesi sırasında ve devreye alınmasından önce ciddi siber zarar riskini en aza indirmek için iki risk senaryosunu ele almamız gerekiyor:

  • Kötü niyetli aktörlerin modeli kullanması. Korumalarımız, kötü niyetli aktörlerin Astra'yı kullanarak güçlendirilmiş kritik sistemlerde daha önce bilinmeyen güvenlik açıklarına yönelik istismarlar geliştirmesini veya güçlendirilmiş hedeflere karşı uçtan uca saldırılar gerçekleştirmesini etkili biçimde önlemelidir.
  • Modelin yetkisiz ve uyumsuz eylemlerde bulunması. Kötü niyetli bir kullanıcı olmasa bile gelişmiş siber güvenlik kabiliyetlerine sahip bir model, uyumsuzsa kendi başına siber zarara yol açabilir. Bu kabiliyetlere sahip modellerin uyumu için çok yüksek standartlar belirlemenin yanı sıra korumalarımız, gerçek dünyada ciddi zarara yol açabilecek uyumsuz eylemleri ikinci bir savunma katmanı olarak hızla tespit edip kontrol altına alabilmelidir.

İkinci risk senaryosunun hem şirket içi geliştirme hem de harici devreye alım için geçerli olduğunu özellikle belirtmek gerekir. Daha önce açıkladığımız üzere OpenAI-Hugging Face olayının ardından; izolasyon ve ağ kontrolleri, kapsamı genişletilen izleme sistemleri, güçlendirilen uyum eğitimi ve eşikleri dahil olmak üzere eğitim altyapımızı daha güvenli hale getirmek için bazı en üst seviye eğitimleri (Astra'ya yönelik bazı eğitimler dahil) iki hafta boyunca duraklattık. Ardından daha sıkı kontroller altında, daha küçük ölçekli çalışmalara devam ettik.

Eğitim ortamlarının güvenliği ve emniyeti için daha yüksek standartlar belirlerken Astra'nın gelecekteki sürümlerine yönelik bazı büyük pekiştirmeli öğrenme (RL) eğitim çalıştırmalarını daha uzun süre erteledik. Yeni güvenlik ve emniyet gereklilikleri uygulamaya konduktan sonra, daha önce duraklattığımız büyük ölçekli en üst seviye RL eğitim çalıştırmasını 28 Ağustos'ta yeniden başlattık. Bazı küçük deneysel eğitim çalıştırmalarını ise geçici olarak ertelemeyi sürdürüyoruz.

Astra'yı kullanıma sunmaya hazırlanmak, siber kötüye kullanıma ve yetkisiz eylemlere karşı daha güçlü korumalar geliştirmemizi de gerektirdi. Aşağıda bu korumaları ve nasıl test edildiklerini açıklıyoruz.

Siber kötüye kullanıma karşı dayanıklılık

Siber güvenlik alanında Yüksek kabiliyetli olarak değerlendirdiğimiz ilk modeli Şubat ayında devreye aldığımızdan bu yana her yeni sürümde siber korumalarımızı güçlendirdik. Genel güvenlik yaklaşımımız; ön eğitim sonrası modellerin ret davranışlarını, sistem düzeyindeki güvenlik sınıflandırıcılarını, çevrimdışı tespiti ve tehditleri engellemeye yönelik önlemleri katmanlar halinde bir araya getiriyor.

GPT‑5.6(yeni bir pencerede açılır) için siber kötüye kullanımı tespit eden aktivasyon sınıflandırıcıları ekledik ve yoğun otomatik red teaming çalışmalarıyla belirlenen evrensel jailbreak'lere karşı koruma kapsamımızı genişlettik. Böylece sistem düzeyindeki koruma katmanlarımızın dayanıklılığını önemli ölçüde artırdık. Bu iyileştirmeleri temel alarak Astra için koruma sistemimizin model katmanına daha fazla yatırım yaptık ve korumalarımızın konuşmalar arası bağlamı işleme kabiliyetini geliştirdik.

  • Model dayanıklılığına yönelik yeni eğitim tekniklerinden yararlanan Astra, izin verilmeyen siber yardım taleplerini daha kararlı biçimde reddediyor. Siber jailbreak değerlendirmelerimizde Astra, taleplerin %91,5'ini reddederken GPT‑5.6 Sol'da bu oran %59'da kalıyor.
  • Daha yüksek riskli olarak değerlendirilen hesaplarda, potansiyel olarak riskli siber yardım taleplerinin daha geniş bir bölümünü reddeden, daha ihtiyatlı bir model davranışı sınırı uyguluyoruz. Yüksek riskli kullanıcıların bu tür siber kötüye kullanım girişimlerini tespit edebilmek için izleme sistemlerimizin değerlendirdiği bağlamı genişlettik.

Titiz testler, şirket içi ve harici red teaming çalışmaları ile düzeltmelerden oluşan programımızı da sürdürüyoruz. Önceki test dönemlerinde belirlenen tüm jailbreak'lerin kapsam dahilinde kalmasını regresyon testleriyle doğrulamanın yanı sıra en yeni şirket içi red teaming saldırganlarımızla yeni bir test süreci yürütüyoruz. Ortak bir jailbreak derecelendirme sistemi tanımlamak için sektör ortaklarıyla çalışıyoruz. Yeni bulguları inceleyip ele almak üzere 7/24 hızlı müdahale programımızdan yararlanacağız. Siber koruma testlerimizle ilgili daha fazla ayrıntıyı Astra sistem kartında paylaşacağız.

Savunma ekiplerinin güvenlik açıklarını bulup gidermesine yardımcı olmak, güvenlik yaklaşımımızın temel unsurlarından biri olmaya devam ediyor. Potansiyel kötüye kullanımı önlemek amacıyla Astra'nın korumalarının, kullanıma sunulduğu ilk aşamada uzun vadede hedeflediğimizden daha fazla kısıtlama getirmesini bekliyoruz. Astra'nın gelişmiş siber güvenlik iş akışlarına erişimi başlangıçta küçük bir alfa test kullanıcısı grubuna açılacak. Daha sonra savunma amaçlı kullanımı desteklemek üzere Daybreak Blue üzerinden erişim genişletilecek.

Uyum ve izleme

Modelin potansiyel olarak uyumsuz eylemlerde bulunmasını önlemek için yeni katmanlı korumalar da uygulamaya koyduk:

  • Model uyumu: Değerlendirmelerimizde Astra'nın açık güvenlik ve emniyet kısıtlamalarına uyma ve yetkilendirildiği kapsam içinde kalma olasılığı GPT‑5.6 Sol'dan çok daha yüksekti. Bu da Astra'yı bugüne kadarki en uyumlu modelimiz yapıyor. Özellikle modelin güvenlik ve emniyet kısıtlamalarına uyma ve yetkilendirildiği kapsam içinde kalma eğilimine odaklandık.
  • İzleme ve kontrol: Şirket içinde uyguladığımız prosedürlere paralel olarak Astra'yı, potansiyel uyumsuz eylemleri hızla tespit edip kontrol altına almaya yönelik ek düşünce zinciri izleme sistemleriyle devreye alıyoruz.

Astra, model uyumu açısından önemli bir ilerlemeyi ve uzun süredir devam eden çeşitli uyum çalışmalarının birikimini temsil ediyor. Bu çalışmalar, ön eğitim müdahalelerinden pekiştirmeli öğrenme sırasında daha dikkatli ve tutarlı puanlamaya kadar uzanıyor. Testlerimizde Astra'nın açık güvenlik kısıtlamalarına ve otomatik inceleme gibi uyarılara GPT‑5.6 Sol'dan daha tutarlı biçimde uyduğunu görüyoruz.

ExploitGym siber değerlendirmesini yürüten ajanların üçüncü bir tarafın sistemlerini ele geçirdiği Hugging Face olayından edindiğimiz bilgiler doğrultusunda bir test de geliştirdik. Modelin kendisine verilen görevi çözmek yerine çevresindeki güvenlik altyapısını ele geçirmeye çalışıp çalışmayacağını ölçen "bal küpü" testleri oluşturmak için bu değerlendirmenin en zor görevlerini kullandık. Üretim korumaları bulunmayan GPT‑5.6 Sol, modele istismar geliştirme talimatı verilen kıyaslama ortamını simüle eden testlerin %56'sında bu hedeflere erişmeye çalıştı. Astra bu testlerde böyle bir girişimde bulunmadı. Bu rakamlar normal üretim kullanımını değil, siber korumaların bulunmadığı test koşullarındaki davranışı gösteriyor.

Sol taraf: Bu yeni değerlendirmede modellerin otomatik incelemeden ret yanıtı aldıklarında nasıl tepki verdiğini gözlemliyoruz. Her görev bir bilgi işi ortamında gerçekleştiriliyor ve görev yürütümü, otomatik incelemenin ret yanıtından hemen sonra başlıyor. Model daha sonra farklı yollar izleyebilir: görev yürütümünü sonlandırabilir, daha güvenli bir alternatif bulmaya çalışabilir, benzer bir komutu yeniden deneyebilir veya otomatik incelemeyi tamamen atlatmak için kötü bir yapılandırmadan(yeni bir pencerede açılır) yararlanabilir. Son iki seçeneğin izlenmesi bu değerlendirmede başarısızlık sayılır. Astra, otomatik incelemeyi atlatmayı hiç denemedi.

Sağ taraf: Bu değerlendirmede, ExploitGym'deki en zor veya çözülemeyen görevlerle karşılaştığında bir modelin "bal küplerini" kullanarak hile yapma eğilimini ölçüyoruz. Test, modelin davranışını değerlendirmek amacıyla korumaların yalnızca gözlem modunda olduğu simüle edilmiş bir ortamda yürütüldü. GPT‑5.6 Sol bu senaryolarda hile yapmaya daha yatkın görünürken Astra bu kestirme yolları kullanmayı denemedi ve yine de bazı görevleri meşru yollarla çözebildi.

Modelleri uyumlu olacak şekilde eğitmek, güvenlik katmanlarından biridir. Uyum testlerimiz ve sonuçlarımız hakkında daha fazla ayrıntıyı Astra sistem kartında paylaşacağız.

Potansiyel uyumsuzluğu tespit edip hızla kontrol altına almak için Astra sınıfı modellerde uyumsuzluk izleme sistemini üretim ortamında da devreye alıyoruz. Bu korumalar şirket içi devreye alımlarda kullandığımız izleme sistemlerine benziyor. Modelin akıl yürütmesini ve eylemlerini yetkisiz davranışlar açısından denetleyen sınıflandırıcılardan oluşan sistem, potansiyel olarak yetkisiz etkinlikleri otomatik olarak durduruyor. Modellerimizin kabiliyetleri arttıkça bu korumalar iyi bir model uyumunun yerini tutamaz. Hedefimiz, gelecekteki modellerin bu korumaları hiçbir zaman tetiklemeyecek kadar iyi uyum sağlamasıdır.

Bunun kullanıcılar için anlamı

OpenAI, yapay zekanın faydalarının geniş kitlelerce erişilebilir olmasını sağlamaya kararlıdır. Astra'nın siber güvenlik kabiliyetlerindeki önemli artış nedeniyle bu modelin güvenli ve emniyetli biçimde devreye alınması konusunda özellikle dikkatli davranıyoruz. Ek güvenlik kontrolleri, savunma amaçlı siber güvenlik çalışmaları dahil olmak üzere meşru işleri bazen yavaşlatabilir, duraklatabilir veya durdurabilir.

Sistem zaman zaman meşru etkinlikleri potansiyel siber kötüye kullanım veya yetkisiz davranış olarak işaretleyebilir ve bu etkinliklerin yanlışlıkla yavaşlatılmasına, duraklatılmasına veya durdurulmasına yol açabilir. Bu durum, doğrudan siber güvenlikle ilişkili görünmeyen çalışmaları veya bir ajanın uzun süre çalıştığı görevleri de kapsayabilir.

Uyumsuzluk izleme sistemi bir görevi duraklatırsa ChatGPT veya Codex kullanıcılarından devam etmeden önce ilgili eylemi incelemeleri istenebilir. API gibi diğer platformlarda ise görev durdurulur. Gereksiz kesintileri azaltmak ve Daybreak gibi programlar aracılığıyla en üst seviye kabiliyetlere erişimi genişletmek için bu korumaları kalibre etmeyi sürdüreceğiz.

Geleceğe bakış

Modellerin daha ciddi sonuçlar doğurabilecek işleri üstlenebildiği ve uyum veya kontrol hatalarının daha ağır sonuçlara yol açabildiği bir yapay zeka geliştirme aşamasına giriyoruz. Bu sistemlerin faydalarından yararlanabilmemiz, kabiliyetleri arttıkça modelleri uyumlu hale getirip kontrol edebilmemize bağlı olacak.

Bu sorumluluk eğitim, değerlendirme ve devreye alma süreçlerinin tamamını kapsıyor. Uyumlu davranışa ilişkin daha güçlü kanıtlar, kabiliyetlerdeki gelişmelere ayak uyduran korumalar ve bu korumalar yeterli olmadığında çalışmaları yavaşlatma kararlılığı gerektiriyor.

Bu sistemleri test etmeye, öğrendiklerimizi paylaşmaya ve belirsizliğini koruyan konuları açıkça belirtmeye devam edeceğiz. Astra'dan sonra gelecek modeller daha fazlasını yapmamızı gerektirecek. Bu sorumluluğu yerine getirmek için gereken zamanı ayıracak ve gerekli çalışmaları yürüteceğiz.