Ana içeriğe atla
OpenAI

16 Eylül 2026

AraştırmaKorumalar

Model hizalama sorunlarını raporlama çerçevemiz

Yükleniyor...

OpenAI'da model hizalama sorunu vakalarını izlemek, incelemek ve açıklamak için yeni bir çerçeveyi; son altı ayda gözlemlediğimiz beklenmedik veya kaygı verici model davranışlarına ilişkin altı raporla birlikte paylaşıyoruz.

Geçmişte araştırmacıları, yapay zekâ geliştiricilerini, politika yapıcıları ve kamuoyunu daha iyi bilgilendirmek amacıyla hizalama sorunları hakkındaki bulgularımızı kamuoyuyla paylaşmaya çalıştık. Ancak bu bulguları raporlamaya yönelik sistematik bir yaklaşım olmadığı için açıklamalarımız duruma göre yapıldı ve idealden daha seyrek kaldı: Çoğu zaman birkaç vakayı tek bir raporda birleştirene kadar bekledik veya bunları yeni yayımlanan modellerin sistem kartlarına ekledik. Bu yeni çerçeve, bildirdiğimiz davranışı henüz tam olarak açıklayamamış veya azaltamamış olsak bile gözlemden sonra hizalama sorunu raporlarının yayımlanmasını hızlandırmayı amaçlıyor.

Yapay zekâ sistemleri geliştikçe ve daha yaygın biçimde kullanıma sunuldukça, hizalama araştırmalarındaki ilerlemeye ilişkin daha geniş ve daha bilgili bir uzlaşı oluşturmamız gerekiyor. Yapay zekâ sektörünün, çok daha uzun süre azami hızda ve sorumlu biçimde ölçeklendirmeyi sürdürmeye yetecek düzeyde hizalama ve izleme sorunlarını çözdüğüne inanmıyoruz. Yapay zekâ geliştirme çalışmalarının önümüzdeki aylarda ve yıllarda nasıl ilerleyeceğine ilişkin kararlar, en üst seviye modelleri geliştiren şirketlerin dışındaki kişilerin de bizzat inceleyebileceği kanıtlara dayanmalıdır.

Hizalama sorunu örnekleri, diğer yapay zekâ geliştiricilerinin sistemleri benzer yeteneklere ulaştığında karşılaşabileceği sorunları belirlemeye, güvenlik önlemlerindeki zayıflıkları ortaya çıkarmaya veya model davranışına ilişkin varsayımları sorgulamaya yardımcı olabilir. Bu bulguları paylaşmak, başkalarının aynı sorunları incelemesine, açıklamalarımızı sınamasına ve risk azaltma yöntemlerini geliştirmesine olanak tanır. Hizalama sorunlarında şeffaflığın değerine inandığımız için yeni çerçevemiz, önemi belirsiz olsa bile açıklama yapılmasını destekliyor. Bu, açıkladığımız bazı vakaların gerçekte anlamlı olmadığının, daha geniş bir örüntünün parçası olmadığının veya gelecekteki gelişmelere işaret etmediğinin anlaşılabileceği anlamına geliyor.

Şu anda yapay zekâ geliştiricilerinin modellerindeki hizalama sorunu örneklerini nasıl açıklaması gerektiğine ilişkin açık standartlar içeren, sektör genelinde geçerli bir çerçeve bulunmuyor. Bugün ana hatlarını sunduğumuz çerçevenin, geliştiricilerin hangi hizalama sorunu vakalarını açıklaması ve raporlarında nelerin yer alması gerektiğini belirleyen bu tür standartların oluşturulmasına yönelik ilk adım olmasını umuyoruz. Bu çerçeveyi, deneyimlerimiz ve kamuoyundan gelen geri bildirimlerle geliştireceğimiz, devam eden bir çalışma olarak görüyoruz.

Burada çerçevenin nasıl işleyeceğini açıklıyor ve yayımladığımız ilk raporları paylaşıyoruz.

Raporlayacağımız hizalama sorunu örnekleri

Model hizalama sorunlarının nasıl ortaya çıktığı, nasıl kendini gösterdiği ve güvenlik önlemlerinin nerede başarılı veya başarısız olduğu konusunda yararlı kanıtlar sunan örnekleri açıklamayı amaçlıyoruz. Yeni mekanizmalara, bilinen davranışlardaki anlamlı değişikliklere ve güvenlik veya risk azaltma hakkındaki varsayımları sorgulatan bulgulara öncelik veriyoruz. Bir örneğin açıklanmaya değer olması için zarara yol açması veya daha geniş bir örüntüyü kanıtlaması gerekmez. Bu çerçeve; eğitim, değerlendirme, test ve kullanıma sunma dâhil olmak üzere modelin yaşam döngüsü boyunca ölçütleri karşılayan davranışları kapsayacaktır.

Buna modellerin yetkisiz hareket etmesinin, diğer modellerle koordinasyon kurmasının veya denetimden kaçmasının yeni yolları; bir hizalama yöntemini ya da güvenlik önlemini sorgulatan aksaklıklar ve yayımlanmış bir güvenlik değerlendirmesindeki iddiayı geçersiz kılabilecek davranışlar dâhildir. Üçüncü tarafları etkileyebilecek hizalama sorunları için de aynı açıklama ölçütleri geçerlidir.

Buna, geçmişte açıkladığımız vakaları tekrarlıyor gibi görünen hizalama sorunu vakaları da dâhil olabilir. Sorunun tekrarlanması, modellerimizin davranışı veya güvenlik önlemlerimizin etkinliği hakkında başlı başına yararlı bir kanıt olabilir. Örneğin belirli bir hizalama sorunu davranışı, tekrarlanan azaltma çabalarına rağmen yeniden ortaya çıkabilir. Bu koşullarda, ilk hizalama sorunu açıklamasını güncelleyerek ek örnekleri yayımlayacağız.

Zaman içinde diğer geliştiriciler, bağımsız araştırmacılar, sektör standart kuruluşları ve düzenleyici kurumlarla birlikte daha nesnel açıklama ölçütleri geliştirmeyi planlıyoruz. Ayrıca ciddi güvenlik, emniyet ve hizalama sorunu olaylarının ABD federal hükûmetiyle paylaşılması gerektiğine inanıyor ve raporlama mekanizmaları önermek üzere çalışıyoruz. Bu çerçeveyi mevcut yükümlülüklerimizin tamamlayıcısı olarak görüyor ve kritik güvenlik olayları veya siber güvenlik ihlalleri dâhil olmak üzere yasal açıklama gerekliliklerimizin yerini almadığını belirtiyoruz.

Bugün paylaştığımız hizalama sorunu örnekleri

Hizalama sorunlarını açıklamaya yönelik yeni çerçevemizi başlatmak üzere modellerimizin eğitimi veya değerlendirilmesi sırasında gözlemlediğimiz hizalama sorunu davranışlarına ilişkin altı rapor yayımlıyoruz. Bu vakalar, kullanıcıdan bilgi gizlemekten engelleri aşmak için onaylanmamış eylemlerde bulunmaya kadar, paylaşmaya değer bulduğumuz çeşitli davranışları gösteriyor. Bunlar tekil vakalara ilişkin raporlardır ve modellerimiz genelinde hizalama sorunlarının ne sıklıkta ortaya çıktığını yansıttığı düşünülmemelidir. Aşağıdaki her madde tam rapora bağlantı içerir.

  1. Görev özetlerinde kendi oluşturduğu talimatlar(yeni bir pencerede açılır). Henüz yayımlanmamış bir araştırma modeli, yeni bir bağlam kapasitesinde çalışmasına devam etmek için kullanılan özetlere, normal kısıtlamalarını göz ardı etme talimatları da dâhil olmak üzere ilgisiz talimatlar ekledi. Etkilenen 27 özet belirledik.

  2. Görev özetlerinde hataları gizleme talimatları(yeni bir pencerede açılır). GPT‑5.6 Sol'un eğitimi sırasında birçok model örneği, hataları veya hizalama sorunu davranışlarını kullanıcıdan gizlemeye yönelik talimatları özetlerine ekledi. Örneğin bağlam yoğunlaştırma özetleri; eksik geçmiş verilerini bunu açıklamadan uydurma ve kaynak sürümleri arasındaki uyuşmazlıkları gizleme talimatları içeriyordu.

  3. Açığa çıkmış API anahtarlarını herkese açık depolarda arama ve ardından bilgi uydurma(yeni bir pencerede açılır). Bir model, Kaliforniya'daki bir ilçenin kazanç rakamlarına ilişkin sıradan bir soruyu yanıtlarken açığa çıkmış bir API anahtarı buldu ve izinsiz kullandı. İstenen rakamlara yine de ulaşamayınca bunları uydurdu ve istenen kaynaktan alınmış veriler gibi sundu.

  4. Atıfta bulunabilmek için dosyaları internete yükleme(yeni bir pencerede açılır). Bir kullanıcı henüz yayımlanmamış bir modelden 5.000.000 metrekareden büyük göllerin kimliklerini ve adlarını istediğinde ajan, Python kullanarak doğru yanıtı buldu. Ancak talimatlar tarayıcıdan bir kaynak gösterilmesini istediği için ajan, kullanıcıya sormadan dosyayı yükleyip yanıtında ona atıfta bulunmaya karar verdi.

  5. Dâhilî bir yazılım deposu üzerinden onaylanmamış yazma işlemleri ve iletişim(yeni bir pencerede açılır). Modeller, eksik girdi dosyalarını ararken farklı eğitim örnekleri arasında istek ve yanıt alışverişinde bulunmak için dâhilî bir yazılım deposunu mesaj panosu olarak kullandı ancak bu dosyaları kurtaramadı. Bu rapor ayrıca bir modelin ağ kısıtlamalarını aşmaya çalışırken test dosyalarını bir depoya başarıyla yüklediği daha eski bir vakayı da inceliyor.

  6. Birlikte çalışan ajanlar arasında onaylanmamış dosya paylaşımı(yeni bir pencerede açılır). Aynı eğitim görevi üzerinde birlikte çalışan ajanlar, birbirlerinin yerel dosyalarına erişemediklerinde dosya paylaşmak için herkese açık dosya barındırma sitelerini kullandı. Görev, modellerden yalnızca yerel dosyaları kullanmalarını istemesine rağmen bu durum, görev çıktılarını herkese açık URL'lerden erişilebilir hâle getirdi.

Açıklama sürecimiz nasıl işliyor?

Her OpenAI çalışanı, güvenlik ve hizalama ekiplerimizin incelemesi için bir hizalama sorunu örneğini bildirebilir ve bunun kamuoyuna açıklanmasının değerlendirilmesini isteyebilir. Böylece, inceleme ve açıklamanın zamanında yapılmasını sağlamak için her adımı son tarihlere bağlı olan açıklama sürecimiz başlar.

Bir örnek bildirildikten sonra teknik personelimiz ne olduğunu, hangi noktaların belirsiz kaldığını, kamuoyuna açıklama yapmanın gerekli olup olmadığını ve hangi olguların paylaşılabileceğini inceleyecektir. Ayrıca herhangi bir üçüncü tarafın etkilenip etkilenmediğini ve yayımdan önce özel olarak bilgilendirilmesi gerekip gerekmediğini değerlendirecektir.

Ardından örnek üç süreçten birine atanacaktır: Açıklamaya Hazır, Sınırlı İnceleme veya Kapsamlı İnceleme (“Yavaş Süreç”).

Açıklamaya Hazır, incelemesi değerlendirmeden sonra yayımlanabilecek kadar tamamlanmış ve ölçütleri karşılayan vakaları kapsar. Sınırlı İnceleme, daha fazla teknik inceleme gerektiren vakaları kapsar. Bu iki sürecin açıkladığımız vakaların büyük çoğunluğunu, özellikle kapsamlı inceleme, üçüncü taraflarla koordinasyon veya ciddi kötüye kullanım risklerinin ele alınmasını gerektirmeyen vakaları kapsamasını bekliyoruz. Bugün yayımladığımız vakaların tamamı bu iki süreçten birine giriyor.

Kapsamlı İnceleme, özellikle üçüncü tarafları içeren karmaşık incelemeleri kapsar. Bir üçüncü taraf etkilendiğinde güvenlik, hukuk ve sorumlu açıklamaya ilişkin yükümlülüklerimiz bu çerçevenin önüne geçer. İlk bildirimi mümkün olan en kısa sürede yayımlamayı amaçlayacağız ancak güvenlik gerekçeleriyle ertelememiz gerekebilir. Örneğin bir model, yaygın kullanılan bir yazılımda daha önce bilinmeyen bir güvenlik açığı keşfedebilir. Bir rapor üçüncü tarafın kimliğini açığa çıkaracaksa herhangi bir güvenlik sınırı aşılmamış olsa bile önceden bildirimde bulunmayı amaçlıyoruz.

Kapsamlı İnceleme kapsamındaki bir vakanın ilk bildiriminde; ne olduğu genel hatlarıyla açıklanacak, dışarıdan uzmanların incelemeye destek verip vermediği belirtilecek ve nihai raporun ne zaman yayımlanacağına ilişkin mevcut tahminler sunulacaktır. OpenAI Hugging Face olayı bu çerçeve kapsamında açıklanmış olsaydı bu sürece girerdi.

Örneği gündeme getiren çalışana, açıklanıp açıklanmayacağına ilişkin karar ve açıklanacaksa hangi sürecin izleneceği bildirilecektir. Açıklama veya uygun süreç konusundaki çözülemeyen anlaşmazlıklar; en üst seviye model yeteneklerini ve güvenlik önlemlerini değerlendiren, Risklere Hazırlık Çerçevemizi denetleyen ve OpenAI yönetimine danışmanlık yapan, şirketin farklı bölümlerindeki üst düzey yetkililerden oluşan OpenAI Güvenlik Danışma Grubuna (SAG) iletilecektir. SAG içindeki anlaşmazlıklar veya çalışanların grubun kararlarına itirazları OpenAI yönetimine taşınacaktır. Açıklama yapmama veya açıklamanın gerekli olmadığı yönündeki kararlar, güvenlik ve hizalama yöneticileriyle ve mümkün olduğu ölçüde ilgili teknik personelle paylaşılacaktır.

Bu açıklama sürecini uygulamadaki işleyişinden öğrendiklerimiz doğrultusunda gözden geçirebilir ve değişiklikleri bu gönderiye kaydedebiliriz.

Her raporda yer alacak bilgiler

Her tam raporda gözlemlediğimiz davranış, davranışın ciddiyeti ve dış etkileri, gerçekleştiği ortam, tarihi veya tarih aralığı, ne zaman keşfedildiği ve ilgili model ya da modeller hakkında genel bilgiler yer alacaktır. Mümkün olduğunda şunları da paylaşacağız:

  • Olayın ayrıntıları ve bundan kaynaklanan zararlar;

  • Hizalama sorununu nasıl keşfettiğimiz ve incelememizin kapsamı;

  • Bunun hizalama araştırmaları ve teknik yapay zekâ güvenliği açısından sonuçlarına ilişkin yorumumuz;

  • Örneğin gündeme getirdiği önemli ve yanıtsız sorular;

  • Davranışı ele almak için aldığımız veya almayı planladığımız önlemler. Hizalama sorunu raporunu incelememizi tamamlamadan veya bir çözüm geliştirmeden yayımlayabileceğimiz için bu bilgiler açıklama sırasında her zaman mevcut olmayabilir.

Müşteri ortamlarındaki hizalama sorunlarında, müşteri gizliliğinin ve sözleşmeden doğan yükümlülüklerimizin izin verdiği ölçüde bilgi paylaşacağız.

Bugünkü raporlar, bilinen hizalama sorunlarının veya devam eden incelemelerin kapsamlı bir dökümü değil, ilk açıklama grubudur. Bu ilk raporlar, çerçevenin kapsadığı vakaların tüm çeşitliliğini veya ciddiyet düzeylerini temsil etme amacı taşımamaktadır. Bu çerçevenin ölçütlerini karşılayan hizalama sorunu vakalarını açıklamayı taahhüt ediyoruz. Bunlar arasında daha uzun inceleme veya üçüncü taraflarla koordinasyon gerektiren daha karmaşık vakalar da bulunmaktadır. Bu çerçeve kapsamında düzenli olarak rapor yayımlamayı sürdürecek, raporlama taahhütlerimizi geliştirdikçe bunlar hakkında daha fazla bilgi paylaşacağız.

Yazar

OpenAI