Bugün güvenlik sınıflandırma görevlerine yönelik açık ağırlıklı akıl yürütme modellerimiz gpt-oss-safeguard'ın araştırma önizlemesini kullanıma sunuyoruz. Modeller iki farklı boyutta sunuluyor: gpt-oss-safeguard-120b ve gpt-oss-safeguard-20b. Bu modeller, açık ağırlıklı gpt-oss modellerimizin ince ayarlı versiyonlarıdır ve herkesin bunları özgürce kullanmasına, değiştirmesine ve dağıtmasına olanak tanıyan aynı Apache 2.0 lisansı kapsamında sunulur. Her iki model de bugün Hugging Face(yeni bir pencerede açılır) üzerinden indirilebilir.
gpt-oss-safeguard modelleri, geliştiricinin sağladığı bir politikayı çıkarım sırasında doğrudan yorumlamak için akıl yürütmeden yararlanır ve kullanıcı mesajlarını, tamamlamaları ve sohbetlerin tamamını geliştiricinin ihtiyaçlarına göre sınıflandırır. Hangi politikanın kullanılacağına her zaman geliştirici karar verdiği için yanıtlar geliştiricinin kullanım senaryosuna daha uygun ve özel olarak uyarlanmış olur. Model, geliştiricinin kararların nasıl verildiğini anlamak için inceleyebileceği bir düşünce zinciri kullanır. Ayrıca politika, modelin eğitimine dahil edilmek yerine çıkarım sırasında sağlanır. Böylece geliştiriciler performansı artırmak için politikaları yinelemeli olarak kolayca gözden geçirip düzenleyebilir. Başlangıçta şirket içi kullanım için geliştirdiğimiz bu yaklaşım, çok sayıda etiketli örnek arasından dolaylı bir karar sınırı çıkarmak üzere sınıflandırıcı eğitmeye dayalı geleneksel yöntemden çok daha esnektir.
gpt-oss-safeguard, geliştiricilerin kullanım senaryolarına en uygun politika kapsamını ve sınırlarını belirlemelerine olanak tanır. Örneğin, bir video oyunu tartışma forumu, oyunda hile yapmayı ele alan gönderileri sınıflandırmak için bir politika geliştirmek isteyebilir. Bir ürün değerlendirme sitesi ise sahte olma ihtimali yüksek yorumları taramak için kendi politikasını kullanmak isteyebilir.
Model aynı anda iki girdi alır: bir politika ve bu politikaya göre sınıflandırılacak içerik. Ardından içeriğin nasıl sınıflandırılması gerektiğine ilişkin sonucu, gerekçesiyle birlikte üretir. Geliştiriciler, bu sonuçları kendi güvenlik işlem hatlarında kullanıp kullanmayacaklarına ve kullanacaklarsa nasıl kullanacaklarına kendileri karar verir. Akıl yürütmeye dayalı bu yaklaşımın özellikle şu durumlarda iyi performans gösterdiğini gözlemledik:
- Olası zarar yeni ortaya çıkıyorsa veya değişim gösteriyorsa ve politikaların hızla uyarlanması gerekiyorsa.
- Alan çok fazla nüans barındırıyorsa ve daha küçük sınıflandırıcıların ele alamayacağı kadar karmaşıksa.
- Geliştiricilerin platformlarındaki her risk için yüksek kaliteli bir sınıflandırıcı eğitmeye yetecek kadar örneği yoksa.
- Gecikme, yüksek kaliteli ve açıklanabilir etiketler üretmekten daha az önemliyse.
Araştırma ve güvenlik topluluğundan geri bildirim almak ve model performansını daha da geliştirmek amacıyla gpt-oss-safeguard'ın bu önizleme sürümünü kullanıma sunuyoruz. Geçtiğimiz aylarda geliştiricilerin kritik ihtiyaçlarını belirlemek, modeli test etmek ve geliştirici belgeleri hazırlamak için bu açık ağırlıklı sürüm üzerinde ROOST(yeni bir pencerede açılır) ile birlikte çalıştık. Bu lansman kapsamında ROOST, online ortamları korumaya yönelik açık yapay zeka modellerini incelemek için bugün kullanıma açılacak bir model topluluğu(yeni bir pencerede açılır) da kuracak. Bu sürümle birlikte, önizleme modelinin güvenlik performansını ayrıntılı olarak açıklayan kısa bir teknik rapor da yayınlıyoruz.
Güvenlik konusunda derinlemesine savunmaya inanıyoruz. Modellerimizi güvenli yanıtlar verecek şekilde eğitiyor ve politikalarımız kapsamında güvenli olmayabilecek girdilerle çıktıları tespit edip ele almak için ek koruma katmanları uyguluyoruz. Belirli bir risk alanında güvenli ve güvensiz içerikleri birbirinden ayıran güvenlik sınıflandırıcıları, uzun süredir kendi büyük dil modellerimiz ve diğer büyük dil modelleri için temel savunma katmanlarından biri olmuştur.
Moderation API(yeni bir pencerede açılır) aracılığıyla sunulanlar gibi geleneksel güvenlik sınıflandırıcıları, önceden tanımlanmış güvenlik politikaları kapsamında binlerce güvenli ve güvensiz içerik örneğinin uzmanlar tarafından seçilip düzenlenmesiyle geliştirilir. Sınıflandırıcı, bu eğitim verilerinden güvenli ve güvensiz çıktıları birbirinden ayırmayı öğrenir. Bu geleneksel yaklaşımda sınıflandırıcı, güvenlik politikasını hiçbir zaman doğrudan görmez. Bunun yerine, güvensiz olarak etiketlenen içerikler arasındaki benzerlikleri ve güvenli içeriklerle aralarındaki farkları belirleyerek örnekleri etiketlemek için kullanılan temel politikayı çıkarsamaya çalışır.
Geleneksel sınıflandırıcılar, düşük gecikme ve işletme maliyetiyle yüksek performans gösterebilir. Ancak yeterli sayıda eğitim örneği toplamak zaman alıcı ve maliyetli olabilir. Politikayı güncellemek veya değiştirmek için de sınıflandırıcının yeniden eğitilmesi gerekir.
gpt-oss-safeguard farklıdır. Akıl yürütme yetenekleri sayesinde geliştiriciler, kendilerinin yazdığı veya başka kaynaklardan aldığı politikalar gibi tüm politikaları uygulayabilir. Akıl yürütme, modellerin yeni yazılmış politikaları da etkili biçimde uygulamasına yardımcı olur. gpt-oss-safeguard, güvenlik politikalarının yanı sıra belirli ürünler ve platformlar açısından önemli olan başka ölçütlere göre içerik etiketlemek için de kullanılabilir.
Başlıca akıl yürütme modellerimiz artık güvenlik politikalarımızı doğrudan öğreniyor ve neyin güvenli olduğunu değerlendirmek için akıl yürütme yeteneklerini kullanıyor. Akıl yürüterek uyumlanma adını verdiğimiz bu yaklaşım, önceki güvenlik eğitimi yöntemlerini önemli ölçüde geliştirir. Yetenekleri artsa bile akıl yürütme modellerimizi, kendilerinden önceki akıl yürütme özelliği olmayan modellere kıyasla çeşitli ölçütlerde daha güvenli hale getirir. Ancak akıl yürütme yalnızca modellerin eğitiminde yararlı değildir. Derinlemesine savunma için de yeni olanaklar sağlar. Akıl yürütmeye dayalı yaklaşımlar daha esnektir ve önceki eğitimlerinin ayrıntılarıyla daha az sınırlıdır. Bu avantajlar, kimi zaman beraberinde getirdikleri ek hesaplama maliyetini ve gecikmeyi fazlasıyla karşılar.
gpt-oss-safeguard, şirket içinde Safety Reasoner (Güvenlik için Akıl Yürütme) adını verdiğimiz bir araçta geliştirdiğimiz yaklaşımın açık ağırlıklı uygulamasıdır. İlk olarak politika etiketleme görevlerinde pekiştirmeli ince ayar yaptık ve modeli, insan uzmanların doğru değerlendirmelerini yansıttığında ödüllendirdik. Böylece model, politikanın verdiği karara nasıl temel oluşturduğu üzerine akıl yürütmeyi öğrendi. Bugün Safety Reasoner sayesinde üretimdeki güvenlik politikalarımızı, bir sınıflandırıcıyı yeniden eğitmekten daha kısa sürede dinamik olarak güncelleyebiliyoruz. Bu özellik, Safety Reasoner'ı yinelemeli dağıtım için önemli bir araç haline getiriyor. Yeni modelleri üretime alırken genellikle daha katı politikalarla başlıyor ve Safety Reasoner'ın bu politikaları dikkatle uygulayabilmesi için gerektiğinde nispeten yüksek miktarda hesaplama kaynağı kullanıyoruz. Ardından canlı kullanım ortamındaki riskleri daha iyi anladıkça politikalarımızı düzenliyoruz. Yakın zamandaki bazı lansmanlarda toplam hesaplama kapasitesinin güvenliğe yönelik akıl yürütmeye ayrılan payı %16'ya kadar çıktı.
Safety Reasoner, güvenlik altyapımızın temel bileşenlerinden biri haline geldi. Görsel oluşturma ve Sora 2 için çıktıları dinamik olarak adım adım değerlendirerek güvenli olmayan üretimleri gerçek zamanlı olarak belirleyip engelliyor. Biyoloji ve kendine zarar verme gibi alanlarda, hangi içeriklerin ilgili alana girdiğini belirlemek için Moderation API'de kullanılanlara benzer küçük, hızlı ve yüksek geri çağırma oranına sahip sınıflandırıcılar çalıştırıyor, ardından bu içerikleri incelemek için Safety Reasoner'ı kullanıyoruz. Safety Reasoner, en uygun yanıtı belirlemek için model çıktılarını ayrıntılı bir sınıflandırma sistemine göre değerlendirir. GPT‑5 ve ChatGPT Agent gibi sistemlerdeki çok katmanlı güvenlik önlemlerimizin bir parçasını oluşturur. gpt-oss-safeguard modelleri artık aynı yaklaşımı herkesin kullanımına sunuyor.
gpt-oss-safeguard modellerini hem kurum içi hem de kurum dışı değerlendirme setlerinde değerlendirdik.
Kurum içi değerlendirmede, çıkarım sırasında gpt-oss-safeguard'a aynı anda birden çok politika sunduk. Her test girdisi için gpt-oss-safeguard'ın metni dahil edilen tüm politikalara göre doğru sınıflandırıp sınıflandırmadığını değerlendirdik. Bu zorlu bir görevdir. Model yalnızca dahil edilen tüm politikalar için altın standart etiketlerle bire bir eşleştiğinde doğru kabul edilir.
gpt-oss-safeguard modellerimiz ve kurum içi Safety Reasoner, çoklu politika doğruluğu açısından gpt-5-thinking ve açık gpt-oss modellerinden daha iyi performans gösteriyor. gpt-oss-safeguard modellerinin küçük boyutu düşünüldüğünde gpt-5-thinking'den daha iyi performans göstermeleri özellikle şaşırtıcı.
Bu modelleri ayrıca 2022 tarihli araştırma makalemizle(yeni bir pencerede açılır) birlikte yayınladığımız moderasyon veri setinde(yeni bir pencerede açılır) ve açık kaynaklı bir sohbet botuna yöneltilen kullanıcı sorgularını temel alan herkese açık karşılaştırmalı değerlendirme ölçütü ToxicChat(yeni bir pencerede açılır)'te değerlendirdik.
2022 moderasyon değerlendirme setinde kurum içi güvenlik politikalarımızı kullandık ve daha sonra yapılan değişiklikleri hesaba katmak için politikalardan birini uyarladık. gpt-oss-safeguard, kurum içi Safety Reasoner ve gpt-5-thinking gibi test edilen diğer tüm modellerden biraz daha iyi performans gösterdi. Ancak Safety Reasoner ve gpt-oss-safeguard arasındaki bu fark istatistiksel olarak anlamlı değildir.
ToxicChat değerlendirmesinde, kurum içi politikalarımızın bazılarından uyarlanmış, elle yazılmış kısa bir prompt kullandık. Kurum içi Safety Reasoner yine gpt-5-thinking'den daha iyi performans gösterdi. gpt-5-thinking ve Safety Reasoner ise gpt-oss-safeguard-120b ve gpt-oss-safeguard-20b'den yalnızca küçük bir farkla daha iyi performans gösterdi. gpt-oss-safeguard'ın görece küçük boyutunun bu tür görevlerde tercih edilmesini sağlayacağını düşünüyoruz.
gpt-oss-safeguard'ın iki belirgin sınırlaması vardır. İlk olarak, on binlerce yüksek kaliteli etiketli örnekle eğitilen sınıflandırıcıların, gpt-oss-safeguard doğrudan politikayı temel alarak akıl yürüttüğünde içerikleri sınıflandırma konusunda hala daha iyi performans gösterebildiğini gözlemledik. Daha karmaşık risklerde daha yüksek performans elde etmek için özel bir sınıflandırıcı eğitmeye zaman ayırmak tercih edilebilir.
İkinci olarak, gpt-oss-safeguard çok fazla zaman ve hesaplama kaynağı gerektirebilir. Bu da platformdaki tüm içerikleri kapsayacak şekilde ölçeklendirilmesini zorlaştırır. Kurum içinde bu sorunu Safety Reasoner ile birkaç şekilde ele alıyoruz: (1) Hangi içeriklerin değerlendirileceğini belirlemek için daha küçük ve hızlı sınıflandırıcılar kullanıyoruz. (2) Bazı durumlarda, güvenli olmayan içerik tespit ettiğimizde müdahale edebilme imkanını korurken düşük gecikmeli bir kullanıcı deneyimi sunmak için Safety Reasoner'ı eşzamansız olarak kullanıyoruz.
gpt-oss-safeguard, OpenAI'ın toplulukla birlikte geliştirdiği ilk açık güvenlik modeli serisidir. İlk testler kapsamında SafetyKit, ROOST, Tomoro ve Discord'daki güven ve güvenlik uzmanlarıyla birlikte gpt-oss-safeguard'ı yinelemeli olarak geliştirdik. ROOST CTO'su Vinay Rao şunları söylüyor: "gpt-oss-safeguard, 'kendi politikalarını ve zarar tanımlarını getir' tasarımına sahip ilk açık kaynaklı akıl yürütme modelidir. Kuruluşlar kritik güvenlik teknolojilerini özgürce inceleyebilmeli, değiştirebilmeli ve kullanabilmeli, ayrıca yenilik yapabilmelidir. Testlerimizde farklı politikaları anlama, akıl yürütmesini açıklama ve politikaları uygularken nüansları gözetme konusunda başarılıydı. Bunun geliştiriciler ve güvenlik ekipleri açısından faydalı olacağına inanıyoruz."
ROOST Model Community (RMC) aracılığıyla da toplulukla birlikte çalışmaya ve açık güvenlik araçlarını geliştirmeye devam edeceğiz. RMC, açık kaynaklı yapay zeka modellerini güvenlik iş akışlarına dahil etmeye yönelik en iyi uygulamaların yanı sıra değerlendirme sonuçlarını ve model geri bildirimlerini paylaşmak üzere güvenlik uzmanlarını ve araştırmacıları bir araya getirir. Bu iş birliği ve onun bir parçası olma hakkında daha fazla bilgi edinmek için RMC GitHub deposunu(yeni bir pencerede açılır) ziyaret edin.
Bu modellerle geliştirmeye başlamak için modelleri Hugging Face(yeni bir pencerede açılır) üzerinden indirin.

