Пређите на главни садржај
OpenAI

29. октобар 2025.

ПроизводИздање

Представљамо gpt-oss-safeguard

Нови отворени безбедносни модели резоновања (120b и 20b) који подржавају прилагођене безбедносне политике.

Учитавање…

Данас објављујемо истраживачки преглед модела gpt-oss-safeguard, наших модела са отвореним тежинама који користе расуђивање за задатке класификације безбедности, доступних у две величине: gpt-oss-safeguard-120b и gpt-oss-safeguard-20b. Ови модели су фино подешене верзије наших gpt-oss отворених модела и доступни су под истом либералном лиценцом Apache 2.0, што свакоме омогућава да их слободно користи, мења и примењује. Оба модела могу се преузети већ данас са платформе Hugging Face(отвара се у новом прозору).

Модели gpt-oss-safeguard користе расуђивање како би директно тумачили политику коју је дефинисао програмер током извршавања – класификујући поруке корисника, одговоре модела и целокупне разговоре у складу са потребама програмера. Програмер увек одлучује коју политику ће користити, па су одговори релевантнији и прилагођенији програмеровом случају употребе. Модел користи начин резоновања, који програмер може да прегледа да би разумео како модел доноси своје одлуке. Поред тога, политика се обезбеђује током извођења закључака, уместо да буде уграђена у модел; тако да програмери могу лако постепено да ревидирају политике како би повећали перформансе. Овај приступ, који смо првобитно развили за интерну употребу, знатно је флексибилнији од традиционалног метода обучавања класификатора да посредно изведе границу одлучивања из великог броја означених примера.

gpt-oss-safeguard омогућава програмерима да одреде границе политика које најбоље одговарају њиховом случају употребе. На пример, форум за дискусију о видео играма можда жели да развије политику за класификацију објава у којима се говори о варању у игри, или сајт са рецензијама производа можда жели да користи сопствену политику за проверу рецензија за које постоји вероватноћа да су лажне.

Модел истовремено прима два улаза — смерницу и садржај који треба класификовати према тој смерници — и даје закључак о томе у коју категорију садржај спада, заједно са својим резоновањем. Програмери одлучују како, ако уопште, да те закључке користе у сопственим безбедносним процесним токовима. Видели смо да овај приступ заснован на резоновању функционише нарочито добро у ситуацијама у којима:

  • Потенцијална штета настаје или се развија, а политике морају брзо да се прилагоде.
  • Домен је изузетно нијансиран и мањим класификаторима је тешко да га обраде.
  • Програмери немају довољно узорака да обуче квалитетан класификатор за сваки ризик на својој платформи.
  • Латенција је мање важна од производње висококвалитетних и објашњивих ознака.

Објављујемо ову пробну верзију gpt-oss-safeguard-а како бисмо добили повратне информације од истраживачке и безбедносне заједнице и додатно унапредили перформансе модела. Током више месеци сарађивали смо са ROOST(отвара се у новом прозору) на овом отвореном издању како бисмо утврдили кључне потребе програмера, тестирали модел и израдили документацију за програмере. Као део овог лансирања, ROOST ће успоставити заједницу модела(отвара се у новом прозору), која се такође покреће данас, ради истраживања отворених модела вештачке интелигенције за заштиту онлајн простора. Уз ово издање, објављујемо и кратак технички извештај који детаљно описује безбедносне перформансе овог пробног модела.

Безбедност на нивоу система: улога класификатора безбедности

Када је реч о безбедности, верујемо у принцип вишеслојне заштите. Обучавамо своје моделе да безбедно одговарају и примењујемо додатне слојеве заштите како бисмо открили и решили потенцијално небезбедне улазне и излазне садржаје у складу са нашим смерницама. Класификатори безбедности, који разликују безбедан од небезбедног садржаја у одређеној области ризика, већ дуго представљају примарни слој одбране за наше и друге велике језичке моделе.

Традиционални безбедносни класификатори, као што су они доступни преко нашег API-ја за модерацију(отвара се у новом прозору), развијају се ручним одабиром хиљада примера безбедног и небезбедног садржаја, у складу са унапред дефинисаним безбедносним политикама. На основу ових података за обуку, класификатор учи да разликује безбедне резултате од небезбедних. У овом традиционалном приступу, класификатор заправо никада не види политику безбедности. Уместо тога, покушава да изведе закључак о основној политици која је коришћена за означавање примера, тако што проналази сличности у садржају означеном као небезбедном и разлике између небезбедног и безбедног садржаја.

Традиционални класификатори могу да имају високе перформансе, уз мало кашњење и ниске оперативне трошкове. Међутим, прикупљање довољне количине примера за обуку може бити дуготрајно и скупо, а ажурирање или промена политике захтева поновну обуку класификатора.

gpt-oss-safeguard је другачији јер његове способности резоновања омогућавају програмерима да примене било коју смерницу, укључујући и оне које сами напишу или преузму из других извора, а резоновање помаже моделима да генерализују новонаписане смернице. Поред безбедносних политика, gpt-oss-safeguard се може користити за означавање садржаја и на друге начине који су важни за одређене производе и платформе.

Дијаграм тока под називом „Расуђивање засновано на политикама уз gpt-oss-safeguard“. Политике које обезбеђује програмер и садржај који обезбеђује корисник уносе се у GPT-OSS-Safeguard. Модел генерише ланац закључивања, а затим доноси одлуку у складу са политиком, при чему се петља означена као „итерација политике“ враћа у процес како би се политике додатно унапредиле. Легенда приказује унос програмера, унос корисника и излаз модела.

Како интерно користимо безбедносно резоновање

Наши главни модели резоновања сада директно уче наше безбедносне политике и користе своје способности резоновања да процењују шта је безбедно. Овај приступ, који називамо пажљиво поравнање, значајно унапређује раније методе безбедносне обуке и чини наше моделе резоновања безбеднијим по неколико основа од њихових претходника без резоновања, чак и како се њихове способности повећавају. Резоновање није корисно само за обучавање самих модела. Такође отвара нове могућности за вишеслојну одбрану. Приступи засновани на резоновању су флексибилнији и мање ограничени детаљима своје претходне обуке, што су предности које понекад више него оправдавају додатне трошкове рачунарских ресурса и кашњење које укључују.

gpt-oss-safeguard је имплементација приступа са отвореним тежинама коју смо развили интерно, у алату који називамо Safety Reasoner. Почели смо са подстицајним финим подешавањем путем поткрепљивања на задацима означавања према политикама, награђујући модел за то што опонаша исправне процене људских стручњака. Ово је научило модел да расуђује о томе како политика доводи до доношења одлуке. Данас нам Safety Reasoner омогућава да динамички ажурирамо наше политике безбедности у продукционом окружењу за мање времена него што би било потребно за поновно обучавање класификатора. То чини Safety Reasoner кључним алатом за итеративно увођење: када примењујемо нове моделе у продукцији, често почињемо са строжим политикама и користимо релативно велике количине рачунарских ресурса тамо где је то потребно да бисмо омогућили Safety Reasoner да пажљиво примењује те политике. Затим прилагођавамо своје политике како се побољшава наше разумевање ризика у продукционом окружењу. У неким од наших недавних лансирања, удео укупних рачунарских ресурса посвећених безбедносном расуђивању достизао је чак 16%.

Safety Reasoner је постао кључна компонента нашег система за безбедност. За генерисање слика и Sora 2, он врши динамичке, корак по корак процене резултата како би у реалном времену идентификовао и блокирао небезбедне генерисане садржаје. У доменима као што су биологија и самоповређивање, покрећемо моделе попут оних који се користе у Moderation API као мале, брзе класификаторе са високим обухватом да бисмо утврдили који садржај припада домену од интереса, а затим користимо Safety Reasoner да прегледа тај садржај. Safety Reasoner класификује излазе модела у складу са детаљном таксономијом како би утврдио који је најбољи начин за реаговање, чинећи део наших вишеслојних безбедносних механизама у системима као што су GPT‑5 и ChatGPT Agent. A sada, модели GPT‑OSS‑Safeguard чине овај исти приступ доступним свима.

Како gpt-oss-safeguard функционише

Проценили смо моделе gpt-oss-safeguard на интерним и екстерним скуповима за процену.

У интерној евалуацији, моделу gpt-oss-safeguard смо током извршавања истовремено прослеђивали више политика. За сваки тестни унос процењујемо да ли gpt-oss-safeguard исправно класификује текст у складу са свим укљученим политикама. Ово је изазован задатак — модел се сматра тачним само ако се тачно поклапа са ознакама златног скупа за све укључене политике.

Наши модели gpt-oss-safeguard и унутрашњи Safety Reasoner надмашују gpt-5-thinking и отворене моделе gpt-oss по тачности у више политика. То што модели gpt-oss-safeguard надмашују gpt-5-thinking посебно је изненађујуће с обзиром на малу величину првих модела.

Ове моделе смо додатно процењивали на скупу података за модерирање(отвара се у новом прозору) који смо објавили уз наш истраживачки рад из 2022.(отвара се у новом прозору) и на ToxicChatу(отвара се у новом прозору), јавном реперу заснованом на корисничким упитима упућеним чет-боту отвореног кода.

На скупу за евалуацију модерирања из 2022. године, процену смо спровели користећи наше интерне политике безбедности (при чему смо једну политику прилагодили како би узела у обзир накнадне измене). gpt-oss-safeguard је незнатно надмашио све друге тестиране моделе, укључујући наш интерни Safety Reasoner и gpt-5-thinking, мада ова разлика између Safety Reasoner-а и gpt-oss-safeguard-а није статистички значајна.

За ToxicChat смо спровели процену користећи кратку ручно написану инструкцију прилагођену неким од наших интерних политика. Наш интерни Safety Reasoner поново је надмашио gpt-5-thinking, док и gpt-5-thinking и Safety Reasoner незнатно надмашују gpt-oss-safeguard-120b и gpt-oss-safeguard-20b. Очекујемо да релативно мала величина модела gpt-oss-safeguard и даље чини тај модел пожељнијим за ову врсту задатка.

Ограничења

Постоје два конкретна ограничења за gpt-oss-safeguard. Прво, приметили смо да класификатори обучени на десетинама хиљада висококвалитетних означених узорака и даље могу боље да класификују садржај него што то gpt-oss-safeguard чини када закључује директно из политике. Улагање времена у обуку наменског класификатора може бити пожељно за постизање бољих перформанси код сложенијих ризика.

Друго, gpt-oss-safeguard може бити временски и рачунарски захтеван, што отежава његово скалирање преко целог садржаја платформе. Интерно, ово решавамо на неколико начина помоћу Safety Reasoner-а: (1) користимо мање и брже класификаторе да бисмо одредили који садржај треба проценити и (2) у одређеним околностима користимо Safety Reasoner асинхроно како бисмо обезбедили корисничко искуство са малим кашњењем, уз задржавање могућности да интервенишемо ако откријемо небезбедан садржај.

Пут пред нама: настављамо да градимо заједно са заједницом

gpt-oss-safeguard је први скуп отворених безбедносних модела OpenAI-а направљен у сарадњи са заједницом. Радили смо на унапређивању gpt-oss-safeguard са стручњацима за поверење и безбедност из SafetyKit, ROOST, Tomoro и Discord у оквиру раног тестирања. Винај Рао, технички директор компаније ROOST, каже: „gpt-oss-safeguard је први модел за расуђивање отвореног кода са приступом ‚сами дефинишите политике и врсте штете’. Организације заслужују да слободно проучавају, мењају и користе кључне технологије за безбедност и да имају могућност да иновирају. У нашем тестирању, модел је показао вештину у разумевању различитих политика, објашњавању свог начина расуђивања и нијансираном примењивању политика, што верујемо да ће бити корисно програмерима и тимовима за безбедност.“

Наставићемо да радимо са заједницом на унапређивању отворених алата за безбедност, укључујући и кроз ROOST модел Community (RMC). RMC окупља стручњаке за безбедност и истраживаче како би размењивали најбоље праксе за примену AI модела отвореног кода у безбедносним процесима, укључујући резултате евалуација и повратне информације о моделима. Посетите RMC GitHub репозиторијум(отвара се у новом прозору) да бисте сазнали више о овом партнерству и начинима да се укључите.

Да бисте почели да градите са овим моделима, преузмите их са Hugging Face(отвара се у новом прозору).

Аутор

OpenAI