Негізгі мазмұнға өту
OpenAI

2025 ж. 29 қазан

ӨнімШығарылым

gpt-oss-safeguard-ты таныстыру

Арнайы қауіпсіздік саясаттарын қолдайтын жаңа ашық ойлайтын қауіпсіздік модельдері (120b және 20b).

Жүктелуде…

Бүгін біз қауіпсіздікті жіктеу тапсырмаларына арналған ашық салмақты ойлайтын модельдеріміз — gpt-oss-safeguard-тың зерттеуге арналған алдын ала нұсқасын шығарамыз. Ол екі өлшемде қолжетімді: gpt-oss-safeguard-120b және gpt-oss-safeguard-20b. Бұл модельдер — біздің gpt-oss ашық модельдеріміздің дәл бапталған нұсқалары және олар сол кең рұқсат беретін Apache 2.0 лицензиясы бойынша қолжетімді, сондықтан кез келген адам оларды еркін пайдалана, өзгерте және өрістете алады. Екі модельді де бүгін Hugging Face(жаңа терезеде ашылады)-тен жүктеп алуға болады.

gpt-oss-safeguard модельдері әзірлеуші ұсынған саясатты инференс кезінде тікелей түсіндіру үшін ой қорытуды қолданады — пайдаланушы хабарламаларын, жауаптарды және толық чаттарды әзірлеушінің қажеттіліктеріне қарай жіктейді. Қай саясатты қолдану керектігін әзірлеуші әрдайым өзі шешеді, сондықтан жауаптар әзірлеушінің пайдалану жағдайына көбірек сәйкес әрі соған бейімделген болады. Модель ойлау тізбегін қолданады, ал әзірлеуші модельдің шешімдерге қалай келетінін түсіну үшін оны қарап шыға алады. Бұған қоса, саясат модельге оқыту арқылы енгізілмей, инференс кезінде беріледі, сондықтан әзірлеушілер өнімділікті арттыру үшін саясаттарды итеративті түрде оңай қайта қарай алады. Біз бастапқыда ішкі пайдалану үшін әзірлеген бұл тәсіл көптеген таңбаланған мысалдар негізінде шешім шекарасын жанама түрде анықтауға классификаторды үйрететін дәстүрлі әдіске қарағанда айтарлықтай икемдірек.

gpt-oss-safeguard әзірлеушілерге өздерінің пайдалану жағдайына ең қолайлы саясат шекараларын белгілеуге мүмкіндік береді. Мысалы, бейне ойындар талқыланатын форум ойындағы алдауды талқылайтын жазбаларды жіктеу саясатын әзірлегісі келуі мүмкін, ал өнімдер туралы пікірлер жарияланатын сайт жалған болуы ықтимал пікірлерді сүзгілеу үшін өз саясатын пайдаланғысы келуі мүмкін.

Модель бір уақытта екі кірісті — саясат пен сол саясат бойынша жіктелетін контентті — қабылдайды да, контенттің қай санатқа жататыны туралы қорытындыны және оған негіз болған ойлауын шығарады. Әзірлеушілер бұл қорытындыларды өздерінің қауіпсіздік пайплайндарында қалай қолдану керектігін және оларды мүлде қолдану керек пе, жоқ па — өздері шешеді. Біз ой қорытуға негізделген бұл тәсілдің мынадай жағдайларда әсіресе жақсы жұмыс істейтінін байқадық:

  • Ықтимал зиян жаңадан пайда болып жатқан немесе өзгеріп жатқан жағдайда саясаттар тез бейімделуі керек.
  • Бұл салада нәзік айырмашылықтар өте көп, сондықтан шағын жіктеуіштер үшін оны өңдеу қиын.
  • Әзірлеушілерде өз платформасындағы әрбір тәуекел үшін жоғары сапалы жіктеуішті үйретуге жеткілікті үлгілер жоқ.
  • Кідіріс жоғары сапалы, түсіндіруге болатын белгілерді жасауға қарағанда маңызы азырақ.

Біз зерттеу және қауіпсіздік қауымдастығынан кері байланыс алып, модель өнімділігін одан әрі жетілдіру үшін gpt-oss-safeguard-тың осы алдын ала нұсқасын шығарып отырмыз. Бірнеше ай бойы біз ROOST(жаңа терезеде ашылады) ұйымымен бірге осы ашық салмақты шығарылым бойынша жұмыс істеп, әзірлеушілердің аса маңызды қажеттіліктерін анықтадық, модельді сынадық және әзірлеушілерге арналған құжаттаманы дайындадық. Осы іске қосу аясында ROOST онлайн кеңістіктерді қорғауға арналған ашық ЖИ модельдерін зерттеу үшін бүгін іске қосылатын модельдер қауымдастығын(жаңа терезеде ашылады) құрады. Осы шығарылыммен қатар біз осы алдын ала нұсқадағы модельдің қауіпсіздік көрсеткіштерін егжей-тегжейлі сипаттайтын қысқаша техникалық есепті жариялап отырмыз.

Жүйе деңгейіндегі қауіпсіздік: қауіпсіздік жіктеуіштерінің рөлі

Қауіпсіздікке келгенде, біз көп деңгейлі қорғаныс тәсілін ұстанамыз. Біз модельдерімізді қауіпсіз жауап беруге үйретеміз және саясаттарымызға сәйкес ықтимал қауіпті кірістер мен шығыстарды анықтап, оларға қатысты шара қолдану үшін қосымша қорғаныс қабаттарын енгіземіз. Белгілі бір тәуекел саласында қауіпсіз контентті қауіпті контенттен ажырататын қауіпсіздік жіктеуіштері біздің және басқа да ірі тілдік модельдер үшін бұрыннан негізгі қорғаныс қабаттарының бірі болып келеді.

Біздің Moderation API(жаңа терезеде ашылады) арқылы қолжетімді дәстүрлі қауіпсіздік жіктеуіштері алдын ала анықталған қауіпсіздік саясаттарына сәйкес қауіпсіз және қауіпті контенттің мыңдаған мысалын қолмен іріктеу арқылы әзірленеді. Осы оқыту деректері негізінде жіктеуіш қауіпсіз шығыстарды қауіпті шығыстардан ажыратуды үйренеді. Бұл дәстүрлі тәсілде жіктеуіш қауіпсіздік саясатын іс жүзінде ешқашан көрмейді. Оның орнына, жіктеуіш қауіпті деп белгіленген контенттегі ұқсастықтарды және қауіпті контент пен қауіпсіз контент арасындағы айырмашылықтарды табу арқылы мысалдарды белгілеуге негіз болған саясатты анықтауға тырысады.

Дәстүрлі жіктеуіштер жоғары өнімділік көрсетіп, кідірісі мен пайдалану құны төмен болуы мүмкін. Бірақ оқыту мысалдарының жеткілікті санын жинау көп уақыт пен қаражатты қажет етуі мүмкін, ал саясатты жаңарту немесе өзгерту жіктеуішті қайта оқытуды талап етеді.

gpt-oss-safeguard өзгеше, өйткені оның ой қорыту қабілеті әзірлеушілерге кез келген саясатты, соның ішінде өздері жазған немесе басқа дереккөздерден алынған саясаттарды қолдануға мүмкіндік береді, ал ой қорыту модельдерге жаңадан жазылған саясаттар жағдайында да жалпылауға көмектеседі. Қауіпсіздік саясаттарынан бөлек, gpt-oss-safeguard нақты өнімдер мен платформалар үшін маңызды басқа тәсілдермен контентті белгілеу үшін де пайдаланылуы мүмкін.

«gpt-oss-safeguard көмегімен саясатқа негізделген ой қорыту» атты ағын диаграммасы. Әзірлеуші ұсынған саясаттар мен пайдаланушы ұсынған контент GPT-OSS-Safeguard-қа беріледі. Модель ойлау тізбегін, содан кейін саясат бойынша шешім шығарады, ал «саясатты итерациялау» деп белгіленген цикл саясаттарды нақтылау үшін кері бағытталады. Түсіндірмеде әзірлеуші кірісі, пайдаланушы кірісі және модель шығысы көрсетілген.

Қауіпсіздікке қатысты ой қорытуды ішкі мақсатта қалай қолданамыз

Біздің негізгі ойлайтын модельдеріміз енді қауіпсіздік саясаттарымызды тікелей үйреніп, ненің қауіпсіз екенін анықтау үшін ой қорыту қабілеттерін пайдаланады. Біз саналы сәйкестендіру деп атайтын бұл тәсіл қауіпсіздікке үйретудің бұрынғы әдістерін едәуір жетілдіреді және мүмкіндіктері артқанның өзінде, ойлайтын модельдерімізді бірнеше өлшем бойынша ой қорытуға негізделмеген алдыңғы модельдеріне қарағанда қауіпсізірек етеді. Бірақ ой қорыту модельдердің өзін үйрету үшін ғана пайдалы емес. Бұл сондай-ақ көп деңгейлі қорғаныс үшін жаңа мүмкіндіктер ашады. Ой қорытуға негізделген тәсілдер икемдірек және бұрынғы оқытудың егжей-тегжейлерімен азырақ шектеледі, ал бұл артықшылықтар кейде олар талап ететін қосымша есептеу шығыны мен кідірісті артығымен ақтайды.

gpt-oss-safeguard — біз Safety Reasoner деп атайтын құралда ішкі мақсатта әзірлеген тәсілдің ашық салмақты іске асырылуы. Біз саясаттарды таңбалау тапсырмаларында күшейтпелі дәл баптаудан бастап, модельді адам сарапшыларының дұрыс пайымдарын қайталағаны үшін марапаттадық. Бұл модельге саясаттың белгілі бір пайымға қалай әкелетінін ой қорыту арқылы түсінуді үйретті. Бүгінде Safety Reasoner бізге қауіпсіздік саясаттарымызды өндірістік ортада жіктеуішті қайта оқытуға кететін уақыттан да аз уақытта динамикалық түрде жаңартуға мүмкіндік береді. Бұл Safety Reasoner-ді итеративті өрістету үшін негізгі құрал етеді: жаңа модельдерді өндірістік ортаға өрістеткенде, біз көбіне қатаңырақ саясаттардан бастаймыз және қажет болған жағдайда Safety Reasoner сол саясаттарды мұқият қолдана алуы үшін салыстырмалы түрде көп есептеу ресурсын пайдаланамыз. Содан кейін өндірістік ортадағы тәуекелдер туралы түсінігіміз тереңдеген сайын, саясаттарымызды түзетеміз. Соңғы іске қосударымыздың кейбірінде қауіпсіздікке қатысты ой қорытуға бөлінген жалпы есептеу ресурстары үлесінің ең жоғары көрсеткіші 16% болды.

Safety Reasoner біздің қауіпсіздік жүйеміздің негізгі құрамдас бөлігіне айналды. Сурет генерациялау мен Sora 2 үшін ол нақты уақытта қауіпті генерацияларды анықтап, бұғаттау мақсатында шығыстарды қадамдық түрде динамикалық бағалайды. Биология және өзіне зиян келтіру сияқты салаларда біз Moderation API-де қолданылатын модельдерге ұқсас модельдерді шағын, жылдам және толықтығы жоғары жіктеуіштер ретінде пайдаланып, қандай контенттің қажетті салаға жататынын анықтаймыз, содан кейін сол контентті Safety Reasoner арқылы қараймыз. Safety Reasoner модель шығыстарын егжей-тегжейлі таксономияға сәйкес жіктеп, қалай тиімді жауап беру керектігін анықтайды және GPT‑5 пен ChatGPT Agent сияқты жүйелердегі көп деңгейлі қорғаныс шараларымыздың бір бөлігі болып табылады. Енді gpt-oss-safeguard модельдері осы тәсілді кез келген адамға қолжетімді етеді.

gpt-oss-safeguard өнімділігі

Біз gpt-oss-safeguard модельдерін ішкі және сыртқы бағалау жиынтықтары бойынша бағаладық.

Ішкі бағалау барысында біз инференс кезінде gpt-oss-safeguard-қа бір мезгілде бірнеше саясат бердік. Әрбір тест кірісі үшін біз gpt-oss-safeguard мәтінді енгізілген саясаттардың барлығы бойынша дұрыс жіктейтінін бағалаймыз. Бұл күрделі тапсырма — модель енгізілген саясаттардың барлығы бойынша эталондық жиынтықтағы белгілерге дәл сәйкес келген жағдайда ғана дұрыс деп есептеледі.

Біздің gpt-oss-safeguard модельдеріміз бен ішкі Safety Reasoner бірнеше саясат бойынша дәлдік көрсеткіші жағынан gpt-5-thinking және gpt-oss ашық модельдерінен асып түседі. gpt-oss-safeguard модельдерінің gpt-5-thinking-тен асып түсуі, әсіресе gpt-oss-safeguard модельдерінің шағын өлшемін ескерсек, таңғаларлық.

Біз бұл модельдерді модерация деректер жиынтығында(жаңа терезеде ашылады) — оны 2022 жылғы зерттеу жұмысымызбен(жаңа терезеде ашылады) бірге жариялаған едік — және ашық бастапқы кодты чатботқа пайдаланушылар жіберген сұрауларға негізделген жалпыға қолжетімді бенчмарк — ToxicChat(жаңа терезеде ашылады) бойынша қосымша бағаладық.

2022 жылғы модерацияны бағалау жиынында біз ішкі қауіпсіздік саясаттарымызды қолданып бағалау жүргіздік (кейінгі өзгерістерді ескеру үшін бір саясатты бейімдедік). gpt-oss-safeguard сыналған барлық басқа модельдерден, соның ішінде біздің ішкі Safety Reasoner мен gpt-5-thinking-тен сәл озып шықты, дегенмен Safety Reasoner мен gpt-oss-safeguard арасындағы бұл айырмашылық статистикалық тұрғыдан маңызды емес.

ToxicChat үшін біз ішкі саясаттарымыздың кейбіріне бейімделген қысқа, қолмен жазылған промптты пайдаланып бағалау жүргіздік. Біздің ішкі Safety Reasoner тағы да gpt-5-thinking-тен жақсырақ нәтиже көрсетті, ал gpt-5-thinking пен Safety Reasoner екеуі де gpt-oss-safeguard-120b және gpt-oss-safeguard-20b модельдерінен сәл ғана озып шықты. Біз gpt-oss-safeguard-тың салыстырмалы түрде шағын өлшемі оны осындай тапсырмалар үшін әлі де қолайлырақ етеді деп күтеміз.

Шектеулер

gpt-oss-safeguard-тың екі нақты шектеуі бар. Біріншіден, біз ондаған мың жоғары сапалы таңбаланған үлгімен оқытылған жіктеуіштер контентті жіктеуде саясат негізінде тікелей ой қорытатын gpt-oss-safeguard-тан әлі де жақсырақ нәтиже көрсете алатынын байқадық. Күрделірек тәуекелдер бойынша жоғары өнімділікке қол жеткізу үшін арнайы жіктеуішті оқытуға уақыт бөлген жөн болуы мүмкін.

Екіншіден, gpt-oss-safeguard көп уақыт пен есептеу ресурстарын талап етуі мүмкін, бұл оны платформадағы барлық контентке масштабтауды қиындатады. Ішкі мақсатта біз Safety Reasoner арқылы бұл мәселені бірнеше тәсілмен шешеміз: (1) қандай контентті бағалау керектігін анықтау үшін шағын әрі жылдам жіктеуіштерді пайдаланамыз және (2) кейбір жағдайларда кідірісі төмен пайдаланушы тәжірибесін қамтамасыз ету үшін Safety Reasoner-ді асинхронды түрде қолданамыз, сонымен бірге қауіпті контентті анықтасақ, араласу мүмкіндігін сақтаймыз.

Алдағы жол: қауымдастықпен бірге дамытуды жалғастыру

gpt-oss-safeguard — қауымдастықпен бірге жасалған OpenAI-дың алғашқы ашық қауіпсіздік модельдерінің жиынтығы. Біз ерте тестілеу аясында SafetyKit, ROOST, Tomoro, және Discord ұйымдарындағы сенім мен қауіпсіздік мамандарымен бірге gpt-oss-safeguard-ты бірнеше рет жетілдірдік. ROOST техникалық директоры Vinay Rao былай дейді: «gpt-oss-safeguard — "өз саясаттарыңыз бен зиян анықтамаларыңызды енгізу" қағидатына негізделген алғашқы ашық бастапқы кодты ойлайтын модель.» Ұйымдар аса маңызды қауіпсіздік технологияларын еркін зерттеп, өзгертіп, пайдалануға және инновациялар енгізуге мүмкіндік алуға лайық. Біздің сынақтарымызда ол әртүрлі саясаттарды түсінуде, өз ой қорытуын түсіндіруде және саясаттарды қолданғанда нәзік айырмашылықтарды ескеруде жоғары шеберлік көрсетті, бұл жасаушылар мен қауіпсіздік топтарына пайдалы болады деп сенеміз.»

Қауымдастықпен бірлесіп, соның ішінде ROOST Model Community (RMC) арқылы ашық қауіпсіздік құралдарын жетілдіруді жалғастырамыз. RMC қауіпсіздік саласының мамандары мен зерттеушілерін ашық бастапқы кодты ЖИ модельдерін қауіпсіздік жұмыс процестеріне енгізудің үздік тәжірибелерімен, соның ішінде бағалау нәтижелерімен және модель туралы кері байланыспен бөлісу үшін біріктіреді. Осы серіктестік және оған қалай қатысуға болатыны туралы толығырақ білу үшін RMC GitHub репозиторийіне(жаңа терезеде ашылады) өтіңіз.

Осы модельдермен жұмыс істеуді бастау үшін оларды Hugging Face(жаңа терезеде ашылады)-тен жүктеп алыңыз.

Автор

OpenAI