Dina iki, kita ngrilis pratinjau riset gpt-oss-safeguard, model penalaran bobot terbuka kanggo tugas klasifikasi keamanan, sing kasedhiya ing rong ukuran: gpt-oss-safeguard-120b lan gpt-oss-safeguard-20b. Model-model iki minangka versi sing wis disetel luwih rinci saka model terbuka gpt-oss kita lan kasedhiya miturut lisensi Apache 2.0 sing padha permisif, saéngga sapa wae bisa nggunakake, ngowahi, lan masang model-model iki kanthi bebas. Loro-lorone model bisa diundhuh dina iki saka Hugging Face(mbukak ing jendhela anyar).
Model gpt-oss-safeguard migunakaké penalaran kanggo langsung napsiraké kebijakan sing diwènèhaké déning pengembang nalika wektu inferensi—nggolongaké pesen pengguna, panyelesaian, lan obrolan lengkap miturut kebutuhan pengembang. Pengembang tansah nemtokake kebijakan apa sing arep digunakake, mula tanggapan dadi luwih relevan lan dicocogake karo kasus penggunaan pengembang. Model nggunakake chain-of-thought, sing bisa dideleng dening pengembang kanggo mangerteni kepiye model kasebut nggawe keputusan. Kajaba iku, kebijakan kasebut diwenehake nalika inferensi, dudu dilatih dadi bagean saka model, mula pengembang gampang merevisi kebijakan kanthi iteratif kanggo ningkatake kinerja. Pendekatan iki, sing wiwitane dikembangake kanggo panggunaan internal, luwih fleksibel kanthi signifikan tinimbang cara tradisional kanggo nglatih klasifikator supaya kanthi ora langsung nyimpulake wates keputusan saka cacah gedhe conto sing wis diwenehi label.
gpt-oss-safeguard ngidini para pengembang netepake wates-wates kebijakan sing paling cocog karo kasus penggunaané. Contoné, forum diskusi gim video bisa waé kepengin ngembangaké kebijakan kanggo nggolongaké kiriman sing ngrembug tumindak curang ing gim, utawa situs ulasan produk bisa waé kepengin nganggo kebijakané dhéwé kanggo nyaring ulasan sing katon kaya-kayané palsu.
Model kasebut nampa rong input bebarengan—kebijakan lan konten sing kudu diklasifikasèkaké miturut kebijakan kasebut—lan ngasilaké simpulan ngenani kategori apa sing cocog kanggo konten kasebut, bebarengan karo penalarané. Para pengembang nemtokaké kepiyé carané—yen pancèn arep digunakaké—nggunakaké kesimpulan kasebut ing alur kerja keslametané dhéwé-dhéwé. Wis katon manawa pendekatan adhedhasar penalaran iki bisa mlaku kanthi apik banget ing kahanan nalika:
- Potensi bebaya lagi muncul utawa terus berkembang, lan kebijakan kudu cepet nyesuaiake.
- Domain iki nduwèni nuansa sing rumit banget lan angel ditangani déning klasifikator sing luwih cilik.
- Para pengembang ora nduwé sampel sing cukup kanggo nglatih klasifikator kualitas dhuwur kanggo saben risiko ing platformé.
- Latensi ora sepenting ngasilake label sing bermutu dhuwur lan bisa dijlentrehake.
Kita ngrilis pratinjau gpt-oss-safeguard iki kanggo nampa umpan balik saka komunitas riset lan keslametan, lan kanggo terus nyempurnakake kinerja model. Suwene pirang-pirang wulan, kita nggarap rilis bobot terbuka iki bareng karo ROOST(mbukak ing jendhela anyar) kanggo ngenali kebutuhan sing wigati banget kanggo pengembang, nguji modhel, lan nggawe dokumentasi pengembang. Minangka bagéan saka peluncuran iki, ROOST bakal mbentuk komunitas model(mbukak ing jendhela anyar), sing uga diluncurake dina iki, kanggo njajaki model AI kabuka kanggo nglindhungi ruang online. Bebarengan karo rilis iki, kita nerbitake laporan teknis ringkes sing njlentrehake kinerja keslametan saka model pratinjau iki.
Nalika nerangake keamanan, kita percaya marang pertahanan kanthi pirang-pirang lapisan. Kita nglatih model-model kita supaya bisa mènèhi tanggapan kanthi aman, lan ngetrapaké lapisan perlindhungan tambahan kanggo ndeteksi lan nangani input lan output sing duwé potensi ora aman miturut kebijakan kita. Klasifikator keamanan, sing mbedakake kontèn aman saka kontèn ora aman ing area risiko tartamtu, wis suwé dadi lapisan pertahanan utama kanggo model basa gedhé duwèké awaké dhéwé lan pihak liya.
Klasifikator keamanan tradisional, kayata sing kasedhiya liwat API Moderation(mbukak ing jendhela anyar) kita, dikembangaké kanthi kurasi manual ewonan conto konten sing aman lan ora aman, miturut kebijakan keamanan sing wis ditemtokaké sadurungé. Saking data latihan punika, klasifikator sinau mbedakaken output ingkang aman kaliyan output ingkang boten aman. Ing pendekatan tradhisional punika, pangklasifikasi boten nate nyumurupi kebijakan keamanan kanthi nyata. Minangka gantine, iki nyoba nyimpulake kebijakan sing ndasari sing digunakake kanggo menehi label marang conto-conto kasebut kanthi nemokake kamiripan ing konten sing diwenehi label ora aman lan prabédan antarane konten ora aman lan konten aman.
Klasifikator tradhisional bisa nduwèni kinerja dhuwur, kanthi latensi cendhek lan biaya operasional murah. Nanging, nglumpukaké conto latihan kanthi jumlah sing cukup bisa mbutuhaké wektu akèh lan biaya larang, lan nganyari utawa ngganti kebijakan mbutuhaké nglatih maneh klasifikator.
gpt-oss-safeguard iku béda amarga kapabilitas panalarané ngidini pengembang ngetrapaké kebijakan apa waé , kalebu kebijakan sing ditulis dhéwé utawa dijupuk saka sumber liya, lan panalaran mbantu modhèl-modhèl nggeneralisasi kebijakan anyar sing lagi ditulis. Saliyane kebijakan keamanan, gpt-oss-safeguard bisa digunakake kanggo menehi label konten kanthi cara liya sing wigati kanggo produk lan platform tartamtu.
Model penalaran utama kita saiki sinau kebijakan kaamanan kita kanthi langsung, lan nggunakake kemampuan penalarane kanggo nalar babagan apa sing aman. Pendekatan iki, sing kita sebut penyelarasan deliberatif, kanthi signifikan ningkatake metode latihan keamanan sadurunge lan ndadekake model penalaran kita luwih aman ing sawetara aspek tinimbang pendahulune sing ora nganggo penalaran, sanajan kapabilitase saya mundhak. Nanging penalaran ora mung migunani kanggo nglatih model-model kasebut dhewe. Iki uga mbukak kemungkinan anyar kanggo pertahanan bertingkat. Pendekatan adhedhasar panalaran luwih fleksibel lan ora pati kawates dening rincian saka latihan sadurungé; kaluwihan iki kadhangkala luwih saka cukup kanggo mbeneraké tambahan biaya komputasi lan latensi sing ditimbulaké.
gpt-oss-safeguard minangka implementasi bobot-terbuka saka pendekatan sing dikembangaké secara internal, ing piranti sing dijenengi Safety Reasoner. Miwiti kanthi fine-tuning penguatan ing tugas pelabelan kebijakan, kanthi menehi ganjaran marang model amarga niru penilaian sing bener saka para ahli manungsa. Pengajaran iki nglatih model supaya bisa nalar babagan kepriye kebijakan nuntun marang pambijiné. Saiki, Safety Reasoner ngidini nganyari kebijakan kaamanan kanthi dinamis ing lingkungan produksi kanthi wektu luwih cekak tinimbang wektu sing dibutuhake kanggo nglatih ulang pengklasifikasi. Iki ndadekake Safety Reasoner dadi piranti utama kanggo penerapan iteratif: nalika masang model anyar menyang lingkungan produksi, asring diwiwiti nganggo kebijakan sing luwih ketat lan nggunakake jumlah komputasi sing relatif gedhe ing papan sing dibutuhake supaya Safety Reasoner bisa ngetrapake kebijakan kasebut kanthi tliti. Sawisé kuwi, kebijakan kita disetel manèh nalika pangerten babagan risiko ing lingkungan produksi saya tambah apik. Ing sawetara peluncuran anyar, bagean saka total daya komputasi sing dikhususake kanggo penalaran keamanan wis tekan nganti 16%.
Safety Reasoner wis dadi komponen inti ing tumpukan keselamatan kita. Kanggo nyasilake gambar lan Sora 2, nindakake evaluasi output kanthi dinamis lan bertahap kanggo ngenali lan mblokir asil generasi sing ora aman secara langsung. Ing domain kayata biologi lan tumindak nyilakani dhiri, model kaya sing digunakake ing Moderation API dilakokaké minangka pengklasifikasi cilik, cepet, lan kanthi tingkat recall dhuwur kanggo nemtokake konten sing kalebu ing domain sing dadi kapentingan, banjur nggunakake Safety Reasoner kanggo mriksa konten kasebut. Safety Reasoner nglasifikasikaké asil output model adhedhasar taksonomi sing rinci kanggo nemtokaké cara paling becik kanggo nanggapi, minangka pérangan saka pengayoman multi-lapisan ing saindhenging sistem kaya GPT‑5 lan ChatGPT Agent. Lan saiki, model-model gpt-oss-safeguard nggawe pendekatan sing padha iki kasedhiya kanggo sapa wae.
Model-model gpt-oss-safeguard wis dievaluasi nganggo kumpulan evaluasi internal lan eksternal.
Ing evaluasi internal, dipunparingaken pirang-pirang kebijakan kanthi bebarengan dhateng gpt-oss-safeguard nalika wekdal inferensi. Kanggo saben input uji, kita ngevaluasi apa gpt-oss-safeguard kanthi bener ngklasifikasikake teks miturut kabeh kebijakan sing kalebu. Iki tugas sing nantang—modhèl mung dianggep akurat yen cocog persis karo label ing set emas kanggo kabèh kebijakan sing kalebu.
Model-model gpt-oss-safeguard kita lan Safety Reasoner internal ngungguli gpt-5-thinking lan model terbuka gpt-oss ing akurasi multi-kebijakan. Model-model gpt-oss-safeguard sing ngungguli gpt-5-thinking iku kaget banget amarga ukuran model-model mau cilik.
Kita uga ngevaluasi luwih lanjut model-model iki ing kumpulan data moderasi(mbukak ing jendhela anyar) sing dirilis bareng karo makalah riset 2022(mbukak ing jendhela anyar) kita lan ing ToxicChat(mbukak ing jendhela anyar), tolok ukur publik adhedhasar kueri pengguna marang chatbot sumber terbuka.
Ing set evaluasi moderasi taun 2022, panjenenganipun dipun evaluasi kanthi migunakaken kebijakan keamanan internal (kanthi nyetel salah satunggaling kebijakan supados nggatekaken owah-owahan salajengipun). gpt-oss-safeguard rada luwih unggul tinimbang kabeh model liyane sing dites, kalebu Safety Reasoner internal kita lan gpt-5-thinking, sanadyan prabédan antarane Safety Reasoner lan gpt-oss-safeguard iki ora signifikan secara statistik.
Kanggo ToxicChat, kita ngevaluasi nganggo prompt cekak sing ditulis kanthi manual lan diadaptasi saka sawetara kebijakan internal kita. Safety Reasoner internal kita maneh ngluwihi kinerja gpt-5-thinking, dene gpt-5-thinking lan Safety Reasoner loro-lorone mung saithik ngluwihi kinerja gpt-oss-safeguard-120b lan gpt-oss-safeguard-20b. Kita ngarepake menawa ukurané gpt-oss-safeguard sing relatif cilik isih ndadekake luwih becik dipilih kanggo jinis tugas iki.
Ana rong watesan tartamtu saka gpt-oss-safeguard. Kaping pisan, kita wis ngamati manawa pangklasifikasi sing dilatih nganggo puluhan ewu sampel berkualitas dhuwur sing wis diwenehi label isih bisa nduweni kinerja luwih apik kanggo nggolongake konten tinimbang gpt-oss-safeguard nalika nalar langsung saka kebijakan. Nyedhiyakake wektu kanggo nglatih pengklasifikasi khusus bisa dadi pilihan sing luwih becik kanggo entuk kinerja sing luwih dhuwur ing risiko sing luwih kompleks.
Kapindho, gpt-oss-safeguard bisa mbutuhake wektu lan daya komputasi sing gedhe, saengga angel diskalakake ing kabeh konten platform. Secara internal, kita nangani bab iki kanthi sawetara cara nganggo Safety Reasoner: (1) kita nggunakake pangklasifikasi sing luwih cilik lan luwih cepet kanggo nemtokake konten endi sing kudu ditaksir lan (2) ing sawetara kahanan, kita nggunakake Safety Reasoner kanthi asinkron kanggo nyedhiyakake pengalaman pengguna kanthi latensi endhek nalika tetep njaga kemampuan kanggo campur tangan yen kita ndeteksi konten sing ora aman.
gpt-oss-safeguard yaiku rangkaian kapisan saka modhel keslametan terbuka OpenAI sing digawé bebarengan karo komunitas. Kita wis bola-bali nyempurnakake gpt-oss-safeguard bebarengan karo para spesialis kapercayan lan keamanan ing SafetyKit, ROOST, Tomoro, lan Discord minangka bagéan saka pangujian awal. CTO ROOST Vinay Rao ujar, “gpt-oss-safeguard minangka model panalaran sumber terbuka pisanan kanthi rancangan ‘nggawa kebijakan lan definisi cilaka dhewe’. Organisasi nduwèni kabèbasan kanggo nyinaoni, ngowahi, lan nggunakake teknologi keslametan sing wigati kanthi bébas, lan uga bisa nindakake inovasi. Ing pengujian kita, piranti iki trampil mangerteni macem-macem kebijakan, njlentrehake nalaré, lan nuduhake nuansa nalika ngetrapake kebijakan kasebut, sing kita yakini bakal migunani kanggo para pengembang lan tim keamanan.”
Bakal terus dilakoni iterasi bebarengan komunitas kanggo ningkataké piranti keslametan terbuka, kalebu liwat ROOST Model Community (RMC). RMC nglumpukaké para praktisi lan panaliti kaslametan kanggo nuduhake praktik paling apik kanggo ngetrapaké modhel AI sumber terbuka ing alur kerja keslametan, kalebu asil evaluasi lan umpan balik modhel. Bukak repo GitHub RMC(mbukak ing jendhela anyar) kanggo mangerteni luwih lengkap babagan kerja sama iki lan carane melu.
Kanggo miwiti mbangun nganggo model-model iki, undhuh model-model kasebut saka Hugging Face(mbukak ing jendhela anyar).

