Үндсэн агуулга руу алгасах
OpenAI

2025 оны аравдугаар сарын 29

БүтээгдэхүүнГаргалт

gpt-oss-safeguard-г танилцуулж байна

Тусгай аюулгүй байдлын бодлогыг дэмждэг шинэ нээлттэй аюулгүй байдлын сэтгэн бодох загварууд (120b ба 20b).

Ачаалж байна…

Өнөөдөр бид аюулгүй байдлын ангиллын даалгаварт зориулсан, gpt-oss-safeguard-120b болон gpt-oss-safeguard-20b гэсэн хоёр хэмжээтэйгээр ашиглах боломжтой, gpt-oss-safeguard нэртэй нээлттэй жинтэй сэтгэн бодох загварын судалгааны урьдчилсан хувилбарыг танилцуулж байна. Эдгээр загвар нь манай gpt-oss нээлттэй загваруудын нарийн тохируулсан хувилбарууд бөгөөд ижил уян хатан Apache 2.0 лицензийн хүрээнд ашиглах боломжтой тул хэн ч тэдгээрийг чөлөөтэй ашиглаж, өөрчилж, нэвтрүүлэх боломжтой. Хоёр загварыг өнөөдрөөс эхлэн Hugging Face(шинэ цонхонд нээгдэнэ)-ээс татаж авах боломжтой.

gpt-oss-safeguard загварууд нь дүгнэлт гаргах үед хөгжүүлэгчийн өгсөн бодлогыг шууд тайлбарлахын тулд сэтгэн бодох аргыг ашигладаг бөгөөд хэрэглэгчийн мессеж, гүйцэтгэл, бүтэн чатуудыг хөгжүүлэгчийн хэрэгцээнд нийцүүлэн ангилдаг. Хөгжүүлэгч ямар бодлого ашиглахаа үргэлж өөрөө шийддэг тул хариултууд нь илүү хамааралтай бөгөөд хөгжүүлэгчийн хэрэглээний тохиолдолд илүү тохирсон байдаг. Загвар нь бодлын хэлхээ ашигладаг бөгөөд хөгжүүлэгч нар загвар шийдвэртээ хэрхэн хүрч байгааг ойлгохын тулд үүнийг хянаж болно. Нэмж дурдахад, бодлогыг загварт сургаж суулгахын оронд дүгнэлт гаргах үед өгдөг тул хөгжүүлэгчид гүйцэтгэлийг сайжруулахын тулд бодлогыг давтан засварлахад хялбар болдог. Бидний анх дотоод хэрэгцээнд зориулан боловсруулсан энэхүү арга нь олон тооны шошготой жишээн дээр үндэслэн ангилагчийг сургаж, шийдвэрийн заагийг шууд бусаар тодорхойлдог уламжлалт аргаас илүү уян хатан юм.

gpt-oss-safeguard нь хөгжүүлэгчдэд өөрсдийн хэрэглээний нөхцөлд хамгийн сайн тохирох бодлогын заагийг тодорхойлох боломжийг олгодог. Жишээлбэл, видео тоглоомын хэлэлцүүлгийн форум нь тоглоомд хууран мэхлэх талаар ярилцсан нийтлэлүүдийг ангилах бодлого боловсруулж болох бол бүтээгдэхүүний үнэлгээний сайт нь хуурамч байх магадлалтай үнэлгээг илрүүлэн шүүх зорилгоор өөрийн бодлогыг ашиглаж болно.

Загвар нь нэгэн зэрэг хоёр оролт — бодлого болон тухайн бодлогын дагуу ангилах агуулгыг — авч, агуулга хаана хамаарах талаар дүгнэлт гаргаж, мөн түүний сэтгэн бодох үйл явцыг тайлбарладаг. Хөгжүүлэгчид эдгээр дүгнэлтийг өөрсдийн аюулгүй байдлын системд ашиглах эсэх болон хэрхэн ашиглахаа өөрсдөө шийддэг. Бид энэ төрлийн эргэцүүлэлд суурилсан арга нь дараах нөхцөл байдалд онцгой үр дүнтэй болохыг анзаарсан:

  • Болзошгүй хор хөнөөл нь шинээр гарч ирж буй эсвэл хувьсан өөрчлөгдөж байгаа бөгөөд бодлогыг хурдан хугацаанд дасан зохицуулан шинэчлэх шаардлагатай үед.
  • Энэ салбар нь маш нарийн төвөгтэй бөгөөд жижиг ангилагчдад боловсруулахад хэцүү.
  • Хөгжүүлэгчид платформ дээрх эрсдэл бүрд өндөр чанартай ангилагчийг сургахад хангалттай хэмжээний жишээ байхгүй байна.
  • Өндөр чанартай, тайлбарлах боломжтой шошго гаргах нь хоцрогдлоос илүү чухал юм.

Бид судалгаа, аюулгүй байдлын хамтын нийгэмлэгээс санал хүсэлт авч, загварын гүйцэтгэлийг цаашид сайжруулахын тулд gpt-oss-safeguard-ийн энэ урьдчилсан хувилбарыг гаргаж байна. Хэдэн сарын турш бид хөгжүүлэгчийн чухал хэрэгцээг тодорхойлох, загварыг турших, хөгжүүлэгчийн баримт бичиг боловсруулахын тулд ROOST(шинэ цонхонд нээгдэнэ) -тай хамтран энэхүү нээлттэй жингийн хувилбар дээр ажилласан. Энэ танилцуулгын хүрээнд ROOST нь өнөөдөр мөн эхэлж буй загварын нийгэмлэг(шинэ цонхонд нээгдэнэ)-ийг байгуулж, онлайн орон зайг хамгаалахын тулд нээлттэй Хиймэл оюун ухааны загваруудыг судлах болно. Уг нээлттэй зэрэгцэн бид энэхүү урьдчилсан загварын аюулгүй байдлын гүйцэтгэлийг дэлгэрэнгүй тайлбарласан товч техникийн тайлан -г нийтэлж байна.

Системийн түвшний аюулгүй байдал: аюулгүй байдлын ангилагчдын үүрэг

Аюулгүй байдлын тухайд бид олон давхар хамгаалалт-ын зарчимд найддаг. Бид загваруудаа аюулгүй хариу үйлдэл үзүүлэхээр сургаж, бодлогынхоо хүрээнд аюултай байж болзошгүй оролт, гаралтыг илрүүлж, шийдвэрлэх нэмэлт хамгаалалтын давхаргуудыг хэрэгжүүлдэг. Тодорхой эрсдэлийн хүрээнд аюулгүй агуулгыг аюултай агуулгаас ялгадаг аюулгүй байдлын ангилагчид нь манай болон бусад том хэлний загваруудын хувьд хамгаалалтын үндсэн давхарга болсоор ирсэн.

Манай Moderation API(шинэ цонхонд нээгдэнэ)-аар ашиглах боломжтой уламжлалт аюулгүй байдлын ангилагчдыг урьдчилан тодорхойлсон аюулгүй байдлын бодлогын хүрээнд аюулгүй болон аюултай агуулгатай мянга мянган жишээг гар аргаар сонгон бүрдүүлэх замаар боловсруулдаг. Энэхүү сургалтын өгөгдлөөс ангилагч нь аюулгүй гаралт ба аюултай гаралтыг ялгаж сурдаг. Энэхүү уламжлалт арга барилд ангилагч нь аюулгүй байдлын бодлогыг хэзээ ч бодитоор хардаггүй. Харин үүний оронд аюултай гэж тэмдэглэсэн агуулга дахь төстэй талууд болон аюултай ба аюулгүй агуулгын хоорондын ялгааг олж, жишээнүүдийг тэмдэглэхэд ашигласан суурь бодлогыг таамаглахыг оролддог.

Уламжлалт ангилагчид бага саатал, ашиглалтын өртөгтэйгөөр өндөр гүйцэтгэлтэй байж чадна. Гэхдээ хангалттай тооны сургалтын жишээ цуглуулах нь цаг их шаардсан, өртөг өндөртэй байж болох бөгөөд бодлогыг шинэчлэх эсвэл өөрчлөх нь ангилагчийг дахин сургахыг шаарддаг.

gpt-oss-safeguard нь харин үүнээс өөр, учир нь түүний эргэцүүлэх чадвар нь хөгжүүлэгчдэд өөрсдийн бичсэн эсвэл бусад эх сурвалжаас авсан бодлогуудыг багтаасан ямар ч бодлогыг хэрэгжүүлэх боломжийг олгодог бөгөөд эргэцүүлэх нь загваруудад шинээр бичсэн бодлогууд дээр ерөнхийлөн дүгнэхэд тусалдаг. Аюулгүй байдлын бодлогоос гадна gpt-oss-safeguard-г тодорхой бүтээгдэхүүн болон платформуудад чухал ач холбогдолтой бусад аргаар агуулгыг шошголоход ашиглаж болно.

‘gpt-oss-safeguard ашигласан бодлогод суурилсан эргэцүүлэл‘ нэртэй урсгалын диаграмм. Хөгжүүлэгчийн өгсөн бодлого болон хэрэглэгчийн өгсөн агуулга GPT-OSS-Safeguard руу ордог. Энэхүү загвар нь бодлын хэлхээг бий болгож, дараа нь бодлогын шийдвэр гаргадаг бөгөөд ‘бодлогын давтан сайжруулалт’ гэсэн гогцоо нь бодлогыг боловсронгуй болгоход чиглэдэг. Тайлбар хэсэг нь хөгжүүлэгчийн оролт, хэрэглэгчийн оролт, загварын гаралтыг тус тус заадаг.

Бид дотооддоо аюулгүй байдлын сэтгэн бодох аргыг хэрхэн ашигладаг тухай

Манай үндсэн сэтгэн бодох загварууд одоо манай аюулгүй байдлын бодлогуудыг шууд сурч, сэтгэн бодох чадвараа ашиглан юу аюулгүй болохыг олж тогтоодог Бидний оновчтой уялдуулах гэж нэрлэдэг энэ арга нь аюулгүй байдлын өмнөх сургалтын аргуудыг мэдэгдэхүйц сайжруулж, чадвар нь сайжирч байгаа хэдий ч манай сэтгэн бодох загваруудыг сэтгэн боддоггүй өмнөх загваруудаасаа хэд хэдэн хэмжээсээр илүү аюулгүй болгодог. Сэтгэн бодох арга нь зөвхөн загваруудыг өөрсдийг нь сургахад хэрэгтэй биш. Мөн энэ нь олон давхар хамгаалалтын шинэ боломжуудыг бий болгодог. Сэтгэн бодоход суурилсан аргууд нь илүү уян хатан бөгөөд өмнөх сургалтынхаа нарийн зүйлсээр бага хязгаарлагддаг бөгөөд эдгээр давуу тал нь заримдаа үүнтэй холбоотой нэмэлт тооцооллын өртөг, хоцролтын хугацаа нэмэгдэх сул талыг бүрэн нөхөхүйц байдаг.

gpt-oss-safeguard нь бидний дотооддоо боловсруулсан, Safety Reasoner гэж нэрлэдэг хэрэгсэлд ашигласан хандлагын нээлттэй жинтэй хэрэгжилт юм. Бид бодлогын дагуу шошгололтын даалгаврууд дээр бататгах нарийн тохиргоогоор эхэлж, загварыг хүний мэргэжилтнүүдийн зөв дүгнэлтийг тусган дуурайхад нь урамшуулах замаар сургасан. Энэ нь бодлого хэрхэн дүгнэлт гаргахад хүргэдэг талаар загварт сэтгэн бодохыг заасан. Өнөөдөр Safety Reasoner нь ангилагчийг дахин сургахад шаардагдах хугацаанаас бага хугацаанд үйлдвэрлэлийн аюулгүй байдлын бодлогоо динамикаар шинэчлэх боломжийг бидэнд олгож байна. Энэ нь Safety Reasoner-ийг давтан нэвтрүүлэлт-ийн гол хэрэгсэл болгодог: бид шинэ загваруудыг үйлдвэрлэлийн орчинд нэвтрүүлэхдээ ихэвчлэн илүү хатуу бодлогоос эхэлж, шаардлагатай үед Safety Reasoner-д тэдгээр бодлогыг анхааралтай хэрэгжүүлэх боломж олгохын тулд харьцангуй их хэмжээний тооцооллын нөөц ашигладаг. Дараа нь үйлдвэрлэл дэх эрсдэлийн талаарх ойлголт маань сайжрахын хэрээр бид бодлогоо нийцүүлэн тохируулдаг. Сүүлийн зарим нэвтрүүлэлтүүдэд аюулгүй байдлын сэтгэн бодоход зориулагдсан нийт тооцооллын хувь 16% хүртэл өндөр байсан.

Safety Reasoner нь манай аюулгүй байдлын хамгаалалтын системийн үндсэн бүрэлдэхүүн хэсэг болсон. Зураг үүсгэх болон Sora 2-ын хувьд энэ нь үүсгэж буй үр дүнг алхам алхмаар, динамикаар үнэлж, аюултай агуулга үүсгэхийг бодит цагийн горимоор илрүүлэн хориглодог. Биологи болон өөртөө хор хөнөөл учруулах зэрэг домэйнд бид Moderation API-д ашигладагтай адил жижиг, хурдан бөгөөд өндөр илрүүлэлтийн чадвартай ангилагч загваруудыг тухайн сонирхож буй домэйнд ямар агуулга багтаж байгааг тодорхойлоход ашиглаж, дараа нь тэр агуулгыг хянахад Safety Reasoner-ийг ашигладаг. Safety Reasoner нь хэрхэн хамгийн зөв хариулахыг тодорхойлохын тулд загварын гаралтуудыг нарийвчилсан ангиллын дагуу ангилж, GPT‑5 болон ChatGPT Agent зэрэг системүүдийн хүрээнд манай олон давхар хамгаалалтын нэг хэсгийг бүрдүүлдэг. Мөн одоо, gpt-oss-safeguard загварууд энэ ижил арга хандлагыг хэн бүхэнд хүртээмжтэй болгож байна.

gpt-oss-safeguard хэрхэн ажилладаг вэ?

Бид gpt-oss-safeguard загваруудыг дотоод болон гадаад үнэлгээний багцууд дээр үнэлсэн.

Дотоод үнэлгээнд бид дүгнэлт хийх үед gpt-oss-safeguard-д нэгэн зэрэг олон бодлогыг өгсөн. Тестийн оролт бүрийн хувьд бид gpt-oss-safeguard нь текстийг оруулсан бүх бодлогын дагуу зөв ангилж байгаа эсэхийг үнэлдэг. Энэ нь сорилттой даалгавар—бөгөөд загвар нь хамрагдсан бүх бодлогын алтан багцын шошготой яг таарсан тохиолдолд л үнэн зөвд тооцогдоно.

Манай gpt-oss-safeguard загварууд болон дотоод Safety Reasoner нь олон бодлогын нарийвчлалаар gpt-5-thinking болон gpt-oss нээлттэй загваруудаас илүү сайн ажилладаг. Gpt-oss-safeguard загварууд Gpt-5-thinking-ээс илүү сайн ажиллаж байгаа нь өмнөх загваруудын хэмжээ харьцангуй бага гэдгийг харгалзан үзвэл онцгой гайхалтай үр дүн юм.

Мөн бид эдгээр загварыг 2022 оны судалгааны өгүүлэл(шинэ цонхонд нээгдэнэ) -дээ гаргасан зохицуулалтын өгөгдлийн багц(шинэ цонхонд нээгдэнэ) болон нээлттэй эхийн чатботод өгсөн хэрэглэгчийн хүсэлтүүдэд үндэслэсэн олон нийтэд нээлттэй жишиг болох ToxicChat(шинэ цонхонд нээгдэнэ) дээр үнэлсэн.

2022 оны зохицуулалтын үнэлгээний багц дээр бид дотоодын аюулгүй байдлын бодлогоо ашиглан (дараагийн өөрчлөлтүүдийг харгалзан нэг бодлогыг өөрчлөх) үнэлсэн. gpt-oss-safeguard нь манай дотоод Safety Reasoner болон gpt-5-thinking-ийг зэргийг шалгасан бусад бүх загвараас бага зэрэг өндөр үзүүлэлттэй байсан боловч Safety Reasoner болон gpt-oss-safeguard-ийн хоорондох энэ ялгаа нь статистикийн хувьд ач холбогдолтой биш юм.

ToxicChat-ийн хувьд бид дотоодын зарим бодлогодоо тулгуурлан боловсруулсан, гараар бичсэн богино зааврыг ашиглан үнэлгээ хийсэн. Бидний дотоодын Safety Reasoner нь gpt-5-thinking-ээс дахин илүү өндөр гүйцэтгэлтэй байсан бол gpt-5-thinking болон Safety Reasoner нь хоёулаа gpt-oss-safeguard-120b болон gpt-oss-safeguard-20b-ээс маш бага хэмжээний өндөр гүйцэтгэлтэй байсан. gpt-oss-safeguard-ийн харьцангуй бага хэмжээ нь энэ төрлийн даалгаварт илүү тохиромжтой хэвээр байна гэж бид үзэж байна.

Хязгаарлалт

gpt-oss-safeguard-д хоёр тодорхой хязгаарлалт байна. Нэгдүгээрт, бид өндөр чанартай шошголсон хэдэн арван мянган жишээн дээр сургагдсан ангилагчид бодлогоос шууд сэтгэн бодох үед gpt-oss-safeguard-аас агуулгыг ангилахдаа илүү сайн ажилласаар байгааг ажигласан. Илүү төвөгтэй эрсдэлүүд дээр илүү өндөр үзүүлэлт гаргахын тулд тусгай ангилагчийг сургахад цаг зарцуулах нь илүү тохиромжтой байж болно.

Хоёрдугаарт, gpt-oss-safeguard нь цаг хугацаа болон тооцоолол их шаарддаг тул платформ дээрх бүх агуулгыг өргөжүүлэхэд хүндрэл учруулдаг. Бид үүнийг дотооддоо Safety Reasoner-тэй хэд хэдэн аргаар зохицуулдаг: (1) бид аль агуулгыг үнэлэхээ тодорхойлохын тулд жижиг, хурдан ангилагч ашигладаг бөгөөд (2) зарим тохиолдолд бид аюултай агуулга илрүүлсэн тохиолдолд хөндлөнгөөс оролцох чадварыг хадгалахын зэрэгцээ бага хоцрогдолтой хэрэглэгчийн туршлагыг хангахын тулд Safety Reasoner-ийг асинхрон горимоор ашигладаг.

Цаашдын алхам: Олон нийттэй хамтран бүтээн байгуулалтаа үргэлжлүүлэх

gpt-oss-safeguard нь олон нийттэй хамтран бүтээсэн OpenAI-ийн анхны нээлттэй аюулгүй байдлын загваруудын багц юм. Бид gpt-oss-safeguard-ийг анхан шатны туршилтын хүрээнд SafetyKit, ROOST, Tomoro болон Discord-ийн итгэлцэл, аюулгүй байдлын чиглэлийн мэргэжилтнүүдтэй хамтран давтан сайжруулсан. ROOST компанийн технологийн захирал Винай Рао хэлэхдээ: “gpt-oss-safeguard бол ‘өөрийн бодлого, хор хөнөөлийн тодорхойлолтыг ашигладаг’ зарчимд суурилсан анхны нээлттэй эхийн сэтгэлгээний загвар юм” гэжээ. Байгууллагууд аюулгүй байдлын чухал технологиудыг чөлөөтэй судалж, өөрчилж, ашиглахын зэрэгцээ инновац хийх боломжтой байх ёстой. Бидний туршилтаар энэ нь өөр өөр бодлогыг ойлгох, үндэслэлийг нь тайлбарлах, бодлогыг хэрэгжүүлэхдээ нарийн зүйлийг харуулах чадвартай байсан бөгөөд энэ нь бүтээгчид болон аюулгүй ажиллагааны багуудад ашигтай байх болно гэж бид үзэж байна.”

Бид ROOST Model Community (RMC) зэрэг нээлттэй аюулгүй байдлын хэрэгслүүдийг давтан сайжруулсаар байх болно. RMC нь аюулгүй байдлын ажлын урсгалд нээлттэй эхийн хиймэл оюун ухааны загваруудыг хэрэгжүүлэх шилдэг туршлагуудыг хуваалцахын тулд аюулгүй байдлын мэргэжилтнүүд болон судлаачдыг нэгтгэдэг бөгөөд үүнд үнэлгээний үр дүн болон загварын санал хүсэлт орно. Энэхүү түншлэлийн талаар болон хэрхэн оролцох талаар илүү ихийг мэдэхийг хүсвэл RMC GitHub репозиторт(шинэ цонхонд нээгдэнэ) зочилно уу.

Эдгээр загварыг Hugging Face(шинэ цонхонд нээгдэнэ)-ээс татаж аваад бүтээж эхлээрэй.

Зохиогч

OpenAI