Aqbeż għall-kontenut prinċipali
OpenAI

29 ta’ Ottubru 2025

ProdottĦruġ

Nintroduċu gpt-oss-safeguard

Mudelli ġodda miftuħa ta’ raġunament għas-sikurezza (120b u 20b) li jappoġġjaw politiki ta’ sikurezza personalizzati.

Qed jillowdja…

Illum qed inniedu verżjoni preliminari għar-riċerka ta’ gpt-oss-safeguard, il-mudelli tar-raġunament tagħna b’piżijiet miftuħa għal kompiti ta’ klassifikazzjoni tas-sikurezza, disponibbli f’żewġ daqsijiet: gpt-oss-safeguard-120b u gpt-oss-safeguard-20b. Dawn il-mudelli huma verżjonijiet irfinati tal-mudelli miftuħa tagħna gpt-oss u huma disponibbli bl-istess liċenzja permissiva Apache 2.0, li tippermetti lil kulħadd jużahom, jimmodifikahom u jimplimentahom liberament. Iż-żewġ mudelli jistgħu jitniżżlu mil-lum minn Hugging Face(jinfetaħ f’tieqa ġdida).

Il-mudelli gpt-oss-safeguard jużaw ir-raġunament biex, waqt l-inferenza, jinterpretaw direttament politika pprovduta mill-iżviluppatur—u jikklassifikaw il-messaġġi tal-utenti, it-tweġibiet iġġenerati u ċ-chats sħaħ skont il-ħtiġijiet tal-iżviluppatur. L-iżviluppatur dejjem jiddeċiedi liema politika tintuża, biex it-tweġibiet ikunu aktar rilevanti u mfassla għall-każ tal-użu tiegħu. Il-mudell juża katina tal-ħsieb, li l-iżviluppatur jista’ jirrieżamina biex jifhem kif il-mudell jasal għad-deċiżjonijiet tiegħu. Barra minn hekk, il-politika tingħata waqt l-inferenza minflok ma tiġi integrata fit-taħriġ tal-mudell, u għalhekk l-iżviluppaturi jistgħu jirreveduha b’mod iterattiv u faċli biex itejbu l-prestazzjoni. Dan l-approċċ, li żviluppajna inizjalment għall-użu intern, huwa ferm aktar flessibbli mill-metodu tradizzjonali li bih jitħarreġ klassifikatur biex jiddeduċi indirettament limitu ta’ deċiżjoni minn għadd kbir ta’ eżempji ttikkettati.

gpt-oss-safeguard jippermetti lill-iżviluppaturi jiddefinixxu l-limiti tal-politika li l-aktar jaqblu mal-każ tal-użu tagħhom. Pereżempju, forum ta’ diskussjoni dwar il-logħob tal-vidjo jista’ jkun irid jiżviluppa politika biex jikklassifika posts dwar qerq fil-logħba, filwaqt li sit ta’ reċensjonijiet tal-prodotti jista’ juża l-politika tiegħu stess biex jiffiltra reċensjonijiet li aktarx huma foloz.

Il-mudell jirċievi żewġ inputs f’daqqa—politika u l-kontenut li għandu jiġi kklassifikat skontha—u jipproduċi konklużjoni dwar fejn jaqa’ l-kontenut, flimkien mar-raġunament tiegħu. L-iżviluppaturi jiddeċiedu kif jużaw dawk il-konklużjonijiet, jekk jużawhom, fil-proċessi tas-sikurezza tagħhom stess. Rajna li dan l-approċċ ibbażat fuq ir-raġunament jaħdem tajjeb b’mod partikolari f’sitwazzjonijiet fejn:

  • Il-ħsara potenzjali tkun qed titfaċċa jew tevolvi, u l-politiki jkollhom jadattaw malajr.
  • Il-qasam ikollu ħafna sfumaturi u jkun diffiċli għal klassifikaturi iżgħar biex jimmaniġġjawh.
  • L-iżviluppaturi ma jkollhomx biżżejjed kampjuni biex iħarrġu klassifikatur ta’ kwalità għolja għal kull riskju fuq il-pjattaforma tagħhom.
  • Il-latenza tkun inqas importanti mill-produzzjoni ta’ tikketti ta’ kwalità għolja li jistgħu jiġu spjegati.

Qed inniedu din il-verżjoni preliminari ta’ gpt-oss-safeguard biex nirċievu feedback mill-komunità tar-riċerka u s-sikurezza u nkomplu ntejbu l-prestazzjoni tal-mudell b’mod iterattiv. Matul diversi xhur, ħdimna ma’ ROOST(jinfetaħ f’tieqa ġdida) fuq din il-verżjoni b’piżijiet miftuħa biex nidentifikaw il-ħtiġijiet kruċjali tal-iżviluppaturi, nittestjaw il-mudell u nipproduċu dokumentazzjoni għall-iżviluppaturi. Bħala parti minn dan it-tnedija, ROOST se tistabbilixxi komunità tal-mudelli(jinfetaħ f’tieqa ġdida), li qed titnieda wkoll illum, biex tesplora mudelli miftuħa tal-IA għall-protezzjoni tal-ispazji online. Flimkien ma’ din il-verżjoni, qed nippubblikaw rapport tekniku qasir li jagħti dettalji dwar il-prestazzjoni tas-sikurezza ta’ dan il-mudell preliminari.

Sikurezza fil-livell tas-sistema: ir-rwol tal-klassifikaturi tas-sikurezza

Fejn tidħol is-sikurezza, aħna nemmnu f’difiża f’diversi livelli. Inħarrġu l-mudelli tagħna biex iwieġbu b’mod sikur, u nimplimentaw livelli addizzjonali ta’ protezzjoni biex nidentifikaw u nittrattaw inputs u outputs li jistgħu ma jkunux sikuri skont il-politiki tagħna. Il-klassifikaturi tas-sikurezza, li jiddistingwu bejn kontenut sikur u mhux sikur f’qasam partikolari ta’ riskju, ilhom għal żmien twil livell ewlieni ta’ difiża għall-mudelli lingwistiċi kbar tagħna u ta’ oħrajn.

Il-klassifikaturi tradizzjonali tas-sikurezza, bħal dawk disponibbli permezz tal-Moderation API(jinfetaħ f’tieqa ġdida) tagħna, jiġu żviluppati billi jintgħażlu manwalment eluf ta’ eżempji ta’ kontenut sikur u mhux sikur skont politiki tas-sikurezza ddefiniti minn qabel. Minn din id-data tat-taħriġ, il-klassifikatur jitgħallem jiddistingwi bejn outputs sikuri u mhux sikuri. F’dan l-approċċ tradizzjonali, il-klassifikatur qatt ma jara l-politika tas-sikurezza nnifisha. Minflok, jipprova jiddeduċi l-politika sottostanti li ntużat biex jiġu ttikkettati l-eżempji billi jsib xebh fil-kontenut ittikkettat bħala mhux sikur u differenzi bejn il-kontenut sikur u dak mhux sikur.

Il-klassifikaturi tradizzjonali jistgħu joffru prestazzjoni għolja, b’latenza u spejjeż operattivi baxxi. Madankollu, il-ġbir ta’ biżżejjed eżempji tat-taħriġ jista’ jieħu ħafna ħin u jiswa ħafna flus, filwaqt li l-aġġornament jew it-tibdil tal-politika jirrikjedi li l-klassifikatur jerġa’ jitħarreġ.

gpt-oss-safeguard huwa differenti għax il-kapaċitajiet tar-raġunament tiegħu jippermettu lill-iżviluppaturi japplikaw kwalunkwe politika, inklużi dawk li jiktbu huma stess jew jieħdu minn sorsi oħra, u r-raġunament jgħin lill-mudelli jiġġeneralizzaw fuq politiki ġodda. Lil hinn mill-politiki tas-sikurezza, gpt-oss-safeguard jista’ jintuża biex jittikketta l-kontenut b’modi oħra li huma importanti għal prodotti u pjattaformi speċifiċi.

Dijagramma tal-fluss bit-titlu ‘Raġunament ibbażat fuq il-politika b’gpt-oss-safeguard.’ Politiki pprovduti mill-iżviluppatur u kontenut ipprovdut mill-utent jidħlu f’GPT-OSS-Safeguard. Il-mudell jipproduċi katina tal-ħsieb u mbagħad deċiżjoni ta’ politika, b’linja lura bit-tikketta ‘iterazzjoni tal-politika’ li terġa’ tidħol biex tirfina l-politiki. Leġġenda tindika input tal-iżviluppatur, input tal-utent, u output tal-mudell.

Kif nużaw internament ir-raġunament dwar is-sikurezza

Il-mudelli tar-raġunament ewlenin tagħna issa jitgħallmu direttament il-politiki tas-sikurezza tagħna u jużaw il-kapaċitajiet tar-raġunament tagħhom biex jiddeterminaw x’inhu sikur. Dan l-approċċ, li nsejħulu allinjament deliberattiv, itejjeb b’mod sinifikanti l-metodi preċedenti tat-taħriġ tas-sikurezza u jagħmel il-mudelli tar-raġunament tagħna aktar sikuri f’diversi aspetti mill-predeċessuri tagħhom mingħajr raġunament, anke hekk kif jiżdiedu l-kapaċitajiet tagħhom. Iżda r-raġunament mhuwiex utli biss għat-taħriġ tal-mudelli nfushom. Joħloq ukoll possibbiltajiet ġodda għal difiża f’diversi livelli. L-approċċi bbażati fuq ir-raġunament huma aktar flessibbli u inqas limitati mid-dettalji tat-taħriġ preċedenti tagħhom—vantaġġi li xi drabi jiġġustifikaw sew l-ispiża komputazzjonali u l-latenza addizzjonali li jinvolvu.

gpt-oss-safeguard huwa implimentazzjoni b’piżijiet miftuħa ta’ approċċ li żviluppajna internament f’għodda li nsejħulha Safety Reasoner. Bdejna b’irfinar ta’ tisħiħ fuq kompiti ta’ tikkettar skont il-politika, billi ppremjajna lill-mudell meta jirrifletti b’mod korrett il-ġudizzji ta’ esperti umani. Dan għallem lill-mudell jirraġuna dwar kif il-politika twassal għall-ġudizzju tiegħu. Illum, Safety Reasoner jippermettilna naġġornaw b’mod dinamiku l-politiki tas-sikurezza tagħna fil-produzzjoni f’inqas żmien milli jkun meħtieġ biex nerġgħu nħarrġu klassifikatur. Dan jagħmel lil Safety Reasoner għodda ewlenija għall-implimentazzjoni iterattiva: meta nimplimentaw mudelli ġodda fil-produzzjoni, spiss nibdew b’politiki aktar stretti u nużaw ammonti relattivament kbar ta’ komputazzjoni fejn meħtieġ biex Safety Reasoner ikun jista’ japplikahom bir-reqqa. Imbagħad naġġustaw il-politiki tagħna hekk kif nifhmu aħjar ir-riskji fil-produzzjoni. F’xi wħud mit-tnedijiet reċenti tagħna, il-proporzjon tal-komputazzjoni totali ddedikat għar-raġunament dwar is-sikurezza laħaq is-16%.

Safety Reasoner sar komponent ċentrali tas-sistema tas-sikurezza tagħna. Għall-ġenerazzjoni tal-immaġnijiet u Sora 2, huwa jevalwa l-outputs b’mod dinamiku u pass pass biex jidentifika u jimblokka ġenerazzjonijiet mhux sikuri f’ħin reali. F’oqsma bħall-bijoloġija u l-ħsara lill-individwu nnifsu, nużaw mudelli bħal dawk użati fil-Moderation API bħala klassifikaturi żgħar, veloċi u b’rata għolja ta’ identifikazzjoni biex niddeterminaw liema kontenut jaqa’ f’qasam ta’ interess, u mbagħad nużaw Safety Reasoner biex jirrieżaminah. Safety Reasoner jikklassifika l-outputs tal-mudell skont tassonomija dettaljata biex jiddetermina l-aħjar mod kif iwieġeb, bħala parti mis-salvagwardji f’diversi livelli tagħna f’sistemi bħal GPT‑5 u ChatGPT Agent. U issa, il-mudelli gpt-oss-safeguard jagħmlu dan l-istess approċċ disponibbli għal kulħadd.

Il-prestazzjoni ta’ gpt-oss-safeguard

Evalwajna l-mudelli gpt-oss-safeguard fuq settijiet ta’ evalwazzjoni kemm interni kif ukoll esterni.

Fl-evalwazzjoni interna, tajna lil gpt-oss-safeguard diversi politiki simultanjament waqt l-inferenza. Għal kull input tat-test, nevalwaw jekk gpt-oss-safeguard jikklassifikax it-test b’mod korrett skont il-politiki kollha inklużi. Dan huwa kompitu diffiċli—il-mudell jitqies preċiż biss jekk jaqbel eżattament mat-tikketti tas-sett ta’ referenza għall-politiki kollha inklużi.

Il-mudelli gpt-oss-safeguard tagħna u s-Safety Reasoner intern jaqbżu lil gpt-5-thinking u lill-mudelli miftuħa gpt-oss fil-preċiżjoni fuq diversi politiki. Il-fatt li l-mudelli gpt-oss-safeguard jaqbżu lil gpt-5-thinking huwa partikolarment sorprendenti minħabba d-daqs żgħir tagħhom.

Komplejna nevalwaw dawn il-mudelli fuq is-sett tad-data tal-moderazzjoni(jinfetaħ f’tieqa ġdida) li ħriġna flimkien mad-dokument ta’ riċerka tagħna tal-2022(jinfetaħ f’tieqa ġdida), u fuq ToxicChat(jinfetaħ f’tieqa ġdida), punt ta’ riferiment pubbliku bbażat fuq mistoqsijiet tal-utenti lil chatbot b’sors miftuħ.

Fuq is-sett ta’ evalwazzjoni tal-moderazzjoni tal-2022, għamilna l-evalwazzjoni billi użajna l-politiki interni tas-sikurezza tagħna, filwaqt li adattajna politika waħda biex tqis bidliet sussegwenti. gpt-oss-safeguard qabeż bi ftit lill-mudelli l-oħra kollha ttestjati, inklużi s-Safety Reasoner intern tagħna u gpt-5-thinking, għalkemm id-differenza bejn Safety Reasoner u gpt-oss-safeguard mhijiex statistikament sinifikanti.

Għal ToxicChat, evalwajna permezz ta’ prompt qasir miktub bl-idejn u adattat minn uħud mill-politiki interni tagħna. Is-Safety Reasoner intern tagħna reġa’ qabeż lil gpt-5-thinking, filwaqt li kemm gpt-5-thinking kif ukoll Safety Reasoner qabżu bi ftit lil gpt-oss-safeguard-120b u gpt-oss-safeguard-20b. Nistennew li d-daqs relattivament żgħir ta’ gpt-oss-safeguard xorta jagħmlu preferibbli għal dan it-tip ta’ kompitu.

Limitazzjonijiet

gpt-oss-safeguard għandu żewġ limitazzjonijiet speċifiċi. L-ewwel nett, osservajna li klassifikaturi mħarrġa fuq għexieren ta’ eluf ta’ kampjuni ttikkettati ta’ kwalità għolja xorta jistgħu jikklassifikaw il-kontenut aħjar minn gpt-oss-safeguard meta dan jirraġuna direttament mill-politika. Għal prestazzjoni ogħla fuq riskji aktar kumplessi, jista’ jkun aħjar li jittieħed il-ħin biex jitħarreġ klassifikatur apposta.

It-tieni, gpt-oss-safeguard jista’ jirrikjedi ħafna ħin u komputazzjoni, u għalhekk huwa diffiċli li jitkabbar biex ikopri l-kontenut kollu tal-pjattaforma. Internament, nittrattaw dan b’diversi modi permezz ta’ Safety Reasoner: (1) nużaw klassifikaturi iżgħar u aktar veloċi biex niddeterminaw liema kontenut għandu jiġi evalwat u (2) f’ċerti ċirkostanzi, nużaw Safety Reasoner b’mod mhux sinkroniku biex noffru esperjenza b’latenza baxxa lill-utent filwaqt li nżommu l-kapaċità li nintervjenu jekk nidentifikaw kontenut mhux sikur.

It-triq ’il quddiem: inkomplu nibnu mal-komunità

gpt-oss-safeguard huwa l-ewwel sett ta’ mudelli miftuħa tas-sikurezza ta’ OpenAI mibni mal-komunità. Bħala parti mill-ittestjar bikri, komplejna ntejbu gpt-oss-safeguard ma’ speċjalisti tal-fiduċja u s-sikurezza minn SafetyKit, ROOST, Tomoro, u Discord. Il-Kap tat-Teknoloġija ta’ ROOST, Vinay Rao, jgħid: “gpt-oss-safeguard huwa l-ewwel mudell tar-raġunament b’sors miftuħ imfassal biex ‘iġġib il-politiki u d-definizzjonijiet tal-ħsara tiegħek stess’. L-organizzazzjonijiet jistħoqqilhom ikunu jistgħu jistudjaw, jimmodifikaw u jużaw liberament teknoloġiji kruċjali tas-sikurezza, kif ukoll ikunu jistgħu jinnovaw. Fit-testijiet tagħna, wera ħila biex jifhem politiki differenti, jispjega r-raġunament tiegħu u jqis l-isfumaturi fl-applikazzjoni tal-politiki, u nemmnu li dan se jkun ta’ benefiċċju għall-iżviluppaturi u t-timijiet tas-sikurezza.”

Se nkomplu ntejbu l-għodod miftuħa tas-sikurezza b’mod iterattiv flimkien mal-komunità, inkluż permezz tar-ROOST Model Community (RMC). L-RMC tlaqqa’ professjonisti tas-sikurezza u riċerkaturi biex jaqsmu l-aħjar prattiki għall-integrazzjoni ta’ mudelli tal-IA b’sors miftuħ fil-proċessi tas-sikurezza, inklużi r-riżultati tal-evalwazzjoni u l-feedback dwar il-mudelli. Żur ir-repożitorju GitHub tal-RMC(jinfetaħ f’tieqa ġdida) biex issir taf aktar dwar din is-sħubija u kif tista’ tieħu sehem.

Biex tibda tibni b’dawn il-mudelli, niżżilhom minn Hugging Face(jinfetaħ f’tieqa ġdida).

Awtur

OpenAI