Inniu, tá réamhamharc taighde á eisiúint againn ar gpt-oss-safeguard, ár samhlacha réasúnaíochta meáchan oscailte le haghaidh tascanna aicmithe sábháilteachta, ar fáil i dhá mhéid: gpt-oss-safeguard-120b agus gpt-oss-safeguard-20b. Is leaganacha mionchoigeartaithe dár samhlacha oscailte gpt-oss iad na samhlacha seo agus tá siad ar fáil faoin gceadúnas liobrálach Apache 2.0 céanna, rud a ligeann d’aon duine iad a úsáid, a mhodhnú, agus a imscaradh go saor. Is féidir an dá shamhail a íoslódáil inniu ó Hugging Face(osclaíonn i bhfuinneog nua).
Úsáideann samhlacha gpt-oss-safeguard réasúnaíocht chun beartas a sholáthraíonn forbróir a léirmhíniú go díreach ag am tátail—aicmiú teachtaireachtaí úsáideora, comhlánuithe, agus comhráite iomlána de réir riachtanais an fhorbróra. Is é an forbróir a chinneann i gcónaí cén beartas atá le húsáid, mar sin bíonn na freagraí níos ábhartha agus curtha in oiriúint do chás úsáide an fhorbróra. Úsáideann an tsamhail sraith smaointe, ar féidir leis an bhforbróir é a athbhreithniú chun tuiscint a fháil ar an gcaoi a bhfuil an tsamhail ag teacht ar a cinntí. Ina theannta sin, soláthraítear an beartas le linn tátail, seachas é a bheith oilte isteach sa tsamhail, mar sin is furasta d’fhorbróirí beartais a athbhreithniú go hatriallach chun feidhmíocht a mhéadú. Tá an cur chuige seo, a d’fhorbraíomar ar dtús le haghaidh úsáid inmheánach, i bhfad níos solúbtha ná an modh traidisiúnta a bhaineann le haicmitheoir a oiliúint chun teorainn chinnidh a thátal go hindíreach ó líon mór samplaí lipéadaithe.
Cuireann gpt-oss-safeguard ar chumas forbróirí na línte beartais is fearr a oireann dá gcás úsáide a leagan síos. Mar shampla, b’fhéidir gur mhaith le fóram plé físchluichíochta beartas a fhorbairt chun poist ina bpléitear caimiléireacht sa chluiche a aicmiú, nó b’fhéidir gur mhaith le suíomh léirmheasanna táirgí a bheartas féin a úsáid chun léirmheasanna ar cosúil gur dócha gur bréige iad a scagadh.
Glacann an tsamhail dhá ionchur ag an am céanna—beartas agus an t-ábhar le haicmiú faoin mbeartas sin—agus aschuir sí conclúid faoi cén áit a bhfuil an t-ábhar, chomh maith lena réasúnaíocht. Is iad na forbróirí a chinneann conas, más ar chor ar bith, na conclúidí sin a úsáid ina bpíblínte sábháilteachta féin. Tá feidhmíocht an chur chuige seo atá bunaithe ar réasúnaíocht le feiceáil go han-mhaith go háirithe i gcásanna ina:
- Tá an dochar féideartha ag teacht chun cinn nó ag forbairt, agus ní mór do na beartais oiriúnú go tapa.
- Tá an réimse thar a bheith caolchúiseach agus is deacair d’aicmitheoirí níos lú é a láimhseáil.
- Níl go leor samplaí ag forbróirí chun aicmitheoir ardchaighdeáin a thraenáil do gach riosca ar a n-ardán.
- Tá mhoill níos lú tábhachtaí ná lipéid ardchaighdeáin, soiléire a tháirgeadh.
Táimid ag eisiúint an réamhamhairc seo de gpt-oss-safeguard chun aiseolas a fháil ón bpobal taighde agus sábháilteachta agus chun tuilleadh atriallta a dhéanamh ar fheidhmíocht na samhla. Thar na míonna, d’oibríomar ar an eisiúint oscailte seo le ROOST(osclaíonn i bhfuinneog nua) chun riachtanais ríthábhachtacha na bhforbróirí a shainaithint, an tsamhail a thástáil agus doiciméadacht d’fhorbróirí a tháirgeadh. Mar chuid den seoladh seo, beidh pobal samhail(osclaíonn i bhfuinneog nua) á bhunú ag ROOST, á sheoladh inniu freisin, chun samhlacha AI oscailte a iniúchadh chun spásanna ar líne a chosaint. In éineacht leis an eisiúint seo, táimid ag foilsiú tuarascáil theicniúil ghearr ina dtugtar mionsonraí ar fheidhmíocht sábháilteachta na samhla réamhamhairc seo.
Maidir le sábháilteacht, creidimid sa chosaint dhomhain. Oilimid ár samhlacha chun freagairt go sábháilte, agus cuirimid sraitheanna breise cosanta i bhfeidhm chun ionchuir agus aschuir a d’fhéadfadh a bheith neamhshábháilte a bhrath agus aghaidh a thabhairt orthu faoinár mbeartais. Is fada atá aicmitheoirí sábháilteachta, a dhéanann idirdhealú idir ábhar sábháilte agus neamhshábháilte i réimse riosca ar leith, ina bpríomhshraith chosanta dár samhlacha móra teanga féin agus do shamhlacha móra teanga eile.
Forbraítear aicmitheoirí sábháilteachta traidisiúnta, amhail iad siúd atá ar fáil trínár API Modhnóireachta(osclaíonn i bhfuinneog nua), trí na mílte sampla d’ábhar sábháilte agus neamhshábháilte a roghnú agus a chur i dtoll a chéile de láimh, faoi bheartais sábháilteachta réamhshainithe. Ó na sonraí oiliúna seo, foghlaimíonn an t-aicmitheoir idirdhealú a dhéanamh idir aschuir shábháilte agus aschuir neamhshábháilte. Sa chur chuige traidisiúnta seo, ní fheiceann an t-aicmitheoir an beartas sábháilteachta i ndáiríre riamh. Ina áit sin, déanann sé iarracht an beartas bunúsach a úsáideadh chun na samplaí a lipéadú a bhaint amach trí chosúlachtaí a aimsiú san ábhar a lipéadaíodh mar neamhshábháilte agus trí dhifríochtaí a aimsiú idir an t-ábhar neamhshábháilte agus an t-ábhar sábháilte.
Is féidir le haicmitheoirí traidisiúnta feidhmíocht ard a bheith acu, le moill íseal agus costas oibriúcháin íseal. Ach d’fhéadfadh sé a bheith am-íditheach agus costasach líon leordhóthanach samplaí oiliúna a bhailiú, agus éilíonn nuashonrú nó athrú an bheartais an t-aicmitheoir a athoiliúint.
Tá gpt-oss-safeguard difriúil toisc go gceadaíonn a chumais réasúnaíochta do fhorbróirí aon bheartas a chur i bhfeidhm, lena n-áirítear cinn a scríobhann siad féin nó a tharraingíonn siad ó fhoinsí eile, agus cabhraíonn an réasúnaíocht leis na samhlacha ginearálú a dhéanamh ar bheartais nua-scríofa. Taobh amuigh de bheartais sábháilteachta, is féidir gpt-oss-safeguard a úsáid chun ábhar a lipéadú ar bhealaí eile atá tábhachtach do tháirgí agus d’ardáin ar leith.
Foghlaimíonn ár bpríomhsamhlacha réasúnaíochta ár bpolasaithe sábháilteachta go díreach anois, agus úsáideann siad a gcumais réasúnaíochta chun réasúnú a dhéanamh faoi cad atá sábháilte. Cuireann an cur chuige seo, ar a dtugaimid ailíniú breithniúcháin, feabhas suntasach ar mhodhanna oiliúna sábháilteachta níos luaithe agus déanann sé ár samhlacha réasúnaíochta níos sábháilte ar roinnt aiseanna ná a réamhtheachtaithe neamh-réasúnaíochta, fiú de réir mar a mhéadaíonn a gcumais. Ach ní bhíonn réasúnaíocht úsáideach chun na samhlacha féin a oiliúint amháin. Cruthaíonn sé féidearthachtaí nua freisin do chosaint dhomhain. Tá cur chuige atá bunaithe ar réasúnaíocht níos solúbtha agus níos lú teoranta ag mionsonraí a n-oiliúna roimhe seo, buntáistí a thugann údar uaireanta níos mó ná don chostas ríomhaireachta breise agus don mhoill a bhaineann leo.
Is cur i bhfeidhm oscailte meáchain é gpt-oss-safeguard den chur chuige a d’fhorbraíomar go hinmheánach, in uirlis ar a dtugaimid Safety Reasoner. Thosaíomar le mionchoigeartú atreisiúcháin ar thascanna lipéadaithe beartais, agus luach saothair á thabhairt don tsamhail as breithiúnais chearta ó shaineolaithe daonna a léiriú. Mhúin sé seo don tsamhail réasúnú a dhéanamh faoin gcaoi a dtagann a breithiúnas as an mbeartas. Faoi láthair, cuireann Safety Reasoner ar ár gcumas ár mbeartais sábháilteachta a nuashonrú go dinimiciúil sa timpeallacht táirgthe i níos lú ama ná mar a thógfadh sé aicmitheoir a athoiliúint. Fágann sé sin gur príomhuirlis é Safety Reasoner le haghaidh imscaradh athdhéanach: nuair a imscaraimid samhlacha nua chuig an táirgeadh, is minic a thosaímid le beartais níos déine agus úsáidimid méideanna réasúnta móra acmhainne ríomhaireachta nuair is gá chun cur ar chumas Safety Reasoner na beartais sin a chur i bhfeidhm go cúramach. Ansin coigeartaímid ár mbeartais de réir mar a fheabhsaíonn ár dtuiscint ar na rioscaí sa timpeallacht táirgthe. I gcuid dár seoltaí le déanaí, bhí an codán den ríomhaireacht iomlán a caitheadh ar réasúnaíocht sábháilteachta chomh hard le 16%.
Tá Safety Reasoner tagtha chun bheith ina chomhpháirt lárnach dár gcruach sábháilteachta. Le haghaidh giniúint íomhá agus Sora 2, déanann sé meastóireachtaí dinimiciúla, céim ar chéim, ar aschuir chun giniúintí neamhshábháilte a shainaithint agus a bhlocáil i bhfíor-am. I réimsí amhail bitheolaíocht agus féindochar, úsáidimid samhlacha cosúil leo siúd a úsáidtear in API na Modhnóireachta mar aicmitheoirí beaga, thapa agus ard-aisghairme chun a chinneadh cén t-ábhar atá laistigh de réimse spéise, agus ansin úsáidimid Safety Reasoner chun an t-ábhar sin a athbhreithniú. Aicmíonn Safety Reasoner aschuir samhlacha de réir an tacsanomaíocht mhionsonraithe chun a chinneadh conas freagairt is fearr, agus é mar chuid dár gcosaintí ilshraitheacha ar fud córais amhail GPT‑5 agus ChatGPT Agent. Agus anois, cuireann samhlacha gpt-oss-safeguard an cur chuige céanna seo ar fáil d’aon duine.
Rinneamar meastóireacht ar na samhlacha gpt-oss-safeguard ar thacair meastóireachta inmheánacha agus sheachtracha araon.
Chuireamar beartais iomadúla ar fáil go comhuaineach do gpt-oss-safeguard tráth an tátail sa mheastóireacht inmheánach. I gcás gach ionchuir tástála, déanaimid measúnú ar cé acu a aicmíonn gpt-oss-safeguard an téacs i gceart de réir na bpolasaithe uile atá san áireamh. Is tasc dúshlánach é seo—meastar go bhfuil an tsamhail cruinn ach amháin má mheaitseálann sí go díreach lipéid an tacair óir do na polasaithe uile atá san áireamh.
Sáraíonn ár samhlacha gpt-oss-safeguard agus an Reasoner Inmheánach um Shábháilteacht samhlacha gpt-5-thinking agus na samhlacha oscailte gpt-oss i gcruinneas ilbheartais. Is iontach go háirithe é go sáraíonn na samhlacha gpt-oss-safeguard gpt-5-thinking de bharr méid beag na múnlaí sin.
Rinneamar measúnú breise ar na samhlacha seo ar an tacar sonraí modhnóireachta(osclaíonn i bhfuinneog nua) a d’eisíomar lenár bpáipéar taighde 2022(osclaíonn i bhfuinneog nua) agus ar ToxicChat(osclaíonn i bhfuinneog nua), tagarmharc poiblí bunaithe ar cheisteanna úsáideoirí chuig róbat comhrá foinse oscailte.
Ar thacar meastóireachta modhnóireachta 2022, rinneamar an mheastóireacht ag baint úsáide as ár mbeartais sábháilteachta inmheánacha (ag oiriúnú beartais amháin chun athruithe ina dhiaidh sin a chur san áireamh). D’fheidhmigh gpt-oss-safeguard beagán níos fearr ná na samhlacha eile go léir a tástáladh, lena n-áirítear ár Safety Reasoner inmheánach agus gpt-5-thinking, cé nach bhfuil an difríocht seo idir Safety Reasoner agus gpt-oss-safeguard suntasach ó thaobh staitistice de.
Maidir le ToxicChat, rinneamar meastóireacht ag úsáid leid ghearr lámhscríofa a cuireadh in oiriúint ó chuid dár bpolasaithe inmheánacha. Sháraigh ár Safety Reasoner inmheánach gpt-5-thinking arís ó thaobh feidhmíochta de, agus sáraíonn gpt-5-thinking agus Safety Reasoner araon gpt-oss-safeguard-120b agus gpt-oss-safeguard-20b ar bheagán. Táimid ag súil go bhfágann méid measartha beag gpt-oss-safeguard gur rogha níos fearr fós é don chineál seo tasc.
Tá dhá theorainn shonracha ag gpt-oss-safeguard. Ar an gcéad dul síos, thugamar faoi deara gur féidir le haicmitheoirí atá oilte ar na deicheanna mílte samplaí lipéadaithe ardcháilíochta feidhmiú níos fearr fós maidir le hábhar a aicmiú ná mar a dhéanann gpt-oss-safeguard nuair a úsáideann sé réasúnaíocht go díreach ón bpolasaí. D’fhéadfadh sé gur fearr an t-am a ghlacadh chun aicmitheoir tiomnaithe a oiliúint chun feidhmíocht níos airde a bhaint amach ar rioscaí níos casta.
Ar an dara dul síos, is féidir le gpt-oss-safeguard a bheith dian ó thaobh ama agus acmhainní ríomhaireachta de, rud a fhágann go bhfuil sé dúshlánach é a scálú ar fud ábhar uile an ardáin. Go hinmheánach, láimhseálaimid é seo ar roinnt bealaí le Safety Reasoner: (1) bainimid úsáid as aicmitheoirí níos lú agus níos tapa chun a chinneadh cén t-inneachar atá le measúnú, agus (2) i gcúinsí áirithe, úsáidimid Safety Reasoner go haisioncrónach chun eispéireas úsáideora le moill íseal a sholáthar agus an cumas idirghabháil a dhéanamh a chothabháil má bhraithimid inneachar neamhshábháilte.
Tá gpt-oss-safeguard mar an chéad tsraith de shamhlacha sábháilteachta oscailte de chuid OpenAI a tógadh leis an bpobal. Tá feabhsuithe atriallacha déanta againn ar gpt-oss-safeguard i gcomhar le speisialtóirí iontaoibhe agus sábháilteachta ag SafetyKit, ROOST, Tomoro, agus Discord mar chuid den luaththástáil. Deir Vinay Rao, CTO ROOST, “is í gpt-oss-safeguard an chéad samhail réasúnaíochta foinse oscailte le dearadh ‘tabhair leat do bheartais féin agus do shainmhínithe díobhála’. Tuillíonn eagraíochtaí an cumas teicneolaíochtaí ríthábhachtacha sábháilteachta a staidéar, a mhodhnú agus a úsáid go saor, agus nuálaíocht a dhéanamh. Inár dtástáil, bhí sé oilte polasaithe éagsúla a thuiscint, a réasúnaíocht a mhíniú, agus miondifríochtaí a léiriú agus na polasaithe á gcur i bhfeidhm, rud a chreidimid a bheidh tairbheach do thógálaithe agus d’fhoirne sábháilteachta.
Leanfaidh muid ar aghaidh ag obair leis an bpobal chun uirlisí sábháilteachta oscailte a fheabhsú, lena n-áirítear trí ROOST samhail Community (RMC). Tugann an RMC cleachtóirí agus taighdeoirí sábháilteachta le chéile chun dea-chleachtais a roinnt maidir le samhlacha AI foinse oscailte a chur i bhfeidhm i sreafaí oibre sábháilteachta, lena n-áirítear torthaí meastóireachta agus aiseolas ar shamhlacha. Tabhair cuairt ar an réimse stórála GitHub RMC(osclaíonn i bhfuinneog nua) chun tuilleadh a fhoghlaim faoin gcomhpháirtíocht seo agus faoi conas a bheith páirteach.
Chun tosú ag tógáil leis na samhlacha seo, íoslódáil iad ó Hugging Face(osclaíonn i bhfuinneog nua).

