ਅੱਜ, ਅਸੀਂ ਸੁਰੱਖਿਆ ਵਰਗੀਕਰਨ ਕਾਰਜਾਂ ਲਈ ਸਾਡੇ ਓਪਨ-ਵੇਟ ਰੀਜ਼ਨਿੰਗ ਮਾਡਲਾਂ, gpt-oss-safeguard ਦਾ ਇੱਕ ਰਿਸਰਚ ਪ੍ਰੀਵਿਊ ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਜੋ ਦੋ ਆਕਾਰਾਂ ਵਿੱਚ ਉਪਲਬਧ ਹਨ: gpt-oss-safeguard-120b ਅਤੇ gpt-oss-safeguard-20b। ਇਹ ਮਾਡਲ ਸਾਡੇ gpt-oss ਓਪਨ ਮਾਡਲਾਂ ਦੇ ਫਾਈਨ-ਟਿਊਨ ਕੀਤੇ ਗਏ ਸੰਸਕਰਣ ਹਨ ਅਤੇ ਉਸੇ ਛੋਟ ਵਾਲੇ Apache 2.0 ਲਾਇਸੈਂਸ ਦੇ ਅਧੀਨ ਉਪਲਬਧ ਹਨ, ਜੋ ਕਿਸੇ ਨੂੰ ਵੀ ਇਹਨਾਂ ਦੀ ਖੁੱਲ੍ਹ ਕੇ ਵਰਤੋਂ ਕਰਨ, ਸੋਧਣ ਅਤੇ ਤੈਨਾਤ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੇ ਹਨ। ਦੋਵੇਂ ਮਾਡਲ ਅੱਜ Hugging Face(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਤੋਂ ਡਾਊਨਲੋਡ ਕੀਤੇ ਜਾ ਸਕਦੇ ਹਨ।
gpt-oss-safeguard ਮਾਡਲ ਇਨਫਰੈਂਸ ਦੇ ਸਮੇਂ ਡਿਵੈਲਪਰ ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤੀ ਪਾਲਿਸੀ ਦੀ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਵਿਆਖਿਆ ਕਰਨ ਲਈ ਰੀਜ਼ਨਿੰਗ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ—ਡਿਵੈਲਪਰ ਦੀਆਂ ਜ਼ਰੂਰਤਾਂ ਦੇ ਅਨੁਸਾਰ ਵਰਤੋਂਕਾਰ ਸੰਦੇਸ਼ਾਂ, ਸੰਪੂਰਨਤਾਵਾਂ, ਅਤੇ ਪੂਰੀਆਂ ਚੈਟਾਂ ਦਾ ਵਰਗੀਕਰਨ ਕਰਦੇ ਹਨ। ਡਿਵੈਲਪਰ ਹਮੇਸ਼ਾ ਇਹ ਫੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਕਿਹੜੀ ਪਾਲਿਸੀ ਵਰਤਣੀ ਹੈ, ਇਸ ਲਈ ਜਵਾਬ ਡਿਵੈਲਪਰ ਦੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ ਲਈ ਵਧੇਰੇ ਢੁਕਵੇਂ ਅਤੇ ਅਨੁਕੂਲ ਹੁੰਦੇ ਹਨ। ਮਾਡਲ ਚੇਨ-ਆਫ-ਥੌਟ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਜਿਸਦੀ ਡਿਵੈਲਪਰ ਇਹ ਸਮਝਣ ਲਈ ਸਮੀਖਿਆ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਮਾਡਲ ਆਪਣੇ ਫੈਸਲਿਆਂ 'ਤੇ ਕਿਵੇਂ ਪਹੁੰਚ ਰਿਹਾ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਪਾਲਿਸੀ ਨੂੰ ਮਾਡਲ ਵਿੱਚ ਸਿਖਲਾਈ ਦੇਣ ਦੀ ਬਜਾਏ ਇਨਫਰੈਂਸ ਦੌਰਾਨ ਪ੍ਰਦਾਨ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਇਸਲਈ ਡਿਵੈਲਪਰਾਂ ਲਈ ਕਾਰਗੁਜ਼ਾਰੀ ਵਧਾਉਣ ਲਈ ਪਾਲਿਸੀਆਂ ਨੂੰ ਵਾਰ-ਵਾਰ ਸੋਧਣਾ ਆਸਾਨ ਹੁੰਦਾ ਹੈ। ਇਹ ਪਹੁੰਚ, ਜਿਸਨੂੰ ਅਸੀਂ ਸ਼ੁਰੂ ਵਿੱਚ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਲਈ ਵਿਕਸਤ ਕੀਤਾ ਸੀ, ਵੱਡੀ ਗਿਣਤੀ ਵਿੱਚ ਲੇਬਲ ਕੀਤੀਆਂ ਉਦਾਹਰਣਾਂ ਤੋਂ ਅਸਿੱਧੇ ਤੌਰ 'ਤੇ ਫੈਸਲੇ ਦੀ ਸੀਮਾ ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਣ ਲਈ ਇੱਕ ਕਲਾਸੀਫਾਇਰ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਦੇ ਰਵਾਇਤੀ ਤਰੀਕੇ ਨਾਲੋਂ ਕਿਤੇ ਵੱਧ ਲਚਕਦਾਰ ਹੈ।
gpt-oss-safeguard ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਉਹਨਾਂ ਦੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਢੁਕਵੀਆਂ ਪਾਲਿਸੀ ਲਾਈਨਾਂ ਖਿੱਚਣ ਦੇ ਯੋਗ ਬਣਾਉਂਦਾ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਇੱਕ ਵੀਡੀਓ ਗੇਮਿੰਗ ਚਰਚਾ ਫੋਰਮ ਗੇਮ ਵਿੱਚ ਧੋਖਾਧੜੀ ਬਾਰੇ ਚਰਚਾ ਕਰਨ ਵਾਲੀਆਂ ਪੋਸਟਾਂ ਦਾ ਵਰਗੀਕਰਨ ਕਰਨ ਲਈ ਇੱਕ ਪਾਲਿਸੀ ਵਿਕਸਤ ਕਰਨਾ ਚਾਹ ਸਕਦਾ ਹੈ, ਜਾਂ ਇੱਕ ਉਤਪਾਦ ਸਮੀਖਿਆ ਸਾਈਟ ਉਹਨਾਂ ਸਮੀਖਿਆਵਾਂ ਦੀ ਜਾਂਚ ਕਰਨ ਲਈ ਆਪਣੀ ਖੁਦ ਦੀ ਪਾਲਿਸੀ ਵਰਤਣਾ ਚਾਹ ਸਕਦੀ ਹੈ ਜੋ ਫਰਜ਼ੀ ਜਾਪਦੀਆਂ ਹਨ।
ਮਾਡਲ ਇੱਕੋ ਸਮੇਂ ਦੋ ਇਨਪੁਟਸ ਲੈਂਦਾ ਹੈ—ਇੱਕ ਪਾਲਿਸੀ ਅਤੇ ਉਸ ਪਾਲਿਸੀ ਦੇ ਅਧੀਨ ਵਰਗੀਕਰਨ ਕਰਨ ਵਾਲੀ ਸਮੱਗਰੀ—ਅਤੇ ਆਪਣੀ ਰੀਜ਼ਨਿੰਗ ਦੇ ਨਾਲ ਇੱਕ ਸਿੱਟਾ ਕੱਢਦਾ ਹੈ ਕਿ ਸਮੱਗਰੀ ਕਿੱਥੇ ਆਉਂਦੀ ਹੈ। ਡਿਵੈਲਪਰ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਉਹਨਾਂ ਸਿੱਟਿਆਂ ਨੂੰ ਆਪਣੀਆਂ ਸੁਰੱਖਿਆ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਕਿਵੇਂ ਵਰਤਣਾ ਹੈ (ਜੇਕਰ ਵਰਤਣਾ ਹੈ)। ਅਸੀਂ ਇਸ ਰੀਜ਼ਨਿੰਗ-ਆਧਾਰਿਤ ਪਹੁੰਚ ਨੂੰ ਖਾਸ ਤੌਰ 'ਤੇ ਉਹਨਾਂ ਸਥਿਤੀਆਂ ਵਿੱਚ ਵਧੀਆ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦੇ ਦੇਖਿਆ ਹੈ ਜਿੱਥੇ:
- ਸੰਭਾਵੀ ਨੁਕਸਾਨ ਉੱਭਰ ਰਿਹਾ ਹੈ ਜਾਂ ਵਿਕਸਤ ਹੋ ਰਿਹਾ ਹੈ, ਅਤੇ ਪਾਲਿਸੀਆਂ ਨੂੰ ਜਲਦੀ ਅਨੁਕੂਲ ਹੋਣ ਦੀ ਲੋੜ ਹੈ।
- ਡੋਮੇਨ ਬਹੁਤ ਹੀ ਸੂਖਮ ਹੈ ਅਤੇ ਛੋਟੇ ਕਲਾਸੀਫਾਇਰਾਂ ਲਈ ਸੰਭਾਲਣਾ ਮੁਸ਼ਕਲ ਹੈ।
- ਡਿਵੈਲਪਰਾਂ ਕੋਲ ਆਪਣੇ ਪਲੇਟਫਾਰਮ 'ਤੇ ਹਰੇਕ ਜੋਖਮ ਲਈ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਕਲਾਸੀਫਾਇਰ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਲੋੜੀਂਦੇ ਨਮੂਨੇ ਨਹੀਂ ਹਨ।
- ਦੇਰੀ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ, ਵਿਆਖਿਆਯੋਗ ਲੇਬਲ ਤਿਆਰ ਕਰਨ ਨਾਲੋਂ ਘੱਟ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਅਸੀਂ ਰਿਸਰਚ ਅਤੇ ਸੁਰੱਖਿਆ ਭਾਈਚਾਰੇ ਤੋਂ ਫੀਡਬੈਕ ਪ੍ਰਾਪਤ ਕਰਨ ਅਤੇ ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ 'ਤੇ ਅੱਗੇ ਕੰਮ ਕਰਨ ਲਈ gpt-oss-safeguard ਦਾ ਇਹ ਪ੍ਰੀਵਿਊ ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ। ਕਈ ਮਹੀਨਿਆਂ ਤੋਂ, ਅਸੀਂ ਡਿਵੈਲਪਰਾਂ ਦੀਆਂ ਨਾਜ਼ੁਕ ਲੋੜਾਂ ਦੀ ਪਛਾਣ ਕਰਨ, ਮਾਡਲ ਦੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਡਿਵੈਲਪਰ ਦਸਤਾਵੇਜ਼ ਤਿਆਰ ਕਰਨ ਲਈ ROOST(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੇ ਨਾਲ ਇਸ ਓਪਨ ਵੇਟ ਰੀਲੀਜ਼ 'ਤੇ ਕੰਮ ਕੀਤਾ ਹੈ। ਇਸ ਲਾਂਚ ਦੇ ਹਿੱਸੇ ਵਜੋਂ ROOST ਇੱਕ ਮਾਡਲ ਕਮਿਊਨਿਟੀ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਸਥਾਪਤ ਕਰੇਗਾ, ਜੋ ਅੱਜ ਹੀ ਲਾਂਚ ਹੋ ਰਹੀ ਹੈ, ਤਾਂ ਜੋ ਔਨਲਾਈਨ ਸਪੇਸ ਦੀ ਰੱਖਿਆ ਕਰਨ ਲਈ ਓਪਨ AI ਮਾਡਲਾਂ ਦੀ ਪੜਚੋਲ ਕੀਤੀ ਜਾ ਸਕੇ। ਇਸ ਰੀਲੀਜ਼ ਦੇ ਨਾਲ, ਅਸੀਂ ਇੱਕ ਛੋਟੀ ਤਕਨੀਕੀ ਰਿਪੋਰਟ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰ ਰਹੇ ਹਾਂ ਜੋ ਇਸ ਪ੍ਰੀਵਿਊ ਮਾਡਲ ਦੇ ਸੁਰੱਖਿਆ ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਵੇਰਵਾ ਦਿੰਦੀ ਹੈ।
ਜਦੋਂ ਸੁਰੱਖਿਆ ਦੀ ਗੱਲ ਆਉਂਦੀ ਹੈ, ਤਾਂ ਅਸੀਂ ਬਹੁ-ਪਰਤੀ ਰੱਖਿਆ ਵਿੱਚ ਵਿਸ਼ਵਾਸ ਕਰਦੇ ਹਾਂ। ਅਸੀਂ ਆਪਣੇ ਮਾਡਲਾਂ ਨੂੰ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਜਵਾਬ ਦੇਣ ਲਈ ਸਿਖਲਾਈ ਦਿੰਦੇ ਹਾਂ, ਅਤੇ ਅਸੀਂ ਆਪਣੀਆਂ ਪਾਲਿਸੀਆਂ ਦੇ ਅਧੀਨ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਅਸੁਰੱਖਿਅਤ ਇਨਪੁਟਸ ਅਤੇ ਆਉਟਪੁੱਟਸ ਦਾ ਪਤਾ ਲਗਾਉਣ ਅਤੇ ਹੱਲ ਕਰਨ ਲਈ ਸੁਰੱਖਿਆ ਦੀਆਂ ਵਾਧੂ ਪਰਤਾਂ ਲਾਗੂ ਕਰਦੇ ਹਾਂ। ਸੁਰੱਖਿਆ ਕਲਾਸੀਫਾਇਰ, ਜੋ ਕਿਸੇ ਖਾਸ ਜੋਖਮ ਵਾਲੇ ਖੇਤਰ ਵਿੱਚ ਸੁਰੱਖਿਅਤ ਅਤੇ ਅਸੁਰੱਖਿਅਤ ਸਮੱਗਰੀ ਵਿੱਚ ਫਰਕ ਕਰਦੇ ਹਨ, ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਸਾਡੇ ਆਪਣੇ ਅਤੇ ਹੋਰ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਲਈ ਰੱਖਿਆ ਦੀ ਮੁੱਖ ਪਰਤ ਰਹੇ ਹਨ।
ਰਵਾਇਤੀ ਸੁਰੱਖਿਆ ਕਲਾਸੀਫਾਇਰ, ਜਿਵੇਂ ਕਿ ਸਾਡੇ ਮੋਡਰੇਸ਼ਨ API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਰਾਹੀਂ ਉਪਲਬਧ ਹਨ, ਪਹਿਲਾਂ ਤੋਂ ਪਰਿਭਾਸ਼ਿਤ ਸੁਰੱਖਿਆ ਪਾਲਿਸੀਆਂ ਦੇ ਅਧੀਨ ਸੁਰੱਖਿਅਤ ਅਤੇ ਅਸੁਰੱਖਿਅਤ ਸਮੱਗਰੀ ਦੀਆਂ ਹਜ਼ਾਰਾਂ ਉਦਾਹਰਣਾਂ ਨੂੰ ਮੈਨੂਅਲ ਤੌਰ 'ਤੇ ਚੁਣ ਕੇ ਤਿਆਰ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਇਸ ਸਿਖਲਾਈ ਡੇਟਾ ਤੋਂ, ਕਲਾਸੀਫਾਇਰ ਸੁਰੱਖਿਅਤ ਆਉਟਪੁੱਟਸ ਨੂੰ ਅਸੁਰੱਖਿਅਤ ਤੋਂ ਵੱਖ ਕਰਨਾ ਸਿੱਖਦਾ ਹੈ। ਇਸ ਰਵਾਇਤੀ ਪਹੁੰਚ ਵਿੱਚ, ਕਲਾਸੀਫਾਇਰ ਅਸਲ ਵਿੱਚ ਸੁਰੱਖਿਆ ਪਾਲਿਸੀ ਨੂੰ ਕਦੇ ਨਹੀਂ ਦੇਖਦਾ। ਇਸਦੀ ਬਜਾਏ, ਇਹ ਅਸੁਰੱਖਿਅਤ ਵਜੋਂ ਲੇਬਲ ਕੀਤੀ ਸਮੱਗਰੀ ਵਿੱਚ ਸਮਾਨਤਾਵਾਂ ਅਤੇ ਅਸੁਰੱਖਿਅਤ ਅਤੇ ਸੁਰੱਖਿਅਤ ਸਮੱਗਰੀ ਵਿੱਚ ਅੰਤਰ ਲੱਭ ਕੇ ਉਸ ਅੰਡਰਲਾਈੰਗ ਪਾਲਿਸੀ ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦਾ ਹੈ ਜਿਸਦੀ ਵਰਤੋਂ ਉਦਾਹਰਣਾਂ ਨੂੰ ਲੇਬਲ ਕਰਨ ਲਈ ਕੀਤੀ ਗਈ ਸੀ।
ਰਵਾਇਤੀ ਕਲਾਸੀਫਾਇਰਾਂ ਵਿੱਚ ਘੱਟ ਦੇਰੀ ਅਤੇ ਸੰਚਾਲਨ ਲਾਗਤ ਦੇ ਨਾਲ ਉੱਚ ਪ੍ਰਦਰਸ਼ਨ ਹੋ ਸਕਦਾ ਹੈ। ਪਰ ਸਿਖਲਾਈ ਦੀਆਂ ਉਦਾਹਰਣਾਂ ਦੀ ਲੋੜੀਂਦੀ ਮਾਤਰਾ ਇਕੱਠੀ ਕਰਨ ਵਿੱਚ ਸਮਾਂ ਲੱਗ ਸਕਦਾ ਹੈ ਅਤੇ ਇਹ ਮਹਿੰਗਾ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ ਪਾਲਿਸੀ ਨੂੰ ਅਪਡੇਟ ਕਰਨ ਜਾਂ ਬਦਲਣ ਲਈ ਕਲਾਸੀਫਾਇਰ ਨੂੰ ਦੁਬਾਰਾ ਸਿਖਲਾਈ ਦੇਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
gpt-oss-safeguard ਵੱਖਰਾ ਹੈ ਕਿਉਂਕਿ ਇਸਦੀਆਂ ਰੀਜ਼ਨਿੰਗ ਸਮਰੱਥਾਵਾਂ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਕੋਈ ਵੀ ਪਾਲਿਸੀ ਲਾਗੂ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀਆਂ ਹਨ, ਜਿਸ ਵਿੱਚ ਉਹ ਪਾਲਿਸੀਆਂ ਸ਼ਾਮਲ ਹਨ ਜੋ ਉਹ ਖੁਦ ਲਿਖਦੇ ਹਨ ਜਾਂ ਹੋਰ ਸਰੋਤਾਂ ਤੋਂ ਲੈਂਦੇ ਹਨ, ਅਤੇ ਰੀਜ਼ਨਿੰਗ ਨਵੀਆਂ ਲਿਖੀਆਂ ਗਈਆਂ ਪਾਲਿਸੀਆਂ ਨੂੰ ਆਮ ਬਣਾਉਣ ਵਿੱਚ ਮਾਡਲਾਂ ਦੀ ਮਦਦ ਕਰਦੀ ਹੈ। ਸੁਰੱਖਿਆ ਪਾਲਿਸੀਆਂ ਤੋਂ ਇਲਾਵਾ, gpt-oss-safeguard ਦੀ ਵਰਤੋਂ ਸਮੱਗਰੀ ਨੂੰ ਹੋਰ ਤਰੀਕਿਆਂ ਨਾਲ ਲੇਬਲ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਜੋ ਖਾਸ ਉਤਪਾਦਾਂ ਅਤੇ ਪਲੇਟਫਾਰਮਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹਨ।
ਸਾਡੇ ਮੁਢਲੇ ਰੀਜ਼ਨਿੰਗ ਮਾਡਲ ਹੁਣ ਸਾਡੀਆਂ ਸੁਰੱਖਿਆ ਪਾਲਿਸੀਆਂ ਨੂੰ ਸਿੱਧੇ ਸਿੱਖਦੇ ਹਨ, ਅਤੇ ਇਹ ਪਤਾ ਲਗਾਉਣ ਲਈ ਆਪਣੀਆਂ ਰੀਜ਼ਨਿੰਗ ਸਮਰੱਥਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਸੁਰੱਖਿਅਤ ਹੈ। ਇਹ ਪਹੁੰਚ, ਜਿਸਨੂੰ ਅਸੀਂ ਸੋਚ-ਵਿਚਾਰ ਆਧਾਰਿਤ ਅਲਾਈਨਮੈਂਟ ਕਹਿੰਦੇ ਹਾਂ, ਪੁਰਾਣੇ ਸੁਰੱਖਿਆ ਸਿਖਲਾਈ ਤਰੀਕਿਆਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਕਰਦੀ ਹੈ ਅਤੇ ਸਾਡੇ ਰੀਜ਼ਨਿੰਗ ਮਾਡਲਾਂ ਨੂੰ ਕਈ ਪਹਿਲੂਆਂ 'ਤੇ ਉਹਨਾਂ ਦੇ ਗੈਰ-ਰੀਜ਼ਨਿੰਗ ਪੂਰਵਜਾਂ ਨਾਲੋਂ ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਬਣਾਉਂਦੀ ਹੈ, ਭਾਵੇਂ ਕਿ ਉਹਨਾਂ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਵੱਧ ਰਹੀਆਂ ਹਨ। ਪਰ ਰੀਜ਼ਨਿੰਗ ਸਿਰਫ਼ ਮਾਡਲਾਂ ਨੂੰ ਖੁਦ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਹੀ ਲਾਭਦਾਇਕ ਨਹੀਂ ਹੈ। ਇਹ ਬਹੁ-ਪਰਤੀ ਰੱਖਿਆ ਲਈ ਨਵੀਆਂ ਸੰਭਾਵਨਾਵਾਂ ਵੀ ਪੈਦਾ ਕਰਦੀ ਹੈ। ਰੀਜ਼ਨਿੰਗ-ਆਧਾਰਿਤ ਪਹੁੰਚਾਂ ਵਧੇਰੇ ਲਚਕਦਾਰ ਹੁੰਦੀਆਂ ਹਨ ਅਤੇ ਉਹਨਾਂ ਦੀ ਪਿਛਲੀ ਸਿਖਲਾਈ ਦੇ ਵੇਰਵਿਆਂ ਦੁਆਰਾ ਘੱਟ ਸੀਮਤ ਹੁੰਦੀਆਂ ਹਨ, ਅਜਿਹੇ ਫਾਇਦੇ ਜੋ ਕਈ ਵਾਰ ਉਹਨਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਵਾਧੂ ਕੰਪਿਊਟ ਲਾਗਤ ਅਤੇ ਦੇਰੀ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਜਾਇਜ਼ ਠਹਿਰਾਉਂਦੇ ਹਨ।
gpt-oss-safeguard ਇੱਕ ਪਹੁੰਚ ਦਾ ਇੱਕ ਓਪਨ-ਵੇਟ ਲਾਗੂਕਰਨ ਹੈ ਜਿਸਨੂੰ ਅਸੀਂ ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ, ਇੱਕ ਟੂਲ ਵਿੱਚ ਵਿਕਸਤ ਕੀਤਾ ਹੈ ਜਿਸਨੂੰ ਅਸੀਂ ਸੇਫਟੀ ਰਿਜਨਰ ਕਹਿੰਦੇ ਹਾਂ। ਅਸੀਂ ਪਾਲਿਸੀ ਲੇਬਲਿੰਗ ਕਾਰਜਾਂ 'ਤੇ ਰੀਇਨਫੋਰਸਮੈਂਟ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਨਾਲ ਸ਼ੁਰੂਆਤ ਕੀਤੀ, ਮਾਡਲ ਨੂੰ ਮਨੁੱਖੀ ਮਾਹਰਾਂ ਦੇ ਸਹੀ ਫੈਸਲਿਆਂ ਦੀ ਨਕਲ ਕਰਨ ਲਈ ਇਨਾਮ ਦਿੱਤਾ। ਇਸਨੇ ਮਾਡਲ ਨੂੰ ਇਸ ਬਾਰੇ ਰੀਜ਼ਨਿੰਗ ਕਰਨਾ ਸਿਖਾਇਆ ਕਿ ਪਾਲਿਸੀ ਇਸਦੇ ਫੈਸਲੇ ਤੱਕ ਕਿਵੇਂ ਪਹੁੰਚਦੀ ਹੈ। ਅੱਜ, ਸੇਫਟੀ ਰਿਜਨਰ ਸਾਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਸਾਡੀਆਂ ਸੁਰੱਖਿਆ ਪਾਲਿਸੀਆਂ ਨੂੰ ਗਤੀਸ਼ੀਲ ਰੂਪ ਵਿੱਚ ਉਸ ਸਮੇਂ ਤੋਂ ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਅਪਡੇਟ ਕਰਨ ਦੇ ਯੋਗ ਬਣਾਉਂਦਾ ਹੈ ਜਿੰਨਾ ਸਮਾਂ ਇੱਕ ਕਲਾਸੀਫਾਇਰ ਨੂੰ ਦੁਬਾਰਾ ਸਿਖਲਾਈ ਦੇਣ ਵਿੱਚ ਲੱਗੇਗਾ। ਇਹ ਸੇਫਟੀ ਰਿਜਨਰ ਨੂੰ ਇਟਰੇਟਿਵ ਡਿਪਲੋਇਮੈਂਟ ਲਈ ਇੱਕ ਮੁੱਖ ਟੂਲ ਬਣਾਉਂਦਾ ਹੈ: ਜਦੋਂ ਅਸੀਂ ਉਤਪਾਦਨ ਵਿੱਚ ਨਵੇਂ ਮਾਡਲ ਤੈਨਾਤ ਕਰਦੇ ਹਾਂ, ਤਾਂ ਅਸੀਂ ਅਕਸਰ ਵਧੇਰੇ ਸਖ਼ਤ ਪਾਲਿਸੀਆਂ ਨਾਲ ਸ਼ੁਰੂਆਤ ਕਰਦੇ ਹਾਂ ਅਤੇ ਸੇਫਟੀ ਰਿਜਨਰ ਨੂੰ ਉਹਨਾਂ ਪਾਲਿਸੀਆਂ ਨੂੰ ਧਿਆਨ ਨਾਲ ਲਾਗੂ ਕਰਨ ਦੇ ਯੋਗ ਬਣਾਉਣ ਲਈ ਜਿੱਥੇ ਲੋੜ ਹੋਵੇ, ਮੁਕਾਬਲਤਨ ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ ਕੰਪਿਊਟ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ। ਫਿਰ ਅਸੀਂ ਆਪਣੀਆਂ ਪਾਲਿਸੀਆਂ ਨੂੰ ਐਡਜਸਟ ਕਰਦੇ ਹਾਂ ਜਿਵੇਂ-ਜਿਵੇਂ ਉਤਪਾਦਨ ਵਿੱਚ ਜੋਖਮਾਂ ਬਾਰੇ ਸਾਡੀ ਸਮਝ ਵਿੱਚ ਸੁਧਾਰ ਹੁੰਦਾ ਹੈ। ਸਾਡੇ ਕੁਝ ਹਾਲੀਆ ਲਾਂਚਾਂ ਵਿੱਚ, ਸੁਰੱਖਿਆ ਰੀਜ਼ਨਿੰਗ ਲਈ ਸਮਰਪਿਤ ਕੁੱਲ ਕੰਪਿਊਟ ਦਾ ਹਿੱਸਾ 16% ਤੱਕ ਉੱਚਾ ਰਿਹਾ ਹੈ।
ਸੇਫਟੀ ਰਿਜਨਰ ਸਾਡੇ ਸੁਰੱਖਿਆ ਸਟੈਕ ਦਾ ਇੱਕ ਮੁੱਖ ਹਿੱਸਾ ਬਣ ਗਿਆ ਹੈ। ਇਮੇਜ ਜਨਰੇਸ਼ਨ ਅਤੇ Sora 2 ਲਈ, ਇਹ ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਅਸੁਰੱਖਿਅਤ ਜਨਰੇਸ਼ਨਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਰੋਕਣ ਲਈ ਆਉਟਪੁੱਟ ਦੇ ਗਤੀਸ਼ੀਲ, ਕਦਮ-ਦਰ-ਕਦਮ ਮੁਲਾਂਕਣ ਕਰਦਾ ਹੈ। ਬਾਇਓਲੋਜੀ ਅਤੇ ਸਵੈ-ਨੁਕਸਾਨ ਵਰਗੇ ਡੋਮੇਨਾਂ ਵਿੱਚ, ਅਸੀਂ ਮੋਡਰਸ਼ਨ API ਵਿੱਚ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਮਾਡਲਾਂ ਵਾਂਗ ਛੋਟੇ, ਤੇਜ਼ ਅਤੇ ਹਾਈ-ਰੀਕਾਲ ਵਾਲੇ ਕਲਾਸੀਫਾਇਰ ਚਲਾਉਂਦੇ ਹਾਂ ਤਾਂ ਜੋ ਇਹ ਪਤਾ ਲਗਾਇਆ ਜਾ ਸਕੇ ਕਿ ਕਿਹੜੀ ਸਮੱਗਰੀ ਦਿਲਚਸਪੀ ਵਾਲੇ ਡੋਮੇਨ ਦੇ ਅੰਦਰ ਹੈ, ਅਤੇ ਫਿਰ ਉਸ ਸਮੱਗਰੀ ਦੀ ਸਮੀਖਿਆ ਕਰਨ ਲਈ ਸੇਫਟੀ ਰਿਜਨਰ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ। ਸੇਫਟੀ ਰਿਜਨਰ ਮਾਡਲ ਆਉਟਪੁੱਟਸ ਨੂੰ ਇੱਕ ਵਿਸਤ੍ਰਿਤ ਟੈਕਸੋਨੋਮੀ ਦੇ ਵਿਰੁੱਧ ਵਰਗੀਕ੍ਰਿਤ ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਇਹ ਨਿਰਧਾਰਤ ਕੀਤਾ ਜਾ ਸਕੇ ਕਿ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰਤੀਕਿਰਿਆ ਕਿਵੇਂ ਦੇਣੀ ਹੈ, ਜੋ ਕਿ GPT‑5 ਅਤੇ ChatGPT ਏਜੰਟ ਵਰਗੇ ਸਿਸਟਮਾਂ ਵਿੱਚ ਸਾਡੇ ਬਹੁ-ਪੱਧਰੀ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦਾ ਹਿੱਸਾ ਬਣਦਾ ਹੈ। ਅਤੇ ਹੁਣ, gpt-oss-safeguard ਮਾਡਲ ਇਸੇ ਪਹੁੰਚ ਨੂੰ ਹਰ ਕਿਸੇ ਲਈ ਉਪਲਬਧ ਕਰਾਉਂਦੇ ਹਨ।
ਅਸੀਂ ਅੰਦਰੂਨੀ ਅਤੇ ਬਾਹਰੀ ਮੁਲਾਂਕਣ ਸੈੱਟਾਂ ਦੋਵਾਂ 'ਤੇ gpt-oss-safeguard ਮਾਡਲਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ।
ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਅਸੀਂ ਇਨਫਰੈਂਸ ਦੇ ਸਮੇਂ gpt-oss-safeguard ਨੂੰ ਇੱਕੋ ਸਮੇਂ ਕਈ ਪਾਲਿਸੀਆਂ ਪ੍ਰਦਾਨ ਕੀਤੀਆਂ। ਹਰੇਕ ਟੈਸਟ ਇਨਪੁਟ ਲਈ, ਅਸੀਂ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਾਂ ਕਿ ਕੀ gpt-oss-safeguard ਸਾਰੀਆਂ ਸ਼ਾਮਲ ਪਾਲਿਸੀਆਂ ਦੇ ਅਧੀਨ ਟੈਕਸਟ ਦਾ ਸਹੀ ਢੰਗ ਨਾਲ ਵਰਗੀਕਰਨ ਕਰਦਾ ਹੈ। ਇਹ ਇੱਕ ਚੁਣੌਤੀਪੂਰਨ ਕੰਮ ਹੈ—ਮਾਡਲ ਨੂੰ ਉਦੋਂ ਹੀ ਸਟੀਕ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਜੇਕਰ ਇਹ ਸਾਰੀਆਂ ਸ਼ਾਮਲ ਪਾਲਿਸੀਆਂ ਲਈ ਗੋਲਡਨ ਸੈੱਟ ਲੇਬਲਾਂ ਨਾਲ ਬਿਲਕੁਲ ਮੇਲ ਖਾਂਦਾ ਹੈ।
ਸਾਡੇ gpt-oss-safeguard ਮਾਡਲ ਅਤੇ ਅੰਦਰੂਨੀ ਸੇਫਟੀ ਰਿਜਨਰ ਬਹੁ-ਪਾਲਿਸੀ ਸਟੀਕਤਾ 'ਤੇ gpt-5-thinking ਅਤੇ gpt-oss ਓਪਨ ਮਾਡਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦੇ ਹਨ। gpt-oss-safeguard ਮਾਡਲਾਂ ਦਾ gpt-5-thinking ਨੂੰ ਪਛਾੜਨਾ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਹੈਰਾਨੀਜਨਕ ਹੈ, ਕਿਉਂਕਿ ਪਹਿਲਾਂ ਵਾਲੇ ਮਾਡਲਾਂ ਦਾ ਆਕਾਰ ਛੋਟਾ ਹੈ।
ਅਸੀਂ ਇਹਨਾਂ ਮਾਡਲਾਂ ਦਾ ਹੋਰ ਮੁਲਾਂਕਣ ਮੋਡਰੇਸ਼ਨ ਡੇਟਾਸੈਟ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) 'ਤੇ ਕੀਤਾ ਜੋ ਅਸੀਂ ਆਪਣੇ 2022 ਦੇ ਖੋਜ ਪੱਤਰ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ ਜਾਰੀ ਕੀਤਾ ਸੀ, ਅਤੇ ToxicChat(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) 'ਤੇ ਕੀਤਾ, ਜੋ ਕਿ ਇੱਕ ਓਪਨ-ਸੋਰਸ ਚੈਟਬੋਟ ਲਈ ਵਰਤੋਂਕਾਰ ਦੀਆਂ ਪੁੱਛਗਿੱਛਾਂ 'ਤੇ ਅਧਾਰਤ ਇੱਕ ਜਨਤਕ ਬੈਂਚਮਾਰਕ ਹੈ।
2022 ਦੇ ਮੋਡਰੇਸ਼ਨ ਮੁਲਾਂਕਣ ਸੈੱਟ 'ਤੇ, ਅਸੀਂ ਆਪਣੀਆਂ ਅੰਦਰੂਨੀ ਸੁਰੱਖਿਆ ਪਾਲਿਸੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਮੁਲਾਂਕਣ ਕੀਤਾ (ਬਾਅਦ ਦੀਆਂ ਤਬਦੀਲੀਆਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਣ ਲਈ ਇੱਕ ਪਾਲਿਸੀ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਇਆ)। gpt-oss-safeguard ਨੇ ਟੈਸਟ ਕੀਤੇ ਗਏ ਹੋਰ ਸਾਰੇ ਮਾਡਲਾਂ ਨੂੰ ਥੋੜ੍ਹਾ ਜਿਹਾ ਪਛਾੜ ਦਿੱਤਾ, ਜਿਸ ਵਿੱਚ ਸਾਡਾ ਅੰਦਰੂਨੀ ਸੇਫਟੀ ਰਿਜਨਰ ਅਤੇ gpt-5-thinking ਸ਼ਾਮਲ ਹਨ, ਹਾਲਾਂਕਿ ਸੇਫਟੀ ਰਿਜਨਰ ਅਤੇ gpt-oss-safeguard ਵਿਚਕਾਰ ਇਹ ਅੰਤਰ ਅੰਕੜਾਤਮਕ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਨਹੀਂ ਹੈ।
ToxicChat ਲਈ, ਅਸੀਂ ਆਪਣੀਆਂ ਕੁਝ ਅੰਦਰੂਨੀ ਪਾਲਿਸੀਆਂ ਤੋਂ ਅਨੁਕੂਲਿਤ ਇੱਕ ਛੋਟੇ ਹੱਥ-ਲਿਖਤ ਪ੍ਰੌੰਪਟ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਮੁਲਾਂਕਣ ਕੀਤਾ। ਸਾਡੇ ਅੰਦਰੂਨੀ ਸੇਫਟੀ ਰਿਜਨਰ ਨੇ ਮੁੜ gpt-5-thinking ਨੂੰ ਪਛਾੜ ਦਿੱਤਾ, ਜਦੋਂ ਕਿ gpt-5-thinking ਅਤੇ ਸੇਫਟੀ ਰਿਜਨਰ ਦੋਵੇਂ ਮਾਮੂਲੀ ਤੌਰ 'ਤੇ gpt-oss-safeguard-120b ਅਤੇ gpt-oss-safeguard-20b ਤੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦੇ ਹਨ। ਸਾਨੂੰ ਉਮੀਦ ਹੈ ਕਿ gpt-oss-safeguard ਦਾ ਮੁਕਾਬਲਤਨ ਛੋਟਾ ਆਕਾਰ ਇਸਨੂੰ ਅਜੇ ਵੀ ਇਸ ਕਿਸਮ ਦੇ ਕੰਮ ਲਈ ਤਰਜੀਹੀ ਬਣਾਉਂਦਾ ਹੈ।
gpt-oss-safeguard ਦੀਆਂ ਦੋ ਖਾਸ ਸੀਮਾਵਾਂ ਹਨ। ਪਹਿਲਾਂ, ਅਸੀਂ ਦੇਖਿਆ ਹੈ ਕਿ ਹਜ਼ਾਰਾਂ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਲੇਬਲ ਕੀਤੇ ਨਮੂਨਿਆਂ 'ਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਕਲਾਸੀਫਾਇਰ ਅਜੇ ਵੀ ਸਮੱਗਰੀ ਦਾ ਵਰਗੀਕਰਨ ਕਰਨ ਵਿੱਚ gpt-oss-safeguard ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰ ਸਕਦੇ ਹਨ ਜਦੋਂ ਇਹ ਸਿੱਧੇ ਪਾਲਿਸੀ ਤੋਂ ਰੀਜ਼ਨਿੰਗ ਕਰ ਰਿਹਾ ਹੋਵੇ। ਵਧੇਰੇ ਗੁੰਝਲਦਾਰ ਜੋਖਮਾਂ 'ਤੇ ਉੱਚ ਪ੍ਰਦਰਸ਼ਨ ਲਈ ਇੱਕ ਸਮਰਪਿਤ ਕਲਾਸੀਫਾਇਰ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਸਮਾਂ ਕੱਢਣਾ ਤਰਜੀਹੀ ਹੋ ਸਕਦਾ ਹੈ।
ਦੂਜਾ, gpt-oss-safeguard ਸਮਾਂ ਅਤੇ ਕੰਪਿਊਟ-ਸਹਿਤ ਹੋ ਸਕਦਾ ਹੈ, ਜਿਸ ਕਾਰਨ ਇਸਨੂੰ ਸਾਰੇ ਪਲੇਟਫਾਰਮ ਦੀ ਸਮੱਗਰੀ ਵਿੱਚ ਫੈਲਾਉਣਾ ਚੁਣੌਤੀਪੂਰਨ ਹੋ ਜਾਂਦਾ ਹੈ। ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ, ਅਸੀਂ ਸੇਫਟੀ ਰਿਜਨਰ ਦੇ ਨਾਲ ਇਸ ਨੂੰ ਕਈ ਤਰੀਕਿਆਂ ਨਾਲ ਸੰਭਾਲਦੇ ਹਾਂ: (1) ਅਸੀਂ ਇਹ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਛੋਟੇ ਅਤੇ ਤੇਜ਼ ਕਲਾਸੀਫਾਇਰ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ ਕਿ ਕਿਹੜੀ ਸਮੱਗਰੀ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ ਹੈ ਅਤੇ (2) ਕੁਝ ਸਥਿਤੀਆਂ ਵਿੱਚ, ਅਸੀਂ ਘੱਟ-ਦੇਰੀ ਵਾਲਾ ਵਰਤੋਂਕਾਰ ਅਨੁਭਵ ਪ੍ਰਦਾਨ ਕਰਨ ਲਈ ਸੇਫਟੀ ਰਿਜਨਰ ਨੂੰ ਅਸਿੰਕ੍ਰੋਨਸ ਤਰੀਕੇ ਨਾਲ ਵਰਤਦੇ ਹਾਂ ਜਦੋਂ ਕਿ ਅਸੁਰੱਖਿਅਤ ਸਮੱਗਰੀ ਦਾ ਪਤਾ ਲੱਗਣ 'ਤੇ ਦਖਲ ਦੇਣ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਬਣਾਈ ਰੱਖਦੇ ਹਾਂ।
gpt-oss-safeguard, ਭਾਈਚਾਰੇ ਦੇ ਨਾਲ ਮਿਲ ਕੇ ਬਣਾਇਆ ਗਿਆ OpenAI ਦਾ ਓਪਨ ਸੇਫਟੀ ਮਾਡਲਾਂ ਦਾ ਪਹਿਲਾ ਸੈੱਟ ਹੈ। ਅਸੀਂ ਸ਼ੁਰੂਆਤੀ ਟੈਸਟਿੰਗ ਦੇ ਹਿੱਸੇ ਵਜੋਂ SafetyKit, ROOST, Tomoro, ਅਤੇ Discord 'ਤੇ ਭਰੋਸਾ ਅਤੇ ਸੁਰੱਖਿਆ ਮਾਹਰਾਂ ਨਾਲ ਮਿਲ ਕੇ gpt-oss-safeguard 'ਤੇ ਦੁਹਰਾਓ ਕੀਤਾ ਹੈ। ROOST ਦੇ CTO ਵਿਨੈ ਰਾਓ ਕਹਿੰਦੇ ਹਨ, "gpt-oss-safeguard ਇੱਕ 'ਆਪਣੀਆਂ ਖੁਦ ਦੀਆਂ ਪਾਲਿਸੀਆਂ ਅਤੇ ਨੁਕਸਾਨ ਦੀਆਂ ਪਰਿਭਾਸ਼ਾਵਾਂ ਲਿਆਓ' ਡਿਜ਼ਾਈਨ ਵਾਲਾ ਪਹਿਲਾ ਓਪਨ ਸੋਰਸ ਰੀਜ਼ਨਿੰਗ ਮਾਡਲ ਹੈ। ਸੰਸਥਾਵਾਂ ਮਹੱਤਵਪੂਰਨ ਸੁਰੱਖਿਆ ਤਕਨਾਲੋਜੀਆਂ ਦਾ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਅਧਿਐਨ ਕਰਨ, ਸੋਧਣ ਅਤੇ ਵਰਤੋਂ ਕਰਨ ਅਤੇ ਨਵੀਨਤਾ ਲਿਆਉਣ ਦੇ ਯੋਗ ਹੋਣ ਦੀਆਂ ਹੱਕਦਾਰ ਹਨ। ਸਾਡੀ ਟੈਸਟਿੰਗ ਵਿੱਚ, ਇਹ ਵੱਖ-ਵੱਖ ਪਾਲਿਸੀਆਂ ਨੂੰ ਸਮਝਣ, ਆਪਣੀ ਰੀਜ਼ਨਿੰਗ ਦੀ ਵਿਆਖਿਆ ਕਰਨ, ਅਤੇ ਪਾਲਿਸੀਆਂ ਨੂੰ ਲਾਗੂ ਕਰਨ ਵਿੱਚ ਸੂਖਮਤਾ ਦਿਖਾਉਣ ਵਿੱਚ ਨਿਪੁੰਨ ਸੀ, ਜਿਸ ਬਾਰੇ ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ ਇਹ ਨਿਰਮਾਤਾਵਾਂ ਅਤੇ ਸੁਰੱਖਿਆ ਟੀਮਾਂ ਲਈ ਲਾਭਦਾਇਕ ਹੋਵੇਗਾ।"
ਅਸੀਂ ਓਪਨ ਸੇਫਟੀ ਟੂਲਿੰਗ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ ਲਈ ਭਾਈਚਾਰੇ ਨਾਲ ਮਿਲ ਕੇ ਦੁਹਰਾਓ ਕਰਨਾ ਜਾਰੀ ਰੱਖਾਂਗੇ, ਜਿਸ ਵਿੱਚ ROOST ਮਾਡਲ ਕਮਿਊਨਿਟੀ (RMC) ਵੀ ਸ਼ਾਮਲ ਹੈ। RMC ਓਪਨ ਸੋਰਸ AI ਮਾਡਲਾਂ ਨੂੰ ਸੁਰੱਖਿਆ ਵਰਕਫਲੋਜ਼ ਵਿੱਚ ਲਾਗੂ ਕਰਨ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਅਭਿਆਸਾਂ ਨੂੰ ਸਾਂਝਾ ਕਰਨ ਵਾਸਤੇ ਸੁਰੱਖਿਆ ਪ੍ਰੈਕਟੀਸ਼ਨਰਾਂ ਅਤੇ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਇਕੱਠੇ ਲਿਆਉਂਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਮੁਲਾਂਕਣ ਦੇ ਨਤੀਜੇ ਅਤੇ ਮਾਡਲ ਫੀਡਬੈਕ ਸ਼ਾਮਲ ਹਨ। ਇਸ ਭਾਈਵਾਲੀ ਬਾਰੇ ਹੋਰ ਜਾਣਨ ਅਤੇ ਇਸ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋਣ ਦੇ ਤਰੀਕੇ ਬਾਰੇ ਜਾਣਨ ਲਈ RMC GitHub ਰਿਪੋਜ਼ਟਰੀ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) 'ਤੇ ਜਾਓ।
ਇਹਨਾਂ ਮਾਡਲਾਂ ਨਾਲ ਨਿਰਮਾਣ ਸ਼ੁਰੂ ਕਰਨ ਲਈ, ਇਹਨਾਂ ਨੂੰ Hugging Face(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਤੋਂ ਡਾਊਨਲੋਡ ਕਰੋ।

