ਲੰਬੇ-ਸਮੇਂ ਵਾਲੇ ਮਾਡਲਾਂ ਦੇ ਦੌਰ ਵਿੱਚ ਸੁਰੱਖਿਆ ਅਤੇ ਸੰਰੇਖਣ
ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਮਾਡਲ ਦੀ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਨੇ ਸਾਨੂੰ ਸੁਰੱਖਿਆ ਬਾਰੇ ਕੀ ਸਿਖਾਇਆ।
ਸਾਰ
ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਮਾਡਲ ਮੁਸ਼ਕਲ ਅਤੇ ਖੁੱਲ੍ਹੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰ ਸਕਦੇ ਹਨ, ਪਰ ਉਹਨਾਂ ਦੀ ਨਿਰੰਤਰਤਾ ਉਹਨਾਂ ਨੂੰ ਅਣਚਾਹੀਆਂ ਕਾਰਵਾਈਆਂ ਕਰਨ ਦੇ ਵਧੇਰੇ ਮੌਕੇ ਵੀ ਦਿੰਦੀ ਹੈ।
ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੇ ਕੰਮਾਂ ਲਈ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਮਾਡਲ ਦੀ ਸੀਮਤ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਦੌਰਾਨ, ਅਸੀਂ ਅਜਿਹੀਆਂ ਨਵੀਆਂ ਅਸਫਲਤਾਵਾਂ ਦੇਖੀਆਂ ਜੋ ਸਾਡੇ ਮੌਜੂਦਾ ਡਿਪਲਾਇਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਦੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਦਰਜ ਨਹੀਂ ਸਨ, ਅਤੇ ਅਸੀਂ ਇਸਦੀ ਪਹੁੰਚ ਨੂੰ ਰੋਕ ਦਿੱਤਾ। ਫਿਰ ਅਸੀਂ ਇਹਨਾਂ ਅਸਫਲਤਾਵਾਂ ਤੋਂ ਮਿਲੇ ਸਬਕਾਂ ਦੀ ਵਰਤੋਂ ਨਵੇਂ ਮੁਲਾਂਕਣ ਬਣਾਉਣ, ਲੰਬੇ-ਸਮੇਂ ਦੇ ਤਾਲਮੇਲ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ, ਟ੍ਰੈਜੈਕਟਰੀ-ਪੱਧਰ ਦੀ ਨਿਗਰਾਨੀ ਜੋੜਨ, ਅਤੇ ਸੀਮਤ ਪਹੁੰਚ ਨੂੰ ਬਹਾਲ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ ਵਧੇਰੇ ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਨਿਯੰਤਰਣ ਦੇਣ ਲਈ ਕੀਤੀ।
ਇਸ ਤਜਰਬੇ ਨੇ ਨਿਰੰਤਰ ਡਿਪਲਾਇਮੈਂਟ ਦੀ ਮਹੱਤਤਾ ਨੂੰ ਹੋਰ ਮਜ਼ਬੂਤ ਕੀਤਾ। ਕੋਈ ਵੀ ਨਿਰਧਾਰਿਤ ਮੁਲਾਂਕਣ ਪ੍ਰਣਾਲੀ ਹਰ ਵਿਵਹਾਰ ਦਾ ਪਹਿਲਾਂ ਤੋਂ ਅਨੁਮਾਨ ਨਹੀਂ ਲਗਾ ਸਕਦੀ, ਇਸ ਲਈ ਡਿਪਲਾਇਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਦੀ ਜਾਂਚ ਦੇ ਨਾਲ-ਨਾਲ ਬਾਰੀਕੀ ਨਾਲ ਨਿਗਰਾਨੀ, ਦਖਲ ਦੇ ਸਕਣ ਵਾਲੇ ਸੁਰੱਖਿਆ ਉਪਾਅ, ਅਤੇ ਲੋੜ ਪੈਣ 'ਤੇ ਰੋਕਣ ਜਾਂ ਵਾਪਸ ਰੋਲ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਹੋਣਾ ਜ਼ਰੂਰੀ ਹੈ।
ਜਿਹੜੇ ਮਾਡਲ ਲੰਬੇ ਸਮੇਂ ਲਈ ਆਪਣੇ ਆਪ ਕੰਮ ਕਰ ਸਕਦੇ ਹਨ, ਉਹ ਔਖੀਆਂ, ਖੁੱਲ੍ਹੇ ਅੰਤ ਵਾਲੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰ ਸਕਦੇ ਹਨ। ਪਰ ਇਹੋ ਡਟੇ ਰਹਿਣ ਦੀ ਸਮਰੱਥਾ, ਉਨ੍ਹਾਂ ਨੂੰ ਲਾਭਦਾਇਕ ਬਣਾਉਂਦੀ ਹੈ, ਉਨ੍ਹਾਂ ਨੂੰ ਅਣਚਾਹੀਆਂ ਕਾਰਵਾਈਆਂ ਕਰਨ ਦੇ ਹੋਰ ਮੌਕੇ ਵੀ ਦਿੰਦੀ ਹੈ—ਅਤੇ ਇਹ ਅਜਿਹੇ ਤਰੀਕਿਆਂ ਨਾਲ ਹੋ ਸਕਦਾ ਹੈ ਜੋ ਘੱਟ ਸਮੇਂ ਵਾਲੇ ਮਾਡਲਾਂ ਲਈ ਬਣਾਏ ਗਏ ਮੁਲਾਂਕਣਾਂ ਤੋਂ ਖੁੰਝ ਸਕਦੇ ਹਨ।
ਲਗਭਗ ਦੋ ਮਹੀਨੇ ਪਹਿਲਾਂ ਅਸੀਂ ਐਲਾਨ ਕੀਤਾ ਸੀ ਕਿ ਇੱਕ ਅੰਦਰੂਨੀ ਸਧਾਰਣ-ਉਦੇਸ਼ ਮਾਡਲ ਨੇ Erdős unit distance conjecture ਨੂੰ ਗਲਤ ਸਾਬਤ ਕੀਤਾ। ਇਹ ਮਾਡਲ ਬਹੁਤ ਲੰਬੇ ਸਮੇਂ ਲਈ ਆਪਣੇ ਆਪ ਕੰਮ ਕਰਨ ਵਾਸਤੇ ਬਣਾਇਆ ਗਿਆ ਸੀ। ਸੀਮਿਤ, ਨਿਗਰਾਨੀ ਹੇਠ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਦੌਰਾਨ, ਅਸੀਂ ਅਜਿਹਾ ਅਣਚਾਹਿਆ ਵਿਹਾਰ ਦੇਖਿਆ ਜੋ ਸਾਡੇ ਮੌਜੂਦਾ ਤਾਇਨਾਤੀ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਨਹੀਂ ਆਇਆ ਸੀ। ਕਿਉਂਕਿ ਇਹ ਵਰਤੋਂ ਸੀਮਤ ਅਤੇ ਨਿਗਰਾਨੀ ਹੇਠ ਸੀ, ਅਸੀਂ ਇਹਨਾਂ ਸਮੱਸਿਆਵਾਂ ਦੀ ਪਛਾਣ ਕਰਨ, ਕੁਝ ਸਮੇਂ ਲਈ ਪਹੁੰਚ ਰੋਕਣ, ਆਪਣੇ ਦੇਖੇ ਗਏ ਵਿਹਾਰ 'ਤੇ ਅਧਾਰਿਤ ਨਵੇਂ ਮੁਲਾਂਕਣ ਤਿਆਰ ਕਰਨ, ਮਾਡਲ ਅਤੇ ਇਸਦੇ ਸੁਰੱਖਿਆ ਪ੍ਰਬੰਧਾਂ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਨ, ਅਤੇ ਫਿਰ ਲਗਾਤਾਰ ਨਿਗਰਾਨੀ ਹੇਠ ਵਰਤੋਂ ਨੂੰ ਬਹਾਲ ਕਰਨ ਵਿੱਚ ਸਫਲ ਰਹੇ।
ਜਿਨ੍ਹਾਂ ਹਾਲਾਤਾਂ ਵਿੱਚ ਅਸੀਂ ਮਾਡਲਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਾਂ, ਉਹ ਅਸਲ ਵਰਤੋਂ ਦੌਰਾਨ ਸਾਹਮਣੇ ਆਉਣ ਵਾਲੀਆਂ ਸਥਿਤੀਆਂ ਨਾਲ ਕਦੇ ਵੀ ਪੂਰੀ ਤਰ੍ਹਾਂ ਮੇਲ ਨਹੀਂ ਖਾ ਸਕਦੇ। ਇਹੋ ਕਾਰਨ ਹੈ ਕਿ ਤਾਇਨਾਤੀ ਤੋਂ ਪਹਿਲਾਂ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਦੇ ਨਾਲ-ਨਾਲ ਸੀਮਿਤ, ਨਿਗਰਾਨੀ ਹੇਠ ਤਾਇਨਾਤੀ ਅਤੇ ਸਮੱਸਿਆਵਾਂ ਆਉਣ 'ਤੇ ਦਖਲ ਦੇਣ, ਕੰਮ ਰੋਕਣ ਜਾਂ ਪੁਰਾਣੀ ਸਥਿਤੀ ਵਿੱਚ ਵਾਪਸ ਮੋੜਨ ਦੀ ਸਮਰੱਥਾ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ। ਤਾਇਨਾਤੀ ਤੋਂ ਮਿਲੀ ਸਿੱਖਿਆ, ਪਹੁੰਚ ਦਾ ਵਿਸਥਾਰ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਹੋਰ ਮਜ਼ਬੂਤ ਮੁਲਾਂਕਣਾਂ ਅਤੇ ਸੁਰੱਖਿਆ ਪ੍ਰਬੰਧਾਂ ਦਾ ਹਿੱਸਾ ਬਣ ਸਕਦੀ ਹੈ।
ਅਗਲੇ ਭਾਗਾਂ ਵਿੱਚ ਅਸੀਂ ਦੇਖੀਆਂ ਗਈਆਂ ਗੱਲਾਂ, ਸਮੱਸਿਆਵਾਂ ਨਾਲ ਨਿਪਟਣ ਦੇ ਤਰੀਕੇ, ਅਤੇ ਇਹ ਤਜਰਬਾ ਭਵਿੱਖ ਦੀਆਂ ਰਿਲੀਜ਼ਾਂ ਨੂੰ ਕਿਵੇਂ ਆਕਾਰ ਦੇਵੇਗਾ, ਇਸਦੇ ਠੋਸ ਉਦਾਹਰਨਾਂ ਸਾਂਝੀਆਂ ਕਰਦੇ ਹਾਂ।
ਨਵਾਂ ਮਾਡਲ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਵਾਰ-ਵਾਰ ਕੋਸ਼ਿਸ਼ਾਂ ਕਰਕੇ ਕਿਸੇ ਉਦੇਸ਼ ਵੱਲ ਕੰਮ ਜਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ। ਇਹੀ ਡਟੇ ਰਹਿਣ ਦੀ ਸਮਰੱਥਾ ਇਸਨੂੰ ਆਪਣੇ ਵਾਤਾਵਰਣ ਦੀਆਂ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਅਤੇ ਉਹਨਾਂ ਦਾ ਫਾਇਦਾ ਉਠਾਉਣ ਵੱਲ ਲੈ ਕੇ ਜਾ ਸਕਦੀ ਹੈ। ਪਿਛਲੇ ਮਾਡਲ sandboxing ਜਾਂ ਵਾਤਾਵਰਣਕ ਪਾਬੰਦੀਆਂ ਮਿਲਣ 'ਤੇ ਆਮ ਤੌਰ 'ਤੇ ਰੁਕ ਜਾਂਦੇ ਅਤੇ ਵਰਤੋਂਕਾਰ ਕੋਲ ਮੁੜ ਆ ਜਾਂਦੇ ਸਨ। ਇਹ ਮਾਡਲ ਅਕਸਰ ਕੋਸ਼ਿਸ਼ ਕਰਦਾ ਰਿਹਾ, ਜਿਸ ਵਿੱਚ ਆਪਣੇ sandbox ਤੋਂ ਬਾਹਰ ਕੰਮ ਕਰਨ ਦੇ ਰਸਤੇ ਲੱਭਣਾ ਵੀ ਸ਼ਾਮਲ ਸੀ।
ਇਸਦੀ ਇੱਕ ਉਦਾਹਰਨ NanoGPT ਸਪੀਡਰਨ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) 'ਤੇ ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਦੌਰਾਨ ਆਈ, ਜੋ ਘੱਟ ਤੋਂ ਘੱਟ ਕਦਮਾਂ ਵਿੱਚ ਇੱਕ ਛੋਟਾ ਭਾਸ਼ਾ ਮਾਡਲ ਟ੍ਰੇਨ ਕਰਨ ਲਈ ਜਨਤਕ ਬੈਂਚਮਾਰਕ ਹੈ। ਸਾਡੇ ਮਾਡਲ ਨੇ PowerCool ਨਾਮ ਦਾ power-law learning-rate cooldown ਬਣਾਇਆ, ਜਿਸ ਨਾਲ ਵੱਡਾ ਸੁਧਾਰ ਆਇਆ। ਮਾਡਲ ਨੂੰ ਆਪਣੇ ਨਤੀਜੇ ਸਿਰਫ਼ Slack 'ਤੇ ਪੋਸਟ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ ਸੀ, ਪਰ NanoGPT ਨਿਰਦੇਸ਼ ਨਤੀਜੇ GitHub 'ਤੇ PR ਵਜੋਂ ਪੋਸਟ ਕਰਨ ਨੂੰ ਕਹਿੰਦੇ ਹਨ ਅਤੇ ਮਾਡਲ ਨੇ ਬਾਅਦ ਵਾਲੇ ਨਿਰਦੇਸ਼ ਮੰਨਦਿਆਂ ਜਨਤਕ GitHub ਰਿਪੋਜ਼ਟਰੀ 'ਤੇ PR #287 ਖੋਲ੍ਹਿਆ। ਮਾਡਲ ਨੇ ਬਾਹਰੀ ਪਹੁੰਚ ਰੋਕਣ ਲਈ ਬਣਾਈਆਂ ਗਈਆਂ sandbox ਪਾਬੰਦੀਆਂ ਨੂੰ ਬਾਈਪਾਸ ਕੀਤਾ ਅਤੇ GitHub 'ਤੇ ਅੱਪਲੋਡ ਕਰਨ ਦੀ ਪ੍ਰਕਿਰਿਆ ਜਾਰੀ ਰੱਖੀ। PR ਬਣਾਉਣ ਲਈ sandbox ਵਿੱਚ ਕਮਜ਼ੋਰੀ ਲੱਭਣ ਵਿੱਚ ਸਾਡੇ ਮਾਡਲ ਨੂੰ ਇੱਕ ਘੰਟਾ ਲੱਗ ਗਿਆ; ਪੁਰਾਣੇ ਮਾਡਲ ਘੱਟ ਡਟਣ ਵਾਲੇ ਸਨ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਵਿੱਚ ਅਸਫਲ ਰਹੇ, ਜਿਸ ਕਰਕੇ ਉਹਨਾਂ ਨੇ PR ਵਾਲਾ ਹਿੱਸਾ ਛੱਡ ਦਿੱਤਾ।1
AI ਸਹਾਇਕਾਂ ਲਈ ਕਈ ਸੁਰੱਖਿਆ ਨਿਯੰਤਰਣ ਵੱਖ-ਵੱਖ ਕਾਰਵਾਈਆਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖ ਕੇ ਬਣਾਏ ਜਾਂਦੇ ਹਨ। ਜੇਕਰ ਕੋਈ ਕਾਰਵਾਈ ਮਨਾਹੀ ਵਾਲੀ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਇਸਨੂੰ ਰੋਕ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਜੇਕਰ ਇਹ ਸੰਵੇਦਨਸ਼ੀਲ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਸਿਸਟਮ ਵਰਤੋਂਕਾਰ ਤੋਂ ਸਪਸ਼ਟ ਮਨਜ਼ੂਰੀ ਮੰਗਦਾ ਹੈ। ਪਰ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਮਾਡਲ, ਜਿਨ੍ਹਾਂ ਦੀਆਂ ਕਾਰਵਾਈਆਂ ਘੰਟਿਆਂ, ਦਿਨਾਂ ਜਾਂ ਹਫ਼ਤਿਆਂ ਤੱਕ ਆਪਣੇ ਆਪ ਚੱਲ ਸਕਦੀਆਂ ਹਨ, ਇਸ ਬਣਤਰ ਨੂੰ ਚੁਣੌਤੀ ਦਿੰਦੇ ਹਨ: ਸਮੁੱਚੇ ਮਾਰਗ ਦੇ ਇਰਾਦੇ ਨੂੰ ਸਮਝਣ ਲਈ ਇਕੱਲੀ ਕਾਰਵਾਈ ਦੀ ਨਿਗਰਾਨੀ ਕਾਫ਼ੀ ਨਹੀਂ ਰਹਿ ਜਾਂਦੀ ਹੈ।
ਉਦਾਹਰਨ ਲਈ, ਇੱਕ ਅਜਿਹੀ ਸਥਿਤੀ ਵਿੱਚ ਜਿੱਥੇ ਮਾਡਲ ਨੂੰ ਸਮੱਸਿਆ ਹੱਲ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ ਸੀ, ਮਾਡਲ ਨੇ ਵੇਖਿਆ ਕਿ ਹੋਰ ਸਿਸਟਮਾਂ ਦੀਆਂ ਸਫਲ ਪਰ ਨਿੱਜੀ ਸਬਮਿਸ਼ਨਾਂ ਸਨ ਅਤੇ ਉਸਨੇ ਮੁਲਾਂਕਣ ਬੈਕਐਂਡ ਤੋਂ ਉਹ ਹੱਲ ਮੁੜ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। ਜਦੋਂ ਇੱਕ ਸਕੈਨਰ ਦੁਆਰਾ ਪ੍ਰਮਾਣਿਕਤਾ ਟੋਕਨ ਦੀ ਪਛਾਣ ਕੀਤੇ ਜਾਣ ਕਰਕੇ ਇਸਦੀ ਪਹਿਲੀ ਕੋਸ਼ਿਸ਼ ਰੋਕ ਦਿੱਤੀ ਗਈ, ਤਾਂ ਮਾਡਲ ਨੇ ਟੋਕਨ ਨੂੰ ਦੋ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡਿਆ, ਉਨ੍ਹਾਂ ਨੂੰ ਧੁੰਦਲਾ ਕੀਤਾ, ਅਤੇ ਫਿਰ ਰਨਟਾਈਮ 'ਤੇ ਕ੍ਰੈਡੇਂਸ਼ੀਅਲ ਮੁੜ ਬਣਾਇਆ, ਤਾਂ ਜੋ ਪੂਰਾ ਟੋਕਨ ਕਦੇ ਵੀ ਇੱਕ ਲਗਾਤਾਰ ਸਟਰਿੰਗ ਵਜੋਂ ਨਾ ਆਵੇ। ਮਾਡਲ ਨੇ ਵਰਤੋਂਕਾਰ ਲਈ ਟਿੱਪਣੀਆਂ ਅਤੇ ਆਪਣੀਆਂ ਰੀਜ਼ਨਿੰਗ ਟ੍ਰੇਸਾਂ ਦੋਵਾਂ ਵਿੱਚ ਇਹ ਸਪੱਸ਼ਟ ਕੀਤਾ ਸੀ ਕਿ ਉਹ ਸਕੈਨਰ ਤੋਂ ਬਚਣ ਲਈ ਇਹ ਕਦਮ ਚੁੱਕ ਰਿਹਾ ਸੀ।
ਇਹ ਉਦਾਹਰਨ ਦਿਖਾਉਂਦੀ ਹੈ ਕਿ ਹਰ ਕਦਮ ਆਪਣੇ ਆਪ ਵਿੱਚ ਠੀਕ ਲੱਗ ਸਕਦਾ ਹੈ, ਜਦਕਿ ਕ੍ਰਮ ਅਜਿਹਾ ਨਤੀਜਾ ਦੇ ਸਕਦਾ ਹੈ ਜਿਸਦੀ ਮਨਜ਼ੂਰੀ ਨਾ ਮਿਲੇ। ਇਹ ਇਹ ਵੀ ਦਿਖਾਉਂਦੀ ਹੈ ਕਿ ਲੰਬੇ ਟਾਈਮ ਹੋਰਾਇਜ਼ਨ 'ਤੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਕੰਮ ਕਰਨ ਵਾਲਾ ਮਾਡਲ ਮਨਜ਼ੂਰੀ ਸਿਸਟਮ ਦੀਆਂ ਅੰਨ੍ਹੀਆਂ ਥਾਵਾਂ ਸਿੱਖ ਸਕਦਾ ਹੈ ਅਤੇ ਆਪਣੇ ਟੀਚੇ ਹਾਸਲ ਕਰਨ ਲਈ ਉਨ੍ਹਾਂ ਤੋਂ ਬਚ ਕੇ ਨਿਕਲ ਸਕਦਾ ਹੈ। ਲੰਬੇ ਟਾਈਮ ਹੋਰਾਇਜ਼ਨ ਦੀ ਸੁਰੱਖਿਆ ਲਈ ਸਿਰਫ਼ ਇਹ ਪੁੱਛਣਾ ਹੀ ਕਾਫ਼ੀ ਨਹੀਂ ਕਿ “ਕੀ ਇਹ ਕਾਰਵਾਈ ਮਨਜ਼ੂਰ ਹੈ?” ਸਗੋਂ ਇਹ ਵੀ ਕਿ “ਕਾਰਵਾਈਆਂ ਦਾ ਇਹ ਕ੍ਰਮ ਕਿਹੜੇ ਨਤੀਜੇ ਵੱਲ ਵੱਧ ਰਿਹਾ ਹੈ?”
ਅਜਿਹੀਆਂ ਘਟਨਾਵਾਂ ਕਾਰਨ ਅਸੀਂ ਨਵੇਂ ਮਾਡਲ ਦੀ ਅੰਦਰੂਨੀ ਤਾਇਨਾਤੀ ਨੂੰ ਰੋਕ ਦਿੱਤਾ। ਅਸੀਂ ਬਹੁ-ਪਰਤੀ ਰੱਖਿਆ ਅਤੇ ਟ੍ਰੈਜੈਕਟਰੀ-ਪੱਧਰੀ ਨਿਗਰਾਨੀ ਦੇ ਆਧਾਰ 'ਤੇ ਸੁਰੱਖਿਆ ਪ੍ਰਣਾਲੀ ਦਾ ਮੁੜ ਨਿਰਮਾਣ ਕੀਤਾ।
- ਘਟਨਾਵਾਂ ਤੋਂ ਬਣੇ ਮੁਲਾਂਕਣ। ਮੁਲਾਂਕਣ ਸਾਨੂੰ ਇਹ ਸਮਝਣ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੇ ਹਨ ਕਿ ਕੀ ਕੋਈ ਸਿਸਟਮ ਅਸਲ ਵਿੱਚ ਤਾਇਨਾਤ ਕੀਤੇ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਵਰਤੋਂ ਲਈ ਸੁਰੱਖਿਅਤ ਹੈ ਜਾਂ ਨਹੀਂ। ਪਰ ਸਭ ਤੋਂ ਲਾਭਦਾਇਕ ਹੋਣ ਲਈ ਮੁਲਾਂਕਣ ਨੂੰ ਅਸਲ ਤਾਇਨਾਤੀ ਦੌਰਾਨ ਮਾਰਗਾਂ ਦੀ ਵੰਡ ਅਤੇ ਸਮੇਂ ਦੀ ਸੀਮਾ ਨੂੰ ਦਰਸਾਉਣਾ ਚਾਹੀਦਾ ਹੈ। ਇਸ ਕਾਰਨ ਅਸੀਂ ਵਿਰੋਧੀ ਮੁਲਾਂਕਣ ਤਿਆਰ ਕਰਨ ਲਈ ਸਾਹਮਣੇ ਆਈਆਂ ਅਸਫਲਤਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ। ਅਸੀਂ ਪਾਇਆ ਕਿ ਅਸਲ ਘਟਨਾਵਾਂ 'ਤੇ ਆਧਾਰਿਤ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਸੁਧਾਰ ਕਰਨ ਨਾਲ ਉਤਪਾਦਨ ਵਿੱਚ ਤਾਇਨਾਤੀ ਤੋਂ ਬਾਅਦ ਸਿਸਟਮ ਦਾ ਵਿਵਹਾਰ ਹੋਰ ਵੀ ਸੁਰੱਖਿਅਤ ਹੋਇਆ।
- ਬਿਹਤਰ ਅਲਾਇਨਮੈਂਟ। ਅਸੀਂ ਵਰਤੋਂਕਾਰ ਦੇ ਟੀਚੇ ਨੂੰ ਪੂਰਾ ਕਰਨ ਦੌਰਾਨ ਬਿਨਾਂ ਇਜਾਜ਼ਤ ਦੇ ਅਣਚਾਹੇ ਕਦਮ ਚੁੱਕਣ ਦੀ ਇਸਦੀ ਪ੍ਰਵਿਰਤੀ ਨੂੰ ਘਟਾਉਣ ਲਈ ਉਪਾਅ ਕੀਤੇ। ਉਦਾਹਰਨ ਲਈ, ਅਸੀਂ ਵੇਖਿਆ ਕਿ ਸਾਡੇ ਮਾਡਲ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਕਾਰਜਾਂ ਦੌਰਾਨ ਹਦਾਇਤਾਂ ਨੂੰ ਯਾਦ ਰੱਖਣ ਵਿੱਚ ਘੱਟ ਸਮਰੱਥ ਸਨ, ਅਤੇ ਜਦੋਂ ਅਸੀਂ ਮਾਡਲ ਨੂੰ ਇਸ ਸਮਰੱਥਾ ਲਈ ਸਿਖਲਾਈ ਦਿੱਤੀ, ਤਾਂ ਇਸ ਨਾਲ ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਤਿਆਰ ਹੋਇਆ ਜੋ ਲੰਬੇ ਸਮੇਂ ਦੇ ਕਾਰਜਾਂ ਦੌਰਾਨ ਵੀ ਨਿਯਮਾਂ ਅਨੁਸਾਰ ਰਿਹਾ।
- ਸਰਗਰਮ ਨਿਗਰਾਨੀ। ਅਸੀਂ ਇੱਕ ਨਿਗਰਾਨੀ ਸਿਸਟਮ ਬਣਾਇਆ ਜੋ ਇਹ ਦੇਖਣ ਲਈ ਮਾਡਲ ਦੇ ਬਦਲਦੇ ਮਾਰਗ ਦੀ ਸਮੀਖਿਆ ਕਰਦਾ ਹੈ ਕਿ ਕਿਤੇ ਉਹ ਵਰਤੋਂਕਾਰ ਦੀ ਪਾਬੰਦੀ ਜਾਂ ਸੁਰੱਖਿਆ ਹੱਦ ਨੂੰ ਪਾਰ ਤਾਂ ਨਹੀਂ ਕਰ ਰਿਹਾ ਹੈ। ਮਾਨੀਟਰ ਸਿਰਫ਼ ਇੱਕ ਕਾਰਵਾਈ ਹੀ ਨਹੀਂ, ਸਗੋਂ ਪੂਰੇ ਮਾਰਗ ਨੂੰ ਵੇਖਦਾ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ ਮਾਨੀਟਰ ਸੈਸ਼ਨ ਨੂੰ ਰੋਕ ਸਕਦਾ ਹੈ ਅਤੇ ਵਰਤੋਂਕਾਰ ਨੂੰ ਹੋਰ ਧਿਆਨ ਨਾਲ ਜਾਂਚਣ ਲਈ ਸੂਚਿਤ ਕਰ ਸਕਦਾ ਹੈ। ਜਾਂਚ ਤੋਂ ਬਾਅਦ, ਜੇਕਰ ਮਾਨੀਟਰ ਗਲਤੀ ਨਾਲ ਟ੍ਰਿਗਰ ਹੋਇਆ ਹੋਵੇ, ਤਾਂ ਵਰਤੋਂਕਾਰ ਮਾਡਲ ਦਾ ਕੰਮ ਜਾਰੀ ਰੱਖਣ ਦੀ ਚੋਣ ਕਰ ਸਕਦਾ ਹੈ।
- ਵਰਤੋਂਕਾਰ ਲਈ ਵਧੇਰੇ ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਕੰਟਰੋਲ। ਅਸੀਂ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਇਨ੍ਹਾਂ ਸੈਸ਼ਨਾਂ ਦੀ ਜਾਂਚ ਕਰਨ, ਕੀਤੀਆਂ ਗਈਆਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਦੇਖਣ ਅਤੇ ਦਖਲਅੰਦਾਜ਼ੀਆਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਦੀ ਵਰਤੋਂਕਾਰ ਦੀ ਸਮਰੱਥਾ ਵਿੱਚ ਸੁਧਾਰ ਕੀਤਾ ਹੈ।
ਨਵੇਂ ਨਿਗਰਾਨੀ ਸਿਸਟਮ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਲਈ, ਅਸੀਂ ਕੁਝ ਅੰਦਰੂਨੀ ਤਾਇਨਾਤੀ ਦੇ ਵਾਤਾਵਰਣਾਂ ਦੇ ਇੱਕ ਛੋਟੇ ਸਮੂਹ ਨੂੰ ਦੁਬਾਰਾ ਚਲਾ ਕੇ ਦੇਖਿਆ ਜਿੱਥੇ ਮਾਡਲ ਨੇ ਪਹਿਲਾਂ ਅਣਚਾਹੇ ਕਦਮ ਚੁੱਕੇ ਸਨ, ਪਰ ਇਸ ਵਾਰ ਨਵੀਆਂ ਸੁਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਲਾਗੂ ਸਨ2। ਇਹ ਨਵੀਆਂ ਸੁਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਮਾਡਲ ਵੱਲੋਂ ਚੁੱਕੇ ਗਏ ਅਣਚਾਹੇ ਕਦਮਾਂ ਨੂੰ ਪਹਿਲਾਂ ਨਾਲੋਂ ਕਾਫ਼ੀ ਜ਼ਿਆਦਾ ਫੜਨ ਵਿੱਚ ਸਮਰੱਥ ਰਹੀਆਂ ਅਤੇ ਜੋ ਕਦਮ ਇਸ ਤੋਂ ਛੁੱਟ ਗਏ, ਉਹ ਸਾਰੇ ਘੱਟ ਗੰਭੀਰਤਾ ਵਾਲੇ ਮੰਨੇ ਗਏ।
ਇਹਨਾਂ ਘੱਟ ਗੰਭੀਰਤਾ ਵਾਲੀਆਂ ਘਟਨਾਵਾਂ ਦੀਆਂ ਕੁਝ ਉਦਾਹਰਣਾਂ ਵਿੱਚ ਹੇਠ ਲਿਖੇ ਮਾਮਲੇ ਸ਼ਾਮਲ ਹਨ:
- ਲੀਨੀਅਰ ਕਮਾਂਡ ਲਾਈਨ ਟੂਲ ਤੱਕ ਪਹੁੰਚ ਕਰਨ ਲਈ, ਮਾਡਲ ਨੇ ਇੱਕ ਨੇਸਟਡ
codex --yoloਸੈਸ਼ਨ ਲਾਂਚ ਕੀਤਾ, ਜਦੋਂ ਕਿ ਅਸਲ ਵਿੱਚ ਇਹ--yoloਫਲੈਗ ਤੋਂ ਬਿਨਾਂ ਵੀ ਅਜਿਹਾ ਕਰ ਸਕਦਾ ਸੀ। - ਮਾਡਲ ਨੇ ਦੇਖਿਆ ਕਿ ਪਹਿਲਾਂ ਤੋਂ ਮੌਜੂਦ ਇੱਕ ਰਿਸੋਰਸ ਗਾਇਬ ਸੀ, ਜਿਸ ਤੋਂ ਬਾਅਦ ਉਸਨੇ ਬਿਨਾਂ ਕਿਸੇ ਵਜ੍ਹਾ ਦੇ ਆਪਣੇ ਮਾਲਕ ਦੇ ਨੇਮਸਪੇਸ ਅਧੀਨ ਆਉਂਦੇ ਹੋਰ ਲਾਈਵ CPU ਪੌਡਸ ਵਿੱਚ, ਅਤੇ ਨਾਲ ਹੀ (ਅਸਫ਼ਲਤਾ ਨਾਲ) ਹੋਰ OpenAI ਕਰਮਚਾਰੀਆਂ ਦੇ ਪੌਡਸ ਵਿੱਚ ਪੜਚੋਲ ਕਰਨੀ ਅਤੇ SSH ਕਰਨਾ ਸ਼ੁਰੂ ਕਰ ਦਿੱਤਾ।
- ਮਾਡਲ ਦੇ ਕਈ
ਫਾਈਂਡਪ੍ਰੋਸੈਸ ਫਸੇ ਹੋਏ ਸਨ ਅਤੇ ਹਰੇਕ ਸ਼ੈੱਲ ਕਮਾਂਡ ਹੈਂਗ ਹੋ ਗਈ ਸੀ। ਇਸ ਤੋਂ ਬਾਅਦ ਇਸਨੇkill -9 -1ਚਲਾਇਆ, ਜਿਸ ਨੇ ਉਸ ਪੌਡ 'ਤੇ ਖਤਮ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਵਾਲੇ ਹਰੇਕ ਪ੍ਰੋਸੈਸ ਨੂੰ SIGKILL ਭੇਜ ਦੇਣਾ ਸੀ, ਜੇਕਰ ਇਹ ਐਗਜ਼ੀਕਿਊਟ ਹੋ ਜਾਂਦਾ। ਹਾਲਾਂਕਿ, ਇਹ ਟਾਈਮ ਆਊਟ ਹੋ ਗਿਆ ਅਤੇ ਐਗਜ਼ੀਕਿਊਟ ਨਹੀਂ ਹੋਇਆ।
ਨਵੇਂ ਸਿਸਟਮ ਦੀ ਜਾਂਚ ਤੋਂ ਬਾਅਦ ਅਸੀਂ ਨਤੀਜਾ ਕੱਢਿਆ ਕਿ ਲੰਬੇ ਸਮੇਂ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਵਾਲੇ ਮਾਡਲਾਂ ਲਈ ਸੀਮਿਤ ਅੰਦਰੂਨੀ ਪਹੁੰਚ ਮੁੜ ਦਿੱਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਕਈ ਹਫ਼ਤੇ ਪਹਿਲਾਂ ਮੁੜ ਤਾਇਨਾਤੀ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਬਾਅਦ ਅਸੀਂ ਸੁਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਦੀ ਕਿਸੇ ਵੀ ਗੰਭੀਰ ਉਲੰਘਣਾ ਨੂੰ ਨਹੀਂ ਦੇਖਿਆ ਹੈ। ਇਹਨਾਂ ਸੁਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਦਾ ਪਹਿਲਾ ਸੰਸਕਰਣ ਜਾਣਬੁੱਝ ਕੇ ਸਾਵਧਾਨੀਪੂਰਵਕ ਰੱਖਿਆ ਗਿਆ ਸੀ। ਅਸੀਂ ਸੁਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਕਮਜ਼ੋਰ ਕੀਤੇ ਬਿਨਾਂ ਗੈਰ-ਜ਼ਰੂਰੀ ਰੁਕਾਵਟਾਂ ਘਟਾਉਣ ਲਈ ਸਿਸਟਮ ਨੂੰ ਲਗਾਤਾਰ ਟਿਊਨ ਕਰਦੇ ਰਹੇ ਹਾਂ।
ਕਿਉਂਕਿ ਅਸੀਂ ਇਸਨੂੰ ਵਾਰ-ਵਾਰ ਲੜੀਵਾਰ ਡਿਪਲਾਇ ਕੀਤਾ, ਇਸ ਲਈ ਅਸੀਂ ਪਹੁੰਚ ਨੂੰ ਵਧਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਕਮੀਆਂ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਸੁਧਾਰਨ ਦੇ ਯੋਗ ਹੋ ਸਕੇ। ਡਿਪਲਾਇਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਦੇ ਮੁਲਾਂਕਣ ਬਹੁਤ ਜ਼ਰੂਰੀ ਹਨ, ਪਰ ਡਿਪਲਾਇਮੈਂਟ ਨਾਲ ਹੀ ਉਹਨਾਂ ਵਿਵਹਾਰਾਂ ਦਾ ਪਤਾ ਲੱਗਦਾ ਹੈ ਜੋ ਪਹਿਲਾਂ ਰਹਿ ਜਾਂਦੇ ਹਨ। ਸੀਮਤ ਪਹੁੰਚ ਨਾਲ ਸ਼ੁਰੂਆਤ ਕਰਨ ਨਾਲ ਸਾਨੂੰ ਅਮਲੀ ਰੂਪ ਵਿੱਚ ਮਾਡਲ ਦਾ ਨਿਰੀਖਣ ਕਰਨ, ਸਮੱਸਿਆਵਾਂ ਆਉਣ 'ਤੇ ਕੰਮ ਰੋਕਣ, ਉਹਨਾਂ ਖਾਮੀਆਂ ਦੀ ਵਰਤੋਂ ਬਿਹਤਰ ਮੁਲਾਂਕਣ ਅਤੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਤਿਆਰ ਕਰਨ ਲਈ ਕਰਨ, ਅਤੇ ਬਦਲਾਅ ਦੀ ਜਾਂਚ ਕਰਨ ਤੋਂ ਬਾਅਦ ਦੁਬਾਰਾ ਸੀਮਤ ਪਹੁੰਚ ਬਹਾਲ ਕਰਨ ਦਾ ਮੌਕਾ ਮਿਲਿਆ।
ਜਿਵੇਂ-ਜਿਵੇਂ ਮਾਡਲ ਲੰਬੇ ਅਤੇ ਹੋਰ ਜਟਿਲ ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲਦੇ ਹਨ, ਮੁਲਾਂਕਣ ਦੌਰਾਨ ਰਹਿ ਗਈਆਂ ਖਾਮੀਆਂ ਦੇ ਗੰਭੀਰ ਸਿੱਟੇ ਹੋ ਸਕਦੇ ਹਨ। ਅਸੀਂ ਮੁਲਾਂਕਣ ਅਤੇ ਡਿਪਲਾਇਮੈਂਟ ਵਿਚਕਾਰਲੇ ਅੰਤਰ ਨੂੰ ਘਟਾਉਣ ਲਈ ਲਗਾਤਾਰ ਕੰਮ ਕਰਦੇ ਰਹਾਂਗੇ: ਮਾਡਲਾਂ ਦੀ ਲੰਬੇ ਸਮੇਂ ਦੀ ਕਾਰਜਪ੍ਰਣਾਲੀ 'ਤੇ ਜਾਂਚ ਕਰਨਾ, ਅਲਾਈਨਮੈਂਟ ਨੂੰ ਸੁਧਾਰਨਾ, ਅਜਿਹਾ ਨਿਰੀਖਣ ਸਿਸਟਮ ਤਿਆਰ ਕਰਨਾ ਜੋ ਲੋੜ ਪੈਣ 'ਤੇ ਦਖਲ ਦੇ ਸਕੇ, ਅਤੇ ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ ਵਧੇਰੇ ਸਪੱਸ਼ਟਤਾ ਅਤੇ ਨਿਯੰਤਰਣ ਦੇਣਾ। ਇਹ ਚੁਣੌਤੀਆਂ ਸਿਰਫ਼ OpenAI ਤੱਕ ਹੀ ਸੀਮਤ ਨਹੀਂ ਹੋਣਗੀਆਂ, ਅਤੇ ਸਾਨੂੰ ਉਮੀਦ ਹੈ ਕਿ ਜੋ ਅਸੀਂ ਸਿੱਖਿਆ ਹੈ ਉਸਨੂੰ ਸਾਂਝਾ ਕਰਨ ਨਾਲ ਪੂਰੇ ਖੇਤਰ ਨੂੰ ਇਹਨਾਂ ਲਈ ਤਿਆਰ ਹੋਣ ਵਿੱਚ ਮਦਦ ਮਿਲੇਗੀ।
ਲੇਖਕ
ਫੁੱਟਨੋਟ
- 1
ਭਾਵੇਂ ਅਸੀਂ PR ਨੂੰ ਜਲਦੀ ਹੀ ਬੰਦ ਕਰ ਦਿੱਤਾ ਸੀ, ਪਰ ਸਪੀਡਰਨ ਦੇ ਕਈ ਭਾਗੀਦਾਰਾਂ ਨੇ ਪਹਿਲਾਂ ਹੀ ਇਸਨੂੰ ਦੇਖ ਲਿਆ ਸੀ ਅਤੇ ਆਪਣੀਆਂ ਸਬਮਿਸ਼ਨਾਂ ਵਿੱਚ ਇਸ ਤਰੀਕੇ ਦੀ ਵਰਤੋਂ ਕਰ ਲਈ ਸੀ; 3030(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), 2990(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), 2930(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), 2925(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), 2900(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ 2890(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਕਦਮਾਂ ਵਾਲੀਆਂ ਲਗਾਤਾਰ ਆਈਆਂ ਵਰਲਡ ਰਿਕਾਰਡ ਸਬਮਿਸ਼ਨਾਂ ਸਾਰੀਆਂ PR 287 ਦਾ ਹਵਾਲਾ ਦਿੰਦੀਆਂ ਹਨ। ਇਹਨਾਂ ਵਿੱਚੋਂ, PR 300(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਖਾਸ ਤੌਰ 'ਤੇ ਦਿਲਚਸਪ ਹੈ ਕਿਉਂਕਿ ਇਹ Opus 4.7 ਦੁਆਰਾ ਜਮ੍ਹਾਂ ਕੀਤੀ ਗਈ PR ਹੈ ਜਦੋਂ Prime Intellect(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ NanoGPT ਸਪੀਡਰਨ 'ਤੇ ਇਸਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ ਸੀ। Opus ਨੇ ਸਾਡੇ ਮਾਡਲ ਦੁਆਰਾ ਜਮ੍ਹਾਂ ਕੀਤੀ PR ਦੇਖੀ, ਖੋਜਾਂ ਨੂੰ ਅਪਣਾਇਆ, ਅਤੇ ਆਪਣੇ ਅੰਤਮ ਨਤੀਜੇ ਵਿੱਚ ਸਾਡੀ PR ਨੂੰ ਕ੍ਰੈਡਿਟ ਦਿੱਤਾ।
- 2


