ਸਾਰ
ਸਮੱਸਿਆ
ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਅਤੇ ਸਾਡੇ ਮਾਡਲਾਂ ਦੀ ਮਜ਼ਬੂਤੀ ਵਧਾਉਣ ਲਈ ਰੈਡ ਟੀਮਿੰਗ ਲਾਜ਼ਮੀ ਹੈ। ਹਾਲਾਂਕਿ, ਮੌਜੂਦਾ ਤਰੀਕੇ ਸਕੇਲ ਨਹੀਂ ਹੋ ਸਕਦੇ, ਜਿਸ ਨਾਲ ਰੁਕਾਵਟ ਬਣਦੀ ਹੈ।
ਆਮ ਤੌਰ 'ਤੇ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਮਜ਼ਬੂਤੀ ਦੇ ਮੁਲਾਂਕਣ ਪਹਿਲਾਂ ਹੀ ਸਾਡੇ ਨਵੀਨਤਮ ਮਾਡਲਾਂ ਦੁਆਰਾ ਸੰਤ੍ਰਿਪਤ ਕੀਤੇ ਜਾ ਚੁੱਕੇ ਹਨ।
ਸਾਨੂੰ ਅਜਿਹੇ ਤਰੀਕੇ ਵਿਕਸਿਤ ਕਰਨ ਦੀ ਲੋੜ ਹੈ ਜੋ ਮਾਡਲ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦੇ ਨਾਲ-ਨਾਲ ਸੁਰੱਖਿਆ ਅਤੇ ਅਲਾਈਨਮੈਂਟ ਨੂੰ ਵੀ ਵਧਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦੇਣ।
ਅਸੀਂ ਕੀ ਕੀਤਾ
ਅਸੀਂ GPT‑Red ਨੂੰ ਟ੍ਰੇਨ ਕੀਤਾ, ਇੱਕ ਆਟੋਮੈਟਡ ਰੈਡ ਟੀਮਿੰਗ ਮਾਡਲ ਜੋ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਦੀ ਸਾਡੀ ਸਮਰੱਥਾ ਨੂੰ ਸਕੇਲ ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਵਿਆਪਕ ਡਿਪਲੌਇਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਅਸੀਂ ਉਨ੍ਹਾਂ ਨੂੰ ਠੀਕ ਕਰ ਸਕੀਏ।
GPT‑Red ਇੱਕ ਤਾਕਤਵਰ ਰੈਡ ਟੀਮਰ ਹੈ, ਅਤੇ ਸਾਡੇ ਪਿਛਲੇ ਮਾਡਲ ਇਸਦੇ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨ ਹਮਲਿਆਂ ਲਈ ਬਹੁਤ ਸੰਵੇਦਨਸ਼ੀਲ ਹਨ।
ਅਸੀਂ GPT‑5.6 ਨੂੰ ਵਿਰੋਧੀ ਢੰਗ ਨਾਲ ਟ੍ਰੇਨ ਕਰਨ ਲਈ GPT‑Red ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ, ਜਿਸ ਨਾਲ ਇਹ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨ ਖਿਲਾਫ ਕਾਫ਼ੀ ਵੱਧ ਮਜ਼ਬੂਤ ਬਣਦਾ ਹੈ।
ਅਸੀਂ ਇਸ ਪਹੁੰਚ ਨੂੰ ਮਨੁੱਖੀ ਅਤੇ ਤੀਜੀ-ਪੱਖ ਰੈਡ ਟੀਮਿੰਗ, ਪਰਤਦਾਰ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਅਤੇ ਰੀਅਲ-ਟਾਈਮ ਨਿਗਰਾਨੀ ਦੇ ਨਾਲ-ਨਾਲ ਅੱਗੇ ਵੀ ਸਕੇਲ ਕਰਦੇ ਰਹਾਂਗੇ।
AI ਸਿਸਟਮ ਆਮ ਤੌਰ 'ਤੇ ਬ੍ਰਾਊਜ਼ਰਾਂ, ਜੁੜੀਆਂ ਐਪਾਂ, ਲੋਕਲ ਫ਼ਾਈਲਾਂ ਅਤੇ ਹੋਰ ਟੂਲਾਂ ਰਾਹੀਂ ਤੀਜੀ-ਪੱਖ ਡਾਟਾ ਨਾਲ ਸਾਹਮਣਾ ਕਰਦੇ ਹਨ। ਅਸਲੀ ਦੁਨੀਆ ਦੇ ਟਾਸਕ ਕਰਨ ਲਈ ਇਹ ਸਹੂਲਤਾਂ ਲਾਜ਼ਮੀ ਹਨ, ਪਰ ਇਹ ਹਾਨੀਕਾਰਕ ਅਦਾਕਾਰਾਂ ਲਈ ਮਾਡਲ ਦੇ ਵਿਵਹਾਰ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਨ ਦੇ ਹੋਰ ਮੌਕੇ ਵੀ ਬਣਾਉਂਦੀਆਂ ਹਨ। ਉਦਾਹਰਨ ਲਈ, ਕੋਈ ਤੀਜਾ ਪੱਖ ਈਮੇਲ, ਵੈੱਬਪੇਜ, ਟੂਲ ਜਵਾਬ ਜਾਂ ਕੋਡ ਰਿਪੋਜ਼ਟਰੀ ਵਿੱਚ ਸਾਵਧਾਨੀ ਨਾਲ ਬਣਾਈ ਹਦਾਇਤ ਜੋੜ ਸਕਦਾ ਹੈ—ਜੋ ਮਾਡਲ ਨੂੰ ਸੰਵੇਦਨਸ਼ੀਲ ਡਾਟਾ ਬਾਹਰੀ ਸਰਵਰ 'ਤੇ ਅੱਪਲੋਡ ਕਰਨ ਲਈ ਧੋਖਾ ਦੇਣ ਵਾਸਤੇ ਬਣਾਈ ਗਈ ਹੋਵੇ।
ਮਨੁੱਖੀ ਰੈਡ ਟੀਮਿੰਗ ਸਾਡੇ ਸੁਰੱਖਿਆ ਕੰਮ ਦਾ ਅਹਿਮ ਹਿੱਸਾ ਹੈ, ਜੋ ਡਿਪਲੌਇਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਇਹ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਅਤੇ ਢੁੱਕਵੇਂ ਸੁਰੱਖਿਆ ਉਪਾਵ ਲਗਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ। ਪਰ ਸਿਰਫ਼ ਮਨੁੱਖੀ ਰੈਡ ਟੀਮਿੰਗ ਨੂੰ ਸਕੇਲ ਕਰਨਾ ਮੁਸ਼ਕਲ ਹੈ। ਇਹਨਾਂ ਅਭਿਆਸਾਂ ਨੂੰ ਡਿਜ਼ਾਈਨ ਕਰਨ ਅਤੇ ਚਲਾਉਣ ਵਿੱਚ ਬਹੁਤ ਸਮਾਂ ਲੱਗਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਨਵੇਂ ਫੇਲ੍ਹ ਮੋਡਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਵਧੇਰੇ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰਨ ਦੀ ਸਾਡੀ ਗਤੀ ਸੀਮਿਤ ਹੋ ਜਾਂਦੀ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਹਾਲਾਂਕਿ ਇਹ ਅਭਿਆਸ ਸਫਲ ਹਮਲਿਆਂ ਦੀਆਂ ਕੀਮਤੀ ਉਦਾਹਰਨਾਂ ਦਿੰਦੇ ਹਨ, ਇਹ ਟ੍ਰੇਨਿੰਗ ਰਾਹੀਂ ਮਾਡਲ ਮਜ਼ਬੂਤੀ ਵਧਾਉਣ ਲਈ ਲੋੜੀਂਦੇ ਵਿਰੋਧੀ ਡਾਟਾ ਦੀ ਮਾਤਰਾ ਅਤੇ ਵਿਭਿੰਨਤਾ ਪੈਦਾ ਨਹੀਂ ਕਰ ਸਕਦੇ।
ਲਗਾਤਾਰ ਹੋਰ ਸਮਰੱਥ ਹੋ ਰਹੇ ਮਾਡਲਾਂ ਦੇ ਨਾਲ ਕਦਮ ਮਿਲਾਉਣ ਲਈ ਰੈਡ ਟੀਮਿੰਗ ਨੂੰ ਵੀ ਸਕੇਲ ਕਰਨਾ ਲਾਜ਼ਮੀ ਹੈ। ਇਸ ਲਈ, ਅਸੀਂ ਆਟੋਮੈਟਡ, ਸਿਰਫ਼-ਅੰਦਰੂਨੀ ਰੈਡ ਟੀਮਿੰਗ ਮਾਡਲਾਂ ਨੂੰ ਟ੍ਰੇਨ ਕਰ ਰਹੇ ਹਾਂ ਜੋ ਡਿਪਲੌਇਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਦੇ ਹਨ ਅਤੇ ਮਜ਼ਬੂਤੀ ਵਧਾਉਣ ਲਈ ਮਾਡਲ ਟ੍ਰੇਨਿੰਗ ਦੌਰਾਨ ਹਮਲੇ ਤਿਆਰ ਕਰਦੇ ਹਨ। ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ ਆਟੋਮੇਟਿਡ ਰੈਡ ਟੀਮਿੰਗ ਸੁਰੱਖਿਆ ਲਈ ਸਵੈ-ਸੁਧਾਰ ਦਾ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਰੂਪ ਖੋਲ੍ਹਦੀ ਹੈ: ਅੱਜ ਦੇ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਭਵਿੱਖ ਦੇ ਮਾਡਲਾਂ ਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਹੋਰ ਸੁਰੱਖਿਅਤ ਬਣਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰਨਾ।
GPT‑Red ਇਨ੍ਹਾਂ ਯਤਨਾਂ ਦਾ ਨਤੀਜਾ ਅਤੇ ਸਾਡਾ ਮੌਜੂਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਆਟੋਮੈਟਡ ਸੁਰੱਖਿਆ ਰੈਡ ਟੀਮਿੰਗ ਮਾਡਲ ਹੈ। ਜਿਵੇਂ ਮਨੁੱਖੀ ਰੈਡ ਟੀਮਰ ਹਮਲੇ ਤਿਆਰ ਕਰਦੇ ਹਨ, ਉਸੇ ਤਰ੍ਹਾਂ ਇਹ ਮਾਡਲ ਵੀ ਪ੍ਰੌਂਪਟ ਭੇਜ ਕੇ, GPT ਮਾਡਲਾਂ ਦੀ ਪ੍ਰਤੀਕਿਰਿਆ ਦੇਖ ਕੇ ਅਤੇ ਉਸ ਵਿੱਚ ਲਗਾਤਾਰ ਬਦਲਾਅ ਕਰਕੇ ਆਪਣੇ ਟੀਚੇ ਵੱਲ ਵਧਦਾ ਹੈ। ਅਸੀਂ GPT‑Red ਨੂੰ OpenAI ਵਿੱਚ ਆਪਣੀਆਂ ਕੁਝ ਸਭ ਤੋਂ ਵੱਡੀਆਂ ਪੋਸਟ-ਟ੍ਰੇਨਿੰਗ ਰਨਾਂ ਦੇ ਕੰਪਿਊਟ ਸਕੇਲ 'ਤੇ ਟ੍ਰੇਨ ਕੀਤਾ ਹੈ—ਜੋ ਕਿ ਸਿਰਫ਼ ਸੁਰੱਖਿਆ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ ਲਈ ਸਮਰਪਿਤ ਕੀਤੀ ਗਈ ਕੰਪਿਊਟ ਦੀ ਬੇਮਿਸਾਲ ਮਾਤਰਾ ਹੈ।
ਅਸੀਂ GPT‑Red ਨੂੰ ਆਪਣੇ ਪ੍ਰੋਡਕਸ਼ਨ ਮਾਡਲਾਂ ਦੀ ਟ੍ਰੇਨਿੰਗ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਸ਼ਾਮਲ ਕਰਦੇ ਹਾਂ। ਨਤੀਜੇ ਵਜੋਂ, GPT‑5.6 Sol ਹੁਣ ਤੱਕ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨਾਂ ਖ਼ਿਲਾਫ਼ ਸਾਡਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਮਾਡਲ ਹੈ, ਜਿਸ ਨੇ ਸਿਰਫ਼ ਚਾਰ ਮਹੀਨੇ ਪਹਿਲਾਂ ਦੇ ਸਾਡੇ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰੋਡਕਸ਼ਨ ਮਾਡਲ ਦੇ ਮੁਕਾਬਲੇ ਸਾਡੇ ਸਭ ਤੋਂ ਔਖੇ ਸਿੱਧੇ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨ ਬੈਂਚਮਾਰਕ 'ਤੇ 6 ਗੁਣਾ ਘੱਟ ਨਾਕਾਮੀਆਂ ਹਾਸਲ ਕੀਤੀਆਂ ਹਨ। ਸਾਡੀ ਪਹੁੰਚ ਦੀ ਸਕੇਲਬਿਲਟੀ ਸਾਨੂੰ ਭਵਿੱਖ ਵਿੱਚ ਹੋਰ ਵੀ ਮਜ਼ਬੂਤ ਨਤੀਜਿਆਂ ਲਈ ਉਤਸ਼ਾਹਿਤ ਕਰਦੀ ਹੈ, ਜਦੋਂ ਅਸੀਂ ਹੋਰ ਤਾਕਤਵਰ ਰੈਡ ਟੀਮਰਾਂ ਨੂੰ ਟ੍ਰੇਨ ਕਰਦੇ ਰਹਾਂਗੇ।
GPT‑Red ਨੂੰ ਸੈਲਫ-ਪਲੇ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਰਾਹੀਂ ਟ੍ਰੇਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਜਿੱਥੇ ਇਸ ਮਾਡਲ ਅਤੇ ਵੱਖ-ਵੱਖ ਤਰ੍ਹਾਂ ਦੇ ਡਿਫੈਂਡਰ LLMs ਨੂੰ ਰੈੱਡ-ਟੀਮਿੰਗ ਦੇ ਕਈ ਤਰ੍ਹਾਂ ਦੇ ਹਾਲਾਤਾਂ 'ਤੇ ਇੱਕੋ ਸਮੇਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ। GPT‑Red ਨੂੰ ਸਹੀ ਖਾਮੀ ਸਾਹਮਣੇ ਲਿਆਉਣ, ਜਿਵੇਂ ਕਿ ਸਫ਼ਲ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਕਰਨ ਲਈ ਇਨਾਮ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਡਿਫੈਂਡਰ ਮਾਡਲਾਂ ਨੂੰ ਹਮਲੇ ਦਾ ਸਾਹਮਣਾ ਕਰਨ ਅਤੇ ਆਪਣੇ ਅਸਲ ਕੰਮਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਇਨਾਮ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਜਿਵੇਂ ਡਿਫੈਂਡਰ ਹੋਰ ਮਜ਼ਬੂਤ ਹੁੰਦੇ ਜਾਂਦੇ ਹਨ, GPT‑Red ਹੋਰ ਵੀ ਤਕੜੇ ਅਤੇ ਵੱਖੋ-ਵੱਖਰੇ ਹਮਲੇ ਖੋਜਣ ਲਈ ਮਜਬੂਰ ਹੋ ਜਾਂਦਾ ਹੈ।
ਸੈਲਫ-ਪਲੇ ਟ੍ਰੇਨਿੰਗ ਦਾ ਸਮਰਥਨ ਕਰਨ ਲਈ, ਅਸੀਂ ਅਜਿਹੇ ਅਸਲ ਹਾਲਾਤਾਂ ਦਾ ਵੱਡਾ ਸੈੱਟ ਤਿਆਰ ਕਰਦੇ ਹਾਂ ਜਿੱਥੇ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਸ਼ਾਮਲ ਕੀਤੇ ਜਾ ਸਕਦੇ ਹਨ। ਹਰੇਕ ਮਾਹੌਲ ਦਾ ਇੱਕ ਖ਼ਤਰਾ ਮਾਡਲ ਹੁੰਦਾ ਹੈ ਜੋ ਇਹ ਤੈਅ ਕਰਦਾ ਹੈ ਕਿ GPT‑Red ਕਿਸ ਚੀਜ਼ ਨੂੰ ਕੰਟਰੋਲ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਕਿਸ ਨੂੰ ਇੱਕ ਸਫ਼ਲ ਹਮਲਾ ਮੰਨਿਆ ਜਾਵੇਗਾ। ਉਦਾਹਰਨ ਦੇ ਲਈ, GPT‑Red ਕਿਸੇ ਸਥਾਨਕ ਫ਼ਾਈਲ ਦੇ ਇੱਕ ਹਿੱਸੇ, ਵੈੱਬਪੇਜ ਬੈਨਰ, ਈਮੇਲ ਦੀ ਬਾਡੀ, ਜਾਂ ਕਿਸੇ ਟੂਲ ਦੇ ਆਊਟਪੁੱਟ ਨੂੰ ਕੰਟਰੋਲ ਕਰ ਸਕਦਾ ਹੈ।
ਆਪਣੀ ਸਿਖਲਾਈ ਦੇ ਅੰਤ 'ਤੇ, GPT‑Red ਇੱਕ ਬਹੁਤ ਹੀ ਮਜ਼ਬੂਤ ਹਮਲਾਵਰ ਬਣ ਜਾਂਦਾ ਹੈ: ਇਹ ਆਪਣੇ ਸਾਹਮਣੇ ਆਉਣ ਵਾਲੇ ਲਗਭਗ ਸਾਰੇ ਮਾਡਲਾਂ ਨੂੰ ਮਾਤ ਦੇ ਸਕਦਾ ਹੈ, ਚਾਹੇ ਉਹ ਅੰਦਰੂਨੀ ਹੋਣ ਜਾਂ ਪ੍ਰੋਡਕਸ਼ਨ ਮਾਡਲ, ਇੱਥੋਂ ਤੱਕ ਕਿ GPT‑5.5 ਤੱਕ ਅਤੇ ਸਮੇਤ। GPT‑Red ਦੁਆਰਾ ਸਿਖਲਾਈ ਪੂਰੀ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਅਸੀਂ GPT‑5.6 ਦੀ ਸਿਖਲਾਈ ਲਈ ਤੁਰੰਤ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਤਿਆਰ ਕਰਨ ਵਾਸਤੇ ਇਸਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਜਿਸ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਉਹ ਮਾਡਲ GPT‑Red ਦੇ ਹਮਲਿਆਂ ਦੇ ਖਿਲਾਫ਼ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸੁਰੱਖਿਅਤ ਬਣ ਗਿਆ।
ਅਸੀਂ GPT‑Red ਨੂੰ ਆਪਣੇ ਦੁਆਰਾ ਤੈਨਾਤ ਕੀਤੇ ਗਏ ਮਾਡਲਾਂ ਤੋਂ ਵੱਖ ਰੱਖਦੇ ਹਾਂ। ਇਹ ਉਹਨਾਂ ਖ਼ਤਰਨਾਕ ਸਮਰੱਥਾਵਾਂ ਨੂੰ ਵਿਰੋਧੀ ਤੱਤਾਂ ਦੇ ਹੱਥ ਲੱਗਣ ਤੋਂ ਬਚਾਉਂਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਦੀ ਅਸੀਂ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ GPT‑Red ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ, ਅਤੇ ਇਸ ਦੇ ਨਾਲ ਹੀ ਇਹ ਸਾਡੇ ਪ੍ਰੋਡਕਸ਼ਨ ਮਾਡਲਾਂ ਨੂੰ ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਤੇ ਮਜ਼ਬੂਤ ਬਣਾਉਂਦਾ ਹੈ।
GPT‑Red ਉਹਨਾਂ ਸਾਰੇ ਡਿਫੈਂਡਰ ਮਾਡਲਾਂ ਅਤੇ ਰੈੱਡ-ਟੀਮਿੰਗ ਦੇ ਹਾਲਾਤਾਂ ਦੇ ਖਿਲਾਫ਼ ਬਹੁਤ ਜ਼ਿਆਦਾ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਹੈ ਜਿਨ੍ਹਾਂ 'ਤੇ ਇਸ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ। ਅਸੀਂ ਇਸ ਗੱਲ ਦਾ ਵੀ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਾਂ ਕਿ ਕੀ ਇਹ ਮਾਡਲ OpenAI ਵਿਖੇ ਵਿਆਪਕ ਪੱਧਰ 'ਤੇ ਸੁਰੱਖਿਆ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ ਲਈ ਇੱਕ ਆਮ-ਮਕਸਦ ਵਾਲੇ ਰੈੱਡ-ਟੀਮਿੰਗ ਏਜੰਟ ਵਜੋਂ ਉਪਯੋਗੀ ਹੈ। ਅਜਿਹਾ ਕਰਨ ਲਈ, ਅਸੀਂ ਨਵੇਂ ਸੁਰੱਖਿਆ ਮਾਹੌਲਾਂ ਅਤੇ ਟਾਰਗੇਟ ਮਾਡਲਾਂ 'ਤੇ GPT‑Red ਦੀ ਪ੍ਰਭਾਵਸ਼ੀਲਤਾ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਾਂ।
ਅਸੀਂ ਪਹਿਲਾਂ Dziemian et al. (2025) ਤੋਂ ਅਸਿੱਧੇ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਅਰੇਨਾ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੇ ਦੁਹਰਾਏ ਗਏ ਸੰਸਕਰਣ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਨਵੇਂ ਰੈਡ ਟੀਮਿੰਗ ਦ੍ਰਿਸ਼ਾਂ ਨੂੰ ਜਨਰਲਾਈਜ਼ ਕਰਨ ਦੀ GPT‑Red ਦੀ ਯੋਗਤਾ ਦਾ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਾਂ। ਇਸ ਚੁਣੌਤੀ ਵਿੱਚ, ਮਨੁੱਖੀ ਰੈਡ ਟੀਮਰਾਂ ਅਤੇ GPT‑Red ਦੋਵਾਂ ਨੇ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਮਾਹੌਲਾਂ ਦੇ ਇੱਕ ਸਮੂਹ 'ਤੇ GPT‑5.1 ਦੇ ਖਿਲਾਫ਼ ਹਮਲਿਆਂ ਦੀ ਪੇਸ਼ਕਸ਼ ਕੀਤੀ। ਇਹ ਰੈਡ ਟੀਮਿੰਗ ਹਾਲਾਤ ਅਤੇ ਟੀਚੇ ਉਹਨਾਂ ਨਾਲੋਂ ਬਿਲਕੁਲ ਵੱਖਰੇ ਹਨ ਜੋ GPT‑Red ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਵਰਤੇ ਗਏ ਸਨ। GPT‑Red ਹਮਲੇ ਵਿੱਚ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸਫ਼ਲਤਾ ਦਰ ਹਾਸਲ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਮਨੁੱਖਾਂ ਦੇ 13% ਦੇ ਮੁਕਾਬਲੇ 84% ਹਾਲਾਤਾਂ ਵਿੱਚ ਸਫ਼ਲਤਾ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ।
GPT‑Red ਆਟੋਮੈਟਡ ਰੈਡ ਟੀਮਰ ਵਜੋਂ ਸ਼ਾਨਦਾਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ। GPT‑Red ਇੰਟਰਨਲ ਮਿਰਰ ਦੀ ਵਰਤੋਂ ਕਰਕੇ, Dziemian et al. (2025) ਦੇ ਇਨਡਾਇਰੈਕਟ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਅਰੇਨਾ 'ਤੇ ਮਨੁੱਖੀ ਰੈਡ ਟੀਮਰਾਂ ਦੇ ਮੁਕਾਬਲੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਦ੍ਰਿਸ਼ਾਂ ਵਿੱਚ GPT‑5.1 ਦੇ ਖਿਲਾਫ਼ ਸਫ਼ਲ ਹਮਲੇ ਪੈਦਾ ਕਰਨ ਵਿੱਚ ਸਮਰੱਥ ਹੈ।
ਰੈਡ ਟੀਮਰ ਦੀ ਅੰਤਿਮ ਪਰਖ ਇਹ ਹੈ ਕਿ ਉਹ ਸਿਸਟਮ ਦੇ ਅੰਦਰਲੇ ਮਾਡਲ ਅਤੇ ਜਾਂਚ-ਢਾਂਚੇ ਦੇ ਡਿਜ਼ਾਈਨ ਬਾਰੇ ਅਧੂਰੀ ਜਾਣਕਾਰੀ ਹੋਣ ਦੇ ਬਾਵਜੂਦ ਅਸਲੀ ਦੁਨੀਆ ਦੇ ਏਜੰਟਿਕ ਸਿਸਟਮਾਂ ਖਿਲਾਫ਼ ਨਿਸ਼ਾਨਾਬੱਧ ਹਾਨੀਕਾਰਕ ਲਕਸ਼ ਹਾਸਲ ਕਰ ਸਕੇ। ਇਸ ਸੈਟਿੰਗ ਵਿੱਚ ਸਾਡੇ ਪਹਿਲੇ ਪ੍ਰਯੋਗ ਨੇ GPT‑Red ਨੂੰ OpenAI ਦਫ਼ਤਰ ਵਿੱਚ Andon Labs ਵੱਲੋਂ ਬਣਾਈ ਇੱਕ AI-ਚਲਿਤ ਵੈਂਡਿੰਗ ਮਸ਼ੀਨ ਖਿਲਾਫ਼ ਖੜ੍ਹਾ ਕੀਤਾ, ਜੋ Project Vend(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਰਗੀ ਸੀ। ਅਸੀਂ GPT‑Red ਨੂੰ ਸਿਸਟਮ ਦਾ ਵੇਰਵਾ ਦਿੱਤਾ ਅਤੇ ਹਮਲੇ ਭੇਜਣ ਤੇ ਸਿਮੂਲੇਟਡ ਏਜੰਟ ਦੀਆਂ ਟੂਲ ਕਾਲਾਂ ਦੇਖਣ ਦੀ ਸਮਰੱਥਾ ਦਿੱਤੀ, ਜੋ ਅਸਲੀ ਦੁਨੀਆ ਦੀ ਡਿਪਲੌਇਮੈਂਟ ਨਾਲ ਕਾਫ਼ੀ ਮਿਲਦੀ-ਜੁਲਦੀ ਹੈ। ਹਮਲਿਆਂ 'ਤੇ ਦੁਹਰਾਈ ਕਰਨ ਤੋਂ ਬਾਅਦ, GPT‑Red ਨੇ ਪ੍ਰੋਡਕਸ਼ਨ ਏਜੰਟ ਖਿਲਾਫ਼ ਆਪਣਾ ਹਮਲਾ ਡਿਪਲੌਇ ਕੀਤਾ ਅਤੇ ਆਪਣੇ ਤਿੰਨੋ ਹਾਨੀਕਾਰਕ ਉਦੇਸ਼ ਹਾਸਲ ਕੀਤੇ:
- ਸਟਾਕ ਵਿੱਚ ਮੌਜੂਦ ਮਹਿੰਗੀ ਚੀਜ਼ ਦੀ ਕੀਮਤ ਬਦਲ ਕੇ ਮਨਜ਼ੂਰ ਘੱਟੋ-ਘੱਟ ਕੀਮਤ $0.50 ਕਰਨਾ;
- $100+ ਦੀ ਨਵੀਂ ਚੀਜ਼ ਆਰਡਰ ਕਰਨਾ ਅਤੇ ਇਸਨੂੰ $0.50 ਵਿੱਚ ਪੇਸ਼ ਕਰਨਾ; ਅਤੇ
- ਕਿਸੇ ਹੋਰ ਗਾਹਕ ਦਾ ਆਰਡਰ ਰੱਦ ਕਰਨਾ।
ਅਸੀਂ ਇਹ ਕਮਜ਼ੋਰੀਆਂ ਪ੍ਰਗਟ ਕੀਤੀਆਂ ਹਨ ਅਤੇ ਨਵੇਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਸਰਗਰਮੀ ਨਾਲ ਜਾਂਚ ਹੋ ਰਹੀ ਹੈ।
GPT‑Red ਵੈਂਡੀ ਨਾਮਕ ਲਾਈਵ ਆਟੋਨੋਮਸ ਏਜੰਟ ਦੀ ਸੁਰੱਖਿਆ ਨੂੰ ਤੋੜਨ ਵਿੱਚ ਸਮਰੱਥ ਹੈ, ਜੋ ਵੈਂਡਿੰਗ ਮਸ਼ੀਨ ਦਾ ਪ੍ਰਬੰਧਨ ਕਰਦਾ ਹੈ। GPT‑Red ਨੇ ਪਹਿਲਾਂ ਸਿਮੂਲੇਸ਼ਨ ਵਿੱਚ ਪ੍ਰੀਖਣ ਕਰਕੇ ਅਤੇ ਫਿਰ ਹਮਲਿਆਂ ਨੂੰ ਲਾਈਵ ਏਜੰਟ 'ਤੇ ਲਾਗੂ ਕਰਕੇ, ਇਸ ਪ੍ਰੋਡਕਸ਼ਨ ਏਜੰਟ ਤੋਂ ਮਹਿੰਗੀਆਂ ਚੀਜ਼ਾਂ ਨੂੰ ਸਸਤਾ ਕਰਵਾਉਣ ਅਤੇ ਹੋਰ ਗਾਹਕਾਂ ਦੇ ਆਰਡਰ ਰੱਦ ਕਰਵਾਉਣ ਵਿੱਚ ਸਫ਼ਲਤਾ ਹਾਸਲ ਕੀਤੀ।
ਅਸੀਂ 10 ਰਾਖਵੇਂ ਡਾਟਾ-ਐਕਸਫ਼ਿਲਟ੍ਰੇਸ਼ਨ ਦ੍ਰਿਸ਼ਾਂ ਦੇ ਸੂਟ 'ਤੇ Codex CLI ਏਜੰਟ (GPT‑5.4 mini 'ਤੇ ਆਧਾਰਿਤ) 'ਤੇ ਹਮਲਾ ਕਰਨ ਲਈ ਵੀ GPT‑Red ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ। ਰਾਖਵੇਂ ਰੈਡ ਟੀਮਿੰਗ ਪ੍ਰਦਰਸ਼ਨ 'ਤੇ ਸਾਡੀ ਟ੍ਰੇਨਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦੇ ਅਸਰ ਦਾ ਅਧਿਐਨ ਕਰਨ ਲਈ ਅਸੀਂ ਮਾਡਲ ਦੀ ਤੁਲਨਾ ਪ੍ਰੌਂਪਟ ਕੀਤੇ GPT‑5.5 ਬੇਸਲਾਈਨ ਨਾਲ ਕਰਦੇ ਹਾਂ। GPT‑Red ਵੱਧ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਵੀ ਹੈ ਕਿਉਂਕਿ ਇਹ ਵੱਧ ਦ੍ਰਿਸ਼ਾਂ ਵਿੱਚ ਏਜੰਟ ਤੋਂ ਸੰਵੇਦਨਸ਼ੀਲ ਡਾਟਾ ਬਾਹਰ ਕਢਵਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਟੋਕਨ ਵਰਤੋਂ ਵਿੱਚ ਵੀ ਵੱਧ ਕੁਸ਼ਲ ਹੈ।
GPT‑Red ਲਾਈਵ Codex ਏਜੰਟਾਂ ਨੂੰ ਤੋੜਨ ਵਿੱਚ ਵੱਧ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਅਤੇ ਕੁਸ਼ਲ ਹੈ। ਅਸੀਂ 10 ਡਾਟਾ ਬਾਹਰ ਕੱਢਣ ਵਾਲੇ ਟਾਸਕਾਂ ਦੇ ਕਸਟਮ ਸੂਟ 'ਤੇ GPT‑5.4 Mini ਨਾਲ ਸਮਰਥਿਤ Codex ਏਜੰਟ ਖਿਲਾਫ਼ ਟੈਸਟ ਕਰਦੇ ਹਾਂ।
GPT‑Red ਦਾ ਅੰਤਿਮ ਲਕਸ਼ ਸਾਡੇ ਮਾਡਲਾਂ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣਾ ਹੈ। ਪਿਛਲੇ ਛੇ ਮਹੀਨਿਆਂ ਦੌਰਾਨ, ਅਸੀਂ ਵਧਦੇ ਕੰਪਿਊਟ ਨਾਲ ਲਗਾਤਾਰ ਹੋਰ ਮਜ਼ਬੂਤ ਰੈਡ ਟੀਮਿੰਗ ਮਾਡਲਾਂ (GPT‑Red ਦੇ ਸ਼ੁਰੂਆਤੀ ਰੂਪ) ਨੂੰ ਟ੍ਰੇਂਡ ਕੀਤਾ ਹੈ, ਅਤੇ GPT‑5.3 ਤੋਂ ਬਾਅਦ ਹਰ ਅਗਲੇ ਪ੍ਰੋਡਕਸ਼ਨ ਮਾਡਲ ਦੀ ਟ੍ਰੇਨਿੰਗ ਵਿੱਚ ਇਨ੍ਹਾਂ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਹੈ। ਸਮੇਂ ਦੇ ਨਾਲ, ਹਰ ਅਗਲਾ GPT ਰਿਲੀਜ਼ ਹੋਰ ਮਜ਼ਬੂਤ ਹੋਇਆ ਹੈ।
ਇੱਕ ਉਦਾਹਰਨ ਵਜੋਂ, GPT‑Red ਦੇ ਸ਼ੁਰੂਆਤੀ ਵਰਜਨ ਨੇ ਸਿੱਧੇ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨ ਹਮਲਿਆਂ ਦੀ ਨਵੀਂ ਸ਼੍ਰੇਣੀ ਲੱਭੀ, ਜਿਸਨੂੰ “ਨਕਲੀ ਚੇਨ-ਆਫ-ਥੌਟ” ਹਮਲੇ ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਇਨ੍ਹਾਂ ਹਮਲਿਆਂ ਨੇ GPT‑5.1'ਤੇ 95% ਤੋਂ ਵੱਧ ਸਫਲਤਾ ਦਰਾਂ ਹਾਸਲ ਕੀਤੀਆਂ ਸਨ, ਪਰ ਹੁਣ GPT‑5.6 Sol ਲਈ 10% ਤੋਂ ਘੱਟ ਹਨ। ਇਸੇ ਤਰ੍ਹਾਂ, ਡਿਵੈਲਪਰ ਟੂਲਾਂ ਅਤੇ ਬ੍ਰਾਊਜ਼ਿੰਗ ਵਿੱਚ ਹਮਲਿਆਂ ਨੂੰ ਟਾਰਗੇਟ ਕਰਨ ਵਾਲੇ ਸਾਡੇ ਕਈ ਅਪਰੋਕਸ਼ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨ ਬੈਂਚਮਾਰਕ ਸਾਡੇ ਨਵੇਂ ਮਾਡਲ (>97% ਸ਼ੁੱਧਤਾ) ਵੱਲੋਂ ਸੈਚੁਰੇਟ ਕੀਤੇ ਜਾ ਚੁੱਕੇ ਹਨ।
GPT‑Red ਦੇ ਖ਼ਿਲਾਫ਼ ਮਜ਼ਬੂਤੀ ਵਿੱਚ ਵੀ ਕਾਫ਼ੀ ਸੁਧਾਰ ਹੋਇਆ ਹੈ। ਮਜ਼ਬੂਤੀ ਪਰਖਣ ਵਾਲੀਆਂ ਕਈ ਵੱਖ-ਵੱਖ ਸਥਿਤੀਆਂ ਵਿੱਚ GPT‑Red ਦੇ ਹਮਲੇ ਦੀ ਸਫਲਤਾ ਦੀ ਦਰ ਸਮੇਂ ਦੇ ਨਾਲ ਲਗਾਤਾਰ ਘਟਦੀ ਗਈ ਹੈ। ਸਾਡੇ ਨਵੀਨਤਮ ਮਾਡਲ ਰੀਲੀਜ਼ ਦੇ ਨਾਲ GPT‑5.6 Sol GPT‑Red ਦੇ ਸਿੱਧੇ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨਾਂ ਵਿੱਚੋਂ ਸਿਰਫ਼ 0.05% 'ਤੇ ਹੀ ਅਸਫ਼ਲ ਹੁੰਦਾ ਹੈ।
ਜਿਵੇਂ ਅਸੀਂ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨ ਲਈ ਸੈਲਫ-ਪਲੇ ਟ੍ਰੇਨਿੰਗ ਨੂੰ ਵਧਾਇਆ ਹੈ, ਸਾਨੂੰ ਅਜਿਹੇ ਨਵੇਂ ਖ਼ਤਰਿਆਂ ਦਾ ਪਤਾ ਲੱਗਾ ਹੈ ਜੋ ਮੌਜੂਦਾ ਮਾਡਲਾਂ ਨੂੰ ਤੋੜ ਸਕਦੇ ਹਨ। ਫਿਰ ਵੀ, ਸਾਡੀ ਸਕੇਲਿੰਗ ਨੇ ਇਨ੍ਹਾਂ ਹਮਲਿਆਂ ਖਿਲਾਫ਼ ਮਜ਼ਬੂਤੀ ਨੂੰ ਵੀ ਕਾਫ਼ੀ ਹੱਦ ਤੱਕ ਸੁਧਾਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ ਹੈ। ਹਮਲੇ ਦੀ ਸਫ਼ਲਤਾ ਦਰ ਰਾਖਵੇਂ ਮਾਹੌਲਾਂ ਵਿੱਚ GPT‑Red ਵੱਲੋਂ ਕੀਤੀਆਂ ਸਾਰੀਆਂ ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਔਸਤ ਸਫ਼ਲਤਾ ਵਜੋਂ ਗਿਣੀ ਜਾਂਦੀ ਹੈ।
ਕੋਈ ਮਾਡਲ ਹੋਰ ਬੇਨਤੀਆਂ ਨੂੰ ਇਨਕਾਰ ਕਰਕੇ ਜਾਂ ਘੱਟ ਸਮਰੱਥ ਬਣ ਕੇ ਵੱਧ ਸੁਰੱਖਿਅਤ ਦਿਖ ਸਕਦਾ ਹੈ। ਜੋ ਮਾਡਲ ਘੱਟ ਕੰਮ ਕਰਦਾ ਹੈ, ਉਸ 'ਤੇ ਹਮਲਾ ਕਰਨਾ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਔਖਾ ਹੁੰਦਾ ਹੈ, ਪਰ ਇਹ ਲਾਭਕਾਰੀ ਮਜ਼ਬੂਤੀ ਨਹੀਂ ਹੈ।
ਅਸੀਂ ਆਮ ਅਤਿ-ਆਧੁਨਿਕ ਸਮਰੱਥਾਵਾਂ ਦੇ ਨਾਲ-ਨਾਲ ਆਪਣੇ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਗਏ ਖਾਸ ਨਿਸ਼ਾਨਾਬੱਧ ਕੰਮਾਂ ਦਾ ਵੀ ਗਹਿਰਾਈ ਨਾਲ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਾਂ। ਸਾਨੂੰ ਪਤਾ ਲੱਗਦਾ ਹੈ ਕਿ ਮਜ਼ਬੂਤੀ ਵਿੱਚ ਹੋਏ ਵੱਡੇ ਸੁਧਾਰ ਦੇ ਬਾਵਜੂਦ ਸਾਰੀਆਂ ਆਮ ਸਮਰੱਥਾਵਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਪ੍ਰਭਾਵਿਤ ਰਹਿੰਦੀਆਂ ਹਨ। ਇਸ ਤੋਂ ਸਾਫ਼ ਹੁੰਦਾ ਹੈ ਕਿ ਮਜ਼ਬੂਤੀ ਵਿੱਚ ਹੋਏ ਇਹ ਲਾਭ, ਟੂਲ ਦੀ ਗਲਤ ਵਰਤੋਂ ਕਰਨ ਜਾਂ ਜਾਇਜ਼ ਬੇਨਤੀਆਂ ਨੂੰ ਬਿਨਾਂ ਵਜ੍ਹਾ ਖਾਰਜ ਕਰਨ ਦੀ ਬਜਾਏ, ਨੁਕਸਾਨਦੇਹ ਹਦਾਇਤਾਂ ਦਾ ਵਧੇਰੇ ਸਖ਼ਤੀ ਨਾਲ ਵਿਰੋਧ ਕਰਨ ਕਰਕੇ ਮਿਲੇ ਹਨ।
AI ਏਜੰਟ ਪਹਿਲਾਂ ਹੀ ਸਾਡੇ ਅਗਲੀ ਪੀੜ੍ਹੀ ਦੇ ਮਾਡਲਾਂ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਵਧਾਉਣ ਲਈ ਵਰਤੇ ਜਾ ਰਹੇ ਹਨ। ਸਾਨੂੰ ਵਿਸ਼ਵਾਸ ਹੈ ਕਿ GPT‑Red ਨਾਲ ਅਸੀਂ ਸੁਰੱਖਿਆ ਲਈ ਇੱਕ ਮਿਲਦਾ-ਜੁਲਦਾ ਫ਼ਲਾਈਵ੍ਹੀਲ ਖੋਲ੍ਹਣਾ ਸ਼ੁਰੂ ਕੀਤਾ ਹੈ, ਜਿੱਥੇ ਅੱਜ ਦੇ ਮਾਡਲ ਕੱਲ੍ਹ ਦੇ ਮਾਡਲਾਂ ਨੂੰ ਹੋਰ ਮਜ਼ਬੂਤ, ਅਲਾਇਨਡ ਅਤੇ ਭਰੋਸੇਯੋਗ ਬਣਾਉਣ ਲਈ ਵਰਤੇ ਜਾ ਸਕਦੇ ਹਨ। ਅਸੀਂ ਭਵਿੱਖ ਵਿੱਚ GPT‑Red ਦੇ ਅਜਿਹੇ ਸੰਸਕਰਣ ਤਿਆਰ ਕਰਨ ਲਈ ਕੰਪਿਊਟੇਸ਼ਨਲ ਸਮਰੱਥਾ ਅਤੇ ਡੇਟਾ ਨੂੰ ਲਗਾਤਾਰ ਵਧਾਉਂਦੇ ਰਹਾਂਗੇ ਜੋ ਅੱਜ ਦੇ ਮਾਡਲ ਨਾਲੋਂ ਵਧੇਰੇ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੋਣਗੇ ਅਤੇ ਨਾਲ ਹੀ ਐਲਗੋਰਿਦਮਿਕ ਸੁਧਾਰ ਵੀ ਕਰਦੇ ਰਹਾਂਗੇ। ਅਤੇ ਬਦਲੇ ਵਿੱਚ, ਇਹ ਮਾਡਲ ਭਵਿੱਖ ਵਿੱਚ ਆਉਣ ਵਾਲੇ GPT ਰੀਲੀਜ਼ਾਂ ਨੂੰ ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਬਣਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰਨਗੇ।
ਅਸੀਂ ਇਸ ਹਫ਼ਤੇ ਦੇ ਅਖੀਰ ਵਿੱਚ ਹੋਰ ਵੇਰਵਿਆਂ ਦੇ ਨਾਲ ਪ੍ਰੀ-ਪ੍ਰਿੰਟ ਜਾਰੀ ਕਰਾਂਗੇ।


