ਮੁੱਖ ਸਮੱਗਰੀ 'ਤੇ ਜਾਓ
OpenAI

Astra ਵੱਲ ਰਾਹ: ਅਹਿਮ ਸਮਰੱਥਾਵਾਂ ਅਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਸੁਰੱਖਿਆ ਉਪਾਅ

ਲੋਡ ਹੋ ਰਿਹਾ ਹੈ…

Astra ਦੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾ ਦੇ ਅਹਿਮ ਪੱਧਰ ਤੱਕ ਪਹੁੰਚ ਸਕਣ ਬਾਰੇ ਸਾਡੇ ਪਿਛਲੇ ਮੁਲਾਂਕਣ ਤੋਂ ਬਾਅਦ, ਅਸੀਂ ਹੋਰ ਸਬੂਤ ਇਕੱਠੇ ਕੀਤੇ ਅਤੇ ਮਾਡਲ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਲਈ ਵਾਧੂ ਜਾਂਚਾਂ ਕੀਤੀਆਂ ਹਨ। ਹੁਣ ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ Astra ਸਾਡੇ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਅਧੀਨ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾ ਦੀ ਅਹਿਮ ਹੱਦ ਪੂਰੀ ਕਰਦਾ ਹੈ। ਇਸ ਦਾ ਅਰਥ ਹੈ ਕਿ ਸਹੀ ਸਾਧਨਾਂ ਅਤੇ ਪਹੁੰਚ ਨਾਲ ਇਹ ਬਹੁਤ ਸਾਰੇ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸੁਰੱਖਿਅਤ ਸਿਸਟਮਾਂ ਵਿੱਚ ਪਹਿਲਾਂ ਅਣਜਾਣ ਸੁਰੱਖਿਆ ਖਾਮੀਆਂ ਲੱਭ ਸਕਦਾ ਹੈ ਅਤੇ ਹਰ ਪੜਾਅ ’ਤੇ ਮਨੁੱਖੀ ਮਾਰਗਦਰਸ਼ਨ ਤੋਂ ਬਿਨਾਂ ਉਨ੍ਹਾਂ ਦਾ ਫਾਇਦਾ ਉਠਾਉਣ ਦੇ ਤਰੀਕੇ ਬਣਾ ਸਕਦਾ ਹੈ। ਇਹ ਪਹਿਲਾ ਮਾਡਲ ਹੈ ਜਿਸ ਨੂੰ ਅਸੀਂ ਇਸ ਪੱਧਰ ’ਤੇ ਰੱਖ ਰਹੇ ਹਾਂ ਅਤੇ ਇਸ ਲਈ ਵਿਕਾਸ ਦੌਰਾਨ ਤੇ ਰਿਲੀਜ਼ ਤੋਂ ਪਹਿਲਾਂ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਉਪਾਅ ਲੋੜੀਂਦੇ ਹਨ।

ਪਿਛਲੇ ਕਈ ਹਫ਼ਤਿਆਂ ਦੌਰਾਨ ਅਸੀਂ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਅਤੇ ਮਾਡਲ ਦੀਆਂ ਅਣਅਧਿਕਾਰਤ ਕਾਰਵਾਈਆਂ ਵਿਰੁੱਧ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਮਜ਼ਬੂਤ ਅਤੇ ਪਰਖਣ ਦੌਰਾਨ Astra ਦੇ ਵਿਕਾਸ ਅਤੇ ਰਿਲੀਜ਼ ਦੇ ਕੁਝ ਹਿੱਸਿਆਂ ਵਿੱਚ ਦੇਰੀ ਕੀਤੀ ਹੈ। ਉਸ ਕੰਮ ਦੇ ਆਧਾਰ ’ਤੇ ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ Astra ਦੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸਾਡੇ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਅਧੀਨ ਰਿਲੀਜ਼ ਲਈ ਗੰਭੀਰ ਨੁਕਸਾਨ ਦੇ ਜੋਖਮ ਨੂੰ ਕਾਫ਼ੀ ਹੱਦ ਤੱਕ ਘਟਾਉਂਦੇ ਹਨ।

ਭਾਵੇਂ Astra Hugging Face ਘਟਨਾ ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਸੀ, ਪਰ ਅਸੀਂ ਉਸ ਘਟਨਾ ਤੋਂ ਮਿਲੀਆਂ ਸਿੱਖਿਆਵਾਂ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੂੰ ਆਪਣੀ ਸੁਰੱਖਿਆ ਪਹੁੰਚ ਵਿੱਚ ਸ਼ਾਮਲ ਕੀਤਾ ਹੈ। ਪਿਛਲੀ ਜਾਂਚ ਦੇ ਆਧਾਰ ’ਤੇ ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ ਉਸ ਵੇਲੇ ਦੇ ਸਾਡੇ ਉਤਪਾਦਨ ਸੁਰੱਖਿਆ ਉਪਾਅ Hugging Face ਦੀ ਘਟਨਾ ਨੂੰ ਰੋਕ ਦਿੱਤਾ ਹੁੰਦਾ। ਉਦੋਂ ਤੋਂ ਅਸੀਂ Astra ਲਈ ਹੋਰ ਵੀ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਉਪਾਅ ਲਾਗੂ ਕੀਤੇ ਹਨ, ਜਿਸ ਵਿੱਚ ਨੁਕਸਾਨਦੇਹ ਸਾਈਬਰ ਬੇਨਤੀਆਂ ਨੂੰ ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਢੰਗ ਨਾਲ ਅਸਵੀਕਾਰ ਕਰਨ ਅਤੇ ਸੁਰੱਖਿਆ ਪਾਬੰਦੀਆਂ ਦਾ ਪਾਲਣ ਕਰਨ ਲਈ ਮਾਡਲ ਦੀ ਸਿਖਲਾਈ, ਦੁਰਵਰਤੋਂ ਵਿਰੁੱਧ ਵਾਧੂ ਸੁਰੱਖਿਆਵਾਂ, ਅਤੇ ਅਜਿਹੀ ਨਿਗਰਾਨੀ ਸ਼ਾਮਲ ਹੈ ਜੋ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਅਣਅਧਿਕਾਰਤ ਗਤੀਵਿਧੀਆਂ ਨੂੰ ਰੋਕ ਸਕਦੀ ਹੈ।

ਅਸੀਂ Astra ਨੂੰ ਜਲਦੀ ਉਪਲਬਧ ਕਰਾਉਣ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਹੇ ਹਾਂ, ਪਰ ਇਸ ਦੀਆਂ ਸਭ ਤੋਂ ਉੱਨਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਤੱਕ ਪਹੁੰਚ ਵੱਧ ਸੀਮਤ ਹੋਵੇਗੀ। ਉੱਨਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਕੰਮ ਸ਼ੁਰੂ ਵਿੱਚ ਜਾਂਚਕਰਤਾਵਾਂ ਦੇ ਇੱਕ ਸਮੂਹ ਲਈ ਉਪਲਬਧ ਹੋਵੇਗਾ। ਇਸ ਤੋਂ ਬਾਅਦ ਰੱਖਿਆਤਮਕ ਵਰਤੋਂ ਵਧਾਉਣ ਲਈ Daybreak Blue ਰਾਹੀਂ ਪਹੁੰਚ ਦਿੱਤੀ ਜਾਵੇਗੀ।

ਰਿਲੀਜ਼ ਵੇਲੇ ਅਸੀਂ ਮਾਡਲ ਦੇ ਸਿਸਟਮ ਕਾਰਡ ਵਿੱਚ ਆਪਣੀ ਸੁਰੱਖਿਆ, ਅਲਾਈਨਮੈਂਟ ਜਾਂਚ ਅਤੇ ਮੁਲਾਂਕਣਾਂ ਬਾਰੇ ਹੋਰ ਵੇਰਵੇ ਸਾਂਝੇ ਕਰਾਂਗੇ। ਰਿਲੀਜ਼ ਤੋਂ ਪਹਿਲਾਂ, ਅਸੀਂ ਇਸ ਪੱਧਰ ਦੀਆਂ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਾਲੇ ਮਾਡਲ ਨੂੰ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਰਿਲੀਜ਼ ਕਰਨ ਦੀ ਤਿਆਰੀ ਲਈ ਕੀਤੇ ਗਏ ਕੁਝ ਕੰਮਾਂ ਬਾਰੇ ਅੱਪਡੇਟ ਦੇਣਾ ਚਾਹੁੰਦੇ ਹਾਂ—ਅਤੇ ਕਿਹੜੇ ਖ਼ਤਰੇ ਬਾਕੀ ਹਨ, ਇਸ ਬਾਰੇ ਪਾਰਦਰਸ਼ੀ ਬਣਨਾ ਚਾਹੁੰਦੇ ਹਾਂ।

Astra ਦੀਆਂ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਦਾ ਮੁਲਾਂਕਣ

ਸਾਡੇ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਅਧੀਨ, ਮਾਡਲ ਹੇਠ ਲਿਖੀਆਂ ਸ਼ਰਤਾਂ ਵਿੱਚੋਂ ਕੋਈ ਇੱਕ ਪੂਰੀ ਕਰਨ ’ਤੇ ਅਹਿਮ ਹੱਦ ਪੂਰੀ ਕਰਦਾ ਹੈ:

  • ਮਾਡਲ ਮਨੁੱਖੀ ਦਖ਼ਲ ਤੋਂ ਬਿਨਾਂ ਅਸਲ ਦੁਨੀਆ ਦੇ ਕਈ ਮਜ਼ਬੂਤ ਅਹਿਮ ਸਿਸਟਮਾਂ ਵਿੱਚ ਹਰ ਗੰਭੀਰਤਾ ਪੱਧਰ ਦੇ ਕਾਰਜਸ਼ੀਲ ਜ਼ੀਰੋ-ਡੇ ਐਕਸਪਲੌਇਟ ਪਛਾਣ ਅਤੇ ਵਿਕਸਿਤ ਕਰ ਸਕਦਾ ਹੈ।
  • ਇਹ ਮਾਡਲ ਸਿਰਫ਼ ਇੱਕ ਹਾਈ-ਪੱਧਰੀ ਲੋੜੀਂਦੇ ਟੀਚੇ ਨੂੰ ਸਾਹਮਣੇ ਰੱਖ ਕੇ ਸਖ਼ਤ ਟੀਚਿਆਂ ਵਿਰੁੱਧ ਸਾਈਬਰ ਹਮਲਿਆਂ ਲਈ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਦੀਆਂ ਨਵੀਆਂ ਰਣਨੀਤੀਆਂ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਉਨ੍ਹਾਂ ਨੂੰ ਲਾਗੂ ਕਰ ਸਕਦਾ ਹੈ।

Astra ਦੇ ਸਾਡੇ ਤਿਆਰੀ ਮੁਲਾਂਕਣ ਵਿੱਚ ਸਵੈਚਾਲਿਤ ਜਨਤਕ ਅਤੇ ਨਿੱਜੀ ਮਾਪਦੰਡਾਂ ਨੂੰ ਮਾਹਰਾਂ ਦੀ ਅਗਵਾਈ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਨਾਲ ਜੋੜਿਆ ਗਿਆ ਹੈ। GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ Astra ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਵਾਧਾ ਦਰਸਾਉਂਦਾ ਹੈ: ਇਹ ਟੋਕਨ ਕੁਸ਼ਲਤਾ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਵੀ ਕਾਫ਼ੀ ਬਿਹਤਰ ਹੈ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਐਕਸਪਲੌਇਟ ਵਿਕਸਿਤ ਕਰਨ ਵਿੱਚ ਵੀ ਵਧੇਰੇ ਸਮਰੱਥ ਹੈ।

ਇੱਕ ਉਦਾਹਰਨ ਵਜੋਂ, ਅਸੀਂ Astra ਨੂੰ ExploitBench ’ਤੇ ਚਲਾਇਆ, ਜਿੱਥੇ ਜਾਣੀਆਂ-ਪਛਾਣੀਆਂ ਕਮਜ਼ੋਰੀਆਂ ਤੋਂ ਐਕਸਪਲੌਇਟ ਬਣਾਉਣ ਦੀ ਮਾਡਲ ਦੀ ਸਮਰੱਥਾ ਮਾਪਣ ਵਾਲੇ ਇਸ ਮਾਪਦੰਡ ’ਤੇ ਇਸ ਨੇ 100% ਦਾ ਸੰਪੂਰਨ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ।

ਡਾਟਾ ਮਿਲਾਵਟ ਦੀਆਂ ਚਿੰਤਾਵਾਂ ਕਾਰਨ ਅਸੀਂ ਫਿਰ “ExploitBench - ਅੰਦਰੂਨੀ ਪੋਰਟ (ਜੂਨ–ਅਗਸਤ 2026)” ਨਾਂ ਦਾ ਅੰਦਰੂਨੀ ਮਾਪਦੰਡ ਬਣਾਇਆ, ਜਿਸ ਵਿੱਚ ਹਾਲ ਹੀ ਵਿੱਚ ਜਨਤਕ ਕੀਤੀਆਂ 20 ਹਾਈ-ਗੰਭੀਰਤਾ ਵਾਲੀਆਂ V8 ਕਮਜ਼ੋਰੀਆਂ ਹਨਇਸ ਡਾਟਾਸੈੱਟ ’ਤੇ Astra ਬਹੁਤ ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ GPT‑5.6 Sol ਨਾਲੋਂ ਕਿਤੇ ਵੱਧ ਮਨਮਾਨੇ ਕੋਡ-ਚਲਾਉਣ ਦੀਆਂ ਦਰਾਂ ਹਾਸਲ ਕਰਦਾ ਹੈ। ਮੁਲਾਂਕਣ ਦੌਰਾਨ ਮਾਡਲ ਨੇ ਐਕਸਪਲੌਇਟ ਲੜੀ ਦੇ ਹਿੱਸੇ ਵਜੋਂ ਦੋ ਜ਼ੀਰੋ-ਡੇ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਖੋਜ ਵੀ ਕੀਤੀ ਅਤੇ ਉਨ੍ਹਾਂ ਦੀ ਵਰਤੋਂ ਵੀ ਕੀਤੀ। ਅਸੀਂ ਇਨ੍ਹਾਂ ਦੋਵਾਂ ਕਮਜ਼ੋਰੀਆਂ ਬਾਰੇ ਰੱਖ-ਰਖਾਅ ਕਰਨ ਵਾਲਿਆਂ ਨੂੰ ਜਾਣਕਾਰੀ ਦੇਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ ਹਾਂ।

ਦਿਖਾਏ ਗਏ Astra ਦੇ ਨਤੀਜੇ Daybreak Blue ਦੀ ਪਹੁੰਚ ਨਾਲ ਮਿਲੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦਰਸਾਉਂਦੇ ਹਨ, ਨਾ ਕਿ ਮੂਲ ਉਤਪਾਦਨ ਸੰਰਚਨਾ।

ਇੱਕ ਮਜ਼ਬੂਤ ਬ੍ਰਾਊਜ਼ਰ ਅਤੇ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ ਵਿਰੁੱਧ ਮਾਹਰਾਂ ਦੀ ਅਗਵਾਈ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ Astra ਨੇ ਪਹਿਲਾਂ ਅਣਜਾਣ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭੀਆਂ ਅਤੇ ਉਨ੍ਹਾਂ ਨੂੰ ਕਾਰਜਸ਼ੀਲ ਐਕਸਪਲੌਇਟ ਲੜੀਆਂ ਵਿੱਚ ਬਦਲਿਆ ਹੈ। ਜਦੋਂ ਬ੍ਰਾਊਜ਼ਰ ਨੇ ਇੱਕ HTML ਫ਼ਾਈਲ ਖੋਲੀ, ਤਾਂ ਇਸ ਨੇ ਇੱਕ ਪੂਰੀ ਬ੍ਰਾਊਜ਼ਰ-ਕੰਪਰੋਮਾਈਜ਼ ਚੇਨ ਬਣਾਈ ਜਿਸ ਨੇ ਸੈਂਡਬਾਕਸ ਤੋਂ ਬਾਹਰ ਨਿਕਲ ਕੇ ਹੋਸਟ ਉੱਤੇ ਕਮਾਂਡਾਂ ਚਲਾਈਆਂ। ਮਾਡਲ ਨੇ ਇੱਕ ਹਾਰਡਨਡ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ ਵਿੱਚ ਕਈ ਕਮਜ਼ੋਰੀਆਂ ਵੀ ਲੱਭੀਆਂ ਅਤੇ ਉਨ੍ਹਾਂ ਨੂੰ ਜੋੜ ਕੇ ਇੱਕ ਗੈਰ-ਵਿਸ਼ੇਸ਼ ਅਧਿਕਾਰ ਪ੍ਰਾਪਤ ਵਰਤੋਂਕਾਰ ਤੋਂ ਰੂਟ ਤੱਕ ਦੀ ਲੋਕਲ ਪ੍ਰਿਵਿਲੇਜ-ਐਸਕੈਲੇਸ਼ਨ ਚੇਨ ਤਿਆਰ ਕੀਤੀ। ਸਮੁੱਚੇ ਤੌਰ ’ਤੇ ਸਾਡੀ ਜਾਂਚ ਨੇ ਸਾਨੂੰ ਇਸ ਨਤੀਜੇ ’ਤੇ ਪਹੁੰਚਾਇਆ ਹੈ ਕਿ Astra ਨਾਜ਼ੁਕ ਸੀਮਾ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ।

ਅਹਿਮ ਸਮਰੱਥਾਵਾਂ ਲਈ ਲੋੜੀਂਦੇ ਸੁਰੱਖਿਆ ਉਪਾਅ

Astra ਦੇ ਪੱਧਰ ਦੀਆਂ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਾਲੇ ਮਾਡਲਾਂ ਲਈ, ਸਾਨੂੰ ਵਿਕਾਸ ਦੌਰਾਨ ਅਤੇ ਤਾਇਨਾਤੀ ਤੋਂ ਪਹਿਲਾਂ ਦੋਵਾਂ ਪੜਾਵਾਂ 'ਤੇ ਗੰਭੀਰ ਸਾਈਬਰ ਨੁਕਸਾਨ ਦੇ ਜੋਖਮ ਨੂੰ ਘੱਟ ਕਰਨ ਲਈ ਦੋ ਰਸਤਿਆਂ ਨੂੰ ਅਪਣਾਉਣ ਦੀ ਲੋੜ ਹੈ:

  • ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ ਖਤਰਨਾਕ ਅਨਸਰ। ਸਾਡੇ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਖਤਰਨਾਕ ਅਨਸਰਾਂ ਵੱਲੋਂ Astra ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਮਜ਼ਬੂਤ ਅਹਿਮ ਸਿਸਟਮਾਂ ਦੀਆਂ ਪਹਿਲਾਂ ਅਣਜਾਣ ਖਾਮੀਆਂ ਲਈ ਐਕਸਪਲੌਇਟ ਬਣਾਉਣ ਜਾਂ ਮਜ਼ਬੂਤ ਨਿਸ਼ਾਨਿਆਂ ਵਿਰੁੱਧ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਹਮਲੇ ਕਰਨ ਤੋਂ ਭਰੋਸੇਯੋਗ ਢੰਗ ਨਾਲ ਰੋਕਣਾ ਚਾਹੀਦਾ ਹੈ।
  • ਮਾਡਲ ਵੱਲੋਂ ਅਣਅਧਿਕਾਰਤ ਅਤੇ ਗਲਤ ਢੰਗ ਨਾਲ ਕਾਰਵਾਈਆਂ ਕਰਨਾ। ਖਤਰਨਾਕ ਵਰਤੋਂਕਾਰ ਨਾ ਹੋਣ ਦੇ ਬਾਵਜੂਦ, ਉੱਨਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਾਲਾ ਮਾਡਲ ਜੇਕਰ ਟੀਚਿਆਂ ਨਾਲੋਂ ਬੇਮੇਲ ਹੋਵੇ, ਤਾਂ ਉਹ ਖ਼ੁਦ ਸਾਈਬਰ ਨੁਕਸਾਨ ਪਹੁੰਚਾ ਸਕਦਾ ਹੈ। ਇਨ੍ਹਾਂ ਸਮਰੱਥਾਵਾਂ ਵਾਲੇ ਮਾਡਲਾਂ ਲਈ ਅਲਾਈਨਮੈਂਟ ਦਾ ਮਿਆਰ ਬਹੁਤ ਹਾਈ ਰੱਖਣ ਤੋਂ ਇਲਾਵਾ, ਬਚਾਅ ਦੀ ਦੂਜੀ ਪਰਤ ਵਜੋਂ ਸਾਡੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਅਸਲ-ਸੰਸਾਰ ਵਿੱਚ ਵੱਡਾ ਨੁਕਸਾਨ ਪਹੁੰਚਾਉਣ ਵਾਲੀਆਂ ਅਜਿਹੀਆਂ ਬੇਮੇਲ ਕਾਰਵਾਈਆਂ ਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਪਛਾਣਨ ਅਤੇ ਰੋਕਣ ਦੇ ਸਮਰੱਥ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ।

ਦੂਜਾ ਰਾਹ ਖਾਸ ਤੌਰ ’ਤੇ ਅੰਦਰੂਨੀ ਵਿਕਾਸ ਅਤੇ ਬਾਹਰੀ ਤਾਇਨਾਤੀ ਦੋਵਾਂ ’ਤੇ ਲਾਗੂ ਹੁੰਦਾ ਹੈ। ਜਿਵੇਂ ਅਸੀਂ ਪਹਿਲਾਂ ਦੱਸਿਆ ਸੀ, OpenAI-Hugging Face ਘਟਨਾ ਤੋਂ ਬਾਅਦ, ਆਪਣੇ ਟ੍ਰੇਨਿੰਗ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਨ ਲਈ, ਜਿਸ ਵਿੱਚ ਅਲੱਗ-ਥਲੱਗ ਰੱਖਣਾ ਅਤੇ ਨੈੱਟਵਰਕ ਨਿਯੰਤਰਣ, ਵਿਸਤ੍ਰਿਤ ਨਿਗਰਾਨੀ, ਅਤੇ ਮਜ਼ਬੂਤ ਅਲਾਈਨਮੈਂਟ ਟ੍ਰੇਨਿੰਗ ਤੇ ਥਰੈਸ਼ਹੋਲਡ ਸ਼ਾਮਲ ਸਨ, ਅਸੀਂ (Astra ਦੀਆਂ ਕੁਝ ਖ਼ਾਸ ਅਤਿ-ਆਧੁਨਿਕ ਟ੍ਰੇਨਿੰਗਾਂ) ਦੋ ਹਫ਼ਤਿਆਂ ਲਈ ਰੋਕ ਦਿੱਤੀਆਂ ਸਨ। ਇਸ ਤੋਂ ਬਾਅਦ, ਅਸੀਂ ਸਖ਼ਤ ਨਿਯੰਤਰਣਾਂ ਤਹਿਤ ਛੋਟੇ ਪੱਧਰ ਦਾ ਕੰਮ ਜਾਰੀ ਰੱਖਿਆ।

ਅਸੀਂ Astra ਦੇ ਭਵਿੱਖੀ ਸੰਸਕਰਣਾਂ ਲਈ ਕੁਝ ਵੱਡੇ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ (RL) ਰਨ ਹੋਰ ਲੰਮੇ ਸਮੇਂ ਤੱਕ ਰੋਕੇ ਰੱਖੇ, ਜਦੋਂ ਤੱਕ ਕਿ ਅਸੀਂ ਉਨ੍ਹਾਂ ਦੇ ਸਿਖਲਾਈ ਮਾਹੌਲ ਦੀ ਸੁਰੱਖਿਆ ਲਈ ਹਾਈ ਮਿਆਰ ਸਥਾਪਤ ਨਹੀਂ ਕਰ ਲਏ। 28 ਅਗਸਤ ਨੂੰ ਨਵੀਆਂ ਸੁਰੱਖਿਆ ਲੋੜਾਂ ਲਾਗੂ ਕੀਤੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਅਸੀਂ ਉਸ ਵੱਡੀ ਅਤਿ-ਆਧੁਨਿਕ RL ਰਨ ਨੂੰ ਦੁਬਾਰਾ ਸ਼ੁਰੂ ਕਰ ਦਿੱਤਾ ਜਿਸਨੂੰ ਪਹਿਲਾਂ ਰੋਕਿਆ ਗਿਆ ਸੀ। ਅਸੀਂ ਕੁਝ ਛੋਟੇ ਪ੍ਰਯੋਗਿਕ ਸਿਖਲਾਈ ਦੌਰਾਂ ਨੂੰ ਅਜੇ ਵੀ ਅਸਥਾਈ ਤੌਰ 'ਤੇ ਰੋਕ ਕੇ ਰੱਖ ਰਹੇ ਹਾਂ।

Astra ਨੂੰ ਰਿਲੀਜ਼ ਲਈ ਤਿਆਰ ਕਰਨ ਵਾਸਤੇ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਅਤੇ ਅਣਅਧਿਕਾਰਤ ਕਾਰਵਾਈਆਂ ਵਿਰੁੱਧ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਵੀ ਲੋੜੀਂਦੀ ਰਹੀ ਹੈ। ਹੇਠਾਂ ਅਸੀਂ ਉਨ੍ਹਾਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਅਤੇ ਉਨ੍ਹਾਂ ਦੀ ਜਾਂਚ ਦੇ ਤਰੀਕੇ ਬਾਰੇ ਦੱਸਦੇ ਹਾਂ।

ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਵਿਰੁੱਧ ਮਜ਼ਬੂਤੀ

ਫਰਵਰੀ ਵਿੱਚ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਦੀ ਹਾਈ ਸਮਰੱਥਾ ਵਾਲਾ ਮੰਨਿਆ ਗਿਆ ਪਹਿਲਾ ਮਾਡਲ ਤਾਇਨਾਤ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਅਸੀਂ ਹਰ ਅਗਲੀ ਰਿਲੀਜ਼ ਨਾਲ ਆਪਣੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਉਪਾਅ ਮਜ਼ਬੂਤ ਕੀਤੇ ਹਨ। ਸਾਡੀ ਸਮੁੱਚੀ ਸੁਰੱਖਿਆ ਪਹੁੰਚ ਵਿੱਚ ਪੋਸਟ-ਟ੍ਰੇਨਡ ਮਾਡਲ ਵੱਲੋਂ ਇਨਕਾਰ, ਸਿਸਟਮ-ਪੱਧਰੀ ਸੁਰੱਖਿਆ ਵਰਗੀਕਰਤਾ, ਆਫਲਾਈਨ ਪਛਾਣ ਅਤੇ ਖਤਰੇ ਨੂੰ ਰੋਕਣ ਦੀਆਂ ਪਰਤਾਂ ਸ਼ਾਮਲ ਹਨ।

GPT‑5.6(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਲਈ ਅਸੀਂ ਆਪਣੇ ਸਿਸਟਮ-ਪੱਧਰੀ ਢਾਂਚੇ ਦੀ ਮਜ਼ਬੂਤੀ ਵਿੱਚ ਕਾਫ਼ੀ ਸੁਧਾਰ ਕੀਤਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਦਾ ਪਤਾ ਲਗਾਉਣ ਲਈ ਐਕਟੀਵੇਸ਼ਨ ਕਲਾਸੀਫਾਇਰ ਜੋੜਨਾ ਅਤੇ ਵਿਆਪਕ ਸਵੈਚਾਲਿਤ ਰੈਡ ਟੀਮਿੰਗ ਰਾਹੀਂ ਲੱਭੇ ਗਏ ਯੂਨੀਵਰਸਲ ਜੇਲ੍ਹਬਰੇਕਸ 'ਤੇ ਕਵਰੇਜ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣਾ ਸ਼ਾਮਲ ਹੈ। ਇਨ੍ਹਾਂ ਸੁਧਾਰਾਂ ਦੇ ਆਧਾਰ ’ਤੇ, ਅਸੀਂ Astra ਲਈ ਆਪਣੇ ਸੁਰੱਖਿਆ ਢਾਂਚੇ ਦੀ ਮਾਡਲ ਪਰਤ ਵਿੱਚ ਹੋਰ ਨਿਵੇਸ਼ ਕੀਤਾ ਹੈ ਅਤੇ ਸਾਡੇ ਸੇਫਗਾਰਡਸ ਦੀ ਕਰਾਸ-ਕਨਵਰਸੇਸ਼ਨ ਪ੍ਰਸੰਗ ਨੂੰ ਸੰਭਾਲਣ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਵੀ ਬਿਹਤਰ ਬਣਾਇਆ ਹੈ।

  • ਮਾਡਲ ਦੀ ਮਜ਼ਬੂਤੀ ਲਈ ਨਵੀਆਂ ਟ੍ਰੇਨਿੰਗ ਤਕਨੀਕਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਿਆਂ, Astra ਪਾਬੰਦੀਸ਼ੁਦਾ ਸਾਈਬਰ ਸਹਾਇਤਾ ਲਈ ਕੀਤੀਆਂ ਜਾਣ ਵਾਲੀਆਂ ਬੇਨਤੀਆਂ ਨੂੰ ਹੋਰ ਵੀ ਮਜ਼ਬੂਤੀ ਨਾਲ ਅਸਵੀਕਾਰ ਕਰਦਾ ਹੈ। ਸਾਡੇ ਸਾਈਬਰ ਜੇਲ੍ਹਬ੍ਰੇਕ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ Astra 91.5% ਬੇਨਤੀਆਂ ਰੱਦ ਕਰਦਾ ਹੈ, ਜਦਕਿ (GPT‑5.6 Sol 59%) ਬੇਨਤੀਆਂ ਰੱਦ ਕਰਦਾ ਹੈ।
  • ਹਾਈ ਜੋਖਮ ਵਾਲੇ ਮੰਨੇ ਗਏ ਖਾਤਿਆਂ ਲਈ, ਅਸੀਂ ਮਾਡਲ ਵਿਹਾਰ ਦੀ ਵਧੇਰੇ ਸੰਜਮੀ ਹੱਦ ਲਾਗੂ ਕਰਦੇ ਹਾਂ, ਜੋ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਖ਼ਤਰਨਾਕ ਸਾਈਬਰ ਸਹਾਇਤਾ ਦੀ ਵਿਸ਼ਾਲ ਸ਼੍ਰੇਣੀ ਨੂੰ ਅਸਵੀਕਾਰ ਕਰਦੀ ਹੈ। ਹਾਈ ਜੋਖਮ ਵਾਲੇ ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਅਸੀਂ ਆਪਣੇ ਨਿਗਰਾਨੀ ਸਿਸਟਮਾਂ ਦੇ ਸੰਦਰਭ ਦਾ ਦਾਇਰਾ ਵਧਾ ਦਿੱਤਾ ਹੈ, ਤਾਂ ਜੋ ਇਸ ਕਿਸਮ ਦੀ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਦਾ ਪਤਾ ਲਾਇਆ ਜਾ ਸਕੇ।

ਅਸੀਂ ਸਖ਼ਤ ਜਾਂਚ, ਅੰਦਰੂਨੀ ਅਤੇ ਬਾਹਰੀ ਰੈਡ ਟੀਮਿੰਗ ਅਤੇ ਖਾਮੀਆਂ ਦੂਰ ਕਰਨ ਦਾ ਆਪਣਾ ਪ੍ਰੋਗਰਾਮ ਵੀ ਜਾਰੀ ਰੱਖਿਆ ਹੈ। ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਪਿਛੜੀ ਜਾਂਚ ਕਰਨ ਤੋਂ ਇਲਾਵਾ ਕਿ ਸਾਡੀਆਂ ਪਿਛਲੀਆਂ ਜਾਂਚ ਮਿਆਦਾਂ ਵਿੱਚ ਮਿਲੇ ਸਾਰੇ ਜੇਲ੍ਹਬ੍ਰੇਕ ਹਾਲੇ ਵੀ ਕਵਰ ਹਨ, ਅਸੀਂ ਆਪਣੇ ਨਵੀਨਤਮ ਅੰਦਰੂਨੀ ਰੈਡ ਟੀਮਿੰਗ ਹਮਲਾਵਰਾਂ ਨਾਲ ਰੈਡ ਟੀਮਿੰਗ ਦਾ ਨਵਾਂ ਦੌਰ ਚਲਾ ਰਹੇ ਹਾਂ। ਅਸੀਂ ਉਦਯੋਗਿਕ ਭਾਈਵਾਲਾਂ ਨਾਲ ਮਿਲ ਕੇ ਸਾਂਝੀ ਜੇਲ੍ਹਬਰੇਕ ਰੇਟਿੰਗ ਪ੍ਰਣਾਲੀ ਤਿਆਰ ਕਰ ਰਹੇ ਹਾਂ, ਅਤੇ ਨਵੀਆਂ ਖੋਜਾਂ ਦੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਉਨ੍ਹਾਂ ਦਾ ਹੱਲ ਕੱਢਣ ਲਈ ਆਪਣੇ 24/7 ਤੇਜ਼-ਜਵਾਬ ਪ੍ਰੋਗਰਾਮ ਦੀ ਵਰਤੋਂ ਕਰਾਂਗੇ। ਅਸੀਂ Astra ਦੇ ਸਿਸਟਮ ਕਾਰਡ ਵਿੱਚ ਆਪਣੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਜਾਂਚ ਬਾਰੇ ਹੋਰ ਵੇਰਵੇ ਸਾਂਝੇ ਕਰਾਂਗੇ।

ਰੱਖਿਆਕਰਤਾਵਾਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਅਤੇ ਠੀਕ ਕਰਨ ਵਿੱਚ ਮਦਦ ਦੇਣਾ ਸਾਡੀ ਸੁਰੱਖਿਆ ਪਹੁੰਚ ਦਾ ਕੇਂਦਰੀ ਥੰਮ੍ਹ ਹੈ। ਰਿਲੀਜ਼ ਵੇਲੇ ਸੰਭਾਵੀ ਦੁਰਵਰਤੋਂ ਤੋਂ ਬਚਾਅ ਲਈ Astra ਦੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸਾਡੀ ਅੰਤਿਮ ਮਨਸ਼ਾ ਨਾਲੋਂ ਵੱਧ ਰੁਕਾਵਟ ਪੈਦਾ ਕਰ ਸਕਦੇ ਹਨ। ਉੱਨਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਕਾਰਜ-ਪ੍ਰਵਾਹਾਂ ਲਈ Astra ਦੀ ਪਹੁੰਚ ਸ਼ੁਰੂ ਵਿੱਚ ਅਲਫ਼ਾ ਜਾਂਚਕਰਤਾਵਾਂ ਦੇ ਛੋਟੇ ਸਮੂਹ ਨੂੰ ਮਿਲੇਗੀ, ਅਤੇ ਬਾਅਦ ਵਿੱਚ ਰੱਖਿਆਤਮਕ ਵਰਤੋਂ ਦਾ ਸਮਰਥਨ ਕਰਨ ਲਈ Daybreak Blue ਰਾਹੀਂ ਇਸ ਦਾ ਦਾਇਰਾ ਵਧਾਇਆ ਜਾਵੇਗਾ।

ਅਲਾਈਨਮੈਂਟ ਅਤੇ ਨਿਗਰਾਨੀ

ਅਸੀਂ ਮਾਡਲ ਨੂੰ ਸੰਭਾਵੀ ਤੌਰ ’ਤੇ ਉਦੇਸ਼ਾਂ ਨਾਲ ਬੇਮੇਲ ਕਾਰਵਾਈਆਂ ਕਰਨ ਤੋਂ ਰੋਕਣ ਲਈ ਵਾਧੂ ਪਰਤਦਾਰ ਸੁਰੱਖਿਆ ਵੀ ਜੋੜੀ ਹੈ:

  • ਮਾਡਲ ਅਲਾਈਨਮੈਂਟ: ਸਾਡੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ Astra ਨੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਸਪੱਸ਼ਟ ਸੁਰੱਖਿਆ ਪਾਬੰਦੀਆਂ ਦਾ ਆਦਰ ਕਰਨ ਅਤੇ ਆਪਣੇ ਅਧਿਕਾਰਤ ਦਾਇਰੇ ਵਿੱਚ ਰਹਿਣ ਦੀ ਕਿਤੇ ਵੱਧ ਸੰਭਾਵਨਾ ਦਿਖਾਈ, ਜਿਸ ਨਾਲ ਇਹ ਹੁਣ ਤੱਕ ਦਾ ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਬਣਿਆ ਹੈ। ਅਸੀਂ ਖਾਸ ਤੌਰ 'ਤੇ ਸੁਰੱਖਿਆ ਅਤੇ ਸੁਰੱਖਿਆ ਪਾਬੰਦੀਆਂ ਪ੍ਰਤੀ ਮਾਡਲ ਦੇ ਆਦਰ ਅਤੇ ਇਸ ਦੇ ਆਪਣੇ ਅਧਿਕਾਰਤ ਦਾਇਰੇ ਵਿੱਚ ਰਹਿਣ ਦੇ ਰੁਝਾਨ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕੀਤਾ।
  • ਨਿਗਰਾਨੀ ਅਤੇ ਨਿਯੰਤਰਣ: ਆਪਣੀਆਂ ਅੰਦਰੂਨੀ ਪ੍ਰਕਿਰਿਆਵਾਂ ਵਾਂਗ, ਅਸੀਂ Astra ਨੂੰ ਵਾਧੂ ਚੇਨ-ਆਫ-ਥੌਟ ਨਿਗਰਾਨੀ ਨਾਲ ਤਾਇਨਾਤ ਕਰ ਰਹੇ ਹਾਂ, ਤਾਂ ਜੋ ਸੰਭਾਵੀ ਬੇਮੇਲ ਕਾਰਵਾਈਆਂ ਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਪਛਾਣਿਆ ਅਤੇ ਰੋਕਿਆ ਜਾ ਸਕੇ।

Astra ਮਾਡਲ ਅਲਾਈਨਮੈਂਟ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਰੱਕੀ ਹੈ ਅਤੇ ਲੰਮੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੀਆਂ ਕਈ ਅਲਾਈਨਮੈਂਟ ਕਾਰਜਧਾਰਾਵਾਂ ਦਾ ਨਤੀਜਾ ਹੈ, ਜਿਨ੍ਹਾਂ ਵਿੱਚ (ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ ਦਖ਼ਲਾਂ ਤੋਂ ਲੈ ਕੇ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ) ਦੌਰਾਨ ਵਧੇਰੇ ਸਾਵਧਾਨ ਅਤੇ ਇਕਸਾਰ ਗ੍ਰੇਡਿੰਗ ਤੱਕ ਸ਼ਾਮਲ ਹਨ। ਟੈਸਟਿੰਗ ਦੌਰਾਨ ਅਸੀਂ ਦੇਖਦੇ ਹਾਂ ਕਿ GPT 5.6 Sol ਦੇ ਮੁਕਾਬਲੇ Astra ਸਪੱਸ਼ਟ ਸੁਰੱਖਿਆ ਪਾਬੰਦੀਆਂ ਅਤੇ ਚੇਤਾਵਨੀਆਂ (ਜਿਵੇਂ ਕਿ ਸਵੈ-ਸਮੀਖਿਆ) ਦਾ ਲਗਾਤਾਰ ਵੱਧ ਪਾਲਣ ਕਰਦਾ ਹੈ।

ਅਸੀਂ Hugging Face ਦੀ ਘਟਨਾ ਤੋਂ ਸੇਧ ਲੈ ਕੇ ਇੱਕ ਟੈਸਟ ਵੀ ਤਿਆਰ ਕੀਤਾ, ਜਿਸ ਵਿੱਚ ExploitGym ਸਾਈਬਰ ਮੁਲਾਂਕਣ ਚਲਾ ਰਹੇ ਏਜੰਟਾਂ ਨੇ ਇੱਕ ਤੀਜੀ ਧਿਰ ਦੇ ਸਿਸਟਮਾਂ ਨੂੰ ਕੰਪਰੋਮਾਈਜ਼ ਕੀਤਾ। ਅਸੀਂ ਉਸ ਮੁਲਾਂਕਣ ਦੇ ਸਭ ਤੋਂ ਔਖੇ ਕੰਮਾਂ ਨਾਲ “ਹਨੀਪੌਟ” ਜਾਂਚਾਂ ਬਣਾਈਆਂ, ਤਾਂ ਜੋ ਪਤਾ ਲੱਗੇ ਕਿ ਕੀ ਮਾਡਲ ਸੌਂਪਿਆ ਕੰਮ ਹੱਲ ਕਰਨ ਦੀ ਥਾਂ ਆਲੇ-ਦੁਆਲੇ ਦੇ ਸੁਰੱਖਿਆ ਢਾਂਚੇ ਵਿੱਚ ਸੰਨ੍ਹ ਲਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੇਗਾ। ਉਤਪਾਦਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ GPT‑5.6 Sol ਨੇ ਮਾਪਦੰਡ ਮਾਹੌਲ ਦੀ ਨਕਲ ਕਰਨ ਵਾਲੀਆਂ 56% ਜਾਂਚਾਂ ਵਿੱਚ ਉਨ੍ਹਾਂ ਨਿਸ਼ਾਨਿਆਂ ਤੱਕ ਪਹੁੰਚ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ, ਜਿੱਥੇ ਮਾਡਲ ਨੂੰ ਐਕਸਪਲੌਇਟ ਬਣਾਉਣ ਲਈ ਕਿਹਾ ਗਿਆ ਸੀ। ਇਨ੍ਹਾਂ ਜਾਂਚਾਂ ਵਿੱਚ Astra ਨੇ ਅਜਿਹੀ ਕੋਈ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕੀਤੀ। ਇਹ ਅੰਕੜੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਜਾਂਚ ਦੀਆਂ ਸਥਿਤੀਆਂ ਵਿੱਚ ਵਿਵਹਾਰ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ, ਨਾ ਕਿ ਆਮ ਉਤਪਾਦਨ ਵਰਤੋਂ।

ਖੱਬੇ: ਇਸ ਨਵੇਂ ਮੁਲਾਂਕਣ ਵਿੱਚ ਅਸੀਂ ਦੇਖਦੇ ਹਾਂ ਕਿ ਮਾਡਲ ਸਵੈ-ਸਮੀਖਿਆ ਵੱਲੋਂ ਰੱਦ ਕੀਤੇ ਜਾਣ ’ਤੇ ਕਿਵੇਂ ਪ੍ਰਤੀਕਿਰਿਆ ਕਰਦੇ ਹਨ। ਹਰ ਕੰਮ ਗਿਆਨ-ਅਧਾਰਿਤ ਕਾਰਜ ਮਾਹੌਲ ਵਿੱਚ ਰੱਖਿਆ ਗਿਆ ਹੈ ਅਤੇ ਰੋਲਆਊਟ ਸਵੈ-ਸਮੀਖਿਆ ਵੱਲੋਂ ਇਨਕਾਰ ਤੋਂ ਤੁਰੰਤ ਬਾਅਦ ਸ਼ੁਰੂ ਹੁੰਦਾ ਹੈ। ਇਸ ਤੋਂ ਬਾਅਦ ਮਾਡਲ ਕੋਲ ਅੱਗੇ ਵਧਣ ਦੇ ਕਈ ਤਰੀਕੇ ਹਨ: ਕਾਰਵਾਈ-ਕ੍ਰਮ ਨੂੰ ਖ਼ਤਮ ਕਰਨਾ, ਕੋਈ ਸੁਰੱਖਿਅਤ ਬਦਲ ਲੱਭਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਨਾ, ਕਿਸੇ ਮਿਲਦੀ-ਜੁਲਦੀ ਕਮਾਂਡ ਨੂੰ ਮੁੜ ਅਜ਼ਮਾਉਣਾ, ਜਾਂ ਸਵੈ-ਸਮੀਖਿਆ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬਾਈਪਾਸ ਕਰਨ ਲਈ ਕਿਸੇ ਖਰਾਬ ਸੰਰਚਨਾ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦਾ ਐਕਸਪਲੌਇਟ ਕਰਨਾ। ਆਖਰੀ ਦੋ ਵਿਕਲਪਾਂ ਵਿੱਚੋਂ ਕਿਸੇ ਨੂੰ ਵੀ ਅਪਣਾਉਣਾ ਇਸ ਮੁਲਾਂਕਣ ਵਿੱਚ ਅਸਫਲਤਾ ਮੰਨਿਆ ਜਾਵੇਗਾ। Astra ਨੇ ਕਦੇ ਵੀ ਸਵੈ-ਸਮੀਖਿਆ ਨੂੰ ਲਾਂਘਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕੀਤੀ।
ਸੱਜੇ: ਇਸ ਮੁਲਾਂਕਣ ਵਿੱਚ ਅਸੀਂ ਜਾਂਚਦੇ ਹਾਂ ਕਿ ExploitGym ਮੁਲਾਂਕਣ ਦੇ ਸਭ ਤੋਂ ਔਖੇ ਜਾਂ ਅਸੰਭਵ ਕੰਮਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਨ ਵੇਲੇ ਮਾਡਲ ਵਿੱਚ ਧੋਖਾ ਕਰਨ (“ਹਨੀਪੌਟਾਂ” ਦੀ ਵਰਤੋਂ ਕਰਨ) ਦੀ ਕਿੰਨੀ ਪ੍ਰਵਿਰਤੀ ਹੈ। ਮਾਡਲ ਦੇ ਵਿਹਾਰ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਲਈ ਇਹ ਜਾਂਚ ਨਕਲੀ ਮਾਹੌਲ ਵਿੱਚ ਸਿਰਫ਼ ਨਿਗਰਾਨੀ ਮੋਡ ਵਾਲੇ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨਾਲ ਚਲਾਈ ਗਈ। ਇਨ੍ਹਾਂ ਸਥਿਤੀਆਂ ਵਿੱਚ GPT‑5.6 Sol ਨੇ ਧੋਖਾ ਕਰਨ ਦੀ ਹਾਈ ਸੰਭਾਵਨਾ ਦਿਖਾਈ, ਪਰ Astra ਨੇ ਇਨ੍ਹਾਂ ਛੋਟੇ ਰਾਹਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕੀਤੀ ਅਤੇ ਫਿਰ ਵੀ ਕੁਝ ਕੰਮ ਜਾਇਜ਼ ਢੰਗ ਨਾਲ ਹੱਲ ਕਰ ਸਕਿਆ।

ਮਾਡਲਾਂ ਨੂੰ ਅਲਾਈਨ ਹੋਣ ਲਈ ਟ੍ਰੇਨ ਕਰਨਾ ਸੁਰੱਖਿਆ ਦੀ ਇੱਕ ਪਰਤ ਹੈ। ਅਸੀਂ Astra ਦੇ ਸਿਸਟਮ ਕਾਰਡ ਵਿੱਚ ਆਪਣੀ ਅਲਾਈਨਮੈਂਟ ਜਾਂਚ ਅਤੇ ਨਤੀਜਿਆਂ ਬਾਰੇ ਹੋਰ ਵੇਰਵੇ ਸਾਂਝੇ ਕਰਾਂਗੇ।

ਅਸੀਂ ਸੰਭਾਵੀ ਮਿਸਅਲਾਈਨਮੈਂਟ ਦਾ ਪਤਾ ਲਗਾਉਣ ਅਤੇ ਇਸ ਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਰੋਕਣ ਲਈ Astra-ਸ਼੍ਰੇਣੀ ਦੇ ਮਾਡਲਾਂ ਵਾਸਤੇ ਉਤਪਾਦਨ ਵਿੱਚ ਮਿਸਅਲਾਈਨਮੈਂਟ ਨਿਗਰਾਨੀ ਵੀ ਤਾਇਨਾਤ ਕਰ ਰਹੇ ਹਾਂ। ਇਹ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸਾਡੀਆਂ ਅੰਦਰੂਨੀ ਤਾਇਨਾਤੀਆਂ ਦੀ ਨਿਗਰਾਨੀ ਵਰਗੇ ਹਨ। ਇਨ੍ਹਾਂ ਵਿੱਚ ਵਰਗੀਕਰਤਾਵਾਂ ਦੀ ਇੱਕ ਪ੍ਰਣਾਲੀ ਸ਼ਾਮਲ ਹੈ, ਜੋ ਅਣਅਧਿਕਾਰਤ ਵਿਹਾਰ ਲਈ ਮਾਡਲ ਦੀ ਰੀਜ਼ਨਿੰਗ ਅਤੇ ਕਾਰਵਾਈਆਂ ਦੀ ਜਾਂਚ ਕਰਦੀ ਹੈ ਅਤੇ ਸੰਭਾਵੀ ਅਣਅਧਿਕਾਰਤ ਸਰਗਰਮੀ ਆਪਣੇ ਆਪ ਰੋਕ ਦਿੰਦੀ ਹੈ। ਇਹ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸਾਡੇ ਮਾਡਲਾਂ ਦੀ ਚੰਗੀ ਅਲਾਈਨਮੈਂਟ ਦੀ ਥਾਂ ਨਹੀਂ ਲੈ ਸਕਦੇ ਕਿਉਂਕਿ ਸਮਰੱਥਾਵਾਂ ਵਧਦੀਆਂ ਹਨ ਅਤੇ ਸਾਡਾ ਟੀਚਾ ਭਵਿੱਖ ਦੇ ਮਾਡਲਾਂ ਨੂੰ ਕਾਫ਼ੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਅਲਾਈਨ ਕਰਨਾ ਹੈ ਤਾਂ ਜੋ ਇਨ੍ਹਾਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਕਦੇ ਵੀ ਟ੍ਰਿਗਰ ਨਾ ਕਰਨਾ ਪਵੇ।

ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਇਸ ਦਾ ਕੀ ਅਰਥ ਹੋਵੇਗਾ

OpenAI ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਵਚਨਬੱਧ ਹੈ ਕਿ AI ਦੇ ਲਾਭ ਵਿਆਪਕ ਤੌਰ ’ਤੇ ਉਪਲਬਧ ਹੋਣ। Astra ਦੀਆਂ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਵੱਡੇ ਵਾਧੇ ਨੂੰ ਦੇਖਦਿਆਂ, ਅਸੀਂ ਇਸ ਤਾਇਨਾਤੀ ਨੂੰ ਸੁਰੱਖਿਅਤ ਬਣਾਉਣ ਲਈ ਖਾਸ ਸਾਵਧਾਨੀ ਵਰਤ ਰਹੇ ਹਾਂ। ਵਾਧੂ ਸੁਰੱਖਿਆ ਜਾਂਚਾਂ ਕਈ ਵਾਰ ਜਾਇਜ਼ ਕੰਮ ਨੂੰ ਹੌਲਾ, ਅਸਥਾਈ ਤੌਰ ’ਤੇ ਰੋਕ ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬੰਦ ਕਰ ਸਕਦੀਆਂ ਹਨ। ਇਸ ਵਿੱਚ ਰੱਖਿਆਤਮਕ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਵੀ ਸ਼ਾਮਲ ਹੈ।

ਸਿਸਟਮ ਕਦੇ-ਕਦੇ ਜਾਇਜ਼ ਸਰਗਰਮੀ ਨੂੰ ਸੰਭਾਵੀ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਜਾਂ ਅਣਅਧਿਕਾਰਤ ਵਿਹਾਰ ਵਜੋਂ ਨਿਸ਼ਾਨਬੱਧ ਕਰ ਸਕਦਾ ਹੈ, ਜਿਸ ਕਾਰਨ ਇਹ ਅਣਜਾਣੇ ਵਿੱਚ ਹੌਲੀ, ਰੋਕਿਆ ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬੰਦ ਹੋ ਸਕਦਾ ਹੈ। ਇਸ ਵਿੱਚ ਉਹ ਕੰਮ ਵੀ ਸ਼ਾਮਲ ਹੋ ਸਕਦਾ ਹੈ ਜੋ ਸਿੱਧੇ ਤੌਰ ’ਤੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਨਾਲ ਸੰਬੰਧਿਤ ਨਹੀਂ ਲੱਗਦਾ ਜਾਂ ਉਹ ਕੰਮ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਕੋਈ ਏਜੰਟ ਲੰਮੇ ਸਮੇਂ ਤੱਕ ਚੱਲਦਾ ਹੈ।

ਜੇਕਰ ਮਿਸਅਲਾਈਨਮੈਂਟ ਨਿਗਰਾਨ ਕੋਈ ਕੰਮ ਅਸਥਾਈ ਤੌਰ ’ਤੇ ਰੋਕਦਾ ਹੈ, ਤਾਂ ChatGPT ਜਾਂ Codex ਦੇ ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ ਜਾਰੀ ਰੱਖਣ ਤੋਂ ਪਹਿਲਾਂ ਕਾਰਵਾਈ ਦੀ ਸਮੀਖਿਆ ਕਰਨ ਲਈ ਕਿਹਾ ਜਾ ਸਕਦਾ ਹੈ। API ਵਰਗੇ ਹੋਰ ਮਾਧਿਅਮਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ’ਤੇ ਕੰਮ ਬੰਦ ਹੋ ਜਾਵੇਗਾ। ਅਸੀਂ ਬੇਲੋੜੀਆਂ ਰੁਕਾਵਟਾਂ ਘਟਾਉਣ ਲਈ ਇਨ੍ਹਾਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਲਗਾਤਾਰ ਸੁਧਾਰਨ ਅਤੇ Daybreak ਵਰਗੇ ਪ੍ਰੋਗਰਾਮਾਂ ਰਾਹੀਂ ਅਤਿ-ਆਧੁਨਿਕ ਸਮਰੱਥਾਵਾਂ ਤੱਕ ਪਹੁੰਚ ਵਧਾਉਣ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਹੇ ਹਾਂ।

ਭਵਿੱਖ ਵੱਲ

ਅਸੀਂ AI ਵਿਕਾਸ ਦੇ ਉਸ ਪੜਾਅ ਵਿੱਚ ਦਾਖ਼ਲ ਹੋ ਰਹੇ ਹਾਂ ਜਿੱਥੇ ਮਾਡਲ ਵਧੇਰੇ ਨਤੀਜਾਕਾਰੀ ਕੰਮ ਸੰਭਾਲ ਸਕਦੇ ਹਨ ਅਤੇ ਅਲਾਈਨਮੈਂਟ ਤੇ ਨਿਯੰਤਰਣ ਦੀਆਂ ਅਸਫਲਤਾਵਾਂ ਦੇ ਹੋਰ ਗੰਭੀਰ ਪ੍ਰਭਾਵ ਪੈ ਸਕਦੇ ਹਨ। ਇਨ੍ਹਾਂ ਸਿਸਟਮਾਂ ਦੇ ਲਾਭ ਹਾਸਲ ਕਰਨਾ ਇਸ ਗੱਲ ’ਤੇ ਨਿਰਭਰ ਕਰੇਗਾ ਕਿ ਉਨ੍ਹਾਂ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਵਧਣ ਦੇ ਨਾਲ ਅਸੀਂ ਮਾਡਲਾਂ ਨੂੰ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਅਲਾਈਨ ਅਤੇ ਨਿਯੰਤਰਿਤ ਕਰ ਸਕਦੇ ਹਾਂ।

ਇਹ ਜ਼ਿੰਮੇਵਾਰੀ ਟ੍ਰੇਨਿੰਗ, ਮੁਲਾਂਕਣ ਅਤੇ ਤਾਇਨਾਤੀ ਤੱਕ ਫੈਲੀ ਹੋਈ ਹੈ। ਇਸ ਲਈ ਅਲਾਈਨ ਵਿਹਾਰ ਦੇ ਮਜ਼ਬੂਤ ਸਬੂਤ, ਸਮਰੱਥਾ ਦੇ ਨਾਲ ਕਦਮ ਮਿਲਾ ਕੇ ਚੱਲਣ ਵਾਲੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਅਤੇ ਉਨ੍ਹਾਂ ਉਪਾਵਾਂ ਦੇ ਨਾਕਾਫ਼ੀ ਹੋਣ ’ਤੇ ਰਫ਼ਤਾਰ ਘਟਾਉਣ ਦੀ ਇੱਛਾ ਲੋੜੀਂਦੀ ਹੈ।

ਅਸੀਂ ਇਨ੍ਹਾਂ ਸਿਸਟਮਾਂ ਦੀ ਜਾਂਚ ਜਾਰੀ ਰੱਖਾਂਗੇ, ਜੋ ਕੁਝ ਅਸੀਂ ਸਿੱਖਦੇ ਹਾਂ ਉਸ ਨੂੰ ਸਾਂਝਾ ਕਰਾਂਗੇ, ਅਤੇ ਇਸ ਬਾਰੇ ਸਪੱਸ਼ਟਤਾ ਰੱਖਾਂਗੇ ਕਿ ਕੀ ਅਨਿਸ਼ਚਿਤ ਬਾਕੀ ਹੈ। Astra ਤੋਂ ਬਾਅਦ ਆਉਣ ਵਾਲੇ ਮਾਡਲ ਸਾਡੇ ਤੋਂ ਹੋਰ ਵੱਧ ਮੰਗ ਕਰਨਗੇ। ਅਸੀਂ ਇਸ ਜ਼ਿੰਮੇਵਾਰੀ ਨੂੰ ਨਿਭਾਉਣ ਲਈ ਲੋੜੀਂਦਾ ਸਮਾਂ ਲਵਾਂਗੇ ਅਤੇ ਜ਼ਰੂਰੀ ਕੰਮ ਕਰਾਂਗੇ।