ਮੁੱਖ ਸਮੱਗਰੀ 'ਤੇ ਜਾਓ
OpenAI
ਲੋਡ ਹੋ ਰਿਹਾ ਹੈ…

ਅੱਜ ਅਸੀਂ GPT‑6 Astra ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਜੋ ਹੁਣ ਤੱਕ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਤਾਇਨਾਤ ਕੀਤਾ ਗਿਆ ਸਾਡਾ ਸਭ ਤੋਂ ਸਮਰੱਥ ਮਾਡਲ ਹੈ। Astra ਸਾਡਾ ਪਹਿਲਾ ਮਾਡਲ ਹੈ ਜੋ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਅਧੀਨ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾ ਦੇ ਗੰਭੀਰ ਪੱਧਰ ਤੱਕ ਪਹੁੰਚਿਆ ਹੈ।

ਇਸ ਰਿਲੀਜ਼ ਦੀ ਸੁਰੱਖਿਆ ਬਾਰੇ ਜਾਣਨ ਵਾਲੀਆਂ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਗੱਲਾਂ ਇਹ ਹਨ:

  1. GPT‑6 Astra ਦੀਆਂ ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਵੱਡਾ ਵਾਧਾ ਹੋਇਆ ਹੈ ਅਤੇ ਇਹ ਸਾਡੇ ਗੰਭੀਰ ਪੱਧਰ ਦੀ ਹੱਦ ਪੂਰੀ ਕਰਦਾ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਸਹੀ ਸੰਦਾਂ ਅਤੇ ਪਹੁੰਚ ਨਾਲ GPT‑6 Astra ਪਹਿਲਾਂ ਅਣਜਾਣ ਸੁਰੱਖਿਆ ਖਾਮੀਆਂ ਲੱਭ ਸਕਦਾ ਹੈ ਅਤੇ ਹਰ ਕਦਮ 'ਤੇ ਮਨੁੱਖੀ ਮਾਰਗਦਰਸ਼ਨ ਤੋਂ ਬਿਨਾਂ ਕਈ ਬਹੁਤ ਸੁਰੱਖਿਅਤ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਉਨ੍ਹਾਂ ਦਾ ਲਾਹਾ ਲੈਣ ਦੇ ਨਵੇਂ ਤਰੀਕੇ ਵਿਕਸਿਤ ਕਰ ਸਕਦਾ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਦੁਰਵਰਤੋਂ ਜਾਂ ਗੈਰ-ਅਨੁਕੂਲਤਾ ਕਾਰਨ ਮਾਡਲ ਵੱਲੋਂ ਨੁਕਸਾਨਦੇਹ ਸਾਈਬਰ ਕਾਰਵਾਈਆਂ ਕੀਤੇ ਜਾਣ ਤੋਂ ਬਚਾਅ ਲਈ ਆਪਣੀ ਸੁਰੱਖਿਆ ਨੂੰ ਕਾਫ਼ੀ ਮਜ਼ਬੂਤ ਕੀਤਾ ਹੈ। ਅਸੀਂ Astra ਅਤੇ ਇਸ ਵਰਗੇ ਮਾਡਲਾਂ ਦੇ ਅੰਦਰੂਨੀ ਵਿਕਾਸ ਅਤੇ ਤਾਇਨਾਤੀ ਨੂੰ ਸੁਰੱਖਿਅਤ ਕਰਨ ਲਈ ਵੀ ਕਦਮ ਚੁੱਕੇ ਹਨ। ਇਨ੍ਹਾਂ ਵਿੱਚ ਵਧੇਰੇ ਸਖ਼ਤ ਆਈਸੋਲੇਸ਼ਨ, ਚੈੱਕਪੋਇੰਟ ਇਨਕ੍ਰਿਪਸ਼ਨ, ਚੇਨ-ਆਫ-ਥੌਟ (CoT) ਸਮੇਤ ਪੂਰੀਆਂ ਕਾਰਵਾਈ ਲੜੀਆਂ ਦੀ ਵਿਆਪਕ ਨਿਗਰਾਨੀ ਅਤੇ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਤੋਂ ਪਹਿਲਾਂ ਰੋਕ ਲਗਾਉਣ ਵਾਲੀ ਅਨੁਕੂਲਤਾ ਮੁਲਾਂਕਣ ਪ੍ਰਕਿਰਿਆ ਸ਼ਾਮਲ ਹਨ।
  2. GPT‑6 Astra ਆਪਣੇ ਪਿਛਲੇ ਮਾਡਲਾਂ ਨਾਲੋਂ ਕਾਫ਼ੀ ਵੱਧ ਮਜ਼ਬੂਤ ਹੈ। ਸੁਰੱਖਿਆ ਮਜ਼ਬੂਤੀ ਦੀਆਂ ਨਵੀਆਂ ਤਕਨੀਕਾਂ ਸ਼ਾਮਲ ਕਰਨ ਕਰਕੇ, GPT‑6 Astra ਲੰਬੀਆਂ ਕਾਰਵਾਈ ਲੜੀਆਂ ਸਮੇਤ, GPT‑5.6 Sol ਨਾਲੋਂ ਜੇਲ੍ਹਬ੍ਰੇਕਾਂ ਵਿਰੁੱਧ ਕਾਫ਼ੀ ਵੱਧ ਮਜ਼ਬੂਤ ਹੈ। ਅਸੀਂ ਇਹ ਗੱਲ ਆਫ਼ਲਾਈਨ ਟੈਸਟਾਂ ਅਤੇ ਆਪਣੇ ਸਖ਼ਤ ਅੰਦਰੂਨੀ ਅਤੇ ਬਾਹਰੀ ਜੇਲ੍ਹਬ੍ਰੇਕ ਜਾਂਚ ਅਤੇ ਸੁਧਾਰ ਪ੍ਰੋਗਰਾਮ ਰਾਹੀਂ ਜਾਣਦੇ ਹਾਂ। ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਹਾਈ ਜੋਖਮ ਵਜੋਂ ਚਿੰਨ੍ਹਿਤ ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਅਸੀਂ ਮਾਡਲ ਦੀ ਇਨਕਾਰ-ਹੱਦ ਨੂੰ ਹੋਰ ਸਾਵਧਾਨ ਬਣਾਉਣ ਅਤੇ ਦੋਹਰੀ ਵਰਤੋਂ ਦੇ ਵਿਆਪਕ ਜੋਖਮਾਂ ਨੂੰ ਕਵਰ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਵਾਧੂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ। ਅਸੀਂ ਰਿਗ੍ਰੈਸ਼ਨ ਜਾਂਚ ਰਾਹੀਂ ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹਾਂ ਕਿ Astra ਪਿਛਲੇ ਜਾਂਚ ਦੌਰਾਂ ਵਿੱਚ ਸਾਹਮਣੇ ਆਏ ਜੇਲ੍ਹਬ੍ਰੇਕਾਂ ਵਿਰੁੱਧ ਮਜ਼ਬੂਤ ਰਹੇ, ਅਤੇ ਆਪਣੇ ਨਵੀਨਤਮ ਅੰਦਰੂਨੀ ਰੈਡ ਟੀਮਿੰਗ ਹਮਲਾਵਰਾਂ ਰਾਹੀਂ ਸਵੈਚਾਲਿਤ ਰੈਡ ਟੀਮਿੰਗ ਦੇ ਨਵੇਂ ਦੌਰ ਚਲਾ ਕੇ ਅਸੀਂ ਆਪਣੇ ਸੁਧਾਰਾਂ ਦੀ ਪੁਸ਼ਟੀ ਵੀ ਕੀਤੀ ਹੈ।
  3. GPT‑6 Astra GPT‑5.6 Sol ਨਾਲੋਂ ਬਿਹਤਰ ਅਨੁਕੂਲ ਹੈ। Astra ਮਾਡਲ ਅਨੁਕੂਲਤਾ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਤਰੱਕੀ ਹੈ, ਜਿਸ ਵਿੱਚ ਸਾਡੇ ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ ਡਾਟੇ ਦੀ ਬਣਤਰ ਤੋਂ ਲੈ ਕੇ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਦੌਰਾਨ ਗ੍ਰੇਡਿੰਗ ਤੱਕ ਦੇ ਸੁਧਾਰ ਸ਼ਾਮਲ ਹਨ। ਅਸੀਂ ਅਨੁਕੂਲਤਾ ਮੁਲਾਂਕਣਾਂ ਦਾ ਨਵਾਂ ਸਮੂਹ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਪੇਸ਼ ਕਰਦੇ ਹਾਂ ਅਤੇ ਸਾਨੂੰ ਪਤਾ ਲੱਗਿਆ ਹੈ ਕਿ GPT‑6 Astra ਸੁਰੱਖਿਆ ਹੱਦਾਂ ਦਾ ਸਤਿਕਾਰ ਕਰਨ ਅਤੇ ਆਪਣੇ ਅਧਿਕਾਰਤ ਦਾਇਰੇ ਵਿੱਚ ਰਹਿਣ ਵਿੱਚ ਵਧੇਰੇ ਸਮਰੱਥ ਹੈ। 54,000 ਤੋਂ ਵੱਧ ਅੰਦਰੂਨੀ Codex ਕਾਰਜਾਂ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ)ਦੀ ਵਰਤੋਂ ਕਰਦਿਆਂ ਇੱਕ ਸਿਮੂਲੇਸ਼ਨ ਵਿੱਚ Sol ਦੇ ਮੁਕਾਬਲੇ Astra ਨੂੰ ਹਾਈ-ਗੰਭੀਰਤਾ ਵਾਲੇ ਗ਼ੈਰ-ਅਨੁਕੂਲ ਵਿਹਾਰ ਲਈ ਲਗਭਗ ਅੱਧੇ ਹੀ ਫਲੈਗ ਮਿਲੇ।
  4. ਅਸੀਂ ਗੈਰ-ਅਨੁਕੂਲਤਾ ਦੀ ਨਿਗਰਾਨੀ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਲਾਗੂ ਕਰ ਰਹੇ ਹਾਂ। ਅਸੀਂ ਮਾਡਲ ਅਨੁਕੂਲਤਾ ਨੂੰ ਆਪਣੇ ਮਾਡਲਾਂ ਦੇ ਸੰਭਾਵੀ ਗੈਰ-ਅਨੁਕੂਲ ਵਿਹਾਰ ਨੂੰ ਰੋਕਣ ਦਾ ਮੁੱਖ ਸਾਧਨ ਮੰਨਦੇ ਹਾਂ। ਪਰ ਨਿਗਰਾਨੀ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲਾਂ ਦੇ ਵਿਹਾਰ ਬਾਰੇ ਵਿਆਪਕ ਜਾਣਕਾਰੀ ਦਿੰਦੀ ਹੈ ਅਤੇ ਅਨੁਕੂਲਤਾ ਤੇ ਸੁਰੱਖਿਆ ਵਿੱਚ ਹੋਰ ਸੁਧਾਰ ਦੇ ਮੌਕੇ ਸਾਹਮਣੇ ਲਿਆਉਂਦੀ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਨਿਗਰਾਨੀ ਪਤਾ ਲੱਗੇ ਗੈਰ-ਅਨੁਕੂਲ ਵਿਹਾਰ ਵਿਰੁੱਧ ਸੁਰੱਖਿਆ ਦੀ ਇੱਕ ਹੋਰ ਪਰਤ ਵਜੋਂ ਕੰਮ ਕਰਦੀ ਹੈ। ਇਨ੍ਹਾਂ ਕਾਰਨਾਂ ਕਰਕੇ, ਅਸੀਂ Astra ਦੀ ਬਾਹਰੀ ਤਾਇਨਾਤੀ ਵਿੱਚ ਸੰਦ ਵਰਤਣ ਵਾਲੀਆਂ ਸਾਰੀਆਂ ਅਨੁਮਾਨ ਪ੍ਰਕਿਰਿਆਵਾਂ ਲਈ ਗ਼ੈਰ-ਅਨੁਕੂਲਤਾ ਨਿਗਰਾਨੀ ਵੀ ਜੋੜ ਦਿੱਤੀ ਹੈ, ਭਾਵੇਂ ਇਸ ਲਈ ਕਾਫ਼ੀ ਗਣਨਾਤਮਕ ਲਾਗਤ ਆਈ ਹੈ। ਇਹ ਪ੍ਰਣਾਲੀ ਸਾਡੀ ਅੰਦਰੂਨੀ ਵਿਵਸਥਾ ਦੇ ਸਮਾਨ ਹੈ।
  5. GPT‑6 Astra ਦੀ ਨਿਗਰਾਨੀਯੋਗਤਾ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਘੱਟ ਗਈ ਹੈ।ਅਸੀਂ GPT‑6 Astra ਦੀ ਨਿਗਰਾਨੀਯੋਗਤਾ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ ਨਿਯੰਤਰਣਯੋਗਤਾ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੀ ਡੂੰਘੀ ਜਾਂਚ ਕੀਤੀ ਹੈ। ਅਸੀਂ ਪਾਇਆ ਹੈ ਕਿ GPT‑6 Astra GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਆਪਣੇ ਖੁਦ ਦੇ CoT ਨੂੰ ਵਧੇਰੇ ਬਿਹਤਰ ਤਰੀਕੇ ਨਾਲ ਕੰਟਰੋਲ ਕਰਨ ਦੇ ਸਮਰੱਥ ਹੈ ਅਤੇ ਇਸਦੇ CoT ਵਿੱਚ ਕੋਈ ਵੀ ਦੋਸ਼ੀ ਠਹਿਰਾਉਣ ਵਾਲੀ ਜਾਣਕਾਰੀ ਸ਼ਾਮਲ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਘੱਟ ਹੁੰਦੀ ਹੈ। ਵਿਰੋਧੀ ਸਥਿਤੀਆਂ ਵਿੱਚ (ਜਿੱਥੇ ਅਸੀਂ ਮਾਡਲ ਨੂੰ ਸਾਡੇ ਮਾਨੀਟਰਾਂ ਤੋਂ ਬਚਣ ਲਈ ਪ੍ਰੇਰਿਤ ਕਰਦੇ ਹਾਂ), ਅਸੀਂ ਦੇਖਿਆ ਹੈ ਕਿ ਜਦੋਂ ਮਾਡਲ ਮੁਲਾਂਕਣਾਂ ਦੌਰਾਨ ਰਣਨੀਤਕ ਤੌਰ 'ਤੇ ਘੱਟ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ (ਸੈਂਡਬੈਗਿੰਗ) ਤਾਂ ਇਹ ਬਿਨਾਂ ਫੜੇ ਗਏ ਰਹਿਣ ਦੇ ਯੋਗ ਹੁੰਦਾ ਹੈ ਅਤੇ ਕੁਝ ਖਾਸ ਤੋੜ-ਫੋੜ ਦੇ ਕਾਰਜ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਕਰਨ ਲਈ ਕਹੇ ਜਾਣ 'ਤੇ ਕਈ ਵਾਰ ਸਾਡੇ ਅੰਦਰੂਨੀ ਮਾਨੀਟਰਾਂ ਨੂੰ ਵੀ ਚਕਮਾ ਦੇਣ ਵਿੱਚ ਕਾਮਯਾਬ ਹੋ ਜਾਂਦਾ ਹੈ। ਅਸੀਂ ਸਟੈਗਾਨੋਗ੍ਰਾਫਿਕ CoT ਰੀਜ਼ਨਿੰਗ (ਉਦਾਹਰਣ ਵਜੋਂ, ਆਮ ਅਤੇ ਜਾਪਦੀ ਤੌਰ 'ਤੇ ਅਸੰਬੰਧਿਤ ਟੈਕਸਟ ਦੇ ਅੰਦਰ ਲੁਕਵੀਂ ਰੀਜ਼ਨਿੰਗ ਨੂੰ ਛੁਪਾਉਣਾ) ਦਾ ਕੋਈ ਸਬੂਤ ਨਹੀਂ ਦੇਖਿਆ ਹੈ, ਜੋ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਬਚਣ ਦਾ ਜੋਖਮ ਕਾਫ਼ੀ ਹੱਦ ਤੱਕ ਹੇਠਲੇ ਪੱਧਰ ਦੇ ਰੀਜ਼ਨਿੰਗ ਕਾਰਜਾਂ ਤੱਕ ਹੀ ਸੀਮਤ ਹੋ ਸਕਦਾ ਹੈ।
    • ਇਹ ਨਤੀਜੇ ਦਰਸਾਉਂਦੇ ਹਨ ਕਿ Astra ਸ਼੍ਰੇਣੀ ਦੇ ਮਾਡਲ ਵਿਰੋਧੀ ਸਥਿਤੀਆਂ ਵਿੱਚ ਸਾਡੇ CoT ਨਿਗਰਾਨਾਂ ਤੋਂ ਬਚ ਸਕਦੇ ਹਨ। ਇਸ ਸਮੇਂ, ਇਹ ਖੋਜਾਂ ਮੁੱਖ ਤੌਰ 'ਤੇ ਵਿਰੋਧੀ ਮੁਲਾਂਕਣਾਂ (ਯਾਨੀ, ਜਦੋਂ ਅਸੀਂ ਮਾਡਲ ਨੂੰ ਨਿਗਰਾਨੀ ਤੋਂ ਬਚਣ ਦੀ ਹਦਾਇਤ ਕਰਦੇ ਹਾਂ) 'ਤੇ ਅਧਾਰਤ ਹਨ, ਅਤੇ ਸਮੁੱਚੇ ਤੌਰ 'ਤੇ ਸਾਡੇ ਅਨੁਕੂਲਤਾ ਮੁਲਾਂਕਣ ਇਹ ਦਰਸਾਉਂਦੇ ਹਨ ਕਿ Astra ਆਮ ਤੌਰ 'ਤੇ ਸੁਰੱਖਿਆ ਅਤੇ ਸੇਫਟੀ ਪਾਬੰਦੀਆਂ ਦੀ ਉਲੰਘਣਾ ਕਰਨ ਦੀ GPT‑5.6 Sol ਨਾਲੋਂ ਘੱਟ ਸੰਭਾਵਨਾ ਰੱਖਦਾ ਹੈ।
    • ਹਾਲਾਂਕਿ, ਅਸੀਂ ਇਸ ਰੁਝਾਨ ਨੂੰ ਗੰਭੀਰਤਾ ਨਾਲ ਲੈਂਦੇ ਹਾਂ, ਅਤੇ ਜਿਵੇਂ-ਜਿਵੇਂ ਸਾਡੇ ਮਾਡਲ ਹੋਰ ਸਮਰੱਥ ਹੁੰਦੇ ਜਾ ਰਹੇ ਹਨ, ਅਸੀਂ ਇਨ੍ਹਾਂ ਖੋਜਾਂ ਅਤੇ ਨਿਗਰਾਨੀਯੋਗਤਾ ਲਈ ਉਨ੍ਹਾਂ ਦੇ ਪ੍ਰਭਾਵਾਂ ਦੀ ਜਾਂਚ ਕਰਨਾ ਜਾਰੀ ਰੱਖ ਰਹੇ ਹਾਂ। OpenAI ਨੇ ਚੇਨ-ਆਫ਼-ਥੌਟ ਨਿਗਰਾਨੀ ਨੂੰ ਬਣਾਈ ਰੱਖਣ ਅਤੇ ਇਸਦੀ ਵਰਤੋਂ ਕਰਨ ਲਈ ਕੰਮ ਕੀਤਾ ਹੈ ਅਤੇ CoT ਨਿਗਰਾਨੀਯੋਗਤਾ ਨੂੰ ਸੁਰੱਖਿਅਤ ਰੱਖਣਾ ਖੋਜ ਪ੍ਰੋਗਰਾਮ ਦਾ ਇੱਕ ਮੁੱਖ ਟੀਚਾ ਹੈ। ਹਾਲਾਂਕਿ, ਇਹ ਨਤੀਜੇ ਮਾਡਲ ਦੀ ਚੇਨ-ਆਫ਼-ਥੌਟ ਦੀ ਜਾਂਚ ਕਰਨ ਤੋਂ ਇਲਾਵਾ ਹੋਰ ਅਨੁਕੂਲਤਾ ਆਡਿਟਿੰਗ ਤਕਨੀਕਾਂ ਨੂੰ ਵਿਕਸਤ ਕਰਨ ਦੀ ਮਹੱਤਤਾ ਨੂੰ ਵੀ ਉਜਾਗਰ ਕਰਦੇ ਹਨ।
  6. GPT‑6 Astra ਬ੍ਰਾਊਜ਼ਿੰਗ ਅਤੇ ਕੰਮਕਾਜੀ ਮਾਹੌਲਾਂ ਵਿੱਚ ਵਧੇਰੇ ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ: GPT‑6 Astra, GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਪ੍ਰੌੰਪਟ ਇੰਜੈਕਸ਼ਨਾਂ ਵਿਰੁੱਧ ਕਾਫ਼ੀ ਵੱਧ ਮਜ਼ਬੂਤ ਹੈ। ਅਸੀਂ ਵਾਧੂ ਤੌਰ 'ਤੇ ਅਸਲ-ਸੰਸਾਰ ਦੀ ਬ੍ਰਾਊਜ਼ਿੰਗ ਅਤੇ ਪੇਸ਼ੇਵਰ ਕੰਪਿਊਟਰ ਮਾਹੌਲਾਂ ਵਿੱਚ ਮਾਡਲ ਦੇ ਵਿਵਹਾਰ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ, ਅਤੇ ਪਾਇਆ ਹੈ ਕਿ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਇਹ ਮਾਡਲ ਗੈਰ-ਅਨੁਕੂਲ ਅਤੇ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਨੁਕਸਾਨਦੇਹ ਕਾਰਵਾਈਆਂ (ਉਦਾਹਰਣ ਵਜੋਂ ਅਣਅਧਿਕਾਰਤ ਲੈਣ-ਦੇਣ, ਡਾਟਾ ਖਰਾਬ ਹੋਣਾ, ਬਹੁਤ ਜ਼ਿਆਦਾ ਪਹੁੰਚ, ਜਾਂ ਕੰਟਰੋਲਾਂ ਤੋਂ ਬਚਣਾ) ਕਰਨ ਦੀ ਬਹੁਤ ਘੱਟ ਸੰਭਾਵਨਾ ਰੱਖਦਾ ਹੈ। ਜਦੋਂ ਇਹ ਏਜੰਟਿਕ ਸੈਟਿੰਗਾਂ ਵਿੱਚ ਨੁਕਸਾਨਦੇਹ ਬੇਨਤੀਆਂ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਹਿੰਸਕ ਹਮਲੇ ਦੀ ਯੋਜਨਾ ਬਣਾਉਣ ਜਾਂ ਧੋਖਾਧੜੀ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਨ ਦੀਆਂ ਬੇਨਤੀਆਂ, ਤਾਂ ਇਹ ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ।
  7. GPT‑6 Astra ਹਾਈ-ਜੋਖਮ ਵਾਲੀਆਂ ਸਥਿਤੀਆਂ ਵਿੱਚ ਕਾਫ਼ੀ ਜ਼ਿਆਦਾ ਸੁਰੱਖਿਅਤ ਹੈ। GPT‑6 Astra ਅਸਲ ਵਰਤੋਂ ਅਤੇ ਮਨੁੱਖੀ ਵਿਰੋਧੀ ਰੈਡ ਟੀਮਿੰਗ ਤੋਂ ਲਈਆਂ ਗਈਆਂ ਚੁਣੌਤੀਪੂਰਨ ਬੇਨਤੀਆਂ ਦਾ GPT‑5.6 Sol ਨਾਲੋਂ ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਜਵਾਬ ਦਿੰਦਾ ਹੈ। Astra ਅਸੁਰੱਖਿਅਤ ਬੇਨਤੀਆਂ ਨੂੰ ਸੁਰੱਖਿਅਤ ਤਰੀਕੇ ਨਾਲ ਪੂਰਾ ਕਰਨ ਅਤੇ ਨੁਕਸਾਨ ਰਹਿਤ ਬੇਨਤੀਆਂ ਨੂੰ ਬੇਲੋੜਾ ਰੱਦ ਕਰਨ ਤੋਂ ਬਚਣ ਦੋਵਾਂ ਮਾਮਲਿਆਂ ਵਿੱਚ ਇੱਕ ਪੈਰੇਟੋ ਸੁਧਾਰ ਹਾਸਲ ਕਰਦਾ ਹੈ। ਇਹ ਸੁਧਾਰ ਉਨ੍ਹਾਂ ਹਾਈ-ਗੰਭੀਰਤਾ ਵਾਲੀਆਂ ਸਥਿਤੀਆਂ ਤੱਕ ਵੀ ਫੈਲੇ ਹੋਏ ਹਨ ਜਿੱਥੇ ਨੁਕਸਾਨ ਦਾ ਜੋਖਮ ਕਿਸੇ ਸਪੱਸ਼ਟ ਬੇਨਤੀ ਦੀ ਬਜਾਏ ਵਿਆਪਕ ਸੰਦਰਭ ਤੋਂ ਪੈਦਾ ਹੁੰਦਾ ਹੈ। Astra 18 ਸਾਲ ਤੋਂ ਘੱਟ ਉਮਰ ਦੇ ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਉਮਰ-ਅਨੁਕੂਲ ਸੁਰੱਖਿਆ ਸੀਮਾਵਾਂ ਨੂੰ ਵੀ ਵਧੇਰੇ ਇਕਸਾਰਤਾ ਨਾਲ ਲਾਗੂ ਕਰਦਾ ਹੈ।