ਇੰਟੈਲੀਜੈਂਸ ਦੀ ਇੱਕ ਨਵੀਂ ਪੀੜ੍ਹੀ
22 ਸਤੰਬਰ, 2026 ਦਾ ਅੱਪਡੇਟ: ਅਸੀਂ GPT‑6 Sol ਅਤੇ GPT‑6 Luna ਨਾਲ ਆਪਣੇ GPT‑6 ਪਰਿਵਾਰ ਦਾ ਵਿਸਤਾਰ ਕਰ ਰਹੇ ਹਾਂ। ਹੋਰ ਜਾਣੋ।
ਅਸੀਂ ਪੇਸ਼ ਕਰ ਰਹੇ ਹਾਂ GPT‑6 Astra, ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਬੁੱਧੀਮਾਨ ਅਤੇ ਅਨੁਕੂਲਿਤ ਮਾਡਲ।
GPT‑6 Astra ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ, ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਅਤੇ ਅਲਾਈਨਮੈਂਟ ਵਿੱਚ ਸਾਲਾਂ ਦੀ ਖੋਜ ਅਤੇ ਵੱਡੇ ਨਿਵੇਸ਼ਾਂ ਨੂੰ ਇੱਕਠਾ ਕਰਦਾ ਹੈ. Astra ਕੰਪਿਊਟਰ ਯੂਜ਼, ਬ੍ਰਾਊਜ਼ਿੰਗ, ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ, ਸਾਈਬਰ ਸੁਰੱਖਿਆ, ਵਿਗਿਆਨ, ਅਤੇ ਪੇਸ਼ੇਵਰ ਕੰਮ ਵਿੱਚ ਅਤਿ-ਆਧੁਨਿਕ ਹੈ. Astra ਨੇ FrontierMath Tier 4 ਵਿੱਚ 98% ਸਕੋਰ ਦੇ ਨਾਲ ਸਿਖਰ ਛੂਹਿਆ ਹੈ, ਅਤੇ ਇਹ ਪਹਿਲਾਂ ਹੀ ਗਣਿਤ ਵਿੱਚ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੀਆਂ ਅਣਸੁਲਝੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਚੁੱਕਾ ਹੈ. Astra ਨੇ ARC-AGI-3 ਵਿੱਚ 99.9% ਸਕੋਰ ਅਤੇ ExploitBench ਵਿੱਚ 100% ਸਕੋਰ ਵੀ ਹਾਸਲ ਕੀਤੇ ਹਨ. ਇਹ ਕੰਪਿਊਟਰ ਅਤੇ ਬ੍ਰਾਊਜ਼ਰ ਦੀ ਵਰਤੋਂ ਵਿੱਚ ਵੀ ਇੱਕ ਨਵਾਂ ਅਤਿ-ਆਧੁਨਿਕ ਮਿਆਰ ਕਾਇਮ ਕਰਦਾ ਹੈ, ਜੋ ਸਭ ਤੋਂ ਔਖੇ ਪੇਸ਼ੇਵਰ ਕੰਮ ਨੂੰ ਬੇਮਿਸਾਲ ਗਤੀ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸਮਝਦਾਰੀ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ.
GPT‑6 Astra ਅੱਜ ਸੀਮਿਤ ਗਿਣਤੀ ਦੀਆਂ ਸੰਸਥਾਵਾਂ ਲਈ ਪੇਸ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਅਤੇ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਵਿੱਚ ਇਹ ਸਾਰੇ ChatGPT Plus, Pro, Business ਅਤੇ Enterprise ਵਰਤੋਂਕਾਰਾਂ ਲਈ, ਨਾਲ ਹੀ OpenAI API, Microsoft Azure ਅਤੇ AWS Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ.
Astra ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਹੈ, ਜਿਸ ਵਿੱਚ ਵਰਤੋਂਕਰ ਦੇ ਇਰਾਦੇ ਅਤੇ ਮਾਡਲ ਵਿਵਹਾਰ ਨੂੰ ਸਮਝਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਹਨ—ਤੁਸੀਂ Astra ਦੇ ਫੈਸਲੇ ਨੂੰ ਵਧੇਰੇ ਭਰੋਸੇ ਨਾਲ ਕੰਮ ਸੌਂਪ ਸਕਦੇ ਹੋ. ਇਸਦਾ ਟੈਸਟ ਕਰਨ ਦੇ ਇੱਕ ਤਰੀਕੇ ਵਜੋਂ, ਅਸੀਂ Hugging Face ਦੀ ਘਟਨਾ ਤੋਂ ਜਾਣਕਾਰੀ ਲੈ ਕੇ ਇੱਕ ਨਵਾਂ ਮੁਲਾਂਕਣ ਤਿਆਰ ਕੀਤਾ ਹੈ, ਜੋ ਇਹ ਜਾਂਚਦਾ ਹੈ ਕਿ ਕੀ ਕਿਸੇ ਮੁਸ਼ਕਲ ਜਾਂ ਅਸੰਭਵ ਕੰਮ ਦਾ ਸਾਹਮਣਾ ਕਰਨ ਵਾਲਾ ਮਾਡਲ ਆਪਣੇ ਨਿਰਧਾਰਤ ਦਾਇਰੇ ਤੋਂ ਬਾਹਰ ਜਾਵੇਗਾ. GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ, ਜੋ ਪ੍ਰੋਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ 48% ਮਾਮਲਿਆਂ ਵਿੱਚ ਅਧਿਕਾਰਤ ਟੀਚੇ ਤੋਂ ਬਾਹਰ ਗਿਆ, GPT‑6 Astra ਨੇ 0% ਮਾਮਲਿਆਂ ਵਿੱਚ ਅਜਿਹਾ ਕੀਤਾ.
ਕੰਪਿਊਟਰ ਦੀ ਵਰਤੋਂ ਲਈ ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ
GPT‑6 Astra ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਦੀ ਗਤੀ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸੁਰੱਖਿਆ ਵਿੱਚ ਇੱਕ ਨਵੇਂ ਅਤਿ-ਆਧੁਨਿਕ ਯੁੱਗ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰਦਾ ਹੈ। ਇਹ ਔਨਲਾਈਨ ਫਾਰਮ ਭਰਨ, CRM ਵਿੱਚ ਗਾਹਕ ਰਿਕਾਰਡਾਂ ਨੂੰ ਅੱਪਡੇਟ ਕਰਨ, ਅਤੇ ਤੁਹਾਡੇ ਕੈਲੰਡਰ ਨੂੰ ਵਿਵਸਥਿਤ ਕਰਨ ਵਰਗੇ ਅਕਾਊ ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲ ਸਕਦਾ ਹੈ। ਇਹ ਔਨਲਾਈਨ ਖੋਜ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਤੁਹਾਡੀ ਈਮੇਲ ਜਾਂ ਤੁਹਾਡੇ ਦਸਤਾਵੇਜ਼ ਐਡੀਟਰ ਵਿੱਚ ਸਾਰ (summaries) ਡ੍ਰਾਫਟ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਵਿਗਿਆਨਕ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰ ਸਕਦਾ ਹੈ, ਪਲੌਟ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ, ਇੱਕ ਵੈੱਬਸਾਈਟ ਬਣਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਫਰੰਟਐਂਡ QA ਜਾਂਚ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਉਸ ਸਾਈਟ 'ਤੇ ਸਾਰੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਕੰਮ ਕਰਦੀਆਂ ਹਨ। ਇਹ ਖੁਦਮੁਖਤਿਆਰ ਤੌਰ 'ਤੇ ਸਾਫ਼ਟਵੇਅਰ ਸਥਾਪਤ ਕਰਨ ਅਤੇ ਟੈਸਟ ਕਰਨ, ਅਤੇ ਸਕ੍ਰੀਨ 'ਤੇ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਸੁਧਾਰ ਸਾਡੇ ਅਤਿ-ਆਧੁਨਿਕ ਮੁਲਾਂਕਣ ਨਤੀਜਿਆਂ ਵਿੱਚ ਵੀ ਝਲਕਦੇ ਹਨ।
ਇਹਨਾਂ ਸੁਧਾਰਾਂ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਅਸਲ ਗਿਆਨ-ਆਧਾਰਿਤ ਟਾਸਕਾਂ ਵਿੱਚ ਕੁਸ਼ਲਤਾ ਵਿੱਚ ਵੀ ਮਹੱਤਵਪੂਰਨ ਵਾਧਾ ਹੁੰਦਾ ਹੈ. OSWorld 2.0 'ਤੇ ਲੇਟੈਂਸੀ ਸਿਮੂਲੇਸ਼ਨਾਂ ਵਿੱਚ, Astra GPT‑5.6 ਨਾਲੋਂ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 47% ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਵਿੱਚ ਵੱਧ ਕਾਰਗੁਜ਼ਾਰੀ ਹਾਸਿਲ ਕਰਦਾ ਹੈ. Sol ਨੇ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 40 ਮਿੰਟਾਂ ਵਿੱਚ 72.6% ਸਕੋਰ ਹਾਸਿਲ ਕੀਤਾ, ਜਦਕਿ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 75 ਮਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ 65.7% ਸੀ.3
GPT‑6 Astra ਦੀਆਂ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸਮਰੱਥਾਵਾਂ ਦੇ ਨਤੀਜੇ ਗੇਮ ਡਿਵੈਲਪਮੈਂਟ, ਇਲੈਕਟ੍ਰੀਕਲ ਇੰਜੀਨੀਅਰਿੰਗ, ਅਤੇ ਰੋਜ਼ਾਨਾ ਦੇ ਜਾਣਕਾਰੀ ਵਾਲੇ ਕੰਮਾਂ ਸਮੇਤ ਕਈ ਖੇਤਰਾਂ ਵਿੱਚ ਦੇਖੇ ਜਾ ਸਕਦੇ ਹਨ:
Astra ਦੇ ਨਾਲ, ਅਸੀਂ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਦੀ ਗਤੀ ਵਿੱਚ ਕਾਫ਼ੀ ਸੁਧਾਰ ਕਰਨ ਲਈ Codex ਜਾਂਚ-ਢਾਂਚੇ ਨੂੰ ਵੀ ਅੱਪਡੇਟ ਕਰ ਰਹੇ ਹਾਂ. Astra ਦੀ ਕਾਰਜਕੁਸ਼ਲਤਾ ਦੇ ਨਾਲ ਮਿਲ ਕੇ, ਇਹ Mind2Web ਬੈਂਚਮਾਰਕ 'ਤੇ ਮੌਜੂਦਾ GPT‑5.6 Sol ਅਨੁਭਵ ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਕੰਮ ਨੂੰ 1.9 ਗੁਣਾ ਤੇਜ਼ੀ ਨਾਲ ਪੂਰਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ. ਮਾਡਲ ਦੀ ਗਤੀ ਵਿੱਚ ਸੁਧਾਰਾਂ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਤੁਹਾਡੇ ਲਈ ਬਹੁਤ ਸਾਰੇ ਸਮਾਂ ਲੈਣ ਵਾਲੇ ਰੋਜ਼ਾਨਾ ਦੇ ਕੰਮਾਂ ਨੂੰ, ਤੁਹਾਡੇ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਕਰ ਸਕਦਾ ਹੈ.4
ਪੇਸ਼ੇਵਰ ਕੰਮ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਬਦੀਲੀ
GPT‑6 Astra ਗੁੰਝਲਦਾਰ ਕੰਮਾਂ ਨਾਲ ਨਜਿੱਠਣ ਵਿੱਚ ਮਦਦ ਕਰਨ ਲਈ, ਪੇਸ਼ੇਵਰ ਵਾਤਾਵਰਨਾਂ ਲਈ ਟੀਚਾਬੱਧ ਟ੍ਰੇਨਿੰਗ ਦੇ ਨਾਲ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਵਿੱਚ ਤਰੱਕੀਆਂ ਨੂੰ ਜੋੜਦਾ ਹੈ. ਇਹ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆਵਾਂ ਲਈ ਲੋੜੀਂਦੀ ਇੰਟੈਲੀਜੈਂਸ ਦੇ ਨਾਲ ਬਹੁ-ਪੜਾਵੀ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਪੂਰਾ ਕਰਨ ਅਤੇ ਸੁਧਰੇ ਦਸਤਾਵੇਜ਼, ਸਪ੍ਰੈੱਡਸ਼ੀਟਾਂ ਅਤੇ ਪ੍ਰੈਜ਼ੈਂਟੇਸ਼ਨਾਂ ਬਣਾਉਣ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਜੋੜਦਾ ਹੈ.
GPT‑6 Astra ਮੌਜੂਦਾ ਟੈਂਪਲੇਟਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਅਤੇ ਅਜਿਹੀਆਂ ਸਲਾਈਡਾਂ ਤਿਆਰ ਕਰਨ ਲਈ ਸਾਡਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ ਜੋ ਸੁਚੱਜੇ ਢੰਗ ਨਾਲ ਵਿਵਸਥਿਤ ਹੋਣ ਅਤੇ ਢਾਂਚਾਗਤ ਬਿਰਤਾਂਤ ਰਾਹੀਂ ਮੁੱਖ ਨੁਕਤਿਆਂ ਨੂੰ ਸੰਖੇਪ ਵਿੱਚ ਪੇਸ਼ ਕਰਨ। ਇਹ ਤੁਹਾਡੇ ਟੈਂਪਲੇਟਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਵਾਲੇ ਅਤੇ ਤੁਹਾਡੀ ਲਿਖਣ ਅਤੇ ਦ੍ਰਿਸ਼ਟੀਗਤ ਸ਼ੈਲੀ ਨਾਲ ਮੇਲ ਖਾਣ ਵਾਲੇ ਸਪਸ਼ਟ, ਚੰਗੀ ਤਰ੍ਹਾਂ ਵਿਵਸਥਿਤ ਦਸਤਾਵੇਜ਼, ਪੇਸ਼ਕਾਰੀਆਂ, ਸਪ੍ਰੈਡਸ਼ੀਟਾਂ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਬਣਾਉਂਦਾ ਹੈ। Astra ਨੂੰ ਇਸ ਤਰ੍ਹਾਂ ਵੀ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਹੈ ਕਿ ਇਹ ਮੌਜੂਦਾ ਕੰਮ ਲਈ ਗੈਰ-ਜ਼ਰੂਰੀ ਜਾਣਕਾਰੀ ਦੁਹਰਾਉਣ ਦੀ ਬਜਾਏ, ਆਉਟਪੁੱਟਾਂ ਵਿੱਚ ਖਾਸ ਤੌਰ 'ਤੇ ਸਿਰਫ਼ ਉਹੀ ਸੰਦਰਭ ਸ਼ਾਮਲ ਕਰੇ ਜੋ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ। ਇਸ ਸਭ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਵਧੇਰੇ ਤੁਰੰਤ ਵਰਤੋਂ ਯੋਗ ਆਰਟੀਫੈਕਟਸ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ ਅਤੇ ਮਿਆਰਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹੋਣ।
GPT‑6 Astra, ਆਪਣੇ ਦੁਆਰਾ ਬਣਾਈਆਂ ਜਾਣ ਵਾਲੀਆਂ ਵੈੱਬਸਾਈਟਾਂ, ਗੇਮਾਂ, ਐਪਲੀਕੇਸ਼ਨਾਂ ਅਤੇ ਰੈਂਡਰਿੰਗ ਵਿੱਚ ਵਧੇਰੇ ਬਿਹਤਰ ਵਿਜ਼ੂਅਲ ਸਮਝ ਲਿਆਉਂਦਾ ਹੈ. ChatGPT ਵਿੱਚ ਸਾਈਟਾਂ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ, Astra ਪ੍ਰੌਂਪਟ ਤੋਂ ਸਿੱਧੇ ਵੈੱਬਸਾਈਟਾਂ, ਵੈੱਬ ਐਪਾਂ ਅਤੇ ਗੇਮਾਂ ਬਣਾ, ਹੋਸਟ ਅਤੇ ਸਾਂਝੀਆਂ ਕਰ ਸਕਦਾ ਹੈ.
ਜਦੋਂ ਹਦਾਇਤਾਂ ਵਿੱਚ ਵਿਆਖਿਆ ਲਈ ਗੁੰਜਾਇਸ਼ ਹੁੰਦੀ ਹੈ, ਤਾਂ GPT‑6 Astra ਸਹੀ ਫ਼ੈਸਲਾ ਲੈਣ ਵਿੱਚ ਪਿਛਲੇ ਮਾਡਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਹੈ. ਇਹ ਆਮ ਗੁੰਝਲਾਂ ਨੂੰ ਦੂਰ ਕਰਨ ਲਈ ਸੰਦਰਭ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ ਅਤੇ ਜਦੋਂ ਜਵਾਬ ਨਾਲ ਨਤੀਜਾ ਬਦਲ ਸਕਦਾ ਹੋਵੇ, ਤਾਂ ਕੇਂਦਰਿਤ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ. Codex ਵਿੱਚ, ਇਹ ਅਸਿੰਕ੍ਰੋਨਸ ਤਰੀਕੇ ਨਾਲ ਸਵਾਲ ਪੁੱਛ ਸਕਦਾ ਹੈ ਅਤੇ ਇਸ ਦੇ ਨਾਲ ਹੀ ਉਹ ਕੰਮ ਜਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਜਵਾਬ ’ਤੇ ਨਿਰਭਰ ਨਹੀਂ ਕਰਦਾ. ਜੇਕਰ ਤੁਸੀਂ ਜਵਾਬ ਨਹੀਂ ਦਿੰਦੇ, ਤਾਂ ਇਹ ਜਿੱਥੇ ਉਚਿਤ ਹੋਵੇ, ਉੱਥੇ ਵਾਜਬ ਧਾਰਨਾਵਾਂ ਦੇ ਆਧਾਰ ’ਤੇ ਅੱਗੇ ਵਧਦਾ ਹੈ, ਪਰ ਮਹੱਤਵਪੂਰਨ ਫੈਸਲਿਆਂ ਲਈ ਤੁਹਾਡੇ ਇਨਪੁੱਟ ਦੀ ਉਡੀਕ ਕਰਦਾ ਹੈ.
ਹੇਠਾਂ ਦਿੱਤੀਆਂ ਉਦਾਹਰਨਾਂ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ Astra ਰੋਜ਼ਾਨਾ ਦੇ ਉਹਨਾਂ ਕੰਮਾਂ ਵਿੱਚ ਕਿਵੇਂ ਸਹਿਯੋਗ ਕਰਦਾ ਹੈ, ਜਿੱਥੇ ਗੁੰਮ ਹੋਈ ਜਾਣਕਾਰੀ ਜਵਾਬ ਨੂੰ ਮਹੱਤਵਪੂਰਨ ਤੌਰ ’ਤੇ ਬਦਲ ਸਕਦੀ ਹੈ.
Astra ਕਿਸੇ ਟਾਸਕ ਦੇ ਵਿਕਸਿਤ ਹੋਣ ਦੇ ਨਾਲ-ਨਾਲ ਆਪਣਾ ਧਿਆਨ ਸਹੀ ਦਿਸ਼ਾ ਵਿੱਚ ਬਣਾਈ ਰੱਖਣ ਵਿੱਚ ਵੀ ਬਿਹਤਰ ਹੈ. ਪੁਰਾਣੇ ਮਾਡਲ ਕਈ ਵਾਰ ਸਟੀਅਰਿੰਗ ਮੈਸੇਜਾਂ ਨੂੰ ਇੱਕ ਨਵੇਂ ਟੀਚੇ ਵਜੋਂ ਸਮਝ ਲੈਂਦੇ ਸਨ, ਜਿਸ ਕਾਰਨ ਉਹ ਮੂਲ ਬੇਨਤੀ ਜਾਂ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਪਾਬੰਦੀਆਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਣਾ ਭੁੱਲ ਜਾਂਦੇ ਸਨ. Astra ਨਵੀਆਂ ਲੋੜਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ, ਪੁੱਛੇ ਜਾਣ ’ਤੇ ਆਪਣੀ ਦਿਸ਼ਾ ਬਦਲਦਾ ਹੈ ਅਤੇ ਵਿਆਪਕ ਟਾਸਕ ਤੋਂ ਭਟਕੇ ਬਿਨਾਂ ਸਾਈਡ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦਿੰਦਾ ਹੈ.
ਕੋਡਿੰਗ
GPT‑6 Astra ਅੱਜ ਤੱਕ ਦਾ ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ।
“GPT‑6 Astra ਸਾਡੇ ਅੰਦਰੂਨੀ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦਾ ਹੈ ਅਤੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਟ੍ਰੇਡਿੰਗ ਇੰਟਿਊਸ਼ਨ ਦੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਸਪਸ਼ਟ ਪ੍ਰਗਤੀ ਦਿਖਾਉਂਦਾ ਹੈ. ਏਜੰਟਿਕ ਕੋਡਿੰਗ ਲਈ ਵਰਤੇ ਜਾਣ 'ਤੇ, GPT‑6 Astra ਡਿਵੈਲਪਰਾਂ ਲਈ ਸਮਝਣ ਵਿੱਚ ਆਸਾਨ ਢੰਗ ਨਾਲ ਸੰਚਾਰ ਕਰਦਾ ਹੈ ਅਤੇ ਅਜਿਹਾ ਕੋਡ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜਿਸਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ-ਪੱਧਰ ਦੀ ਗੁਣਵੱਤਾ ਤੱਕ ਪਹੁੰਚਣ ਲਈ ਘੱਟ ਦੁਹਰਾਅ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ.”
“ਅਸੀਂ ਆਪਣੀਆਂ ਪਹਿਲੀ ਪੀੜ੍ਹੀ ਦੀਆਂ ਇਵੈਲਜ਼ ਵਿੱਚੋਂ ਇੱਕ 'ਤੇ ਘੱਟ, ਦਰਮਿਆਨੇ ਅਤੇ ਉੱਚ ਯਤਨਾਂ ਦੇ ਪੱਧਰਾਂ 'ਤੇ Astra ਨੂੰ ਟੈਸਟ ਕੀਤਾ ਹੈ, ਅਤੇ ਇਹ GPT 5.6 Sol ਨਾਲੋਂ ਕਾਫ਼ੀ ਅੱਗੇ ਰਿਹਾ। ਉੱਚ ਯਤਨ ਵਿੱਚ ਨਵੇਂ ਬਿਲਡ 'ਤੇ ਜ਼ਿਆਦਾ ਦੁਹਰਾਓ, ਬ੍ਰਾਊਜ਼ਰ ਟੈਸਟਿੰਗ ਰਾਹੀਂ ਵੱਧ ਪੁਸ਼ਟੀ, ਅਤੇ apply-patch ਦੇ ਮੁਕਾਬਲੇ ਕੋਡ ਚਲਾਉਣ ਵੱਲ ਜ਼ਿਆਦਾ ਝੁਕਾਅ ਮਿਲਦਾ ਹੈ। ਮਾਡਲ ਆਪਣੇ ਯਤਮ ਕਿਵੇਂ ਖਰਚ ਕਰਦਾ ਹੈ, ਇਸ ਨੂੰ ਸਮਝ ਕੇ ਹੀ ਅਸੀਂ ਲੱਖਾਂ ਬਿਲਡਰਾਂ ਨੂੰ ਵਿਚਾਰ ਤੋਂ ਕਾਰਜਸ਼ੀਲ ਐਪ ਤੱਕ ਇੱਕ ਤੇਜ਼, ਵੱਧ ਭਰੋਸੇਯੋਗ ਰਸਤਾ ਦਿੰਦੇ ਹਾਂ।”
Astra ਦੇ ਨਾਲ, ਅਸੀਂ ਸੰਦਰਭ ਸੀਮਾ ਦੇ ਭਰ ਜਾਣ 'ਤੇ ਸੰਦਰਭ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਣ ਅਤੇ ਮੁੜ-ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ Codex ਵਾਸਤੇ ਇੱਕ ਨਵਾਂ ਤਰੀਕਾ ਪੇਸ਼ ਕਰ ਰਹੇ ਹਾਂ. ਇਤਿਹਾਸਕ ਤੌਰ 'ਤੇ, ਮਾਡਲਾਂ ਨੇ ਲੰਬੇ ਸੈਸ਼ਨਾਂ ਦੌਰਾਨ ਕੰਮ ਦਾ ਸਾਰ ਦੇਣ ਲਈ ਕੰਪੈਕਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਠੀਕ ਕਰਨ ਜਾਂ ਵੱਡੇ ਰੀਫੈਕਟਰਾਂ ਨਾਲ ਨਜਿੱਠਣ ਵੇਲੇ. ਹਰ ਕੰਪੈਕਸ਼ਨ ਕੁਝ ਵੇਰਵਿਆਂ ਨੂੰ ਛੱਡ ਸਕਦਾ ਹੈ ਕਿ ਕੋਈ ਸੁਧਾਰ ਕਿਉਂ ਅਸਫਲ ਹੋਇਆ ਜਾਂ ਕੋਈ ਕੰਪੋਨੈਂਟ ਕਿਵੇਂ ਵਿਹਾਰ ਕਰਦਾ ਹੈ. Codex ਵਿੱਚ, Astra ਬਾਰ-ਬਾਰ ਸੰਕੁਚਿਤ ਕਰਕੇ ਇੱਕ ਸਿੰਗਲ ਸਾਰ ਬਣਾਉਣ ਦੀ ਬਜਾਏ, ਇਕੱਠੇ ਕੀਤੇ ਵੇਰਵਿਆਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ, ਸੰਦਰਭ ਸੀਮਾ ਵਿੱਚ ਨੋਟਸ ਰੱਖ ਸਕਦਾ ਹੈ. ਪੁਰਾਣੀਆਂ ਸੰਦਰਭ ਸੀਮਾ ਖੋਜ-ਯੋਗ ਰਹਿੰਦੀਆਂ ਹਨ, ਇਸ ਲਈ Astra ਪਿਛਲੇ ਸੰਦੇਸ਼ਾਂ ਅਤੇ ਟੂਲ ਦੇ ਨਤੀਜਿਆਂ ਤੋਂ ਜ਼ਰੂਰਤਾਂ ਜਾਂ ਟੈਸਟ ਦੇ ਨਤੀਜੇ ਲੱਭ ਸਕਦਾ ਹੈ—ਭਾਵੇਂ ਉਹ ਜਾਣਕਾਰੀ ਇਸਦੇ ਨੋਟਸ ਵਿੱਚ ਦਰਜ ਨਾ ਕੀਤੀ ਗਈ ਹੋਵੇ. ਤੁਸੀਂ ਇਸ ਪ੍ਰਯੋਗਾਤਮਕ ਫੀਚਰ ਨੂੰ ਆਪਣੇ Codex config.toml,(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹੋ, ਅਤੇ ਆਉਣ ਵਾਲੇ ਹਫ਼ਤਿਆਂ ਵਿੱਚ ਇਹ Astra ਲਈ ਡਿਫੌਲਟ ਬਣ ਜਾਵੇਗਾ.
ਵਿਗਿਆਨਕ ਖੋਜ ਨੂੰ ਅੱਗੇ ਵਧਾਉਣਾ
Astra ਵਿਗਿਆਨਕ ਖੋਜ ਦੇ ਪਿੱਛੇ ਦੇ ਵਿਹਾਰਕ ਕੰਮ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ. ਵਿਗਿਆਨਕ ਰੀਜ਼ਨਿੰਗ ਨੂੰ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਨਾਲ ਜੋੜ ਕੇ, ਇਹ ਡਾਟਾ ਦੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਨਤੀਜਿਆਂ ਦੀ ਪੜਚੋਲ ਕਰਨ ਲਈ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਵਿਸ਼ੇਸ਼ ਸੌਫ਼ਟਵੇਅਰ ਵਿੱਚ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਸਬੂਤਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਅਤੇ ਇਹ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਮਿਲਦੀ ਹੈ ਕਿ ਅੱਗੇ ਕੀ ਖੋਜ ਕਰਨੀ ਹੈ.
ਸਾਈਬਰ ਸੁਰੱਖਿਆ
ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਆਪਣੇ ਸੁਰੱਖਿਆ ਅੱਪਡੇਟ ਵਿੱਚ ਚਰਚਾ ਕੀਤੀ ਸੀ, Astra ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਛਾਲ ਹੈ ਅਤੇ ਸਾਡੇ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਦੇ ਤਹਿਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੀਮਾ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ. ਜ਼ੀਰੋ-ਡੇ ਐਕਸਪਲੋਇਟਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਵਿਕਸਿਤ ਕਰਨ ਦੀ ਇਸਦੀ ਸਮਰੱਥਾ ਰੱਖਿਅਕਾਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਪੈਚ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀ ਹੈ, ਪਰ ਇਹ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਜ਼ਰੂਰਤ ਵੀ ਪੈਦਾ ਕਰਦੀ ਹੈ. ਇਹ ਸਮਝਣ ਲਈ ਕਿ ਇਹ ਸਮਰੱਥਾਵਾਂ ਕਿੰਨੀ ਹੱਦ ਤੱਕ ਵਧੀਆਂ ਹਨ, ਅਸੀਂ Astra ਨੂੰ ਅੰਦਰੂਨੀ ਅਤੇ ਤੀਜੀ-ਧਿਰ ਦੇ ਮਾਹਰਾਂ ਵੱਲੋਂ ਕੀਤੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਪਰਖਿਆ.
ਅਸੀਂ ਸਭ ਤੋਂ ਪਹਿਲਾਂ ExploitBench ਅਤੇ ExploitGym 'ਤੇ ਪ੍ਰੋ਼ਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਮਾਡਲ ਦਾ ਟੈਸਟ ਕੀਤਾ, ਜੋ ਇਹ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਮਾਡਲ ਜਾਣੀਆਂ ਸੌਫਟਵੇਅਰ ਕਮਜ਼ੋਰੀਆਂ ਨੂੰ ਕਾਰਜਸ਼ੀਲ ਐਕਸਪਲੋਇਟਾਂ ਵਿੱਚ ਬਦਲ ਸਕਦੇ ਹਨ. ExploitBench 'ਤੇ, Astra ਨੇ 100% ਦਾ ਸੰਪੂਰਨ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜਦੋਂ ਕਿ ਸਾਡੇ ਪਿਛਲੇ ਅਤਿ-ਆਧੁਨਿਕ ਸਾਈਬਰ-ਸਮਰੱਥ ਮਾਡਲ GPT‑5.6 Sol ਦਾ ਸਕੋਰ 78.5% ਸੀ. ExploitGym 'ਤੇ, Astra ਨੇ ਕਾਫ਼ੀ ਘੱਟ ਆਊਟਪੁੱਟ ਟੋਕਨ ਵਰਤਦਿਆਂ 42.4% ਸਫਲਤਾ ਦਰ ਹਾਸਲ ਕੀਤੀ, ਜਦਕਿ GPT‑5.6 Sol ਲਈ ਇਹ 30.3% ਸੀ.13
ਇਹਨਾਂ ਚਿੰਤਾਵਾਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਦਿਆਂ ਕਿ ਇਤਿਹਾਸਕ ਸੌਫ਼ਟਵੇਅਰ ਕਮਜ਼ੋਰੀਆਂ ਦੇ ਸਾਹਮਣੇ ਆਉਣ ਨਾਲ ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ ਪ੍ਰਭਾਵਿਤ ਹੋ ਸਕਦੇ ਹਨ, ਅਸੀਂ Astra ਦਾ ਦੋ ਨਵੇਂ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਵੀ ਮੁਲਾਂਕਣ ਕੀਤਾ. ਪਹਿਲਾਂ, ਅਸੀਂ ਪਿਛਲੇ ਤਿੰਨ ਮਹੀਨਿਆਂ ਦੀਆਂ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਐਕਸਪਲੋਇਟ ਵਿਕਾਸ ਦੀ ਜਾਂਚ ਕਰਨ ਵਾਸਤੇ ਇੱਕ ਅੰਦਰੂਨੀ “ExploitBench (ਜੂਨ–ਅਗਸਤ 2026)” ਮੁਲਾਂਕਣ ਤਿਆਰ ਕੀਤਾ.14 Astra ਨੇ ਇਸ ਡਾਟਾਸੈੱਟ ’ਤੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਵੱਧ ਆਰਬਿਟਰੇਰੀ ਕੋਡ-ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਦਰਾਂ ਹਾਸਲ ਕੀਤੀਆਂ, ਜਦਕਿ ਆਊਟਪੁੱਟ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਕਾਫ਼ੀ ਘੱਟ ਰਹੀ. ਮੁਲਾਂਕਣ ਦੌਰਾਨ, Astra ਨੇ ਇੱਥੋਂ ਤੱਕ ਕਿ ਦੋ ਅਜਿਹੀਆਂ ਜ਼ੀਰੋ-ਡੇ ਕਮਜ਼ੋਰੀਆਂ ਖੋਜੀਆਂ ਅਤੇ ਵਰਤੀਆਂ, ਜੋ ਪਹਿਲਾਂ ਅਣਜਾਣ ਸਨ. ਅਸੀਂ ਦੋਵਾਂ ਕਮਜ਼ੋਰੀਆਂ ਬਾਰੇ ਉਨ੍ਹਾਂ ਦੇ ਮੈਨਟੇਨਰਾਂ ਨੂੰ ਸੂਚਿਤ ਕਰ ਰਹੇ ਹਾਂ.
ਅਸੀਂ SRE-Bench15 ’ਤੇ ਵੀ Astra ਦਾ ਟੈਸਟ ਕੀਤਾ, ਜੋ ਇੱਕ ਅਜਿਹਾ ਬੈਂਚਮਾਰਕ ਹੈ ਜੋ ਇਹ ਮਾਪਦਾ ਹੈ ਕਿ ਕੀ ਮਾਡਲ ਰਾਅ ਸੋਰਸ ਕੋਡ ਤੱਕ ਪਹੁੰਚ ਤੋਂ ਬਿਨਾਂ ਸੌਫ਼ਟਵੇਅਰ ਬਾਈਨਰੀਆਂ ਨੂੰ ਰਿਵਰਸ ਇੰਜੀਨੀਅਰ ਕਰਕੇ ਉਹਨਾਂ ਦੇ ਮੁੱਖ ਲੌਜਿਕ ਨੂੰ ਸਮਝ ਸਕਦੇ ਹਨ. Astra ਨੇ 88.0% ਟਾਸਕਾਂ ਨੂੰ ਇੱਕ ਹੀ ਕੋਸ਼ਿਸ਼ ਵਿੱਚ ਅਤੇ 99.2% ਟਾਸਕਾਂ ਨੂੰ ਚਾਰ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਹੱਲ ਕੀਤਾ, ਜਦੋਂ ਕਿ GPT‑5.6 Sol ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕ੍ਰਮਵਾਰ 55.9% ਅਤੇ 68.7% ਰਿਹਾ.
ਬੈਂਚਮਾਰਕਾਂ ਤੋਂ ਪਰੇ, ਮਾਹਰਾਂ ਦੀ ਅਗਵਾਈ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਤੋਂ ਪਤਾ ਲੱਗਾ ਹੈ ਕਿ Astra, ਪ੍ਰੋਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਚਲਾਏ ਜਾਣ ’ਤੇ, ਪਹਿਲਾਂ ਤੋਂ ਅਣਜਾਣ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਹਾਰਡਨਡ ਬ੍ਰਾਊਜ਼ਰਾਂ ਵਿੱਚ ਆਰਬਿਟਰੇਰੀ ਕੋਡ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਹਾਰਡਨਡ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮਾਂ ਲਈ ਪ੍ਰਿਵਿਲੇਜ-ਐਸਕੇਲੇਸ਼ਨ ਐਕਸਪਲੋਇਟ ਬਣਾ ਸਕਦਾ ਹੈ.
ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਡਿਫੈਂਡਰ ਦੀ ਵਿੰਡੋ ਵਿੱਚ ਚਰਚਾ ਕੀਤੀ ਸੀ, ਅਤਿ-ਆਧੁਨਿਕ ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਡਿਫੈਂਡਰਾਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਤੇਜ਼ੀ ਨਾਲ ਪਤਾ ਲਗਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਪਰ ਇਹ ਉਹਨਾਂ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਫਾਇਦਾ ਉਠਾਉਣਾ ਵੀ ਆਸਾਨ ਬਣਾਉਂਦੀਆਂ ਹਨ, ਜਿਸ ਨਾਲ ਡਿਫੈਂਡਰਾਂ ਲਈ ਆਪਣੇ ਆਪ ਨੂੰ ਢਾਲਣ ਦੀ ਜ਼ਰੂਰਤ ਹੋਰ ਵੀ ਵੱਧ ਜਾਂਦੀ ਹੈ. ਅੱਜ ਲਾਂਚ ਹੋਣ ਵਾਲੇ Astra ਦੇ ਵਰਜ਼ਨ ਨਾਲ, ਡਿਫੈਂਡਰ ਇਸਦੀ ਵਰਤੋਂ ਸੁਰੱਖਿਅਤ ਕੋਡ ਸਮੀਖਿਆ ਅਤੇ ਪੈਚਿੰਗ ਵਰਗੀਆਂ ਟਾਸਕਾਂ ਨੂੰ ਪੂਰੇ ਕਰਨ ਲਈ ਕਰ ਸਕਦੇ ਹਨ.
ਹਾਲਾਂਕਿ, Astra ਹੋਰ ਵੱਧ ਐਡਵਾਂਸਡ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਟਾਸਕਾਂ ਜਿਵੇਂ ਕਿ ਕਮਜ਼ੋਰੀਆਂ ਲਈ ਪ੍ਰੂਫ-ਆਫ-ਕਾਂਸੈਪਟ ਐਕਸਪਲੋਇਟਸ ਬਣਾਉਣ ਨੂੰ ਕਰਨ ਤੋਂ ਇਨਕਾਰ ਕਰ ਦੇਵੇਗਾ. OpenAI Daybreak ਰਾਹੀਂ, ਅਸੀਂ ਆਉਣ ਵਾਲੇ ਹਫ਼ਤਿਆਂ ਵਿੱਚ ਪਹੁੰਚ ਦਾ ਵਿਸਤਾਰ ਕਰਨ ਅਤੇ ਘੱਟ ਪਾਬੰਦੀਆਂ ਵਾਲੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸ਼ੁਰੂ ਕਰਨ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਹੇ ਹਾਂ. ਇਹ ਹੋਰ ਰੱਖਿਆਤਮਕ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਸਮਰੱਥ ਬਣਾਏਗਾ, ਜਿਸ ਵਿੱਚ ਕਮਜ਼ੋਰੀਆਂ ਅਤੇ ਪ੍ਰੂਫ਼-ਆਫ਼-ਕਾਂਸੈਪਟ ਦੀ ਪ੍ਰਮਾਣਿਕਤਾ, ਮਾਲਵੇਅਰ ਵਿਸ਼ਲੇਸ਼ਣ, ਅਤੇ ਡਿਟੈਕਸ਼ਨ ਇੰਜੀਨੀਅਰਿੰਗ ਸ਼ਾਮਲ ਹਨ.
ਅਸੀਂ GPT‑5.6 Sol ਲਈ ਆਪਣੇ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਹੋਰ ਮਜ਼ਬੂਤ ਕਰਦੇ ਹੋਏ, ਸੰਭਾਵੀ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਦੇ ਖਿਲਾਫ ਆਪਣੀ ਸੁਰੱਖਿਆ ਨੂੰ ਵੀ ਮਜ਼ਬੂਤ ਕੀਤਾ ਹੈ. ਇਹਨਾਂ ਵਿੱਚ ਸੰਭਾਵੀ ਜੇਲਬ੍ਰੇਕਾਂ ਦਾ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਸਾਹਮਣਾ ਕਰਨ ਲਈ ਮਾਡਲ ਦੀ ਵਧੇਰੇ ਮਜ਼ਬੂਤੀ ਅਤੇ ਸਾਡੇ ਨਿਗਰਾਨੀ ਸਿਸਟਮਾਂ ਲਈ ਵਧੇਰੇ ਸੰਦਰਭ ਸ਼ਾਮਲ ਹਨ. ਅਸੀਂ ਆਪਣੇ 12 ਅੰਦਰੂਨੀ ਰੈਡ ਟੀਮਿੰਗ ਹਮਲਾਵਰਾਂ ਨਾਲ ਸਖ਼ਤ ਅੰਦਰੂਨੀ ਅਤੇ ਬਾਹਰੀ ਟੈਸਟਿੰਗ ਜਾਰੀ ਰੱਖੀ ਹੈ, ਜਿਸ ਵਿੱਚ ਸਵੈਚਾਲਿਤ ਮੁਲਾਂਕਣ ਵੀ ਸ਼ਾਮਲ ਹਨ. ਸਾਡੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਅਤੇ ਟੈਸਟਿੰਗ ਬਾਰੇ ਹੋਰ ਵੇਰਵੇ Astra ਸੁਰੱਖਿਆ ਸੰਖੇਪ ਜਾਣਕਾਰੀ ਅਤੇ ਸਿਸਟਮ ਕਾਰਡ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਉਪਲਬਧ ਹਨ..
GPT‑6 Astra ਨੂੰ ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਅਲਾਈਨ ਕਰਨਾ ਅਤੇ ਤਾਇਨਾਤ ਕਰਨਾ
Astra ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਹੈ. Astra ਸਾਵਧਾਨੀ ਵਰਤਣ, ਟਾਸਕ ਦੀਆਂ ਹੱਦਾਂ ਦਾ ਸਤਿਕਾਰ ਕਰਨ ਅਤੇ ਪਾਰਦਰਸ਼ੀ ਢੰਗ ਨਾਲ ਸੰਚਾਰ ਕਰਨ ਵਿੱਚ ਸ਼ਾਨਦਾਰ ਹੈ. ਇਹ ਕੰਮ ਸਾਡੇ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੇ ਖੋਜ ਪ੍ਰੋਗਰਾਮ ਦਾ ਨਵੀਨਤਮ ਨਤੀਜਾ ਹੈ, ਜੋ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਮਨੁੱਖੀ ਇਰਾਦੇ ਨਾਲ ਤਾਲਮੇਲ ਵਿੱਚ ਰਹਿਣ ਵਾਲੇ ਮਾਡਲਾਂ ਨੂੰ ਟ੍ਰੇਨ ਕਰਨ 'ਤੇ ਕੇਂਦਰਿਤ ਹੈ.
ਸੰਵੇਦਨਸ਼ੀਲ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ, Astra ਆਪਣੇ ਜੋਖਮ ਦੇ ਅਨੁਪਾਤ ਵਿੱਚ ਸਾਵਧਾਨੀ ਨਾਲ ਅੱਗੇ ਵਧਦਾ ਹੈ. ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਵਾਲੇ ਉਹਨਾਂ ਟਾਸਕਾਂ ਦੇ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਗਲਤ ਵਿਵਹਾਰ ਪੈਦਾ ਕਰਨ ਲਈ ਵਿਰੋਧਾਤਮਕ ਢੰਗ ਨਾਲ ਚੁਣਿਆ ਗਿਆ ਸੀ, Astra ਅਣਚਾਹੇ ਨਤੀਜਿਆਂ ਤੋਂ ਬਚਣ ਵਿੱਚ ਵੱਧ ਸਫਲ ਰਹੀ. ਮੂਲ ਰੂਪ ਵਿੱਚ ਪ੍ਰਦਾਨ ਕੀਤੇ ਜਾਂਦੇ ਵਾਧੂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨਾਲ ਚਲਾਉਣ ’ਤੇ ਹੋਰ ਵੀ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਮਿਲਿਆ.
Astra ਕਿਸੇ ਵੀ ਹੋਰ ਟੈਸਟ ਕੀਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲ ਨਾਲੋਂ ਘੱਟ ਗਲਤ-ਸੰਰੇਖਿਤ ਨਤੀਜੇ ਪੈਦਾ ਕਰਦਾ ਹੈ. ਨਿਰਪੱਖ ਤੁਲਨਾ ਲਈ, ਅਸੀਂ ਇੱਕ ਆਮ ਕੰਪਿਊਟਰ-ਯੂਜ਼ਿੰਗ-ਏਜੰਟ ਜਾਂਚ-ਢਾਂਚਾ ਵਰਤਿਆ (ਜੋ ਦੋਵਾਂ OpenAI Responses API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ Anthropic Messages API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਉਪਲਬਧ ਨੇਟਿਵ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਟੂਲਾਂ 'ਤੇ ਆਧਾਰਿਤ ਹੈ) ਅਤੇ ਵਾਧੂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਮੁਲਾਂਕਣ ਕੀਤਾ, ਜੋ ਆਮ ਤੌਰ 'ਤੇ Codex ਅਤੇ ChatGPT ਵਰਕ ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਲਾਗੂ ਕੀਤੇ ਜਾਂਦੇ ਹਨ (ਸਵੈ-ਸਮੀਖਿਆ, ਪੁਸ਼ਟੀਕਰਨ ਨੀਤੀ).
Astra ਦੇ ਵਰਤੋਂਕਾਰ ਦੁਆਰਾ ਨਿਰਧਾਰਤ ਕੀਤੀਆਂ ਅਤੇ ਇਸਦੇ ਵਾਤਾਵਰਨ ਦੁਆਰਾ ਸੰਕੇਤਿਤ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਕੰਮ ਕਰਨ ਦੀ ਵੀ ਵੱਧ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ. ਇੱਕ ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਨੇ Codex Auto-Review ਵੱਲੋਂ ਕੀਤੇ ਇਨਕਾਰ ਨੂੰ ਕਦੇ ਵੀ ਬਾਈਪਾਸ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕੀਤੀ. ਇਹ ਗੱਲ ਉਸ ਵੇਲੇ ਵੀ ਸਹੀ ਰਹੀ ਜਦੋਂ Auto-review ਨੂੰ ਜਾਣ-ਬੁੱਝ ਕੇ ਇਸ ਤਰ੍ਹਾਂ ਕੌਂਫਿਗਰ ਕੀਤਾ ਗਿਆ ਸੀ ਕਿ ਇਸ ਤੋਂ ਬਚ ਕੇ ਨਿਕਲਿਆ ਜਾ ਸਕੇ, ਅਤੇ ਕਿਸੇ ਹੋਰ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਪੂਰਾ ਕਰਨਾ ਅਸੰਭਵ ਸੀ. ਵਾਤਾਵਰਨ ਦੀਆਂ ਪਾਬੰਦੀਆਂ ਲਈ ਇਹ ਸਤਿਕਾਰ ਸਾਡੇ ਅਸੰਭਵ ਸਾਈਬਰ ਟਾਸਕ ਮੁਲਾਂਕਣ ਦੇ ਨਤੀਜਿਆਂ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ, ਜੋ ਅਸੀਂ ਇਸ ਪੋਸਟ ਦੀ ਜਾਣ-ਪਛਾਣ ਵਿੱਚ ਸਾਂਝੇ ਕੀਤੇ ਸਨ, ਅਤੇ ਹੋਰ ਨਤੀਜਿਆਂ ਨਾਲ ਵੀ ਜੋ ਸਾਡੇ ਸਿਸਟਮ ਕਾਰਡ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਦਰਜ ਹਨ.
Astra ਇਸ ਤੋਂ ਇਲਾਵਾ ਪਾਰਦਰਸ਼ੀ ਵਰਤੋਂਕਾਰ ਸੰਚਾਰ ਵਿੱਚ ਨਵੇਂ ਮਾਪਦੰਡ ਸਥਾਪਤ ਕਰਦਾ ਹੈ. ਇੱਕ ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਵੱਲੋਂ GPT‑5.6 ਨਾਲੋਂ ਤਿੰਨ ਗੁਣਾ ਘੱਟ ਸੰਭਾਵਨਾ ਹੈ ਕਿ Sol ਆਪਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਅਤੇ ਉਪਲਬਧ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਬਾਰੇ ਗਲਤ ਪੇਸ਼ਕਾਰੀਆਂ ਕਰੇ.
ਸਾਡੇ ਸਮਰੱਥਾ-ਭਰਮ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਆਪਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਬਾਰੇ ਘੱਟ ਗੁੰਮਰਾਹਕੁੰਨ ਦਾਅਵੇ ਕਰਕੇ, GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਸੁਧਾਰ ਦਿਖਾਉਂਦਾ ਹੈ।
ਸਾਡੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਪਾਇਆ ਗਿਆ ਕਿ Astra ਦੀ ਲਿਖਤੀ ਰੀਜ਼ਨਿੰਗ GPT‑5.6 Sol ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਨਿਗਰਾਨੀ ਕਰਨਾ ਵਧੇਰੇ ਮੁਸ਼ਕਲ ਹੈ, ਜੋ ਉਹਨਾਂ ਟੈਸਟਾਂ ’ਤੇ ਆਧਾਰਿਤ ਸੀ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਖਾਸ ਤੌਰ ’ਤੇ ਇਸਨੂੰ ਨਿਗਰਾਨੀ ਤੋਂ ਬਚਣ ਲਈ ਕਿਹਾ ਗਿਆ ਸੀ. ਅਸੀਂ ਇਸਦਾ ਕਾਰਨ ਸਰਲ ਟਾਸਕਾਂ ਵਿੱਚ ਲਿਖਤੀ ਰੀਜ਼ਨਿੰਗ ਉੱਤੇ Astra ਦੇ ਵੱਧ ਕੰਟਰੋਲ ਅਤੇ ਘੱਟ ਲਿਖਤੀ ਕਦਮਾਂ ਨਾਲ ਸਮੱਸਿਆਵਾਂ ਹੱਲ ਕਰਨ ਦੀ ਇਸਦੀ ਸਮਰੱਥਾ ਨੂੰ ਮੰਨਦੇ ਹਾਂ. Astra ਨੂੰ ਅਜੇ ਵੀ ਗੁੰਝਲਦਾਰ ਟਾਸਕਾਂ ਲਈ ਲੋੜੀਂਦੀ ਰੀਜ਼ਨਿੰਗ ਨੂੰ ਛੁਪਾਉਣ ਵਿੱਚ ਮੁਸ਼ਕਲ ਆਉਂਦੀ ਜਾਪਦੀ ਹੈ, ਪਰ ਅਸੀਂ ਇਸ ਗਿਰਾਵਟ ਨੂੰ ਗੰਭੀਰਤਾ ਨਾਲ ਲੈਂਦੇ ਹਾਂ. ਨਿਗਰਾਨੀਯੋਗਤਾ ਵਿੱਚ ਸੁਧਾਰ ਕਰਨਾ ਖੋਜ ਦੀ ਤਰਜੀਹ ਬਣਿਆ ਹੋਇਆ ਹੈ, ਅਤੇ ਨਾਲ ਦਿੱਤਾ ਸਿਸਟਮ ਕਾਰਡ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਸਾਡੀਆਂ ਖੋਜਾਂ ਅਤੇ ਚੱਲ ਰਹੇ ਕੰਮ ਦਾ ਵੇਰਵਾ ਦਿੰਦਾ ਹੈ.
ਅਲਾਈਨਮੈਂਟ ਸਿਖਲਾਈ, ਡਿਪਲੌਇਮੈਂਟ ਲਈ ਸਾਡੀ ਪਹੁੰਚ ਦਾ ਮੁੱਖ ਹਿੱਸਾ ਹੈ. ਸੁਰੱਖਿਆ ਦੀ ਵਾਧੂ ਪਰਤ ਵਜੋਂ, ਅਸੀਂ ਅਸੁਰੱਖਿਅਤ ਵਿਹਾਰ ਦਾ ਪਤਾ ਲਗਾਉਣ ਅਤੇ ਉਸਨੂੰ ਰੋਕਣ ਵਿੱਚ ਮਦਦ ਲਈ Codex ਸਵੈ-ਸਮੀਖਿਆ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਰਗੇ ਸਿਸਟਮ ਸੁਰੱਖਿਆ ਉਪਾਅ ਅਤੇ ਏਜੰਟਾਂ ਦੀ ਰੀਜ਼ਨਿੰਗ ਅਤੇ ਕਾਰਵਾਈਆਂ ਦੀ ਨਿਗਰਾਨੀ ਵੀ ਬਣਾਉਂਦੇ ਹਾਂ. ਸਾਡੀ ਸੁਰੱਖਿਆ ਅੱਪਡੇਟ ਵਿੱਚ ਦੱਸੇ ਅਨੁਸਾਰ, ਅਸੀਂ ਗਲਤ ਅਲਾਈਨਮੈਂਟ ਬਾਰੇ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤ ਕਰਨ ਅਤੇ ਇਸ ਦੀਆਂ ਸਭ ਤੋਂ ਗੰਭੀਰ ਘਟਨਾਵਾਂ ਨੂੰ ਰੋਕਣ ਵਿੱਚ ਮਦਦ ਲਈ Astra-ਸ਼੍ਰੇਣੀ ਦੇ ਮਾਡਲਾਂ ਵਾਸਤੇ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਗਲਤ ਅਲਾਈਨਮੈਂਟ ਦੀ ਨਿਗਰਾਨੀ ਵੀ ਡਿਪਲੌਇ ਕਰ ਰਹੇ ਹਾਂ. ਇਹ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸਾਡੀਆਂ ਅੰਦਰੂਨੀ ਡਿਪਲੌਇਮੈਂਟ ਦੀ ਨਿਗਰਾਨੀ ਵਰਗੇ ਹਨ ਅਤੇ ਇਹਨਾਂ ਵਿੱਚ ਵਰਗੀਕਰਤਾਵਾਂ ਦੀ ਇੱਕ ਪ੍ਰਣਾਲੀ ਸ਼ਾਮਲ ਹੈ, ਜੋ ਅਣਅਧਿਕਾਰਤ ਵਿਹਾਰ ਦੀ ਜਾਂਚ ਲਈ ਮਾਡਲ ਦੀ ਰੀਜ਼ਨਿੰਗ ਅਤੇ ਕਾਰਵਾਈਆਂ ਦੀ ਜਾਂਚ ਕਰਦੀ ਹੈ ਅਤੇ ਸੰਭਾਵੀ ਅਣਅਧਿਕਾਰਤ ਸਰਗਰਮੀ ਨੂੰ ਆਪਣੇ ਆਪ ਰੋਕ ਦਿੰਦੀ ਹੈ.
Astra ਦੀਆਂ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਵਾਧੇ ਨੂੰ ਦੇਖਦੇ ਹੋਏ, ਅਸੀਂ ਇਸ ਡਿਪਲੌਇਮੈਂਟ ਨੂੰ ਸੁਰੱਖਿਅਤ ਅਤੇ ਮਜ਼ਬੂਤ ਬਣਾਉਣ ਲਈ ਖ਼ਾਸ ਤੌਰ 'ਤੇ ਸਾਵਧਾਨੀ ਵਰਤ ਰਹੇ ਹਾਂ. ਵਾਧੂ ਸੁਰੱਖਿਆ ਜਾਂਚਾਂ ਕਈ ਵਾਰ ਜਾਇਜ਼ ਕੰਮ ਨੂੰ ਹੌਲੀ, ਰੋਕ ਜਾਂ ਬੰਦ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਜਿਸ ਵਿੱਚ ਰੱਖਿਆਤਮਕ ਸਾਈਬਰਸੁਰੱਖਿਆ ਵੀ ਸ਼ਾਮਲ ਹੈ. ਜੇਕਰ ChatGPT ਜਾਂ Codex ਵਿੱਚ ਕੋਈ ਟਾਸਕ ਅਸਥਾਈ ਤੌਰ ’ਤੇ ਰੁਕ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਜਾਰੀ ਰੱਖਣ ਤੋਂ ਪਹਿਲਾਂ ਤੁਹਾਨੂੰ ਕਾਰਵਾਈ ਦੀ ਸਮੀਖਿਆ ਕਰਨ ਲਈ ਕਿਹਾ ਜਾ ਸਕਦਾ ਹੈ. API ਵਿੱਚ, ਟਾਸਕ ਰੁਕ ਜਾਵੇਗੀ. ਇਹ ਟੈਸਟ ਕਈ ਵਾਰ ਵੈਧ ਕੰਮ ਵਿੱਚ ਰੁਕਾਵਟ ਪਾ ਸਕਦੇ ਹਨ, ਅਤੇ ਅਸੀਂ ਬੇਲੋੜੀਆਂ ਰੁਕਾਵਟਾਂ ਨੂੰ ਘਟਾਉਣ ਲਈ ਇਸ ਸਿਸਟਮ ਵਿੱਚ ਲਗਾਤਾਰ ਸੁਧਾਰ ਕਰ ਰਹੇ ਹਾਂ. ਗਲਤ ਅਲਾਈਨਮੈਂਟ ਨਿਗਰਾਨੀ ਅਲਾਈਨਮੈਂਟ ਦੀ ਥਾਂ ਨਹੀਂ ਲੈ ਸਕਦੀ: ਸਾਡਾ ਟੀਚਾ ਅਜਿਹੇ ਮਾਡਲ ਬਣਾਉਣਾ ਹੈ ਜੋ ਭਰੋਸੇਯੋਗ ਢੰਗ ਨਾਲ ਆਪਣੇ ਅਧਿਕਾਰਤ ਦਾਇਰੇ ਵਿੱਚ ਰਹਿਣ, ਤਾਂ ਜੋ ਇਹਨਾਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਦਖਲ ਦੇਣ ਦੀ ਲੋੜ ਨਾ ਪਵੇ.
ਉਪਲਬਧਤਾ
GPT‑6 Astra ਅੱਜ ਸੀਮਿਤ ਗਿਣਤੀ ਦੀਆਂ ਸੰਸਥਾਵਾਂ ਲਈ ਪੇਸ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਅਤੇ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਵਿੱਚ ਇਹ ਸਾਰੇ ChatGPT Plus, Pro, Business ਅਤੇ Enterprise ਵਰਤੋਂਕਾਰਾਂ ਲਈ, ਨਾਲ ਹੀ OpenAI API, Microsoft Azure ਅਤੇ AWS Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ. Astra ਦੀ ਵਰਤੋਂ ਮੌਜੂਦਾ ਸਬਸਕ੍ਰਿਪਸ਼ਨ ਭੱਤਿਆਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹੈ—ਵਰਤੋਂਕਾਰ ਅਤੇ ਕਾਰੋਬਾਰ ਵਾਧੂ ਵਰਤੋਂ ਲਈ ਕ੍ਰੈਡਿਟ ਵੀ ਖਰੀਦ ਸਕਣਗੇ. Pro, Business ਅਤੇ Enterprise ਪਲਾਨਾਂ ਵਾਲੇ ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ GPT‑6 Astra Pro ਤੱਕ ਵੀ ਪਹੁੰਚ ਮਿਲੇਗੀ. Enterprise ਐਡਮਿਨਿਸਟ੍ਰੇਟਰ ਆਪਣੀ ਵਰਕਸਪੇਸ ਲਈ Astra ਨੂੰ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹਨ; ਲਾਂਚ ਦੇ ਸਮੇਂ ਪਹੁੰਚ ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ ਬੰਦ ਰਹਿੰਦੀ ਹੈ.
Astra ਯੋਗ API ਗਾਹਕਾਂ ਲਈ ਜ਼ੀਰੋ ਡਾਟਾ ਰਿਟੈਂਸ਼ਨ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਅਤੇ ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਪਿਛਲੇ ਮਹੀਨੇ ਸਾਂਝਾ ਕੀਤਾ ਸੀ, ਅਸੀਂ ਗਾਹਕਾਂ ਦੀ ਪ੍ਰਾਈਵੇਸੀ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਸੁਰੱਖਿਆ ਨਿਗਰਾਨੀ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਨ ਲਈ ਪ੍ਰਾਈਵੇਟ ਸੇਫ਼ਟੀ ਪ੍ਰੋਸੈਸਿੰਗ ਦੀ ਟੈਸਟਿੰਗ ਕਰ ਰਹੇ ਹਾਂ.
ਡਿਵੈਲਪਰਾਂ ਲਈ, GPT‑6 Astra OpenAI API ਵਿੱਚ gpt-6-astra ਵਜੋਂ ਅਤੇ Microsoft Azure ਅਤੇ Amazon Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ।
OpenAI API ਸਟੈਂਡਰਡ ਕੀਮਤ ਹਰ 10 ਲੱਖ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $10 ਅਤੇ ਹਰ 10 ਲੱਖ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $50 ਹੈ. ਕੈਸ਼ ਰੀਡਸ ਅਤੇ ਰਾਈਟਸ 'ਤੇ ਵੱਖਰੀਆਂ ਦਰਾਂ ਲਾਗੂ ਹੁੰਦੀਆਂ ਹਨ. API ਵਿੱਚ GPT‑6 Astra ਲਈ ਫਾਸਟ ਮੋਡ ਉਪਲਬਧ ਹੈ ਅਤੇ ਇਹ ਸਟੈਂਡਰਡ ਕੀਮਤ ਤੋਂ ਦੁੱਗਣੀ ਕੀਮਤ 'ਤੇ ਸਟੈਂਡਰਡ ਪ੍ਰੋਸੈਸਿੰਗ ਨਾਲੋਂ ਦੋ ਗੁਣਾ ਤੱਕ ਦੀ ਸਪੀਡ ਦਿੰਦਾ ਹੈ.
ਪੇਸ਼ੇਵਰ
ਪੇਸ਼ੇਵਰ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
ਅੰਦਰੂਨੀ ਡਿਜ਼ਾਈਨ ਟਾਸਕਾਂ | 50.0% | 47.4% | - | 35.8% | - | - |
ਅੰਦਰੂਨੀ ਡਾਟਾ ਸਾਇੰਸ ਟਾਸਕਾਂ | 40.9% | 30.5% | - | 34.7% | - | - |
ਆਰਟੀਫੀਸ਼ੀਅਲ ਐਨਾਲਿਸਿਸ ਇੰਟੈਲੀਜੈਂਸ ਇੰਡੈਕਸ v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
ਕੋਡਿੰਗ
| ਕੋਡਿੰਗ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (ਸਕੋਰ) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (ਸਕੋਰ) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| ਅੰਦਰੂਨੀ ਡੇਟਾਬੇਸ ਮਾਈਗ੍ਰੇਸ਼ਨ ਟਾਸਕ | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis ਕੋਡਿੰਗ ਏਜੰਟ ਇੰਡੈਕਸ v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
ਅਕਾਦਮਿਕ
ਅਕਾਦਮਿਕ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath ਟੀਅਰ 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (ਟੂਲਾਂ ਦੇ ਨਾਲ) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
ਅਲਾਈਨਮੈਂਟ
ਅਲਾਈਨਮੈਂਟ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
ਅੰਦਰੂਨੀ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸੁਰੱਖਿਆ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਹੋਣਾ ਬਿਹਤਰ ਹੈ) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
ਅੰਦਰੂਨੀ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸੁਰੱਖਿਆ ਬੈਂਚਮਾਰਕ, AutoReview ਦੇ ਨਾਲ (ਘੱਟ ਬਿਹਤਰ ਹੈ) | 1.8% | 4.3% | - | - | - | - |
ਅੰਦਰੂਨੀ ਬਾਈਪਾਸ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਬਿਹਤਰ ਹੈ) | 0.00% | 0.29% | - | - | - | - |
ExploitGym honeypot (ਘੱਟ ਬਿਹਤਰ ਹੁੰਦਾ ਹੈ) | 0.0% | 48.2% | - | - | - | - |
ਅਸੰਭਵ ExploitGym | 100.0% | - | - | - | - | - |
ਅੰਦਰੂਨੀ ਹੈਲੂਸੀਨੇਸ਼ਨ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਹੋਣਾ ਬਿਹਤਰ ਹੈ) | 4.2% | 12.2% | - | - | - | - |
ਲੰਬਾ ਸੰਦਰਭ
ਲੰਬਾ ਸੰਦਰਭ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
ਅਮੂਰਤ ਰੀਜ਼ਨਿੰਗ
| ਅਮੂਰਤ ਰੀਜ਼ਨਿੰਗ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 7 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
ਮੁਲਾਂਕਣ ਸਕੋਰ ਕਿਸੇ ਵੀ ਯਤਨ ਪੱਧਰ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਹੁੰਦੇ ਹਨ. GPT ਮੁਲਾਂਕਣ ਸਾਡੇ ਖੋਜ ਵਾਤਾਵਰਨ ਵਿੱਚ ਜਾਂ ਸਾਡੇ API ਰਾਹੀਂ ਚਲਾਏ ਗਏ ਸਨ, ਜੋ ਸਿਸਟਮ ਪ੍ਰੌਂਪਟਾਂ, ਉਪਲਬਧ ਟੂਲਾਂ ਆਦਿ ਵਿੱਚ ਫਰਕ ਕਰਕੇ ਪ੍ਰੋਡਕਸ਼ਨ ChatGPT ਤੋਂ ਥੋੜ੍ਹੀ ਵੱਖਰੀ ਆਊਟਪੁੱਟ ਦੇ ਸਕਦੇ ਹਨ.
ਫੁੱਟਨੋਟ
- 1
ARC-AGI-3 ਉੱਤੇ, GPT-6 Astra ਨੂੰ ਸਾਡੇ Responses API ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ ਚਲਾਇਆ ਗਿਆ ਸੀ, ਜੋ ਅਸਲ-ਦੁਨੀਆ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਨਾਲ ਬਿਹਤਰ ਮੇਲ ਲਈ ਦੋ ਸੈਟਿੰਗਾਂ ਬਦਲਦਾ ਹੈ. ਇਹ ਤਬਦੀਲੀਆਂ ਖਾਸ ਤੌਰ 'ਤੇ ARC-AGI-3 ਨੂੰ ਨਿਸ਼ਾਨਾ ਨਹੀਂ ਬਣਾਉਂਦੀਆਂ.
- 2
GPT-5.6 Sol ਸਾਡੇ API, ChatGPT Codex, ਅਤੇ ChatGPT ਵਰਕ ਵਿੱਚ ਉਪਲਬਧ ਵਰਜ਼ਨ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ. ChatGPT ਚੈਟ ਵਿੱਚ ਵਰਜ਼ਨ ਥੋੜ੍ਹਾ ਵੱਖਰਾ ਹੈ.
- 3
OSWorld V2-Offline ਮੂਲ OSWorld V2 ਦਾ ਇੱਕ ਉਪ-ਸੈੱਟ ਹੈ ਜੋ ਇੰਟਰਨੈੱਟ ਪਹੁੰਚ ਤੋਂ ਬਿਨਾਂ ਕੰਮ ਕਰਦਾ ਹੈ. OSWorld-V2 Offline ਉੱਤੇ Claude ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਲੇਖਕਾਂ ਨੇ ਅਧਿਕਾਰਤ ਲੀਡਰਬੋਰਡ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਉੱਤੇ ਦੁਹਰਾਇਆ. OSWorld 2.0 ਉੱਤੇ, Claude ਦੇ ਸਕੋਰਾਂ ਲਈ ਅਧਿਕਾਰਤ ਸੈਟਿੰਗਾਂ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਨਾ ਕਿ Fable 5.1 ਸਿਸਟਮ ਕਾਰਡ ਦੇ ਸੋਧੇ ਹੋਏ ਟਾਸਕ ਅਤੇ ਸੋਧੇ ਹੋਏ ਮੁਲਾਂਕਣ.
- 4
- 5
BenchCAD 'ਤੇ, Claude ਦੇ ਸਕੋਰ eval ਵਿੱਚ ਕੀਤੀਆਂ ਤਿੰਨ ਸੋਧਾਂ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ, ਜਿਨ੍ਹਾਂ ਦਾ ਵੇਰਵਾ Fable 5.1 ਸਿਸਟਮ ਕਾਰਡ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਦਿੱਤਾ ਗਿਆ ਹੈ.
- 6
ਗੁਆਂਗ ਯਾਂਗ, ਵਿਕਟੋਰੀਆ ਐਬਰਟ, ਨਾਜ਼ਿਫ਼ ਤਾਮੇਰ, ਬ੍ਰਾਇਨ ਸਿਯੁਆਨ ਝੇਂਗ, ਲੁਈਜ਼ਾ ਪੋਜ਼ਬੋਨ, ਅਤੇ ਨੋਆ ਏ. ਸਮਿਥ. “LEGATO: ਲਾਰਜ-ਸਕੇਲ ਐਂਡ-ਟੂ-ਐਂਡ ਜਨਰਲਾਈਜ਼ੇਬਲ ਅਪ੍ਰੋਚ ਟੂ ਟਾਈਪਸੈਟ OMR(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” arXiv:2506.19065, 2025.
- 7
ਮਾਰਕ ਆਰ. ਐਚ. ਗੋਥਮ, ਮੌਰੀਨ ਰੈਡਬੌਂਡ, ਬਰੂਨੋ ਬਾਵਰ, ਅਤੇ ਪੀਟਰ ਜੋਨਾਸ. “The OpenScore String Quartet Corpus(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” ਡਿਜੀਟਲ ਲਾਇਬ੍ਰੇਰੀਜ਼ ਫ਼ਾਰ ਮਿਊਜ਼ਿਕੋਲੋਜੀ ਬਾਰੇ 10ਵੀਂ ਅੰਤਰਰਾਸ਼ਟਰੀ ਕਾਨਫਰੰਸ ਦੀਆਂ ਕਾਰਵਾਈਆਂ, ਸਫ਼ੇ 49–57. ACM, 2023.
- 8
FrontierCode 'ਤੇ, GPT-6 Astra ਨੂੰ ਇੱਕ ਡਿਵੈਲਪਰ ਮੈਸੇਜ ਨਾਲ ਚਲਾਇਆ ਗਿਆ ਸੀ ਜੋ ਇਸਦੇ Codex ਵਿੱਚ ਡਿਵੈਲਪਰ ਮੈਸੇਜ ਦੇ ਇੱਕ ਭਾਗ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਰਗਾ ਸੀ: "ਬਹੁਤ ਜ਼ਿਆਦਾ ਟੈਸਟ ਫਾਈਲਾਂ ਬਣਾਉਣ ਤੋਂ ਬਚੋ. ਨਵੀਂ ਟੈਸਟ ਫਾਈਲ ਸਿਰਫ਼ ਤਦੋਂ ਬਣਾਓ ਜਦੋਂ ਰਿਪੋਜ਼ਟਰੀ ਦੇ ਨਿਯਮਾਂ ਅਨੁਸਾਰ ਇਸਦੀ ਲੋੜ ਹੋਵੇ ਜਾਂ ਜਦੋਂ ਕੋਈ ਮੌਜੂਦਾ ਫਾਈਲ ਇਸ ਲਈ ਢੁਕਵੀਂ ਥਾਂ ਨਾ ਹੋਵੇ. ਗੈਰ-ਸੰਬੰਧਿਤ ਕਲੀਨਅੱਪ ਅਤੇ ਬੇਲੋੜੀ ਪੇਚੀਦਗੀ ਤੋਂ ਬਚੋ. ਉਚਿਤ ਮੌਜੂਦਾ ਯੂਟਿਲਿਟੀਆਂ ਦੀ ਮੁੜ ਵਰਤੋਂ ਕਰੋ. ਸੰਬੰਧਿਤ ਰਿਪੋਜ਼ਟਰੀ ਹਦਾਇਤਾਂ ਪੜ੍ਹੋ ਅਤੇ ਨੇੜਲੇ ਕੋਡ, ਟੈਸਟਾਂ, ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ CI ਦੀ ਜਾਂਚ ਕਰੋ. ਸਥਾਪਿਤ ਰਵਾਇਤਾਂ ਦੀ ਪਾਲਣਾ ਕਰੋ. ਟੀਚਾ ਸਾਫ਼-ਸੁਥਰਾ, ਮਰਜ ਕਰਨ ਯੋਗ ਕੋਡ ਹੈ." ਪ੍ਰੌਂਪਟ ਨੂੰ eval ਲਈ ਅਨੁਕੂਲਿਤ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਸੀ.
- 9
ਪਹਿਲਾ ਇਸ ਗੱਲ ਨਾਲ ਸੰਬੰਧਿਤ ਹੈ ਕਿ ਤੁਸੀਂ ਸੰਖਿਆ ਰੇਖਾ ਉੱਤੇ ਕਿੰਨਾ ਵੀ ਅੱਗੇ ਚਲੇ ਜਾਓ, ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਇੱਕ-ਦੂਜੇ ਦੇ ਕਿੰਨੇ ਨੇੜੇ ਆ ਸਕਦੀਆਂ ਹਨ. ਇੱਕ ਦਹਾਕੇ ਤੋਂ ਵੱਧ ਸਮੇਂ ਤੱਕ, ਸਭ ਤੋਂ ਵਧੀਆ ਗਿਆਤ ਨਤੀਜਾ ਇਹ ਸੀ ਕਿ ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਦੇ ਬੇਅੰਤ ਜੋੜੇ ਹਨ ਜਿਨ੍ਹਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਵੱਧ ਤੋਂ ਵੱਧ 246 ਹੈ. Julia Stadlmann(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਹਾਲ ਹੀ ਵਿੱਚ ਉਸ ਸੀਮਾ ਨੂੰ 240 ਤੱਕ ਸੁਧਾਰਿਆ. Astra ਨੇ 186 ਦੀ ਇੱਕ ਮਜ਼ਬੂਤ ਸੀਮਾ ਸਥਾਪਿਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ, ਜਿਸ ਨਾਲ ਇਹ ਦਿਖਾਇਆ ਗਿਆ ਕਿ ਅਨੰਤ ਗਿਣਤੀ ਵਿੱਚ ਜੋੜੇ ਇਸ ਘੱਟ ਦੂਰੀ ਦੇ ਅੰਦਰ ਮਿਲਦੇ ਹਨ. ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਦੇ ਛੋਟੇ ਅੰਤਰਾਲ: ਸਬੂਤ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ ਸਹਾਇਕ ਖੋਜ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).
- 10
ਦੂਜਾ ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਦੇ ਵਿਚਕਾਰ ਅਸਧਾਰਨ ਤੌਰ 'ਤੇ ਵੱਡੇ ਅੰਤਰਾਂ ਨਾਲ ਸੰਬੰਧਿਤ ਹੈ. Astra ਨੇ ਇਨ੍ਹਾਂ ਅੰਤਰਾਂ ਦੀ ਇੱਕ ਸੀਮਾ ਵਿੱਚ ਇੱਕ ਪਦ ਵਿੱਚ ਸੁਧਾਰ ਕੀਤਾ, ਜੋ 80 ਸਾਲਾਂ ਤੋਂ ਵੱਧ ਸਮੇਂ ਤੱਕ ਅਪਰਿਵਰਤਿਤ ਰਹੀ ਸੀ. ਅਸੀਂ ਦੋਵਾਂ ਨਤੀਜਿਆਂ ਲਈ ਪ੍ਰਮਾਣ, ਸੰਖੇਪ ਚੇਨ-ਆਫ-ਥੌਟ ਅਤੇ ਪੁਸ਼ਟੀਕਰਨ ਸਮੱਗਰੀ ਸਾਂਝੀ ਕਰ ਰਹੇ ਹਾਂ. ਵੱਡੇ ਅਭਾਜ ਅੰਤਰਾਲ: ਪ੍ਰਮਾਣ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ ਸਹਾਇਕ ਖੋਜ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).
- 11
- 12
- 13
- 14
ExploitBench (ਜੂਨ–ਅਗਸਤ 2026) ਵਿੱਚ 20 ਹਾਈ-ਗੰਭੀਰਤਾ ਵਾਲੀਆਂ V8 ਕਮਜ਼ੋਰੀਆਂ 13 ਸਥਿਰ Chrome ਰਿਲੀਜ਼ਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ. ਬੈਂਚਮਾਰਕ ਇਹ ਜਾਂਚਦਾ ਹੈ ਕਿ ਕੀ ਏਜੰਟ ਹਰ ਨਿਰਧਾਰਤ ਕਮਜ਼ੋਰੀ ਦਾ ਸ਼ੋਸ਼ਣ ਕਰਕੇ Linux ਲਈ V8 ਅਤੇ ਅਧਿਕਾਰਤ Chrome ਰਿਲੀਜ਼ਾਂ ਵਿੱਚ ਆਰਬਿਟਰੇਰੀ ਕੋਡ-ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਹਾਸਲ ਕਰ ਸਕਦੇ ਹਨ. ਸ਼ਾਮਲ ਕੀਤੀਆਂ ਕੁਝ ਕਮਜ਼ੋਰੀਆਂ ਮੁਲਾਂਕਣ ਦੀਆਂ ਸੀਮਾਵਾਂ ਹੇਠ ਆਰਬਿਟਰੇਰੀ ਕੋਡ ਨੂੰ ਚਲਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਨਹੀਂ ਦੇ ਸਕਦੀਆਂ, ਇਸ ਲਈ 100% ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕਰਨੀ ਸੰਭਵ ਨਹੀਂ ਹੋ ਸਕਦੀ. ਨੋਟ: GPT-5.6 Sol ਦਾ 5.5% ਸਕੋਰ ਬੈਂਚਮਾਰਕ ਵਿੱਚ 300-ਟਰਨ ਦੀ ਸੀਮਾ ਦਾ ਨਤੀਜਾ ਹੈ, ਜੋ max ਵਰਤਣ ਵਾਲੇ ਅਸਲ ਗਾਹਕਾਂ ਲਈ ਕੋਈ ਸੀਮਾ ਨਹੀਂ ਹੋਵੇਗੀ. ਸਮਾਨ ਸੈਟਿੰਗਾਂ 'ਤੇ ਮਾਡਲ ਨੇ ਘੱਟ ਸੀਮਾਵਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਨ 'ਤੇ 11.5% ਦਾ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ.
- 15
Jeremy Spence ਅਤੇ ਹੋਰ. “ਏਜੈਂਟਿਕ ਸਾਈਬਰਸੁਰੱਖਿਆ ਲਈ ਅਗਲੀ ਚੁਣੌਤੀ: ਇੱਕ ਯਥਾਰਥਵਾਦੀ, ਦੂਸ਼ਣ-ਰਹਿਤ ਰਿਵਰਸ ਇੰਜੀਨੀਅਰਿੰਗ ਬੈਂਚਮਾਰਕ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” arXiv:2608.11469v1, 2026.
- 16
ਜਦੋਂ ਅਸੀਂ ਤੀਜੀ-ਧਿਰ ਦੇ ਮਾਡਲਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਾਂ, ਤਾਂ ਅਸੀਂ ਇੱਕ ਸਰਲ ਖੋਜ ਸੈੱਟਅੱਪ ਵਰਤਦੇ ਹਾਂ. Codex ਦੀ ਪ੍ਰੋਡਕਸ਼ਨ ਕੌਂਫਿਗਰੇਸ਼ਨ ਵਧੇਰੇ ਜਟਿਲ ਹੈ, ਜਿਸ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਰਾਅ-ਮਾਡਲ ਗਲਤੀ ਦਰਾਂ ਵੱਖਰੀਆਂ ਹੋ ਸਕਦੀਆਂ ਹਨ. ਪ੍ਰਦਾਤਾ-ਪੱਖੀ ਸੁਰੱਖਿਆ ਉਪਾਅ ਅਤੇ ਕੰਪਿਊਟਰ-ਟੂਲ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨ ਅਜੇ ਵੀ ਵੱਖਰੇ ਹਨ. ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ Codex ਵਿੱਚ ਬਿਨਾਂ-ਪੁਸ਼ਟੀ ਵਾਲੀ ਸਥਿਤੀ ਦਾ ਅਨੁਭਵ ਨਹੀਂ ਹੁੰਦਾ, ਕਿਉਂਕਿ ਇਹ ਇੱਕ ਅੰਦਰੂਨੀ ਖੋਜ ਕੌਂਫਿਗਰੇਸ਼ਨ ਹੈ।
- 17
