OpenAI

GPT-6 Astra: A new generation of intelligence

ਇੰਟੈਲੀਜੈਂਸ ਦੀ ਇੱਕ ਨਵੀਂ ਪੀੜ੍ਹੀ

22 ਸਤੰਬਰ, 2026 ਦਾ ਅੱਪਡੇਟ: ਅਸੀਂ GPT‑6 Sol ਅਤੇ GPT‑6 Luna ਨਾਲ ਆਪਣੇ GPT‑6 ਪਰਿਵਾਰ ਦਾ ਵਿਸਤਾਰ ਕਰ ਰਹੇ ਹਾਂ। ਹੋਰ ਜਾਣੋ।

ਅਸੀਂ ਪੇਸ਼ ਕਰ ਰਹੇ ਹਾਂ GPT‑6 Astra, ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਬੁੱਧੀਮਾਨ ਅਤੇ ਅਨੁਕੂਲਿਤ ਮਾਡਲ।

GPT‑6 Astra ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ, ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਅਤੇ ਅਲਾਈਨਮੈਂਟ ਵਿੱਚ ਸਾਲਾਂ ਦੀ ਖੋਜ ਅਤੇ ਵੱਡੇ ਨਿਵੇਸ਼ਾਂ ਨੂੰ ਇੱਕਠਾ ਕਰਦਾ ਹੈ. Astra ਕੰਪਿਊਟਰ ਯੂਜ਼, ਬ੍ਰਾਊਜ਼ਿੰਗ, ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ, ਸਾਈਬਰ ਸੁਰੱਖਿਆ, ਵਿਗਿਆਨ, ਅਤੇ ਪੇਸ਼ੇਵਰ ਕੰਮ ਵਿੱਚ ਅਤਿ-ਆਧੁਨਿਕ ਹੈ. Astra ਨੇ FrontierMath Tier 4 ਵਿੱਚ 98% ਸਕੋਰ ਦੇ ਨਾਲ ਸਿਖਰ ਛੂਹਿਆ ਹੈ, ਅਤੇ ਇਹ ਪਹਿਲਾਂ ਹੀ ਗਣਿਤ ਵਿੱਚ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੀਆਂ ਅਣਸੁਲਝੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ⁠ ਵਿੱਚ ਮਦਦ ਕਰ ਚੁੱਕਾ ਹੈ. Astra ਨੇ ARC-AGI-3 ਵਿੱਚ 99.9% ਸਕੋਰ ਅਤੇ ExploitBench ਵਿੱਚ 100% ਸਕੋਰ ਵੀ ਹਾਸਲ ਕੀਤੇ ਹਨ. ਇਹ ਕੰਪਿਊਟਰ ਅਤੇ ਬ੍ਰਾਊਜ਼ਰ ਦੀ ਵਰਤੋਂ ਵਿੱਚ ਵੀ ਇੱਕ ਨਵਾਂ ਅਤਿ-ਆਧੁਨਿਕ ਮਿਆਰ ਕਾਇਮ ਕਰਦਾ ਹੈ, ਜੋ ਸਭ ਤੋਂ ਔਖੇ ਪੇਸ਼ੇਵਰ ਕੰਮ ਨੂੰ ਬੇਮਿਸਾਲ ਗਤੀ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸਮਝਦਾਰੀ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ. 

GPT‑6 Astra ਅੱਜ ਸੀਮਿਤ ਗਿਣਤੀ ਦੀਆਂ ਸੰਸਥਾਵਾਂ ਲਈ ਪੇਸ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਅਤੇ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਵਿੱਚ ਇਹ ਸਾਰੇ ChatGPT Plus, Pro, Business ਅਤੇ Enterprise ਵਰਤੋਂਕਾਰਾਂ ਲਈ, ਨਾਲ ਹੀ OpenAI API, Microsoft Azure ਅਤੇ AWS Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ.

“ARC-AGI-3 ਉੱਤੇ, Astra ਨੇ 96% ਪੱਧਰਾਂ ਵਿੱਚ ਸਾਡੀ ਮਨੁੱਖੀ ਕਾਰਵਾਈ-ਕੁਸ਼ਲਤਾ ਆਧਾਰ-ਰੇਖਾ ਨੂੰ ਪਾਰ ਕਰ ਲਿਆ, ਜਿਸ ਨਾਲ ਬੈਂਚਮਾਰਕ ਉੱਤੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਤੌਰ 'ਤੇ ਮਨੁੱਖੀ ਬਰਾਬਰੀ ਹਾਸਲ ਹੋ ਗਈ. ਇਹ ਨਾ ਸਿਰਫ਼ ਸਾਡੇ ਵੱਲੋਂ ਹੁਣ ਤੱਕ ਟੈਸਟ ਕੀਤਾ ਗਿਆ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ, ਸਗੋਂ ਇਹ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲਾਂ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ ਇੱਕ ਅਰਥਪੂਰਨ ਤਬਦੀਲੀ ਵੀ ਦਰਸਾਉਂਦਾ ਹੈ - ਨਾ ਸਿਰਫ਼ ਨਵੇਂ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ ਰਾਹ ਲੱਭਣ ਅਤੇ ਉਨ੍ਹਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਇਸਦੀ ਯੋਗਤਾ ਵਿੱਚ, ਸਗੋਂ ਇਸ ਗੱਲ ਵਿੱਚ ਵੀ ਕਿ ਇਹ ਅਜਿਹਾ ਕਰਨਾ ਕਿੰਨੀ ਕੁਸ਼ਲਤਾ ਨਾਲ ਸਿੱਖਦਾ ਹੈ.”
ਗ੍ਰੇਗ ਕਾਮਰਾਡਟ, ARC ਪ੍ਰਾਈਜ਼ ਫਾਊਂਡੇਸ਼ਨ

Astra ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਹੈ, ਜਿਸ ਵਿੱਚ ਵਰਤੋਂਕਰ ਦੇ ਇਰਾਦੇ ਅਤੇ ਮਾਡਲ ਵਿਵਹਾਰ ਨੂੰ ਸਮਝਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਹਨ—ਤੁਸੀਂ Astra ਦੇ ਫੈਸਲੇ ਨੂੰ ਵਧੇਰੇ ਭਰੋਸੇ ਨਾਲ ਕੰਮ ਸੌਂਪ ਸਕਦੇ ਹੋ. ਇਸਦਾ ਟੈਸਟ ਕਰਨ ਦੇ ਇੱਕ ਤਰੀਕੇ ਵਜੋਂ, ਅਸੀਂ Hugging Face ਦੀ ਘਟਨਾ ਤੋਂ ਜਾਣਕਾਰੀ ਲੈ ਕੇ ਇੱਕ ਨਵਾਂ ਮੁਲਾਂਕਣ ਤਿਆਰ ਕੀਤਾ ਹੈ, ਜੋ ਇਹ ਜਾਂਚਦਾ ਹੈ ਕਿ ਕੀ ਕਿਸੇ ਮੁਸ਼ਕਲ ਜਾਂ ਅਸੰਭਵ ਕੰਮ ਦਾ ਸਾਹਮਣਾ ਕਰਨ ਵਾਲਾ ਮਾਡਲ ਆਪਣੇ ਨਿਰਧਾਰਤ ਦਾਇਰੇ ਤੋਂ ਬਾਹਰ ਜਾਵੇਗਾ. GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ, ਜੋ ਪ੍ਰੋਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ 48% ਮਾਮਲਿਆਂ ਵਿੱਚ ਅਧਿਕਾਰਤ ਟੀਚੇ ਤੋਂ ਬਾਹਰ ਗਿਆ, GPT‑6 Astra ਨੇ 0% ਮਾਮਲਿਆਂ ਵਿੱਚ ਅਜਿਹਾ ਕੀਤਾ.

ਕੰਪਿਊਟਰ ਦੀ ਵਰਤੋਂ ਲਈ ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ

GPT‑6 Astra ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਦੀ ਗਤੀ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸੁਰੱਖਿਆ ਵਿੱਚ ਇੱਕ ਨਵੇਂ ਅਤਿ-ਆਧੁਨਿਕ ਯੁੱਗ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰਦਾ ਹੈ। ਇਹ ਔਨਲਾਈਨ ਫਾਰਮ ਭਰਨ, CRM ਵਿੱਚ ਗਾਹਕ ਰਿਕਾਰਡਾਂ ਨੂੰ ਅੱਪਡੇਟ ਕਰਨ, ਅਤੇ ਤੁਹਾਡੇ ਕੈਲੰਡਰ ਨੂੰ ਵਿਵਸਥਿਤ ਕਰਨ ਵਰਗੇ ਅਕਾਊ ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲ ਸਕਦਾ ਹੈ। ਇਹ ਔਨਲਾਈਨ ਖੋਜ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਤੁਹਾਡੀ ਈਮੇਲ ਜਾਂ ਤੁਹਾਡੇ ਦਸਤਾਵੇਜ਼ ਐਡੀਟਰ ਵਿੱਚ ਸਾਰ (summaries) ਡ੍ਰਾਫਟ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਵਿਗਿਆਨਕ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰ ਸਕਦਾ ਹੈ, ਪਲੌਟ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ, ਇੱਕ ਵੈੱਬਸਾਈਟ ਬਣਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਫਰੰਟਐਂਡ QA ਜਾਂਚ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਉਸ ਸਾਈਟ 'ਤੇ ਸਾਰੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਕੰਮ ਕਰਦੀਆਂ ਹਨ। ਇਹ ਖੁਦਮੁਖਤਿਆਰ ਤੌਰ 'ਤੇ ਸਾਫ਼ਟਵੇਅਰ ਸਥਾਪਤ ਕਰਨ ਅਤੇ ਟੈਸਟ ਕਰਨ, ਅਤੇ ਸਕ੍ਰੀਨ 'ਤੇ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਸੁਧਾਰ ਸਾਡੇ ਅਤਿ-ਆਧੁਨਿਕ ਮੁਲਾਂਕਣ ਨਤੀਜਿਆਂ ਵਿੱਚ ਵੀ ਝਲਕਦੇ ਹਨ।

ਇਹਨਾਂ ਸੁਧਾਰਾਂ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਅਸਲ ਗਿਆਨ-ਆਧਾਰਿਤ ਟਾਸਕਾਂ ਵਿੱਚ ਕੁਸ਼ਲਤਾ ਵਿੱਚ ਵੀ ਮਹੱਤਵਪੂਰਨ ਵਾਧਾ ਹੁੰਦਾ ਹੈ. OSWorld 2.0 'ਤੇ ਲੇਟੈਂਸੀ ਸਿਮੂਲੇਸ਼ਨਾਂ ਵਿੱਚ, Astra GPT‑5.6 ਨਾਲੋਂ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 47% ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਵਿੱਚ ਵੱਧ ਕਾਰਗੁਜ਼ਾਰੀ ਹਾਸਿਲ ਕਰਦਾ ਹੈ. Sol ਨੇ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 40 ਮਿੰਟਾਂ ਵਿੱਚ 72.6% ਸਕੋਰ ਹਾਸਿਲ ਕੀਤਾ, ਜਦਕਿ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 75 ਮਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ 65.7% ਸੀ.3

GPT‑6 Astra ਦੀਆਂ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸਮਰੱਥਾਵਾਂ ਦੇ ਨਤੀਜੇ ਗੇਮ ਡਿਵੈਲਪਮੈਂਟ, ਇਲੈਕਟ੍ਰੀਕਲ ਇੰਜੀਨੀਅਰਿੰਗ, ਅਤੇ ਰੋਜ਼ਾਨਾ ਦੇ ਜਾਣਕਾਰੀ ਵਾਲੇ ਕੰਮਾਂ ਸਮੇਤ ਕਈ ਖੇਤਰਾਂ ਵਿੱਚ ਦੇਖੇ ਜਾ ਸਕਦੇ ਹਨ:

Astra ਦੇ ਨਾਲ, ਅਸੀਂ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਦੀ ਗਤੀ ਵਿੱਚ ਕਾਫ਼ੀ ਸੁਧਾਰ ਕਰਨ ਲਈ Codex ਜਾਂਚ-ਢਾਂਚੇ ਨੂੰ ਵੀ ਅੱਪਡੇਟ ਕਰ ਰਹੇ ਹਾਂ. Astra ਦੀ ਕਾਰਜਕੁਸ਼ਲਤਾ ਦੇ ਨਾਲ ਮਿਲ ਕੇ, ਇਹ Mind2Web ਬੈਂਚਮਾਰਕ 'ਤੇ ਮੌਜੂਦਾ GPT‑5.6 Sol ਅਨੁਭਵ ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਕੰਮ ਨੂੰ 1.9 ਗੁਣਾ ਤੇਜ਼ੀ ਨਾਲ ਪੂਰਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ. ਮਾਡਲ ਦੀ ਗਤੀ ਵਿੱਚ ਸੁਧਾਰਾਂ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਤੁਹਾਡੇ ਲਈ ਬਹੁਤ ਸਾਰੇ ਸਮਾਂ ਲੈਣ ਵਾਲੇ ਰੋਜ਼ਾਨਾ ਦੇ ਕੰਮਾਂ ਨੂੰ, ਤੁਹਾਡੇ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਕਰ ਸਕਦਾ ਹੈ.4

“ਅਸੀਂ ਲਾਂਚ ਦੇ ਦਿਨ GPT‑6 Astra ਨੂੰ Devin ਦੇ ਜਾਂਚ-ਢਾਂਚੇ ਵਿੱਚ ਇੰਟੀਗ੍ਰੇਟ ਕਰ ਰਹੇ ਹਾਂ, ਜਿੱਥੇ ਇਹ ਸਾਡੇ ਅੰਦਰੂਨੀ ਟੈਸਟਿੰਗ ਬੈਂਚਮਾਰਕ ‘ਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦਾ ਹੈ. ਇਸਦੀ ਸ਼ਾਨਦਾਰ ਕੰਪਿਊਟਰ ਵਰਤੋਂ, ਲਿਖਣ ਦੀ ਸਮਰੱਥਾ, ਅਤੇ ਕੋਡਬੇਸ ਦੀ ਸਮਝ ਨੇ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਸੈੱਟਅੱਪ ਦੇ ਹੀ ਟੈਸਟਿੰਗ ਨੂੰ ਬਿਹਤਰ ਬਣਾ ਦਿੱਤਾ: ਵੀਡੀਓਜ਼ ਨੂੰ ਸਮਝਣਾ ਕਾਫ਼ੀ ਆਸਾਨ ਹੈ, ਅਤੇ ਰਿਪੋਰਟਾਂ ਹੋਰ ਸਪਸ਼ਟ ਅਤੇ ਸੰਖੇਪ ਹਨ”
ਸਿਲਾਸ ਅਲਬਰਟੀ, SVP ਰਿਸਰਚ, Cognition

ਪੇਸ਼ੇਵਰ ਕੰਮ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਬਦੀਲੀ

GPT‑6 Astra ਗੁੰਝਲਦਾਰ ਕੰਮਾਂ ਨਾਲ ਨਜਿੱਠਣ ਵਿੱਚ ਮਦਦ ਕਰਨ ਲਈ, ਪੇਸ਼ੇਵਰ ਵਾਤਾਵਰਨਾਂ ਲਈ ਟੀਚਾਬੱਧ ਟ੍ਰੇਨਿੰਗ ਦੇ ਨਾਲ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਵਿੱਚ ਤਰੱਕੀਆਂ ਨੂੰ ਜੋੜਦਾ ਹੈ. ਇਹ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆਵਾਂ ਲਈ ਲੋੜੀਂਦੀ ਇੰਟੈਲੀਜੈਂਸ ਦੇ ਨਾਲ ਬਹੁ-ਪੜਾਵੀ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਪੂਰਾ ਕਰਨ ਅਤੇ ਸੁਧਰੇ ਦਸਤਾਵੇਜ਼, ਸਪ੍ਰੈੱਡਸ਼ੀਟਾਂ ਅਤੇ ਪ੍ਰੈਜ਼ੈਂਟੇਸ਼ਨਾਂ ਬਣਾਉਣ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਜੋੜਦਾ ਹੈ.

GPT‑6 Astra ਮੌਜੂਦਾ ਟੈਂਪਲੇਟਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਅਤੇ ਅਜਿਹੀਆਂ ਸਲਾਈਡਾਂ ਤਿਆਰ ਕਰਨ ਲਈ ਸਾਡਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ ਜੋ ਸੁਚੱਜੇ ਢੰਗ ਨਾਲ ਵਿਵਸਥਿਤ ਹੋਣ ਅਤੇ ਢਾਂਚਾਗਤ ਬਿਰਤਾਂਤ ਰਾਹੀਂ ਮੁੱਖ ਨੁਕਤਿਆਂ ਨੂੰ ਸੰਖੇਪ ਵਿੱਚ ਪੇਸ਼ ਕਰਨ। ਇਹ ਤੁਹਾਡੇ ਟੈਂਪਲੇਟਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਵਾਲੇ ਅਤੇ ਤੁਹਾਡੀ ਲਿਖਣ ਅਤੇ ਦ੍ਰਿਸ਼ਟੀਗਤ ਸ਼ੈਲੀ ਨਾਲ ਮੇਲ ਖਾਣ ਵਾਲੇ ਸਪਸ਼ਟ, ਚੰਗੀ ਤਰ੍ਹਾਂ ਵਿਵਸਥਿਤ ਦਸਤਾਵੇਜ਼, ਪੇਸ਼ਕਾਰੀਆਂ, ਸਪ੍ਰੈਡਸ਼ੀਟਾਂ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਬਣਾਉਂਦਾ ਹੈ। Astra ਨੂੰ ਇਸ ਤਰ੍ਹਾਂ ਵੀ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਹੈ ਕਿ ਇਹ ਮੌਜੂਦਾ ਕੰਮ ਲਈ ਗੈਰ-ਜ਼ਰੂਰੀ ਜਾਣਕਾਰੀ ਦੁਹਰਾਉਣ ਦੀ ਬਜਾਏ, ਆਉਟਪੁੱਟਾਂ ਵਿੱਚ ਖਾਸ ਤੌਰ 'ਤੇ ਸਿਰਫ਼ ਉਹੀ ਸੰਦਰਭ ਸ਼ਾਮਲ ਕਰੇ ਜੋ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ। ਇਸ ਸਭ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਵਧੇਰੇ ਤੁਰੰਤ ਵਰਤੋਂ ਯੋਗ ਆਰਟੀਫੈਕਟਸ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ ਅਤੇ ਮਿਆਰਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹੋਣ।

GPT‑6 Astra, ਆਪਣੇ ਦੁਆਰਾ ਬਣਾਈਆਂ ਜਾਣ ਵਾਲੀਆਂ ਵੈੱਬਸਾਈਟਾਂ, ਗੇਮਾਂ, ਐਪਲੀਕੇਸ਼ਨਾਂ ਅਤੇ ਰੈਂਡਰਿੰਗ ਵਿੱਚ ਵਧੇਰੇ ਬਿਹਤਰ ਵਿਜ਼ੂਅਲ ਸਮਝ ਲਿਆਉਂਦਾ ਹੈ. ChatGPT ਵਿੱਚ ਸਾਈਟਾਂ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ, Astra ਪ੍ਰੌਂਪਟ ਤੋਂ ਸਿੱਧੇ ਵੈੱਬਸਾਈਟਾਂ, ਵੈੱਬ ਐਪਾਂ ਅਤੇ ਗੇਮਾਂ ਬਣਾ, ਹੋਸਟ ਅਤੇ ਸਾਂਝੀਆਂ ਕਰ ਸਕਦਾ ਹੈ.

“Astra ਸਾਨੂੰ ਸਮਰੱਥਾ ਅਤੇ ਕਾਰਜਕੁਸ਼ਲਤਾ ਦੋਵਾਂ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਫਾਇਦਾ ਦਿੰਦਾ ਹੈ। ਇਹ ਸਾਡੇ ਦੁਆਰਾ ਟੈਸਟ ਕੀਤੇ ਗਏ ਹੋਰ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ 20% ਤੱਕ ਘੱਟ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਸਾਡੇ ਸਭ ਤੋਂ ਗੁੰਝਲਦਾਰ ਰਚਨਾਤਮਕ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਸਫਲਤਾਪੂਰਵਕ ਨੇਪਰੇ ਚਾੜ੍ਹਦਾ ਹੈ। ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ, ਸਾਡੇ ਗਾਹਕਾਂ ਲਈ, ਇਸਦਾ ਮਤਲਬ ਉੱਚ ਗੁਣਵੱਤਾ ਵਾਲਾ ਨਤੀਜਾ ਹੈ।”
ਐਲੈਕਸ ਮਸ਼ਰਾਬੋਵ, CEO ਅਤੇ ਸਹਿ-ਸੰਸਥਾਪਕ, Higgsfield AI

ਜਦੋਂ ਹਦਾਇਤਾਂ ਵਿੱਚ ਵਿਆਖਿਆ ਲਈ ਗੁੰਜਾਇਸ਼ ਹੁੰਦੀ ਹੈ, ਤਾਂ GPT‑6 Astra ਸਹੀ ਫ਼ੈਸਲਾ ਲੈਣ ਵਿੱਚ ਪਿਛਲੇ ਮਾਡਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਹੈ. ਇਹ ਆਮ ਗੁੰਝਲਾਂ ਨੂੰ ਦੂਰ ਕਰਨ ਲਈ ਸੰਦਰਭ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ ਅਤੇ ਜਦੋਂ ਜਵਾਬ ਨਾਲ ਨਤੀਜਾ ਬਦਲ ਸਕਦਾ ਹੋਵੇ, ਤਾਂ ਕੇਂਦਰਿਤ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ. Codex ਵਿੱਚ, ਇਹ ਅਸਿੰਕ੍ਰੋਨਸ ਤਰੀਕੇ ਨਾਲ ਸਵਾਲ ਪੁੱਛ ਸਕਦਾ ਹੈ ਅਤੇ ਇਸ ਦੇ ਨਾਲ ਹੀ ਉਹ ਕੰਮ ਜਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਜਵਾਬ ’ਤੇ ਨਿਰਭਰ ਨਹੀਂ ਕਰਦਾ. ਜੇਕਰ ਤੁਸੀਂ ਜਵਾਬ ਨਹੀਂ ਦਿੰਦੇ, ਤਾਂ ਇਹ ਜਿੱਥੇ ਉਚਿਤ ਹੋਵੇ, ਉੱਥੇ ਵਾਜਬ ਧਾਰਨਾਵਾਂ ਦੇ ਆਧਾਰ ’ਤੇ ਅੱਗੇ ਵਧਦਾ ਹੈ, ਪਰ ਮਹੱਤਵਪੂਰਨ ਫੈਸਲਿਆਂ ਲਈ ਤੁਹਾਡੇ ਇਨਪੁੱਟ ਦੀ ਉਡੀਕ ਕਰਦਾ ਹੈ.

ਹੇਠਾਂ ਦਿੱਤੀਆਂ ਉਦਾਹਰਨਾਂ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ Astra ਰੋਜ਼ਾਨਾ ਦੇ ਉਹਨਾਂ ਕੰਮਾਂ ਵਿੱਚ ਕਿਵੇਂ ਸਹਿਯੋਗ ਕਰਦਾ ਹੈ, ਜਿੱਥੇ ਗੁੰਮ ਹੋਈ ਜਾਣਕਾਰੀ ਜਵਾਬ ਨੂੰ ਮਹੱਤਵਪੂਰਨ ਤੌਰ ’ਤੇ ਬਦਲ ਸਕਦੀ ਹੈ.

Astra ਕਿਸੇ ਟਾਸਕ ਦੇ ਵਿਕਸਿਤ ਹੋਣ ਦੇ ਨਾਲ-ਨਾਲ ਆਪਣਾ ਧਿਆਨ ਸਹੀ ਦਿਸ਼ਾ ਵਿੱਚ ਬਣਾਈ ਰੱਖਣ ਵਿੱਚ ਵੀ ਬਿਹਤਰ ਹੈ. ਪੁਰਾਣੇ ਮਾਡਲ ਕਈ ਵਾਰ ਸਟੀਅਰਿੰਗ ਮੈਸੇਜਾਂ ਨੂੰ ਇੱਕ ਨਵੇਂ ਟੀਚੇ ਵਜੋਂ ਸਮਝ ਲੈਂਦੇ ਸਨ, ਜਿਸ ਕਾਰਨ ਉਹ ਮੂਲ ਬੇਨਤੀ ਜਾਂ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਪਾਬੰਦੀਆਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਣਾ ਭੁੱਲ ਜਾਂਦੇ ਸਨ. Astra ਨਵੀਆਂ ਲੋੜਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ, ਪੁੱਛੇ ਜਾਣ ’ਤੇ ਆਪਣੀ ਦਿਸ਼ਾ ਬਦਲਦਾ ਹੈ ਅਤੇ ਵਿਆਪਕ ਟਾਸਕ ਤੋਂ ਭਟਕੇ ਬਿਨਾਂ ਸਾਈਡ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦਿੰਦਾ ਹੈ.

“Astra ਗੁੰਝਲਦਾਰ ਕਾਨੂੰਨੀ ਕੰਮਾਂ ਵਿੱਚ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਗੁਣਵੱਤਾ ਪੱਖੋਂ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਹੈ। ਸਾਡੀ ਸ਼ੁਰੂਆਤੀ ਟੈਸਟਿੰਗ ਵਿੱਚ, Astra ਨੇ ਕਾਨੂੰਨੀ ਕੰਮ ਨੂੰ ਇੱਕ ਸੂਝਵਾਨ ਵਕੀਲ ਵਾਂਗ ਸੰਭਾਲ ਕੇ ਵੱਖਰੀ ਪਛਾਣ ਬਣਾਈ: ਇਹ ਸਥਾਪਿਤ ਰਿਕਾਰਡਾਂ ਵਿੱਚੋਂ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਵੱਖਰਾ ਕਰਦਾ ਹੈ, ਬਿਨਾਂ ਸਬੂਤ ਵਾਲੀਆਂ ਧਾਰਨਾਵਾਂ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਂਦਾ ਹੈ, ਅਤੇ ਖਾਮੀਆਂ ਨੂੰ ਠੋਸ ਡਰਾਫਟਿੰਗ ਵਿਕਲਪਾਂ ਵਿੱਚ ਬਦਲਦਾ ਹੈ।”
ਨਿਕੋ ਗਰੂਪੇਨ, ਹੈੱਡ ਆਫ ਐਪਲਾਈਡ ਰਿਸਰਚ, Harvey

ਕੋਡਿੰਗ

GPT‑6 Astra ਅੱਜ ਤੱਕ ਦਾ ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ।

2 ਵਿੱਚੋਂ 1
“GPT‑6 Astra ਸਾਡੇ ਅੰਦਰੂਨੀ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦਾ ਹੈ ਅਤੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਟ੍ਰੇਡਿੰਗ ਇੰਟਿਊਸ਼ਨ ਦੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਸਪਸ਼ਟ ਪ੍ਰਗਤੀ ਦਿਖਾਉਂਦਾ ਹੈ. ਏਜੰਟਿਕ ਕੋਡਿੰਗ ਲਈ ਵਰਤੇ ਜਾਣ 'ਤੇ, GPT‑6 Astra ਡਿਵੈਲਪਰਾਂ ਲਈ ਸਮਝਣ ਵਿੱਚ ਆਸਾਨ ਢੰਗ ਨਾਲ ਸੰਚਾਰ ਕਰਦਾ ਹੈ ਅਤੇ ਅਜਿਹਾ ਕੋਡ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜਿਸਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ-ਪੱਧਰ ਦੀ ਗੁਣਵੱਤਾ ਤੱਕ ਪਹੁੰਚਣ ਲਈ ਘੱਟ ਦੁਹਰਾਅ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ.”
ਜੌਨ ਕ੍ਰੇਪੇਜ਼ੀ, AI ਸਹਾਇਕ, Jane Street

Astra ਦੇ ਨਾਲ, ਅਸੀਂ ਸੰਦਰਭ ਸੀਮਾ ਦੇ ਭਰ ਜਾਣ 'ਤੇ ਸੰਦਰਭ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਣ ਅਤੇ ਮੁੜ-ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ Codex ਵਾਸਤੇ ਇੱਕ ਨਵਾਂ ਤਰੀਕਾ ਪੇਸ਼ ਕਰ ਰਹੇ ਹਾਂ. ਇਤਿਹਾਸਕ ਤੌਰ 'ਤੇ, ਮਾਡਲਾਂ ਨੇ ਲੰਬੇ ਸੈਸ਼ਨਾਂ ਦੌਰਾਨ ਕੰਮ ਦਾ ਸਾਰ ਦੇਣ ਲਈ ਕੰਪੈਕਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਠੀਕ ਕਰਨ ਜਾਂ ਵੱਡੇ ਰੀਫੈਕਟਰਾਂ ਨਾਲ ਨਜਿੱਠਣ ਵੇਲੇ. ਹਰ ਕੰਪੈਕਸ਼ਨ ਕੁਝ ਵੇਰਵਿਆਂ ਨੂੰ ਛੱਡ ਸਕਦਾ ਹੈ ਕਿ ਕੋਈ ਸੁਧਾਰ ਕਿਉਂ ਅਸਫਲ ਹੋਇਆ ਜਾਂ ਕੋਈ ਕੰਪੋਨੈਂਟ ਕਿਵੇਂ ਵਿਹਾਰ ਕਰਦਾ ਹੈ. Codex ਵਿੱਚ, Astra ਬਾਰ-ਬਾਰ ਸੰਕੁਚਿਤ ਕਰਕੇ ਇੱਕ ਸਿੰਗਲ ਸਾਰ ਬਣਾਉਣ ਦੀ ਬਜਾਏ, ਇਕੱਠੇ ਕੀਤੇ ਵੇਰਵਿਆਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ, ਸੰਦਰਭ ਸੀਮਾ ਵਿੱਚ ਨੋਟਸ ਰੱਖ ਸਕਦਾ ਹੈ. ਪੁਰਾਣੀਆਂ ਸੰਦਰਭ ਸੀਮਾ ਖੋਜ-ਯੋਗ ਰਹਿੰਦੀਆਂ ਹਨ, ਇਸ ਲਈ Astra ਪਿਛਲੇ ਸੰਦੇਸ਼ਾਂ ਅਤੇ ਟੂਲ ਦੇ ਨਤੀਜਿਆਂ ਤੋਂ ਜ਼ਰੂਰਤਾਂ ਜਾਂ ਟੈਸਟ ਦੇ ਨਤੀਜੇ ਲੱਭ ਸਕਦਾ ਹੈ—ਭਾਵੇਂ ਉਹ ਜਾਣਕਾਰੀ ਇਸਦੇ ਨੋਟਸ ਵਿੱਚ ਦਰਜ ਨਾ ਕੀਤੀ ਗਈ ਹੋਵੇ. ਤੁਸੀਂ ਇਸ ਪ੍ਰਯੋਗਾਤਮਕ ਫੀਚਰ ਨੂੰ ਆਪਣੇ Codex config.toml,⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹੋ, ਅਤੇ ਆਉਣ ਵਾਲੇ ਹਫ਼ਤਿਆਂ ਵਿੱਚ ਇਹ Astra ਲਈ ਡਿਫੌਲਟ ਬਣ ਜਾਵੇਗਾ.

ਵਿਗਿਆਨਕ ਖੋਜ ਨੂੰ ਅੱਗੇ ਵਧਾਉਣਾ

“ਕਹਾਣੀ ਇਹ ਹੈ: ਇੱਕ ਯੁੱਗ ਦਾ ਅੰਤ, ਦੂਜੇ ਦੀ ਸ਼ੁਰੂਆਤ।”
ਗ੍ਰੈਗ ਬਰਨਹਮ, EpochAI

GPT‑6 Astra ਵਿਗਿਆਨਕ ਖੋਜ, ਗਣਿਤ, ਅਤੇ ਸਿਹਤ ਦੇ ਖੇਤਰ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਰੱਕੀ ਹੈ. ਅੱਜ, ਅਸੀਂ ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਵਿਚਕਾਰ ਦੇ ਅੰਤਰਾਂ ਬਾਰੇ ਦੋ ਹੋਰ ਨਤੀਜੇ ਸਾਂਝੇ ਕਰ ਰਹੇ ਹਾਂ.9, 10

Astra ਗਣਿਤ ਅਤੇ ਵਿਗਿਆਨ ਦੇ ਕਈ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਨਵੇਂ ਰਿਕਾਰਡ ਵੀ ਕਾਇਮ ਕਰਦਾ ਹੈ.

Astra ਵਿਗਿਆਨਕ ਖੋਜ ਦੇ ਪਿੱਛੇ ਦੇ ਵਿਹਾਰਕ ਕੰਮ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ. ਵਿਗਿਆਨਕ ਰੀਜ਼ਨਿੰਗ ਨੂੰ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਨਾਲ ਜੋੜ ਕੇ, ਇਹ ਡਾਟਾ ਦੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਨਤੀਜਿਆਂ ਦੀ ਪੜਚੋਲ ਕਰਨ ਲਈ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਵਿਸ਼ੇਸ਼ ਸੌਫ਼ਟਵੇਅਰ ਵਿੱਚ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਸਬੂਤਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਅਤੇ ਇਹ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਮਿਲਦੀ ਹੈ ਕਿ ਅੱਗੇ ਕੀ ਖੋਜ ਕਰਨੀ ਹੈ.

ਸਾਈਬਰ ਸੁਰੱਖਿਆ

ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਆਪਣੇ ਸੁਰੱਖਿਆ ਅੱਪਡੇਟ⁠ ਵਿੱਚ ਚਰਚਾ ਕੀਤੀ ਸੀ, Astra ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਛਾਲ ਹੈ ਅਤੇ ਸਾਡੇ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਦੇ ਤਹਿਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੀਮਾ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ. ਜ਼ੀਰੋ-ਡੇ ਐਕਸਪਲੋਇਟਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਵਿਕਸਿਤ ਕਰਨ ਦੀ ਇਸਦੀ ਸਮਰੱਥਾ ਰੱਖਿਅਕਾਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਲੱਭਣ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਪੈਚ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀ ਹੈ, ਪਰ ਇਹ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਜ਼ਰੂਰਤ ਵੀ ਪੈਦਾ ਕਰਦੀ ਹੈ. ਇਹ ਸਮਝਣ ਲਈ ਕਿ ਇਹ ਸਮਰੱਥਾਵਾਂ ਕਿੰਨੀ ਹੱਦ ਤੱਕ ਵਧੀਆਂ ਹਨ, ਅਸੀਂ Astra ਨੂੰ ਅੰਦਰੂਨੀ ਅਤੇ ਤੀਜੀ-ਧਿਰ ਦੇ ਮਾਹਰਾਂ ਵੱਲੋਂ ਕੀਤੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਪਰਖਿਆ.

ਅਸੀਂ ਸਭ ਤੋਂ ਪਹਿਲਾਂ ExploitBench ਅਤੇ ExploitGym 'ਤੇ ਪ੍ਰੋ਼ਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਮਾਡਲ ਦਾ ਟੈਸਟ ਕੀਤਾ, ਜੋ ਇਹ ਮੁਲਾਂਕਣ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਮਾਡਲ ਜਾਣੀਆਂ ਸੌਫਟਵੇਅਰ ਕਮਜ਼ੋਰੀਆਂ ਨੂੰ ਕਾਰਜਸ਼ੀਲ ਐਕਸਪਲੋਇਟਾਂ ਵਿੱਚ ਬਦਲ ਸਕਦੇ ਹਨ. ExploitBench 'ਤੇ, Astra ਨੇ 100% ਦਾ ਸੰਪੂਰਨ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜਦੋਂ ਕਿ ਸਾਡੇ ਪਿਛਲੇ ਅਤਿ-ਆਧੁਨਿਕ ਸਾਈਬਰ-ਸਮਰੱਥ ਮਾਡਲ GPT‑5.6 Sol ਦਾ ਸਕੋਰ 78.5% ਸੀ. ExploitGym 'ਤੇ, Astra ਨੇ ਕਾਫ਼ੀ ਘੱਟ ਆਊਟਪੁੱਟ ਟੋਕਨ ਵਰਤਦਿਆਂ 42.4% ਸਫਲਤਾ ਦਰ ਹਾਸਲ ਕੀਤੀ, ਜਦਕਿ GPT‑5.6 Sol ਲਈ ਇਹ 30.3% ਸੀ.13

ਇਹਨਾਂ ਚਿੰਤਾਵਾਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਦਿਆਂ ਕਿ ਇਤਿਹਾਸਕ ਸੌਫ਼ਟਵੇਅਰ ਕਮਜ਼ੋਰੀਆਂ ਦੇ ਸਾਹਮਣੇ ਆਉਣ ਨਾਲ ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ ਪ੍ਰਭਾਵਿਤ ਹੋ ਸਕਦੇ ਹਨ, ਅਸੀਂ Astra ਦਾ ਦੋ ਨਵੇਂ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਵੀ ਮੁਲਾਂਕਣ ਕੀਤਾ. ਪਹਿਲਾਂ, ਅਸੀਂ ਪਿਛਲੇ ਤਿੰਨ ਮਹੀਨਿਆਂ ਦੀਆਂ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਐਕਸਪਲੋਇਟ ਵਿਕਾਸ ਦੀ ਜਾਂਚ ਕਰਨ ਵਾਸਤੇ ਇੱਕ ਅੰਦਰੂਨੀ “ExploitBench (ਜੂਨ–ਅਗਸਤ 2026)” ਮੁਲਾਂਕਣ ਤਿਆਰ ਕੀਤਾ.14 Astra ਨੇ ਇਸ ਡਾਟਾਸੈੱਟ ’ਤੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਵੱਧ ਆਰਬਿਟਰੇਰੀ ਕੋਡ-ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਦਰਾਂ ਹਾਸਲ ਕੀਤੀਆਂ, ਜਦਕਿ ਆਊਟਪੁੱਟ ਟੋਕਨਾਂ ਦੀ ਗਿਣਤੀ ਕਾਫ਼ੀ ਘੱਟ ਰਹੀ. ਮੁਲਾਂਕਣ ਦੌਰਾਨ, Astra ਨੇ ਇੱਥੋਂ ਤੱਕ ਕਿ ਦੋ ਅਜਿਹੀਆਂ ਜ਼ੀਰੋ-ਡੇ ਕਮਜ਼ੋਰੀਆਂ ਖੋਜੀਆਂ ਅਤੇ ਵਰਤੀਆਂ, ਜੋ ਪਹਿਲਾਂ ਅਣਜਾਣ ਸਨ. ਅਸੀਂ ਦੋਵਾਂ ਕਮਜ਼ੋਰੀਆਂ ਬਾਰੇ ਉਨ੍ਹਾਂ ਦੇ ਮੈਨਟੇਨਰਾਂ ਨੂੰ ਸੂਚਿਤ ਕਰ ਰਹੇ ਹਾਂ.

ਅਸੀਂ SRE-Bench15 ’ਤੇ ਵੀ Astra ਦਾ ਟੈਸਟ ਕੀਤਾ, ਜੋ ਇੱਕ ਅਜਿਹਾ ਬੈਂਚਮਾਰਕ ਹੈ ਜੋ ਇਹ ਮਾਪਦਾ ਹੈ ਕਿ ਕੀ ਮਾਡਲ ਰਾਅ ਸੋਰਸ ਕੋਡ ਤੱਕ ਪਹੁੰਚ ਤੋਂ ਬਿਨਾਂ ਸੌਫ਼ਟਵੇਅਰ ਬਾਈਨਰੀਆਂ ਨੂੰ ਰਿਵਰਸ ਇੰਜੀਨੀਅਰ ਕਰਕੇ ਉਹਨਾਂ ਦੇ ਮੁੱਖ ਲੌਜਿਕ ਨੂੰ ਸਮਝ ਸਕਦੇ ਹਨ. Astra ਨੇ 88.0% ਟਾਸਕਾਂ ਨੂੰ ਇੱਕ ਹੀ ਕੋਸ਼ਿਸ਼ ਵਿੱਚ ਅਤੇ 99.2% ਟਾਸਕਾਂ ਨੂੰ ਚਾਰ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਹੱਲ ਕੀਤਾ, ਜਦੋਂ ਕਿ GPT‑5.6 Sol ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕ੍ਰਮਵਾਰ 55.9% ਅਤੇ 68.7% ਰਿਹਾ.

ਬੈਂਚਮਾਰਕਾਂ ਤੋਂ ਪਰੇ, ਮਾਹਰਾਂ ਦੀ ਅਗਵਾਈ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਤੋਂ ਪਤਾ ਲੱਗਾ ਹੈ ਕਿ Astra, ਪ੍ਰੋਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਚਲਾਏ ਜਾਣ ’ਤੇ, ਪਹਿਲਾਂ ਤੋਂ ਅਣਜਾਣ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਹਾਰਡਨਡ ਬ੍ਰਾਊਜ਼ਰਾਂ ਵਿੱਚ ਆਰਬਿਟਰੇਰੀ ਕੋਡ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਹਾਰਡਨਡ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮਾਂ ਲਈ ਪ੍ਰਿਵਿਲੇਜ-ਐਸਕੇਲੇਸ਼ਨ ਐਕਸਪਲੋਇਟ ਬਣਾ ਸਕਦਾ ਹੈ.

ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਡਿਫੈਂਡਰ ਦੀ ਵਿੰਡੋ ਵਿੱਚ ਚਰਚਾ ਕੀਤੀ ਸੀ, ਅਤਿ-ਆਧੁਨਿਕ ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਡਿਫੈਂਡਰਾਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਤੇਜ਼ੀ ਨਾਲ ਪਤਾ ਲਗਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਪਰ ਇਹ ਉਹਨਾਂ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਫਾਇਦਾ ਉਠਾਉਣਾ ਵੀ ਆਸਾਨ ਬਣਾਉਂਦੀਆਂ ਹਨ, ਜਿਸ ਨਾਲ ਡਿਫੈਂਡਰਾਂ ਲਈ ਆਪਣੇ ਆਪ ਨੂੰ ਢਾਲਣ ਦੀ ਜ਼ਰੂਰਤ ਹੋਰ ਵੀ ਵੱਧ ਜਾਂਦੀ ਹੈ. ਅੱਜ ਲਾਂਚ ਹੋਣ ਵਾਲੇ Astra ਦੇ ਵਰਜ਼ਨ ਨਾਲ, ਡਿਫੈਂਡਰ ਇਸਦੀ ਵਰਤੋਂ ਸੁਰੱਖਿਅਤ ਕੋਡ ਸਮੀਖਿਆ ਅਤੇ ਪੈਚਿੰਗ ਵਰਗੀਆਂ ਟਾਸਕਾਂ ਨੂੰ ਪੂਰੇ ਕਰਨ ਲਈ ਕਰ ਸਕਦੇ ਹਨ.

ਹਾਲਾਂਕਿ, Astra ਹੋਰ ਵੱਧ ਐਡਵਾਂਸਡ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਟਾਸਕਾਂ ਜਿਵੇਂ ਕਿ ਕਮਜ਼ੋਰੀਆਂ ਲਈ ਪ੍ਰੂਫ-ਆਫ-ਕਾਂਸੈਪਟ ਐਕਸਪਲੋਇਟਸ ਬਣਾਉਣ ਨੂੰ ਕਰਨ ਤੋਂ ਇਨਕਾਰ ਕਰ ਦੇਵੇਗਾ. OpenAI Daybreak⁠ ਰਾਹੀਂ, ਅਸੀਂ ਆਉਣ ਵਾਲੇ ਹਫ਼ਤਿਆਂ ਵਿੱਚ ਪਹੁੰਚ ਦਾ ਵਿਸਤਾਰ ਕਰਨ ਅਤੇ ਘੱਟ ਪਾਬੰਦੀਆਂ ਵਾਲੇ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸ਼ੁਰੂ ਕਰਨ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਹੇ ਹਾਂ. ਇਹ ਹੋਰ ਰੱਖਿਆਤਮਕ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਸਮਰੱਥ ਬਣਾਏਗਾ, ਜਿਸ ਵਿੱਚ ਕਮਜ਼ੋਰੀਆਂ ਅਤੇ ਪ੍ਰੂਫ਼-ਆਫ਼-ਕਾਂਸੈਪਟ ਦੀ ਪ੍ਰਮਾਣਿਕਤਾ, ਮਾਲਵੇਅਰ ਵਿਸ਼ਲੇਸ਼ਣ, ਅਤੇ ਡਿਟੈਕਸ਼ਨ ਇੰਜੀਨੀਅਰਿੰਗ ਸ਼ਾਮਲ ਹਨ.

ਅਸੀਂ GPT‑5.6 Sol ਲਈ ਆਪਣੇ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਹੋਰ ਮਜ਼ਬੂਤ ਕਰਦੇ ਹੋਏ, ਸੰਭਾਵੀ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਦੇ ਖਿਲਾਫ ਆਪਣੀ ਸੁਰੱਖਿਆ ਨੂੰ ਵੀ ਮਜ਼ਬੂਤ ਕੀਤਾ ਹੈ. ਇਹਨਾਂ ਵਿੱਚ ਸੰਭਾਵੀ ਜੇਲਬ੍ਰੇਕਾਂ ਦਾ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਸਾਹਮਣਾ ਕਰਨ ਲਈ ਮਾਡਲ ਦੀ ਵਧੇਰੇ ਮਜ਼ਬੂਤੀ ਅਤੇ ਸਾਡੇ ਨਿਗਰਾਨੀ ਸਿਸਟਮਾਂ ਲਈ ਵਧੇਰੇ ਸੰਦਰਭ ਸ਼ਾਮਲ ਹਨ. ਅਸੀਂ ਆਪਣੇ 12 ਅੰਦਰੂਨੀ ਰੈਡ ਟੀਮਿੰਗ ਹਮਲਾਵਰਾਂ ਨਾਲ ਸਖ਼ਤ ਅੰਦਰੂਨੀ ਅਤੇ ਬਾਹਰੀ ਟੈਸਟਿੰਗ ਜਾਰੀ ਰੱਖੀ ਹੈ, ਜਿਸ ਵਿੱਚ ਸਵੈਚਾਲਿਤ ਮੁਲਾਂਕਣ ਵੀ ਸ਼ਾਮਲ ਹਨ. ਸਾਡੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਅਤੇ ਟੈਸਟਿੰਗ ਬਾਰੇ ਹੋਰ ਵੇਰਵੇ Astra ਸੁਰੱਖਿਆ ਸੰਖੇਪ ਜਾਣਕਾਰੀ⁠ ਅਤੇ ਸਿਸਟਮ ਕਾਰਡ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਉਪਲਬਧ ਹਨ..

GPT‑6 Astra ਨੂੰ ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਅਲਾਈਨ ਕਰਨਾ ਅਤੇ ਤਾਇਨਾਤ ਕਰਨਾ

Astra ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਹੈ. Astra ਸਾਵਧਾਨੀ ਵਰਤਣ, ਟਾਸਕ ਦੀਆਂ ਹੱਦਾਂ ਦਾ ਸਤਿਕਾਰ ਕਰਨ ਅਤੇ ਪਾਰਦਰਸ਼ੀ ਢੰਗ ਨਾਲ ਸੰਚਾਰ ਕਰਨ ਵਿੱਚ ਸ਼ਾਨਦਾਰ ਹੈ. ਇਹ ਕੰਮ ਸਾਡੇ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੇ ਖੋਜ ਪ੍ਰੋਗਰਾਮ ਦਾ ਨਵੀਨਤਮ ਨਤੀਜਾ ਹੈ, ਜੋ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਮਨੁੱਖੀ ਇਰਾਦੇ ਨਾਲ ਤਾਲਮੇਲ ਵਿੱਚ ਰਹਿਣ ਵਾਲੇ ਮਾਡਲਾਂ ਨੂੰ ਟ੍ਰੇਨ ਕਰਨ 'ਤੇ ਕੇਂਦਰਿਤ ਹੈ.

ਸੰਵੇਦਨਸ਼ੀਲ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ, Astra ਆਪਣੇ ਜੋਖਮ ਦੇ ਅਨੁਪਾਤ ਵਿੱਚ ਸਾਵਧਾਨੀ ਨਾਲ ਅੱਗੇ ਵਧਦਾ ਹੈ. ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਵਾਲੇ ਉਹਨਾਂ ਟਾਸਕਾਂ ਦੇ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਗਲਤ ਵਿਵਹਾਰ ਪੈਦਾ ਕਰਨ ਲਈ ਵਿਰੋਧਾਤਮਕ ਢੰਗ ਨਾਲ ਚੁਣਿਆ ਗਿਆ ਸੀ, Astra ਅਣਚਾਹੇ ਨਤੀਜਿਆਂ ਤੋਂ ਬਚਣ ਵਿੱਚ ਵੱਧ ਸਫਲ ਰਹੀ. ਮੂਲ ਰੂਪ ਵਿੱਚ ਪ੍ਰਦਾਨ ਕੀਤੇ ਜਾਂਦੇ ਵਾਧੂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨਾਲ ਚਲਾਉਣ ’ਤੇ ਹੋਰ ਵੀ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਮਿਲਿਆ.

Astra ਕਿਸੇ ਵੀ ਹੋਰ ਟੈਸਟ ਕੀਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲ ਨਾਲੋਂ ਘੱਟ ਗਲਤ-ਸੰਰੇਖਿਤ ਨਤੀਜੇ ਪੈਦਾ ਕਰਦਾ ਹੈ. ਨਿਰਪੱਖ ਤੁਲਨਾ ਲਈ, ਅਸੀਂ ਇੱਕ ਆਮ ਕੰਪਿਊਟਰ-ਯੂਜ਼ਿੰਗ-ਏਜੰਟ ਜਾਂਚ-ਢਾਂਚਾ ਵਰਤਿਆ (ਜੋ ਦੋਵਾਂ OpenAI Responses API⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ Anthropic Messages API⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਉਪਲਬਧ ਨੇਟਿਵ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਟੂਲਾਂ 'ਤੇ ਆਧਾਰਿਤ ਹੈ) ਅਤੇ ਵਾਧੂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਮੁਲਾਂਕਣ ਕੀਤਾ, ਜੋ ਆਮ ਤੌਰ 'ਤੇ Codex ਅਤੇ ChatGPT ਵਰਕ ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਲਾਗੂ ਕੀਤੇ ਜਾਂਦੇ ਹਨ (ਸਵੈ-ਸਮੀਖਿਆ, ਪੁਸ਼ਟੀਕਰਨ ਨੀਤੀ).

Astra ਦੇ ਵਰਤੋਂਕਾਰ ਦੁਆਰਾ ਨਿਰਧਾਰਤ ਕੀਤੀਆਂ ਅਤੇ ਇਸਦੇ ਵਾਤਾਵਰਨ ਦੁਆਰਾ ਸੰਕੇਤਿਤ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਕੰਮ ਕਰਨ ਦੀ ਵੀ ਵੱਧ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ. ਇੱਕ ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਨੇ Codex Auto-Review ਵੱਲੋਂ ਕੀਤੇ ਇਨਕਾਰ ਨੂੰ ਕਦੇ ਵੀ ਬਾਈਪਾਸ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕੀਤੀ. ਇਹ ਗੱਲ ਉਸ ਵੇਲੇ ਵੀ ਸਹੀ ਰਹੀ ਜਦੋਂ Auto-review ਨੂੰ ਜਾਣ-ਬੁੱਝ ਕੇ ਇਸ ਤਰ੍ਹਾਂ ਕੌਂਫਿਗਰ ਕੀਤਾ ਗਿਆ ਸੀ ਕਿ ਇਸ ਤੋਂ ਬਚ ਕੇ ਨਿਕਲਿਆ ਜਾ ਸਕੇ, ਅਤੇ ਕਿਸੇ ਹੋਰ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਪੂਰਾ ਕਰਨਾ ਅਸੰਭਵ ਸੀ. ਵਾਤਾਵਰਨ ਦੀਆਂ ਪਾਬੰਦੀਆਂ ਲਈ ਇਹ ਸਤਿਕਾਰ ਸਾਡੇ ਅਸੰਭਵ ਸਾਈਬਰ ਟਾਸਕ ਮੁਲਾਂਕਣ ਦੇ ਨਤੀਜਿਆਂ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ, ਜੋ ਅਸੀਂ ਇਸ ਪੋਸਟ ਦੀ ਜਾਣ-ਪਛਾਣ ਵਿੱਚ ਸਾਂਝੇ ਕੀਤੇ ਸਨ, ਅਤੇ ਹੋਰ ਨਤੀਜਿਆਂ ਨਾਲ ਵੀ ਜੋ ਸਾਡੇ ਸਿਸਟਮ ਕਾਰਡ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਦਰਜ ਹਨ.

Astra ਇਸ ਤੋਂ ਇਲਾਵਾ ਪਾਰਦਰਸ਼ੀ ਵਰਤੋਂਕਾਰ ਸੰਚਾਰ ਵਿੱਚ ਨਵੇਂ ਮਾਪਦੰਡ ਸਥਾਪਤ ਕਰਦਾ ਹੈ. ਇੱਕ ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਵੱਲੋਂ GPT‑5.6 ਨਾਲੋਂ ਤਿੰਨ ਗੁਣਾ ਘੱਟ ਸੰਭਾਵਨਾ ਹੈ ਕਿ Sol ਆਪਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਅਤੇ ਉਪਲਬਧ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਬਾਰੇ ਗਲਤ ਪੇਸ਼ਕਾਰੀਆਂ ਕਰੇ.

ਸਾਡੇ ਸਮਰੱਥਾ-ਭਰਮ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਆਪਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਬਾਰੇ ਘੱਟ ਗੁੰਮਰਾਹਕੁੰਨ ਦਾਅਵੇ ਕਰਕੇ, GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਸੁਧਾਰ ਦਿਖਾਉਂਦਾ ਹੈ।

ਸਾਡੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਪਾਇਆ ਗਿਆ ਕਿ Astra ਦੀ ਲਿਖਤੀ ਰੀਜ਼ਨਿੰਗ GPT‑5.6 Sol ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਨਿਗਰਾਨੀ ਕਰਨਾ ਵਧੇਰੇ ਮੁਸ਼ਕਲ ਹੈ, ਜੋ ਉਹਨਾਂ ਟੈਸਟਾਂ ’ਤੇ ਆਧਾਰਿਤ ਸੀ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਖਾਸ ਤੌਰ ’ਤੇ ਇਸਨੂੰ ਨਿਗਰਾਨੀ ਤੋਂ ਬਚਣ ਲਈ ਕਿਹਾ ਗਿਆ ਸੀ. ਅਸੀਂ ਇਸਦਾ ਕਾਰਨ ਸਰਲ ਟਾਸਕਾਂ ਵਿੱਚ ਲਿਖਤੀ ਰੀਜ਼ਨਿੰਗ ਉੱਤੇ Astra ਦੇ ਵੱਧ ਕੰਟਰੋਲ ਅਤੇ ਘੱਟ ਲਿਖਤੀ ਕਦਮਾਂ ਨਾਲ ਸਮੱਸਿਆਵਾਂ ਹੱਲ ਕਰਨ ਦੀ ਇਸਦੀ ਸਮਰੱਥਾ ਨੂੰ ਮੰਨਦੇ ਹਾਂ. Astra ਨੂੰ ਅਜੇ ਵੀ ਗੁੰਝਲਦਾਰ ਟਾਸਕਾਂ ਲਈ ਲੋੜੀਂਦੀ ਰੀਜ਼ਨਿੰਗ ਨੂੰ ਛੁਪਾਉਣ ਵਿੱਚ ਮੁਸ਼ਕਲ ਆਉਂਦੀ ਜਾਪਦੀ ਹੈ, ਪਰ ਅਸੀਂ ਇਸ ਗਿਰਾਵਟ ਨੂੰ ਗੰਭੀਰਤਾ ਨਾਲ ਲੈਂਦੇ ਹਾਂ. ਨਿਗਰਾਨੀਯੋਗਤਾ ਵਿੱਚ ਸੁਧਾਰ ਕਰਨਾ ਖੋਜ ਦੀ ਤਰਜੀਹ ਬਣਿਆ ਹੋਇਆ ਹੈ, ਅਤੇ ਨਾਲ ਦਿੱਤਾ ਸਿਸਟਮ ਕਾਰਡ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਸਾਡੀਆਂ ਖੋਜਾਂ ਅਤੇ ਚੱਲ ਰਹੇ ਕੰਮ ਦਾ ਵੇਰਵਾ ਦਿੰਦਾ ਹੈ.

ਅਲਾਈਨਮੈਂਟ ਸਿਖਲਾਈ, ਡਿਪਲੌਇਮੈਂਟ ਲਈ ਸਾਡੀ ਪਹੁੰਚ ਦਾ ਮੁੱਖ ਹਿੱਸਾ ਹੈ. ਸੁਰੱਖਿਆ ਦੀ ਵਾਧੂ ਪਰਤ ਵਜੋਂ, ਅਸੀਂ ਅਸੁਰੱਖਿਅਤ ਵਿਹਾਰ ਦਾ ਪਤਾ ਲਗਾਉਣ ਅਤੇ ਉਸਨੂੰ ਰੋਕਣ ਵਿੱਚ ਮਦਦ ਲਈ Codex ਸਵੈ-ਸਮੀਖਿਆ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਰਗੇ ਸਿਸਟਮ ਸੁਰੱਖਿਆ ਉਪਾਅ ਅਤੇ ਏਜੰਟਾਂ ਦੀ ਰੀਜ਼ਨਿੰਗ ਅਤੇ ਕਾਰਵਾਈਆਂ ਦੀ ਨਿਗਰਾਨੀ ਵੀ ਬਣਾਉਂਦੇ ਹਾਂ. ਸਾਡੀ ਸੁਰੱਖਿਆ ਅੱਪਡੇਟ⁠ ਵਿੱਚ ਦੱਸੇ ਅਨੁਸਾਰ, ਅਸੀਂ ਗਲਤ ਅਲਾਈਨਮੈਂਟ ਬਾਰੇ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤ ਕਰਨ ਅਤੇ ਇਸ ਦੀਆਂ ਸਭ ਤੋਂ ਗੰਭੀਰ ਘਟਨਾਵਾਂ ਨੂੰ ਰੋਕਣ ਵਿੱਚ ਮਦਦ ਲਈ Astra-ਸ਼੍ਰੇਣੀ ਦੇ ਮਾਡਲਾਂ ਵਾਸਤੇ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਗਲਤ ਅਲਾਈਨਮੈਂਟ ਦੀ ਨਿਗਰਾਨੀ ਵੀ ਡਿਪਲੌਇ ਕਰ ਰਹੇ ਹਾਂ. ਇਹ ਸੁਰੱਖਿਆ ਉਪਾਅ ਸਾਡੀਆਂ ਅੰਦਰੂਨੀ ਡਿਪਲੌਇਮੈਂਟ ਦੀ ਨਿਗਰਾਨੀ ਵਰਗੇ ਹਨ ਅਤੇ ਇਹਨਾਂ ਵਿੱਚ ਵਰਗੀਕਰਤਾਵਾਂ ਦੀ ਇੱਕ ਪ੍ਰਣਾਲੀ ਸ਼ਾਮਲ ਹੈ, ਜੋ ਅਣਅਧਿਕਾਰਤ ਵਿਹਾਰ ਦੀ ਜਾਂਚ ਲਈ ਮਾਡਲ ਦੀ ਰੀਜ਼ਨਿੰਗ ਅਤੇ ਕਾਰਵਾਈਆਂ ਦੀ ਜਾਂਚ ਕਰਦੀ ਹੈ ਅਤੇ ਸੰਭਾਵੀ ਅਣਅਧਿਕਾਰਤ ਸਰਗਰਮੀ ਨੂੰ ਆਪਣੇ ਆਪ ਰੋਕ ਦਿੰਦੀ ਹੈ.

Astra ਦੀਆਂ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਵਾਧੇ ਨੂੰ ਦੇਖਦੇ ਹੋਏ, ਅਸੀਂ ਇਸ ਡਿਪਲੌਇਮੈਂਟ ਨੂੰ ਸੁਰੱਖਿਅਤ ਅਤੇ ਮਜ਼ਬੂਤ ਬਣਾਉਣ ਲਈ ਖ਼ਾਸ ਤੌਰ 'ਤੇ ਸਾਵਧਾਨੀ ਵਰਤ ਰਹੇ ਹਾਂ. ਵਾਧੂ ਸੁਰੱਖਿਆ ਜਾਂਚਾਂ ਕਈ ਵਾਰ ਜਾਇਜ਼ ਕੰਮ ਨੂੰ ਹੌਲੀ, ਰੋਕ ਜਾਂ ਬੰਦ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਜਿਸ ਵਿੱਚ ਰੱਖਿਆਤਮਕ ਸਾਈਬਰਸੁਰੱਖਿਆ ਵੀ ਸ਼ਾਮਲ ਹੈ. ਜੇਕਰ ChatGPT ਜਾਂ Codex ਵਿੱਚ ਕੋਈ ਟਾਸਕ ਅਸਥਾਈ ਤੌਰ ’ਤੇ ਰੁਕ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਜਾਰੀ ਰੱਖਣ ਤੋਂ ਪਹਿਲਾਂ ਤੁਹਾਨੂੰ ਕਾਰਵਾਈ ਦੀ ਸਮੀਖਿਆ ਕਰਨ ਲਈ ਕਿਹਾ ਜਾ ਸਕਦਾ ਹੈ. API ਵਿੱਚ, ਟਾਸਕ ਰੁਕ ਜਾਵੇਗੀ. ਇਹ ਟੈਸਟ ਕਈ ਵਾਰ ਵੈਧ ਕੰਮ ਵਿੱਚ ਰੁਕਾਵਟ ਪਾ ਸਕਦੇ ਹਨ, ਅਤੇ ਅਸੀਂ ਬੇਲੋੜੀਆਂ ਰੁਕਾਵਟਾਂ ਨੂੰ ਘਟਾਉਣ ਲਈ ਇਸ ਸਿਸਟਮ ਵਿੱਚ ਲਗਾਤਾਰ ਸੁਧਾਰ ਕਰ ਰਹੇ ਹਾਂ. ਗਲਤ ਅਲਾਈਨਮੈਂਟ ਨਿਗਰਾਨੀ ਅਲਾਈਨਮੈਂਟ ਦੀ ਥਾਂ ਨਹੀਂ ਲੈ ਸਕਦੀ: ਸਾਡਾ ਟੀਚਾ ਅਜਿਹੇ ਮਾਡਲ ਬਣਾਉਣਾ ਹੈ ਜੋ ਭਰੋਸੇਯੋਗ ਢੰਗ ਨਾਲ ਆਪਣੇ ਅਧਿਕਾਰਤ ਦਾਇਰੇ ਵਿੱਚ ਰਹਿਣ, ਤਾਂ ਜੋ ਇਹਨਾਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਦਖਲ ਦੇਣ ਦੀ ਲੋੜ ਨਾ ਪਵੇ.

ਉਪਲਬਧਤਾ

GPT‑6 Astra ਅੱਜ ਸੀਮਿਤ ਗਿਣਤੀ ਦੀਆਂ ਸੰਸਥਾਵਾਂ ਲਈ ਪੇਸ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਅਤੇ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਵਿੱਚ ਇਹ ਸਾਰੇ ChatGPT Plus, Pro, Business ਅਤੇ Enterprise ਵਰਤੋਂਕਾਰਾਂ ਲਈ, ਨਾਲ ਹੀ OpenAI API, Microsoft Azure ਅਤੇ AWS Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ. Astra ਦੀ ਵਰਤੋਂ ਮੌਜੂਦਾ ਸਬਸਕ੍ਰਿਪਸ਼ਨ ਭੱਤਿਆਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹੈ—ਵਰਤੋਂਕਾਰ ਅਤੇ ਕਾਰੋਬਾਰ ਵਾਧੂ ਵਰਤੋਂ ਲਈ ਕ੍ਰੈਡਿਟ ਵੀ ਖਰੀਦ ਸਕਣਗੇ. Pro, Business ਅਤੇ Enterprise ਪਲਾਨਾਂ ਵਾਲੇ ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ GPT‑6 Astra Pro ਤੱਕ ਵੀ ਪਹੁੰਚ ਮਿਲੇਗੀ. Enterprise ਐਡਮਿਨਿਸਟ੍ਰੇਟਰ ਆਪਣੀ ਵਰਕਸਪੇਸ ਲਈ Astra ਨੂੰ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹਨ; ਲਾਂਚ ਦੇ ਸਮੇਂ ਪਹੁੰਚ ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ ਬੰਦ ਰਹਿੰਦੀ ਹੈ.

Astra ਯੋਗ API ਗਾਹਕਾਂ ਲਈ ਜ਼ੀਰੋ ਡਾਟਾ ਰਿਟੈਂਸ਼ਨ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਅਤੇ ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਪਿਛਲੇ ਮਹੀਨੇ ਸਾਂਝਾ ਕੀਤਾ ਸੀ, ਅਸੀਂ ਗਾਹਕਾਂ ਦੀ ਪ੍ਰਾਈਵੇਸੀ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਸੁਰੱਖਿਆ ਨਿਗਰਾਨੀ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਨ ਲਈ ਪ੍ਰਾਈਵੇਟ ਸੇਫ਼ਟੀ ਪ੍ਰੋਸੈਸਿੰਗ ਦੀ ਟੈਸਟਿੰਗ ਕਰ ਰਹੇ ਹਾਂ.

ਡਿਵੈਲਪਰਾਂ ਲਈ, GPT‑6 Astra OpenAI API ਵਿੱਚ gpt-6-astra ਵਜੋਂ ਅਤੇ Microsoft Azure ਅਤੇ Amazon Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ।

OpenAI API ਸਟੈਂਡਰਡ ਕੀਮਤ ਹਰ 10 ਲੱਖ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $10 ਅਤੇ ਹਰ 10 ਲੱਖ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $50 ਹੈ. ਕੈਸ਼ ਰੀਡਸ ਅਤੇ ਰਾਈਟਸ 'ਤੇ ਵੱਖਰੀਆਂ ਦਰਾਂ ਲਾਗੂ ਹੁੰਦੀਆਂ ਹਨ. API ਵਿੱਚ GPT‑6 Astra ਲਈ ਫਾਸਟ ਮੋਡ ਉਪਲਬਧ ਹੈ ਅਤੇ ਇਹ ਸਟੈਂਡਰਡ ਕੀਮਤ ਤੋਂ ਦੁੱਗਣੀ ਕੀਮਤ 'ਤੇ ਸਟੈਂਡਰਡ ਪ੍ਰੋਸੈਸਿੰਗ ਨਾਲੋਂ ਦੋ ਗੁਣਾ ਤੱਕ ਦੀ ਸਪੀਡ ਦਿੰਦਾ ਹੈ.

ਕੰਪਿਊਟਰ ਦੀ ਵਰਤੋਂ

ਕੰਪਿਊਟਰ ਦੀ ਵਰਤੋਂ

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

ਏਜੰਟਾਂ ਦੀ ਆਖ਼ਰੀ ਪ੍ਰੀਖਿਆ

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, ਔਫਲਾਈਨ ਸੈੱਟ, ਅੰਸ਼ਿਕ ਸਕੋਰ)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (ਕੋਈ ਟੂਲ ਨਹੀਂ)

92.7%

76.9%

-

87.3%17

-

-

ਪੇਸ਼ੇਵਰ

ਪੇਸ਼ੇਵਰ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

ਅੰਦਰੂਨੀ ਡਿਜ਼ਾਈਨ ਟਾਸਕਾਂ

50.0%

47.4%

-

35.8%

-

-

ਅੰਦਰੂਨੀ ਡਾਟਾ ਸਾਇੰਸ ਟਾਸਕਾਂ

40.9%

30.5%

-

34.7%

-

-

ਆਰਟੀਫੀਸ਼ੀਅਲ ਐਨਾਲਿਸਿਸ ਇੰਟੈਲੀਜੈਂਸ ਇੰਡੈਕਸ v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

ਕੋਡਿੰਗ

ਕੋਡਿੰਗGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (ਸਕੋਰ)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (ਸਕੋਰ)53.3% 847.5%50.9%53.5%53.4%43.6%
ਅੰਦਰੂਨੀ ਡੇਟਾਬੇਸ ਮਾਈਗ੍ਰੇਸ਼ਨ ਟਾਸਕ63.9%42.7%57.8%50.3%--
Artificial Analysis ਕੋਡਿੰਗ ਏਜੰਟ ਇੰਡੈਕਸ v1.467.065.1-67.268.161.2

ਅਕਾਦਮਿਕ

ਅਕਾਦਮਿਕ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath ਟੀਅਰ 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (ਟੂਲਾਂ ਦੇ ਨਾਲ)

57.2%

-

65.0%

63.8%

63.6%

-

ਵਿਗਿਆਨ ਅਤੇ ਹੈਲਥ

ਵਿਗਿਆਨ ਅਤੇ ChatGPT ਸਿਹਤGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (ਅੰਦਰੂਨੀ)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (ਲੰਬਾਈ-ਅਨੁਕੂਲਿਤ)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

ਸਾਈਬਰ ਸੁਰੱਖਿਆ

ਸਾਈਬਰਸੁਰੱਖਿਆGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (ਜੂਨ-ਅਗਸਤ 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

ਅਲਾਈਨਮੈਂਟ

ਅਲਾਈਨਮੈਂਟ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

ਅੰਦਰੂਨੀ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸੁਰੱਖਿਆ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਹੋਣਾ ਬਿਹਤਰ ਹੈ)

2.4%

22.0%

9.5%

18.3%

11.5%

-

ਅੰਦਰੂਨੀ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸੁਰੱਖਿਆ ਬੈਂਚਮਾਰਕ, AutoReview ਦੇ ਨਾਲ (ਘੱਟ ਬਿਹਤਰ ਹੈ)

1.8%

4.3%

-

-

-

-

ਅੰਦਰੂਨੀ ਬਾਈਪਾਸ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਬਿਹਤਰ ਹੈ)

0.00%

0.29%

-

-

-

-

ExploitGym honeypot (ਘੱਟ ਬਿਹਤਰ ਹੁੰਦਾ ਹੈ)

0.0%

48.2%

-

-

-

-

ਅਸੰਭਵ ExploitGym

100.0%

-

-

-

-

-

ਅੰਦਰੂਨੀ ਹੈਲੂਸੀਨੇਸ਼ਨ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਹੋਣਾ ਬਿਹਤਰ ਹੈ)

4.2%

12.2%

-

-

-

-

ਲੰਬਾ ਸੰਦਰਭ

ਲੰਬਾ ਸੰਦਰਭ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

ਅਮੂਰਤ ਰੀਜ਼ਨਿੰਗ

ਅਮੂਰਤ ਰੀਜ਼ਨਿੰਗGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 77.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

ਮੁਲਾਂਕਣ ਸਕੋਰ ਕਿਸੇ ਵੀ ਯਤਨ ਪੱਧਰ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਹੁੰਦੇ ਹਨ. GPT ਮੁਲਾਂਕਣ ਸਾਡੇ ਖੋਜ ਵਾਤਾਵਰਨ ਵਿੱਚ ਜਾਂ ਸਾਡੇ API ਰਾਹੀਂ ਚਲਾਏ ਗਏ ਸਨ, ਜੋ ਸਿਸਟਮ ਪ੍ਰੌਂਪਟਾਂ, ਉਪਲਬਧ ਟੂਲਾਂ ਆਦਿ ਵਿੱਚ ਫਰਕ ਕਰਕੇ ਪ੍ਰੋਡਕਸ਼ਨ ChatGPT ਤੋਂ ਥੋੜ੍ਹੀ ਵੱਖਰੀ ਆਊਟਪੁੱਟ ਦੇ ਸਕਦੇ ਹਨ.

ਫੁੱਟਨੋਟ

  1. 1

    ARC-AGI-3 ਉੱਤੇ, GPT-6 Astra ਨੂੰ ਸਾਡੇ Responses API ਜਾਂਚ-ਢਾਂਚੇ⁠ ਨਾਲ ਚਲਾਇਆ ਗਿਆ ਸੀ, ਜੋ ਅਸਲ-ਦੁਨੀਆ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਨਾਲ ਬਿਹਤਰ ਮੇਲ ਲਈ ਦੋ ਸੈਟਿੰਗਾਂ ਬਦਲਦਾ ਹੈ. ਇਹ ਤਬਦੀਲੀਆਂ ਖਾਸ ਤੌਰ 'ਤੇ ARC-AGI-3 ਨੂੰ ਨਿਸ਼ਾਨਾ ਨਹੀਂ ਬਣਾਉਂਦੀਆਂ.

  2. 2

    GPT-5.6 Sol ਸਾਡੇ API, ChatGPT Codex, ਅਤੇ ChatGPT ਵਰਕ ਵਿੱਚ ਉਪਲਬਧ ਵਰਜ਼ਨ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ. ChatGPT ਚੈਟ ਵਿੱਚ ਵਰਜ਼ਨ ਥੋੜ੍ਹਾ ਵੱਖਰਾ ਹੈ.⁠

  3. 3

    OSWorld V2-Offline ਮੂਲ OSWorld V2 ਦਾ ਇੱਕ ਉਪ-ਸੈੱਟ ਹੈ ਜੋ ਇੰਟਰਨੈੱਟ ਪਹੁੰਚ ਤੋਂ ਬਿਨਾਂ ਕੰਮ ਕਰਦਾ ਹੈ. OSWorld-V2 Offline ਉੱਤੇ Claude ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਲੇਖਕਾਂ ਨੇ ਅਧਿਕਾਰਤ ਲੀਡਰਬੋਰਡ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਉੱਤੇ ਦੁਹਰਾਇਆ. OSWorld 2.0 ਉੱਤੇ, Claude ਦੇ ਸਕੋਰਾਂ ਲਈ ਅਧਿਕਾਰਤ ਸੈਟਿੰਗਾਂ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਨਾ ਕਿ Fable 5.1 ਸਿਸਟਮ ਕਾਰਡ ਦੇ ਸੋਧੇ ਹੋਏ ਟਾਸਕ ਅਤੇ ਸੋਧੇ ਹੋਏ ਮੁਲਾਂਕਣ.

  4. 4

    ਮਾਡਲ ਦੇ ਸਮੇਂ ਸੰਬੰਧਿਤ ਪ੍ਰਦਰਸ਼ਨ ਰਨਾਂ ਲਈ ਰਿਪੋਰਟ ਕੀਤੇ ਗਏ ਬੀਤ ਚੁੱਕੇ ਸਮੇਂ ਹਨ. ਦਿਖਾਈਆਂ ਗਈਆਂ ਕਲਿੱਪਾਂ ਸੰਪਾਦਿਤ ਅੰਸ਼ ਹਨ.

  5. 5

    BenchCAD 'ਤੇ, Claude ਦੇ ਸਕੋਰ eval ਵਿੱਚ ਕੀਤੀਆਂ ਤਿੰਨ ਸੋਧਾਂ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ, ਜਿਨ੍ਹਾਂ ਦਾ ਵੇਰਵਾ Fable 5.1 ਸਿਸਟਮ ਕਾਰਡ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਦਿੱਤਾ ਗਿਆ ਹੈ.

  6. 6

    ਗੁਆਂਗ ਯਾਂਗ, ਵਿਕਟੋਰੀਆ ਐਬਰਟ, ਨਾਜ਼ਿਫ਼ ਤਾਮੇਰ, ਬ੍ਰਾਇਨ ਸਿਯੁਆਨ ਝੇਂਗ, ਲੁਈਜ਼ਾ ਪੋਜ਼ਬੋਨ, ਅਤੇ ਨੋਆ ਏ. ਸਮਿਥ. “LEGATO: ਲਾਰਜ-ਸਕੇਲ ਐਂਡ-ਟੂ-ਐਂਡ ਜਨਰਲਾਈਜ਼ੇਬਲ ਅਪ੍ਰੋਚ ਟੂ ਟਾਈਪਸੈਟ OMR⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” arXiv:2506.19065, 2025.

  7. 7

    ਮਾਰਕ ਆਰ. ਐਚ. ਗੋਥਮ, ਮੌਰੀਨ ਰੈਡਬੌਂਡ, ਬਰੂਨੋ ਬਾਵਰ, ਅਤੇ ਪੀਟਰ ਜੋਨਾਸ. “The OpenScore String Quartet Corpus⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” ਡਿਜੀਟਲ ਲਾਇਬ੍ਰੇਰੀਜ਼ ਫ਼ਾਰ ਮਿਊਜ਼ਿਕੋਲੋਜੀ ਬਾਰੇ 10ਵੀਂ ਅੰਤਰਰਾਸ਼ਟਰੀ ਕਾਨਫਰੰਸ ਦੀਆਂ ਕਾਰਵਾਈਆਂ, ਸਫ਼ੇ 49–57. ACM, 2023.

  8. 8

    FrontierCode 'ਤੇ, GPT-6 Astra ਨੂੰ ਇੱਕ ਡਿਵੈਲਪਰ  ਮੈਸੇਜ ਨਾਲ ਚਲਾਇਆ ਗਿਆ ਸੀ ਜੋ ਇਸਦੇ Codex ਵਿੱਚ ਡਿਵੈਲਪਰ ਮੈਸੇਜ ਦੇ ਇੱਕ ਭਾਗ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਰਗਾ ਸੀ: "ਬਹੁਤ ਜ਼ਿਆਦਾ ਟੈਸਟ ਫਾਈਲਾਂ ਬਣਾਉਣ ਤੋਂ ਬਚੋ. ਨਵੀਂ ਟੈਸਟ ਫਾਈਲ ਸਿਰਫ਼ ਤਦੋਂ ਬਣਾਓ ਜਦੋਂ ਰਿਪੋਜ਼ਟਰੀ ਦੇ ਨਿਯਮਾਂ ਅਨੁਸਾਰ ਇਸਦੀ ਲੋੜ ਹੋਵੇ ਜਾਂ ਜਦੋਂ ਕੋਈ ਮੌਜੂਦਾ ਫਾਈਲ ਇਸ ਲਈ ਢੁਕਵੀਂ ਥਾਂ ਨਾ ਹੋਵੇ. ਗੈਰ-ਸੰਬੰਧਿਤ ਕਲੀਨਅੱਪ ਅਤੇ ਬੇਲੋੜੀ ਪੇਚੀਦਗੀ ਤੋਂ ਬਚੋ. ਉਚਿਤ ਮੌਜੂਦਾ ਯੂਟਿਲਿਟੀਆਂ ਦੀ ਮੁੜ ਵਰਤੋਂ ਕਰੋ. ਸੰਬੰਧਿਤ ਰਿਪੋਜ਼ਟਰੀ ਹਦਾਇਤਾਂ ਪੜ੍ਹੋ ਅਤੇ ਨੇੜਲੇ ਕੋਡ, ਟੈਸਟਾਂ, ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ CI ਦੀ ਜਾਂਚ ਕਰੋ. ਸਥਾਪਿਤ ਰਵਾਇਤਾਂ ਦੀ ਪਾਲਣਾ ਕਰੋ. ਟੀਚਾ ਸਾਫ਼-ਸੁਥਰਾ, ਮਰਜ ਕਰਨ ਯੋਗ ਕੋਡ ਹੈ." ਪ੍ਰੌਂਪਟ ਨੂੰ eval ਲਈ ਅਨੁਕੂਲਿਤ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਸੀ.

  9. 9

    ਪਹਿਲਾ ਇਸ ਗੱਲ ਨਾਲ ਸੰਬੰਧਿਤ ਹੈ ਕਿ ਤੁਸੀਂ ਸੰਖਿਆ ਰੇਖਾ ਉੱਤੇ ਕਿੰਨਾ ਵੀ ਅੱਗੇ ਚਲੇ ਜਾਓ, ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਇੱਕ-ਦੂਜੇ ਦੇ ਕਿੰਨੇ ਨੇੜੇ ਆ ਸਕਦੀਆਂ ਹਨ. ਇੱਕ ਦਹਾਕੇ ਤੋਂ ਵੱਧ ਸਮੇਂ ਤੱਕ, ਸਭ ਤੋਂ ਵਧੀਆ ਗਿਆਤ ਨਤੀਜਾ ਇਹ ਸੀ ਕਿ ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਦੇ ਬੇਅੰਤ ਜੋੜੇ ਹਨ ਜਿਨ੍ਹਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਵੱਧ ਤੋਂ ਵੱਧ 246 ਹੈ. Julia Stadlmann⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਹਾਲ ਹੀ ਵਿੱਚ ਉਸ ਸੀਮਾ ਨੂੰ 240 ਤੱਕ ਸੁਧਾਰਿਆ. Astra ਨੇ 186 ਦੀ ਇੱਕ ਮਜ਼ਬੂਤ ਸੀਮਾ ਸਥਾਪਿਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ, ਜਿਸ ਨਾਲ ਇਹ ਦਿਖਾਇਆ ਗਿਆ ਕਿ ਅਨੰਤ ਗਿਣਤੀ ਵਿੱਚ ਜੋੜੇ ਇਸ ਘੱਟ ਦੂਰੀ ਦੇ ਅੰਦਰ ਮਿਲਦੇ ਹਨ. ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਦੇ ਛੋਟੇ ਅੰਤਰਾਲ: ਸਬੂਤ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ ਸਹਾਇਕ ਖੋਜ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).

  10. 10

    ਦੂਜਾ ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਦੇ ਵਿਚਕਾਰ ਅਸਧਾਰਨ ਤੌਰ 'ਤੇ ਵੱਡੇ ਅੰਤਰਾਂ ਨਾਲ ਸੰਬੰਧਿਤ ਹੈ. Astra ਨੇ ਇਨ੍ਹਾਂ ਅੰਤਰਾਂ ਦੀ ਇੱਕ ਸੀਮਾ ਵਿੱਚ ਇੱਕ ਪਦ ਵਿੱਚ ਸੁਧਾਰ ਕੀਤਾ, ਜੋ 80 ਸਾਲਾਂ ਤੋਂ ਵੱਧ ਸਮੇਂ ਤੱਕ ਅਪਰਿਵਰਤਿਤ ਰਹੀ ਸੀ. ਅਸੀਂ ਦੋਵਾਂ ਨਤੀਜਿਆਂ ਲਈ ਪ੍ਰਮਾਣ, ਸੰਖੇਪ ਚੇਨ-ਆਫ-ਥੌਟ ਅਤੇ ਪੁਸ਼ਟੀਕਰਨ ਸਮੱਗਰੀ ਸਾਂਝੀ ਕਰ ਰਹੇ ਹਾਂ. ਵੱਡੇ ਅਭਾਜ ਅੰਤਰਾਲ: ਪ੍ਰਮਾਣ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਅਤੇ ਸਹਾਇਕ ਖੋਜ⁠(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).

  11. 11

    ਅਸੀਂ ਸਾਰੇ Claude ਮਾਡਲਾਂ ਦਾ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਮੁਲਾਂਕਣ ਕੀਤਾ, HealthBench Professional ਦੀ ਨਿਰਧਾਰਤ ਪ੍ਰਕਿਰਿਆ ਦੀ ਪਾਲਣਾ ਕਰਦੇ ਹੋਏ, GPT-5.4 ਗ੍ਰੇਡਿੰਗ ਅਤੇ ਲੰਬਾਈ-ਅਨੁਸਾਰ ਸਮਾਯੋਜਿਤ, ਬਿਨਾਂ ਕਲਿੱਪ ਕੀਤੇ ਸਕੋਰਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ. Fable 5.1 ਲਈ, ਅਸੀਂ ਪ੍ਰਦਾਤਾ ਦੇ ਇਨਕਾਰਾਂ ਲਈ Opus 5 ਨੂੰ ਫਾਲਬੈਕ ਵਜੋਂ ਵਰਤਿਆ.

  12. 12

    Claude Fable 5 ਅਤੇ 5.1 ਨੂੰ LifeSciBench Gold v1, GeneBench Pro v13 ਅਤੇ MedChemBench ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਹੈ ਕਿਉਂਕਿ ਉਹ ਇਹਨਾਂ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਜ਼ਿਆਦਾਤਰ ਸਵਾਲਾਂ ਦਾ ਜਵਾਬ ਦੇਣ ਤੋਂ ਇਨਕਾਰ ਕਰਦੇ ਹਨ.

  13. 13

    ExploitGym 'ਤੇ, ਅਸੀਂ Astra ਅਤੇ Sol ਨੂੰ ਛੇ-ਘੰਟਿਆਂ ਦੀ ਸਮਾਂ ਸੀਮਾ ਤੋਂ ਬਿਨਾਂ ਟੈਸਟ ਕੀਤਾ, ਤਾਂ ਜੋ ਉਹਨਾਂ ਦੀਆਂ ਪੂਰੀਆਂ ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਦਾ ਬਿਹਤਰ ਮੁਲਾਂਕਣ ਕੀਤਾ ਜਾ ਸਕੇ. ਉਹ ਇੰਨੇ ਤੇਜ਼ ਹਨ ਕਿ ਇਸ ਦਾ ਪ੍ਰਭਾਵ ਬਹੁਤ ਘੱਟ ਪੈਂਦਾ ਹੈ.

  14. 14

    ExploitBench (ਜੂਨ–ਅਗਸਤ 2026) ਵਿੱਚ 20 ਹਾਈ-ਗੰਭੀਰਤਾ ਵਾਲੀਆਂ V8 ਕਮਜ਼ੋਰੀਆਂ 13 ਸਥਿਰ Chrome ਰਿਲੀਜ਼ਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ. ਬੈਂਚਮਾਰਕ ਇਹ ਜਾਂਚਦਾ ਹੈ ਕਿ ਕੀ ਏਜੰਟ ਹਰ ਨਿਰਧਾਰਤ ਕਮਜ਼ੋਰੀ ਦਾ ਸ਼ੋਸ਼ਣ ਕਰਕੇ Linux ਲਈ V8 ਅਤੇ ਅਧਿਕਾਰਤ Chrome ਰਿਲੀਜ਼ਾਂ ਵਿੱਚ ਆਰਬਿਟਰੇਰੀ ਕੋਡ-ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਹਾਸਲ ਕਰ ਸਕਦੇ ਹਨ. ਸ਼ਾਮਲ ਕੀਤੀਆਂ ਕੁਝ ਕਮਜ਼ੋਰੀਆਂ ਮੁਲਾਂਕਣ ਦੀਆਂ ਸੀਮਾਵਾਂ ਹੇਠ ਆਰਬਿਟਰੇਰੀ ਕੋਡ ਨੂੰ ਚਲਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਨਹੀਂ ਦੇ ਸਕਦੀਆਂ, ਇਸ ਲਈ 100% ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕਰਨੀ ਸੰਭਵ ਨਹੀਂ ਹੋ ਸਕਦੀ. ਨੋਟ: GPT-5.6 Sol ਦਾ 5.5% ਸਕੋਰ ਬੈਂਚਮਾਰਕ ਵਿੱਚ 300-ਟਰਨ ਦੀ ਸੀਮਾ ਦਾ ਨਤੀਜਾ ਹੈ, ਜੋ max ਵਰਤਣ ਵਾਲੇ ਅਸਲ ਗਾਹਕਾਂ ਲਈ ਕੋਈ ਸੀਮਾ ਨਹੀਂ ਹੋਵੇਗੀ. ਸਮਾਨ ਸੈਟਿੰਗਾਂ 'ਤੇ ਮਾਡਲ ਨੇ ਘੱਟ ਸੀਮਾਵਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਨ 'ਤੇ 11.5% ਦਾ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ.

  15. 15
  16. 16

    ਜਦੋਂ ਅਸੀਂ ਤੀਜੀ-ਧਿਰ ਦੇ ਮਾਡਲਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਾਂ, ਤਾਂ ਅਸੀਂ ਇੱਕ ਸਰਲ ਖੋਜ ਸੈੱਟਅੱਪ ਵਰਤਦੇ ਹਾਂ. Codex ਦੀ ਪ੍ਰੋਡਕਸ਼ਨ ਕੌਂਫਿਗਰੇਸ਼ਨ ਵਧੇਰੇ ਜਟਿਲ ਹੈ, ਜਿਸ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਰਾਅ-ਮਾਡਲ ਗਲਤੀ ਦਰਾਂ ਵੱਖਰੀਆਂ ਹੋ ਸਕਦੀਆਂ ਹਨ. ਪ੍ਰਦਾਤਾ-ਪੱਖੀ ਸੁਰੱਖਿਆ ਉਪਾਅ ਅਤੇ ਕੰਪਿਊਟਰ-ਟੂਲ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨ ਅਜੇ ਵੀ ਵੱਖਰੇ ਹਨ. ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ Codex ਵਿੱਚ ਬਿਨਾਂ-ਪੁਸ਼ਟੀ ਵਾਲੀ ਸਥਿਤੀ ਦਾ ਅਨੁਭਵ ਨਹੀਂ ਹੁੰਦਾ, ਕਿਉਂਕਿ ਇਹ ਇੱਕ ਅੰਦਰੂਨੀ ਖੋਜ ਕੌਂਫਿਗਰੇਸ਼ਨ ਹੈ।

  17. 17

    ScreenSpot-Pro ਅਤੇ ExploitGym ਲਈ, ਸਾਡੇ ਵੱਲੋਂ ਰਿਪੋਰਟ ਕੀਤੇ Fable ਸਕੋਰ Mythos ਤੋਂ ਆਉਂਦੇ ਹਨ, ਜੋ ਘੱਟ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਵਾਲਾ Fable ਹੈ.