OpenAI

GPT-6 Astra: A new generation of intelligence

ਇੰਟੈਲੀਜੈਂਸ ਦੀ ਇੱਕ ਨਵੀਂ ਪੀੜ੍ਹੀ

ਅਸੀਂ ਪੇਸ਼ ਕਰ ਰਹੇ ਹਾਂ GPT‑6 Astra, ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਬੁੱਧੀਮਾਨ ਅਤੇ ਅਨੁਕੂਲਿਤ ਮਾਡਲ।

GPT‑6 Astra ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ, ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਅਤੇ ਅਲਾਈਨਮੈਂਟ ਵਿੱਚ ਸਾਲਾਂ ਦੀ ਖੋਜ ਅਤੇ ਵੱਡੇ ਨਿਵੇਸ਼ਾਂ ਨੂੰ ਇੱਕਠਾ ਕਰਦਾ ਹੈ. Astra ਕੰਪਿਊਟਰ ਯੂਜ਼, ਬ੍ਰਾਊਜ਼ਿੰਗ, ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ, ਸਾਈਬਰ ਸੁਰੱਖਿਆ, ਵਿਗਿਆਨ, ਅਤੇ ਪੇਸ਼ੇਵਰ ਕੰਮ ਵਿੱਚ ਅਤਿ-ਆਧੁਨਿਕ ਹੈ. Astra ਨੇ FrontierMath Tier 4 ਵਿੱਚ 98% ਸਕੋਰ ਦੇ ਨਾਲ ਸਿਖਰ ਛੂਹਿਆ ਹੈ, ਅਤੇ ਇਹ ਪਹਿਲਾਂ ਹੀ ਗਣਿਤ ਵਿੱਚ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੀਆਂ ਅਣਸੁਲਝੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਚੁੱਕਾ ਹੈ. Astra ਨੇ ARC-AGI-3 ਵਿੱਚ 99.9% ਸਕੋਰ ਅਤੇ ExploitBench ਵਿੱਚ 100% ਸਕੋਰ ਵੀ ਹਾਸਲ ਕੀਤੇ ਹਨ. ਇਹ ਕੰਪਿਊਟਰ ਅਤੇ ਬ੍ਰਾਊਜ਼ਰ ਦੀ ਵਰਤੋਂ ਵਿੱਚ ਵੀ ਇੱਕ ਨਵਾਂ ਅਤਿ-ਆਧੁਨਿਕ ਮਿਆਰ ਕਾਇਮ ਕਰਦਾ ਹੈ, ਜੋ ਸਭ ਤੋਂ ਔਖੇ ਪੇਸ਼ੇਵਰ ਕੰਮ ਨੂੰ ਬੇਮਿਸਾਲ ਗਤੀ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸਮਝਦਾਰੀ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ. 

GPT‑6 Astra ਅੱਜ ਸੀਮਿਤ ਗਿਣਤੀ ਦੀਆਂ ਸੰਸਥਾਵਾਂ ਲਈ ਪੇਸ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਅਤੇ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਵਿੱਚ ਇਹ ਸਾਰੇ ChatGPT Plus, Pro, Business ਅਤੇ Enterprise ਵਰਤੋਂਕਾਰਾਂ ਲਈ, ਨਾਲ ਹੀ OpenAI API, Microsoft Azure ਅਤੇ AWS Bedrock ਰਾਹੀਂ ਉਪਲਬਧ ਹੋਵੇਗਾ.

“ARC-AGI-3 ਉੱਤੇ, Astra ਨੇ 96% ਪੱਧਰਾਂ ਵਿੱਚ ਸਾਡੀ ਮਨੁੱਖੀ ਕਾਰਵਾਈ-ਕੁਸ਼ਲਤਾ ਆਧਾਰ-ਰੇਖਾ ਨੂੰ ਪਾਰ ਕਰ ਲਿਆ, ਜਿਸ ਨਾਲ ਬੈਂਚਮਾਰਕ ਉੱਤੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਤੌਰ 'ਤੇ ਮਨੁੱਖੀ ਬਰਾਬਰੀ ਹਾਸਲ ਹੋ ਗਈ. ਇਹ ਨਾ ਸਿਰਫ਼ ਸਾਡੇ ਵੱਲੋਂ ਹੁਣ ਤੱਕ ਟੈਸਟ ਕੀਤਾ ਗਿਆ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ, ਸਗੋਂ ਇਹ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲਾਂ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ ਇੱਕ ਅਰਥਪੂਰਨ ਤਬਦੀਲੀ ਵੀ ਦਰਸਾਉਂਦਾ ਹੈ - ਨਾ ਸਿਰਫ਼ ਨਵੇਂ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ ਰਾਹ ਲੱਭਣ ਅਤੇ ਉਨ੍ਹਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਇਸਦੀ ਯੋਗਤਾ ਵਿੱਚ, ਸਗੋਂ ਇਸ ਗੱਲ ਵਿੱਚ ਵੀ ਕਿ ਇਹ ਅਜਿਹਾ ਕਰਨਾ ਕਿੰਨੀ ਕੁਸ਼ਲਤਾ ਨਾਲ ਸਿੱਖਦਾ ਹੈ.”
ਗ੍ਰੇਗ ਕਾਮਰਾਡਟ, ARC ਪ੍ਰਾਈਜ਼ ਫਾਊਂਡੇਸ਼ਨ

Astra ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਹੈ, ਜਿਸ ਵਿੱਚ ਵਰਤੋਂਕਰ ਦੇ ਇਰਾਦੇ ਅਤੇ ਮਾਡਲ ਵਿਵਹਾਰ ਨੂੰ ਸਮਝਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਹਨ—ਤੁਸੀਂ Astra ਦੇ ਫੈਸਲੇ ਨੂੰ ਵਧੇਰੇ ਭਰੋਸੇ ਨਾਲ ਕੰਮ ਸੌਂਪ ਸਕਦੇ ਹੋ. ਇਸਦਾ ਟੈਸਟ ਕਰਨ ਦੇ ਇੱਕ ਤਰੀਕੇ ਵਜੋਂ, ਅਸੀਂ Hugging Face ਦੀ ਘਟਨਾ ਤੋਂ ਜਾਣਕਾਰੀ ਲੈ ਕੇ ਇੱਕ ਨਵਾਂ ਮੁਲਾਂਕਣ ਤਿਆਰ ਕੀਤਾ ਹੈ, ਜੋ ਇਹ ਜਾਂਚਦਾ ਹੈ ਕਿ ਕੀ ਕਿਸੇ ਮੁਸ਼ਕਲ ਜਾਂ ਅਸੰਭਵ ਕੰਮ ਦਾ ਸਾਹਮਣਾ ਕਰਨ ਵਾਲਾ ਮਾਡਲ ਆਪਣੇ ਨਿਰਧਾਰਤ ਦਾਇਰੇ ਤੋਂ ਬਾਹਰ ਜਾਵੇਗਾ. GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ, ਜੋ ਪ੍ਰੋਡਕਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਤੋਂ ਬਿਨਾਂ 48% ਮਾਮਲਿਆਂ ਵਿੱਚ ਅਧਿਕਾਰਤ ਟੀਚੇ ਤੋਂ ਬਾਹਰ ਗਿਆ, GPT‑6 Astra ਨੇ 0% ਮਾਮਲਿਆਂ ਵਿੱਚ ਅਜਿਹਾ ਕੀਤਾ.

ਕੰਪਿਊਟਰ ਦੀ ਵਰਤੋਂ ਲਈ ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ

GPT‑6 Astra ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਦੀ ਗਤੀ, ਸ਼ੁੱਧਤਾ ਅਤੇ ਸੁਰੱਖਿਆ ਵਿੱਚ ਇੱਕ ਨਵੇਂ ਅਤਿ-ਆਧੁਨਿਕ ਯੁੱਗ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰਦਾ ਹੈ। ਇਹ ਔਨਲਾਈਨ ਫਾਰਮ ਭਰਨ, CRM ਵਿੱਚ ਗਾਹਕ ਰਿਕਾਰਡਾਂ ਨੂੰ ਅੱਪਡੇਟ ਕਰਨ, ਅਤੇ ਤੁਹਾਡੇ ਕੈਲੰਡਰ ਨੂੰ ਵਿਵਸਥਿਤ ਕਰਨ ਵਰਗੇ ਅਕਾਊ ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲ ਸਕਦਾ ਹੈ। ਇਹ ਔਨਲਾਈਨ ਖੋਜ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਤੁਹਾਡੀ ਈਮੇਲ ਜਾਂ ਤੁਹਾਡੇ ਦਸਤਾਵੇਜ਼ ਐਡੀਟਰ ਵਿੱਚ ਸਾਰ (summaries) ਡ੍ਰਾਫਟ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਵਿਗਿਆਨਕ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰ ਸਕਦਾ ਹੈ, ਪਲੌਟ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ, ਇੱਕ ਵੈੱਬਸਾਈਟ ਬਣਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਫਰੰਟਐਂਡ QA ਜਾਂਚ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਉਸ ਸਾਈਟ 'ਤੇ ਸਾਰੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਕੰਮ ਕਰਦੀਆਂ ਹਨ। ਇਹ ਖੁਦਮੁਖਤਿਆਰ ਤੌਰ 'ਤੇ ਸਾਫ਼ਟਵੇਅਰ ਸਥਾਪਤ ਕਰਨ ਅਤੇ ਟੈਸਟ ਕਰਨ, ਅਤੇ ਸਕ੍ਰੀਨ 'ਤੇ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਸੁਧਾਰ ਸਾਡੇ ਅਤਿ-ਆਧੁਨਿਕ ਮੁਲਾਂਕਣ ਨਤੀਜਿਆਂ ਵਿੱਚ ਵੀ ਝਲਕਦੇ ਹਨ।

ਇਹਨਾਂ ਸੁਧਾਰਾਂ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਅਸਲ ਗਿਆਨ-ਆਧਾਰਿਤ ਟਾਸਕਾਂ ਵਿੱਚ ਕੁਸ਼ਲਤਾ ਵਿੱਚ ਵੀ ਮਹੱਤਵਪੂਰਨ ਵਾਧਾ ਹੁੰਦਾ ਹੈ. OSWorld 2.0 'ਤੇ ਲੇਟੈਂਸੀ ਸਿਮੂਲੇਸ਼ਨਾਂ ਵਿੱਚ, Astra GPT‑5.6 ਨਾਲੋਂ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 47% ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਵਿੱਚ ਵੱਧ ਕਾਰਗੁਜ਼ਾਰੀ ਹਾਸਿਲ ਕਰਦਾ ਹੈ. Sol ਨੇ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 40 ਮਿੰਟਾਂ ਵਿੱਚ 72.6% ਸਕੋਰ ਹਾਸਿਲ ਕੀਤਾ, ਜਦਕਿ ਪ੍ਰਤੀ ਟਾਸਕ ਲਗਭਗ 75 ਮਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ 65.7% ਸੀ.3

GPT‑6 Astra ਦੀਆਂ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸਮਰੱਥਾਵਾਂ ਦੇ ਨਤੀਜੇ ਗੇਮ ਡਿਵੈਲਪਮੈਂਟ, ਇਲੈਕਟ੍ਰੀਕਲ ਇੰਜੀਨੀਅਰਿੰਗ, ਅਤੇ ਰੋਜ਼ਾਨਾ ਦੇ ਜਾਣਕਾਰੀ ਵਾਲੇ ਕੰਮਾਂ ਸਮੇਤ ਕਈ ਖੇਤਰਾਂ ਵਿੱਚ ਦੇਖੇ ਜਾ ਸਕਦੇ ਹਨ:

Astra ਦੇ ਨਾਲ, ਅਸੀਂ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਦੀ ਗਤੀ ਵਿੱਚ ਕਾਫ਼ੀ ਸੁਧਾਰ ਕਰਨ ਲਈ Codex ਜਾਂਚ-ਢਾਂਚੇ ਨੂੰ ਵੀ ਅੱਪਡੇਟ ਕਰ ਰਹੇ ਹਾਂ। Astra ਦੀ ਕਾਰਜਕੁਸ਼ਲਤਾ ਦੇ ਨਾਲ ਮਿਲ ਕੇ, ਇਹ Mind2Web ਬੈਂਚਮਾਰਕ 'ਤੇ ਮੌਜੂਦਾ GPT‑5.6 Sol ਅਨੁਭਵ ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਕੰਮ ਨੂੰ 1.9 ਗੁਣਾ ਤੇਜ਼ੀ ਨਾਲ ਪੂਰਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ। ਗਤੀ ਵਿੱਚ ਮਾਡਲ ਦੇ ਸੁਧਾਰਾਂ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਤੁਹਾਡੇ ਲਈ ਬਹੁਤ ਸਾਰੇ ਸਮਾਂ ਲੈਣ ਵਾਲੇ ਰੋਜ਼ਾਨਾ ਦੇ ਕੰਮਾਂ ਨੂੰ, ਤੁਹਾਡੇ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਕਰ ਸਕਦਾ ਹੈ।

“ਅਸੀਂ ਲਾਂਚ ਦੇ ਦਿਨ GPT‑6 Astra ਨੂੰ Devin ਦੇ ਜਾਂਚ-ਢਾਂਚੇ ਵਿੱਚ ਇੰਟੀਗ੍ਰੇਟ ਕਰ ਰਹੇ ਹਾਂ, ਜਿੱਥੇ ਇਹ ਸਾਡੇ ਅੰਦਰੂਨੀ ਟੈਸਟਿੰਗ ਬੈਂਚਮਾਰਕ ‘ਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦਾ ਹੈ. ਇਸਦੀ ਸ਼ਾਨਦਾਰ ਕੰਪਿਊਟਰ ਵਰਤੋਂ, ਲਿਖਣ ਦੀ ਸਮਰੱਥਾ, ਅਤੇ ਕੋਡਬੇਸ ਦੀ ਸਮਝ ਨੇ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਸੈੱਟਅੱਪ ਦੇ ਹੀ ਟੈਸਟਿੰਗ ਨੂੰ ਬਿਹਤਰ ਬਣਾ ਦਿੱਤਾ: ਵੀਡੀਓਜ਼ ਨੂੰ ਸਮਝਣਾ ਕਾਫ਼ੀ ਆਸਾਨ ਹੈ, ਅਤੇ ਰਿਪੋਰਟਾਂ ਹੋਰ ਸਪਸ਼ਟ ਅਤੇ ਸੰਖੇਪ ਹਨ”
ਸਿਲਾਸ ਅਲਬਰਟੀ, SVP ਰਿਸਰਚ, Cognition

ਪੇਸ਼ੇਵਰ ਕੰਮ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਬਦੀਲੀ

GPT‑6 Astra ਗੁੰਝਲਦਾਰ ਕੰਮਾਂ ਨਾਲ ਨਜਿੱਠਣ ਵਿੱਚ ਮਦਦ ਕਰਨ ਲਈ, ਪੇਸ਼ੇਵਰ ਵਾਤਾਵਰਨਾਂ ਲਈ ਟੀਚਾਬੱਧ ਟ੍ਰੇਨਿੰਗ ਦੇ ਨਾਲ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਵਿੱਚ ਤਰੱਕੀਆਂ ਨੂੰ ਜੋੜਦਾ ਹੈ. ਇਹ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆਵਾਂ ਲਈ ਲੋੜੀਂਦੀ ਇੰਟੈਲੀਜੈਂਸ ਦੇ ਨਾਲ ਬਹੁ-ਪੜਾਵੀ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਪੂਰਾ ਕਰਨ ਅਤੇ ਸੁਧਰੇ ਦਸਤਾਵੇਜ਼, ਸਪ੍ਰੈੱਡਸ਼ੀਟਾਂ ਅਤੇ ਪ੍ਰੈਜ਼ੈਂਟੇਸ਼ਨਾਂ ਬਣਾਉਣ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਜੋੜਦਾ ਹੈ.

GPT‑6 Astra ਮੌਜੂਦਾ ਟੈਂਪਲੇਟਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਅਤੇ ਅਜਿਹੀਆਂ ਸਲਾਈਡਾਂ ਤਿਆਰ ਕਰਨ ਲਈ ਸਾਡਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ ਜੋ ਸੁਚੱਜੇ ਢੰਗ ਨਾਲ ਵਿਵਸਥਿਤ ਹੋਣ ਅਤੇ ਢਾਂਚਾਗਤ ਬਿਰਤਾਂਤ ਰਾਹੀਂ ਮੁੱਖ ਨੁਕਤਿਆਂ ਨੂੰ ਸੰਖੇਪ ਵਿੱਚ ਪੇਸ਼ ਕਰਨ। ਇਹ ਤੁਹਾਡੇ ਟੈਂਪਲੇਟਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਵਾਲੇ ਅਤੇ ਤੁਹਾਡੀ ਲਿਖਣ ਅਤੇ ਦ੍ਰਿਸ਼ਟੀਗਤ ਸ਼ੈਲੀ ਨਾਲ ਮੇਲ ਖਾਣ ਵਾਲੇ ਸਪਸ਼ਟ, ਚੰਗੀ ਤਰ੍ਹਾਂ ਵਿਵਸਥਿਤ ਦਸਤਾਵੇਜ਼, ਪੇਸ਼ਕਾਰੀਆਂ, ਸਪ੍ਰੈਡਸ਼ੀਟਾਂ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਬਣਾਉਂਦਾ ਹੈ। Astra ਨੂੰ ਇਸ ਤਰ੍ਹਾਂ ਵੀ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਹੈ ਕਿ ਇਹ ਮੌਜੂਦਾ ਕੰਮ ਲਈ ਗੈਰ-ਜ਼ਰੂਰੀ ਜਾਣਕਾਰੀ ਦੁਹਰਾਉਣ ਦੀ ਬਜਾਏ, ਆਉਟਪੁੱਟਾਂ ਵਿੱਚ ਖਾਸ ਤੌਰ 'ਤੇ ਸਿਰਫ਼ ਉਹੀ ਸੰਦਰਭ ਸ਼ਾਮਲ ਕਰੇ ਜੋ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ। ਇਸ ਸਭ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਵਧੇਰੇ ਤੁਰੰਤ ਵਰਤੋਂ ਯੋਗ ਆਰਟੀਫੈਕਟਸ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ ਅਤੇ ਮਿਆਰਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹੋਣ।

GPT‑6 Astra, ਆਪਣੇ ਦੁਆਰਾ ਬਣਾਈਆਂ ਜਾਣ ਵਾਲੀਆਂ ਵੈੱਬਸਾਈਟਾਂ, ਗੇਮਾਂ, ਐਪਲੀਕੇਸ਼ਨਾਂ ਅਤੇ ਰੈਂਡਰਿੰਗ ਵਿੱਚ ਵਧੇਰੇ ਬਿਹਤਰ ਵਿਜ਼ੂਅਲ ਸਮਝ ਲਿਆਉਂਦਾ ਹੈ. ChatGPT ਵਿੱਚ ਸਾਈਟਾਂ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ, Astra ਪ੍ਰੌਂਪਟ ਤੋਂ ਸਿੱਧੇ ਵੈੱਬਸਾਈਟਾਂ, ਵੈੱਬ ਐਪਾਂ ਅਤੇ ਗੇਮਾਂ ਬਣਾ, ਹੋਸਟ ਅਤੇ ਸਾਂਝੀਆਂ ਕਰ ਸਕਦਾ ਹੈ.

“Astra ਸਾਨੂੰ ਸਮਰੱਥਾ ਅਤੇ ਕਾਰਜਕੁਸ਼ਲਤਾ ਦੋਵਾਂ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਫਾਇਦਾ ਦਿੰਦਾ ਹੈ। ਇਹ ਸਾਡੇ ਦੁਆਰਾ ਟੈਸਟ ਕੀਤੇ ਗਏ ਹੋਰ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ 20% ਤੱਕ ਘੱਟ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਸਾਡੇ ਸਭ ਤੋਂ ਗੁੰਝਲਦਾਰ ਰਚਨਾਤਮਕ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਸਫਲਤਾਪੂਰਵਕ ਨੇਪਰੇ ਚਾੜ੍ਹਦਾ ਹੈ। ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ, ਸਾਡੇ ਗਾਹਕਾਂ ਲਈ, ਇਸਦਾ ਮਤਲਬ ਉੱਚ ਗੁਣਵੱਤਾ ਵਾਲਾ ਨਤੀਜਾ ਹੈ।”
ਐਲੈਕਸ ਮਸ਼ਰਾਬੋਵ, CEO ਅਤੇ ਸਹਿ-ਸੰਸਥਾਪਕ, Higgsfield AI

ਜਦੋਂ ਹਦਾਇਤਾਂ ਵਿੱਚ ਵਿਆਖਿਆ ਲਈ ਗੁੰਜਾਇਸ਼ ਹੁੰਦੀ ਹੈ, ਤਾਂ GPT‑6 Astra ਸਹੀ ਫ਼ੈਸਲਾ ਲੈਣ ਵਿੱਚ ਪਿਛਲੇ ਮਾਡਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਹੈ. ਇਹ ਆਮ ਗੁੰਝਲਾਂ ਨੂੰ ਦੂਰ ਕਰਨ ਲਈ ਸੰਦਰਭ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ ਅਤੇ ਜਦੋਂ ਜਵਾਬ ਨਾਲ ਨਤੀਜਾ ਬਦਲ ਸਕਦਾ ਹੋਵੇ, ਤਾਂ ਕੇਂਦਰਿਤ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ. Codex ਵਿੱਚ, ਇਹ ਅਸਿੰਕ੍ਰੋਨਸ ਤਰੀਕੇ ਨਾਲ ਸਵਾਲ ਪੁੱਛ ਸਕਦਾ ਹੈ ਅਤੇ ਇਸ ਦੇ ਨਾਲ ਹੀ ਉਹ ਕੰਮ ਜਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੇ ਜਵਾਬ ’ਤੇ ਨਿਰਭਰ ਨਹੀਂ ਕਰਦਾ. ਜੇਕਰ ਤੁਸੀਂ ਜਵਾਬ ਨਹੀਂ ਦਿੰਦੇ, ਤਾਂ ਇਹ ਜਿੱਥੇ ਉਚਿਤ ਹੋਵੇ, ਉੱਥੇ ਵਾਜਬ ਧਾਰਨਾਵਾਂ ਦੇ ਆਧਾਰ ’ਤੇ ਅੱਗੇ ਵਧਦਾ ਹੈ, ਪਰ ਮਹੱਤਵਪੂਰਨ ਫੈਸਲਿਆਂ ਲਈ ਤੁਹਾਡੇ ਇਨਪੁੱਟ ਦੀ ਉਡੀਕ ਕਰਦਾ ਹੈ.

ਹੇਠਾਂ ਦਿੱਤੀਆਂ ਉਦਾਹਰਨਾਂ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ Astra ਰੋਜ਼ਾਨਾ ਦੇ ਉਹਨਾਂ ਕੰਮਾਂ ਵਿੱਚ ਕਿਵੇਂ ਸਹਿਯੋਗ ਕਰਦਾ ਹੈ, ਜਿੱਥੇ ਗੁੰਮ ਹੋਈ ਜਾਣਕਾਰੀ ਜਵਾਬ ਨੂੰ ਮਹੱਤਵਪੂਰਨ ਤੌਰ ’ਤੇ ਬਦਲ ਸਕਦੀ ਹੈ.

Astra ਕਿਸੇ ਟਾਸਕ ਦੇ ਵਿਕਸਿਤ ਹੋਣ ਦੇ ਨਾਲ-ਨਾਲ ਆਪਣਾ ਧਿਆਨ ਸਹੀ ਦਿਸ਼ਾ ਵਿੱਚ ਬਣਾਈ ਰੱਖਣ ਵਿੱਚ ਵੀ ਬਿਹਤਰ ਹੈ. ਪੁਰਾਣੇ ਮਾਡਲ ਕਈ ਵਾਰ ਸਟੀਅਰਿੰਗ ਮੈਸੇਜਾਂ ਨੂੰ ਇੱਕ ਨਵੇਂ ਟੀਚੇ ਵਜੋਂ ਸਮਝ ਲੈਂਦੇ ਸਨ, ਜਿਸ ਕਾਰਨ ਉਹ ਮੂਲ ਬੇਨਤੀ ਜਾਂ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਪਾਬੰਦੀਆਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਣਾ ਭੁੱਲ ਜਾਂਦੇ ਸਨ. Astra ਨਵੀਆਂ ਲੋੜਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ, ਪੁੱਛੇ ਜਾਣ ’ਤੇ ਆਪਣੀ ਦਿਸ਼ਾ ਬਦਲਦਾ ਹੈ ਅਤੇ ਵਿਆਪਕ ਟਾਸਕ ਤੋਂ ਭਟਕੇ ਬਿਨਾਂ ਸਾਈਡ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦਿੰਦਾ ਹੈ.

“Astra ਗੁੰਝਲਦਾਰ ਕਾਨੂੰਨੀ ਕੰਮਾਂ ਵਿੱਚ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਗੁਣਵੱਤਾ ਪੱਖੋਂ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਹੈ। ਸਾਡੀ ਸ਼ੁਰੂਆਤੀ ਟੈਸਟਿੰਗ ਵਿੱਚ, Astra ਨੇ ਕਾਨੂੰਨੀ ਕੰਮ ਨੂੰ ਇੱਕ ਸੂਝਵਾਨ ਵਕੀਲ ਵਾਂਗ ਸੰਭਾਲ ਕੇ ਵੱਖਰੀ ਪਛਾਣ ਬਣਾਈ: ਇਹ ਸਥਾਪਿਤ ਰਿਕਾਰਡਾਂ ਵਿੱਚੋਂ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਵੱਖਰਾ ਕਰਦਾ ਹੈ, ਬਿਨਾਂ ਸਬੂਤ ਵਾਲੀਆਂ ਧਾਰਨਾਵਾਂ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਂਦਾ ਹੈ, ਅਤੇ ਖਾਮੀਆਂ ਨੂੰ ਠੋਸ ਡਰਾਫਟਿੰਗ ਵਿਕਲਪਾਂ ਵਿੱਚ ਬਦਲਦਾ ਹੈ।”
ਨਿਕੋ ਗਰੂਪੇਨ, ਹੈੱਡ ਆਫ ਐਪਲਾਈਡ ਰਿਸਰਚ, Harvey

ਕੋਡਿੰਗ

GPT‑6 Astra ਅੱਜ ਤੱਕ ਦਾ ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ।

2 ਵਿੱਚੋਂ 1
“GPT‑6 Astra ਸਾਡੇ ਅੰਦਰੂਨੀ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਅਤਿ-ਆਧੁਨਿਕ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦਾ ਹੈ ਅਤੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਟ੍ਰੇਡਿੰਗ ਇੰਟਿਊਸ਼ਨ ਦੇ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਸਪਸ਼ਟ ਪ੍ਰਗਤੀ ਦਿਖਾਉਂਦਾ ਹੈ. ਏਜੰਟਿਕ ਕੋਡਿੰਗ ਲਈ ਵਰਤੇ ਜਾਣ 'ਤੇ, GPT‑6 Astra ਡਿਵੈਲਪਰਾਂ ਲਈ ਸਮਝਣ ਵਿੱਚ ਆਸਾਨ ਢੰਗ ਨਾਲ ਸੰਚਾਰ ਕਰਦਾ ਹੈ ਅਤੇ ਅਜਿਹਾ ਕੋਡ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜਿਸਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ-ਪੱਧਰ ਦੀ ਗੁਣਵੱਤਾ ਤੱਕ ਪਹੁੰਚਣ ਲਈ ਘੱਟ ਦੁਹਰਾਅ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ.”
ਜੌਨ ਕ੍ਰੇਪੇਜ਼ੀ, AI ਸਹਾਇਕ, Jane Street

Astra ਦੇ ਨਾਲ, ਅਸੀਂ ਸੰਦਰਭ ਸੀਮਾ ਦੇ ਭਰ ਜਾਣ 'ਤੇ ਸੰਦਰਭ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਣ ਅਤੇ ਮੁੜ-ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ Codex ਵਾਸਤੇ ਇੱਕ ਨਵਾਂ ਤਰੀਕਾ ਪੇਸ਼ ਕਰ ਰਹੇ ਹਾਂ. ਇਤਿਹਾਸਕ ਤੌਰ 'ਤੇ, ਮਾਡਲਾਂ ਨੇ ਲੰਬੇ ਸੈਸ਼ਨਾਂ ਦੌਰਾਨ ਕੰਮ ਦਾ ਸਾਰ ਦੇਣ ਲਈ ਕੰਪੈਕਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਠੀਕ ਕਰਨ ਜਾਂ ਵੱਡੇ ਰੀਫੈਕਟਰਾਂ ਨਾਲ ਨਜਿੱਠਣ ਵੇਲੇ. ਹਰ ਕੰਪੈਕਸ਼ਨ ਕੁਝ ਵੇਰਵਿਆਂ ਨੂੰ ਛੱਡ ਸਕਦਾ ਹੈ ਕਿ ਕੋਈ ਸੁਧਾਰ ਕਿਉਂ ਅਸਫਲ ਹੋਇਆ ਜਾਂ ਕੋਈ ਕੰਪੋਨੈਂਟ ਕਿਵੇਂ ਵਿਹਾਰ ਕਰਦਾ ਹੈ. Codex ਵਿੱਚ, Astra ਬਾਰ-ਬਾਰ ਸੰਕੁਚਿਤ ਕਰਕੇ ਇੱਕ ਸਿੰਗਲ ਸਾਰ ਬਣਾਉਣ ਦੀ ਬਜਾਏ, ਇਕੱਠੇ ਕੀਤੇ ਵੇਰਵਿਆਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ, ਸੰਦਰਭ ਸੀਮਾ ਵਿੱਚ ਨੋਟਸ ਰੱਖ ਸਕਦਾ ਹੈ. ਪੁਰਾਣੀਆਂ ਸੰਦਰਭ ਸੀਮਾ ਖੋਜ-ਯੋਗ ਰਹਿੰਦੀਆਂ ਹਨ, ਇਸ ਲਈ Astra ਪਿਛਲੇ ਸੰਦੇਸ਼ਾਂ ਅਤੇ ਟੂਲ ਦੇ ਨਤੀਜਿਆਂ ਤੋਂ ਜ਼ਰੂਰਤਾਂ ਜਾਂ ਟੈਸਟ ਦੇ ਨਤੀਜੇ ਲੱਭ ਸਕਦਾ ਹੈ—ਭਾਵੇਂ ਉਹ ਜਾਣਕਾਰੀ ਇਸਦੇ ਨੋਟਸ ਵਿੱਚ ਦਰਜ ਨਾ ਕੀਤੀ ਗਈ ਹੋਵੇ. ਤੁਸੀਂ ਇਸ ਪ੍ਰਯੋਗਾਤਮਕ ਫੀਚਰ ਨੂੰ ਆਪਣੇ Codex config.toml,(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹੋ, ਅਤੇ ਆਉਣ ਵਾਲੇ ਹਫ਼ਤਿਆਂ ਵਿੱਚ ਇਹ Astra ਲਈ ਡਿਫੌਲਟ ਬਣ ਜਾਵੇਗਾ.

ਵਿਗਿਆਨਕ ਖੋਜ ਨੂੰ ਅੱਗੇ ਵਧਾਉਣਾ

“ਕਹਾਣੀ ਇਹ ਹੈ: ਇੱਕ ਯੁੱਗ ਦਾ ਅੰਤ, ਦੂਜੇ ਦੀ ਸ਼ੁਰੂਆਤ।”
ਗ੍ਰੈਗ ਬਰਨਹਮ, EpochAI

GPT‑6 Astra ਵਿਗਿਆਨਕ ਖੋਜ, ਗਣਿਤ, ਅਤੇ ਸਿਹਤ ਦੇ ਖੇਤਰ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਰੱਕੀ ਹੈ। ਅੱਜ, ਅਸੀਂ ਅਭਾਜ ਸੰਖਿਆਵਾਂ ਵਿਚਕਾਰਲੇ ਅੰਤਰਾਂ ਦੇ ਬਾਰੇ ਦੋ ਹੋਰ ਨਤੀਜੇ ਸਾਂਝੇ ਕਰ ਰਹੇ ਹਾਂ [ਲਿੰਕ ਦੇ ਨਾਲ]। Astra ਵਿਗਿਆਨ ਦੇ ਕਈ ਮੁਲਾਂਕਣਾਂ ਵਿੱਚ ਨਵੇਂ ਰਿਕਾਰਡ ਵੀ ਕਾਇਮ ਕਰਦਾ ਹੈ:

Astra ਵਿਗਿਆਨਕ ਖੋਜ ਦੇ ਪਿੱਛੇ ਦੇ ਵਿਹਾਰਕ ਕੰਮ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ. ਵਿਗਿਆਨਕ ਰੀਜ਼ਨਿੰਗ ਨੂੰ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਨਾਲ ਜੋੜ ਕੇ, ਇਹ ਡਾਟਾ ਦੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਨਤੀਜਿਆਂ ਦੀ ਪੜਚੋਲ ਕਰਨ ਲਈ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਵਿਸ਼ੇਸ਼ ਸੌਫ਼ਟਵੇਅਰ ਵਿੱਚ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਸਬੂਤਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਅਤੇ ਇਹ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਮਿਲਦੀ ਹੈ ਕਿ ਅੱਗੇ ਕੀ ਖੋਜ ਕਰਨੀ ਹੈ.

ਸਾਈਬਰ ਸੁਰੱਖਿਆ

Astra ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਇੱਕ ਵੱਡਾ ਬਦਲਾਅ ਹੈ। ਜ਼ੀਰੋ-ਡੇ ਐਕਸਪਲੋਇਟਸ ਦੀ ਪਛਾਣ ਕਰਨ ਅਤੇ ਵਿਕਸਿਤ ਕਰਨ ਦੀ ਇਸਦੀ ਸਮਰੱਥਾ ਰੱਖਿਅਕਾਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਨੂੰ ਪੈਚ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀ ਹੈ, ਪਰ ਇਹ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਜ਼ਰੂਰਤ ਵੀ ਪੈਦਾ ਕਰਦੀ ਹੈ। ਇਹ ਸਮਰੱਥਾਵਾਂ ਕਿੰਨੀ ਦੂਰ ਤੱਕ ਫੈਲੀਆਂ ਹੋਈਆਂ ਹਨ, ਇਹ ਸਮਝਣ ਲਈ ਅਸੀਂ ਅੰਦਰੂਨੀ ਅਤੇ ਥਰਡ-ਪਾਰਟੀ ਮਾਹਰਾਂ ਦੇ ਮੁਲਾਂਕਣਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ।

ਅਸੀਂ ਸਭ ਤੋਂ ਪਹਿਲਾਂ ExploitBench ਅਤੇ ExploitGym 'ਤੇ Astra ਦਾ ਟੈਸਟ ਕੀਤਾ, ਜੋ ਇਹ ਮਾਪਦੇ ਹਨ ਕਿ ਕੀ ਮਾਡਲ ਕਮਜ਼ੋਰ ਕੋਡਬੇਸਾਂ ਵਿੱਚ ਆਰਬਿਟਰੇਰੀ ਕੋਡ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹਨ ਜਾਂ ਨਹੀਂ।

ਸੰਭਾਵੀ ਚਿੰਤਾਵਾਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਦੇ ਹੋਏ ਕਿ ਇਤਿਹਾਸਕ ਸਾਫ਼ਟਵੇਅਰ ਕਮਜ਼ੋਰੀਆਂ ਦੇ ਸਾਹਮਣੇ ਆਉਣ ਨਾਲ ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ ਪ੍ਰਭਾਵਿਤ ਹੋ ਸਕਦੇ ਹਨ, ਅਸੀਂ Astra ਦਾ ਦੋ ਨਵੇਂ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਵੀ ਮੁਲਾਂਕਣ ਕੀਤਾ ਹੈ। ਇੱਕ ਲਈ, ਅਸੀਂ ਪਿਛਲੇ ਤਿੰਨ ਮਹੀਨਿਆਂ ਦੀਆਂ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਐਕਸਪਲੋਇਟ ਵਿਕਾਸ ਦੀ ਜਾਂਚ ਕਰਨ ਵਾਸਤੇ ਇੱਕ ਅੰਦਰੂਨੀ “ExploitBench (ਜੂਨ–ਅਗਸਤ 2026)” ਮੁਲਾਂਕਣ ਤਿਆਰ ਕੀਤਾ। 2 ਬਹੁਤ ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ Astra ਨੇ ਇਸ ਡਾਟਾਸੈੱਟ 'ਤੇ GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਜ਼ਿਆਦਾ ਆਰਬਿਟਰੇਰੀ ਕੋਡ-ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਦਰਾਂ ਪ੍ਰਾਪਤ ਕੀਤੀਆਂ। ਮੁਲਾਂਕਣ ਦੌਰਾਨ, Astra ਨੇ ਦੋ ਅਜਿਹੀਆਂ Chrome V8 heap-sandbox escape ਤਕਨੀਕਾਂ ਖੋਜੀਆਂ ਅਤੇ ਵਰਤੀਆਂ, ਜੋ ਪਹਿਲਾਂ ਅਣਜਾਣ ਸਨ। ਅਸੀਂ ਇਨ੍ਹਾਂ ਦੋਵਾਂ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਖੁਲਾਸਾ ਉਨ੍ਹਾਂ ਦੇ ਮੇਨਟੇਨਰਾਂ ਨੂੰ ਕਰ ਰਹੇ ਹਾਂ।

ਅਸੀਂ SRE-Bench 'ਤੇ ਵੀ Astra ਦਾ ਟੈਸਟ ਕੀਤਾ, ਜੋ ਕਿ ਇੱਕ ਬੈਂਚਮਾਰਕ ਹੈ ਅਤੇ ਇਹ ਮਾਪਦਾ ਹੈ ਕਿ ਕੀ ਮਾਡਲ ਬਾਈਨਰੀ ਸਾਫ਼ਟਵੇਅਰ ਦੇ ਮੁੱਖ ਲਾਜਿਕ ਨੂੰ ਸਮਝਣ ਲਈ ਉਸਨੂੰ ਰਿਵਰਸ ਇੰਜੀਨੀਅਰ ਕਰ ਸਕਦੇ ਹਨ ਜਾਂ ਨਹੀਂ। ਬੈਂਚਮਾਰਕ ਦੇ ਲੇਖਕਾਂ ਨੇ ਸ਼ੁਰੂ ਤੋਂ ਸਾਫ਼ਟਵੇਅਰ ਬਣਾਇਆ ਅਤੇ ਇਸਦੇ ਸੋਰਸ ਕੋਡ ਨੂੰ ਪ੍ਰਾਈਵੇਟ ਰੱਖਿਆ। Astra ਨੇ 88.0% ਕੰਮਾਂ ਨੂੰ ਇੱਕ ਹੀ ਕੋਸ਼ਿਸ਼ ਵਿੱਚ ਅਤੇ 99.2% ਕੰਮਾਂ ਨੂੰ ਚਾਰ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਹੱਲ ਕੀਤਾ, ਜਦੋਂ ਕਿ GPT‑5.6 Sol ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕ੍ਰਮਵਾਰ 55.9% ਅਤੇ 68.7% ਰਿਹਾ।

ਬੈਂਚਮਾਰਕਾਂ ਤੋਂ ਪਰੇ, ਮਾਹਰਾਂ ਦੀ ਅਗਵਾਈ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਤੋਂ ਪਤਾ ਲੱਗਾ ਹੈ ਕਿ Astra, ਪਹਿਲਾਂ ਤੋਂ ਅਣਜਾਣ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਹਾਰਡਨਡ ਬ੍ਰਾਊਜ਼ਰਾਂ ਵਿੱਚ ਆਰਬਿਟਰੇਰੀ ਕੋਡ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਹਾਰਡਨਡ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮਾਂ ਲਈ ਪ੍ਰਿਵਿਲੇਜ-ਐਸਕੇਲੇਸ਼ਨ ਐਕਸਪਲੋਇਟ ਬਣਾ ਸਕਦਾ ਹੈ। ਕੁੱਲ ਮਿਲਾ ਕੇ, ਇਨ੍ਹਾਂ ਨਤੀਜਿਆਂ ਨੇ ਸਾਡੇ ਇਸ ਫੈਸਲੇ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ ਕਿ Astra ਨੇ ਸਾਡੇ ਪ੍ਰਿਪੇਅਰਡਨੈਸ ਫ੍ਰੇਮਵਰਕ ਦੇ ਤਹਿਤ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਵਿੱਚ ਗੰਭੀਰ ਸੀਮਾ ਨੂੰ ਪਾਰ ਕਰ ਲਿਆ ਹੈ।

ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਡਿਫੈਂਡਰ ਦੀ ਵਿੰਡੋ ਵਿੱਚ ਚਰਚਾ ਕੀਤੀ ਸੀ, ਅਤਿ-ਆਧੁਨਿਕ ਸਾਈਬਰ ਸਮਰੱਥਾਵਾਂ ਰੱਖਿਆ ਕਰਨ ਵਾਲਿਆਂ ਨੂੰ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਤੇਜ਼ੀ ਨਾਲ ਪਤਾ ਲਗਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਪਰ ਇਹ ਉਨ੍ਹਾਂ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਫਾਇਦਾ ਉਠਾਉਣਾ ਵੀ ਆਸਾਨ ਬਣਾਉਂਦੀਆਂ ਹਨ, ਜਿਸ ਨਾਲ ਰੱਖਿਅਕਾਂ ਲਈ ਆਪਣੇ ਆਪ ਨੂੰ ਢਾਲਣ ਦੀ ਜ਼ਰੂਰਤ ਹੋਰ ਵੀ ਵੱਧ ਜਾਂਦੀ ਹੈ।

ਅੱਜ ਲਾਂਚ ਹੋਣ ਵਾਲੇ Astra ਦੇ ਵਰਜ਼ਨ ਲਈ, ਅਸੀਂ ਮਹੱਤਵਪੂਰਨ ਰੱਖਿਆਤਮਕ ਕੰਮਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਾਂ ਜਿਵੇਂ ਕਿ ਸੁਰੱਖਿਅਤ ਕੋਡ ਰਿਵਿਊ, ਪੈਚਿੰਗ, ਅਤੇ ਥ੍ਰੈਟ ਮਾਡਲਿੰਗ। ਹਾਲਾਂਕਿ, ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ, Astra ਐਡਵਾਂਸਡ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਕੰਮਾਂ ਜਿਵੇਂ ਕਿ ਐਕਸਪਲੋਇਟ ਖੋਜ ਨੂੰ ਕਰਨ ਤੋਂ ਇਨਕਾਰ ਕਰ ਦੇਵੇਗਾ। OpenAI Daybreak ਰਾਹੀਂ, ਅਸੀਂ OpenAI Daybreak ਪ੍ਰੋਗਰਾਮ ਵਿੱਚ ਭਰੋਸੇਮੰਦ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਰੱਖਿਅਕਾਂ ਦੇ ਇੱਕ ਐਲਫਾ ਸਮੂਹ ਲਈ ਘੱਟ ਪਾਬੰਦੀਆਂ ਵਾਲੀ ਪਹੁੰਚ ਸ਼ੁਰੂ ਕਰ ਰਹੇ ਹਾਂ। ਇਹ ਰੱਖਿਆਤਮਕ ਵਰਕਫਲੋਜ਼ ਤੱਕ ਪਹੁੰਚ ਦਾ ਵਿਸਤਾਰ ਕਰਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਵਲਨਰੇਬਿਲਟੀ ਟ੍ਰਾਇਜ ਅਤੇ ਪ੍ਰਮਾਣਿਕਤਾ, ਮਾਲਵੇਅਰ ਵਿਸ਼ਲੇਸ਼ਣ, ਡਿਟੈਕਸ਼ਨ ਇੰਜੀਨੀਅਰਿੰਗ, ਅਤੇ ਪੈਚ ਪ੍ਰਮਾਣਿਕਤਾ ਸ਼ਾਮਲ ਹੈ। ਸਾਡੀ ਯੋਜਨਾ Daybreak Blue ਰਾਹੀਂ ਅੱਗੇ ਹੋਰ ਪਹੁੰਚ ਦਾ ਵਿਸਤਾਰ ਕਰਨ ਦੀ ਹੈ।

ਅਸੀਂ GPT‑5.6 Sol ਲਈ ਸਾਡੇ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੇ ਆਧਾਰ 'ਤੇ, ਸੰਭਾਵੀ ਸਾਈਬਰ ਦੁਰਵਰਤੋਂ ਦੇ ਖਿਲਾਫ ਆਪਣੀ ਸੁਰੱਖਿਆ ਨੂੰ ਵੀ ਮਜ਼ਬੂਤ ਕੀਤਾ ਹੈ। ਇਨ੍ਹਾਂ ਵਿੱਚ ਸੰਭਾਵੀ ਜੇਲ੍ਹਬ੍ਰੇਕ ਦਾ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਸਾਹਮਣਾ ਕਰਨ ਲਈ ਮਜ਼ਬੂਤ ਮਾਡਲ ਰੋਬਸਟਨੈੱਸ ਟ੍ਰੇਨਿੰਗ ਅਤੇ ਸਾਡੇ ਨਿਗਰਾਨੀ ਸਿਸਟਮਾਂ ਲਈ ਵਧੇਰੇ ਸੰਦਰਭ ਸ਼ਾਮਲ ਹਨ। ਅਸੀਂ ਆਪਣੇ ਅੰਦਰੂਨੀ ਰੈਡ ਟੀਮਿੰਗ ਹਮਲਾਵਰਾਂ ਦੇ ਨਾਲ ਸਵੈਚਲਿਤ ਟੈਸਟਾਂ ਸਮੇਤ, ਸਖ਼ਤ ਅੰਦਰੂਨੀ ਅਤੇ ਬਾਹਰੀ ਟੈਸਟਿੰਗ ਜਾਰੀ ਰੱਖੀ ਹੈ। ਸਾਡੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਅਤੇ ਟੈਸਟਿੰਗ ਬਾਰੇ ਹੋਰ ਵੇਰਵੇ Astra ਸਿਸਟਮ ਕਾਰਡ ਅਤੇ ਸਾਡੇ ਬਲੌਗ ਵਿੱਚ ਉਪਲਬਧ ਹਨ।

GPT‑6 Astra ਨੂੰ ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਅਲਾਈਨ ਕਰਨਾ ਅਤੇ ਤਾਇਨਾਤ ਕਰਨਾ

Astra ਸਾਡਾ ਸਭ ਤੋਂ ਵੱਧ ਅਲਾਈਨ ਕੀਤਾ ਮਾਡਲ ਹੈ. Astra ਸਾਵਧਾਨੀ ਵਰਤਣ, ਟਾਸਕ ਦੀਆਂ ਹੱਦਾਂ ਦਾ ਸਤਿਕਾਰ ਕਰਨ ਅਤੇ ਪਾਰਦਰਸ਼ੀ ਢੰਗ ਨਾਲ ਸੰਚਾਰ ਕਰਨ ਵਿੱਚ ਸ਼ਾਨਦਾਰ ਹੈ. ਇਹ ਕੰਮ ਸਾਡੇ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੇ ਖੋਜ ਪ੍ਰੋਗਰਾਮ ਦਾ ਨਵੀਨਤਮ ਨਤੀਜਾ ਹੈ, ਜੋ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਮਨੁੱਖੀ ਇਰਾਦੇ ਨਾਲ ਤਾਲਮੇਲ ਵਿੱਚ ਰਹਿਣ ਵਾਲੇ ਮਾਡਲਾਂ ਨੂੰ ਟ੍ਰੇਨ ਕਰਨ 'ਤੇ ਕੇਂਦਰਿਤ ਹੈ.

ਸੰਵੇਦਨਸ਼ੀਲ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ, Astra ਆਪਣੇ ਜੋਖਮ ਦੇ ਅਨੁਪਾਤ ਵਿੱਚ ਸਾਵਧਾਨੀ ਨਾਲ ਅੱਗੇ ਵਧਦਾ ਹੈ. ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਵਾਲੇ ਉਹਨਾਂ ਟਾਸਕਾਂ ਦੇ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਗਲਤ ਵਿਵਹਾਰ ਪੈਦਾ ਕਰਨ ਲਈ ਵਿਰੋਧਾਤਮਕ ਢੰਗ ਨਾਲ ਚੁਣਿਆ ਗਿਆ ਸੀ, Astra ਅਣਚਾਹੇ ਨਤੀਜਿਆਂ ਤੋਂ ਬਚਣ ਵਿੱਚ ਵੱਧ ਸਫਲ ਰਹੀ. ਮੂਲ ਰੂਪ ਵਿੱਚ ਪ੍ਰਦਾਨ ਕੀਤੇ ਜਾਂਦੇ ਵਾਧੂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨਾਲ ਚਲਾਉਣ ’ਤੇ ਹੋਰ ਵੀ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਮਿਲਿਆ.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) and Anthropic Messages API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra ਦੇ ਵਰਤੋਂਕਾਰ ਦੁਆਰਾ ਨਿਰਧਾਰਤ ਕੀਤੀਆਂ ਅਤੇ ਇਸਦੇ ਵਾਤਾਵਰਨ ਦੁਆਰਾ ਸੰਕੇਤਿਤ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਕੰਮ ਕਰਨ ਦੀ ਵੀ ਵੱਧ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ. ਇੱਕ ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਨੇ Codex Auto-Review ਵੱਲੋਂ ਕੀਤੇ ਇਨਕਾਰ ਨੂੰ ਕਦੇ ਵੀ ਬਾਈਪਾਸ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਨਹੀਂ ਕੀਤੀ. ਇਹ ਗੱਲ ਉਸ ਵੇਲੇ ਵੀ ਸਹੀ ਰਹੀ ਜਦੋਂ Auto-review ਨੂੰ ਜਾਣ-ਬੁੱਝ ਕੇ ਇਸ ਤਰ੍ਹਾਂ ਕੌਂਫਿਗਰ ਕੀਤਾ ਗਿਆ ਸੀ ਕਿ ਇਸ ਤੋਂ ਬਚ ਕੇ ਨਿਕਲਿਆ ਜਾ ਸਕੇ, ਅਤੇ ਕਿਸੇ ਹੋਰ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਪੂਰਾ ਕਰਨਾ ਅਸੰਭਵ ਸੀ. ਵਾਤਾਵਰਨ ਦੀਆਂ ਪਾਬੰਦੀਆਂ ਲਈ ਇਹ ਸਤਿਕਾਰ ਸਾਡੇ ਅਸੰਭਵ ਸਾਈਬਰ ਟਾਸਕ ਮੁਲਾਂਕਣ ਦੇ ਨਤੀਜਿਆਂ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ, ਜੋ ਅਸੀਂ ਇਸ ਪੋਸਟ ਦੀ ਜਾਣ-ਪਛਾਣ ਵਿੱਚ ਸਾਂਝੇ ਕੀਤੇ ਸਨ, ਅਤੇ ਹੋਰ ਨਤੀਜਿਆਂ ਨਾਲ ਵੀ ਜੋ ਸਾਡੇ ਸਿਸਟਮ ਕਾਰਡ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਵਿੱਚ ਦਰਜ ਹਨ.

Astra ਧੋਖੇਬਾਜ਼ੀ ਵਾਲੇ ਵਿਵਹਾਰ ਵਿੱਚ ਵੀ ਕਾਫ਼ੀ ਕਮੀ ਦਿਖਾਉਂਦਾ ਹੈ। ਜਿੰਨ੍ਹਾਂ ਨੂੰ ਕੰਮ ਸੌਂਪਿਆਂ ਜਾਣਾ ਹੈ ਉਹਨਾਂ ਲੋਕਾਂ ਨੂੰ ਮਾਡਲ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦੀ ਸਪਸ਼ਟ ਸਮਝ ਅਤੇ ਇਸ ਦੀ ਤਰੱਕੀ ਬਾਰੇ ਇਮਾਨਦਾਰ ਰਿਪੋਰਟਿੰਗ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਇਹ ਇਮਾਨਦਾਰੀ ਦੇ ਇੱਕ ਪਹਿਲੂ ਨੂੰ ਮਾਪਦਾ ਹੈ; ਜਾਣ-ਬੁੱਝ ਕੇ ਕੀਤੀ ਜਾਣ ਵਾਲੇ ਹੇਰਾਫੇਰੀ ਨੂੰ ਘਟਾਉਣਾ ਸਾਡੇ ਸੰਰੇਖਣ ਸੰਬੰਧੀ ਕੰਮ ਦਾ ਇੱਕ ਵਿਆਪਕ ਕੇਂਦਰ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ।

ਸਾਡੇ ਸਮਰੱਥਾ-ਭਰਮ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਮੁਲਾਂਕਣ ਵਿੱਚ, Astra ਆਪਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਬਾਰੇ ਘੱਟ ਗੁੰਮਰਾਹਕੁੰਨ ਦਾਅਵੇ ਕਰਕੇ, GPT‑5.6 Sol ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਸੁਧਾਰ ਦਿਖਾਉਂਦਾ ਹੈ।

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

ਉਪਲਬਧਤਾ

GPT‑6 Astra ਅੱਜ ਸਾਡੇ ਟਰੱਸਟਡ ਐਕਸੈਸ ਪ੍ਰੋਗਰਾਮ ਵਿੱਚ ਉੱਦਮਾਂ ਅਤੇ ਗਾਹਕਾਂ ਲਈ ਪੇਸ਼ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ, ਅਤੇ ਆਉਣ ਵਾਲੇ ਕੁਝ ਦਿਨਾਂ ਵਿੱਚ ChatGPT Plus, Pro, Business ਅਤੇ Enterprise ਦੀ ਸਬਸਕ੍ਰਿਪਸ਼ਨ ਲੈਣ ਵਾਲੇ ਲੋਕਾਂ ਲਈ ਵੀ ਇਹ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਹੋਵੇਗਾ। Astra ਦੀ ਵਰਤੋਂ $100 ਅਤੇ $200 ਵਾਲੀਆਂ Pro ਯੋਜਨਾਵਾਂ ਅਤੇ $100 ਵਾਲੀ Business ਯੋਜਨਾ ਵਿੱਚ ਮੌਜੂਦਾ ਵਰਤੋਂ ਭੱਤੇ ਦੇ ਅੰਦਰ ਹੀ ਸ਼ਾਮਲ ਹੈ, ਜਿਸ ਵਿੱਚ ਕੋਈ ਵਾਧੂ ਰੇਟ ਲਿਮਿਟ ਜਾਂ ਪਾਬੰਦੀਆਂ ਨਹੀਂ ਹਨ। $20 Plus ਸਬਸਕ੍ਰਿਪਸ਼ਨ ਵਾਲੇ ਲੋਕ ਅਤੇ ਸਟੈਂਡਰਡ Business ਯੋਜਨਾ ਵਾਲੇ ਗਾਹਕ ਘੱਟ ਸੀਮਾਵਾਂ ਦੇ ਨਾਲ GPT‑6 Astra ਤੱਕ ਪਹੁੰਚ ਕਰ ਸਕਦੇ ਹਨ, ਅਤੇ ਵਾਧੂ ਪਹੁੰਚ ਲਈ ਕ੍ਰੈਡਿਟ ਖਰੀਦਣ ਦਾ ਵਿਕਲਪ ਵੀ ਮੌਜੂਦ ਹੈ। Enterprise ਪ੍ਰਸ਼ਾਸਕ ਆਪਣੇ ਵਰਕਸਪੇਸ ਲਈ Astra ਨੂੰ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹਨ; ਲਾਂਚ ਦੇ ਸਮੇਂ ਪਹੁੰਚ ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ ਬੰਦ ਰਹਿੰਦੀ ਹੈ।

Pro Lite, Pro, Business, ਅਤੇ Enterprise ਵਾਲੇ ਵਰਤੋਂਕਾਰ ਵੀ ਚੈਟ ਵਿੱਚ GPT‑6 Astra ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹਨ। Astra ਯੋਗ API ਗਾਹਕਾਂ ਲਈ ਜ਼ੀਰੋ ਡਾਟਾ ਰਿਟੈਂਸ਼ਨ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਅਤੇ ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਪਿਛਲੇ ਮਹੀਨੇ ਸਾਂਝਾ ਕੀਤਾ ਸੀ, ਅਸੀਂ ਗਾਹਕਾਂ ਦੀ ਗੋਪਨੀਯਤਾ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਸੁਰੱਖਿਆ ਨਿਗਰਾਨੀ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਨ ਲਈ Private Safety Processing ਦੀ ਟੈਸਟਿੰਗ ਕਰ ਰਹੇ ਹਾਂ।

ਡਿਵੈਲਪਰਾਂ ਲਈ, GPT‑6 Astra OpenAI API ਵਿੱਚ gpt-6-astra ਵਜੋਂ ਉਪਲਬਧ ਹੈ, ਅਤੇ AWS Bedrock ਵਿੱਚ ਵੀ ਉਪਲਬਧ ਹੈ। OpenAI API ਸਟੈਂਡਰਡ ਕੀਮਤ ਹਰ 10 ਲੱਖ ਇਨਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $10 ਅਤੇ ਹਰ 10 ਲੱਖ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $50 ਹੈ। ਕੈਸ਼ ਰੀਡਸ ਅਤੇ ਰਾਈਟਸ 'ਤੇ ਵੱਖਰੀਆਂ ਦਰਾਂ ਲਾਗੂ ਹੁੰਦੀਆਂ ਹਨ। API ਵਿੱਚ GPT‑6 Astra ਲਈ ਫਾਸਟ ਮੋਡ ਉਪਲਬਧ ਹੈ ਅਤੇ ਇਹ ਸਟੈਂਡਰਡ ਕੀਮਤ ਤੋਂ ਦੁੱਗਣੀ ਕੀਮਤ 'ਤੇ ਸਟੈਂਡਰਡ ਪ੍ਰੋਸੈਸਿੰਗ ਨਾਲੋਂ 2.5 ਗੁਣਾ ਤੱਕ ਦੀ ਸਪੀਡ ਦਿੰਦਾ ਹੈ।

ਕੰਪਿਊਟਰ ਦੀ ਵਰਤੋਂ

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

ਅਕਾਦਮਿਕ

ਅਕਾਦਮਿਕ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.7 Flash

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.2%

94.5%

ਸਿਧਾਂਤਕ ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ

75.4%

FrontierMath ਟੀਅਰ 1-3 (v2)

89.0%

90.2%

87.0%

85.6%

71.6%

FrontierMath ਟੀਅਰ 4 (v2)

97.6%

83.0%

87.8%

87.8%

73.2%

36.6%

ਮਨੁੱਖਤਾ ਦਾ ਆਖ਼ਰੀ ਇਮਤਿਹਾਨ (ਟੂਲ)

65.0%

63.8%

63.6%

ਮਨੁੱਖਤਾ ਦਾ ਆਖ਼ਰੀ ਇਮਤਿਹਾਨ (ਟੂਲਾਂ ਤੋਂ ਬਿਨਾਂ)

59.1%

55.5%

54.9%

47.9%

ਵਿਗਿਆਨ ਅਤੇ ਹੈਲਥ

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

ਸਾਈਬਰ ਸੁਰੱਖਿਆ

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

ਅਲਾਈਨਮੈਂਟ

ਅਲਾਈਨਮੈਂਟ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

ਅੰਦਰੂਨੀ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸੁਰੱਖਿਆ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਹੋਣਾ ਬਿਹਤਰ ਹੈ)

2.4%

22.0%

9.5%

18.3%

11.5%

-

ਅੰਦਰੂਨੀ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਸੁਰੱਖਿਆ ਬੈਂਚਮਾਰਕ, AutoReview ਦੇ ਨਾਲ (ਘੱਟ ਬਿਹਤਰ ਹੈ)

1.8%

4.3%

-

-

-

-

ਅੰਦਰੂਨੀ ਬਾਈਪਾਸ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਬਿਹਤਰ ਹੈ)

0.00%

0.29%

-

-

-

-

ExploitGym honeypot (ਘੱਟ ਬਿਹਤਰ ਹੁੰਦਾ ਹੈ)

0.0%

48.2%

-

-

-

-

ਅਸੰਭਵ ExploitGym

100.0%

-

-

-

-

-

ਅੰਦਰੂਨੀ ਹੈਲੂਸੀਨੇਸ਼ਨ ਬੈਂਚਮਾਰਕ (ਘੱਟ ਹੋਣਾ ਬਿਹਤਰ ਹੈ)

4.2%

12.2%

-

-

-

-

ਲੰਬਾ ਸੰਦਰਭ

ਲੰਬਾ ਸੰਦਰਭ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

ਅਮੂਰਤ ਰੀਜ਼ਨਿੰਗ

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

ਮੁਲਾਂਕਣ ਸਕੋਰ ਕਿਸੇ ਵੀ ਯਤਨ ਪੱਧਰ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਹੁੰਦੇ ਹਨ. GPT ਮੁਲਾਂਕਣ ਸਾਡੇ ਖੋਜ ਵਾਤਾਵਰਨ ਵਿੱਚ ਜਾਂ ਸਾਡੇ API ਰਾਹੀਂ ਚਲਾਏ ਗਏ ਸਨ, ਜੋ ਸਿਸਟਮ ਪ੍ਰੌਂਪਟਾਂ, ਉਪਲਬਧ ਟੂਲਾਂ ਆਦਿ ਵਿੱਚ ਫਰਕ ਕਰਕੇ ਪ੍ਰੋਡਕਸ਼ਨ ChatGPT ਤੋਂ ਥੋੜ੍ਹੀ ਵੱਖਰੀ ਆਊਟਪੁੱਟ ਦੇ ਸਕਦੇ ਹਨ.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) and supporting research(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) and supporting research(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.