ਮੁੱਖ ਸਮੱਗਰੀ 'ਤੇ ਜਾਓ
OpenAI

29 ਜੁਲਾਈ 2026

ਖੋਜਪ੍ਰਕਾਸ਼ਨ

ਦੋ ਸੈਟਿੰਗਾਂ ਨੂੰ ਸਮਰੱਥ ਕਰਨ ਨਾਲ ARC-AGI-3 ਬੈਂਚਮਾਰਕ ਸਕੋਰ ਤਿੰਨ ਗੁਣਾ ਕਿਵੇਂ ਹੋ ਗਏ

ਲੋਡ ਹੋ ਰਿਹਾ ਹੈ…

ARC-AGI-3 ਬੈਂਚਮਾਰਕ ਦੀਆਂ ਬੁਝਾਰਤਾਂ ਹੱਲ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ GPT‑5.6 Sol ਦਾ ਤੇਜ਼ ਕੀਤਾ ਵੀਡੀਓ ਜਿਸ ਵਿੱਚ ਖੱਬੇ ਪਾਸੇ ਅਧਿਕਾਰਤ ਜਾਂਚ-ਢਾਂਚਾ ਅਤੇ ਸੱਜੇ ਪਾਸੇ ਸਾਡਾ ਰਿਸਪਾਂਸਿਜ਼ API ਜਾਂਚ-ਢਾਂਚਾ ਹੈ, ਜੋ ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਦਾ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਚਾਲੂ ਕਰਦਾ ਹੈ। ਇਸ ਗੇਮ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੀ ਦਰਜਾਬੰਦੀ ਵਿੱਚ ਕੋਈ ਵੀ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲ ਪਹਿਲੇ ਪੱਧਰ ਤੋਂ ਅੱਗੇ ਕੋਈ ਪੱਧਰ ਹੱਲ ਨਹੀਂ ਕਰਦਾ। ਸਾਡੇ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ GPT‑5.6 Sol ਸਾਰੇ ਛੇ ਪੱਧਰ ਹੱਲ ਕਰਦਾ ਹੈ।

ਜਦੋਂ ਅਸੀਂ ਪਹਿਲੀ ਵਾਰ ARC-AGI-3(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਬੈਂਚਮਾਰਕ ਉੱਤੇ GPT‑5.6 Sol ਦੇ ਘੱਟ ਸਕੋਰ ਦੇਖੇ, ਤਾਂ ਅਸੀਂ ਹੈਰਾਨ ਰਹਿ ਗਏ।

GPT‑5.6 Sol ਨੇ ਗਣਿਤ ਦੀਆਂ ਲੰਮੇ ਸਮੇਂ ਤੋਂ ਅਣਸੁਲਝੀਆਂ ਸਮੱਸਿਆਵਾਂ, ਜਿਵੇਂ ਚੱਕਰ ਦੋਹਰੇ ਆਵਰਣ ਦੀ ਪਰਿਕਲਪਨਾ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), ਹੱਲ ਕੀਤੀਆਂ ਹਨ ਅਤੇ ਪੋਕੇਮੋਨ ਫਾਇਰ ਰੈੱਡ ਵਰਗੀਆਂ ਗੇਮਾਂ ਨੂੰ ਵੀ ਹਰਾਇਆ ਹੈ। ਪਰ 2D ਬੁਝਾਰਤ ਗੇਮਾਂ ਦੇ ਬੈਂਚਮਾਰਕ ARC-AGI-3 ਉੱਤੇ GPT‑5.6 Sol ਨੇ ਸਿਰਫ਼ 7.8% ਸਕੋਰ ਕੀਤਾ, ਜਦਕਿ GPT‑5.5 ਮੁਸ਼ਕਲ ਨਾਲ ਹੀ ਗੇਮਾਂ ਖੇਡ ਸਕਿਆ ਅਤੇ ਉਸ ਦਾ ਸਕੋਰ ਕੇਵਲ 0.4% ਰਿਹਾ।

ਕੀ 2D ਬੁਝਾਰਤ ਗੇਮਾਂ ਸਾਡੇ ਮਾਡਲਾਂ ਲਈ ਅਸਧਾਰਨ ਤੌਰ ਉੱਤੇ ਔਖੀਆਂ ਸਨ? ਜਾਂ ਇਸ ਪਿੱਛੇ ਕੋਈ ਹੋਰ ਕਾਰਨ ਸੀ?

ਬੈਂਚਮਾਰਕ ਸ਼ਾਇਦ ਹੀ ਕਦੇ AI ਮਾਡਲਾਂ ਨੂੰ ਇਕੱਲਿਆਂ ਮਾਪਦੇ ਹਨ। ਉਹ API ਸੈਟਿੰਗਾਂ, ਜਾਂਚ-ਢਾਂਚੇ ਦੀ ਬਣਤਰ ਅਤੇ ਨਿਰਦੇਸ਼ ਦੇਣ ਨਾਲ ਜੁੜੀਆਂ ਘੱਟ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਚੋਣਾਂ ਨੂੰ ਵੀ ਮਾਪਦੇ ਹਨ। ARC-AGI-3 ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਅਸੀਂ ਪਾਇਆ ਕਿ ChatGPT ਅਤੇ Codex ਵਿੱਚ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਦੋ API ਸੈਟਿੰਗਾਂ—ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣਾ ਅਤੇ ਕੰਪੈਕਸ਼ਨ—ਚਾਲੂ ਕਰਨ ਨਾਲ ਜਨਤਕ ਕਾਰਜ ਸੈੱਟ ਉੱਤੇ ਸਕੋਰ ਤਿੰਨ ਗੁਣਾ ਹੋ ਗਏ ਅਤੇ ਆਉਟਪੁੱਟ ਟੋਕਨ ਛੇ ਗੁਣਾ ਘਟ ਗਏ।

ਅਧਿਕਾਰਤ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ GPT‑5.6 Sol ਨੇ ARC-AGI-3 ਦੇ ਜਨਤਕ ਸੈੱਟ ਉੱਤੇ 13.3% ਸਕੋਰ ਕੀਤਾ। ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਨਾਲ ਇਸ ਨੇ 38.3% ਸਕੋਰ ਕੀਤਾ। ਸਕੋਰ ਸਾਪੇਖ ਮਨੁੱਖੀ ਕਾਰਵਾਈ ਕੁਸ਼ਲਤਾ (RHAE(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ))ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਮਨੁੱਖੀ ਆਧਾਰ-ਰੇਖਾ ਨਾਲ ਤੁਲਨਾ ਕਰਨ ਵਾਲਾ ਮਾਪਦੰਡਮਾਪਦੇ ਹਨ। ਅਧਿਕਾਰਤ ਗੇਮਪਲੇ ਲੌਗਾਂ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੇ ਆਧਾਰ ਉੱਤੇ ਸਾਡਾ ਅਨੁਮਾਨ ਹੈ ਕਿ ਔਸਤ ਮਨੁੱਖੀ ਪਰੀਖਿਅਕ ਨੇ 48% ਸਕੋਰ ਕੀਤਾ। ਮਾਡਲਾਂ ਨੂੰ ਇਹ ਨਹੀਂ ਦੱਸਿਆ ਜਾਂਦਾ ਕਿ ਉਨ੍ਹਾਂ ਦਾ ਸਕੋਰ ਕਿਵੇਂ ਲਾਇਆ ਜਾਵੇਗਾ ਅਤੇ ਉਹ ਖੇਡ ਦੌਰਾਨ ਆਪਣਾ ਸਕੋਰ ਨਹੀਂ ਦੇਖ ਸਕਦੇਕਾਰਵਾਈਆਂ ਸਿਰਫ਼ ਹਰ ਫਰੇਮ ਦੀ ਲਿਖਤੀ ਪੇਸ਼ਕਾਰੀ ਅਤੇ ਮੌਜੂਦਾ ਪੱਧਰ ਦੱਸਦੀਆਂ ਹਨ।

ARC-AGI-3

ARC-AGI-3 ਇੱਕ ਬੈਂਚਮਾਰਕ ਹੈ, ਜੋ ਇਹ ਮਾਪਣ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ ਕਿ AI ਏਜੰਟ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸਿੱਖਦੇ ਅਤੇ ਰੀਜ਼ਨਿੰਗ ਕਰਦੇ ਹਨ। ਏਜੰਟ ਅਣਜਾਣ 2D ਗੇਮਾਂ ਦੀ ਪੜਚੋਲ ਕਰਦੇ ਹਨ ਅਤੇ ਸਪਸ਼ਟ ਹਦਾਇਤਾਂ ਤੋਂ ਬਿਨਾਂ ਉਨ੍ਹਾਂ ਦੇ ਕੰਮ ਕਰਨ ਦਾ ਤਰੀਕਾ ਸਮਝਦੇ ਹਨ। ਤੁਸੀਂ arcprize.org/tasks(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਉੱਤੇ 25 ਪ੍ਰਦਰਸ਼ਨੀ ਗੇਮਾਂ ਖੇਡ ਸਕਦੇ ਹੋ।

ARC-AGI-3 ਜਾਣਬੁੱਝ ਕੇ ਇੱਕ ਆਮ ਜਾਂਚ-ਢਾਂਚਾ ਵਰਤਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਕੋਈ ਔਜ਼ਾਰ ਜਾਂ ਵਿਸ਼ੇਸ਼ ਸਹੂਲਤਾਂ ਨਹੀਂ ਹਨ। ARC ਦਾ ਤਰਕ ਸੀ ਕਿ ਸਧਾਰਨ ਜਾਂਚ-ਢਾਂਚਾ ਮਾਡਲ ਦੀਆਂ ਕਮੀਆਂ ਨੂੰ ਹੋਰ ਸਪਸ਼ਟ ਕਰਦਾ ਹੈ ਅਤੇ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਵਧੇਰੇ ਨਿਰਪੱਖ ਬਣਾਉਂਦਾ ਹੈ। ਇਸ ਦੇ ਉਲਟ, ਵਪਾਰਕ ਡਿਵੈਲਪਰ ਹਰ ਮਾਡਲ ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਅਤੇ ਖਾਸੀਅਤਾਂ ਮੁਤਾਬਕ ਜਾਂਚ-ਢਾਂਚੇ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਉਂਦੇ ਹਨ।

ਗੇਮਾਂ ਵਿੱਚ GPT‑5.6 Sol ਨੇ ਸਿਰਫ਼ ਦ੍ਰਿਸ਼ਟੀ ਵਾਲੇ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ Pokémon FireRed ਨੂੰ ਹਰਾਇਆ ਹੈ, ਜਿਸ ਦਾ ਸਿੱਧਾ ਪ੍ਰਸਾਰਣ GPT_Plays_Pokemon(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਕੀਤਾ। ਇਸ ਨੇ Codex ਦੀ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਨਾਲ Slay the Spire ਨੂੰ ਹਰਾਇਆ, ਜਿਸ ਦਾ ਸਿੱਧਾ ਪ੍ਰਸਾਰਣ EpochAI(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਕੀਤਾ ਅਤੇ Baba Is You ਦੇ ਸ਼ੁਰੂਆਤੀ ਪੜਾਅ ਪਾਰ ਕੀਤੇ, ਜਿਵੇਂ Piotr Migdał & Piotr Grabowski(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਸਾਂਝਾ ਕੀਤਾ। ARC-AGI-3 ਵਿੱਚ ਅਜਿਹਾ ਕੀ ਵੱਖਰਾ ਸੀ?

Codex ਵਿੱਚ GPT-5.6 Sol, Slay the Spire 2 ਦੀ ਬੇਤਰਤੀਬ ਰੋਜ਼ਾਨਾ ਚੁਣੌਤੀ ਨੂੰ ਪੂਰਾ ਕਰ ਰਿਹਾ ਹੈ।

ਈਥਨ ਮੋਲਿਕ ਦਿਖਾਉਂਦੇ ਹਨ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਕਿ Codex ਵਿੱਚ GPT‑5.6 Sol, Slay the Spire 2 ਦੀ ਇੱਕ ਬੇਤਰਤੀਬ ਰੋਜ਼ਾਨਾ ਚੁਣੌਤੀ ਨੂੰ ਪਾਰ ਕਰਦਾ ਹੈ। ਇਹ ਗੇਮ GPT‑5.6 Sol ਦੇ ਗਿਆਨ ਦੀ ਅੰਤਿਮ ਮਿਤੀ ਤੋਂ ਬਾਅਦ ਜਾਰੀ ਹੋਈ ਸੀ।

GPT‑5.5 ਦੀਆਂ ਕਮੀਆਂ ਬਾਰੇ ARC ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਤੋਂ ਪ੍ਰੇਰਿਤ ਹੋ ਕੇ ਅਸੀਂ GPT‑5.6 Sol ਦੀਆਂ ਕੁਝ ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ। ARC ਵਾਂਗ ਸਾਨੂੰ ਵੀ ਲੱਗਿਆ ਕਿ ਮਾਡਲ ਬਹੁਤਾ ਸਮਝਦਾਰ ਨਹੀਂ ਸੀ। ਇਹ ਹਰ ਕਾਰਵਾਈ ਬਾਰੇ ਲੰਮਾ ਸਮਾਂ ਸੋਚਦਾ ਰਿਹਾ ਅਤੇ ਅੱਗੇ ਵਧਣ ਲਈ ਜੂਝਦਾ ਰਿਹਾ।

ਪਰ ਡੂੰਘਾਈ ਨਾਲ ਜਾਂਚ ਕਰਨ ਉੱਤੇ ਅਸੀਂ ਪਾਇਆ ਕਿ ਮਾਡਲ ਦੀ ਉਲਝਣ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਖੁਦ ਮਾਡਲ ਦੀ ਅੰਦਰੂਨੀ ਕਮੀ ਨਹੀਂ, ਸਗੋਂ ਜਾਂਚ-ਢਾਂਚੇ ਦੀਆਂ ਸੈਟਿੰਗਾਂ ਕਾਰਨ ਸੀ।

ਪਹਿਲਾਂ ਅਸੀਂ ਦੇਖਿਆ ਕਿ ਗੇਮ ਦੀ ਹਰ ਕਾਰਵਾਈ ਤੋਂ ਬਾਅਦ ਸਾਰੀ ਨਿੱਜੀ ਰੀਜ਼ਨਿੰਗ ਹਟਾ ਦਿੱਤੀ ਜਾਂਦੀ ਸੀ। ਇਸ ਦਾ ਮਤਲਬ ਸੀ ਕਿ ਹਰ ਕਾਰਵਾਈ ਵੇਲੇ GPT‑5.6 Sol ਨੂੰ ਆਪਣੀ ਪਿਛਲੀ ਸੋਚ ਯਾਦ ਰੱਖੇ ਬਿਨਾਂ ਗੇਮ ਨੂੰ ਮੁੜ ਸ਼ੁਰੂ ਤੋਂ ਸਮਝਣ ਲਈ ਕਿਹਾ ਜਾਂਦਾ ਸੀ। ਮਾਡਲ ਪਿਛਲੀਆਂ ਚਾਲਾਂ ਦਾ ਰਿਕਾਰਡ ਅਤੇ ਉਨ੍ਹਾਂ ਨਾਲ ਦਿੱਤੇ ਸੰਖੇਪ ਨੋਟ ਤਾਂ ਦੇਖ ਸਕਦਾ ਸੀ, ਪਰ ਉਹ ਉਨ੍ਹਾਂ ਤੱਕ ਪਹੁੰਚਾਉਣ ਵਾਲੀਆਂ ਯੋਜਨਾਵਾਂ, ਸੂਝਾਂ ਜਾਂ ਵਿਚਾਰ ਨਹੀਂ ਦੇਖ ਸਕਦਾ ਸੀ।

ਦੂਜਾ, ਅਸੀਂ ਦੇਖਿਆ ਕਿ ਜਾਂਚ-ਢਾਂਚਾ ਸਰਕਦੀ ਕਟੌਤੀ ਸੀਮਾ ਵਰਤਦਾ ਸੀ, ਜਿਸ ਕਾਰਨ ਇਤਿਹਾਸ ਵਧਣ ਨਾਲ ਪੁਰਾਣੀਆਂ ਕਾਰਵਾਈਆਂ ਦਿਖਾਈ ਦੇਣੀਆਂ ਬੰਦ ਹੋ ਜਾਂਦੀਆਂ ਸਨ। ਇਸ ਲਈ GPT‑5.6 Sol ਨਾ ਸਿਰਫ਼ ਆਪਣੀ ਪਿਛਲੀ ਸੋਚ ਯਾਦ ਨਹੀਂ ਰੱਖ ਸਕਦਾ ਸੀ, ਸਗੋਂ ਉਹ ਆਪਣੀਆਂ ਪਿਛਲੀਆਂ ਕਾਰਵਾਈਆਂ ਦੀ ਯਾਦ ਵੀ ਗੁਆ ਰਿਹਾ ਸੀ।

ਜਾਂਚ-ਢਾਂਚੇ ਦੀਆਂ ਇਨ੍ਹਾਂ ਦੋ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ—ਰੀਜ਼ਨਿੰਗ ਹਟਾਉਣਾ ਅਤੇ ਸਰਕਦੀ ਕਟੌਤੀ—ਨੇ ਮਿਲ ਕੇ ਇਹ ਸਮਝਾਉਣ ਵਿੱਚ ਮਦਦ ਕੀਤੀ ਕਿ GPT‑5.6 Sol ਸਮੇਂ ਦੇ ਨਾਲ ਸਿੱਖਣ ਵਿੱਚ ਕਿਉਂ ਜੂਝ ਰਿਹਾ ਸੀ।

ਏਜੰਟ ਸਭ ਤੋਂ ਵਧੀਆ ਤਦ ਕਰਦੇ ਹਨ, ਜਦੋਂ ਉਨ੍ਹਾਂ ਨੂੰ ਆਪਣੇ ਕੀਤੇ ਕੰਮ ਯਾਦ ਰਹਿੰਦੇ ਹਨ

ਸਾਡੇ ਮਾਡਲਾਂ ਨੂੰ ਜਵਾਬ ਜਾਂ ਔਜ਼ਾਰ ਕਾਲਾਂ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਨਿੱਜੀ ਰੀਜ਼ਨਿੰਗ ਸੁਨੇਹਿਆਂ ਰਾਹੀਂ ਸੋਚਣ ਦੀ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਨਿੱਜੀ ਸੋਚ ਵਾਲੇ ਸੁਨੇਹੇ ਗੱਲਬਾਤ ਦੇ ਇਤਿਹਾਸ ਦੇ ਹਿੱਸੇ ਵਜੋਂ ਕਾਇਮ ਰੱਖੇ ਜਾਂਦੇ ਹਨ। ਜੇ ਗੱਲਬਾਤ ਬਹੁਤ ਲੰਮੀ ਹੋ ਜਾਵੇ, ਤਾਂ ਅਸੀਂ ਉਸ ਦਾ ਸਾਰ ਬਣਾ ਕੇ ਜਾਰੀ ਰੱਖਦੇ ਹਾਂ।

ਇੱਕ ਚਿੱਤਰ ਜੋ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਲੰਮੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਕਾਰਜ ਵਿੱਚ ਮਾਡਲ ਦੀ ਰੀਜ਼ਨਿੰਗ, ਟੂਲ ਕਾਲਸ, ਗੱਲਬਾਤ ਦਾ ਇਤਿਹਾਸ ਅਤੇ ਸੰਦਰਭ ਕੰਪੈਕਸ਼ਨ ਮਿਲ ਕੇ ਕਿਵੇਂ ਕੰਮ ਕਰਦੇ ਹਨ।

ਸਾਡੇ ਮਾਡਲਾਂ ਨੂੰ ਇਸੇ ਤਰ੍ਹਾਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ChatGPT ਤੇ Codex ਵਿੱਚ ਵੀ ਇਸੇ ਤਰ੍ਹਾਂ ਲਾਗੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਆਪਣੀ ਉਤਪਾਦਨ ਵਿਵਸਥਾ ਨਾਲ ਬਿਹਤਰ ਮੇਲ ਲਈ ਅਸੀਂ ਆਪਣੀ ਰਿਸਪਾਂਸਿਜ਼ API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ ARC-AGI-3 ਜਾਂਚ-ਢਾਂਚਾ ਲਾਗੂ ਕੀਤਾ। ਸਾਡੀ API ਨਾਲ ਸੰਦਰਭ ਦਾ ਪ੍ਰਬੰਧ ਕਰਨਾ ਆਸਾਨ ਹੈ। GPT‑5.6 ਲਈ ਪਿਛਲੇ ਜਵਾਬ ਦੀ ID ਭੇਜਣ ਨਾਲ ਔਜ਼ਾਰ ਕਾਲਾਂ ਅਤੇ ਵਾਰੀਆਂ ਦੌਰਾਨ ਰੀਜ਼ਨਿੰਗ ਆਪਣੇ ਆਪ ਕਾਇਮ ਰਹਿੰਦੀ ਹੈ।

ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਨਾਲ ਸਾਨੂੰ ਦੋ ਵੱਡੀਆਂ ਤਬਦੀਲੀਆਂ ਦਿਖਾਈ ਦਿੱਤੀਆਂ। ਪਹਿਲਾਂ, GPT‑5.6 Sol ਨੇ ਹਰ ਕਾਰਵਾਈ ਤੋਂ ਪਹਿਲਾਂ ਸੋਚਣ ਵਿੱਚ ਘੱਟ ਸਮਾਂ ਲਾਇਆ ਕਿਉਂਕਿ ਹੁਣ ਉਸ ਨੂੰ ਹਰ ਵਾਰੀ ਗੇਮ ਨੂੰ ਮੁੜ ਸ਼ੁਰੂ ਤੋਂ ਸਮਝਣ ਦੀ ਲੋੜ ਨਹੀਂ ਸੀ। ਦੂਜਾ, ਜਦੋਂ ਇਹ ਆਪਣੇ ਪਿਛਲੇ ਵਿਚਾਰਾਂ ਨੂੰ ਯਾਦ ਰੱਖਣ ਦੇ ਯੋਗ ਸੀ, ਤਾਂ GPT‑5.6 Sol ਸਮੇਂ ਦੇ ਨਾਲ ਸਿੱਖਣ ਅਤੇ ਤਾਲਮੇਲ ਵਾਲੀਆਂ ਰਣਨੀਤੀਆਂ ਅਪਣਾਉਣ ਵਿੱਚ ਕਿਤੇ ਜ਼ਿਆਦਾ ਬਿਹਤਰ ਹੋ ਗਿਆ।

ਅਗਲਾ ਸੁਧਾਰ ਸਰਕਦੀ ਕਟੌਤੀ ਨੂੰ ਕੰਪੈਕਸ਼ਨ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ ਬਦਲਣ ਤੋਂ ਆਇਆ, ਜੋ ਰਿਸਪਾਂਸਿਜ਼ API ਦੀ ਇੱਕ ਹੋਰ ਸੈਟਿੰਗ ਹੈ।

ARC-AGI-3 ਜਾਂਚ-ਢਾਂਚਾ ਸੰਦਰਭ ਸੀਮਾਵਾਂ ਨਾਲ ਨਜਿੱਠਣ ਲਈ ਸਰਕਦੀ ਕਟੌਤੀ ਵਰਤਦਾ ਹੈ। ਜਦੋਂ ਗੱਲਬਾਤ ਦਾ ਸੰਦਰਭ 175,000 ਅੱਖਰਾਂ ਤੋਂ ਵੱਧ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਸਭ ਤੋਂ ਪੁਰਾਣੇ ਸੁਨੇਹੇ ਹਟਾ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ।

ਸਰਕਦੀ ਕਟੌਤੀ ਦੀਆਂ ਦੋ ਕਮੀਆਂ ਹਨ। ਪਹਿਲੀ, ਮਾਡਲ ਪਹਿਲਾਂ ਦੇ ਨਿਰੀਖਣ ਅਤੇ ਕਾਰਵਾਈਆਂ ਗੁਆ ਦਿੰਦਾ ਹੈ। ਦੂਜੀ, ਇਹ ਕਾਰਜਾਂ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਵਧੇਰੇ ਭਰੀ ਸੰਦਰਭ ਸੀਮਾ ਨਾਲ ਚਲਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਕਾਰਗੁਜ਼ਾਰੀ ਥੋੜ੍ਹੀ ਘਟ ਸਕਦੀ ਹੈ।

ਜਦੋਂ ਅਸੀਂ ARC-AGI-3 ਉੱਤੇ ਕੰਪੈਕਸ਼ਨ ਚਾਲੂ ਕੀਤਾ, ਤਾਂ GPT‑5.6 Sol ਲੰਮੀਆਂ ਕੋਸ਼ਿਸ਼ਾਂ ਦੌਰਾਨ ਹਰ ਗੇਮ ਬਾਰੇ ਸਿੱਖੀ ਜਾਣਕਾਰੀ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਕਾਇਮ ਰੱਖ ਸਕਿਆ ਅਤੇ ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਨਾਲ ਵੱਧ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ।

ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਚਾਲੂ ਕਰਨ ਦਾ ਅਸਰ ਦਿਖਾਉਣ ਲਈ ਇੱਥੇ ਇੱਕ ਐਨੀਮੇਸ਼ਨ ਹੈ, ਜੋ ਹਰੇਕ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ ARC-AGI-3 ਬੁਝਾਰਤਾਂ ਦੀ ਲੜੀ ਹੱਲ ਕਰਦੇ ਸਮੇਂ GPT‑5.6 Sol ਦੀ 175K ਸੰਦਰਭ ਸੀਮਾ ਦਿਖਾਉਂਦੀ ਹੈ।

ਵਿਚਕਾਰਲੇ ਦੋ ਕਾਲਮ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ਹਰੇਕ ਜਾਂਚ-ਢਾਂਚਾ ਮਾਡਲ ਦੀ ਸੰਦਰਭ ਸੀਮਾ ਨੂੰ ਵੱਖਰੇ ਢੰਗ ਨਾਲ ਕਿਵੇਂ ਵਰਤਦਾ ਹੈ। ਆਪਣੇ ਅਤੀਤ ਦੀ ਬਿਹਤਰ ਯਾਦ ਨਾਲ GPT‑5.6 Sol ਹਰ ਕਾਰਵਾਈ ਲਈ ਘੱਟ ਸੋਚਦਾ ਹੈ ਅਤੇ ਕਿਤੇ ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧਦਾ ਹੈ। ਨੋਟ: ਸਾਡੀ ਕਾਰਜ-ਵਿਧੀ ਅੱਖਰਾਂ ਦੀ ਬਜਾਏ 175,000 ਟੋਕਨਾਂ ਦੀ ਸੀਮਾ ਵਰਤਦੀ ਹੈ, ਪਰ ਅੰਤ ਵਿੱਚ ਇਹ ਲਗਭਗ ਬਰਾਬਰ ਹੀ ਰਹਿੰਦੀ ਹੈ ਕਿਉਂਕਿ ਲਿਖਤ ਦਾ ਬਹੁਤ ਵੱਡਾ ਹਿੱਸਾ ਕਾਰਵਾਈ ਗਰਿੱਡਾਂ ਦਾ ਹੈ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਸਾਡਾ ਟੋਕਨਾਈਜ਼ਰ 1:1 ਅਨੁਪਾਤ ਨਾਲ ਟੋਕਨਾਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ।

ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਨਾਲ GPT‑5.6 Sol (Max) ਲਗਭਗ ਤਿੰਨ ਗੁਣਾ ਸਕੋਰ ਅਤੇ ਛੇ ਗੁਣਾ ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹਾਸਲ ਕਰਦਾ ਹੈ।

ਸਿੱਟਾ ਅਤੇ ਸਿਫ਼ਾਰਸ਼ਾਂ

ਸਾਨੂੰ ਉਮੀਦ ਹੈ ਕਿ ਇਹ ਪ੍ਰਯੋਗ ਯਾਦ ਦਿਵਾਉਣਗੇ ਕਿ ਮੁਲਾਂਕਣ ਸ਼ਾਇਦ ਹੀ ਕਦੇ ਮਾਡਲਾਂ ਨੂੰ ਇਕੱਲਿਆਂ ਮਾਪਦੇ ਹਨ—ਉਹ API ਸੈਟਿੰਗਾਂ, ਜਾਂਚ-ਢਾਂਚੇ ਦੀ ਬਣਤਰ ਅਤੇ ਨਿਰਦੇਸ਼ ਦੇਣ ਬਾਰੇ ਘੱਟ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਚੋਣਾਂ ਦੇ ਸਮੂਹ ਨੂੰ ਵੀ ਮਾਪਦੇ ਹਨ। ਇਹ ਪਹਿਲੀ ਵਾਰ ਨਹੀਂ ਹੈ ਜਦੋਂ ਕਿਸੇ ਜਨਤਕ ਬੈਂਚਮਾਰਕ ਉੱਤੇ ਘੱਟ ਸਕੋਰਾਂ ਨੇ ਸਾਨੂੰ ਹੈਰਾਨ ਕੀਤਾ ਅਤੇ ਫਿਰ ਪਤਾ ਲੱਗਿਆ ਕਿ ਮੁਲਾਂਕਣ ਚਲਾਉਣ ਵਾਲਾ ਸਿਸਟਮ ਅਜਿਹਾ ਆਮ ਜਾਂਚ-ਢਾਂਚਾ ਵਰਤ ਰਿਹਾ ਸੀ, ਜੋ ਰੀਜ਼ਨਿੰਗ ਸੁਨੇਹੇ ਹਟਾ ਦਿੰਦਾ ਸੀ।

ਜੇ ਤੁਸੀਂ API ਵਿਕਾਸਕਾਰ ਹੋ ਅਤੇ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਵੱਧ ਤੋਂ ਵੱਧ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਅਸੀਂ ਉਹੀ ਸੈਟਿੰਗਾਂ ਵਰਤਣ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦੇ ਹਾਂ ਜੋ ਅਸੀਂ ਆਪਣੇ ਉਤਪਾਦਾਂ ਵਿੱਚ ਲਾਗੂ ਕਰਦੇ ਹਾਂ:

  • ਸਾਡੀ ਪੁਰਾਣੀ ਚੈਟ ਕੰਪਲੀਸ਼ਨਜ਼ API ਦੀ ਬਜਾਏ ਰਿਸਪਾਂਸਿਜ਼ API ਵਰਤੋ
  • ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖੋ
  • ਕੰਪੈਕਸ਼ਨ ਵਰਤੋ

ਜੇ ਤੁਸੀਂ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਕਰ ਰਹੇ ਹੋ, ਤਾਂ ਅਸੀਂ ਉਪਰੋਕਤ ਸੈਟਿੰਗਾਂ ਵਰਤਣ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਉੱਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦੇ ਹਾਂ ਕਿਉਂਕਿ ਇਹ ChatGPT ਅਤੇ Codex ਦੀ ਅਸਲ ਵਰਤੋਂ ਨਾਲ ਸਭ ਤੋਂ ਵਧੀਆ ਮੇਲ ਖਾਂਦੀਆਂ ਹਨ।

ਅਸੀਂ AGI ਦੇ ਮੁਲਾਂਕਣ ਉੱਤੇ ਕਈ ਸਾਲਾਂ ਦੇ ਰਚਨਾਤਮਕ ਕੰਮ ਲਈ ARC ਦੇ ਧੰਨਵਾਦੀ ਹਾਂ। ਅਸੀਂ ਉਸ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਵੀ ਧੰਨਵਾਦੀ ਹਾਂ, ਜਿਸ ਨੇ ਸਾਨੂੰ ਇੱਥੇ ਹੋਰ ਡੂੰਘਾਈ ਨਾਲ ਜਾਂਚ ਕਰਨ ਲਈ ਪ੍ਰੇਰਿਆ।

ਜੇ ਤੁਸੀਂ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ ਆਪਣੀ ਕਾਬਲੀਅਤ ਪਰਖਣੀ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ arcprize.org/tasks(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਉੱਤੇ ਜਨਤਕ ਗੇਮਾਂ ਖੁਦ ਖੇਡ ਕੇ ਦੇਖੋ।

ਲੇਖਕ

Ilan Bigio, Ted Sanders