ARC-AGI-3 ਬੈਂਚਮਾਰਕ ਦੀਆਂ ਬੁਝਾਰਤਾਂ ਹੱਲ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ GPT‑5.6 Sol ਦਾ ਤੇਜ਼ ਕੀਤਾ ਵੀਡੀਓ ਜਿਸ ਵਿੱਚ ਖੱਬੇ ਪਾਸੇ ਅਧਿਕਾਰਤ ਜਾਂਚ-ਢਾਂਚਾ ਅਤੇ ਸੱਜੇ ਪਾਸੇ ਸਾਡਾ ਰਿਸਪਾਂਸਿਜ਼ API ਜਾਂਚ-ਢਾਂਚਾ ਹੈ, ਜੋ ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਦਾ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਚਾਲੂ ਕਰਦਾ ਹੈ। ਇਸ ਗੇਮ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੀ ਦਰਜਾਬੰਦੀ ਵਿੱਚ ਕੋਈ ਵੀ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲ ਪਹਿਲੇ ਪੱਧਰ ਤੋਂ ਅੱਗੇ ਕੋਈ ਪੱਧਰ ਹੱਲ ਨਹੀਂ ਕਰਦਾ। ਸਾਡੇ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ GPT‑5.6 Sol ਸਾਰੇ ਛੇ ਪੱਧਰ ਹੱਲ ਕਰਦਾ ਹੈ।
ਜਦੋਂ ਅਸੀਂ ਪਹਿਲੀ ਵਾਰ ARC-AGI-3(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਬੈਂਚਮਾਰਕ ਉੱਤੇ GPT‑5.6 Sol ਦੇ ਘੱਟ ਸਕੋਰ ਦੇਖੇ, ਤਾਂ ਅਸੀਂ ਹੈਰਾਨ ਰਹਿ ਗਏ।
GPT‑5.6 Sol ਨੇ ਗਣਿਤ ਦੀਆਂ ਲੰਮੇ ਸਮੇਂ ਤੋਂ ਅਣਸੁਲਝੀਆਂ ਸਮੱਸਿਆਵਾਂ, ਜਿਵੇਂ ਚੱਕਰ ਦੋਹਰੇ ਆਵਰਣ ਦੀ ਪਰਿਕਲਪਨਾ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ), ਹੱਲ ਕੀਤੀਆਂ ਹਨ ਅਤੇ ਪੋਕੇਮੋਨ ਫਾਇਰ ਰੈੱਡ ਵਰਗੀਆਂ ਗੇਮਾਂ ਨੂੰ ਵੀ ਹਰਾਇਆ ਹੈ। ਪਰ 2D ਬੁਝਾਰਤ ਗੇਮਾਂ ਦੇ ਬੈਂਚਮਾਰਕ ARC-AGI-3 ਉੱਤੇ GPT‑5.6 Sol ਨੇ ਸਿਰਫ਼ 7.8% ਸਕੋਰ ਕੀਤਾ, ਜਦਕਿ GPT‑5.5 ਮੁਸ਼ਕਲ ਨਾਲ ਹੀ ਗੇਮਾਂ ਖੇਡ ਸਕਿਆ ਅਤੇ ਉਸ ਦਾ ਸਕੋਰ ਕੇਵਲ 0.4% ਰਿਹਾ।
ਕੀ 2D ਬੁਝਾਰਤ ਗੇਮਾਂ ਸਾਡੇ ਮਾਡਲਾਂ ਲਈ ਅਸਧਾਰਨ ਤੌਰ ਉੱਤੇ ਔਖੀਆਂ ਸਨ? ਜਾਂ ਇਸ ਪਿੱਛੇ ਕੋਈ ਹੋਰ ਕਾਰਨ ਸੀ?
ਬੈਂਚਮਾਰਕ ਸ਼ਾਇਦ ਹੀ ਕਦੇ AI ਮਾਡਲਾਂ ਨੂੰ ਇਕੱਲਿਆਂ ਮਾਪਦੇ ਹਨ। ਉਹ API ਸੈਟਿੰਗਾਂ, ਜਾਂਚ-ਢਾਂਚੇ ਦੀ ਬਣਤਰ ਅਤੇ ਨਿਰਦੇਸ਼ ਦੇਣ ਨਾਲ ਜੁੜੀਆਂ ਘੱਟ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਚੋਣਾਂ ਨੂੰ ਵੀ ਮਾਪਦੇ ਹਨ। ARC-AGI-3 ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਅਸੀਂ ਪਾਇਆ ਕਿ ChatGPT ਅਤੇ Codex ਵਿੱਚ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਦੋ API ਸੈਟਿੰਗਾਂ—ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣਾ ਅਤੇ ਕੰਪੈਕਸ਼ਨ—ਚਾਲੂ ਕਰਨ ਨਾਲ ਜਨਤਕ ਕਾਰਜ ਸੈੱਟ ਉੱਤੇ ਸਕੋਰ ਤਿੰਨ ਗੁਣਾ ਹੋ ਗਏ ਅਤੇ ਆਉਟਪੁੱਟ ਟੋਕਨ ਛੇ ਗੁਣਾ ਘਟ ਗਏ।
ਅਧਿਕਾਰਤ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ GPT‑5.6 Sol ਨੇ ARC-AGI-3 ਦੇ ਜਨਤਕ ਸੈੱਟ ਉੱਤੇ 13.3% ਸਕੋਰ ਕੀਤਾ। ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਨਾਲ ਇਸ ਨੇ 38.3% ਸਕੋਰ ਕੀਤਾ। ਸਕੋਰ ਸਾਪੇਖ ਮਨੁੱਖੀ ਕਾਰਵਾਈ ਕੁਸ਼ਲਤਾ (RHAE(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ))—ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਮਨੁੱਖੀ ਆਧਾਰ-ਰੇਖਾ ਨਾਲ ਤੁਲਨਾ ਕਰਨ ਵਾਲਾ ਮਾਪਦੰਡ—ਮਾਪਦੇ ਹਨ। ਅਧਿਕਾਰਤ ਗੇਮਪਲੇ ਲੌਗਾਂ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਦੇ ਆਧਾਰ ਉੱਤੇ ਸਾਡਾ ਅਨੁਮਾਨ ਹੈ ਕਿ ਔਸਤ ਮਨੁੱਖੀ ਪਰੀਖਿਅਕ ਨੇ 48% ਸਕੋਰ ਕੀਤਾ। ਮਾਡਲਾਂ ਨੂੰ ਇਹ ਨਹੀਂ ਦੱਸਿਆ ਜਾਂਦਾ ਕਿ ਉਨ੍ਹਾਂ ਦਾ ਸਕੋਰ ਕਿਵੇਂ ਲਾਇਆ ਜਾਵੇਗਾ ਅਤੇ ਉਹ ਖੇਡ ਦੌਰਾਨ ਆਪਣਾ ਸਕੋਰ ਨਹੀਂ ਦੇਖ ਸਕਦੇ—ਕਾਰਵਾਈਆਂ ਸਿਰਫ਼ ਹਰ ਫਰੇਮ ਦੀ ਲਿਖਤੀ ਪੇਸ਼ਕਾਰੀ ਅਤੇ ਮੌਜੂਦਾ ਪੱਧਰ ਦੱਸਦੀਆਂ ਹਨ।
ARC-AGI-3 ਇੱਕ ਬੈਂਚਮਾਰਕ ਹੈ, ਜੋ ਇਹ ਮਾਪਣ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ ਕਿ AI ਏਜੰਟ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸਿੱਖਦੇ ਅਤੇ ਰੀਜ਼ਨਿੰਗ ਕਰਦੇ ਹਨ। ਏਜੰਟ ਅਣਜਾਣ 2D ਗੇਮਾਂ ਦੀ ਪੜਚੋਲ ਕਰਦੇ ਹਨ ਅਤੇ ਸਪਸ਼ਟ ਹਦਾਇਤਾਂ ਤੋਂ ਬਿਨਾਂ ਉਨ੍ਹਾਂ ਦੇ ਕੰਮ ਕਰਨ ਦਾ ਤਰੀਕਾ ਸਮਝਦੇ ਹਨ। ਤੁਸੀਂ arcprize.org/tasks(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਉੱਤੇ 25 ਪ੍ਰਦਰਸ਼ਨੀ ਗੇਮਾਂ ਖੇਡ ਸਕਦੇ ਹੋ।
ARC-AGI-3 ਜਾਣਬੁੱਝ ਕੇ ਇੱਕ ਆਮ ਜਾਂਚ-ਢਾਂਚਾ ਵਰਤਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਕੋਈ ਔਜ਼ਾਰ ਜਾਂ ਵਿਸ਼ੇਸ਼ ਸਹੂਲਤਾਂ ਨਹੀਂ ਹਨ। ARC ਦਾ ਤਰਕ ਸੀ ਕਿ ਸਧਾਰਨ ਜਾਂਚ-ਢਾਂਚਾ ਮਾਡਲ ਦੀਆਂ ਕਮੀਆਂ ਨੂੰ ਹੋਰ ਸਪਸ਼ਟ ਕਰਦਾ ਹੈ ਅਤੇ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਵਧੇਰੇ ਨਿਰਪੱਖ ਬਣਾਉਂਦਾ ਹੈ। ਇਸ ਦੇ ਉਲਟ, ਵਪਾਰਕ ਡਿਵੈਲਪਰ ਹਰ ਮਾਡਲ ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਅਤੇ ਖਾਸੀਅਤਾਂ ਮੁਤਾਬਕ ਜਾਂਚ-ਢਾਂਚੇ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਉਂਦੇ ਹਨ।
ਗੇਮਾਂ ਵਿੱਚ GPT‑5.6 Sol ਨੇ ਸਿਰਫ਼ ਦ੍ਰਿਸ਼ਟੀ ਵਾਲੇ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ Pokémon FireRed ਨੂੰ ਹਰਾਇਆ ਹੈ, ਜਿਸ ਦਾ ਸਿੱਧਾ ਪ੍ਰਸਾਰਣ GPT_Plays_Pokemon(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਕੀਤਾ। ਇਸ ਨੇ Codex ਦੀ ਕੰਪਿਊਟਰ ਵਰਤੋਂ ਨਾਲ Slay the Spire ਨੂੰ ਹਰਾਇਆ, ਜਿਸ ਦਾ ਸਿੱਧਾ ਪ੍ਰਸਾਰਣ EpochAI(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਕੀਤਾ ਅਤੇ Baba Is You ਦੇ ਸ਼ੁਰੂਆਤੀ ਪੜਾਅ ਪਾਰ ਕੀਤੇ, ਜਿਵੇਂ Piotr Migdał & Piotr Grabowski(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨੇ ਸਾਂਝਾ ਕੀਤਾ। ARC-AGI-3 ਵਿੱਚ ਅਜਿਹਾ ਕੀ ਵੱਖਰਾ ਸੀ?

ਈਥਨ ਮੋਲਿਕ ਦਿਖਾਉਂਦੇ ਹਨ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਕਿ Codex ਵਿੱਚ GPT‑5.6 Sol, Slay the Spire 2 ਦੀ ਇੱਕ ਬੇਤਰਤੀਬ ਰੋਜ਼ਾਨਾ ਚੁਣੌਤੀ ਨੂੰ ਪਾਰ ਕਰਦਾ ਹੈ। ਇਹ ਗੇਮ GPT‑5.6 Sol ਦੇ ਗਿਆਨ ਦੀ ਅੰਤਿਮ ਮਿਤੀ ਤੋਂ ਬਾਅਦ ਜਾਰੀ ਹੋਈ ਸੀ।
GPT‑5.5 ਦੀਆਂ ਕਮੀਆਂ ਬਾਰੇ ARC ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਤੋਂ ਪ੍ਰੇਰਿਤ ਹੋ ਕੇ ਅਸੀਂ GPT‑5.6 Sol ਦੀਆਂ ਕੁਝ ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ। ARC ਵਾਂਗ ਸਾਨੂੰ ਵੀ ਲੱਗਿਆ ਕਿ ਮਾਡਲ ਬਹੁਤਾ ਸਮਝਦਾਰ ਨਹੀਂ ਸੀ। ਇਹ ਹਰ ਕਾਰਵਾਈ ਬਾਰੇ ਲੰਮਾ ਸਮਾਂ ਸੋਚਦਾ ਰਿਹਾ ਅਤੇ ਅੱਗੇ ਵਧਣ ਲਈ ਜੂਝਦਾ ਰਿਹਾ।
ਪਰ ਡੂੰਘਾਈ ਨਾਲ ਜਾਂਚ ਕਰਨ ਉੱਤੇ ਅਸੀਂ ਪਾਇਆ ਕਿ ਮਾਡਲ ਦੀ ਉਲਝਣ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਖੁਦ ਮਾਡਲ ਦੀ ਅੰਦਰੂਨੀ ਕਮੀ ਨਹੀਂ, ਸਗੋਂ ਜਾਂਚ-ਢਾਂਚੇ ਦੀਆਂ ਸੈਟਿੰਗਾਂ ਕਾਰਨ ਸੀ।
ਪਹਿਲਾਂ ਅਸੀਂ ਦੇਖਿਆ ਕਿ ਗੇਮ ਦੀ ਹਰ ਕਾਰਵਾਈ ਤੋਂ ਬਾਅਦ ਸਾਰੀ ਨਿੱਜੀ ਰੀਜ਼ਨਿੰਗ ਹਟਾ ਦਿੱਤੀ ਜਾਂਦੀ ਸੀ। ਇਸ ਦਾ ਮਤਲਬ ਸੀ ਕਿ ਹਰ ਕਾਰਵਾਈ ਵੇਲੇ GPT‑5.6 Sol ਨੂੰ ਆਪਣੀ ਪਿਛਲੀ ਸੋਚ ਯਾਦ ਰੱਖੇ ਬਿਨਾਂ ਗੇਮ ਨੂੰ ਮੁੜ ਸ਼ੁਰੂ ਤੋਂ ਸਮਝਣ ਲਈ ਕਿਹਾ ਜਾਂਦਾ ਸੀ। ਮਾਡਲ ਪਿਛਲੀਆਂ ਚਾਲਾਂ ਦਾ ਰਿਕਾਰਡ ਅਤੇ ਉਨ੍ਹਾਂ ਨਾਲ ਦਿੱਤੇ ਸੰਖੇਪ ਨੋਟ ਤਾਂ ਦੇਖ ਸਕਦਾ ਸੀ, ਪਰ ਉਹ ਉਨ੍ਹਾਂ ਤੱਕ ਪਹੁੰਚਾਉਣ ਵਾਲੀਆਂ ਯੋਜਨਾਵਾਂ, ਸੂਝਾਂ ਜਾਂ ਵਿਚਾਰ ਨਹੀਂ ਦੇਖ ਸਕਦਾ ਸੀ।
ਦੂਜਾ, ਅਸੀਂ ਦੇਖਿਆ ਕਿ ਜਾਂਚ-ਢਾਂਚਾ ਸਰਕਦੀ ਕਟੌਤੀ ਸੀਮਾ ਵਰਤਦਾ ਸੀ, ਜਿਸ ਕਾਰਨ ਇਤਿਹਾਸ ਵਧਣ ਨਾਲ ਪੁਰਾਣੀਆਂ ਕਾਰਵਾਈਆਂ ਦਿਖਾਈ ਦੇਣੀਆਂ ਬੰਦ ਹੋ ਜਾਂਦੀਆਂ ਸਨ। ਇਸ ਲਈ GPT‑5.6 Sol ਨਾ ਸਿਰਫ਼ ਆਪਣੀ ਪਿਛਲੀ ਸੋਚ ਯਾਦ ਨਹੀਂ ਰੱਖ ਸਕਦਾ ਸੀ, ਸਗੋਂ ਉਹ ਆਪਣੀਆਂ ਪਿਛਲੀਆਂ ਕਾਰਵਾਈਆਂ ਦੀ ਯਾਦ ਵੀ ਗੁਆ ਰਿਹਾ ਸੀ।
ਜਾਂਚ-ਢਾਂਚੇ ਦੀਆਂ ਇਨ੍ਹਾਂ ਦੋ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ—ਰੀਜ਼ਨਿੰਗ ਹਟਾਉਣਾ ਅਤੇ ਸਰਕਦੀ ਕਟੌਤੀ—ਨੇ ਮਿਲ ਕੇ ਇਹ ਸਮਝਾਉਣ ਵਿੱਚ ਮਦਦ ਕੀਤੀ ਕਿ GPT‑5.6 Sol ਸਮੇਂ ਦੇ ਨਾਲ ਸਿੱਖਣ ਵਿੱਚ ਕਿਉਂ ਜੂਝ ਰਿਹਾ ਸੀ।
ਸਾਡੇ ਮਾਡਲਾਂ ਨੂੰ ਜਵਾਬ ਜਾਂ ਔਜ਼ਾਰ ਕਾਲਾਂ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਨਿੱਜੀ ਰੀਜ਼ਨਿੰਗ ਸੁਨੇਹਿਆਂ ਰਾਹੀਂ ਸੋਚਣ ਦੀ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਨਿੱਜੀ ਸੋਚ ਵਾਲੇ ਸੁਨੇਹੇ ਗੱਲਬਾਤ ਦੇ ਇਤਿਹਾਸ ਦੇ ਹਿੱਸੇ ਵਜੋਂ ਕਾਇਮ ਰੱਖੇ ਜਾਂਦੇ ਹਨ। ਜੇ ਗੱਲਬਾਤ ਬਹੁਤ ਲੰਮੀ ਹੋ ਜਾਵੇ, ਤਾਂ ਅਸੀਂ ਉਸ ਦਾ ਸਾਰ ਬਣਾ ਕੇ ਜਾਰੀ ਰੱਖਦੇ ਹਾਂ।
ਸਾਡੇ ਮਾਡਲਾਂ ਨੂੰ ਇਸੇ ਤਰ੍ਹਾਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ChatGPT ਤੇ Codex ਵਿੱਚ ਵੀ ਇਸੇ ਤਰ੍ਹਾਂ ਲਾਗੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਆਪਣੀ ਉਤਪਾਦਨ ਵਿਵਸਥਾ ਨਾਲ ਬਿਹਤਰ ਮੇਲ ਲਈ ਅਸੀਂ ਆਪਣੀ ਰਿਸਪਾਂਸਿਜ਼ API(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ ARC-AGI-3 ਜਾਂਚ-ਢਾਂਚਾ ਲਾਗੂ ਕੀਤਾ। ਸਾਡੀ API ਨਾਲ ਸੰਦਰਭ ਦਾ ਪ੍ਰਬੰਧ ਕਰਨਾ ਆਸਾਨ ਹੈ। GPT‑5.6 ਲਈ ਪਿਛਲੇ ਜਵਾਬ ਦੀ ID ਭੇਜਣ ਨਾਲ ਔਜ਼ਾਰ ਕਾਲਾਂ ਅਤੇ ਵਾਰੀਆਂ ਦੌਰਾਨ ਰੀਜ਼ਨਿੰਗ ਆਪਣੇ ਆਪ ਕਾਇਮ ਰਹਿੰਦੀ ਹੈ।
ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਨਾਲ ਸਾਨੂੰ ਦੋ ਵੱਡੀਆਂ ਤਬਦੀਲੀਆਂ ਦਿਖਾਈ ਦਿੱਤੀਆਂ। ਪਹਿਲਾਂ, GPT‑5.6 Sol ਨੇ ਹਰ ਕਾਰਵਾਈ ਤੋਂ ਪਹਿਲਾਂ ਸੋਚਣ ਵਿੱਚ ਘੱਟ ਸਮਾਂ ਲਾਇਆ ਕਿਉਂਕਿ ਹੁਣ ਉਸ ਨੂੰ ਹਰ ਵਾਰੀ ਗੇਮ ਨੂੰ ਮੁੜ ਸ਼ੁਰੂ ਤੋਂ ਸਮਝਣ ਦੀ ਲੋੜ ਨਹੀਂ ਸੀ। ਦੂਜਾ, ਜਦੋਂ ਇਹ ਆਪਣੇ ਪਿਛਲੇ ਵਿਚਾਰਾਂ ਨੂੰ ਯਾਦ ਰੱਖਣ ਦੇ ਯੋਗ ਸੀ, ਤਾਂ GPT‑5.6 Sol ਸਮੇਂ ਦੇ ਨਾਲ ਸਿੱਖਣ ਅਤੇ ਤਾਲਮੇਲ ਵਾਲੀਆਂ ਰਣਨੀਤੀਆਂ ਅਪਣਾਉਣ ਵਿੱਚ ਕਿਤੇ ਜ਼ਿਆਦਾ ਬਿਹਤਰ ਹੋ ਗਿਆ।
ਅਗਲਾ ਸੁਧਾਰ ਸਰਕਦੀ ਕਟੌਤੀ ਨੂੰ ਕੰਪੈਕਸ਼ਨ(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਨਾਲ ਬਦਲਣ ਤੋਂ ਆਇਆ, ਜੋ ਰਿਸਪਾਂਸਿਜ਼ API ਦੀ ਇੱਕ ਹੋਰ ਸੈਟਿੰਗ ਹੈ।
ARC-AGI-3 ਜਾਂਚ-ਢਾਂਚਾ ਸੰਦਰਭ ਸੀਮਾਵਾਂ ਨਾਲ ਨਜਿੱਠਣ ਲਈ ਸਰਕਦੀ ਕਟੌਤੀ ਵਰਤਦਾ ਹੈ। ਜਦੋਂ ਗੱਲਬਾਤ ਦਾ ਸੰਦਰਭ 175,000 ਅੱਖਰਾਂ ਤੋਂ ਵੱਧ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਸਭ ਤੋਂ ਪੁਰਾਣੇ ਸੁਨੇਹੇ ਹਟਾ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ।
ਸਰਕਦੀ ਕਟੌਤੀ ਦੀਆਂ ਦੋ ਕਮੀਆਂ ਹਨ। ਪਹਿਲੀ, ਮਾਡਲ ਪਹਿਲਾਂ ਦੇ ਨਿਰੀਖਣ ਅਤੇ ਕਾਰਵਾਈਆਂ ਗੁਆ ਦਿੰਦਾ ਹੈ। ਦੂਜੀ, ਇਹ ਕਾਰਜਾਂ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਵਧੇਰੇ ਭਰੀ ਸੰਦਰਭ ਸੀਮਾ ਨਾਲ ਚਲਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਕਾਰਗੁਜ਼ਾਰੀ ਥੋੜ੍ਹੀ ਘਟ ਸਕਦੀ ਹੈ।
ਜਦੋਂ ਅਸੀਂ ARC-AGI-3 ਉੱਤੇ ਕੰਪੈਕਸ਼ਨ ਚਾਲੂ ਕੀਤਾ, ਤਾਂ GPT‑5.6 Sol ਲੰਮੀਆਂ ਕੋਸ਼ਿਸ਼ਾਂ ਦੌਰਾਨ ਹਰ ਗੇਮ ਬਾਰੇ ਸਿੱਖੀ ਜਾਣਕਾਰੀ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਕਾਇਮ ਰੱਖ ਸਕਿਆ ਅਤੇ ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਨਾਲ ਵੱਧ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ।
ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਚਾਲੂ ਕਰਨ ਦਾ ਅਸਰ ਦਿਖਾਉਣ ਲਈ ਇੱਥੇ ਇੱਕ ਐਨੀਮੇਸ਼ਨ ਹੈ, ਜੋ ਹਰੇਕ ਜਾਂਚ-ਢਾਂਚੇ ਨਾਲ ARC-AGI-3 ਬੁਝਾਰਤਾਂ ਦੀ ਲੜੀ ਹੱਲ ਕਰਦੇ ਸਮੇਂ GPT‑5.6 Sol ਦੀ 175K ਸੰਦਰਭ ਸੀਮਾ ਦਿਖਾਉਂਦੀ ਹੈ।
ਵਿਚਕਾਰਲੇ ਦੋ ਕਾਲਮ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ਹਰੇਕ ਜਾਂਚ-ਢਾਂਚਾ ਮਾਡਲ ਦੀ ਸੰਦਰਭ ਸੀਮਾ ਨੂੰ ਵੱਖਰੇ ਢੰਗ ਨਾਲ ਕਿਵੇਂ ਵਰਤਦਾ ਹੈ। ਆਪਣੇ ਅਤੀਤ ਦੀ ਬਿਹਤਰ ਯਾਦ ਨਾਲ GPT‑5.6 Sol ਹਰ ਕਾਰਵਾਈ ਲਈ ਘੱਟ ਸੋਚਦਾ ਹੈ ਅਤੇ ਕਿਤੇ ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧਦਾ ਹੈ। ਨੋਟ: ਸਾਡੀ ਕਾਰਜ-ਵਿਧੀ ਅੱਖਰਾਂ ਦੀ ਬਜਾਏ 175,000 ਟੋਕਨਾਂ ਦੀ ਸੀਮਾ ਵਰਤਦੀ ਹੈ, ਪਰ ਅੰਤ ਵਿੱਚ ਇਹ ਲਗਭਗ ਬਰਾਬਰ ਹੀ ਰਹਿੰਦੀ ਹੈ ਕਿਉਂਕਿ ਲਿਖਤ ਦਾ ਬਹੁਤ ਵੱਡਾ ਹਿੱਸਾ ਕਾਰਵਾਈ ਗਰਿੱਡਾਂ ਦਾ ਹੈ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਸਾਡਾ ਟੋਕਨਾਈਜ਼ਰ 1:1 ਅਨੁਪਾਤ ਨਾਲ ਟੋਕਨਾਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ।
ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖਣ ਅਤੇ ਕੰਪੈਕਸ਼ਨ ਨਾਲ GPT‑5.6 Sol (Max) ਲਗਭਗ ਤਿੰਨ ਗੁਣਾ ਸਕੋਰ ਅਤੇ ਛੇ ਗੁਣਾ ਘੱਟ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹਾਸਲ ਕਰਦਾ ਹੈ।
ਸਾਨੂੰ ਉਮੀਦ ਹੈ ਕਿ ਇਹ ਪ੍ਰਯੋਗ ਯਾਦ ਦਿਵਾਉਣਗੇ ਕਿ ਮੁਲਾਂਕਣ ਸ਼ਾਇਦ ਹੀ ਕਦੇ ਮਾਡਲਾਂ ਨੂੰ ਇਕੱਲਿਆਂ ਮਾਪਦੇ ਹਨ—ਉਹ API ਸੈਟਿੰਗਾਂ, ਜਾਂਚ-ਢਾਂਚੇ ਦੀ ਬਣਤਰ ਅਤੇ ਨਿਰਦੇਸ਼ ਦੇਣ ਬਾਰੇ ਘੱਟ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ ਚੋਣਾਂ ਦੇ ਸਮੂਹ ਨੂੰ ਵੀ ਮਾਪਦੇ ਹਨ। ਇਹ ਪਹਿਲੀ ਵਾਰ ਨਹੀਂ ਹੈ ਜਦੋਂ ਕਿਸੇ ਜਨਤਕ ਬੈਂਚਮਾਰਕ ਉੱਤੇ ਘੱਟ ਸਕੋਰਾਂ ਨੇ ਸਾਨੂੰ ਹੈਰਾਨ ਕੀਤਾ ਅਤੇ ਫਿਰ ਪਤਾ ਲੱਗਿਆ ਕਿ ਮੁਲਾਂਕਣ ਚਲਾਉਣ ਵਾਲਾ ਸਿਸਟਮ ਅਜਿਹਾ ਆਮ ਜਾਂਚ-ਢਾਂਚਾ ਵਰਤ ਰਿਹਾ ਸੀ, ਜੋ ਰੀਜ਼ਨਿੰਗ ਸੁਨੇਹੇ ਹਟਾ ਦਿੰਦਾ ਸੀ।
ਜੇ ਤੁਸੀਂ API ਵਿਕਾਸਕਾਰ ਹੋ ਅਤੇ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਵੱਧ ਤੋਂ ਵੱਧ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਅਸੀਂ ਉਹੀ ਸੈਟਿੰਗਾਂ ਵਰਤਣ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦੇ ਹਾਂ ਜੋ ਅਸੀਂ ਆਪਣੇ ਉਤਪਾਦਾਂ ਵਿੱਚ ਲਾਗੂ ਕਰਦੇ ਹਾਂ:
- ਸਾਡੀ ਪੁਰਾਣੀ ਚੈਟ ਕੰਪਲੀਸ਼ਨਜ਼ API ਦੀ ਬਜਾਏ ਰਿਸਪਾਂਸਿਜ਼ API ਵਰਤੋ
- ਰੀਜ਼ਨਿੰਗ ਕਾਇਮ ਰੱਖੋ
- ਕੰਪੈਕਸ਼ਨ ਵਰਤੋ
ਜੇ ਤੁਸੀਂ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਕਰ ਰਹੇ ਹੋ, ਤਾਂ ਅਸੀਂ ਉਪਰੋਕਤ ਸੈਟਿੰਗਾਂ ਵਰਤਣ ਵਾਲੇ ਮੁਲਾਂਕਣਾਂ ਉੱਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦੇ ਹਾਂ ਕਿਉਂਕਿ ਇਹ ChatGPT ਅਤੇ Codex ਦੀ ਅਸਲ ਵਰਤੋਂ ਨਾਲ ਸਭ ਤੋਂ ਵਧੀਆ ਮੇਲ ਖਾਂਦੀਆਂ ਹਨ।
ਅਸੀਂ AGI ਦੇ ਮੁਲਾਂਕਣ ਉੱਤੇ ਕਈ ਸਾਲਾਂ ਦੇ ਰਚਨਾਤਮਕ ਕੰਮ ਲਈ ARC ਦੇ ਧੰਨਵਾਦੀ ਹਾਂ। ਅਸੀਂ ਉਸ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਵੀ ਧੰਨਵਾਦੀ ਹਾਂ, ਜਿਸ ਨੇ ਸਾਨੂੰ ਇੱਥੇ ਹੋਰ ਡੂੰਘਾਈ ਨਾਲ ਜਾਂਚ ਕਰਨ ਲਈ ਪ੍ਰੇਰਿਆ।
ਜੇ ਤੁਸੀਂ ਅਤਿ-ਆਧੁਨਿਕ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ ਆਪਣੀ ਕਾਬਲੀਅਤ ਪਰਖਣੀ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ arcprize.org/tasks(ਨਵੀਂ ਵਿੰਡੋ ਵਿੱਚ ਖੁੱਲ੍ਹਦਾ ਹੈ) ਉੱਤੇ ਜਨਤਕ ਗੇਮਾਂ ਖੁਦ ਖੇਡ ਕੇ ਦੇਖੋ।


