ಮುಖ್ಯ ವಿಷಯಕ್ಕೆ ನೇರವಾಗಿ ಹೋಗಿ
OpenAI

ಎರಡು ಸೆಟ್ಟಿಂಗ್‌ಗಳನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಿ ARC-AGI-3 ಮಾನದಂಡದ ಅಂಕಗಳನ್ನು ಮೂರು ಪಟ್ಟು ಹೆಚ್ಚಿಸಿದ ಬಗೆ

ಲೋಡ್ ಆಗುತ್ತಿದೆ…

ARC-AGI-3 ಮಾನದಂಡದ ಒಗಟುಗಳನ್ನು ಪರಿಹರಿಸಲು GPT‑5.6 Sol ಪ್ರಯತ್ನಿಸುವ ವೇಗವರ್ಧಿತ ವಿಡಿಯೊ. ಎಡಭಾಗದಲ್ಲಿ ಅಧಿಕೃತ ಪೂರಕ ವ್ಯವಸ್ಥೆ ಮತ್ತು ಬಲಭಾಗದಲ್ಲಿ ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಂಡು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುವ ನಮ್ಮ ರೆಸ್ಪಾನ್ಸಸ್ API ಪೂರಕ ವ್ಯವಸ್ಥೆ ಇದೆ. ಈ ಆಟದ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಅಂಕಪಟ್ಟಿಯಲ್ಲಿ ಯಾವುದೇ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ ಮೊದಲ ಹಂತವನ್ನು ಮೀರಿಲ್ಲ. ನಮ್ಮ ಪೂರಕ ವ್ಯವಸ್ಥೆಯೊಂದಿಗೆ GPT‑5.6 Sol ಎಲ್ಲ ಆರು ಹಂತಗಳನ್ನೂ ಪರಿಹರಿಸುತ್ತದೆ.

ARC-AGI-3(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮಾನದಂಡದಲ್ಲಿ GPT‑5.6 Sol ಗಳಿಸಿದ ಕಡಿಮೆ ಅಂಕಗಳನ್ನು ಮೊದಲು ನೋಡಿದಾಗ ನಮಗೆ ಗೊಂದಲವಾಯಿತು.

GPT‑5.6 Sol ಗಣಿತದ ಸೈಕಲ್ ಡಬಲ್ ಕವರ್ ಊಹೆ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)ಯಂತಹ ದೀರ್ಘಕಾಲದ ಬಗೆಹರಿಯದ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಿದೆ ಮತ್ತು ಪೊಕ್ಮಾನ್ ಫೈರ್‌ರೆಡ್‌ನಂತಹ ಆಟಗಳನ್ನು ಜಯಿಸಿದೆ. ಆದರೆ 2D ಒಗಟಿನ ಆಟಗಳ ಮಾನದಂಡವಾದ ARC-AGI-3 ನಲ್ಲಿ GPT‑5.6 Sol ಕೇವಲ 7.8% ಅಂಕ ಗಳಿಸಿತು; GPT‑5.5 ಆಟಗಳನ್ನು ಆಡುವುದಕ್ಕೂ ಬಹಳ ಕಷ್ಟಪಟ್ಟು, ಕೇವಲ 0.4% ಗಳಿಸಿತು.

ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳಿಗೆ 2D ಒಗಟಿನ ಆಟಗಳು ಅಸಾಮಾನ್ಯವಾಗಿ ಕಷ್ಟವಾಗಿದ್ದವೇ? ಅಥವಾ ಬೇರೆ ಏನಾದರೂ ನಡೆಯುತ್ತಿತ್ತೇ?

ಮಾನದಂಡಗಳು AI ಮಾಡೆಲ್‌ಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯುವುದು ಅಪರೂಪ. ಅವು API ಸೆಟ್ಟಿಂಗ್‌ಗಳು, ಪೂರಕ ವ್ಯವಸ್ಥೆಯ ವಿನ್ಯಾಸ ಮತ್ತು ಪ್ರಾಂಪ್ಟ್‌ಗಳಿಗೆ ಸಂಬಂಧಿಸಿದ ಅಷ್ಟಾಗಿ ಗೋಚರಿಸದ ಆಯ್ಕೆಗಳನ್ನೂ ಅಳೆಯುತ್ತವೆ. ARC-AGI-3 ವಿಷಯದಲ್ಲಿ, ChatGPT ಮತ್ತು Codex ನಲ್ಲಿ ನಾವು ಬಳಸುವ ಎರಡು API ಸೆಟ್ಟಿಂಗ್‌ಗಳಾದ ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಳ್ಳುವಿಕೆ ಮತ್ತು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಿದಾಗ, ಸಾರ್ವಜನಿಕ ಕಾರ್ಯಸಮೂಹದಲ್ಲಿ ಅಂಕಗಳು ಮೂರು ಪಟ್ಟು ಹೆಚ್ಚಿ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳು 6 ಪಟ್ಟು ಕಡಿಮೆಯಾದವು.

ಅಧಿಕೃತ ಪೂರಕ ವ್ಯವಸ್ಥೆಯೊಂದಿಗೆ GPT‑5.6 Sol, ARC-AGI-3 ಸಾರ್ವಜನಿಕ ಸಮೂಹದಲ್ಲಿ 13.3% ಅಂಕ ಗಳಿಸಿತು. ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಂಡು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆ ಬಳಸಿದಾಗ 38.3% ಗಳಿಸಿತು. ಅಂಕಗಳು ಸಾಪೇಕ್ಷ ಮಾನವ ಕ್ರಿಯಾ ದಕ್ಷತೆಯನ್ನು (RHAE(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ))ಮಾಡೆಲ್‌ನ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮಾನವ ಮೂಲಮಟ್ಟದೊಂದಿಗೆ ಹೋಲಿಸುವ ಮಾನದಂಡವನ್ನುಅಳೆಯುತ್ತವೆ. ಅಧಿಕೃತ ಆಟದ ದಾಖಲೆಗಳ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಆಧಾರದಲ್ಲಿ, ಸರಾಸರಿ ಮಾನವ ಪರೀಕ್ಷಕರು 48% ಅಂಕ ಗಳಿಸಿದ್ದಾರೆಂದು ನಾವು ಅಂದಾಜಿಸಿದ್ದೇವೆ. ಅಂಕಗಳನ್ನು ಹೇಗೆ ನೀಡಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಮಾಡೆಲ್‌ಗಳಿಗೆ ತಿಳಿಸುವುದಿಲ್ಲ ಮತ್ತು ಆಟದ ಉದ್ದಕ್ಕೂ ಅವು ತಮ್ಮ ಅಂಕವನ್ನು ನೋಡಲಾರವುಕ್ರಿಯೆಗಳಿಗೆ ಪ್ರತಿ ಫ್ರೇಮ್‌ನ ಪಠ್ಯ ರೂಪ ಮತ್ತು ಅವು ಇರುವ ಹಂತದ ಮಾಹಿತಿ ಮಾತ್ರ ಮರಳುತ್ತದೆ.

ARC-AGI-3

AI ಏಜೆಂಟ್‌ಗಳು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ಕಲಿಯುತ್ತವೆ ಮತ್ತು ರೀಜನಿಂಗ್ ಮಾಡುತ್ತವೆ ಎಂಬುದನ್ನು ಅಳೆಯಲು ARC-AGI-3 ಮಾನದಂಡವನ್ನು ರೂಪಿಸಲಾಗಿದೆ. ಏಜೆಂಟ್‌ಗಳು ಪರಿಚಯವಿಲ್ಲದ 2D ಆಟಗಳನ್ನು ಅನ್ವೇಷಿಸಿ, ಸ್ಪಷ್ಟ ಸೂಚನೆಗಳಿಲ್ಲದೆ ಅವು ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಗ್ರಹಿಸುತ್ತವೆ. ನೀವು arcprize.org/tasks(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ 25 ಪ್ರಾತ್ಯಕ್ಷಿಕೆ ಆಟಗಳನ್ನು ಆಡಬಹುದು.

ARC-AGI-3 ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಪರಿಕರಗಳು ಅಥವಾ ವಿಶೇಷ ವೈಶಿಷ್ಟ್ಯಗಳಿಲ್ಲದ ಸಾಮಾನ್ಯ ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಬಳಸುತ್ತದೆ. ಸರಳ ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಮಾಡೆಲ್‌ನ ನ್ಯೂನತೆಗಳನ್ನು ಹೆಚ್ಚು ಗೋಚರಿಸುವಂತೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಮಾಡೆಲ್‌ಗಳ ಹೋಲಿಕೆಯನ್ನು ಹೆಚ್ಚು ನ್ಯಾಯಸಮ್ಮತವಾಗಿಸುತ್ತದೆ ಎಂಬುದು ARCನ ತರ್ಕವಾಗಿತ್ತು. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ವಾಣಿಜ್ಯ ಅಭಿವೃದ್ಧಿಪಡಿಸುವವರು ಪ್ರತಿ ಮಾಡೆಲ್‌ನ ವೈಶಿಷ್ಟ್ಯಗಳು ಮತ್ತು ವಿಶಿಷ್ಟ ನಡವಳಿಕೆಗೆ ತಕ್ಕಂತೆ ಪೂರಕ ವ್ಯವಸ್ಥೆಗಳನ್ನು ಸುಧಾರಿಸುತ್ತಾರೆ.

ಆಟಗಳಲ್ಲಿ GPT‑5.6 Sol, ದೃಶ್ಯವನ್ನು ಮಾತ್ರ ಬಳಸುವ ಪೂರಕ ವ್ಯವಸ್ಥೆಯೊಂದಿಗೆ ಪೊಕ್ಮಾನ್ ಫೈರ್‌ರೆಡ್ ಅನ್ನು (GPT_Plays_Pokemon(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಪ್ರಸಾರ ಮಾಡಿದಂತೆ), Codexನ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯಿಂದ ಸ್ಲೇ ದ ಸ್ಪೈರ್ ಅನ್ನು (EpochAI(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಪ್ರಸಾರ ಮಾಡಿದಂತೆ) ಮತ್ತು ಬಾಬಾ ಇಸ್ ಯು ಆಟದ ಮೊದಲ ಹಂತಗಳನ್ನು (ಪ್ಯೋಟರ್ ಮಿಗ್ಡಾಲ್ & ಪ್ಯೋಟರ್ ಗ್ರಾಬೋವ್ಸ್ಕಿ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಹಂಚಿಕೊಂಡಂತೆ) ಜಯಿಸಿದೆ. ARC-AGI-3 ನಲ್ಲಿ ಅಷ್ಟೊಂದು ಭಿನ್ನವಾಗಿದ್ದದ್ದು ಏನು?

Codex ನಲ್ಲಿ ಸ್ಲೇ ದ ಸ್ಪೈರ್ 2ರ ಯಾದೃಚ್ಛಿಕ ದೈನಂದಿನ ಸವಾಲನ್ನು ಪೂರ್ಣಗೊಳಿಸುತ್ತಿರುವ GPT-5.6 Sol.

GPT‑5.6 Solನ ಜ್ಞಾನ ಮಿತಿಯ ನಂತರ ಬಿಡುಗಡೆಯಾದ ಸ್ಲೇ ದ ಸ್ಪೈರ್ 2 ಆಟದಲ್ಲಿ, Codexನಲ್ಲಿರುವ GPT‑5.6 Sol ಯಾದೃಚ್ಛಿಕ ದೈನಂದಿನ ಸವಾಲನ್ನು ಜಯಿಸುವುದನ್ನು ಈಥನ್ ಮೊಲಿಕ್ ತೋರಿಸುತ್ತಾರೆ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ).

GPT‑5.5ನ ನ್ಯೂನತೆಗಳ ಕುರಿತು ARC ನಡೆಸಿದ ವಿಶ್ಲೇಷಣೆ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)ಯಿಂದ ಪ್ರೇರಿತರಾಗಿ, GPT‑5.6 Solನ ಕೆಲವು ಪ್ರಯತ್ನಗಳನ್ನು ನಾವು ಪರಿಶೀಲಿಸಿದೆವು. ARC ಗಮನಿಸಿದಂತೆಯೇ, ಮಾಡೆಲ್ ಅಷ್ಟೇನೂ ಚುರುಕಾಗಿ ಕಾಣಲಿಲ್ಲ ಎಂಬುದನ್ನು ನಾವೂ ಕಂಡೆವು. ಅದು ಪ್ರತಿ ಕ್ರಿಯೆಯ ಕುರಿತು ಬಹಳ ಹೊತ್ತು ಚಿಂತಿಸುತ್ತಿತ್ತು ಮತ್ತು ಮುಂದುವರಿಯಲು ಕಷ್ಟಪಡುತ್ತಿತ್ತು.

ಆದರೆ ಇನ್ನಷ್ಟು ಆಳವಾಗಿ ಪರಿಶೀಲಿಸಿದಾಗ, ಮಾಡೆಲ್‌ನ ಬಹುಪಾಲು ಗೊಂದಲವು ಅದರ ಸ್ವಂತ ಸಹಜ ನ್ಯೂನತೆಯಿಂದಲ್ಲ, ಪೂರಕ ವ್ಯವಸ್ಥೆಯ ಸೆಟ್ಟಿಂಗ್‌ಗಳಿಂದ ಉಂಟಾಗಿತ್ತು ಎಂಬುದು ತಿಳಿಯಿತು.

ಮೊದಲನೆಯದಾಗಿ, ಆಟದ ಪ್ರತಿ ಕ್ರಿಯೆಯ ನಂತರ ಎಲ್ಲ ಖಾಸಗಿ ರೀಜನಿಂಗ್ ಅನ್ನು ಅಳಿಸಲಾಗುತ್ತಿತ್ತು ಎಂಬುದನ್ನು ಗಮನಿಸಿದೆವು. ಹೀಗಾಗಿ GPT‑5.6 Sol ತನ್ನ ಹಿಂದಿನ ಚಿಂತನೆಯನ್ನು ನೆನಪಿಸಿಕೊಳ್ಳಲಾಗದೆ, ಪ್ರತಿ ಕ್ರಿಯೆಯಲ್ಲೂ ಆಟವನ್ನು ಮೊದಲಿನಿಂದ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬೇಕಾಗುತ್ತಿತ್ತು. ಮಾಡೆಲ್‌ಗೆ ಹಿಂದಿನ ನಡೆಗಳ ದಾಖಲೆ ಮತ್ತು ಅವುಗಳ ಸಂಕ್ಷಿಪ್ತ ಟಿಪ್ಪಣಿಗಳು ಕಾಣುತ್ತಿದ್ದವು. ಆದರೆ ಆ ನಡೆಗಳಿಗೆ ಕಾರಣವಾದ ಯೋಜನೆಗಳು, ಒಳನೋಟಗಳು ಅಥವಾ ಆಲೋಚನೆಗಳು ಕಾಣುತ್ತಿರಲಿಲ್ಲ.

ಎರಡನೆಯದಾಗಿ, ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಜಾರುವ ಕಡಿತ ವಿಂಡೋವನ್ನು ಬಳಸುತ್ತಿತ್ತು; ಇತಿಹಾಸ ಬೆಳೆದಂತೆ ಹಳೆಯ ಕ್ರಿಯೆಗಳು ಕಾಣದಂತಾಗುತ್ತಿದ್ದವು. ಹೀಗಾಗಿ GPT‑5.6 Sol ತನ್ನ ಹಿಂದಿನ ಚಿಂತನೆಯನ್ನಷ್ಟೇ ಅಲ್ಲ, ಹಿಂದಿನ ಕ್ರಿಯೆಗಳ ನೆನಪನ್ನೂ ಕಳೆದುಕೊಳ್ಳುತ್ತಿತ್ತು.

ಪೂರಕ ವ್ಯವಸ್ಥೆಯ ಈ ಎರಡು ವೈಶಿಷ್ಟ್ಯಗಳು—ರೀಜನಿಂಗ್ ಅಳಿಸುವಿಕೆ ಮತ್ತು ಜಾರುವ ಕಡಿತ—GPT‑5.6 Sol ಕಾಲಕ್ರಮೇಣ ಕಲಿಯಲು ಏಕೆ ಕಷ್ಟಪಡುತ್ತಿತ್ತು ಎಂಬುದನ್ನು ವಿವರಿಸಲು ನೆರವಾದವು.

ತಾವು ಮಾಡಿದ್ದನ್ನು ನೆನಪಿಟ್ಟುಕೊಂಡಾಗ ಏಜೆಂಟ್‌ಗಳು ಅತ್ಯುತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ

ಉತ್ತರಗಳು ಅಥವಾ ಪರಿಕರ ಕರೆಗಳನ್ನು ಔಟ್‌ಪುಟ್ ಮಾಡುವ ಮೊದಲು ಖಾಸಗಿ ರೀಜನಿಂಗ್ ಸಂದೇಶಗಳ ಮೂಲಕ ಯೋಚಿಸುವಂತೆ ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳಿಗೆ ತರಬೇತಿ ನೀಡಲಾಗಿದೆ. ಈ ಖಾಸಗಿ ಚಿಂತನೆಯ ಸಂದೇಶಗಳನ್ನು ಸಂಭಾಷಣೆಯ ಇತಿಹಾಸದ ಭಾಗವಾಗಿ ಉಳಿಸಿಕೊಳ್ಳಲಾಗುತ್ತದೆ. ಸಂಭಾಷಣೆ ತುಂಬಾ ದೀರ್ಘವಾದರೆ, ನಾವು ಅದನ್ನು ಸಾರಾಂಶಗೊಳಿಸಿ ಮುಂದುವರಿಸುತ್ತೇವೆ.

ದೀರ್ಘಕಾಲ ನಡೆಯುವ ಕಾರ್ಯದಲ್ಲಿ ಮಾಡೆಲ್‌ನ ರೀಜನಿಂಗ್, ಪರಿಕರ ಕರೆಗಳು, ಸಂಭಾಷಣೆ ಇತಿಹಾಸ ಮತ್ತು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆ ಒಟ್ಟಾಗಿ ಹೇಗೆ ಕೆಲಸ ಮಾಡುತ್ತವೆ ಎಂಬುದನ್ನು ತೋರಿಸುವ ರೇಖಾಚಿತ್ರ.

ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಹೀಗೆಯೇ ತರಬೇತಿ ನೀಡಲಾಗಿದೆ ಮತ್ತು ChatGPT ಹಾಗೂ Codexನಲ್ಲೂ ಹೀಗೆಯೇ ನಿಯೋಜಿಸಲಾಗಿದೆ. ನಮ್ಮ ಉತ್ಪಾದನಾ ವ್ಯವಸ್ಥೆಗೆ ಹೆಚ್ಚು ಹೊಂದುವಂತೆ, ನಮ್ಮ ರೆಸ್ಪಾನ್ಸಸ್ API(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಬಳಸಿ ARC-AGI-3 ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಅಳವಡಿಸಿದೆವು. ನಮ್ಮ API ಸಂದರ್ಭವನ್ನು ನಿರ್ವಹಿಸುವುದನ್ನು ಸುಲಭಗೊಳಿಸುತ್ತದೆ. GPT‑5.6ಗೆ ಹಿಂದಿನ ಪ್ರತಿಕ್ರಿಯೆ IDಯನ್ನು ರವಾನಿಸಿದರೆ, ಪರಿಕರ ಕರೆಗಳು ಮತ್ತು ಸಂಭಾಷಣೆಯ ಸರದಿಗಳಾದ್ಯಂತ ರೀಜನಿಂಗ್ ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಉಳಿಯುತ್ತದೆ.

ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಂಡಾಗ ಎರಡು ದೊಡ್ಡ ಬದಲಾವಣೆಗಳನ್ನು ಗಮನಿಸಿದೆವು. ಮೊದಲನೆಯದಾಗಿ, ಪ್ರತಿ ಸರದಿಯಲ್ಲೂ ಆಟವನ್ನು ಮೊದಲಿನಿಂದ ಅರ್ಥೈಸಬೇಕಾಗಿರಲಿಲ್ಲವಾದ್ದರಿಂದ GPT‑5.6 Sol ಪ್ರತಿ ಕ್ರಿಯೆಗೆ ಮುನ್ನ ಯೋಚಿಸಲು ಕಡಿಮೆ ಸಮಯ ತೆಗೆದುಕೊಂಡಿತು. ಎರಡನೆಯದಾಗಿ, ಹಿಂದಿನ ಆಲೋಚನೆಗಳನ್ನು ನೆನಪಿಸಿಕೊಳ್ಳಲು ಸಾಧ್ಯವಾದಾಗ GPT‑5.6 Sol ಕಾಲಕ್ರಮೇಣ ಕಲಿಯುವುದರಲ್ಲಿ ಮತ್ತು ಸುಸಂಬದ್ಧ ತಂತ್ರಗಳನ್ನು ಬಳಸುವುದರಲ್ಲಿ ಹೆಚ್ಚು ಸಮರ್ಥವಾಯಿತು.

ಜಾರುವ ಕಡಿತದ ಬದಲು ರೆಸ್ಪಾನ್ಸಸ್ APIಯ ಮತ್ತೊಂದು ಸೆಟ್ಟಿಂಗ್ ಆದ ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಬಳಸಿದಾಗ ಮುಂದಿನ ಸುಧಾರಣೆ ದೊರೆಯಿತು.

ARC-AGI-3 ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಸಂದರ್ಭದ ಮಿತಿಗಳನ್ನು ಜಾರುವ ಕಡಿತದ ಮೂಲಕ ನಿಭಾಯಿಸುತ್ತದೆ. ಸಂಭಾಷಣೆಯ ಸಂದರ್ಭವು 175,000 ಅಕ್ಷರಗಳನ್ನು ಮೀರಿದಾಗ, ಅತ್ಯಂತ ಹಳೆಯ ಸಂದೇಶಗಳನ್ನು ಅಳಿಸಲಾಗುತ್ತದೆ.

ಜಾರುವ ಕಡಿತಕ್ಕೆ ಎರಡು ನ್ಯೂನತೆಗಳಿವೆ. ಮೊದಲನೆಯದಾಗಿ, ಮಾಡೆಲ್ ಹಿಂದಿನ ವೀಕ್ಷಣೆಗಳು ಮತ್ತು ಕ್ರಿಯೆಗಳನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತದೆ. ಎರಡನೆಯದಾಗಿ, ಕಾರ್ಯದ ಬಹುಭಾಗದಲ್ಲಿ ಅದು ಹೆಚ್ಚು ತುಂಬಿದ ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋದೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ; ಇದು ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸ್ವಲ್ಪ ಕುಗ್ಗಿಸಬಹುದು.

ARC-AGI-3 ನಲ್ಲಿ ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಿದಾಗ, ದೀರ್ಘ ಪ್ರಯತ್ನಗಳಾದ್ಯಂತ ಪ್ರತಿ ಆಟದ ಕುರಿತು ಕಲಿತದ್ದನ್ನು GPT‑5.6 Sol ಉತ್ತಮವಾಗಿ ಉಳಿಸಿಕೊಂಡಿತು ಮತ್ತು ಕಡಿಮೆ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳೊಂದಿಗೆ ಹೆಚ್ಚು ಅಂಕ ಗಳಿಸಿತು.

ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಳ್ಳುವಿಕೆ ಮತ್ತು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯ ಪರಿಣಾಮವನ್ನು ವಿವರಿಸಲು, ಪ್ರತಿ ಪೂರಕ ವ್ಯವಸ್ಥೆಯೊಂದಿಗೆ ARC-AGI-3 ಒಗಟುಗಳ ಸರಣಿಯನ್ನು ಪರಿಹರಿಸುವಾಗ GPT‑5.6 Solನ 175K ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು ತೋರಿಸುವ ಅನಿಮೇಷನ್ ಇಲ್ಲಿದೆ.

ಪ್ರತಿ ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಮಾಡೆಲ್‌ನ ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು ವಿಭಿನ್ನವಾಗಿ ಹೇಗೆ ಬಳಸುತ್ತದೆ ಎಂಬುದನ್ನು ಮಧ್ಯದ ಎರಡು ಲಂಬಸಾಲುಗಳು ಚಿತ್ರಿಸುತ್ತವೆ. ತನ್ನ ಹಿಂದಿನ ಅನುಭವದ ಉತ್ತಮ ನೆನಪಿನಿಂದಾಗಿ GPT‑5.6 Sol ಪ್ರತಿ ಕ್ರಿಯೆಗೆ ಕಡಿಮೆ ಯೋಚಿಸಿ, ಹೆಚ್ಚು ವೇಗವಾಗಿ ಮುಂದುವರಿಯುತ್ತದೆ. ಗಮನಿಸಿ: ನಮ್ಮ ಅಳವಡಿಕೆಯು ಅಕ್ಷರಗಳ ಬದಲು 175,000 ಟೋಕನ್‌ಗಳ ಮಿತಿಯನ್ನು ಬಳಸುತ್ತದೆ. ಆದರೂ ಫಲಿತಾಂಶ ಬಹುತೇಕ ಒಂದೇ ಆಗಿರುತ್ತದೆ, ಏಕೆಂದರೆ ಬಹುಪಾಲು ಪಠ್ಯವು ಕ್ರಿಯಾ ಗ್ರಿಡ್‌ಗಳಾಗಿದ್ದು, ನಮ್ಮ ಟೋಕನೈಸರ್ ಅವನ್ನು 1:1 ಅನುಪಾತದಲ್ಲಿ ಟೋಕನ್‌ಗಳಾಗಿ ವಿಭಜಿಸುತ್ತದೆ.

ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಳ್ಳುವಿಕೆ ಮತ್ತು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆ ಒಟ್ಟಾಗಿ GPT‑5.6 Solಗೆ (Max) ಸುಮಾರು 3 ಪಟ್ಟು ಹೆಚ್ಚು ಅಂಕವನ್ನು 6 ಪಟ್ಟು ಕಡಿಮೆ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳೊಂದಿಗೆ ಗಳಿಸಲು ನೆರವಾಗುತ್ತವೆ.

ತೀರ್ಮಾನ ಮತ್ತು ಶಿಫಾರಸುಗಳು

ಮೌಲ್ಯಮಾಪನಗಳು ಮಾಡೆಲ್‌ಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯುವುದು ಅಪರೂಪ; ಅವು API ಸೆಟ್ಟಿಂಗ್‌ಗಳು, ಪೂರಕ ವ್ಯವಸ್ಥೆಯ ವಿನ್ಯಾಸ ಮತ್ತು ಪ್ರಾಂಪ್ಟ್‌ಗಳಿಗೆ ಸಂಬಂಧಿಸಿದ ಅಷ್ಟಾಗಿ ಗೋಚರಿಸದ ಆಯ್ಕೆಗಳ ಸಮೂಹವನ್ನೂ ಅಳೆಯುತ್ತವೆ ಎಂಬುದನ್ನು ಈ ಪ್ರಯೋಗಗಳು ನೆನಪಿಸುತ್ತವೆ ಎಂದು ಆಶಿಸುತ್ತೇವೆ. ಸಾರ್ವಜನಿಕ ಮಾನದಂಡದಲ್ಲಿ ಕಡಿಮೆ ಅಂಕಗಳು ನಮ್ಮನ್ನು ಅಚ್ಚರಿಗೊಳಿಸಿ, ನಂತರ ಮೌಲ್ಯಮಾಪನ ನಿರ್ವಾಹಕವು ರೀಜನಿಂಗ್ ಸಂದೇಶಗಳನ್ನು ಕೈಬಿಡುವ ಸಾಮಾನ್ಯ ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಬಳಸುತ್ತಿತ್ತು ಎಂದು ತಿಳಿದದ್ದು ಇದೇ ಮೊದಲಲ್ಲ.

ನೀವು ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಗರಿಷ್ಠಗೊಳಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿರುವ API ಅಭಿವೃದ್ಧಿಪಡಿಸುವವರಾಗಿದ್ದರೆ, ನಮ್ಮ ಸ್ವಂತ ಉತ್ಪನ್ನಗಳಲ್ಲಿ ನಾವು ಬಳಸುವ ಈ ಸೆಟ್ಟಿಂಗ್‌ಗಳನ್ನೇ ಬಳಸಲು ಶಿಫಾರಸು ಮಾಡುತ್ತೇವೆ:

  • ನಮ್ಮ ಹಳೆಯ ಚಾಟ್ ಕಂಪ್ಲೀಷನ್ಸ್ API ಬದಲು ರೆಸ್ಪಾನ್ಸಸ್ API ಬಳಸಿ
  • ರೀಜನಿಂಗ್ ಉಳಿಸಿಕೊಳ್ಳಿ
  • ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆ ಬಳಸಿ

ಮಾಡೆಲ್‌ಗಳನ್ನು ಹೋಲಿಸುತ್ತಿದ್ದರೆ, ChatGPT ಮತ್ತು Codexನ ನೈಜ ಬಳಕೆಗೆ ಅತ್ಯುತ್ತಮವಾಗಿ ಹೊಂದುವ ಮೇಲಿನ ಸೆಟ್ಟಿಂಗ್‌ಗಳನ್ನು ಬಳಸುವ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಅವಲಂಬಿಸಲು ಶಿಫಾರಸು ಮಾಡುತ್ತೇವೆ.

AGI ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ ARC ಹಲವು ವರ್ಷಗಳಿಂದ ಮಾಡಿರುವ ಸೃಜನಶೀಲ ಕೆಲಸಕ್ಕಾಗಿ ಮತ್ತು ಇದನ್ನು ಇನ್ನಷ್ಟು ಸೂಕ್ಷ್ಮವಾಗಿ ಪರಿಶೀಲಿಸಲು ನಮಗೆ ಪ್ರೇರಣೆ ನೀಡಿದ ಅದರ ವಿಶ್ಲೇಷಣೆಗಾಗಿ ನಾವು ಕೃತಜ್ಞರಾಗಿದ್ದೇವೆ.

ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್‌ಗಳ ವಿರುದ್ಧ ನಿಮ್ಮ ಸಾಮರ್ಥ್ಯವನ್ನು ಪರೀಕ್ಷಿಸಬೇಕೆಂದರೆ, arcprize.org/tasks(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ಸಾರ್ವಜನಿಕ ಆಟಗಳನ್ನು ನೀವೇ ಆಡಿ ನೋಡಿ.

ಲೇಖಕ

Ilan Bigio, Ted Sanders