মূল কনটেন্টে যান
OpenAI

২৯ জুলাই, ২০২৬

গবেষণাপাবলিকেশন

দুটি সেটিং চালু করে ARC-AGI-3 বেঞ্চমার্কে আমাদের স্কোর তিন গুণ বাড়ল কীভাবে

লোডিং…

ARC-AGI-3 বেঞ্চমার্কে পাজল সমাধানের চেষ্টা করছে GPT‑5.6 Sol—এমন একটি দ্রুতগতির ভিডিও, যেখানে অফিশিয়াল কার্যপরিধি (বামে) এবং আমাদের Responses API কার্যপরিধি (ডানে) দেখানো হয়েছে; এটি reasoning ধরে রাখে এবং সংকোচন চালু করে. এই গেমের(একটি নতুন উইন্ডোতে খোলে) লিডারবোর্ডে, কোনো অত্যাধুনিক মডেল প্রথমটির পর আর কোনো লেভেল সমাধান করে না. আমাদের কার্যপরিধি দিয়ে, GPT‑5.6 Sol ছয়টিই সমাধান করে.

ARC-AGI-3(একটি নতুন উইন্ডোতে খোলে) বেঞ্চমার্কে GPT‑5.6 Sol-এর কম স্কোর প্রথম দেখার পর আমরা বিভ্রান্ত হয়েছিলাম.

GPT‑5.6 Sol গণিতে সাইকেল ডাবল কভার কনজেকচার(একটি নতুন উইন্ডোতে খোলে)-এর মতো দীর্ঘদিনের উন্মুক্ত সমস্যা সমাধান করেছে এবং Pokémon FireRed-এর মতো গেমেও জিতেছে. কিন্তু 2D পাজল গেমের বেঞ্চমার্ক ARC-AGI-3-এ GPT‑5.6 Sol মাত্র 7.8% স্কোর করেছে, আর GPT‑5.5 প্রায় গেমগুলো খেলতেই পারেনি, স্কোর ছিল নগণ্য 0.4%.

2D পাজল গেম কি আমাদের মডেলগুলোর জন্য অস্বাভাবিকভাবে কঠিন ছিল? নাকি অন্য কিছু ঘটছিল?

বেঞ্চমার্ক খুব কমই AI মডেলকে আলাদাভাবে মাপে. এগুলো API সেটিংস, কার্যপরিধি নকশা এবং prompting নিয়ে কম দৃশ্যমান সিদ্ধান্তগুলোকেও মাপে. ARC-AGI-3-এর ক্ষেত্রে আমরা দেখেছি, ChatGPT ও Codex-এ ব্যবহৃত দুটি API সেটিং—retained reasoning ও সংকোচন—চালু করলে পাবলিক টাস্ক সেটে স্কোর তিন গুণ হয় এবং আউটপুট টোকেন 6 গুণ কমে যায়.

অফিশিয়াল কার্যপরিধি দিয়ে, GPT‑5.6 Sol ARC-AGI-3 পাবলিক সেটে 13.3% স্কোর করেছে. ধরে রাখা reasoning ও সংকোচন দিয়ে, এটি 38.3% স্কোর করেছে. স্কোর রিলেটিভ হিউম্যান অ্যাকশন এফিশিয়েন্সি (RHAE(একটি নতুন উইন্ডোতে খোলে))মানুষের বেসলাইনের সঙ্গে মডেলের পারফরম্যান্স তুলনা করার একটি মেট্রিক. অফিশিয়াল গেমপ্লে লগ(একটি নতুন উইন্ডোতে খোলে) ভিত্তিতে, আমাদের অনুমান গড় মানব টেস্টার 48% স্কোর করেছেন. মডেলগুলোকে জানানো হয় না কীভাবে তাদের স্কোর করা হবে, এবং পুরো সময় তারা নিজেদের স্কোর দেখতে পায় নাঅ্যাকশনগুলো শুধু প্রতিটি ফ্রেমের একটি টেক্সট উপস্থাপনা এবং তারা কোন লেভেলে আছে তা ফেরত দেয়.

ARC-AGI-3

ARC-AGI-3 হলো AI এজেন্ট কত ভালোভাবে শেখে ও reasoning করে তা মাপার জন্য তৈরি একটি বেঞ্চমার্ক. এজেন্টরা অপরিচিত 2D গেম অনুসন্ধান করে এবং স্পষ্ট নির্দেশনা ছাড়াই সেগুলো কীভাবে কাজ করে তা অনুমান করে. আপনি arcprize.org/tasks(একটি নতুন উইন্ডোতে খোলে)-এ 25টি ডেমো গেম খেলতে পারেন.

ARC-AGI-3 ইচ্ছাকৃতভাবে একটি সাধারণ কার্যপরিধি ব্যবহার করে, যাতে কোনো টুল বা বিশেষ ফিচার নেই. ARC-এর যুক্তি ছিল, সহজ কার্যপরিধি মডেলের দুর্বলতাগুলোকে আরও স্পষ্ট করে এবং মডেল তুলনাকে আরও ন্যায্য করে. অন্যদিকে, বাণিজ্যিক ডেভেলপাররা প্রতিটি মডেলের ফিচার ও বৈশিষ্ট্যের জন্য কার্যপরিধিগুলো অপটিমাইজ করেন.

গেমিংয়ে, GPT‑5.6 Sol শুধু ভিশন-নির্ভর কার্যপরিধি দিয়ে Pokémon FireRed জিতেছে (GPT_Plays_Pokemon(একটি নতুন উইন্ডোতে খোলে) যেমন স্ট্রিম করেছে), Codex কম্পিউটার ব্যবহার দিয়ে Slay the Spire জিতেছে (EpochAI(একটি নতুন উইন্ডোতে খোলে) যেমন স্ট্রিম করেছে), এবং Baba Is You-এর প্রথম ধাপগুলো পার করেছে (Piotr Migdał & Piotr Grabowski(একটি নতুন উইন্ডোতে খোলে) যেমন শেয়ার করেছেন). ARC-AGI-3-এ এত আলাদা কী ছিল?

Codex-এ GPT-5.6 Sol, Slay the Spire 2-এ একটি র‍্যান্ডমাইজড দৈনিক চ্যালেঞ্জ সম্পন্ন করছে.

Ethan Mollick দেখিয়েছেন(একটি নতুন উইন্ডোতে খোলে) Codex-এ GPT‑5.6 Sol Slay the Spire 2-এ একটি র‍্যান্ডমাইজড দৈনিক চ্যালেঞ্জ জিতছে; গেমটি GPT‑5.6 Sol-এর knowledge cutoff-এর পরে প্রকাশিত হয়েছে.

GPT‑5.5‑এর দুর্বলতা নিয়ে ARC-এর বিশ্লেষণ(একটি নতুন উইন্ডোতে খোলে) থেকে অনুপ্রাণিত হয়ে, আমরা GPT‑5.6 Sol-এর কিছু প্রচেষ্টা পরীক্ষা করেছি. ARC-এর মতো আমরাও দেখেছি, মডেলটিকে খুব বুদ্ধিমান মনে হচ্ছিল না. প্রতিটি অ্যাকশনে এটি অনেক সময় নিচ্ছিল এবং এগোতে হিমশিম খাচ্ছিল.

কিন্তু আরও গভীরে তাকিয়ে আমরা দেখলাম, মডেলের বিভ্রান্তির বড় অংশ মডেলের নিজের অন্তর্নিহিত সীমাবদ্ধতা নয়, বরং কার্যপরিধির সেটিংসের কারণে.

প্রথমে আমরা লক্ষ্য করলাম, প্রতিটি গেম অ্যাকশনের পর সব private reasoning ফেলে দেওয়া হচ্ছিল. এর মানে, প্রতিটি অ্যাকশনের সঙ্গে GPT‑5.6 Sol-কে গেমটি নতুন করে বুঝতে বলা হচ্ছিল, কারণ সে আগের চিন্তা মনে রাখতে পারছিল না. মডেলটি আগের চালের রেকর্ড এবং সঙ্গে থাকা সংক্ষিপ্ত নোট দেখতে পারত, কিন্তু সেই চালগুলোর পেছনের পরিকল্পনা, উপলব্ধি বা চিন্তা দেখতে পারত না.

দ্বিতীয়ত, আমরা দেখেছি কার্যপরিধিটি rolling truncation window ব্যবহার করছিল, ফলে ইতিহাস বড় হওয়ার সঙ্গে পুরোনো অ্যাকশনগুলো অদৃশ্য হয়ে যাচ্ছিল. তাই GPT‑5.6 Sol শুধু আগের চিন্তাই মনে রাখতে পারছিল না তা নয়, আগের অ্যাকশনের স্মৃতিও হারাচ্ছিল.

একসঙ্গে, কার্যপরিধির এই দুই বৈশিষ্ট্য—reasoning ফেলে দেওয়া এবং rolling truncation—ব্যাখ্যা করতে সাহায্য করেছে কেন GPT‑5.6 Sol সময়ের সঙ্গে শেখায় লড়াই করছিল.

এজেন্টরা যা করেছে তা মনে রাখলে সবচেয়ে ভালো করে

আমাদের মডেলগুলোকে উত্তর বা টুল কল আউটপুট করার আগে private reasoning message দিয়ে চিন্তা করতে প্রশিক্ষণ দেওয়া হয়. এই private thinking message-গুলো কথোপকথনের ইতিহাসের অংশ হিসেবে রাখা হয়. কোনো কথোপকথন খুব দীর্ঘ হলে, আমরা সেটির সারাংশ করি এবং চালিয়ে যাই.

দীর্ঘমেয়াদি একটি টাস্কে মডেলের reasoning, টুল কল, কথোপকথনের ইতিহাস এবং কনটেক্সট সংকোচন কীভাবে একসঙ্গে কাজ করে তা দেখানো ডায়াগ্রাম.

এভাবেই আমাদের মডেলগুলোকে প্রশিক্ষণ দেওয়া হয়, এবং ChatGPT ও Codex-এ এভাবেই সেগুলো ডিপ্লয় করা হয়. আমাদের production setup-এর সঙ্গে আরও ভালোভাবে মেলাতে, আমরা আমাদের Responses API(একটি নতুন উইন্ডোতে খোলে) দিয়ে ARC-AGI-3 কার্যপরিধি বাস্তবায়ন করেছি. আমাদের API কনটেক্সট পরিচালনা সহজ করে: GPT‑5.6‑এর ক্ষেত্রে, আগের response ID পাস করলে টুল কল ও turn জুড়ে reasoning স্বয়ংক্রিয়ভাবে ধরে রাখা হয়.

Reasoning ধরে রাখার পর, আমরা দুটি বড় পরিবর্তন লক্ষ্য করেছি. প্রথমত, প্রতিটি অ্যাকশনের আগে GPT‑5.6 Sol কম সময় ভেবেছে, কারণ প্রতিটি turn-এ আর তাকে একেবারে শুরু থেকে গেমটি বুঝতে হচ্ছিল না. দ্বিতীয়ত, আগের চিন্তাগুলো মনে রাখতে পারলে, GPT‑5.6 Sol সময়ের সঙ্গে শেখা এবং সুসংগত কৌশল প্রয়োগে অনেক ভালো করেছে.

পরের উন্নতিটি এসেছে rolling truncation-এর বদলে সংকোচন(একটি নতুন উইন্ডোতে খোলে) ব্যবহারে, যা Responses API-এর আরেকটি সেটিং.

ARC-AGI-3 কার্যপরিধি rolling truncation দিয়ে কনটেক্সট সীমা সামলায়. কথোপকথনের কনটেক্সট 175,000 অক্ষর ছাড়ালে, সবচেয়ে পুরোনো মেসেজগুলো ফেলে দেওয়া হয়.

Rolling truncation-এর দুটি অসুবিধা আছে. প্রথমত, মডেলটি আগের পর্যবেক্ষণ ও অ্যাকশন হারায়. দ্বিতীয়ত, টাস্কের বড় অংশে এটি বেশি ভরা কনটেক্সট উইন্ডো নিয়ে কাজ করে, যা পারফরম্যান্স সামান্য কমাতে পারে.

ARC-AGI-3-এ সংকোচন চালু করলে, GPT‑5.6 Sol দীর্ঘ রান জুড়ে প্রতিটি গেম সম্পর্কে যা শিখেছে তা আরও ভালোভাবে ধরে রাখতে পেরেছে, এবং কম আউটপুট টোকেনে বেশি স্কোর পেয়েছে.

Reasoning ধরে রাখা ও সংকোচন চালুর প্রভাব দেখাতে, এখানে একটি অ্যানিমেশন আছে যেখানে প্রতিটি কার্যপরিধি দিয়ে ARC-AGI-3 পাজলের একটি সিরিজ সমাধানের সময় GPT‑5.6 Sol-এর 175K কনটেক্সট উইন্ডো দেখানো হয়েছে.

মাঝের দুটি কলামে দেখানো হয়েছে, প্রতিটি কার্যপরিধি কীভাবে মডেলের কনটেক্সট উইন্ডো আলাদাভাবে ব্যবহার করে. নিজের অতীত আরও ভালোভাবে মনে রাখতে পারায়, GPT‑5.6 Sol প্রতিটি অ্যাকশনে কম ভাবে এবং অনেক দ্রুত এগোয়. নোট: আমাদের বাস্তবায়নে অক্ষরের বদলে 175,000 টোকেনের সীমা ব্যবহার করা হয়েছে, তবে শেষ পর্যন্ত এটি বেশ কাছাকাছি, কারণ টেক্সটের বিশাল অংশ অ্যাকশন গ্রিড, যা আমাদের tokenizer 1:1 অনুপাতে tokenize করে.

একসঙ্গে, reasoning ধরে রাখা ও সংকোচন GPT‑5.6 Sol (Max)-কে প্রায় 3 গুণ স্কোর অর্জন করতে দেয়, তাও 6 গুণ কম আউটপুট টোকেন দিয়ে.

উপসংহার ও সুপারিশ

আমরা আশা করি এই পরীক্ষাগুলো মনে করিয়ে দেবে যে eval খুব কমই মডেলকে আলাদাভাবে মাপে—এগুলো API সেটিংস, কার্যপরিধি নকশা এবং prompting নিয়ে কম দৃশ্যমান একগুচ্ছ সিদ্ধান্তও মাপে. এটাই প্রথম নয় যে কোনো পাবলিক বেঞ্চমার্কে কম স্কোর দেখে আমরা অবাক হয়েছি, তারপর দেখেছি eval runner এমন একটি সাধারণ কার্যপরিধি ব্যবহার করছিল যা reasoning message বাদ দিচ্ছিল.

আপনি যদি একজন API ডেভেলপার হন এবং পারফরম্যান্স সর্বোচ্চ করতে চান, আমরা আমাদের নিজস্ব পণ্যে ব্যবহৃত একই সেটিংস ব্যবহার করার পরামর্শ দিই:

  • আমাদের legacy চ্যাট কমপ্লিশন্স API নয়, Responses API ব্যবহার করুন
  • Reasoning ধরে রাখুন
  • সংকোচন ব্যবহার করুন

আর আপনি যদি মডেল তুলনা করেন, আমরা এমন eval-এর ওপর নির্ভর করার পরামর্শ দিই যা ওপরের সেটিংস ব্যবহার করে; এগুলো ChatGPT ও Codex-এ বাস্তব ব্যবহারের সঙ্গে সবচেয়ে ভালো মেলে.

AGI evaluation নিয়ে ARC-এর বহু বছরের সৃজনশীল কাজের জন্য, এবং এখানে আমাদের আরও গভীরভাবে দেখতে অনুপ্রাণিত করা তাদের বিশ্লেষণের জন্য আমরা কৃতজ্ঞ.

আপনি যদি অত্যাধুনিক মডেলগুলোর বিরুদ্ধে নিজের দক্ষতা যাচাই করতে চান, arcprize.org/tasks(একটি নতুন উইন্ডোতে খোলে)-এ পাবলিক গেমগুলো নিজে চেষ্টা করুন.

লেখক

Ilan Bigio, Ted Sanders