মূল কনটেন্টে যান
OpenAI

১৩ আগস্ট, ২০২৬

প্রয়োগভিত্তিক AI

নির্মাতাদের GPT‑5.6 গাইড

প্রোডাকশনে থাকা স্টার্টআপগুলোর প্রযুক্তিগত শিক্ষা

লোডিং…

GPT‑5.6 দাম-কার্যক্ষমতার নতুন মানদণ্ড স্থাপন করেছে

GPT‑5.6 মডেল পরিবার অত্যাধুনিক পর্যায়ের এজেন্ট কর্মক্ষমতাকে নাটকীয়ভাবে আরও সাশ্রয়ী করে, একই সঙ্গে কী সম্ভব তার সীমাও এগিয়ে নিয়ে যায়.

এই গাইডে আমরা দেখাচ্ছি, স্টার্টআপগুলো কীভাবে আরও বুদ্ধিদীপ্ত মডেল নির্বাচন এবং নতুন API নিয়ন্ত্রণ ব্যবহার করছে, যা যুক্তির ধারাবাহিকতা, মাল্টি-এজেন্ট অর্কেস্ট্রেশন ও প্রোগ্রাম্যাটিক টুল কলিংয়ে সহায়তা করে—ফলে খরচের সামান্য অংশে দ্রুততর, আরও সক্ষম এজেন্ট তৈরি করা যায়.

শুরু থেকেই আরও ভালো অভিজ্ঞতা

GPT‑5 থেকে প্রতিটি মডেল প্রজন্ম কম টোকেনে দীর্ঘমেয়াদি কাজ সামলানোর চেষ্টা করেছে. GPT‑5.6 সেই ধারাই এগিয়ে নিচ্ছে: শক্তিশালী এজেন্ট কর্মক্ষমতা, কম খরচ, এবং অন্তর্নিহিত কার্যপরিধিতে ন্যূনতম পরিবর্তন.

শীর্ষ-স্তরের খরচ দক্ষতার উন্নতির সঙ্গে কম রিজনিং এফোর্টেও বাড়তি নির্ভুলতা যুক্ত হয়েছে. উদাহরণ হিসেবে, Agents’ Last Exam-এ কার্যপরিধি অপরিবর্তিত রাখলে GPT‑5.6 Sol “নিম্ন” রিজনিংয়ে GPT‑5.5‑এর “উচ্চ” রিজনিংকে ছাড়িয়ে গেছে. প্রোডাকশন টেস্টিংয়েও আমরা একই ধরনের সাফল্যের গল্প দেখেছি, যেখানে স্টার্টআপগুলো আগের ডিফল্ট থেকে রিজনিং এফোর্ট কমিয়ে বিভিন্ন ওয়ার্কফ্লোতে উল্লেখযোগ্য খরচ সাশ্রয়ের কথা জানিয়েছে.

আমরা GPT‑5.6-কে আমাদের কার্যপরিধিতে বসিয়েছিলাম, আর কম রিজনিং এফোর্টই আমাদের সেরা ফল দিয়েছে. ডেটা কখন সত্যিই নেই তা এটি বুঝেছে, ভুল সূত্রের পেছনে ছুটেনি, এবং কম টোকেনেই সঠিক উত্তরে পৌঁছেছে.
— ইজি মিলার, AI রিসার্চ লিড, Hex(একটি নতুন উইন্ডোতে খোলে)

মডেল নির্বাচন

ঐতিহাসিকভাবে, দীর্ঘমেয়াদি ব্যবহারের ক্ষেত্রে সর্বোচ্চ উপলব্ধ রিজনিংসহ ফ্ল্যাগশিপ মডেলে আপগ্রেড করাই ছিল সেরা বিকল্প. এর বড় কারণ ছিল, দীর্ঘ কনটেক্সট ও টুল কলিং সামলানোর ক্ষেত্রে এই মডেলগুলো খরচ-সাশ্রয়ী মডেলগুলোর তুলনায় অনেক বেশি সক্ষম ছিল. 5.6-পরিবারে এটি বদলেছে: বেশি টেস্ট-টাইম কম্পিউট দিয়ে Luna ও Terra প্রায়ই GPT‑5.4 ও 5.5-এর মতো কাজ করতে পারে, অথচ খরচ উল্লেখযোগ্যভাবে কম.

1 এর মধ্যে 3
Luna খরচের এক-অষ্টাদশাংশে GPT‑5.5‑এর এক্সট্র্যাকশন নির্ভুলতার 98% ধরে রাখে. এতে আমাদের এজেন্টগুলো এমন খরচে উচ্চমানের ডকুমেন্ট বোঝাপড়া পায়, যা আরও অনেক ওয়ার্কফ্লোতে ব্যবহারিক হয়ে ওঠে.
— সেরহি শ্চোহোলিয়েভ, ইঞ্জিনিয়ারিং লিড, এজেন্ট, Hypha(একটি নতুন উইন্ডোতে খোলে)

BrowseComp-এর কাজগুলো বিবেচনা করুন: এটি একটি সার্চ-ভিত্তিক বেঞ্চমার্ক, যা দুর্লভ তথ্য খুঁজে বের করার মডেলের সক্ষমতা পরীক্ষা করে. তিন মাস আগে, GPT‑5.5 (অতি উচ্চ) এই বেঞ্চমার্কে মোট $33.27 খরচে 84.36% স্কোর করেছিল. লঞ্চের সময়, GPT‑5.6 Luna (অতি উচ্চ) প্রায় একই কর্মক্ষমতা দেয়—$1.33 খরচে 84.04% স্কোর. এর পর থেকে আমরা দাম আরও কমিয়েছি. আমাদের সর্বশেষ মূল্যছাঁট সম্পর্কে আরও পড়ুন.

ছোট 5.6-পরিবারের মডেলগুলো উচ্চ-ভলিউম ওয়ার্কলোড, লেটেন্সি-সংবেদনশীল ইন্টারঅ্যাকশন এবং এজেন্টিক ওয়ার্কফ্লোর পুনরাবৃত্ত ধাপের জন্য খুব উপযোগী. উদাহরণ হিসেবে, আপনি যদি এজেন্টিক বিশ্লেষণের আগে হাতে লেখা মেমো পার্স করে এমন একটি লিগ্যাল-টেক স্টার্টআপ চালান, তাহলে পুরো ব্যবহারের ক্ষেত্রে একটি অত্যাধুনিক মডেল ব্যবহারের বদলে এখন এক্সট্র্যাকশনের জন্য Terra বা Luna ব্যবহার করে উল্লেখযোগ্য খরচ সাশ্রয় করতে পারেন.

আরও দক্ষ এজেন্ট নকশার জন্য Responses API-কে বিকশিত করা

GPT‑5.6‑কে শুরু থেকেই আরও কার্যক্ষম করার পাশাপাশি, আরও উন্নতি আনতে আমরা Responses API-তে নতুন প্রিমিটিভও দিয়েছি. এজেন্টগুলোকে আরও দক্ষভাবে কাজ করতে সক্ষম করতে আমরা তিনটি পরিপূরক স্থাপত্যগত হস্তক্ষেপসহ GPT‑5.6‑কে শুরু থেকে শেষ পর্যন্ত প্রশিক্ষণ দিয়েছি:

  1. আগে করা কাজ আবার ব্যবহার করুন: মডেল টার্নজুড়ে রিজনিং সংরক্ষণ(একটি নতুন উইন্ডোতে খোলে) করার সুযোগ দিয়ে এবং দীর্ঘমেয়াদি কথোপকথন সংকুচিত করতে নেটিভ সংকোচন(একটি নতুন উইন্ডোতে খোলে) ব্যবহার করে, মডেল দীর্ঘ কাজের পরিসরজুড়ে বিভ্রান্ত না হয়ে বা আগের কনটেক্সট পুনর্গঠন না করেই কাজে সামঞ্জস্য বজায় রাখতে পারে.
  2. উপযুক্ত ক্ষেত্রে সমান্তরাল বিভাজন: নেটিভ মাল্টি-এজেন্ট অর্কেস্ট্রেশন(একটি নতুন উইন্ডোতে খোলে) ব্যবহার করলে জটিল কাজ দ্রুত শেষ করতে সমান্তরাল ওয়ার্কস্ট্রিমজুড়ে একাধিক এজেন্ট সমন্বয় করা যায়.
  3. নির্ধারিত কাজ কোডে সরিয়ে নিন: মডেলের কনটেক্সট উইন্ডোর বাইরে টুল আউটপুট ফিল্টার, অ্যাগ্রিগেট ও অর্কেস্ট্রেট করতে প্রোগ্রাম্যাটিক টুল কলিং(একটি নতুন উইন্ডোতে খোলে) ব্যবহার করুন, যাতে মডেল টোকেন বিচারমূলক কাজের জন্য রাখা যায় এবং খরচ, লেটেন্সি ও কনটেক্সট রট কমে.

একসঙ্গে ব্যবহার করলে পার্থক্যটি নাটকীয় হতে পারে. উদাহরণ হিসেবে, ARC-AGI-3-এ GPT‑5.6 Sol স্ট্যান্ডার্ড কার্যপরিধি দিয়ে 13.3% স্কোর করেছে. তবে সংরক্ষিত রিজনিং ও সংকোচন চালু করার পর স্কোর বেড়ে 38.3% হয়েছে—এবং আউটপুট টোকেন প্রায় ছয় গুণ কম ব্যবহার হয়েছে. মডেলে কোনো পরিবর্তন নয়, তবু কর্মক্ষমতা প্রায় তিন গুণ. আমাদের ARC-AGI-3 কার্যপরিধি তদন্ত সম্পর্কে এখানে আরও পড়তে পারেন.

প্রোগ্রাম্যাটিক টুল কলিং

এজেন্টিক ওয়ার্কফ্লোতে প্রায়ই দুই ধরনের কাজ থাকে:

  1. যেসব কাজে বিচারবোধ দরকার
  2. যে কাজগুলোতে মূলত ডেটা সরানো, ফিল্টার করা ও একত্র করা দরকার

যখন কোনো এজেন্ট 100টি ফাইলিং উদ্ধার করে, তারিখ অনুযায়ী ফিল্টার করে এবং প্রাসঙ্গিক লেনদেন শনাক্ত করে, তখন মডেলের কনটেক্সট উইন্ডোতে প্রতিটি মধ্যবর্তী ফল নিয়ে যুক্তি করার দরকার হওয়া উচিত নয়. প্রোগ্রাম্যাটিক টুল কলিং GPT‑5.6‑কে টুল অর্কেস্ট্রেট করতে, স্বাধীন কলগুলো সমান্তরালে চালাতে এবং কনটেক্সট উইন্ডোর বাইরে সেগুলোর আউটপুট প্রক্রিয়া করতে JavaScript লিখতে দেয়. তাতে মডেল বুদ্ধিমত্তা-নির্ভর কাজেই মন দিতে পারে: বিচার প্রয়োগ করা.

আর্থিক গবেষণায় কঠিন অংশ হলো নির্ভরযোগ্যভাবে ফাইলিং বের করা, টুল সমন্বয় করা এবং সংখ্যাগুলো বিশ্লেষণ করা. আমাদের মূল্যায়নে, Programmatic Tool Calling ব্যবহার করা GPT‑5.6 আমাদের রুব্রিকের গুণমানের সমান ফল দিয়েছে, অথচ 21% কম ইনপুট টোকেন ব্যবহার করেছে. এটাই আর্থিক গবেষণা নিয়ে আলোচনা করতে পারে এমন এজেন্ট এবং বাস্তবে তা সম্পন্ন করতে পারে এমন এজেন্টের পার্থক্য.
— অ্যালেক্স ওয়াং, অ্যাপ্লাইড AI, Rogo(একটি নতুন উইন্ডোতে খোলে)

মাল্টি-এজেন্ট

জটিল, সমান্তরাল করা যায় এমন কাজে, একাধিক এজেন্ট ওয়ার্কস্ট্রিমজুড়ে কাজ ও রিজনিং ভাগ করে দিলে কাজ দ্রুত শেষ হয় এবং বুদ্ধিমত্তাও বাড়ে. এ ধরনের সেটআপে, প্রধান এজেন্ট সাবএজেন্টগুলো অর্কেস্ট্রেট করা এবং তাদের কাছে কাজ অর্পণের দায়িত্বে থাকে. সাবএজেন্টগুলো সমান্তরালে তাদের লক্ষ্য অনুসরণ করে এবং শেষে চূড়ান্ত সংশ্লেষণের জন্য তাদের আউটপুট প্রধান এজেন্টের কাছে ফেরত দেয়. দলগুলো Responses API-তে মাল্টি-এজেন্ট চালু করে(একটি নতুন উইন্ডোতে খোলে) নেটিভভাবে মাল্টি-এজেন্ট ব্যবহার শুরু করতে পারে. ChatGPT‑তে Ultra সক্ষমতা সেটিংও এভাবেই কাজ করে.

1 এর মধ্যে 2
Qualia উন্মুক্ত গবেষণা সমস্যায় এজেন্টের দল চালায়, আর GPT‑5.6 Sol একেবারে জমে গেছে. এটি GPT‑5.5‑এর তুলনায় স্পষ্ট উন্নতি দেখিয়েছে, আমাদের পরীক্ষা করা প্রায় সব মডেলের চেয়ে দ্রুত শেষ করেছে, এবং দ্রুতই আমাদের পছন্দের OpenAI মডেল হয়ে উঠেছে.
— ই চি, প্রতিষ্ঠাতা, Quadrillion(একটি নতুন উইন্ডোতে খোলে)

GPT‑5.6 উপযুক্ত সাবএজেন্টের সংখ্যা এবং কখন সেগুলো চালু করতে হবে তা ভালোভাবে বোঝে, তবে মাল্টি-এজেন্ট আচরণ খুব সহজে নির্দেশনা দিয়ে নিয়ন্ত্রণ করা যায়. কখন সাবএজেন্ট আহ্বান করতে হবে সে বিষয়ে মডেলকে নির্দেশনা দিলে শুধু সেই পরিস্থিতিতেই এজেন্ট তৈরি হওয়ার সম্ভাবনা বাড়ে, যেখানে অতিরিক্ত টোকেন ব্যয় করলে কর্মক্ষমতা উন্নত হবে.

প্রম্পট ক্যাশিং

মডেল পরিবারের সবকটিতে প্রম্পট ক্যাশ TTL ন্যূনতম 30 মিনিটে বাড়ানো হয়েছে, এবং এখন মডেলের কনটেক্সট উইন্ডোর মধ্যে নির্ধারিতভাবে ক্যাশ ব্রেকপয়েন্ট সেট করা যায়. এতে স্টার্টআপগুলো তাদের ক্যাশ হিট রেট উল্লেখযোগ্যভাবে বাড়াতে পেরেছে.

আমরা একটি শেয়ার করা 29,000-টোকেন প্রম্পটে ক্যাশ ব্রেকপয়েন্ট ও ওয়ার্কস্পেস-নির্দিষ্ট কী যোগ করে আনক্যাশড ইনপুট 28% কমিয়েছি. 30 মিনিটের ক্যাশ উইন্ডোটিও বড় সুযোগ খুলে দিয়েছে: আমাদের এজেন্টগুলো একেবারে শুরু না করে রানগুলোর মধ্যে একই কনটেক্সট আবার ব্যবহার করতে পেরেছে.
— লরেঞ্জো জেন্তিলে, AI ইঞ্জিনিয়ার, Ploy(একটি নতুন উইন্ডোতে খোলে)

ক্যাশ ব্রেকপয়েন্ট সেট করার পাশাপাশি উপযুক্ত prompt_cache_key(একটি নতুন উইন্ডোতে খোলে) ব্যবহার চালিয়ে গেলে, আগে একই প্রিফিক্স পরিবেশন করা ইনফারেন্স ইঞ্জিনেই অনুরোধ যাওয়ার সম্ভাবনা বাড়ে, ফলে লেটেন্সি কমে.

উপসংহার

এই উদাহরণগুলোতে সবচেয়ে চোখে পড়ে, এজেন্ট তৈরির অর্থনীতি কতটা বদলে গেছে.

যেসব ব্যবহারের ক্ষেত্রে আগে প্রতিটি ধাপে অত্যাধুনিক মডেল দরকার হতো, সেগুলো এখন ছোট মডেল ব্যবহার, রিজনিং এফোর্ট টিউনিং এবং দক্ষ স্থাপত্যগত সিদ্ধান্তের মাধ্যমে খরচের সামান্য অংশে সমমানের বা আরও ভালো ফল পেতে পারে.

আপনারা সবাই কী তৈরি করেন, তা দেখার জন্য আমরা উচ্ছ্বসিত!

  • 2026
  • API প্ল্যাটফর্ম

লেখকদের সম্পর্কে

এই গাইডটি তৈরি করেছেন Samarth Madduru(একটি নতুন উইন্ডোতে খোলে), Prashant Mital(একটি নতুন উইন্ডোতে খোলে), Dave Leo(একটি নতুন উইন্ডোতে খোলে), এবং Julien Reiman(একটি নতুন উইন্ডোতে খোলে); প্রাথমিক পরীক্ষা থেকে প্রোডাকশন পর্যন্ত GPT‑5.6-এ নির্মাণকারী স্টার্টআপগুলোর সঙ্গে ঘনিষ্ঠভাবে কাজ করার অভিজ্ঞতার ভিত্তিতে.