মূল কনটেন্টে যান
OpenAI

GPT‑5.6 কীভাবে অত্যাধুনিক বুদ্ধিমত্তা ও দক্ষতা এক করে

লোডিং…

মানুষ আমাদের মডেল দিয়ে যে নানা ধরনের কাজ করে, সেই পুরো পরিসরে সক্ষমতা ও খরচ সামঞ্জস্য করতে আমরা GPT‑5.6 মডেল পরিবার নকশা করেছি. আমাদের ফ্ল্যাগশিপ মডেল GPT‑5.6 Sol, max reasoning সহ, Artificial Analysis Coding Agent Index-এ Claude Fable 5-কে অর্ধেকেরও কম খরচে ছাড়িয়ে যায়. Terra অর্ধেক দামে বুদ্ধিমত্তা বেঞ্চমার্কে GPT‑5.5-এর সমান কাজ করে, আর Luna আমাদের দ্রুততম ও সবচেয়ে সাশ্রয়ী মডেল, যার দাম Sol-এর খরচের চেয়ে 80% কম. এই দক্ষতাগুলো দিতে আমাদের গবেষণা ও প্রযুক্তি দলগুলো আমাদের স্ট্যাকের প্রতিটি প্রধান স্তরে উল্লেখযোগ্য অপ্টিমাইজেশন করেছে. এই উন্নতিগুলো আমাদের মডেল, ইনফারেন্স (আউটপুট তৈরি করতে আমরা কীভাবে মডেল চালাই) এবং Codex ও ChatGPT কাজ উভয়ের ব্যবহৃত আমাদের এজেন্টিক কার্যপরিধি জুড়ে বিস্তৃত.

গত চার বছরে আমরা আমাদের মডেল এক বিলিয়ন সক্রিয় ব্যবহারকারী এবং দুই মিলিয়নের বেশি ব্যবসায়ে স্কেল করেছি; সবার কাছে বুদ্ধিমত্তার সুফল পৌঁছে দেওয়ার কেন্দ্রে ছিল দক্ষতা. আমাদের লক্ষ্য হলো নিশ্চিত করা যে আর্টিফিশিয়াল জেনারেল ইন্টেলিজেন্স সমগ্র মানবতার উপকারে আসে. এই বছরগুলোতে আমরা আমাদের স্ট্যাকজুড়ে ক্রমাগত আরও বড় অপ্টিমাইজেশন উন্মুক্ত করার কাজ করেছি, যাতে খরচ-বুদ্ধিমত্তা বক্ররেখার প্রতিটি বিন্দুতে সর্বোচ্চ কর্মক্ষম মডেল দেওয়া যায়. GPT‑5.6‑এর মাধ্যমে আমরা এখন পর্যন্ত টোকেনপ্রতি সর্বোচ্চ বুদ্ধিমত্তা-দক্ষতা অর্জন করেছি; এটি প্রতি টোকেনে আরও বেশি কাজ করতে প্রশিক্ষিত. প্রশিক্ষণে আমরা কাজের সাফল্য ও দক্ষতা—দুটিই অপ্টিমাইজ করি, যাতে মডেলকে কোনো কাজের মধ্য দিয়ে আরও সরাসরি পথে যেতে শেখানো যায়.

এই পোস্টে আমরা আমাদের মডেলের বাইরে তাকিয়ে দেখাব, স্ট্যাকের আরও দুটি বড় অংশে অগ্রগতির মাধ্যমে কীভাবে আমরা দক্ষতার জন্য নকশা করেছি: এক) ইনফারেন্স, যেখানে লোড ব্যালান্সিং, speculative decoding, ক্যাশিং ও কার্নেল অপ্টিমাইজেশনের মতো প্রক্রিয়া অপ্টিমাইজ করে একই হার্ডওয়্যার থেকে বেশি আউটপুট নেওয়া হয়, এবং দুই) আমাদের এজেন্টিক কার্যপরিধি, যেখানে কনটেক্সট ফোলা, টুল ব্যবহার ও পুনরাবৃত্ত কাজ আরও ভালোভাবে পরিচালনা করা হয়. এই লাভগুলোর কয়েকটি স্বয়ংক্রিয়ভাবে অর্জনে GPT‑5.6 Sol-এর ভূমিকাও আমরা শেয়ার করব. যেকোনো একক উন্নতি সীমিত মনে হলেও, এসব সাফল্য একসঙ্গে বাড়তে বাড়তে আমাদের বুদ্ধিমত্তা ও দক্ষতা—দুটিরই অত্যাধুনিক পর্যায়ে পৌঁছাতে দেয়.

এজেন্ট কার্যপরিধি, API অর্কেস্ট্রেশন ও মডেল ইনফারেন্সজুড়ে GPT-5.6-এর দক্ষতা দেখানো ডায়াগ্রাম, যেখানে কম নেটওয়ার্ক ডেটা, কম CPU কাজ এবং বেশি GPU আউটপুট তৈরি হয়.

GPT‑5.6 Sol দিয়ে ইনফারেন্স ত্বরান্বিত করা

কম্পিউট-সীমিত এক বিশ্বে, যেখানে মডেলের চাহিদা সক্ষমতার চেয়ে দ্রুত বাড়ছে, দক্ষতা প্রতিটি সিস্টেম নকশার কেন্দ্রে. আমাদের ইনফারেন্স স্ট্যাকের ক্ষেত্রে এটি বিশেষভাবে সত্য, যেখানে প্রশিক্ষিত মডেল চালিয়ে প্রতিক্রিয়া তৈরি করা হয়. আমাদের প্রধান লক্ষ্য হলো একই হার্ডওয়্যারে আরও বেশি টোকেন পরিবেশন করা, একই সঙ্গে ব্যবহারকারীরা যে বুদ্ধিমত্তা, ল্যাটেন্সি, প্রাপ্যতা ও নির্ভরযোগ্যতা প্রত্যাশা করেন তা বজায় রাখা.

এটি অর্জন করতে পুরো সিস্টেম অপ্টিমাইজ করতে হয়. একটি মডেল আলাদাভাবে খুব দক্ষ হতে পারে, কিন্তু অনুরোধ খারাপভাবে বণ্টিত হলে, হার্ডওয়্যার অলস পড়ে থাকলে, বা ডেটা চলাচল কম্পিউটেশন ধীর করলে সেটি পরিবেশন করা এখনও ব্যয়বহুল হতে পারে. প্রতিটি স্তরের উন্নতি একে অন্যকে বাড়ায়; লাভ আসে রাউটিং (অনুরোধ কোথায় পাঠানো হয়), শিডিউলিং (অনুরোধ কখন পাঠানো হয়), কার্নেল (GPU-তে চলা সফটওয়্যার), ক্যাশিং (সংরক্ষিত ও পুনঃব্যবহৃত কাজ), এবং মডেল ইমপ্লিমেন্টেশন (GPU কোডের ক্রম) অপ্টিমাইজেশন থেকে. Codex-এ GPT‑5.6 Sol এই সব অপ্টিমাইজেশনে গুরুত্বপূর্ণ ভূমিকা রেখেছে.

প্রথম গুরুত্বপূর্ণ উদাহরণ হলো লোড ব্যালান্সিং. বিশ্বজুড়ে আমরা ভূগোল, উপলভ্য সক্ষমতা এবং অ্যাক্সেলারেটরের ধরন (মডেল চালানো GPU বা বিশেষায়িত চিপের ধরন) ইত্যাদি বিষয়ের ভিত্তিতে অনুরোধ রাউট করি. একটি ক্লাস্টারের মধ্যে আমরা লোড, কনটেক্সটের দৈর্ঘ্য, ক্যাশের প্রাপ্যতা এবং অনুরোধের অন্যান্য বৈশিষ্ট্যের ভিত্তিতে মডেল ইনস্ট্যান্সগুলোর মধ্যে কাজ বণ্টন করি. প্রতিটি ইনস্ট্যান্সের ভেতর কাজ আবার অ্যাক্সেলারেটর, মডেলের সাব-নেটওয়ার্ক এবং কম্পিউটিং কোরজুড়ে দক্ষভাবে ভাগ করতে হয়. Codex-এ GPT‑5.6 Sol আমাদের প্রোডাকশন ট্রাফিক বিশ্লেষণ করতে, আগে চোখ এড়ানো ভারসাম্যহীনতার উৎস শনাক্ত করতে, নতুন রাউটিং কৌশল পরীক্ষা করতে এবং এসব হিউরিস্টিক নিরন্তর টিউন করতে সাহায্য করে. শুধু এই লোড ব্যালান্সিং উন্নতিগুলোই আমাদের মডেল পরিবেশনের খরচ নাটকীয়ভাবে কমিয়েছে.

আমরা GPT‑5.6 Sol ব্যবহার করে মডেলের forward pass-ও অপ্টিমাইজ করেছি: যে কম্পিউটেশন ইনপুটকে পরবর্তী-টোকেন পূর্বাভাসে রূপান্তর করে. স্বতন্ত্র অপারেশন দ্রুত হলেও অতিরিক্ত মেমরি চলাচল, সিঙ্ক্রোনাইজেশন এবং অদক্ষ ডেটা লেআউট GPU-কে অলস রেখে দিতে পারে. এটি এড়াতে GPT‑5.6 Sol এমন কাজ খুঁজে বের করেছে, যা আগে থেকে গণনা করা, এড়ানো বা সমান্তরাল করা যায়. Codex দিয়ে GPT‑5.6 Sol স্বয়ংক্রিয়ভাবে আমাদের প্রোডাকশন কার্নেল—অর্থাৎ মডেল গঠনকারী গাণিতিক অপারেশন চালানো মূল কোড—পুনর্লিখন ও অপ্টিমাইজ করেছে. এটি আংশিকভাবে কাজ করেছে কারণ আমরা GPT‑5.6‑কে Triton(একটি নতুন উইন্ডোতে খোলে) এবং Gluon(একটি নতুন উইন্ডোতে খোলে)-এ কার্নেল লেখা ও উন্নত করায় কার্যকর হতে প্রশিক্ষণ দিয়েছি; এগুলো OpenAI রক্ষণাবেক্ষিত দুটি ওপেন-সোর্স GPU প্রোগ্রামিং ভাষা. GPT‑5.6 Sol-এর বিস্তৃত কার্নেল অগ্রগতির সঙ্গে মিলিয়ে এই প্রচেষ্টাগুলো এন্ড-টু-এন্ড পরিবেশন খরচ 20% কমিয়েছে. GPT‑5.6 Sol লেখা কার্নেলগুলোর সঠিকতা যাচাইয়ে সহায়তার জন্য আমরা ওপেন-সোর্স টুল FpSan(একটি নতুন উইন্ডোতে খোলে) (Floating-Point Sanitizer)-এর মতো ভেরিফিকেশন টুলিংয়েও বড় বিনিয়োগ করেছি.

গতি ও দক্ষতা বাড়ানোর আরেকটি উপায় হলো speculative decoding. এই কৌশলে প্রাথমিক মডেলের পাশাপাশি একটি ছোট ড্রাফট (বা “স্পেকুলেটর”) মডেল চালানো হয়, যা প্রাথমিক মডেল সমান্তরালে যাচাই করার জন্য কয়েকটি টোকেন প্রস্তাব করে. এই প্রস্তাবগুলো গৃহীত হলে সিস্টেম একটি মাত্র প্রাথমিক-মডেল পাস থেকে একাধিক আউটপুট টোকেন তৈরি করতে পারে, ফলে ব্যয়বহুল ধারাবাহিক কম্পিউটেশনের পরিমাণ কমে. GPT‑5.6 Sol নিজের ড্রাফট মডেল উন্নত করেছে তার আর্কিটেকচারে শত শত পরীক্ষা নকশা ও চালিয়ে, আকার, কাঠামো এবং বৈশিষ্ট্যের পরিবর্তন পরীক্ষা করে. এছাড়া GPT‑5.6 Sol স্পেকুলেটর প্রশিক্ষণ প্রক্রিয়া চালু ও পর্যবেক্ষণ করেছে, এবং হার্ডওয়্যার ব্যর্থতা ও প্রশিক্ষণ অস্থিতিশীলতাসহ সমস্যা দেখা দিলে স্বয়ংক্রিয়ভাবে হস্তক্ষেপ করেছে. ফলে পাওয়া উন্নতিগুলো টোকেন-উৎপাদন দক্ষতা 15%-এর বেশি বাড়িয়েছে.

ক্যাশে না থাকা ইনপুট টোকেন প্রক্রিয়ার সময় মডেল এক কম্পিউট-নিবিড় পাসে key-value (KV) ক্যাশ তৈরি করে; আউটপুট তৈরি করার সময় এটি বারবার সেই ক্যাশ থেকে পড়ে এবং সেটি বাড়ায়. পরিবেশনের জন্য সর্বোত্তম কনফিগারেশন, যেমন ব্যাচিং, শার্ডিং এবং KV ব্যবস্থাপনা, কাজের ধরনের ওপর গভীরভাবে নির্ভর করে—প্রম্পট ও আউটপুটের দৈর্ঘ্য, ব্যাচের আকার, ক্যাশ হিট রেট, কোয়েরির বৈশিষ্ট্য এবং আরও অনেক কিছু. তবে আগে কনফিগারেশন স্পেস এত বড় ছিল যে পদ্ধতিগতভাবে টিউন করা যেত না, ফলে ইঞ্জিনিয়ারদের বিস্তৃত হিউরিস্টিকের ওপর নির্ভর করতে হতো. Codex-এ GPT‑5.6 Sol দিয়ে আমরা প্রোডাকশন ওয়ার্কলোড বিশ্লেষণ করতে, সম্ভাব্য কনফিগারেশন তৈরি ও মূল্যায়ন করতে, এবং প্রতিটি পরিস্থিতির জন্য ইঞ্জিন ও মডেল কীভাবে কনফিগার হয় তা হাইপার-অপ্টিমাইজ করতে পেরেছি. এর ফলে ওয়ার্কলোড-নির্দিষ্ট অপ্টিমাইজেশনের এক নতুন স্তর বাস্তবসম্মত হয়, একই হার্ডওয়্যার থেকে আরও কার্যকর ইনফারেন্স বের করে আনা যায়.

ইনফারেন্স অপ্টিমাইজেশন একটি চলমান ফিডব্যাক লুপ. আমরা প্রোডাকশন আচরণ মাপি, সবচেয়ে বড় ফাঁকগুলো শনাক্ত করি, পরিবর্তন বাস্তবায়ন করি এবং যাচাই করি যে সেগুলো বিচ্ছিন্ন বেঞ্চমার্ক নয়, পুরো সিস্টেমকে উন্নত করছে. GPT‑5.6 Sol এবং Codex সেই লুপের প্রতিটি অংশ ত্বরান্বিত করে. এর মানে আমাদের দল আরও বেশি ধারণা পরীক্ষা করতে পারে, বদলে যাওয়া ওয়ার্কলোডে দ্রুত সাড়া দিতে পারে, এবং ব্যবহারকারীদের জন্য কম ল্যাটেন্সি, বেশি সক্ষমতা ও কম খরচের ইনফারেন্স স্ট্যাক তৈরি করতে পারে.

আমাদের এজেন্টিক কার্যপরিধি কীভাবে পুনরাবৃত্ত কাজ সহজ করে

ChatGPT কাজ এবং Codex ধারাবাহিক মডেল অনুরোধ ও টুল কলের মাধ্যমে জটিল কাজ সম্পন্ন করে. একটি টার্নে, ব্যবহারকারীর অনুরোধ থেকে চূড়ান্ত প্রতিক্রিয়া পর্যন্ত, Codex সোর্স কোড পরীক্ষা করতে, ডিপ্লয়মেন্ট ইতিহাস খুঁজতে, ইনসিডেন্ট রিপোর্ট পড়তে, ফাইল সম্পাদনা করতে এবং পরীক্ষা চালাতে পারে. প্রতিটি ধাপে একটি অনুরোধ লাগতে পারে.

কনটেক্সট প্রস্তুত করা, ডেটা পাঠানো, ইনফারেন্স চালানো, টুল কল করা এবং প্রসেস শুরু করা—সবকিছুর জন্যই সময় ও কম্পিউট লাগে. কোনো কাজে 30টি মডেল অনুরোধ লাগলে, প্রতি অনুরোধে অতিরিক্ত এক সেকেন্ডও জমে বড় হয়ে যায়. সামগ্রিক কর্মক্ষমতা বাড়ানো মানে শুধু মডেলকে দ্রুত করা নয়, পুরো সিস্টেমজুড়ে পুনরাবৃত্ত কাজ কমানো.

একটি ব্যবহারকারীর কাজ মডেলে প্রবেশ করে; কাজটি শেষ করার আগে মডেল বারবার একটি টুল কল করতে, ফলাফল পেতে এবং আরেকটি মডেল সিদ্ধান্ত নিতে পারে.

একটি ব্যবহারকারীর টার্নে অনেক মডেল ও টুল ইটারেশন থাকতে পারে. পুনরাবৃত্ত অঞ্চলের ভেতরের যেকোনো খরচ বহুবার দিতে হতে পারে.

এই গুণকগুলো আমাদের এজেন্টিক কার্যপরিধির নকশাকে প্রভাবিত করেছে; এটি একটি Rust অর্কেস্ট্রেশন স্তর, যা আমাদের মডেল, টুল এবং ব্যবহারকারীর পরিবেশকে যুক্ত করে. এরপর আমরা দেখাব কনটেক্সট ফোলা এড়ানো, টুল লোড করা এবং কাজ পুনঃব্যবহার করা কীভাবে প্রতিটি অনুরোধকে আরও দক্ষ করে.

কনটেক্সট ফোলা এড়ান

এজেন্টদের আরও বেশি টুল, দক্ষতা, প্লাগইন এবং কথোপকথনের ইতিহাসে প্রবেশাধিকার দিলে কনটেক্সট উইন্ডো সহজেই বড় হয়ে যেতে পারে. এতে খরচ বাড়ে, মডেলের মনোযোগ বিঘ্নিত হয় এবং অপ্রয়োজনীয় যুক্তি-প্রক্রিয়া শুরু হয়. কার্যপরিধি deferred discovery-এর মাধ্যমে এই অতিরিক্ত ব্যয় কমাতে পারে, যাতে ইন্টিগ্রেশন, কাস্টম MCP টুল, দক্ষতা ও প্লাগইন শুধু প্রয়োজন হলে সামনে আসে. কার্যপরিধি পৃথক টুল ও MCP ইন্টিগ্রেশনকে অপ্রত্যাশিতভাবে কনটেক্সট উইন্ডো দখল করতেও বাধা দেয়. মডেল ভিন্ন সীমা না চাইলে, টুল আউটপুট ডিফল্টভাবে 10,000 টোকেনে সীমাবদ্ধ থাকে.

প্রম্পট ক্যাশিংয়ের জন্য হুবহু প্রিফিক্স বজায় রাখুন

আগেই বলা হয়েছে, একটি এজেন্ট লুপ একই নির্দেশনা, কথোপকথনের ইতিহাস, টুলের সংজ্ঞা এবং আগের ফলাফল এক টার্নের মধ্যেই একাধিকবার GPU-তে পাঠাতে পারে. এই পুনরাবৃত্ত ইনপুটগুলো প্রক্রিয়া করা ব্যয়বহুল, তাই প্রম্পট ক্যাশিং আগে প্রক্রিয়াকৃত প্রম্পট প্রিফিক্সের সঙ্গে যুক্ত কম্পিউটেশন পুনঃব্যবহার করে. সেই প্রিফিক্স বজায় রাখতে কার্যপরিধি মডেলের দৃশ্যমান সব ইতিহাসকে শুধু-সংযোজনযোগ্য হিসেবে ধরে: নতুন বার্তা, টুলের ফলাফল ও পরিবেশের আপডেট আগের কনটেক্সটে ঢোকানো না হয়ে শেষে যোগ হয়. টুলগুলোও নির্ধারিত ক্রমে উপস্থাপন করা হয়, আর অনুমোদন নীতির মতো রানটাইম সেটিংস টুলের সংজ্ঞায় এমবেড না করে এক্সিকিউশনের সময় প্রয়োগ করা হয়. এই নকশাগত সিদ্ধান্ত Codex এবং ChatGPT কাজের সামগ্রিক উচ্চ প্রম্পট-ক্যাশ হিট রেটে ভূমিকা রাখে.

তিনটি অনুরোধে স্থায়ী সংযোগে পাঠানো বাইটের সঙ্গে মডেলের দেখা বাড়তে থাকা কনটেক্সট এবং ক্যাশে পুনঃব্যবহারের উপযোগী প্রিফিক্সের তুলনা করা হয়েছে.

ইনক্রিমেন্টাল ট্রান্সপোর্ট বদলে দেয় নেটওয়ার্ক দিয়ে কী যায়; প্রম্পট ক্যাশিং বদলে দেয় মডেল কোন হিসাব আবার করা এড়াতে পারে. প্রস্থগুলো ধারণাগত, এবং অতিরিক্ত কমপ্রেশন স্তর দেখানো হয়নি.

বুদ্ধিমত্তা বক্ররেখাজুড়ে দক্ষতা

GPT‑5.6 দিয়ে আমরা যে দক্ষতার উন্নতি এনেছি, তা গবেষণা, ইনফারেন্স এবং আমাদের এজেন্টিক কার্যপরিধি জুড়ে পুরো স্ট্যাকে বহু বছরের ধারাবাহিক উন্নতির ফল. এই উন্নতিগুলোর অনেকটি আনতে GPT‑5.6‑এর ভূমিকা আমাদের আশাবাদী করে যে অপ্টিমাইজেশনের গতি আরও বাড়বে. আমরা আমাদের স্ট্যাকের ভিত্তিগত উন্নতির পাশাপাশি কার্নেল অপ্টিমাইজেশনের মতো ক্ষেত্রে আরও বড় অপ্টিমাইজেশন চালিয়ে যাব. চলমান এসব অন্তর্নিহিত উন্নতি আরও ব্যাপকভাবে প্রাপ্য, সাশ্রয়ী বুদ্ধিমত্তা হিসেবে আমাদের ব্যবহারকারী ও গ্রাহকদের কাছে পৌঁছে দিতে আমরা আগ্রহী.

এই পোস্টে অবদানের জন্য Technical Staff-এর সদস্য Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson এবং Steve Coffey-কে বিশেষ ধন্যবাদ.

লেখক

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey