আইরনক্ল্যাডের সঙ্গে কম্পিউটার ব্যবহারে অগ্রগতি
চুক্তি-সংক্রান্ত গবেষণায় সহযোগিতা কীভাবে জটিল পেশাগত কাজে এআই এজেন্টের প্রশিক্ষণ ও মূল্যায়নে আমাদের সাহায্য করছে.
আমরা যখন GPT‑6 Astra উন্মোচন করি, তখন দেখিয়েছিলাম নথি তৈরি থেকে ওয়েবসাইট পরীক্ষা পর্যন্ত পেশাগত কাজে কম্পিউটার ব্যবহারে আমাদের মডেলগুলো কতটা এগিয়েছে. আমাদের পরবর্তী লক্ষ্য হলো বিশেষায়িত সফটওয়্যার ব্যবহার করে জটিল ব্যবসায়িক সমস্যা সমাধানে এজেন্টগুলোর সক্ষমতা ও দক্ষতা বাড়ানো. কোনো প্রতিষ্ঠানের ব্যবসায়িক নিয়ম বোঝা, একাধিক ধাপের কর্মপ্রবাহ সম্পাদন করা এবং কাজটি মূল প্রয়োজনীয়তা পূরণ করেছে কি না যাচাই করার জন্য মডেলগুলোকে কীভাবে প্রশিক্ষণ দেওয়া যায়, তা আমরা অনুসন্ধান করছি.
এই গবেষণার গতি বাড়াতে আমরা অল্পসংখ্যক সফটওয়্যার প্রতিষ্ঠানের সঙ্গে সরাসরি অংশীদারত্ব গড়ছি, যারা এসব কর্মপ্রবাহ সবচেয়ে ভালো বোঝে. একসঙ্গে আমরা কঠিন ও গুরুত্বপূর্ণ কাজগুলো চিহ্নিত করছি এবং আমাদের মডেলের প্রশিক্ষণ ও মূল্যায়নের জন্য সেগুলোকে গবেষণার বিষয় হিসেবে গড়ে তুলছি. এর চূড়ান্ত লক্ষ্য হলো বাস্তব ব্যবসায়িক ব্যবহারে মডেলগুলোকে আরও সক্ষম ও উপযোগী করে তোলা.
আমাদের প্রথম সহযোগী আইরনক্ল্যাড, এআইভিত্তিক চুক্তি ব্যবস্থাপনার একটি শীর্ষস্থানীয় প্রতিষ্ঠান. আইরনক্ল্যাডের দলের সঙ্গে ঘনিষ্ঠভাবে কাজ করে আমরা এমন কাজ তৈরি করেছি, যেখানে এজেন্টগুলোকে চুক্তি, অনুমোদন ও পুনর্ব্যবহারযোগ্য আইনি শর্তের বিন্যাস নির্ধারণ করতে হয়. এসব জটিল কর্মপ্রবাহে আমরা অগ্রগতিও দেখিয়েছি. সফল ফলাফল কেমন হওয়া উচিত তা নির্ধারণে এবং গ্রাহকদের বাস্তব চাহিদা সরাসরি অত্যাধুনিক মডেলের উন্নয়ন প্রক্রিয়ায় যুক্ত করতে আইরনক্ল্যাডের অভিজ্ঞতা গুরুত্বপূর্ণ ভূমিকা রেখেছে. তাদের সহযোগিতার জন্য আমরা কৃতজ্ঞ এবং একসঙ্গে যা অর্জন করেছি, তা জানাতে উচ্ছ্বসিত.
GPT‑6 Astra হলো আইরনক্ল্যাডের কাজের ওপর প্রশিক্ষিত আমাদের প্রথম অত্যাধুনিক মডেল. আমাদের গবেষণামূলক মূল্যায়নে এর গড় স্কোর GPT‑5.6 Sol-এর চেয়ে ৩২% বেশি ছিল, আর প্রতি প্রচেষ্টায় আনুমানিক সময় লেগেছে ৪৮% কম.1
ধরা যাক, আইনি কার্যক্রম পরিচালনাকারী একটি দল সফটওয়্যার কেনার প্রক্রিয়া তৈরি করছে. নির্দিষ্ট অঙ্কের বেশি কেনাকাটায় অর্থ বিভাগের অনুমোদন লাগতে পারে, কিছু অনুরোধ নিরাপত্তা বিভাগের পর্যালোচনা দরকার হতে পারে এবং প্রচলিত শর্তের বাইরে কোনো শর্ত থাকলে তা আইন বিভাগের পর্যালোচনা প্রয়োজন হতে পারে. যিনি প্রক্রিয়াটি তৈরি করছেন, তাঁকে এই সংক্ষিপ্ত তালিকা থেকে অনুরোধ গ্রহণের ফরম, নথির নমুনা, অনুমোদনের নিয়ম এবং চূড়ান্ত চুক্তির রেকর্ড তৈরি করতে হবে.
একই কাজ করার সময় একটি এআই এজেন্টকে সফটওয়্যারের প্রতিটি ধাপে ওই প্রয়োজনীয়তাগুলো মনে রাখতে হবে. যেমন, ব্যয়সীমার বেশি হলে অর্থ বিভাগের অনুমোদন লাগবে—এমন ব্যবস্থা করতে হবে এবং ওই সীমার ওপর ও নিচের অনুরোধগুলো সঠিক প্রক্রিয়া অনুসরণ করছে কি না, তা পরীক্ষা করতে হবে. আলাদা আলাদা ধাপ ঠিকভাবে সম্পন্ন করাই যথেষ্ট নয়: যেসব পরিস্থিতি সামলানোর জন্য প্রক্রিয়াটি তৈরি করা হয়েছে, তার সবগুলোতেই সেটিকে কার্যকর হতে হবে.
আইরনক্ল্যাডের কর্মী এবং OpenAI-এ যাঁরা আইরনক্ল্যাড ব্যবহার করেন, তাঁরা আমাদের গবেষকদের আইন, বাণিজ্য ও ক্রয়সংক্রান্ত ১১টি কাজ চিহ্নিত করতে সাহায্য করেছেন. এর মধ্যে ছিল গোপনীয়তা রক্ষার চুক্তি তৈরি, ক্রয়ের অনুমোদন প্রক্রিয়া তৈরি এবং অনুরোধকারী যে আইনি অধিক্ষেত্র বেছে নেন, সে অনুযায়ী পুনর্ব্যবহারযোগ্য আইনি ধারা হালনাগাদ করার মতো কাজ. আমাদের অনুমান, একজন অভিজ্ঞ ব্যবহারকারীর এসব কাজের প্রতিটিতে গড়ে প্রায় ৩০ থেকে ৪০ মিনিট লাগবে.
জটিলতা অনুযায়ী প্রতিটি কাজ আমরা ৮ থেকে ৫০টি মানদণ্ডের ভিত্তিতে মূল্যায়ন করেছি. এতে আমরা দেখতে পেরেছি, মডেল কোন অংশগুলো ঠিক করেছে এবং কোথায় ঘাটতি রয়ে গেছে. আইরনক্ল্যাড তাদের পণ্যের সার্ভারে চালিত সফটওয়্যার পরিবেশও দিয়েছে, যেখানে মডেলগুলো এসব কাজ অনুশীলন করতে পেরেছে. আমাদের গবেষকেরা প্রতিনিধিত্বমূলক কর্মপ্রবাহের ভিত্তিতে কৃত্রিমভাবে প্রশিক্ষণের কাজ তৈরি করেছেন2 এবং অনুশীলন ও প্রতিক্রিয়ার মাধ্যমে মডেলগুলোকে উন্নত করতে রিইনফোর্সমেন্ট লার্নিং ব্যবহার করেছেন. কাজ সম্পর্কে অভিজ্ঞ ব্যক্তিদের সঙ্গে মিলে কাজ নির্বাচন, বিস্তারিত মানদণ্ড এবং মডেলের অনুশীলনের পরিবেশ—এই সমন্বয় নিশ্চিত করে যে আমরা গ্রাহকদের জন্য সবচেয়ে গুরুত্বপূর্ণ বাস্তব কাজগুলোতেই উন্নতি করছি.
আমরা আস্ট্রার জন্য Max যুক্তিবিশ্লেষণ এবং সলের জন্য উচ্চ যুক্তিবিশ্লেষণ ব্যবহার করে আস্ট্রা ও GPT‑5.6 Sol-এর তুলনা করেছি. এই সেটিংসেই প্রতিটি মডেল সর্বোচ্চ স্কোর পেয়েছে. গবেষণার ১১টি কাজে আস্ট্রার গড় স্কোর ছিল ৫৫.০%, যেখানে GPT‑5.6 Sol-এর ছিল ৪১.৬%. আর প্রতি প্রচেষ্টায় আনুমানিক গড় সময় সলের ৩৭.০ মিনিট থেকে কমে আস্ট্রার ক্ষেত্রে হয়েছে ১৯.২ মিনিট.3 আস্ট্রার উন্নয়নে ব্যবহৃত একটি অভ্যন্তরীণ মডেল এসব কাজে আরও ভালো, ৬৩.৭% স্কোর পেয়েছে. ভবিষ্যৎ মডেলগুলোতেও এই বাড়তি উন্নতি যুক্ত করা আমাদের লক্ষ্য.
পরিমাপক | GPT‑5.6 Sol | GPT‑6 Astra |
মূল্যায়ন মানদণ্ডে গড় স্কোর | ৪১.৬% | ৫৫.০% |
প্রতি প্রচেষ্টায় আনুমানিক গড় সময় | ৩৭.০ মিনিট | ১৯.২ মিনিট |
সিমুলেশনের হিসাবে প্রতি প্রচেষ্টায় কম সময় নিয়েই আস্ট্রা কাজের আরও বেশি প্রয়োজনীয়তা পূরণ করেছে. নিচের দুটি ভিডিওতে দেখা যায়, মডেলগুলো গবেষণার একই কাজ কীভাবে সম্পন্ন করেছে. আস্ট্রা (প্রথমটি) আনুমানিক ২০ মিনিটে কাজের প্রায় ৯৪% মানদণ্ড পূরণ করেছে; GPT‑5.6 Sol (দ্বিতীয়টি) আনুমানিক ৩২ মিনিটে পূরণ করেছে প্রায় ৮৫%.
GPT‑6 Astra আনুমানিক ২০ মিনিটে কাজটির প্রায় ৯৪% মানদণ্ড পূরণ করেছে.
GPT‑5.6 Sol আনুমানিক ৩২ মিনিটে কাজটির প্রায় ৮৫% মানদণ্ড পূরণ করেছে.
এই কাজে আইরনক্ল্যাডের ভূমিকা এমন একটি চ্যালেঞ্জ তুলে ধরে, যা তাদের গ্রাহকদের সুপরিচিত: চুক্তি সম্পাদনের প্রক্রিয়ায় ব্যতিক্রমী পরিস্থিতি সামলাতে হয়, আবার ব্যবসার জন্য অপরিহার্য নিয়মগুলোও অক্ষুণ্ণ রাখতে হয়. কাজের মাঝপথে কোনো এজেন্ট এসব নিয়মের একটি ভুলে গেলে, সফটওয়্যার প্রতিষ্ঠান তাকে কতটা কাজ নিশ্চিন্তে দিতে পারবে, তা সীমিত হয়ে যায়. এ থেকেই বোঝা যায়, চুক্তির জটিল কাজে এজেন্টগুলো আরও দক্ষ হয়ে উঠলেও কেন মানুষের তদারকি গুরুত্বপূর্ণ এবং কেন চুক্তি ব্যবস্থাপনার একটি পূর্ণাঙ্গ প্ল্যাটফর্ম অপরিহার্য. আমাদের গবেষকদের সঙ্গে কাজ করার ফলে আইরনক্ল্যাড এই সমস্যাগুলোকে মূল মডেলের উন্নয়ন প্রক্রিয়ায় নিয়ে আসতে পারছে, যেখানে আমরা একসঙ্গে সেগুলো নিয়ে গবেষণা করতে পারি.
মডেলগুলোর সক্ষমতা বাড়ার সঙ্গে সঙ্গে আইরনক্ল্যাড নিজেদের আরও বেশি পণ্যে সেগুলো ব্যবহারের সুযোগ পাচ্ছে. এর ফলে আইন ও ব্যবসায়িক দলগুলো যে নিয়ন্ত্রণব্যবস্থার ওপর নির্ভর করে, তা অক্ষুণ্ণ রেখেই এআই চুক্তির জটিল কাজের আরও বেশি দায়িত্ব নিতে পারবে.
বর্তমান এজেন্টগুলো এখনো নির্ভরযোগ্যভাবে সম্পন্ন করতে পারে না, এমন গুরুত্বপূর্ণ পেশাগত কাজ নিয়ে আমাদের গবেষণা ও প্রকৌশল দলের সঙ্গে সরাসরি কাজ করতে আমরা অল্পসংখ্যক সফটওয়্যার প্রতিষ্ঠানকে আমন্ত্রণ জানাচ্ছি. আপনার দলের এমন কোনো কাজ থাকলে আমরা একটি সুনির্দিষ্ট উদাহরণ দেখতে চাই: এজেন্টকে কী করতে বলা হচ্ছে, কোথায় সেটি ব্যর্থ হচ্ছে তার প্রমাণ এবং সফল ফলাফল কীভাবে বিচার করবেন. সহযোগীদের এমন লোকজন যুক্ত করার সক্ষমতাও থাকতে হবে, যারা কাজটি গভীরভাবে বোঝেন. পাশাপাশি পরীক্ষার জন্য নিরাপদ পরিবেশ এবং গবেষণায় নিরাপদে ব্যবহারযোগ্য তথ্য দিতে হবে. এগুলো থেকে আমরা ব্যর্থতার কারণ অনুসন্ধান এবং মডেলের উন্নতি হচ্ছে কি না, তা পরিমাপের কাজ শুরু করতে পারি.
আপনার দল এই শর্তগুলো পূরণ করলে, গবেষণায় সহযোগিতার সম্ভাবনা যাচাই করতে আবেদন করুন.
লেখকবৃন্দ
পাদটীকা
- 1
- 2
এসইসির এডগার তথ্যভান্ডারে সর্বসাধারণের জন্য উন্মুক্ত চুক্তিগুলো থেকে আমরা অনুকরণমূলক কাজ তৈরি করেছি. তার আগে ব্যক্তিগত তথ্য অপসারণের জন্য নির্ধারিত ছাঁকনি প্রয়োগ করেছি. প্রশিক্ষণ বা মূল্যায়নে আমরা OpenAI-এর গ্রাহকদের তথ্য, OpenAI-এর অভ্যন্তরীণ চুক্তি কিংবা আইরনক্ল্যাডের গ্রাহকদের অপ্রকাশ্য তথ্য বা চুক্তি ব্যবহার করিনি.
- 3


