মূল কনটেন্টে যান
OpenAI

৬ সেপ্টেম্বর, ২০২৬

গবেষণাপাবলিকেশননিরাপত্তা

গবেষণায় গতি আনা: OpenAI-এর ভেতরের দৃশ্য

লোডিং…

AGI যেন সমগ্র মানবতার উপকারে আসে, তা নিশ্চিত করতে আমরা বিশ্বাস করি এটি গণতান্ত্রিকভাবে পরিচালিত হওয়া উচিত. এটি কেবল অত্যন্ত সক্ষম AI সিস্টেমগুলোর সক্ষমতা, ঝুঁকি এবং সুরক্ষা ব্যবস্থা সম্পর্কে তথ্যসমৃদ্ধ জনপরিসরের বিতর্কের মাধ্যমেই ঘটতে পারে. বিশ্বজুড়ে মানুষের অত্যাধুনিক AI-এর সম্ভাব্য ভবিষ্যৎ গতিপথ বোঝা প্রয়োজন, যাতে এটি কিভাবে বিকশিত হবে সে বিষয়ে তারা অর্থবহ মতামত রাখতে পারে.

নির্দিষ্ট ঝুঁকি, ঘটনা এবং সুরক্ষা ব্যবস্থা সম্পর্কে স্বচ্ছতা প্রয়োজনীয় কিন্তু যথেষ্ট নয়. সবচেয়ে সক্ষম সিস্টেমগুলো কিভাবে বিকশিত হচ্ছে এবং অত্যাধুনিক ল্যাবগুলোর ভেতরে তারা কিভাবে গবেষণার অগ্রগতি এগিয়ে নিচ্ছে, তা জনসাধারণেরও বোঝা দরকার বলে আমরা মনে করি.

আমাদের লক্ষ্য নিরাপদভাবে এমন একটি স্বয়ংক্রিয় AI গবেষক তৈরি করা, যা মানব তত্ত্বাবধানে কাজ করে ডীপ লার্নিং ও সামঞ্জস্যকরণে আরও অগ্রগতি আনতে এবং পুনরাবৃত্তিমূলক উন্নতি সম্ভব করতে পারে. আমাদের পরিমাপ অনুযায়ী, গত শরতে ঘোষিত⁠(একটি নতুন উইন্ডোতে খোলে) এ বছরের সেপ্টেম্বরের মধ্যে একজন স্বয়ংক্রিয় রিসার্চ ইন্টার্ন পাওয়ার লক্ষ্যটি আমরা এখন অর্জন করেছি. “রিসার্চ ইন্টার্ন” বলতে আমরা এমন একটি সিস্টেমকে বুঝি, যা মানুষের নির্দেশনার অধীনে সুস্পষ্টভাবে সংজ্ঞায়িত গবেষণা কাজ সম্পন্ন করতে পারে—এর মধ্যে এমন কাজও অন্তর্ভুক্ত, যা একজন দক্ষ গবেষকের করতে কয়েক দিন লেগে যেতে পারে. আমরা 2028 সালের মার্চের মধ্যে একটি স্বয়ংক্রিয় AI গবেষক তৈরি করার লক্ষ্যে উল্লেখযোগ্য অগ্রগতি অর্জন করছি.

এই বছরে OpenAI গবেষকদের দৈনন্দিন কাজ উল্লেখযোগ্যভাবে বদলেছে. গবেষকরা সারা দিন কোডিং এজেন্ট ব্যবহার করছেন (প্রায়ই একসঙ্গে একাধিক সেশনে) এবং মোট ব্যবহার দ্রুত বাড়ছে, যা OpenAI-এর অন্যান্য টিমের বৃদ্ধিকেও ছাড়িয়ে যাচ্ছে. গবেষকেরা আরও দ্রুত কোডে অবদান রাখছেন এবং আরও বেশি পরীক্ষা-নিরীক্ষা চালাচ্ছেন. গবেষকেরা যেভাবে এজেন্ট ব্যবহার করেন, সেটিও বদলে যাচ্ছে: এজেন্টগুলো ক্রমশ আরও জটিল কাজ সামলাচ্ছে এবং সেগুলোতে আরও ঘন ঘন সফল হচ্ছে. AI গবেষণা বহু সম্ভাব্য প্রতিবন্ধকতা-সহ একটি জটিল প্রক্রিয়া, তাই অগ্রগতির সামগ্রিক গতি সম্ভবত এই নির্দিষ্ট সূচকগুলোর সঙ্গে তাল মেলাতে পারবে না. তবে সামগ্রিকভাবে, এই ফলাফলগুলো আমাদের অনেকের অভ্যন্তরীণভাবে থাকা সেই বৃহত্তর ধারণার সঙ্গে সামঞ্জস্যপূর্ণ যে এজেন্টিক টুলগুলো গবেষণার অগ্রগতিকে উল্লেখযোগ্যভাবে ত্বরান্বিত করছে. মানুষই এখনও আমাদের গবেষণার অগ্রাধিকার নির্ধারণ করে, কোন ধারণা ও ফলাফল এগিয়ে নেওয়া হবে তা বিচার করে এবং সিস্টেমগুলো স্কেল করা, স্থগিত রাখা, নাকি ডিপ্লয় করা হবে—সে সিদ্ধান্ত নেয়.

যদি এটি দায়িত্বশীলভাবে করা হয়, আমরা বিশ্বাস করি স্বয়ংক্রিয় AI গবেষণা এমন মডেল তৈরি করবে যা সরাসরি মানুষের কল্যাণ বৃদ্ধি করবে এবং OpenAI-এর মিশনকে এগিয়ে নেবে. এটি উন্নত বুদ্ধিমত্তার খরচ কমিয়ে আনতে পারে, যাতে বিশ্বজুড়ে মানুষ উপকৃত হতে পারে. আমরা এই কাজটি আংশিকভাবে এ কারণে করছি যে স্বয়ংক্রিয় গবেষণা আমাদের অ্যালাইনমেন্ট সমস্যা সমাধান করতে এবং ক্রমশ আরও সক্ষম হয়ে ওঠা AI-এর বিরুদ্ধে প্রতিরক্ষা ব্যবস্থা গড়ে তুলতে সহায়তা করতে পারে. একজন স্বয়ংক্রিয় AI গবেষক একই সঙ্গে একজন স্বয়ংক্রিয় নিরাপত্তা বা অ্যালাইনমেন্ট গবেষকও হতে পারেন. আরও সক্ষম ও সামঞ্জস্যপূর্ণ সিস্টেম গুরুত্বপূর্ণ অবকাঠামো সুরক্ষিত করতে, বিপজ্জনক AI এজেন্টের বিরুদ্ধে প্রতিরক্ষা গড়ে তুলতে এবং নতুন সুরক্ষামূলক ব্যবস্থা তৈরি করতে সহায়তা করতে পারে.

এগুলো উপযোগী স্বয়ংক্রিয় গবেষণা-সক্ষমতা বিকাশের কারণ, কিন্তু এর অর্থ এই নয় যে দ্রুত RSI অবশ্যই এমন একটি ফলাফল, যা আমাদের অর্জনের চেষ্টা করা উচিত. এগোনো হবে কি না এবং কিভাবে এগোনো হবে, তা নির্ভর করতে হবে মানুষের নিয়ন্ত্রণ বজায় রাখার আমাদের সক্ষমতার উপর এবং সুফল ও ঝুঁকি সম্পর্কে তথ্যসমৃদ্ধ গণতান্ত্রিক সিদ্ধান্তের উপর.

আমরা এখনও জানি না কিভাবে নিরাপদে পুরোপুরি সামঞ্জস্যপূর্ণ, পূর্ণাঙ্গ RSI-তে পৌঁছানো যায়. আমরা সক্ষমতার সঙ্গে তাল মিলিয়ে অ্যালাইনমেন্ট ও নিরাপত্তা ব্যবস্থা প্রসারিত করার কাজ করছি. কিন্তু আমরা ধরে নিতে পারি না যে অ্যালাইনমেন্ট ও নিরাপত্তার অগ্রগতি তাল মিলিয়ে চলবে এবং আরও সক্ষম সিস্টেমগুলো পর্যবেক্ষণ করা আরও কঠিন হয়ে উঠতে পারে. সতর্ক অ্যালাইনমেন্ট ও নিরাপত্তা সংক্রান্ত কাজ এই প্রচেষ্টার কেন্দ্রে রয়েছে এবং এটি শুরু হয় আজ এজেন্টিক কোডিং সিস্টেমে আমরা যে নিরাপত্তা সমস্যাগুলো দেখি সেগুলো পরিমাপ ও প্রশমনের মাধ্যমে. যখনই আমরা দেখব যে এগিয়ে যাওয়া একটি অগ্রহণযোগ্য নিরাপত্তা ঝুঁকি তৈরি করবে, তখন আমরা যথাযথভাবে প্রতিক্রিয়া জানাব—এর মধ্যে এমন সিস্টেমগুলোর উন্নয়ন বা মোতায়েন ধীর করা বা বন্ধ করাও অন্তর্ভুক্ত, যেগুলোকে আমরা পর্যাপ্তভাবে সুরক্ষিত রাখতে অক্ষম বলে মনে করি.

সাম্প্রতিক Hugging Face ঘটনার পর, আমরা এই প্রতিশ্রুতি বাস্তবায়ন করেছি⁠, ডেপ্লয়মেন্টের জন্য নির্ধারিত আমাদের সর্বশেষ মডেলগুলোর রিইনফোর্সমেন্ট লার্নিং (RL) প্রশিক্ষণে বিরতি দিয়ে; এ সময় আমরা আমাদের গবেষণা পরিবেশ আরও সুরক্ষিত করেছি, রেড-টিম পরীক্ষা চালিয়েছি এবং আমাদের পর্যবেক্ষণ ব্যবস্থার আওতা বাড়িয়েছি. এতে সব গবেষণা বন্ধ হয়ে যায়নি: কিছু ওয়ার্কলোড আরও কঠোর নিয়ন্ত্রণের অধীনে আবার শুরু হয়েছিল, আর অন্যগুলো স্থগিতই ছিল. আমরা আমাদের সুরক্ষা ও অ্যালাইনমেন্ট মানদণ্ড বাড়িয়েছি এবং মডেলের জীবনচক্রের আরও গভীরে সুরক্ষা বিষয়ক কাজ অন্তর্ভুক্ত করেছি, যাতে পুরো প্রশিক্ষণজুড়ে অ্যালাইনমেন্টপূর্ণ আচরণের আরও শক্তিশালী প্রমাণ প্রয়োজন হয়.

আজ আমরা সাম্প্রতিক মাসগুলোতে RSI-এর দিকে আমাদের অগ্রগতিতে এজেন্টিক সিস্টেমগুলো কিভাবে অবদান রেখেছে, তার একটি বিশদ চিত্র তুলে ধরছি. এজেন্টিক সিস্টেমগুলো নতুন এবং দ্রুত পরিবর্তিত হচ্ছে, আর পরিমাপ-সংক্রান্ত আমাদের প্রচেষ্টাগুলো এখনও প্রাথমিক পর্যায়ে রয়েছে. এই প্রাথমিক ফলাফল এবং সেগুলোর পেছনের পদ্ধতিগুলো শেয়ার করার মাধ্যমে, আমরা জনসাধারণকে অবহিত করতে, জনসমক্ষে প্রকাশের একটি রীতি উৎসাহিত করতে এবং ক্ষেত্রটিকে পরিমাপের অভিন্ন মানদণ্ডের দিকে এগিয়ে নিতে সহায়তা করতে চাই.

শেষ পর্যন্ত, আমাদের অত্যাধুনিক নীতি রূপরেখায়⁠ যেমন লিখেছি, আমরা বিশ্বাস করি যে আমাদের এবং অন্যান্য কোম্পানির RSI-এর দিকে অগ্রগতি প্রকাশ্যে ট্র্যাক করা বাধ্যতামূলক হওয়া উচিত. এ ধরনের কোনো বাধ্যবাধকতা না থাকলেও, আমরা আমাদের RSI অগ্রগতি সম্পর্কে স্বচ্ছতা বজায় রাখা চালিয়ে যাওয়ার পরিকল্পনা করছি. আমাদের পরিমাপের কৌশল ও বোঝাপড়া উন্নত হওয়ার সঙ্গে সঙ্গে, নিরাপত্তা ও মালিকানাধীন তথ্য সুরক্ষিত রাখার প্রয়োজনের সঙ্গে ভারসাম্য বজায় রেখে আমরা আমাদের স্বচ্ছতা-বিষয়ক পদ্ধতি পরিমার্জন করব.

1. কোডিং এজেন্টগুলো OpenAI-এর গবেষকদের দৈনন্দিন কাজকে নতুনভাবে রূপ দিচ্ছে

এই বছরের শুরুতে, OpenAI-তে এজেন্ট ব্যবহারের ভিত্তিতে মধ্যম মানের গবেষক কোডিং এজেন্ট শুধুমাত্র পরিমিত পরিমাণে ব্যবহার করছিলেন. আগস্টের মাঝামাঝি নাগাদ, গড়পড়তা গবেষকরা তাদের কাজে প্রতিদিন এজেন্টদের অন্তর্ভুক্ত করছিলেন, যার জন্য এপিআই মূল্য অনুযায়ী দৈনিক $600 এরও বেশি খরচ হচ্ছিল. আমাদের গবেষণা প্রতিষ্ঠানের 90 তম পার্সেন্টাইলের ব্যবহারকারী এখন প্রতিদিন $7,000 এর বেশি মূল্যের টোকেন ব্যবহার করেন.

জুন 2026-এর আগে, গবেষণা সংস্থা জুড়ে এজেন্টগুলোর মোট কার্যকাল তখনও মোট মানবশ্রমের চেয়ে কম ছিল. এরপর থেকে তা পরিবর্তিত হয়েছে. একটি মানক 8 ঘণ্টার কর্মদিবসের হিসেবে, আগস্টের মাঝামাঝি পর্যন্ত গবেষণা সংস্থাটি প্রতি মানবশ্রমের কর্মদিবসের জন্য মোট 3.1 এজেন্ট-কর্মদিবসের প্রচেষ্টা ব্যবহার করে.

এটি দেখার আরেকটি উপায় হলো বোঝা যে কতজন গবেষক উচ্চমাত্রায় সমান্তরাল ওয়ার্কফ্লো ব্যবহার করেন (যেমন, একই সঙ্গে চার বা তার বেশি এজেন্ট চালানো). নিচে যেমন দেখানো হয়েছে, এই সংখ্যাটি বাড়ছে. এই পরিসংখ্যানগুলিতে ব্যবহারকারীর সরাসরি শুরু করা এজেন্ট এবং ব্যবহারকারীর সরাসরি চালু করা সেগুলো থেকে ডাউনস্ট্রিমে তৈরি সাব-এজেন্ট—উভয়ের দৈনিক সর্বোচ্চ সংখ্যা অন্তর্ভুক্ত রয়েছে.

2. গবেষকরা আরও বেশি কোড লিখছেন এবং আরও বেশি পরীক্ষা চালাচ্ছেন

AI গবেষণার বড় একটি অংশকে শ্রমনিবিড় প্রক্রিয়া হিসেবে দেখা যায়, যার লক্ষ্য হলো মডেলের বুদ্ধিমত্তা বা পারফরম্যান্সে নতুন কোনো উন্নতি আমাদের মূল মডেলগুলোর একটিতে যুক্ত করা. প্রক্রিয়াটি অনেক ধাপের উপর নির্ভর করে এবং সব ধাপ একসঙ্গে সঠিকভাবে সম্পন্ন হলে সক্ষমতা এগিয়ে যায়: গবেষকদের নতুন উন্নতি নকশা করতে হয়, মডেলের পারফরম্যান্স বিচার করতে মূল্যায়ন লিখতে হয়, এই উন্নতিগুলোকে ব্যাপক পরিসরে পরীক্ষা করার অবকাঠামো তৈরি করতে হয়, প্রশিক্ষণের সময় বাগের পাশাপাশি অনিরাপদ বা অসামঞ্জস্যপূর্ণ আচরণ শনাক্ত করতে হয় এবং সফল ধারণাগুলোকে একটি মূল প্রশিক্ষণ রানে যুক্ত করতে হয়. গবেষণা প্রক্রিয়ার যেকোনো অংশে ব্যর্থতা পুরো চক্রকে সীমাবদ্ধ করে দিতে পারে.

কোড লেখা এবং পরীক্ষা-নিরীক্ষা চালানো হলো গবেষকদের কাজের অংশ হিসেবে করা দুটি প্রধান কার্যক্রম এবং আমরা এমন প্রমাণ দেখতে পাচ্ছি যে এই প্রক্রিয়াগুলো ত্বরান্বিত হচ্ছে.

এই ডেটা পয়েন্টগুলো পরিমাপ করা তুলনামূলকভাবে সহজ, কিন্তু ব্যাখ্যা করা কঠিন হতে পারে. স্বয়ংক্রিয়করণ এগিয়ে যাওয়ার সঙ্গে সঙ্গে, যে কাজগুলো সবচেয়ে কম স্বয়ংক্রিয় করা যায়, সেগুলো গবেষকদের প্রচেষ্টার আরও বড় অংশ দখল করবে এবং ভবিষ্যৎ অগ্রগতির পথে গুরুত্বপূর্ণ বাধা হয়ে উঠবে. কম্পিউট অগ্রগতির আরেকটি সীমাবদ্ধকারী কারণ এবং সময়ের সঙ্গে সঙ্গে অন্যান্য বাধাগুলো কমে যাওয়ার সঙ্গে সঙ্গে এটি আরও গুরুত্বপূর্ণ হয়ে উঠতে পারে.

2026 জুড়ে, সক্রিয় পরীক্ষকপ্রতি পরীক্ষার সংখ্যা বেড়েছে এবং জানুয়ারি 2025-এ ট্র্যাকিং শুরু হওয়ার পর থেকে আগস্ট 2026 সর্বকালের উচ্চ পর্যায়ে ছিল. এটি Codex গ্রহণের বৃদ্ধির সঙ্গে সম্পর্কিত, যদিও আমরা লক্ষ করছি যে 2025 সাল থেকে আমাদের উপলভ্য কম্পিউট সক্ষমতাও উল্লেখযোগ্যভাবে বেড়েছে.

3. গবেষকেরা যে কাজের জন্য এজেন্ট ব্যবহার করেন, তা বদলে যাচ্ছে

গুণগত পর্যবেক্ষণ ও অভ্যন্তরীণ তথ্য উভয়ই ইঙ্গিত দেয় যে গবেষকেরা কোডিং এজেন্টদের কাছে যে কাজগুলো অর্পণ করেন, সেগুলোর ধরন বদলাচ্ছে; সময়ের সঙ্গে উচ্চ স্তরের ও দীর্ঘমেয়াদি কাজ অর্পণ করা আরও সাধারণ হয়ে উঠছে.

এই প্রবণতা সম্পর্কে আরও স্পষ্ট ধারণা পেতে, আমরা Epoch AI দ্বারা তৈরি AI R&D জীবনচক্রের অংশ হিসেবে থাকা বিভিন্ন ধরনের কাজের একটি সম্প্রতি প্রকাশিত শ্রেণিবিন্যাস⁠(একটি নতুন উইন্ডোতে খোলে) ব্যবহার করে গবেষণা প্রতিষ্ঠানে সাম্প্রতিক ব্যবহার বিশ্লেষণ করেছি. সব ধরনের কাজকে শ্রেণীবদ্ধ করার দীর্ঘদিনের O*NET সিস্টেম থেকে অনুপ্রাণিত এই শ্রেণীবিন্যাসটি অত্যাধুনিক AI R&D-এর জন্য বিশেষভাবে তৈরি এবং প্রক্রিয়াটিকে ছয়টি প্রধান ধাপে ভাগ করে:

  1. সিদ্ধান্ত নিন: কী নিয়ে কাজ করবেন, কী চালিয়ে যাবেন, কোথায় বরাদ্দ করবেন

  2. ডিজাইন: গবেষণার ধারণা ও প্রকৌশলগত স্পেসিফিকেশন

  3. বিল্ড: কোড ও ডেটাসেট

  4. রান: প্রশিক্ষণ/মূল্যায়ন রান, হার্ডওয়্যার, সার্ভিং

  5. বিশ্লেষণ করুন: পরীক্ষা-নিরীক্ষা, মডেল, ডিপ্লয়মেন্ট, বাহ্যিক কাজ

  6. যোগাযোগ করুন: প্রাপ্ত ফলাফল, মতামত, অবস্থা, সিদ্ধান্ত

নিচে, আমরা এই শ্রেণীবিন্যাসের অধীনে কোডিং এজেন্ট টোকেনগুলোকে শ্রেণিবদ্ধ করি.

আমরা দেখতে পাচ্ছি যে 2026 সালের জানুয়ারি থেকে আগস্টের মধ্যে গবেষণা কার্যক্রমের সব বিভাগে বৃদ্ধি পেয়েছে. জানুয়ারিতে, প্রধান বিভাগ ছিল গবেষণা ও অবকাঠামো কোড. এই ক্যাটাগরিটি সম্প্রসারিত হয়েছে, তবে আমরা অতিরিক্ত ক্যাটাগরিগুলোতেও উল্লেখযোগ্য বৃদ্ধি দেখছি, বিশেষ করে প্রযুক্তিগত সহায়তা এবং মনিটরিং রানগুলোতে. উচ্চ-স্তরের পরিকল্পনা এখনও এজেন্টের আউটপুট টোকেনের একটি ন্যূনতম অংশ হিসেবে রয়ে গেছে.

অভিজ্ঞতাভিত্তিকভাবে, সহকর্মীরা জানান যে কোডিং এজেন্টগুলো অভ্যন্তরীণ গবেষণা অবকাঠামোর সমস্যা সমাধানে অত্যন্ত দক্ষ, যা গবেষণার অগ্রগতির একটি তাৎপর্যপূর্ণ প্রতিবন্ধকতা দূর করে. গবেষকদের তাদের পরীক্ষার সমস্যা সমাধানে সহায়তা করতে আগে নির্ধারিত পরামর্শ সেশন আয়োজন করত এমন একাধিক দল 2026 সালে উপস্থিতি কমে যাওয়ার কথা জানিয়েছে এবং তাদের মধ্যে একটি দল অন্যান্য সিস্টেমের উন্নয়নে মনোযোগ দিতে সেশন আয়োজন পুরোপুরি বন্ধ করে দিয়েছে.

এখানে, আমরা সেই প্রধান অভ্যন্তরীণ চ্যানেলগুলোর একটিতে প্রতিদিনের শীর্ষ-স্তরের পোস্টের সংখ্যা প্লট করি, যেখানে গবেষকরা অন্যান্য টিমের কাছ থেকে প্রযুক্তিগত সহায়তা চান. আমাদের জানা মতে, চ্যানেলটির কার্যক্রম কমে যাওয়া মানুষ দ্বারা পরিচালিত অন্য কোনো প্রযুক্তিগত সহায়তা চ্যানেলে জিজ্ঞাসাগুলো সরে যাওয়ার মাধ্যমে পুষিয়ে যায়নি. ট্রাফিকের এই হ্রাসটি এই বৃহত্তর পরিবর্তনের সঙ্গে সামঞ্জস্যপূর্ণ.

গবেষকেরা যে কাজগুলো করতে বলেন, সেগুলোতে কোডিং এজেন্টগুলো সফল হচ্ছে কি না, সেটিও আমরা অধ্যয়ন করতে পারি. একটি এজেন্টিক ক্লাসিফায়ার ব্যবহার করে আমরা দেখতে পাই যে জানুয়ারি থেকে জুলাই পর্যন্ত, যেসব কাজের জন্য আমরা গ্রাউন্ড ট্রুথ ফলাফল খুঁজে পেতে পারি, সেসব কাজের ক্ষেত্রে কঠিনতার কয়েকটি স্তরজুড়ে—যেখানে কঠিনতার মানদণ্ড হিসেবে কাজটি সম্পন্ন করতে একজন মানুষের আনুমানিক কত সময় লাগবে তা ধরা হয়েছে—সাফল্যের হার সাধারণত বৃদ্ধি পেয়েছে. তবে সফল হতে এজেন্টগুলোর এখনও উল্লেখযোগ্য মাত্রার মানবিক দিকনির্দেশনার প্রয়োজন হয়, বিশেষ করে কাজের জটিলতা বাড়ার সঙ্গে সঙ্গে. গত 6 মাসে, সফল 4-8 ঘণ্টার কাজগুলোর অর্ধেকেরও বেশি ক্ষেত্রে এক বা তার বেশি হস্তক্ষেপ জড়িত ছিল.

গবেষক-সংক্রান্ত কাজগুলোতে সাফল্যের হার সময়ের সাথে সাথে বেড়েছে. গ্রাফটিতে সেইসব শ্রেণিবিন্যাস বাদ দেওয়া হয়েছে যেগুলোর ফলাফল অনিশ্চিত ছিল এবং সেইসব পয়েন্টও বাদ দেওয়া হয়েছে যেগুলোর সেশন সংখ্যা 50-এর কম অথবা স্বতন্ত্র ব্যবহারকারী সংখ্যা 50-এর কম.

জানুয়ারি থেকে জুলাই পর্যন্ত টাস্ক সফলতা ও হস্তক্ষেপের হার, সময়সীমা অনুযায়ী বিভক্ত. যেসব শ্রেণিবিন্যাসের ফলাফল অনিশ্চিত ছিল, সেগুলো বাদ দেয়.

4. মডেল উন্নয়নের গতি নির্ধারণ

নিরাপদ ও উপকারী AGI-এর জন্য আরও সক্ষম সিস্টেমের দিকে অগ্রগতি এমন কাজের জন্য প্রয়োজনীয় সুরক্ষা ব্যবস্থার উপরও নির্ভর করবে. ঝুঁকিগুলো সম্পর্কে আরও জানার সঙ্গে সঙ্গে প্রয়োজনীয় সুরক্ষা ব্যবস্থা সম্পর্কে আমাদের মূল্যায়ন পরিবর্তিত হতে পারে.

আমরা যেমন বর্ণনা করেছি,⁠ আমরা সম্প্রতি পর্যবেক্ষণ, সামঞ্জস্য এবং নিরাপত্তার জন্য আমাদের মানদণ্ড আপডেট করেছি. এখানে, আমরা দেখাচ্ছি যে সাম্প্রতিক বিধিনিষেধ গবেষণা কার্যক্রমের একটি দিককে কিভাবে প্রভাবিত করেছে.

*20 জুলাই থেকে 6 আগস্টের মধ্যে এখানে দেখানো Astra কম্পিউটের বেশিরভাগই সুরক্ষা ও নিরাপত্তা উন্নয়ন বাস্তবায়ন পরীক্ষা করার উদ্দেশ্যে ছিল.

20 জুলাই, এজেন্টরা আমাদের গবেষণা অবকাঠামোর নিরাপত্তা লঙ্ঘন করেছে বলে জানতে পারার পর, আমরা প্রশিক্ষণের জন্য ব্যবহৃত কনটেইনার পরিষেবাটি সাময়িকভাবে বন্ধ করে দিই এবং পরে উল্লেখযোগ্য অতিরিক্ত বিধিনিষেধসহ পুনরায় চালু করি.

এর ফলে দলগুলো কঠোরভাবে সুরক্ষিত গবেষণা পরিবেশের মধ্যে কাজ করার উপযোগী করে তাদের কর্মপ্রবাহ পুনর্বিন্যাস করার সময় RL প্রশিক্ষণ কম্পিউটের তীব্র হ্রাস ঘটে. উপরের চিত্রে ডেপ্লয়মেন্টের জন্য নির্ধারিত আমাদের সর্বশেষ মডেলগুলোর রিইনফোর্সমেন্ট লার্নিংয়ে দুই সপ্তাহের বিরতি অন্তর্ভুক্ত রয়েছে. 20 জুলাই থেকে 6 আগস্টের মধ্যে হওয়া Astra-শ্রেণির RL পরীক্ষাগুলোর মধ্যে GPU বরাদ্দের ভিত্তিতে অধিকাংশ রান সুরক্ষা ও নিরাপত্তা উন্নয়নগুলোর বাস্তবায়ন পরীক্ষা করার উদ্দেশ্যে ছিল.

7 আগস্ট, আমাদের গুরুত্বপূর্ণ সাইবার সক্ষমতা থাকতে পারে⁠ —এমন প্রাথমিক প্রমাণের ফলে প্রিপেয়ার্ডনেস ফ্রেমওয়ার্কের⁠(একটি নতুন উইন্ডোতে খোলে) অধীনে অতিরিক্ত মডেল-নির্দিষ্ট নিরাপত্তা বিধিনিষেধ আরোপ করা হয়, যার কারণে Astra মডেলকে উচ্চতর নিরাপত্তার গবেষণা পরিবেশে চালাতে হয়েছে. পরের সপ্তাহে Astra-শ্রেণির GPU বরাদ্দ আরও 59.2 শতাংশ কমে, কিন্তু অন্য মডেল শ্রেণিতে বরাদ্দ 17.2 শতাংশ বেড়ে যায়. সেই বৃদ্ধি Astra-শ্রেণির হ্রাসের প্রায় 85 শতাংশ পুষিয়ে দিয়েছে, ফলে বিশ্লেষিত RL ওয়ার্কলোডগুলিতে মোট বরাদ্দ মোটামুটি অপরিবর্তিত রয়েছে. Astra-সম্পৃক্ত কাজ সীমিত থাকার সময় কিছু প্রশিক্ষণ ও পরীক্ষানিরীক্ষা নন-Astra মডেলে স্থানান্তরের সঙ্গে এই ধারা সামঞ্জস্যপূর্ণ এবং নতুন বিধিনিষেধের আওতাভুক্ত ওয়ার্কলোডে আর ব্যবহার করা না যাওয়া কম্পিউটের অন্য ব্যবহার গবেষকেরা খুঁজে পেয়েছেন—এমন উপাখ্যানভিত্তিক প্রতিবেদনের সঙ্গেও এটি মেলে.

এই ডেটা প্রশিক্ষণ ও নিরাপত্তা নিয়ে চলমান আলোচনার জন্য একটি উপযোগী সংকেত দেয়: যখন নতুন নিয়ন্ত্রণ ব্যবস্থা চালু করা হয়, তখন কম্পিউটিং ক্ষমতা মূল্যবান ও নমনীয়ই থাকে এবং গবেষণা পরিসরের মধ্যে স্বাভাবিকভাবেই বিকল্প ব্যবহারের দিকে পরিচালিত হবে. দীর্ঘমেয়াদে, AI অগ্রগতির গতি নিয়ে আলোচনাগুলো নতুন বা প্রস্তাবিত নিয়ন্ত্রণের আওতাধীন গণনাগত সম্পদ কিভাবে সর্বোত্তমভাবে ব্যবহার করা যেতে পারে—সেই প্রশ্ন পর্যন্তও বিস্তৃত হওয়া উচিত.

5. সামনের পথ

সামঞ্জস্যপূর্ণ RSI-এর দিকে অগ্রগতি করা এবং সেই অগ্রগতি বোঝা আমাদের মিশনের জন্য গুরুত্বপূর্ণ. আমরা আমাদের পদ্ধতিগুলো আরও পরিমার্জন করব, বিকশিত হওয়া বোঝাপড়া সম্পর্কে জানাব এবং অত্যাধুনিক সিস্টেমগুলোর বিষয়ে অবগত জনসাধারণের বিতর্ক ও অর্থবহ গণতান্ত্রিক শাসনের দিকে কাজ করব.

অ্যাপেন্ডিক্স: এই পোস্টের জন্য আমাদের পদ্ধতিগুলো

এজেন্ট-চালিত AI গবেষণা এখনও নতুন এবং আমরা এখনও শিখছি কিভাবে এটি পরিমাপ করতে হয়. কিছু সূচক, যেমন আমাদের গবেষণা দলগুলো যে পরিমাণ কোড তৈরি করে, সংগ্রহ করা তুলনামূলকভাবে সহজ, কিন্তু ব্যাখ্যা করা কঠিন, কারণ গবেষণার অগ্রগতির সঙ্গে এগুলোর সম্পর্ক অনিশ্চিত. গবেষণার অগ্রগতির উপর আরও সরাসরি গুরুত্ব দেয় এমন মেট্রিক্স—যেমন গবেষকেরা এজেন্টদের যে কাজ দেন, সেগুলোতে এজেন্টরা কত ঘন ঘন সফল হয়—আরও কার্যকর হতে পারে, তবে সেগুলো তৈরি ও যাচাই করা জটিল. জটিলতা আরও বাড়িয়ে, গবেষকেরা যেসব সরঞ্জাম ও সিস্টেমের উপর নির্ভর করেন, সেগুলো দ্রুত বিকশিত হচ্ছে. গবেষণা ত্বরান্বিত করার বিষয়ে আমাদের বোঝাপড়া গভীর করা OpenAI জুড়ে একটি গুরুত্বপূর্ণ অগ্রাধিকারের ক্ষেত্র.

এই বিশ্লেষণগুলোতে, অন্যথায় উল্লেখ না থাকলে:

  • “গবেষক” বলতে আমাদের গবেষণা সংস্থার যেকোনো সদস্যকে বোঝাতে একটি বিস্তৃত পরিভাষা; এর মধ্যে এমন ব্যক্তিরাও অন্তর্ভুক্ত, যারা গবেষণা অবকাঠামো তৈরি করেন, গবেষণা প্রকল্প পরিচালনা করেন অথবা অন্য কোনোভাবে এই উদ্যোগকে সহায়তা করেন.

  • গবেষকরা যেসব টুল ও সিস্টেমের উপর নির্ভর করেন, সেগুলোর দ্রুত বিবর্তনের কারণে কোডিং এজেন্ট ব্যবহারের মেট্রিকগুলো বেশিরভাগ ব্যবহারকে অন্তর্ভুক্ত করে, তবে সব ব্যবহারকে নয়.