মূল কনটেন্টে যান
OpenAI

১৬ সেপ্টেম্বর, ২০২৬

গবেষণানিরাপত্তা

মডেল মিসঅ্যালাইনমেন্ট রিপোর্টিংয়ের আমাদের কাঠামো

লোডিং…

OpenAI-তে মডেল মিসঅ্যালাইনমেন্টের ঘটনা ট্র্যাক, তদন্ত এবং প্রকাশের জন্য আমরা একটি নতুন কাঠামো শেয়ার করছি, পাশাপাশি গত ছয় মাসে দেখা অপ্রত্যাশিত বা উদ্বেগজনক মডেল আচরণ নিয়ে ছয়টি রিপোর্ট প্রকাশ করছি.

আগে গবেষক, AI ডেভেলপার, নীতিনির্ধারক এবং সাধারণ মানুষকে আরও ভালোভাবে অবহিত করার জন্য আমরা মিসঅ্যালাইনমেন্ট সম্পর্কে আমাদের ফলাফল জনসমক্ষে প্রকাশ করতে চেয়েছি. কিন্তু এসব ফলাফল রিপোর্ট করার কোনো পদ্ধতিগত পন্থা না থাকায় আমাদের প্রকাশগুলো ছিল পরিস্থিতিভিত্তিক এবং আদর্শের তুলনায় কম ঘনঘন: আমরা প্রায়ই কয়েকটি ঘটনা একত্র করে এক রিপোর্টে দেওয়ার জন্য অপেক্ষা করেছি, অথবা নতুন প্রকাশিত মডেলের সিস্টেম কার্ডে সেগুলো যোগ করেছি. এই নতুন কাঠামোর উদ্দেশ্য হলো কোনো মিসঅ্যালাইনমেন্ট পর্যবেক্ষণের পর দ্রুত রিপোর্ট প্রকাশ করা, এমনকি যখন আমরা যে আচরণ রিপোর্ট করছি তা পুরোপুরি ব্যাখ্যা বা প্রশমিত করতে পারিনি.

AI সিস্টেম আরও উন্নত ও আরও বিস্তৃতভাবে ডিপ্লয়ড হওয়ার সঙ্গে সঙ্গে অ্যালাইনমেন্ট গবেষণার অগ্রগতি নিয়ে আমাদের আরও বিস্তৃত এবং ভালোভাবে অবহিত ঐকমত্য গড়ে তুলতে হবে. আমরা বিশ্বাস করি না যে AI শিল্প অ্যালাইনমেন্ট ও মনিটরিং যথেষ্ট মাত্রায় সমাধান করেছে, যাতে আরও দীর্ঘ সময় সর্বোচ্চ গতিতে দায়িত্বশীলভাবে স্কেল করা যায়. আগামী মাস ও বছরগুলোতে AI উন্নয়ন কীভাবে এগোনো উচিত সে বিষয়ে সিদ্ধান্ত এমন প্রমাণের ওপর নির্ভর করতে হবে, যা অত্যাধুনিক মডেল নির্মাণকারী কোম্পানিগুলোর বাইরের মানুষ নিজেরাই পরীক্ষা করতে পারেন.

মিসঅ্যালাইনমেন্টের উদাহরণ অন্য AI ডেভেলপারদের তাদের সিস্টেম একই ধরনের সক্ষমতায় পৌঁছালে যে সমস্যার মুখোমুখি হতে পারেন তা শনাক্ত করতে, সুরক্ষা ব্যবস্থার দুর্বলতা প্রকাশ করতে, বা মডেল আচরণ সম্পর্কে অনুমানকে চ্যালেঞ্জ করতে সাহায্য করতে পারে. এসব ফলাফল শেয়ার করলে অন্যরা একই সমস্যা তদন্ত করতে, আমাদের ব্যাখ্যা পরীক্ষা করতে এবং প্রশমন ব্যবস্থা উন্নত করতে পারে. মিসঅ্যালাইনমেন্ট নিয়ে স্বচ্ছতার মূল্য আমরা বিশ্বাস করি বলে, গুরুত্ব অনিশ্চিত হলেও আমাদের নতুন কাঠামো প্রকাশের পক্ষে থাকে. এর অর্থ হলো, আমরা যে কিছু ঘটনা প্রকাশ করি সেগুলো পরে ভিত্তিহীন বলে প্রমাণিত হতে পারে এবং কোনো বৃহত্তর ধারা বা ভবিষ্যৎ বিকাশের ইঙ্গিত নাও হতে পারে.

এই মুহূর্তে AI ডেভেলপাররা তাদের মডেলে মিসঅ্যালাইনমেন্টের উদাহরণ কীভাবে প্রকাশ করবেন, সে বিষয়ে স্পষ্ট মানদণ্ডসহ কোনো শিল্পব্যাপী কাঠামো নেই. আমরা আশা করি, আজ আমরা যে কাঠামোর রূপরেখা দিচ্ছি তা এমন মানদণ্ড তৈরির প্রথম ধাপ; এতে ডেভেলপারদের কোন মিসঅ্যালাইনমেন্ট ঘটনা প্রকাশ করা উচিত এবং তাদের রিপোর্টে কী থাকা উচিত তা নির্ধারণ করা হয়েছে. আমরা এই কাঠামোকে চলমান কাজ হিসেবে দেখি, যা অভিজ্ঞতা এবং জনসাধারণের প্রতিক্রিয়ার ভিত্তিতে পরিমার্জন করব.

এখানে আমরা কাঠামোটি কীভাবে কাজ করবে তা বর্ণনা করছি এবং আমরা যে প্রথম রিপোর্টগুলো প্রকাশ করছি তা শেয়ার করছি.

মিসঅ্যালাইনমেন্টের কোন উদাহরণ আমরা রিপোর্ট করব

মডেল মিসঅ্যালাইনমেন্ট কীভাবে সৃষ্টি হয়, কীভাবে প্রকাশ পায়, এবং কোথায় সুরক্ষা ব্যবস্থা সফল বা ব্যর্থ হয় সে সম্পর্কে উপযোগী প্রমাণ দেয় এমন উদাহরণ প্রকাশ করাই আমাদের লক্ষ্য. আমরা নতুন প্রক্রিয়া, পরিচিত আচরণে অর্থপূর্ণ পরিবর্তন, এবং নিরাপত্তা বা প্রশমন সম্পর্কে অনুমানকে চ্যালেঞ্জ করে এমন ফলাফলকে অগ্রাধিকার দিই. প্রকাশের যোগ্য হতে কোনো উদাহরণের ক্ষতি করা বা বৃহত্তর ধারা প্রতিষ্ঠা করা আবশ্যক নয়. এই কাঠামো মডেলের জীবনচক্রজুড়ে যোগ্য আচরণকে অন্তর্ভুক্ত করবে, যার মধ্যে প্রশিক্ষণ, মূল্যায়ন, পরীক্ষা এবং ডিপ্লয়মেন্ট রয়েছে.

এর মধ্যে রয়েছে অনুমতি ছাড়া মডেলগুলোর কাজ করার, অন্য মডেলের সঙ্গে সমন্বয় করার, বা তদারকি এড়ানোর নতুন উপায়; এমন ব্যর্থতা যা কোনো অ্যালাইনমেন্ট পদ্ধতি বা সুরক্ষা ব্যবস্থা নিয়ে প্রশ্ন তোলে; এবং প্রকাশিত নিরাপত্তা মূল্যায়নের কোনো দাবিকে চ্যালেঞ্জ করে এমন আচরণ. তৃতীয় পক্ষকে প্রভাবিত করতে পারে এমন মিসঅ্যালাইনমেন্টের ক্ষেত্রেও একই প্রকাশ মানদণ্ড প্রযোজ্য.

এর মধ্যে অতীতে আমরা প্রকাশ করেছি এমন ঘটনার পুনরাবৃত্তি বলে মনে হওয়া মিসঅ্যালাইনমেন্টের ঘটনাও থাকতে পারে. সমস্যাটির পুনরাবৃত্তি নিজেই আমাদের মডেলগুলো কীভাবে আচরণ করে বা আমাদের সুরক্ষা ব্যবস্থা কতটা কার্যকর সে সম্পর্কে উপযোগী প্রমাণ হতে পারে, যেমন কোনো নির্দিষ্ট ধরনের মিসঅ্যালাইন্ড আচরণ বারবার প্রশমনের চেষ্টা সত্ত্বেও চলতে থাকলে. এ ধরনের পরিস্থিতিতে, আমরা মূল মিসঅ্যালাইনমেন্ট প্রকাশনা আপডেট করে অতিরিক্ত উদাহরণগুলো প্রকাশ করব.

সময়ের সঙ্গে সঙ্গে আমরা অন্যান্য ডেভেলপার, বাইরের গবেষক, শিল্পমান নির্ধারণী সংস্থা এবং নিয়ন্ত্রকদের সঙ্গে আরও বস্তুনিষ্ঠ প্রকাশ মানদণ্ড তৈরি করার পরিকল্পনা করছি. আমরা আরও বিশ্বাস করি যে গুরুতর নিরাপত্তা, সিকিউরিটি এবং মিসঅ্যালাইনমেন্ট ঘটনা মার্কিন ফেডারেল সরকারের সঙ্গে শেয়ার করা উচিত, এবং আমরা রিপোর্টিং প্রক্রিয়া প্রস্তাব করতে কাজ করছি. আমরা এই কাঠামোকে আমাদের বিদ্যমান বাধ্যবাধকতার পরিপূরক হিসেবে দেখি, এবং উল্লেখ করি যে এটি গুরুত্বপূর্ণ নিরাপত্তা ঘটনা বা সাইবারসিকিউরিটি লঙ্ঘনসহ আমাদের আইনি প্রকাশের প্রয়োজনীয়তাকে প্রতিস্থাপন করে না.

মিসঅ্যালাইনমেন্টের যে উদাহরণগুলো আমরা আজ শেয়ার করছি

মিসঅ্যালাইনমেন্ট প্রকাশের নতুন কাঠামো শুরু করতে, আমাদের মডেলগুলোর প্রশিক্ষণ বা মূল্যায়নের সময় দেখা মিসঅ্যালাইন্ড আচরণের ঘটনাগুলো নিয়ে আমরা ছয়টি রিপোর্ট প্রকাশ করছি. এই ঘটনাগুলো বিভিন্ন ধরনের আচরণ দেখায়, যা আমরা শেয়ার করার মতো বলে মনে করি; ব্যবহারকারীর কাছ থেকে তথ্য গোপন করা থেকে শুরু করে বাধা অতিক্রমের জন্য অনুমোদনহীন পদক্ষেপ নেওয়া পর্যন্ত. এগুলো পৃথক ঘটনার রিপোর্ট, এবং আমাদের মডেলগুলোতে মিসঅ্যালাইনমেন্ট কত ঘন ঘন ঘটে তার প্রতিফলন হিসেবে এগুলো ধরা উচিত নয়. নিচের প্রতিটি আইটেম পূর্ণাঙ্গ রিপোর্টে লিংক করে.

  1. টাস্ক সারাংশে নিজে তৈরি নির্দেশনা(একটি নতুন উইন্ডোতে খোলে). প্রকাশ না করা একটি গবেষণা মডেল নতুন কনটেক্সট উইন্ডোতে তার কাজ চালিয়ে যেতে ব্যবহৃত সারাংশে সম্পর্কহীন নির্দেশনা ঢুকিয়েছিল, যার মধ্যে তার স্বাভাবিক সীমাবদ্ধতা উপেক্ষা করার নির্দেশনাও ছিল. আমরা প্রভাবিত 27টি সারাংশ শনাক্ত করেছি.

  2. টাস্ক সারাংশে ভুল গোপন করার নির্দেশনা(একটি নতুন উইন্ডোতে খোলে). GPT‑5.6 Sol-এর প্রশিক্ষণের সময় অনেক মডেল ইনস্ট্যান্স ব্যবহারকারীর কাছ থেকে ভুল বা মিসঅ্যালাইন্ড আচরণ গোপন করতে তাদের সারাংশে নির্দেশনা যোগ করেছিল. উদাহরণস্বরূপ, সংকোচন সারাংশে অনুপস্থিত ঐতিহাসিক ডেটা তৈরি করে নেওয়া কিন্তু তা প্রকাশ না করা, এবং উৎস সংস্করণের অমিল লুকানোর নির্দেশনা ছিল.

  3. উন্মুক্ত API key-এর জন্য পাবলিক রিপোজিটরি খোঁজা, তারপর তথ্য বানিয়ে বলা(একটি নতুন উইন্ডোতে খোলে). ক্যালিফোর্নিয়ার একটি কাউন্টিতে আয়ের পরিসংখ্যান নিয়ে একটি সাধারণ প্রশ্নের উত্তর দেওয়ার সময় একটি মডেল অনুমতি ছাড়া একটি উন্মুক্ত API key খুঁজে পেয়ে ব্যবহার করেছিল. এর পরও অনুরোধ করা পরিসংখ্যান আনতে না পারলে, এটি সেগুলো বানিয়ে অনুরোধ করা উৎসের ডেটা হিসেবে উপস্থাপন করে.

  4. উদ্ধৃতি দেওয়ার জন্য ফাইল ইন্টারনেটে আপলোড করা(একটি নতুন উইন্ডোতে খোলে). একজন ব্যবহারকারী যখন প্রকাশ না করা একটি মডেলের কাছে 5,000,000 বর্গমিটারের বেশি আয়তনের হ্রদের ID ও নাম জানতে চান, এজেন্টটি Python ব্যবহার করে সঠিক উত্তর খুঁজে পায়. কিন্তু নির্দেশনায় ব্রাউজার উদ্ধৃতি চাওয়া হয়েছিল বলে, এজেন্টটি ব্যবহারকারীকে না জিজ্ঞেস করেই ফাইলটি আপলোড করার সিদ্ধান্ত নেয়, যাতে উত্তরে সেটি উদ্ধৃত করতে পারে.

  5. অভ্যন্তরীণ সফটওয়্যার রিপোজিটরির মাধ্যমে অনুমোদনহীন লেখা এবং যোগাযোগ(একটি নতুন উইন্ডোতে খোলে). মডেলগুলো অনুপস্থিত ইনপুট ফাইল খোঁজার সময় পৃথক প্রশিক্ষণ নমুনার মধ্যে অনুরোধ ও উত্তর আদান-প্রদানের জন্য একটি অভ্যন্তরীণ সফটওয়্যার রিপোজিটরিকে মেসেজ বোর্ড হিসেবে ব্যবহার করেছিল, যদিও তারা সেই ফাইলগুলো উদ্ধার করতে পারেনি. এই রিপোর্টে আগের একটি ঘটনাও পর্যালোচনা করা হয়েছে, যেখানে একটি মডেল নেটওয়ার্ক সীমাবদ্ধতা পাশ কাটানোর চেষ্টা করতে গিয়ে সফলভাবে টেস্ট ফাইল একটি রিপোজিটরিতে আপলোড করেছিল.

  6. সহযোগী এজেন্টদের মধ্যে অনুমোদনহীন ফাইল শেয়ারিং(একটি নতুন উইন্ডোতে খোলে). একই প্রশিক্ষণ টাস্কে একসঙ্গে কাজ করা এজেন্টরা একে অন্যের স্থানীয় ফাইলে প্রবেশ করতে না পারলে ফাইল শেয়ার করতে পাবলিক ফাইল-হোস্টিং ওয়েবসাইট ব্যবহার করেছিল. এর ফলে টাস্কের ডেলিভারেবলগুলো পাবলিক URL-এ পাওয়া যাচ্ছিল, যদিও টাস্কে মডেলগুলোকে শুধু স্থানীয় ফাইল ব্যবহার করতে বলা হয়েছিল.

আমাদের প্রকাশ প্রক্রিয়া কীভাবে কাজ করে

যেকোনো OpenAI কর্মী আমাদের নিরাপত্তা ও অ্যালাইনমেন্ট টিমের তদন্তের জন্য মিসঅ্যালাইনমেন্টের কোনো উদাহরণ চিহ্নিত করতে পারেন এবং সেটি জনসমক্ষে প্রকাশের জন্য বিবেচনার অনুরোধ করতে পারেন. এতে আমাদের প্রকাশ প্রক্রিয়া শুরু হয়, যেখানে সময়মতো তদন্ত ও প্রকাশ নিশ্চিত করতে প্রতিটি ধাপের সময়সীমা থাকে.

কোনো উদাহরণ চিহ্নিত হলে, আমাদের কারিগরি কর্মীরা কী ঘটেছে, কী এখনও অনিশ্চিত, জনসমক্ষে প্রকাশ যুক্তিযুক্ত কি না, এবং কোন তথ্য শেয়ার করা যাবে তা তদন্ত করবেন. তারা আরও মূল্যায়ন করবেন কোনো তৃতীয় পক্ষ প্রভাবিত হয়েছে কি না এবং প্রকাশের আগে তাদের ব্যক্তিগতভাবে জানানো দরকার কি না.

তারপর উদাহরণটি তিনটি ট্র্যাকের একটিতে বরাদ্দ করা হবে: প্রকাশের জন্য প্রস্তুত, সীমিত তদন্ত, অথবা বৃহত্তর তদন্ত (“ধীর ট্র্যাক”).

প্রকাশের জন্য প্রস্তুত এমন যোগ্য ঘটনাকে অন্তর্ভুক্ত করে যার তদন্ত পর্যালোচনার পর প্রকাশের জন্য যথেষ্ট সম্পূর্ণ. সীমিত তদন্ত অন্তর্ভুক্ত করে সেসব ঘটনাকে, যেগুলোর আরও কারিগরি তদন্ত প্রয়োজন. আমরা আশা করি, আমরা যে ঘটনাগুলো প্রকাশ করি তার বড় অংশ এই দুই ট্র্যাকের আওতায় পড়বে, বিশেষ করে যেসব ক্ষেত্রে বিস্তৃত তদন্ত, তৃতীয় পক্ষের সঙ্গে সমন্বয়, বা গুরুতর অপব্যবহার ঝুঁকি সামলানোর প্রয়োজন নেই. আজ আমরা যে ঘটনাগুলো প্রকাশ করছি, সেগুলো সবই এই দুই ট্র্যাকের একটির মধ্যে পড়ে.

বৃহত্তর তদন্ত জটিল তদন্তকে অন্তর্ভুক্ত করে, বিশেষ করে যেগুলোতে তৃতীয় পক্ষ জড়িত থাকে. কোনো তৃতীয় পক্ষ প্রভাবিত হলে, আমাদের নিরাপত্তা, আইনি এবং দায়িত্বশীল প্রকাশ-সংক্রান্ত বাধ্যবাধকতা এই কাঠামোর ওপর অগ্রাধিকার পায়. আমরা যত দ্রুত সম্ভব একটি প্রাথমিক নোটিশ প্রকাশের লক্ষ্য রাখব, তবে নিরাপত্তাজনিত কারণে তা বিলম্বিত করতে হতে পারে, যেমন কোনো মডেল ব্যাপকভাবে ব্যবহৃত সফটওয়্যারে আগে অজানা কোনো দুর্বলতা আবিষ্কার করলে. কোনো রিপোর্টে তৃতীয় পক্ষ শনাক্ত হয়ে গেলে, কোনো নিরাপত্তা সীমানা অতিক্রম না করা হলেও আমরা আগাম নোটিশ দিতে চাই.

বৃহত্তর তদন্তের কোনো ঘটনার প্রাথমিক নোটিশে কী ঘটেছে তার উচ্চ পর্যায়ের বিবরণ থাকবে, বাইরের বিশেষজ্ঞরা তদন্তে সহায়তা করছেন কি না বলা হবে, এবং চূড়ান্ত রিপোর্ট কখন প্রকাশের আশা করছি তার কোনো উপলব্ধ অনুমান দেওয়া হবে. OpenAI Hugging Face ঘটনাটি এই কাঠামোর আওতায় প্রকাশ করা হলে এই ট্র্যাকের অধীনে পড়ত.

যে কর্মী উদাহরণটি উত্থাপন করেছেন, তাকে এটি প্রকাশ করা হবে কি না এবং প্রকাশ করা হলে কোন ট্র্যাক অনুসরণ করা হবে, সে সিদ্ধান্ত জানানো হবে. প্রকাশ বা উপযুক্ত ট্র্যাক নিয়ে অমীমাংসিত মতভেদ OpenAI-এর নিরাপত্তা উপদেষ্টা গ্রুপে (SAG) পাঠানো হবে. এটি কোম্পানির বিভিন্ন অংশের জ্যেষ্ঠ কর্মকর্তাদের একটি দল, যা অত্যাধুনিক মডেলের সক্ষমতা ও সুরক্ষা ব্যবস্থা মূল্যায়ন করে, আমাদের প্রিপেয়ার্ডনেস ফ্রেমওয়ার্ক তত্ত্বাবধান করে এবং OpenAI নেতৃত্বকে পরামর্শ দেয়. নিরাপত্তা উপদেষ্টা গ্রুপের অভ্যন্তরীণ মতভেদ, অথবা তার সিদ্ধান্তে কর্মীদের আপত্তি, OpenAI নেতৃত্বের কাছে উন্নীত করা হবে. প্রকাশ না করার সিদ্ধান্ত, অথবা প্রকাশের যথেষ্ট কারণ নেই এমন সিদ্ধান্ত, নিরাপত্তা ও অ্যালাইনমেন্ট নেতৃত্বের সঙ্গে এবং যতটা সম্ভব সংশ্লিষ্ট কারিগরি কর্মীদের সঙ্গে শেয়ার করা হবে.

এই প্রকাশ প্রক্রিয়া বাস্তবে কীভাবে কাজ করে তা শেখার ভিত্তিতে আমরা এটি সংশোধন করতে পারি, এবং এই পোস্টে যেকোনো পরিবর্তন নথিভুক্ত করব.

প্রতিটি রিপোর্টে যা থাকবে

প্রতিটি পূর্ণাঙ্গ রিপোর্টে আমরা যে আচরণ দেখেছি, তার গুরুতরতা ও কোনো বাহ্যিক প্রভাব, যে পরিবেশে তা ঘটেছে, তার তারিখ বা তারিখের পরিসর, আমরা কখন তা জানতে পেরেছি, এবং উচ্চ পর্যায়ে সংশ্লিষ্ট মডেল বা মডেলগুলো বর্ণনা করা হবে. যেখানে সম্ভব, আমরা আরও শেয়ার করব:

  • কী ঘটেছিল এবং এর ফলে কোনো ক্ষতি হলে তার আরও বিস্তারিত;

  • আমরা কীভাবে মিসঅ্যালাইনমেন্টটি আবিষ্কার করেছি, এবং আমাদের তদন্তের পরিধি;

  • অ্যালাইনমেন্ট গবেষণা এবং কারিগরি AI নিরাপত্তার জন্য এর তাৎপর্য সম্পর্কে আমাদের ব্যাখ্যা;

  • উদাহরণটি যেসব গুরুত্বপূর্ণ অনুত্তরিত প্রশ্ন তোলে;

  • আচরণটি মোকাবিলায় আমরা যেসব ব্যবস্থা নিচ্ছি বা নেওয়ার পরিকল্পনা করছি. প্রকাশের সময় এগুলো সবসময় নাও পাওয়া যেতে পারে, কারণ তদন্ত শেষ করার বা সমাধান তৈরি করার আগেই আমরা মিসঅ্যালাইনমেন্ট রিপোর্ট প্রকাশ করতে পারি.

গ্রাহক ডিপ্লয়মেন্টে ঘটে যাওয়া মিসঅ্যালাইনমেন্টের ক্ষেত্রে, গ্রাহকের গোপনীয়তা এবং আমাদের চুক্তিগত বাধ্যবাধকতা যতটা অনুমতি দেয় আমরা ততটা তথ্য শেয়ার করব.

আজকের রিপোর্টগুলো জানা মিসঅ্যালাইনমেন্ট বা চলমান তদন্তের পূর্ণ বিবরণ নয়, বরং প্রকাশের একটি প্রাথমিক সেট. এই প্রাথমিক রিপোর্টগুলো এই কাঠামোর আওতাভুক্ত ঘটনাগুলোর সম্পূর্ণ পরিসর বা গুরুতরতা উপস্থাপন করার উদ্দেশ্যে নয়. এই কাঠামোর মানদণ্ড পূরণ করে এমন মিসঅ্যালাইনমেন্টের ঘটনা প্রকাশে আমরা প্রতিশ্রুতিবদ্ধ, যার মধ্যে দীর্ঘ তদন্ত বা তৃতীয় পক্ষের সঙ্গে সমন্বয় প্রয়োজন এমন আরও জটিল ঘটনাও রয়েছে. আমরা এই কাঠামোর আওতায় চলমানভাবে রিপোর্ট প্রকাশ করতে থাকব, এবং আমাদের রিপোর্টিং প্রতিশ্রুতিগুলো উন্নয়ন করতে থাকলে সে সম্পর্কে আরও শেয়ার করব.

লেখকবৃন্দ

OpenAI