লোডিং…
আজ আমরা GPT‑6 Astra প্রকাশ করছি, যা এখন পর্যন্ত আমাদের বিস্তৃতভাবে মোতায়েন করা সবচেয়ে সক্ষম মডেল. আমাদের প্রিপেয়ার্ডনেস ফ্রেমওয়ার্কের অধীনে সাইবার নিরাপত্তা সক্ষমতার সংকটপূর্ণ স্তরে পৌঁছানো আমাদের প্রথম মডেল হলো Astra.
এই লঞ্চের নিরাপত্তা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ বিষয়গুলো হলো:
- GPT‑6 Astra সাইবার সক্ষমতায় বড় অগ্রগতি এবং আমাদের সংকটপূর্ণ সীমা পূরণ করে. এর অর্থ হলো, সঠিক টুল ও অ্যাক্সেস থাকলে GPT‑6 Astra আগে অজানা নিরাপত্তা ত্রুটি খুঁজে বের করতে পারে এবং প্রতিটি ধাপে মানুষের নির্দেশনা ছাড়াই বহু ভালোভাবে সুরক্ষিত সিস্টেমে সেগুলো কাজে লাগানোর নতুন উপায় তৈরি করতে পারে. তাই অপব্যবহার বা মিসঅ্যালাইনমেন্ট—যে কারণেই হোক না কেন, মডেল যাতে ক্ষতিকর সাইবার পদক্ষেপ না নেয় সে বিষয়ে আমরা আমাদের সুরক্ষা উল্লেখযোগ্যভাবে জোরদার করেছি. Astra ও অনুরূপ মডেলগুলোর অভ্যন্তরীণ উন্নয়ন ও মোতায়েন সুরক্ষিত করতেও আমরা পদক্ষেপ নিয়েছি, যার মধ্যে রয়েছে আরও কঠোর আইসোলেশন, চেকপয়েন্ট এনক্রিপশন, চেইন-অফ-থট (CoT)-সহ পূর্ণ ট্র্যাজেক্টরির সার্বিক মনিটরিং, এবং অভ্যন্তরীণ ব্যবহারের আগে বাধ্যতামূলক অ্যালাইনমেন্ট মূল্যায়ন প্রক্রিয়া.
- GPT‑6 Astra তার পূর্বসূরিদের তুলনায় উল্লেখযোগ্যভাবে বেশি শক্তিশালী. নতুন রোবাস্টনেস নিরাপত্তা প্রশিক্ষণ কৌশল যুক্ত করার ফলে GPT‑6 Astra GPT‑5.6 Sol-এর তুলনায় নিরাপত্তা এড়ানোর কৌশলের বিরুদ্ধে উল্লেখযোগ্যভাবে বেশি শক্তিশালী, দীর্ঘতর ট্র্যাজেক্টরিতেও. অফলাইন পরীক্ষা এবং আমাদের কঠোর অভ্যন্তরীণ ও বাহ্যিক নিরাপত্তা এড়ানোর কৌশল পরীক্ষা ও প্রতিকার কর্মসূচি থেকে আমরা এটি জানি. সম্ভাব্য উচ্চ ঝুঁকির ব্যবহারকারী হিসেবে চিহ্নিতদের জন্য, মডেলের প্রত্যাখ্যানসীমা আরও সতর্কভাবে সমন্বয় করতে এবং দ্বৈত-ব্যবহারের ঝুঁকির বিস্তৃত পরিসর অন্তর্ভুক্ত করতে আমরা অতিরিক্ত প্রশিক্ষণ দিয়েছি. আগের পরীক্ষার পর্যায়ে পাওয়া নিরাপত্তা এড়ানোর কৌশলের বিরুদ্ধে Astra শক্তিশালী আছে কি না তা নিশ্চিত করতে আমরা রিগ্রেশন টেস্টিং ব্যবহার করি, এবং আমাদের উন্নতি যাচাই করতে সর্বশেষ অভ্যন্তরীণ রেড টিমিং আক্রমণকারীদের দিয়ে স্বয়ংক্রিয় রেড টিমিং-এর নতুন রাউন্ড চালিয়েছি.
- GPT‑6 Astra অ্যালাইনমেন্টে GPT‑5.6 Sol-এর চেয়ে ভালো. মডেল অ্যালাইনমেন্টে Astra একটি উল্লেখযোগ্য অগ্রগতি, এবং এতে আমাদের প্রি-ট্রেনিং ডেটার গঠন থেকে রিইনফোর্সমেন্ট লার্নিংয়ের সময়কার মূল্যায়ন পর্যন্ত অ্যালাইনমেন্ট উন্নতি অন্তর্ভুক্ত. আমরা অ্যালাইনমেন্ট মূল্যায়নের একটি নতুন স্যুইট(একটি নতুন উইন্ডোতে খোলে) প্রকাশ করছি, এবং দেখতে পাচ্ছি যে GPT‑6 Astra নিরাপত্তা ও সুরক্ষা সীমা মানা এবং অনুমোদিত পরিসরের মধ্যে থাকার ক্ষেত্রে আরও শক্তিশালী. যেখানে 54,000টি অভ্যন্তরীণ Codex কাজ(একটি নতুন উইন্ডোতে খোলে) এর বেশি ব্যবহার করা হয়েছে, এমন একটি সিমুলেশনে Astra উচ্চ-গুরুত্বের মিসঅ্যালাইনড আচরণের জন্য Sol-এর তুলনায় প্রায় অর্ধেক ফ্ল্যাগ পেয়েছে.
- আমরা বিস্তৃতভাবে মিসঅ্যালাইনমেন্ট মনিটরিং মোতায়েন করছি. আমরা মডেল অ্যালাইনমেন্টকে আমাদের মডেলগুলোর সম্ভাব্য মিসঅ্যালাইনড আচরণ ঠেকানোর প্রধান উপায় হিসেবে দেখি. তবে মনিটরিং অত্যাধুনিক মডেলের আচরণ সম্পর্কে বিস্তৃত দৃশ্যমানতা দেয়, যা অ্যালাইনমেন্ট ও নিরাপত্তা আরও উন্নত করার সুযোগ স্পষ্ট করে. এ ছাড়া, শনাক্ত হওয়া মিসঅ্যালাইনড আচরণের বিরুদ্ধে মনিটরিং অতিরিক্ত সুরক্ষা স্তর হিসেবে কাজ করে. এই কারণগুলোতে, Astra-র বাহ্যিক মোতায়েনে জড়িত সব টুল-ব্যবহারকারী ইনফারেন্সে আমরা অতিরিক্তভাবে মিসঅ্যালাইনমেন্ট মনিটরিং যুক্ত করেছি, যার কম্পিউট খরচ উল্লেখযোগ্য. এই সিস্টেমটি আমাদের অভ্যন্তরীণ ব্যবস্থার অনুরূপ.
- GPT‑6 Astra-র মনিটরযোগ্যতা GPT‑5.6 Sol-এর তুলনায় কমেছে. GPT‑6 Astra-র মনিটরযোগ্যতা(একটি নতুন উইন্ডোতে খোলে) এবং নিয়ন্ত্রণযোগ্যতা(একটি নতুন উইন্ডোতে খোলে) নিয়ে আমরা উল্লেখযোগ্য অনুসন্ধান করেছি. আমরা দেখেছি যে GPT‑6 Astra নিজের CoT নিয়ন্ত্রণে GPT‑5.6 Sol-এর চেয়ে বেশি সক্ষম, এবং তার CoT-তে দোষসূচক তথ্য রাখার সম্ভাবনা কম. প্রতিকূল পরিবেশে (যেখানে আমরা মডেলকে আমাদের মনিটর এড়িয়ে যেতে চাপ দিই) আমরা দেখি যে মূল্যায়নে কৌশল হিসেবে কম পারফর্ম করার সময় মডেলটি ধরা না পড়ে থাকতে পারে (স্যান্ডব্যাগিং) এবং নির্দিষ্ট কিছু নাশকতামূলক কাজ(একটি নতুন উইন্ডোতে খোলে) করতে বলা হলে কখনও কখনও আমাদের অভ্যন্তরীণ মনিটর এড়িয়ে যেতে পারে. আমরা স্টেগানোগ্রাফিক CoT যুক্তির প্রমাণ দেখিনি (যেমন সাধারণ ও আপাতভাবে সম্পর্কহীন লেখার মধ্যে গোপন যুক্তি লুকানো) এটি ইঙ্গিত করে যে এড়ানোর ঝুঁকি অনেকটাই নিম্ন-যুক্তির কাজের মধ্যে সীমাবদ্ধ থাকতে পারে.
- এই ফলাফলগুলো ইঙ্গিত করে যে প্রতিকূল পরিস্থিতিতে Astra শ্রেণির মডেলগুলো আমাদের CoT মনিটর এড়িয়ে যেতে পারে. এ মুহূর্তে এই ফলাফলগুলো মূলত প্রতিকূল মূল্যায়নের ওপর ভিত্তি করে (অর্থাৎ যখন আমরা মডেলকে মনিটরিং এড়াতে নির্দেশ দিই) সামগ্রিকভাবে আমাদের অ্যালাইনমেন্ট মূল্যায়ন দেখায় যে Astra নিরাপত্তা ও সুরক্ষা বিধিনিষেধ লঙ্ঘন করার সম্ভাবনায় GPT‑5.6 Sol-এর চেয়ে কম.
- তবু আমরা এই প্রবণতাকে গুরুত্বের সঙ্গে নিচ্ছি, এবং আমাদের মডেলগুলো আরও সক্ষম হওয়ার সঙ্গে সঙ্গে মনিটরযোগ্যতার জন্য এই ফলাফল ও সেগুলোর তাৎপর্য নিয়ে অনুসন্ধান চালিয়ে যাচ্ছি. OpenAI চেইন অব থট মনিটরিং সংরক্ষণ ও ব্যবহার করতে কাজ করেছে, এবং CoT মনিটরযোগ্যতা বজায় রাখা গবেষণা কর্মসূচির একটি মূল লক্ষ্য. তবে এই ফলাফলগুলো মডেলের চেইন-অফ-থট পরীক্ষা করার বাইরে অ্যালাইনমেন্ট অডিটিং কৌশল তৈরির গুরুত্বও তুলে ধরে.
- GPT‑6 Astra ব্রাউজিং ও কর্মক্ষেত্রের পরিবেশে আরও দায়িত্বশীলভাবে কাজ করে: GPT‑6 Astra প্রম্পট ইনজেকশনের বিরুদ্ধে GPT‑5.6 Sol-এর তুলনায় উল্লেখযোগ্যভাবে বেশি শক্তিশালী. আমরা বাস্তবসম্মত ব্রাউজিং ও পেশাগত কম্পিউটার পরিবেশেও মডেলের আচরণ পরীক্ষা করেছি, এবং দেখেছি যে GPT‑5.6 Sol-এর তুলনায় মডেলটির মিসঅ্যালাইনড ও সম্ভাব্য ধ্বংসাত্মক কাজ করার সম্ভাবনা উল্লেখযোগ্যভাবে কম (যেমন অননুমোদিত লেনদেন, ডেটা হারানো, অতিরিক্ত অ্যাক্সেস, বা নিয়ন্ত্রণ এড়িয়ে যাওয়া). এজেন্টিক পরিবেশে ক্ষতিকর অনুরোধ সামলানোর সময়ও এটি আরও নিরাপদভাবে কাজ করে, যেমন সহিংস হামলার পরিকল্পনায় সহায়তা করা বা প্রতারণা করার অনুরোধ.
- উচ্চ ঝুঁকির পরিস্থিতিতে GPT‑6 Astra উল্লেখযোগ্যভাবে বেশি নিরাপদ. প্রোডাকশন এবং প্রতিকূল মানব রেড টিমিং থেকে নেওয়া কঠিন অনুরোধে GPT‑6 Astra GPT‑5.6 Sol-এর তুলনায় বেশি নিরাপদভাবে সাড়া দেয়. অনিরাপদ অনুরোধ নিরাপদভাবে সম্পন্ন করা এবং ক্ষতিকর নয় এমন অনুরোধে অপ্রয়োজনীয় প্রত্যাখ্যান এড়ানোর ক্ষেত্রে Astra একটি পারেটো উন্নতি অর্জন করেছে. এই উন্নতিগুলো এমন উচ্চ-গুরুত্বের পরিস্থিতিতেও প্রযোজ্য, যেখানে ক্ষতির ঝুঁকি সরাসরি অনুরোধ থেকে নয়, বরং বিস্তৃত প্রেক্ষাপট থেকে আসে. 18 বছরের কম বয়সী ব্যবহারকারীদের জন্য Astra বয়স-উপযোগী নিরাপত্তা সীমাও আরও ধারাবাহিকভাবে প্রয়োগ করে.
আরও তথ্যের জন্য সম্পূর্ণ সিস্টেম কার্ড(একটি নতুন উইন্ডোতে খোলে) দেখুন.


