আমরা GPT‑5.6 সিরিজের সীমিত প্রিভিউ শুরু করছি: Sol, আমাদের ফ্ল্যাগশিপ মডেল; Terra, দৈনন্দিন কাজের জন্য ভারসাম্যপূর্ণ মডেল; এবং Luna, দ্রুত ও সাশ্রয়ী মডেল. Terra GPT‑5.5‑এর সঙ্গে প্রতিযোগিতামূলক পারফরম্যান্স দেয়, অথচ 2x সস্তা; আর Luna আমাদের সর্বনিম্ন খরচে শক্তিশালী সক্ষমতা দেয়.
GPT‑5.6 Sol এখন পর্যন্ত আমাদের সবচেয়ে দৃঢ় সুরক্ষা স্ট্যাক নিয়ে চালু হচ্ছে. উচ্চতর ঝুঁকির কার্যকলাপ, সংবেদনশীল সাইবার অনুরোধ এবং পুনরাবৃত্ত অপব্যবহারের বিরুদ্ধে আমরা সুরক্ষা জোরদার করেছি, এবং দুর্বলতা খুঁজতে, আমাদের সিস্টেমকে চাপের মুখে পরীক্ষা করতে ও বাস্তব আক্রমণের বিরুদ্ধে তা শক্ত করতে কয়েক সপ্তাহ ব্যয় করেছি.
আমরা বিস্তৃত অ্যাক্সেসে বিশ্বাস করি, এবং আগামী কয়েক সপ্তাহে GPT‑5.6 Sol, Terra ও Luna সাধারণভাবে উপলভ্য করার পরিকল্পনা করছি. মার্কিন সরকারের সঙ্গে আমাদের চলমান সম্পৃক্ততার অংশ হিসেবে, আজকের লঞ্চের আগে আমরা আমাদের পরিকল্পনা ও মডেলগুলোর সক্ষমতার প্রিভিউ দিয়েছি. তাদের অনুরোধে, বিস্তৃতভাবে প্রকাশের আগে আমরা বিশ্বস্ত অংশীদারদের একটি ছোট দলের জন্য সীমিত প্রিভিউ দিয়ে শুরু করছি, যাদের অংশগ্রহণের কথা সরকারের সঙ্গে ভাগ করা হয়েছে. এই প্রিভিউ চলাকালে, বিস্তৃত প্রাপ্যতার দিকে এগোতে আমরা পরীক্ষা চালিয়ে যাব এবং অংশীদারদের সঙ্গে ঘনিষ্ঠভাবে সমন্বয় করব. আমরা মনে করি না এ ধরনের সরকারি অ্যাক্সেস প্রক্রিয়া দীর্ঘমেয়াদে ডিফল্ট হওয়া উচিত. এতে প্রয়োজনীয় সেরা টুলগুলো ব্যবহারকারী, ডেভেলপার, এন্টারপ্রাইজ, সাইবার প্রতিরক্ষাকারী এবং বৈশ্বিক অংশীদারদের নাগালের বাইরে থাকে. আমরা এই স্বল্পমেয়াদি পদক্ষেপ নিচ্ছি, কারণ আমাদের বিশ্বাস আগামী কয়েক সপ্তাহে বিস্তৃত প্রাপ্যতার সবচেয়ে শক্তিশালী পথ এটিই; একই সঙ্গে আমরা প্রশাসনের সঙ্গে সাইবার এক্সিকিউটিভ অর্ডার কাঠামো এবং ভবিষ্যৎ মডেল রিলিজের জন্য পুনরাবৃত্তিযোগ্য প্রক্রিয়া তৈরি করছি.
GPT‑5.6 Sol এখন পর্যন্ত আমাদের সবচেয়ে শক্তিশালী মডেল. মডেল পারফরম্যান্সের প্রিভিউ দিতে, আমরা কোডিং, জীববিজ্ঞান ও সাইবার নিরাপত্তায় উন্নত এজেন্টিক সক্ষমতা তুলে ধরা একগুচ্ছ মূল্যায়ন ভাগ করছি; অতিরিক্ত নিরাপত্তা ও প্রস্তুতি মূল্যায়ন আমাদের সিস্টেম কার্ডে(একটি নতুন উইন্ডোতে খোলে) পাওয়া যাবে. মডেলটি বিস্তৃতভাবে উপলভ্য করার সময় আমরা আরও বিস্তৃত মূল্যায়ন ফলাফল ভাগ করব.
GPT‑5.6‑এর সঙ্গে আমরা নতুন `max` রিজনিং প্রচেষ্টা চালু করছি, যাতে Sol গভীর রিজনিংয়ের জন্য সর্বাধিক সময় পায়. এছাড়া, আমরা নতুন `ultra` মোড চালু করছি, যা জটিল কাজ দ্রুত করতে সাবএজেন্ট কাজে লাগিয়ে একটি এজেন্টের সক্ষমতার বাইরে যায়.
কোডিং কর্মপ্রবাহের জন্য, GPT‑5.6 Sol Terminal‑Bench 2.1-এ নতুন সেরা মান স্থাপন করেছে; এটি পরিকল্পনা, পুনরাবৃত্তি ও টুল সমন্বয় দরকার এমন কমান্ড-লাইন কর্মপ্রবাহ পরীক্ষা করে.
GPT‑5.6 Sol জীববিজ্ঞানের কর্মপ্রবাহেও ব্যাপক উন্নতি দেখায়. দীর্ঘমেয়াদি জিনোমিক্স ও পরিমাণগত-জীববিজ্ঞান বিশ্লেষণ মূল্যায়নকারী GeneBench v1-এ, এটি কম টোকেন ব্যবহার করেও GPT‑5.5-এর চেয়ে শক্তিশালী ফল অর্জন করে.
সাইবার নিরাপত্তার জন্য GPT‑5.6 Sol এখন পর্যন্ত আমাদের সবচেয়ে সক্ষম মডেল. দুর্বলতা গবেষণা ও এক্সপ্লয়টেশনসহ দীর্ঘমেয়াদি নিরাপত্তা কাজের ক্ষেত্রে এটি পারফরম্যান্স-দক্ষতার সীমারেখা সরিয়ে দেয়. ExploitBench²-এ, GPT‑5.6 Sol মাত্র ~1/3 আউটপুট টোকেন ব্যবহার করেই Mythos Preview-এর সঙ্গে প্রতিযোগিতামূলক. OpenAI ও অন্যান্য ফ্রন্টিয়ার ল্যাবের সহযোগিতায় UC Berkeley গবেষকদের তৈরি বেঞ্চমার্ক ExploitGym(একটি নতুন উইন্ডোতে খোলে)3-এ, রিজনিং বাড়ানোর সঙ্গে সঙ্গে GPT‑5.6 Sol, Terra ও Luna মডেলগুলো সাইবার সক্ষমতায় শক্তিশালী উন্নতি দেখায়.
প্রতিটি মডেলের সক্ষমতার সঙ্গে মিলিয়ে কনফিগারেশন রেখে, আমরা GPT‑5.6 Sol, Terra ও Luna তৈরি করেছি এখন পর্যন্ত আমাদের সবচেয়ে দৃঢ় সুরক্ষাব্যবস্থা দিয়ে. মডেল যত বেশি সক্ষম হয়, আমরা সুরক্ষাব্যবস্থা এমনভাবে নকশা করি যাতে কোড রিভিউ, দুর্বলতা গবেষণা, প্যাচ উন্নয়ন, ডিবাগিং, নিরাপত্তা শিক্ষা ও প্রতিরক্ষামূলক পরীক্ষার মতো বৈধ কাজে অ্যাক্সেস বজায় রেখেও সেগুলো বাস্তব প্রতিপক্ষের চাপ আরও ভালোভাবে সামলাতে পারে. আমাদের লক্ষ্য হলো এসব উপকারী ব্যবহার অপ্রয়োজনীয়ভাবে সীমিত না করে নিষিদ্ধ আক্রমণাত্মক কার্যকলাপকে আরও কঠিন, অনিশ্চিত ও শনাক্তযোগ্য করা. মডেল ও সুরক্ষাব্যবস্থার আমাদের মূল্যায়নের ভিত্তিতে, নিষিদ্ধ আক্রমণাত্মক ব্যবহারকে অর্থবহভাবে সীমিত রেখে বৈধ প্রতিরক্ষামূলক কাজে উল্লেখযোগ্য সুবিধা পাওয়ার আশা করি.
শুরু থেকে শেষ পর্যন্ত নির্ভরযোগ্যভাবে আক্রমণ চালানোর চেয়ে মানুষকে দুর্বলতা খুঁজে বের করে ঠিক করতে সাহায্য করতেই GPT‑5.6 Sol বেশি ভালো. এই সক্ষমতাগুলো এগিয়ে যেতে থাকায় আমাদের অগ্রাধিকার হলো নিশ্চিত করা যে এগুলো প্রতিরক্ষাকারীদের কাছে পৌঁছায় ও তাদের উপকারে আসে, যাতে তারা এই টুলগুলো ব্যবহার করে দুর্বলতা খুঁজতে, প্যাচ তৈরি করতে এবং আরও বিস্তৃতভাবে সিস্টেম শক্তিশালী করতে পারে.
আমাদের Preparedness Framework অনুযায়ী GPT‑5.6 Sol Cyber Critical সীমা অতিক্রম করে না. Chromium ও Firefox-সংক্রান্ত মূল্যায়নে, এটি বাগ এবং এক্সপ্লয়টেশন প্রিমিটিভ—একটি এক্সপ্লয়েটের নির্মাণ-উপাদান—শনাক্ত করেছে, কিন্তু পরীক্ষিত শর্তে স্বয়ংক্রিয়ভাবে কার্যকর full-chain exploit তৈরি করেনি. তবু বেঞ্চমার্কের সীমা কোনো মডেল কী কী উপায়ে ব্যবহার হতে পারে বা অন্য টুলের সঙ্গে মিলিয়ে ব্যবহার হতে পারে, তার সবকিছু ধরতে পারে না. এই অনিশ্চয়তা, সঙ্গে মডেলের সক্ষমতায় বিস্তৃত ধাপগত পরিবর্তন, এ কারণেই আমরা মডেলের বাড়তি সক্ষমতার সঙ্গে শক্তিশালী সুরক্ষাব্যবস্থা ও ধাপে ধাপে রিলিজ যুক্ত করছি. আমাদের সুরক্ষাব্যবস্থা সম্পর্কে আরও বিস্তারিত আমরা GPT‑5.6 Preview সিস্টেম কার্ডে(একটি নতুন উইন্ডোতে খোলে) ভাগ করেছি.
দৃঢ়প্রতিজ্ঞ বা অভিযোজিত অপব্যবহারের বিরুদ্ধে একক কোনো সুরক্ষাব্যবস্থাই যথেষ্ট নয়. GPT‑5.6 প্রিভিউজুড়ে আমরা স্তরিত সুরক্ষাব্যবস্থা ব্যবহার করি, যেখানে মডেলভেদে সুনির্দিষ্ট কনফিগারেশন ভিন্ন হয়, এবং বাস্তব আক্রমণের বিরুদ্ধে সেগুলোকে চাপের মুখে পরীক্ষা করি. এর মধ্যে আছে মডেলের ভেতরে প্রশিক্ষিত সুরক্ষা, জেনারেশনের সময় রিয়েল-টাইম পরীক্ষা, অ্যাকাউন্ট-স্তরের সিগন্যাল, ভিন্নতর অ্যাক্সেস, পর্যবেক্ষণ, প্রয়োগ এবং অব্যাহত পরীক্ষা.
GPT‑5.6-কে নিষিদ্ধ সাইবার সহায়তা প্রত্যাখ্যান করতে প্রশিক্ষণ দেওয়া হয়েছে, এমনকি ব্যবহারকারীরা তাদের উদ্দেশ্য আড়াল করতে বা মডেলকে জেলব্রেক করতে চাইলেও. মডেল-স্তরের এসব সুরক্ষাব্যবস্থা মডেল কোন কাজে সহায়তা করবে এবং কোন কাজে করবে না, তার চারপাশে প্রথম সীমানা তৈরি করে.
রিয়েল-টাইম সাইবার ও জীববিজ্ঞান অপব্যবহার ক্লাসিফায়ার আউটপুট তৈরি হওয়ার সময়ই তা মূল্যায়ন করে আরেকটি স্তর দেয়. উচ্চতর ঝুঁকির ক্ষেত্রে, তারা সম্ভাব্য লঙ্ঘন শনাক্ত করলে একটি বড় রিজনিং মডেল কথোপকথন ও তার প্রেক্ষাপট পর্যালোচনা করার সময় জেনারেশন থামিয়ে রাখা হতে পারে. আউটপুট নিষিদ্ধ বলে মূল্যায়িত হলে, ব্যবহারকারীর কাছে পৌঁছানোর আগেই তা আটকে রাখা হয়.
ফ্ল্যাগ করা কার্যকলাপ সংশ্লিষ্ট কথোপকথন ও ঝুঁকির সিগন্যালজুড়ে অ্যাকাউন্ট-স্তরের পর্যালোচনাও চালু করতে পারে, যা কনটেন্ট সংরক্ষণ ও পর্যালোচনা নিয়ে আমাদের শর্তাবলি ও নীতির সঙ্গে সামঞ্জস্যপূর্ণ. একটি কথোপকথনের বাইরে তাকানো আমাদের সিস্টেমকে বৈধ দ্বৈত-ব্যবহারের নিরাপত্তা কাজ থেকে স্থায়ী ক্ষতিকর আচরণ আলাদা করতে সাহায্য করে, যেখানে একই ধরনের প্রযুক্তিগত ধারণা একেবারে ভিন্ন প্রেক্ষাপটে দেখা যেতে পারে.
সব মিলিয়ে, এই স্তরগুলো সামগ্রিক পদ্ধতিকে একক কোনো সুরক্ষাব্যবস্থার চেয়ে বেশি দৃঢ় করে. মডেলের আচরণ ক্ষতিকর প্রতিক্রিয়ার সম্ভাবনা কমায়, রিয়েল-টাইম সিস্টেম জেনারেশনের সময় হস্তক্ষেপ করতে পারে, অ্যাকাউন্ট-স্তরের পর্যালোচনা বিস্তৃত ধরন শনাক্ত করতে পারে, আর ভিন্নতর অ্যাক্সেস সবচেয়ে সংবেদনশীল সক্ষমতাকে ডিফল্টভাবে ব্যাপকভাবে উপলভ্য না করেও গুরুত্বপূর্ণ প্রতিরক্ষামূলক কাজ সংরক্ষণ করে.
বিশেষ করে প্রিভিউ চলাকালে, ব্যবহারকারীরা এমন সুরক্ষাব্যবস্থার সম্মুখীন হতে পারেন যা কিছু অনুরোধ ব্লক বা প্রত্যাখ্যান করে. অতিরিক্ত পর্যালোচনার জন্য জেনারেশন থামিয়ে রাখা হলে অন্য কিছু অনুরোধে বেশি সময় লাগতে পারে. সুরক্ষাব্যবস্থা মাঝে মাঝে বৈধ কাজেও হস্তক্ষেপ করতে পারে, বিশেষ করে দ্বৈত-ব্যবহারের ক্ষেত্রে যেখানে প্রতিরক্ষামূলক ও আক্রমণাত্মক কার্যকলাপ শুরুতে একই রকম দেখাতে পারে.
প্রিভিউটি যে বিষয়গুলো পরীক্ষা করার জন্য তৈরি, এটি তারই অংশ. আমরা শুধু অপব্যবহার সীমিত করতে সুরক্ষাব্যবস্থা কার্যকর কিনা তা নয়, বৈধ ব্যবহারকারীরা এখনও নির্ভরযোগ্য ও দক্ষভাবে স্বাভাবিক কাজ শেষ করতে পারেন কিনা তাও বুঝতে চাই. প্রিভিউ চলাকালে পাওয়া মতামত অপ্রয়োজনীয় ব্লক ও বিলম্ব কমাতে, সুরক্ষাব্যবস্থা কীভাবে প্রেক্ষাপট বোঝে তা উন্নত করতে এবং বিস্তৃত রিলিজের আগে আরও মসৃণ অভিজ্ঞতা তৈরি করতে আমাদের সাহায্য করবে.
এন্টারপ্রাইজ গোপনীয়তার প্রয়োজনীয়তা সমর্থন করেও নিরাপত্তা এগিয়ে নিতে আমরা এন্টারপ্রাইজ গ্রাহকদের সঙ্গে দীর্ঘমেয়াদি পদ্ধতি নিয়েও কাজ করছি, যার মধ্যে আছে গোপনীয়তা-সংরক্ষণকারী শনাক্তকরণ, গ্রাহক-পরিচালিত নিরাপত্তা নিয়ন্ত্রণ এবং গ্রাহক, ব্যবহারকারী বা কাজের ঝুঁকির সঙ্গে সামঞ্জস্যপূর্ণ অ্যাক্সেস.
আক্রমণকারীরা তাদের কৌশল বদলালেও সুরক্ষাব্যবস্থাগুলো কার্যকর থাকতে হবে. কেবল পরিচিত আক্রমণের নির্দিষ্ট সেটে কাজ করে এমন সুরক্ষা ফ্রন্টিয়ার মডেলের জন্য যথেষ্ট দৃঢ় নয়.
তাই নিরাপত্তায় আমরা আগের যেকোনো সময়ের চেয়ে বেশি বুদ্ধিমত্তা ও কম্পিউট প্রয়োগ করছি, নিজেদের মডেল ব্যবহার করে দুর্বলতা খুঁজছি এবং সুরক্ষাব্যবস্থা দ্রুত উন্নত করছি. সর্বজনীন জেলব্রেক খোঁজার লক্ষ্যে স্বয়ংক্রিয় রেড-টিমিংয়ে আমরা 700,000-এর বেশি A100-সমতুল্য GPU ঘণ্টা ব্যয় করেছি: এমন আক্রমণ যা শুধু একটি সংকীর্ণ পরিস্থিতিতে নয়, অনেক প্রম্পট বা প্রেক্ষাপটে কাজ করতে পারে. এই কঠিনতর, আরও সাধারণ আক্রমণগুলোর ওপর জোর দেওয়ায় পরিচিত ব্যর্থতার নির্দিষ্ট সেটের বাইরেও আমরা সুরক্ষাব্যবস্থা পরীক্ষা করতে পেরেছি. এতে শুধু মানব-পরীক্ষায় যতটা সম্ভব তার চেয়ে অনেক বেশি আক্রমণের ধরন অনুসন্ধান করা, ব্যর্থতার ধরন আগেই শনাক্ত করা এবং দুর্বলতা খুঁজে পাওয়া থেকে তা সমাধান করা পর্যন্ত সময় কমানো সম্ভব হয়.
স্বয়ংক্রিয় রেড-টিমিংয়ের পাশাপাশি, আমরা তৃতীয় পক্ষের পরীক্ষকদের সঙ্গে কাজ করে বিস্তৃত মানব বিশেষজ্ঞ রেড-টিমিং চালিয়েছি, যা প্রিভিউ সময়কালেও চলবে. মানব রেড-টিমিং স্বয়ংক্রিয় কাজকে সম্পূরক করে, কারণ সৃজনশীল বিশেষজ্ঞরা আমাদের সিস্টেমের অনুমান না করা উপায়ে মডেলটির অপব্যবহার করার চেষ্টা করলে সুরক্ষাব্যবস্থা কতটা টেকে তা এতে পরীক্ষা করা যায়.
কোনো মূল্যায়নই প্রতিটি পণ্য কনফিগারেশন, বহু-ধাপের আক্রমণ বা বাস্তব কর্মপ্রবাহকে উপস্থাপন করতে পারে না. তাই নতুন আবিষ্কৃত জেলব্রেক পুনরুৎপাদন, মূল্যায়ন, অগ্রাধিকার নির্ধারণ ও প্রতিকার করার জন্য আমরা একটি দ্রুত-প্রতিক্রিয়া প্রক্রিয়া বজায় রাখি, তারপর সেগুলোকে আমাদের চলমান মূল্যায়নে যোগ করি, যাতে ভবিষ্যতে একই ধরনের ব্যর্থতার বিরুদ্ধে পরীক্ষা করা যায়.
প্রিভিউ চলাকালে GPT‑5.6 মডেলগুলো শুরুতে API ও Codex-এর মাধ্যমে নির্বাচিত বিশ্বস্ত অংশীদার ও সংস্থার জন্য উপলভ্য হবে. শিগগিরই ChatGPT, Codex ও API ব্যবহারকারীদের জন্য এগুলো আরও বিস্তৃতভাবে উপলভ্য করার পরিকল্পনা আমাদের আছে.
GPT‑5.6‑এর সঙ্গে চালু হওয়া এই নতুন নামকরণ পদ্ধতিতে সংখ্যা একটি মডেলের প্রজন্ম নির্দেশ করে, আর Sol, Terra ও Luna এমন স্থায়ী সক্ষমতার স্তর নির্দেশ করে, যেগুলো নিজস্ব গতিতে এগোতে পারে. সব মিলিয়ে, এই পরিবার মানুষ ও ডেভেলপারদের বুদ্ধিমত্তা, গতি ও খরচের ক্ষেত্রে আরও স্পষ্ট পছন্দ দেয়.
GPT‑5.6‑এর তিনটি মডেল আকারে প্রতি 1M টোকেন অনুযায়ী মূল্য নির্ধারিত: Sol ইনপুটে $5 / আউটপুটে $30; Terra ইনপুটে $2.50 / আউটপুটে $15; এবং Luna ইনপুটে $1 / আউটপুটে $6. GPT‑5.6 আরও পূর্বানুমানযোগ্য প্রম্পট ক্যাশিংও চালু করছে, যার মধ্যে স্পষ্ট ক্যাশ ব্রেকপয়েন্ট এবং 30 মিনিটের ন্যূনতম ক্যাশ লাইফের সমর্থন রয়েছে. GPT‑5.6 ও পরবর্তী মডেলগুলোর জন্য, ক্যাশ রাইটের বিল মডেলের আনক্যাশড ইনপুট রেটের 1.25x হারে হবে, আর ক্যাশ রিডে 90% ক্যাশড-ইনপুট ডিসকাউন্ট অব্যাহত থাকবে.
আমরা জুলাই মাসে Cerebras-এ প্রতি সেকেন্ডে 750 টোকেন পর্যন্ত গতিতে GPT‑5.6 Sol-ও চালু করছি, যা গ্রাহকদের কাছে অভূতপূর্ব গতিতে ফ্রন্টিয়ার বুদ্ধিমত্তা নিয়ে আসবে. ক্ষমতা বাড়ানোর সময় শুরুতে নির্বাচিত গ্রাহকদের মধ্যেই অ্যাক্সেস সীমিত থাকবে.
এই প্রিভিউ সময়কাল থেকে শেখা অব্যাহত রাখতে এবং শিগগিরই আরও মানুষের কাছে GPT‑5.6 Sol, Terra ও Luna পৌঁছে দিতে আমরা আগ্রহী.
1. আমরা আমাদের মডেলগুলোর প্রোডাকশন আচরণ দেখে এবং অফলাইনে সিমুলেট করে ল্যাটেন্সি ও API খরচ অনুমান করি. এসব অনুমানে টুল কলের বিবরণ, নমুনা টোকেন এবং ইনপুট টোকেন ধরা হয়েছে. বাস্তব ফলাফল উল্লেখযোগ্যভাবে ভিন্ন হতে পারে এবং আমাদের সিমুলেশনে ধরা পড়েনি এমন অনেক বিষয়ের ওপর নির্ভর করে. আমরা দ্রুত API গতিতে ল্যাটেন্সি এবং নিয়মিত API মূল্যে খরচ সিমুলেট করি.
2. সব মডেল 5টি সিড ও রিজনিং ধারাবাহিকতাসহ ExploitBench API harness ব্যবহার করে মূল্যায়ন করা হয়েছে.
3. আমরা আমাদের alpha API-তে ExploitGym চালিয়েছি, যা আমাদের public API-এর চেয়ে দ্রুত প্রতিক্রিয়া আউটপুট করে, তারপর আমাদের public API-এর সঙ্গে মেলাতে পুনরায় স্কেল করেছি. public API-এর প্রত্যাশিত গতির সঙ্গে মেলাতে ল্যাটেন্সি পুনরায় স্কেল করার সময় কিছু আনুমানিক ল্যাটেন্সি 2h ও 6h সময়সীমা ছাড়িয়ে যায়, যদিও মূল্যায়ন রানে সেগুলো ঠিকভাবেই মানা হয়েছিল. সময়-সংবেদনশীল কাজের জন্য দ্রুত গতি পেতে আমরা API-তে priority processing এবং Codex-এ fast mode দিই.
4. যেসব মডেলের আউটপুট টোকেন, ল্যাটেন্সি বা খরচ রিপোর্ট করা হয়নি, সেগুলো অনুভূমিক ডটেড লাইন হিসেবে প্লট করা হয়েছে.

