বুদ্ধিমত্তার এক নতুন প্রজন্ম
আমরা বিশ্বের সবচেয়ে বুদ্ধিমান ও অ্যালাইনড মডেল GPT‑6 Astra উন্মোচন করছি.
GPT‑6 Astra প্রি-ট্রেনিং, রিইনফোর্সমেন্ট লার্নিং এবং অ্যালাইনমেন্ট জুড়ে বহু বছরের গবেষণা ও বড় বাজিকে একত্রিত করেছে. কম্পিউটার ব্যবহার, ব্রাউজিং, সফটওয়্যার ইঞ্জিনিয়ারিং, সাইবার নিরাপত্তা, বিজ্ঞান এবং পেশাগত কাজের ক্ষেত্রে Astra সর্বাধুনিক. Astra 98% স্কোর নিয়ে FrontierMath Tier 4-এ স্যাচুরেশন অর্জন করেছে এবং ইতিমধ্যেই গণিতের দীর্ঘদিনের অমীমাংসিত সমস্যার সমাধান করতে সহায়তা করেছে. Astra 99.9% স্কোর নিয়ে ARC-AGI-3-এ সম্পৃক্ততার সীমায় পৌঁছেছে এবং 100% স্কোর নিয়ে ExploitBench-এ সম্পৃক্ততার সীমায় পৌঁছেছে. এটি কম্পিউটার ও ব্রাউজার ব্যবহারের ক্ষেত্রেও অত্যাধুনিক উন্মোচন করেছে এবং অতুলনীয় গতি, নির্ভুলতা ও বিচারবোধের সঙ্গে সবচেয়ে চাহিদাসম্পন্ন পেশাদার কাজ সম্পন্ন করে.
GPT‑6 Astra আজ সীমিত সংখ্যক প্রতিষ্ঠানের জন্য ধাপে ধাপে চালু করা হচ্ছে এবং আগামী কয়েক দিনের মধ্যে এটি সব ChatGPT Plus, Pro, Business ও Enterprise ব্যবহারকারীর জন্য, পাশাপাশি OpenAI API, Microsoft Azure এবং AWS Bedrock-এর মাধ্যমে উপলভ্য হবে.
Astra হলো আমাদের সবচেয়ে সামঞ্জস্যপূর্ণ মডেল, যা ব্যবহারকারীর অভিপ্রায় এবং মডেলের আচরণ বোঝার ক্ষেত্রে উল্লেখযোগ্য উন্নতি করেছে—আপনি Astra-এর সিদ্ধান্তের উপর আরও বেশি আস্থা রেখে কাজ অর্পণ করতে পারেন. এটি পরীক্ষা করার একটি উপায় হিসেবে, আমরা Hugging Face-এর ঘটনার আলোকে একটি নতুন মূল্যায়ন তৈরি করেছি, যা যাচাই করে কঠিন বা অসম্ভব কোনো কাজের মুখোমুখি হলে একটি মডেল তার নির্ধারিত পরিধির বাইরে যাবে কি না. উৎপাদন-সংক্রান্ত সুরক্ষা ব্যবস্থা ছাড়া GPT‑5.6 Sol 48% ক্ষেত্রে অনুমোদিত লক্ষ্যের বাইরে গেলেও, GPT‑6 Astra 0% ক্ষেত্রে তা করেছে.
কম্পিউটার ব্যবহারের জন্য বিশ্বের সেরা মডেল
GPT‑6 Astra কম্পিউটার ব্যবহারের গতি, নির্ভুলতা ও নিরাপত্তায় এক নতুন দিগন্ত উন্মোচন করেছে. এটি অনলাইন ফর্ম পূরণ করা, CRM-এ গ্রাহকের রেকর্ড আপডেট করা এবং আপনার ক্যালেন্ডার গুছিয়ে রাখার মতো একঘেয়ে কাজগুলো সামলে নিতে পারে. এটি অনলাইনে গবেষণা করতে এবং আপনার ইমেইল বা ডকুমেন্ট এডিটরে সারসংক্ষেপের খসড়া তৈরি করতে পারে. এটি বৈজ্ঞানিক ডেটা বিশ্লেষণ করতে, প্লট তৈরি করতে, একটি ওয়েবসাইট তৈরি করতে এবং সেই সাইটের সব ফিচার ঠিকভাবে কাজ করছে কি না তা নিশ্চিত করতে ফ্রন্টএন্ড QA চেক চালাতে পারে. এটি আপনাকে স্বয়ংক্রিয়ভাবে সফটওয়্যার ইনস্টল ও পরীক্ষা করতে এবং স্ক্রিনে দেখা সমস্যাগুলো নির্ণয় ও সমাধান করতে সহায়তা করতে পারে. এই উন্নতিগুলো আমাদের সর্বাধুনিক মূল্যায়ন ফলাফলেও প্রতিফলিত হয়েছে.
এই উন্নতিগুলোর ফলেও বাস্তব জ্ঞান সংক্রান্ত কাজে দক্ষতার উল্লেখযোগ্য বৃদ্ধি ঘটে. OSWorld 2.0-তে ল্যাটেন্সি সিমুলেশনে, Astra প্রতিটি টাস্কে GPT‑5.6-এর তুলনায় প্রায় 47% কম সময়ে উচ্চতর কম্পিউটার-ব্যবহারের পারফরম্যান্স অর্জন করে Sol, প্রতি টাস্কে আনুমানিক 40 মিনিটে 72.6% স্কোর করেছে, যেখানে প্রতি টাস্কে আনুমানিক 75 মিনিটে 65.7% স্কোর ছিল.3
GPT‑6 Astra-এর কম্পিউটার ব্যবহারের সক্ষমতা বিভিন্ন ক্ষেত্রের আউটপুটে দেখা যায়, যার মধ্যে রয়েছে গেম ডেভেলপমেন্ট, ইলেকট্রিক্যাল ইঞ্জিনিয়ারিং এবং দৈনন্দিন জ্ঞানভিত্তিক কাজ:
Astra-এর পাশাপাশি, আমরা কম্পিউটার ব্যবহারের গতি উল্লেখযোগ্যভাবে উন্নত করতে Codex কার্যপরিধিও আপডেট করছি. Astra-এর দক্ষতার সঙ্গে মিলিয়ে, এর ফলে Mind2Web বেঞ্চমার্কে বর্তমান GPT‑5.6 Sol অভিজ্ঞতার তুলনায় 1.9 গুণ দ্রুত কাজ সম্পন্ন করা যায়. গতির ক্ষেত্রে মডেলটির উন্নতির অর্থ হলো, এটি আপনার হয়ে দৈনন্দিন জীবনের অনেক সময়সাপেক্ষ কাজ আপনি নিজে করতে পারেন তার চেয়েও দ্রুত করতে পারে.
পেশাগত কাজে এক উল্লেখযোগ্য পরিবর্তন
GPT‑6 Astra জটিল কাজ মোকাবিলায় সহায়তা করতে, কম্পিউটার ব্যবহারের অগ্রগতির সঙ্গে পেশাদার পরিবেশের জন্য লক্ষ্যভিত্তিক প্রশিক্ষণকে একত্রিত করে. এটি জটিল সমস্যার জন্য প্রয়োজনীয় বুদ্ধিমত্তাকে বহু-ধাপের কর্মপ্রবাহ সম্পাদন এবং পরিশীলিত নথি, স্প্রেডশিট ও প্রেজেন্টেশন তৈরি করার সক্ষমতার সঙ্গে সমন্বিত করে.
GPT‑6 Astra বিদ্যমান টেমপ্লেট অনুসরণ করা এবং সুসংগঠিত বর্ণনার মাধ্যমে মূল বিষয়গুলো সংক্ষেপে তুলে ধরা সুনিপুণ বিন্যাসের স্লাইড তৈরি করার ক্ষেত্রে আমাদের সেরা মডেল. এটি আপনার টেমপ্লেট অনুসরণ করে এবং আপনার লেখার ও ভিজ্যুয়াল শৈলীর সঙ্গে সামঞ্জস্যপূর্ণ পরিষ্কার, সুশৃঙ্খলভাবে বিন্যস্ত ডকুমেন্ট, প্রেজেন্টেশন, স্প্রেডশিট এবং বিশ্লেষণ তৈরি করে. Astra-কে এমনভাবেও প্রশিক্ষণ দেওয়া হয়েছে, যাতে এটি বর্তমান কাজের জন্য অপ্রয়োজনীয় তথ্য পুনরাবৃত্তি করার বদলে আউটপুটে শুধু প্রাসঙ্গিক প্রসঙ্গই অন্তর্ভুক্ত করে. এসবের অর্থ হলো, এটি আপনার ব্যবসায়িক প্রেক্ষাপট ও মানদণ্ডের সাথে সামঞ্জস্যপূর্ণ আরও তাৎক্ষণিকভাবে ব্যবহারযোগ্য আর্টিফ্যাক্ট আউটপুট করতে পারে.
GPT‑6 Astra যে ওয়েবসাইট, গেম, অ্যাপ্লিকেশন এবং রেন্ডারিং তৈরি করে, সেগুলোতেও আরও শক্তিশালী ভিজ্যুয়াল বিচারবোধ নিয়ে আসে. ChatGPT‑এ সাইটগুলোর(একটি নতুন উইন্ডোতে খোলে) সাহায্যে Astra সরাসরি একটি প্রম্পট থেকেই ওয়েবসাইট, ওয়েব অ্যাপ এবং গেম তৈরি, হোস্ট ও শেয়ার করতে পারে.
নির্দেশনায় ব্যাখ্যার সুযোগ থাকলে, GPT‑6 Astra সঠিক সিদ্ধান্ত নেওয়ার ক্ষেত্রে আগের মডেলগুলোর চেয়ে ভালো. এটি সাধারণ ঘাটতিগুলো পূরণ করতে প্রাসঙ্গিক তথ্য ব্যবহার করে এবং যখন উত্তরটি ফলাফল বদলে দিতে পারে, তখন লক্ষ্যভিত্তিক প্রশ্ন করে. Codex-এ এটি আপনার উত্তরের উপর নির্ভরশীল নয় এমন কাজ চালিয়ে যাওয়ার পাশাপাশি অ্যাসিঙ্ক্রোনাসভাবে প্রশ্ন করতে পারে. আপনি সাড়া না দিলে, এটি যথোপযুক্ত ক্ষেত্রে যুক্তিসঙ্গত অনুমানের ভিত্তিতে কাজ চালিয়ে যায়, কিন্তু গুরুত্বপূর্ণ সিদ্ধান্তগুলোর জন্য আপনার মতামতের অপেক্ষা করে.
নিচের উদাহরণগুলো দেখায় যে Astra কিভাবে দৈনন্দিন কাজগুলোতে সহযোগিতা করে, যেখানে তথ্যের অভাব উত্তরকে উল্লেখযোগ্যভাবে বদলে দিতে পারে.
কোনো কাজ এগিয়ে যাওয়ার সাথে সাথে নিজের লক্ষ্য স্থির রাখতেও Astra বেশি পারদর্শী. আগের মডেলগুলো কখনও কখনও নির্দেশনামূলক বার্তাগুলোকে নতুন লক্ষ্য হিসেবে বিবেচনা করত, ফলে মূল অনুরোধ বা আগের সীমাবদ্ধতাগুলো আর খেয়ালে রাখত না. Astra নতুন প্রয়োজনীয়তা অন্তর্ভুক্ত করে, অনুরোধ করা হলে দিক পরিবর্তন করে এবং বৃহত্তর কাজটি থেকে বিচ্যুত না হয়ে আনুষঙ্গিক প্রশ্নের উত্তর দেয়.
কোডিং
GPT‑6 Astra এখন পর্যন্ত সফটওয়্যার ইঞ্জিনিয়ারিংয়ের জন্য সেরা মডেল.
“GPT‑6 Astra আমাদের অভ্যন্তরীণ কোডিং বেঞ্চমার্কে অত্যাধুনিক কর্মক্ষমতা প্রদান করে এবং GPT‑5.6 Sol-এর তুলনায় ট্রেডিং ইন্টুইশন মূল্যায়নে স্পষ্ট অগ্রগতি দেখায়. এজেন্টিক কোডিংয়ের জন্য ব্যবহার করা হলে, GPT‑6 Astra এমনভাবে যোগাযোগ করে যা ডেভেলপারদের জন্য অনুসরণ করা সহজ এবং এমন কোড তৈরি করে যা প্রোডাকশন মানে পৌঁছাতে কম পুনরাবৃত্তির প্রয়োজন হয়.”
“আমরা আমাদের প্রথম প্রজন্মের একটি ইভ্যালে Astra-কে কম, মাঝারি এবং উচ্চ প্রচেষ্টায় পরীক্ষা করেছি এবং এটি GPT 5.6 Sol-এর চেয়ে উল্লেখযোগ্যভাবে এগিয়ে ছিল. অতিরিক্ত প্রচেষ্টার ফলে একটি নতুন বিল্ডে আরও বেশি পুনরাবৃত্তি, ব্রাউজার পরীক্ষার মাধ্যমে আরও বেশি যাচাইকরণ এবং প্যাচ প্রয়োগের পরিবর্তে কোড এক্সিকিউশনের দিকে ঝোঁক বাড়ে. একটি মডেল কিভাবে তার প্রচেষ্টা ব্যয় করে তা বোঝার মাধ্যমেই আমরা লক্ষ লক্ষ বিল্ডারকে ধারণা থেকে কার্যকর অ্যাপে পৌঁছানোর আরও দ্রুত ও নির্ভরযোগ্য পথ দিই.”
Astra-এর মাধ্যমে, কনটেক্সট উইন্ডো পূর্ণ হয়ে গেলে কনটেক্সট সংরক্ষণ ও পুনরুদ্ধারের জন্য আমরা Codex-এ একটি নতুন উপায় চালু করছি. অতীতে, দীর্ঘ সেশনে কাজের সারসংক্ষেপ করতে মডেলগুলো সংকোচন ব্যবহার করেছে, যেমন জটিল সমস্যা ডিবাগ করার সময় বা বড় রিফ্যাক্টর করার সময়. প্রতিটি সংকোচনে কোনো ফিক্স কেন ব্যর্থ হয়েছে বা কোনো কম্পোনেন্ট কিভাবে কাজ করে সে সম্পর্কে কিছু বিস্তারিত তথ্য বাদ পড়তে পারে. Codex-এ, Astra কনটেক্সট উইন্ডোজুড়ে নোট রাখতে পারে, ফলে জমা হওয়া বিস্তারিত তথ্যকে বারবার একটি সারসংক্ষেপে সংকুচিত না করেই সংরক্ষণ করা যায়. আগের কনটেক্সট উইন্ডোগুলো অনুসন্ধানযোগ্য থাকে, তাই Astra আগের বার্তা এবং টুল আউটপুট থেকে প্রয়োজনীয়তা বা পরীক্ষার ফলাফল খুঁজে পেতে পারে—এমনকি সেই তথ্য তার নোটে ধরা না থাকলেও. আপনি আপনার Codex config.toml(একটি নতুন উইন্ডোতে খোলে)-এ এই পরীক্ষামূলক ফিচারটি চালু করতে পারেন এবং আগামী কয়েক সপ্তাহের মধ্যে এটি Astra-এর জন্য ডিফল্ট হয়ে যাবে.
বৈজ্ঞানিক আবিষ্কারকে এগিয়ে নেওয়া
GPT‑6 Astra বৈজ্ঞানিক আবিষ্কার, গণিত ও স্বাস্থ্যের জন্য একটি গুরুত্বপূর্ণ অগ্রগতি. আজ আমরা মৌলিক সংখ্যাগুলোর মধ্যবর্তী ব্যবধান সম্পর্কে আরও দুটি ফলাফল শেয়ার করছি [WITH LINK]. Astra বিজ্ঞানবিষয়ক মূল্যায়ন স্যুটজুড়ে নতুন রেকর্ডও স্থাপন করেছে:
Astra বৈজ্ঞানিক আবিষ্কারের পেছনের প্রায়োগিক কাজে সাহায্য করতে পারে. বৈজ্ঞানিক যুক্তি বিশ্লেষণকে কম্পিউটার ব্যবহারের সঙ্গে একত্র করে, এটি ডেটা পর্যালোচনা ও ফলাফল অন্বেষণের জন্য বিশেষায়িত সফটওয়্যারে সরাসরি কাজ করতে পারে, যা গবেষকদের প্রমাণ মূল্যায়ন করতে এবং এরপর কী তদন্ত করা উচিত তা সিদ্ধান্ত নিতে সহায়তা করে.
সাইবারসিকিউরিটি
Astra সাইবার নিরাপত্তা সক্ষমতায় এক ধাপ এগিয়ে. এর জিরো-ডে এক্সপ্লয়েট শনাক্ত ও তৈরি করার সক্ষমতা ডিফেন্ডারদের দুর্বলতাগুলো প্যাচ করতে সাহায্য করতে পারে, তবে এটি আরও শক্তিশালী সুরক্ষা ব্যবস্থার প্রয়োজনও তৈরি করে. এই সক্ষমতাগুলো কতদূর পর্যন্ত বিস্তৃত তা বোঝার জন্য, আমরা অভ্যন্তরীণ ও তৃতীয় পক্ষের বিশেষজ্ঞদের মূল্যায়ন ব্যবহার করেছি.
আমরা প্রথমে ExploitBench এবং ExploitGym-এ Astra পরীক্ষা করেছি, যেগুলো পরিমাপ করে মডেলগুলো দুর্বল কোডবেসে আর্বিট্রারি কোড এক্সিকিউশন অর্জন করতে পারে কি না.
পূর্ববর্তী সফটওয়্যার দুর্বলতাগুলোর সংস্পর্শে আসার কারণে বেঞ্চমার্কের ফলাফল প্রভাবিত হয়ে থাকতে পারে—এমন সম্ভাব্য উদ্বেগ বিবেচনায় রেখে, আমরা Astra-কে দুটি নতুন বেঞ্চমার্কেও মূল্যায়ন করেছি. প্রথমত, আমরা পূর্ববর্তী তিন মাসের দুর্বলতা ব্যবহার করে এক্সপ্লয়েট ডেভেলপমেন্ট পরীক্ষা করার জন্য একটি অভ্যন্তরীণ “ExploitBench (জুন–আগস্ট 2026)” মূল্যায়ন তৈরি করেছি. 2 Astra অনেক কম আউটপুট টোকেন ব্যবহার করেই এই ডেটাসেটে GPT‑5.6 Sol-এর তুলনায় উল্লেখযোগ্যভাবে বেশি আরবিট্রারি কোড-এক্সিকিউশন রেট অর্জন করেছে. মূল্যায়নের সময়, Astra আগে অজানা ছিল এমন দুটি Chrome V8 হিপ-স্যান্ডবক্স থেকে বেরিয়ে যাওয়ার কৌশল আবিষ্কার করে এবং ব্যবহার করে. আমরা উভয় দুর্বলতা তাদের মেইনটেইনারদের কাছে প্রকাশ করছি.
আমরা Astra-কে SRE-Bench-এও পরীক্ষা করেছি, যা একটি বেঞ্চমার্ক এবং এটি পরিমাপ করে যে মডেলগুলো বাইনারি সফটওয়্যারের মূল লজিক বোঝার জন্য সেটিকে রিভার্স ইঞ্জিনিয়ার করতে পারে কি না. বেঞ্চমার্কটির প্রণেতারা একেবারে শুরু থেকে সফটওয়্যারটি তৈরি করেছেন এবং এর সোর্স কোড গোপন রেখেছেন. Astra একটি প্রচেষ্টায় 88.0% কাজ এবং চারটি প্রচেষ্টার মধ্যে 99.2% কাজ সমাধান করেছে, যেখানে GPT‑5.6 Sol যথাক্রমে 55.9% এবং 68.7% কাজ সমাধান করেছে.
বেঞ্চমার্কের বাইরেও, বিশেষজ্ঞ-নেতৃত্বাধীন মূল্যায়নে দেখা গেছে যে Astra পূর্বে অজানা দুর্বলতা ব্যবহার করে কঠোরভাবে সুরক্ষিত ব্রাউজারে নির্বিচারে কোড নির্বাহ করতে এবং কঠোরভাবে সুরক্ষিত অপারেটিং সিস্টেমের জন্য বিশেষাধিকার-বৃদ্ধির এক্সপ্লয়েট তৈরি করতে সক্ষম. সব মিলিয়ে, এই ফলাফলগুলো আমাদের এই সিদ্ধান্তে সহায়তা করেছে যে Astra আমাদের প্রিপেয়ার্ডনেস ফ্রেমওয়ার্ক-এর অধীনে সাইবার নিরাপত্তায় সংকটজনক সীমায় পৌঁছেছে.
The Defender’s Window-এ আমরা যেমন আলোচনা করেছি, অত্যাধুনিক সাইবার সক্ষমতা ডিফেন্ডারদের দ্রুত দুর্বলতা খুঁজে পেতে সাহায্য করতে পারে, তবে এগুলো সেই দুর্বলতাগুলোকে কাজে লাগানোও সহজ করে তোলে, ফলে ডিফেন্ডারদের মানিয়ে নেওয়ার তাগিদ আরও বেড়ে যায়.
আজ চালু হওয়া Astra-এর সংস্করণের জন্য, আমরা নিরাপদ কোড পর্যালোচনা, প্যাচিং এবং থ্রেট মডেলিংয়ের মতো গুরুত্বপূর্ণ প্রতিরক্ষামূলক কাজগুলো সমর্থন করি. তবে, ডিফল্টভাবে, Astra এক্সপ্লয়েট আবিষ্কারের মতো উন্নত সাইবার নিরাপত্তা-সংক্রান্ত কাজ সম্পাদন করতে অস্বীকার করবে. OpenAI Daybreak-এর মাধ্যমে, আমরা OpenAI Daybreak প্রোগ্রামে বিশ্বস্ত সাইবার নিরাপত্তা ডিফেন্ডারদের একটি আলফা গোষ্ঠীর জন্য কম বিধিনিষেধযুক্ত অ্যাক্সেস রোল আউট করছি. এটি প্রতিরক্ষামূলক নিরাপত্তা কর্মপ্রবাহে অ্যাক্সেসের সুযোগ প্রসারিত করে, যার মধ্যে রয়েছে দুর্বলতা বাছাই ও যাচাইকরণ, ম্যালওয়্যার বিশ্লেষণ, সনাক্তকরণ প্রকৌশল এবং প্যাচ যাচাইকরণ. আমরা Daybreak Blue-এর মাধ্যমে আরও অ্যাক্সেস প্রসারিত করার পরিকল্পনা করছি.
GPT‑5.6 Sol-এর জন্য আমাদের সুরক্ষা স্ট্যাকের উপর ভিত্তি করে, সম্ভাব্য সাইবার অপব্যবহারের বিরুদ্ধে আমরা আমাদের সুরক্ষাও জোরদার করেছি. এর মধ্যে রয়েছে সম্ভাব্য নিরাপত্তা এড়ানোর কৌশল আরও ভালোভাবে প্রতিরোধ করতে মডেলের দৃঢ়তা বাড়ানোর জন্য শক্তিশালী প্রশিক্ষণ এবং আমাদের পর্যবেক্ষণ ব্যবস্থার জন্য আরও কনটেক্সট. আমাদের অভ্যন্তরীণ রেড টিমিং আক্রমণকারীদের সঙ্গে স্বয়ংক্রিয় পরীক্ষাসহ কঠোর অভ্যন্তরীণ ও বাহ্যিক পরীক্ষা আমরা অব্যাহত রেখেছি. আমাদের সাইবার সুরক্ষা ব্যবস্থা ও পরীক্ষা সম্পর্কে আরও বিস্তারিত Astra সিস্টেম কার্ড এবং আমাদের ব্লগে পাওয়া যাবে.
দায়িত্বশীলভাবে GPT‑6 Astra-এর সামঞ্জস্যকরণ ও মোতায়েন
Astra হলো আমাদের সবচেয়ে সামঞ্জস্যপূর্ণ মডেল. Astra যত্নশীলতা প্রদর্শন, কাজের সীমারেখা মেনে চলা এবং স্বচ্ছভাবে যোগাযোগ করার ক্ষেত্রে দক্ষ. এই কাজটি আমাদের দীর্ঘদিনের গবেষণা কর্মসূচির সর্বশেষ ফল, যা শুরু থেকে শেষ পর্যন্ত মানুষের অভিপ্রায়ের সঙ্গে সামঞ্জস্যপূর্ণ থাকা মডেল প্রশিক্ষণের উপর কেন্দ্রীভূত.
সংবেদনশীল পরিবেশে, Astra ঝুঁকির মাত্রার সঙ্গে সামঞ্জস্যপূর্ণ সতর্কতা অবলম্বন করে এগিয়ে যায়. ভুল আচরণ ঘটানোর উদ্দেশ্যে প্রতিপক্ষসুলভভাবে নির্বাচিত কম্পিউটার ব্যবহার-সংক্রান্ত কাজগুলোর একটি মূল্যায়নে, Astra অনাকাঙ্ক্ষিত পরিণতি এড়াতে বেশি সফল ছিল. ডিফল্টভাবে প্রদত্ত অতিরিক্ত নিরাপত্তা ব্যবস্থা সহ চালানো হলে আরও শক্তিশালী পারফরম্যান্স পাওয়া গেছে.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(একটি নতুন উইন্ডোতে খোলে) and Anthropic Messages API(একটি নতুন উইন্ডোতে খোলে)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
এছাড়াও, Astra ব্যবহারকারীর নির্ধারিত এবং এর পরিবেশ থেকে পরোক্ষভাবে বোঝা সীমারেখার মধ্যে কাজ করার সম্ভাবনা বেশি. একটি অভ্যন্তরীণ মূল্যায়নে, Astra কখনোই Codex অটো-রিভিউয়ের প্রত্যাখ্যান এড়ানোর চেষ্টা করেনি. এমনকি যখন অটো-রিভিউ ইচ্ছাকৃতভাবে এড়ানোর জন্য কনফিগার করা হয়েছিল এবং অন্য কোনোভাবে কাজটি সম্পন্ন করা অসম্ভব ছিল, তখনও এই বিষয়টি প্রযোজ্য ছিল. পরিবেশের বিধিনিষেধের প্রতি এই সম্মান এই পোস্টের ভূমিকায় শেয়ার করা আমাদের সমাধান করা অসম্ভব সাইবার টাস্ক মূল্যায়নের ফলাফল এবং আমাদের সিস্টেম কার্ডে(একটি নতুন উইন্ডোতে খোলে) নথিভুক্ত অন্যান্য ফলাফলের সঙ্গে সামঞ্জস্যপূর্ণ.
Astra-এর প্রতারণামূলক আচরণেও উল্লেখযোগ্য হ্রাস দেখা যায়.যাঁরা কাজ অর্পণ করেন, তাঁদের একটি মডেলের সক্ষমতা সম্পর্কে স্পষ্ট ধারণা এবং এর অগ্রগতি সম্পর্কে সৎভাবে প্রতিবেদন করা প্রয়োজন. এটি সততার একটি দিক পরিমাপ করে; ইচ্ছাকৃত প্রতারণা কমানো আমাদের অ্যালাইনমেন্ট-সংক্রান্ত কাজের একটি বৃহত্তর লক্ষ্য হিসেবে রয়ে গেছে.
আমাদের সক্ষমতা-হ্যালুসিনেশন মূল্যায়নে, Astra GPT‑5.6 Sol-এর তুলনায় উল্লেখযোগ্য উন্নতি দেখিয়েছে এবং এর সক্ষমতা সম্পর্কে কম বিভ্রান্তিকর দাবি করেছে.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(একটি নতুন উইন্ডোতে খোলে) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(একটি নতুন উইন্ডোতে খোলে) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
উপলভ্যতা
GPT‑6 Astra আজ Enterprise এবং আমাদের Trusted Access Program-এর গ্রাহকদের জন্য ধাপে ধাপে চালু করা হচ্ছে, আর আগামী কয়েক দিনের মধ্যে ChatGPT Plus, Pro, Business এবং Enterprise সাবস্ক্রাইব করা ব্যক্তিদের জন্য ব্যাপকভাবে উপলভ্য হবে. Astra ব্যবহার $100 ও $200 এর Pro প্ল্যান এবং $100 এর Business প্ল্যানের বিদ্যমান ব্যবহারের বরাদ্দের মধ্যে অন্তর্ভুক্ত, এতে কোনো অতিরিক্ত সীমা বা বিধিনিষেধ নেই. $20 এর Plus সাবস্ক্রিপশনধারী ব্যক্তি এবং স্ট্যান্ডার্ড Business প্ল্যানের গ্রাহকেরা কম সীমাসহ GPT‑6 Astra ব্যবহার করতে পারবেন এবং অতিরিক্ত অ্যাক্সেসের জন্য ক্রেডিট কেনার বিকল্প থাকবে. Enterprise অ্যাডমিনিস্ট্রেটররা তাদের ওয়ার্কস্পেসের জন্য Astra সক্ষম করতে পারবেন; চালুর সময় অ্যাক্সেস ডিফল্টভাবে বন্ধ থাকবে.
Pro Lite, Pro, Business এবং Enterprise-এর ব্যবহারকারীরাও চ্যাটে GPT‑6 Astra ব্যবহার করতে পারেন. Astra যোগ্য API গ্রাহকদের জন্য জিরো ডাটা রিটেনশন সমর্থন করে এবং গত মাসে আমরা যেমন শেয়ার করেছি, গ্রাহকের গোপনীয়তা বজায় রেখে নিরাপত্তা পর্যবেক্ষণ জোরদার করতে আমরা প্রাইভেট সেফটি প্রসেসিং পরীক্ষা করছি.
ডেভেলপারদের জন্য, GPT‑6 Astra OpenAI API-তে gpt-6-astra নামে উপলভ্য এবং AWS Bedrock-এও উপলভ্য. OpenAI API Standard-এর মূল্য প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $10 এবং প্রতি মিলিয়ন আউটপুট টোকেনের জন্য $50. ক্যাশ থেকে পড়া এবং ক্যাশে লেখার জন্য পৃথক হার প্রযোজ্য. API-তে GPT‑6 Astra-এর জন্য ফাস্ট মোড উপলভ্য, যা Standard প্রসেসিংয়ের 2x মূল্যে তার চেয়ে 2.5x পর্যন্ত গতি দেয়.
কম্পিউটার ব্যবহার
| কম্পিউটার ব্যবহার | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| OSWorld 2.0 (আগস্ট রিলিজ, আংশিক স্কোর) | - | - | - | 66.1% | 70.6% | - |
| OSWorld 2.0 (আগস্ট রিলিজ, অফলাইন উপসেট, আংশিক স্কোর) | - | - | - | - | - | - |
| ScreenSpot Pro | 92.6% | 76.8% | - | - | - | - |
| BrowseComp | 92.1% | 90.4% | - | 87.4% | 90.8% | - |
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
বিজ্ঞান ও স্বাস্থ্য
| বিজ্ঞান ও স্বাস্থ্য | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| GeneBench Pro | 37.1% | 32.3% | - | - | - | - |
| MedChemBench (অভ্যন্তরীণ) | 49.7% | 47.4% | - | - | - | - |
| LifeSci Bench | 60.8% | 59.9% | - | - | - | - |
| HealthBench Professional (দৈর্ঘ্য-সামঞ্জস্যকৃত) | 63.4% | 60.5% | 62.1% | 60.9% | 59.8% | 48.7% |
সাইবারসিকিউরিটি
| সাইবারসিকিউরিটি | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| CVE-Bench | - | 94.1% | - | - | - | - |
| ক্যাপচার দ্য ফ্ল্যাগ চ্যালেঞ্জসমূহ | - | 96.7% | - | - | - | - |
| SEC-Bench Pro | 85.4% | 79.1% | - | - | - | - |
| CyberGym | - | 84.5% | - | - | - | - |
| ExploitBench | 100.0% | 78.5% | - | - | 70.0% | - |
| ExploitGym (2 ঘণ্টা) | - | 33.7%? | - | - | 171 | - |
| ExploitGym (6 ঘণ্টা) | - | 33.7%? | - | - | 191 | - |
অ্যালাইনমেন্ট
অ্যালাইনমেন্ট | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
অভ্যন্তরীণ কম্পিউটার ব্যবহারের নিরাপত্তা বেঞ্চমার্ক (কম হলে ভালো) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
অভ্যন্তরীণ কম্পিউটার ব্যবহার নিরাপত্তা বেঞ্চমার্ক, AutoReview সহ (কম হলে ভালো) | 1.8% | 4.3% | - | - | - | - |
অভ্যন্তরীণ বাইপাস বেঞ্চমার্ক (কম হলে ভালো) | 0.00% | 0.29% | - | - | - | - |
ExploitGym হানিপট (কম হলে ভালো) | 0.0% | 48.2% | - | - | - | - |
অসম্ভব ExploitGym | 100.0% | - | - | - | - | - |
অভ্যন্তরীণ হ্যালুসিনেশন বেঞ্চমার্ক (কম হলে ভালো) | 4.2% | 12.2% | - | - | - | - |
লং কনটেক্সট
লং কনটেক্সট | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
অবস্থানগত যুক্তি
| অবস্থানগত যুক্তি | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| ARC-AGI-3 | 99.9% | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | 84.6% |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | 95.5% |
যেকোনো প্রচেষ্টায় মূল্যায়ন স্কোর সর্বোচ্চ. GPT‑এর মূল্যায়ন আমাদের গবেষণা পরিবেশে বা আমাদের API-এর মাধ্যমে চালানো হয়েছিল, যা সিস্টেম প্রম্পট, উপলভ্য টুল ইত্যাদির পার্থক্যের কারণে প্রোডাকশন ChatGPT থেকে সামান্য ভিন্ন আউটপুট দিতে পারে.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(একটি নতুন উইন্ডোতে খোলে). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(একটি নতুন উইন্ডোতে খোলে).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(একটি নতুন উইন্ডোতে খোলে).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(একটি নতুন উইন্ডোতে খোলে).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(একটি নতুন উইন্ডোতে খোলে): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(একটি নতুন উইন্ডোতে খোলে) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(একটি নতুন উইন্ডোতে খোলে) and supporting research(একটি নতুন উইন্ডোতে খোলে).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(একটি নতুন উইন্ডোতে খোলে) and supporting research(একটি নতুন উইন্ডোতে খোলে).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(একটি নতুন উইন্ডোতে খোলে).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
