GPT‑6 Sol ও Luna উন্মোচন
আপনার দৈনন্দিন কাজে অত্যাধুনিক বুদ্ধিমত্তা আনার আরও উপায়.
এই মাসের শুরুতে আমরা GPT‑6 Astra উন্মোচন করেছি, যা বিশ্বের সবচেয়ে বুদ্ধিমান ও সবচেয়ে সামঞ্জস্যপূর্ণ মডেল. সবচেয়ে কঠিন ও গুরুত্বপূর্ণ প্রকল্পের জন্য এখনও Astra-এর পূর্ণ গভীরতা দরকার হলেও, কাজ হয় ভিন্ন ভিন্ন পরিসর, গতি ও বাজেটে.
তাই আমরা GPT‑6 Sol এবং GPT‑6 Luna দিয়ে GPT‑6 জগৎকে বিস্তৃত করছি. GPT‑6 Astra বুদ্ধিমত্তার এক নতুন প্রজন্ম এনেছে—এই মডেলগুলো ব্যয়-দক্ষতার অত্যাধুনিক সীমাকে এগিয়ে নিয়ে সেই বুদ্ধিমত্তার সুফল আরও ছড়িয়ে দিতে সহায়তা করে. GPT‑6 Astra-এর মতো পদ্ধতিতে আমরা GPT‑6 Sol ও Luna প্রশিক্ষণ দিয়েছি, ফলে পেশাগত কাজ, তথ্যনিষ্ঠতা, কোডিং, কম্পিউটার ব্যবহার ও অ্যালাইনমেন্টে Astra-এর সর্বাধুনিক পারফরম্যান্সের পেছনের অগ্রগতি আরও দ্রুত ও সাশ্রয়ী মডেলে এসেছে.
GPT‑6 মডেলগুলো ব্যয়–বুদ্ধিমত্তা বক্ররেখায় এগিয়ে আছে; প্রতিটি স্তরে অসাধারণ সক্ষমতার সঙ্গে এমন অবকাঠামো যুক্ত হয়েছে যা এগুলোকে বৃহৎ পরিসরে দক্ষতার সঙ্গে সরবরাহ করে. ক্যাশিং ও ইনফারেন্সে উন্নতির ফলে আমরা কম খরচে এই মডেলগুলো সরবরাহ করতে পারছি, আর GPT‑5.6-এর প্রচারমূলক মূল্যের তুলনায় Sol ও Luna-এর API মূল্য ৫০% কমিয়ে সেই সাশ্রয় সরাসরি ব্যবহারকারী ও গ্রাহকদের দিচ্ছি. সব মিলিয়ে, এই উন্নতিগুলো আরও বেশি দৈনন্দিন কাজ ও অ্যাপ্লিকেশনে বৃহৎ পরিসরে উন্নত AI ব্যবহারকে বাস্তবসম্মত করে তোলে.
মডেল | ইনপুট | আউটপুট | মূল্য হ্রাস |
GPT‑6 Sol | $4 → $2 | $20 → $10 | ৫০% সস্তা |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | ৫০% সস্তা |
মূল্য প্রতি ১০ লক্ষ টোকেনের জন্য.
GPT‑6 Astra সামগ্রিকভাবে এখনও আমাদের সেরা মডেল. সেরা ফলাফল ও কোনো আপস ছাড়া অভিজ্ঞতা চাইলে এটি বেছে নিন.
জটিল কাজ শেষ করার জন্য সবচেয়ে দরকারি সক্ষমতাগুলোতে GPT‑6 Sol ও Luna আপনার পরিচিত ও ব্যবহৃত মডেলগুলোতে বুদ্ধিমত্তার উন্নতি ও ব্যয়-দক্ষতা নিয়ে আসে.
GPT‑6 Sol কঠিন কাজের দায়িত্ব নিতে পারে এবং উচ্চতর ব্যবহারসীমা ও কম খরচে আপনাকে আরও বেশি পুনরাবৃত্তির সুযোগ দেয়; একই দামের প্রতিদ্বন্দ্বী মডেলের তুলনায় বেশি বুদ্ধিমত্তা ও ভালো ফলাফল দেয়.
অ্যাপজুড়ে ব্যবসায়িক ওয়ার্কফ্লোর পরীক্ষা AutomationBench-এ, xhigh effort-এ GPT‑6 Sol প্রতি কাজের খরচে Opus 5-এর মাত্র ৯% ব্যয়ে max effort-এ Claude Opus 5-কে ছাড়িয়ে যায়. high effort-এ, GPT‑6 Luna তার পূর্বসূরির তুলনায় প্রতি কাজের খরচ ৫৮% কম রেখে ৫.৪ শতাংশ পয়েন্ট উন্নতি করে.
AutomationBench 1.0.6(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টদের sales, marketing, operations, support, finance এবং HR জুড়ে ৪৭টি টুল ব্যবহার করে end-to-end ওয়ার্কফ্লোতে পরীক্ষা করা হয়. Claude Fable 5.1-এর ডেটাপয়েন্ট তার প্রকৃত খরচ কম দেখায়, কারণ এতে Opus 5 fallback-এর খরচ বাদ পড়েছে, যা প্রায় ৪০% কাজে ঘটেছিল.
GPT‑6 Sol অনেক কম খরচে Claude Fable 5.1-কেও ছাড়িয়ে যায়, এমনকি low-effort GPT‑6 Astra-কেও পেছনে ফেলে.
মডেল (ও effort) | স্কোর | প্রতি কাজের খরচ |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (নিম্ন) | 30.3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26.9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 w/ Opus 5 Fallback (Max) | 31.4% | >8.9x GPT‑6 Sol (fallback খরচ রিপোর্ট করা হয়নি) |
জটিল পেশাগত ওয়ার্কফ্লোতে এজেন্টদের মূল্যায়নকারী Agents’ Last Exam-এ, max effort-এ GPT‑6 Sol ৫৬.৪% স্কোর করে, যা মূল্যায়নে Claude Opus 5-এর সর্বোচ্চ স্কোরের চেয়ে বেশি, অথচ প্রতি কাজের খরচ ৬০% কম.
Agents’ Last Exam V1(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টদের ৫৫টি উপ-শিল্পজুড়ে দীর্ঘমেয়াদি, অর্থনৈতিকভাবে মূল্যবান কাজে মূল্যায়ন করা হয়, যা কম্পিউটারে সম্পন্ন পেশাগত কাজের অধিকাংশ প্রধান ক্ষেত্রকে কভার করে.
কোনো উত্তর কতটা উপযোগী হবে তা তথ্য ঠিক থাকার ওপর নির্ভর করে, আর আমরা তথ্যগত নির্ভরযোগ্যতায় অগ্রগতি অব্যাহত রেখেছি. আমাদের অভ্যন্তরীণ তথ্যনিষ্ঠতা মূল্যায়নে, যা এমন পরিচয়বিহীন বাস্তব কথোপকথনের ওপর ভিত্তি করে যেখানে ব্যবহারকারীরা আমাদের মডেলের ভুল চিহ্নিত করেছিলেন, GPT‑6 Sol তার পূর্বসূরির তুলনায় প্রায় অর্ধেক ভুল করে এবং অনেক কম খরচে Astra-স্তরের নির্ভরযোগ্যতার কাছাকাছি পৌঁছায়. GPT‑6 Luna-ও উল্লেখযোগ্যভাবে উন্নতি করেছে; উচ্চ effort স্তরে এটি প্রায় এক-শতাংশ খরচে GPT‑5.6 Sol-এর সমতুল্য হয়.
এখানে আমরা পরিচয়বিহীন ChatGPT কথোপকথনে তথ্যনিষ্ঠতা মূল্যায়ন করি, যেখানে ব্যবহারকারীরা আগের কোনো মডেলের তথ্যগত ভুল চিহ্নিত করেছিলেন. এই ভুল-উদ্রেককারী কথোপকথনগুলো সাধারণ ব্যবহারের প্রতিনিধিত্ব করে না, যেখানে তথ্যগত ভুল তুলনামূলক বিরল. স্কোরগুলো দৈর্ঘ্য অনুযায়ী নিয়ন্ত্রিত নয়; তবে আমাদের verbosity sweep-এ দেখা গেছে উত্তরের দৈর্ঘ্যের ওপর নির্ভরতা প্রায় নেই.
এই বছর, কোডিং এজেন্টগুলো আগের যেকোনো সময়ের চেয়ে বেশি জটিল, বিস্তৃত ও দীর্ঘমেয়াদি কাজ নিতে শুরু করেছে. OpenAI-তে আমাদের অভ্যন্তরীণ ব্যবহার সূচকীয়ভাবে বেড়েছে. API মূল্যে হিসাব করলে, দৈনিক টোকেন ব্যবহার মধ্যম গবেষকের জন্য $600 এবং ৯০তম পারসেন্টাইলের গবেষকদের জন্য $7,000 ছাড়িয়ে গেছে (গবেষণা ত্বরান্বিতকরণ: OpenAI-এর ভেতরের দৃশ্য). কোডিং এজেন্টগুলো যত দীর্ঘ ও কঠিন কাজ নিচ্ছে, ধারাবাহিক ব্যবহারের খরচ তত বেশি গুরুত্বপূর্ণ হয়ে উঠছে. GPT‑6 Sol ও Luna শক্তিশালী কোডিং পারফরম্যান্সকে কম API মূল্যের সঙ্গে মিলিয়ে দেয়, ফলে ডেভেলপাররা আরও বেশি পুনরাবৃত্তির সুযোগ পান এবং দলগুলো Codex-কে আরও উচ্চাভিলাষী কাজ দিতে আত্মবিশ্বাস পায়.
বাস্তব কোডবেসে মার্জ করার মতো পরিবর্তন কোডিং এজেন্ট তৈরি করতে পারে কি না তা মূল্যায়নকারী FrontierCode-এ, GPT‑6 Sol GPT‑5.6 Sol-এর তুলনায় উল্লেখযোগ্যভাবে উন্নতি করে এবং অনেক কম খরচে Claude Fable 5.1 xhigh-এর সমতুল্য হতে পারে.
FrontierCode 1.1 Main(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টরা কোড লেখে, যা শুধু সঠিকতার ভিত্তিতে নয়, “মার্জযোগ্যতা”-র ভিত্তিতেও মূল্যায়িত হয়: যেমন টেস্টের মান, পরিসর নিয়ন্ত্রণ, কোড স্টাইল এবং কোডবেসের মানদণ্ড মেনে চলা.
বাস্তব কোডবেসে জটিল সফটওয়্যার-ইঞ্জিনিয়ারিং কাজের পারফরম্যান্স পরীক্ষা করা DeepSWE v1.1-এ, max effort-এ GPT‑6 Sol ৬৮.৮% স্কোর করে, যা মূল্যায়নে Claude Fable 5-এর সর্বোচ্চ স্কোরের ১.১ শতাংশ পয়েন্টের মধ্যে—xhigh effort-এ ৬৯.৯%—এবং প্রতি কাজের খরচ প্রায় ৮০% কম.
max effort-এ GPT‑6 Luna ৬৬.৬% স্কোর করে, যা medium effort-এ Claude Opus 5 ও Fable 5-এর সমতুল্য. এই তুলনাগুলোতে, প্রতি কাজের খরচে Luna Opus 5-এর চেয়ে ৯৩% এবং Fable 5-এর চেয়ে ৯৬% কম.
DeepSWE 1.1(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টরা মৌলিক, দীর্ঘমেয়াদি সফটওয়্যার ইঞ্জিনিয়ারিং কাজ সমাধান করে.
GPT‑6 Astra কম্পিউটার ব্যবহারের জন্য বিশ্বের সেরা মডেল হিসেবে রয়ে গেলেও, GPT‑6 Sol ও Luna তাদের পূর্বসূরিদের তুলনায় বেশি ব্যয়-দক্ষ পারফরম্যান্স দেয়. OSWorld 2.0 offline-এ, xhigh effort-এ GPT‑6 Sol medium effort-এ Claude Opus 5-এর কাছাকাছি স্কোর পায়—৬০.৫% বনাম ৬০.৩%—প্রতি কাজের খরচ প্রায় ৮০% কম রেখে. GPT‑6 Luna (max) GPT‑5.6 Sol (medium)-কে তার খরচের এক-দশমাংশে ছাড়িয়ে যেতে পারে.
OSWorld 2.0(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টরা দৈনন্দিন ও পেশাগত কাজজুড়ে দীর্ঘমেয়াদি কম্পিউটার-ব্যবহার ওয়ার্কফ্লো করার চেষ্টা করে. আমরা v2026.08.08 রিলিজের offline set-এ partial reward রিপোর্ট করি.
আমরা GPT‑6 Astra-এর উন্নত যোগাযোগশৈলী Sol ও Luna-তেও এনেছি, যা আমাদের মতে প্রযুক্তিগত ও কোডিং কথোপকথনে বিশেষভাবে চোখে পড়বে. সারবস্তু না হারিয়ে আরও বেশি স্পষ্টতা, কম জার্গন, অদ্ভুত বাক্যবন্ধ কম, কম-মূল্যের বিবরণ কম, এবং সামগ্রিকভাবে সামান্য ছোট উত্তর আশা করুন.
স্টাইল ব্যক্তিনির্ভর হলেও, এখানে আমরা GPT‑6 Sol-এর উত্তরকেই পছন্দ করি. এটি দ্রুত সিদ্ধান্তে ঝাঁপ দেয় না, প্রশ্নকারীর কাছে স্পষ্ট হতে পারে এমন বিবরণ (যেমন ওয়েবসাইটে চারটি পৃষ্ঠা আছে) পুনরাবৃত্তিতে কম সময় দেয়, কম অস্পষ্ট ভাষা ব্যবহার করে (যেমন “bento feel”, “reshaping… around that system”), কী পরীক্ষা করেছে আর কী করেনি তা আরও খোলামেলাভাবে জানায়, এবং ইমেজ টুল প্রম্পটের মতো বাস্তবায়ন-সংক্রান্ত অপ্রয়োজনীয় বিবরণ শেয়ার করে না.
কম টোকেন মূল্যের পাশাপাশি, GPT‑6‑এর ওপর তৈরি করা ডেভেলপারদের অ্যাপ্লিকেশনগুলো যে কনটেক্সট পুনরায় ব্যবহার করে তাতে আরও সাশ্রয় করতে আমরা সহায়তা করছি. GPT‑6‑এর জন্য আমরা প্রম্পট ক্যাশিং উন্নত করেছি, যাতে ডিফল্টভাবেই বেশি cache hit rate পাওয়া যায়; এতে এজেন্টরা বেশি কনটেক্সট পুনরায় ব্যবহার করতে পারে, দ্রুত সাড়া দেয় এবং cached input-token read-এ ৯০% ছাড়ের সুবিধা পায়.
ডেভেলপারদের ক্যাশিং পারফরম্যান্স মাপা ও অপ্টিমাইজ করার আরও উপায়ও আছে:
পর্যবেক্ষণ ও নির্ণয় করুন. প্রম্পট ক্যাশিং ড্যাশবোর্ড(একটি নতুন উইন্ডোতে খোলে) দেখায় কত ইনপুট ক্যাশ হয়েছে এবং সময়ের সঙ্গে তা কীভাবে বদলাচ্ছে. ডায়াগনস্টিক টুল(একটি নতুন উইন্ডোতে খোলে) ক্যাশিংয়ের মিস হওয়া সুযোগ এবং কী ঠিক করতে হবে তা ব্যাখ্যা করতে সহায়তা করে.
ক্যাশ না ভেঙে reasoning effort ও টুলের প্রাপ্যতা সামঞ্জস্য করুন. কঠিন কাজের জন্য reasoning effort(একটি নতুন উইন্ডোতে খোলে) বাড়ান বা সহজ follow-up-এর জন্য কমান, এবং আপনার এজেন্টের প্রয়োজন বদলালে টুল চালু বা বন্ধ করুন(একটি নতুন উইন্ডোতে খোলে). দুটি নিয়ন্ত্রণই এখন ক্যাশে পুনরায় ব্যবহারের জন্য আগের কনটেক্সট সংরক্ষণ করে.
কোন prefix ক্যাশ হবে তা অপ্টিমাইজ করুন. স্পষ্ট breakpoint ডেভেলপারদের cached prompt prefix কোথায় শেষ হবে তা বেছে নিতে দেয়. এতে ডেভেলপাররা cache reuse-এর ওপর আরও নিয়ন্ত্রণ পান এবং পারফরম্যান্স উন্নত হতে পারে.
GitHub জানিয়েছে, গত কয়েক মাসে এই উন্নতিগুলো OpenAI মডেলে বিলিয়ন বিলিয়ন request জুড়ে নতুন করে প্রক্রিয়াকরণ দরকার এমন প্রম্পট টোকেনের অংশ ৫০%-এর বেশি কমিয়েছে, ফলে Copilot দ্রুত সাড়া দিতে পারছে.
GPT‑6 Sol ও Luna Astra-এর সঙ্গে উন্মোচিত অ্যালাইনমেন্ট কাজের ওপর ভিত্তি করে তৈরি, যা এখন পর্যন্ত আমাদের সবচেয়ে aligned মডেল. আমাদের অ্যালাইনমেন্ট মূল্যায়নে, Sol ও Luna উভয়ই তাদের GPT‑5.6 counterpart-এর তুলনায় উন্নতি দেখায়, যার মধ্যে তাদের কোডিং কাজ নিয়ে বিভ্রান্তিকর দাবির হার কমাও রয়েছে.
নিচের মূল্যায়নগুলো ইচ্ছাকৃতভাবে চ্যালেঞ্জিং পরিস্থিতি পরীক্ষা করে এবং সাধারণ ব্যবহারে ব্যর্থতার হার মাপে না. সম্পূর্ণ ফলাফলের জন্য সিস্টেম কার্ড(একটি নতুন উইন্ডোতে খোলে) দেখুন.
GPT‑6 Sol ও GPT‑6 Luna আজ থেকে সব Plus, Pro, Business, Enterprise এবং Edu ব্যবহারকারীর জন্য ChatGPT কাজ ও Codex-এ উপলভ্য. Free ও Go ব্যবহারকারীরা desktop app-এ GPT‑6 Luna ব্যবহার করতে পারবেন. এই মডেলগুলো এখনও চ্যাটে উপলভ্য নয়. OpenAI API-তে এগুলো gpt-6-sol এবং gpt-6-luna হিসেবে উপলভ্য.
সবার জন্য সেবা স্থিতিশীল রাখতে, আমরা সারা দিনে ধীরে ধীরে ChatGPT‑তে এই মডেলগুলো চালু করার পরিকল্পনা করছি. ChatGPT কাজ বা Codex-এ নতুন মডেলগুলো না দেখলে, অনুগ্রহ করে পরে আবার চেষ্টা করুন.
GPT‑এর মূল্যায়ন আমাদের গবেষণা পরিবেশে বা আমাদের API-এর মাধ্যমে করা হয়েছে, যা system prompt, উপলভ্য টুল ইত্যাদির পার্থক্যের কারণে production ChatGPT থেকে সামান্য ভিন্ন output দিতে পারে. প্রতিদ্বন্দ্বী মডেলের মূল্যায়ন প্রকাশ্যে উপলভ্য রিপোর্ট থেকে নেওয়া হয়েছে. Claude Fable 5.1-এর স্কোর উপলভ্য না থাকলে Claude Fable 5-এর স্কোর রিপোর্ট করা হয়েছে.


