মূল কনটেন্টে যান
OpenAI

GPT‑6 Sol ও Luna উন্মোচন

আপনার দৈনন্দিন কাজে অত্যাধুনিক বুদ্ধিমত্তা আনার আরও উপায়.

লোডিং…

এই মাসের শুরুতে আমরা GPT‑6 Astra উন্মোচন করেছি, যা বিশ্বের সবচেয়ে বুদ্ধিমান ও সবচেয়ে সামঞ্জস্যপূর্ণ মডেল. সবচেয়ে কঠিন ও গুরুত্বপূর্ণ প্রকল্পের জন্য এখনও Astra-এর পূর্ণ গভীরতা দরকার হলেও, কাজ হয় ভিন্ন ভিন্ন পরিসর, গতি ও বাজেটে.

তাই আমরা GPT‑6 Sol এবং GPT‑6 Luna দিয়ে GPT‑6 জগৎকে বিস্তৃত করছি. GPT‑6 Astra বুদ্ধিমত্তার এক নতুন প্রজন্ম এনেছে—এই মডেলগুলো ব্যয়-দক্ষতার অত্যাধুনিক সীমাকে এগিয়ে নিয়ে সেই বুদ্ধিমত্তার সুফল আরও ছড়িয়ে দিতে সহায়তা করে. GPT‑6 Astra-এর মতো পদ্ধতিতে আমরা GPT‑6 Sol ও Luna প্রশিক্ষণ দিয়েছি, ফলে পেশাগত কাজ, তথ্যনিষ্ঠতা, কোডিং, কম্পিউটার ব্যবহার ও অ্যালাইনমেন্টে Astra-এর সর্বাধুনিক পারফরম্যান্সের পেছনের অগ্রগতি আরও দ্রুত ও সাশ্রয়ী মডেলে এসেছে.

GPT‑6 মডেলগুলো ব্যয়–বুদ্ধিমত্তা বক্ররেখায় এগিয়ে আছে; প্রতিটি স্তরে অসাধারণ সক্ষমতার সঙ্গে এমন অবকাঠামো যুক্ত হয়েছে যা এগুলোকে বৃহৎ পরিসরে দক্ষতার সঙ্গে সরবরাহ করে. ক্যাশিং ও ইনফারেন্সে উন্নতির ফলে আমরা কম খরচে এই মডেলগুলো সরবরাহ করতে পারছি, আর GPT‑5.6-এর প্রচারমূলক মূল্যের তুলনায় Sol ও Luna-এর API মূল্য ৫০% কমিয়ে সেই সাশ্রয় সরাসরি ব্যবহারকারী ও গ্রাহকদের দিচ্ছি. সব মিলিয়ে, এই উন্নতিগুলো আরও বেশি দৈনন্দিন কাজ ও অ্যাপ্লিকেশনে বৃহৎ পরিসরে উন্নত AI ব্যবহারকে বাস্তবসম্মত করে তোলে.

GPT‑6 API মূল্য

মডেল

ইনপুট

আউটপুট

মূল্য হ্রাস

GPT‑6 Sol
vs. GPT‑5.6 Sol

$4 → $2

$20 → $10

৫০% সস্তা

GPT‑6 Luna
vs. GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

৫০% সস্তা

মূল্য প্রতি ১০ লক্ষ টোকেনের জন্য.

GPT‑6 Astra সামগ্রিকভাবে এখনও আমাদের সেরা মডেল. সেরা ফলাফল ও কোনো আপস ছাড়া অভিজ্ঞতা চাইলে এটি বেছে নিন.

মডেল পরিবারজুড়ে এক ধাপ এগিয়ে

জটিল কাজ শেষ করার জন্য সবচেয়ে দরকারি সক্ষমতাগুলোতে GPT‑6 Sol ও Luna আপনার পরিচিত ও ব্যবহৃত মডেলগুলোতে বুদ্ধিমত্তার উন্নতি ও ব্যয়-দক্ষতা নিয়ে আসে.

পেশাগত কাজ

GPT‑6 Sol কঠিন কাজের দায়িত্ব নিতে পারে এবং উচ্চতর ব্যবহারসীমা ও কম খরচে আপনাকে আরও বেশি পুনরাবৃত্তির সুযোগ দেয়; একই দামের প্রতিদ্বন্দ্বী মডেলের তুলনায় বেশি বুদ্ধিমত্তা ও ভালো ফলাফল দেয়.

অ্যাপজুড়ে ব্যবসায়িক ওয়ার্কফ্লোর পরীক্ষা AutomationBench-এ, xhigh effort-এ GPT‑6 Sol প্রতি কাজের খরচে Opus 5-এর মাত্র ৯% ব্যয়ে max effort-এ Claude Opus 5-কে ছাড়িয়ে যায়. high effort-এ, GPT‑6 Luna তার পূর্বসূরির তুলনায় প্রতি কাজের খরচ ৫৮% কম রেখে ৫.৪ শতাংশ পয়েন্ট উন্নতি করে.

AutomationBench 1.0.6⁠(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টদের sales, marketing, operations, support, finance এবং HR জুড়ে ৪৭টি টুল ব্যবহার করে end-to-end ওয়ার্কফ্লোতে পরীক্ষা করা হয়. Claude Fable 5.1-এর ডেটাপয়েন্ট তার প্রকৃত খরচ কম দেখায়, কারণ এতে Opus 5 fallback-এর খরচ বাদ পড়েছে, যা প্রায় ৪০% কাজে ঘটেছিল.

GPT‑6 Sol অনেক কম খরচে Claude Fable 5.1-কেও ছাড়িয়ে যায়, এমনকি low-effort GPT‑6 Astra-কেও পেছনে ফেলে.

মডেল (ও effort)

স্কোর

প্রতি কাজের খরচ

GPT‑6 Sol (xhigh)

33.2%

$0.27

GPT‑6 Astra (নিম্ন)

30.3%

3.9x GPT‑6 Sol

Claude Opus 5 (Max)

26.9%

11.1x GPT‑6 Sol

Claude Fable 5.1 w/ Opus 5 Fallback (Max)

31.4%

>8.9x GPT‑6 Sol

(fallback খরচ রিপোর্ট করা হয়নি)

জটিল পেশাগত ওয়ার্কফ্লোতে এজেন্টদের মূল্যায়নকারী Agents’ Last Exam-এ, max effort-এ GPT‑6 Sol ৫৬.৪% স্কোর করে, যা মূল্যায়নে Claude Opus 5-এর সর্বোচ্চ স্কোরের চেয়ে বেশি, অথচ প্রতি কাজের খরচ ৬০% কম.

Agents’ Last Exam V1⁠(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টদের ৫৫টি উপ-শিল্পজুড়ে দীর্ঘমেয়াদি, অর্থনৈতিকভাবে মূল্যবান কাজে মূল্যায়ন করা হয়, যা কম্পিউটারে সম্পন্ন পেশাগত কাজের অধিকাংশ প্রধান ক্ষেত্রকে কভার করে.

তথ্যনিষ্ঠতা

কোনো উত্তর কতটা উপযোগী হবে তা তথ্য ঠিক থাকার ওপর নির্ভর করে, আর আমরা তথ্যগত নির্ভরযোগ্যতায় অগ্রগতি অব্যাহত রেখেছি. আমাদের অভ্যন্তরীণ তথ্যনিষ্ঠতা মূল্যায়নে, যা এমন পরিচয়বিহীন বাস্তব কথোপকথনের ওপর ভিত্তি করে যেখানে ব্যবহারকারীরা আমাদের মডেলের ভুল চিহ্নিত করেছিলেন, GPT‑6 Sol তার পূর্বসূরির তুলনায় প্রায় অর্ধেক ভুল করে এবং অনেক কম খরচে Astra-স্তরের নির্ভরযোগ্যতার কাছাকাছি পৌঁছায়. GPT‑6 Luna-ও উল্লেখযোগ্যভাবে উন্নতি করেছে; উচ্চ effort স্তরে এটি প্রায় এক-শতাংশ খরচে GPT‑5.6 Sol-এর সমতুল্য হয়.

এখানে আমরা পরিচয়বিহীন ChatGPT কথোপকথনে তথ্যনিষ্ঠতা মূল্যায়ন করি, যেখানে ব্যবহারকারীরা আগের কোনো মডেলের তথ্যগত ভুল চিহ্নিত করেছিলেন. এই ভুল-উদ্রেককারী কথোপকথনগুলো সাধারণ ব্যবহারের প্রতিনিধিত্ব করে না, যেখানে তথ্যগত ভুল তুলনামূলক বিরল. স্কোরগুলো দৈর্ঘ্য অনুযায়ী নিয়ন্ত্রিত নয়; তবে আমাদের verbosity sweep-এ দেখা গেছে উত্তরের দৈর্ঘ্যের ওপর নির্ভরতা প্রায় নেই.

কোডিং

এই বছর, কোডিং এজেন্টগুলো আগের যেকোনো সময়ের চেয়ে বেশি জটিল, বিস্তৃত ও দীর্ঘমেয়াদি কাজ নিতে শুরু করেছে. OpenAI-তে আমাদের অভ্যন্তরীণ ব্যবহার সূচকীয়ভাবে বেড়েছে. API মূল্যে হিসাব করলে, দৈনিক টোকেন ব্যবহার মধ্যম গবেষকের জন্য $600 এবং ৯০তম পারসেন্টাইলের গবেষকদের জন্য $7,000 ছাড়িয়ে গেছে (গবেষণা ত্বরান্বিতকরণ: OpenAI-এর ভেতরের দৃশ্য⁠). কোডিং এজেন্টগুলো যত দীর্ঘ ও কঠিন কাজ নিচ্ছে, ধারাবাহিক ব্যবহারের খরচ তত বেশি গুরুত্বপূর্ণ হয়ে উঠছে. GPT‑6 Sol ও Luna শক্তিশালী কোডিং পারফরম্যান্সকে কম API মূল্যের সঙ্গে মিলিয়ে দেয়, ফলে ডেভেলপাররা আরও বেশি পুনরাবৃত্তির সুযোগ পান এবং দলগুলো Codex-কে আরও উচ্চাভিলাষী কাজ দিতে আত্মবিশ্বাস পায়.

বাস্তব কোডবেসে মার্জ করার মতো পরিবর্তন কোডিং এজেন্ট তৈরি করতে পারে কি না তা মূল্যায়নকারী FrontierCode-এ, GPT‑6 Sol GPT‑5.6 Sol-এর তুলনায় উল্লেখযোগ্যভাবে উন্নতি করে এবং অনেক কম খরচে Claude Fable 5.1 xhigh-এর সমতুল্য হতে পারে.

FrontierCode 1.1 Main⁠(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টরা কোড লেখে, যা শুধু সঠিকতার ভিত্তিতে নয়, “মার্জযোগ্যতা”-র ভিত্তিতেও মূল্যায়িত হয়: যেমন টেস্টের মান, পরিসর নিয়ন্ত্রণ, কোড স্টাইল এবং কোডবেসের মানদণ্ড মেনে চলা.

বাস্তব কোডবেসে জটিল সফটওয়্যার-ইঞ্জিনিয়ারিং কাজের পারফরম্যান্স পরীক্ষা করা DeepSWE v1.1-এ, max effort-এ GPT‑6 Sol ৬৮.৮% স্কোর করে, যা মূল্যায়নে Claude Fable 5-এর সর্বোচ্চ স্কোরের ১.১ শতাংশ পয়েন্টের মধ্যে—xhigh effort-এ ৬৯.৯%—এবং প্রতি কাজের খরচ প্রায় ৮০% কম.

max effort-এ GPT‑6 Luna ৬৬.৬% স্কোর করে, যা medium effort-এ Claude Opus 5 ও Fable 5-এর সমতুল্য. এই তুলনাগুলোতে, প্রতি কাজের খরচে Luna Opus 5-এর চেয়ে ৯৩% এবং Fable 5-এর চেয়ে ৯৬% কম.

DeepSWE 1.1⁠(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টরা মৌলিক, দীর্ঘমেয়াদি সফটওয়্যার ইঞ্জিনিয়ারিং কাজ সমাধান করে.

কম্পিউটার ব্যবহার

GPT‑6 Astra কম্পিউটার ব্যবহারের জন্য বিশ্বের সেরা মডেল হিসেবে রয়ে গেলেও, GPT‑6 Sol ও Luna তাদের পূর্বসূরিদের তুলনায় বেশি ব্যয়-দক্ষ পারফরম্যান্স দেয়. OSWorld 2.0 offline-এ, xhigh effort-এ GPT‑6 Sol medium effort-এ Claude Opus 5-এর কাছাকাছি স্কোর পায়—৬০.৫% বনাম ৬০.৩%—প্রতি কাজের খরচ প্রায় ৮০% কম রেখে. GPT‑6 Luna (max) GPT‑5.6 Sol (medium)-কে তার খরচের এক-দশমাংশে ছাড়িয়ে যেতে পারে.

OSWorld 2.0⁠(একটি নতুন উইন্ডোতে খোলে)-এ, AI এজেন্টরা দৈনন্দিন ও পেশাগত কাজজুড়ে দীর্ঘমেয়াদি কম্পিউটার-ব্যবহার ওয়ার্কফ্লো করার চেষ্টা করে. আমরা v2026.08.08 রিলিজের offline set-এ partial reward রিপোর্ট করি.

সহযোগিতার ধরন

আমরা GPT‑6 Astra-এর উন্নত যোগাযোগশৈলী Sol ও Luna-তেও এনেছি, যা আমাদের মতে প্রযুক্তিগত ও কোডিং কথোপকথনে বিশেষভাবে চোখে পড়বে. সারবস্তু না হারিয়ে আরও বেশি স্পষ্টতা, কম জার্গন, অদ্ভুত বাক্যবন্ধ কম, কম-মূল্যের বিবরণ কম, এবং সামগ্রিকভাবে সামান্য ছোট উত্তর আশা করুন.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

স্টাইল ব্যক্তিনির্ভর হলেও, এখানে আমরা GPT‑6 Sol-এর উত্তরকেই পছন্দ করি. এটি দ্রুত সিদ্ধান্তে ঝাঁপ দেয় না, প্রশ্নকারীর কাছে স্পষ্ট হতে পারে এমন বিবরণ (যেমন ওয়েবসাইটে চারটি পৃষ্ঠা আছে) পুনরাবৃত্তিতে কম সময় দেয়, কম অস্পষ্ট ভাষা ব্যবহার করে (যেমন “bento feel”, “reshaping… around that system”), কী পরীক্ষা করেছে আর কী করেনি তা আরও খোলামেলাভাবে জানায়, এবং ইমেজ টুল প্রম্পটের মতো বাস্তবায়ন-সংক্রান্ত অপ্রয়োজনীয় বিবরণ শেয়ার করে না.

এজেন্ট ও দীর্ঘ কথোপকথনের জন্য ক্যাশিং উন্নত করা

কম টোকেন মূল্যের পাশাপাশি, GPT‑6‑এর ওপর তৈরি করা ডেভেলপারদের অ্যাপ্লিকেশনগুলো যে কনটেক্সট পুনরায় ব্যবহার করে তাতে আরও সাশ্রয় করতে আমরা সহায়তা করছি. GPT‑6‑এর জন্য আমরা প্রম্পট ক্যাশিং উন্নত করেছি, যাতে ডিফল্টভাবেই বেশি cache hit rate পাওয়া যায়; এতে এজেন্টরা বেশি কনটেক্সট পুনরায় ব্যবহার করতে পারে, দ্রুত সাড়া দেয় এবং cached input-token read-এ ৯০% ছাড়ের সুবিধা পায়.

ডেভেলপারদের ক্যাশিং পারফরম্যান্স মাপা ও অপ্টিমাইজ করার আরও উপায়ও আছে:

GitHub জানিয়েছে, গত কয়েক মাসে এই উন্নতিগুলো OpenAI মডেলে বিলিয়ন বিলিয়ন request জুড়ে নতুন করে প্রক্রিয়াকরণ দরকার এমন প্রম্পট টোকেনের অংশ ৫০%-এর বেশি কমিয়েছে, ফলে Copilot দ্রুত সাড়া দিতে পারছে.

অ্যালাইনমেন্ট আরও উন্নত করা

GPT‑6 Sol ও Luna Astra-এর সঙ্গে উন্মোচিত অ্যালাইনমেন্ট কাজের ওপর ভিত্তি করে তৈরি, যা এখন পর্যন্ত আমাদের সবচেয়ে aligned মডেল. আমাদের অ্যালাইনমেন্ট মূল্যায়নে, Sol ও Luna উভয়ই তাদের GPT‑5.6 counterpart-এর তুলনায় উন্নতি দেখায়, যার মধ্যে তাদের কোডিং কাজ নিয়ে বিভ্রান্তিকর দাবির হার কমাও রয়েছে.

নিচের মূল্যায়নগুলো ইচ্ছাকৃতভাবে চ্যালেঞ্জিং পরিস্থিতি পরীক্ষা করে এবং সাধারণ ব্যবহারে ব্যর্থতার হার মাপে না. সম্পূর্ণ ফলাফলের জন্য সিস্টেম কার্ড⁠(একটি নতুন উইন্ডোতে খোলে) দেখুন.

প্রাপ্যতা

GPT‑6 Sol ও GPT‑6 Luna আজ থেকে সব Plus, Pro, Business, Enterprise এবং Edu ব্যবহারকারীর জন্য ChatGPT কাজ ও Codex-এ উপলভ্য. Free ও Go ব্যবহারকারীরা desktop app-এ GPT‑6 Luna ব্যবহার করতে পারবেন. এই মডেলগুলো এখনও চ্যাটে উপলভ্য নয়. OpenAI API-তে এগুলো gpt-6-sol এবং gpt-6-luna হিসেবে উপলভ্য.

সবার জন্য সেবা স্থিতিশীল রাখতে, আমরা সারা দিনে ধীরে ধীরে ChatGPT‑তে এই মডেলগুলো চালু করার পরিকল্পনা করছি. ChatGPT কাজ বা Codex-এ নতুন মডেলগুলো না দেখলে, অনুগ্রহ করে পরে আবার চেষ্টা করুন.


GPT‑এর মূল্যায়ন আমাদের গবেষণা পরিবেশে বা আমাদের API-এর মাধ্যমে করা হয়েছে, যা system prompt, উপলভ্য টুল ইত্যাদির পার্থক্যের কারণে production ChatGPT থেকে সামান্য ভিন্ন output দিতে পারে. প্রতিদ্বন্দ্বী মডেলের মূল্যায়ন প্রকাশ্যে উপলভ্য রিপোর্ট থেকে নেওয়া হয়েছে. Claude Fable 5.1-এর স্কোর উপলভ্য না থাকলে Claude Fable 5-এর স্কোর রিপোর্ট করা হয়েছে.

লেখকবৃন্দ

OpenAI