মূল কনটেন্টে যান
OpenAI

GPT-6.1Sol

ধারাবাহিক অত্যাধুনিক পারফরম্যান্সের জন্য দামের এক-পঞ্চমাংশে Astra-এর কাছাকাছি বুদ্ধিমত্তা

আমরা GPT‑6.1 Sol চালু করছি, যা GPT‑6 Sol-এর একটি আপগ্রেড এবং এজেন্টিক কোডিংয়ের পাশাপাশি কম্পিউটার ব্যবহার ও পেশাদার কাজে ব্যতিক্রমী শক্তিশালী পারফরম্যান্স দেয়. এটি চাহিদাপূর্ণ কাজে Sol-কে GPT‑6 Astra-এর আরও কাছাকাছি নিয়ে আসে, Astra-এর মানক ইনপুট ও আউটপুট টোকেন দামের এক-পঞ্চমাংশে, ফলে একই বাজেটের মধ্যে সক্ষম এজেন্ট তৈরি ও চালানোর জন্য ডেভেলপাররা আরও বেশি সুযোগ পান.

GPT‑6.1 Sol, Sol-এর দামে Astra-এর কাছাকাছি পারফরম্যান্স এনে দেয়, ফলে আজ উপলভ্য পারফরম্যান্সের বিচারে এটি সবচেয়ে খরচ-সাশ্রয়ী মডেল. ক্যাশ করা ইনপুটের খরচ প্রতি মিলিয়ন টোকেনে মাত্র $0.10, যা মানক ইনপুট দামের ওপর 95% ছাড়; পুনরাবৃত্ত অনুরোধে প্রসঙ্গ পুনর্ব্যবহার করতে হয় এমন এজেন্টিক ওয়ার্কলোডের জন্য এটি আরও সাশ্রয়ী.

GPT‑6 Astra সামগ্রিকভাবে এখনও আমাদের সবচেয়ে সক্ষম অত্যাধুনিক মডেল. ব্যবহারকারীরা যে গুরুত্বপূর্ণ কাজ আরও নিয়মিত করতে চান এবং API গ্রাহকেরা যারা বৃহৎ পরিসরে অ্যাপ্লিকেশন তৈরি ও চালান, তাদের জন্য GPT‑6.1 Sol সক্ষমতা ও খরচের নতুন ভারসাম্য দেয়.

তিনটি মডেল কার্ড: GPT-6 Astra, সেরা ফলাফলের জন্য আমাদের সবচেয়ে বুদ্ধিমান মডেল, $10 ইনপুট, $50 আউটপুট, এবং $1 ক্যাশ করা ইনপুট; GPT-6.1 Sol, দামের এক-পঞ্চমাংশে Astra-এর কাছাকাছি বুদ্ধিমত্তা, $2 ইনপুট, $10 আউটপুট, এবং $0.10 ক্যাশ করা ইনপুট; GPT-6 Luna, বৃহৎ পরিসরে দ্রুত ও দক্ষ দৈনন্দিন কাজ, $0.10 ইনপুট, $0.50 আউটপুট, এবং $0.01 ক্যাশ করা ইনপুট.

বিভিন্ন কাজে আরও সক্ষম Sol

জটিল পেশাদার কাজজুড়ে GPT‑6 Sol-এর তুলনায় GPT‑6.1 Sol উল্লেখযোগ্য উন্নতি দেয়, কোড লেখা ও ডিবাগ করা থেকে শুরু করে নথি বোঝা এবং বহু-ধাপের ব্যবসায়িক কর্মপ্রবাহ সম্পাদন পর্যন্ত. এসব মূল্যায়নের কয়েকটিতে এটি অনেক কম খরচে GPT‑6 Astra-এর পারফরম্যান্সের কাছাকাছি পৌঁছে যায়.

কোডিং

DeepSWE v1.1-এ, যা বাস্তব কোডবেসে জটিল সফটওয়্যার-ইঞ্জিনিয়ারিং কাজ মূল্যায়ন করে, GPT‑6.1 Sol প্রায় এক-পঞ্চমাংশ খরচে GPT‑6 Astra-এর সমান ফল করে, আর কম যুক্তি-প্রচেষ্টা ও খরচে GPT‑6 Sol-এর সেরা স্কোরকে 6.4 শতাংশ পয়েন্টে ছাড়িয়ে যায়.

DeepSWE 1.1⁠⁠(একটি নতুন উইন্ডোতে খোলে) পরীক্ষায় কৃত্রিম বুদ্ধিমত্তার এজেন্টগুলো সফটওয়্যার প্রকৌশলের মৌলিক ও দীর্ঘমেয়াদি কাজের সমাধান করে.

পেশাদার কাজ

GDP.pdf-এ, যা টেবিল, চার্ট, ডায়াগ্রাম ও সূক্ষ্ম-মুদ্রিত বিবরণসহ জটিল PDF নথি ব্যবহার করে মডেলগুলো কত নিখুঁতভাবে পেশাদার প্রশ্নের উত্তর দেয় তা মাপে, GPT‑6.1 Sol পরীক্ষিত যুক্তি সেটিংসজুড়ে প্রতি কাজের অর্ধেকেরও কম খরচে ফলব্যাকসহ Opus 5.5-এর চেয়ে বেশি স্কোর করে. এটি প্রতি কাজের প্রায় এক-পঞ্চমাংশ খরচে GPT‑6 Astra-এর সর্বাধুনিক পারফরম্যান্সের কাছাকাছিও পৌঁছে যায়.

GDP.pdf⁠(একটি নতুন উইন্ডোতে খোলে) পরীক্ষায় মডেলগুলোকে আর্থিক সেবা, স্বাস্থ্যসেবা, আইন ও আরও সাতটি পেশাগত ক্ষেত্রের কর্মপ্রক্রিয়া থেকে নেওয়া জটিল পিডিএফ নিয়ে বাস্তব কাজভিত্তিক নির্দেশনার জবাব দিতে হয়.

AutomationBench-এ, যা এজেন্টরা বহু-ধাপের ব্যবসায়িক কর্মপ্রবাহ সঠিকভাবে সম্পন্ন করতে পারে কি না মাপে, GPT‑6.1 Sol মাঝারি যুক্তি-প্রচেষ্টায় প্রায় এক-তৃতীয়াংশ খরচে Opus 5.5-এর চেয়ে 2.2 শতাংশ পয়েন্ট বেশি স্কোর করে. একই সেটিংয়ে সেই স্কোর GPT‑6 Sol-এর তুলনায়ও 4.8 শতাংশ পয়েন্ট বেশি.

In AutomationBench 1.0.6⁠⁠(একটি নতুন উইন্ডোতে খোলে), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

কম্পিউটার ব্যবহার

কম্পিউটার অ্যাপ্লিকেশনের সঙ্গে ইন্টারঅ্যাক্ট করতে হয় এমন কাজেও GPT‑6.1 Sol উল্লেখযোগ্য অগ্রগতি করেছে. OSWorld 2.0-এর অফলাইন সেটে, যা চাহিদাপূর্ণ কম্পিউটার-ব্যবহার কর্মপ্রবাহে এজেন্টদের মূল্যায়ন করে, GPT‑6.1 Sol সর্বোচ্চ যুক্তি-প্রচেষ্টায় অর্ধেকেরও কম খরচে GPT‑6 Sol-কে সাত শতাংশ পয়েন্টে ছাড়িয়ে যায়. সর্বোচ্চ যুক্তি-প্রচেষ্টায় প্রতি কাজের প্রায় এক-সপ্তমাংশ খরচে এটি Astra-এর স্কোরের 2.1 শতাংশ পয়েন্টের মধ্যে আসে.

In OSWorld 2.0⁠⁠(একটি নতুন উইন্ডোতে খোলে), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

বৈজ্ঞানিক গবেষণা

Terminal-Bench Science 0.1-এ, যা ডেটা বিশ্লেষণ, সিমুলেশন ও থিওরেম প্রমাণসহ বৈজ্ঞানিক কর্মপ্রবাহ মূল্যায়ন করে, GPT‑6.1 Sol সর্বোচ্চ যুক্তি-প্রচেষ্টায় প্রতি কাজের অর্ধেকেরও কম খরচে GPT‑6 Sol-এর স্কোর দ্বিগুণেরও বেশি করে. সর্বোচ্চ প্রচেষ্টায় GPT‑6.1 Sol-এর গড় খরচ প্রতি কাজে $5.47, যেখানে Opus 5.5-এর $23.21 এবং Astra-এর $23.80; ফলে যেকোনো মডেলের তুলনায় 75%-এরও বেশি কম খরচে এটি উল্লেখযোগ্য বৈজ্ঞানিক সক্ষমতা দেয়.

পরীক্ষিত মডেলগুলোর মধ্যে GPT‑6 Astra এখনও 68.1% নিয়ে সর্বোচ্চ স্কোর অর্জন করে, এবং সবচেয়ে কঠিন বৈজ্ঞানিক গবেষণা কাজের জন্য এটিই ব্যবহার করা উচিত.

Terminal-Bench Science 0.1⁠(একটি নতুন উইন্ডোতে খোলে) পরীক্ষায় এজেন্টগুলো কোড ও টার্মিনালের সরঞ্জাম ব্যবহার করে বৈজ্ঞানিক গবেষণার কাজ সম্পন্ন করে. এর মধ্যে রয়েছে উপাত্ত বিশ্লেষণ, অনুকরণভিত্তিক পরীক্ষা চালানো এবং উপাত্তের সঙ্গে মডেল খাপ খাওয়ানো.

তথ্যগত নির্ভুলতা

কঠিন প্রম্পটে GPT‑6.1 Sol তথ্যগত নির্ভুলতাও উন্নত করে. অতি-উচ্চ যুক্তি-প্রচেষ্টায় এর তথ্যগত ভুলের হার 4.1%, যা GPT‑6 Sol-এর 4.5% থেকে কম এবং একই সেটিংয়ে Astra-এর 4.0%-এর কাছাকাছি, অথচ প্রতি কাজে Astra-এর তুলনায় প্রায় 83% কম খরচ হয়.

এই মূল্যায়ন এমন পরিচয়মুক্ত কথোপকথনে অন্তত একটি তথ্যগত ভুল থাকা উত্তরের অংশ মাপে, যেখানে ব্যবহারকারীরা আগের কোনো মডেলের ভুল চিহ্নিত করেছিলেন. ইচ্ছাকৃতভাবে কঠিন করা এসব প্রম্পট সাধারণ ব্যবহারের প্রতিনিধিত্ব করে না.

আমরা তথ্যগত নির্ভুলতা মূল্যায়ন করি পরিচয়মুক্ত করা ChatGPT কথোপকথনে, যেখানে ব্যবহারকারীরা আগের কোনো মডেলের তথ্যগত ভুল চিহ্নিত করেছিলেন. ভুল সৃষ্টি করতে পারে এমন এসব কথোপকথন সাধারণ ব্যবহারের প্রতিনিধিত্ব করে না, যেখানে তথ্যগত ভুল তুলনামূলকভাবে বিরল.

GPT‑6.1 Sol নিরাপদে ডেপ্লয় করা

আমাদের অ্যালাইনমেন্ট মূল্যায়নে GPT‑6 Sol-এর তুলনায় GPT‑6.1 Sol উল্লেখযোগ্য উন্নতি দেখায়, যা এটিকে GPT‑6 Astra-এর কাছাকাছি নিয়ে আসে.

GPT‑6.1 Sol নিজের সীমাবদ্ধতা সম্পর্কে বেশি স্বচ্ছ এবং ব্যবহারকারীর উদ্দেশ্য ও নিরাপত্তা সীমাবদ্ধতা মানার ক্ষেত্রে বেশি নির্ভরযোগ্য. চ্যালেঞ্জিং মূল্যায়নে, অচল সার্চ টুল সম্পর্কে স্বচ্ছতা, স্পষ্ট সীমাবদ্ধতা মানা, এবং এজেন্টিক কাজের সময় অননুমোদিত ফলাফল এড়ানোর ক্ষেত্রে এটি GPT‑6 Sol-এর চেয়ে কম ব্যর্থতার হার দেখায়. আমরা স্বয়ংক্রিয় নিরাপত্তা রিভিউয়ারকে পাশ কাটানোর কোনো চেষ্টা দেখিনি, যা GPT‑6 Astra ও GPT‑6 Sol-এর সঙ্গে মিলে যায়.

নিচের মূল্যায়নগুলো ইচ্ছাকৃতভাবে চ্যালেঞ্জিং পরিস্থিতি পরীক্ষা করে এবং সাধারণ ব্যবহারে ব্যর্থতার হার মাপে না.

মূল্য ও প্রাপ্যতা

GPT‑6.1 Sol আজ থেকে ChatGPT Work ও Codex-এ সব Plus, Pro, Business, Enterprise এবং Edu ব্যবহারকারীর জন্য উপলভ্য. এই মডেলগুলো এখনও চ্যাটে উপলভ্য নয়. ডেভেলপাররা OpenAI API-এর মাধ্যমে gpt-6.1-sol হিসেবেও এটি ব্যবহার করতে পারেন. এর মানক API দাম হলো প্রতি মিলিয়ন ইনপুট টোকেনে $2, প্রতি মিলিয়ন ক্যাশ করা ইনপুট টোকেনে $0.10, এবং প্রতি মিলিয়ন আউটপুট টোকেনে $10.

এর পাশাপাশি আমরা GPT‑6 Astra Ultrafast চালু করছি, যা GPT‑6 Astra-এর তুলনায় 8x পর্যন্ত দ্রুত বিশ্বের দ্রুততম অত্যাধুনিক মডেল, সেই সঙ্গে GPT‑6.1 Sol Ultrafast-ও. এগুলো API-তে, পাশাপাশি ChatGPT Work ও Codex-এ, আমাদের নতুন সর্বোচ্চ-ব্যবহার Pro স্তরের ব্যবহারকারীদের জন্য $500/মাসে উপলভ্য. GPT‑6.1 Sol Ultrafast দিয়ে ডেভেলপাররা আগে GPT‑6 Astra-তে যে পরিমাণ API খরচ করতেন প্রায় সেই খরচেই 8× পর্যন্ত গতিতে Astra-এর কাছাকাছি বুদ্ধিমত্তা পেতে পারেন.

লেখকবৃন্দ

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.