মূল কনটেন্টে যান
OpenAI

৯ অক্টোবর, ২০২৬

GPT‑6.1 Sol-এর মাধ্যমে ব্রাউজার পরীক্ষায় মডেল খরচ 76x কমায় Asana

গ্রাহকদের আরও সক্ষম মডেল দিতে Asana Codex-এ GPT‑6 Astra ব্যবহার করে পরীক্ষায় ব্রাউজার এজেন্টের খরচ 76x কমিয়েছে, গতি বাড়িয়েছে 5x.

নীল স্তরে সাজানো কাগজের বুনটের ওপর Asana-এর সাদা লোগো.
কোম্পানির আকার: Enterprise
অঞ্চল: উত্তর আমেরিকা
ইন্ডাস্ট্রি: প্রযুক্তি
পণ্যসমূহ: Codex

76x

GPT-6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে মডেলের আনুমানিক খরচ কমেছে

5x

GPT-6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে আরও দ্রুত ব্রাউজার রান

0.47 ডলার

GPT-6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে মডেলের গড় আনুমানিক খরচ

লোডিং…

Codex-এ GPT‑6 Astra দিয়ে পরীক্ষা চালিয়ে Asana GPT‑6.1 Sol-এ তার ব্রাউজার এজেন্টের ওয়ার্কফ্লো উন্নত করেছে. এতে খরচ হয়েছে 76x কম, গতি বেড়েছে 5x.

Asana তার অধিগ্রহণ করা⁠(একটি নতুন উইন্ডোতে খোলে) প্ল্যাটফর্ম StackAI⁠(একটি নতুন উইন্ডোতে খোলে)-এর মাধ্যমে গ্রাহকদের বিভিন্ন ব্যবসায়িক অ্যাপ্লিকেশনে কাজ স্বয়ংক্রিয় করতে সাহায্য করে. StackAI দিয়ে গ্রাহকেরা কোড না লিখেই ওয়েবসাইট নেভিগেট করা, ফরম পূরণ ও তথ্য সংগ্রহের ওয়ার্কফ্লো তৈরি করতে পারেন. Asana যত বড় পরিসরে কাজ করে, সেখানে ওয়ার্কফ্লোর ছোট ছোট অদক্ষতাও সম্মিলিতভাবে বড় প্রভাব ফেলে.

Asana-এর StackAI CTO ফ্র্যাঙ্ক হিদালগো, পিএইচডি, ব্রাউজার এজেন্টকে আরও দ্রুত ও সাশ্রয়ী করার উদ্যোগ নেন. তিনি Codex-এ GPT‑6 Astra-কে এজেন্টটি বিশ্লেষণ করতে, উন্নয়নের পরীক্ষা চালাতে ও ফলাফল তুলনা করতে নির্দেশ দেন. তাঁর হিসাবে, নিজ হাতে যে কাজে এক থেকে দুই মাস লাগত, তা শেষ হয় প্রায় এক সপ্তাহে.

Asana-এর 144 বার রান করার গবেষণায়⁠(একটি নতুন উইন্ডোতে খোলে) GPT‑6.1 Sol ও আরও তিনটি অত্যাধুনিক মডেল পরীক্ষা করা হয়, যেগুলোকে এখানে মডেল A, B ও C বলা হয়েছে. GPT‑6.1 Sol-এ পাওয়া উন্নত ওয়ার্কফ্লোকে প্রতিবার রান করায় মডেলের আনুমানিক খরচ ছিল গড়ে 0.47 ডলার, সময় প্রায় চার মিনিট. মডেল B-তে মূল প্রোডাকশন সেটআপের তুলনায় এটি 76x সাশ্রয়ী ও 5x দ্রুত.

“মানুষ ও এজেন্টের যৌথ দল বাস্তবে এভাবেই কাজ করে. একজন প্রকৌশলী দিকনির্দেশনা দিয়েছেন, GPT-6 Astra পরীক্ষাগুলো চালিয়েছে, আর ফলাফল Command-এর মাধ্যমে প্রোডাকশনে যুক্ত হয়েছে. Asana কীভাবে মানুষ ও এজেন্টের যৌথ দলকে বাস্তবে কার্যকর করে তোলে, এটি তারই উদাহরণ.”
—অর্ণব বসু, Asana-এর CPO

GPT‑6 Astra দিয়ে ব্রাউজার-এজেন্টের অদক্ষতা শনাক্ত করা

দ্রুত এগোতে হিদালগো প্রথমে Codex-এ GPT‑6 Astra দিয়ে কোডবেজের ম্যাপিং করেন এবং এজেন্ট কীভাবে মডেলের প্রতিটি অনুরোধ তৈরি করে, তার ব্যাখ্যা নেন. GPT‑6 Astra দেখতে পায়, এজেন্ট নির্দিষ্ট নির্দেশনা ও টুলের ডিফিনিশন ক্যাশে রাখলেও সংগৃহীত পেজের টেক্সট ও স্ক্রিনশটের ক্রমবর্ধমান ইতিহাস রাখে না. তাই প্রতিটি অনুরোধে পুরো খরচে সেই ইতিহাস আবার পাঠানো হচ্ছিল.

এজেন্ট প্রায় প্রতি ধাপেই পুরোনো স্ক্রিনশট বাদ দিত এবং লেখা ছাঁটাই করত. প্রতিটি সম্পাদনায় ইতিহাস বদলে যেত, তাই শুধু ইতিহাস ক্যাশে রাখলেই লাভ হতো না. আবার তথ্য হারালে এজেন্টকে আগেই পড়া পেজে ফিরে যেতে হতে পারত.

আনুমানিক দুই মাসের গবেষণা GPT‑6 Astra দিয়ে এক সপ্তাহে

হিদালগো GPT‑6 Astra-এর প্রস্তাবিত সমাধানগুলো পর্যালোচনা করে পরীক্ষার জন্য তিনটি বেছে নেন:

  • এজেন্টের ব্রাউজিং ইতিহাসও ক্যাশে রাখা

  • সংরক্ষণযোগ্য টেক্সটের পরিমাণ বাড়ানো

  • প্রতি ধাপে না সরিয়ে একসঙ্গে একগুচ্ছ স্ক্রিনশট অপসারণ করা

কোন চলকগুলো গুরুত্বপূর্ণ, তা বুঝতে GPT‑6 Astra প্রথমে কিছু দ্রুত পরীক্ষা চালায়. কোডটি নিয়ন্ত্রিত পরীক্ষার উপযোগী ছিল না. তাই এটি কোড পুনর্গঠন করে, যাতে একই ফ্রন্টএন্ড ও ব্যাকএন্ড আলাদা সেটিংসে একাধিক ওয়ার্কফ্লো একসঙ্গে চালানো যায়.

Astra পুরো গবেষণাটি চালায়: ইতিহাসের বাজেট 120,000 ও 480,000 ক্যারেক্টার এবং ক্যাশিং ও স্ক্রিনশটের ছয়টি নীতি. প্রতিটি ব্যবস্থা চারটি মডেলের প্রতিটিতে তিনবার পরীক্ষা করা হয় (নিচের সারণি দেখুন). সবচেয়ে ভালো ফল দেওয়া নীতিতে 20টি স্ক্রিনশট জমতে দেওয়া হয়, তারপর শুধু সর্বশেষটি রেখে বাকিগুলো সরানো হয়. এতে স্ক্রিনশট সরানোর মধ্যবর্তী দীর্ঘ সময় আগের ইতিহাস অপরিবর্তিত থাকে. ইতিহাসের বাজেটের বেশি সীমার সঙ্গে মিলিয়ে এটিই হয় উন্নত ওয়ার্কফ্লো. প্রতিটি কনফিগারেশনে একই কাজ করা হয়: একটি পাবলিক ডেমো ক্যাটালগের 32টি বইয়ের প্রতিটির ছয়টি তথ্য সংগ্রহ. Asana-এর কিছু গ্রাহক StackAI-তে এমন কাজই করেন.

মডেল

বিবরণ

মূল্য

মডেল A

অন্য একটি অত্যাধুনিক ল্যাবের ছোট ও সাশ্রয়ী মডেল, 2025 সালের শরতে রিলিজ হয়েছে

GPT‑6.1 Sol-এর অর্ধেক মূল্য

মডেল B

মডেলটি প্রাথমিকভাবে প্রোডাকশনে ব্যবহৃত হয়েছে, মডেল A-এর ল্যাবেই তৈরি, 2026 সালের গ্রীষ্মে রিলিজ হয়েছে

GPT‑6.1 Sol-এর সমান মূল্য

মডেল C

মডেল B-এর হালনাগাদ সংস্করণ, 2026 সালের শরতে রিলিজ হয়েছে

GPT‑6.1 Sol-এর সমান মূল্য

GPT‑6.1 Sol

OpenAI-এর মডেল

GPT‑6 Astra ওয়ার্কফ্লো রান করে অনুরোধ, ব্যবহারের রেকর্ড ও আউটপুট পরীক্ষা করে. মডেলের পৃথক সেশনে কাজটি পর্যালোচনা করা হয়. প্রতি সেশনের অনুরোধ, ডেটা ট্রেস ও ফলাফল Asana-এর সফটওয়্যার ডেলিভারি প্ল্যাটফর্ম Command⁠(একটি নতুন উইন্ডোতে খোলে)-এ রেকর্ড করা হয়, যাতে দলটি পরে পুরো গবেষণা পর্যালোচনা করতে পারে. Command থেকে গবেষণার ফল প্রথমে টিকিট, পরে pull request হয়. এরপর পরিবর্তনগুলো প্রোডাকশনে যায়.

“নিজ হাতে করলে এই কাজে আমার এক থেকে দুই মাস লাগত. Codex-এ GPT-6 Astra দিয়ে প্রায় এক সপ্তাহ লেগেছে: ঘুমাতে যাওয়ার আগে একটি /goal নির্ধারণ করতাম, আর সকালে ফলাফল পর্যালোচনা করতাম.”
—ফ্র্যাঙ্ক হিদালগো, পিএইচডি, Asana-তে StackAI CTO

প্রতি রানে মডেলের খরচ 0.50 ডলারের নিচে নামানো

এই উন্নয়নে মডেল B-এর প্রতি রানে আনুমানিক খরচ অন্তত 36.21 ডলার (আগের কিছু রান শেষ হওয়ার আগেই ধাপের সর্বোচ্চ সীমায় পৌঁছেছিল) থেকে 1.24 ডলারে নামে, অর্থাৎ 29x কমে. GPT‑6.1 Sol-এ উন্নত ওয়ার্কফ্লোর খরচ ছিল আরও 2.6x কম, 0.47 ডলার. উন্নত ওয়ার্কফ্লো প্রতিবারই কাজ শেষ করেছে এবং সঠিক উত্তর দিয়েছে.

3টি রানের গড়. ≥: বেসলাইনে সীমায় পৌঁছে থেমে যাওয়া রান রয়েছে, তাই এর গড় একটি নিম্নসীমা.

ডান দিকের দুটি অংশ উন্নত মডেল B-এর সঙ্গে তুলনা দেখায়. একই গবেষণার পর্ব 1-এ মডেল B এবং পর্ব 2-তে মডেল C ও Sol 6.1 রান করা হয় (ডট রেখা).

শুধু GPT‑6.1 Sol-এ, ইতিহাসের বেশি বাজেট রেখে নতুন ক্যাশিং ও স্ক্রিনশট নীতি প্রয়োগে প্রতি রানের খরচ 4x কমে 1.97 ডলার থেকে 0.47 ডলার হয়. প্রতি কলের খরচ প্রায় 3x কম হয়, কারণ ইনপুটের 89% এসেছে ক্যাশ থেকে, যার মূল্য ক্যাশে না থাকা ইনপুটের মাত্র 5%. রানও দ্রুত হয়: মডেল B-এর মূল সেটআপে অন্তত 22.5 মিনিট লাগত, GPT‑6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে লাগে প্রায় চার মিনিট.

3টি রানের গড়, SD হুইসকার. ≥: গড়ের মধ্যে সীমায় পৌঁছে থেমে যাওয়া বা অসমাপ্ত রান রয়েছে, তাই প্রকৃত মান অন্তত এটি বা এর বেশি হবে.

বার নীল রঙের. ক্যাশিংয়ের প্রভাব বুঝতে 480k বেশি বাজেট বারের সঙ্গে তুলনা করুন.

রান মার্কার ও SD হুইসকার মূল ছবি থেকে আনুমানিকভাবে পুনর্গঠিত; রানের মূল মান ও স্ট্যান্ডার্ড বিচ্যুতির তথ্য পাওয়া যায়নি.

3টি রানের গড়, SD হুইসকার. ≥: গড়ের মধ্যে সীমায় পৌঁছে থেমে যাওয়া বা অসমাপ্ত রান রয়েছে, তাই প্রকৃত মান অন্তত এটি বা এর বেশি হবে.

বার নীল রঙের. ক্যাশিংয়ের প্রভাব বুঝতে 480k বেশি বাজেট বারের সঙ্গে তুলনা করুন.

রান মার্কার ও SD হুইসকার মূল ছবি থেকে আনুমানিকভাবে পুনর্গঠিত; রানের মূল মান ও স্ট্যান্ডার্ড বিচ্যুতির তথ্য পাওয়া যায়নি.

এজেন্ট আদৌ উত্তর দিতে পারবে কি না, ইতিহাস ব্যবস্থাপনা তাতে কীভাবে প্রভাব ফেলে, গবেষণায় তাও দেখা যায়. GPT‑6.1 Sol-কে ব্রাউজিং ইতিহাস রাখার বেশি জায়গা দিলে উত্তর আসা রানের সংখ্যা বাড়িয়েছে. কম সীমায় 18 বারের মধ্যে মাত্র তিন বার উত্তর পাওয়া গিয়েছিল; বেশি সীমায় 18 বারই উত্তর পাওয়া যায়, প্রতিটিই সঠিক. হিদালগোর কাছে এর ব্যবসায়িক সুফল হলো, পরিচালন ব্যয় স্থির রেখে গ্রাহকদের আরও দ্রুত ও সক্ষম মডেল দেওয়া.

“এই কাজগুলোর জন্য গ্রাহকদের কোন মডেল দিতে পারব, আগে খরচের কারণে তা সীমিত ছিল. এজেন্টকে আরও দক্ষ করে আমরা পরিচালন ব্যয় কমানোর পাশাপাশি গ্রাহকদের আরও ভালো ও দ্রুত মডেল দিতে পারছি.”
—ফ্র্যাঙ্ক হিদালগো, পিএইচডি, Asana-তে StackAI CTO

পরীক্ষা-নিরীক্ষা ও পণ্য পরীক্ষার পরিসর বাড়ানো

Asana StackAI-এর ব্রাউজার নেভিগেশনে পরিবর্তনগুলো রিলিজ করেছে. একই ধরনের পরীক্ষা সহজে আবার চালানোর টুলও তৈরি করছে. দলটি পর্যায়ক্রমে প্ল্যাটফর্মের মূল্যায়নে এই পরীক্ষা যুক্ত করতে চায়, যাতে গ্রাহক ও অভ্যন্তরীণ দলগুলো এজেন্ট কনফিগার করার সময় খরচ, রানটাইম ও উত্তরের মান তুলনা করতে পারে.

“এখন আর শিপিংয়ের গতি বাধা নয়; বাধা হলো মানুষের মনোযোগের সীমা. আমরা এমন এক বাস্তবতার কাছাকাছি, যেখানে প্রত্যেক PM হিসেবে একদল এজেন্টকে নেতৃত্ব দেবেন.”
—ফ্র্যাঙ্ক হিদালগো, পিএইচডি, Asana-তে StackAI CTO

Asana এখন পণ্যের নতুন ফিচার রিলিজ করার আগে Codex-এ GPT‑6 Astra দিয়ে পরীক্ষা করছে: Astra প্ল্যাটফর্মে ঘুরে বিভিন্ন ইনপুট ব্যবহার করে দেখে এবং মানব QA রিভিউয়ারদের কাছে বাগ রিপোর্ট করে. হিদালগো একে নতুন সফটওয়্যার ডেভেলপমেন্ট লাইফসাইকেলের ভিত্তি মনে করেন, যেখানে ক্লাউডে এজেন্টের বহু সেশন একসঙ্গে বিভিন্ন ফিচার পরীক্ষা করে.

সম্পূর্ণ গবেষণাটি পাওয়া যাবে Asana⁠(একটি নতুন উইন্ডোতে খোলে) ও StackAI⁠(একটি নতুন উইন্ডোতে খোলে)-এর ব্লগে.

কাজের নতুন যুগে যোগ দিন

বিশ্বজুড়ে 1 মিলিয়নেরও বেশি ব্যবসা OpenAI-এর সাথে অর্থপূর্ণ ফলাফল অর্জন করছে.