GPT‑6.1 Sol-এর মাধ্যমে ব্রাউজার পরীক্ষায় মডেল খরচ 76x কমায় Asana
গ্রাহকদের আরও সক্ষম মডেল দিতে Asana Codex-এ GPT‑6 Astra ব্যবহার করে পরীক্ষায় ব্রাউজার এজেন্টের খরচ 76x কমিয়েছে, গতি বাড়িয়েছে 5x.

76x
GPT-6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে মডেলের আনুমানিক খরচ কমেছে
5x
GPT-6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে আরও দ্রুত ব্রাউজার রান
0.47 ডলার
GPT-6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে মডেলের গড় আনুমানিক খরচ
Codex-এ GPT‑6 Astra দিয়ে পরীক্ষা চালিয়ে Asana GPT‑6.1 Sol-এ তার ব্রাউজার এজেন্টের ওয়ার্কফ্লো উন্নত করেছে. এতে খরচ হয়েছে 76x কম, গতি বেড়েছে 5x.
Asana তার অধিগ্রহণ করা(একটি নতুন উইন্ডোতে খোলে) প্ল্যাটফর্ম StackAI(একটি নতুন উইন্ডোতে খোলে)-এর মাধ্যমে গ্রাহকদের বিভিন্ন ব্যবসায়িক অ্যাপ্লিকেশনে কাজ স্বয়ংক্রিয় করতে সাহায্য করে. StackAI দিয়ে গ্রাহকেরা কোড না লিখেই ওয়েবসাইট নেভিগেট করা, ফরম পূরণ ও তথ্য সংগ্রহের ওয়ার্কফ্লো তৈরি করতে পারেন. Asana যত বড় পরিসরে কাজ করে, সেখানে ওয়ার্কফ্লোর ছোট ছোট অদক্ষতাও সম্মিলিতভাবে বড় প্রভাব ফেলে.
Asana-এর StackAI CTO ফ্র্যাঙ্ক হিদালগো, পিএইচডি, ব্রাউজার এজেন্টকে আরও দ্রুত ও সাশ্রয়ী করার উদ্যোগ নেন. তিনি Codex-এ GPT‑6 Astra-কে এজেন্টটি বিশ্লেষণ করতে, উন্নয়নের পরীক্ষা চালাতে ও ফলাফল তুলনা করতে নির্দেশ দেন. তাঁর হিসাবে, নিজ হাতে যে কাজে এক থেকে দুই মাস লাগত, তা শেষ হয় প্রায় এক সপ্তাহে.
Asana-এর 144 বার রান করার গবেষণায়(একটি নতুন উইন্ডোতে খোলে) GPT‑6.1 Sol ও আরও তিনটি অত্যাধুনিক মডেল পরীক্ষা করা হয়, যেগুলোকে এখানে মডেল A, B ও C বলা হয়েছে. GPT‑6.1 Sol-এ পাওয়া উন্নত ওয়ার্কফ্লোকে প্রতিবার রান করায় মডেলের আনুমানিক খরচ ছিল গড়ে 0.47 ডলার, সময় প্রায় চার মিনিট. মডেল B-তে মূল প্রোডাকশন সেটআপের তুলনায় এটি 76x সাশ্রয়ী ও 5x দ্রুত.
“মানুষ ও এজেন্টের যৌথ দল বাস্তবে এভাবেই কাজ করে. একজন প্রকৌশলী দিকনির্দেশনা দিয়েছেন, GPT-6 Astra পরীক্ষাগুলো চালিয়েছে, আর ফলাফল Command-এর মাধ্যমে প্রোডাকশনে যুক্ত হয়েছে. Asana কীভাবে মানুষ ও এজেন্টের যৌথ দলকে বাস্তবে কার্যকর করে তোলে, এটি তারই উদাহরণ.”
দ্রুত এগোতে হিদালগো প্রথমে Codex-এ GPT‑6 Astra দিয়ে কোডবেজের ম্যাপিং করেন এবং এজেন্ট কীভাবে মডেলের প্রতিটি অনুরোধ তৈরি করে, তার ব্যাখ্যা নেন. GPT‑6 Astra দেখতে পায়, এজেন্ট নির্দিষ্ট নির্দেশনা ও টুলের ডিফিনিশন ক্যাশে রাখলেও সংগৃহীত পেজের টেক্সট ও স্ক্রিনশটের ক্রমবর্ধমান ইতিহাস রাখে না. তাই প্রতিটি অনুরোধে পুরো খরচে সেই ইতিহাস আবার পাঠানো হচ্ছিল.
এজেন্ট প্রায় প্রতি ধাপেই পুরোনো স্ক্রিনশট বাদ দিত এবং লেখা ছাঁটাই করত. প্রতিটি সম্পাদনায় ইতিহাস বদলে যেত, তাই শুধু ইতিহাস ক্যাশে রাখলেই লাভ হতো না. আবার তথ্য হারালে এজেন্টকে আগেই পড়া পেজে ফিরে যেতে হতে পারত.
হিদালগো GPT‑6 Astra-এর প্রস্তাবিত সমাধানগুলো পর্যালোচনা করে পরীক্ষার জন্য তিনটি বেছে নেন:
এজেন্টের ব্রাউজিং ইতিহাসও ক্যাশে রাখা
সংরক্ষণযোগ্য টেক্সটের পরিমাণ বাড়ানো
প্রতি ধাপে না সরিয়ে একসঙ্গে একগুচ্ছ স্ক্রিনশট অপসারণ করা
কোন চলকগুলো গুরুত্বপূর্ণ, তা বুঝতে GPT‑6 Astra প্রথমে কিছু দ্রুত পরীক্ষা চালায়. কোডটি নিয়ন্ত্রিত পরীক্ষার উপযোগী ছিল না. তাই এটি কোড পুনর্গঠন করে, যাতে একই ফ্রন্টএন্ড ও ব্যাকএন্ড আলাদা সেটিংসে একাধিক ওয়ার্কফ্লো একসঙ্গে চালানো যায়.
Astra পুরো গবেষণাটি চালায়: ইতিহাসের বাজেট 120,000 ও 480,000 ক্যারেক্টার এবং ক্যাশিং ও স্ক্রিনশটের ছয়টি নীতি. প্রতিটি ব্যবস্থা চারটি মডেলের প্রতিটিতে তিনবার পরীক্ষা করা হয় (নিচের সারণি দেখুন). সবচেয়ে ভালো ফল দেওয়া নীতিতে 20টি স্ক্রিনশট জমতে দেওয়া হয়, তারপর শুধু সর্বশেষটি রেখে বাকিগুলো সরানো হয়. এতে স্ক্রিনশট সরানোর মধ্যবর্তী দীর্ঘ সময় আগের ইতিহাস অপরিবর্তিত থাকে. ইতিহাসের বাজেটের বেশি সীমার সঙ্গে মিলিয়ে এটিই হয় উন্নত ওয়ার্কফ্লো. প্রতিটি কনফিগারেশনে একই কাজ করা হয়: একটি পাবলিক ডেমো ক্যাটালগের 32টি বইয়ের প্রতিটির ছয়টি তথ্য সংগ্রহ. Asana-এর কিছু গ্রাহক StackAI-তে এমন কাজই করেন.
মডেল | বিবরণ | মূল্য |
|---|---|---|
মডেল A | অন্য একটি অত্যাধুনিক ল্যাবের ছোট ও সাশ্রয়ী মডেল, 2025 সালের শরতে রিলিজ হয়েছে | GPT‑6.1 Sol-এর অর্ধেক মূল্য |
মডেল B | মডেলটি প্রাথমিকভাবে প্রোডাকশনে ব্যবহৃত হয়েছে, মডেল A-এর ল্যাবেই তৈরি, 2026 সালের গ্রীষ্মে রিলিজ হয়েছে | GPT‑6.1 Sol-এর সমান মূল্য |
মডেল C | মডেল B-এর হালনাগাদ সংস্করণ, 2026 সালের শরতে রিলিজ হয়েছে | GPT‑6.1 Sol-এর সমান মূল্য |
GPT‑6.1 Sol | OpenAI-এর মডেল |
GPT‑6 Astra ওয়ার্কফ্লো রান করে অনুরোধ, ব্যবহারের রেকর্ড ও আউটপুট পরীক্ষা করে. মডেলের পৃথক সেশনে কাজটি পর্যালোচনা করা হয়. প্রতি সেশনের অনুরোধ, ডেটা ট্রেস ও ফলাফল Asana-এর সফটওয়্যার ডেলিভারি প্ল্যাটফর্ম Command(একটি নতুন উইন্ডোতে খোলে)-এ রেকর্ড করা হয়, যাতে দলটি পরে পুরো গবেষণা পর্যালোচনা করতে পারে. Command থেকে গবেষণার ফল প্রথমে টিকিট, পরে pull request হয়. এরপর পরিবর্তনগুলো প্রোডাকশনে যায়.
“নিজ হাতে করলে এই কাজে আমার এক থেকে দুই মাস লাগত. Codex-এ GPT-6 Astra দিয়ে প্রায় এক সপ্তাহ লেগেছে: ঘুমাতে যাওয়ার আগে একটি /goal নির্ধারণ করতাম, আর সকালে ফলাফল পর্যালোচনা করতাম.”
এই উন্নয়নে মডেল B-এর প্রতি রানে আনুমানিক খরচ অন্তত 36.21 ডলার (আগের কিছু রান শেষ হওয়ার আগেই ধাপের সর্বোচ্চ সীমায় পৌঁছেছিল) থেকে 1.24 ডলারে নামে, অর্থাৎ 29x কমে. GPT‑6.1 Sol-এ উন্নত ওয়ার্কফ্লোর খরচ ছিল আরও 2.6x কম, 0.47 ডলার. উন্নত ওয়ার্কফ্লো প্রতিবারই কাজ শেষ করেছে এবং সঠিক উত্তর দিয়েছে.
3টি রানের গড়. ≥: বেসলাইনে সীমায় পৌঁছে থেমে যাওয়া রান রয়েছে, তাই এর গড় একটি নিম্নসীমা.
ডান দিকের দুটি অংশ উন্নত মডেল B-এর সঙ্গে তুলনা দেখায়. একই গবেষণার পর্ব 1-এ মডেল B এবং পর্ব 2-তে মডেল C ও Sol 6.1 রান করা হয় (ডট রেখা).
শুধু GPT‑6.1 Sol-এ, ইতিহাসের বেশি বাজেট রেখে নতুন ক্যাশিং ও স্ক্রিনশট নীতি প্রয়োগে প্রতি রানের খরচ 4x কমে 1.97 ডলার থেকে 0.47 ডলার হয়. প্রতি কলের খরচ প্রায় 3x কম হয়, কারণ ইনপুটের 89% এসেছে ক্যাশ থেকে, যার মূল্য ক্যাশে না থাকা ইনপুটের মাত্র 5%. রানও দ্রুত হয়: মডেল B-এর মূল সেটআপে অন্তত 22.5 মিনিট লাগত, GPT‑6.1 Sol-এর উন্নত ওয়ার্কফ্লোতে লাগে প্রায় চার মিনিট.
3টি রানের গড়, SD হুইসকার. ≥: গড়ের মধ্যে সীমায় পৌঁছে থেমে যাওয়া বা অসমাপ্ত রান রয়েছে, তাই প্রকৃত মান অন্তত এটি বা এর বেশি হবে.
বার নীল রঙের. ক্যাশিংয়ের প্রভাব বুঝতে 480k বেশি বাজেট বারের সঙ্গে তুলনা করুন.
রান মার্কার ও SD হুইসকার মূল ছবি থেকে আনুমানিকভাবে পুনর্গঠিত; রানের মূল মান ও স্ট্যান্ডার্ড বিচ্যুতির তথ্য পাওয়া যায়নি.
3টি রানের গড়, SD হুইসকার. ≥: গড়ের মধ্যে সীমায় পৌঁছে থেমে যাওয়া বা অসমাপ্ত রান রয়েছে, তাই প্রকৃত মান অন্তত এটি বা এর বেশি হবে.
বার নীল রঙের. ক্যাশিংয়ের প্রভাব বুঝতে 480k বেশি বাজেট বারের সঙ্গে তুলনা করুন.
রান মার্কার ও SD হুইসকার মূল ছবি থেকে আনুমানিকভাবে পুনর্গঠিত; রানের মূল মান ও স্ট্যান্ডার্ড বিচ্যুতির তথ্য পাওয়া যায়নি.
এজেন্ট আদৌ উত্তর দিতে পারবে কি না, ইতিহাস ব্যবস্থাপনা তাতে কীভাবে প্রভাব ফেলে, গবেষণায় তাও দেখা যায়. GPT‑6.1 Sol-কে ব্রাউজিং ইতিহাস রাখার বেশি জায়গা দিলে উত্তর আসা রানের সংখ্যা বাড়িয়েছে. কম সীমায় 18 বারের মধ্যে মাত্র তিন বার উত্তর পাওয়া গিয়েছিল; বেশি সীমায় 18 বারই উত্তর পাওয়া যায়, প্রতিটিই সঠিক. হিদালগোর কাছে এর ব্যবসায়িক সুফল হলো, পরিচালন ব্যয় স্থির রেখে গ্রাহকদের আরও দ্রুত ও সক্ষম মডেল দেওয়া.
“এই কাজগুলোর জন্য গ্রাহকদের কোন মডেল দিতে পারব, আগে খরচের কারণে তা সীমিত ছিল. এজেন্টকে আরও দক্ষ করে আমরা পরিচালন ব্যয় কমানোর পাশাপাশি গ্রাহকদের আরও ভালো ও দ্রুত মডেল দিতে পারছি.”
Asana StackAI-এর ব্রাউজার নেভিগেশনে পরিবর্তনগুলো রিলিজ করেছে. একই ধরনের পরীক্ষা সহজে আবার চালানোর টুলও তৈরি করছে. দলটি পর্যায়ক্রমে প্ল্যাটফর্মের মূল্যায়নে এই পরীক্ষা যুক্ত করতে চায়, যাতে গ্রাহক ও অভ্যন্তরীণ দলগুলো এজেন্ট কনফিগার করার সময় খরচ, রানটাইম ও উত্তরের মান তুলনা করতে পারে.
“এখন আর শিপিংয়ের গতি বাধা নয়; বাধা হলো মানুষের মনোযোগের সীমা. আমরা এমন এক বাস্তবতার কাছাকাছি, যেখানে প্রত্যেক PM হিসেবে একদল এজেন্টকে নেতৃত্ব দেবেন.”
Asana এখন পণ্যের নতুন ফিচার রিলিজ করার আগে Codex-এ GPT‑6 Astra দিয়ে পরীক্ষা করছে: Astra প্ল্যাটফর্মে ঘুরে বিভিন্ন ইনপুট ব্যবহার করে দেখে এবং মানব QA রিভিউয়ারদের কাছে বাগ রিপোর্ট করে. হিদালগো একে নতুন সফটওয়্যার ডেভেলপমেন্ট লাইফসাইকেলের ভিত্তি মনে করেন, যেখানে ক্লাউডে এজেন্টের বহু সেশন একসঙ্গে বিভিন্ন ফিচার পরীক্ষা করে.
সম্পূর্ণ গবেষণাটি পাওয়া যাবে Asana(একটি নতুন উইন্ডোতে খোলে) ও StackAI(একটি নতুন উইন্ডোতে খোলে)-এর ব্লগে.


