মূল কনটেন্টে যান
OpenAI

২০ মার্চ, ২০২৫

রিলিজপ্রোডাক্ট

API-তে পরবর্তী প্রজন্মের অডিও মডেল এর পরিচিতি

ভয়েস এজেন্টের জন্য নতুন অডিও মডেলের একটি স্যুট, যা এখন বিশ্বব্যাপী ডেভেলপারদের জন্য উপলব্ধ.

OpenAI-এর পরবর্তী প্রজন্মের অডিও মডেলের ব্লগের প্রধান চিত্র
লোডিং…

28 আগস্ট 2025 সালের আপডেট: আমরা Realtime API-এর সাধারণ প্রাপ্যতা ঘোষণা করেছি. এখানে আরও জানুন.


গত কয়েক মাসে, আমরা টেক্সট-ভিত্তিক এজেন্টগুলোর বুদ্ধিমত্তা, সক্ষমতা এবং উপযোগিতা বাড়াতে বিনিয়োগ করেছি—যা ব্যবহারকারীদের পক্ষ থেকে স্বাধীনভাবে কাজ সম্পন্ন করে—যেমন অপারেটর, ডীপ রিসার্চ, কম্পিউটার-ইউজিং এজেন্ট এবং বিল্ট-ইন টুলসহ Responses API-এর মতো রিলিজের মাধ্যমে. তবে, এজেন্টদের প্রকৃতপক্ষে কার্যকর করে তোলার জন্য মানুষের প্রয়োজন শুধু টেক্সট বা বার্তার বাইরেও তাদের সাথে আরও গভীর ও সহজবোধ্য যোগাযোগ স্থাপন করা—যেখানে কার্যকরভাবে ভাব বিনিময়ের জন্য স্বাভাবিক কথ্য ভাষা ব্যবহার করা যাবে.

আজ আমরা API-তে নতুন স্পিচ-টু-টেক্সট এবং টেক্সট-টু-স্পিচ অডিও মডেল চালু করছি, যা আরও শক্তিশালী, কাস্টমাইজযোগ্য এবং বুদ্ধিমান ভয়েস এজেন্ট তৈরি করা সম্ভব করবে যা বাস্তব মূল্য প্রদান করে. আমাদের সর্বশেষ স্পিচ-টু-টেক্সট মডেলগুলো একটি নতুন এবং আধুনিক মানদণ্ড স্থাপন করেছে, যা নির্ভুলতা এবং নির্ভরযোগ্যতার দিক থেকে বিদ্যমান সমাধানগুলোকে ছাড়িয়ে গেছে—বিশেষ করে আঞ্চলিক টান, কোলাহলপূর্ণ পরিবেশ এবং কথার গতির ভিন্নতার মতো চ্যালেঞ্জিং পরিস্থিতির ক্ষেত্রে. এই উন্নতিগুলো ট্রান্সক্রিপশনের নির্ভরযোগ্যতা বাড়ায়, ফলে কাস্টমার কল সেন্টার, মিটিং নোট ট্রান্সক্রিপশন এবং আরও অনেক কিছুর মতো ব্যবহারক্ষেত্রে মডেলগুলো বিশেষভাবে উপযোগী হয়ে ওঠে.

প্রথমবারের মতো, ডেভেলপাররা টেক্সট-টু-স্পিচ মডেলকে নির্দিষ্টভাবে কথা বলার নির্দেশ দিতে পারেন—যেমন, “একজন সহানুভূতিশীল কাস্টমার সার্ভিস এজেন্টের মতো কথা বলুন”—যা ভয়েস এজেন্টদের জন্য কাস্টমাইজেশনের একটি নতুন স্তর উন্মোচন করে. এটি আরও সহানুভূতিশীল ও গতিশীল গ্রাহক সেবা ভয়েস থেকে শুরু করে সৃজনশীল গল্প বলার অভিজ্ঞতার জন্য অভিব্যক্তিপূর্ণ বর্ণনা পর্যন্ত, বিভিন্ন ধরনের উপযোগী অ্যাপ্লিকেশন সক্ষম করে.

আমরা 2022 সালে আমাদের প্রথম অডিও মডেল চালু করেছি এবং তারপর থেকে, আমরা এই মডেলগুলির বুদ্ধিমত্তা, নির্ভুলতা এবং নির্ভরযোগ্যতা উন্নত করতে প্রতিশ্রুতিবদ্ধ. এই নতুন মডেলগুলোর সাহায্যে ডেভেলপাররা আরও নির্ভুল ও শক্তিশালী স্পিচ-টু-টেক্সট সিস্টেম এবং অভিব্যক্তিপূর্ণ, চরিত্রসমৃদ্ধ টেক্সট-টু-স্পিচ ভয়েস তৈরি করতে পারেন—সবই API-এর মধ্যে.

শান্ত
সার্ফার
পেশাদার
মধ্যযুগীয় নাইট
ট্রু ক্রাইম অনুরাগী
ঘুমানোর সময়ের গল্প

আমাদের সর্বশেষ অডিও মডেলগুলি সম্পর্কে আরও তথ্য

নতুন স্পিচ-টু-টেক্সট মডেলসমূহ

আমরা নতুন gpt-4o-transcribe এবং gpt-4o-mini-transcribe মডেলগুলি পরিচয় করাচ্ছি, যেগুলি শব্দ ত্রুটি হারে উন্নতি এবং ভাষা শনাক্তকরণ ও নির্ভুলতায় মূল Whisper মডেলগুলির তুলনায় উন্নত.

gpt-4o-transcribe বিদ্যমান Whisper মডেলগুলোর তুলনায় একাধিক প্রতিষ্ঠিত মানদণ্ডে উন্নত Word Error Rate (WER) পারফরম্যান্স প্রদর্শন করে, যা আমাদের speech-to-text প্রযুক্তিতে উল্লেখযোগ্য অগ্রগতি প্রতিফলিত করে. এই অগ্রগতিগুলি সরাসরি রিইনফোর্সমেন্ট লার্নিংয়ে লক্ষ্যভিত্তিক উদ্ভাবন এবং বৈচিত্র্যময়, উচ্চ-মানের অডিও ডেটাসেটের মাধ্যমে ব্যাপক মধ্যপ্রশিক্ষণ থেকে উদ্ভূত.

এর ফলে, এই নতুন স্পিচ-টু-টেক্সট মডেলগুলো কথার সূক্ষ্ম পার্থক্যগুলো আরও ভালোভাবে ধরতে পারে, ভুল শনাক্তকরণের হার কমায় এবং ট্রান্সক্রিপশনের নির্ভরযোগ্যতা বৃদ্ধি করে; বিশেষ করে বিভিন্ন আঞ্চলিক টান, কোলাহলপূর্ণ পরিবেশ এবং কথার গতির ভিন্নতার মতো চ্যালেঞ্জিং পরিস্থিতির ক্ষেত্রে. এই মডেলগুলি এখন স্পিচ-টু-টেক্সট API(একটি নতুন উইন্ডোতে খোলে)-এ উপলভ্য.

Word Error Rate (WER) স্পিচ-রিকগনিশন মডেলের নির্ভুলতা মাপার একটি পদ্ধতি, যা রেফারেন্স ট্রান্সক্রিপ্টের তুলনায় ভুলভাবে ট্রান্সক্রাইব করা শব্দের শতাংশ হিসাব করে. WER যত কম, তত ভালো এবং এর মানে কম ত্রুটি. আমাদের সর্বশেষ স্পিচ-টু-টেক্সট মডেলগুলো বিভিন্ন বেঞ্চমার্কে কম WER অর্জন করেছে, যার মধ্যে রয়েছে FLEURS (ফিউ-শট লার্নিং ইভ্যালুয়েশন অফ ইউনিভার্সাল রিপ্রেজেন্টেশনস অফ স্পিচ)—এটি ম্যানুয়ালি ট্রান্সক্রাইব করা অডিও নমুনা ব্যবহার করে 100-টিরও বেশি ভাষা জুড়ে বিস্তৃত একটি বহুভাষিক স্পিচ বেঞ্চমার্ক. এই ফলাফলগুলি আরও উন্নত ট্রান্সক্রিপশন নির্ভুলতা এবং আরও বিস্তৃত ভাষা কভারেজ প্রদর্শন করে. এখানে যেমন দেখানো হয়েছে, আমাদের মডেলগুলি সব ভাষার মূল্যায়নে Whisper v2 এবং Whisper v3 এর তুলনায় ধারাবাহিকভাবে শ্রেষ্ঠত্ব প্রদর্শন করে.

FLEURS-এ, আমাদের মডেলগুলি কম ওয়ার্ড এরর রেট (WER) এবং শক্তিশালী বহুভাষিক কার্যকারিতা প্রদান করে. কম WER ভালো এবং এর মানে কম ত্রুটি হয়. এখানে দেখানো হয়েছে, আমাদের মডেলগুলি বেশিরভাগ প্রধান ভাষায় অন্যান্য শীর্ষস্থানীয় মডেলগুলির সমকক্ষ বা তাদের চেয়েও ভালো করে.

নতুন টেক্সট-টু-স্পিচ মডেল

আমরা আরও উন্নত নিয়ন্ত্রণ ক্ষমতা সহ একটি নতুন gpt-4o-mini-tts মডেলও চালু করছি. প্রথমবারের মতো, ডেভেলপাররা মডেলকে শুধু কী বলতে হবে তা নয়, বরং কিভাবে বলতে হবে তাও “নির্দেশ” দিতে পারেন—যা গ্রাহক সেবা থেকে সৃজনশীল গল্প বলার মতো ব্যবহারের ক্ষেত্রে আরও কাস্টমাইজড অভিজ্ঞতা প্রদান করে. মডেলটি টেক্সট-টু-স্পিচ API(একটি নতুন উইন্ডোতে খোলে) এ উপলব্ধ. মনে রাখবেন যে এই টেক্সট-টু-স্পিচ মডেলগুলি কৃত্রিম, প্রিসেট ভয়েসগুলির মধ্যেই সীমাবদ্ধ এবং আমরা নিশ্চিত করতে এগুলি পর্যবেক্ষণ করি যাতে সেগুলি সবসময় সিন্থেটিক প্রিসেটগুলির সাথে সামঞ্জস্যপূর্ণ থাকে.

মডেলগুলোর পেছনের প্রযুক্তিগত উদ্ভাবনসমূহ

অথেনটিক অডিও ডেটাসেট দিয়ে প্রিট্রেইনিং

আমাদের নতুন অডিও মডেলগুলো GPT‑4o এবং GPT‑4o‑mini আর্কিটেকচারের উপর ভিত্তি করে তৈরি এবং বিশেষায়িত অডিও-কেন্দ্রিক ডেটাসেটে ব্যাপকভাবে প্রি-ট্রেইন করা হয়েছে, যা মডেলের কর্মদক্ষতা উন্নত করতে গুরুত্বপূর্ণ ভূমিকা পালন করেছে. এই লক্ষ্যভিত্তিক পদ্ধতি বক্তৃতার সূক্ষ্মতা সম্পর্কে আরও গভীর অন্তর্দৃষ্টি প্রদান করে এবং অডিও-সম্পর্কিত কাজগুলোতে অসাধারণ কার্যক্ষমতা সক্ষম করে.

উন্নত ডিস্টিলেশন পদ্ধতিসমূহ

আমরা আমাদের ডিস্টিলেশন কৌশলগুলি উন্নত করেছি, যা আমাদের বৃহত্তম অডিও মডেলগুলি থেকে ছোট, আরও দক্ষ মডেলগুলিতে জ্ঞান স্থানান্তর করতে সক্ষম করে. উন্নত সেল্ফ-প্লে পদ্ধতি ব্যবহার করে, আমাদের ডিস্টিলেশন ডেটাসেটগুলো বাস্তবসম্মত কথোপকথনের গতিশীলতা সঠিকভাবে ধারণ করে এবং প্রকৃত ব্যবহারকারী-সহকারী মিথস্ক্রিয়াকে পুনরায় তৈরি করে. এটি আমাদের ছোট মডেলগুলিকে চমৎকার কথোপকথনের গুণমান এবং প্রতিক্রিয়াশীলতা প্রদান করতে সহায়তা করে.

রিইনফোর্সমেন্ট লার্নিং প্যারাডাইম

আমাদের স্পিচ-টু-টেক্সট মডেলগুলোর জন্য, আমরা একটি রিইনফোর্সমেন্ট লার্নিং (RL)-নির্ভর পদ্ধতি সংযুক্ত করেছি, যা ট্রান্সক্রিপশন নির্ভুলতাকে সর্বোচ্চ স্তরে উন্নীত করেছে. এই পদ্ধতিটি নির্ভুলতা উল্লেখযোগ্যভাবে উন্নত করে এবং হ্যালুসিনেশন কমায়, যার ফলে জটিল স্পিচ স্বীকৃতি পরিস্থিতিতে আমাদের স্পিচ-টু-টেক্সট সমাধানগুলোকে অত্যন্ত প্রতিযোগিতামূলক করে তোলে.

এই উন্নয়নগুলি অডিও মডেলিং এর ক্ষেত্রে অগ্রগতির প্রতীক, যেখানে উদ্ভাবনী পদ্ধতিগুলি ব্যবহারিক উন্নতির সাথে মিলিত হয়ে বক্তৃতা অ্যাপ্লিকেশনগুলিতে উন্নত কর্মক্ষমতা প্রদান করে.

API এর প্রাপ্যতা

এই নতুন অডিও মডেলগুলি এখন সব ডেভেলপারদের জন্য উপলব্ধ – অডিও দিয়ে তৈরি করার বিষয়ে আরও জানুন এখানে(একটি নতুন উইন্ডোতে খোলে). যেসব ডেভেলপার ইতিমধ্যেই টেক্সট-ভিত্তিক মডেল দিয়ে কথোপকথনমূলক অভিজ্ঞতা তৈরি করছেন, তাদের জন্য আমাদের স্পিচ-টু-টেক্সট এবং টেক্সট-টু-স্পিচ মডেল যোগ করাই একটি ভয়েস এজেন্ট তৈরি করার সবচেয়ে সহজ উপায়. আমরা Agents SDK(একটি নতুন উইন্ডোতে খোলে) এর সাথে একটি ইন্টিগ্রেশন প্রকাশ করছি, যা এই ডেভেলপমেন্ট প্রক্রিয়াটিকে সহজ করে. লো-ল্যাটেন্সি স্পিচ-টু-স্পিচ অভিজ্ঞতা তৈরি করতে আগ্রহী ডেভেলপারদের জন্য, আমরা আমাদের স্পিচ-টু-স্পিচ মডেলগুলি Realtime API-তে ব্যবহার করার সুপারিশ করি.

পরবর্তী পদক্ষেপ

ভবিষ্যতের দিকে তাকিয়ে, আমরা আমাদের অডিও মডেলগুলোর বুদ্ধিমত্তা এবং নির্ভুলতা উন্নত করতে বিনিয়োগ চালিয়ে যাওয়ার এবং ডেভেলপারদের তাদের নিজস্ব কাস্টম ভয়েস ব্যবহার করে আরও ব্যক্তিগতকৃত অভিজ্ঞতা তৈরি করার উপায়গুলি অনুসন্ধান করার পরিকল্পনা করছি, যা আমাদের সুরক্ষা মানের সাথে সামঞ্জস্যপূর্ণ. এছাড়াও, আমরা চালিয়ে যাচ্ছি নীতিনির্ধারক, গবেষক, ডেভেলপার এবং সৃজনশীল ব্যক্তিদের সঙ্গে সিন্থেটিক কণ্ঠস্বরের চ্যালেঞ্জ ও সুযোগ নিয়ে কথোপকথনে অংশগ্রহণ করতে. এই উন্নত অডিও সক্ষমতাগুলি ব্যবহার করে ডেভেলপাররা যে উদ্ভাবনী এবং সৃজনশীল অ্যাপ্লিকেশন তৈরি করবেন তা দেখার জন্য আমরা উচ্ছ্বসিত. আমরা ডেভেলপারদের মাল্টিমোডাল এজেন্টিক অভিজ্ঞতা তৈরি করতে সক্ষম করতে ভিডিওসহ অন্যান্য মোডালিটিতেও বিনিয়োগ করব.

লাইভস্ট্রিম রিপ্লে

লেখকবৃন্দ

OpenAI

গবেষণা লিডস

ক্রিস্টিনা কিম, জুনহুয়া মাও, ই শেন, ইউ ঝাং

অবদানকারীগণ

গবেষণা

অ্যালেক্স পাইনো, বোয়েন চেং, চেংক্সু ঝুয়াং, ক্রিস কচ, ড্যামিয়ান ম্রোওকা, এরিক রিটার, জ্যাকব মেনিক, জেমস বেটকার, জি লিন, জেইমি কিরোস, জিয়াহুই ইউ, লিয়াং ঝৌ, লিয়ু চেন, কেভিন লু, ম্যাডেলিন বয়েড, মাইকেল ল্যাম্পে, মাইক হিটন, নানক্সিন চেন, নিতিশ কেস্কর, সাচি জৈন, স্যাম টয়জার, সোময় জৈন, টাও জু, টোমার ক্যাপলান, ওয়েই হান, শিয়াংনিং চেন, ই জিয়া

ইঞ্জিনিয়ারিং

আলিনা উ, আন্দ্রেস গার্সিয়া গার্সিয়া, আরশি ভাটনাগর, অ্যাভিটাল অলিভার, ব্রেন্ডান কুইন, ক্রিস্টিনা হুয়াং, ডেভিড ফ্যাং, ড্রাগোস অপ্রিকা, ডমিনিক কুন্ডেল, এডেড ওইয়োহ, ইয়ারোস্লাভ ত্ভেরদোখলিব, জিয়াচেং ফেং, জেই চেন, জেনিয়া ভারাভভা, জর্ডান সিটকিন, জোসেফ ফ্লোরেনসিও, লিয়েন মামিতসুকা, মাদা আফলাক, মানোলি লিওডাকিস, মার্ক হাডনাল, নোয়া ম্যাককালাম, ওলা ওকেলোলা, পিটার বাক্কুম, রোহান মেহতা, রোমাঁ হুয়েট, ওয়ানিং জিয়াং, ওয়েইন চ্যাং, ইলেই কিয়ান

প্রোডাক্ট

অনুভা শ্রীবাস্তব, জ্যাকি শ্যানন, জেফ হ্যারিস, রিয়া মিয়ারা, জিয়াওলিন হাও

নেতৃত্বের পৃষ্ঠপোষকরা

আইডান ক্লার্ক, অ্যান্ড্রু গিবিয়ানস্কি, ডেভিড সাসাকি, কেভিন ওয়েইল, লিয়াম ফেদুস, মার্ক চেন, নিক রাইডার, নিক টার্লি, অলিভিয়ার গোডমেন্ট, প্রফুল্ল ধারিওয়াল, শেংজিয়া ঝাও, শুচাও বি, শেরউইন উ, সুলমান চৌধুরী