پرش به محتوای اصلی
OpenAI

۳۰ اسفند ۱۴۰۳

انتشارمحصول

معرفی مدل‌های صوتی نسلِ بعد در API

مجموعه‌ای جدید از مدل‌های صوتی برای تقویت عامل‌های صوتی، اکنون در دسترس توسعه‌دهندگان در سراسر جهان قرار دارد.

تصویر اصلی وبلاگ مدل‌های صوتی نسل بعد OpenAI
در حال بارگذاری…

به‌روزرسانی در ۲۸ اوت ۲۰۲۵: ما دسترسی عمومی Realtime API را اعلام کردیم. اینجا بیشتر بدانید.


در چند ماه گذشته، ما در ارتقای هوشمندی، قابلیت‌ها و کارآمدی عامل‌های مبتنی بر متن—یا سیستم‌هایی که به‌طور مستقل وظایف را از طرف کاربران انجام می‌دهند—با انتشارهایی مانند اپراتور، تحقیق عمیق، عامل‌های کامپیوتری، و Responses API با ابزارهای داخلی سرمایه‌گذاری کرده‌ایم. با این حال، برای اینکه عامل‌ها واقعاً مفید باشند، مردم باید بتوانند تعاملات عمیق‌تر و شهودی‌تری با عامل‌ها فراتر از صرفاً متن داشته باشند—با استفاده از زبان گفتاری طبیعی برای برقراری ارتباط مؤثر.

امروز، ما مدل‌های صوتی جدید تبدیل گفتار به متن و تبدیل متن به گفتار را در API راه‌اندازی می‌کنیم—و این امکان را فراهم می‌کنیم تا عامل‌های صوتی قدرتمندتر، قابل‌سفارشی‌سازی‌تر، و هوشمندتری بسازید که ارزش واقعی ارائه می‌دهند. مدل‌های جدید تبدیل گفتار به متن ما یک معیار جدید و پیشرفته تعیین می‌کنند که از نظر دقت و قابلیت اطمینان از راهکارهای موجود بهتر عمل می‌کنند—به‌ویژه در سناریوهای چالش‌برانگیز شامل لهجه‌ها، محیط‌های پر سر و صدا و سرعت‌های مختلف گفتار. این بهبودها قابلیت اطمینان در رونوشت‌برداری را افزایش می‌دهند و مدل‌ها را به‌ویژه برای موارد استفاده‌ای مانند مراکز تماس مشتریان، رونوشت‌برداری از یادداشت‌های جلسه و موارد دیگر بسیار مناسب می‌سازند.

برای نخستین بار، توسعه‌دهندگان همچنین می‌توانند به مدل تبدیل متن به گفتار دستور دهند که به شیوه‌ای مشخص صحبت کند—برای مثال، «مثل یک کارشناس پشتیبانی مشتری همدل صحبت کنید»—و سطح جدیدی از سفارشی‌سازی را برای عامل‌های صوتی فراهم کنند. این امکان طیف وسیعی از برنامه‌های سفارشی را فراهم می‌کند، از صداهای خدمات مشتری همدلانه‌تر و پویاتر گرفته تا روایت‌گری بیان‌گر برای تجربه‌های داستان‌گویی خلاقانه.

ما نخستین مدل صوتی خود را در ۲۰۲۲ راه‌اندازی کردیم و از آن زمان، متعهد به بهبود هوشمندی، دقت و قابلیت اطمینان این مدل‌ها بوده‌ایم. با این مدل‌های صوتی جدید، توسعه‌دهندگان می‌توانند سیستم‌های تبدیل گفتار به متن دقیق‌تر و مقاوم‌تری بسازند و صداهای تبدیل متن به گفتار پر‌بیان‌تر و شخصیت‌مندتری ایجاد کنند—همه درون API.

آرام
موج‌سوار
حرفه‌ای
شوالیه قرون وسطی
علاقه‌مند به جنایات واقعی
قصه شب

اطلاعات بیشتر دربارهٔ جدیدترین مدل‌های صوتی ما

مدل‌های جدید گفتار به متن

ما در حال معرفی مدل‌های جدید gpt-4o-transcribe و gpt-4o-mini-transcribe هستیم که در مقایسه با مدل‌های اصلی Whisper، بهبودهایی در نرخ خطای کلمه، تشخیص بهتر زبان و دقت بالاتر دارند.

gpt-4o-transcribe عملکرد بهبود یافته‌ای در نرخ خطای کلمه (WER) نسبت به مدل‌های موجود Whisper در چندین بنچمارک تثبیت‌شده نشان می‌دهد که نشان‌دهنده پیشرفت قابل‌توجهی در فناوری تبدیل گفتار به متن ما است. این پیشرفت‌ها به طور مستقیم از نوآوری‌های هدفمند در یادگیری تقویتی و آموزش میانی گسترده با مجموعه‌داده‌های صوتی متنوع و باکیفیت ناشی می‌شوند.

در نتیجه، این مدل‌های جدید تبدیل گفتار به متن می‌توانند ظرافت‌های گفتار را بهتر درک کنند، تشخیص‌های نادرست را کاهش دهند و قابلیت اطمینان در رونوشت‌برداری را افزایش دهند، به‌ویژه در سناریوهای چالش‌برانگیز شامل لهجه‌ها، محیط‌های پر سر و صدا و سرعت‌های مختلف گفتار. این مدل‌ها اکنون در API گفتار به متن(در یک پنجره جدید باز می‌شود) در دسترس می‌باشند.

نرخ خطای کلمه (WER) دقت مدل‌های تشخیص گفتار را با محاسبه درصد کلماتی که در مقایسه با یک رونوشت مرجع به‌اشتباه رونویسی شده‌اند اندازه‌گیری می‌کند—WER کمتر بهتر و به معنای خطاهای کمتر است. مدل‌های جدید تبدیل گفتار به متن ما در معیارهای مختلف، از جمله FLEURS (ارزیابی یادگیری چند نمونه از بازنمایی‌های جهانی گفتار)—یک معیار سنجش گفتار چندزبانه که بیش از ۱۰۰ زبان را با استفاده از نمونه‌های صوتی رونویسی‌شده به‌صورت دستی پوشش می‌دهد—به WER پایین‌تری دست می‌یابند. این نتایج دقت رونوشت‌برداری قوی‌تر و پوشش زبانی جامع‌تری را نشان می‌دهند. همان‌طور که در اینجا نشان داده شده است، مدل‌های ما به طور مداوم در تمامی ارزیابی‌های زبانی عملکرد بهتری نسبت به Whisper v2 و Whisper v3 دارند.

در FLEURS، مدل‌های ما WER پایین‌تری دارند و عملکرد چند زبانه‌ی قوی ارائه می‌دهند. WER کمتر بهتر بوده و به معنای خطاهای کمتر است. همان‌طور که در اینجا نشان داده شده است، مدل‌های ما در اکثر زبان‌های اصلی با دیگر مدل‌های پیشرو برابری می‌کنند یا عملکرد بهتری دارند.

مدل جدید تبدیل متن به گفتار

ما همچنین یک مدل جدید gpt-4o-mini-tts را با قابلیت هدایت بهتر معرفی می‌کنیم. برای نخستین بار، توسعه‌دهندگان می‌توانند به مدل «دستور دهند» نه فقط چه بگوید، بلکه چگونه آن را بگوید—و این امکان را فراهم می‌کند تا تجربه‌هایی سفارشی‌تر برای موارد استفاده‌ای از پشتیبانی مشتری تا داستان‌گویی خلاقانه ایجاد شود. این مدل در API تبدیل متن به گفتار(در یک پنجره جدید باز می‌شود) در دسترس است. توجه داشته باشید که این مدل‌های تبدیل متن به گفتار به صداهای مصنوعی از پیش تعیین‌شده محدود هستند و ما آن‌ها را نظارت می‌کنیم تا اطمینان حاصل کنیم که به‌طور مداوم با پیش‌تنظیمات مصنوعی مطابقت دارند.

نوآوری‌های فنی پشت مدل‌ها

پیش‌آموزش با مجموعه‌داده‌های صوتی معتبر

مدل‌های صوتی جدید ما بر اساس معماری‌های GPT‑4o و GPT‑4o‑mini ساخته شده‌اند و به‌طور گسترده بر روی مجموعه‌داده‌های تخصصی صوت‌محور پیش‌آموزش دیده‌اند که در بهینه‌سازی عملکرد مدل نقشی حیاتی ایفا کرده‌اند. این رویکرد هدفمند بینش عمیق‌تری نسبت به ظرافت‌های گفتاری ارائه می‌دهد و عملکرد بی‌نظیری را در تمامی وظایف مرتبط با صدا ممکن می‌سازد.

روش‌های پیشرفته تقطیر

ما تکنیک‌های تقطیر خود را بهبود بخشیده‌ایم و امکان انتقال دانش از بزرگ‌ترین مدل‌های صوتی‌مان به مدل‌های کوچک‌تر و کارآمدتر را فراهم کرده‌ایم. با بهره‌گیری از روش‌های پیشرفته‌ی خودبازی، مجموعه‌داده‌های تقطیر ما به‌طور مؤثر پویایی‌های واقعی مکالمه را ثبت کرده و تعاملات واقعی کاربر-دستیار را بازتولید می‌کنند. این به مدل‌های کوچک‌تر ما کمک می‌کند تا کیفیت مکالمه‌ای عالی و پاسخ‌گویی سریع را ارائه دهند.

پارادایم یادگیری تقویتی

برای مدل‌های تبدیل گفتار به متن خود، یک الگوی سنگین یادگیری تقویتی (RL) را یکپارچه کرده‌ایم و دقت رونوشت‌برداری را به سطح پیشرفته‌ترین فناوری رسانده‌ایم. این روش‌شناسی دقت را به‌طور چشمگیری بهبود می‌بخشد و توهم‌زایی را کاهش می‌دهد و راهکارهای تبدیل گفتار به متن ما را در سناریوهای پیچیده تشخیص گفتار به‌طور استثنایی رقابتی می‌سازد.

این تحولات نشان‌دهندهٔ پیشرفت در حوزهٔ مدل‌سازی صوتی هستند و روش‌های نوآورانه را با بهبودهای عملی ترکیب می‌کنند تا عملکرد بهتری در کاربردهای گفتار ارائه دهند.

در دسترس بودن API

این مدل‌های صوتی جدید اکنون برای همه توسعه‌دهندگان در دسترس هستند – اطلاعات بیشتر درباره ساخت با صوت اینجا(در یک پنجره جدید باز می‌شود). برای توسعه‌دهندگانی که از قبل در حال ساخت تجربه‌های گفتگویی با مدل‌های مبتنی بر متن هستند، افزودن مدل‌های تبدیل گفتار به متن و تبدیل متن به گفتار ما ساده‌ترین راه برای ساخت یک عامل صوتی است. ما در حال انتشار یک یکپارچه‌سازی با Agents SDK(در یک پنجره جدید باز می‌شود) هستیم که این امر فرآیند توسعه را ساده‌تر می‌کند. برای توسعه‌دهندگانی که به دنبال ساخت تجربه‌های مکالمه-به-مکالمه با تأخیر کم هستند، توصیه می‌کنیم با مدل‌های مکالمه-به-مکالمه ما در Realtime API کار کنید.

بعد چه می‌شود؟

با نگاهی به آینده، قصد داریم همچنان به سرمایه‌گذاری برای بهبود هوشمندی و دقت مدل‌های صوتی خود ادامه دهیم و راه‌هایی را بررسی کنیم تا به توسعه‌دهندگان امکان دهیم صداهای سفارشی خود را بیاورند و تجربه‌هایی حتی شخصی‌سازی‌شده‌تر بسازند، به شیوه‌هایی که با استانداردهای ایمنی ما هم‌خوانی داشته باشد. علاوه بر این، ما در حال ادامه مشارکت در گفت‌وگوها با سیاست‌گذاران، پژوهشگران، توسعه‌دهندگان و خلاقان درباره چالش‌ها و فرصت‌هایی که صداهای مصنوعی می‌توانند ارائه دهند هستیم. ما هیجان‌زده‌ایم که ببینیم توسعه‌دهندگان با استفاده از این قابلیت‌های صوتی بهبودیافته چه برنامه‌های نوآورانه و خلاقانه‌ای خواهند ساخت. ما همچنین در سایر روش‌ها—از جمله ویدیو—سرمایه‌گذاری خواهیم کرد تا توسعه‌دهندگان بتوانند تجربه‌های چندرسانه‌ای عامل‌محور ایجاد کنند.

بازپخش زنده

نویسنده‌ها

OpenAI

پژوهش‌های پیشرو

کریستینا کیم، جونها مائو، یی شن، یو ژانگ

مشارکت‌کنندگان

تحقیق

الکس پینو، بوون چنگ، چنگشو ژوانگ، کریس کوچ، دامیان مروکا، اریک ریتر، جیکوب منیک، جیمز بتکر، جی لین، جیمی کیروس، جیاهویی یو، لیانگ ژو، لییو چن، کوین لو، مدلین بوید، مایکل لمپ، مایک هیتون، نانشین چن، نیتیش کسکار، ساچی جین، سم تویزر، سومای جین، تائو شو، تومر کاپلان، وی هان، شیانگ نینگ چن، یه جیا

مهندسی

آلینا وو، آندرس گارسیا گارسیا، آرشی باتناگار، آویتال الیور، برندان کوئین، کریستینا هوانگ، دیوید فنگ، دراگوس اوپریکا، دومینیک کوندل، ادده اویوو، یاروسلاو توردوخلیب، جیاچنگ فنگ، جی چن، جنیا واراووا، جردن سیتکین، جوزف فلورنسو، لین مامیتسوکا، مادا افلاک، مانولی لیوداکیس، مارک هادنال، نوآ مک کالوم، اولا اوکلولا، پیتر باکوم، روهان مهتا، رومن هوئه، وانینگ جیانگ، وین چانگ، ییلی کیان

محصول

آنوبها سریواستاوا، جکی شانون، جف هریس، ریا مییارا، شیائولین هائو

حامیان مالی رهبری

آیدان کلارک، اندرو گیبیانسکی، دیوید ساساکی، کوین ویل، لیام فدوس، مارک چن، نیک رایدر، نیک تورلی، اولیویه گودمان، پرافولا داریوال، شنگجیا ژائو، شوچائو بی، شروین وو، سولمان چودری