معرفی مدلهای صوتی نسلِ بعد در API
مجموعهای جدید از مدلهای صوتی برای تقویت عاملهای صوتی، اکنون در دسترس توسعهدهندگان در سراسر جهان قرار دارد.

بهروزرسانی در ۲۸ اوت ۲۰۲۵: ما دسترسی عمومی Realtime API را اعلام کردیم. اینجا بیشتر بدانید.
در چند ماه گذشته، ما در ارتقای هوشمندی، قابلیتها و کارآمدی عاملهای مبتنی بر متن—یا سیستمهایی که بهطور مستقل وظایف را از طرف کاربران انجام میدهند—با انتشارهایی مانند اپراتور، تحقیق عمیق، عاملهای کامپیوتری، و Responses API با ابزارهای داخلی سرمایهگذاری کردهایم. با این حال، برای اینکه عاملها واقعاً مفید باشند، مردم باید بتوانند تعاملات عمیقتر و شهودیتری با عاملها فراتر از صرفاً متن داشته باشند—با استفاده از زبان گفتاری طبیعی برای برقراری ارتباط مؤثر.
امروز، ما مدلهای صوتی جدید تبدیل گفتار به متن و تبدیل متن به گفتار را در API راهاندازی میکنیم—و این امکان را فراهم میکنیم تا عاملهای صوتی قدرتمندتر، قابلسفارشیسازیتر، و هوشمندتری بسازید که ارزش واقعی ارائه میدهند. مدلهای جدید تبدیل گفتار به متن ما یک معیار جدید و پیشرفته تعیین میکنند که از نظر دقت و قابلیت اطمینان از راهکارهای موجود بهتر عمل میکنند—بهویژه در سناریوهای چالشبرانگیز شامل لهجهها، محیطهای پر سر و صدا و سرعتهای مختلف گفتار. این بهبودها قابلیت اطمینان در رونوشتبرداری را افزایش میدهند و مدلها را بهویژه برای موارد استفادهای مانند مراکز تماس مشتریان، رونوشتبرداری از یادداشتهای جلسه و موارد دیگر بسیار مناسب میسازند.
برای نخستین بار، توسعهدهندگان همچنین میتوانند به مدل تبدیل متن به گفتار دستور دهند که به شیوهای مشخص صحبت کند—برای مثال، «مثل یک کارشناس پشتیبانی مشتری همدل صحبت کنید»—و سطح جدیدی از سفارشیسازی را برای عاملهای صوتی فراهم کنند. این امکان طیف وسیعی از برنامههای سفارشی را فراهم میکند، از صداهای خدمات مشتری همدلانهتر و پویاتر گرفته تا روایتگری بیانگر برای تجربههای داستانگویی خلاقانه.
ما نخستین مدل صوتی خود را در ۲۰۲۲ راهاندازی کردیم و از آن زمان، متعهد به بهبود هوشمندی، دقت و قابلیت اطمینان این مدلها بودهایم. با این مدلهای صوتی جدید، توسعهدهندگان میتوانند سیستمهای تبدیل گفتار به متن دقیقتر و مقاومتری بسازند و صداهای تبدیل متن به گفتار پربیانتر و شخصیتمندتری ایجاد کنند—همه درون API.
ما در حال معرفی مدلهای جدید gpt-4o-transcribe و gpt-4o-mini-transcribe هستیم که در مقایسه با مدلهای اصلی Whisper، بهبودهایی در نرخ خطای کلمه، تشخیص بهتر زبان و دقت بالاتر دارند.
gpt-4o-transcribe عملکرد بهبود یافتهای در نرخ خطای کلمه (WER) نسبت به مدلهای موجود Whisper در چندین بنچمارک تثبیتشده نشان میدهد که نشاندهنده پیشرفت قابلتوجهی در فناوری تبدیل گفتار به متن ما است. این پیشرفتها به طور مستقیم از نوآوریهای هدفمند در یادگیری تقویتی و آموزش میانی گسترده با مجموعهدادههای صوتی متنوع و باکیفیت ناشی میشوند.
در نتیجه، این مدلهای جدید تبدیل گفتار به متن میتوانند ظرافتهای گفتار را بهتر درک کنند، تشخیصهای نادرست را کاهش دهند و قابلیت اطمینان در رونوشتبرداری را افزایش دهند، بهویژه در سناریوهای چالشبرانگیز شامل لهجهها، محیطهای پر سر و صدا و سرعتهای مختلف گفتار. این مدلها اکنون در API گفتار به متن(در یک پنجره جدید باز میشود) در دسترس میباشند.
نرخ خطای کلمه (WER) دقت مدلهای تشخیص گفتار را با محاسبه درصد کلماتی که در مقایسه با یک رونوشت مرجع بهاشتباه رونویسی شدهاند اندازهگیری میکند—WER کمتر بهتر و به معنای خطاهای کمتر است. مدلهای جدید تبدیل گفتار به متن ما در معیارهای مختلف، از جمله FLEURS (ارزیابی یادگیری چند نمونه از بازنماییهای جهانی گفتار)—یک معیار سنجش گفتار چندزبانه که بیش از ۱۰۰ زبان را با استفاده از نمونههای صوتی رونویسیشده بهصورت دستی پوشش میدهد—به WER پایینتری دست مییابند. این نتایج دقت رونوشتبرداری قویتر و پوشش زبانی جامعتری را نشان میدهند. همانطور که در اینجا نشان داده شده است، مدلهای ما به طور مداوم در تمامی ارزیابیهای زبانی عملکرد بهتری نسبت به Whisper v2 و Whisper v3 دارند.
در FLEURS، مدلهای ما WER پایینتری دارند و عملکرد چند زبانهی قوی ارائه میدهند. WER کمتر بهتر بوده و به معنای خطاهای کمتر است. همانطور که در اینجا نشان داده شده است، مدلهای ما در اکثر زبانهای اصلی با دیگر مدلهای پیشرو برابری میکنند یا عملکرد بهتری دارند.
ما همچنین یک مدل جدید gpt-4o-mini-tts را با قابلیت هدایت بهتر معرفی میکنیم. برای نخستین بار، توسعهدهندگان میتوانند به مدل «دستور دهند» نه فقط چه بگوید، بلکه چگونه آن را بگوید—و این امکان را فراهم میکند تا تجربههایی سفارشیتر برای موارد استفادهای از پشتیبانی مشتری تا داستانگویی خلاقانه ایجاد شود. این مدل در API تبدیل متن به گفتار(در یک پنجره جدید باز میشود) در دسترس است. توجه داشته باشید که این مدلهای تبدیل متن به گفتار به صداهای مصنوعی از پیش تعیینشده محدود هستند و ما آنها را نظارت میکنیم تا اطمینان حاصل کنیم که بهطور مداوم با پیشتنظیمات مصنوعی مطابقت دارند.
مدلهای صوتی جدید ما بر اساس معماریهای GPT‑4o و GPT‑4o‑mini ساخته شدهاند و بهطور گسترده بر روی مجموعهدادههای تخصصی صوتمحور پیشآموزش دیدهاند که در بهینهسازی عملکرد مدل نقشی حیاتی ایفا کردهاند. این رویکرد هدفمند بینش عمیقتری نسبت به ظرافتهای گفتاری ارائه میدهد و عملکرد بینظیری را در تمامی وظایف مرتبط با صدا ممکن میسازد.
ما تکنیکهای تقطیر خود را بهبود بخشیدهایم و امکان انتقال دانش از بزرگترین مدلهای صوتیمان به مدلهای کوچکتر و کارآمدتر را فراهم کردهایم. با بهرهگیری از روشهای پیشرفتهی خودبازی، مجموعهدادههای تقطیر ما بهطور مؤثر پویاییهای واقعی مکالمه را ثبت کرده و تعاملات واقعی کاربر-دستیار را بازتولید میکنند. این به مدلهای کوچکتر ما کمک میکند تا کیفیت مکالمهای عالی و پاسخگویی سریع را ارائه دهند.
برای مدلهای تبدیل گفتار به متن خود، یک الگوی سنگین یادگیری تقویتی (RL) را یکپارچه کردهایم و دقت رونوشتبرداری را به سطح پیشرفتهترین فناوری رساندهایم. این روششناسی دقت را بهطور چشمگیری بهبود میبخشد و توهمزایی را کاهش میدهد و راهکارهای تبدیل گفتار به متن ما را در سناریوهای پیچیده تشخیص گفتار بهطور استثنایی رقابتی میسازد.
این تحولات نشاندهندهٔ پیشرفت در حوزهٔ مدلسازی صوتی هستند و روشهای نوآورانه را با بهبودهای عملی ترکیب میکنند تا عملکرد بهتری در کاربردهای گفتار ارائه دهند.
این مدلهای صوتی جدید اکنون برای همه توسعهدهندگان در دسترس هستند – اطلاعات بیشتر درباره ساخت با صوت اینجا(در یک پنجره جدید باز میشود). برای توسعهدهندگانی که از قبل در حال ساخت تجربههای گفتگویی با مدلهای مبتنی بر متن هستند، افزودن مدلهای تبدیل گفتار به متن و تبدیل متن به گفتار ما سادهترین راه برای ساخت یک عامل صوتی است. ما در حال انتشار یک یکپارچهسازی با Agents SDK(در یک پنجره جدید باز میشود) هستیم که این امر فرآیند توسعه را سادهتر میکند. برای توسعهدهندگانی که به دنبال ساخت تجربههای مکالمه-به-مکالمه با تأخیر کم هستند، توصیه میکنیم با مدلهای مکالمه-به-مکالمه ما در Realtime API کار کنید.
با نگاهی به آینده، قصد داریم همچنان به سرمایهگذاری برای بهبود هوشمندی و دقت مدلهای صوتی خود ادامه دهیم و راههایی را بررسی کنیم تا به توسعهدهندگان امکان دهیم صداهای سفارشی خود را بیاورند و تجربههایی حتی شخصیسازیشدهتر بسازند، به شیوههایی که با استانداردهای ایمنی ما همخوانی داشته باشد. علاوه بر این، ما در حال ادامه مشارکت در گفتوگوها با سیاستگذاران، پژوهشگران، توسعهدهندگان و خلاقان درباره چالشها و فرصتهایی که صداهای مصنوعی میتوانند ارائه دهند هستیم. ما هیجانزدهایم که ببینیم توسعهدهندگان با استفاده از این قابلیتهای صوتی بهبودیافته چه برنامههای نوآورانه و خلاقانهای خواهند ساخت. ما همچنین در سایر روشها—از جمله ویدیو—سرمایهگذاری خواهیم کرد تا توسعهدهندگان بتوانند تجربههای چندرسانهای عاملمحور ایجاد کنند.
نویسندهها
پژوهشهای پیشرو
کریستینا کیم، جونها مائو، یی شن، یو ژانگ
مشارکتکنندگان
تحقیق
الکس پینو، بوون چنگ، چنگشو ژوانگ، کریس کوچ، دامیان مروکا، اریک ریتر، جیکوب منیک، جیمز بتکر، جی لین، جیمی کیروس، جیاهویی یو، لیانگ ژو، لییو چن، کوین لو، مدلین بوید، مایکل لمپ، مایک هیتون، نانشین چن، نیتیش کسکار، ساچی جین، سم تویزر، سومای جین، تائو شو، تومر کاپلان، وی هان، شیانگ نینگ چن، یه جیا
مهندسی
آلینا وو، آندرس گارسیا گارسیا، آرشی باتناگار، آویتال الیور، برندان کوئین، کریستینا هوانگ، دیوید فنگ، دراگوس اوپریکا، دومینیک کوندل، ادده اویوو، یاروسلاو توردوخلیب، جیاچنگ فنگ، جی چن، جنیا واراووا، جردن سیتکین، جوزف فلورنسو، لین مامیتسوکا، مادا افلاک، مانولی لیوداکیس، مارک هادنال، نوآ مک کالوم، اولا اوکلولا، پیتر باکوم، روهان مهتا، رومن هوئه، وانینگ جیانگ، وین چانگ، ییلی کیان
محصول
آنوبها سریواستاوا، جکی شانون، جف هریس، ریا مییارا، شیائولین هائو
حامیان مالی رهبری
آیدان کلارک، اندرو گیبیانسکی، دیوید ساساکی، کوین ویل، لیام فدوس، مارک چن، نیک رایدر، نیک تورلی، اولیویه گودمان، پرافولا داریوال، شنگجیا ژائو، شوچائو بی، شروین وو، سولمان چودری