OpenAI

۱۷ تیر ۱۴۰۵

محصولانتشار

معرفی GPT‑Live

نسلی تازه از مدل‌های صوتی که برای تعامل طبیعی‌تر میان انسان و هوش مصنوعی طراحی شده‌اند و اکنون ChatGPT Voice را پشتیبانی می‌کنند.

در حال بارگذاری…

به‌روزرسانی ۳۱ ژوئیهٔ ۲۰۲۶: فایل‌های صوتی پشتیبانی‌شده‌ای که با GPT‑Live در ChatGPT Voice یا از طریق API ‏OpenAI تولید می‌شوند، اکنون دارای واترمارک SynthID هستند. ابزار عمومی راستی‌آزمایی ما اکنون سیگنال‌های منشأ OpenAI را در فایل‌های صوتی پشتیبانی‌شده تشخیص می‌دهد. همچنین، برای راستی‌آزمایی دسترسی از طریق API فراهم کرده‌ایم تا توسعه‌دهندگان و سازمان‌ها بتوانند بررسی منشأ محتوا را در گردش‌کارهای خود بگنجانند. این به‌روزرسانی‌ها ادامهٔ رویکرد ایمنیِ شرح‌داده‌شده در زیر و تلاش‌های گسترده‌تر ما برای آسان‌ترکردن شناسایی محتوای تولیدشده توسط OpenAI هستند.

ما در حال عرضه GPT‑Live هستیم؛ نسل تازه‌ای از مدل‌های صوتی که گفت‌وگو با هوش مصنوعی را بسیار شبیه‌تر به یک مکالمه واقعی می‌کند.

GPT‑Live بر پایه معماری تمام‌دوسویه ساخته شده است؛ یعنی می‌تواند هم‌زمان گوش بدهد و صحبت کند. در طول مکالمه، GPT‑Live می‌تواند با عبارت‌هایی مثل «اوهوم» یا «آره» نشان دهد که توجه می‌کند، وارد رفت‌وبرگشت‌های سریع شود، یا وقتی برای فکر کردن به چند لحظه زمان نیاز دارید، فقط ساکت بماند. نتیجه، تجربه‌ای صوتی است که صحبت کردن با آن به‌طرزی دلپذیر آسان است.

GPT‑Live همچنین هوشمندترین مدل صوتی ما تا امروز است. برای پرسش‌هایی که به جست‌وجوی وب، استدلال عمیق‌تر یا کارهای پیچیده‌تر نیاز دارند، در پشت صحنه کار را به جدیدترین مدل پیشرو ما واگذار می‌کند و وقتی نتیجه آماده شد، آن را به مکالمه برمی‌گرداند. در حین انجام کار، GPT‑Live می‌تواند همچنان با شما صحبت کند و جریان مکالمه را حفظ کند. در زمان عرضه، GPT‑Live در پس‌زمینه از GPT‑5.5 استفاده خواهد کرد. با انتشار مدل‌های پیشرو جدید، مدلی را که GPT‑Live استفاده می‌کند به‌طور پیوسته به‌روزرسانی خواهیم کرد.

این پیشرفت‌ها تجربه تازه‌ای از ChatGPT سخنگو را ممکن می‌کنند که هوشمندتر و طبیعی‌تر است. با گذشت زمان، باور داریم این پژوهش همچنین امکان استفاده از صدا را برای کارهایی هرچه پیچیده‌تر، طولانی‌تر و عامل‌محورتر فراهم خواهد کرد.

از امروز، عرضه تدریجی دو نسخه از GPT‑Live — GPT‑Live‑1 و GPT‑Live‑1 mini — را برای کاربران ChatGPT در سراسر جهان آغاز می‌کنیم. همچنین قصد داریم به‌زودی آن‌ها را به API بیاوریم، و توسعه‌دهندگان و سازمان‌ها می‌توانند با استفاده از این فرم برای دریافت اطلاع‌رسانی ثبت‌نام کنند.

ورود به عصر تازه‌ای از تعامل انسان و هوش مصنوعی

چشم‌انداز ما این است که تعامل واقعاً طبیعی میان انسان و هوش مصنوعی را ممکن کنیم: جهانی که در آن همکاری با هوش مصنوعی به روانی و پاسخ‌گویی کار با یک انسان دیگر باشد، در حالی که استدلال و اجرای وظایف پیچیده بی‌وقفه در پس‌زمینه انجام می‌شود.

رویکردهای پیشین

نسل‌های قدیمی‌تر سیستم‌های صوتی هوش مصنوعی ما را به آن چشم‌انداز نزدیک‌تر کردند، اما با مصالحه‌های مهمی همراه بودند.

سیستم‌های صوتی آبشاری

سیستم‌های صوتی آبشاری برای پردازش هر نوبت، به مجموعه‌ای از مدل‌ها متکی‌اند که یکی پس از دیگری عمل می‌کنند. ChatGPT سخنگوی اولیه سه مدل را به هم زنجیر کرده بود: یک مدل گفتار به متن برای رونویسی گفتار شما، یک مدل زبانی بزرگ برای تولید پاسخ، و یک مدل متن به گفتار برای تبدیل دوباره آن به گفتار. این رویکرد برای نخستین بار امکان صحبت با مدل‌های هوش مصنوعی پیشرو را فراهم کرد، اما پیچیدگی آن هزینه داشت: ممکن بود اطلاعات میان مدل‌ها از دست برود، و پاسخ‌ها کند و خشک بودند.

سیستم صوتی چندمرحله‌ای

پاسخ‌های کند و غیرروان، مکث‌های طولانی

رونوشت
نمونه مکالمه با حالت صوتی استاندارد، با استفاده از GPT-5.5 فوری

مدل‌های صوتی نوبتی

مدل‌های صوتی نوبتی مانند دستیار صوتی پیشرفته ChatGPT صدا را درون یک مدل واحد پردازش و تولید می‌کردند؛ این کار تأخیر را کاهش می‌داد و مکالمه‌ها را روان‌تر می‌کرد — اما همچنان بر پایه نوبت‌های جداگانه کار می‌کردند. مدل باید منتظر می‌ماند تا کاربر صحبتش را تمام کند و بعد پاسخ بدهد؛ در نتیجه رفت‌وبرگشت‌ها خشک می‌شد. افزون بر این، چون تشخیص نوبت بر پایه سکوت است، حتی یک مکث کوتاه یا صدای پس‌زمینه می‌توانست به‌اشتباه پایان نوبت تلقی شود — و باعث شود مدل در زمان‌هایی غیرطبیعی حرف کاربر را قطع کند.

مدل صوتی مبتنی بر نوبت

پاسخ‌ها کمی سریع‌تر و روان‌ترند، اما تعامل رفت‌وبرگشتی با مدل همچنان محدود به نظر می‌رسد

رونوشت
نمونه مکالمه با دستیار صوتی پیشرفته ChatGPT

رویکرد تازه ما

GPT‑Live این محدودیت‌ها را با دو تغییر معماری برطرف می‌کند.

تعامل پیوسته

نخست، GPT‑Live را برای تعامل پیوسته و با معماری تمام‌دوسویه ساختیم. GPT‑Live به‌جای پردازش دنباله‌ای از پیام‌های جداگانه، هنگام تولید خروجی، ورودی را نیز به‌طور پیوسته پردازش می‌کند. بنابراین مدل می‌تواند در هر ثانیه بارها درباره تعامل تصمیم بگیرد: صحبت کند، به گوش دادن ادامه دهد، مکث کند، حرف را قطع کند یا ابزاری را فراخوانی کند.

این امکان به مدل اجازه می‌دهد رفت‌وبرگشت طبیعی‌تری داشته باشد، حس بهتری از زمان را حفظ کند و حتی ترجمه زنده انجام دهد.

تعامل پیوسته

پاسخ‌های سریع، طبیعی و گویا، همراه با گوش‌دادن فعال‌تر

رونوشت
نمونه مکالمه با GPT-Live-1، با استفاده از GPT-5.5 فوری

واگذاری برای کارهای عمیق‌تر

دوم، GPT‑Live را — که تعامل پیوسته را مدیریت می‌کند — از کارهای عمیق‌تر جدا کردیم. وقتی پرسشی به جست‌وجو، استدلال یا قابلیت‌های عامل‌محورتر نیاز داشته باشد، GPT‑Live می‌تواند کار را به مدل دیگری مانند GPT‑5.5 واگذار کند. این باعث می‌شود حتی وقتی چند کار را در پس‌زمینه انجام می‌دهد، مکالمه را ادامه دهد.

این تغییر معماری همچنین به GPT‑Live امکان می‌دهد به‌طور پیوسته از جدیدترین مدل‌ها و عامل‌ها استفاده کند و هوشمندی پیشرو را با تعامل طبیعی ترکیب کند.

واگذاری وظایف پیچیده‌تر به مدل‌های پیشرفته‌تر

GPT-Live پاسخ‌های سریع و طبیعی ارائه می‌دهد، در حالی که GPT-5.5 جست‌وجو را در پس‌زمینه انجام می‌دهد

رونوشت
نمونه مکالمه با GPT-Live-1، با استفاده از GPT-5.5 فوری

ارزیابی‌ها

ما ارزیابی‌های انسانی تازه‌ای ساختیم تا خوشایندی و جریان مکالمه را بسنجیم. در این مقایسه‌های رودررو، GPT‑Live‑1 و GPT‑Live‑1 mini در مکالمه‌های همسان ۵ تا ۱۰ دقیقه‌ای، که ترجیح کلی، نوبت‌گیری، قطع کردن، جریان مکالمه و میزان طبیعی بودن هر تعامل را می‌سنجند، با اختلافی چشمگیر به دستیار صوتی پیشرفته ترجیح داده می‌شوند.

  • GPQA: ‏GPT‑Live‑1 در GPQA عملکردی به‌مراتب بهتر از دستیار صوتی پیشرفته دارد؛ GPQA استدلال علمی در سطح کارشناسی را در زیست‌شناسی، شیمی و فیزیک می‌سنجد.
  • BrowseComp: ‏GPT‑Live‑1 در BrowseComp نسبت به دستیار صوتی پیشرفته پیشرفت‌های چشمگیری نشان می‌دهد؛ BrowseComp جست‌وجوی وب عامل‌محور و توانایی یافتن اطلاعات دشوار‌یاب را می‌سنجد.
  • τ³-Voice Telecom (نسخهٔ داخلی): در این معیار، مدل GPT‑Live‑1 عملکرد بهتری از حالت صوتی پیشرفته دارد. این معیار، عامل‌های صوتی را در انجام وظایف واقع‌گرایانه و چندنوبتیِ پشتیبانی مخابراتی ارزیابی می‌کند.

* GPT‑Live‑1 (فوری) و GPT‑Live‑1 mini در پس‌زمینه از مدل GPT‑5.5 فوری استفاده می‌کنند، در حالی که GPT‑Live‑1 متوسط و GPT‑Live‑1 بالا از مدل GPT‑5.5 Thinking با تلاش استدلال متوسط و بالا استفاده می‌کنند.

برای این ارزیابی، از یک مدل کاربر سفارشی‌سازی‌شده استفاده کردیم که از جدیدترین مدل‌های استدلالی ما بهره می‌برد.

تجربه‌ای تازه از ChatGPT سخنگو

هر هفته، بیش از ۱۵۰ میلیون نفر با استفاده از قابلیت‌هایی مانند Voice و Dictation با ChatGPT تعامل دارند. آن‌ها از این قابلیت‌ها برای دریافت کمک‌های روزمره بدون نیاز به استفاده از دست، تمرین زبان، تعریف داستان‌های پیش از خواب یا حتی گفت‌وگو در مسیر رفت‌وآمد استفاده می‌کنند.

از امروز، با لمس دکمه Voice برای گفت‌وگو با ChatGPT، تجربه‌ای بهبودیافته مبتنی بر GPT‑Live خواهید داشت؛ با مکالمه‌هایی طبیعی‌تر، پاسخ‌هایی هوشمندتر، درک بهتر گفتار و پاسخ‌هایی همراه با عناصر بصری.

گفت‌وگوهای طبیعی‌تر

حالا گفت‌وگو با ChatGPT بیش از پیش شبیه یک مکالمه واقعی خواهد بود. می‌توانید با پرسیدن سؤال، مکالمه را قطع کنید، برای فکر کردن مکث کنید یا از ChatGPT بخواهید آهسته‌تر صحبت کند. ChatGPT با واکنش‌های طبیعی مانند «هوم» یا «متوجه شدم» نشان می‌دهد که صحبت‌های شما را دنبال می‌کند. همچنین، نه صدای متمایز ChatGPT را برای GPT‑Live بازطراحی و بهینه‌سازی کرده‌ایم.

پاسخ‌های هوشمندانه‌تر

ChatGPT Voice اکنون می‌تواند از جدیدترین مدل‌های پیشرفته ما بهره بگیرد و در مواقع نیاز، پاسخ‌هایی هوشمندتر ارائه دهد. همچنین می‌توانید سطح استدلال متناسب با نیاز خود را انتخاب کنید: Instant برای پاسخ‌های سریع، یا Medium و High زمانی که می‌خواهید ChatGPT زمان بیشتری را صرف تفکر کند.

درک بهتر گفتار

اگر برای فکر کردن لحظه‌ای مکث کنید، ChatGPT Voice اکنون به‌جای وارد شدن به مکالمه و قطع کردن صحبت شما، منتظر می‌ماند. اگر از آن بخواهید سکوت کند و فقط گوش دهد، همین کار را انجام می‌دهد. همچنین، در محیط‌هایی با صداهای پس‌زمینه مانند عبور خودروها یا گفت‌وگوهای اطراف، ChatGPT بهتر می‌تواند روی صدای شما تمرکز کند و از صداهای مزاحم تأثیر نپذیرد.

نمایش سریع پاسخ‌ها به‌صورت بصری

برخی پاسخ‌ها وقتی به‌صورت بصری ارائه شوند، کاربردی‌تر هستند. هنگام گفت‌وگو، ChatGPT اکنون می‌تواند برای موضوعاتی مانند آب‌وهوا، سهام، ورزش و موارد دیگر، کارت‌های تصویریِ حاوی اطلاعات نمایش دهد. Voice همچنان از قابلیت‌هایی مانند جست‌وجو، حافظه، تصاویر و بارگذاری فایل‌ها نیز پشتیبانی می‌کند.

حاصل این تغییرات، تجربه‌ای از ChatGPT Voice است که طبیعی‌تر، توانمندتر و کاربردی‌تر در زندگی روزمره به نظر می‌رسد.

سازوکارهای ایمنی طراحی‌شده ویژه مکالمات صوتی

GPT‑Live به‌گونه‌ای طراحی شده است که از ابتدا به‌صورت پیش‌فرض ایمن باشد. این سامانه از پیشرفت‌های ایمنی جدیدترین مدل‌های ما بهره می‌گیرد و در کنار آن، آموزش‌های ایمنی اختصاصی برای حوزه‌های کلیدی ریسک و سازوکارهای حفاظتی جدیدی را ارائه می‌کند که به‌طور ویژه برای تعاملات صوتی طراحی شده‌اند.

آزمون‌های ایمنی گسترده‌تر

برای اینکه نحوه استفاده واقعی افراد از قابلیت صوتی را بهتر منعکس کنیم، ابتدا دامنه آزمون‌های ایمنی خود را گسترش دادیم تا ارزیابی‌های جدید و اختصاصی برای صوت را نیز دربرگیرد. همچنین ارزیابی‌های مصنوعی مبتنی بر صدای تولیدشده طراحی کردیم تا با بهره‌گیری از آموخته‌های خود از دستیار صوتی پیشرفته، حوزه‌های کلیدی ایمنی را با تمرکز و دقت بیشتری بررسی کنیم. این حوزه‌ها شامل خودآزاری، روان‌پریشی و شیدایی، وابستگی عاطفی به هوش مصنوعی، خشونت و محتوای جنسی می‌شوند. کارشناسان داخلی نیز مدل را با سناریوهای چالش‌برانگیز آزمایش کردند تا خطرهای ویژه تعاملات صوتی را شناسایی کنند.

در آزمون‌های ما، GPT‑Live تقریباً در همه حوزه‌هایی که ارزیابی کردیم، عملکردی هم‌سطح یا بهتر ازدستیار صوتی پیشرفته داشت. برای اطلاعات بیشتر درباره آزمون‌ها و سازوکارهای ایمنی ما، می‌توانید به کارت سیستم(در یک پنجره جدید باز می‌شود) GPT‑Live مراجعه کنید.

سازوکارهای حفاظتی تعبیه‌شده

از آنجا که مکالمات صوتی به‌صورت بلادرنگ انجام می‌شوند، سازوکارهای ایمنی جدیدی طراحی کرده‌ایم که می‌توانند حین پاسخ‌گویی مدل فعال شوند. اگر سیستم محتوایی بالقوه ناایمن را تشخیص دهد، می‌تواند مدل را به سمت پاسخ ایمن‌تر هدایت کند، پیام‌ها یا منابع حمایتی مرتبط را نمایش دهد یا در شرایط پرخطرتر، مکالمه صوتی را پایان دهد. برای گفت‌وگوهای مرتبط با خودآزاری نیز، قابلیت‌های حمایتی ChatGPT را برای Voice بهینه کرده‌ایم؛ از جمله ارائه راهنمایی برای دسترسی به خطوط کمک بحران که توسط متخصصان بررسی و تأیید شده‌اند.

برای حمایت از کاربران نوجوان، سازوکارهای حفاظتی بیشتری طراحی کردیم و رفتارهای متناسب با سن را مستقیماً در مدل آموزش دادیم تا خطر ارائه پاسخ‌های نامناسب کاهش یابد. والدین می‌توانند از طریق کنترل‌های والدین تعیین کنند که آیا نوجوانشان به ChatGPT Voice دسترسی داشته باشد یا خیر. همچنین، والدین مرتبط ممکن است در شرایط پرخطرتر، مانند مشاهده نشانه‌هایی از خودآزاری احتمالی یا قصد خودکشی، اعلان دریافت کنند.

یادگیری مبتنی بر استفاده در دنیای واقعی

همچنین در حال اجرای سنجش‌های بلندمدت و پایش پس از عرضه با تمرکز بر اتکای عاطفی هستیم تا درک خود را از این موضوع بهبود دهیم و سازوکارهای حفاظتی را بیش از پیش ارتقا بخشیم. با تکیه بر پژوهش‌های پیشین خود درباره استفاده عاطفی و بهزیستی عاطفی، این اقدامات به ما کمک می‌کنند الگوهای نوظهور را شناسایی کنیم و نحوه پاسخ‌گویی سیستم در تعاملات حساس عاطفی را بهبود دهیم.

در نهایت، GPT‑Live برای گفت‌وگو طراحی شده است، نه برای جعل یا تقلید صدای افراد واقعی. این سامانه از مجموعه‌ای از صداهای از پیش تعیین‌شده در ChatGPT استفاده می‌کند و سازوکارهای حفاظتی در آن تعبیه شده است تا از تقلید صدای افراد واقعی جلوگیری شود.

ما متعهد به حفظ و ارتقای ایمنی و بهزیستی هستیم و با یادگیری از نحوه استفاده واقعی، به تقویت مستمر این سازوکارهای حفاظتی ادامه خواهیم داد.

دسترس‌پذیری و محدودیت‌ها

GPT‑Live اکنون به‌تدریج برای کاربران ChatGPT در سراسر جهان روی iOS، Android و ChatGPT.com(در یک پنجره جدید باز می‌شود) عرضه می‌شود. GPT‑Live‑1 به مدل پیش‌فرض مورد استفاده برای ChatGPT Voice در کاربران Go، Plus و Pro تبدیل خواهد شد و GPT‑Live‑1 mini مدل پیش‌فرض کاربران Free خواهد بود. جزئیات بیشتر درباره دسترس‌پذیری در مرکز راهنما(در یک پنجره جدید باز می‌شود) ما در دسترس است.

GPT‑Live را برای برخی از محبوب‌ترین زبان‌های مورد استفاده در ChatGPT بهینه کرده‌ایم. با این حال، در برخی زبان‌ها ممکن است مدل همچنان لهجه‌ای غیر بومی داشته باشد یا در روانی گفتار با محدودیت‌هایی مواجه باشد. ما به‌طور مستمر در حال بهبود تجربه چندزبانه GPT‑Live هستیم.

در زمان عرضه، GPT‑Live در ChatGPT هنوز از مکالمه صوتی همراه با ویدیو یا اشتراک‌گذاری صفحه پشتیبانی نخواهد کرد، اما در حال کار برای ارائه این قابلیت‌ها در آینده نزدیک هستیم. همچنان می‌توانید به نسخه‌های پیشین ChatGPT Voice، از جمله Standard و Advanced Voice Mode، دسترسی داشته باشید؛ نسخه‌هایی که این قابلیت‌ها در آن‌ها در دسترس هستند.

نویسنده

OpenAI