بهروزرسانی ۳۱ ژوئیهٔ ۲۰۲۶: فایلهای صوتی پشتیبانیشدهای که با GPT‑Live در ChatGPT Voice یا از طریق API OpenAI تولید میشوند، اکنون دارای واترمارک SynthID هستند. ابزار عمومی راستیآزمایی ما اکنون سیگنالهای منشأ OpenAI را در فایلهای صوتی پشتیبانیشده تشخیص میدهد. همچنین، برای راستیآزمایی دسترسی از طریق API فراهم کردهایم تا توسعهدهندگان و سازمانها بتوانند بررسی منشأ محتوا را در گردشکارهای خود بگنجانند. این بهروزرسانیها ادامهٔ رویکرد ایمنیِ شرحدادهشده در زیر و تلاشهای گستردهتر ما برای آسانترکردن شناسایی محتوای تولیدشده توسط OpenAI هستند.
ما در حال عرضه GPT‑Live هستیم؛ نسل تازهای از مدلهای صوتی که گفتوگو با هوش مصنوعی را بسیار شبیهتر به یک مکالمه واقعی میکند.
GPT‑Live بر پایه معماری تمامدوسویه ساخته شده است؛ یعنی میتواند همزمان گوش بدهد و صحبت کند. در طول مکالمه، GPT‑Live میتواند با عبارتهایی مثل «اوهوم» یا «آره» نشان دهد که توجه میکند، وارد رفتوبرگشتهای سریع شود، یا وقتی برای فکر کردن به چند لحظه زمان نیاز دارید، فقط ساکت بماند. نتیجه، تجربهای صوتی است که صحبت کردن با آن بهطرزی دلپذیر آسان است.
GPT‑Live همچنین هوشمندترین مدل صوتی ما تا امروز است. برای پرسشهایی که به جستوجوی وب، استدلال عمیقتر یا کارهای پیچیدهتر نیاز دارند، در پشت صحنه کار را به جدیدترین مدل پیشرو ما واگذار میکند و وقتی نتیجه آماده شد، آن را به مکالمه برمیگرداند. در حین انجام کار، GPT‑Live میتواند همچنان با شما صحبت کند و جریان مکالمه را حفظ کند. در زمان عرضه، GPT‑Live در پسزمینه از GPT‑5.5 استفاده خواهد کرد. با انتشار مدلهای پیشرو جدید، مدلی را که GPT‑Live استفاده میکند بهطور پیوسته بهروزرسانی خواهیم کرد.
این پیشرفتها تجربه تازهای از ChatGPT سخنگو را ممکن میکنند که هوشمندتر و طبیعیتر است. با گذشت زمان، باور داریم این پژوهش همچنین امکان استفاده از صدا را برای کارهایی هرچه پیچیدهتر، طولانیتر و عاملمحورتر فراهم خواهد کرد.
از امروز، عرضه تدریجی دو نسخه از GPT‑Live — GPT‑Live‑1 و GPT‑Live‑1 mini — را برای کاربران ChatGPT در سراسر جهان آغاز میکنیم. همچنین قصد داریم بهزودی آنها را به API بیاوریم، و توسعهدهندگان و سازمانها میتوانند با استفاده از این فرم برای دریافت اطلاعرسانی ثبتنام کنند.
ورود به عصر تازهای از تعامل انسان و هوش مصنوعی
چشمانداز ما این است که تعامل واقعاً طبیعی میان انسان و هوش مصنوعی را ممکن کنیم: جهانی که در آن همکاری با هوش مصنوعی به روانی و پاسخگویی کار با یک انسان دیگر باشد، در حالی که استدلال و اجرای وظایف پیچیده بیوقفه در پسزمینه انجام میشود.
رویکردهای پیشین
نسلهای قدیمیتر سیستمهای صوتی هوش مصنوعی ما را به آن چشمانداز نزدیکتر کردند، اما با مصالحههای مهمی همراه بودند.
سیستمهای صوتی آبشاری
سیستمهای صوتی آبشاری برای پردازش هر نوبت، به مجموعهای از مدلها متکیاند که یکی پس از دیگری عمل میکنند. ChatGPT سخنگوی اولیه سه مدل را به هم زنجیر کرده بود: یک مدل گفتار به متن برای رونویسی گفتار شما، یک مدل زبانی بزرگ برای تولید پاسخ، و یک مدل متن به گفتار برای تبدیل دوباره آن به گفتار. این رویکرد برای نخستین بار امکان صحبت با مدلهای هوش مصنوعی پیشرو را فراهم کرد، اما پیچیدگی آن هزینه داشت: ممکن بود اطلاعات میان مدلها از دست برود، و پاسخها کند و خشک بودند.
سیستم صوتی چندمرحلهای
پاسخهای کند و غیرروان، مکثهای طولانی
مدلهای صوتی نوبتی
مدلهای صوتی نوبتی مانند دستیار صوتی پیشرفته ChatGPT صدا را درون یک مدل واحد پردازش و تولید میکردند؛ این کار تأخیر را کاهش میداد و مکالمهها را روانتر میکرد — اما همچنان بر پایه نوبتهای جداگانه کار میکردند. مدل باید منتظر میماند تا کاربر صحبتش را تمام کند و بعد پاسخ بدهد؛ در نتیجه رفتوبرگشتها خشک میشد. افزون بر این، چون تشخیص نوبت بر پایه سکوت است، حتی یک مکث کوتاه یا صدای پسزمینه میتوانست بهاشتباه پایان نوبت تلقی شود — و باعث شود مدل در زمانهایی غیرطبیعی حرف کاربر را قطع کند.
مدل صوتی مبتنی بر نوبت
پاسخها کمی سریعتر و روانترند، اما تعامل رفتوبرگشتی با مدل همچنان محدود به نظر میرسد
رویکرد تازه ما
GPT‑Live این محدودیتها را با دو تغییر معماری برطرف میکند.
تعامل پیوسته
نخست، GPT‑Live را برای تعامل پیوسته و با معماری تمامدوسویه ساختیم. GPT‑Live بهجای پردازش دنبالهای از پیامهای جداگانه، هنگام تولید خروجی، ورودی را نیز بهطور پیوسته پردازش میکند. بنابراین مدل میتواند در هر ثانیه بارها درباره تعامل تصمیم بگیرد: صحبت کند، به گوش دادن ادامه دهد، مکث کند، حرف را قطع کند یا ابزاری را فراخوانی کند.
این امکان به مدل اجازه میدهد رفتوبرگشت طبیعیتری داشته باشد، حس بهتری از زمان را حفظ کند و حتی ترجمه زنده انجام دهد.
تعامل پیوسته
پاسخهای سریع، طبیعی و گویا، همراه با گوشدادن فعالتر
واگذاری برای کارهای عمیقتر
دوم، GPT‑Live را — که تعامل پیوسته را مدیریت میکند — از کارهای عمیقتر جدا کردیم. وقتی پرسشی به جستوجو، استدلال یا قابلیتهای عاملمحورتر نیاز داشته باشد، GPT‑Live میتواند کار را به مدل دیگری مانند GPT‑5.5 واگذار کند. این باعث میشود حتی وقتی چند کار را در پسزمینه انجام میدهد، مکالمه را ادامه دهد.
این تغییر معماری همچنین به GPT‑Live امکان میدهد بهطور پیوسته از جدیدترین مدلها و عاملها استفاده کند و هوشمندی پیشرو را با تعامل طبیعی ترکیب کند.
واگذاری وظایف پیچیدهتر به مدلهای پیشرفتهتر
GPT-Live پاسخهای سریع و طبیعی ارائه میدهد، در حالی که GPT-5.5 جستوجو را در پسزمینه انجام میدهد
ارزیابیها
ما ارزیابیهای انسانی تازهای ساختیم تا خوشایندی و جریان مکالمه را بسنجیم. در این مقایسههای رودررو، GPT‑Live‑1 و GPT‑Live‑1 mini در مکالمههای همسان ۵ تا ۱۰ دقیقهای، که ترجیح کلی، نوبتگیری، قطع کردن، جریان مکالمه و میزان طبیعی بودن هر تعامل را میسنجند، با اختلافی چشمگیر به دستیار صوتی پیشرفته ترجیح داده میشوند.
- GPQA: GPT‑Live‑1 در GPQA عملکردی بهمراتب بهتر از دستیار صوتی پیشرفته دارد؛ GPQA استدلال علمی در سطح کارشناسی را در زیستشناسی، شیمی و فیزیک میسنجد.
- BrowseComp: GPT‑Live‑1 در BrowseComp نسبت به دستیار صوتی پیشرفته پیشرفتهای چشمگیری نشان میدهد؛ BrowseComp جستوجوی وب عاملمحور و توانایی یافتن اطلاعات دشواریاب را میسنجد.
- τ³-Voice Telecom (نسخهٔ داخلی): در این معیار، مدل GPT‑Live‑1 عملکرد بهتری از حالت صوتی پیشرفته دارد. این معیار، عاملهای صوتی را در انجام وظایف واقعگرایانه و چندنوبتیِ پشتیبانی مخابراتی ارزیابی میکند.
* GPT‑Live‑1 (فوری) و GPT‑Live‑1 mini در پسزمینه از مدل GPT‑5.5 فوری استفاده میکنند، در حالی که GPT‑Live‑1 متوسط و GPT‑Live‑1 بالا از مدل GPT‑5.5 Thinking با تلاش استدلال متوسط و بالا استفاده میکنند.
برای این ارزیابی، از یک مدل کاربر سفارشیسازیشده استفاده کردیم که از جدیدترین مدلهای استدلالی ما بهره میبرد.
تجربهای تازه از ChatGPT سخنگو
هر هفته، بیش از ۱۵۰ میلیون نفر با استفاده از قابلیتهایی مانند Voice و Dictation با ChatGPT تعامل دارند. آنها از این قابلیتها برای دریافت کمکهای روزمره بدون نیاز به استفاده از دست، تمرین زبان، تعریف داستانهای پیش از خواب یا حتی گفتوگو در مسیر رفتوآمد استفاده میکنند.
از امروز، با لمس دکمه Voice برای گفتوگو با ChatGPT، تجربهای بهبودیافته مبتنی بر GPT‑Live خواهید داشت؛ با مکالمههایی طبیعیتر، پاسخهایی هوشمندتر، درک بهتر گفتار و پاسخهایی همراه با عناصر بصری.
گفتوگوهای طبیعیتر
حالا گفتوگو با ChatGPT بیش از پیش شبیه یک مکالمه واقعی خواهد بود. میتوانید با پرسیدن سؤال، مکالمه را قطع کنید، برای فکر کردن مکث کنید یا از ChatGPT بخواهید آهستهتر صحبت کند. ChatGPT با واکنشهای طبیعی مانند «هوم» یا «متوجه شدم» نشان میدهد که صحبتهای شما را دنبال میکند. همچنین، نه صدای متمایز ChatGPT را برای GPT‑Live بازطراحی و بهینهسازی کردهایم.
پاسخهای هوشمندانهتر
ChatGPT Voice اکنون میتواند از جدیدترین مدلهای پیشرفته ما بهره بگیرد و در مواقع نیاز، پاسخهایی هوشمندتر ارائه دهد. همچنین میتوانید سطح استدلال متناسب با نیاز خود را انتخاب کنید: Instant برای پاسخهای سریع، یا Medium و High زمانی که میخواهید ChatGPT زمان بیشتری را صرف تفکر کند.
درک بهتر گفتار
اگر برای فکر کردن لحظهای مکث کنید، ChatGPT Voice اکنون بهجای وارد شدن به مکالمه و قطع کردن صحبت شما، منتظر میماند. اگر از آن بخواهید سکوت کند و فقط گوش دهد، همین کار را انجام میدهد. همچنین، در محیطهایی با صداهای پسزمینه مانند عبور خودروها یا گفتوگوهای اطراف، ChatGPT بهتر میتواند روی صدای شما تمرکز کند و از صداهای مزاحم تأثیر نپذیرد.
نمایش سریع پاسخها بهصورت بصری
برخی پاسخها وقتی بهصورت بصری ارائه شوند، کاربردیتر هستند. هنگام گفتوگو، ChatGPT اکنون میتواند برای موضوعاتی مانند آبوهوا، سهام، ورزش و موارد دیگر، کارتهای تصویریِ حاوی اطلاعات نمایش دهد. Voice همچنان از قابلیتهایی مانند جستوجو، حافظه، تصاویر و بارگذاری فایلها نیز پشتیبانی میکند.



حاصل این تغییرات، تجربهای از ChatGPT Voice است که طبیعیتر، توانمندتر و کاربردیتر در زندگی روزمره به نظر میرسد.
سازوکارهای ایمنی طراحیشده ویژه مکالمات صوتی
GPT‑Live بهگونهای طراحی شده است که از ابتدا بهصورت پیشفرض ایمن باشد. این سامانه از پیشرفتهای ایمنی جدیدترین مدلهای ما بهره میگیرد و در کنار آن، آموزشهای ایمنی اختصاصی برای حوزههای کلیدی ریسک و سازوکارهای حفاظتی جدیدی را ارائه میکند که بهطور ویژه برای تعاملات صوتی طراحی شدهاند.
آزمونهای ایمنی گستردهتر
برای اینکه نحوه استفاده واقعی افراد از قابلیت صوتی را بهتر منعکس کنیم، ابتدا دامنه آزمونهای ایمنی خود را گسترش دادیم تا ارزیابیهای جدید و اختصاصی برای صوت را نیز دربرگیرد. همچنین ارزیابیهای مصنوعی مبتنی بر صدای تولیدشده طراحی کردیم تا با بهرهگیری از آموختههای خود از دستیار صوتی پیشرفته، حوزههای کلیدی ایمنی را با تمرکز و دقت بیشتری بررسی کنیم. این حوزهها شامل خودآزاری، روانپریشی و شیدایی، وابستگی عاطفی به هوش مصنوعی، خشونت و محتوای جنسی میشوند. کارشناسان داخلی نیز مدل را با سناریوهای چالشبرانگیز آزمایش کردند تا خطرهای ویژه تعاملات صوتی را شناسایی کنند.
در آزمونهای ما، GPT‑Live تقریباً در همه حوزههایی که ارزیابی کردیم، عملکردی همسطح یا بهتر ازدستیار صوتی پیشرفته داشت. برای اطلاعات بیشتر درباره آزمونها و سازوکارهای ایمنی ما، میتوانید به کارت سیستم(در یک پنجره جدید باز میشود) GPT‑Live مراجعه کنید.
سازوکارهای حفاظتی تعبیهشده
از آنجا که مکالمات صوتی بهصورت بلادرنگ انجام میشوند، سازوکارهای ایمنی جدیدی طراحی کردهایم که میتوانند حین پاسخگویی مدل فعال شوند. اگر سیستم محتوایی بالقوه ناایمن را تشخیص دهد، میتواند مدل را به سمت پاسخ ایمنتر هدایت کند، پیامها یا منابع حمایتی مرتبط را نمایش دهد یا در شرایط پرخطرتر، مکالمه صوتی را پایان دهد. برای گفتوگوهای مرتبط با خودآزاری نیز، قابلیتهای حمایتی ChatGPT را برای Voice بهینه کردهایم؛ از جمله ارائه راهنمایی برای دسترسی به خطوط کمک بحران که توسط متخصصان بررسی و تأیید شدهاند.
برای حمایت از کاربران نوجوان، سازوکارهای حفاظتی بیشتری طراحی کردیم و رفتارهای متناسب با سن را مستقیماً در مدل آموزش دادیم تا خطر ارائه پاسخهای نامناسب کاهش یابد. والدین میتوانند از طریق کنترلهای والدین تعیین کنند که آیا نوجوانشان به ChatGPT Voice دسترسی داشته باشد یا خیر. همچنین، والدین مرتبط ممکن است در شرایط پرخطرتر، مانند مشاهده نشانههایی از خودآزاری احتمالی یا قصد خودکشی، اعلان دریافت کنند.
یادگیری مبتنی بر استفاده در دنیای واقعی
همچنین در حال اجرای سنجشهای بلندمدت و پایش پس از عرضه با تمرکز بر اتکای عاطفی هستیم تا درک خود را از این موضوع بهبود دهیم و سازوکارهای حفاظتی را بیش از پیش ارتقا بخشیم. با تکیه بر پژوهشهای پیشین خود درباره استفاده عاطفی و بهزیستی عاطفی، این اقدامات به ما کمک میکنند الگوهای نوظهور را شناسایی کنیم و نحوه پاسخگویی سیستم در تعاملات حساس عاطفی را بهبود دهیم.
در نهایت، GPT‑Live برای گفتوگو طراحی شده است، نه برای جعل یا تقلید صدای افراد واقعی. این سامانه از مجموعهای از صداهای از پیش تعیینشده در ChatGPT استفاده میکند و سازوکارهای حفاظتی در آن تعبیه شده است تا از تقلید صدای افراد واقعی جلوگیری شود.
ما متعهد به حفظ و ارتقای ایمنی و بهزیستی هستیم و با یادگیری از نحوه استفاده واقعی، به تقویت مستمر این سازوکارهای حفاظتی ادامه خواهیم داد.
دسترسپذیری و محدودیتها
GPT‑Live اکنون بهتدریج برای کاربران ChatGPT در سراسر جهان روی iOS، Android و ChatGPT.com(در یک پنجره جدید باز میشود) عرضه میشود. GPT‑Live‑1 به مدل پیشفرض مورد استفاده برای ChatGPT Voice در کاربران Go، Plus و Pro تبدیل خواهد شد و GPT‑Live‑1 mini مدل پیشفرض کاربران Free خواهد بود. جزئیات بیشتر درباره دسترسپذیری در مرکز راهنما(در یک پنجره جدید باز میشود) ما در دسترس است.
GPT‑Live را برای برخی از محبوبترین زبانهای مورد استفاده در ChatGPT بهینه کردهایم. با این حال، در برخی زبانها ممکن است مدل همچنان لهجهای غیر بومی داشته باشد یا در روانی گفتار با محدودیتهایی مواجه باشد. ما بهطور مستمر در حال بهبود تجربه چندزبانه GPT‑Live هستیم.
در زمان عرضه، GPT‑Live در ChatGPT هنوز از مکالمه صوتی همراه با ویدیو یا اشتراکگذاری صفحه پشتیبانی نخواهد کرد، اما در حال کار برای ارائه این قابلیتها در آینده نزدیک هستیم. همچنان میتوانید به نسخههای پیشین ChatGPT Voice، از جمله Standard و Advanced Voice Mode، دسترسی داشته باشید؛ نسخههایی که این قابلیتها در آنها در دسترس هستند.


