پرش به محتوای اصلی
OpenAI

۱۹ شهریور ۱۴۰۵

محصولعرضه

با GPT‑Live‑۱ در API تجربه‌های صوتی طبیعی تری بسازید

GPT‑Live‑۱ مکالمات طبیعی و تمام دو طرفهٔ ChatGPT را با کنترل بیشتر بر نحوهٔ صحبت کردن و عمل کردن عامل‌های صوتی به API می‌آورد.

در حال بارگذاری…

GPT‑Live‑1 را در API عرضه می‌کنیم تا توسعه دهندگان بتوانند با یک مدل صوتی قدرتمند و طبیعی، اپلیکیشن‌های مجهز به صدا و گردش کارهای کسب و کار بسازند. نخست در ChatGPT معرفی شد، GPT‑Live‑1 می‌تواند همزمان گوش دهد و صحبت کند و همانطور که در Codex و ChatGPT کار دیده‌ایم⁠(در یک پنجره جدید باز می‌شود)، استدلال عمیق‌تر و اقدامات را به مدل‌ها و ابزارهای همراه خود واگذار کند.

برای عرضهٔ GPT‑Live‑۱ در API، بر قابلیت‌های تازه‌ای تمرکز کرده‌ایم که به توسعه دهندگان امکان می‌دهد تجربه‌‌های صوتی را متناسب با کاربران، گردش کارها و اهدافشان هدایت و سفارشی سازی کنند. یکی از نقاط قوت اصلی GPT‑Live‑۱، مدیریت روان وقفه‌ها، هم‌اکنون نیز تأثیر تجاری ایجاد کرده است: در ارزیابی‌های اولیه، Speak دریافت که GPT‑Live‑۱ پیش از پاسخ مدرس زبان، زمان بیشتری برای فکر کردن به زبان آموزان داد و در مقایسه با سامانه‌های نوبتی قبلی، وقفه‌ها را نزدیک به ۸۰٪ کاهش داد.

نقاط قوت کلیدی GPT‑Live‑۱ در API:

  • مدیریت وقفه‌ها: با استفاده از یک مدل واحد که صدای ورودی و خروجی را همزمان تحلیل می‌کند، مدیریت وقفه‌ها را بهبود می‌بخشد و از تأخیر و تحویل‌های شکنندهٔ معماری‌های زنجیره‌ای STT–الگوهای زبانی بزرگ (LLM)–TTS جلوگیری می‌کند.

  • واگذاری استدلال و فراخوانی ابزار: GPT‑Live‑1 می‌تواند استدلال و فراخوانی ابزار را به یک مدل متنی پشتیبان مانند GPT‑۶ Astra یا یک مدل شخص ثالث واگذار کند.

  • لحن، سرعت و سبک: به توسعه دهندگان امکان می‌دهد لحن، سرعت و سبک گفتگوی عامل را از طریق اعلان سیستمی شکل دهند.

  • مدیریت بی‌صدای زمینه و نویز پس‌زمینه: نویز پس‌زمینه و سکوت را بهتر مدیریت می‌کند، بی‌آنکه مکالمه را قطع کند یا هر مرحله را با صدای بلند توضیح دهد.

  • پایداری در نشست‌های طولانی: حفظ زمینه و کیفیت مکالمه را در تعاملات طولانی بهبود می‌دهد.

  • پشتیبانی تلفنی: استقرار عامل‌های صوتی تمام‌دوطرفه را برای تماس‌های تلفنی، از رزرو رستوران تا پشتیبانی مشتری، ممکن می‌کند.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

این نسخه آزمایشی محدودیت زمانی دارد. با استفاده از آن، با شرایط OpenAI موافقت می‌کنید و سیاست حفظ حریم خصوصی ما را تأیید می‌کنید.

معماری عامل صوتی خود را ساده کنید و تأخیر صوتی را کاهش دهید

عامل‌های صوتی سنتی، تبدیل گفتار به متن، یک مدل استدلال و تبدیل متن به گفتار را به هم متصل می‌کنند. هر انتقال، تأخیر را افزایش می‌دهد و احتمال از دست رفتن زمان‌بندی، زمینه یا ریتم طبیعی مکالمه را بیشتر می‌کند. هماهنگ‌کردن این مراحل، از جمله مدیریت قطع صحبت، مکث یا تغییر مسیر افراد، اغلب بر عهدهٔ توسعه‌دهندگان است.

GPT‑Live‑۱ گوش دادن و صحبت کردن را در یک مدل واحد انجام می‌دهد و لایهٔ صوتی را ساده‌تر می‌کند. این مدل می‌تواند همان لحظه به وقفه‌ها و تأییدها واکنش نشان دهد و در عین حال استدلال عمیق‌تر را به بخش پشتیبان واگذار کند. به این ترتیب، همزمان با انجام کارها در پس زمینه، مکالمه ادامه پیدا می‌کند.

“GPT‑Live‑1 در مقایسه با سامانهٔ آبشاری ما، پایگاه کد را ۸۰٪ ساده‌تر کرد و ۲۳ هزار خط کد را حذف کرد. این قابلیت، گفت‌وگوهای طبیعی و بلادرنگ با بیماران را ممکن کرد و به تیم ما فرصت داد تجربهٔ کاربر را از رزرو نوبت تا پیمودن مسیر درمان بهبود دهد.”
—تونی استویانوف، هم بنیان گذار و مدیر ارشد فناوری

توسعه‌دهندگان مدل‌ها، ابزارها و چارچوب عامل پشت مکالمه را انتخاب می‌کنند. برای نمونه، می‌توانند GPT‑Live‑1 را برای کارهای پرتعدادی مانند زمان‌بندی یا به‌روزرسانی سفارش‌ها با مدلی مثل Luna همراه کنند و برای مسائل پیچیدهٔ مشتری که به استدلال نیاز دارند، از مدلی مانند Astra استفاده کنند. این انعطاف‌پذیری به توسعه‌دهندگان امکان می‌دهد عمق استدلال، سرعت و هزینه را با هر کار متناسب کنند.

GPT‑Live‑۱ به صورت بومی متن پیاده شدهٔ ASR و متن پاسخ را ارائه می‌کند. همچنین در درک نویسه‌های الفبایی عددی توانمند است و از سوء گیری کلید واژه‌ای پشتیبانی می‌کند. اگرچه GPT‑Live‑۱ یک مدل نوبتی نیست، تشخیص نوبت را به صورت بومی پشتیبانی می‌کند؛ بنابراین توسعه دهندگان همچنان می‌توانند بر پایهٔ مرزهای صریح نوبت برنامه بسازند.

سنجش مزیت تمام‌دوطرفه

در ارزیابی‌های ما، GPT‑Live‑1 عملکرد Full Duplex Bench را نسبت به GPT‑Realtime‑۲.۱ ۳۰ واحد درصد بهبود می‌دهد، و در تأخیر نوبت گیری و رفتار تعاملی بهبودهای چشمگیری دارد. این مدل همراه با GPT‑۶ Astra و با تلاش استدلال متوسط، در Tau۳ نیز رتبهٔ نخست را دارد؛ معیاری که هوشمندی پیشرو عامل صوتی را در وظایف سرتاسری می‌سنجد.

وظایف گفتاریِ خدمات مشتری را در حوزه‌های خطوط هوایی، خرده فروشی و مخابرات ارزیابی می‌کند. Pass@۱ موفقیت در انجام وظیفه را اندازه گیری می‌کند؛ عنوان اصلی به هر حوزه وزن یکسانی می‌دهد.


* بک اند GPT Live: Astra (متوسط).

پشتیبانی بانکی گفتاری را با بازیابی اطلاعات و ابزارهای حساب ارزیابی می‌کند. Pass@۱ نسبت وظایف banking_knowledge تکمیل شده با موفقیت به ۹۷ وظیفه است.


* بک اند GPT Live: Astra (متوسط).

مدیریت مکث‌ها، نوبت گیری در مکالمه، وقفه‌ها و بازخوردهای کوتاه را ارزیابی می‌کند.

واکنش‌ها به گفتار پس زمینه، گفتار خطاب به فردی دیگر، بازخوردهای کوتاه شنونده و وقفه‌ها را آزمایش می‌کند.

مدت زمانی را اندازه می‌گیرد که عامل پس از پایان نوبت کاربر، پاسخ خود را آغاز می‌کند.

استفاده از ابزار را در درخواست‌های گفتاریِ دارای مکث‌های طبیعی، تردیدها و خود اصلاحی‌ها می‌آزماید. Pass@۱ به توالی فراخوانی ابزار امتیاز می‌دهد.


* بک اند GPT Live: Terra (پایین).

پاسخ گفتاری به درخواست‌های مستلزم استفاده از ابزار را که در آن مکث‌ها، تردیدها و خود اصلاحی‌ها وجود دارد، ارزیابی می‌کند. میزان تطابق پاسخ با مقصود مرجع را امتیاز دهی می‌کند.


* بک اند GPT Live: Terra (پایین).

مشتریان چه می‌گویند

1 از 4
“افزودن GPT‑Live‑۱ به Yelp Host و Hatch، نوبت گیری در مکالمه و دقت را در مقایسه با معماری صوتی سنتی ما بهبود داد. وقتی Yelp Host از GPT‑Live‑۱ برای پاسخگویی به تماس‌هایی مانند رزرو و سفارش غذا استفاده می‌کند، شاهد بهبود چشمگیری در نرخ رسیدگی به تماس‌ها هستیم. تماس گیرندگان همچنین با جمله‌هایی کامل‌تر و طبیعی‌تر صحبت می‌کنند؛ نشانه‌ای از اینکه تجربهٔ آن سوی خط واقعاً متفاوت است.”
—الکس لوی، مدیر ارشد فناوری

گزینه‌های صوتی جدید

توسعه‌دهندگان به صداهایی نیاز دارند که با محصولشان متناسب باشد و برای کاربران آن طبیعی به نظر برسد. با GPT‑Live‑1، مجموعهٔ کوچک صداهای بلادرنگ را به طیف گسترده‌تری از لهجه‌ها، گویش‌ها و زبان‌ها گسترش می‌دهیم تا توسعه‌دهندگان حق انتخاب بیشتری برای صدای دستیارهایشان داشته باشند.

به صداهای جدید گوش کنید

در ماه‌های آینده همچنان گزینه‌های صوتی و زبان‌های موجود را گسترش خواهیم داد.

قیمت‌گذاری و دسترس‌پذیری

GPT‑Live‑۱ از امروز در API⁠(در یک پنجره جدید باز می‌شود) با نرخ ۰.۰۵ دلار به ازای هر دقیقه برای لایهٔ صوتی سمت کاربر در دسترس است. آن را با مدل پشتیبان و چارچوب آزمون عامل متناسب با محصول‌تان همراه کرده و تجربه‌ای صوتی بسازید که هم پای حجم کار موردنیاز گسترش یابد.

اتصال GPT-Live-۱ به Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

اتصال GPT-Live-۱ به Codex. این بخش نشان می‌دهد که یک برنامه چگونه زمینه مکالمه را به Codex منتقل می‌کند و پاسخ آن را به GPT-Live-۱ بازمی‌گرداند. راه اندازی اتصال و مدیریت واگذاری حذف شده‌اند.

برای دسترسی به صداهای سفارشی و آگاهی بیشتر از شرایط احراز صلاحیت و فرآیند درخواست، با واحد فروش تماس بگیرید.

راه دیگری برای ساخت گردش‌کارهای صوتی بر پایه GPT‑Live‑۱، استفاده از OpenAI Presence است که از مدل برای ارائه تعاملات صوتی بلا درنگ استفاده می‌کند. Presence به سازمان‌ها کمک می‌کند عوامل هوش مصنوعی قابل اعتماد را مستقر کنند؛ عواملی که می‌توانند به پرسش‌ها پاسخ دهند، مشکلات را حل کرده، از سیستم‌های شرکت استفاده کنند، اقدامات تأیید شده انجام داده و در صورت نیاز موضوع را به افراد ارجاع دهند. برای اطلاعات بیشتر با مدیر حساب OpenAI خود تماس بگیرید.

نویسنده

OpenAI