ข้ามไปยังเนื้อหาหลัก
OpenAI

สร้างประสบการณ์เสียงที่เป็นธรรมชาติยิ่งขึ้นด้วย GPT‑Live‑1 ใน API

GPT‑Live‑1 นำการสนทนาอย่างเป็นธรรมชาติของ ChatGPT ที่พูดและฟังได้พร้อมกันมาให้ใช้ผ่าน API พร้อมให้คุณควบคุมวิธีที่เอเจนต์เสียงพูดและทำงานได้มากขึ้น

กำลังโหลด…

เรากำลังเปิดตัว GPT‑Live‑1 ใน API ซึ่งเป็นโมเดลเสียงที่ทรงประสิทธิภาพและเป็นธรรมชาติ ช่วยให้นักพัฒนาสร้างแอปที่ใช้เสียงและเวิร์กโฟลว์สำหรับธุรกิจได้ GPT‑Live‑1 เปิดตัวครั้งแรกใน ChatGPT โดยสามารถฟังและพูดไปพร้อมกันได้ และยังสามารถมอบหมายงานที่ต้องใช้การให้เหตุผลเชิงลึกและการดำเนินการต่างๆ ให้กับโมเดลและเครื่องมือที่ทำงานร่วมกันได้ เช่นเดียวกับที่เห็นใน Codex และ ChatGPT Work⁠(เปิดในหน้าต่างใหม่)

สำหรับการเปิดตัว GPT‑Live‑1 ใน API เรามุ่งเน้นความสามารถใหม่ที่ช่วยให้นักพัฒนากำหนดทิศทางและปรับแต่งประสบการณ์เสียงให้เหมาะกับผู้ใช้ เวิร์กโฟลว์ และเป้าหมายของตน จุดแข็งสำคัญของ GPT‑Live‑1 คือการรับมือกับการพูดแทรกได้อย่างลื่นไหล ซึ่งเริ่มสร้างผลลัพธ์ทางธุรกิจให้ได้เห็นแล้ว โดยในการประเมินช่วงแรก Speak พบว่า GPT‑Live‑1 ช่วยให้ผู้เรียนมีเวลาคิดมากขึ้นก่อนที่ผู้สอนภาษาจะตอบกลับ ทำให้การพูดแทรกลดลงเกือบ 80% เมื่อเทียบกับระบบก่อนหน้าที่ผลัดกันพูดเป็นรอบ

จุดเด่นหลักของ GPT‑Live‑1 ใน API:

  • การรับมือกับการพูดแทรก: ปรับปรุงการรับมือกับการพูดแทรกด้วยโมเดลเดียวที่ประมวลผลและทำความเข้าใจเสียงขาเข้าและขาออกไปพร้อมกัน จึงลดความล่าช้าและปัญหาที่อาจเกิดขึ้นจากการส่งต่อข้อมูลระหว่างระบบในสถาปัตยกรรมแบบ STT–LLM–TTS ที่ทำงานต่อกันเป็นทอดๆ

  • การมอบหมายงานด้านการให้เหตุผลและการเรียกใช้เครื่องมือ: GPT‑Live‑1 สามารถส่งต่องานด้านการให้เหตุผลและการเรียกใช้เครื่องมือให้โมเดลข้อความในแบ็กเอนด์ เช่น GPT‑6 Astra หรือโมเดลของผู้ให้บริการรายอื่น

  • โทน จังหวะ และสไตล์: ช่วยให้นักพัฒนากำหนดโทน จังหวะ และรูปแบบการสนทนาของเอเจนต์ผ่านพรอมต์ระบบได้

  • การจัดการบริบทและเสียงรบกวนเบื้องหลัง: จัดการเสียงรบกวนและช่วงเงียบได้ดียิ่งขึ้น โดยไม่รบกวนจังหวะการสนทนาหรือพูดอธิบายทุกขั้นตอนที่กำลังดำเนินการ

  • ความเสถียรในการสนทนาที่ยาวนาน: รักษาบริบทได้ดียิ่งขึ้น พร้อมคงคุณภาพการสนทนาได้ตลอดการโต้ตอบที่ต่อเนื่องเป็นเวลานาน

  • การรองรับระบบโทรศัพท์: รองรับการนำเอเจนต์เสียงที่สามารถพูดและฟังพร้อมกันมาใช้งานผ่านโทรศัพท์ ตั้งแต่การจองโต๊ะร้านอาหารไปจนถึงการช่วยเหลือลูกค้า

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

เดโมนี้มีระยะเวลาจำกัด เมื่อคุณใช้สิ่งนี้ คุณตกลงยอมรับเงื่อนไขของ OpenAI และรับทราบนโยบายความเป็นส่วนตัวของเรา

ลดความซับซ้อนของสถาปัตยกรรมเอเจนต์เสียงและลดความหน่วงในการโต้ตอบด้วยเสียง

เอเจนต์เสียงแบบเดิมต้องเชื่อมระบบแปลงเสียงเป็นข้อความ โมเดลสำหรับการให้เหตุผล และระบบแปลงข้อความเป็นเสียงเข้าด้วยกัน ทุกครั้งที่มีการส่งต่อการประมวลผลระหว่างระบบจะเพิ่มความล่าช้า และเพิ่มโอกาสที่จังหวะ บริบท หรือความลื่นไหลตามธรรมชาติของการสนทนาจะขาดหายไป นักพัฒนาจึงมักต้องคอยประสานการทำงานในแต่ละขั้นตอนด้วยตนเอง รวมถึงกำหนดว่าระบบควรรับมืออย่างไรเมื่อผู้ใช้พูดแทรก หยุดพูด หรือเปลี่ยนประเด็น

GPT‑Live‑1 ใช้โมเดลเดียวในการฟังและพูด ทำให้ระบบเสียงเรียบง่ายขึ้น สามารถรับมือกับการพูดแทรกและคำตอบรับสั้นๆ ได้ทันที พร้อมส่งต่องานที่ต้องใช้การให้เหตุผลเชิงลึกไปยังระบบฝั่งแบ็กเอนด์ ทำให้การสนทนาดำเนินต่อไปได้ในขณะที่ระบบทำงานอยู่เบื้องหลัง

“เมื่อเทียบกับระบบเดิมที่ทำงานต่อกันหลายขั้นตอน GPT‑Live‑1 ช่วยลดความซับซ้อนของโค้ดลง 80% และลดโค้ดไปได้ 23,000 บรรทัด ทำให้ผู้ป่วยสามารถสนทนาแบบเรียลไทม์ได้อย่างเป็นธรรมชาติ และทำให้ทีมของเรามีเวลาไปพัฒนาประสบการณ์ตั้งแต่การนัดหมายไปจนถึงการเข้ารับบริการดูแล”
—Tony Stoyanov ผู้ร่วมก่อตั้งและประธานเจ้าหน้าที่ฝ่ายเทคโนโลยี

นักพัฒนาสามารถเลือกโมเดล เครื่องมือ และระบบควบคุมเอเจนต์ที่ทำงานอยู่เบื้องหลังการสนทนาได้เอง เช่น อาจใช้ GPT‑Live‑1 ร่วมกับโมเดลอย่าง Luna สำหรับงานปริมาณมาก เช่น การนัดหมายหรือแจ้งสถานะคำสั่งซื้อ และใช้โมเดลอย่าง Astra สำหรับปัญหาลูกค้าที่ซับซ้อนและต้องใช้การให้เหตุผล ความยืดหยุ่นนี้ช่วยให้นักพัฒนาเลือกระดับการให้เหตุผล ความเร็ว และต้นทุนให้เหมาะกับงานแต่ละประเภทได้

GPT‑Live‑1 รองรับการถอดเสียงด้วย ASR และการแสดงข้อความตอบกลับได้โดยตรง อีกทั้งยังเข้าใจตัวอักษรและตัวเลขได้ดี พร้อมรองรับการให้น้ำหนักกับคีย์เวิร์ดที่กำหนด แม้ GPT‑Live‑1 จะไม่ใช่โมเดลที่ทำงานแบบผลัดกันพูด แต่ก็รองรับการตรวจจับจังหวะผลัดกันพูดในตัว นักพัฒนาจึงยังสามารถพัฒนาระบบโดยกำหนดจุดเริ่มต้นและสิ้นสุดของแต่ละช่วงการพูดได้อย่างชัดเจน

การประเมินข้อได้เปรียบของการพูดและฟังพร้อมกัน

จากการประเมินของเรา GPT‑Live‑1 ทำคะแนน Full Duplex Bench ได้สูงกว่า GPT‑Realtime‑2.1 อยู่ 30 จุดเปอร์เซ็นต์ พร้อมกับความหน่วงในการผลัดกันพูดและพฤติกรรมการโต้ตอบที่ดีขึ้นอย่างมาก เมื่อทำงานร่วมกับ GPT‑6 Astra ที่ใช้ระดับการให้เหตุผลปานกลาง GPT‑Live‑1 ยังครองอันดับ 1 บน Tau3 ซึ่งใช้วัดความสามารถของเอเจนต์เสียงระดับแนวหน้าในการทำงานแบบครบวงจร

ประเมินการทำงานด้านบริการลูกค้าผ่านการสนทนาด้วยเสียงในธุรกิจสายการบิน ค้าปลีก และโทรคมนาคม Pass@1 ใช้วัดความสำเร็จในการทำงาน โดยผลลัพธ์หลักให้น้ำหนักแต่ละกลุ่มธุรกิจเท่ากัน


* แบ็กเอนด์ GPT Live: Astra (ปานกลาง)

ประเมินการให้ความช่วยเหลือด้านธนาคารด้วยเสียง ซึ่งต้องอาศัยการค้นคืนข้อมูลและการใช้เครื่องมือเกี่ยวกับบัญชี Pass@1 คือสัดส่วนของงาน banking_knowledge จำนวน 97 งานที่ดำเนินการสำเร็จ


* แบ็กเอนด์ GPT Live: Astra (ปานกลาง)

ประเมินการจัดการช่วงหยุดพูด การผลัดกันพูดในการสนทนา การขัดจังหวะ และการตอบรับระหว่างฟัง

ทดสอบว่าโมเดลตอบสนองอย่างไรต่อเสียงพูดจากคนรอบข้าง การพูดกับบุคคลอื่น การตอบรับระหว่างฟัง และการขัดจังหวะระหว่างการสนทนา

วัดความเร็วที่เอเจนต์เริ่มตอบหลังจากผู้ใช้จบเทิร์น

ใช้ทดสอบการเรียกใช้เครื่องมือจากคำขอด้วยเสียงที่มีการเว้นจังหวะ ความลังเล และการแก้คำพูดของตนเองอย่างเป็นธรรมชาติ Pass@1 ใช้ประเมินลำดับการเรียกใช้เครื่องมือ


* แบ็กเอนด์ GPT Live: Terra (ต่ำ)

ประเมินคำตอบที่พูดสำหรับคำขอที่ใช้เครื่องมือซึ่งมีการเว้นช่วง ลังเล และแก้ไขคำพูดของตนเอง ให้คะแนนว่าคำตอบสอดคล้องกับเจตนาที่อ้างอิงมากเพียงใด


* แบ็กเอนด์ GPT Live: Terra (ต่ำ)

เสียงจากลูกค้า

1 จาก 4
“การนำ GPT‑Live‑1 มาใช้กับ Yelp Host และ Hatch ช่วยให้การผลัดกันพูดเป็นธรรมชาติและแม่นยำยิ่งขึ้นเมื่อเทียบกับระบบเสียงแบบเดิมของเรา เมื่อ Yelp Host ใช้ GPT‑Live‑1 รับสาย เช่น การจองโต๊ะและสั่งอาหาร เราพบว่าอัตราการจัดการสายดีขึ้นอย่างเห็นได้ชัด นอกจากนี้ ผู้โทรยังพูดเป็นประโยคที่สมบูรณ์และเป็นธรรมชาติมากขึ้น ซึ่งสะท้อนให้เห็นว่าประสบการณ์การสนทนาทางโทรศัพท์เปลี่ยนไปอย่างชัดเจน”
—Alex Levy ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยี

ตัวเลือกเสียงใหม่

นักพัฒนาต้องการเสียงที่เข้ากับผลิตภัณฑ์และฟังเป็นธรรมชาติสำหรับผู้ใช้งาน GPT‑Live‑1 จึงเพิ่มตัวเลือกเสียงแบบเรียลไทม์ให้หลากหลายกว่าเดิม ครอบคลุมทั้งสำเนียง ภาษาถิ่น และภาษาต่างๆ เพื่อให้นักพัฒนามีอิสระมากขึ้นในการเลือกเสียงที่เหมาะกับผู้ช่วยของตน

ลองฟังเสียงใหม่

ในช่วงหลายเดือนต่อจากนี้ เราจะเพิ่มตัวเลือกเสียงและขยายการรองรับภาษาอย่างต่อเนื่อง

ราคาและความพร้อมใช้งาน

GPT‑Live‑1 พร้อมให้ใช้งานผ่าน API แล้ววันนี้⁠(เปิดในหน้าต่างใหม่) โดยเลเยอร์เสียงส่วนฟรอนต์เอนด์มีราคา 0.05 ดอลลาร์ต่อนาที เลือกโมเดลแบ็กเอนด์และระบบสำหรับเอเจนต์ให้เหมาะกับผลิตภัณฑ์ของคุณ แล้วนำมาใช้ร่วมกันเพื่อสร้างประสบการณ์เสียงที่พร้อมรองรับการขยายตัวตามภาระงานที่ต้องจัดการ

เชื่อมต่อ GPT-Live-1 กับ Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

การเชื่อมต่อ GPT-Live-1 กับ Codex ตัวอย่างนี้แสดงให้เห็นว่าแอปพลิเคชันส่งบริบทของการสนทนาไปยัง Codex และส่งคำตอบจาก Codex กลับไปยัง GPT-Live-1 อย่างไร ไม่รวมขั้นตอนการตั้งค่าการเชื่อมต่อและการจัดการการมอบหมายงาน

หากต้องการใช้เสียงที่ปรับแต่งเอง โปรดติดต่อฝ่ายขายเพื่อดูข้อมูลเพิ่มเติมเกี่ยวกับคุณสมบัติในการขอใช้งานและขั้นตอนการยื่นคำขอ

อีกทางเลือกสำหรับการสร้างเวิร์กโฟลว์เสียงบน GPT‑Live‑1 คือ OpenAI Presence ซึ่งใช้โมเดลนี้เป็นพื้นฐานในการโต้ตอบด้วยเสียงแบบเรียลไทม์ Presence ช่วยให้องค์กรนำเอเจนต์ AI ที่ไว้วางใจได้มาใช้งาน เพื่อช่วยตอบคำถาม แก้ปัญหา ใช้ระบบของบริษัท ดำเนินการที่ได้รับอนุมัติ และส่งต่อให้เจ้าหน้าที่เมื่อจำเป็น หากต้องการทราบข้อมูลเพิ่มเติม โปรดติดต่อผู้จัดการดูแลบัญชี OpenAI ของคุณ

ผู้เขียน

OpenAI