เรากำลังเปิดตัว GPT‑Live‑1 ใน API ซึ่งเป็นโมเดลเสียงที่ทรงประสิทธิภาพและเป็นธรรมชาติ ช่วยให้นักพัฒนาสร้างแอปที่ใช้เสียงและเวิร์กโฟลว์สำหรับธุรกิจได้ GPT‑Live‑1 เปิดตัวครั้งแรกใน ChatGPT โดยสามารถฟังและพูดไปพร้อมกันได้ และยังสามารถมอบหมายงานที่ต้องใช้การให้เหตุผลเชิงลึกและการดำเนินการต่างๆ ให้กับโมเดลและเครื่องมือที่ทำงานร่วมกันได้ เช่นเดียวกับที่เห็นใน Codex และ ChatGPT Work(เปิดในหน้าต่างใหม่)
สำหรับการเปิดตัว GPT‑Live‑1 ใน API เรามุ่งเน้นความสามารถใหม่ที่ช่วยให้นักพัฒนากำหนดทิศทางและปรับแต่งประสบการณ์เสียงให้เหมาะกับผู้ใช้ เวิร์กโฟลว์ และเป้าหมายของตน จุดแข็งสำคัญของ GPT‑Live‑1 คือการรับมือกับการพูดแทรกได้อย่างลื่นไหล ซึ่งเริ่มสร้างผลลัพธ์ทางธุรกิจให้ได้เห็นแล้ว โดยในการประเมินช่วงแรก Speak พบว่า GPT‑Live‑1 ช่วยให้ผู้เรียนมีเวลาคิดมากขึ้นก่อนที่ผู้สอนภาษาจะตอบกลับ ทำให้การพูดแทรกลดลงเกือบ 80% เมื่อเทียบกับระบบก่อนหน้าที่ผลัดกันพูดเป็นรอบ
จุดเด่นหลักของ GPT‑Live‑1 ใน API:
การรับมือกับการพูดแทรก: ปรับปรุงการรับมือกับการพูดแทรกด้วยโมเดลเดียวที่ประมวลผลและทำความเข้าใจเสียงขาเข้าและขาออกไปพร้อมกัน จึงลดความล่าช้าและปัญหาที่อาจเกิดขึ้นจากการส่งต่อข้อมูลระหว่างระบบในสถาปัตยกรรมแบบ STT–LLM–TTS ที่ทำงานต่อกันเป็นทอดๆ
การมอบหมายงานด้านการให้เหตุผลและการเรียกใช้เครื่องมือ: GPT‑Live‑1 สามารถส่งต่องานด้านการให้เหตุผลและการเรียกใช้เครื่องมือให้โมเดลข้อความในแบ็กเอนด์ เช่น GPT‑6 Astra หรือโมเดลของผู้ให้บริการรายอื่น
โทน จังหวะ และสไตล์: ช่วยให้นักพัฒนากำหนดโทน จังหวะ และรูปแบบการสนทนาของเอเจนต์ผ่านพรอมต์ระบบได้
การจัดการบริบทและเสียงรบกวนเบื้องหลัง: จัดการเสียงรบกวนและช่วงเงียบได้ดียิ่งขึ้น โดยไม่รบกวนจังหวะการสนทนาหรือพูดอธิบายทุกขั้นตอนที่กำลังดำเนินการ
ความเสถียรในการสนทนาที่ยาวนาน: รักษาบริบทได้ดียิ่งขึ้น พร้อมคงคุณภาพการสนทนาได้ตลอดการโต้ตอบที่ต่อเนื่องเป็นเวลานาน
การรองรับระบบโทรศัพท์: รองรับการนำเอเจนต์เสียงที่สามารถพูดและฟังพร้อมกันมาใช้งานผ่านโทรศัพท์ ตั้งแต่การจองโต๊ะร้านอาหารไปจนถึงการช่วยเหลือลูกค้า
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
เดโมนี้มีระยะเวลาจำกัด เมื่อคุณใช้สิ่งนี้ คุณตกลงยอมรับเงื่อนไขของ OpenAI และรับทราบนโยบายความเป็นส่วนตัวของเรา
เอเจนต์เสียงแบบเดิมต้องเชื่อมระบบแปลงเสียงเป็นข้อความ โมเดลสำหรับการให้เหตุผล และระบบแปลงข้อความเป็นเสียงเข้าด้วยกัน ทุกครั้งที่มีการส่งต่อการประมวลผลระหว่างระบบจะเพิ่มความล่าช้า และเพิ่มโอกาสที่จังหวะ บริบท หรือความลื่นไหลตามธรรมชาติของการสนทนาจะขาดหายไป นักพัฒนาจึงมักต้องคอยประสานการทำงานในแต่ละขั้นตอนด้วยตนเอง รวมถึงกำหนดว่าระบบควรรับมืออย่างไรเมื่อผู้ใช้พูดแทรก หยุดพูด หรือเปลี่ยนประเด็น
GPT‑Live‑1 ใช้โมเดลเดียวในการฟังและพูด ทำให้ระบบเสียงเรียบง่ายขึ้น สามารถรับมือกับการพูดแทรกและคำตอบรับสั้นๆ ได้ทันที พร้อมส่งต่องานที่ต้องใช้การให้เหตุผลเชิงลึกไปยังระบบฝั่งแบ็กเอนด์ ทำให้การสนทนาดำเนินต่อไปได้ในขณะที่ระบบทำงานอยู่เบื้องหลัง
นักพัฒนาสามารถเลือกโมเดล เครื่องมือ และระบบควบคุมเอเจนต์ที่ทำงานอยู่เบื้องหลังการสนทนาได้เอง เช่น อาจใช้ GPT‑Live‑1 ร่วมกับโมเดลอย่าง Luna สำหรับงานปริมาณมาก เช่น การนัดหมายหรือแจ้งสถานะคำสั่งซื้อ และใช้โมเดลอย่าง Astra สำหรับปัญหาลูกค้าที่ซับซ้อนและต้องใช้การให้เหตุผล ความยืดหยุ่นนี้ช่วยให้นักพัฒนาเลือกระดับการให้เหตุผล ความเร็ว และต้นทุนให้เหมาะกับงานแต่ละประเภทได้
GPT‑Live‑1 รองรับการถอดเสียงด้วย ASR และการแสดงข้อความตอบกลับได้โดยตรง อีกทั้งยังเข้าใจตัวอักษรและตัวเลขได้ดี พร้อมรองรับการให้น้ำหนักกับคีย์เวิร์ดที่กำหนด แม้ GPT‑Live‑1 จะไม่ใช่โมเดลที่ทำงานแบบผลัดกันพูด แต่ก็รองรับการตรวจจับจังหวะผลัดกันพูดในตัว นักพัฒนาจึงยังสามารถพัฒนาระบบโดยกำหนดจุดเริ่มต้นและสิ้นสุดของแต่ละช่วงการพูดได้อย่างชัดเจน
จากการประเมินของเรา GPT‑Live‑1 ทำคะแนน Full Duplex Bench ได้สูงกว่า GPT‑Realtime‑2.1 อยู่ 30 จุดเปอร์เซ็นต์ พร้อมกับความหน่วงในการผลัดกันพูดและพฤติกรรมการโต้ตอบที่ดีขึ้นอย่างมาก เมื่อทำงานร่วมกับ GPT‑6 Astra ที่ใช้ระดับการให้เหตุผลปานกลาง GPT‑Live‑1 ยังครองอันดับ 1 บน Tau3 ซึ่งใช้วัดความสามารถของเอเจนต์เสียงระดับแนวหน้าในการทำงานแบบครบวงจร
ประเมินการทำงานด้านบริการลูกค้าผ่านการสนทนาด้วยเสียงในธุรกิจสายการบิน ค้าปลีก และโทรคมนาคม Pass@1 ใช้วัดความสำเร็จในการทำงาน โดยผลลัพธ์หลักให้น้ำหนักแต่ละกลุ่มธุรกิจเท่ากัน
* แบ็กเอนด์ GPT Live: Astra (ปานกลาง)
ประเมินการให้ความช่วยเหลือด้านธนาคารด้วยเสียง ซึ่งต้องอาศัยการค้นคืนข้อมูลและการใช้เครื่องมือเกี่ยวกับบัญชี Pass@1 คือสัดส่วนของงาน banking_knowledge จำนวน 97 งานที่ดำเนินการสำเร็จ
* แบ็กเอนด์ GPT Live: Astra (ปานกลาง)
ประเมินการจัดการช่วงหยุดพูด การผลัดกันพูดในการสนทนา การขัดจังหวะ และการตอบรับระหว่างฟัง
ทดสอบว่าโมเดลตอบสนองอย่างไรต่อเสียงพูดจากคนรอบข้าง การพูดกับบุคคลอื่น การตอบรับระหว่างฟัง และการขัดจังหวะระหว่างการสนทนา
วัดความเร็วที่เอเจนต์เริ่มตอบหลังจากผู้ใช้จบเทิร์น
ใช้ทดสอบการเรียกใช้เครื่องมือจากคำขอด้วยเสียงที่มีการเว้นจังหวะ ความลังเล และการแก้คำพูดของตนเองอย่างเป็นธรรมชาติ Pass@1 ใช้ประเมินลำดับการเรียกใช้เครื่องมือ
* แบ็กเอนด์ GPT Live: Terra (ต่ำ)
ประเมินคำตอบที่พูดสำหรับคำขอที่ใช้เครื่องมือซึ่งมีการเว้นช่วง ลังเล และแก้ไขคำพูดของตนเอง ให้คะแนนว่าคำตอบสอดคล้องกับเจตนาที่อ้างอิงมากเพียงใด
* แบ็กเอนด์ GPT Live: Terra (ต่ำ)
นักพัฒนาต้องการเสียงที่เข้ากับผลิตภัณฑ์และฟังเป็นธรรมชาติสำหรับผู้ใช้งาน GPT‑Live‑1 จึงเพิ่มตัวเลือกเสียงแบบเรียลไทม์ให้หลากหลายกว่าเดิม ครอบคลุมทั้งสำเนียง ภาษาถิ่น และภาษาต่างๆ เพื่อให้นักพัฒนามีอิสระมากขึ้นในการเลือกเสียงที่เหมาะกับผู้ช่วยของตน
ในช่วงหลายเดือนต่อจากนี้ เราจะเพิ่มตัวเลือกเสียงและขยายการรองรับภาษาอย่างต่อเนื่อง
GPT‑Live‑1 พร้อมให้ใช้งานผ่าน API แล้ววันนี้(เปิดในหน้าต่างใหม่) โดยเลเยอร์เสียงส่วนฟรอนต์เอนด์มีราคา 0.05 ดอลลาร์ต่อนาที เลือกโมเดลแบ็กเอนด์และระบบสำหรับเอเจนต์ให้เหมาะกับผลิตภัณฑ์ของคุณ แล้วนำมาใช้ร่วมกันเพื่อสร้างประสบการณ์เสียงที่พร้อมรองรับการขยายตัวตามภาระงานที่ต้องจัดการ
หากต้องการใช้เสียงที่ปรับแต่งเอง โปรดติดต่อฝ่ายขายเพื่อดูข้อมูลเพิ่มเติมเกี่ยวกับคุณสมบัติในการขอใช้งานและขั้นตอนการยื่นคำขอ
อีกทางเลือกสำหรับการสร้างเวิร์กโฟลว์เสียงบน GPT‑Live‑1 คือ OpenAI Presence ซึ่งใช้โมเดลนี้เป็นพื้นฐานในการโต้ตอบด้วยเสียงแบบเรียลไทม์ Presence ช่วยให้องค์กรนำเอเจนต์ AI ที่ไว้วางใจได้มาใช้งาน เพื่อช่วยตอบคำถาม แก้ปัญหา ใช้ระบบของบริษัท ดำเนินการที่ได้รับอนุมัติ และส่งต่อให้เจ้าหน้าที่เมื่อจำเป็น หากต้องการทราบข้อมูลเพิ่มเติม โปรดติดต่อผู้จัดการดูแลบัญชี OpenAI ของคุณ

