GPT‑Live‑1을 API에 출시합니다. 개발자는 강력하고 자연스러운 음성 모델을 활용해 음성 지원 앱과 비즈니스 워크플로를 구축할 수 있습니다. ChatGPT에서 처음 선보인 GPT‑Live‑1은 듣기와 말하기를 동시에 할 수 있으며, Codex와 ChatGPT Work에서 볼 수 있듯 (새 창에서 열기)함께 사용하는 모델과 도구에 더 심층적인 추론과 작업을 위임할 수도 있습니다.
GPT‑Live‑1의 API 출시를 위해 개발자가 사용자, 워크플로, 목표에 맞춰 음성 경험을 조정하고 맞춤 설정할 수 있도록 새로운 기능을 강화했습니다. GPT‑Live‑1의 핵심 강점 중 하나인 자연스러운 끼어들기 처리는 이미 실질적인 비즈니스 성과로 이어지고 있습니다. 초기 평가에서 Speak는 GPT‑Live‑1을 사용했을 때 언어 튜터가 응답하기 전 학습자가 생각할 시간이 더 주어져 기존 턴 기반 시스템에 비해 끼어들기가 약 80% 감소한 것을 확인했습니다.
API에서 GPT‑Live‑1의 주요 강점:
끼어들기 처리: 하나의 모델이 수신 및 송신 오디오를 함께 고려해 추론함으로써 STT–LLM–TTS를 연쇄적으로 연결한 아키텍처에서 발생하는 지연과 불안정한 전환을 피하고 끼어들기 처리를 개선합니다.
추론 및 도구 호출 위임: GPT‑Live‑1은 GPT‑6 Astra 또는 타사 모델과 같은 백엔드 텍스트 모델에 추론과 도구 호출을 위임할 수 있습니다.
어조, 말하기 속도, 스타일: 개발자는 시스템 프롬프트를 통해 에이전트의 어조, 말하기 속도, 대화 스타일을 조정할 수 있습니다.
무음 컨텍스트 관리 및 배경 소음: 대화를 방해하거나 모든 단계를 소리 내어 설명하지 않으면서 배경 소음과 침묵을 더 효과적으로 처리합니다.
긴 세션의 안정성: 장시간 상호작용에서도 컨텍스트 유지력과 대화 품질을 높입니다.
전화 통신 지원: 식당 예약부터 고객 지원까지, 전화 통화용 전이중 음성 에이전트를 배포할 수 있습니다.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
이 데모는 시간 제한이 있습니다. 사용 시 OpenAI 이용약관에 동의하고 개인정보 보호 정책을 확인한 것으로 간주됩니다.
기존 음성 에이전트는 음성 텍스트 변환, 추론 모델, 텍스트 음성 변환을 이어 붙이는 방식입니다. 단계가 전환될 때마다 지연이 늘어나고 타이밍, 컨텍스트 또는 자연스러운 대화 흐름을 놓칠 가능성도 커집니다. 누군가 말을 끊거나 잠시 멈추거나 대화 방향을 바꿀 때의 처리까지 포함해, 이러한 단계를 조율하는 일은 흔히 개발자의 몫입니다.
GPT‑Live‑1은 하나의 모델에서 듣기와 말하기를 모두 처리하여 음성 레이어를 간소화합니다. 끼어들기와 맞장구에 실시간으로 반응하면서 더 심층적인 추론은 백엔드에 위임할 수 있습니다. 따라서 백그라운드에서 작업이 진행되는 동안에도 대화를 이어갈 수 있습니다.
개발자는 대화를 지원할 모델, 도구, 에이전트 하네스를 선택합니다. 예를 들어 일정 관리나 주문 업데이트처럼 처리량이 많은 작업에는 GPT‑Live‑1을 Luna 같은 모델과 결합하고, 추론이 필요한 복잡한 고객 문제에는 Astra 같은 모델을 사용할 수 있습니다. 이러한 유연성 덕분에 개발자는 각 작업에 맞춰 추론의 깊이, 속도, 비용을 조정할 수 있습니다.
GPT‑Live‑1은 ASR 전사본과 응답 텍스트를 기본으로 제공합니다. 또한 영숫자를 정확하게 이해하며 키워드 편향 설정을 지원합니다. GPT‑Live‑1은 턴 기반 모델은 아니지만 턴 감지를 기본으로 지원하므로, 개발자는 명시적인 턴 경계를 기준으로 애플리케이션을 계속 구축할 수 있습니다.
평가 결과, GPT‑Live‑1은 GPT‑Realtime‑2.1 대비 Full Duplex Bench 성능을 30%포인트 향상했으며, 대화 순서 전환 지연과 상호작용 동작에서도 큰 개선을 보였습니다. 중간 수준의 추론 노력을 적용한 GPT‑6 Astra와 함께 사용하면 엔드투엔드 작업에서 최첨단 음성 에이전트의 지능을 측정하는 Tau3에서도 1위를 기록합니다.
항공, 소매, 통신 분야의 음성 고객 지원 작업을 평가합니다. Pass@1은 작업 성공 여부를 측정하며, 전체 결과를 산출할 때 각 분야에 동일한 가중치를 적용합니다.
* GPT Live 백엔드: Astra(중간).
지식 검색 및 계정 도구를 활용하는 음성 뱅킹 지원 작업을 평가합니다. Pass@1은 97개의 banking_knowledge 작업 중 성공적으로 완료된 작업의 비율입니다.
* GPT Live 백엔드: Astra(중간).
멈춤 처리, 대화 순서 전환, 끼어들기, 맞장구를 평가합니다.
배경에서 들리는 말소리, 다른 사람에게 하는 말, 청자의 맞장구, 끼어들기에 대한 반응을 테스트합니다.
사용자가 발화를 마친 후 에이전트가 응답을 시작하기까지 걸리는 시간을 측정합니다.
자연스러운 멈춤, 머뭇거림, 자기 수정이 포함된 음성 요청에서 도구 사용 능력을 평가합니다. Pass@1은 도구 호출 시퀀스의 정확도를 평가합니다.
* GPT Live 백엔드: Terra(낮음).
멈춤, 머뭇거림, 자기 수정이 포함된 도구 사용 요청에 대한 음성 답변을 평가합니다. 답변이 기준 의도와 얼마나 잘 일치하는지 평가합니다.
* GPT Live 백엔드: Terra(낮음).
개발자에게는 제품에 잘 어울리고 사용자에게 자연스럽게 들리는 음성이 필요합니다. GPT‑Live‑1에서는 소수의 실시간 음성에서 다양한 억양, 방언, 언어를 아우르는 폭넓은 음성으로 선택지를 확대해, 개발자가 어시스턴트의 목소리를 더 자유롭게 선택할 수 있습니다.
앞으로 몇 달 동안 음성 옵션과 지원 언어를 계속 확대할 예정입니다.
GPT‑Live‑1은 현재 API에서(새 창에서 열기) 프런트엔드 음성 레이어 기준 분당 0.05달러에 이용할 수 있습니다. 제품에 적합한 백엔드 모델 및 에이전트 하네스와 결합해, 수행해야 하는 작업 규모에 맞춰 확장할 수 있는 음성 경험을 구축하세요.
맞춤형 음성 이용 자격과 신청 절차에 대한 자세한 내용은 영업팀에 문의하세요.
GPT‑Live‑1을 기반으로 음성 워크플로를 구축하는 또 다른 방법은 OpenAI Presence입니다. Presence는 이 모델을 활용해 실시간 음성 상호작용을 지원합니다. Presence는 질문에 답하고, 문제를 해결하며, 사내 시스템을 사용하고, 승인된 작업을 수행하며, 필요한 경우 사람에게 이관할 수 있는 신뢰할 수 있는 AI 에이전트를 기업이 배포하도록 지원합니다. 자세한 내용은 OpenAI 계정 담당자에게 문의하세요.

