OpenAI

2026년 7월 8일

제품릴리스

GPT‑Live 소개

사람과 AI가 더욱 자연스럽게 소통할 수 있도록 설계된 차세대 음성 모델로, 이제 ChatGPT 음성 대화를 지원합니다.

로딩 중...

2026년 7월 31일 업데이트. ChatGPT 음성 대화 및 OpenAI API를 통해 GPT‑Live에서 생성된 지원 대상 오디오에도 이제 SynthID 워터마크가 적용됩니다. 또한 공개 검증 도구에서 이제 지원 대상 오디오 파일의 OpenAI 생성 출처 신호를 감지할 수 있으며, 개발자와 조직이 자체 워크플로에 출처 검증 기능을 통합할 수 있도록 검증 API도 새롭게 제공합니다. 본 업데이트는 아래에서 설명하는 안전성 접근 방식을 바탕으로, OpenAI가 생성한 콘텐츠를 더욱 쉽게 식별할 수 있도록 하기 위한 지속적인 노력의 일환입니다.

AI와 대화하는 경험을 실제 대화에 훨씬 더 가깝게 만들어 주는 차세대 음성 모델, GPT‑Live를 출시합니다.

GPT‑Live는 동시에 듣고 말할 수 있는 풀 듀플렉스 아키텍처를 기반으로 구축되었습니다. 대화 중 GPT‑Live는 '음'이나 '네' 같은 표현으로 주의를 기울이고 있음을 보여 주고, 빠르게 주고받는 대화에 참여하거나, 사용자가 생각할 시간이 필요할 때는 조용히 기다릴 수 있습니다. 그래서 GPT‑Live와의 음성 대화는 놀랄 만큼 편안하고 자연스럽게 느껴집니다.

GPT‑Live는 지금까지 선보인 모델 중 가장 스마트한 음성 모델이기도 합니다. 웹 검색, 더 깊은 추론, 더 복잡한 작업이 필요한 질문의 경우 백그라운드에서 최신 프런티어 모델에 위임하고, 결과가 준비되면 다시 대화로 가져옵니다. 작업이 진행되는 동안에도 GPT‑Live는 사용자와 계속 대화하며 흐름을 유지할 수 있습니다. 출시 시점에 GPT‑Live는 백그라운드에서 GPT‑5.5를 사용합니다. 새로운 프런티어 모델을 출시할 때마다 GPT‑Live가 사용하는 모델을 지속적으로 업데이트할 예정입니다.

이러한 발전은 더 지능적이고 자연스럽게 사용할 수 있는 새로운 ChatGPT 음성 대화 경험을 제공합니다. 장기적으로 이 연구는 음성으로 점점 더 복잡하고 오래 걸리며 에이전트처럼 수행되는 작업을 처리할 수 있는 역량도 열어 줄 것이라고 믿습니다.

오늘부터 전 세계 ChatGPT 사용자에게 GPT‑Live의 두 가지 버전인 GPT‑Live‑1GPT‑Live‑1 mini를 순차적으로 제공합니다. API에서도 곧 제공될 예정이며, 개발자와 기업은 이 양식을 통해 알림을 신청할 수 있습니다.

인간-AI 상호작용의 새로운 시대를 열며

OpenAI의 비전은 진정으로 자연스러운 인간과 AI의 상호작용을 가능하게 하는 것입니다. 이러한 상호작용이 이루어지는 세상에서 AI와의 협업은 다른 사람과 함께 일하는 것처럼 유연하고 즉각적으로 느껴지며, 추론 작업과 복잡한 작업은 백그라운드에서 매끄럽게 이루어집니다.

이전 접근 방식

이전 세대의 음성 AI 시스템은 그 비전에 더 가까이 다가가게 해 주었지만, 중요한 절충점이 있었습니다.

캐스케이드형 음성 시스템

캐스케이드형 음성 시스템은 각 턴을 처리하기 위해 여러 모델이 차례로 작동하는 방식에 의존합니다. 초기의 ChatGPT 음성 대화는 세 가지 모델을 연결했습니다. 사용자의 말을 전사하는 음성-텍스트 모델, 응답을 생성하는 대규모 언어 모델, 그리고 이를 다시 음성으로 변환하는 텍스트-음성 모델입니다. 이 접근 방식 덕분에 처음으로 프런티어 AI 모델과 대화할 수 있었지만, 그 복잡성에는 대가가 따랐습니다. 모델 사이에서 정보가 손실될 수 있었고, 응답은 느리고 어색했습니다.

단계별 처리 방식의 음성 시스템

느리고 부자연스러운 응답, 긴 대기 시간

전사
GPT-5.5의 즉시 모드를 사용한 표준 음성 대화 예시

턴 기반 음성 모델

ChatGPT 고급 음성 모드와 같은 턴 기반 음성 모델은 하나의 모델 안에서 오디오를 처리하고 생성해 지연 시간을 줄이고 대화를 더 매끄럽게 만들었습니다. 하지만 여전히 분리된 턴을 통해 작동했습니다. 모델은 응답하기 전에 사용자가 말을 멈출 때까지 기다려야 했고, 그 결과 주고받는 대화가 경직되었습니다. 또한 턴 감지가 침묵을 기준으로 이루어지기 때문에 아주 짧은 멈춤이나 배경 소음도 턴의 끝으로 오인될 수 있었고, 이로 인해 모델이 부자연스러운 순간에 끼어들기도 했습니다.

턴 기반 음성 모델

응답은 조금 더 빠르고 매끄러워졌지만, 모델과 주고받는 대화는 여전히 딱딱하게 느껴집니다.

전사
ChatGPT 고급 음성 대화 예시

새로운 접근 방식

GPT‑Live는 두 가지 아키텍처 변화로 이러한 한계를 해결합니다.

연속적 상호작용

첫째, GPT‑Live를 풀 듀플렉스 아키텍처를 사용한 연속적 상호작용에 맞게 구축했습니다. 별개의 메시지들을 순서대로 처리하는 대신, GPT‑Live는 출력을 생성하는 동시에 입력을 지속적으로 처리합니다. 따라서 모델은 초당 여러 번 상호작용 결정을 내릴 수 있습니다. 말할지, 계속 들을지, 잠시 멈출지, 끼어들지, 또는 도구를 호출할지를 판단합니다.

이를 통해 모델은 더 자연스럽게 대화를 주고받고, 시간의 흐름을 더 잘 파악하며, 실시간 번역까지 수행할 수 있습니다.

끊김 없는 상호작용

더 빠르고 자연스럽고 표현력 있는 응답, 사용자의 말을 더 잘 이해함

전사
GPT-Live-1과 대화 예시, GPT-5.5의 즉시 모드 사용

더 깊이 있는 작업을 위한 위임

둘째, 연속적 상호작용을 처리하는 GPT‑Live와 더 깊이 있는 작업을 분리했습니다. 질문에 검색, 추론 또는 더 에이전트적인 역량이 필요할 때 GPT‑Live는 해당 작업을 GPT‑5.5 같은 다른 모델에 위임할 수 있습니다. 이를 통해 백그라운드에서 여러 작업을 처리하는 동안에도 대화를 계속 이어 갈 수 있습니다.

또한 이 아키텍처 변화 덕분에 GPT‑Live는 최신 모델과 에이전트를 지속적으로 활용하며, 프런티어 지능과 자연스러운 상호작용을 결합할 수 있습니다.

복잡한 작업은 위임하기

GPT-Live는 빠르고 자연스러운 응답을 제공하고, GPT-5.5는 백그라운드에서 검색을 처리합니다.

전사
GPT-Live-1과 대화 예시, GPT-5.5의 즉시 모드 사용

평가

대화의 쾌적함과 흐름을 측정하기 위한 새로운 인간 평가 체계도 구축했습니다. 이러한 일대일 비교에서 GPT‑Live‑1과 GPT‑Live‑1 mini는 전반적 선호도, 턴 주고받기, 끼어들기, 대화 흐름, 각 상호작용이 얼마나 자연스럽게 느껴졌는지를 측정한 동일 조건의 5~10분 대화에서 고급 음성 모드보다 훨씬 더 선호되었습니다.

  • GPQA: GPT‑Live‑1은 생물학, 화학, 물리학 전반의 전문가 수준 과학적 추론을 테스트하는 GPQA에서 고급 음성 모드를 크게 앞섭니다.
  • BrowseComp: GPT‑Live‑1은 에이전트형 웹 검색과 찾기 어려운 정보를 찾아내는 능력을 테스트하는 BrowseComp에서 고급 음성 모드 대비 큰 향상을 보입니다.
  • τ³-Voice Telecom(내부 변형)**: GPT‑Live‑1은 실제 통신사 고객 지원 환경의 다중 턴 과제를 통해 음성 에이전트의 성능을 평가하는 τ³-Voice Telecom에서 고급 음성 모드보다 우수한 성능을 보였습니다.

* GPT‑Live‑1(instant)와 GPT‑Live‑1 mini는 백그라운드에서 GPT‑5.5 Instant 모델을 사용하고, GPT‑Live‑1 Medium 및 GPT‑Live‑1 High는 중간 및 높음 수준의 추론 레벨을 적용한 GPT‑5.5 Thinking 모델을 사용합니다.

** 본 평가에는 최신 추론 모델을 기반으로 구축한 맞춤형 사용자 모델을 사용했습니다.

새로워진 ChatGPT 음성 대화

매주 1억 5천만 명이 넘는 사람들이 음성 대화와 Dictation 같은 기능을 사용해 ChatGPT와 대화합니다. 손을 쓰지 않고 일상적인 도움을 받거나, 외국어를 연습하고, 잠자리 이야기를 들려달라고 하거나, 출퇴근길에 가볍게 대화를 나누는 등 다양한 방식으로 활용하고 있습니다.

오늘부터 음성 대화 버튼을 눌러 ChatGPT와 대화를 시작하면 GPT‑Live 기반의 새로운 음성 대화를 경험할 수 있습니다. 더 자연스러운 대화, 더 똑똑한 답변, 더 뛰어난 음성 이해, 그리고 시각적 응답을 제공합니다.

더 자연스러운 대화

이제 ChatGPT와 나누는 대화는 실제 사람과 이야기하는 것처럼 훨씬 더 자연스럽게 느껴집니다. 대화 도중 질문을 던져도 되고, 잠시 생각을 정리한 뒤 말을 이어가도 되며, ChatGPT에게 천천히 말해 달라고 요청할 수도 있습니다. ChatGPT는 "음", "알겠어요"처럼 자연스럽게 반응하며 사용자의 말을 잘 따라오고 있다는 것을 알려줍니다. 또한 GPT‑Live에 맞춰 ChatGPT의 9가지 음성을 새롭게 다듬었습니다.

더 똑똑한 답변

이제 ChatGPT 음성 대화는 최신 프런티어 모델을 활용해 필요할 때 더 똑똑한 답변을 제공합니다. 또한 상황에 맞게 추론 수준을 선택할 수도 있습니다. 빠른 응답이 필요하다면 Instant를, 더 깊이 생각한 답변이 필요하다면 Medium 또는 High를 선택하면 됩니다.

향상된 음성 이해

잠시 생각을 정리하느라 말을 멈추면 ChatGPT는 끼어들지 않고 기다립니다. 조용히 듣기만 해 달라고 하면 그대로 따라줍니다. 또한 지나가는 차량 소리나 주변 사람들의 대화처럼 배경 소음이 있더라도 다른 소리에 방해받지 않고 사용자의 목소리에 더욱 집중합니다.

한눈에 보는 시각적 답변

눈으로 함께 확인하면 더 이해하기 쉬운 답변도 있습니다. 이제 ChatGPT는 대화 중에도 날씨, 주식, 스포츠 등 다양한 주제의 풍부한 시각적 카드를 보여줄 수 있습니다. 또한 음성 대화에서는 검색, 메모리, 이미지, 파일 업로드 기능도 계속 사용할 수 있습니다.

그 결과 ChatGPT 음성 대화는 더욱 자연스럽고, 더 많은 일을 할 수 있으며, 일상에서 한층 더 유용한 경험을 제공합니다.

음성 대화를 위한 안전 설계

GPT‑Live는 기본적으로 안전하게 사용할 수 있도록 설계되었습니다. 최신 모델의 안전성 개선을 바탕으로, 주요 위험 영역에 대한 전용 안전성 학습과 음성 대화에 특화된 새로운 보호 장치를 더했습니다.

확대된 안전성 테스트

사람들이 실제 환경에서 음성 대화를 사용하는 방식을 더 잘 반영하기 위해 새로운 음성 중심 평가를 추가해 안전성 테스트를 확대했습니다. 또한 고급 음성 모드를 통해 얻은 경험을 바탕으로, 생성된 음성을 활용한 합성 평가도 마련해 주요 안전성 영역을 더욱 집중적으로 평가했습니다. 여기에는 자해, 정신병 및 조증, AI에 대한 정서적 의존, 폭력, 성적 콘텐츠가 포함됩니다. 또한 내부 전문가들이 음성 대화에서만 발생할 수 있는 위험을 중심으로 레드팀 테스트를 수행했습니다.

테스트 결과, GPT‑Live는 평가한 거의 모든 항목에서 고급 음성 모드와 비슷하거나 더 뛰어난 성능을 보였습니다. 테스트와 보호 장치에 대한 자세한 내용은 GPT‑Live 시스템 카드(새 창에서 열기)에서 확인할 수 있습니다.

기본으로 제공되는 보호 장치

음성 대화는 실시간으로 이루어지기 때문에 모델이 말하는 중에도 작동하는 보호 장치를 마련했습니다. 시스템이 잠재적으로 안전하지 않은 응답을 감지하면 더 안전한 방향으로 응답을 유도하거나, 추가적인 안전 안내나 지원 정보를 제공하며, 위험도가 높은 경우에는 음성 대화를 종료할 수 있습니다. 자해와 관련된 대화의 경우에는 전문가의 검토를 거친 위기 상담 핫라인을 안내하는 등 ChatGPT의 지원 절차를 음성 대화에 맞게 적용했습니다.

청소년 사용자를 보호하기 위한 추가 보호 기능도 마련했으며, 연령에 적합한 방식으로 응답하도록 모델을 학습시켜 부적절한 응답이 발생할 가능성을 줄였습니다. 부모는 자녀 보호 기능을 통해 자녀의 ChatGPT 음성 대화 사용 여부를 설정할 수 있으며, 자해나 자살 의도가 의심되는 위험도가 높은 상황에서는 연결된 부모에게 알림이 전달될 수 있습니다.

실제 사용을 통해 개선

또한 AI에 대한 정서적 의존에 초점을 맞춘 장기적인 측정과 출시 후 모니터링을 도입해, 사용 양상에 대한 이해를 높이고 보호 장치를 지속적으로 개선해 나가고 있습니다. 정서적 활용과 정서적 웰빙에 관한 기존 연구를 바탕으로, 새로운 사용 패턴을 파악하고 정서적으로 민감한 상황에서 시스템이 더욱 적절하게 대응할 수 있도록 개선해 나갈 것입니다.

GPT‑Live는 다른 사람의 목소리를 흉내 내기 위한 것이 아니라 자연스러운 대화를 위해 설계되었습니다. ChatGPT에서 제공하는 미리 정의된 음성을 사용하며, 실제 사람의 목소리를 모방하지 못하도록 보호 장치도 적용되어 있습니다.

앞으로도 사용자의 안전과 웰빙을 최우선으로 생각하며, 실제 사용 과정에서 얻은 경험을 바탕으로 이러한 보호 장치를 계속 강화해 나가겠습니다.

제공 여부 및 제한 사항

GPT‑Live는 현재 iOS, Android, ChatGPT.com(새 창에서 열기)에서 전 세계 ChatGPT 사용자에게 순차적으로 제공되고 있습니다. Go, Plus, Pro 사용자의 ChatGPT 음성 대화에는 GPT‑Live‑1이 기본 모델로 적용되며, Free 사용자는 GPT‑Live‑1 mini가 기본 모델로 사용됩니다. 제공 여부에 대한 자세한 정보는 도움말 센터(새 창에서 열기)에서 확인할 수 있습니다.

GPT‑Live는 ChatGPT에서 가장 많이 사용되는 일부 언어에 맞춰 최적화되었습니다. 일부 언어에서는 원어민과 다른 억양이 나타나거나 다소 유창하지 않을 수 있습니다. 모든 언어에서 더 나은 경험을 제공할 수 있도록 지속적으로 개선하고 있습니다.

출시 직후에는 ChatGPT에서 동영상이나 화면 공유와 함께 음성 대화를 사용할 수 없지만, 이러한 기능은 곧 지원될 예정입니다. 그때까지는 해당 기능을 지원하는 기존 ChatGPT 음성 대화 버전(표준 및 고급 음성 모드)을 계속 이용할 수 있습니다.

작성자

OpenAI