
2025년 8월 28일 업데이트: Realtime API가 정식 출시(GA)되었습니다. 자세한 내용은 여기를 참고하세요.
지난 몇 달간 OpenAI는 Operator, 심층 리서치, 컴퓨터 제어 에이전트, 도구가 내장된 Responses API 등의 출시를 통해 텍스트 기반 에이전트(사용자를 대신하여 독립적으로 작업을 수행하는 시스템)의 지능, 역량 및 유용성을 발전시키는 데 투자해 왔습니다. 그러나 에이전트가 진정으로 유용해지기 위해서는 사용자가 텍스트를 넘어 자연스러운 음성 언어를 사용하여 더 깊고 직관적으로 에이전트와 상호작용할 수 있어야 합니다.
오늘 OpenAI는 API에 새로운 음성-텍스트 변환 및 텍스트-음성 변환 오디오 모델을 출시합니다. 이를 통해 실질적인 가치를 제공하는 더욱 강력하고, 맞춤화 가능하며, 지능적인 음성 에이전트를 구축할 수 있게 되었습니다. OpenAI의 최신 음성-텍스트 변환 모델은 정확도와 신뢰성 면에서 기존 솔루션을 능가하며 새로운 업계 표준을 제시합니다. 특히 억양, 소음, 불규칙한 속도 등 까다로운 환경에서 성능이 두드러집니다. 이러한 개선 사항은 전사 신뢰도를 높여 고객 콜센터, 회의록 전사 등과 같은 사용 사례에 모델을 특히 적합하게 만듭니다.
최초로 개발자가 텍스트-음성 변환 모델에게 "공감하는 고객 서비스 상담원처럼 말해줘"와 같이 발화 방식을 구체적으로 지시할 수 있게 되어, 음성 에이전트의 맞춤화 수준이 획기적으로 높아졌습니다. 이로써 공감 능력 뛰어난 고객 서비스 음성부터 창의적인 스토리텔링을 위한 표현력 풍부한 내레이션까지 폭넓은 활용이 가능합니다.
OpenAI는 2022년에 첫 번째 오디오 모델을 출시했으며, 그 이후로 이러한 모델의 지능, 정확도 및 신뢰성을 개선하기 위해 전념해 왔습니다. 이번 신규 모델을 통해 개발자는 API 내에서 더 정확하고 강력한 음성-텍스트 변환 시스템과 개성 넘치는 텍스트-음성 변환 음성을 구현할 수 있습니다.
기존 Whisper 모델 대비 단어 오류율을 개선하고 언어 인식 및 정확도를 높인 새로운 gpt-4o-transcribe 및 gpt-4o-mini-transcribe 모델을 소개합니다.
gpt-4o-transcribe는 여러 공인 벤치마크에서 기존 Whisper 모델보다 향상된 단어 오류율(WER) 성능을 기록하며, OpenAI 음성-텍스트 변환 기술의 비약적인 발전을 보여줍니다. 이러한 성과는 강화학습 분야의 목표 지향적 혁신과, 다양한 고품질 오디오 데이터셋을 활용한 광범위한 중간 학습 덕분에 가능했습니다.
그 결과, 새로운 음성-텍스트 변환 모델은 억양, 소음 환경, 다양한 말하기 속도 등 까다로운 조건에서도 음성의 미세한 뉘앙스를 더 잘 포착하고 오인식을 줄이며 전사 신뢰도를 높였습니다. 이러한 모델은 현재 음성-텍스트 변환 API(새 창에서 열기)에서 바로 사용할 수 있습니다.
단어 오류율(WER)은 참조 스크립트 대비 잘못 전사된 단어 비율을 계산해 음성 인식 모델의 정확도를 측정하는 지표로, 수치가 낮을수록 오류가 적고 성능이 우수합니다. OpenAI의 최신 음성-텍스트 변환 모델은 수동 전사 오디오 샘플을 기반으로 100개 이상의 언어를 평가하는 다국어 음성 벤치마크인 FLEURS(음성의 보편적 표현에 대한 퓨샷 학습 평가)를 포함해, 여러 벤치마크에서 더 낮은 WER을 기록했습니다. 이는 전사 정확도가 높아졌고 언어 커버리지가 더욱 견고해졌음을 보여줍니다. 자료와 같이, OpenAI 모델은 모든 언어 평가에서 Whisper v2 및 Whisper v3를 일관되게 앞서고 있습니다.
FLEURS 벤치마크에서 OpenAI 모델은 더 낮은 단어 오류율(WER)과 강력한 다국어 성능을 입증했습니다. WER은 수치가 낮을수록 오류가 적고 성능이 뛰어남을 뜻합니다. 자료에서 볼 수 있듯, OpenAI 모델은 대부분의 주요 언어에서 타사의 선도 모델과 대등하거나 그 이상의 성능을 발휘합니다.
제어 가능성이 강화된 새로운 gpt-4o-mini-tts 모델도 함께 출시합니다. 최초로 개발자는 모델에게 무엇을 말할지뿐만 아니라 어떻게 말할지도 '지시'할 수 있어, 고객 서비스부터 창의적 스토리텔링까지 사용 사례에 딱 맞는 최적의 경험을 제공할 수 있습니다. 이 모델은 텍스트-음성 변환 API(새 창에서 열기)에서 이용 가능합니다. 이러한 텍스트 음성 변환 모델은 인공적인 사전 설정 음성으로 제한되며, OpenAI는 이들이 합성 프리셋과 일관되게 일치하는지 모니터링한다는 점을 참고하시기 바랍니다.
신규 오디오 모델은 GPT‑4o 및 GPT‑4o‑mini 아키텍처를 기반으로 하며, 성능 최적화의 핵심인 오디오 특화 데이터셋으로 광범위한 사전 학습을 거쳤습니다. 이러한 목표 지향적 접근은 음성 뉘앙스에 대한 심층적 이해를 가능케 하여 오디오 관련 작업 전반에서 탁월한 성능을 발휘합니다.
증류 기술을 고도화하여 대규모 오디오 모델의 지식을 더 작고 효율적인 모델로 전이할 수 있게 되었습니다. 발전된 셀프 플레이 기법을 적용한 증류 데이터셋은 실제 대화 흐름을 효과적으로 포착하고 진정한 사용자-어시스턴트 상호작용을 재현합니다. 덕분에 소형 모델에서도 탁월한 대화 품질과 응답성을 경험할 수 있습니다.
OpenAI의 음성-텍스트 변환 모델에 강화 학습(RL) 중심의 패러다임을 통합하여, 전사 정확도를 최고 수준으로 끌어올렸습니다. 이 방법론은 정밀도를 획기적으로 높이고 환각 현상을 줄여, 복잡한 음성 인식 환경에서 독보적인 경쟁력을 제공합니다.
이는 혁신적 방법론과 실질적 기능 개선을 결합해 음성 애플리케이션 성능을 강화한, 오디오 모델링 분야의 진보라 할 수 있습니다.
이 새로운 오디오 모델들은 지금 모든 개발자가 사용할 수 있으며, 오디오를 활용한 개발에 대한 자세한 내용은 여기(새 창에서 열기)에서 확인할 수 있습니다. 이미 텍스트 기반 모델로 대화형 서비스를 구축 중인 개발자라면, OpenAI의 음성-텍스트 변환 및 텍스트-음성 변환 모델을 추가하는 것만으로 매우 간단하게 음성 에이전트를 구현할 수 있습니다. 개발 과정을 간소화해 주는 Agents SDK(새 창에서 열기) 통합 기능도 함께 출시했습니다. 저지연 음성-음성 변환 경험을 구축하려는 개발자에게는 Realtime API의 음성-음성 변환 모델 사용을 권장합니다.
앞으로도 OpenAI는 오디오 모델의 지능과 정확도를 개선하는 데 지속적으로 투자할 계획이며, 안전 표준에 부합하는 방식으로 개발자가 자체적인 커스텀 음성을 가져와 더욱 개인화된 경험을 구축할 수 있는 방법을 모색할 것입니다. 또한 합성 음성이 가져올 도전과 기회에 대해 정책 입안자, 연구원, 개발자, 크리에이터와 지속적으로 소통하고 있습니다. 향상된 오디오 기능으로 개발자가 만들어낼 혁신적이고 창의적인 애플리케이션이 기대됩니다. 아울러 동영상을 포함한 다양한 모달리티에 투자하여 개발자가 멀티모달 에이전트 경험을 구축하도록 지원할 것입니다.
작성자
리서치 리드
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
기여자
리서치
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
엔지니어링
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
제품
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
리더십 스폰서
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry