어제는 GPT‑5.6이 자체적으로 실행 효율성을 높이는 데 어떻게 기여했는지 소개했습니다. 오늘은 GPT‑5.6 Luna(새 창에서 열기)와 Terra(새 창에서 열기)의 가격을 인하하고, API에서 GPT‑5.6 Sol을 더욱 빠르게 사용할 수 있도록 함으로써 이러한 개선의 혜택을 고객에게 제공합니다. 이러한 업데이트를 통해 고객은 AI에 투자한 비용으로 더 큰 가치를 얻을 수 있으며, 속도가 중요한 상황에서는 더욱 신속하게 작업을 수행할 수 있습니다.
오늘부터 가장 빠르고 경제적인 모델인 GPT‑5.6 Luna의 가격은 80%, 일상적인 업무에 적합한 균형 잡힌 모델인 GPT‑5.6 Terra의 가격은 20% 인하됩니다. Luna와 Terra의 가격 인하는 Codex와 ChatGPT Work에서 유료 구독 사용량을 산정하는 방식에도 동일하게 반영됩니다. Luna는 높은 품질을 유지하면서도 대규모 작업을 훨씬 더 비용 효율적으로 처리할 수 있도록 지원합니다. 또한 툴을 활용하고 여러 단계로 이루어진 워크플로를 완료할 수 있어, 더 다양한 AI 애플리케이션을 대규모 환경에서 실용적으로 운영할 수 있습니다.
더 많은 사람들이 뛰어난 AI를 더욱 합리적인 비용으로 활용할 수 있도록 하는 것은 범용 인공지능의 혜택이 인류 모두에게 돌아가도록 하려는 OpenAI의 사명의 핵심입니다. 이번 변화는 이러한 약속을 실천으로 옮긴 결과입니다. 또한 모델을 개발하고 운영하며 실제 업무에 활용하는 전 과정에서 수년간 이어 온 개선의 성과를 반영하고 있습니다.
API에는 Priority Processing을 대체하는 패스트 모드도 새롭게 도입합니다. GPT‑5.6 Sol에서는 패스트 모드를 사용하면 가격은 Standard 처리의 두 배이지만, 추론 수준은 그대로 유지하면서 최대 2.5배 더 빠른 속도를 제공합니다. 패스트 모드는 이전 버전과의 호환성을 지원하므로 priority 태그가 지정된 기존 요청은 자동으로 패스트 모드를 사용합니다.
AI를 효율적으로 활용하려면 먼저 달성하려는 결과를 명확히 해야 합니다. 업무의 중요도, 오류 발생 비용, 긴급성, 규모에 따라 추론 수준, 속도, 안정성, 비용 사이의 최적의 균형은 달라집니다. 또한 이러한 균형은 워크플로의 단계마다 달라질 수 있습니다.
GPT‑5.6은 이러한 균형을 훨씬 더 유연하게 최적화할 수 있도록 지원합니다. Luna는 1년 전 최고 수준이었던 모델과 비슷한 성능을 작업당 약 6% 수준의 비용으로 제공하며, 속도는 거의 9배에 달합니다. 전문 업무 성능을 평가하는 Agents' Last Exam 기준에서도 Luna는 작업당 비용을 약 99% 절감하면서 Fable 5를 뛰어넘는 성능을 제공합니다.
실제 환경에서는 기업이 먼저 원하는 결과와 품질 기준을 정한 다음, 평가를 통해 더 높은 추론 수준이 결과를 실질적으로 개선하는 구간과 더 빠르고 저렴한 처리가 동일한 품질을 제공할 수 있는 구간을 판단할 수 있습니다. 예를 들어 코딩 워크플로에서는 Sol을 사용해 불확실성을 해소하고 작업 계획을 수립한 뒤, Luna를 사용해 명확하게 정의된 변경 사항을 구현하고 테스트를 작성·실행하며 결과를 평가할 수 있습니다. 다른 워크플로에서는 또 다른 균형이 더 적합할 수도 있습니다.
GPT‑5.6 제품군은 이러한 선택의 폭을 더욱 넓혀 줍니다. 기업은 각 단계에서 필요한 만큼의 추론 수준을 활용하면서, 그에 상응하는 비용만 지불하도록 최적화할 수 있습니다.
이러한 유연성은 모델을 뒷받침하는 모든 계층의 효율성을 높이는 것에서 시작됩니다.
OpenAI의 경쟁력은 모델 자체는 물론 이를 실행하는 추론 시스템, 그리고 모델을 툴과 컨텍스트에 연결하는 에이전틱 하네스를 함께 개선하는 데서 나옵니다. GPT‑5.6 모델은 작업을 수행할 때 더욱 효율적인 경로를 선택합니다. 향상된 라우팅은 하드웨어 활용도를 높이고, 최적화된 프로덕션 소프트웨어는 토큰을 더욱 효율적으로 생성하며, 더욱 똑똑해진 컨텍스트 관리는 에이전트가 이미 완료한 작업을 반복하지 않도록 돕습니다. 이러한 개선이 결합되면서 동일한 컴퓨팅 리소스로 더 많은 유용한 작업을 수행할 수 있게 되었고, 각 결과를 생성하는 데 필요한 시간과 토큰, 비용도 줄일 수 있게 되었습니다.
GPT‑5.6 Sol은 다음 단계의 성능 및 효율 개선을 이끌어 내는 데 점점 더 중요한 역할을 하고 있습니다. 사람이 주도하는 개발 과정에서 Sol은 프로덕션 커널을 자율적으로 다시 작성하고 최적화했으며, 토큰 생성 성능을 개선하기 위해 수백 건의 실험을 설계하고 수행했습니다. 또한 학습 과정을 모니터링하면서 문제가 발생하면 스스로 개입해 대응했습니다. 이러한 커널 최적화 작업으로 모델을 운영하는 엔드투엔드 비용을 20% 절감했으며, 실험을 통해 토큰 생성 효율은 15% 이상 향상되었습니다. 이러한 노력은 지금도 계속되고 있으며, 더욱 긴밀한 피드백 루프를 만들어 가고 있습니다. 모델의 성능이 향상되고 더 자율적으로 작업할 수 있게 될수록, 효율성을 개선하는 속도 또한 더욱 빨라집니다. GPT‑5.6의 엔지니어링에 대해 자세히 알아보세요.
더 많은 사람들이 AI를 활용할 수 있도록 하려면 컴퓨팅 리소스를 확대하는 것뿐만 아니라, 이를 더욱 효율적으로 활용하는 것도 중요합니다. OpenAI는 탄탄한 인프라 포트폴리오를 구축하고, 각 워크로드를 가장 적합한 시스템에 배치하고 있습니다. 이러한 접근 방식은 가격 대비 성능 전반을 아우릅니다. 비용을 중시하는 환경에서는 Luna와 Terra의 새로운 가격 정책을 통해 대규모 작업을 더욱 경제적으로 운영할 수 있습니다. 최고 수준의 성능이 필요한 환경에서는 응답 속도가 중요한 경우 패스트 모드를 통해 API 고객이 Sol을 더욱 빠르게 사용할 수 있습니다.
엔터프라이즈는 가장 중요한 업무의 속도를 유지하면서도 더 많은 AI를 일상적인 운영에 도입할 수 있습니다. 대규모 문서 분석, 고객 상호작용 분류, 반복적인 구현 작업은 더 낮은 비용으로 폭넓게 운영할 수 있으며, 더 높은 비용을 들일 가치가 있는 복잡한 Sol 워크로드는 더욱 빠르게 처리할 수 있습니다.
이러한 개선 효과는 서로 시너지를 내며 더욱 커질 수 있습니다. 사람이 주도하는 개발 과정에서 성능이 향상된 모델은 OpenAI 기술팀이 차세대 개선 방안을 더 빠르게 찾아낼 수 있도록 지원하며, 더 뛰어난 성능과 더 낮은 비용을 실현하는 시간을 단축합니다. OpenAI는 앞으로도 성능과 효율성을 함께 발전시켜, 차세대 AI가 더 낮은 비용으로 더 많은 작업을 수행할 수 있도록 하는 데 집중할 것입니다.
GPT‑5.6 Terra와 Luna는 계속해서 ChatGPT Work, Codex, OpenAI API에서 사용할 수 있습니다. ChatGPT Work와 Codex에서는 Free 및 Go 사용자가 Terra를 사용할 수 있으며, Plus, Pro, Business, Enterprise 사용자는 Terra와 Luna를 모두 선택할 수 있습니다.
7월 30일부터 API 가격은 Terra가 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 12달러이며, Luna는 입력 토큰 100만 개당 0.20달러, 출력 토큰 100만 개당 1.20달러입니다. Sol의 가격은 변경되지 않습니다. ChatGPT와 Codex의 구독 가격 및 할당량은 그대로 유지되며, Terra와 Luna 사용 시에는 더 적은 크레딧이 차감됩니다. 가격 변경은 오늘부터 AWS에도 순차적으로 적용됩니다.
GPT‑5.6 Sol의 패스트 모드는 API의 Priority Processing을 대체하며, Codex의 /fast와 동일한 방식으로 동작합니다. 기존에 priority 태그를 사용한 API 요청도 계속 사용할 수 있습니다. API 가격에 대한 자세한 내용을 확인하세요.


