AI 시대를 위한 성과 지표
제가 여러 CFO들에게 가장 자주 듣는 질문은 간단합니다. AI에 투자한 비용으로 어떻게 더 큰 가치를 창출할 수 있을까 하는 것입니다.
그동안 시장은 구매한 시트 수, 활성 사용자 수, 라이선스 갱신률과 같은 도입 지표를 기준으로 소프트웨어의 성공을 평가해 왔습니다. 하지만 AI의 가치를 제대로 이해하려면 그보다 더 중요한 기준이 필요합니다. 바로 얼마나 많은 업무를 실제로 완수했는가입니다.
CFO를 비롯한 경영진이 가장 먼저 따져봐야 할 경제적 질문은 AI가 수행하는 업무의 가치가 그 업무를 수행하는 데 드는 비용보다 더 빠르게 증가하고 있는가입니다.
이 질문에 답하려면 토큰당 비용과 같은 단일 지표만으로는 충분하지 않습니다. 토큰 가격이 저렴한 모델이라도 원하는 결과를 얻기까지 더 많은 재시도와 시간이 필요하거나 사람의 검토가 더 많이 필요할 수 있습니다. 반면 성능이 더 뛰어난 모델은 토큰 비용이 더 높더라도 같은 작업을 한 번에 완료할 수 있습니다. 중요한 것은 결과를 만들어내는 비용 자체가 아니라, 그 결과가 창출하는 가치에 비해 성공적인 결과를 얻기까지 실제로 얼마의 비용이 들었는가입니다.
AI 시대를 평가하는 궁극적인 성과 지표는 '달러당 유용한 AI 성과'라고 할 수 있습니다. 이 지표는 다음 네 가지 핵심 질문에 답합니다.
- AI가 실제로 가치 있는 업무를 수행하고 있는가?
- 성공적으로 완료된 작업 하나를 처리하는 데 얼마의 비용이 드는가?
- 결과를 신뢰할 수 있는가?
- AI에 투자하는 비용은 사용량이 늘어날수록 더 큰 가치를 만들어내는가?
먼저 업무 자체를 살펴봐야 합니다.
AI는 고객 문제를 얼마나 해결했습니까? 코드 변경 사항의 배포를 얼마나 지원했습니까? 계약서를 얼마나 검토했습니까? 사람들은 AI 덕분에 얼마나 많은 시간을 절약했습니까? 그리고 적절한 순간에 필요한 정보를 활용할 수 있었기 때문에 더 나은 의사결정을 내린 사례는 얼마나 됩니까?
토큰은 사람들이 실제로 활용할 수 있는 결과를 만들어낼 때 비로소 가치를 창출합니다. 모델의 성능이 향상될수록 더 긴 문맥을 유지하고, 여러 단계를 거쳐 추론하며, 다양한 도구를 넘나들고, 상황에 맞게 유연하게 대응하는 등 더욱 복잡한 업무까지 수행할 수 있습니다.
가장 좋은 출발점은 하나의 워크플로를 정하는 것입니다. 먼저 해당 워크플로에서 무엇을 '완료'로 볼 것인지 정의한 다음, 실제 업무가 이루어지는 시스템에서 그 결과를 측정해야 합니다.
예를 들어 고객 지원팀에서는 고객 문의가 해결된 상태가 '완료'일 수 있습니다. 엔지니어링팀에서는 테스트를 통과한 코드 변경 사항이, 법무팀에서는 계약서를 정확하고 기한 내에 검토한 것이 완료의 기준이 될 수 있습니다.
예를 들어 재무팀이 예측 검토 회의를 준비한다고 가정해 보겠습니다. 최종 의사결정에 이르기 전까지는 최신 예측 자료를 찾고, 데이터를 Excel이나 Sheets로 옮기고, 변경 사항을 확인하고, 여러 탭의 데이터를 대조하고, 프레젠테이션 자료를 다시 만들고, 모든 수치가 정확하게 일치하는지 확인하는 등 많은 작업이 이루어집니다.
ChatGPT Work는 이러한 작업의 상당 부분을 대신 수행해 팀이 정말 중요한 질문에 더 많은 시간을 집중할 수 있도록 돕습니다. 무엇이 달라졌는가? 왜 달라졌는가? 다음에는 무엇을 해야 하는가?
이것이 바로 달러당 유용한 AI 성과가 실제 업무에서 의미하는 바입니다. 더 많은 업무를 더 빠르게 완료하는 동시에, 사람들은 판단력과 창의성, 전문성이 필요한 일에 더 많은 시간을 투자할 수 있습니다.
다음으로 살펴봐야 할 것은 해당 업무를 높은 품질로 완료하는 데 실제로 얼마의 비용이 드는가입니다.
AI가 수행하는 작업은 매우 다양합니다. 간단한 질문에 답하는 일은 적은 컴퓨팅 자원만으로도 충분할 수 있습니다. 반면 코딩, 리서치, 재무 업무와 같은 워크플로는 더 깊은 추론과 도구 활용, 여러 단계의 작업이 필요합니다. 이러한 복잡한 업무는 더 많은 컴퓨팅 자원을 사용하지만, 그만큼 훨씬 더 큰 가치를 창출할 수 있습니다.
모델 관점에서 성공적으로 완료된 작업당 비용은 가격, 사용된 컴퓨팅 자원의 양, 그리고 올바른 결과에 도달할 가능성에 따라 달라집니다. 기업 입장에서는 여기에 직원의 시간, 사람의 검토, 재시도, 재작업 비용까지 모두 포함해 계산해야 합니다.
계산 방법은 간단합니다.
- 업무를 완료하는 데 들어간 전체 비용을 합산합니다.
- 요구되는 품질 기준을 충족한 작업 수를 계산합니다.
- 전체 비용을 성공적으로 완료된 작업 수로 나눕니다.
따라서 토큰당 가격이 가장 낮다고 해서 결과당 비용까지 가장 낮은 것은 아닙니다. 프런티어 모델은 일상적인 요청이라도 한 번에 올바른 답을 제공해 재시도와 지연 시간, 검토 과정, 전체 컴퓨팅 자원을 줄일 수 있다면 가장 높은 가치를 제공할 수 있습니다.
계층형 모델 제품군은 이러한 비용 대비 효과를 더욱 유연하게 최적화할 수 있도록 해줍니다. 지난주 공개한 GPT‑5.6은 세 가지 등급으로 제공됩니다. Sol은 대표 플래그십 모델이며, Terra는 성능과 비용의 균형을 맞춘 모델입니다. Luna는 가장 빠르면서도 가장 경제적인 모델입니다.
이러한 모델은 적합한 선택을 위한 출발점이 됩니다. 궁극적으로는 업무 전체의 비용 대비 효과를 기준으로 적절한 모델을 선택해야 합니다. 예를 들어 빠르게 대량 처리해야 하는 워크플로에는 Luna를, 더 깊이 있는 작업에는 Terra를, 그리고 더 강력한 추론으로 재시도를 줄이고 최상의 결과를 얻고자 할 때는 Sol을 선택할 수 있습니다.
OpenAI는 토큰 하나로도 더 많은 실질적인 업무를 수행할 수 있도록 GPT‑5.6을 학습시켰습니다. Artificial Analysis Coding Agent Index에서는 최대 추론 수준으로 설정한 GPT‑5.6 Sol이 다른 선도 모델보다 출력 토큰을 54% 적게 사용하면서도 새로운 최고 성능을 기록했습니다. 아래 차트는 그 결과를 보여줍니다.
DeepSWE v1.1: 장기간에 걸친 엔지니어링 작업을 평가합니다. GPT‑5.6 Sol은 예상 API 비용을 36.2% 낮추면서 Claude Fable 5의 69.9%를 뛰어넘는 72.7%를 기록해 최고 성능을 달성했습니다.
GPT‑5.6 제품군의 목표는 모두 같습니다. 같은 비용으로 더 많은 업무를 성공적으로 수행하는 것입니다. 효율성이 높아질수록 기존 업무를 더 낮은 비용으로 처리할 수 있고, 성능이 향상될수록 이전에는 불가능했던 새로운 업무까지 수행할 수 있게 됩니다.
새로운 모델 세대가 나올 때마다 이 두 가지 모두가 개선되어야 합니다. 고객은 더 큰 가치를 창출하는 업무를 수행할 수 있어야 하며, 동시에 각 작업을 완료하는 데 드는 비용은 계속 낮아져야 합니다.
세 번째 지표는 신뢰성입니다.
AI는 일반적으로 단계적으로 활용 범위가 확대됩니다. 처음에는 초안 작성을 돕는 역할을 하고, 이후에는 필요한 맥락을 파악하며 여러 도구와 데이터를 활용해 추론합니다. 시간이 지나면 실제 작업을 수행하고, 예외 상황을 처리하며, 워크플로를 완료하는 단계까지 발전합니다. 이 과정에서 사람은 필요한 경우 판단을 내리고 관리하는 역할을 맡습니다.
각 단계로 발전할수록 더 큰 가치를 창출하는 동시에 시스템에도 더 높은 수준의 역량이 요구됩니다.
신뢰성은 곧 경제적 가치로 이어집니다. 결과가 정확하고, 신뢰할 수 있는 근거를 갖추며, 일관성을 유지하고, 필요한 경우 적절히 사람에게 넘겨진다면 사람은 검토와 수정, 재작업에 들이는 시간을 크게 줄일 수 있습니다. 그만큼 작업당 비용도 낮아지고, 조직은 보다 중요한 업무에도 AI를 자신 있게 활용할 수 있게 됩니다.
팀은 다음 세 가지 결과를 추적하면 이를 구체적으로 측정할 수 있습니다.
- 바로 사용 가능: 결과물이 그대로 품질 기준을 충족함
- 수정 필요: 재시도하거나 사람이 수정해야 함
- 사람의 개입 필요: 사람이 직접 이어받아 작업을 완료해야 함
이러한 지표는 단순한 모델 정확도보다 훨씬 많은 것을 보여줍니다. AI가 프로젝트를 완료하는 데 필요한 실제 업무를 얼마나 줄여주고 있는지 확인할 수 있기 때문입니다.
신뢰성을 확보하려면 명확한 운영 기준도 마련해야 합니다. AI가 초안 작성 단계를 넘어 실제 작업을 수행하기 전에 조직은 다음 사항을 명확히 정의해야 합니다.
- 시스템이 접근할 수 있는 데이터
- AI가 사용할 수 있거나 변경할 수 있는 시스템
- 사람이 언제 작업을 검토하거나 승인해야 하는지
안전성, 보안, 개인정보 보호, 그리고 통제 체계는 AI를 더욱 폭넓게 활용하기 위한 기반입니다. 사람들은 시스템이 어떻게 동작하는지, 자신의 데이터가 어떻게 처리되는지, 그리고 AI의 작업이 어떤 방식으로 관리되는지를 이해할 수 있어야 합니다.
ChatGPT Work는 ChatGPT Enterprise가 제공하는 보안, 개인정보 보호, 규정 준수, 워크스페이스 관리 기능을 기반으로 구축되었습니다. 이를 통해 조직은 적절한 관리 체계를 유지하면서도 AI가 더 많은 맥락을 이해하고 더욱 중요한 워크플로를 수행하도록 지원할 수 있습니다.
뛰어난 성능은 AI를 처음 사용하게 만드는 이유가 됩니다. 그러나 AI를 실제 업무 방식의 일부로 정착시키는 것은 신뢰성입니다.
마지막으로 살펴봐야 할 것은 규모가 커질수록 비용 대비 효과가 함께 향상되는가입니다.
기업은 동일한 워크플로를 지속적으로 추적해 이를 측정할 수 있습니다. 품질 기준을 충족한 작업 수와 전체 수행 비용, 그리고 성공적으로 완료된 작업당 비용을 함께 살펴봐야 합니다. 품질이 유지되거나 향상되는 가운데 완료된 업무가 전체 비용보다 더 빠르게 증가한다면, AI에 투자한 비용은 시간이 갈수록 더 큰 가치를 창출하고 있는 것입니다.
이 모든 것을 가능하게 하는 핵심에는 컴퓨팅 자원이 있습니다.
컴퓨팅 자원은 연구 개발은 물론 AI가 수행하는 모든 작업을 뒷받침합니다. 또한 제품의 품질과 속도, 신뢰성, 가용성, 비용에도 직접적인 영향을 미칩니다. 학습 컴퓨팅 자원은 미래의 성능을 높이고, 추론 컴퓨팅 자원은 지금 당장 고객에게 실질적인 가치를 제공합니다. 이 두 요소 모두 더 나은 고객 경험으로 이어져야 합니다.
더 뛰어난 모델, 더욱 효율적인 추론, AI에 최적화된 하드웨어, 높은 자원 활용률, 더 똑똑한 라우팅, 그리고 우수한 제품 설계는 모두 컴퓨팅 투자 대비 성과를 높여줍니다. 새로운 인프라 세대는 더 뛰어난 모델의 학습을 가능하게 하고, 발전한 알고리즘과 하드웨어, 소프트웨어는 이러한 모델을 더욱 효율적으로 운영하도록 지원합니다.
고객은 이러한 발전을 더 정확한 답변, 더 빠른 결과, 더 적은 수정 작업, 더 신뢰할 수 있는 제품, 그리고 더 낮은 업무 수행 비용이라는 형태로 체감하게 됩니다.
이러한 효과는 누적되면서 더 큰 가치를 만들어냅니다. 더 나은 인프라는 연구를 가속화하고, 연구는 더욱 뛰어나고 효율적인 모델을 만들어냅니다. 더 좋은 모델은 제품을 개선하고, 더 좋은 제품은 도입 확대와 학습, 매출 성장을 이끌어냅니다. 그리고 이러한 성장은 다시 차세대 연구와 컴퓨팅, 배포, 안전성에 대한 지속적인 투자로 이어집니다.
OpenAI는 하나의 통합된 AI 플랫폼을 통해 이러한 요소를 하나의 생태계로 연결합니다. 사용자는 ChatGPT와 ChatGPT Work를 통해 이를 활용하고, 개발자는 Codex와 API를 통해 애플리케이션을 구축합니다. 기업은 실제 업무가 이루어지는 시스템에 이를 배포해 활용합니다.
이 플랫폼의 어느 한 계층이라도 발전하면 모든 제품과 고객이 그 혜택을 함께 누릴 수 있습니다.
이 네 가지 지표를 종합하면 달러당 유용한 AI 성과가 실제로 향상되고 있는지 확인할 수 있습니다.
실질적인 업무 성과는 AI가 어떤 결과를 만들어내는지를 보여줍니다. 성공적으로 완료된 작업당 비용은 그 결과를 얻기 위해 얼마나 많은 비용이 드는지를 나타냅니다. 신뢰성은 사람이 AI의 결과를 얼마나 안심하고 활용할 수 있는지를 보여주며, 규모 확장에 따른 가치는 AI에 투자한 비용과 컴퓨팅 자원이 시간이 지날수록 더 많은 성과를 만들어내고 있는지를 보여줍니다.
궁극적인 목표는 사람들이 더 의미 있는 업무를 수행하고, 더 나은 의사결정을 내리며, 사람만이 발휘할 수 있는 판단력과 창의성이 필요한 일에 더 많은 시간을 쓸 수 있도록 돕는 AI를 만드는 것입니다.
OpenAI의 역할은 새로운 모델이 나올 때마다 이 방정식을 더욱 개선하는 것입니다. 더 뛰어난 모델을 만들고, 더 빠르고 신뢰할 수 있는 결과를 제공하며, 고객이 원하는 업무를 수행하는 비용을 지속적으로 낮추는 것입니다.
이러한 발전이 쌓일수록 AI는 더 많은 사람과 조직에 더욱 유용한 도구가 될 것입니다.


