메인 콘텐츠로 건너뛰기
OpenAI

GPT‑6 Sol과 Luna 소개

매일 하는 업무에 프런티어 지능을 활용하는 더 다양한 방법.

로딩 중...

이달 초, 세계에서 가장 지능이 뛰어나고 정렬 수준이 높은 모델인 GPT‑6 Astra를 공개했습니다. 가장 까다롭고 중요한 프로젝트에는 여전히 Astra의 온전한 역량이 필요하지만, 실제 업무의 규모와 속도, 예산은 다양합니다.

그래서 GPT‑6 제품군을 GPT‑6 Sol과 GPT‑6 Luna로 확장합니다. GPT‑6 Astra가 새로운 세대의 지능을 열었다면, 이 모델들은 비용 효율성의 프런티어를 확장해 그 지능의 혜택을 더 널리 제공합니다. GPT‑6 Sol과 Luna는 GPT‑6 Astra와 유사한 방식으로 훈련되어, 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬에서 Astra의 최첨단 성능을 뒷받침한 발전을 더 빠르고 경제적인 모델에 담았습니다.

GPT‑6 모델은 비용 대비 지능 전반에서 앞서며, 각 등급의 뛰어난 역량과 이를 대규모로 효율적으로 제공하는 인프라를 결합합니다. 캐싱과 추론 기술을 개선해 이 모델들을 더 낮은 비용으로 제공할 수 있게 되었으며, GPT‑5.6 프로모션 가격과 비교해 Sol과 Luna의 API 가격을 50% 인하함으로써 절감 효과를 사용자와 고객에게 그대로 돌려드립니다. 이러한 개선을 통해 더 많은 일상 업무와 대규모 애플리케이션에서 고급 AI를 실용적으로 활용할 수 있습니다.

GPT‑6 API 가격

모델

입력

출력

가격 인하

GPT‑6 Sol
GPT‑5.6 Sol 대비

$4 → $2

$20 → $10

50% 저렴

GPT‑6 Luna
GPT‑5.6 Luna 대비

$0.20 → $0.10

$1.20 → $0.50

50% 저렴

가격은 토큰 100만 개 기준입니다.

GPT‑6 Astra는 여전히 모든 면에서 가장 뛰어난 OpenAI 모델입니다. 타협 없는 경험과 최고의 결과를 원한다면 이 모델을 선택하세요.

모델 제품군 전반의 도약

GPT‑6 Sol과 Luna는 복잡한 업무를 처리하는 데 가장 유용한 역량 전반에서, 이미 익숙하게 사용해 온 모델에 향상된 지능과 비용 효율성을 더합니다.

전문 업무

GPT‑6 Sol은 어려운 업무를 처리하면서도 더 높은 사용량 한도와 낮은 비용으로 반복 작업의 여유를 넓혀 줍니다. 또한 가격대가 비슷한 경쟁 모델보다 더 높은 지능과 우수한 결과를 제공합니다.

여러 앱에 걸친 비즈니스 워크플로를 평가하는 AutomationBench에서 xhigh 추론 수준의 GPT‑6 Sol은 Max 추론 수준의 Claude Opus 5보다 뛰어난 성능을 보였으며, 작업당 비용은 Opus 5의 9%에 불과했습니다. High 추론 수준의 GPT‑6 Luna는 이전 모델보다 5.4%포인트 높은 성능을 보이면서 작업당 비용은 58% 낮췄습니다.

AutomationBench 1.0.6⁠(새 창에서 열기)에서는 영업, 마케팅, 운영, 지원, 재무, 인사 분야의 47개 도구를 활용한 전체 워크플로로 AI 에이전트를 테스트합니다. Claude Fable 5.1의 데이터 포인트에는 약 40%의 작업에서 사용된 Opus 5 대체 모델의 비용이 빠져 있어 실제 비용이 과소평가되었습니다.

GPT‑6 Sol은 훨씬 낮은 비용으로 Claude Fable 5.1을 능가하며, 추론 수준이 낮은 GPT‑6 Astra보다도 뛰어납니다.

모델(및 추론 수준)

점수

작업당 비용

GPT‑6 Sol(xhigh)

33.2%

$0.27

GPT‑6 Astra(낮음)

30.3%

GPT‑6 Sol의 3.9배

Claude Opus 5(Max)

26.9%

GPT‑6 Sol의 11.1배

Claude Fable 5.1(대체 모델: Opus 5, Max)

31.4%

GPT‑6 Sol의 >8.9배

(대체 모델 비용 미공개)

복잡한 전문 워크플로에서 에이전트를 평가하는 Agents’ Last Exam에서 Max 추론 수준의 GPT‑6 Sol은 56.4%를 기록해 Claude Opus 5의 평가상 최고 점수를 넘어섰으며, 작업당 비용은 60% 낮았습니다.

Agents’ Last Exam V1⁠(새 창에서 열기)에서는 컴퓨터로 수행되는 주요 전문 업무 분야 대부분을 포괄하는 55개 세부 산업의 장시간에 걸친 경제적 가치가 높은 작업으로 AI 에이전트를 평가합니다.

사실성

답변의 유용성은 사실의 정확성에 달려 있으며, OpenAI는 사실적 신뢰성을 계속 높이고 있습니다. 사용자가 모델의 오류를 신고한 비식별화된 실제 대화를 바탕으로 한 내부 사실성 평가에서 GPT‑6 Sol은 이전 모델보다 오류가 약 절반으로 줄었으며, 훨씬 낮은 비용으로 Astra에 가까운 신뢰성을 보였습니다. GPT‑6 Luna도 크게 개선되어, 추론 수준을 높이면 약 100분의 1 비용으로 GPT‑5.6 Sol과 대등한 성능을 냅니다.

여기서는 사용자가 이전 모델의 사실 오류를 신고한 비식별화된 ChatGPT 대화를 바탕으로 사실성을 평가합니다. 오류를 유발하는 이 대화들은 사실 오류가 훨씬 드문 일반적인 사용 양상을 나타내지 않습니다. 점수에서 답변 길이는 통제하지 않았지만, 장황함을 달리한 실험에서는 답변 길이에 따른 차이가 거의 없었습니다.

코딩

올해 코딩 에이전트는 전례 없이 복잡하고 범위가 넓으며 오래 걸리는 작업을 처리하기 시작했습니다. OpenAI의 내부 사용량도 기하급수적으로 증가했습니다. API 가격으로 환산한 일일 토큰 사용액은 연구자 중앙값 기준 600달러, 상위 10% 연구자 기준 7,000달러를 넘어섰습니다(연구 가속화: OpenAI 내부에서 바라본 모습⁠). 코딩 에이전트가 더 오래 걸리고 까다로운 작업을 맡게 되면서 지속적인 사용 비용이 더욱 중요해지고 있습니다. GPT‑6 Sol과 Luna는 뛰어난 코딩 성능과 더 낮은 API 가격을 결합해 개발자에게 반복 작업의 여유를 넓혀 주고, 팀이 Codex에 더 야심 찬 작업을 안심하고 맡길 수 있게 합니다.

코딩 에이전트가 실제 코드베이스에 바로 병합할 수 있는 변경 사항을 만드는지 평가하는 FrontierCode에서 GPT‑6 Sol은 GPT‑5.6 Sol보다 크게 향상되었으며, 훨씬 낮은 비용으로 xhigh 추론 수준의 Claude Fable 5.1과 대등한 성능을 냅니다.

FrontierCode 1.1 Main⁠(새 창에서 열기)에서는 AI 에이전트가 작성한 코드의 정확성뿐 아니라 테스트 품질, 범위 준수, 코드 스타일, 코드베이스 표준 준수 등 ‘병합 가능성’도 평가합니다.

실제 코드베이스의 복잡한 소프트웨어 엔지니어링 작업 성능을 평가하는 DeepSWE v1.1에서 Max 추론 수준의 GPT‑6 Sol은 68.8%를 기록했습니다. 이는 xhigh 추론 수준에서 69.9%를 기록한 Claude Fable 5의 평가상 최고 점수와 1.1%포인트 차이이며, 작업당 비용은 약 80% 낮습니다.

Max 추론 수준의 GPT‑6 Luna는 66.6%를 기록해 중간 추론 수준의 Claude Opus 5 및 Fable 5와 비슷한 성능을 보였습니다. 이 비교에서 Luna의 작업당 비용은 Opus 5보다 93%, Fable 5보다 96% 낮습니다.

DeepSWE 1.1⁠(새 창에서 열기)에서는 AI 에이전트가 독창적이고 장시간에 걸친 소프트웨어 엔지니어링 작업을 해결합니다.

컴퓨터 사용

GPT‑6 Astra는 여전히 컴퓨터 사용 분야에서 세계 최고의 모델이지만, GPT‑6 Sol과 Luna는 이전 모델보다 비용 효율적인 성능을 제공합니다. OSWorld 2.0 오프라인에서 xhigh 추론 수준의 GPT‑6 Sol은 중간 추론 수준의 Claude Opus 5와 비슷한 점수인 60.5% 대 60.3%를 기록했으며, 작업당 비용은 약 80% 낮았습니다. GPT‑6 Luna(Max)는 10분의 1 비용으로 GPT‑5.6 Sol(중간)을 능가합니다.

OSWorld 2.0⁠(새 창에서 열기)에서는 AI 에이전트가 일상 및 전문 업무를 아우르는 장시간의 컴퓨터 사용 워크플로를 수행합니다. v2026.08.08 릴리스의 오프라인 세트에서 얻은 부분 보상을 보고합니다.

협업 스타일

GPT‑6 Astra에서 개선된 커뮤니케이션 스타일을 Sol과 Luna에도 적용했으며, 특히 기술 및 코딩 관련 대화에서 그 차이가 두드러질 것으로 기대합니다. 내용의 충실함은 유지하면서 더 명확하고, 전문 용어와 어색한 표현 및 불필요한 세부 정보는 줄고, 전반적으로 답변은 조금 더 짧아집니다.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

스타일은 주관적이지만, 여기서는 GPT‑6 Sol의 답변이 더 낫다고 판단합니다. 성급하게 결론을 내리지 않고, 질문자에게 명백할 수 있는 세부 사항(예: 웹사이트가 네 페이지라는 점)을 반복하는 데 시간을 덜 쓰며, 모호한 표현(예: ‘벤토 느낌’, ‘그 시스템을 중심으로 재구성’)도 적습니다. 또한 무엇을 확인했고 확인하지 않았는지 더 솔직하게 밝히며, 이미지 도구 프롬프트 같은 구현 세부 정보를 불필요하게 공유하지 않습니다.

에이전트와 긴 대화를 위한 캐싱 개선

토큰 가격 인하와 더불어, GPT‑6로 개발하는 개발자가 애플리케이션에서 재사용하는 컨텍스트 비용을 더 절감할 수 있도록 지원합니다. GPT‑6의 프롬프트 캐싱을 개선해 기본 캐시 적중률을 높였습니다. 이를 통해 에이전트는 더 많은 컨텍스트를 재사용하고 더 빠르게 응답하며, 캐시된 입력 토큰 읽기에 90% 할인을 받을 수 있습니다.

개발자는 캐싱 성능을 측정하고 최적화할 수 있는 방법도 더 많아졌습니다.

  • 모니터링 및 진단. 프롬프트 캐싱 대시보드⁠(새 창에서 열기)에서는 캐시된 입력의 양과 시간에 따른 변화를 확인할 수 있습니다. 진단 도구⁠(새 창에서 열기)는 놓친 캐싱 기회와 수정할 사항을 파악하는 데 도움이 됩니다.

  • 캐시를 유지하면서 추론 수준과 도구 사용 가능 여부 조정. 어려운 작업에서는 추론 수준⁠(새 창에서 열기)을 높이고 간단한 후속 작업에서는 낮출 수 있으며, 에이전트의 요구 사항이 바뀌면 도구를 활성화하거나 비활성화⁠(새 창에서 열기)할 수 있습니다. 이제 두 설정 모두 이전 컨텍스트를 유지해 캐시에서 재사용할 수 있습니다.

  • 캐시할 접두사 최적화. 명시적 중단점을 사용하면 캐시된 프롬프트 접두사가 끝나는 지점을 개발자가 선택할 수 있습니다. 이를 통해 캐시 재사용을 더 세밀하게 제어하고 성능을 높일 수 있습니다.

GitHub에 따르면, 지난 몇 달 동안 이러한 개선으로 OpenAI 모델에 전송된 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰의 비율이 50% 넘게 줄어 Copilot의 응답 속도가 빨라졌습니다.

지속적인 정렬 개선

GPT‑6 Sol과 Luna는 지금까지 OpenAI에서 정렬 수준이 가장 높은 모델인 Astra에 도입된 정렬 기술을 기반으로 합니다. 정렬 평가에서 Sol과 Luna는 코딩 작업에 관한 오해의 소지가 있는 주장의 비율이 낮아지는 등 각각의 GPT‑5.6 모델보다 개선된 모습을 보였습니다.

아래 평가는 의도적으로 까다로운 상황을 테스트하며, 일반적인 사용 환경의 실패율을 측정하지 않습니다. 전체 결과는 시스템 카드⁠(새 창에서 열기)에서 확인하세요.

이용 가능 여부

GPT‑6 Sol과 GPT‑6 Luna는 오늘부터 모든 Plus, Pro, Business, Enterprise, Edu 사용자의 ChatGPT Work와 Codex에서 이용할 수 있습니다. Free 및 Go 사용자는 데스크톱 앱에서 GPT‑6 Luna를 이용할 수 있습니다. 이 모델들은 아직 Chat에서 이용할 수 없습니다. OpenAI API에서는 gpt-6-sol과 gpt-6-luna로 제공됩니다.

모두에게 안정적인 서비스를 제공하기 위해 오늘 하루 동안 이 모델들을 ChatGPT에 점진적으로 출시할 예정입니다. ChatGPT Work 또는 Codex에 새 모델이 표시되지 않으면 나중에 다시 시도해 주세요.


GPT 평가는 연구 환경이나 API를 통해 수행했으며, 시스템 프롬프트와 사용 가능한 도구 등의 차이로 인해 실제 ChatGPT와 출력이 약간 다를 수 있습니다. 경쟁 모델의 평가는 공개된 보고서에서 가져왔습니다. Claude Fable 5.1의 점수가 없는 경우 Claude Fable 5의 점수를 사용했습니다.

작성자

OpenAI