GPT-6.1Sol
Astra에 근접한 지능을 5분의 1 가격으로, 프런티어 성능을 지속적으로 활용하세요
GPT‑6 Sol의 업그레이드 모델인 GPT‑6.1 Sol을 소개합니다. 에이전트 기반 코딩은 물론 컴퓨터 사용과 전문 업무에서도 탁월한 성능을 제공합니다. 고난도 작업에서 GPT‑6 Astra에 한층 더 근접한 성능을 제공하면서도 표준 입력 및 출력 토큰 가격은 Astra의 5분의 1에 불과합니다. 개발자는 같은 예산으로 유능한 에이전트를 구축하고 운영할 여력을 더 확보할 수 있습니다.
GPT‑6.1 Sol은 Sol의 가격으로 Astra에 근접한 성능을 제공하며, 현재 이용 가능한 모델 중 성능 대비 비용 효율이 가장 뛰어납니다. 캐시된 입력은 표준 입력 가격보다 95% 저렴한 100만 토큰당 $0.10에 불과합니다. 반복되는 요청에서 컨텍스트를 재사용해야 하는 에이전트 워크로드의 비용 부담을 한층 줄여줍니다.
종합적인 역량에서는 GPT‑6 Astra가 여전히 OpenAI의 가장 뛰어난 프런티어 모델입니다. GPT‑6.1 Sol은 중요한 작업을 더 자주 수행하려는 사용자와 대규모 애플리케이션을 구축하고 운영하는 API 고객에게 역량과 비용 사이의 새로운 균형점을 제시합니다.

GPT‑6.1 Sol은 코드 작성 및 디버깅부터 문서 이해, 다단계 비즈니스 워크플로 실행까지 복잡한 전문 업무 전반에서 GPT‑6 Sol보다 크게 향상된 성능을 제공합니다. 이러한 평가 중 여러 항목에서 훨씬 낮은 비용으로 GPT‑6 Astra에 근접한 성능을 보입니다.
실제 코드베이스에서 복잡한 소프트웨어 엔지니어링 작업을 평가하는 DeepSWE v1.1에서 GPT‑6.1 Sol은 약 5분의 1 비용으로 GPT‑6 Astra와 대등한 성능을 보입니다. 또한 더 낮은 추론 강도와 비용으로 GPT‑6 Sol의 최고 점수를 6.4%포인트 웃돕니다.
벤치마크 DeepSWE 1.1(새 창에서 열기)에서 AI 에이전트는 새롭게 설계된 장기 소프트웨어 엔지니어링 과제를 해결합니다.
GDP.pdf는 표, 차트, 도표, 작은 글씨로 된 세부 사항 등이 포함된 복잡한 PDF 문서를 활용해 모델이 전문적인 질문에 얼마나 정확하게 답하는지 측정합니다. 이 평가에서 GPT‑6.1 Sol은 테스트한 추론 설정 전반에 걸쳐 폴백을 사용하는 Opus 5.5보다 높은 점수를 기록하면서도 작업당 비용은 절반 미만입니다. 또한 작업당 비용은 약 5분의 1이면서 GPT‑6 Astra의 최첨단 성능에 근접합니다.
벤치마크 GDP.pdf(새 창에서 열기)에서 모델은 금융, 의료, 법률을 비롯한 10개 전문 분야의 실제 업무에 쓰이는 복잡한 PDF에 관한 실무 프롬프트에 답해야 합니다.
에이전트가 다단계 비즈니스 워크플로를 올바르게 완료하는지 측정하는 AutomationBench에서 GPT‑6.1 Sol은 중간 추론 강도 설정으로 Opus 5.5보다 2.2%포인트 높은 점수를 기록하며, 비용은 약 3분의 1입니다. 이는 같은 설정의 GPT‑6 Sol보다도 4.8%포인트 높은 점수입니다.
In AutomationBench 1.0.6(새 창에서 열기), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol은 컴퓨터 애플리케이션과 상호작용해야 하는 작업에서도 상당한 진전을 보입니다. 고난도 컴퓨터 사용 워크플로에서 에이전트를 평가하는 OSWorld 2.0의 오프라인 세트에서 GPT‑6.1 Sol은 최대 추론 강도 설정으로 GPT‑6 Sol보다 7%포인트 높은 성능을 보이면서도 비용은 절반 미만입니다. 최대 추론 강도 설정에서 Astra와의 점수 차이는 2.1%포인트에 불과하며, 작업당 비용은 약 7분의 1입니다.
In OSWorld 2.0(새 창에서 열기), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
데이터 분석, 시뮬레이션, 정리 증명 등의 과학 워크플로를 평가하는 Terminal-Bench Science 0.1에서 GPT‑6.1 Sol은 최대 추론 강도 설정으로 GPT‑6 Sol 점수의 2배 이상을 기록하면서도 작업당 비용은 절반 미만입니다. 최대 추론 강도에서 GPT‑6.1 Sol의 평균 작업당 비용은 $5.47입니다. Opus 5.5의 $23.21, Astra의 $23.80과 비교하면 두 모델보다 75% 이상 낮은 비용으로 뛰어난 과학 연구 역량을 제공합니다.
GPT‑6 Astra는 여전히 테스트한 모델 중 가장 높은 68.1%를 기록하므로, 가장 어려운 과학 연구 작업에는 GPT‑6 Astra를 사용하는 것이 좋습니다.
벤치마크 Terminal-Bench Science 0.1(새 창에서 열기)에서 에이전트는 코드와 터미널 도구를 사용해 데이터 분석, 시뮬레이션 실행, 모델 피팅 등을 포함한 과학 연구 워크플로를 수행합니다.
GPT‑6.1 Sol은 고난도 프롬프트에 대한 사실 정확성도 향상되었습니다. 추론 강도를 매우 높음으로 설정했을 때 사실 오류율은 4.1%로, GPT‑6 Sol의 4.5%보다 낮아져 동일한 설정의 Astra가 기록한 4.0%에 더 근접했습니다. 작업당 비용은 Astra보다 약 83% 낮습니다.
이 평가는 사용자가 이전 모델의 오류를 신고한 대화를 비식별화하여, 사실 오류가 하나 이상 포함된 답변의 비율을 측정합니다. 의도적으로 난도를 높인 이러한 프롬프트는 일반적인 사용 환경을 대표하지 않습니다.
이전 모델의 사실 오류를 사용자가 신고한 ChatGPT 대화를 비식별화하여 사실 정확성을 평가합니다. 오류를 유발하는 이러한 대화는 사실 오류가 더 드물게 발생하는 일반적인 사용 환경을 대표하지 않습니다.
GPT‑6.1 Sol은 OpenAI의 정렬 평가에서 GPT‑6 Sol보다 크게 개선된 모습을 보이며 GPT‑6 Astra에 더 근접했습니다.
GPT‑6.1 Sol은 자신의 한계를 더 투명하게 알리고, 사용자의 의도와 안전 제약을 더 신뢰성 있게 준수합니다. 고난도 평가에서 검색 도구의 작동 불능을 투명하게 알리기, 명시적 제한 준수하기, 에이전트 작업 중 승인되지 않은 결과 방지하기 등의 항목에서 GPT‑6 Sol보다 낮은 실패율을 보입니다. GPT‑6 Astra 및 GPT‑6 Sol과 마찬가지로 자동화된 안전 검토 시스템을 우회하려는 시도는 관찰되지 않았습니다.
아래 평가는 의도적으로 까다로운 상황을 테스트한 것으로, 일반적인 사용 환경에서의 실패율을 측정한 것이 아닙니다.
오늘부터 모든 Plus, Pro, Business, Enterprise, Edu 사용자는 ChatGPT Work와 Codex에서 GPT‑6.1 Sol을 이용할 수 있습니다. 이 모델들은 아직 Chat에서 이용할 수 없습니다. 개발자는 OpenAI API에서도 gpt-6.1-sol로 이용할 수 있습니다. 표준 API 가격은 입력 토큰 100만 개당 $2, 캐시된 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $10입니다.
이와 함께 GPT‑6 Astra보다 최대 8배 빠른 세계에서 가장 빠른 프런티어 모델 GPT‑6 Astra Ultrafast와 GPT‑6.1 Sol Ultrafast도 출시합니다. 이 모델들은 API에서 이용할 수 있으며, 월 $500에 최대 사용량을 제공하는 새로운 Pro 등급 사용자는 ChatGPT Work와 Codex에서도 이용할 수 있습니다. GPT‑6.1 Sol Ultrafast를 통해 개발자는 기존 GPT‑6 Astra와 거의 동일한 API 비용으로 Astra에 근접한 지능을 최대 8배 빠른 속도로 활용할 수 있습니다.
작성자
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

