메인 콘텐츠로 건너뛰기
OpenAI

2026년 8월 13일

AI 활용 사례

개발자를 위한 GPT‑5.6 가이드

프로덕션 환경에서 스타트업이 얻은 기술적 교훈

로딩 중...

GPT‑5.6, 가격 대비 성능의 새로운 기준을 세우다

GPT‑5.6 모델 제품군은 프런티어 수준의 에이전트 성능을 훨씬 낮은 비용으로 제공하는 동시에, 에이전트가 수행할 수 있는 작업의 한계를 더욱 확장합니다.

이 가이드에서는 스타트업이 더 스마트한 모델 선택과 추론 연속성, 멀티 에이전트 오케스트레이션, 프로그래밍 방식 도구 호출을 지원하는 새로운 API 제어 기능을 활용하여 훨씬 적은 비용으로 더 빠르고 뛰어난 에이전트를 구축하는 방법을 소개합니다.

별도의 조정 없이도 더 나은 성능

GPT‑5 이후 각 세대의 모델은 더 적은 토큰으로 더 장기적인 작업을 해결하는 것을 목표로 발전해 왔습니다. GPT‑5.6은 이러한 흐름을 이어갑니다. 기반 하네스는 거의 변경하지 않으면서 에이전트 성능은 강화하고 비용은 낮췄습니다.

전반적인 비용 효율 개선에 더해, 낮은 추론 수준에서도 정확도가 향상되면서 그 효과가 더욱 커집니다. 예를 들어 동일한 하네스를 사용한 Agents’ Last Exam에서 추론 수준을 ‘low’로 설정한 GPT‑5.6 Sol은 ‘high’로 설정한 GPT‑5.5보다 뛰어난 성능을 보였습니다. 프로덕션 테스트에서도 비슷한 성공 사례를 확인했습니다. 스타트업들은 기존 기본 설정보다 추론 수준을 낮춤으로써 다양한 워크플로에서 비용을 크게 절감했다고 보고합니다.

하네스에 GPT‑5.6을 바로 적용했더니 낮은 추론 노력에서 가장 좋은 결과를 얻었습니다. 데이터가 없을 때를 정확히 파악하고, 잘못된 단서를 쫓지 않았으며, 더 적은 토큰으로 정답에 도달했습니다.
— 이지 밀러, Hex(새 창에서 열기) AI 리서치 책임자

모델 선택

지금까지 장기 작업이 필요한 사용 사례에는 가장 높은 추론 수준의 플래그십 모델로 업그레이드하는 것이 최선이었습니다. 이는 주로 이러한 모델이 비용 최적화 모델보다 긴 컨텍스트와 도구 호출을 처리하는 능력이 훨씬 뛰어났기 때문입니다. 하지만 5.6 제품군에서 상황이 달라졌습니다. 테스트 시점 연산을 늘리면 Luna와 Terra는 훨씬 저렴한 비용으로도 GPT‑5.4 및 5.5와 비슷한 성능을 내는 경우가 많습니다.

3개 중 1
Luna는 GPT‑5.5의 추출 정확도를 98% 유지하면서 비용은 18분의 1에 불과합니다. 덕분에 훨씬 더 많은 워크플로에 실용적으로 적용할 수 있는 비용으로 에이전트에 고품질 문서 이해 기능을 제공할 수 있습니다.
— 세르히 쇼홀리예우, Hypha(새 창에서 열기) 에이전트 엔지니어링 책임자

잘 알려지지 않은 사실을 검색하는 모델의 능력을 평가하는 검색 기반 벤치마크인 BrowseComp의 작업을 살펴보겠습니다. 3개월 전 GPT‑5.5(Extra High)는 이 벤치마크에서 총 $33.27의 비용으로 84.36%를 기록했습니다. 출시 시점의 GPT‑5.6 Luna(Extra High)는 $1.33의 비용으로 84.04%를 기록해 사실상 동일한 성능을 제공합니다. 이후 가격을 추가로 인하했습니다. 최근 가격 인하에 관한 자세한 내용은 여기에서 확인하세요.

5.6 제품군의 소형 모델은 처리량이 많은 워크로드, 지연 시간에 민감한 상호작용, 에이전틱 워크플로에서 반복되는 단계에 매우 적합합니다. 예를 들어 에이전틱 분석에 앞서 손으로 쓴 메모를 파싱하는 리걸테크 스타트업이라면 전체 사용 사례에 프런티어 모델을 쓰는 대신 Terra나 Luna로 정보를 추출해 비용을 크게 절감할 수 있습니다.

더 효율적인 에이전트 설계를 위한 Responses API의 진화

GPT‑5.6의 기본 성능을 높이는 데 그치지 않고, 추가적인 성능 향상을 위해 Responses API에 새로운 기본 기능도 도입했습니다. 또한 에이전트가 더 효율적으로 작동할 수 있도록 서로 보완하는 세 가지 아키텍처 개선 사항을 적용해 GPT‑5.6을 엔드 투 엔드로 학습했습니다.

  1. 이미 수행한 작업 재사용: 모델 턴 간에 추론을 유지(새 창에서 열기)하고 네이티브 컨텍스트 압축(새 창에서 열기)으로 장시간 이어지는 대화를 압축하면, 모델이 혼란에 빠지거나 이전 컨텍스트를 재구성하지 않고도 더 긴 작업 과정에서 일관성을 유지할 수 있습니다.
  2. 필요에 따라 작업을 병렬로 분할: 네이티브 멀티 에이전트 오케스트레이션(새 창에서 열기)을 사용하면 여러 병렬 작업 흐름에서 다수의 에이전트를 조율해 복잡한 작업을 더 빠르게 완료할 수 있습니다.
  3. 결정론적 작업을 코드로 이전: 프로그래밍 방식 도구 호출(새 창에서 열기)을 사용해 모델의 컨텍스트 윈도우 밖에서 도구 출력을 필터링·집계·조율하면 모델 토큰을 판단에 집중시킬 수 있으며 비용, 지연 시간, 컨텍스트 저하도 줄어듭니다.

함께 사용하면 그 효과는 극적일 수 있습니다. 예를 들어 ARC-AGI-3에서 GPT‑5.6 Sol은 표준 하네스로 13.3%를 기록했습니다. 하지만 추론 유지와 컨텍스트 압축을 활성화하자 출력 토큰을 약 6배 적게 사용하면서도 점수가 38.3%로 뛰었습니다. 모델을 변경하지 않고도 성능이 거의 3배로 향상된 것입니다. 자세한 내용은 ARC-AGI-3 하네스 조사에서 확인할 수 있습니다.

프로그래밍 방식 도구 호출

에이전틱 워크플로에는 흔히 두 종류의 작업이 포함됩니다.

  1. 판단이 필요한 작업
  2. 주로 데이터를 이동하고 필터링하고 결합하는 작업

에이전트가 공시 자료 100건을 가져와 날짜별로 필터링하고 관련 거래를 식별할 때, 모델이 컨텍스트 윈도우에서 모든 중간 결과를 일일이 추론할 필요는 없습니다. 프로그래밍 방식 도구 호출을 사용하면 GPT‑5.6이 JavaScript를 작성해 도구를 조율하고, 독립적인 호출을 병렬로 실행하며, 컨텍스트 윈도우 밖에서 출력을 처리할 수 있습니다. 따라서 모델은 지능이 필요한 일, 즉 판단을 내리는 데 집중할 수 있습니다.

금융 리서치에서 어려운 점은 공시 자료를 안정적으로 가져오고, 도구를 조율하며, 수치를 분석하는 것입니다. 평가 결과, 프로그래밍 방식 도구 호출을 사용한 GPT‑5.6은 입력 토큰을 21% 적게 사용하면서도 평가 기준상 동일한 품질을 달성했습니다. 이것이 금융 리서치를 논할 수 있는 에이전트와 실제로 수행할 수 있는 에이전트의 차이입니다.
— 알렉스 왕, Rogo(새 창에서 열기) 응용 AI 담당

멀티 에이전트

복잡하지만 병렬화할 수 있는 작업에서는 동작과 추론을 여러 에이전트 작업 흐름에 분산함으로써 작업을 더 빠르게 완료하고 추론 능력도 높일 수 있습니다. 이러한 구성에서는 주 에이전트가 서브에이전트를 조율하고 작업을 위임합니다. 서브에이전트는 각자의 목표를 병렬로 수행한 뒤, 최종 종합을 위해 결과를 주 에이전트에 전달합니다. 팀은 Responses API에서 멀티 에이전트를 활성화(새 창에서 열기)해 네이티브 멀티 에이전트 기능을 바로 활용할 수 있습니다. ChatGPT의 Ultra 기능 설정도 이와 같은 방식으로 작동합니다.

2개 중 1
Qualia는 정답이 정해지지 않은 연구 문제에 여러 에이전트로 구성된 팀을 투입하는데, GPT‑5.6 Sol은 기대에 딱 맞는 성능을 보여줬습니다. GPT‑5.5보다 확연히 향상됐고, 테스트한 거의 모든 모델보다 빠르게 작업을 마쳐 곧바로 저희가 가장 먼저 찾는 OpenAI 모델이 됐습니다.
— 이 치, Quadrillion(새 창에서 열기) 창립자

GPT‑5.6은 적절한 서브에이전트 수와 생성 시점을 잘 판단하지만, 멀티 에이전트 동작을 매우 세밀하게 조정할 수도 있습니다. 서브에이전트를 호출할 시점을 모델에 지시하면 추가 토큰 비용으로 더 나은 성능을 얻을 수 있는 상황에서만 에이전트가 생성될 가능성을 높일 수 있습니다.

프롬프트 캐싱

전체 모델 제품군에서 프롬프트 캐시 TTL이 최소 30분으로 연장됐으며, 이제 모델의 컨텍스트 윈도우 안에서 캐시 중단점을 결정론적으로 설정할 수 있습니다. 이를 통해 스타트업은 캐시 적중률을 크게 높일 수 있게 됐습니다.

공유된 29,000토큰 프롬프트에 캐시 중단점과 워크스페이스별 키를 추가해 캐시되지 않은 입력을 28% 줄였습니다. 30분 캐시 윈도우도 큰 돌파구였습니다. 에이전트가 실행할 때마다 처음부터 시작하지 않고 동일한 컨텍스트를 재사용할 수 있게 됐습니다.
— 로렌조 젠틸레, Ploy(새 창에서 열기) AI 엔지니어

캐시 중단점을 설정하는 것과 함께 적절한 prompt_cache_key(새 창에서 열기)를 계속 사용하면, 동일한 접두사를 이전에 처리했던 추론 엔진으로 요청이 전달될 가능성이 높아져 지연 시간이 줄어듭니다.

결론

이 사례들에서 특히 두드러지는 점은 에이전트 구축의 경제성이 크게 달라졌다는 것입니다.

이전에는 모든 단계에 프런티어 모델이 필요했던 사용 사례도 이제 소형 모델을 사용하고, 추론 수준을 조정하며, 효율적인 아키텍처를 선택해 훨씬 적은 비용으로 비슷하거나 더 나은 결과를 얻을 수 있습니다.

여러분이 무엇을 만들어 낼지 기대됩니다!

  • 2026
  • API 플랫폼

저자 소개

이 가이드는 초기 테스트부터 프로덕션까지 GPT-5.6을 기반으로 제품을 구축하는 스타트업과 긴밀히 협력한 경험을 바탕으로 사마르트 마두루(새 창에서 열기), 프라샨트 미탈(새 창에서 열기), 데이브 레오(새 창에서 열기), 줄리앙 라이먼(새 창에서 열기)이 작성했습니다.