메인 콘텐츠로 건너뛰기
OpenAI

API 고객을 위한 패스트 모드

패스트 모드는 안정적인 고속 성능과 유연한 종량제를 함께 제공합니다. OpenAI의 최신 프런티어 모델인 gpt-5.6-sol의 경우, 패스트 모드를 사용하면 최대 2.5배 더 빠른 속도로 이용할 수 있습니다.

패스트 모드의 주요 장점은 다음과 같습니다.

  • 안정적으로 유지되는 짧은 지연 시간: 표준 처리보다 더 빠르고 일정한 속도로 토큰을 생성하며, 피크 시간대에도 안정적인 성능을 제공합니다.
  • 유연한 사용 방식: 표준 처리와 마찬가지로 사전 용량 예약 없이 종량제로 사용할 수 있습니다.

참고: 2026년 7월 30일부터 '우선 처리'의 이름이 '패스트 모드'로 변경되었습니다. API 요청에서는 service_tier: priority 또는 service_tier: fast 모두를 사용할 수 있습니다.

Short contextLong context가동 시간 SLA3레이턴시 SLA3
입력 토큰 100만 개당 가격입력 토큰 100만 개당 가격(캐시됨)출력 토큰 100만 개당 가격입력 토큰 100만 개당 가격입력 토큰 100만 개당 가격(캐시됨)출력 토큰 100만 개당 가격
GPT-5.6 Sol
US$10.00US$1.00US$60.00US$20.00US$2.00US$90.0099.9%99% > 80개의 토큰/초2
GPT-5.6 Terra
US$4.00US$0.40US$24.00US$8.00US$0.80US$36.0099.9%99% > 70개의 토큰/초2
GPT-5.6 Luna
US$0.40US$0.04US$2.40US$0.80US$0.08US$3.6099.9%99% > 100개의 토큰/초2
GPT-5.5
Long-Context 제외1
US$12.50US$1.250US$75.0099.9%99% > 50개의 토큰/초2
GPT-5.4 mini
Long-Context 제외1
US$1.50US$0.150US$9.0099.9%99% > 100개의 토큰/초2
GPT-5.4
Long-Context 제외1
US$5.00US$0.500US$30.0099.9%99% > 50개의 토큰/초2
GPT-5.2
US$3.50US$0.350US$28.0099.9%99% > 50개의 토큰/초2
GPT-5.1
US$2.50US$0.250US$20.0099.9%99% > 50개의 토큰/초2
GPT-5
US$2.50US$0.250US$20.0099.9%99% > 50개의 토큰/초2
GPT-5 mini
US$0.45US$0.045US$3.6099.9%99% > 80개의 토큰/초2
GPT-5.1 codex
US$2.50US$0.250US$20.0099.9%99% > 50개의 토큰/초2
GPT-5 codex
US$2.50US$0.250US$20.0099.9%99% > 50개의 토큰/초2
GPT-4.1
US$3.50US$0.875US$14.0099.9%99% > 80개의 토큰/초2
GPT-4.1 mini
US$0.70US$0.175US$2.8099.9%99% > 90개의 토큰/초2
GPT-4.1 nano
US$0.20US$0.050US$0.8099.9%99% > 100개의 토큰/초2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
US$4.25US$2.125US$17.0099.9%99% > 80개의 토큰/초2
gpt-4o-2024-05-13
US$8.75US$26.2599.9%99% > 80개의 토큰/초2
GPT-4o mini
US$0.25US$0.125US$1.0099.9%99% > 90개의 토큰/초2
o3
US$3.50US$0.875US$14.0099.9%99% > 80개의 토큰/초2
o4-mini
US$2.00US$0.500US$8.0099.9%99% > 90개의 토큰/초2
1프롬프트 토큰이 27만 2천 개를 초과할 것으로 예상되는 요청 수
25분마다 p50 요청 레이턴시로 계산됩니다. 기존 엔터프라이즈 계약에 1분마다 p50 요청 레이턴시로 계산되는 레이턴시 SLA가 포함된 고객은 기존의 SLA 역시 계속 적용됩니다.
3Enterprise 고객에게만 적용됩니다

작동 방식

API 고객은 기존 service_tier 매개변수에서 service_tier = "fast"를 지정해, 각 요청별로 패스트 모드를 사용할 수 있습니다.

패스트 모드로 처리되는 토큰은 표준 처리 요금보다 높은 프리미엄 단가로 토큰당 과금됩니다.

요청마다 설정하는 것 외에도 '프로젝트 설정 > 기본 서비스 등급: 패스트'에서 프로젝트의 기본 서비스 등급을 패스트 모드로 설정할 수 있습니다. 필요한 경우 요청마다 개별적으로 재정의할 수도 있습니다. 프로젝트 설정에서 패스트 모드를 선택하는 것은 기존의 우선 처리를 선택하는 것과 동일합니다.

제약사항

  • 패스트 모드의 요청 한도는 다른 서비스 등급과 공유됩니다.
  • 드물지만 패스트 모드의 분당 토큰 수가 급증할 경우 단계적 요청 한도에 도달할 수 있습니다. 이 경우 일부 추가 트래픽은 표준 처리로 전환될 수 있습니다.

자주 묻는 질문

가격

모델

속도 제한

신뢰성

정책