API 고객을 위한 패스트 모드
패스트 모드는 안정적인 고속 성능과 유연한 종량제를 함께 제공합니다. OpenAI의 최신 프런티어 모델인 gpt-5.6-sol의 경우, 패스트 모드를 사용하면 최대 2.5배 더 빠른 속도로 이용할 수 있습니다.
패스트 모드의 주요 장점은 다음과 같습니다.
- 안정적으로 유지되는 짧은 지연 시간: 표준 처리보다 더 빠르고 일정한 속도로 토큰을 생성하며, 피크 시간대에도 안정적인 성능을 제공합니다.
- 유연한 사용 방식: 표준 처리와 마찬가지로 사전 용량 예약 없이 종량제로 사용할 수 있습니다.
참고: 2026년 7월 30일부터 '우선 처리'의 이름이 '패스트 모드'로 변경되었습니다. API 요청에서는 service_tier: priority 또는 service_tier: fast 모두를 사용할 수 있습니다.
| Short context | Long context | 가동 시간 SLA3 | 레이턴시 SLA3 | |||||
|---|---|---|---|---|---|---|---|---|
| 입력 토큰 100만 개당 가격 | 입력 토큰 100만 개당 가격(캐시됨) | 출력 토큰 100만 개당 가격 | 입력 토큰 100만 개당 가격 | 입력 토큰 100만 개당 가격(캐시됨) | 출력 토큰 100만 개당 가격 | |||
GPT-5.6 Sol | US$10.00 | US$1.00 | US$60.00 | US$20.00 | US$2.00 | US$90.00 | 99.9% | 99% > 80개의 토큰/초2 |
GPT-5.6 Terra | US$4.00 | US$0.40 | US$24.00 | US$8.00 | US$0.80 | US$36.00 | 99.9% | 99% > 70개의 토큰/초2 |
GPT-5.6 Luna | US$0.40 | US$0.04 | US$2.40 | US$0.80 | US$0.08 | US$3.60 | 99.9% | 99% > 100개의 토큰/초2 |
GPT-5.5 Long-Context 제외1 | US$12.50 | US$1.250 | US$75.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5.4 mini Long-Context 제외1 | US$1.50 | US$0.150 | US$9.00 | — | — | — | 99.9% | 99% > 100개의 토큰/초2 |
GPT-5.4 Long-Context 제외1 | US$5.00 | US$0.500 | US$30.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5.2 | US$3.50 | US$0.350 | US$28.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5.1 | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5 | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5 mini | US$0.45 | US$0.045 | US$3.60 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
GPT-5.1 codex | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5 codex | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-4.1 | US$3.50 | US$0.875 | US$14.00 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
GPT-4.1 mini | US$0.70 | US$0.175 | US$2.80 | — | — | — | 99.9% | 99% > 90개의 토큰/초2 |
GPT-4.1 nano | US$0.20 | US$0.050 | US$0.80 | — | — | — | 99.9% | 99% > 100개의 토큰/초2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$4.25 | US$2.125 | US$17.00 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
gpt-4o-2024-05-13 | US$8.75 | — | US$26.25 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
GPT-4o mini | US$0.25 | US$0.125 | US$1.00 | — | — | — | 99.9% | 99% > 90개의 토큰/초2 |
o3 | US$3.50 | US$0.875 | US$14.00 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
o4-mini | US$2.00 | US$0.500 | US$8.00 | — | — | — | 99.9% | 99% > 90개의 토큰/초2 |
작동 방식
API 고객은 기존 service_tier 매개변수에서 service_tier = "fast"를 지정해, 각 요청별로 패스트 모드를 사용할 수 있습니다.
패스트 모드로 처리되는 토큰은 표준 처리 요금보다 높은 프리미엄 단가로 토큰당 과금됩니다.
요청마다 설정하는 것 외에도 '프로젝트 설정 > 기본 서비스 등급: 패스트'에서 프로젝트의 기본 서비스 등급을 패스트 모드로 설정할 수 있습니다. 필요한 경우 요청마다 개별적으로 재정의할 수도 있습니다. 프로젝트 설정에서 패스트 모드를 선택하는 것은 기존의 우선 처리를 선택하는 것과 동일합니다.
제약사항
- 패스트 모드의 요청 한도는 다른 서비스 등급과 공유됩니다.
- 드물지만 패스트 모드의 분당 토큰 수가 급증할 경우 단계적 요청 한도에 도달할 수 있습니다. 이 경우 일부 추가 트래픽은 표준 처리로 전환될 수 있습니다.