API 고객을 위한 패스트 모드
패스트 모드는 사용한 만큼 비용을 지불하는 유연성과 함께 안정적인 고속 성능을 제공합니다. gpt-5.6-sol에서 패스트 모드를 사용하면 최대 2.5배 더 빠른 속도로 이용할 수 있습니다.
패스트 모드의 주요 장점은 다음과 같습니다.
안정적으로 유지되는 짧은 지연 시간: 표준 처리보다 더 빠르고 일정한 속도로 토큰을 생성하며, 피크 시간대에도 안정적인 성능을 제공합니다.
유연한 사용 방식: 표준 처리와 마찬가지로 사전 용량 예약 없이 종량제로 사용할 수 있습니다.
참고: 2026년 7월 30일부터 '우선 처리'의 이름이 '패스트 모드'로 변경되었습니다. API 요청에서는 service_tier: priority 또는 service_tier: fast 모두를 사용할 수 있습니다.
| 간략한 컨텍스트 | 긴 컨텍스트 | 가동 시간 SLA3 | 레이턴시 SLA3 | |||||
|---|---|---|---|---|---|---|---|---|
| 입력 토큰 100만 개당 가격 | 입력 토큰 100만 개당 가격(캐시됨) | 출력 토큰 100만 개당 가격 | 입력 토큰 100만 개당 가격 | 입력 토큰 100만 개당 가격(캐시됨) | 출력 토큰 100만 개당 가격 | |||
GPT-6 Astra | US$20.00 | US$2.00 | US$100.00 | US$40.00 | US$4.00 | US$150.00 | — | — |
GPT-6.1 Sol | US$4.00 | US$0.20 | US$20.00 | US$8.00 | US$0.40 | US$30.00 | — | — |
GPT-6 Sol | US$4.00 | US$0.40 | US$20.00 | US$8.00 | US$0.80 | US$30.00 | — | — |
GPT-6 Luna | US$0.20 | US$0.02 | US$1.00 | US$0.40 | US$0.04 | US$1.50 | — | — |
GPT-5.6 Sol | US$8.00 | US$0.80 | US$40.00 | US$16.00 | US$1.60 | US$60.00 | 99.9% | 99% > 80개의 토큰/초2 |
GPT-5.6 Terra | US$4.00 | US$0.40 | US$24.00 | US$8.00 | US$0.80 | US$36.00 | 99.9% | 99% > 70개의 토큰/초2 |
GPT-5.6 Luna | US$0.40 | US$0.04 | US$2.40 | US$0.80 | US$0.08 | US$3.60 | 99.9% | 99% > 100개의 토큰/초2 |
GPT-5.5 Long-Context 제외1 | US$12.50 | US$1.250 | US$75.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5.4 mini Long-Context 제외1 | US$1.50 | US$0.150 | US$9.00 | — | — | — | 99.9% | 99% > 100개의 토큰/초2 |
GPT-5.4 Long-Context 제외1 | US$5.00 | US$0.500 | US$30.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5.2 | US$3.50 | US$0.350 | US$28.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5.1 | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5 | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5 mini | US$0.45 | US$0.045 | US$3.60 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
GPT-5.1 codex | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-5 codex | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 99% > 50개의 토큰/초2 |
GPT-4.1 | US$3.50 | US$0.875 | US$14.00 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
GPT-4.1 mini | US$0.70 | US$0.175 | US$2.80 | — | — | — | 99.9% | 99% > 90개의 토큰/초2 |
GPT-4.1 nano | US$0.20 | US$0.050 | US$0.80 | — | — | — | 99.9% | 99% > 100개의 토큰/초2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$4.25 | US$2.125 | US$17.00 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
gpt-4o-2024-05-13 | US$8.75 | — | US$26.25 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
GPT-4o mini | US$0.25 | US$0.125 | US$1.00 | — | — | — | 99.9% | 99% > 90개의 토큰/초2 |
o3 | US$3.50 | US$0.875 | US$14.00 | — | — | — | 99.9% | 99% > 80개의 토큰/초2 |
o4-mini | US$2.00 | US$0.500 | US$8.00 | — | — | — | 99.9% | 99% > 90개의 토큰/초2 |
작동 방식
API 고객은 기존 service_tier 매개변수에서 service_tier = "fast"를 지정해, 각 요청별로 패스트 모드를 사용할 수 있습니다.
패스트 모드로 처리되는 토큰은 표준 처리 요금보다 높은 프리미엄 단가로 토큰당 과금됩니다.
요청마다 설정하는 것 외에도 '프로젝트 설정 > 기본 서비스 등급: 패스트'에서 프로젝트의 기본 서비스 등급을 패스트 모드로 설정할 수 있습니다. 필요한 경우 요청마다 개별적으로 재정의할 수도 있습니다. 프로젝트 설정에서 패스트 모드를 선택하는 것은 기존의 우선 처리를 선택하는 것과 동일합니다.
제약사항
패스트 모드의 요청 한도는 다른 서비스 등급과 공유됩니다.
드물지만 패스트 모드의 분당 토큰 수가 급증할 경우 단계적 요청 한도에 도달할 수 있습니다. 이 경우 일부 추가 트래픽은 표준 처리로 전환될 수 있습니다.