Mode Cepat untuk Pelanggan API
Mode Cepat menawarkan kinerja yang andal dan berkecepatan tinggi dengan fleksibilitas bayar sesuai pemakaian. Untuk model terdepan terbaru kami, gpt-5.6-sol, Anda dapat mengakses kecepatan hingga 2,5x lebih cepat dengan Mode Cepat.
Dengan memilih Mode Cepat, Anda dapat mendapatkan:
- Latensi rendah yang dapat diprediksi: Mode Cepat menghasilkan token lebih cepat dan dengan kecepatan yang lebih konsisten dibandingkan dengan layanan Pemrosesan Standar, bahkan selama permintaan puncak.
- Fleksibilitas yang mudah digunakan: Seperti Pemrosesan Standar, Mode Cepat dapat diakses secara fleksibel dengan model bayar sesuai penggunaan, tanpa memerlukan penyediaan sebelumnya.
Catatan: Pemrosesan Prioritas diubah namanya menjadi Mode Cepat pada 30 Juli 2026. Anda dapat menggunakan service_tier: priority atau service_tier: fast dalam permintaan API Anda.
| Short context | Long context | SLA Waktu aktif3 | SLA Latensi3 | |||||
|---|---|---|---|---|---|---|---|---|
| Harga per 1JT token masukan | Harga per 1JT token masukan (dengan cache) | Harga per 1JT token keluaran | Harga per 1JT token masukan | Harga per 1JT token masukan (dengan cache) | Harga per 1JT token keluaran | |||
GPT-5.6 Sol | US$10,00 | US$1,00 | US$60,00 | US$20,00 | US$2,00 | US$90,00 | 99,9% | 99% > 80 token per detik2 |
GPT-5.6 Terra | US$4,00 | US$0,40 | US$24,00 | US$8,00 | US$0,80 | US$36,00 | 99,9% | 99% > 70 token per detik2 |
GPT-5.6 Luna | US$0,40 | US$0,04 | US$2,40 | US$0,80 | US$0,08 | US$3,60 | 99,9% | 99% > 100 token per detik2 |
GPT-5.5 mengecualikan konteks panjang1 | US$12,50 | US$1,250 | US$75,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-5.4 mini mengecualikan konteks panjang1 | US$1,50 | US$0,150 | US$9,00 | — | — | — | 99,9% | 99% > 100 token per detik2 |
GPT-5.4 mengecualikan konteks panjang1 | US$5,00 | US$0,500 | US$30,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-5.2 | US$3,50 | US$0,350 | US$28,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-5.1 | US$2,50 | US$0,250 | US$20,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-5 | US$2,50 | US$0,250 | US$20,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-5 mini | US$0,45 | US$0,045 | US$3,60 | — | — | — | 99,9% | 99% > 80 token per detik2 |
GPT-5.1 codex | US$2,50 | US$0,250 | US$20,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-5 codex | US$2,50 | US$0,250 | US$20,00 | — | — | — | 99,9% | 99% > 50 token per detik2 |
GPT-4.1 | US$3,50 | US$0,875 | US$14,00 | — | — | — | 99,9% | 99% > 80 token per detik2 |
GPT-4.1 mini | US$0,70 | US$0,175 | US$2,80 | — | — | — | 99,9% | 99% > 90 token per detik2 |
GPT-4.1 nano | US$0,20 | US$0,050 | US$0,80 | — | — | — | 99,9% | 99% > 100 token per detik2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$4,25 | US$2,125 | US$17,00 | — | — | — | 99,9% | 99% > 80 token per detik2 |
gpt-4o-2024-05-13 | US$8,75 | — | US$26,25 | — | — | — | 99,9% | 99% > 80 token per detik2 |
GPT-4o mini | US$0,25 | US$0,125 | US$1,00 | — | — | — | 99,9% | 99% > 90 token per detik2 |
o3 | US$3,50 | US$0,875 | US$14,00 | — | — | — | 99,9% | 99% > 80 token per detik2 |
o4-mini | US$2,00 | US$0,500 | US$8,00 | — | — | — | 99,9% | 99% > 90 token per detik2 |
Cara kerjanya
Pelanggan dapat mengarahkan trafik ke Mode Cepat berdasarkan setiap permintaan menggunakan parameter service_tier yang sudah ada, dengan opsi service_tier = "fast".
Token yang dilayani oleh Mode Cepat akan dikenakan biaya per token, dengan harga premium dibandingkan tarif Pemrosesan Standar.
Selain dikonfigurasi pada tingkat permintaan, Anda juga dapat mengatur proyek ke Mode Cepat secara default di Pengaturan proyek > Tingkat Layanan Default: Cepat. Anda masih dapat menimpa (override) per permintaan. Memilih Cepat di pengaturan proyek Anda setara dengan memilih Prioritas.
Keterbatasan
- Batas laju Mode Cepat dibagikan dengan tingkat layanan lainnya.
- Dalam kasus yang jarang terjadi, peningkatan cepat pada Token per Menit Mode Cepat Anda dapat menyebabkan tercapainya batas laju kenaikan. Jika Anda melebihi batas laju kenaikan, maka trafik tambahan mungkin akan dialihkan ke Pemrosesan Standar.